รีวิว VoiceStudio — สตูดิโอเสียง AI แบบ open source ที่รันในเครื่องเราเอง
ข้อมูล Repo
debpalash/VoiceStudio- ภาษา
- Python
- ดาว
- 53,763
- สร้างเมื่อ
- แก้ไขล่าสุด
เปลี่ยนสถานะผ่าน API: PATCH /api/reports/6acbf642-481a-4694-a12b-cae12cfee11d
แคปชันสำหรับ Facebook
อยากโคลนเสียงหรือพากย์วิดีโอด้วย AI แต่ไม่อยากจ่ายรายเดือน ลองดูตัวนี้ครับ VoiceStudio เป็นแอปเสียง AI แบบ open source ที่เจ้าของวางตัวเป็นทางเลือกแทน ElevenLabs งานหลักรันบนเครื่องเราเอง ✅ โคลนเสียง ออกแบบเสียง พากย์วิดีโอ พูดแล้วพิมพ์ให้ ถอดเสียง และทำ audiobook ในแอปเดียว ✅ คำอธิบาย repo ระบุว่ารองรับ 646 ภาษา ✅ มี Local API กับ MCP ให้ agent อย่าง Claude Code, Codex, Cursor เรียกใช้ ✅ ใช้ GPU NVIDIA หรือ Apple Silicon ได้ ไม่มีการ์ดจอก็รันบน CPU ได้แต่ช้ากว่า ✅ ติดตั้งคำสั่งเดียวบน macOS/Linux หรือโหลดแอปจากหน้า Releases เหมาะกับคนทำคอนเทนต์เสียง พอดแคสต์ หรือ audiobook ที่อยากทำงานแบบ offline ข้อควรรู้: license เป็น AGPL-3.0 และโมเดลแต่ละตัวมี license ของตัวเอง ใช้เชิงพาณิชย์ต้องเช็กก่อน ส่วนการโคลนเสียงคนอื่นต้องได้รับอนุญาตเท่านั้น 🔗 https://github.com/debpalash/VoiceStudio #AIVoice #VoiceCloning #OpenSource #LocalAI
ภาพปกแบบ HTML สด
แสดงจาก HTML ต้นฉบับที่ใช้สร้างภาพ ดาวน์โหลดเป็น PNG 1080×1350 ได้ทันที
สไตล์ Easy AI
1080×1350แก้ไข 2026-10-10
สไตล์ easy-app
1080×1350แก้ไข 2026-10-10
สรุป
VoiceStudio รวม voice cloning, voice design, พากย์วิดีโอ, dictation, ถอดเสียง และทำ audiobook ไว้ในแอปเดสก์ท็อปเดียว รันบนเครื่องเราเป็นหลัก มี Local API และ MCP ให้ agent เรียกใช้ คำอธิบาย repo ระบุว่ารองรับ 646 ภาษา
คืออะไร
VoiceStudio เป็นโอเพนซอร์สแทน ElevenLabs ที่รวมงานเสียงหลายอย่างไว้ในโปรเจกต์เดียว ตัว repo เขียนว่าเป็น fully-local และ local-first — คือ workflow หลักรันบนฮาร์ดแวร์ของคุณเอง ส่วนบริการรีโมตเป็นตัวเลือกเสริม (และการส่ง usage analytics ต้องได้ consent ก่อน)
ติดตั้งผ่านสคริปต์จาก voicestudio.sh หรือดาวน์โหลด desktop app ให้ดาวน์โหลดจากหน้า Releases
จุดเด่น
- ครอบคลุมงานเสียงหลายแบบในที่เดียว — voice cloning, voice design, video dubbing (พร้อม speech ที่ sync เวลา), dictation ผ่าน floating widget, transcription และการทำ audiobook/งานแบบ batch ตามที่ README แบ่งเป็น 3 กลุ่ม: Create / Produce / Connect
- รองรับ 646 ภาษา (ตัวเลขนี้มาจากคำอธิบาย repo)
- ทำงานบนเครื่องตัวเอง และเลือก engine ได้ — ค่าเริ่มต้นเป็น VoiceStudio (powered by k2-fsa/OmniVoice) หรือสลับไปใช้ engine อื่น ดูแคตตาล็อกได้ที่ docs/feature-catalog.md
- ต่อกับ agent ได้ — มี Local API และ MCP สำหรับ agent (ดูได้ที่ docs/speech-platform.md และ docs/mcp.md) รวมถึง remote workers แบบ optional
- รองรับหลายชนิดเครื่อง — CUDA acceleration บน NVIDIA GPU (Windows/Linux), Metal (MPS) บน Apple Silicon และถ้าไม่มี GPU แยกก็ยังใช้บน CPU ได้ (ช้ากว่า และตอน setup จะติดตั้ง PyTorch เวอร์ชัน CPU ขนาดเล็ก ต้องมีพื้นที่ว่างราว 5 GB)
- ติดตั้งง่ายด้วยคำสั่งเดียว และตัว installer เก็บค่า settings, projects และ models ของคุณไว้
- มี agent guide ให้ paste ได้เลย — รองรับ Claude Code, Codex, Cursor ฯลฯ และ agent ที่รองรับ skills สามารถรัน
npx skills add debpalash/VoiceStudioได้ (เลือก skillvoicestudioหรือvoicestudio-maintainer) - มีเอกสารครบ: troubleshooting, การดาวน์โหลดโมเดล, engine guides, benchmarks และ changelog
เหมาะกับใคร
- คนทำคอนเทนต์เสียงหรือวิดีโอที่อยาก clone เสียงหรือออกแบบเสียงเองโดยไม่ต้องผูกกับเซอร์วิสเสียงตายตัว
- คนทำ audiobook และงาน batch ซึ่งต้องการทำงานแบบ offline/local-first
- สาย AI/agent ที่อยากใช้งานเสียงเป็นเครื่องมือผ่าน Local API หรือ MCP
- ผู้ใช้ที่ต้องการ self-host (มีคู่มือ Docker แยกต่างหาก)
ควรระวังตรงนี้นิดหนึ่ง: README เขียนชัดว่าให้ clone เสียง "only with permission"
เริ่มต้นใช้งาน
ติดตั้งแบบคำสั่งเดียว (macOS / Linux):
# Latest Electron release
curl -fsSL https://voicestudio.sh/install | sh
บน Windows ให้รันใน PowerShell:
irm https://voicestudio.sh/install | iex
หรือดาวน์โหลดจากหน้า Releases ได้ (macOS .dmg, Windows .exe, Linux .AppImage หรือ .deb) แล้วทำตามคู่มือของแต่ละแพลตฟอร์ม: macOS | Windows | Linux | Docker
ถ้าอยากให้ coding agent ช่วยติดตั้งและทดสอบให้ คัดลอก prompt นี้ไปวางได้เลย:
Install the VoiceStudio Electron app on this device and verify it works, following
https://github.com/debpalash/VoiceStudio/blob/main/docs/install/agent.md
รันจาก source (Electron):
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run setup:api # prepare Python dependencies before starting Electron
bun run dev
หลังติดตั้งแล้ว: เปิดหน้า Voice cloning เลือกเสียง หรืออัปโหลดไฟล์เสียงตัวอย่างที่สะอาด แล้วใส่ข้อความและกด generate (ระบบจะถามให้ติดตั้งโมเดลที่ต้องใช้ตอนนั้น)
ข้อควรรู้
- License: AGPL-3.0 (GNU Affero General Public License v3.0) และ README เตือนว่า โมเดลแต่ละตัวมี license ของตัวเอง ต้องตรวจเงื่อนไขก่อนนำไปใช้เชิงพาณิชย์ รวมถึงการ clone เสียงควรได้รับอนุญาตเท่านั้น
- ความสดใหม่: push ล่าสุด 6 ต.ค. 2026, โปรเจกต์สร้างเมื่อ 9 เม.ย. 2026 อายุประมาณ 6 เดือน ยังไม่ archived (ข้อมูล ณ 6 ต.ค. 2026)
- ดาว/ฟอร์ก: 53.8k ดาว และ 6.0k ฟอร์ก (ข้อมูล ณ 6 ต.ค. 2026)
- ข้อจำกัดด้านแพลตฟอร์ม: Windows on ARM (เช่น Snapdragon X) ระบุว่าเป็น Experimental ยังรอการตรวจสอบ — native ARM64 app คู่กับ Python backend แบบ x64 ที่รันภายใต้ emulation และใช้ CPU เท่านั้น
- Intel Mac: ใช้ได้แค่ UI ของแอป ต้องต่อไปยัง remote backend
- ไม่มี GPU แยก: ใช้งานได้บน CPU แต่ช้ากว่า และ setup จะติดตั้ง PyTorch เวอร์ชัน CPU (ต้องมีพื้นที่ว่างราว 5 GB)
- แอปเดสก์ท็อปเปลี่ยนแล้ว: ตอนนี้ใช้ Electron เป็นตัวเดียว ทั้ง desktop app และ web UI เวอร์ชัน 0.5.3 เป็นรุ่น Tauri สุดท้าย ผู้ใช้ Tauri เดิมต้องติดตั้ง Electron แยก และ installer ไม่ fallback ไปใช้บิลด์ Tauri ที่เก็บไว้
- ความต้องการระหว่าง build: ตัวเลือก
--mainต้องมี Git, Node.js 22+, Bun, Rust/Cargo และ build tools ของแพลตฟอร์ม - สถานะโปรเจกต์: ยัง active แต่มี issue/PR เปิดอยู่ 63 รายการ ควรลองเองก่อนใช้ในงานจริง
🔗 https://github.com/debpalash/VoiceStudio
ข้อมูลจาก GitHub ณ 6 ต.ค. 2026: ⭐ 53,763 | ภาษา Python | license AGPL-3.0