รีวิว Voicebox — สตูดิโอเสียง AI แบบ local-first รวม TTS และ dictation
ข้อมูล Repo
jamiepine/voicebox- ภาษา
- TypeScript
- ดาว
- 56,268
- สร้างเมื่อ
- แก้ไขล่าสุด
เปลี่ยนสถานะผ่าน API: PATCH /api/reports/7702281e-8265-4206-ae9a-0109dcfe6e40
แคปชันสำหรับ Facebook
อยากได้สตูดิโอเสียง AI ที่รันบนเครื่องตัวเอง โดยไม่ส่งเสียงออกคลาวด์ ลองดู Voicebox ครับ เป็น open-source ที่รวมฝั่งพูด (clone / TTS) กับฝั่งฟัง (dictation + Whisper) ในแอปเดียว ✅ TTS 7 engines สลับได้รายครั้ง รวม Qwen3-TTS, Chatterbox, Kokoro, TADA ✅ clone เสียงจากไฟล์สั้น ๆ หรือเลือก preset กว่า 50 เสียง ✅ ครอบคลุม 23 ภาษา (Chatterbox Multilingual) ✅ ให้ agent พูดกลับผ่าน MCP tool เดียว (voicebox_speak) ✅ เขียนด้วย Tauri ไม่ใช่ Electron เหมาะกับสายพอดแคสต์ คนเน้น privacy และคนที่อยากให้ Claude Code / Cursor พูดตอบ ข้อควรรู้: open issues เยอะ และ Linux อาจต้อง build เอง 🔗 https://github.com/jamiepine/voicebox #VoiceAI #TTS #OpenSource #ClaudeCode #LocalFirst
ภาพปกแบบ HTML สด
แสดงจาก HTML ต้นฉบับที่ใช้สร้างภาพ ดาวน์โหลดเป็น PNG 1080×1350 ได้ทันที
สไตล์ Easy AI
1080×1350แก้ไข 2026-10-10
สไตล์ easy-app
1080×1350แก้ไข 2026-10-10
สรุป
Voicebox เป็น AI voice studio แบบ open-source ที่รันบนเครื่องเรา รวม TTS 7 engines, voice cloning, dictation และ Whisper STT พร้อม MCP ให้ agent อย่าง Claude Code พูดกลับด้วยเสียงที่เรา clone license MIT
คืออะไร
Voicebox เป็น local-first AI voice studio แบบ open-source ที่รันบนเครื่องเราเอง README อธิบายว่าเป็นทางเลือกฟรีของ ElevenLabs (ฝั่งพูด) และ WisprFlow (ฝั่งฟัง/dictation) ในแอปเดียว
รวมงาน clone เสียง, สร้างเสียงพูด, dictation ด้วย hotkey ทั่วระบบ, STT ด้วย Whisper และให้ MCP-aware agent (เช่น Claude Code, Cursor, Cline) พูดกลับด้วยเสียงที่เราเลือกผ่าน tool voicebox_speak
หน้าเว็บ: voicebox.sh | เอกสาร: docs.voicebox.sh
จุดเด่น
- TTS 7 engines สลับได้รายครั้ง: Qwen3-TTS, Qwen CustomVoice, LuxTTS, Chatterbox Multilingual, Chatterbox Turbo, HumeAI TADA, Kokoro
- Voice cloning + preset — clone แบบ zero-shot จากไฟล์เสียงสั้น ๆ หรือเลือก preset กว่า 50 เสียงผ่าน Kokoro และ Qwen CustomVoice
- 23 ภาษา ผ่าน Chatterbox Multilingual
- Global dictation — กดคีย์ลัดพูด แล้วข้อความถูกใส่ในช่องที่ active
- STT ด้วย Whisper รวมโหมด Turbo
- Agent voice — MCP server ในตัว ให้ agent พูดออกเสียงได้
- Stories editor — timeline หลายแทร็กสำหรับบทสนทนา/พอดแคสต์
- เขียนด้วย Tauri (Rust) ไม่ใช่ Electron | รองรับ macOS / Windows / Docker (และระบุ GPU หลายค่ายใน README)
เหมาะกับใคร
- คนทำคอนเทนต์เสียงหรือพอดแคสต์ที่ไม่อยากจ่ายสมาชิกรายเดือน
- คนที่กังวลเรื่อง privacy — README ระบุว่าโมเดลและเสียงที่ clone ไม่ออกจากเครื่อง
- ผู้ใช้ Claude Code / Cursor / Cline ที่อยากให้ agent พูดตอบ
เริ่มต้นใช้งาน
ดาวน์โหลดไบนารีจากหน้า Releases ของ repo หรือจาก voicebox.sh (macOS / Windows)
สำหรับนักพัฒนา ดู Quick Start ในส่วน Development ของ README (ต้อง build เองบนบางแพลตฟอร์ม)
ตั้ง MCP ใน Claude Code / Cursor ให้ชี้ไปที่ MCP server ของ Voicebox หรือ binary voicebox-mcp ผ่าน stdio ตามคู่มือใน README ส่วน API / MCP server
ข้อควรรู้
- License: MIT
- สร้างเมื่อ ม.ค. 2026 | push ล่าสุด 4 ต.ค. 2026
- open issues เยอะ (670 ณ 4 ต.ค. 2026) — โปรเจกต์ยังเคลื่อนไหวเร็ว ควรลองก่อนพึ่งใช้จริง
- Linux อาจต้อง build เองถ้ายังไม่มีไบนารีสำเร็จรูปใน Releases
- ⭐ 56,268 ณ 4 ต.ค. 2026 | ภาษาหลัก TypeScript
🔗 https://github.com/jamiepine/voicebox
ข้อมูลจาก GitHub ณ 4 ต.ค. 2026: ⭐ 56,268 | ภาษา TypeScript | license MIT