รีวิว VibeVoice — โมเดลเสียง open source จาก Microsoft ถอดเสียงยาว 60 นาทีพร้อมแยกผู้พูด
ข้อมูล Repo
microsoft/VibeVoice- ภาษา
- Python
- ดาว
- 54,604
- สร้างเมื่อ
- แก้ไขล่าสุด
เปลี่ยนสถานะผ่าน API: PATCH /api/reports/32dc9317-cbb7-4a0c-8637-6361a9e7ae87
แคปชันสำหรับ Facebook
Microsoft เปิด source โมเดลเสียง VibeVoice ไว้ ตัวเด่นตอนนี้คือฝั่งถอดเสียง ที่บอกได้ด้วยว่า "ใครพูดอะไร ตอนไหน" ✅ VibeVoice-ASR ถอดเสียงยาวถึง 60 นาทีได้ในรอบเดียว พร้อมแยกผู้พูดและใส่ timestamp ✅ ใส่ hotwords อย่างชื่อคนหรือศัพท์เฉพาะ เพื่อช่วยให้ถอดได้แม่นขึ้น ✅ มีรุ่น streaming ถอดไปพร้อมกับเสียงที่เข้ามา รองรับ 10 ภาษา ✅ รุ่น BitNet ลดขนาดโมเดลจาก 4.62 GB เหลือ 1.58 GB และ README รายงานว่ารัน real-time บน CPU ได้ ✅ ฝั่ง TTS มี VibeVoice-Realtime-0.5B ให้ลองผ่าน Colab เหมาะกับคนทำงานถอดเสียงประชุม สัมภาษณ์ หรือ call center และคนที่อยากลอง ASR บนเครื่องที่ไม่มี GPU ข้อควรรู้: Microsoft ถอดโค้ด VibeVoice-TTS ตัวหลักออกจาก repo ตั้งแต่ ก.ย. 2025 เพราะพบการนำไปใช้ผิดวัตถุประสงค์ และ README ระบุว่าโมเดลมีไว้เพื่องานวิจัยและพัฒนา ไม่แนะนำให้ใช้งานเชิงพาณิชย์โดยไม่ทดสอบเพิ่ม (license เป็น MIT) 🔗 https://github.com/microsoft/VibeVoice #VoiceAI #SpeechToText #Microsoft #OpenSource
ภาพปกแบบ HTML สด
แสดงจาก HTML ต้นฉบับที่ใช้สร้างภาพ ดาวน์โหลดเป็น PNG 1080×1350 ได้ทันที
สไตล์ Easy AI
1080×1350แก้ไข 2026-10-10
สไตล์ easy-app
1080×1350แก้ไข 2026-10-10
สรุป
VibeVoice เป็นชุดโมเดล voice AI แบบ open source จาก Microsoft ฝั่ง ASR ถอดเสียงยาว 60 นาทีในรอบเดียว พร้อมแยกผู้พูดและ timestamp มีรุ่น streaming และรุ่น BitNet ที่รันบน CPU ฝั่ง TTS มี Realtime-0.5B ส่วนโค้ด TTS ตัวหลักถูกถอดออกจาก repo แล้ว
คืออะไร
VibeVoice คือชุดโมเดล voice AI แบบ open source จาก Microsoft ที่ README ระบุว่าเป็น family of open-source frontier voice AI models ครอบคลุมทั้งการถอดเสียง (ASR) และการสังเคราะห์เสียง (TTS)
แนวคิดหลักที่ทีมผู้เขียนอธิบายไว้คือ continuous speech tokenizers (Acoustic และ Semantic) ที่ทำงานที่ frame rate ต่ำมาก 7.5 Hz บวกกับ next-token diffusion ที่ใช้ LLM เข้าใจบริบทของข้อความและลำดับการพูด แล้วให้ diffusion head สร้างรายละเอียดเชิงเสียงความละเอียดสูง
โมเดลในตารางของ README:
| โมเดล | หน้าที่ |
|---|---|
| VibeVoice-ASR-7B | ถอดเสียงยาว 60 นาที single-pass |
| VibeVoice-ASR-Streaming | streaming ASR ถอดตามเสียงที่วิ่งเข้ามา |
| VibeVoice-ASR-BitNet | รุ่นย่อสำหรับ inference บน CPU |
| VibeVoice-TTS-1.5B | multi-speaker TTS (ตอนนี้ quick try ถูกปิดไว้) |
| VibeVoice-Realtime-0.5B | real-time TTS แบบ streaming |
จุดเด่น
- ASR ที่ออก Who / When / What — ตัว VibeVoice-ASR ทำ ASR, diarization และ timestamping ไปพร้อมกัน ได้ผลลัพธ์เป็นโครงสร้างที่บอกว่าใครพูดอะไร เมื่อไหร่และรับเสียงยาวได้ 60 นาทีใน pass เดียว (ในขอบเขต 64K token)
- Customized Hotwords — ใส่คำเฉพาะ เช่น ชื่อคน ศัพท์เทคนิค หรือ background เข้าไปช่วยเพิ่มความแม่นยำกับคอนเทนต์เฉพาะโดเมน
- Streaming variant — มีโมเดลที่ถอดเสียงไปด้วยขณะที่เสียงยังวิ่งเข้ามา ปล่อยข้อความทีละ chunk ไม่ต้องรอจบไฟล์ มีโมเดล 7B รองรับ 10 ภาษา
- รุ่น CPU แบบ BitNet — VibeVoice-ASR-BitNet ใช้ heterogeneous quantization (I8_S + I2_S) ย่อโมเดลจาก 4.62 GB เหลือ 1.58 GB และรายงาน real-time inference (RTF < 1) บน 3+ CPU threads โดยไม่ต้องใช้ GPU
- Realtime TTS ขนาดเล็ก — VibeVoice-Realtime-0.5B รองรับ streaming text input, first audible latency ประมาณ 300 มิลลิวินาที และมี experimental speakers 9 ภาษา (DE, FR, IT, JP, KR, NL, PL, PT, ES) กับ 11 เสียงสไตล์อังกฤษ
- ทางออกสำหรับการนำไปใช้ต่อ — ASR เข้า Transformers แล้ว (มี.ค. 2026) รองรับ vLLM, มีโค้ด finetuning และมีรุ่น streaming ให้ serve ผ่าน vLLM
- มีงานวิจัยรองรับ — README ลิงก์ไปทั้ง paper บน arXiv, technical report และ OpenReview (TTS ได้รับการรับเป็น Oral ที่ ICLR 2026)
เหมาะกับใคร
- คนที่ทำงานด้าน ASR และอยากได้ transcript ที่มี speaker label กับ timestamp มาเลยโดยไม่ต้องต่อ diarization pipeline เอง
- ทีมที่อยากทำ realtime transcription เช่น call center, meeting note หรือแอปที่ถอดเสียงสดๆ
- คนที่รันบนเครื่องไม่มี GPU และอยากลอง ASR แบบ real-time บน CPU ผ่าน VibeASR.cpp
- ผู้ที่สนใจ speech tokenizer / diffusion TTS เชิงวิจัย และอยากอ่านโค้ดกับเทคนิคละเอียด
- ไม่เหมาะกับคนที่อยากได้ TTS multi-speaker 90 นาทีมาใช้งานต่อทันที เพราะโค้ด TTS ถูกนำออกจาก repo ไปแล้ว (ดูหัวข้อข้อควรรู้)
เริ่มต้นใช้งาน
หน้า README หลักไม่ได้มีคำสั่ง pip install ให้คัดลอกมาใช้ ทางที่ repo ชี้ไว้ให้คือเข้า playground, Colab หรือ docs รายตัวโมเดล
ทางเข้าที่ README มีให้:
- Playground ของ ASR: https://aka.ms/vibevoice-asr
- Demo ของ ASR-Streaming: https://aka.ms/vibeasr
- Colab ของ Realtime-0.5B: https://colab.research.google.com/github/microsoft/VibeVoice/blob/main/demo/vibevoice_realtime_colab.ipynb
- Colab ของ VibeVoice ตัวหลัก: https://colab.research.google.com/github/microsoft/VibeVoice/blob/main/demo/VibeVoice_colab.ipynb
- Project page (demo + ตัวอย่างเสียง): https://microsoft.github.io/VibeVoice
โมเดลทั้งหมดอยู่บน Hugging Face ใต้ org microsoft ดูรายละเอียดการรัน, dependency และตัวอย่างการเรียกใช้ใน docs ของแต่ละโมเดล (docs/vibevoice-asr.md, docs/vibevoice-asr-streaming.md, docs/vibevoice-realtime-0.5b.md) และโค้ด finetuning อยู่ที่ finetuning-asr/README.md
ข้อควรรู้
สถานะตอนนี้ (ณ 3 ต.ค. 2026)
- ⭐ 54,604 ดาว และ 🍴 6,140 forks (ข้อมูล ณ 3 ต.ค. 2026) เป็น repo ภาษา Python ที่คนติดตามเยอะมากในสาย voice AI
- repo ยังไม่ถูก archive และมี open issues 199 อยู่
- push ล่าสุด 3 ก.ย. 2026 ถือว่ายัง active อยู่ และอายุโปรเจกต์ประมาณ 1 ปี 1 เดือน (สร้างเมื่อ 25 ส.ค. 2025)
โค้ด TTS ถูกเอาออกไปแล้ว — ข่าววันที่ 5 ก.ย. 2025 ระบุว่าทีมงานพบการนำเครื่องมือไปใช้ในทางที่ไม่ตรงกับเจตนาที่ประกาศไว้ จึง "removed the VibeVoice-TTS code from this repository" ในตารางโมเดล TTS-1.5B ก็ถูกตั้ง Quick Try เป็น Disabled ส่วน VibeVoice-Realtime-0.5B ยังอยู่และมี Colab ให้ลอง
License — repo ระบุเป็น MIT License แต่ README ก็เตือนเองว่าไม่แนะนำให้ใช้ในงาน commercial หรือ real-world application โดยไม่ผ่านการทดสอบและพัฒนาเพิ่มเติม โดยระบุว่าโมเดลนี้ intended for research and development purposes only ถ้าจะเอาไปใช้เชิงพาณิชย์ แนะนำให้อ่านไฟล์ LICENSE จริง ๆ แล้วทดสอบให้ดีก่อน
ข้อจำกัดที่ทีมผู้เขียนระบุไว้เอง
- โมเดลอาจให้ผลลัพธ์ที่ไม่คาดคิด มีอคติ หรือไม่แม่นยำ และสืบทอดอคติ/ข้อผิดพลาดจาก base model (ระบุว่าเป็น Qwen2.5 1.5b ในรุ่นนี้)
- มีความเสี่ยงสูงในการนำไปสร้าง deepfake เสียงปลอม เพื่อปลอมตัวตน หลอกลวง หรือกระจายข้อมูลบิดเบือน repo ระบุให้ตรวจสอบความน่าเชื่อถือของ transcript และเปิดเผยการใช้ AI เมื่อแชร์คอนเทนต์ที่สร้างโดย AI
สรุป — ถ้ามองเป็นงานวิจัยและต้นแบบ รุ่น ASR คือส่วนที่พัฒนาไปข้างหน้าจริง มีทั้ง non-streaming, streaming, เวอร์ชัน CPU และโค้ด finetuning ส่วนคนที่อยากได้ multi-speaker TTS 90 นาทีจาก repo นี้ ต้องดูอีกทาง เพราะโค้ดถูกถอดออกไปแล้ว
🔗 https://github.com/microsoft/VibeVoice
ข้อมูลจาก GitHub ณ 3 ต.ค. 2026: ⭐ 54,604 | ภาษา Python | license MIT