Easy App
กลับไปหน้ารีวิว Repo
รีวิว Repoร่าง

รีวิว VibeVoice — โมเดลเสียง open source จาก Microsoft ถอดเสียงยาว 60 นาทีพร้อมแยกผู้พูด

vibe-coder
รีวิว VibeVoice — โมเดลเสียง open source จาก Microsoft ถอดเสียงยาว 60 นาทีพร้อมแยกผู้พูด

ข้อมูล Repo

microsoft/VibeVoice
ภาษา
Python
ดาว
54,604
สร้างเมื่อ
แก้ไขล่าสุด
ร่าง

เปลี่ยนสถานะผ่าน API: PATCH /api/reports/32dc9317-cbb7-4a0c-8637-6361a9e7ae87

แคปชันสำหรับ Facebook

Microsoft เปิด source โมเดลเสียง VibeVoice ไว้ ตัวเด่นตอนนี้คือฝั่งถอดเสียง ที่บอกได้ด้วยว่า "ใครพูดอะไร ตอนไหน" ✅ VibeVoice-ASR ถอดเสียงยาวถึง 60 นาทีได้ในรอบเดียว พร้อมแยกผู้พูดและใส่ timestamp ✅ ใส่ hotwords อย่างชื่อคนหรือศัพท์เฉพาะ เพื่อช่วยให้ถอดได้แม่นขึ้น ✅ มีรุ่น streaming ถอดไปพร้อมกับเสียงที่เข้ามา รองรับ 10 ภาษา ✅ รุ่น BitNet ลดขนาดโมเดลจาก 4.62 GB เหลือ 1.58 GB และ README รายงานว่ารัน real-time บน CPU ได้ ✅ ฝั่ง TTS มี VibeVoice-Realtime-0.5B ให้ลองผ่าน Colab เหมาะกับคนทำงานถอดเสียงประชุม สัมภาษณ์ หรือ call center และคนที่อยากลอง ASR บนเครื่องที่ไม่มี GPU ข้อควรรู้: Microsoft ถอดโค้ด VibeVoice-TTS ตัวหลักออกจาก repo ตั้งแต่ ก.ย. 2025 เพราะพบการนำไปใช้ผิดวัตถุประสงค์ และ README ระบุว่าโมเดลมีไว้เพื่องานวิจัยและพัฒนา ไม่แนะนำให้ใช้งานเชิงพาณิชย์โดยไม่ทดสอบเพิ่ม (license เป็น MIT) 🔗 https://github.com/microsoft/VibeVoice #VoiceAI #SpeechToText #Microsoft #OpenSource

ภาพปกแบบ HTML สด

แสดงจาก HTML ต้นฉบับที่ใช้สร้างภาพ ดาวน์โหลดเป็น PNG 1080×1350 ได้ทันที

สรุป

VibeVoice เป็นชุดโมเดล voice AI แบบ open source จาก Microsoft ฝั่ง ASR ถอดเสียงยาว 60 นาทีในรอบเดียว พร้อมแยกผู้พูดและ timestamp มีรุ่น streaming และรุ่น BitNet ที่รันบน CPU ฝั่ง TTS มี Realtime-0.5B ส่วนโค้ด TTS ตัวหลักถูกถอดออกจาก repo แล้ว

คืออะไร

VibeVoice คือชุดโมเดล voice AI แบบ open source จาก Microsoft ที่ README ระบุว่าเป็น family of open-source frontier voice AI models ครอบคลุมทั้งการถอดเสียง (ASR) และการสังเคราะห์เสียง (TTS)

แนวคิดหลักที่ทีมผู้เขียนอธิบายไว้คือ continuous speech tokenizers (Acoustic และ Semantic) ที่ทำงานที่ frame rate ต่ำมาก 7.5 Hz บวกกับ next-token diffusion ที่ใช้ LLM เข้าใจบริบทของข้อความและลำดับการพูด แล้วให้ diffusion head สร้างรายละเอียดเชิงเสียงความละเอียดสูง

โมเดลในตารางของ README:

โมเดลหน้าที่
VibeVoice-ASR-7Bถอดเสียงยาว 60 นาที single-pass
VibeVoice-ASR-Streamingstreaming ASR ถอดตามเสียงที่วิ่งเข้ามา
VibeVoice-ASR-BitNetรุ่นย่อสำหรับ inference บน CPU
VibeVoice-TTS-1.5Bmulti-speaker TTS (ตอนนี้ quick try ถูกปิดไว้)
VibeVoice-Realtime-0.5Breal-time TTS แบบ streaming

จุดเด่น

  • ASR ที่ออก Who / When / What — ตัว VibeVoice-ASR ทำ ASR, diarization และ timestamping ไปพร้อมกัน ได้ผลลัพธ์เป็นโครงสร้างที่บอกว่าใครพูดอะไร เมื่อไหร่และรับเสียงยาวได้ 60 นาทีใน pass เดียว (ในขอบเขต 64K token)
  • Customized Hotwords — ใส่คำเฉพาะ เช่น ชื่อคน ศัพท์เทคนิค หรือ background เข้าไปช่วยเพิ่มความแม่นยำกับคอนเทนต์เฉพาะโดเมน
  • Streaming variant — มีโมเดลที่ถอดเสียงไปด้วยขณะที่เสียงยังวิ่งเข้ามา ปล่อยข้อความทีละ chunk ไม่ต้องรอจบไฟล์ มีโมเดล 7B รองรับ 10 ภาษา
  • รุ่น CPU แบบ BitNet — VibeVoice-ASR-BitNet ใช้ heterogeneous quantization (I8_S + I2_S) ย่อโมเดลจาก 4.62 GB เหลือ 1.58 GB และรายงาน real-time inference (RTF < 1) บน 3+ CPU threads โดยไม่ต้องใช้ GPU
  • Realtime TTS ขนาดเล็ก — VibeVoice-Realtime-0.5B รองรับ streaming text input, first audible latency ประมาณ 300 มิลลิวินาที และมี experimental speakers 9 ภาษา (DE, FR, IT, JP, KR, NL, PL, PT, ES) กับ 11 เสียงสไตล์อังกฤษ
  • ทางออกสำหรับการนำไปใช้ต่อ — ASR เข้า Transformers แล้ว (มี.ค. 2026) รองรับ vLLM, มีโค้ด finetuning และมีรุ่น streaming ให้ serve ผ่าน vLLM
  • มีงานวิจัยรองรับ — README ลิงก์ไปทั้ง paper บน arXiv, technical report และ OpenReview (TTS ได้รับการรับเป็น Oral ที่ ICLR 2026)

เหมาะกับใคร

  • คนที่ทำงานด้าน ASR และอยากได้ transcript ที่มี speaker label กับ timestamp มาเลยโดยไม่ต้องต่อ diarization pipeline เอง
  • ทีมที่อยากทำ realtime transcription เช่น call center, meeting note หรือแอปที่ถอดเสียงสดๆ
  • คนที่รันบนเครื่องไม่มี GPU และอยากลอง ASR แบบ real-time บน CPU ผ่าน VibeASR.cpp
  • ผู้ที่สนใจ speech tokenizer / diffusion TTS เชิงวิจัย และอยากอ่านโค้ดกับเทคนิคละเอียด
  • ไม่เหมาะกับคนที่อยากได้ TTS multi-speaker 90 นาทีมาใช้งานต่อทันที เพราะโค้ด TTS ถูกนำออกจาก repo ไปแล้ว (ดูหัวข้อข้อควรรู้)

เริ่มต้นใช้งาน

หน้า README หลักไม่ได้มีคำสั่ง pip install ให้คัดลอกมาใช้ ทางที่ repo ชี้ไว้ให้คือเข้า playground, Colab หรือ docs รายตัวโมเดล

ทางเข้าที่ README มีให้:

โมเดลทั้งหมดอยู่บน Hugging Face ใต้ org microsoft ดูรายละเอียดการรัน, dependency และตัวอย่างการเรียกใช้ใน docs ของแต่ละโมเดล (docs/vibevoice-asr.md, docs/vibevoice-asr-streaming.md, docs/vibevoice-realtime-0.5b.md) และโค้ด finetuning อยู่ที่ finetuning-asr/README.md

ข้อควรรู้

สถานะตอนนี้ (ณ 3 ต.ค. 2026)

  • ⭐ 54,604 ดาว และ 🍴 6,140 forks (ข้อมูล ณ 3 ต.ค. 2026) เป็น repo ภาษา Python ที่คนติดตามเยอะมากในสาย voice AI
  • repo ยังไม่ถูก archive และมี open issues 199 อยู่
  • push ล่าสุด 3 ก.ย. 2026 ถือว่ายัง active อยู่ และอายุโปรเจกต์ประมาณ 1 ปี 1 เดือน (สร้างเมื่อ 25 ส.ค. 2025)

โค้ด TTS ถูกเอาออกไปแล้ว — ข่าววันที่ 5 ก.ย. 2025 ระบุว่าทีมงานพบการนำเครื่องมือไปใช้ในทางที่ไม่ตรงกับเจตนาที่ประกาศไว้ จึง "removed the VibeVoice-TTS code from this repository" ในตารางโมเดล TTS-1.5B ก็ถูกตั้ง Quick Try เป็น Disabled ส่วน VibeVoice-Realtime-0.5B ยังอยู่และมี Colab ให้ลอง

License — repo ระบุเป็น MIT License แต่ README ก็เตือนเองว่าไม่แนะนำให้ใช้ในงาน commercial หรือ real-world application โดยไม่ผ่านการทดสอบและพัฒนาเพิ่มเติม โดยระบุว่าโมเดลนี้ intended for research and development purposes only ถ้าจะเอาไปใช้เชิงพาณิชย์ แนะนำให้อ่านไฟล์ LICENSE จริง ๆ แล้วทดสอบให้ดีก่อน

ข้อจำกัดที่ทีมผู้เขียนระบุไว้เอง

  • โมเดลอาจให้ผลลัพธ์ที่ไม่คาดคิด มีอคติ หรือไม่แม่นยำ และสืบทอดอคติ/ข้อผิดพลาดจาก base model (ระบุว่าเป็น Qwen2.5 1.5b ในรุ่นนี้)
  • มีความเสี่ยงสูงในการนำไปสร้าง deepfake เสียงปลอม เพื่อปลอมตัวตน หลอกลวง หรือกระจายข้อมูลบิดเบือน repo ระบุให้ตรวจสอบความน่าเชื่อถือของ transcript และเปิดเผยการใช้ AI เมื่อแชร์คอนเทนต์ที่สร้างโดย AI

สรุป — ถ้ามองเป็นงานวิจัยและต้นแบบ รุ่น ASR คือส่วนที่พัฒนาไปข้างหน้าจริง มีทั้ง non-streaming, streaming, เวอร์ชัน CPU และโค้ด finetuning ส่วนคนที่อยากได้ multi-speaker TTS 90 นาทีจาก repo นี้ ต้องดูอีกทาง เพราะโค้ดถูกถอดออกไปแล้ว

🔗 https://github.com/microsoft/VibeVoice

ข้อมูลจาก GitHub ณ 3 ต.ค. 2026: ⭐ 54,604 | ภาษา Python | license MIT

ไฟล์แนบ (3)

Easy App — กล่องรายงานจาก AI
v0.7.1 (1496eed)