
VibeVoice-ASR-Streaming-1.5B เทียบกับ Granite Speech 5.0 470M TurboCTC: สองตัวเก็งสตรีมมิงโอเพนเวตที่เงียบ ๆ
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
ผลงานโอเพนเวทสำหรับการแปลงเสียงพูดเป็นข้อความแบบสตรีมมิ่งที่น่าสนใจที่สุดสองชิ้นในช่วงปลายเดือนสิงหาคม 2026 ต่างก็ออกมาโดยไม่มีงานเปิดตัวทั้งคู่ เมื่อวันที่ 25 สิงหาคม IBM วาง Granite Speech 5.0 470M TurboCTC บน Hugging Face — น้ำหนักโมเดล การ์ดโมเดล และบล็อกโพสต์ เท่านั้น — และในวันที่ 2 กันยายน Microsoft Research อัปโหลด VibeVoice-ASR-Streaming-1.5B ภายใต้เนมสเปซ microsoft โดยไม่มีการประกาศใด ๆ เลย นอกจากบรรทัดข่าวในคลัง GitHub ของ VibeVoice ทั้งคู่เป็นสิ่งแบบเดียวกันและเดิมพันทางวิศวกรรมที่ตรงข้ามกัน: โมเดลของ IBM เป็นเอนโค้ดเดอร์ pure-CTC ที่มีพารามิเตอร์ 470 ล้านตัว ออกแบบมาให้ทำงานด้วยความเร็วระดับเอดจ์บนแล็ปท็อป ส่วนของ Microsoft เป็นโมเดลภาษาคำพูดระดับ 1.5B ที่ห่อหุ้มด้วยโทเคนไนเซอร์เสียงและส่วนหัวแบบ diffusion — รวมประมาณสามพันล้านพารามิเตอร์ — สร้างขึ้นเพื่อทำความเข้าใจเสียงพูดในฐานะภาษาพร้อมกับถอดความ
ก่อนจะถึงตัวเลข ขอกล่าวถึงป้ายระบุแหล่งข้อมูลที่ทำให้การเปรียบเทียบนี้โปร่งใส ทุกอย่างที่ระบุว่ารายงานโดย IBM มาจากการ์ดโมเดลของ Granite Speech 5.0 470M TurboCTC และรายการในลีดเดอร์บอร์ด Open ASR ซึ่ง IBM เป็นผู้รันผ่านชุดทดสอบอย่างเป็นทางการในวันเปิดตัว และยังไม่มีการทำซ้ำอย่างอิสระจากภายนอก ส่วนทุกอย่างเกี่ยวกับ VibeVoice-ASR-Streaming-1.5B นั้นได้มาจากการอ่าน repository — ไฟล์คอนฟิก การ์ดโมเดล และเอกสารสตรีมมิงของ Microsoft — เพราะ Microsoft ยังไม่ได้เผยแพร่ตัวเลขความแม่นยำหรือความหน่วงเป็นลายลักษณ์อักษร และไม่มีใครนอก Microsoft เคยวัดประสิทธิภาพของเช็คพอยต์ดังกล่าว โมเดลทั้งสองไม่ได้ถูกทดสอบในชุดทดสอบร่วมกัน การเปรียบเทียบนี้จึงเป็นการเทียบทั้งสองโมเดลกับหลักฐานสาธารณะชุดเดียวกัน ซึ่งเป็นทั้งหมดที่ทั้งสองบริษัทได้นำเสนอออกมา ณ ตอนนี้
การปล่อยสองครั้งอย่างเงียบ ๆ ห่างกันแปดวัน
โมเดลทั้งสองเปิดตัวในลักษณะที่ไม่มีการเอิกเกริกเหมือนกัน ซึ่งควรกล่าวตรง ๆ เพราะทั้งสองบริษัทแทบไม่ได้พูดถึงอะไรเพิ่มเติมอีกเลยตั้งแต่นั้น Granite Speech 5.0 470M TurboCTC ของ IBM เป็นสมาชิกที่ใช้สัญญาอนุญาต Apache-2.0 ในการเปิดตัวสองเวอร์ชัน — โดย IBM ยังเผยแพร่รุ่นพี่น้อง -NC ที่ไม่ใช่เชิงพาณิชย์พร้อมตัวเลขเด่นที่ดีกว่าเล็กน้อย — และการ์ดของโมเดลดังกล่าวระบุวันที่เผยแพร่คือ 25 สิงหาคม 2026 พร้อมการรองรับ Transformers แบบเนทีฟและการส่งผลงานเข้าสู่ลีดเดอร์บอร์ด Open ASR ในวันเดียวกัน คู่สตรีมมิงของ Microsoft อย่าง VibeVoice-ASR-Streaming-7B และ VibeVoice-ASR-Streaming-1.5B ถูกสร้างขึ้นบน Hugging Face ภายในนาทีเดียวกันของวันที่ 2 กันยายน ขณะที่บรรทัดข่าวบน GitHub ซึ่งประกาศว่า "โมเดล ASR สตรีมมิงแบบรวมที่ถอดเสียงได้ต่อเนื่องว่าใครพูดอะไรในขณะที่เสียงพูดเข้ามา" ลงวันที่ 3 กันยายน และเอ่ยถึงรุ่น 7B ทิ้งให้รุ่น 1.5B ที่กล่าวถึงในที่นี้เป็นรุ่นน้องที่เปิดตัวออกมาอย่างเงียบ ๆ เคียงข้างกัน
สิ่งที่น่าสนใจคือ สองทีมต่างใช้คำว่า “สตรีมมิง” แต่กลับสร้างสิ่งที่ตรงข้ามกันโดยสิ้นเชิง Granite Speech 5.0 470M TurboCTC เป็นคอนฟอร์เมอร์เอนโค้ดเดอร์ที่ฝึกด้วย CTC และถอดรหัสในรอบเดียวแบบไม่เป็นออโตรีเกรสซีฟ — ไม่มีดีโค้ดเดอร์ที่สร้างข้อความทีละโทเค็น โมเดลจึงมีโครงสร้างที่ประหยัดและเร็วโดยธรรมชาติ ส่วน VibeVoice-ASR-Streaming-1.5B เป็น speech LLM: โทเคไนเซอร์แบบคอนโวลูชันสองตัวแปลงเสียง 24 kHz ให้เป็นสตรีมโทเค็นเสียงที่ความถี่ ~7.5 Hz จากนั้นดีโค้ดเดอร์ตระกูล Qwen2 (28 เลเยอร์, 1,536 หน่วยซ่อนเร้น — ระดับ 1.5B) อ่านสตรีมดังกล่าว และส่วนหัวแบบ diffusion สร้างทรานสคริปต์ออกมาเป็นชิ้นๆ ประมาณ 2.9 วินาที โดยมี lookahead ราวครึ่งวินาที อันหนึ่งเปรียบได้กับรถแข่ง ส่วนอีกอันคือโมเดลภาษาขนาดเล็กที่บังเอิญฟังได้
การตรวจสอบสเปก
พารามิเตอร์ — Granite Speech 5.0 470M TurboCTC: 470M, ตัวเข้ารหัสเท่านั้น เทียบกับ VibeVoice-ASR-Streaming-1.5B: รวม ~3B (แกนหลัก LM ระดับ 1.5B บวกกับตัวโทเคนไนเซอร์และส่วนหัวแบบ diffusion)
• สถาปัตยกรรม — เอ็นโคเดอร์คอนฟอร์เมอร์พร้อม self-attention แบบบล็อก และ self-conditioning ฝึกด้วย CTC และถอดรหัสแบบ non-autoregressive ด้วยวิธี greedy เทียบกับโทเคไนเซอร์แบบคู่ทั้งแบบอะคูสติกและซีแมนติกที่ป้อนเข้าสู่ดีโค้ดเดอร์แบบ causal ในตระกูล Qwen2 พร้อม diffusion head แบบ DDPM
• จังหวะการส่งออกข้อมูล — ประมาณ 12.5 เฟรมต่อวินาที สตรีมแบบเป็นชิ้นส่วน เทียบกับโทเคนเสียงพูดประมาณ 7.5 Hz โดยส่งข้อความต่อชิ้นประมาณ 2.9 วินาที พร้อมการมองล่วงหน้าประมาณ 0.5 วินาที
• ภาษา — เฉพาะภาษาอังกฤษเทียบกับสิบภาษา: จีน อังกฤษ ฝรั่งเศส เยอรมัน อิตาลี ญี่ปุ่น เกาหลี โปรตุเกส รัสเซีย และสเปน
• น้ำหนัก — ประมาณ 0.5B พารามิเตอร์ / เศษเสี้ยวของ GB ในระดับเอจ เทียบกับ ~5.6 GB bf16 ในระดับ NVIDIA-GPU
• ความแม่นยำในเอกสาร — IBM รายงานค่า WER เฉลี่ยประมาณ 5.00% บนชุด short-form ของ Open ASR เทียบกับไม่มีค่า WER ที่ระบุในเนื้อหา
• สัญญาอนุญาต — Apache-2.0 เทียบกับ MIT
• วางจำหน่าย — 25 สิงหาคม 2026 เทียบกับ 2 กันยายน 2026.

ความเร็ว: อันหนึ่งถูกสร้างให้มีขนาดเล็ก ส่วนอีกอันถูกสร้างให้เป็นโมเดลภาษา
ความแตกต่างทางสถาปัตยกรรมปรากฏให้เห็นเป็นอย่างแรกในด้านความเร็วและฮาร์ดแวร์ Granite Speech 5.0 470M TurboCTC ถูกวางตำแหน่งให้กับแล็ปท็อป สมาร์ตโฟน และอุปกรณ์เอจอื่นๆ เนื่องจากตัวเข้ารหัส CTC บริสุทธิ์ไม่มีการสุ่มตัวอย่างใดๆ — ผลลัพธ์คือการประมวลผลแบบ greedy เพียงรอบเดียวบนส่วนหัว BPE ที่มี 16,384 หน่วย — จึงใช้ทรัพยากรน้อยมากในการรัน และการ์ดข้อมูลโมเดลของ IBM รายงานตัวเลขทรูพุต Open ASR ที่วัดบน H200 เพียงตัวเดียวว่าอยู่ในช่วงหลายหมื่น RTFx สำหรับไลน์ TurboCTC พร้อมกับเดโม WebGPU ที่ถอดเสียงแบบสดในแท็บเบราว์เซอร์ ตัวเลขเหล่านั้นเป็นการวัดโดย IBM และยังไม่มีการตรวจสอบซ้ำ แต่ประเด็นเชิงโครงสร้างก็ยืนได้ด้วยตัวเอง: ตัวเข้ารหัสขนาด 470M ที่ไร้ตัวถอดรหัสแบบออโตรีเกรสซีฟคือโมเดลที่สามารถรันบนฮาร์ดแวร์ที่ติดตั้งมาพร้อมกับโทรศัพท์ได้
VibeVoice-ASR-Streaming-1.5B เลือกแนวทางที่ตรงกันข้าม ตัวดีโค้ดเดอร์ของมันเป็น causal language model ซึ่งหมายความว่าข้อความถูกสร้างขึ้นในลูปที่หนักกว่าการหา argmax แบบ CTC และวิธีการรันที่ documented ไว้คือการโฮสต์เองบน GPU ของ NVIDIA — ไม่ว่าจะเป็น Python demos ในรีポสิทอรี microsoft/VibeVoice หรือ vLLM plugin ของมัน — ด้วยน้ำหนัก bf16 ประมาณ 5.6 GB ก่อนจะนับ KV cache ใดๆ Microsoft ไม่ได้เผยแพร่ตัวเลข throughput หรือ real-time-factor ใดๆ ดังนั้นจึงไม่มีตัวเลขจากผู้จำหน่ายมาเทียบกับของ IBM สิ่งที่สถาปัตยกรรม LLM ซื้อมาแทนคือบริบท: โมเดลนำความเข้าใจเรื่องผู้พูดและเนื้อหาข้ามทรานสคริปต์ได้ในแบบที่ language model ทำ ซึ่งคือความแตกต่างระหว่างการถอดเสียงกับารตามบทสนทนา
ความแม่นยำ: ผู้ขายรายหนึ่งพิมพ์ตัวเลข ส่วนอีกรายหนึ่งพิมพ์รูปภาพ
จากหลักฐาน Granite Speech 5.0 470M TurboCTC นำหน้า VibeVoice-ASR-Streaming-1.5B ด้วยความต่างที่สามารถตั้งเป็นเกณฑ์วัดที่เผยแพร่ได้ทั้งชุด IBM นำโมเดลของตนไปรันบนชุดเครื่องมือของ Open ASR leaderboard อย่างเป็นทางการในวันเปิดตัว และรายงานอัตราคำผิดโดยเฉลี่ยประมาณ 5.00% บนชุดภาษาอังกฤษแบบสั้นสาธารณะ ซึ่งเป็นตัวเลขที่วัดโดยผู้จำหน่าย ยังไม่ได้รับการตรวจสอบจากบุคคลที่สาม และไม่มีอยู่เลยในฝั่ง Microsoft ของการเปรียบเทียบนี้ การ์ดโมเดลของ VibeVoice-ASR-Streaming-1.5B แสดงผลการประเมินเป็นรูปภาพ แต่ไม่มีค่า WER, RTF หรือ latency เป็นตัวเลขในข้อความ จุดอ้างอิงตัวเลขเพียงแห่งเดียวในตระกูล VibeVoice คือค่า WER เฉลี่ย 7.77% ที่ผู้จำหน่ายรายงานบนการ์ด VibeVoice-ASR แบบ batch จากชุดทดสอบภาษาอังกฤษแปดชุด ซึ่งอธิบายโมเดลแบบไม่สตรีมและใช้แทนกันไม่ได้ ไม่ว่าการทดสอบโดยอิสระครั้งสุดท้ายจะออกมาอย่างไร บทสรุปที่ซื่อตรงในวันนี้คือ IBM เผยแพร่ตัวเลข ส่วน Microsoft เผยแพร่รูปภาพ

ภาษาและผลลัพธ์: ภาษาอังกฤษเท่านั้น เทียบกับ ใครพูดอะไรในสิบภาษา
Granite Speech 5.0 470M TurboCTC รองรับเฉพาะภาษาอังกฤษ และให้ผลลัพธ์เป็นข้อความถอดเสียงดิบ นั่นไม่ใช่ข้อจำกัดสำหรับภาระงานที่ IBM ตั้งเป้าไว้ — การถอดเสียงภาษาอังกฤษระดับองค์กรบนฮาร์ดแวร์เอดจ์ — แต่การเปรียบเทียบก็จบลงทันทีที่เสียงของคุณไม่ใช่ภาษาอังกฤษ ส่วน VibeVoice-ASR-Streaming-1.5B ระบุภาษาที่รองรับไว้ 10 ภาษา และอ้างว่าให้เอาต์พุตสตรีมมิงแบบระบุตัวผู้พูดได้ โดยการ์ดโมเดลระบุว่า “ถอดเสียงอย่างต่อเนื่องว่าใครพูดอะไรในขณะที่เสียงพูดเข้ามา” พร้อมฮอตเวิร์ดสำหรับคำศัพท์เฉพาะโดเมนซึ่งส่งเป็นพรอมป์ต์บริบท คุณสมบัติเสริมทั้งสองอย่างนี้สมควรได้รับการอ่านอย่างกังขา — การระบุผู้พูดแบบสตรีมมิงข้ามขอบเขตบล็อกเสียง (chunk) นั้นยากอย่างแท้จริง และข้ออ้างดังกล่าวก็ยังไม่ผ่านการพิสูจน์ — แต่มันคือเหตุผลที่ทีมซึ่งมีการประชุมหลายภาษาแบบสดถึงจะหันมามองโมเดลของ Microsoft ตั้งแต่แรก
การอนุญาตสิทธิ์และระบบนิเวศ: Apache-2.0 เทียบกับ MIT, Transformers เทียบกับ repo งานวิจัย
ใบอนุญาตทั้งสองอนุญาตให้ใช้เชิงพาณิชย์ ซึ่งทำให้คู่นี้แตกต่างจากรุ่น -NC ของ IBM เองในสถาปัตยกรรมเดียวกันแล้ว Granite Speech 5.0 470M TurboCTC เป็น Apache-2.0 พร้อมการให้สิทธิบัตรตามปกติ และรองรับโดยตรงใน Hugging Face Transformers (AutoModelForCTC จาก transformers >= 5.16) รวมถึง mlx-audio สำหรับ Apple Silicon — หมายความว่ามันทำงานได้ทุกที่ที่ชุมชนการปรับใช้ที่ใหญ่ที่สุดในระบบนิเวศนี้ใช้งาน บนฮาร์ดแวร์ของผู้ขายทุกราย VibeVoice-ASR-Streaming-1.5B เป็น MIT ซึ่งเรียบง่ายกว่า แต่เส้นทางการให้บริการเป็นการตั้งค่าแบบวิจัยจากการคอมไพล์ซอร์ส: คลาสสถาปัตยกรรมของ checkpoint คือ VibeVoiceForASRStreamingTraining ไม่ปรากฏในเอกสาร Transformers สาธารณะ และเอกสารสตรีมมิ่งของ Microsoft เองก็ชี้ไปที่โค้ดเดโมในรีโพสิทอรีและปลั๊กอิน vLLM มากกว่าการโหลดไลบรารีมาตรฐาน สำหรับทีมที่ทำงานในระบบการผลิต ความแตกต่างนี้ส่งผลจริง: โมเดลหนึ่งสามารถใส่เข้าไปในไปป์ไลน์ Transformers ที่มีอยู่ได้ทันที ส่วนอีกโมเดลหนึ่งให้คุณต้องตั้งรีโพสิทอรีงานวิจัยขึ้นมาและตรวจสอบเส้นทางการโหลดด้วยตัวเอง

คุณควรประเมินการเปิดตัวแบบเงียบตัวใด
ประเมิน Granite Speech 5.0 470M TurboCTC ก่อน หากปริมาณงานของคุณเป็นภาษาอังกฤษ ฮาร์ดแวร์ของคุณเป็นแบบเกรดเอดจ์หรือทำงานบน CPU เป็นหลัก และคุณต้องการโมเดลที่เสียบเข้ากับ Transformers ได้ทันที โดยมีตัวเลขบนการ์ดไว้ให้ตรวจสอบความถูกต้องคร่าวๆ ได้ นี่เป็นตัวเลือกที่ความเสี่ยงต่ำกว่าในทุกมิติ ยกเว้นเพียงด้านเดียว — มันจะไม่ช่วยคุณในเรื่องภาษาที่สอง หรือการถอดความการประชุมสดที่ต้องรู้ว่าใครกำลังพูดอยู่
ประเมิน VibeVoice-ASR-Streaming-1.5B หากคุณต้องการสตรีมมิ่งแบบหลายภาษา หากคุณต้องการทดสอบฟีเจอร์การระบุว่าใครพูดอะไรหรือฮอตเวิร์ด หรือหากคุณอยากเลือกใช้แนวทางแบบโมเดลภาษาสำหรับเสียงพูดมากกว่าเอนโคเดอร์ล้วน เตรียมงบประมาณสำหรับ NVIDIA GPU การติดตั้งจากซอร์สโค้ด น้ำหนักโมเดลประมาณ 5.6 GB และการประเมินผลที่คุณออกแบบเอง เพราะยังไม่มีใคร—รวมถึง Microsoft—เผยแพร่ตัวเลขที่คุณพึ่งพาได้ในตอนนี้
สิ่งที่การเปิดตัวแบบเงียบทั้งสองครั้งไม่ได้เปลี่ยนแปลงคือคุณค่าของการทำให้ชั้น ASR ยังคงสับเปลี่ยนได้ ในขณะที่คุณกำลังค้นหาว่าเดิมพันไหนให้ผลตอบแทน โมเดลทั้งสองยังเป็นโมเดลใหม่ และในขณะที่เขียนนี้ยังไม่มีตัวใดถูกให้บริการผ่าน OrcaRouter เมื่อผู้ให้บริการเริ่มโฮสต์ตัวใดตัวหนึ่ง วิธีที่เสี่ยงต่ำในการทดลองใช้คือการเรียกผ่านเลเยอร์กำหนดเส้นทางที่อยู่หน้าโมเดลกว่า 200 รุ่น ในราคาตามที่ผู้ให้บริการกำหนด — มาร์กอัป 0% ราคาจึงเปลี่ยนถึงมือในวันเดียวกัน — พร้อมเฟลโอเวอร์อัตโนมัติไปยังสิ่งที่คุณไว้วางใจอยู่แล้ว จัดส่งเสียงจริงส่วนหนึ่งไปยังโมเดลใหม่ อ่านบทถอดเสียง แล้วให้ทราฟฟิกของคุณเอง ไม่ใช่ตารางเบนช์มาร์กในวันเปิดตัว เป็นผู้ตัดสินว่าเดิมพันเงียบๆ ตัวไหนคือคำตอบที่ถูกต้อง
