การ์ดไตเติลแบบฮีโร่ที่สร้างขึ้นสำหรับ 'VibeVoice-ASR-Streaming-1.5B เทียบกับ Granite Speech 5.0 470M TurboCTC: สองม้ามืดสตรีมมิงโอเพนเวต' พร้อมคำบรรยายว่า 'โมเดล ASR สตรีมมิงโอเพนเวตสองรุ่นที่ห่างกันแปดวัน' พร้อมการ์ดโมเดลสองใบ — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 ก.ย. 2026 · MIT · รวม ~3B · LLM ด้านเสียงพูด) และ Granite Speech 5.0 470M TurboCTC (IBM · 25 ส.ค. 2026 · Apache-2.0 · 470M · ตัวเข้ารหัส CTC ล้วน) — และแท็กที่ระบุว่า 'ความเร็วระดับเอดจ์ (IBM)', 'ภาษาอังกฤษเท่านั้น (IBM)' และ 'ใครพูดอะไรใน 10 ภาษา (Microsoft, ยังไม่ยืนยัน)' โลโก้ OrcaRouter ถูกวางซ้อนที่มุมขวาล่าง
Guides & Insights

VibeVoice-ASR-Streaming-1.5B เทียบกับ Granite Speech 5.0 470M TurboCTC: สองตัวเก็งสตรีมมิงโอเพนเวตที่เงียบ ๆ

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ผลงานโอเพนเวทสำหรับการแปลงเสียงพูดเป็นข้อความแบบสตรีมมิ่งที่น่าสนใจที่สุดสองชิ้นในช่วงปลายเดือนสิงหาคม 2026 ต่างก็ออกมาโดยไม่มีงานเปิดตัวทั้งคู่ เมื่อวันที่ 25 สิงหาคม IBM วาง Granite Speech 5.0 470M TurboCTC บน Hugging Face — น้ำหนักโมเดล การ์ดโมเดล และบล็อกโพสต์ เท่านั้น — และในวันที่ 2 กันยายน Microsoft Research อัปโหลด VibeVoice-ASR-Streaming-1.5B ภายใต้เนมสเปซ microsoft โดยไม่มีการประกาศใด ๆ เลย นอกจากบรรทัดข่าวในคลัง GitHub ของ VibeVoice ทั้งคู่เป็นสิ่งแบบเดียวกันและเดิมพันทางวิศวกรรมที่ตรงข้ามกัน: โมเดลของ IBM เป็นเอนโค้ดเดอร์ pure-CTC ที่มีพารามิเตอร์ 470 ล้านตัว ออกแบบมาให้ทำงานด้วยความเร็วระดับเอดจ์บนแล็ปท็อป ส่วนของ Microsoft เป็นโมเดลภาษาคำพูดระดับ 1.5B ที่ห่อหุ้มด้วยโทเคนไนเซอร์เสียงและส่วนหัวแบบ diffusion — รวมประมาณสามพันล้านพารามิเตอร์ — สร้างขึ้นเพื่อทำความเข้าใจเสียงพูดในฐานะภาษาพร้อมกับถอดความ

ก่อนจะถึงตัวเลข ขอกล่าวถึงป้ายระบุแหล่งข้อมูลที่ทำให้การเปรียบเทียบนี้โปร่งใส ทุกอย่างที่ระบุว่ารายงานโดย IBM มาจากการ์ดโมเดลของ Granite Speech 5.0 470M TurboCTC และรายการในลีดเดอร์บอร์ด Open ASR ซึ่ง IBM เป็นผู้รันผ่านชุดทดสอบอย่างเป็นทางการในวันเปิดตัว และยังไม่มีการทำซ้ำอย่างอิสระจากภายนอก ส่วนทุกอย่างเกี่ยวกับ VibeVoice-ASR-Streaming-1.5B นั้นได้มาจากการอ่าน repository — ไฟล์คอนฟิก การ์ดโมเดล และเอกสารสตรีมมิงของ Microsoft — เพราะ Microsoft ยังไม่ได้เผยแพร่ตัวเลขความแม่นยำหรือความหน่วงเป็นลายลักษณ์อักษร และไม่มีใครนอก Microsoft เคยวัดประสิทธิภาพของเช็คพอยต์ดังกล่าว โมเดลทั้งสองไม่ได้ถูกทดสอบในชุดทดสอบร่วมกัน การเปรียบเทียบนี้จึงเป็นการเทียบทั้งสองโมเดลกับหลักฐานสาธารณะชุดเดียวกัน ซึ่งเป็นทั้งหมดที่ทั้งสองบริษัทได้นำเสนอออกมา ณ ตอนนี้

การปล่อยสองครั้งอย่างเงียบ ๆ ห่างกันแปดวัน

โมเดลทั้งสองเปิดตัวในลักษณะที่ไม่มีการเอิกเกริกเหมือนกัน ซึ่งควรกล่าวตรง ๆ เพราะทั้งสองบริษัทแทบไม่ได้พูดถึงอะไรเพิ่มเติมอีกเลยตั้งแต่นั้น Granite Speech 5.0 470M TurboCTC ของ IBM เป็นสมาชิกที่ใช้สัญญาอนุญาต Apache-2.0 ในการเปิดตัวสองเวอร์ชัน — โดย IBM ยังเผยแพร่รุ่นพี่น้อง -NC ที่ไม่ใช่เชิงพาณิชย์พร้อมตัวเลขเด่นที่ดีกว่าเล็กน้อย — และการ์ดของโมเดลดังกล่าวระบุวันที่เผยแพร่คือ 25 สิงหาคม 2026 พร้อมการรองรับ Transformers แบบเนทีฟและการส่งผลงานเข้าสู่ลีดเดอร์บอร์ด Open ASR ในวันเดียวกัน คู่สตรีมมิงของ Microsoft อย่าง VibeVoice-ASR-Streaming-7B และ VibeVoice-ASR-Streaming-1.5B ถูกสร้างขึ้นบน Hugging Face ภายในนาทีเดียวกันของวันที่ 2 กันยายน ขณะที่บรรทัดข่าวบน GitHub ซึ่งประกาศว่า "โมเดล ASR สตรีมมิงแบบรวมที่ถอดเสียงได้ต่อเนื่องว่าใครพูดอะไรในขณะที่เสียงพูดเข้ามา" ลงวันที่ 3 กันยายน และเอ่ยถึงรุ่น 7B ทิ้งให้รุ่น 1.5B ที่กล่าวถึงในที่นี้เป็นรุ่นน้องที่เปิดตัวออกมาอย่างเงียบ ๆ เคียงข้างกัน

สิ่งที่น่าสนใจคือ สองทีมต่างใช้คำว่า “สตรีมมิง” แต่กลับสร้างสิ่งที่ตรงข้ามกันโดยสิ้นเชิง Granite Speech 5.0 470M TurboCTC เป็นคอนฟอร์เมอร์เอนโค้ดเดอร์ที่ฝึกด้วย CTC และถอดรหัสในรอบเดียวแบบไม่เป็นออโตรีเกรสซีฟ — ไม่มีดีโค้ดเดอร์ที่สร้างข้อความทีละโทเค็น โมเดลจึงมีโครงสร้างที่ประหยัดและเร็วโดยธรรมชาติ ส่วน VibeVoice-ASR-Streaming-1.5B เป็น speech LLM: โทเคไนเซอร์แบบคอนโวลูชันสองตัวแปลงเสียง 24 kHz ให้เป็นสตรีมโทเค็นเสียงที่ความถี่ ~7.5 Hz จากนั้นดีโค้ดเดอร์ตระกูล Qwen2 (28 เลเยอร์, 1,536 หน่วยซ่อนเร้น — ระดับ 1.5B) อ่านสตรีมดังกล่าว และส่วนหัวแบบ diffusion สร้างทรานสคริปต์ออกมาเป็นชิ้นๆ ประมาณ 2.9 วินาที โดยมี lookahead ราวครึ่งวินาที อันหนึ่งเปรียบได้กับรถแข่ง ส่วนอีกอันคือโมเดลภาษาขนาดเล็กที่บังเอิญฟังได้

การตรวจสอบสเปก

พารามิเตอร์ — Granite Speech 5.0 470M TurboCTC: 470M, ตัวเข้ารหัสเท่านั้น เทียบกับ VibeVoice-ASR-Streaming-1.5B: รวม ~3B (แกนหลัก LM ระดับ 1.5B บวกกับตัวโทเคนไนเซอร์และส่วนหัวแบบ diffusion)

• สถาปัตยกรรม — เอ็นโคเดอร์คอนฟอร์เมอร์พร้อม self-attention แบบบล็อก และ self-conditioning ฝึกด้วย CTC และถอดรหัสแบบ non-autoregressive ด้วยวิธี greedy เทียบกับโทเคไนเซอร์แบบคู่ทั้งแบบอะคูสติกและซีแมนติกที่ป้อนเข้าสู่ดีโค้ดเดอร์แบบ causal ในตระกูล Qwen2 พร้อม diffusion head แบบ DDPM

• จังหวะการส่งออกข้อมูล — ประมาณ 12.5 เฟรมต่อวินาที สตรีมแบบเป็นชิ้นส่วน เทียบกับโทเคนเสียงพูดประมาณ 7.5 Hz โดยส่งข้อความต่อชิ้นประมาณ 2.9 วินาที พร้อมการมองล่วงหน้าประมาณ 0.5 วินาที

• ภาษา — เฉพาะภาษาอังกฤษเทียบกับสิบภาษา: จีน อังกฤษ ฝรั่งเศส เยอรมัน อิตาลี ญี่ปุ่น เกาหลี โปรตุเกส รัสเซีย และสเปน

• น้ำหนัก — ประมาณ 0.5B พารามิเตอร์ / เศษเสี้ยวของ GB ในระดับเอจ เทียบกับ ~5.6 GB bf16 ในระดับ NVIDIA-GPU

• ความแม่นยำในเอกสาร — IBM รายงานค่า WER เฉลี่ยประมาณ 5.00% บนชุด short-form ของ Open ASR เทียบกับไม่มีค่า WER ที่ระบุในเนื้อหา

• สัญญาอนุญาต — Apache-2.0 เทียบกับ MIT

• วางจำหน่าย — 25 สิงหาคม 2026 เทียบกับ 2 กันยายน 2026.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total / 1.5B-class LM, Architecture speech LLM + diffusion, Languages 10, Streaming ~2.9 s chunks + ~0.5 s lookahead, WER none published, License MIT. Right column Granite Speech 5.0 470M TurboCTC: Released Aug 25 2026, Params 470M, Architecture conformer CTC, Languages English only, Streaming chunkwise ~12.5 frames/s, WER ~5.00% (IBM-reported), License Apache-2.0. Footer reads 'Granite figures IBM-reported, unverified; VibeVoice specs read from the HF repo; no independent benchmark of either exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

ความเร็ว: อันหนึ่งถูกสร้างให้มีขนาดเล็ก ส่วนอีกอันถูกสร้างให้เป็นโมเดลภาษา

ความแตกต่างทางสถาปัตยกรรมปรากฏให้เห็นเป็นอย่างแรกในด้านความเร็วและฮาร์ดแวร์ Granite Speech 5.0 470M TurboCTC ถูกวางตำแหน่งให้กับแล็ปท็อป สมาร์ตโฟน และอุปกรณ์เอจอื่นๆ เนื่องจากตัวเข้ารหัส CTC บริสุทธิ์ไม่มีการสุ่มตัวอย่างใดๆ — ผลลัพธ์คือการประมวลผลแบบ greedy เพียงรอบเดียวบนส่วนหัว BPE ที่มี 16,384 หน่วย — จึงใช้ทรัพยากรน้อยมากในการรัน และการ์ดข้อมูลโมเดลของ IBM รายงานตัวเลขทรูพุต Open ASR ที่วัดบน H200 เพียงตัวเดียวว่าอยู่ในช่วงหลายหมื่น RTFx สำหรับไลน์ TurboCTC พร้อมกับเดโม WebGPU ที่ถอดเสียงแบบสดในแท็บเบราว์เซอร์ ตัวเลขเหล่านั้นเป็นการวัดโดย IBM และยังไม่มีการตรวจสอบซ้ำ แต่ประเด็นเชิงโครงสร้างก็ยืนได้ด้วยตัวเอง: ตัวเข้ารหัสขนาด 470M ที่ไร้ตัวถอดรหัสแบบออโตรีเกรสซีฟคือโมเดลที่สามารถรันบนฮาร์ดแวร์ที่ติดตั้งมาพร้อมกับโทรศัพท์ได้

VibeVoice-ASR-Streaming-1.5B เลือกแนวทางที่ตรงกันข้าม ตัวดีโค้ดเดอร์ของมันเป็น causal language model ซึ่งหมายความว่าข้อความถูกสร้างขึ้นในลูปที่หนักกว่าการหา argmax แบบ CTC และวิธีการรันที่ documented ไว้คือการโฮสต์เองบน GPU ของ NVIDIA — ไม่ว่าจะเป็น Python demos ในรีポสิทอรี microsoft/VibeVoice หรือ vLLM plugin ของมัน — ด้วยน้ำหนัก bf16 ประมาณ 5.6 GB ก่อนจะนับ KV cache ใดๆ Microsoft ไม่ได้เผยแพร่ตัวเลข throughput หรือ real-time-factor ใดๆ ดังนั้นจึงไม่มีตัวเลขจากผู้จำหน่ายมาเทียบกับของ IBM สิ่งที่สถาปัตยกรรม LLM ซื้อมาแทนคือบริบท: โมเดลนำความเข้าใจเรื่องผู้พูดและเนื้อหาข้ามทรานสคริปต์ได้ในแบบที่ language model ทำ ซึ่งคือความแตกต่างระหว่างการถอดเสียงกับารตามบทสนทนา

ความแม่นยำ: ผู้ขายรายหนึ่งพิมพ์ตัวเลข ส่วนอีกรายหนึ่งพิมพ์รูปภาพ

จากหลักฐาน Granite Speech 5.0 470M TurboCTC นำหน้า VibeVoice-ASR-Streaming-1.5B ด้วยความต่างที่สามารถตั้งเป็นเกณฑ์วัดที่เผยแพร่ได้ทั้งชุด IBM นำโมเดลของตนไปรันบนชุดเครื่องมือของ Open ASR leaderboard อย่างเป็นทางการในวันเปิดตัว และรายงานอัตราคำผิดโดยเฉลี่ยประมาณ 5.00% บนชุดภาษาอังกฤษแบบสั้นสาธารณะ ซึ่งเป็นตัวเลขที่วัดโดยผู้จำหน่าย ยังไม่ได้รับการตรวจสอบจากบุคคลที่สาม และไม่มีอยู่เลยในฝั่ง Microsoft ของการเปรียบเทียบนี้ การ์ดโมเดลของ VibeVoice-ASR-Streaming-1.5B แสดงผลการประเมินเป็นรูปภาพ แต่ไม่มีค่า WER, RTF หรือ latency เป็นตัวเลขในข้อความ จุดอ้างอิงตัวเลขเพียงแห่งเดียวในตระกูล VibeVoice คือค่า WER เฉลี่ย 7.77% ที่ผู้จำหน่ายรายงานบนการ์ด VibeVoice-ASR แบบ batch จากชุดทดสอบภาษาอังกฤษแปดชุด ซึ่งอธิบายโมเดลแบบไม่สตรีมและใช้แทนกันไม่ได้ ไม่ว่าการทดสอบโดยอิสระครั้งสุดท้ายจะออกมาอย่างไร บทสรุปที่ซื่อตรงในวันนี้คือ IBM เผยแพร่ตัวเลข ส่วน Microsoft เผยแพร่รูปภาพ

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

ภาษาและผลลัพธ์: ภาษาอังกฤษเท่านั้น เทียบกับ ใครพูดอะไรในสิบภาษา

Granite Speech 5.0 470M TurboCTC รองรับเฉพาะภาษาอังกฤษ และให้ผลลัพธ์เป็นข้อความถอดเสียงดิบ นั่นไม่ใช่ข้อจำกัดสำหรับภาระงานที่ IBM ตั้งเป้าไว้ — การถอดเสียงภาษาอังกฤษระดับองค์กรบนฮาร์ดแวร์เอดจ์ — แต่การเปรียบเทียบก็จบลงทันทีที่เสียงของคุณไม่ใช่ภาษาอังกฤษ ส่วน VibeVoice-ASR-Streaming-1.5B ระบุภาษาที่รองรับไว้ 10 ภาษา และอ้างว่าให้เอาต์พุตสตรีมมิงแบบระบุตัวผู้พูดได้ โดยการ์ดโมเดลระบุว่า “ถอดเสียงอย่างต่อเนื่องว่าใครพูดอะไรในขณะที่เสียงพูดเข้ามา” พร้อมฮอตเวิร์ดสำหรับคำศัพท์เฉพาะโดเมนซึ่งส่งเป็นพรอมป์ต์บริบท คุณสมบัติเสริมทั้งสองอย่างนี้สมควรได้รับการอ่านอย่างกังขา — การระบุผู้พูดแบบสตรีมมิงข้ามขอบเขตบล็อกเสียง (chunk) นั้นยากอย่างแท้จริง และข้ออ้างดังกล่าวก็ยังไม่ผ่านการพิสูจน์ — แต่มันคือเหตุผลที่ทีมซึ่งมีการประชุมหลายภาษาแบบสดถึงจะหันมามองโมเดลของ Microsoft ตั้งแต่แรก

การอนุญาตสิทธิ์และระบบนิเวศ: Apache-2.0 เทียบกับ MIT, Transformers เทียบกับ repo งานวิจัย

ใบอนุญาตทั้งสองอนุญาตให้ใช้เชิงพาณิชย์ ซึ่งทำให้คู่นี้แตกต่างจากรุ่น -NC ของ IBM เองในสถาปัตยกรรมเดียวกันแล้ว Granite Speech 5.0 470M TurboCTC เป็น Apache-2.0 พร้อมการให้สิทธิบัตรตามปกติ และรองรับโดยตรงใน Hugging Face Transformers (AutoModelForCTC จาก transformers >= 5.16) รวมถึง mlx-audio สำหรับ Apple Silicon — หมายความว่ามันทำงานได้ทุกที่ที่ชุมชนการปรับใช้ที่ใหญ่ที่สุดในระบบนิเวศนี้ใช้งาน บนฮาร์ดแวร์ของผู้ขายทุกราย VibeVoice-ASR-Streaming-1.5B เป็น MIT ซึ่งเรียบง่ายกว่า แต่เส้นทางการให้บริการเป็นการตั้งค่าแบบวิจัยจากการคอมไพล์ซอร์ส: คลาสสถาปัตยกรรมของ checkpoint คือ VibeVoiceForASRStreamingTraining ไม่ปรากฏในเอกสาร Transformers สาธารณะ และเอกสารสตรีมมิ่งของ Microsoft เองก็ชี้ไปที่โค้ดเดโมในรีโพสิทอรีและปลั๊กอิน vLLM มากกว่าการโหลดไลบรารีมาตรฐาน สำหรับทีมที่ทำงานในระบบการผลิต ความแตกต่างนี้ส่งผลจริง: โมเดลหนึ่งสามารถใส่เข้าไปในไปป์ไลน์ Transformers ที่มีอยู่ได้ทันที ส่วนอีกโมเดลหนึ่งให้คุณต้องตั้งรีโพสิทอรีงานวิจัยขึ้นมาและตรวจสอบเส้นทางการโหลดด้วยตัวเอง

A screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the model title Granite-Speech-5.0-470M-TurboCTC, the Apache-2.0 license tag, the English-language tag, the automatic-speech-recognition pipeline tag, and the model summary describing a compact 470 million parameter English ASR model for edge deployment.

คุณควรประเมินการเปิดตัวแบบเงียบตัวใด

ประเมิน Granite Speech 5.0 470M TurboCTC ก่อน หากปริมาณงานของคุณเป็นภาษาอังกฤษ ฮาร์ดแวร์ของคุณเป็นแบบเกรดเอดจ์หรือทำงานบน CPU เป็นหลัก และคุณต้องการโมเดลที่เสียบเข้ากับ Transformers ได้ทันที โดยมีตัวเลขบนการ์ดไว้ให้ตรวจสอบความถูกต้องคร่าวๆ ได้ นี่เป็นตัวเลือกที่ความเสี่ยงต่ำกว่าในทุกมิติ ยกเว้นเพียงด้านเดียว — มันจะไม่ช่วยคุณในเรื่องภาษาที่สอง หรือการถอดความการประชุมสดที่ต้องรู้ว่าใครกำลังพูดอยู่

ประเมิน VibeVoice-ASR-Streaming-1.5B หากคุณต้องการสตรีมมิ่งแบบหลายภาษา หากคุณต้องการทดสอบฟีเจอร์การระบุว่าใครพูดอะไรหรือฮอตเวิร์ด หรือหากคุณอยากเลือกใช้แนวทางแบบโมเดลภาษาสำหรับเสียงพูดมากกว่าเอนโคเดอร์ล้วน เตรียมงบประมาณสำหรับ NVIDIA GPU การติดตั้งจากซอร์สโค้ด น้ำหนักโมเดลประมาณ 5.6 GB และการประเมินผลที่คุณออกแบบเอง เพราะยังไม่มีใคร—รวมถึง Microsoft—เผยแพร่ตัวเลขที่คุณพึ่งพาได้ในตอนนี้

สิ่งที่การเปิดตัวแบบเงียบทั้งสองครั้งไม่ได้เปลี่ยนแปลงคือคุณค่าของการทำให้ชั้น ASR ยังคงสับเปลี่ยนได้ ในขณะที่คุณกำลังค้นหาว่าเดิมพันไหนให้ผลตอบแทน โมเดลทั้งสองยังเป็นโมเดลใหม่ และในขณะที่เขียนนี้ยังไม่มีตัวใดถูกให้บริการผ่าน OrcaRouter เมื่อผู้ให้บริการเริ่มโฮสต์ตัวใดตัวหนึ่ง วิธีที่เสี่ยงต่ำในการทดลองใช้คือการเรียกผ่านเลเยอร์กำหนดเส้นทางที่อยู่หน้าโมเดลกว่า 200 รุ่น ในราคาตามที่ผู้ให้บริการกำหนด — มาร์กอัป 0% ราคาจึงเปลี่ยนถึงมือในวันเดียวกัน — พร้อมเฟลโอเวอร์อัตโนมัติไปยังสิ่งที่คุณไว้วางใจอยู่แล้ว จัดส่งเสียงจริงส่วนหนึ่งไปยังโมเดลใหม่ อ่านบทถอดเสียง แล้วให้ทราฟฟิกของคุณเอง ไม่ใช่ตารางเบนช์มาร์กในวันเปิดตัว เป็นผู้ตัดสินว่าเดิมพันเงียบๆ ตัวไหนคือคำตอบที่ถูกต้อง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube