การ์ดไตเติลฮีโร่ที่สร้างขึ้นสำหรับ 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B: ผู้ท้าชิงที่ใช้ใบอนุญาต MIT ซึ่งยังไม่ผ่านการพิสูจน์ ปะทะกับแชมป์ Open ASR' โดยมีคำบรรยายใต้ไตเติลว่า 'ตัวเลือกมาตรฐานที่พิสูจน์แล้ว ปะทะกับผู้ท้าชิงที่เพิ่งมาได้วันเดียว' พร้อมด้วยการ์ดโมเดลสองใบ ได้แก่ VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 กันยายน 2026 · MIT · ยังไม่มี benchmark เผยแพร่) และ NVIDIA Parakeet TDT 0.6B (NVIDIA · 5 พฤษภาคม 2025 · CC-BY-4.0 · Open ASR อันดับ 1 ตั้งแต่เดือนพฤษภาคม 2025) รวมถึงแท็กที่ระบุว่า 'ค่า WER เฉลี่ย 6.05% (Parakeet)', 'ห่างกัน 16 เดือน' และ 'ใครพูดอะไร + hotwords (Microsoft, ยังไม่ได้รับการยืนยัน)' โลโก้ OrcaRouter ถูกวางประกอบไว้ที่มุมขวาล่าง
Guides & Insights

VibeVoice-ASR-Streaming-1.5B เทียบกับ NVIDIA Parakeet TDT 0.6B: ผู้ท้าชิงจาก MIT ที่ยังไม่ผ่านการพิสูจน์ สู้กับแชมป์ Open ASR

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

หากคุณต้องการระบบแปลงคำพูดเป็นข้อความแบบเปิดน้ำหนัก (open-weights) สำหรับใช้งานจริงในปัจจุบัน มีค่าเริ่มต้นอยู่หนึ่งตัว นั่นคือ NVIDIA Parakeet TDT 0.6B ตั้งแต่เดือนพฤษภาคม 2025 Parakeet TDT 0.6B v2 ที่มีพารามิเตอร์ 600 ล้านตัวครองอันดับหนึ่งบน Hugging Face Open ASR leaderboard ด้วยอัตราคำผิดเฉลี่ย 6.05% ซึ่งเป็นตำแหน่งที่บุคคลที่สามยืนยันผลได้ต่อเนื่องยาวนานกว่าหนึ่งปี ผู้ท้าชิงรายใหม่ล่าสุดคือ VibeVoice-ASR-Streaming-1.5B ซึ่ง Microsoft Research อัปโหลดเมื่อวันที่ 2 กันยายน 2026 — ช้ากว่า Parakeet สิบหกเดือน ภายใต้สัญญาอนุญาต MIT พร้อมฟีเจอร์การระบุผู้พูดแบบสตรีมมิง และจนถึงตอนนี้ยังไม่มีตัวเลขความแม่นยำที่เผยแพร่ออกมาเลย หน้านี้เปรียบเทียบแชมป์และผู้ท้าชิงในแง่หลักฐาน สถาปัตยกรรม และสิ่งที่แต่ละตัวมาพร้อมให้ใช้งานได้ทันที

ก่อนที่จะดูสเปก มีป้ายกำกับสองอย่างที่สำคัญ เพราะมันคือภาพรวมทั้งหมดของการแข่งขันครั้งนี้ ตัวเลขของ Parakeet นั้นชัดเจนแล้ว: อัตรา WER เฉลี่ย 6.05% และตัวเลข throughput RTFx ที่ประมาณ 3,386 ซึ่งอยู่เบื้องหลังคำกล่าวอ้างที่ว่า "เสียงหนึ่งชั่วโมงในเวลาประมาณหนึ่งวินาที" ได้อยู่บนลีดเดอร์บอร์ดสาธารณะและเอกสารของ NVIDIA มานานกว่าหนึ่งปี ส่วนด้านของ VibeVoice-ASR-Streaming-1.5B สิ่งที่พอทราบได้จากที่เก็บโค้ด (repository) ก็คือ โมเดลการ์ด ไฟล์คอนฟิก และเอกสารสตรีมมิ่งของ Microsoft — เนื่องจาก Microsoft ไม่ได้เผยแพร่ค่า WER ระยะหน่วง หรือ throughput ในรูปแบบข้อความ และไม่มีเกณฑ์วัดผลอิสระของ checkpoint นี้ ณ เวลาที่เขียนนี้ หนึ่งคอลัมน์ของการเปรียบเทียบทุกอันด้านล่างผ่านการทดสอบจริง อีกคอลัมน์หนึ่งเป็นเพียงแผ่นข้อมูลสเปก

ห่างกันสิบหกเดือน กับการครองตำแหน่งบนลีดเดอร์บอร์ดหนึ่งครั้ง

Parakeet TDT 0.6B v2 เปิดตัวเมื่อวันที่ 5 พฤษภาคม 2025 ในฐานะคำตอบของ NVIDIA สำหรับปัญหาการรู้จำเสียงพูดแบบสตรีมมิ่ง (streaming ASR): ตัวเข้ารหัส FastConformer จับคู่กับตัวถอดรหัสแบบ token-and-duration transducer (TDT) ที่ทำนายแต่ละโทเค็นและระยะเวลาที่มันคงอยู่ได้ในขั้นตอนเดียว ซึ่งเป็นเทคนิคด้านประสิทธิภาพที่กำจัดค่าใช้จ่ายของ blank token ของทรานสดิวเซอร์แบบดั้งเดิม มันเป็นลิขสิทธิ์ CC-BY-4.0 เหมาะสำหรับการใช้งานเชิงพาณิชย์ และคว้าอันดับหนึ่งบนกระดานผู้นำ Open ASR ด้วยอัตราคำผิดเฉลี่ย 6.05% นอกจากนี้ยังนำเสนอฟีเจอร์สำหรับการผลิตที่กระดานผู้นำไม่ได้วัดไว้ เช่น เครื่องหมายวรรคตอน การใช้อักษรตัวพิมพ์ใหญ่ และไทม์สแตมป์ระดับคำ พร้อมทั้งตัวเข้ารหัสแบบ full-attention ที่รองรับเสียงได้สูงสุด 24 นาทีในการประมวลผลครั้งเดียว ซึ่งทำให้มีประโยชน์สำหรับการประชุมยาวและพอดแคสต์โดยไม่ต้องแบ่งส่วนเสียงอย่างรุนแรง

VibeVoice-ASR-Streaming-1.5B เป็นผู้ท้าชิงในความหมายที่แท้จริงที่สุด: มันมีอยู่จริง มีการบันทึกข้อมูลไว้ และยังไม่มีการพิสูจน์ว่ามันทำงานได้ดีเพียงใด ข่าวบน GitHub ของ Microsoft ลงวันที่ 3 กันยายน ประกาศโมเดล ASR แบบสตรีมมิงรวม (unified streaming ASR) ที่ "ถอดความต่อเนื่องว่าใครพูดอะไรขณะที่เสียงพูดไหลเข้ามา" พร้อมด้วยฮอตเวิร์ดและอีกสิบภาษา และคอนฟิกของเช็คพอยต์ได้อธิบายแนวทางวิศวกรรมที่ต่างออกไปโดยสิ้นเชิง — ตัวถอดรหัสโมเดลภาษาในตระกูล Qwen2 ที่ป้อนด้วยตัวแปลงเสียงแบบคอนโวลูชัน (convolutional audio tokenizers) พร้อมกับหัวแบบดิฟฟิวชัน (diffusion head) ที่สร้างผลลัพธ์เป็นชิ้นยาวประมาณ 2.9 วินาที และมองไปข้างหน้าประมาณ 0.5 วินาที ในขณะที่ Parakeet เป็นโมเดลเสียงที่ออกแบบมาเพื่อจุดประสงค์เฉพาะ ได้รับการปรับปรุงตลอดกว่าหนึ่งปีของการใช้งานจริง VibeVoice-ASR-Streaming-1.5B กลับเป็นเช็คพอยต์ในตระกูลงานวิจัยที่มีอายุเพียงแค่สองวัน

ความไม่สมมาตรของหลักฐานคือแก่นของเรื่อง

อ่านเนื้อหาที่เหลือของหน้านี้โดยมีข้อเท็จจริงข้อหนึ่งอยู่ตรงหน้า: การเปรียบเทียบนี้มีตัวเลขอยู่เพียงฝั่งเดียวเท่านั้น ฝั่งของ Parakeet TDT 0.6B มีการป้องกันตำแหน่งบนลีดเดอร์บอร์ดมาหนึ่งปี — ค่า WER เฉลี่ย 6.05% บนชุดเสียงพูดสั้นภาษาอังกฤษแบบสาธารณะของ Open ASR, ~3,386 RTFx ที่แบตช์ 128 บนฮาร์ดแวร์ NVIDIA และระบบนิเวศเครื่องมือปรับใช้ NeMo การเร่งความเร็วด้วย TensorRT และการควอนไทซ์ FP8 ที่ถูกใช้งานในระบบผลิตจริง ส่วนฝั่งของ VibeVoice-ASR-Streaming-1.5B มีตัวเลขการประเมินจากการ์ดโมเดลซึ่งเป็นรูปภาพแทนที่จะเป็นข้อความ และค่า WER เฉลี่ย 7.77% ที่ผู้พัฒนารายงานไว้ในการ์ด VibeVoice-ASR แบบแบตช์จากชุดทดสอบภาษาอังกฤษแปดชุด — ตัวเลขที่อธิบายโมเดลแบบไม่สตรีมมิงและไม่สามารถนำมาใช้กับเช็คพอยต์นี้ได้ ผู้ท้าชิงอาจจะยอดเยี่ยมก็เป็นได้ แต่ประเด็นคือ “อาจจะยอดเยี่ยมก็เป็นได้” คือหลักฐานทั้งหมดที่มีอยู่

การตรวจสอบสเปก

• พารามิเตอร์ — NVIDIA Parakeet TDT 0.6B: 600M, ตัวเข้ารหัส FastConformer + ตัวถอดรหัส TDT เทียบกับ VibeVoice-ASR-Streaming-1.5B: รวม ~3B (แบ็คโบน Qwen ระดับ 1.5B พร้อมโทเคนไนเซอร์และส่วนหัวแบบดีฟิวชัน)

• เปิดตัว — 5 พฤษภาคม 2025 เทียบกับ 2 กันยายน 2026

ความแม่นยำ — ค่า WER เฉลี่ย 6.05% อยู่อันดับ 1 ของ Open ASR ตั้งแต่เดือนพฤษภาคม 2025 มีการยืนยันผลซ้ำโดยบุคคลที่สาม เทียบกับอีกฝ่ายที่ไม่มีการเผยแพร่ผลใดๆ เลย

• ความเร็ว — ประมาณ 3,386 RTFx ที่แบตช์ 128 บนฮาร์ดแวร์ NVIDIA คิดเป็นเสียงประมาณ 1 ชั่วโมงต่อวินาที เทียบกับที่ไม่มีตัวเลขปริมาณงานที่เผยแพร่

• Streaming — รองรับการสตรีมมิ่ง โดยมีบริบทแบบ full-attention ยาวได้ถึง 24 นาทีต่อรอบ (pass) เทียบกับการสตรีมมิ่งแบบแบ่งเป็นส่วน (chunked streaming) ซึ่งมีชิ้นส่วน ~2.9 วินาที พร้อมการมองล่วงหน้า ~0.5 วินาที

• เอาต์พุตเสริม — เครื่องหมายวรรคตอน ตัวพิมพ์ใหญ่ การประทับเวลาระดับคำ เทียบกับการระบุผู้พูดแบบสตรีมมิ่งว่าใครพูดอะไร (ไม่ได้รับการยืนยัน) และฮอตเวิร์ด; สิบภาษา

• ใบอนุญาต — CC-BY-4.0 vs MIT

• ระบบนิเวศ — NVIDIA NeMo พร้อม TensorRT และ FP8 เทียบกับเดโมจากรีโพ microsoft/VibeVoice และปลั๊กอิน vLLM

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total, Architecture speech LLM + diffusion, WER none published, Streaming ~2.9 s chunks, Extras who-said-what + hotwords, License MIT. Right column NVIDIA Parakeet TDT 0.6B v2: Released May 5 2025, Params 600M, Architecture FastConformer + TDT, WER 6.05% Open ASR #1, Streaming full-attention up to 24 min, Extras punctuation + timestamps, License CC-BY-4.0. Footer reads 'Parakeet figures per the Open ASR leaderboard, settled since 2025; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

เบื้องหลัง: สองแนวคิดเกี่ยวกับจุดประสงค์ของโมเดลเสียงพูด

สถาปัตยกรรมทั้งสองแสดงความเชื่อที่แตกต่างกันเกี่ยวกับงานนี้ Parakeet TDT 0.6B มองการถอดเสียงเป็นปัญหาการประมวลผลสัญญาณที่แก้ได้อย่างมีประสิทธิภาพ: ตัวเข้ารหัส FastConformer สกัดคุณลักษณะทางเสียง และตัวถอดรหัส TDT จะปล่อยโทเค็นข้อความและช่วงเวลาร่วมกัน นั่นคือเหตุผลที่มันทำงานได้เร็วกว่าเรียลไทม์หลายพันเท่า และเหตุผลที่มันทำงานได้สบายบนสแตกการปรับใช้ของ NVIDIA ส่วน VibeVoice-ASR-Streaming-1.5B มองการถอดเสียงเป็นปัญหาทางภาษา: บีบอัดเสียงให้เป็นสตรีมโทเค็น ส่งให้โมเดลภาษาที่อ่านบริบทเทียบเท่าบทถอดเสียงหนึ่งบท แล้วให้ความเข้าใจของ LM เกี่ยวกับใครพูดอะไรและบทสนทนาเชื่อมโยงกันอย่างไรเป็นคนทำงาน เบื้องหลัง LLM ยังเป็นเหตุผลที่ checkpoint มีพารามิเตอร์ประมาณ 3B แทนที่จะเป็น 600M และเป็นเหตุผลที่ Microsoft ไม่ได้อ้างสิทธิ์เรื่องพื้นที่การใช้งานบนอุปกรณ์ขอบ — นี่คือโมเดลที่ต้องการ GPU และใช้หน่วยความจำเพื่อพกพาบริบท

สำหรับการถอดเสียงสด ผลเชิงปฏิบัติคือรูปแบบของความหน่วง เอนโค้ดเดอร์แบบ full-attention ของ Parakeet สามารถประมวลผลหน้าต่างเสียงยาวๆ ได้ในรอบเดียว ซึ่งเป็นปรัชญาการสตรีมมิ่งที่ต่างจากข้อกำหนดแบบ chunk-and-lookahead ที่ตายตัวของ VibeVoice-ASR-Streaming-1.5B ซึ่งใช้เสียงประมาณ 2.9 วินาทีต่อเซกเมนต์ที่ส่งออกหนึ่งชิ้น ไม่มีระบบใดในสองระบบนี้เป็นสตรีมเมอร์แบบให้ผลลัพธ์บางส่วนทีละคำในสไตล์ของ API เชิงพาณิชย์ที่หน่วงต่ำที่สุด ทั้งสองเป็นระบบแบบแบ่งเป็นชิ้น และระบบที่เหมาะสมจะขึ้นอยู่กับว่าเสียงของคุณมาเป็นไฟล์จำกัดขอบเขตหรือเป็นเซสชันสดที่ต่อเนื่องแบบไม่รู้จบ

เรื่องราวของฟีเจอร์และพื้นที่การปรับใช้

ในแง่ความสามารถมาตรฐานที่มีมาให้ Parakeet TDT 0.6B เป็นผลิตภัณฑ์ถอดเสียงที่สมบูรณ์กว่า: เครื่องหมายวรรคตอนและการใช้ตัวพิมพ์ใหญ่มากับบทถอดเสียง การประทับเวลาระดับคำพร้อมสำหรับการจัดตำแหน่ง และหน้าต่างการประมวลผลแบบครั้งเดียวความยาว 24 นาทีช่วยลดข้อผิดพลาดจากการแบ่งเป็นชิ้นส่วนในการบันทึกเสียงยาว ในทางกลับกัน VibeVoice-ASR-Streaming-1.5B สวนกลับด้วยฟีเจอร์ที่ Parakeet ไม่ได้ระบุไว้ นั่นคือ ผลลัพธ์ที่ระบุตัวผู้พูดและคำเฉพาะ (hotwords) รองรับสิบภาษา แต่คำกล่าวอ้างเรื่องการระบุผู้พูดแบบสตรีมมิงนั้นเป็นสิ่งที่ต้องมีการตรวจสอบโดยอิสระจริง ๆ — เพราะขอบเขตของชิ้นส่วนคือจุดที่การระบุผู้พูดเริ่มคลาดเคลื่อน — และนั่นคือเหตุผลที่ควรพิจารณาโมเดลของ Microsoft มากกว่าของ NVIDIA หากความต้องการของคุณคือการรู้ว่าใครพูดอะไรในการประชุมสด

A screenshot of the Hugging Face model card for nvidia/parakeet-tdt-0.6b-v2, showing the NVIDIA namespace, the model title 'Parakeet TDT 0.6B V2 (En)', the automatic-speech-recognition and NeMo pipeline tags, and the card description of the 600-million-parameter FastConformer model with TDT decoder, punctuation and timestamps, audio segments up to 24 minutes in a single pass, and an RTFx of 3380 on the Open ASR leaderboard at batch 128.

ย่านต่างๆ ก็แตกต่างกันพอๆ กับตัวโมเดลเลย Parakeet TDT 0.6B เป็นพลเมืองของ NVIDIA NeMo: มี TensorRT, FP8 และเครื่องมือปรับใช้ที่ปรับจูนมาสำหรับ GPU ของ NVIDIA ซึ่งถือว่าดีเยี่ยมหากคุณอยู่บนโครงสร้างพื้นฐานของ NVIDIA อยู่แล้ว ส่วน VibeVoice-ASR-Streaming-1.5B อาศัยอยู่ในคลังเก็บงานวิจัย: เส้นทางที่มีเอกสารรองรับคือเดโม Python ของ Microsoft และปลั๊กอิน vLLM คลาสสถาปัตยกรรมของมันยังไม่ปรากฏในเอกสาร Transformers ที่เปิดเผยต่อสาธารณะ และการจะตั้งค่าให้ทำงานได้นั้นต้องติดตั้งจากซอร์สโค้ดและต้องตรวจสอบด้วยตัวเองว่าเส้นทางการโหลดทำงานได้จริง สำหรับทีมที่ให้คุณค่ากับการปรับใช้ที่เรียบง่าย ตรงไปตรงมา และมีเอกสารครบถ้วน ความแตกต่างเพียงข้อนี้ก็มีน้ำหนักมากกว่าช่องว่างของ benchmark ได้

ข้อโต้แย้งสำหรับผู้ดำรงตำแหน่ง, ข้อโต้แย้งสำหรับผู้ท้าชิง

กรณีของ NVIDIA Parakeet TDT 0.6B คือกรณีของสิ่งที่รู้จักกันดี: การป้องกันตำแหน่งในลีดเดอร์บอร์ดเป็นเวลาหนึ่งปี การทำซ้ำโดยบุคคลที่สาม ใบอนุญาตเชิงพาณิชย์ ฟีเจอร์สำหรับการใช้งานจริง และระบบนิเวศการปรับใช้ที่รองรับทราฟฟิกจริง หากคุณกำลังจะเปิดตัวฟีเจอร์ถอดเสียงภาษาอังกฤษในไตรมาสนี้ และต้องการโมเดลน้ำหนักเปิด นี่คือตัวเลือกเริ่มต้นที่สามารถป้องกันได้ และภาระการพิสูจน์ตกอยู่กับสิ่งใดก็ตามที่อ้างว่าจะเข้ามาแทนที่

เหตุผลที่ต้องเลือกใช้ VibeVoice-ASR-Streaming-1.5B นั้นแคบและเฉพาะเจาะจง: คุณต้องการการระบุผู้พูดแบบสตรีมมิงหรือฮอตเวิร์ด คุณต้องการรองรับภาษามากกว่าภาษาอังกฤษ หรือคุณเชื่อว่าแนวทางโมเดลภาษาสำหรับเสียงพูดจะเป็นฝ่ายชนะและคุณต้องการเริ่มก่อนใคร มันคือการเดิมพัน ไม่ใช่การตัดสินใจ — ยังไม่มีตัวเลขใดมาสนับสนุนการย้ายทราฟฟิกโปรดักชันไปใช้โมเดลนี้ และท่าทีของไมโครซอฟท์เองคือวิจัยเป็นอันดับแรก ตอนนี้ทั้งสองโมเดลยังไม่มีให้บริการผ่าน OrcaRouter ดังนั้นวิธีต้นทุนต่ำในการทดสอบการเดิมพันนี้จึงเป็นแพตเทิร์นที่ใช้ได้กับโอเพนโมเดลใหม่ทุกตัว: เก็บเลเยอร์ ASR ไว้เบื้องหลัง API การกำหนดเส้นทางเดียวที่ให้เข้าถึงโมเดลกว่า 200 รุ่นในราคารายการของผู้ให้บริการโดยไม่มีการบวกเพิ่มและมีเฟลโอเวอร์อัตโนมัติ ส่งเสียงจริงส่วนหนึ่งไปยัง VibeVoice-ASR-Streaming-1.5B ทันทีที่ผู้ให้บริการเริ่มโฮสต์โมเดลนี้ แล้วให้ทรานสคริปต์จากทราฟฟิกของคุณเองเป็นผู้ตัดสินว่าผู้ท้าชิงสมควรได้รับมงกุฎที่ Parakeet ครองมาสิบหกเดือนหรือไม่

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube