
VibeVoice-ASR-Streaming-1.5B เทียบกับ NVIDIA Parakeet TDT 0.6B: ผู้ท้าชิงจาก MIT ที่ยังไม่ผ่านการพิสูจน์ สู้กับแชมป์ Open ASR
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
หากคุณต้องการระบบแปลงคำพูดเป็นข้อความแบบเปิดน้ำหนัก (open-weights) สำหรับใช้งานจริงในปัจจุบัน มีค่าเริ่มต้นอยู่หนึ่งตัว นั่นคือ NVIDIA Parakeet TDT 0.6B ตั้งแต่เดือนพฤษภาคม 2025 Parakeet TDT 0.6B v2 ที่มีพารามิเตอร์ 600 ล้านตัวครองอันดับหนึ่งบน Hugging Face Open ASR leaderboard ด้วยอัตราคำผิดเฉลี่ย 6.05% ซึ่งเป็นตำแหน่งที่บุคคลที่สามยืนยันผลได้ต่อเนื่องยาวนานกว่าหนึ่งปี ผู้ท้าชิงรายใหม่ล่าสุดคือ VibeVoice-ASR-Streaming-1.5B ซึ่ง Microsoft Research อัปโหลดเมื่อวันที่ 2 กันยายน 2026 — ช้ากว่า Parakeet สิบหกเดือน ภายใต้สัญญาอนุญาต MIT พร้อมฟีเจอร์การระบุผู้พูดแบบสตรีมมิง และจนถึงตอนนี้ยังไม่มีตัวเลขความแม่นยำที่เผยแพร่ออกมาเลย หน้านี้เปรียบเทียบแชมป์และผู้ท้าชิงในแง่หลักฐาน สถาปัตยกรรม และสิ่งที่แต่ละตัวมาพร้อมให้ใช้งานได้ทันที
ก่อนที่จะดูสเปก มีป้ายกำกับสองอย่างที่สำคัญ เพราะมันคือภาพรวมทั้งหมดของการแข่งขันครั้งนี้ ตัวเลขของ Parakeet นั้นชัดเจนแล้ว: อัตรา WER เฉลี่ย 6.05% และตัวเลข throughput RTFx ที่ประมาณ 3,386 ซึ่งอยู่เบื้องหลังคำกล่าวอ้างที่ว่า "เสียงหนึ่งชั่วโมงในเวลาประมาณหนึ่งวินาที" ได้อยู่บนลีดเดอร์บอร์ดสาธารณะและเอกสารของ NVIDIA มานานกว่าหนึ่งปี ส่วนด้านของ VibeVoice-ASR-Streaming-1.5B สิ่งที่พอทราบได้จากที่เก็บโค้ด (repository) ก็คือ โมเดลการ์ด ไฟล์คอนฟิก และเอกสารสตรีมมิ่งของ Microsoft — เนื่องจาก Microsoft ไม่ได้เผยแพร่ค่า WER ระยะหน่วง หรือ throughput ในรูปแบบข้อความ และไม่มีเกณฑ์วัดผลอิสระของ checkpoint นี้ ณ เวลาที่เขียนนี้ หนึ่งคอลัมน์ของการเปรียบเทียบทุกอันด้านล่างผ่านการทดสอบจริง อีกคอลัมน์หนึ่งเป็นเพียงแผ่นข้อมูลสเปก
ห่างกันสิบหกเดือน กับการครองตำแหน่งบนลีดเดอร์บอร์ดหนึ่งครั้ง
Parakeet TDT 0.6B v2 เปิดตัวเมื่อวันที่ 5 พฤษภาคม 2025 ในฐานะคำตอบของ NVIDIA สำหรับปัญหาการรู้จำเสียงพูดแบบสตรีมมิ่ง (streaming ASR): ตัวเข้ารหัส FastConformer จับคู่กับตัวถอดรหัสแบบ token-and-duration transducer (TDT) ที่ทำนายแต่ละโทเค็นและระยะเวลาที่มันคงอยู่ได้ในขั้นตอนเดียว ซึ่งเป็นเทคนิคด้านประสิทธิภาพที่กำจัดค่าใช้จ่ายของ blank token ของทรานสดิวเซอร์แบบดั้งเดิม มันเป็นลิขสิทธิ์ CC-BY-4.0 เหมาะสำหรับการใช้งานเชิงพาณิชย์ และคว้าอันดับหนึ่งบนกระดานผู้นำ Open ASR ด้วยอัตราคำผิดเฉลี่ย 6.05% นอกจากนี้ยังนำเสนอฟีเจอร์สำหรับการผลิตที่กระดานผู้นำไม่ได้วัดไว้ เช่น เครื่องหมายวรรคตอน การใช้อักษรตัวพิมพ์ใหญ่ และไทม์สแตมป์ระดับคำ พร้อมทั้งตัวเข้ารหัสแบบ full-attention ที่รองรับเสียงได้สูงสุด 24 นาทีในการประมวลผลครั้งเดียว ซึ่งทำให้มีประโยชน์สำหรับการประชุมยาวและพอดแคสต์โดยไม่ต้องแบ่งส่วนเสียงอย่างรุนแรง
VibeVoice-ASR-Streaming-1.5B เป็นผู้ท้าชิงในความหมายที่แท้จริงที่สุด: มันมีอยู่จริง มีการบันทึกข้อมูลไว้ และยังไม่มีการพิสูจน์ว่ามันทำงานได้ดีเพียงใด ข่าวบน GitHub ของ Microsoft ลงวันที่ 3 กันยายน ประกาศโมเดล ASR แบบสตรีมมิงรวม (unified streaming ASR) ที่ "ถอดความต่อเนื่องว่าใครพูดอะไรขณะที่เสียงพูดไหลเข้ามา" พร้อมด้วยฮอตเวิร์ดและอีกสิบภาษา และคอนฟิกของเช็คพอยต์ได้อธิบายแนวทางวิศวกรรมที่ต่างออกไปโดยสิ้นเชิง — ตัวถอดรหัสโมเดลภาษาในตระกูล Qwen2 ที่ป้อนด้วยตัวแปลงเสียงแบบคอนโวลูชัน (convolutional audio tokenizers) พร้อมกับหัวแบบดิฟฟิวชัน (diffusion head) ที่สร้างผลลัพธ์เป็นชิ้นยาวประมาณ 2.9 วินาที และมองไปข้างหน้าประมาณ 0.5 วินาที ในขณะที่ Parakeet เป็นโมเดลเสียงที่ออกแบบมาเพื่อจุดประสงค์เฉพาะ ได้รับการปรับปรุงตลอดกว่าหนึ่งปีของการใช้งานจริง VibeVoice-ASR-Streaming-1.5B กลับเป็นเช็คพอยต์ในตระกูลงานวิจัยที่มีอายุเพียงแค่สองวัน
ความไม่สมมาตรของหลักฐานคือแก่นของเรื่อง
อ่านเนื้อหาที่เหลือของหน้านี้โดยมีข้อเท็จจริงข้อหนึ่งอยู่ตรงหน้า: การเปรียบเทียบนี้มีตัวเลขอยู่เพียงฝั่งเดียวเท่านั้น ฝั่งของ Parakeet TDT 0.6B มีการป้องกันตำแหน่งบนลีดเดอร์บอร์ดมาหนึ่งปี — ค่า WER เฉลี่ย 6.05% บนชุดเสียงพูดสั้นภาษาอังกฤษแบบสาธารณะของ Open ASR, ~3,386 RTFx ที่แบตช์ 128 บนฮาร์ดแวร์ NVIDIA และระบบนิเวศเครื่องมือปรับใช้ NeMo การเร่งความเร็วด้วย TensorRT และการควอนไทซ์ FP8 ที่ถูกใช้งานในระบบผลิตจริง ส่วนฝั่งของ VibeVoice-ASR-Streaming-1.5B มีตัวเลขการประเมินจากการ์ดโมเดลซึ่งเป็นรูปภาพแทนที่จะเป็นข้อความ และค่า WER เฉลี่ย 7.77% ที่ผู้พัฒนารายงานไว้ในการ์ด VibeVoice-ASR แบบแบตช์จากชุดทดสอบภาษาอังกฤษแปดชุด — ตัวเลขที่อธิบายโมเดลแบบไม่สตรีมมิงและไม่สามารถนำมาใช้กับเช็คพอยต์นี้ได้ ผู้ท้าชิงอาจจะยอดเยี่ยมก็เป็นได้ แต่ประเด็นคือ “อาจจะยอดเยี่ยมก็เป็นได้” คือหลักฐานทั้งหมดที่มีอยู่
การตรวจสอบสเปก
• พารามิเตอร์ — NVIDIA Parakeet TDT 0.6B: 600M, ตัวเข้ารหัส FastConformer + ตัวถอดรหัส TDT เทียบกับ VibeVoice-ASR-Streaming-1.5B: รวม ~3B (แบ็คโบน Qwen ระดับ 1.5B พร้อมโทเคนไนเซอร์และส่วนหัวแบบดีฟิวชัน)
• เปิดตัว — 5 พฤษภาคม 2025 เทียบกับ 2 กันยายน 2026
ความแม่นยำ — ค่า WER เฉลี่ย 6.05% อยู่อันดับ 1 ของ Open ASR ตั้งแต่เดือนพฤษภาคม 2025 มีการยืนยันผลซ้ำโดยบุคคลที่สาม เทียบกับอีกฝ่ายที่ไม่มีการเผยแพร่ผลใดๆ เลย
• ความเร็ว — ประมาณ 3,386 RTFx ที่แบตช์ 128 บนฮาร์ดแวร์ NVIDIA คิดเป็นเสียงประมาณ 1 ชั่วโมงต่อวินาที เทียบกับที่ไม่มีตัวเลขปริมาณงานที่เผยแพร่
• Streaming — รองรับการสตรีมมิ่ง โดยมีบริบทแบบ full-attention ยาวได้ถึง 24 นาทีต่อรอบ (pass) เทียบกับการสตรีมมิ่งแบบแบ่งเป็นส่วน (chunked streaming) ซึ่งมีชิ้นส่วน ~2.9 วินาที พร้อมการมองล่วงหน้า ~0.5 วินาที
• เอาต์พุตเสริม — เครื่องหมายวรรคตอน ตัวพิมพ์ใหญ่ การประทับเวลาระดับคำ เทียบกับการระบุผู้พูดแบบสตรีมมิ่งว่าใครพูดอะไร (ไม่ได้รับการยืนยัน) และฮอตเวิร์ด; สิบภาษา
• ใบอนุญาต — CC-BY-4.0 vs MIT
• ระบบนิเวศ — NVIDIA NeMo พร้อม TensorRT และ FP8 เทียบกับเดโมจากรีโพ microsoft/VibeVoice และปลั๊กอิน vLLM


เบื้องหลัง: สองแนวคิดเกี่ยวกับจุดประสงค์ของโมเดลเสียงพูด
สถาปัตยกรรมทั้งสองแสดงความเชื่อที่แตกต่างกันเกี่ยวกับงานนี้ Parakeet TDT 0.6B มองการถอดเสียงเป็นปัญหาการประมวลผลสัญญาณที่แก้ได้อย่างมีประสิทธิภาพ: ตัวเข้ารหัส FastConformer สกัดคุณลักษณะทางเสียง และตัวถอดรหัส TDT จะปล่อยโทเค็นข้อความและช่วงเวลาร่วมกัน นั่นคือเหตุผลที่มันทำงานได้เร็วกว่าเรียลไทม์หลายพันเท่า และเหตุผลที่มันทำงานได้สบายบนสแตกการปรับใช้ของ NVIDIA ส่วน VibeVoice-ASR-Streaming-1.5B มองการถอดเสียงเป็นปัญหาทางภาษา: บีบอัดเสียงให้เป็นสตรีมโทเค็น ส่งให้โมเดลภาษาที่อ่านบริบทเทียบเท่าบทถอดเสียงหนึ่งบท แล้วให้ความเข้าใจของ LM เกี่ยวกับใครพูดอะไรและบทสนทนาเชื่อมโยงกันอย่างไรเป็นคนทำงาน เบื้องหลัง LLM ยังเป็นเหตุผลที่ checkpoint มีพารามิเตอร์ประมาณ 3B แทนที่จะเป็น 600M และเป็นเหตุผลที่ Microsoft ไม่ได้อ้างสิทธิ์เรื่องพื้นที่การใช้งานบนอุปกรณ์ขอบ — นี่คือโมเดลที่ต้องการ GPU และใช้หน่วยความจำเพื่อพกพาบริบท
สำหรับการถอดเสียงสด ผลเชิงปฏิบัติคือรูปแบบของความหน่วง เอนโค้ดเดอร์แบบ full-attention ของ Parakeet สามารถประมวลผลหน้าต่างเสียงยาวๆ ได้ในรอบเดียว ซึ่งเป็นปรัชญาการสตรีมมิ่งที่ต่างจากข้อกำหนดแบบ chunk-and-lookahead ที่ตายตัวของ VibeVoice-ASR-Streaming-1.5B ซึ่งใช้เสียงประมาณ 2.9 วินาทีต่อเซกเมนต์ที่ส่งออกหนึ่งชิ้น ไม่มีระบบใดในสองระบบนี้เป็นสตรีมเมอร์แบบให้ผลลัพธ์บางส่วนทีละคำในสไตล์ของ API เชิงพาณิชย์ที่หน่วงต่ำที่สุด ทั้งสองเป็นระบบแบบแบ่งเป็นชิ้น และระบบที่เหมาะสมจะขึ้นอยู่กับว่าเสียงของคุณมาเป็นไฟล์จำกัดขอบเขตหรือเป็นเซสชันสดที่ต่อเนื่องแบบไม่รู้จบ
เรื่องราวของฟีเจอร์และพื้นที่การปรับใช้
ในแง่ความสามารถมาตรฐานที่มีมาให้ Parakeet TDT 0.6B เป็นผลิตภัณฑ์ถอดเสียงที่สมบูรณ์กว่า: เครื่องหมายวรรคตอนและการใช้ตัวพิมพ์ใหญ่มากับบทถอดเสียง การประทับเวลาระดับคำพร้อมสำหรับการจัดตำแหน่ง และหน้าต่างการประมวลผลแบบครั้งเดียวความยาว 24 นาทีช่วยลดข้อผิดพลาดจากการแบ่งเป็นชิ้นส่วนในการบันทึกเสียงยาว ในทางกลับกัน VibeVoice-ASR-Streaming-1.5B สวนกลับด้วยฟีเจอร์ที่ Parakeet ไม่ได้ระบุไว้ นั่นคือ ผลลัพธ์ที่ระบุตัวผู้พูดและคำเฉพาะ (hotwords) รองรับสิบภาษา แต่คำกล่าวอ้างเรื่องการระบุผู้พูดแบบสตรีมมิงนั้นเป็นสิ่งที่ต้องมีการตรวจสอบโดยอิสระจริง ๆ — เพราะขอบเขตของชิ้นส่วนคือจุดที่การระบุผู้พูดเริ่มคลาดเคลื่อน — และนั่นคือเหตุผลที่ควรพิจารณาโมเดลของ Microsoft มากกว่าของ NVIDIA หากความต้องการของคุณคือการรู้ว่าใครพูดอะไรในการประชุมสด

ย่านต่างๆ ก็แตกต่างกันพอๆ กับตัวโมเดลเลย Parakeet TDT 0.6B เป็นพลเมืองของ NVIDIA NeMo: มี TensorRT, FP8 และเครื่องมือปรับใช้ที่ปรับจูนมาสำหรับ GPU ของ NVIDIA ซึ่งถือว่าดีเยี่ยมหากคุณอยู่บนโครงสร้างพื้นฐานของ NVIDIA อยู่แล้ว ส่วน VibeVoice-ASR-Streaming-1.5B อาศัยอยู่ในคลังเก็บงานวิจัย: เส้นทางที่มีเอกสารรองรับคือเดโม Python ของ Microsoft และปลั๊กอิน vLLM คลาสสถาปัตยกรรมของมันยังไม่ปรากฏในเอกสาร Transformers ที่เปิดเผยต่อสาธารณะ และการจะตั้งค่าให้ทำงานได้นั้นต้องติดตั้งจากซอร์สโค้ดและต้องตรวจสอบด้วยตัวเองว่าเส้นทางการโหลดทำงานได้จริง สำหรับทีมที่ให้คุณค่ากับการปรับใช้ที่เรียบง่าย ตรงไปตรงมา และมีเอกสารครบถ้วน ความแตกต่างเพียงข้อนี้ก็มีน้ำหนักมากกว่าช่องว่างของ benchmark ได้
ข้อโต้แย้งสำหรับผู้ดำรงตำแหน่ง, ข้อโต้แย้งสำหรับผู้ท้าชิง
กรณีของ NVIDIA Parakeet TDT 0.6B คือกรณีของสิ่งที่รู้จักกันดี: การป้องกันตำแหน่งในลีดเดอร์บอร์ดเป็นเวลาหนึ่งปี การทำซ้ำโดยบุคคลที่สาม ใบอนุญาตเชิงพาณิชย์ ฟีเจอร์สำหรับการใช้งานจริง และระบบนิเวศการปรับใช้ที่รองรับทราฟฟิกจริง หากคุณกำลังจะเปิดตัวฟีเจอร์ถอดเสียงภาษาอังกฤษในไตรมาสนี้ และต้องการโมเดลน้ำหนักเปิด นี่คือตัวเลือกเริ่มต้นที่สามารถป้องกันได้ และภาระการพิสูจน์ตกอยู่กับสิ่งใดก็ตามที่อ้างว่าจะเข้ามาแทนที่
เหตุผลที่ต้องเลือกใช้ VibeVoice-ASR-Streaming-1.5B นั้นแคบและเฉพาะเจาะจง: คุณต้องการการระบุผู้พูดแบบสตรีมมิงหรือฮอตเวิร์ด คุณต้องการรองรับภาษามากกว่าภาษาอังกฤษ หรือคุณเชื่อว่าแนวทางโมเดลภาษาสำหรับเสียงพูดจะเป็นฝ่ายชนะและคุณต้องการเริ่มก่อนใคร มันคือการเดิมพัน ไม่ใช่การตัดสินใจ — ยังไม่มีตัวเลขใดมาสนับสนุนการย้ายทราฟฟิกโปรดักชันไปใช้โมเดลนี้ และท่าทีของไมโครซอฟท์เองคือวิจัยเป็นอันดับแรก ตอนนี้ทั้งสองโมเดลยังไม่มีให้บริการผ่าน OrcaRouter ดังนั้นวิธีต้นทุนต่ำในการทดสอบการเดิมพันนี้จึงเป็นแพตเทิร์นที่ใช้ได้กับโอเพนโมเดลใหม่ทุกตัว: เก็บเลเยอร์ ASR ไว้เบื้องหลัง API การกำหนดเส้นทางเดียวที่ให้เข้าถึงโมเดลกว่า 200 รุ่นในราคารายการของผู้ให้บริการโดยไม่มีการบวกเพิ่มและมีเฟลโอเวอร์อัตโนมัติ ส่งเสียงจริงส่วนหนึ่งไปยัง VibeVoice-ASR-Streaming-1.5B ทันทีที่ผู้ให้บริการเริ่มโฮสต์โมเดลนี้ แล้วให้ทรานสคริปต์จากทราฟฟิกของคุณเองเป็นผู้ตัดสินว่าผู้ท้าชิงสมควรได้รับมงกุฎที่ Parakeet ครองมาสิบหกเดือนหรือไม่
