
VibeVoice-ASR-Streaming-7B เทียบกับ Whisper Large v3 Turbo: สิ่งที่ Streaming Checkpoint ของ Microsoft เพิ่มเติมให้กับค่าเริ่มต้นแบบ Open-Weight
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
ในช่วงเกือบสองปีที่ผ่านมา คำตอบสำหรับคำถามที่ว่า “จดเสียงเองแบบประหยัด” คือ Whisper Large v3 Turbo — โมเดลเปิดน้ำหนัก 809 ล้านพารามิเตอร์จาก OpenAI ใช้สัญญาอนุญาต MIT รองรับ 99 ภาษา เล็กพอจะรันบนเวิร์กสเตชัน และฟรีเมื่อคุณมีฮาร์ดแวร์เป็นของตัวเอง ในวันที่ 2 กันยายน 2026 Microsoft Research อัปโหลดผู้ท้าชิงค่าเริ่มต้นนั้น: VibeVoice-ASR-Streaming-7B เช็คพอยต์สตรีมมิงภายใต้สัญญาอนุญาต MIT บน Hugging Face ที่ถอดเสียงแบบเรียลไทม์ขณะเสียงเข้ามา อ้างว่าให้ผลลัพธ์แยกตามผู้พูด และ—ต่างจากโมเดลที่ทีมส่วนใหญ่รันอยู่แล้ว—ไม่เคยถูกออกแบบมาให้ทำงานแบบแบตช์ โมเดลทั้งสองเป็นโอเพนเวตจากแล็บใหญ่ แทบทุกอย่างอื่นเกี่ยวกับโมเดลเหล่านี้คือการแลกเปลี่ยน และหน้านี้มีไว้เพื่อบอกว่าคุณกำลังแลกอะไรอยู่จริง
ความไม่สมมาตรข้อหนึ่งเป็นตัวกำหนดการเปรียบเทียบทั้งหมด จึงขอยกขึ้นมากล่าวก่อน Whisper Large v3 Turbo เป็นโมเดลรู้จำเสียงที่มีการทำซ้ำผลลัพธ์โดยทีมอิสระมากที่สุดในโลก: ตัวเลข word error ของมันถูกทีมหลายพันทีมนำไปรันซ้ำบนชุดเกณฑ์มาตรฐานสาธารณะและไฟล์เสียงของพวกเขาเองมานานหลายปี จุดอ่อนของมันก็ถูกบันทึกไว้ชัดเจนไม่แพ้จุดแข็ง VibeVoice-ASR-Streaming-7B เพิ่งถือกำเนิดได้วันเดียว ยังไม่มี benchmark อิสระอยู่ที่ใดเลย และ{{1}}Microsoft{{/1}}ก็ยังไม่เคยเผยแพร่อัตรา word error แบบสตรีมมิงในรูปแบบข้อความที่อ่านได้ ข้อมูลทุกอย่างในฝั่ง{{1}}Microsoft{{/1}}ด้านล่างนี้ล้วนอ่านจาก repository — คอนฟิก การ์ดโมเดล และเอกสารสตรีมมิง{{1}}ของ Microsoft{{/1}} — และระบุไว้เช่นนั้น.
ค่าเริ่มต้นแบบ open-weights และเหตุผลที่มันยังคงอยู่
Whisper Large v3 Turbo เป็นรุ่นพี่น้องที่ถูกกลั่น (distilled) ของ Whisper Large v3: โดยยังคงเอนโคเดอร์ 32 ชั้นไว้ และตัดดีโคเดอร์จาก 32 ชั้นเหลือ 4 ชั้น ซึ่งทำให้จำนวนพารามิเตอร์ลดลงเหลือ 809M และปริมาณงาน (throughput) บน GPU เพิ่มขึ้นราวสี่เท่า ขณะที่ความแม่นยำยังใกล้เคียงเดิม เนื่องจากน้ำหนักของโมเดลเผยแพร่ภายใต้สัญญาอนุญาต MIT และโมเดลมีขนาดเล็ก มันจึงกลายเป็นเอนจินถอดเสียงแบบฝังตัวเริ่มต้นสำหรับบอทประชุม เครื่องมือทำคำบรรยาย และไปป์ไลน์บันทึกการโทร ข้อจำกัดของมันก็เป็นที่รู้จักดีไม่แพ้กัน มันเป็นโมเดลแบบแบตช์ (batch model) — รับไฟล์เสียงแล้วคืนทรานสคริปต์ แทนที่จะสร้างคำพูดออกมาตามเวลาที่พูดจริง มันไม่ได้ถูกฝึกมาสำหรับงานแปล และงานดังกล่าวมีประสิทธิภาพลดลงอย่างมาก ความแม่นยำของมันกับเสียงที่มีสัญญาณรบกวน เสียงที่มีสำเนียง หรือเสียงพูดที่ทับซ้อนกันนั้นไม่สม่ำเสมอ และมันคืนผลเป็นข้อความธรรมดา: ไม่มีเครื่องหมายวรรคตอนหรือตัวพิมพ์ใหญ่ตามค่าเริ่มต้น ไม่มีการแยกผู้พูด (speaker diarization) ไม่มี timestamp ในเวอร์ชันนี้ และไม่มีการไบแอสคำสำคัญ (keyword biasing) สแตกสำหรับงานผลิต (production stack) ที่สร้างบน Whisper จะประกอบชิ้นส่วนเหล่านั้นแยกจากกัน โดยแต่ละชิ้นเพิ่มความหน่วง (latency) และรูปแบบความล้มเหลว (failure modes) ของตัวเอง

ช่องว่างของสเปก
• พารามิเตอร์ — 809M (ตัวถอดรหัสแบบกลั่น) เทียบกับประมาณ 9B ทั้งหมด (แกนหลักภาษา Qwen2-7B บวกกับตัวเข้ารหัสเสียง; "7B" นับเฉพาะ LLM และหน้า Hugging Face ระบุ 9B)
• สัญญาอนุญาต — MIT, โอเพนเวตส์, ทั้งสองแบบ
• สตรีมมิง — ออกแบบเป็นแบตช์โดยธรรมชาติ: การใช้งานสตรีมมิงแบบโฮสต์เองโดยทั่วไปมีเวลาแฝง 1–5 วินาที เทียบกับแบบสตรีมมิงโดยกำเนิด: ชิ้นข้อมูล ~2.9 วินาทีพร้อมการมองไปข้างหน้า ~0.5 วินาที ข้อความถูกส่งออกทีละชิ้น และบริบทถูกเก็บรักษาไว้ในแคช KV
• ภาษา — 99 ภาษาที่มีการสืบทอดใช้งานโดยชุมชนมาหลายปี เทียบกับ 10 ภาษาที่ประกาศไว้ (en, zh, es, pt, de, ja, ko, fr, ru, it)
• นอกเหนือจากทรานสคริปต์ — ไม่มีโดยค่าเริ่มต้น เทียบกับเอาต์พุตสตรีมมิงที่อ้างว่าระบุว่าใครพูดอะไร และฮอตเวิร์ดที่กำหนดเอง (ยังไม่ยืนยัน)
• ความแม่นยำในสิ่งพิมพ์ — WER 2.1% บน LibriSpeech test-clean, 4.2% บน test-other, ~7.7% บน Open ASR composite, 8–12% บนเสียงที่มีสัญญาณรบกวนในการทดสอบของชุมชน โดยทั้งหมดถูกทำซ้ำอย่างอิสระ ขณะที่ไม่มีตัวเลข WER ของระบบสตรีมมิ่งที่ตีพิมพ์เป็นลายลักษณ์อักษร
• พื้นที่ใช้งาน — รันบนแล็ปท็อปหรือ GPU ระดับกลางเพียงตัวเดียว เทียบกับน้ำหนัก bf16 ประมาณ 18 GB ก่อน KV cache; ควรเผื่อ GPU ระดับ 24 GB

การสตรีมมิ่งเพิ่มอะไรจริง ๆ
เหตุผลที่ต้องมองข้าม Whisper Large v3 Turbo ไปเลยก็คือเส้นทางแบบเรียลไทม์ และนี่คือจุดที่โมเดลทั้งสองไม่สามารถเทียบเคียงกันได้อีกต่อไป Whisper เป็นแบบประมวลผลเป็นชุด (batch-oriented): เพื่อให้ได้คำในขณะที่ผู้พูดยังพูดอยู่ ทีมงานจึงต้องเพิ่มส่วนแบ่งกลุ่มเสียง (chunking), การตรวจจับกิจกรรมเสียง (voice-activity detection) และโค้ดเชื่อมต่อ (glue code) และการใช้งานสตรีมมิ่งที่โฮสต์เองโดยทั่วไปจะมีความหน่วงอยู่ที่ 1 ถึง 5 วินาที ซึ่งไม่ผ่านเกณฑ์ระดับต่ำกว่าหนึ่งวินาทีสำหรับตัวแทนโทรศัพท์และการบรรยายสด หากไม่มีการพัฒนาทางวิศวกรรมอย่างจริงจัง VibeVoice-ASR-Streaming-7B ถูกสร้างขึ้นสำหรับเส้นทางนั้น การตั้งค่าของมันแสดงให้เห็นว่าเสียงถูกบีบอัด 3,200 เท่า กลายเป็นสตรีมโทเค็นอัตรา 7.5 เฟรมต่อวินาที ซึ่งประมวลผลเป็นกลุ่มๆ ละ 22 เฟรม โดยมีมุมมองไปข้างหน้า 4 เฟรม — ประมาณ 2.9 วินาทีของเสียงต่อกลุ่ม — และข้อความจะถูกส่งออกเมื่อแต่ละกลุ่มเสร็จสิ้น ขณะที่บริบทก่อนหน้านี้ถูกเก็บไว้ในแคช KV ดังนั้นเซสชันจึงไม่ต้องคำนวณใหม่ตั้งแต่ต้น จังหวะดังกล่าวเป็นการออกแบบที่ได้มาจากการตั้งค่า ไม่ใช่ค่าหน่วงที่วัดได้ และยังไม่มีใครเผยแพร่ตัวเลขแบบต้นทางถึงปลายทางสำหรับมัน แต่สถาปัตยกรรมนี้เป็นสถาปัตยกรรมถอดเสียงสดอย่างชัดเจน ในแบบที่ Whisper ไม่ใช่
บันทึกของ Whisper ยาวและเปิดเผยต่อสาธารณะ ส่วนของ checkpoint ใหม่ยังว่างเปล่า
ความแม่นยำคือจุดที่อายุของ Whisper Large v3 Turbo เป็นข้อได้เปรียบ ค่า WER 2.1% บน LibriSpeech test-clean และ 4.2% บน test-other เป็น{{1}}ตัวเลขจากโมเดลโอเพนเวตที่ทีมจำนวนมากทดสอบซ้ำแล้วได้ผลตรงกัน{{/1}}; ค่าประมาณ 7.7% จาก Open ASR leaderboard composite {{2}}นั้นตามหลัง Large v3 ตัวเต็มอยู่ราว 1 จุด{{/2}}; และตัวเลข 8–12% ที่บันทึกไว้จากการทดสอบเสียงที่มีสัญญาณรบกวนโดยชุมชนก็หมายความว่า{{3}}ไม่มีใครแปลกใจกับมัน{{/3}} จุดอ่อนเหล่านี้คือสิ่งที่บันทึกไว้แล้ว — {{4}}มันบอกคุณชัดเจนว่าโมเดลต้องการความช่วยเหลือตรงจุดไหนก่อนที่คุณจะต่อยอดจากมัน{{/4}}
VibeVoice-ASR-Streaming-7B ไม่มีบันทึกผลงานแบบนั้น การ์ดโมเดลของมันมาพร้อมกับรูปภาพผลการประเมิน และรายงานเทคนิคแบบสตรีมมิงของ Microsoft ก็เป็นไฟล์ PDF แต่ไม่มีตัวเลขอัตราคำผิดแบบสตรีมมิงที่อ้างอิงได้ในรูปแบบข้อความ ตัวเลขเดียวที่ยึดเป็นหลักในตระกูลนี้คือตารางที่ผู้พัฒนารายงานไว้ในการ์ดของ VibeVoice-ASR แบบแบตช์ ซึ่งมีค่า WER เฉลี่ย 7.77% จากชุดทดสอบภาษาอังกฤษแปดชุด และ 2.20% บน LibriSpeech clean ซึ่งไม่ใช่ตัวเลขของเช็คพอยต์นี้ และการตอบรับจากชุมชนต่อโมเดลแบตช์เองก็มีความเห็นหลากหลาย: ได้รับคำชมในเรื่องการแยกผู้พูดที่พร้อมใช้ทันที แต่ถูกวิจารณ์ว่าหนักและบางครั้งมีแนวโน้มหลอน ไม่มีสิ่งใดที่กล่าวมาใช้กับโมเดลสตรีมมิงได้ ซึ่งคือประเด็นสำคัญ: ถ้าใช้ Whisper คุณจะรู้รูปแบบความล้มเหลวล่วงหน้า แต่กับ VibeVoice-ASR-Streaming-7B คุณคือผู้ทดสอบคนแรก
ภาษาและขนาด: 99 เทียบกับ 10, 0.8B เทียบกับ 9B
ต้นทุนที่เป็นรูปธรรมที่สุดสองประการของการเปลี่ยนคือภาษาและขนาด Whisper Large v3 Turbo ถอดเสียงได้ 99 ภาษา; ภาษาที่มีทรัพยากรต่ำและภาษาวรรณยุกต์มีคุณภาพด้อยลง — ไทย กวางตุ้ง และเวลช์เป็นจุดอ่อนที่ถูกกล่าวถึงบ่อย — แต่รายการนี้มีประวัติการทำซ้ำจากชุมชนหลายปีอยู่เบื้องหลัง VibeVoice-ASR-Streaming-7B ระบุเพียงสิบภาษา: อังกฤษ จีน สเปน โปรตุเกส เยอรมัน ญี่ปุ่น เกาหลี ฝรั่งเศส รัสเซีย และอิตาลี หากทราฟฟิกของคุณอยู่ในสิบภาษานั้น การครอบคลุมก็ไม่ใช่ปัญหา; หากไม่ใช่ การเปรียบเทียบก็จบลงเพียงเท่านี้ ขนาดคือต้นทุนประการที่สอง: พารามิเตอร์ 809M รันได้บนแล็ปท็อป ในขณะที่พารามิเตอร์รวมประมาณ 9B ในรูปแบบ bf16 หมายถึงน้ำหนักประมาณ 18 GB ก่อน KV cache และต้องใช้ GPU ระดับ 24 GB เพื่อรองรับได้อย่างสบายๆ สำหรับทีมที่รัน Whisper บนฮาร์ดแวร์ขนาดกลางอยู่แล้ว นี่คือการยกระดับโครงสร้างพื้นฐานอย่างมีนัยสำคัญ ซึ่งจะสมเหตุสมผลก็ต่อเมื่อมีความต้องการถอดเสียงสดจริงเท่านั้น
เมื่อฟรีไม่ใช่ประเด็น
Whisper Large v3 Turbo ฟรีที่จะรัน; ต้นทุนอยู่ที่ฮาร์ดแวร์และงานวิศวกรรมที่อยู่รอบตัวมัน การปรับใช้ faster-whisper บน T4 ตัวเดียวมีต้นทุนประมาณ $0.05–$0.10 ต่อชั่วโมงของเสียงตามอัตราค่าเช่า GPU ทั่วไป และงานที่มีโหลดต่อเนื่องยังต้องเพิ่มชุดระบบแยกผู้พูด (diarization) และเครื่องหมายวรรคตอนที่คุณต้องสร้างขึ้นเอง เพราะ Whisper คืนผลลัพธ์เป็นข้อความธรรมดา VibeVoice-ASR-Streaming-7B ก็ฟรีที่จะรันเช่นกัน แต่ต้องใช้ฮาร์ดแวร์ที่แพงกว่า เพื่อแลกกับสถาปัตยกรรมแบบสตรีมมิ่งที่อ้างว่าระบุผู้พูดและควบคุมบริบทได้ ซึ่ง Whisper ขาด — ข้ออ้างที่คุณจะต้องพิสูจน์ด้วยตัวเอง เพราะไม่มีเกณฑ์วัดมาตรฐานอิสระอยู่จริง สำหรับการถอดความแบบแบตช์ในปริมาณมาก ปริมาณงานและรอยเท้าขนาดเล็กของ Whisper ยังคงชนะ สำหรับเสียงสดแบบหลายผู้พูดที่ต้องได้บทถอดความระหว่างการสนทนา Whisper ทำงานฝืนการออกแบบของตัวเอง ขณะที่สตรีมมิ่งเช็คพอยต์ทำงานสอดคล้องกับมัน — ถ้ามันทำงานได้จริง ซึ่งนั่นคือคำถามที่คุณต้องหาคำตอบด้วยเสียงของคุณเองบน GPU ของคุณเอง

สแตกเชิงปฏิบัติ
คำตอบในโลกจริงที่พบบ่อยที่สุดไม่ใช่ "อย่างใดอย่างหนึ่ง" แต่เป็น "ทั้งคู่" และนี่คือคำแนะนำในที่นี้: ใช้ Whisper Large v3 Turbo เป็นช่องทางประมวลผลแบบทีละชุดปริมาณมากซึ่งสถิติและขนาด footprint ของมันทำให้ไม่มีใครเทียบได้ และประเมิน VibeVoice-ASR-Streaming-7B บนช่องทางสดที่ Whisper ไม่สามารถรองรับค่า latency ที่กำหนดได้ — โดยมีเกณฑ์การประเมินที่ชัดเจน เพราะไม่มี benchmark ให้อ้างอิง ทั้งสองโมเดลสามารถใช้ทรัพยากร GPU ร่วมกันและใช้ codebase เดียวกันได้ จุดที่ routing layer จะคุ้มค่ากับบทบาทในสถาปัตยกรรมชุดนี้คือชั้นเหนือกว่า transcript ไม่ใช่ตัวการถอดความเอง: OrcaRouter ไม่ได้ทำหน้าที่ route งาน speech-to-text ในวันนี้ และไม่มีโมเดลใดในสองตัวนี้อยู่ในแคตตาล็อกของมัน แต่ตัว summarizer, กฎการแจ้งเตือน และตัววางแผน agent ที่ใช้ข้อมูลจาก live transcript นั้น คือโมเดลภาษากว่า 200 ตัวที่มันทำหน้าที่เป็น front end ให้ผ่าน API เดียวกัน ในราคาตามรายการของแต่ละ provider แบบส่งผ่านโดยไม่บวกกำไร และมีการ failover ข้าม provider อัตโนมัติ checkpoint แบบสตรีมมิ่งที่วางจำหน่ายโดยไม่มี benchmark แม้แต่ตัวเดียวนั้นสมควรได้รับการปฏิบัติแบบเดียวกับโมเดลที่ยังไม่ผ่านการพิสูจน์ใดๆ — คือปล่อยให้รับปริมาณ traffic จริงส่วนหนึ่งภายใต้ระบบ fallback เพื่อจะได้สร้างหรือสูญเสียความไว้วางใจจากหลักฐานการประชุมจริงของคุณเอง ไม่ใช่จากข้อมูลบน model card
