
VibeVoice-ASR-Streaming-7B เทียบกับ Gemini 3.5 Transcribe Live: หนึ่งสัปดาห์ สองรูปแบบการแปลงเสียงพูดเป็นข้อความแบบสตรีมมิ่ง
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
สัปดาห์สุดท้ายของเดือนสิงหาคมและสองสามวันแรกของเดือนกันยายน 2026 เกิดระบบแปลงเสียงพูดเป็นข้อความแบบสตรีมมิงสองระบบที่ดูเหมือนเป็นคู่แข่งกัน แต่แท้จริงแล้วเป็นคำตอบที่ต่างกันต่อคำถามเดียวกัน เมื่อวันที่ 26 สิงหาคม Google ได้เปิดตัว Gemini 3.5 Transcribe Live ในรูปแบบ public preview: เอนด์พอยต์แปลงเสียงพูดเป็นข้อความแบบโฮสต์และแบบปิด ซึ่งคืนทรานสคริปต์ฉบับสมบูรณ์ภายใน 0.40 วินาทีหลังจากผู้พูดหยุดพูด โดยมีอัตราคำผิดแบบสตรีม 4.0% ที่วัดโดย Artificial Analysis และเอกสารเปิดตัวฉบับเต็มสนับสนุน เมื่อวันที่ 2 กันยายน Microsoft Research ได้อัปโหลด VibeVoice-ASR-Streaming-7B ไปยัง Hugging Face ภายใต้เนมสเปซ microsoft: น้ำหนักโมเดลแบบเปิดภายใต้สัญญาอนุญาต MIT ไม่มีการแถลงข่าว ไม่มีหน้าเปิดตัว และโมเดลการ์ดที่ไม่ได้เผยแพร่อัตราคำผิดหรือค่าหน่วงใดๆ ในข้อความที่อ่านได้เลย ทั้งสองระบบรองรับเสียงที่ยังเข้ามาไม่จบ ซึ่งนับเป็นแทบสิ่งเดียวที่ทั้งคู่มีร่วมกัน
หลักฐานทั้งสองฝั่งไม่สมดุลกัน ดังนั้นการเปรียบเทียบนี้จึงเขียนขึ้นจากสิ่งที่เรารู้เท่าที่ผ่านมา Gemini 3.5 Transcribe Live เป็นผลิตภัณฑ์ของ Google ที่มีการเผยแพร่ราคา token และผลการวัดจากบุคคลที่สาม ซึ่งได้ระบุไว้ด้านล่าง VibeVoice-ASR-Streaming-7B เป็น checkpoint ที่ทุกข้อกล่าวอ้างอ่านโดยตรงจาก repository เอง ทั้งไฟล์ config, model card และเอกสาร streaming ของ Microsoft ใน VibeVoice GitHub repository ยังไม่มีสิ่งใดเกี่ยวกับฝั่ง Microsoft ที่ถูกวัดผลอย่างอิสระ และเราระบุไว้เช่นนั้นในทุกจุดที่ตัวเลขดูเหมือนจะทำหน้าที่
เส้นทางการเผยแพร่: การเปิดตัว API และการอัปโหลดอย่างเงียบๆ
Google เปิดตัว Gemini 3.5 Transcribe Live ตามกระบวนการปกติ โมเดลนี้อยู่ภายใต้แบรนด์ Gemini Audio ร่วมกับ Gemini 3.5 Transcribe เวอร์ชันพี่น้อง (เส้นทาง Interactions API สำหรับไฟล์ที่บันทึกไว้ล่วงหน้า) ราคาอยู่บนหน้าโมเดล และลีดเดอร์บอร์ดอิสระก็จัดอันดับ Live endpoint ภายในไม่กี่วัน ซึ่งเป็นที่มาของค่า streaming WER 4.0% และค่า latency สุดท้าย 0.40 วินาที มีระดับฟรีให้ใช้งาน โดยมีข้อแม้ตามปกติว่าเนื้อหาจากระดับฟรีอาจถูกนำไปใช้เพื่อพัฒนาผลิตภัณฑ์ของ Google
การเปิดตัวเวอร์ชันสตรีมมิงของ Microsoft ไม่ได้มีกลไกเหล่านั้นเลย คลังที่เก็บบน Hugging Face ที่ชื่อ microsoft/VibeVoice-ASR-Streaming-7B ถูกสร้างขึ้นเมื่อวันที่ 2 กันยายน 2026 เวลา 15:46 UTC และมีการแก้ไขครั้งสุดท้ายในอีกสามนาทีต่อมา โดยประกอบด้วย safetensors จำนวน 8 ชิ้น โทเค็นไนเซอร์ และคอนฟิกของตัวประมวลผลล่วงหน้า ภายใต้สัญญาอนุญาต MIT บันทึกอย่างเป็นทางการคือบรรทัดในข่าวลงวันที่ 3 กันยายน ในคลัง microsoft/VibeVoice ซึ่งประกาศว่า "แบบจำลอง ASR แบบสตรีมมิงแบบรวมศูนย์ที่ถอดความอย่างต่อเนื่องว่าใครพูดอะไรเมื่อเสียงเข้ามา พร้อมรองรับคำเฉพาะ (hotwords) ที่ปรับแต่งได้ และ 10 ภาษา" พร้อมลิงก์ไปยังเดโมที่ aka.ms/vibeasr และรายงานทางเทคนิคฉบับสตรีมมิง เมื่อเราตรวจสอบหนึ่งวันหลังจากการอัปโหลด เช็คพอยต์ยังคงแสดงจำนวนดาวน์โหลดเป็นศูนย์ และไม่มีผู้ให้บริการโฮสต์อินเฟอเรนซ์รายใดระบุไว้ การ์ดแบบจำลองให้ข้อมูลมากกว่าประกาศ และคลังนี้เป็นแหล่งที่มาของเกือบทุกอย่างด้านล่างนี้

สเปก เทียบเคียงกัน
• มันคืออะไร — VibeVoice-ASR-Streaming-7B: ASR แบบสตรีมมิ่งแบบเปิดน้ำหนัก (open-weights) โฮสต์ได้เอง เทียบกับ Gemini 3.5 Transcribe Live: API สตรีมมิ่งแบบโฮสต์ น้ำหนักปิด (closed weights)
• รูปแบบการสตรีม — จะส่งข้อความออกมาเป็นช่วงๆ ประมาณ 2.9 วินาที โดยมีการมองล่วงหน้าประมาณ 0.5 วินาที (ได้จากการตั้งค่า checkpoint) เทียบกับเซสชัน WebSocket แบบสองทิศทางที่มีทรานสคริปต์บางส่วนต่อเนื่อง และผลลัพธ์สุดท้ายจะออกมาภายใน 0.40 วินาทีหลังจากผู้พูดหยุดพูด
• ความแม่นยำที่พิมพ์ไว้ — ไม่มีการเผยแพร่ตัวเลข WER หรือค่าความหน่วงในรูปแบบข้อความ เทียบกับ WER แบบสตรีมมิงที่ 4.0% และ 2.6% บนโมเดลแบบบันทึกเสียงล่วงหน้า ตามข้อมูลของ Artificial Analysis
• ผู้พูด — อ้างว่ามีการระบุแหล่งที่มาว่าใครพูดอะไรในการสตรีม โดยไม่มีการยืนยัน เทียบกับไม่มีระบบแยกผู้พูด (speaker diarization) บน Live endpoint (ซึ่งมีให้ใช้งานในโมเดลแบบบันทึกล่วงหน้า รองรับสูงสุดสามผู้พูด)
• ภาษา — 10 (en, zh, es, pt, de, ja, ko, fr, ru, it) เทียบกับการตรวจจับอัตโนมัติที่ครอบคลุมมากกว่า 85 ภาษา พร้อมรองรับการสลับภาษากลางสตรีม
• ความยาวของเซสชัน — ถูกจำกัดด้วย GPU และหน่วยความจำของคุณเท่านั้น เทียบกับเพดานสูงสุด 10 นาทีต่อ Live session
• ค่าใช้จ่าย — $0 สำหรับน้ำหนัก (weights) ประมาณ 18 GB ของ bf16 สำหรับการโฮสต์เอง เทียบกับประมาณ $0.54 ต่อชั่วโมงเสียงบน Live เมื่อนับโทเคนเอาต์พุตข้อความแล้ว

"สตรีมมิ่ง" ในแต่ละฝ่ายหมายถึงอะไร
คำนี้ซ่อนความแตกต่างในการออกแบบจริง และควรกล่าวให้แม่นยำ เพราะทั้งสองระบบไม่ได้ตั้งใจจะให้เกิดจังหวะเดียวกันด้วยซ้ำ คอนฟิกของตัวประมวลผลล่วงหน้าของไมโครซอฟต์ทำให้จังหวะของ VibeVoice ชัดเจนเป็นรูปธรรม: เสียงเข้ามาที่ 24 กิโลเฮิรตซ์ และถูกบีบอัด 3,200 เท่า เป็นสตรีมโทเคนที่ประมาณ 7.5 เฟรมต่อวินาที จากนั้นคอนฟิกประกาศชิ้นข้อมูล 22 เฟรม และการมองไปข้างหน้า 4 เฟรม — ประมาณเสียง 2.9 วินาทีต่อชิ้นข้อมูล โดยมีเสียงในอนาคตอีกประมาณครึ่งวินาทีเพื่อช่วยให้ชัดเจนขึ้น โมเดลจะส่งข้อความออกมาครั้งหนึ่งต่อชิ้นข้อมูลที่ประมวลผลเสร็จ และบริบทจากชิ้นข้อมูลก่อนหน้าจะถูกเก็บรักษาไว้ผ่าน KV cache ดังนั้นเซสชันยาวจึงไม่ต้องคำนวณใหม่ทั้งหมด บทถอดความที่ใช้งานได้จริงจะเพิ่มขึ้นเป็นช่วง ๆ ประมาณสามวินาที
จุดสิ้นสุด (endpoint) แบบ Live ของ Google ถูกสร้างขึ้นสำหรับการวนซ้ำที่เร็วขึ้นและโต้ตอบได้มากขึ้น: สตรีมเสียงผ่าน WebSocket เป็นชิ้นส่วน PCM ขนาด 16 หรือ 24 kHz คำถอดความแบบบางส่วนจะกลับมาอย่างต่อเนื่องในขณะที่ผู้พูดยังพูดอยู่ และทรานสคริปต์ที่จัดรูปแบบแล้วจะมาถึง 0.40 วินาทีหลังจากสิ้นสุดคำพูด — ตัวเลขดังกล่าวเป็นค่าที่วัดโดย Artificial Analysis ซึ่ง Google อ้างอิง ข้อแลกเปลี่ยนคือขีดจำกัดของเซสชัน (เสียงสิบนาที หลังจากนั้นแอปพลิเคชันของคุณต้องเชื่อมต่อใหม่และต่อข้อมูลเข้าด้วยกัน) และคุณสมบัติเสริมที่ขาดหายไป: ไม่มีการแยกผู้พูด (speaker diarization) และไม่มีคำบอกเวลาระดับคำบนเส้นทาง Live ซึ่งทั้งสองอย่างมีอยู่ใน Gemini 3.5 Transcribe แบบบันทึกล่วงหน้า ดังนั้นบทสรุปที่ตรงไปตรงมาก็คือ โมเดลสตรีมมิ่งของ Google เร็วกว่าต่อหนึ่งคำพูด ในขณะที่เช็คพอยต์สตรีมมิ่งของ Microsoft ช้ากว่าต่อชิ้นส่วน แต่ให้การระบุผู้พูดซึ่งเส้นทาง Live ของ Google ไม่มี ที่ความยาวเซสชันซึ่ง Google ไม่ได้เสนอให้
ความแม่นยำ: วัดเทียบกับพื้นที่ว่าง
ช่องว่างที่กว้างที่สุดในการเปรียบเทียบครั้งนี้คือช่องว่างด้านหลักฐาน ไม่ใช่ด้านคุณภาพเสมอไป Artificial Analysis วัด Gemini 3.5 Transcribe Live ได้อัตราคำผิดเฉลี่ย 4.0% ในรูปแบบสตรีมมิง และ 2.6% ในรูปแบบไม่สตรีมมิง โดยโมเดลแบบหลังถูกจัดอันดับที่ห้าบนลีดเดอร์บอร์ด WER ของ Artificial Analysis เมื่อเปิดตัว; Google อ้างอิงตัวเลขแยกต่างหากที่ 5.50% สำหรับสตรีมมิง และ 5.04% สำหรับไม่สตรีมมิง บนชุดข้อมูลหลายภาษา FLEURS จงอ่านตัวเลขเหล่านั้นตามที่ถูกระบุไว้: Artificial Analysis เป็นอิสระจาก Google แต่ตัวเลขจาก API ที่เพิ่งมีอายุหนึ่งวันยังเร็วเกินไป และค่าพรีเมียมของสตรีมมิงที่สูงกว่าโมเดลแบบแบตช์ — 4.0% เทียบกับ 2.6% — คือราคาปกติของการส่งมอบแบบเรียลไทม์
VibeVoice-ASR-Streaming-7B ไม่มีค่าที่เทียบเคียงได้ที่ใดเลย การ์ดโมเดลมาพร้อมกับรูปภาพแสดงค่าประเมินผล และรายงานทางเทคนิคของ Microsoft เป็น PDF แต่ทั้งคู่ไม่ได้ให้ตัวเลข WER แบบสตรีมมิ่งหรือค่าหน่วงเวลาที่เป็นข้อความธรรมดา ซึ่งสามารถอ้างอิงหรือตรวจสอบได้โดยอิสระ จุดยึดเชิงตัวเลขเพียงอย่างเดียวของทั้งตระกูลคือการ์ดโมเดลแบบ batch ของ VibeVoice-ASR ซึ่งรายงานค่าเฉลี่ย WER 7.77% จากการทดสอบโดยผู้พัฒนาบนชุดทดสอบภาษาอังกฤษแปดชุด และ 2.20% บน LibriSpeech clean — ตัวเลขเหล่านี้เป็นของโมเดลแบบไม่สตรีมมิ่ง ไม่ใช่ตัวนี้ และโมเดลแบบสตรีมมิ่งมักจะแลกความแม่นยำเล็กน้อยเพื่อให้ได้ความหน่วงที่เร็วขึ้น จนกว่าจะมีใครนำ checkpoint แบบสตรีมมิ่งไปทดสอบกับชุดเครื่องมือสาธารณะ คำกล่าวที่ยุติธรรมคือ ฝั่งหนึ่งของการเปรียบเทียบนี้ถูกวัดผลแล้ว ส่วนอีกฝั่งหนึ่งยังไม่ได้ถูกวัดผล
ต้นทุน: API แบบคิดตามการใช้งาน เทียบกับ GPU ที่คุณจัดสรรงบประมาณไว้แล้ว
Google คิดค่าบริการ Gemini 3.5 Transcribe Live ตามจำนวน token และคิดอัตราเสียงที่ 25 tokens ต่อวินาที จากอัตรา Live ที่เผยแพร่ — $3.50 ต่อ 1M audio tokens และ $21 ต่อ 1M text-output tokens — ราคาเฉลี่ยต่อชั่วโมงเสียงอยู่ที่ประมาณ $0.54 หรือประมาณ $9 ต่อ 1,000 audio-minutes และโมเดลแบบ pre-recorded ยังถูกกว่านั้นอีก คือประมาณ $0.30 ต่อชั่วโมง ความเงียบจะฟรีก็ต่อเมื่อ client ของคุณไม่ได้ส่งสตรีมนั้นเข้ามา: การเชื่อมต่อใหม่ เสียงที่ซ้ำซ้อน และการบันทึกโลกล้วนเพิ่ม token ที่ถูกนับรวมในบิลจริง
checkpoint ของ Microsoft กลับคิดราคาเป็น GPU-hours แทน น้ำหนักแบบ bf16 เพียงอย่างเดียวนั้นใช้พื้นที่ประมาณ 18 GB ก่อนที่จะมี KV cache ใด ๆ เส้นทางที่มีการบันทึกไว้คือเดโม่ Python ในรีโพสิทอรี microsoft/VibeVoice และปลั๊กอิน vLLM ที่ให้บริการ WebSocket และเอนด์พอยต์ที่เข้ากันได้กับ OpenAI และไม่มีราคาสำหรับการโฮสต์เพราะยังไม่มีผู้ให้บริการรายใดโฮสต์โมเดลนี้ — โมเดลนี้ไม่ได้อยู่บน Azure AI Foundry แบบที่ VibeVoice-ASR แบบแบตช์มีมาตั้งแต่เดือนมีนาคม การโฮสต์ speech-LLM ระดับ 7B ด้วยตนเองหมายถึงการจัดงบประมาณสำหรับ GPU ระดับ 24 GB และเวลาดำเนินการของคุณเอง สิ่งที่ได้ตอบแทนคือความยาวเซสชันไม่จำกัดและน้ำหนักที่คุณเป็นเจ้าของ โมเดลทั้งสองนี้ไม่ได้แยกจากกันโดยสิ้นเชิง ซึ่งเป็นประเด็นของส่วนสุดท้าย

การรักษาตัวเลือกให้มีราคาถูก
การที่คุณจะเลือกแบบไหนขึ้นอยู่กับว่าคุณต้องการตัวเลขหรือโค้ด เลือก Gemini 3.5 Transcribe Live เมื่อคุณต้องการการถอดเสียงที่ใช้งานได้ในปัจจุบัน มีความแม่นยำที่เผยแพร่ให้เห็น และไม่ต้องใช้ GPU ในการรัน — และเมื่อเสียงของคุณไม่ได้จำกัดอยู่แค่สิบภาษา หรือคุณพร้อมที่จะสร้างการระบุผู้พูดด้วยตัวเอง เนื่องจาก Live endpoint ไม่ได้มีฟีเจอร์นี้ให้ เลือก VibeVoice-ASR-Streaming-7B เมื่อคุณโฮสต์ด้วยตัวเอง เมื่อความยาวเซสชันไม่จำกัดหรือผลลัพธ์สตรีมมิงที่ระบุผู้พูดตามที่กล่าวอ้างมีความสำคัญ และเมื่อคุณยินดีที่จะตั้งเกณฑ์การประเมินของคุณเอง เพราะไม่มีเกณฑ์มาตรฐานให้อ้างอิง
ไม่มีตัวเลือกใดต้องเป็นแบบถาวร และนั่นคือจุดที่เลเยอร์การจัดเส้นทางพิสูจน์ความคุ้มค่าของมัน — สำหรับโมเดลที่ทำงานกับทรานสคริปต์ ไม่ใช่ตัวการถอดเสียงเอง ปัจจุบัน OrcaRouter ไม่ได้จัดเส้นทางบริการแปลงเสียงเป็นข้อความ และไม่มีโมเดลใดในหน้านี้อยู่ในแคตตาล็อกของมัน สิ่งที่มันทำคือให้ API เดียวกับโมเดลภาษา 200+ ตัวที่บริโภคทรานสคริปต์สด — ตัวสรุป ตัวดึงรายการที่ต้องดำเนินการ ตัววางแผนของเอเจนต์เสียง — ในราคาที่ผู้ให้บริการกำหนดโดยส่งผ่านโดยไม่มีมาร์กอัป พร้อมเฟลโอเวอร์อัตโนมัติระหว่างผู้ให้บริการ การลดราคาจากผู้ขายสำหรับโมเดลใดๆ ในสแต็กนั้นมีผลทันทีในวันเดียวกัน เพราะราคาตามรายการถูกส่งผ่านแทนที่จะบวกเพิ่ม ขั้นตอนการถอดเสียงยังคงอยู่ที่ที่คุณวางไว้ สแต็กที่ประมวลผลทรานสคริปต์คือเลเยอร์ที่คีย์เดียวและเส้นทางสำรองทำให้เช็คพอยต์อายุหนึ่งสัปดาห์ที่ยังไม่ได้วัดประสิทธิภาพกลายเป็นตัวเลือกที่ทดสอบได้ แทนที่จะเป็นการเดิมพัน
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
