
VibeVoice-ASR-Streaming-1.5B เทียบกับ Gemini 3.5 Transcribe: ASR แบบสตรีมมิงเงียบๆ ของไมโครซอฟท์ สู้กับ API ใหม่ของกูเกิล
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
เจ็ดวันและเส้นแบ่งทางปรัชญาหนึ่งข้อคั่นระหว่างระบบแปลงคำพูดเป็นข้อความแบบสตรีมมิงรุ่นใหม่ล่าสุดสองระบบ เมื่อวันที่ 26 สิงหาคม 2026 Google เปิดตัว Gemini 3.5 Transcribe ในรุ่นพรีวิวสาธารณะ: API แปลงคำพูดเป็นข้อความแบบโฮสต์และปิดระบบ คิดราคาต่อโทเค็นเสียง พร้อมเอนด์พอยต์ Live แยกต่างหากสำหรับเซสชันแบบเรียลไทม์ เมื่อวันที่ 2 กันยายน 2026 Microsoft Research อัปโหลด VibeVoice-ASR-Streaming-1.5B ขึ้น Hugging Face ภายใต้เนมสเปซ microsoft — น้ำหนักโมเดลภายใต้ใบอนุญาต MIT ไม่มีการแถลงข่าว ไม่มีโพสต์เปิดตัว และในขณะที่เขียนบทความนี้ ยังไม่มีสื่อภายนอกกล่าวถึงเลย ทั้งสองระบบถอดเสียงคำพูดในขณะที่เสียงยังคงเข้ามาเรื่อย ๆ แทบทุกอย่างอื่นเกี่ยวกับพวกเขา — ใครได้รับอนุญาตให้เรียกใช้ มีค่าใช้จ่ายเท่าไร มีหลักฐานอะไรบ้างที่พิสูจน์ว่ามันทำงาน — ล้วนแตกต่างกัน
หน้านี้เปรียบเทียบทั้งสองระบบตามสภาพที่แท้จริง ณ ปัจจุบัน ซึ่งทำให้หลักฐานของทั้งสองฝั่งไม่สมมาตรกัน Gemini 3.5 Transcribe เป็นผลิตภัณฑ์ Google ที่ใช้งานจริง โดยมีการเผยแพร่ราคา token และตัวเลขความแม่นยำจากบุคคลที่สามอย่าง Artificial Analysis ซึ่งก็คือตัวเลขที่ติดป้าย AA ด้านล่าง ส่วน VibeVoice-ASR-Streaming-1.5B เป็น checkpoint ที่โมเดลการ์ดของมันไม่มีการเผยแพร่อัตราคำผิด (word-error-rate) หรือค่าหน่วงเวลา (latency) ในรูปแบบข้อความเลยแม้แต่น้อย — การประเมินบนการ์ดเป็นรูปภาพ ส่วนการประกาศเพียงหนึ่งเดียวของตระกูล streaming ที่มีจนถึงตอนนี้คือข้อความข่าวลงวันที่ 3 กันยายนในที่เก็บ GitHub ของ Microsoft ชื่อ VibeVoice ข้อมูลทั้งหมดในฝั่ง Microsoft ด้านล่างเป็นสิ่งที่รู้ได้จากที่เก็บดังกล่าวเท่านั้น ได้แก่ ไฟล์คอนฟิก โมเดลการ์ด และเอกสารประกอบ streaming ของ Microsoft เอง โดยยังไม่มีสิ่งใดที่ถูกวัดประสิทธิภาพอย่างเป็นอิสระ
สองโมเดลโดยสรุป
• มันคืออะไร — VibeVoice-ASR-Streaming-1.5B: เช็คพอยต์แบบเปิด, ใช้สัญญาอนุญาต MIT, โฮสต์เองได้ เทียบกับ Gemini 3.5 Transcribe: API ที่โฮสต์ให้บริการ, น้ำหนักโมเดลปิด
• การเปิดตัว — weights วันที่ 2 กันยายน 2026, ไลน์ข่าว repo วันที่ 3 กันยายน เทียบกับการพรีวิวต่อสาธารณะวันที่ 26 สิงหาคม 2026 พร้อมเอกสารเปิดตัวฉบับเต็ม
• รูปแบบการสตรีม — ส่งข้อความออกมาเป็นท่อนๆ ประมาณ 2.9 วินาทีต่อท่อน โดยมีการมองไปข้างหน้าประมาณ 0.5 วินาที สถานะเซสชันถูกเก็บไว้ในแคชคำนำหน้า เทียบกับเซสชัน WebSocket Live ที่คิดค่าใช้จ่ายตามโทเคนเสียง และจำกัดเสียงสูงสุด 10 นาทีต่อเซสชัน
• ความแม่นยำในเอกสารสิ่งพิมพ์ — ไม่มีการเผยแพร่ตัวเลข WER หรือความหน่วงเป็นข้อความ เทียบกับค่า WER ที่ AA วัดได้ 2.6% บนเอนด์พอยต์แบบบันทึกล่วงหน้า และ 4.0% บนเอนด์พอยต์แบบสด
• ผลลัพธ์ผู้พูด — อ้างว่ามีการระบุว่าใครพูดอะไรแบบสตรีมมิง (ยังไม่ผ่านการยืนยัน) เทียบกับไม่มี speaker diarization และไม่มี timestamp ระดับคำบน Live endpoint
• Hotwords — รองรับ ผ่านพรอมต์บริบทเดียวกันกับ VibeVoice-ASR แบบแบตช์ ในขณะที่ไม่ได้เป็นฟีเจอร์ที่ระบุไว้ของ Live endpoint
• ต้นทุน — $0 สำหรับน้ำหนัก, ~5.6 GB สำหรับการโฮสต์เอง เทียบกับประมาณ $0.30 ต่อชั่วโมงเสียงโดยเฉลี่ยบนเอนด์พอยต์ที่บันทึกล่วงหน้า และ ~$0.54 บน Live ตามราคาโทเค็นที่ Google ระบุไว้

API ที่โฮสต์ไว้และการอัปโหลดอย่างเงียบๆ ห่างกันเจ็ดวัน
Gemini 3.5 Transcribe เป็นโมเดลถอดเสียงรุ่นทดแทนของ Google และเผยแพร่เป็นผลิตภัณฑ์สองแบบ เอนด์พอยต์แบบบันทึกล่วงหน้า ซึ่งให้บริการผ่าน Interactions API จะรับไฟล์เสียงเต็มรูปแบบและส่งคืนทรานสคริปต์พร้อมส่วนเสริมที่คาดหวัง เอนด์พอยต์แบบสด (Live) ชื่อ gemini-3.5-transcribe-live ทำงานผ่าน WebSocket แบบสองทิศทาง และเป็นตัวที่แข่งขันกับ VibeVoice-ASR-Streaming-1.5B ในเรื่องลักษณะของงาน: การถอดเสียงเซสชันขณะที่เกิดขึ้นจริง Google ประกาศด้วยกลไกปกติ — เปิดตัวเป็น public preview ในวันที่ 26 สิงหาคม กำหนดราคาในหน้าโมเดล และกระดานผู้นำจากบุคคลที่สามนำไปจัดอันดับภายในไม่กี่วัน
การสตรีมรีลีสของ Microsoft ไม่มีอะไรแบบนั้นเลย เมื่อวันที่ 2 กันยายน บัญชี Hugging Face ของ microsoft ได้สร้างเช็คพอยต์สองรายการในนาทีเดียวกัน: VibeVoice-ASR-Streaming-7B และ VibeVoice-ASR-Streaming-1.5B ตารางโมเดลในรีโพซิทอรี GitHub ตอนนี้ระบุ VibeVoice-ASR-Streaming เป็นสมาชิกในตระกูล และส่วน News มีข้อความวันที่ 3 กันยายนประกาศว่า "โมเดล ASR สตรีมมิงแบบรวมเป็นหนึ่งที่ถอดเสียงอย่างต่อเนื่องว่าใครพูดอะไรเมื่อคำพูดมาถึง พร้อมรองรับคำฮอตเวิร์ดที่กำหนดเองและ 10 ภาษา" — แต่ประกาศนั้นเอ่ยชื่อเฉพาะรุ่น 7B และรุ่น 1.5B เป็นรุ่นน้องที่เล็กกว่า ซึ่งเปิดตัวมาพร้อมกันโดยไม่ถูกเอ่ยถึง เมื่อเราตรวจสอบหนึ่งวันหลังอัปโหลด เช็คพอยต์ทั้งสองยังคงแสดงการดาวน์โหลดเป็นศูนย์

"สตรีมมิ่ง" ในแต่ละฝ่ายหมายถึงอะไร
คำว่า streaming ซ่อนความแตกต่างในการออกแบบที่แท้จริงไว้ การกำหนดค่าตัวประมวลผลล่วงหน้าของ Microsoft ทำให้จังหวะของ VibeVoice เป็นรูปธรรม: เสียงเข้ามาที่ 24 kHz และถูกบีบอัด 3,200 เท่าเป็นสตรีมของโทเค็นคำพูดที่ประมาณ 7.5 เฮิรตซ์ (หนึ่งโทเค็นทุก ๆ ประมาณ 133 มิลลิวินาที) จากนั้นการกำหนดค่าจะระบุ chunk จำนวน 22 เฟรม และ lookahead 4 เฟรม — คิดเป็นเสียงประมาณ 2.9 วินาทีต่อ chunk โดยใช้เสียงในอนาคตประมาณครึ่งวินาทีเพื่อทำให้เซกเมนต์ปัจจุบันมีความแน่นอนยิ่งขึ้น โมเดลจะสร้างข้อความหนึ่งครั้งต่อ chunk ที่สรุปผลแล้ว และเอกสารของ Microsoft ระบุว่าบริบทจาก chunk ก่อนหน้าถูกเก็บรักษาไว้ผ่าน KV cache ดังนั้นเซสชันที่ยาวจึงไม่ต้องคำนวณใหม่ตั้งแต่ต้น ตัวเลขชุดนี้ถูกระบุไว้ในการกำหนดค่า และผลในทางปฏิบัติคือทรานสคริปต์จะเพิ่มขึ้นเป็นช่วง ๆ ประมาณสามวินาที ไม่ใช่ทีละคำแบบบางส่วน
ปลายทาง Live ของ Google มีรูปแบบการสตรีมที่ต่างออกไป: เป็นเซสชัน WebSocket แบบสองทิศทางซึ่งเสียงจะถูกคิดค่าใช้จ่ายในอัตรา 25 โทเคนเสียงต่อวินาที ออกแบบมาเพื่อการใช้งานแบบโต้ตอบ แต่จำกัดเสียงไว้ที่ 10 นาทีต่อเซสชัน และ—เฉพาะบนปลายทาง Live—ไม่มีระบบแยกแยะผู้พูด (speaker diarization) หรือการประทับเวลาในระดับคำ (word-level timestamps) สำหรับผู้ที่เปรียบเทียบทั้งสองระบบในฐานะเอนจินถอดเสียงสด ความแตกต่างที่สำคัญคือ ขีดจำกัดของเซสชัน (10 นาทีบนฝั่ง Live ของ Google ส่วนฝั่ง Microsoft ถูกจำกัดเพียงแค่ GPU และหน่วยความจำของคุณเอง) จังหวะการส่งข้อมูลออก (ชิ้นส่วนละ ~3 วินาที เทียบกับสิ่งที่เซสชัน WebSocket ส่งให้) และคุณสมบัติเสริมในผลลัพธ์ (การระบุผู้พูดและคำสำคัญ (hotwords) ที่ Microsoft ระบุไว้บนการ์ดของตน แต่ไม่มีในรายการคุณสมบัติของ Google Live)
ความแม่นยำ: ด้านหนึ่งมีตัวเลข อีกด้านหนึ่งมีรูปภาพ
นี่คือช่องว่างที่กว้างที่สุดในการเปรียบเทียบครั้งนี้ และเป็นช่องว่างของหลักฐาน ไม่จำเป็นต้องเป็นเรื่องของคุณภาพ Artificial Analysis วัด Gemini 3.5 Transcribe ว่ามีอัตราความผิดพลาดของคำที่ 2.6% บนเอนด์พอยต์แบบบันทึกไว้ล่วงหน้า และ 4.0% บนเอนด์พอยต์แบบ Live — ค่าพรีเมียมที่คุณจ่ายเพื่อการส่งแบบเรียลไทม์ปรากฏชัดในอัตราความผิดพลาด ซึ่งเป็นการแลกเปลี่ยนที่ตรงไปตรงมาและพบได้ทั่วไปสำหรับระบบสตรีมมิง ตัวเลขเหล่านั้นมาจากบุคคลที่สามบนลีดเดอร์บอร์ดที่เป็นกลาง ซึ่งเผยแพร่หลังการเปิดตัวเพียงไม่กี่วัน
VibeVoice-ASR-Streaming-1.5B ไม่มีตัวเลขที่เทียบเคียงได้จากที่ใดเลย การ์ดโมเดลมาพร้อมรูปภาพแสดงผลการประเมิน แต่ไม่มีตัวเลข WER, RTF หรือ latency ในรูปแบบข้อความ — ไม่มีอะไรที่อ้างอิงได้ และไม่มีอะไรที่ตรวจสอบได้อย่างอิสระ Microsoft ยังไม่ได้ใส่ตัวเลขความแม่นยำแบบสตรีมมิ่งในข้อความสำหรับทั้งรุ่น 7B และ 1.5B จุดยึดตัวเลขเพียงจุดเดียวในทั้งตระกูลคือการ์ดโมเดลแบบแบตช์ VibeVoice-ASR ซึ่งรายงานค่าเฉลี่ย WER 7.77% ที่รันโดยผู้จำหน่ายบนชุดทดสอบภาษาอังกฤษแปดชุด และ 2.20% บน LibriSpeech clean — แต่สิ่งนั้นอธิบายโมเดลแบบไม่สตรีมมิ่ง และโมเดลสตรีมมิ่งโดยทั่วไปจะแลกความแม่นยำเล็กน้อยเพื่อชนะในด้านเวลาแฝง จนกว่าจะมีใครสักคนรัน checkpoint แบบสตรีมมิ่งผ่านชุดทดสอบสาธารณะ จุดยืนที่ซื่อสัตย์คือโมเดลของ Google ถูกวัดค่าแล้ว ส่วนของ Microsoft ยังไม่ได้ถูกวัด
ต้นทุน: ต่อชั่วโมงเสียง เทียบกับ ต่อชั่วโมง GPU
Google ขาย Gemini 3.5 Transcribe ตามจำนวนโทเคน และราคาถูกแบ่งออกมาอย่างชัดเจนระหว่างสองเอนด์พอยต์ เอนด์พอยต์แบบพรีเรคอร์ด (pre-recorded) ระบุราคา $2 ต่อ 1 ล้านโทเคนเสียงที่นำเข้า และ $12 ต่อ 1 ล้านโทเคนข้อความที่ส่งออก ซึ่งคิดเป็นประมาณ $0.30 ต่อชั่วโมงเสียงแบบผสม (blended) เอนด์พอยต์แบบ Live ระบุราคา $3.50 ต่อ 1 ล้านโทเคนเสียง และ $21 ต่อ 1 ล้านโทเคนข้อความ — ประมาณ $0.54 ต่อชั่วโมงเสียงแบบผสม หรือสูงกว่าราคาแบบพรีเรคอร์ดประมาณ 80% ซึ่งเป็นราคาของการส่งแบบเรียลไทม์ Google คิดค่าเสียงที่ 25 โทเคนต่อวินาที ดังนั้นช่วงเงียบจะไม่มีค่าใช้จ่ายก็ต่อเมื่อไคลเอนต์ของคุณไม่ได้สตรีมมันเข้ามา ส่วนการเชื่อมต่อใหม่ เสียงที่ซ้ำกัน และการบันทึกล็อกล้วนเพิ่มค่าใช้จ่ายจริงได้ มีฟรีเทียร์ให้ใช้งาน โดยมีข้อแม้ว่าเนื้อหาในฟรีเทียร์อาจถูกนำไปใช้เพื่อปรับปรุงผลิตภัณฑ์ของ Google

โมเดลของ Microsoft กลับคิดราคาเป็นชั่วโมงการใช้งาน GPU แทน จุดเช็คพอยต์ขนาด 1.5B มีน้ำหนักแบบ bf16 ประมาณ 5.6 GB (แกนภาษาหลัก Qwen ระดับ 1.5B บวกกับตัวแปลงโทเค็นเสียงและส่วนหัวแบบ diffusion — ข้อมูลเมตาของ safetensors รวมกันแล้วประมาณ 3B พารามิเตอร์) และเส้นทางที่ระบุไว้เพื่อรันโมเดลคือแบบโฮสต์เอง: สคริปต์ตัวอย่าง Python ในที่เก็บ microsoft/VibeVoice หรือปลั๊กอิน vLLM ที่ Microsoft อธิบายไว้สำหรับให้บริการเอนด์พอยต์ที่เข้ากันได้กับ OpenAI และ WebSocket ยังไม่มีราคาแบบโฮสต์เพราะยังไม่มีผู้ให้บริการ inference รายใดลงรายการโมเดลนี้ คำถามเรื่องต้นทุนจึงอยู่ที่ว่าเวลาบน GPU ของคุณเองถูกกว่าอัตรารายชั่วโมงของ Google หรือไม่ ซึ่งสำหรับปริมาณการถอดเสียงแบบต่อเนื่องแทบทุกกรณีก็ถูกกว่าอยู่ดี — และคำถามเรื่องสัญญาอนุญาตก็แยกจากคำถามเรื่องต้นทุน เพราะน้ำหนักแบบ MIT เป็นของคุณเองที่จะเก็บไว้ได้ในแบบที่การสมัครใช้ API ไม่สามารถทำได้
ทั้งสองสิ่งนี้ไม่ได้แยกขาดจากกันในสแตกของระบบโปรดักชัน รูปแบบที่ใช้งานได้จริงสำหรับทีมที่ต้องการการถอดเสียงสดในวันนี้ คือการวางชั้น ASR ไว้หลังเอนด์พอยต์เดียว เพื่อให้การเลือกยังคงย้อนกลับได้: API เราเตอร์ที่มีโมเดลกว่า 200 รุ่นอยู่เบื้องหลัง ในราคารายการของผู้ให้บริการ — ไม่มีมาร์กอัป การเปลี่ยนแปลงราคาของผู้ให้บริการจึงมีผลจริงในวันเดียวกัน — พร้อมระบบ failover อัตโนมัติ คือชั้นที่ทำให้คุณใช้ measured API ของ Google เป็นค่าเริ่มต้น ขณะที่ทราฟฟิกจริงส่วนหนึ่งทดสอบ VibeVoice-ASR-Streaming-1.5B ทันทีที่มีผู้ให้บริการโฮสต์โมเดลดังกล่าว นั่นคือรูปแบบของ OrcaRouter และเป็นวิธีที่มีความเสี่ยงต่ำในการนำเช็คพอยต์ที่ยังไม่มีใครยืนยันความแม่นยำมาใช้
ใครควรเลือกอันไหน
เลือก Gemini 3.5 Transcribe หากคุณต้องการ API การถอดเสียงที่ใช้งานได้จริงในวันนี้ มีความแม่นยำที่เผยแพร่ต่อสาธารณะ ราคาต่อชั่วโมงที่คาดเดาได้ และไม่ต้องดูแล GPU — โดยเฉพาะอย่างยิ่งหากเสียงของคุณไม่อยู่ในสิบบภาษาที่ Microsoft ระบุไว้ หรือหากคุณต้องการ diarization และ timestamp ระดับคำของ endpoint แบบ pre-recorded สำหรับการถอดเสียงไฟล์ ขีดจำกัด 10 นาทีของเซสชัน Live เป็นข้อจำกัดจริงที่คุณต้องทดสอบกับกรณีการใช้งานของคุณก่อนตัดสินใจใช้สำหรับเซสชันสด
เลือก VibeVoice-ASR-Streaming-1.5B หากคุณโฮสต์เอง หากต้องการควบคุมน้ำหนักโมเดลและข้อมูลตามที่ MIT เปิดให้ใช้ หากต้องการความยาวเซสชันไม่จำกัด หรือหากฟีเจอร์เอาต์พุตสตรีมมิงแบบระบุว่าใครพูดอะไรและฮอตเวิร์ดเป็นสิ่งที่คุณอยากประเมินเป็นพิเศษ ต้องเตรียมงบประมาณสำหรับการติดตั้งจากซอร์สโค้ด น้ำหนักโมเดลประมาณ 5.6 GB บน GPU ของ NVIDIA และเกณฑ์การประเมินของคุณเอง — ไม่มี benchmark ให้อิง ดังนั้นเรื่องความแม่นยำจึงเป็นสิ่งที่คุณต้องตอบด้วยเสียงของคุณเอง
คำตัดสินหลังผ่านไปหนึ่งสัปดาห์: Google ส่งมอบผลิตภัณฑ์ที่ผ่านการวัดผลอย่างรอบคอบ ส่วน Microsoft ส่งมอบเดิมพันที่น่าสนใจ Gemini 3.5 Transcribe คือตัวเลือกเริ่มต้นที่ปลอดภัยกว่า และเป็นตัวที่มีตัวเลขจากบุคคลที่สามรองรับอยู่เบื้องหลัง ส่วน VibeVoice-ASR-Streaming-1.5B เป็นทางเลือกแบบเปิด โฮสต์เองได้ และไม่ผ่านการตรวจสอบใด ๆ เลย สิ่งที่ทำให้การเลือกนี้ต้นทุนต่ำก็คือ มันไม่จำเป็นต้องเป็นทางเลือกถาวร — ทำให้ ASR endpoint สลับเปลี่ยนได้ และ checkpoint ที่ปล่อยออกมาโดยไม่มี benchmark แม้แต่ตัวเดียว ก็สามารถสร้างหรือลดทราฟฟิกของคุณได้จากหลักฐานในบทถอดเสียงของคุณเอง
