
Grok Voice Transcribe 2.0 กับ VibeVoice ASR Streaming 7B: ตัวเลขที่ Microsoft ไม่ได้เปิดเผย
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
VibeVoice ASR Streaming 7B เป็นระบบรู้จำเสียงพูดแบบสตรีมมิ่งแบบรวมของ Microsoft ซึ่งอัปโหลดไปยัง Hugging Face เมื่อวันที่ 2 กันยายน 2026 และประกาศในคลังเก็บ microsoft/VibeVoice หนึ่งวันต่อมาภายใต้สัญญาอนุญาต MIT และมันทำสิ่งที่ไม่เหมือนกับ Grok Voice Transcribe 2.0 หรือคู่แข่งส่วนใหญ่ของมัน: มันส่งข้อความที่ระบุผู้พูดได้ทันทีเมื่อมีเสียงเข้ามา โดยไม่มีขั้นตอนการแยกผู้พูดแยกต่างหาก รายงานทางเทคนิคของ Microsoft กล่าวว่าเช็คพอยต์ 7B ทำได้ค่า WER และ CER เฉลี่ยต่ำสุดในห้าชุดการประเมิน และมีการระบุผู้พูดที่ดีที่สุดหรือดีที่สุดเท่ากันใน 12 จาก 13 การตั้งค่าการประเมิน สิ่งที่โมเดลการ์ดไม่ได้ทำคือการเผยแพร่ตัวเลขแม้แต่ตัวเดียวในรูปแบบข้อความ — ไม่มี WER, ไม่มี RTF, ไม่มีตัวเลขความหน่วง; ผลลัพธ์มีอยู่ในรูปแบบรูปภาพในรายงานเท่านั้น Grok Voice Transcribe 2.0 ซึ่งเปิดตัว 16 วันต่อมาเมื่อวันที่ 18 กันยายน 2026 ในราคา $0.10 ต่อชั่วโมงเสียงสำหรับแบบแบตช์ และ $0.20 ต่อชั่วโมงสำหรับแบบสตรีมมิ่ง เผยแพร่ทุกอย่าง: WER ของทรานสคริปต์สุดท้าย 2.7% และ WER ของ partial แรก 3.4% บนบอร์ดสตรีมมิ่งของ Artificial Analysis โดยใช้เวลา 0.49 วินาทีต่ออัน ดังนั้นจุดเริ่มต้นที่ตรงไปตรงมาสำหรับการเปรียบเทียบนี้คือ หนึ่งในสองโมเดลมีการบันทึกเอกสารที่ดีกว่าอย่างเห็นได้ชัด และความไม่สมมาตรนั้นเองคือข้อเท็จจริงที่เกี่ยวข้องกับการตัดสินใจมากที่สุดในการเปรียบเทียบนี้
สิ่งที่ Microsoft เผยแพร่ และสิ่งที่ผู้อ่านสามารถทำได้กับมัน
รายงาน VibeVoice เป็นงานวิจัยจริง และข้ออ้างในรายงานมีความเฉพาะเจาะจงในเชิงรูปแบบ แม้ไม่ใช่ในเชิงค่า รายงานนี้ประเมินชุดทดสอบมาตรฐานด้านการประชุม 4 ชุด ได้แก่ AliMeeting, AISHELL-4, AMI-SDM และ AMI-IHM พร้อมกับ MLC-Challenge ครอบคลุม 9 ภาษา และรายงานผลลัพธ์หลัก 2 ประการ: โมเดล 7B มี WER/CER เฉลี่ยต่ำที่สุดในทั้ง 5 ชุด และมีการระบุผู้พูดที่ดีที่สุดหรือดีที่สุดร่วมใน 12 จาก 13 การตั้งค่าการประเมิน ทั้งสองเป็นข้ออ้างเชิงสัมพัทธ์ ซึ่งเป็นข้ออ้างประเภทที่มีความหมาย: "ต่ำที่สุดในทั้ง 5 ชุดนี้" เป็นข้อความเกี่ยวกับการจัดลำดับ และการจัดลำดับคือสิ่งที่ผู้ซื้อต้องการ
สิ่งที่หายไปคือตัวเลขสัมบูรณ์ทุกตัว ไม่มีเปอร์เซ็นต์ WER ให้เทียบกับสิ่งใด ไม่มีตัวเลข throughput ไม่มีการวัดค่า latency และไม่มีการแยกผลรายชุดในข้อความ ตารางเปรียบเทียบที่วาง VibeVoice ไว้ข้าง Grok Voice Transcribe 2.0 แล้วกำหนดตัวเลขให้โมเดลของ Microsoft กำลังประดิษฐ์ตัวเลขนั้นขึ้นมา สิ่งที่กล่าวได้คือ VibeVoice ชนะการประเมินห้าชุดของตัวเอง และไม่มีใครนอก Microsoft รันซ้ำเลย — ไม่มี benchmark อิสระ ไม่มีการประเมินจากบุคคลที่สาม และ ณ เวลาที่เขียน ไม่มีผู้ให้บริการ inference แบบโฮสต์รายใดที่ลงรายการโมเดลนี้เลย ดังนั้นการเปรียบเทียบจึงอยู่ระหว่างตัวเลขที่มีการบันทึกไว้ กับอันดับที่ไม่มีการบันทึกไว้ และอันดับที่ไม่มีการบันทึกไว้นั้นไม่ได้เป็นฝ่ายที่อ่อนแอกว่าในสองฝ่าย เพียงเพราะมันไม่มีจุดทศนิยม
เอกสารของ Grok Voice Transcribe 2.0 มีปัญหาตรงกันข้าม ตัวเลข 2.7% และ 3.4% ของมันมาจากบอร์ด AA-WER Streaming ของ Artificial Analysis ซึ่งเป็นค่าผสมถ่วงน้ำหนักระหว่าง AA-AgentTalk ที่ 50% กับ VoxPopuli และ Earnings22 อย่างละ 25% — เป็นเสียงสนทนาภาษาอังกฤษในรูปแบบตัวแทน (agent) ประมาณแปดชั่วโมง ที่รันอย่างอิสระ ซึ่งมีที่มาเชื่อถือได้จริงกว่าเกณฑ์ประเมินของผู้ขายเองอย่างแท้จริง แต่มันเป็นเพียงเสี้ยวแคบ ๆ ของภาษาอังกฤษชิ้นหนึ่ง และหน้าบอร์ดเองก็พล็อตไว้เพียง 27 จาก 33 โมเดลที่ SpaceXAI นับรวม เมื่ออ้างว่าครองอันดับหนึ่งจาก 32 โมเดล ตัวเลขที่แม่นยำบนการทดสอบแคบ ๆ กับข้ออ้างที่ไม่แม่นยำบนการทดสอบที่กว้างกว่า ไม่สามารถนำมาเปรียบเทียบกันตรง ๆ ได้ และบทความนี้จะไม่เสแสร้งว่าเป็นเช่นนั้น
สองวินาทีครึ่งเทียบกับครึ่งวินาที
การเปรียบเทียบความหน่วงคือจุดเดียวที่โมเดลทั้งสองสามารถนำมาเทียบเคียงกันได้โดยไม่มีข้อแม้ใด ๆ เกี่ยวกับชุดข้อมูล เพราะทั้งคู่เปิดเผยการตั้งค่าการสตรีมของตน และความแตกต่างนั้นเป็นเชิงสถาปัตยกรรมมากกว่าจะเป็นการเลือกปรับจูน
VibeVoice ASR Streaming 7B ทำงานทีละชังก์ เช็กพอยต์ที่เผยแพร่ใช้ 22 เฟรมแฝงต่อชังก์ ซึ่งที่ 7.5 เฟรมแฝงต่อวินาทีของโมเดล คิดเป็นเสียงประมาณ 2.9 วินาทีต่อชังก์ โดยมีการมองล่วงหน้าสี่เฟรมแฝง — ประมาณ 0.5 วินาทีของเสียงในอนาคต — และความหน่วงที่คาดหวังในการระบุผู้พูดประมาณ 2.00 วินาที มันส่งออกข้อความหนึ่งครั้งต่อชังก์ นั่นคือระบบสตรีมมิ่งจริง แต่จังหวะนั้นวัดเป็นวินาที ไม่ใช่มิลลิวินาที
Grok Voice Transcribe 2.0 ส่งคืนบทถอดความบางส่วนครั้งแรกภายใน 0.49 วินาทีหลังจากผู้พูดหยุด และสร้างบทถอดความฉบับสมบูรณ์ภายใน 0.49 วินาทีหลังสิ้นสุดการพูด มันแลกความเร็วนั้นมาด้วยความแม่นยำ — อัตราความผิดพลาดของบทถอดความบางส่วนครั้งแรกลดลงจาก 18.3% ในเวอร์ชัน 1.0 เหลือ 3.4% ในเวอร์ชัน 2.0 โดยแลกกับการเพิ่มจาก 0.25 วินาทีเป็น 0.49 วินาทีในตัวชี้วัดเดียวกัน
วางไว้ข้างๆ กัน:
• จังหวะการสตรีม — Grok Voice Transcribe 2.0 ส่งผลลัพธ์บางส่วนอย่างต่อเนื่อง โดยมีความหน่วงของผลลัพธ์บางส่วนแรกที่ 0.49 วินาที เทียบกับ VibeVoice ASR Streaming 7B ที่ส่งข้อความหนึ่งชิ้นประมาณทุก ๆ 2.9 วินาที
• ความหน่วงในการระบุผู้พูด — ถูกรวมไว้ภายในเส้นทาง 0.49 วินาทีเดียวกัน เทียบกับประมาณ 2.00 วินาทีตามการออกแบบ
• Lookahead — ไม่เปิดเผย เทียบกับสี่เฟรมแฝง ประมาณ 0.5 วินาทีของเสียงล่วงหน้า
• ผลในทางปฏิบัติ — วอยซ์เอเจนต์สามารถลงมือทำกับประโยคที่กำลังพูดอยู่ได้ เทียบกับระบบที่ได้รับย่อหน้าที่ติดป้ายกำกับผู้พูดทุก ๆ สามวินาที
ทั้งสองแบบนี้ไม่ได้ผิดอะไร ชังก์ความยาว 2.9 วินาทีเป็นดีไซน์ที่สมเหตุสมผลอย่างยิ่งสำหรับการถอดเสียงการประชุม ซึ่งผลลัพธ์คือเอกสาร และคุณค่าอยู่ที่เอกสารนั้นมาถึงระหว่างการประชุม ไม่ใช่หลังการประชุม แต่เป็นดีไซน์ที่ผิดสำหรับเอเจนต์สนทนา ซึ่งความเงียบสามวินาทีไม่ใช่การหยุดชั่วคราว หากคือความล้มเหลว ช่องว่างระหว่างจังหวะทั้งสองอยู่ที่ประมาณหกเท่า และมันสอดคล้องเกือบพอดีกับความแตกต่างระหว่างการถอดเสียงบทสนทนากับการมีส่วนร่วมในบทสนทนานั้น

การระบุผู้พูดเป็นเอาต์พุต ไม่ใช่ขั้นตอนในไปป์ไลน์
นี่คือจุดที่โมเดลของ Microsoft เหนือกว่าอย่างแท้จริง และการออกแบบนี้คุ้มค่าที่จะทำความเข้าใจ เพราะมันเป็นเหตุผลที่การแบ่งเป็นชิ้นนั้นหยาบ
VibeVoice ใช้โทเคไนเซอร์ที่ผ่านการฝึกมาแล้วสองตัว — ตัวเข้ารหัสเสียงและตัวเข้ารหัสความหมาย — ทำงานที่ 24 kHz ด้วยการดาวน์แซมปลิง 3,200× เพื่อสร้างเฟรมแฝง 7.5 เฟรมต่อวินาที หนึ่งเฟรมทุก 133 มิลลิวินาที เฟรมเหล่านั้นถูกฉายเข้าสู่แกนหลักของโมเดลภาษา Qwen2.5 และเสียงพูดที่เข้ามากับข้อความที่สร้างขึ้นจะถูกสลับแทรกเป็นลำดับเดียว โดยที่เสียงพูดและข้อความที่สังเกตก่อนหน้านี้ยังคงอยู่ในบริบทของโมเดล ผลที่ตามมาคือตัวตนของผู้พูดไม่เคยเป็นปัญหาที่แยกต่างหาก: โมเดลไม่ได้ถอดความแล้วจึงตัดสินใจว่าใครพูด แต่กำลังสร้างข้อความโดยมีเงื่อนไขจากประวัติเสียงที่ยังคงมีเสียงของผู้พูดอยู่ นั่นคือเหตุผลว่าทำไมจึงไม่มีขั้นตอนการแยกผู้พูดให้ต้องจัดแนว และทำไมข้อกล่าวอ้างของ Microsoft เกี่ยวกับการระบุผู้พูดใน 12 จาก 13 การตั้งค่าจึงมีความน่าเชื่อถือในเชิงสถาปัตยกรรมมากกว่าที่จะเป็นผลลัพธ์แบบเสริม
ต้นทุนของการออกแบบนั้นคือการเก็บรักษาประวัติที่เพิ่มขึ้นแบบเชิงเส้นตามความยาวของการบันทึก ซึ่งเป็นเหตุผลว่าทำไมเช็คพอยต์ที่เผยแพร่จึงมุ่งเป้าไปที่การบันทึกที่มีความยาวไม่เกินแปดนาที นั่นเป็นเพดานที่แท้จริงและถูกระบุไว้อย่างชัดเจน มันตัดโมเดลออกสำหรับงานรูปแบบยาว — การประชุมรายงานผลประกอบการสองชั่วโมง เสียงจากศูนย์ติดต่อลูกค้าเต็มวัน — เว้นแต่คุณจะสร้างการแบ่งส่วนและการเริ่มต้นใหม่ด้วยตนเอง ซึ่งนำความซับซ้อนที่สถาปัตยกรรมถูกออกแบบมาเพื่อกำจัดกลับเข้ามาอีกครั้ง
Grok Voice Transcribe 2.0 แก้ปัญหาเดียวกันด้วยวิธีที่ต่างออกไป และมีชุดข้อจำกัดที่แตกต่างกัน โดยรวมการแยกผู้พูด (diarization) ไว้โดยไม่มีค่าใช้จ่ายเพิ่มเติม และรองรับช่องเสียงอิสระสูงสุดแปดช่องในคำขอเดียว สำหรับระบบโทรศัพท์ในศูนย์ติดต่อ ซึ่งผู้เข้าร่วมแต่ละคนมักมาบนช่องของตนเอง การแยกช่องสัญญาณมีความน่าเชื่อถือมากกว่าการแยกผู้พูด และไม่มีอัตราความผิดพลาดผูกอยู่ สำหรับเสียงผสม ขึ้นอยู่กับคุณภาพของการแยกผู้พูด และต่างจาก Meta's Muse Voice Transcribe — ซึ่งเผยแพร่อัตราความผิดพลาดเฉลี่ยของการแยกผู้พูดที่ 17.5% — SpaceXAI ยังไม่ได้เผยแพร่ตัวเลขการแยกผู้พูดเลย ดังนั้นทั้งสองโมเดลจึงทิ้งช่องว่างในหลักฐานด้านการแยกผู้พูด: โมเดลหนึ่งเผยแพร่การจัดอันดับโดยไม่มีค่าตัวเลข อีกโมเดลหนึ่งเผยแพร่รายการคุณสมบัติโดยไม่มีการวัด
สิบแปดกิกะไบต์ สิบภาษา MIT
ข้อเท็จจริงด้านการปรับใช้แตกต่างกันอย่างสิ้นเชิงจนแทบไม่ใช่การเปรียบเทียบ VibeVoice ASR Streaming 7B มีน้ำหนัก bf16 ประมาณ 18 GB — การ์ดบน Hugging Face ระบุว่ามีพารามิเตอร์ทั้งหมด 9B สำหรับเช็กพอยต์ที่ชื่อ 7B โดยมีรุ่นพี่น้อง 1.5B ที่ประมาณ 5.6 GB — สัญญาอนุญาต MIT พร้อมเดโม Python และปลั๊กอิน vLLM สำหรับการให้บริการ สิบภาษา: จีน อังกฤษ ฝรั่งเศส เยอรมัน อิตาลี ญี่ปุ่น เกาหลี โปรตุเกส รัสเซีย และสเปน Microsoft วางตำแหน่งไว้สำหรับการวิจัยและพัฒนา
Grok Voice Transcribe 2.0 เป็นเอนด์พอยต์แบบ managed ที่ไม่มีเวตให้ดาวน์โหลด รองรับรูปแบบอินพุต 12 รูปแบบ ตั้งแต่เสียงโทรศัพท์ 8 kHz ไปจนถึง 48 kHz สูงสุดแปดช่องสัญญาณ คำสำคัญ 100 คำต่อคำขอ ตรวจจับภาษาอัตโนมัติพร้อมสลับภาษาได้ระหว่างการบันทึก inverse text normalization ใน 25 ภาษา ไฟล์สูงสุด 500 MB และขีดจำกัดของบริการที่ 10 คำขอต่อวินาที และ 100 เซสชันสตรีมมิ่งที่ทำงานพร้อมกันต่อทีม ทำงานใน us-east-1 และเฉพาะ us-east-1 เท่านั้น
• น้ำหนัก — MIT, 18 GB, เป็นของคุณที่จะรันที่ไหนก็ได้ เทียบกับไม่มี, โฮสต์โดยผู้ขายเท่านั้น
• ภาษา — 10 ภาษาที่ระบุชื่อ เทียบกับการตรวจจับอัตโนมัติพร้อมการรองรับการจัดรูปแบบครอบคลุม 25 ภาษา
• การให้น้ำหนักคำสำคัญ — รองรับผ่าน hotwords เทียบกับคำสำคัญสูงสุด 100 คำต่อคำขอ
• ความยาวในการบันทึก — ประมาณแปดนาทีต่อจุดตรวจสอบ ก่อนที่การเก็บรักษาประวัติจะเป็นข้อจำกัด เทียบกับไม่มีเพดานที่ประกาศไว้ ไฟล์สูงสุด 500 MB
• การควบคุมรีเจียน — ไม่ว่าคุณจะดีพลอยบนระบบใด เทียบกับ us-east-1
• ต้นทุน — ไม่มีค่าธรรมเนียมใบอนุญาต บวกกับหน่วยความจำ GPU 18 GB และสแตกสำหรับให้บริการ เทียบกับ 0.10 ดอลลาร์ต่อชั่วโมงแบบแบตช์ และ 0.20 ดอลลาร์ต่อชั่วโมงแบบสตรีมมิ่ง
โมเดลขนาด 18 GB ไม่ใช่สิ่งที่คุณจะรันบนแล็ปท็อป และปลั๊กอิน vLLM หมายความว่าต้องใช้ GPU ที่มีหน่วยความจำจริง เมื่อเทียบกับข้อจำกัดนั้น ไลเซนส์ MIT สำหรับโมเดลขนาดนั้นถือเป็นเรื่องผิดปกติและมีค่า โดยเป็นหนึ่งในสองทางเลือกเดียวที่คุณสามารถรันภายในเครือข่ายของคุณเองได้โดยไม่ต้องมีความสัมพันธ์ใด ๆ กับผู้ขาย ซึ่งสำหรับงานเสียงที่มีการกำกับดูแล นี่ไม่ใช่แค่ความชอบแต่เป็นข้อกำหนด ส่วนทางเลือกแบบ managed นั้นราคาถูกเมื่อคิดเป็นรายชั่วโมง และเป็นไปไม่ได้ที่จะติดตั้งภายในองค์กร

จุดที่การตัดสินใจด้านการกำหนดเส้นทางควรอยู่
ค่าใช้จ่ายคือจุดที่โมเดลทั้งสองเปรียบเทียบกันได้จริงในเชิงตัวเลขในที่สุด เส้นทางแบบแบตช์ของ Grok Voice Transcribe 2.0 ราคา $0.10 ต่อชั่วโมงเสียง ประมาณ $1.67 ต่อ 1,000 นาที และเส้นทางสตรีมมิงของมันราคา $0.20 หรือประมาณ $3.33 ส่วน VibeVoice ASR Streaming 7B ไม่มีค่าลิขสิทธิ์เลย สิ่งที่มันมีแทนคือหน่วยความจำ GPU ที่ต้องใช้ประจำราว 18 GB และสแต็กให้บริการ vLLM ที่คุณต้องดูแลรันเอง โมเดลระดับ 7B ที่ขนาดเท่านี้จะไม่ถูกเมื่อคิดต่อชั่วโมงเสียงบนฮาร์ดแวร์เช่า และเส้นโค้งอัตราการใช้งานก็ไม่ปรานี — GPU ที่เปิดอุ่นไว้รอทราฟฟิกพีคมีค่าใช้จ่ายเท่ากันไม่ว่าจะกำลังถอดเสียงหรือว่างอยู่
นั่นคือรูปแบบปกติของข้อโต้แย้งเรื่องการสร้างเองกับการซื้อ และคำตอบก็ออกมาต่างกันไป ขึ้นอยู่กับปริมาณ และขึ้นอยู่กับว่าเสียงนั้นได้รับอนุญาตให้ออกจากเครือข่ายของคุณหรือไม่ สิ่งที่เปลี่ยนไปในเดือนที่ผ่านมาคือคำตอบเคลื่อนที่เร็วแค่ไหน ผู้นำด้านความแม่นยำของการสตรีมเปลี่ยนมือสองครั้งในสามสัปดาห์ และโมเดลที่เปิดตัวช่วงต้นเดือนกันยายนก็ถูกแทนที่ภายในกลางเดือนกันยายน สถาปัตยกรรมใดก็ตามที่ทำให้การเลือกโมเดลมีต้นทุนสูงในการย้อนกลับ ตอนนี้ถือเป็นสถาปัตยกรรมที่ผิดสำหรับหมวดหมู่นี้
OrcaRouter คือจุดที่การพลิกกลับนั้นมีต้นทุนต่ำ คีย์เดียวที่เข้ากันได้กับ OpenAI ครอบคลุมโมเดล 200+ รายการพร้อมการสลับสำรองอัตโนมัติข้ามผู้ให้บริการ ดังนั้นการที่เอนด์พอยต์แบบจัดการในภูมิภาคเดียวล่มจึงเป็นเหตุการณ์ด้านการจัดเส้นทางมากกว่าการหยุดให้บริการ และราคาตามรายการของผู้ให้บริการส่งผ่านด้วยมาร์กอัป 0% — หมายความว่าการเปลี่ยนแปลงราคาของผู้ขายหรือเช็กพอยต์ใหม่จะพร้อมใช้งานในฝั่งเราภายในวันเดียวกัน สำหรับทีมที่ต้องการทดสอบ VibeVoice กับ Grok Voice Transcribe 2.0 บนเสียงของตัวเอง หรือเพื่อเก็บทางเลือกสำรองที่โฮสต์เองไว้เบื้องหลังอินเทอร์เฟซเดียวกันกับระบบหลักแบบจัดการ จุดเรียกใช้งานก็ไม่ใช่สิ่งที่ต้องเปลี่ยนแปลงอีกต่อไป

คำตัดสินอย่างตรงไปตรงมา: VibeVoice ASR Streaming 7B เป็นโมเดลที่น่าสนใจกว่า และ Grok Voice Transcribe 2.0 เป็นผลิตภัณฑ์ที่ใช้งานได้จริงมากกว่า และช่องว่างระหว่างสองประโยคนั้นอธิบายได้ทั้งหมดด้วยการที่ผู้ขายรายหนึ่งเผยแพร่แผนภูมิ ส่วนอีกรายเผยแพร่ตัวเลข หากความต้องการของคุณคือการถอดเสียงการประชุมที่มีการระบุผู้พูดแบบติดตั้งภายในองค์กร สำหรับการประชุมที่สั้นกว่าแปดนาที เช็กพอยต์ของ Microsoft ก็เป็นตัวเดียวในสองตัวที่เข้าเกณฑ์ หากความต้องการของคุณคือวอยซ์เอเจนต์ที่ตอบภายในจังหวะหยุดพูดของบทสนทนา จังหวะการประมวลผลเป็นชังก์ 2.9 วินาทีก็ตัดมันออกไปก่อนที่จะได้พูดถึงความแม่นยำด้วยซ้ำ และหากคุณกำลังรอการเปรียบเทียบที่จะยุติเรื่องนี้ — เสียงเดียวกันผ่านทั้งสองโมเดล ให้คะแนนโดยคนที่ไม่ได้ทำงานให้บริษัทใดบริษัทหนึ่งในสองแห่ง — การวัดนั้นยังไม่มีอยู่ ซึ่งคุ้มค่าที่จะจดจำไว้ในครั้งหน้าที่ตารางหนึ่งวางตัวเลขไว้ข้างชื่อ VibeVoice
