การ์ดฮีโร่ของบทความที่อ่านว่า 'Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B' พร้อมป้าย 'การเปรียบเทียบโมเดล' และคำโปรย 'ตัวเลขที่ Microsoft ไม่ได้เผยแพร่' โดยมีชิปที่อ่านว่า WER แบบสตรีมมิ่ง 2.7%, ผลบางส่วนแรก 0.49 วินาที, ชังก์ 2.9 วินาที พร้อมการระบุผู้พูด และเวท MIT ที่ 18 GB บนพื้นหลังไล่เฉดสีขาวไปน้ำเงิน พร้อมโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

Grok Voice Transcribe 2.0 กับ VibeVoice ASR Streaming 7B: ตัวเลขที่ Microsoft ไม่ได้เปิดเผย

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

VibeVoice ASR Streaming 7B เป็นระบบรู้จำเสียงพูดแบบสตรีมมิ่งแบบรวมของ Microsoft ซึ่งอัปโหลดไปยัง Hugging Face เมื่อวันที่ 2 กันยายน 2026 และประกาศในคลังเก็บ microsoft/VibeVoice หนึ่งวันต่อมาภายใต้สัญญาอนุญาต MIT และมันทำสิ่งที่ไม่เหมือนกับ Grok Voice Transcribe 2.0 หรือคู่แข่งส่วนใหญ่ของมัน: มันส่งข้อความที่ระบุผู้พูดได้ทันทีเมื่อมีเสียงเข้ามา โดยไม่มีขั้นตอนการแยกผู้พูดแยกต่างหาก รายงานทางเทคนิคของ Microsoft กล่าวว่าเช็คพอยต์ 7B ทำได้ค่า WER และ CER เฉลี่ยต่ำสุดในห้าชุดการประเมิน และมีการระบุผู้พูดที่ดีที่สุดหรือดีที่สุดเท่ากันใน 12 จาก 13 การตั้งค่าการประเมิน สิ่งที่โมเดลการ์ดไม่ได้ทำคือการเผยแพร่ตัวเลขแม้แต่ตัวเดียวในรูปแบบข้อความ — ไม่มี WER, ไม่มี RTF, ไม่มีตัวเลขความหน่วง; ผลลัพธ์มีอยู่ในรูปแบบรูปภาพในรายงานเท่านั้น Grok Voice Transcribe 2.0 ซึ่งเปิดตัว 16 วันต่อมาเมื่อวันที่ 18 กันยายน 2026 ในราคา $0.10 ต่อชั่วโมงเสียงสำหรับแบบแบตช์ และ $0.20 ต่อชั่วโมงสำหรับแบบสตรีมมิ่ง เผยแพร่ทุกอย่าง: WER ของทรานสคริปต์สุดท้าย 2.7% และ WER ของ partial แรก 3.4% บนบอร์ดสตรีมมิ่งของ Artificial Analysis โดยใช้เวลา 0.49 วินาทีต่ออัน ดังนั้นจุดเริ่มต้นที่ตรงไปตรงมาสำหรับการเปรียบเทียบนี้คือ หนึ่งในสองโมเดลมีการบันทึกเอกสารที่ดีกว่าอย่างเห็นได้ชัด และความไม่สมมาตรนั้นเองคือข้อเท็จจริงที่เกี่ยวข้องกับการตัดสินใจมากที่สุดในการเปรียบเทียบนี้

สิ่งที่ Microsoft เผยแพร่ และสิ่งที่ผู้อ่านสามารถทำได้กับมัน

รายงาน VibeVoice เป็นงานวิจัยจริง และข้ออ้างในรายงานมีความเฉพาะเจาะจงในเชิงรูปแบบ แม้ไม่ใช่ในเชิงค่า รายงานนี้ประเมินชุดทดสอบมาตรฐานด้านการประชุม 4 ชุด ได้แก่ AliMeeting, AISHELL-4, AMI-SDM และ AMI-IHM พร้อมกับ MLC-Challenge ครอบคลุม 9 ภาษา และรายงานผลลัพธ์หลัก 2 ประการ: โมเดล 7B มี WER/CER เฉลี่ยต่ำที่สุดในทั้ง 5 ชุด และมีการระบุผู้พูดที่ดีที่สุดหรือดีที่สุดร่วมใน 12 จาก 13 การตั้งค่าการประเมิน ทั้งสองเป็นข้ออ้างเชิงสัมพัทธ์ ซึ่งเป็นข้ออ้างประเภทที่มีความหมาย: "ต่ำที่สุดในทั้ง 5 ชุดนี้" เป็นข้อความเกี่ยวกับการจัดลำดับ และการจัดลำดับคือสิ่งที่ผู้ซื้อต้องการ

สิ่งที่หายไปคือตัวเลขสัมบูรณ์ทุกตัว ไม่มีเปอร์เซ็นต์ WER ให้เทียบกับสิ่งใด ไม่มีตัวเลข throughput ไม่มีการวัดค่า latency และไม่มีการแยกผลรายชุดในข้อความ ตารางเปรียบเทียบที่วาง VibeVoice ไว้ข้าง Grok Voice Transcribe 2.0 แล้วกำหนดตัวเลขให้โมเดลของ Microsoft กำลังประดิษฐ์ตัวเลขนั้นขึ้นมา สิ่งที่กล่าวได้คือ VibeVoice ชนะการประเมินห้าชุดของตัวเอง และไม่มีใครนอก Microsoft รันซ้ำเลย — ไม่มี benchmark อิสระ ไม่มีการประเมินจากบุคคลที่สาม และ ณ เวลาที่เขียน ไม่มีผู้ให้บริการ inference แบบโฮสต์รายใดที่ลงรายการโมเดลนี้เลย ดังนั้นการเปรียบเทียบจึงอยู่ระหว่างตัวเลขที่มีการบันทึกไว้ กับอันดับที่ไม่มีการบันทึกไว้ และอันดับที่ไม่มีการบันทึกไว้นั้นไม่ได้เป็นฝ่ายที่อ่อนแอกว่าในสองฝ่าย เพียงเพราะมันไม่มีจุดทศนิยม

เอกสารของ Grok Voice Transcribe 2.0 มีปัญหาตรงกันข้าม ตัวเลข 2.7% และ 3.4% ของมันมาจากบอร์ด AA-WER Streaming ของ Artificial Analysis ซึ่งเป็นค่าผสมถ่วงน้ำหนักระหว่าง AA-AgentTalk ที่ 50% กับ VoxPopuli และ Earnings22 อย่างละ 25% — เป็นเสียงสนทนาภาษาอังกฤษในรูปแบบตัวแทน (agent) ประมาณแปดชั่วโมง ที่รันอย่างอิสระ ซึ่งมีที่มาเชื่อถือได้จริงกว่าเกณฑ์ประเมินของผู้ขายเองอย่างแท้จริง แต่มันเป็นเพียงเสี้ยวแคบ ๆ ของภาษาอังกฤษชิ้นหนึ่ง และหน้าบอร์ดเองก็พล็อตไว้เพียง 27 จาก 33 โมเดลที่ SpaceXAI นับรวม เมื่ออ้างว่าครองอันดับหนึ่งจาก 32 โมเดล ตัวเลขที่แม่นยำบนการทดสอบแคบ ๆ กับข้ออ้างที่ไม่แม่นยำบนการทดสอบที่กว้างกว่า ไม่สามารถนำมาเปรียบเทียบกันตรง ๆ ได้ และบทความนี้จะไม่เสแสร้งว่าเป็นเช่นนั้น

สองวินาทีครึ่งเทียบกับครึ่งวินาที

การเปรียบเทียบความหน่วงคือจุดเดียวที่โมเดลทั้งสองสามารถนำมาเทียบเคียงกันได้โดยไม่มีข้อแม้ใด ๆ เกี่ยวกับชุดข้อมูล เพราะทั้งคู่เปิดเผยการตั้งค่าการสตรีมของตน และความแตกต่างนั้นเป็นเชิงสถาปัตยกรรมมากกว่าจะเป็นการเลือกปรับจูน

VibeVoice ASR Streaming 7B ทำงานทีละชังก์ เช็กพอยต์ที่เผยแพร่ใช้ 22 เฟรมแฝงต่อชังก์ ซึ่งที่ 7.5 เฟรมแฝงต่อวินาทีของโมเดล คิดเป็นเสียงประมาณ 2.9 วินาทีต่อชังก์ โดยมีการมองล่วงหน้าสี่เฟรมแฝง — ประมาณ 0.5 วินาทีของเสียงในอนาคต — และความหน่วงที่คาดหวังในการระบุผู้พูดประมาณ 2.00 วินาที มันส่งออกข้อความหนึ่งครั้งต่อชังก์ นั่นคือระบบสตรีมมิ่งจริง แต่จังหวะนั้นวัดเป็นวินาที ไม่ใช่มิลลิวินาที

Grok Voice Transcribe 2.0 ส่งคืนบทถอดความบางส่วนครั้งแรกภายใน 0.49 วินาทีหลังจากผู้พูดหยุด และสร้างบทถอดความฉบับสมบูรณ์ภายใน 0.49 วินาทีหลังสิ้นสุดการพูด มันแลกความเร็วนั้นมาด้วยความแม่นยำ — อัตราความผิดพลาดของบทถอดความบางส่วนครั้งแรกลดลงจาก 18.3% ในเวอร์ชัน 1.0 เหลือ 3.4% ในเวอร์ชัน 2.0 โดยแลกกับการเพิ่มจาก 0.25 วินาทีเป็น 0.49 วินาทีในตัวชี้วัดเดียวกัน

วางไว้ข้างๆ กัน:

• จังหวะการสตรีม — Grok Voice Transcribe 2.0 ส่งผลลัพธ์บางส่วนอย่างต่อเนื่อง โดยมีความหน่วงของผลลัพธ์บางส่วนแรกที่ 0.49 วินาที เทียบกับ VibeVoice ASR Streaming 7B ที่ส่งข้อความหนึ่งชิ้นประมาณทุก ๆ 2.9 วินาที

• ความหน่วงในการระบุผู้พูด — ถูกรวมไว้ภายในเส้นทาง 0.49 วินาทีเดียวกัน เทียบกับประมาณ 2.00 วินาทีตามการออกแบบ

• Lookahead — ไม่เปิดเผย เทียบกับสี่เฟรมแฝง ประมาณ 0.5 วินาทีของเสียงล่วงหน้า

• ผลในทางปฏิบัติ — วอยซ์เอเจนต์สามารถลงมือทำกับประโยคที่กำลังพูดอยู่ได้ เทียบกับระบบที่ได้รับย่อหน้าที่ติดป้ายกำกับผู้พูดทุก ๆ สามวินาที

ทั้งสองแบบนี้ไม่ได้ผิดอะไร ชังก์ความยาว 2.9 วินาทีเป็นดีไซน์ที่สมเหตุสมผลอย่างยิ่งสำหรับการถอดเสียงการประชุม ซึ่งผลลัพธ์คือเอกสาร และคุณค่าอยู่ที่เอกสารนั้นมาถึงระหว่างการประชุม ไม่ใช่หลังการประชุม แต่เป็นดีไซน์ที่ผิดสำหรับเอเจนต์สนทนา ซึ่งความเงียบสามวินาทีไม่ใช่การหยุดชั่วคราว หากคือความล้มเหลว ช่องว่างระหว่างจังหวะทั้งสองอยู่ที่ประมาณหกเท่า และมันสอดคล้องเกือบพอดีกับความแตกต่างระหว่างการถอดเสียงบทสนทนากับการมีส่วนร่วมในบทสนทนานั้น

Screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B, showing the MIT licence tag, the 10 languages and Streaming tags, the model card opening line 'a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the 9B parameter and BF16 tensor type fields, a notice that no inference provider deploys it, and the architecture diagram showing 2.9 second chunks with 0.5 second lookahead.

การระบุผู้พูดเป็นเอาต์พุต ไม่ใช่ขั้นตอนในไปป์ไลน์

นี่คือจุดที่โมเดลของ Microsoft เหนือกว่าอย่างแท้จริง และการออกแบบนี้คุ้มค่าที่จะทำความเข้าใจ เพราะมันเป็นเหตุผลที่การแบ่งเป็นชิ้นนั้นหยาบ

VibeVoice ใช้โทเคไนเซอร์ที่ผ่านการฝึกมาแล้วสองตัว — ตัวเข้ารหัสเสียงและตัวเข้ารหัสความหมาย — ทำงานที่ 24 kHz ด้วยการดาวน์แซมปลิง 3,200× เพื่อสร้างเฟรมแฝง 7.5 เฟรมต่อวินาที หนึ่งเฟรมทุก 133 มิลลิวินาที เฟรมเหล่านั้นถูกฉายเข้าสู่แกนหลักของโมเดลภาษา Qwen2.5 และเสียงพูดที่เข้ามากับข้อความที่สร้างขึ้นจะถูกสลับแทรกเป็นลำดับเดียว โดยที่เสียงพูดและข้อความที่สังเกตก่อนหน้านี้ยังคงอยู่ในบริบทของโมเดล ผลที่ตามมาคือตัวตนของผู้พูดไม่เคยเป็นปัญหาที่แยกต่างหาก: โมเดลไม่ได้ถอดความแล้วจึงตัดสินใจว่าใครพูด แต่กำลังสร้างข้อความโดยมีเงื่อนไขจากประวัติเสียงที่ยังคงมีเสียงของผู้พูดอยู่ นั่นคือเหตุผลว่าทำไมจึงไม่มีขั้นตอนการแยกผู้พูดให้ต้องจัดแนว และทำไมข้อกล่าวอ้างของ Microsoft เกี่ยวกับการระบุผู้พูดใน 12 จาก 13 การตั้งค่าจึงมีความน่าเชื่อถือในเชิงสถาปัตยกรรมมากกว่าที่จะเป็นผลลัพธ์แบบเสริม

ต้นทุนของการออกแบบนั้นคือการเก็บรักษาประวัติที่เพิ่มขึ้นแบบเชิงเส้นตามความยาวของการบันทึก ซึ่งเป็นเหตุผลว่าทำไมเช็คพอยต์ที่เผยแพร่จึงมุ่งเป้าไปที่การบันทึกที่มีความยาวไม่เกินแปดนาที นั่นเป็นเพดานที่แท้จริงและถูกระบุไว้อย่างชัดเจน มันตัดโมเดลออกสำหรับงานรูปแบบยาว — การประชุมรายงานผลประกอบการสองชั่วโมง เสียงจากศูนย์ติดต่อลูกค้าเต็มวัน — เว้นแต่คุณจะสร้างการแบ่งส่วนและการเริ่มต้นใหม่ด้วยตนเอง ซึ่งนำความซับซ้อนที่สถาปัตยกรรมถูกออกแบบมาเพื่อกำจัดกลับเข้ามาอีกครั้ง

Grok Voice Transcribe 2.0 แก้ปัญหาเดียวกันด้วยวิธีที่ต่างออกไป และมีชุดข้อจำกัดที่แตกต่างกัน โดยรวมการแยกผู้พูด (diarization) ไว้โดยไม่มีค่าใช้จ่ายเพิ่มเติม และรองรับช่องเสียงอิสระสูงสุดแปดช่องในคำขอเดียว สำหรับระบบโทรศัพท์ในศูนย์ติดต่อ ซึ่งผู้เข้าร่วมแต่ละคนมักมาบนช่องของตนเอง การแยกช่องสัญญาณมีความน่าเชื่อถือมากกว่าการแยกผู้พูด และไม่มีอัตราความผิดพลาดผูกอยู่ สำหรับเสียงผสม ขึ้นอยู่กับคุณภาพของการแยกผู้พูด และต่างจาก Meta's Muse Voice Transcribe — ซึ่งเผยแพร่อัตราความผิดพลาดเฉลี่ยของการแยกผู้พูดที่ 17.5% — SpaceXAI ยังไม่ได้เผยแพร่ตัวเลขการแยกผู้พูดเลย ดังนั้นทั้งสองโมเดลจึงทิ้งช่องว่างในหลักฐานด้านการแยกผู้พูด: โมเดลหนึ่งเผยแพร่การจัดอันดับโดยไม่มีค่าตัวเลข อีกโมเดลหนึ่งเผยแพร่รายการคุณสมบัติโดยไม่มีการวัด

สิบแปดกิกะไบต์ สิบภาษา MIT

ข้อเท็จจริงด้านการปรับใช้แตกต่างกันอย่างสิ้นเชิงจนแทบไม่ใช่การเปรียบเทียบ VibeVoice ASR Streaming 7B มีน้ำหนัก bf16 ประมาณ 18 GB — การ์ดบน Hugging Face ระบุว่ามีพารามิเตอร์ทั้งหมด 9B สำหรับเช็กพอยต์ที่ชื่อ 7B โดยมีรุ่นพี่น้อง 1.5B ที่ประมาณ 5.6 GB — สัญญาอนุญาต MIT พร้อมเดโม Python และปลั๊กอิน vLLM สำหรับการให้บริการ สิบภาษา: จีน อังกฤษ ฝรั่งเศส เยอรมัน อิตาลี ญี่ปุ่น เกาหลี โปรตุเกส รัสเซีย และสเปน Microsoft วางตำแหน่งไว้สำหรับการวิจัยและพัฒนา

Grok Voice Transcribe 2.0 เป็นเอนด์พอยต์แบบ managed ที่ไม่มีเวตให้ดาวน์โหลด รองรับรูปแบบอินพุต 12 รูปแบบ ตั้งแต่เสียงโทรศัพท์ 8 kHz ไปจนถึง 48 kHz สูงสุดแปดช่องสัญญาณ คำสำคัญ 100 คำต่อคำขอ ตรวจจับภาษาอัตโนมัติพร้อมสลับภาษาได้ระหว่างการบันทึก inverse text normalization ใน 25 ภาษา ไฟล์สูงสุด 500 MB และขีดจำกัดของบริการที่ 10 คำขอต่อวินาที และ 100 เซสชันสตรีมมิ่งที่ทำงานพร้อมกันต่อทีม ทำงานใน us-east-1 และเฉพาะ us-east-1 เท่านั้น

• น้ำหนัก — MIT, 18 GB, เป็นของคุณที่จะรันที่ไหนก็ได้ เทียบกับไม่มี, โฮสต์โดยผู้ขายเท่านั้น

• ภาษา — 10 ภาษาที่ระบุชื่อ เทียบกับการตรวจจับอัตโนมัติพร้อมการรองรับการจัดรูปแบบครอบคลุม 25 ภาษา

• การให้น้ำหนักคำสำคัญ — รองรับผ่าน hotwords เทียบกับคำสำคัญสูงสุด 100 คำต่อคำขอ

• ความยาวในการบันทึก — ประมาณแปดนาทีต่อจุดตรวจสอบ ก่อนที่การเก็บรักษาประวัติจะเป็นข้อจำกัด เทียบกับไม่มีเพดานที่ประกาศไว้ ไฟล์สูงสุด 500 MB

• การควบคุมรีเจียน — ไม่ว่าคุณจะดีพลอยบนระบบใด เทียบกับ us-east-1

• ต้นทุน — ไม่มีค่าธรรมเนียมใบอนุญาต บวกกับหน่วยความจำ GPU 18 GB และสแตกสำหรับให้บริการ เทียบกับ 0.10 ดอลลาร์ต่อชั่วโมงแบบแบตช์ และ 0.20 ดอลลาร์ต่อชั่วโมงแบบสตรีมมิ่ง

โมเดลขนาด 18 GB ไม่ใช่สิ่งที่คุณจะรันบนแล็ปท็อป และปลั๊กอิน vLLM หมายความว่าต้องใช้ GPU ที่มีหน่วยความจำจริง เมื่อเทียบกับข้อจำกัดนั้น ไลเซนส์ MIT สำหรับโมเดลขนาดนั้นถือเป็นเรื่องผิดปกติและมีค่า โดยเป็นหนึ่งในสองทางเลือกเดียวที่คุณสามารถรันภายในเครือข่ายของคุณเองได้โดยไม่ต้องมีความสัมพันธ์ใด ๆ กับผู้ขาย ซึ่งสำหรับงานเสียงที่มีการกำกับดูแล นี่ไม่ใช่แค่ความชอบแต่เป็นข้อกำหนด ส่วนทางเลือกแบบ managed นั้นราคาถูกเมื่อคิดเป็นรายชั่วโมง และเป็นไปไม่ได้ที่จะติดตั้งภายในองค์กร

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7% streaming, first partial 0.49s, cadence continuous partials, diarization included with no figure published, $0.10 per batch hour, managed in us-east-1. The right column gives VibeVoice ASR Streaming 7B the rows: WER lowest of five sets but unpublished, speaker attribution about 2.00s, cadence 2.9 second chunks, diarization built into streaming, MIT weights at about 18 GB, recordings up to 8 minutes. A footer reads 'VibeVoice figures Microsoft-reported with no absolute values published; Grok figures per Artificial Analysis.'

จุดที่การตัดสินใจด้านการกำหนดเส้นทางควรอยู่

ค่าใช้จ่ายคือจุดที่โมเดลทั้งสองเปรียบเทียบกันได้จริงในเชิงตัวเลขในที่สุด เส้นทางแบบแบตช์ของ Grok Voice Transcribe 2.0 ราคา $0.10 ต่อชั่วโมงเสียง ประมาณ $1.67 ต่อ 1,000 นาที และเส้นทางสตรีมมิงของมันราคา $0.20 หรือประมาณ $3.33 ส่วน VibeVoice ASR Streaming 7B ไม่มีค่าลิขสิทธิ์เลย สิ่งที่มันมีแทนคือหน่วยความจำ GPU ที่ต้องใช้ประจำราว 18 GB และสแต็กให้บริการ vLLM ที่คุณต้องดูแลรันเอง โมเดลระดับ 7B ที่ขนาดเท่านี้จะไม่ถูกเมื่อคิดต่อชั่วโมงเสียงบนฮาร์ดแวร์เช่า และเส้นโค้งอัตราการใช้งานก็ไม่ปรานี — GPU ที่เปิดอุ่นไว้รอทราฟฟิกพีคมีค่าใช้จ่ายเท่ากันไม่ว่าจะกำลังถอดเสียงหรือว่างอยู่

นั่นคือรูปแบบปกติของข้อโต้แย้งเรื่องการสร้างเองกับการซื้อ และคำตอบก็ออกมาต่างกันไป ขึ้นอยู่กับปริมาณ และขึ้นอยู่กับว่าเสียงนั้นได้รับอนุญาตให้ออกจากเครือข่ายของคุณหรือไม่ สิ่งที่เปลี่ยนไปในเดือนที่ผ่านมาคือคำตอบเคลื่อนที่เร็วแค่ไหน ผู้นำด้านความแม่นยำของการสตรีมเปลี่ยนมือสองครั้งในสามสัปดาห์ และโมเดลที่เปิดตัวช่วงต้นเดือนกันยายนก็ถูกแทนที่ภายในกลางเดือนกันยายน สถาปัตยกรรมใดก็ตามที่ทำให้การเลือกโมเดลมีต้นทุนสูงในการย้อนกลับ ตอนนี้ถือเป็นสถาปัตยกรรมที่ผิดสำหรับหมวดหมู่นี้

OrcaRouter คือจุดที่การพลิกกลับนั้นมีต้นทุนต่ำ คีย์เดียวที่เข้ากันได้กับ OpenAI ครอบคลุมโมเดล 200+ รายการพร้อมการสลับสำรองอัตโนมัติข้ามผู้ให้บริการ ดังนั้นการที่เอนด์พอยต์แบบจัดการในภูมิภาคเดียวล่มจึงเป็นเหตุการณ์ด้านการจัดเส้นทางมากกว่าการหยุดให้บริการ และราคาตามรายการของผู้ให้บริการส่งผ่านด้วยมาร์กอัป 0% — หมายความว่าการเปลี่ยนแปลงราคาของผู้ขายหรือเช็กพอยต์ใหม่จะพร้อมใช้งานในฝั่งเราภายในวันเดียวกัน สำหรับทีมที่ต้องการทดสอบ VibeVoice กับ Grok Voice Transcribe 2.0 บนเสียงของตัวเอง หรือเพื่อเก็บทางเลือกสำรองที่โฮสต์เองไว้เบื้องหลังอินเทอร์เฟซเดียวกันกับระบบหลักแบบจัดการ จุดเรียกใช้งานก็ไม่ใช่สิ่งที่ต้องเปลี่ยนแปลงอีกต่อไป

Screenshot of the microsoft/VibeVoice GitHub repository showing the description 'Open-Source Frontier Voice AI' and the MIT licence in the About sidebar, the file listing with demo and vibevoice directories both updated with streaming ASR inference code and a vllm_plugin directory, the repository's 53.6 thousand stars, and a GitHub Trending badge reading number 1 Repository Of The Day.

คำตัดสินอย่างตรงไปตรงมา: VibeVoice ASR Streaming 7B เป็นโมเดลที่น่าสนใจกว่า และ Grok Voice Transcribe 2.0 เป็นผลิตภัณฑ์ที่ใช้งานได้จริงมากกว่า และช่องว่างระหว่างสองประโยคนั้นอธิบายได้ทั้งหมดด้วยการที่ผู้ขายรายหนึ่งเผยแพร่แผนภูมิ ส่วนอีกรายเผยแพร่ตัวเลข หากความต้องการของคุณคือการถอดเสียงการประชุมที่มีการระบุผู้พูดแบบติดตั้งภายในองค์กร สำหรับการประชุมที่สั้นกว่าแปดนาที เช็กพอยต์ของ Microsoft ก็เป็นตัวเดียวในสองตัวที่เข้าเกณฑ์ หากความต้องการของคุณคือวอยซ์เอเจนต์ที่ตอบภายในจังหวะหยุดพูดของบทสนทนา จังหวะการประมวลผลเป็นชังก์ 2.9 วินาทีก็ตัดมันออกไปก่อนที่จะได้พูดถึงความแม่นยำด้วยซ้ำ และหากคุณกำลังรอการเปรียบเทียบที่จะยุติเรื่องนี้ — เสียงเดียวกันผ่านทั้งสองโมเดล ให้คะแนนโดยคนที่ไม่ได้ทำงานให้บริษัทใดบริษัทหนึ่งในสองแห่ง — การวัดนั้นยังไม่มีอยู่ ซึ่งคุ้มค่าที่จะจดจำไว้ในครั้งหน้าที่ตารางหนึ่งวางตัวเลขไว้ข้างชื่อ VibeVoice

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube