
VibeVoice-ASR-Streaming-7B เทียบกับ Muse Voice Transcribe: สองผู้ท้าชิงสายสตรีมมิง ห่างกันเพียงหนึ่งวัน
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
ในช่วงประมาณสามสิบหกชั่วโมงของต้นเดือนกันยายน ค.ศ. 2026 ห้องแล็บใหญ่สองแห่งเปิดตัวโมเดลแปลงคำพูดเป็นข้อความแบบสตรีมมิ่งที่ให้คำมั่นแบบเดียวกับพาดหัวข่าว — นั่นคือทรานสคริปต์สดที่บอกด้วยว่าใครพูดอะไร ในขณะที่กำลังพูดอยู่นั้น เมื่อวันที่ 1 กันยายน Meta Superintelligence Labs เปิดตัว Muse Voice Transcribe เป็นโฮสต์ API ราคา 3.00 ดอลลาร์ต่อ 1,000 นาทีเสียง คิดเป็นประมาณ 0.18 ดอลลาร์ต่อชั่วโมง โดยรวมการรู้จำแบบสตรีมมิ่ง การแยกผู้พูดมากกว่า 20 คน และการตรวจจับจุดสิ้นสุดคำพูดไว้ในกระบวนการเดียว เมื่อวันที่ 2 กันยายน Microsoft Research อัปโหลด VibeVoice-ASR-Streaming-7B ขึ้น Hugging Face: โอเพนเวตภายใต้สัญญาอนุญาต MIT ไม่มีการประกาศใดๆ การ์ดโมเดลอ้างว่ารองรับการถอดความแบบสตรีมมิ่งพร้อมระบุผู้พูด มีฮอตเวิร์ดและสิบภาษา และไม่มีบริการโฮสต์อยู่ที่ใดเลย จุดขายเดียวกัน โมเดลธุรกิจตรงข้ามกัน และหลักฐานจากทั้งสองฝ่ายก็บางเบากว่าที่ทั้งสองแล็บอยากให้คุณสังเกตเห็น
หน้านี้เขียนขึ้นโดยอิงจากสิ่งที่เรารู้เท่าที่ทราบในขณะนี้ เนื่องจากทั้งสองโมเดลไม่มีตัวเลขความแม่นยำที่ผ่านการตรวจสอบอย่างเป็นอิสระ ตัวเลขของ Muse Voice Transcribe เป็นข้อมูลที่ Meta เปิดเผยในวันเปิดตัว ซึ่งมาจากการรายงานของผู้ผลิตและยังไม่มีการทำซ้ำเพื่อยืนยันผล ส่วน VibeVoice-ASR-Streaming-7B ยังไม่ได้เผยแพร่ตัวเลขความแม่นยำแบบสตรีมมิ่งในเอกสารใดๆ เลย ดังนั้นการเปรียบเทียบด้านล่างจึงอิงตามสิ่งที่เห็นได้ในเชิงโครงสร้างและสิ่งที่ทราบได้จริง เช่น สถาปัตยกรรม ราคา สิทธิการใช้งาน และพฤติกรรมที่บันทึกไว้ และจะติดป้ายกำกับตัวเลขจากผู้ผลิตจำนวนไม่กี่จุดเมื่อปรากฏให้เห็น
ผู้ท้าชิงสองรายต่อไปป์ไลน์แบบแบตช์ ห่างกันหนึ่งวัน
โมเดลทั้งสองต่างโจมตีสมมติฐานเดียวกัน นั่นคือแนวคิดที่ว่าการแปลงคำพูดเป็นข้อความเป็นสิ่งที่ต้องรันบนไฟล์บันทึกเสียงที่เสร็จสิ้นแล้ว Muse Voice Transcribe เป็นผลิตภัณฑ์แรกที่ Meta เรียกว่า "โมเดลการรับรู้เสียงแบบเรียลไทม์" (real-time audio perception model) ซึ่งใช้กระบวนการสตรีมมิ่งผ่านเดียวที่ทำทั้งการรู้จำเสียง การแยกแยะผู้พูด (speaker diarization) จากเสียงมากกว่ายี่สิบคน และการตรวจจับจุดสิ้นสุดของคำพูดซึ่งเป็นหน้าที่ตัดสินว่าผู้พูดพูดจบจริงหรือแค่หยุดชั่วคราว โดยเปิดตัวบนสามช่องทางพร้อมกัน ได้แก่ Meta Model API ในราคา 0.18 ดอลลาร์ต่อชั่วโมงเสียง Meta AI สำหรับ Mac ที่ผู้ใช้กดแป้น Fn ค้างไว้เพื่อสั่งพิมพ์ลงในแอปพลิเคชันใดก็ได้ และ Muse Code ส่วน VibeVoice-ASR-Streaming-7B ของ Microsoft เป็นสมาชิกแบบสตรีมมิ่งของตระกูล VibeVoice แบบโอเพนซอร์ส และเส้นทางการเปิดตัวของมันเงียบกว่ามาก โดยมีเพียงคลังข้อมูลบน Hugging Face ที่สร้างเมื่อวันที่ 2 กันยายน (การประทับเวลาแสดง 15:46 UTC และถูกแก้ไขครั้งสุดท้ายอีกสามนาทีต่อมา) ชิ้นส่วน safetensors แปดชิ้นภายใต้สัญญาอนุญาต MIT และข้อความบันทึกข่าวลงวันที่ 3 กันยายนในคลัง GitHub microsoft/VibeVoice ที่ระบุว่ามันคือ "โมเดล ASR แบบสตรีมมิ่งรวมศูนย์ที่ถอดความต่อเนื่องว่าใครพูดอะไรเมื่อเสียงเข้ามา พร้อมรองรับคำสำคัญแบบกำหนดเองและ 10 ภาษา" และหนึ่งวันหลังอัปโหลด มันยังคงแสดงยอดดาวน์โหลดเป็นศูนย์

การชนกันของฟีเจอร์
• กลไกการสตรีม — Muse Voice Transcribe ใช้เสียงเป็นชิ้น ๆ ละ 80 มิลลิวินาที และยืนยันคำเมื่อคำคงที่แล้ว ในขณะที่ VibeVoice-ASR-Streaming-7B ประมวลผลชิ้นเสียงประมาณ 2.9 วินาที โดยมี lookahead ประมาณ 0.5 วินาที และส่งข้อความออกมาหนึ่งครั้งต่อชิ้นเสียงที่ประมวลผลเสร็จสมบูรณ์
• การระบุผู้พูด — ผู้พูดมากกว่า 20 คนในรอบเดียว, อัตราความผิดพลาดในการแยกเสียงผู้พูดเฉลี่ย 17.5% ตามที่ผู้ขายรายงาน เทียบกับเอาต์พุตแบบสตรีมมิ่งที่ระบุว่าใครพูดอะไร ซึ่งอ้างไว้ในการ์ดโมเดล ยังไม่ผ่านการตรวจสอบ
• Endpointing — มีในตัว: สตรีมมีขอบเขตการจบคำพูด แต่ไม่มีการระบุไว้ในเอกสารว่าเป็นสัญญาณเอาต์พุต
• ตัวควบคุมบริบท — การปรับน้ำหนักภาษา คำสำคัญ และบริบท เทียบกับคำฮอตเวิร์ดที่ปรับแต่งเองผ่านพรอมต์บริบท (--context_info)
• ภาษา — ฝึกฝนบน 70+ ภาษา, 25 ภาษาที่ผ่านการตรวจสอบอย่างละเอียดตั้งแต่เปิดตัว, การสลับภาษาแบบธรรมชาติ เทียบกับ 10 ภาษาที่ประกาศไว้ (en, zh, es, pt, de, ja, ko, fr, ru, it)
• หลักฐาน — การอ้างสิทธิ์ของผู้จำหน่ายในวันเปิดตัว: ค่า WER 3.1% สำหรับผลลัพธ์สุดท้าย (finals) ที่ 0.16 วินาทีหลังพูดจบ และ 3.6% สำหรับผลลัพธ์บางส่วนแรก (first partials) โดยอ้างอิงจากตารางผู้นำการสตรีมของ Artificial Analysis เทียบกับที่ไม่มีค่า WER หรือค่าหน่วงสำหรับการสตรีมที่เผยแพร่เป็นข้อความ
• ค่าใช้จ่ายและใบอนุญาต — $0.18 ต่อชั่วโมงเสียง แบบโฮสต์ น้ำหนักโมเดลแบบปิด เทียบกับ $0 สำหรับน้ำหนักโมเดล (MIT), ประมาณ 18 GB ในรูปแบบ bf16, โฮสต์เอง

แนวคิดสองแบบที่แตกต่างกันอย่างสิ้นเชิงเกี่ยวกับ "สตรีมมิ่ง"
คำว่า streaming ครอบคลุมช่วงจังหวะที่กว้าง และช่องว่างระหว่างสองแบบนี้กว้างพอที่จะเปลี่ยนสิ่งที่คุณสามารถสร้างบนแต่ละแบบได้ Muse Voice Transcribe สตรีมในระดับคำ สถาปัตยกรรมของ Meta รับเสียงเป็นชิ้นขนาด 80 มิลลิวินาที และใช้สิ่งที่เรียกว่า "adaptive delay" — นโยบายความล่าช้าที่เรียนรู้ผ่าน reinforcement learning ซึ่งยืนยันแต่ละคำทันทีที่โมเดลมั่นใจ โดยเก็บบริบทของคำที่มันไม่แน่ใจไว้มากกว่า แทนที่จะใช้ขีดจำกัดความหน่วงคงที่เดียว ผู้ขายอ้างว่าบทถอดความสุดท้ายจะออกมาภายใน 0.16 วินาทีหลังจากผู้พูดหยุด และบทถอดความบางส่วนแรกภายใน 0.13 วินาที จังหวะเช่นนี้ถูกสร้างขึ้นสำหรับลูปแบบโต้ตอบ: การทำคำบรรยายสด การเขียนตามคำบอก และเอเจนต์เสียงที่ต้องตอบสนองต่อคำพูดที่จบลงเกือบทันที
VibeVoice-ASR-Streaming-7B สตรีมในระดับที่หยาบกว่า คอนฟิกของตัวประมวลผลล่วงหน้าระบุว่าเสียงเข้ามาที่ 24 kHz ถูกบีบอัด 3,200 เท่าให้เป็นโทเคนในอัตราประมาณ 7.5 เฟรมต่อวินาที จากนั้นจึงประมวลผลเป็นบล็อกละ 22 เฟรม โดยมองล่วงหน้า 4 เฟรม ซึ่งคิดเป็นเสียงประมาณ 2.9 วินาทีต่อบล็อก และมองล่วงหน้าประมาณครึ่งวินาที โดยตัวเลขเหล่านี้ได้มาจากคอนฟิก ไม่ใช่ค่าแลเทนซีที่วัดจริง ข้อความจะถูกปล่อยออกมาเมื่อแต่ละบล็อกประมวลผลเสร็จ โดยบริบทจากบล็อกก่อนหน้าจะถูกเก็บรักษาไว้ผ่าน KV cache เพื่อให้เซสชันที่ยาวนานไม่ต้องคำนวณใหม่ตั้งแต่ต้น ทรานสคริปต์ที่เพิ่มขึ้นครั้งละประมาณสามวินาทีแบบนี้ใช้ได้ดีกับบันทึกการประชุมและการวิเคราะห์การโทร แต่มันเป็นผลิตภัณฑ์คนละแบบกับการสตรีมคำแบบต่ำกว่าหนึ่งวินาทีสำหรับการสนทนาสด ทั้งสองแล็บต่างก็ยังไม่ได้เผยแพร่การวัดแลเทนซีแบบ end-to-end สำหรับ checkpoint แบบสตรีมมิ่ง ดังนั้นจึงควรถือว่าจังหวะการปล่อยข้อความนี้คือสิ่งที่ออกแบบไว้ และความรู้สึกการใช้งานจริงยังไม่ผ่านการทดสอบ
ป้ายกำกับผู้พูดและการระบุจุดสิ้นสุดของเสียงพูด: ฝั่งหนึ่งมีมาในตัว ส่วนอีกฝั่งหนึ่งเป็นเพียงการกล่าวอ้าง
การระบุผู้พูดเป็นจุดที่ผลิตภัณฑ์สตรีมมิงมักกล่าวเกินจริงมากที่สุด และทั้งสองผลิตภัณฑ์นี้ก็อ้างเช่นกัน เวอร์ชันของ Muse Voice Transcribe มีความเป็นรูปธรรมและมีโครงสร้าง: การแบ่งแยกผู้พูด (diarization) ทำงานภายในสตรีมมิงพาสเดียวกันกับการรู้จำเสียง ดังนั้นการบันทึกการประชุมที่มีผู้เข้าร่วมยี่สิบคนจึงสามารถมีป้ายกำกับรายบุคคลต่อผู้พูดได้โดยไม่ต้องมีขั้นตอนแยกต่างหากแบบ "อัปโหลด รอ รับรายชื่อผู้พูดกลับมา" และ Meta รายงานอัตราความผิดพลาดของการแบ่งแยกผู้พูดโดยเฉลี่ยที่ 17.5% — เป็นตัวเลขจากผู้จำหน่าย ยังไม่มีการทำซ้ำเพื่อยืนยัน แต่เป็นตัวเลขที่ผูกกับกลไกจริง นอกจากนี้ยังส่งสัญญาณขอบเขตการสิ้นสุดการพูด ซึ่งเป็นความสามารถที่เงียบกว่า: แอปพลิเคชันจะได้รับสัญญาณที่ชัดเจนว่า "การผลัดพูดของผู้พูดคนนี้จบแล้ว" โดยไม่ต้องสร้างตัวตรวจจับการมีเสียงพูด ซึ่งเป็นเหตุผลที่เอเจนต์เสียงที่สร้างบน ASR ดิบมักตัดบทผู้พูดบ่อยครั้ง
VibeVoice-ASR-Streaming-7B อ้างบนการ์ดโมเดลว่ามีเอาต์พุตสตรีมมิงที่บอกว่าใครพูดอะไร ซึ่งสอดคล้องกับเอาต์พุตแบบมีโครงสร้าง Who/When/What ของ VibeVoice-ASR แบบแบตช์ — แต่สำหรับเช็คพอยต์สตรีมมิง การอ้างนี้ยังไม่ได้รับการยืนยัน ไม่มีการทดสอบอิสระใดที่ทำซ้ำผลได้ และไม่มีสัญญาณบอกการจบเสียง (endpointing) ที่มีการบันทึกไว้แบบที่ Muse มี หากงานของคุณคือเสียงสดแบบหลายผู้พูดจริง ๆ ตอนนี้ Muse มีกลไกที่ครบถ้วนกว่า และหากคุณกำลังประเมินว่าโมเดลแบบเปิดน้ำหนัก (open-weights) จะทำงานแบบเดียวกันบนฮาร์ดแวร์ที่คุณควบคุมได้หรือไม่ การอ้างของ VibeVoice ก็เป็นสิ่งที่ควรทดสอบกับบันทึกการประชุมของคุณเองก่อนที่จะเชื่อ
หลักฐาน: ข้อกล่าวอ้างในวันเปิดตัวเทียบกับบัตรเปล่า
การพูดให้ชัดเจนเกี่ยวกับสิ่งที่แต่ละฝ่ายมีนั้นเป็นเรื่องสำคัญ เพราะไม่มีฝ่ายใดมีสิ่งที่ผู้ซื้อต้องการจริง ๆ Muse Voice Transcribe มีชุดข้อมูลตัวเลขจากผู้ขายหนาแน่น — อัตราคำผิด 3.1% ในทรานสคริปต์ฉบับสุดท้าย 3.6% ในผลลัพธ์ชั่วคราวครั้งแรก ความหน่วงของผลลัพธ์สุดท้าย 0.16 วินาที และค่าความผิดพลาดโดยเฉลี่ยของการแยกผู้พูด 17.5% — ทั้งหมดนี้ Meta เป็นผู้เผยแพร่ในวันเปิดตัว และชี้ไปที่กระดานผู้นำการถอดเสียงพูดเป็นข้อความแบบสตรีมมิงของ {{1}}Artificial Analysis{{/1}} ซึ่ง Meta อ้างว่าครองตำแหน่งสูงสุด {{2}}สิ่งเหล่านี้เป็นเพียงการกล่าวอ้าง ยังไม่มีใครนอกห้องปฏิบัติการทำการทดสอบซ้ำ แต่มีความเฉพาะเจาะจงมากพอที่จะพิสูจน์ว่าเป็นเท็จได้ ซึ่งก็นับเป็นความก้าวหน้าอย่างหนึ่ง{{/2}}
VibeVoice-ASR-Streaming-7B ไม่มีสิ่งเหล่านั้นเลย การ์ดโมเดลของมันมาพร้อมรูปภาพแสดงผลการประเมิน และรายงานทางเทคนิคแบบสตรีมมิงเป็นไฟล์ PDF แต่ไม่มีตัวเลข WER หรือความหน่วงแบบสตรีมมิงที่สามารถอ้างอิงได้ในเนื้อหาที่เป็นข้อความ จุดยึดเชิงตัวเลขเพียงอย่างเดียวในตระกูล VibeVoice คือตารางที่ผู้จำหน่ายรายงานในการ์ดของ VibeVoice-ASR แบบแบตช์ — ค่า WER เฉลี่ย 7.77% จากชุดทดสอบภาษาอังกฤษแปดชุด และ 2.20% บน LibriSpeech clean — ซึ่งชัดเจนว่าไม่ใช่ตัวเลขของ checkpoint นี้ เมื่อคำกล่าวอ้างในวันเปิดตัวต้องเผชิญกับการ์ดที่ว่างเปล่า ตัวตัดสินอย่างตรงไปตรงมาคือทุกอย่างยกเว้นตัวเลข WER ที่เป็นหัวข้อหลัก นั่นคือ ราคา สัญญาอนุญาต จังหวะการสตรีมมิง และคุณสมบัติที่แต่ละฝ่ายบันทึกไว้จริง
ภาษา: ตรวจสอบแล้ว 25 ภาษา จากที่ระบุไว้ 10 ภาษา
ความครอบคลุมด้านภาษาเป็นสิ่งที่แยกระหว่างทั้งสองรุ่นนี้ได้มากกว่าข้ออ้างด้านความแม่นยำในพาดหัวเสียอีก Muse Voice Transcribe ถูกฝึกด้วยภาษามากกว่า 70 ภาษา แต่ Meta ตรวจสอบยืนยันเพียง 25 ภาษาเมื่อเปิดตัว — และรายการที่ผ่านการตรวจสอบแล้ว ไม่ใช่รายการที่ใช้ฝึก คือความครอบคลุมระดับใช้งานจริง โดยมีจุดต่างที่การสลับภาษาแบบธรรมชาติ: มันถูกออกแบบให้สลับภาษากลางประโยคได้โดยไม่ต้องบอกให้รู้ VibeVoice-ASR-Streaming-7B ประกาศ 10 ภาษาในโมเดลการ์ดของตน ได้แก่ อังกฤษ จีน สเปน โปรตุเกส เยอรมัน ญี่ปุ่น เกาหลี ฝรั่งเศส รัสเซีย อิตาลี — เทียบกับ 50+ ของ VibeVoice-ASR แบบแบตช์ หากทราฟฟิกของคุณรวมถึงบทสนทนาที่มีการสลับภาษา Muse มีจุดขายที่เจาะจงกว่า หากทราฟฟิกอยู่ในสิบภาษานั้น ความครอบคลุมของโมเดล Microsoft อย่างน้อยก็ชัดเจน ซึ่งมากกว่าที่เอกสารเปิดตัวส่วนใหญ่ให้ได้เสียอีก
ค่าใช้จ่ายและสิ่งที่คุณจะได้รับ
สิ่งที่ใช้ตัดสินใจได้ชัดเจนที่สุดคือความแตกต่างของรูปแบบธุรกิจ Muse Voice Transcribe คิด $0.18 ต่อชั่วโมงเสียง ซึ่งถูกกว่า list price ของ API ถอดเสียงแบบสตรีมมิ่งรายใหญ่ทุกราย — ไม่ต้องใช้ GPU ไม่ต้องดูแลระบบ น้ำหนักโมเดลเป็นแบบปิด และราคาถูกกำหนดโดย Meta ส่วน VibeVoice-ASR-Streaming-7B ดาวน์โหลดฟรี แต่ถ้าจะโฮสต์เองบน GPU ระดับ 24 GB ต้องเตรียมน้ำหนักโมเดลแบบ bf16 ประมาณ 18 GB ยังไม่รวม KV cache โดยเส้นทาง serving ตามเอกสารคือสคริปต์ตัวอย่าง microsoft/VibeVoice หรือปลั๊กอิน vLLM และยังไม่มีผู้ให้บริการอินเฟอเรนซ์รายใดโฮสต์โมเดลนี้อยู่เลย ใบอนุญาต MIT คือสินทรัพย์ที่ยั่งยืน: คุณเป็นเจ้าของน้ำหนักโมเดล เก็บไว้หรือนำไปปรับแต่ง (fine-tune) ต่อได้ ในแบบที่การสมัคร API ไม่สามารถทำได้ และนั่นคือจุดที่ภาพราคาอาจน่าสนใจขึ้น — ทันทีที่ผู้ให้บริการรายหนึ่งโฮสต์ checkpoint แบบเปิด อัตรา $0.18 ต่อชั่วโมงก็จะกลายเป็นราคาตลาด ไม่ใช่ list price ของผู้ขายรายเดียว ซึ่งเป็นสถานการณ์ที่เราเตอร์แบบ pass-through จะพิสูจน์คุณค่าของมันพอดี ตอนนี้ OrcaRouter ยังไม่ได้จัดเส้นทางสำหรับงาน speech-to-text และโมเดลทั้งสองนี้ก็ไม่ได้อยู่ในแคตตาล็อกของมัน สิ่งที่ OrcaRouter ทำคือส่งผ่าน list price ของผู้ให้บริการโดยไม่คิดมาร์กอัป (0% markup) สำหรับโมเดลภาษา 200+ ตัวที่ใช้ทรานสคริปต์สด (live transcript) เป็นอินพุต ดังนั้นการลดราคาของผู้ขาย ณ จุดใดก็ตามในสแตก (stack) นั้น จะมีผลจริงฝั่งผู้ซื้อในวันเดียวกับที่ประกาศ

คำถามที่พบบ่อย
ค่า WER 3.1% ของ Muse Voice Transcribe หมายความว่ามันแม่นยำกว่า VibeVoice-ASR-Streaming-7B หรือไม่
ไม่ และการเปรียบเทียบนี้ยังไม่มีความหมายในตอนนี้ ตัวเลข 3.1% ของ Meta เป็นการอ้างสิทธิ์ในวันเปิดตัวสำหรับเส้นทางสตรีมมิง ซึ่งรายงานโดยผู้พัฒนาระบบเองและยังไม่มีการตรวจสอบยืนยันซ้ำ VibeVoice-ASR-Streaming-7B ยังไม่ได้เผยแพร่ตัวเลขความแม่นยำสำหรับการสตรีมมิงเป็นลายลักษณ์อักษรเลยแม้แต่น้อย จนกว่าทั้งสองโมเดลจะถูกทดสอบด้วยชุดทดสอบสาธารณะเดียวกันบนไฟล์เสียงเดียวกัน ข้อความที่ตรงไปตรงมาเพียงอย่างเดียวคือ Muse มีการอ้างสิทธิ์ที่เฉพาะเจาะจงซึ่งสามารถทดสอบได้ ในขณะที่ VibeVoice ยังไม่มี
ฉันสามารถใช้โมเดลตัวใดตัวหนึ่งกับเสียงที่บันทึกไว้แล้วได้ไหม
ใช่ทั้งสองกรณี แต่มีรูปแบบต่างกัน Muse Voice Transcribe จัดการบันทึกเสียงที่ยาวเกินหนึ่งชั่วโมงผ่าน API สตรีมมิงเดียวกัน ปลั๊กอิน vLLM ของ VibeVoice-ASR-Streaming-7B มี endpoint สำหรับถอดความทั้งไฟล์ควบคู่ไปกับ endpoint สตรีม WebSocket แต่ทั้งคู่ถูกออกแบบและตั้งราคาสำหรับกรณีใช้งานสด — Muse ด้วยโมเดลธุรกิจแบบสตรีมมิงเท่านั้น ส่วน VibeVoice ด้วยสถาปัตยกรรมแบบแบ่งชิ้นส่วนที่ส่งออกผลเมื่อเสียงเข้ามา — ดังนั้นหากปริมาณงานของคุณเป็นไฟล์แบตช์ล้วนๆ API ถอดเสียงไฟล์โดยเฉพาะมักจะถูกกว่าและวัดผลได้ดีกว่าทั้งสองแบบ
