การ์ดพาดหัวแบบ Hero สำหรับบทความ 'VibeVoice-ASR-Streaming-1.5B' พร้อมแท็ก 'สิ่งที่เรารู้จนถึงตอนนี้' คำโปรย 'ระบบแปลงเสียงพูดเป็นข้อความแบบสตรีมมิงของ Microsoft เปิดตัวเงียบๆ' และชิปข้อความ 'เผยแพร่ 2 กันยายน 2026', 'MIT · โอเพนเวต' และ '10 ภาษา' โลโก้ OrcaRouter ประกอบอยู่ที่มุมขวาล่าง
Guides & Insights

VibeVoice-ASR-Streaming-1.5B อธิบาย: สตรีมมิ่ง ASR ของ Microsoft มาโดยไม่มีการเปิดตัวอย่างเป็นทางการ

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เมื่อวันที่ 2 กันยายน 2026 Microsoft Research ได้อัปโหลดเช็คพอยต์ใหม่สองตัวสำหรับแปลงคำพูดเป็นข้อความไปยัง Hugging Face โดยไม่มีการแถลงข่าว ไม่มีบล็อกโพสต์ และไม่ได้สร้างกระแสฮือฮาใดๆ: microsoft/VibeVoice-ASR-Streaming-1.5B และรุ่นที่ใหญ่กว่าคือ microsoft/VibeVoice-ASR-Streaming-7B การประกาศเพียงอย่างเดียวเท่าที่มีในตอนนี้คือรายการข่าวลงวันที่ 3 กันยายน 2026 ในส่วนข่าวของที่เก็บ VibeVoice โอเพนซอร์สของ Microsoft บน GitHub ซึ่งระบุว่าการเปิดตัวครั้งนี้เป็นโมเดล ASR สตรีมมิงแบบรวมที่ถอดเสียงออกมาได้ว่าใครพูดอะไรในขณะที่เสียงยังหลั่งไหลเข้ามา พร้อมทั้งฮอตเวิร์ดที่ปรับแต่งเองได้และสิบภาษา เช็คพอยต์ทั้งสองตัวอยู่ภายใต้ใบอนุญาต MIT และถูกสร้างขึ้นบนบัญชี Hugging Face อย่างเป็นทางการของ microsoft โดยห่างกันประมาณห้านาที และทั้งคู่มียอดดาวน์โหลดเป็นศูนย์เมื่อเราตรวจสอบในวันถัดมา เราไม่พบการรายงานข่าวจากบุคคลที่สามเกี่ยวกับเช็คพอยต์ตัวใดตัวหนึ่งเลย

ที่ทำให้บทความนี้เป็นงานเขียนที่ไม่ปกติก็คือ นี่คือการเปิดตัวจริงที่ระบุวันที่ได้ — น้ำหนักบน Hugging Face ลงวันที่ 2 กันยายน และประกาศในรีโพลงวันที่ 3 กันยายน — ซึ่งโลกภายนอกในวงกว้างยังไม่ตามทัน สิ่งที่สามารถรู้ได้ทั้งหมดด้านล่างนี้มาจากการอ่านรีโพ: ไฟล์คอนฟิก การ์ดโมเดล และเอกสารสตรีมมิงของไมโครซอฟต์เอง สิ่งที่ยังไม่ได้รับการยืนยัน ไม่ว่าจะเป็นความแม่นยำ ระยะหน่วงจริง หรือการระบุผู้พูดแบบสตรีมมิงจะยังใช้ได้จริงในการสนทนาที่มีผู้พูดสองคนหรือไม่ ถูกระบุไว้เช่นนั้น และยังไม่มี benchmark ให้อ้างอิง เนื่องจากไมโครซอฟต์ยังไม่ได้เผยแพร่ benchmark ในรูปแบบข้อความ

ประกาศเพียงอย่างเดียวคือบรรทัดข่าว

VibeVoice คือกลุ่มโมเดลเสียงโอเพนซอร์สภายใต้ใบอนุญาต MIT ของ Microsoft Research สมาชิก ASR ที่เป็นที่รู้จักมากที่สุดคือ microsoft/VibeVoice-ASR ซึ่งเปิดตัวเมื่อวันที่ 21 มกราคม 2026: เป็นโมเดลแบบแบตช์ที่ประมวลผลเสียงได้สูงสุดหกสิบนาทีในครั้งเดียว และส่งคืนบทถอดเสียงที่มีโครงสร้างพร้อมข้อมูลผู้พูด ช่วงเวลา และเนื้อหา — มียอดดาวน์โหลดจาก Hugging Face ตามมาประมาณ 700,000 ครั้ง ต่อมาในวันที่ 2 กันยายน องค์กรเดียวกันได้เผยแพร่โมเดลสตรีมมิงคู่แฝดคือ microsoft/VibeVoice-ASR-Streaming-7B และ microsoft/VibeVoice-ASR-Streaming-1.5B; API ของ Hugging Face ระบุเวลาในรุ่น 7B ไว้ที่ 2026-09-02T15:46 UTC และรุ่น 1.5B ในอีกห้านาทีต่อมาคือ 15:51 UTC ตารางโมเดลในคลังข้อมูล GitHub ขณะนี้แสดง VibeVoice-ASR-Streaming เป็นรายการของตนเอง และในส่วน News มีข้อความลงวันที่ 3 กันยายนประกาศเปิดตัวโมเดลดังกล่าว

สิ่งที่ใหม่จริง ๆ เมื่อเทียบกับโมเดลเดือนมกราคมคือโมเดลการโต้ตอบ: จุดตรวจสอบแบบสตรีมมิ่งจะถอดความทันทีที่เสียงเข้ามา แทนที่จะรอไฟล์ที่สมบูรณ์ อย่างอื่นทั้งหมด — สถาปัตยกรรมสปีชโทเคนเบื้องหลัง ผลลัพธ์ที่ระบุผู้พูด กลไกฮอตเวิร์ด — ล้วนเป็นการต่อยอดจากดีไซน์แบบแบตช์ ที่ปรับขนาดและเปลี่ยนเป้าหมายไปสู่การใช้งานแบบเรียลไทม์ สังเกตความแตกต่างด้านภาษาตั้งแต่ต้น: โมเดลแบบแบตช์โฆษณารองรับมากกว่า 50 ภาษา ขณะที่การ์ดแบบสตรีมมิ่งระบุเพียงสิบภาษา

A screenshot of the microsoft/VibeVoice GitHub repository README showing the model table that lists VibeVoice-ASR-Streaming as a member of the family and the News section entry dated September 3, 2026 announcing the streaming ASR release.

ในเช็คพอยต์นี้ "streaming" หมายความว่าอะไร

เอกสารสตรีมมิงของ Microsoft อธิบายเจตนาไว้อย่างตรงไปตรงมา: โมเดลถอดเสียงในขณะที่เสียงยังมาไม่ครบ และส่งข้อความออกมาทีละครั้งต่อชิ้นเสียงหนึ่งชิ้น ทำให้บทถอดเสียงปรากฏขึ้นพร้อมกับที่ผู้พูดกำลังพูด ไฟล์ preprocessor_config.json ของรีโพ 1.5B ทำให้จังหวะการทำงานนี้เป็นรูปธรรม:

• อัตราการสุ่มตัวอย่างและอัตราโทเคน — เสียงนำเข้า 24 kHz บีบอัด 3,200 เท่า ซึ่งให้สตรีมโทเคนคำพูดประมาณ 7.5 Hz (ประมาณหนึ่งโทเคนทุก 133 ms)

• Chunk — 22 เฟรม ซึ่งที่ 7.5 Hz คิดเป็นเสียงประมาณ 2.9 วินาทีต่อเซ็กเมนต์ที่ส่งออก

• Lookahead — 4 เฟรม ประมาณ 0.5 วินาทีของเสียงในอนาคตที่ใช้เพื่อยืนยันเซกเมนต์ปัจจุบัน

(เลขคณิตตรงไปตรงมาจาก repo: 22 × 3,200 = 70,400 ตัวอย่าง ≈ 2.93 วินาทีที่ 24 kHz; 4 × 3,200 = 12,800 ตัวอย่าง ≈ 0.53 วินาที เอกสารของ Microsoft เองระบุว่า checkpoint จะทำงานด้วย chunk ที่มันถูกฝึกมาเสมอ ดังนั้นค่าเหล่านี้จึงปรับแต่งไม่ได้ในเวลาอนุมาน)

ซึ่งจัดให้สิ่งนี้อยู่ในกลุ่มการสตรีมแบบเป็นช่วง (chunked streaming) มากกว่าแบบคำต่อคำ: บทถอดเสียงสดจะเพิ่มขึ้นเป็นช่วงๆ ประมาณสามวินาที โดยมองไปข้างหน้าประมาณครึ่งวินาที ไม่ใช่ผลลัพธ์ย่อยแบบรายโทเค็น นี่คือการออกแบบที่ถูกต้องและพบได้ทั่วไปสำหรับการถอดเสียงการประชุมและการโทรศัพท์ แต่ก็มีรูปแบบความหน่วง (latency profile) ที่ต่างจากระบบที่ปล่อยผลลัพธ์ย่อยในเวลาต่ำกว่าหนึ่งวินาที — ดังนั้นจงมองว่า “สตรีมมิง” เป็นสเปกตรัม และวัดมันเทียบกับงบประมาณความหน่วงของคุณเองก่อนจะสร้างผลิตภัณฑ์คำบรรยายสดบนพื้นฐานดังกล่าว

เบื้องหลัง: โมเดลภาษาขนาดใหญ่ด้านเสียงพูดระดับ Qwen

การอ่าน config.json ของ checkpoint ขนาด 1.5B เผยให้เห็นสูตร VibeVoice ที่เราคุ้นเคยกันดีในขนาดที่เล็กลง:

ตัวถอดรหัสคือโมเดลภาษาตระกูล Qwen2 ซึ่งมีมิติตรงกับคลาส Qwen2.5 ขนาด 1.5B ทุกประการ ได้แก่ 28 เลเยอร์ หน่วยซ่อน 1,536 หน่วย หัวข้อสนใจ (attention heads) 12 หัวพร้อมหัวคีย์-แวลู 2 หัว และหน้าต่างบริบท 65,536 โทเคน LLM คือสิ่งที่ทำให้โมเดลสามารถคงความเข้าใจเกี่ยวกับผู้พูดและเนื้อหาไว้ได้ตลอดทั้งทรานสคริปต์

• ตัวแปลงโทเคนเชิงเสียงและเชิงความหมาย — ตัวเข้ารหัสคอนโวลูชันเชิงลึกที่มีสไตรดิง 8/5/5/4/2/2 — แปลงเสียง 24 kHz ให้เป็นสตรีมโทเคนคำพูดความถี่ ~7.5 Hz ที่ตัวถอดรหัสอ่าน

ส่วน {{1}}หัวแพร่กระจาย (diffusion head){{/1}} ({{2}}DDPM{{/2}}, 20 ขั้นตอนการลดสัญญาณรบกวน, การทำนาย v) ตั้งอยู่บนฝั่ง {{3}}การสร้าง (generation){{/3}} ซึ่งสอดคล้องกับผลิตภัณฑ์อื่นๆ ในไลน์ {{4}}VibeVoice{{/4}}

• ความซื่อสัตย์เรื่องขนาด: ข้อมูลเมตา safetensors ของ checkpoint เองระบุพารามิเตอร์ประมาณ 3 พันล้านตัว หรือประมาณ 5.6 กิกะไบต์ของน้ำหนัก "1.5B" ในชื่อคือขนาดของแกนหลักภาษา — การอ่านตามธรรมชาติของคอนฟิกที่ตัวถอดรหัสเป็นโมเดล Qwen ระดับ 1.5B — โดยโทเคนไนเซอร์เสียงและส่วนหัว diffusion เป็นส่วนที่เพิ่มเข้ามาที่เหลือ สตริงสถาปัตยกรรมในคอนฟิก VibeVoiceForASRStreamingTraining บ่งชี้ว่านี่คือ checkpoint ในตระกูลงานวิจัย

A single-column scoreboard titled 'VibeVoice-ASR-Streaming-1.5B — the scoreboard' with the subtitle 'Key specs read from the Hugging Face checkpoint and Microsoft's repo' and six rows: 'Released: Sept 2, 2026', 'Streaming cadence: ~3 s chunks, ~0.5 s lookahead', 'Languages: 10', 'Speaker output: who said what (unverified)', 'Scale: 1.5B LM backbone, ~3B total', 'License: MIT, open weights'. Footer: 'Specs from HF config and microsoft/VibeVoice repo — no independent benchmarks yet.' The OrcaRouter logo is composited in the bottom-right corner.

ใครพูดว่าอะไร ในสิบภาษา

ความสามารถหลักที่การ์ดโมเดลระบุคือการถอดความแบบสตรีมมิ่งที่ระบุผู้พูด: ตามหัวข้อย่อยของการ์ดเองระบุว่ามัน "ถอดความอย่างต่อเนื่องว่าใครพูดอะไรเมื่อมีเสียงพูดเข้ามา" อีกทั้งยังโฆษณาคำฮอตเวิร์ดที่ปรับแต่งได้สำหรับคำศัพท์เฉพาะโดเมน และระบุภาษาที่รองรับสิบภาษา ได้แก่ จีน อังกฤษ ฝรั่งเศส เยอรมัน อิตาลี ญี่ปุ่น เกาหลี โปรตุเกส รัสเซีย และสเปน

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the MIT license tag, the automatic-speech-recognition pipeline tag, and the card description of streaming speaker-attributed transcription with customized hotwords and ten languages.

Hotwords ถูกใช้งานผ่านกลไกการปรับบริบท (context-biasing) เดียวกับที่โมเดลแบบแบตช์ใช้ ในเดโมบรรทัดคำสั่งของ Microsoft คุณส่งคำเหล่านี้เป็นข้อมูลบริบท — ตัวอย่างเช่น --context_info "Microsoft,VibeVoice" — เพื่อปรับการรู้จำให้เหมาะกับชื่อและศัพท์เทคนิคโดยไม่ต้องปรับแต่งละเอียด (fine-tuning) การ์ดดังกล่าวไม่ได้กล่าวถึงการตรวจจับภาษาอัตโนมัติหรือการสลับภาษา (code-switching) สำหรับโมเดลแบบสตรีมมิง ซึ่งเป็นช่องว่างอีกประการเมื่อเทียบกับข้อกล่าวอ้างของโมเดลแบบแบตช์

ข้อควรระวังประการหนึ่งสมควรเน้นย้ำ หน้าเอกสารสตรีมมิงมุ่งเน้นที่การส่งข้อมูลแบบแยกชิ้นส่วนและ hotwords แต่ไม่ได้ลงรายละเอียดว่าการระบุผู้พูดถูกรักษาไว้อย่างไรเมื่อข้ามขอบเขตของชิ้นส่วนข้อมูล การแยกผู้พูดแบบสตรีมมิงนั้นยากอย่างแท้จริง — ผู้พูดอาจพูดทับซ้อนกัน และขอบเขตของชิ้นส่วนข้อมูลคือจุดที่การระบุผู้พูดคลาดเคลื่อนพอดี กรอบแนวคิดแบบ "ใครพูดอะไร" บนการ์ดนั้นเป็นเพียงคำกล่าวอ้างของผู้ขาย จนกว่าจะมีคนนำการสนทนาสดจริงแบบสองผู้พูดมาทดสอบกับระบบแล้วตรวจสอบ

มันอยู่ตรงไหน: ตระกูล VibeVoice และวงการ streaming-ASR ปี 2026

ภายในตระกูลผลิตภัณฑ์ การเปิดตัวจะถูกจัดวางตำแหน่งดังนี้:

• microsoft/VibeVoice-ASR (21 มกราคม 2026) — เรือธงรุ่นแบตช์: รองรับได้ถึง 60 นาทีในครั้งเดียว, 50+ ภาษา, เอาต์พุต Who/When/What, ฮอตเวิร์ด, ดาวน์โหลดประมาณ 700K

• microsoft/VibeVoice-ASR-Streaming-7B และ microsoft/VibeVoice-ASR-Streaming-1.5B (2 กันยายน 2026) — ตัวแปรสตรีมมิ่งรุ่นใหม่; หัวข้อของชิ้นนี้คือรุ่น 1.5B

• microsoft/VibeVoice-ASR-BitNet (23 กรกฎาคม 2026) — เอ็นจินเอดจ์แบบ quantized ที่เน้นการทำงานบน CPU สำหรับโมเดลแบบแบตช์

โมเดล VibeVoice-1.5B TTS และ VibeVoice-Realtime-0.5B streaming-TTS เป็นสมาชิกที่แยกจากกันในตระกูลเดียวกัน ไม่ได้เป็นส่วนหนึ่งของสาย ASR

สาขา ASR แบบเปิดน้ำหนักที่กว้างขึ้นมีการเคลื่อนไปสู่แบบเรียลไทม์ตลอดทั้งปี ดังนั้นโมเดลสตรีมมิ่งตัวใหม่จึงมีจุดเปรียบเทียบโดยตรง Qwen3-ASR (Alibaba, ประมาณ 1.7B) เป็นโมเดลแบบรวมที่รองรับทั้งสตรีมมิ่งและออฟไลน์ ครอบคลุมมากกว่า 50 ภาษาและสำเนียง ASR ของ NVIDIA Nemotron 3.5 เป็นโมเดลสตรีมมิ่งขนาด 0.6B ครอบคลุม 40 ภาษา ภายใต้ใบอนุญาต OpenMDW แทนที่จะเป็น MIT Granite Speech 5.0 470M TurboCTC ของ IBM เป็น Apache-2.0 พร้อมตัวเลขอัตราการประมวลผลที่รายงานโดยผู้จำหน่ายซึ่งสูงผิดปกติ เมื่อเทียบกับสิ่งเหล่านั้น โมเดลสตรีมมิ่งของ Microsoft แตกต่างกันในสามเรื่อง: ใบอนุญาต MIT, แกนหลักแบบ LLM ที่นำความเข้าใจเกี่ยวกับผู้พูดและเนื้อหาแทนที่จะเป็นโมเดลเสียงบริสุทธิ์ และกรอบการถอดเสียงสดแบบระบุผู้พูด คำถามปลายเปิดคือความแม่นยำและความหน่วงจริงในโลกการใช้งานจริง — ทั้งสองอย่างยังไม่มีตัวเลขจากแหล่งอิสระ

สิ่งที่ยังไม่ได้รับการยืนยัน

การอ่าน repo บอกให้คุณทราบถึงการออกแบบ แต่ไม่ได้บอกว่ามันทำงานดีแค่ไหน โดยเฉพาะ:

• ไม่มีตัวเลขด้านความแม่นยำหรือความหน่วงในข้อความ การ์ดโมเดลมาพร้อมรูปภาพแสดงผลลัพธ์เท่านั้น แต่ไม่มีค่า WER, RTF หรือตารางความหน่วงเป็นตัวเลขในเนื้อหา — ไม่มีสิ่งใดให้อ้างอิงได้โดยอิสระ

• ไม่มีการประเมินจากบุคคลที่สาม ยอดดาวน์โหลดเป็นศูนย์ภายในหนึ่งวันหลังอัปโหลด; ไม่มีเกณฑ์วัดของชุมชน ไม่มีรายการในลีดเดอร์บอร์ด และไม่มีการทดสอบอิสระที่เราสามารถค้นหาได้

• เส้นทางให้บริการเป็นการตั้งค่างานวิจัยจากซอร์สโค้ดโดยตรง เอกสารสตรีมมิงของ Microsoft รันจากโคลนของรีโพซิทอรี VibeVoice บน GitHub ภายในคอนเทนเนอร์ NVIDIA PyTorch (nvcr.io/nvidia/pytorch โดยแนะนำให้ใช้ flash-attention) การ์ดโมเดลยังแสดงชิ้นส่วนโค้ดไปป์ไลน์ของ Transformers และปล่อยรายละเอียดการติดตั้งให้ไปดูที่ GitHub เราไม่ได้ตรวจสอบว่า Transformers เวอร์ชันที่เผยแพร่ในปัจจุบันสามารถรันการอนุมานแบบสตรีมมิงบนเช็คพอยต์นี้ได้ทันทีหรือไม่

• กรอบแนวคิดคือมุ่งวิจัยเป็นอันดับแรก ที่เก็บโค้ดของ Microsoft ระบุว่าโมเดล VibeVoice สร้างขึ้นเพื่อวัตถุประสงค์ด้านการวิจัยและพัฒนา ตัว weights อยู่ภายใต้สัญญาอนุญาต MIT จุดยืนคือ “นี่คืองานวิจัย” ไม่ใช่ “นี่คือผลิตภัณฑ์ที่ได้รับการซัพพอร์ตอย่างเป็นทางการ” ควรกันงบประมาณไว้สำหรับการประเมินผลของคุณเอง

คุณควรต่อยอดจากมันไหม?

สำหรับทีมที่โฮสต์ ASR ด้วยตนเองอยู่แล้ว สิ่งนี้น่าจะคุ้มค่ากับการประเมินในช่วงสุดสัปดาห์ หากเสียงของคุณอยู่ในกลุ่มสิบภาษา และคุณจำเป็นต้องมีการถอดความสดแบบระบุผู้พูดจากโมเดลที่ใช้สัญญาอนุญาต MIT โดยเฉพาะ ควรงบประมาณน้ำหนักโมเดลประมาณ 5.6 GB สำหรับรุ่น 1.5B บน GPU ของ NVIDIA และการติดตั้งจากซอร์สโค้ด และวางแผนวัดความแม่นยำด้วยเสียงของคุณเองก่อนจะเชื่อถือมัน

สำหรับทีมที่กำลังส่งไปป์ไลน์ถอดเสียงระดับโปรดักชันในวันนี้ คำตอบที่สุขุมคือการรอหนึ่งในสามสิ่ง: Microsoft เผยแพร่ตัวเลขความแม่นยำและความหน่วงที่ปัจจุบันมีอยู่เพียงเป็นรูปภาพ; การวัดประสิทธิภาพจากแหล่งอิสระ; หรือเส้นทางการให้บริการที่มีการดูแลรักษาและรันไทม์ที่รองรับ จังหวะการแบ่งประมาณ 3 วินาทียังเป็นข้อกำหนดที่ควรนำไปตรวจสอบกับความต้องการด้านความหน่วงของคุณ แทนที่จะคาดเดาจากคำว่า "streaming"

วิธีที่ประหยัดในการคงตัวเลือกไว้คือการไม่ผูกแอปพลิเคชันของคุณเข้ากับเอนจินถอดเสียงเพียงตัวเดียว การมีชั้นจัดเส้นทาง (routing layer) ที่นำหน้าโมเดลหลายตัวผ่าน API เดียวกันหมายความว่า เมื่อ VibeVoice-ASR-Streaming — หรือระบบ ASR แบบเปิดตัวถัดไป — ถูกวางบนผู้ให้บริการอินเฟอเรนซ์ การทดสอบ A/B กับโมเดลเดิมบนทราฟฟิกเดียวกันจะเป็นการเปลี่ยนค่าคอนฟิก ไม่ใช่การปรับเปลี่ยนแพลตฟอร์มใหม่ทั้งหมด และเนื่องจากเราเตอร์แบบ pass-through คิดราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่ม การเปรียบเทียบนี้จึงยังคงมีต้นทุนต่ำ ขณะที่การเฟลโอเวอร์อัตโนมัติจะกันไม่ให้โมเดลใหม่ที่ยังไม่ผ่านการพิสูจน์กลายเป็นจุดเดียวที่ทำให้ไปป์ไลน์ของคุณล่ม นี่คือรูปแบบทั่วไปสำหรับการนำโมเดลที่เพิ่งเปิดตัวได้ไม่กี่วันมาใช้: ให้มันได้แสดงฝีมือบนทราฟฟิกจริงก่อน แล้วค่อยเดิมพันระบบโปรดักชันกับมัน

คำถามที่พบบ่อย

VibeVoice-ASR-Streaming-1.5B เป็นรุ่นที่ Microsoft ปล่อยออกมาจริงหรือไม่?

ใช่ เช็คพอยต์ดังกล่าวอยู่บนบัญชี Hugging Face อย่างเป็นทางการของ microsoft โดยมีเวลาสร้าง (timestamp) วันที่ 2 กันยายน 2026 และที่เก็บ microsoft/VibeVoice บน GitHub ก็อ้างอิง VibeVoice-ASR-Streaming ไว้ในตารางโมเดลของตน พร้อมด้วยรายการข่าวลงวันที่ 3 กันยายน 2026 สิ่งที่ผิดปกติไม่ใช่ที่มาของมัน หากแต่เป็นความเงียบต่างหาก: ไม่มีการแถลงข่าว ไม่มีบล็อกโพสต์ และไม่มีบุคคลที่สามรายงานข่าวนี้ ณ เวลาที่เขียนข้อความนี้

ทำไมต้องมีสองขนาด 7B และ 1.5B?

Microsoft อัปโหลด checkpoint ทั้งสองในนาทีเดียวกัน แต่ยังไม่ได้เผยแพร่การเปรียบเทียบ จาก configs นั้น 1.5B เป็นรุ่นที่เล็กที่สุด — แกนภาษา Qwen ระดับ 1.5B บวกกับ audio stack, มีพารามิเตอร์ประมาณ 3B และน้ำหนัก ~5.6 GB ความหมายโดยธรรมชาติคือรุ่น 7B ที่แม่นยำกว่า และรุ่น 1.5B ที่ถูกกว่าและเร็วกว่า แต่ Microsoft ไม่ได้กล่าวเช่นนั้น และไม่มี benchmarks ที่จะยืนยันการแลกเปลี่ยนนี้

อันนี้แตกต่างจาก VibeVoice-ASR รุ่นก่อนหน้าอย่างไร?

โมเดลแบตช์เดือนมกราคมประมวลผลเสียงได้สูงสุด 60 นาทีในหนึ่งรอบ และรองรับมากกว่า 50 ภาษา ส่วนเช็คพอยต์แบบสตรีมมิงจะถอดเสียงในขณะที่เสียงกำลังเข้ามา โดยปล่อยทรานสคริปต์ออกมาเป็นส่วนๆ ประมาณ 3 วินาที พร้อมการมองไปข้างหน้าประมาณ 0.5 วินาที และ model card ระบุภาษาไว้ 10 ภาษา ทั้งสองใช้สถาปัตยกรรม speech-token แบบเดียวกัน มีแนวคิดการส่งออกผลลัพธ์ที่ระบุผู้พูด และกลไก hotword เหมือนกัน

สำหรับตอนนี้ VibeVoice-ASR-Streaming-1.5B เป็นเพียง checkpoint บวกกับไลน์ข่าว ถ้าคุณโฮสต์เองและต้องการ streaming ASR ที่ใช้ไลเซนส์แบบ permissive เพื่อประเมินผล ลองอ่าน repo ดูได้ แต่ถ้าคุณกำลังเลือกเอนจินสำหรับโปรดักชัน ให้รอตัวเลขก่อน สัญญาณที่น่าสนใจคือ Microsoft กำลังผลักดันไลน์ระบบเสียงของตัวเองให้เป็นแบบเรียลไทม์ที่สองขนาดพร้อมกัน — และทำได้เงียบเสียจนวันต่อมา ตัวนับดาวน์โหลดยังคงอ่านค่าเป็นศูนย์

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube