
MAI-Transcribe-2-Streaming เปิดให้ใช้งานแล้ว: Microsoft ครองแชมป์การถอดข้อความแบบสตรีมมิ่งด้วยค่า WER 2.5%
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 221 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
MAI-Transcribe-2-Streaming คือคำตอบของ Microsoft AI ต่อคำถามหนึ่งที่การเปิดตัวในเดือนกันยายนของบริษัททิ้งไว้ และมันตอบคำถามนั้นภายใน 28 วัน เปิดตัวเมื่อวันที่ 1 ตุลาคม 2026 MAI-Transcribe-2-Streaming เป็นโมเดลถอดเสียงเป็นข้อความแบบเรียลไทม์ที่ถอดเสียงขณะคำพูดเข้ามา แทนที่จะถอดหลังไฟล์จบ Microsoft กล่าวว่ามันครองอันดับหนึ่งด้านความแม่นยำทั้งในบทถอดเสียงฉบับสมบูรณ์และบางส่วนในการประเมิน AA-WER Streaming ของ Artificial Analysis ด้วยอัตราความผิดพลาดของคำ 2.5% โดยบทถอดเสียงฉบับสมบูรณ์พร้อมภายใน 0.13 วินาทีหลังสิ้นสุดการพูด นั่นเป็นคำกล่าวอ้างของผู้ผลิตเกี่ยวกับวิธีการของตัวติดตามมากกว่าเป็นแถวข้อมูลที่ตัวติดตามเผยแพร่ — ณ เวลาที่ร่าง บอร์ด 37 โมเดลไม่ได้รวมมันไว้ และโมเดลที่มันจะแทนที่คือ Grok Voice Transcribe 2.0 (Streaming) ที่ 2.73% และ 0.49 วินาที โมเดลที่มันสร้างขึ้นมา MAI-Transcribe-2 เปิดตัวเมื่อวันที่ 3 กันยายนเป็นโมเดลแบบแบตช์ที่ WER 2.0% โดยไม่มี SKU แบบเรียลไทม์; ตัวแปรแบบสตรีมมิ่งปิดช่องว่างนั้นโดยไม่ต้องแลกความแม่นยำที่ทำให้เวอร์ชันแบตช์โดดเด่นไปมากนัก สิ่งที่มันแลกไปคือราคา: สตรีมมิ่งมีค่าใช้จ่ายเป็น 5.4 เท่าของอัตราแบตช์เมื่อเปิดตัว
กรอบที่ Microsoft ต้องการคือการกวาดเรียบทั้งลีดเดอร์บอร์ดสตรีมมิ่ง กรอบที่ตัวเลขสนับสนุนนั้นแคบกว่าและน่าสนใจกว่า — โมเดลที่อ้างว่าเป็นผู้นำทั้งด้านความแม่นยำและความหน่วงพร้อมกัน บนแนวหน้าซึ่งรายการที่แม่นยำที่สุดบนลีดเดอร์บอร์ดใช้เวลานิ่งนานกว่ารายการที่เร็วที่สุดของมันถึงสี่เท่า และไม่มีรายการเร็วเหล่านั้นรายการใดมีอัตราคำผิดระดับคำต่ำกว่า 3% โดยตั้งราคาเท่ากับผู้ครองตลาดรายเดิม ไม่ใช่ต่ำกว่า นี่คือการเปิดตัวตามที่เกิดขึ้นจริง โดยมีข้อกล่าวอ้างของผู้ขายติดป้ายกำกับไว้
สิ่งที่ Microsoft เปิดตัวเมื่อวันที่ 1 ตุลาคม
MAI-Transcribe-2-Streaming ให้บริการผ่านสแต็กเสียงพูดของ Microsoft ในบริการ Azure AI Speech โดยมีเอกสารประกอบภายใต้ชื่อของโมเดลเอง และใช้รูปแบบการเผยแพร่แบบ API เท่านั้น ไม่มีเวต เหมือนกับรุ่นแบตช์ โดยถอดเสียง 60 ภาษา พร้อมการตรวจจับภาษาต่อเนื่องอัตโนมัติ ดังนั้นเซสชันที่สลับภาษากลางสตรีมจึงไม่จำเป็นต้องประกาศไว้ล่วงหน้า Microsoft วางตำแหน่งโมเดลนี้บนพรมแดนพาเรโตระหว่างความแม่นยำกับความหน่วงในแผนภูมิสตรีมมิงของ Artificial Analysis — ซึ่งเป็นการตีความข้อมูลของแทร็กเกอร์โดยผู้ขายเอง และเป็นการตีความที่แผนภูมิของแทร็กเกอร์เองสนับสนุน
โมเดลสตรีมมิ่งไม่ใช่ทั้งหมดของการเปิดตัวครั้งนี้ ไมโครซอฟต์เปิดตัวโมเดลเสียงอีกสองตัวมาพร้อมกัน ได้แก่ MAI-Voice-2.1 ซึ่งครอบคลุม 23 ภาษาใน 26 โลแคล และ MAI-Voice-2.1-Flash ซึ่งประมวลผลเสียงได้สูงสุด 45 วินาทีด้วยความหน่วงประมาณ 150 มิลลิวินาที เมื่อมองเป็นชุดเดียวกัน การเปิดตัวเมื่อวันที่ 1 ตุลาคมจึงถือเป็นสแต็กการสนทนาแบบเรียลไทม์เต็มรูปแบบ — ฟัง เข้าใจ พูด — มากกว่าจะเป็นการเปิดตัวโมเดลเพียงตัวเดียว

กำลังอ่านตารางอันดับการสตรีม
AA-WER Streaming วัดสองสิ่งต่อโมเดล: บทถอดความที่เสร็จสมบูรณ์ผิดพลาดแค่ไหน และผู้พูดหยุดแล้วใช้เวลานานเท่าใดจึงจะเสร็จ คำกล่าวอ้างของ Microsoft คือ MAI-Transcribe-2-Streaming นำในทั้งสองด้าน: อัตราความผิดพลาดระดับคำ 2.5% บนบทถอดความสุดท้ายที่ 0.13 วินาทีหลังสิ้นสุดคำพูด และ 2.5% เดียวกันบนบทถอดความบางส่วนแรกที่ 0.12 วินาที ซึ่ง Microsoft กล่าวว่าเป็นอันดับหนึ่งด้านความแม่นยำในทั้งสองรายการ ให้อ่านค่านั้นในฐานะตัวเลขจากผู้ขาย — ณ เวลาที่จัดทำร่าง บอร์ดสตรีมมิ่งของ tracker เองยังไม่ได้พล็อตโมเดลนี้ ดังนั้นจึงไม่มีแถว MAI-Transcribe-2-Streaming แบบอิสระให้อ่าน สิ่งที่บอร์ดแสดงให้เห็นจริง ๆ คือสนามแข่งขันที่โมเดลนี้อ้างว่าจะเอาชนะ และสนามนั้นสูสีกันยิ่งกว่าที่กรอบแบบ "มงกุฎ" บ่งชี้:
• Grok Voice Transcribe 2.0 — ค่า WER ของข้อความถอดเสียงฉบับสุดท้าย 2.73% ที่ 0.49 วินาทีหลังสิ้นสุดเสียงพูด ตามข้อมูลจาก Artificial Analysis และเป็นผู้นำอันดับปัจจุบันบนกระดานจัดอันดับ ซึ่งตามหลัง 2.5% ที่ Microsoft อ้างไว้ 0.23 จุด และใช้เวลาสรุปผลช้ากว่าประมาณสี่เท่า — นั่นคือความต่างระหว่างคำบรรยายที่ตามทันกับคำบรรยายที่ล่าช้า
• Muse Voice Transcribe — 3.06% ที่ 0.16 วินาที ตามข้อมูลของ Artificial Analysis คู่แข่งที่ใกล้เคียงที่สุดในด้านความหน่วงตามหลังอยู่ประมาณ 30 มิลลิวินาที และมีความแม่นยำต่ำกว่าคำกล่าวอ้างของ Microsoft อยู่ 0.5 จุด
• ElevenLabs Scribe v2 Realtime — 3.59% ที่ 0.14 วินาที ตามข้อมูลของ Artificial Analysis ความเร็วแทบจะสูสีกัน แต่ความแม่นยำตามหลังอยู่มากกว่าหนึ่งจุด
• Gemini 3.5 Transcribe Live — WER แบบสตรีมมิ่ง 4.00% ที่ 0.40 วินาที ซึ่งเป็นตัวเลขที่ Artificial Analysis เผยแพร่ และ Google อ้างอิงสำหรับโมเดล Live API ของตัวเอง นั่นคือช่องว่าง 1.5 จุด และนี่คือการเปรียบเทียบที่การเปิดตัวนี้มุ่งเป้าไว้
คอลัมน์ first-partial คือจุดที่ข้อกล่าวอ้างนี้แตกต่างจากส่วนอื่น ๆ ของกระดานมากที่สุด บน tracker ตัวเดียวกัน first partial ของ Grok Voice Transcribe 2.0 อยู่ที่ 3.36% และของ Gemini 3.5 Transcribe Live อยู่ที่ 5.77% — โดยปกติ partial ควรแย่กว่า final transcript มักต่างกันหนึ่งจุดหรือมากกว่า เพราะโมเดลตัดสินใจก่อนที่ประโยคจะจบ first partial ที่ตรงกับตัวเลข final คือส่วนที่ผิดปกติอย่างแท้จริงของการเปิดตัวของ Microsoft และเป็นส่วนที่ข้อมูลของ tracker เองยังยืนยันไม่ได้ ให้อ้างอิงเป็นข้อกล่าวอ้างไปก่อนจนกว่าจะมีแถวข้อมูลปรากฏ
ข้อแม้ที่ตรงไปตรงมาคือ 0.13 วินาทีกับ 0.16 วินาทีเป็นประสบการณ์ผลิตภัณฑ์แบบเดียวกันสำหรับมนุษย์ที่อ่านคำบรรยาย และส่วนต่างระหว่าง 2.5% กับ 2.73% ที่นำตารางอันดับอยู่ในตอนนี้อยู่ที่ประมาณ 2 คำต่อ 1,000 คำ ส่วนนำขนาดนั้นมีจริงแต่เล็ก และจะเป็นส่วนนำที่ใคร ๆ รู้สึกได้หรือไม่นั้นขึ้นอยู่กับปริมาณงาน จุดที่มันกัดจริงคือส่วนปลาย: สตรีมของศูนย์ติดต่อที่ทำงานวันละ 8 ชั่วโมง ด้วยอัตรา 2.73% เทียบกับ 2.5% คือคำผิดเพิ่มอีกหลายหมื่นคำต่อปี และข้อผิดพลาดระดับคำในบทถอดเสียงไม่ได้กระจายอย่างสม่ำเสมอ — มันกระจุกตัวอยู่ที่คำนามเฉพาะและตัวเลขซึ่งเป็นสิ่งที่ทำให้บทถอดเสียงมีประโยชน์

สิ่งที่ $9.00 ต่อ 1,000 นาทีซื้อได้
การสตรีมมีค่าใช้จ่ายสูงกว่าแบบแบตช์ และ Microsoft ตั้งราคาไว้ที่ระดับบนสุดของระดับเรียลไทม์ แทนที่จะต่ำกว่านั้น MAI-Transcribe-2-Streaming ตั้งราคาไว้ที่ $0.54 ต่อชั่วโมงเสียง ซึ่งคิดเป็น $9.00 ต่อ 1,000 นาทีของเสียงที่สตรีม โดยระบุว่าเป็นราคาแนะนำที่ใช้ได้จนถึงสิ้นปี สำหรับการเปรียบเทียบ แบบแบตช์ MAI-Transcribe-2 อยู่ที่ $0.10 ต่อชั่วโมงเสียง — $1.67 ต่อ 1,000 นาที — ดังนั้นการถอดเสียงแบบเรียลไทม์มีค่าใช้จ่ายประมาณ 5.4 เท่าของอัตราแบบไฟล์สำหรับตระกูลพื้นฐานเดียวกัน และมีค่าความผิดพลาดของคำมากกว่า 0.5 จุด นั่นไม่ใช่การบวกกำไรที่ Microsoft ซ่อนอยู่ แต่เป็นราคาที่ตรงไปตรงมาของการเชื่อมต่อแบบคงอยู่และการถอดเสียงบางส่วนที่ต้องแม่นยำก่อนที่ประโยคจะจบ
เมื่อเทียบกับโมเดลอื่น ๆ ในกลุ่มสตรีมมิง ภาพรวมยังคละกัน MAI-Transcribe-2-Streaming สูสีกับ Gemini 3.5 Transcribe Live ที่ราคาราว $9 ต่อ 1,000 นาที — แม่นยำกว่า ในราคาเท่ากัน โดยอยู่สูงกว่า ElevenLabs Scribe v2 Realtime และ Deepgram Flux ซึ่งอยู่ที่ราว $6.50 ต่อ 1,000 นาที อยู่สูงกว่า Cartesia Ink-2 ที่ราว $4 และสูงกว่า Muse Voice Transcribe ราวสามเท่า ซึ่งอยู่ที่ราว $3 ดังนั้นการเปิดตัวครั้งนี้จึงเป็นกลยุทธ์ที่เน้นความแม่นยำและความหน่วงในราคาที่เทียบเท่าคู่แข่ง ไม่ใช่สงครามราคา; ทีมที่ใช้โมเดลสตรีมมิงที่ถูกกว่าอยู่แล้วจะต้องจ่ายเงินเพิ่มขึ้นเพื่อแลกกับคะแนน WER ที่ดีขึ้น
การแลกเปลี่ยนนั้นควรค่าแก่การเรียกชื่อให้แม่นยำ เพราะมันเป็นการแลกเปลี่ยนเดียวกันกับที่การเปิดตัวแบบแบตช์ได้พลิกกลับ ในเดือนกันยายน Microsoft ทำให้ความแม่นยำมีราคาถูก ในเดือนตุลาคม มันทำให้ความแม่นยำแบบเรียลไทม์มีค่าใช้จ่ายเท่ากับของรายอื่น ๆ หากไปป์ไลน์ของคุณต้องการเพียงบทถอดเสียงในภายหลัง ก็ไม่มีอะไรเกี่ยวกับวันที่ 1 ตุลาคมที่จะเปลี่ยนบิลของคุณ หากมันต้องการบทถอดเสียงเหล่านั้นในขณะที่สายยังคงดำเนินอยู่ การคำนวณก็เพิ่งเปลี่ยนไปสู่คุณภาพ

การสร้างต่อยอดจากทรานสคริปต์คืออีกครึ่งหนึ่งของการตัดสินใจนั้น และนั่นคือจุดที่เลเยอร์แบบหลายโมเดลพิสูจน์คุณค่าของตัวเอง ทรานสคริปต์แบบเรียลไทม์แทบไม่เคยเป็นจุดสิ้นสุดของไปป์ไลน์ — มันถูกนำไปสรุป ให้คะแนน ค้นหา จัดเส้นทาง และส่งต่อ升級 และขั้นตอนเหล่านั้นต้องการโมเดลที่แตกต่างกันด้วยต้นทุนที่แตกต่างกัน OrcaRouter มีอยู่เพื่อเลเยอร์นั้น: API เดียวที่ครอบคลุมโมเดลกว่า 200 รายการ ราคาตามประกาศของผู้ให้บริการส่งผ่านตรงโดยบวกกำไร 0% การสลับไปใช้ระบบสำรองอัตโนมัติ และ DSL สำหรับจัดเส้นทางที่สามารถส่งทรานสคริปต์สดไปยังโมเดลหนึ่งเพื่อการตรวจสอบด้านคอมพลายแอนซ์ และอีกโมเดลหนึ่งสำหรับจดบันทึกการประชุม โดยไม่ต้องบูรณาการเพิ่มเป็นครั้งที่สอง ตัว MAI-Transcribe-2-Streaming เองไม่ได้อยู่ในรายชื่อนั้น — มันให้บริการผ่านสแต็กเสียงพูดของ Microsoft เอง — แต่ทรานสคริปต์แบบสตรีมมิ่งที่มันสร้างขึ้นนั้นเป็นอินพุตปริมาณสูงที่ไวต่อความหน่วงแบบเดียวกับที่เป็นเหตุผลสนับสนุนให้คงเลเยอร์ที่อยู่เหนือมันไว้เป็นแบบไม่ผูกกับโมเดลใดโมเดลหนึ่ง
อะไรที่ยังไม่ได้รับการพิสูจน์
มีสามประเด็นที่ยังเป็นคำถามเปิดอยู่จริง ๆ ประการแรก การแยกผู้พูด (diarization): โมเดลแบบแบตช์รวมการระบุผู้พูดไว้ด้วยกัน โดยไม่มีการเผยแพร่อัตราความผิดพลาดในการแยกผู้พูด และเอกสารเกี่ยวกับสตรีมมิ่งของ Microsoft ไม่ได้กล่าวอ้างเรื่องการแยกผู้พูดเลย — สำหรับโมเดลเรียลไทม์ที่ป้อนระบบช่วยเหลือเจ้าหน้าที่แบบสดหรือคำบรรยาย การรู้ว่าใครพูดอะไร มักเป็นคุณสมบัติที่สำคัญกว่า WER ดิบ ๆ ประการที่สอง รายละเอียดการรองรับหลายภาษา: การรองรับ 60 ภาษาพร้อมการตรวจจับภาษาแบบต่อเนื่องอัตโนมัติเป็นข้ออ้างที่กว้าง และความหน่วงรายภาษาของโมเดลสตรีมมิ่งอาจแปรผันได้มากกว่าของโมเดลแบบแบตช์มาก เพราะคุณภาพบทถอดความบางส่วนขึ้นอยู่กับว่าโมเดลตัดสินใจเลือกภาษาได้เร็วเพียงใด Microsoft ไม่ได้เผยแพร่ตารางสตรีมมิ่งรายภาษาเลย ประการที่สาม WER ของสตรีมมิ่งวัดจากเสียง benchmark ที่สะอาด; รูปแบบความล้มเหลวที่ส่งผลเสียต่อการใช้งานจริงคือสตรีมฟาร์ฟิลด์ที่มีเสียงรบกวน และไม่มีการเปรียบเทียบสตรีมมิ่งฟาร์ฟิลด์ที่เป็นอิสระในวันเปิดตัว
จุดที่มันออกจากสแต็กของคุณ
สิ่งที่น่าสนใจเกี่ยวกับการเปิดตัวครั้งนี้ไม่ใช่ว่า Microsoft มีข้อความถอดเสียงแบบสตรีมมิ่งที่แม่นยำที่สุด แต่เป็นจังหวะ: แบตช์ในเดือนกันยายน สตรีมมิ่งในเดือนตุลาคม ในตระกูลเดียวกัน บนพื้นผิวเอกสารเดียวกัน โดยมีโครงสร้างราคาที่ครอบคลุมตั้งแต่ $1.67 ถึง $9.00 ต่อ 1,000 นาทีสำหรับความสามารถพื้นฐานเดียวกัน สิ่งนี้ทำให้ทีมต่างๆ มีทางเลือกจริงเป็นครั้งแรก — จ่ายสำหรับเรียลไทม์เฉพาะจุดที่เรียลไทม์มีความสำคัญ และใช้แบตช์กับทุกอย่างที่เหลือ — แต่มันยังหมายความว่าเลเยอร์การถอดเสียงตอนนี้เป็นสิ่งที่คุณปรับแต่งตามเวิร์กโหลด แทนที่จะกำหนดมาตรฐานเพียงครั้งเดียว
อ่านข้อกล่าวอ้างในพาดหัวข่าวตามตัวอักษรแล้ว มันก็ถือเป็นคำแถลงของผู้ขายได้ว่า: Microsoft กล่าวว่า MAI-Transcribe-2-Streaming เป็นอันดับหนึ่งทั้งในด้านความแม่นยำของทรานสคริปต์สุดท้ายและความแม่นยำของผลลัพธ์บางส่วนครั้งแรก และว่ามันอยู่บนพรมแดนพาเรโต เครื่องหมายดอกจันคือ กระดานของ tracker ยังไม่ได้พล็อตโมเดล ความได้เปรียบที่มันอ้างว่ามีเหนือผู้นำปัจจุบันนั้นน้อยพอที่จะหายไปในการรันซ้ำ ความได้เปรียบด้านราคาเป็นศูนย์ และเรื่องราวเกี่ยวกับการแยกผู้พูด (diarization) ยังไม่ถูกเล่า นั่นคือสิ่งที่ต้องจับตามอง ไม่ใช่ตำแหน่งมงกุฎ
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
