การ์ดฮีโร่ของบทความที่อ่านว่า 'MAI-Transcribe-2-Streaming เปิดให้บริการแล้ว' พร้อมป้าย 'โมเดลใหม่ · MICROSOFT AI' และคำบรรยายย่อย 'Microsoft คว้ามงกุฎการถอดเสียงแบบสตรีมมิ่งที่ 2.5% WER' พร้อมแถบสถิติที่แสดงอัตราความผิดพลาดของคำแบบสตรีมมิ่ง 2.5% ที่ 0.13 วินาทีหลังจากสิ้นสุดการพูด โดยระบุบนการ์ดว่าเป็นข้ออ้างของ Microsoft และเป็นครั้งแรกสำหรับทั้งบทถอดเสียงฉบับสมบูรณ์และบางส่วน 60 ภาษาพร้อมการตรวจจับภาษาต่อเนื่องอัตโนมัติ และ $9.00 ต่อ 1,000 นาที โดยอธิบายว่า $0.54 ต่อชั่วโมงเสียงในราคาเปิดตัวจนถึงปี 2026 บนพื้นหลังไล่ระดับสีขาวถึงน้ำเงินพร้อมโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

MAI-Transcribe-2-Streaming เปิดให้ใช้งานแล้ว: Microsoft ครองแชมป์การถอดข้อความแบบสตรีมมิ่งด้วยค่า WER 2.5%

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

MAI-Transcribe-2-Streaming คือคำตอบของ Microsoft AI ต่อคำถามหนึ่งที่การเปิดตัวในเดือนกันยายนของบริษัททิ้งไว้ และมันตอบคำถามนั้นภายใน 28 วัน เปิดตัวเมื่อวันที่ 1 ตุลาคม 2026 MAI-Transcribe-2-Streaming เป็นโมเดลถอดเสียงเป็นข้อความแบบเรียลไทม์ที่ถอดเสียงขณะคำพูดเข้ามา แทนที่จะถอดหลังไฟล์จบ Microsoft กล่าวว่ามันครองอันดับหนึ่งด้านความแม่นยำทั้งในบทถอดเสียงฉบับสมบูรณ์และบางส่วนในการประเมิน AA-WER Streaming ของ Artificial Analysis ด้วยอัตราความผิดพลาดของคำ 2.5% โดยบทถอดเสียงฉบับสมบูรณ์พร้อมภายใน 0.13 วินาทีหลังสิ้นสุดการพูด นั่นเป็นคำกล่าวอ้างของผู้ผลิตเกี่ยวกับวิธีการของตัวติดตามมากกว่าเป็นแถวข้อมูลที่ตัวติดตามเผยแพร่ — ณ เวลาที่ร่าง บอร์ด 37 โมเดลไม่ได้รวมมันไว้ และโมเดลที่มันจะแทนที่คือ Gro​k Voice Transcribe 2.0 (Streaming) ที่ 2.73% และ 0.49 วินาที โมเดลที่มันสร้างขึ้นมา MAI-Transcribe-2 เปิดตัวเมื่อวันที่ 3 กันยายนเป็นโมเดลแบบแบตช์ที่ WER 2.0% โดยไม่มี SKU แบบเรียลไทม์; ตัวแปรแบบสตรีมมิ่งปิดช่องว่างนั้นโดยไม่ต้องแลกความแม่นยำที่ทำให้เวอร์ชันแบตช์โดดเด่นไปมากนัก สิ่งที่มันแลกไปคือราคา: สตรีมมิ่งมีค่าใช้จ่ายเป็น 5.4 เท่าของอัตราแบตช์เมื่อเปิดตัว

กรอบที่ Microsoft ต้องการคือการกวาดเรียบทั้งลีดเดอร์บอร์ดสตรีมมิ่ง กรอบที่ตัวเลขสนับสนุนนั้นแคบกว่าและน่าสนใจกว่า — โมเดลที่อ้างว่าเป็นผู้นำทั้งด้านความแม่นยำและความหน่วงพร้อมกัน บนแนวหน้าซึ่งรายการที่แม่นยำที่สุดบนลีดเดอร์บอร์ดใช้เวลานิ่งนานกว่ารายการที่เร็วที่สุดของมันถึงสี่เท่า และไม่มีรายการเร็วเหล่านั้นรายการใดมีอัตราคำผิดระดับคำต่ำกว่า 3% โดยตั้งราคาเท่ากับผู้ครองตลาดรายเดิม ไม่ใช่ต่ำกว่า นี่คือการเปิดตัวตามที่เกิดขึ้นจริง โดยมีข้อกล่าวอ้างของผู้ขายติดป้ายกำกับไว้

สิ่งที่ Microsoft เปิดตัวเมื่อวันที่ 1 ตุลาคม

MAI-Transcribe-2-Streaming ให้บริการผ่านสแต็กเสียงพูดของ Microsoft ในบริการ Azure AI Speech โดยมีเอกสารประกอบภายใต้ชื่อของโมเดลเอง และใช้รูปแบบการเผยแพร่แบบ API เท่านั้น ไม่มีเวต เหมือนกับรุ่นแบตช์ โดยถอดเสียง 60 ภาษา พร้อมการตรวจจับภาษาต่อเนื่องอัตโนมัติ ดังนั้นเซสชันที่สลับภาษากลางสตรีมจึงไม่จำเป็นต้องประกาศไว้ล่วงหน้า Microsoft วางตำแหน่งโมเดลนี้บนพรมแดนพาเรโตระหว่างความแม่นยำกับความหน่วงในแผนภูมิสตรีมมิงของ Artificial Analysis — ซึ่งเป็นการตีความข้อมูลของแทร็กเกอร์โดยผู้ขายเอง และเป็นการตีความที่แผนภูมิของแทร็กเกอร์เองสนับสนุน

โมเดลสตรีมมิ่งไม่ใช่ทั้งหมดของการเปิดตัวครั้งนี้ ไมโครซอฟต์เปิดตัวโมเดลเสียงอีกสองตัวมาพร้อมกัน ได้แก่ MAI-Voice-2.1 ซึ่งครอบคลุม 23 ภาษาใน 26 โลแคล และ MAI-Voice-2.1-Flash ซึ่งประมวลผลเสียงได้สูงสุด 45 วินาทีด้วยความหน่วงประมาณ 150 มิลลิวินาที เมื่อมองเป็นชุดเดียวกัน การเปิดตัวเมื่อวันที่ 1 ตุลาคมจึงถือเป็นสแต็กการสนทนาแบบเรียลไทม์เต็มรูปแบบ — ฟัง เข้าใจ พูด — มากกว่าจะเป็นการเปิดตัวโมเดลเพียงตัวเดียว

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models as accurate, fast and low cost, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

กำลังอ่านตารางอันดับการสตรีม

AA-WER Streaming วัดสองสิ่งต่อโมเดล: บทถอดความที่เสร็จสมบูรณ์ผิดพลาดแค่ไหน และผู้พูดหยุดแล้วใช้เวลานานเท่าใดจึงจะเสร็จ คำกล่าวอ้างของ Microsoft คือ MAI-Transcribe-2-Streaming นำในทั้งสองด้าน: อัตราความผิดพลาดระดับคำ 2.5% บนบทถอดความสุดท้ายที่ 0.13 วินาทีหลังสิ้นสุดคำพูด และ 2.5% เดียวกันบนบทถอดความบางส่วนแรกที่ 0.12 วินาที ซึ่ง Microsoft กล่าวว่าเป็นอันดับหนึ่งด้านความแม่นยำในทั้งสองรายการ ให้อ่านค่านั้นในฐานะตัวเลขจากผู้ขาย — ณ เวลาที่จัดทำร่าง บอร์ดสตรีมมิ่งของ tracker เองยังไม่ได้พล็อตโมเดลนี้ ดังนั้นจึงไม่มีแถว MAI-Transcribe-2-Streaming แบบอิสระให้อ่าน สิ่งที่บอร์ดแสดงให้เห็นจริง ๆ คือสนามแข่งขันที่โมเดลนี้อ้างว่าจะเอาชนะ และสนามนั้นสูสีกันยิ่งกว่าที่กรอบแบบ "มงกุฎ" บ่งชี้:

• Grok Voice Transcribe 2.0 — ค่า WER ของข้อความถอดเสียงฉบับสุดท้าย 2.73% ที่ 0.49 วินาทีหลังสิ้นสุดเสียงพูด ตามข้อมูลจาก Artificial Analysis และเป็นผู้นำอันดับปัจจุบันบนกระดานจัดอันดับ ซึ่งตามหลัง 2.5% ที่ Microsoft อ้างไว้ 0.23 จุด และใช้เวลาสรุปผลช้ากว่าประมาณสี่เท่า — นั่นคือความต่างระหว่างคำบรรยายที่ตามทันกับคำบรรยายที่ล่าช้า

• Muse Voice Transcribe — 3.06% ที่ 0.16 วินาที ตามข้อมูลของ Artificial Analysis คู่แข่งที่ใกล้เคียงที่สุดในด้านความหน่วงตามหลังอยู่ประมาณ 30 มิลลิวินาที และมีความแม่นยำต่ำกว่าคำกล่าวอ้างของ Microsoft อยู่ 0.5 จุด

• ElevenLabs Scribe v2 Realtime — 3.59% ที่ 0.14 วินาที ตามข้อมูลของ Artificial Analysis ความเร็วแทบจะสูสีกัน แต่ความแม่นยำตามหลังอยู่มากกว่าหนึ่งจุด

• Gemini 3.5 Transcribe Live — WER แบบสตรีมมิ่ง 4.00% ที่ 0.40 วินาที ซึ่งเป็นตัวเลขที่ Artificial Analysis เผยแพร่ และ Google อ้างอิงสำหรับโมเดล Live API ของตัวเอง นั่นคือช่องว่าง 1.5 จุด และนี่คือการเปรียบเทียบที่การเปิดตัวนี้มุ่งเป้าไว้

คอลัมน์ first-partial คือจุดที่ข้อกล่าวอ้างนี้แตกต่างจากส่วนอื่น ๆ ของกระดานมากที่สุด บน tracker ตัวเดียวกัน first partial ของ Grok Voice Transcribe 2.0 อยู่ที่ 3.36% และของ Gemini 3.5 Transcribe Live อยู่ที่ 5.77% — โดยปกติ partial ควรแย่กว่า final transcript มักต่างกันหนึ่งจุดหรือมากกว่า เพราะโมเดลตัดสินใจก่อนที่ประโยคจะจบ first partial ที่ตรงกับตัวเลข final คือส่วนที่ผิดปกติอย่างแท้จริงของการเปิดตัวของ Microsoft และเป็นส่วนที่ข้อมูลของ tracker เองยังยืนยันไม่ได้ ให้อ้างอิงเป็นข้อกล่าวอ้างไปก่อนจนกว่าจะมีแถวข้อมูลปรากฏ

ข้อแม้ที่ตรงไปตรงมาคือ 0.13 วินาทีกับ 0.16 วินาทีเป็นประสบการณ์ผลิตภัณฑ์แบบเดียวกันสำหรับมนุษย์ที่อ่านคำบรรยาย และส่วนต่างระหว่าง 2.5% กับ 2.73% ที่นำตารางอันดับอยู่ในตอนนี้อยู่ที่ประมาณ 2 คำต่อ 1,000 คำ ส่วนนำขนาดนั้นมีจริงแต่เล็ก และจะเป็นส่วนนำที่ใคร ๆ รู้สึกได้หรือไม่นั้นขึ้นอยู่กับปริมาณงาน จุดที่มันกัดจริงคือส่วนปลาย: สตรีมของศูนย์ติดต่อที่ทำงานวันละ 8 ชั่วโมง ด้วยอัตรา 2.73% เทียบกับ 2.5% คือคำผิดเพิ่มอีกหลายหมื่นคำต่อปี และข้อผิดพลาดระดับคำในบทถอดเสียงไม่ได้กระจายอย่างสม่ำเสมอ — มันกระจุกตัวอยู่ที่คำนามเฉพาะและตัวเลขซึ่งเป็นสิ่งที่ทำให้บทถอดเสียงมีประโยชน์

A generated comparison card titled 'The streaming field, by the numbers' with a left column for MAI-Transcribe-2-Streaming (final-transcript word error rate 2.5% flagged as Microsoft's claim, time to final transcript 0.13s after speech end, first-partial word error rate 2.5% at 0.12s flagged as claimed, $9.00 per 1,000 minutes introductory, 60 languages with automatic detection, and 'not yet plotted' for the tracker's board) and a right column headed 'The field it claims to beat' listing Grok Voice Transcribe 2.0 at 2.73% and 0.49s, Muse Voice Transcribe at 3.06% and 0.16s, ElevenLabs Scribe v2 Realtime at 3.59% and 0.14s, Qwen3 ASR Flash Realtime at 3.73% and 0.48s, Gemini 3.5 Transcribe Live at 4.00% and 0.40s, and a board size of 37 models, with a footer noting that Microsoft's figures are the vendor's own claim measured on Artificial Analysis's streaming methodology while the right-hand column is what Artificial Analysis currently publishes, all times being after detected end of speech, and the OrcaRouter logo bottom right.

สิ่งที่ $9.00 ต่อ 1,000 นาทีซื้อได้

การสตรีมมีค่าใช้จ่ายสูงกว่าแบบแบตช์ และ Microsoft ตั้งราคาไว้ที่ระดับบนสุดของระดับเรียลไทม์ แทนที่จะต่ำกว่านั้น MAI-Transcribe-2-Streaming ตั้งราคาไว้ที่ $0.54 ต่อชั่วโมงเสียง ซึ่งคิดเป็น $9.00 ต่อ 1,000 นาทีของเสียงที่สตรีม โดยระบุว่าเป็นราคาแนะนำที่ใช้ได้จนถึงสิ้นปี สำหรับการเปรียบเทียบ แบบแบตช์ MAI-Transcribe-2 อยู่ที่ $0.10 ต่อชั่วโมงเสียง — $1.67 ต่อ 1,000 นาที — ดังนั้นการถอดเสียงแบบเรียลไทม์มีค่าใช้จ่ายประมาณ 5.4 เท่าของอัตราแบบไฟล์สำหรับตระกูลพื้นฐานเดียวกัน และมีค่าความผิดพลาดของคำมากกว่า 0.5 จุด นั่นไม่ใช่การบวกกำไรที่ Microsoft ซ่อนอยู่ แต่เป็นราคาที่ตรงไปตรงมาของการเชื่อมต่อแบบคงอยู่และการถอดเสียงบางส่วนที่ต้องแม่นยำก่อนที่ประโยคจะจบ

เมื่อเทียบกับโมเดลอื่น ๆ ในกลุ่มสตรีมมิง ภาพรวมยังคละกัน MAI-Transcribe-2-Streaming สูสีกับ Gemini 3.5 Transcribe Live ที่ราคาราว $9 ต่อ 1,000 นาที — แม่นยำกว่า ในราคาเท่ากัน โดยอยู่สูงกว่า ElevenLabs Scribe v2 Realtime และ Deepgram Flux ซึ่งอยู่ที่ราว $6.50 ต่อ 1,000 นาที อยู่สูงกว่า Cartesia Ink-2 ที่ราว $4 และสูงกว่า Muse Voice Transcribe ราวสามเท่า ซึ่งอยู่ที่ราว $3 ดังนั้นการเปิดตัวครั้งนี้จึงเป็นกลยุทธ์ที่เน้นความแม่นยำและความหน่วงในราคาที่เทียบเท่าคู่แข่ง ไม่ใช่สงครามราคา; ทีมที่ใช้โมเดลสตรีมมิงที่ถูกกว่าอยู่แล้วจะต้องจ่ายเงินเพิ่มขึ้นเพื่อแลกกับคะแนน WER ที่ดีขึ้น

การแลกเปลี่ยนนั้นควรค่าแก่การเรียกชื่อให้แม่นยำ เพราะมันเป็นการแลกเปลี่ยนเดียวกันกับที่การเปิดตัวแบบแบตช์ได้พลิกกลับ ในเดือนกันยายน Microsoft ทำให้ความแม่นยำมีราคาถูก ในเดือนตุลาคม มันทำให้ความแม่นยำแบบเรียลไทม์มีค่าใช้จ่ายเท่ากับของรายอื่น ๆ หากไปป์ไลน์ของคุณต้องการเพียงบทถอดเสียงในภายหลัง ก็ไม่มีอะไรเกี่ยวกับวันที่ 1 ตุลาคมที่จะเปลี่ยนบิลของคุณ หากมันต้องการบทถอดเสียงเหล่านั้นในขณะที่สายยังคงดำเนินอยู่ การคำนวณก็เพิ่งเปลี่ยนไปสู่คุณภาพ

A single-column scoreboard card titled 'MAI-Transcribe-2-Streaming — the launch scoreboard' listing 2.5% final-transcript WER at 0.13s, 2.5% first-partial WER at 0.12s, an accuracy rank claimed at #1 for final and partial transcripts, tracker status 'not yet plotted on the 37-model board', $9.00 per 1,000 minutes ($0.54 per audio-hour) introductory through 2026, 60 languages with automatic continuous detection, no published diarization or word-level timestamp claim for the streaming SKU, and the batch sibling MAI-Transcribe-2 at 2.0% AA-WER, roughly 411x real time and $1.67 per 1,000 minutes, with the OrcaRouter logo bottom right.

การสร้างต่อยอดจากทรานสคริปต์คืออีกครึ่งหนึ่งของการตัดสินใจนั้น และนั่นคือจุดที่เลเยอร์แบบหลายโมเดลพิสูจน์คุณค่าของตัวเอง ทรานสคริปต์แบบเรียลไทม์แทบไม่เคยเป็นจุดสิ้นสุดของไปป์ไลน์ — มันถูกนำไปสรุป ให้คะแนน ค้นหา จัดเส้นทาง และส่งต่อ升級 และขั้นตอนเหล่านั้นต้องการโมเดลที่แตกต่างกันด้วยต้นทุนที่แตกต่างกัน OrcaRouter มีอยู่เพื่อเลเยอร์นั้น: API เดียวที่ครอบคลุมโมเดลกว่า 200 รายการ ราคาตามประกาศของผู้ให้บริการส่งผ่านตรงโดยบวกกำไร 0% การสลับไปใช้ระบบสำรองอัตโนมัติ และ DSL สำหรับจัดเส้นทางที่สามารถส่งทรานสคริปต์สดไปยังโมเดลหนึ่งเพื่อการตรวจสอบด้านคอมพลายแอนซ์ และอีกโมเดลหนึ่งสำหรับจดบันทึกการประชุม โดยไม่ต้องบูรณาการเพิ่มเป็นครั้งที่สอง ตัว MAI-Transcribe-2-Streaming เองไม่ได้อยู่ในรายชื่อนั้น — มันให้บริการผ่านสแต็กเสียงพูดของ Microsoft เอง — แต่ทรานสคริปต์แบบสตรีมมิ่งที่มันสร้างขึ้นนั้นเป็นอินพุตปริมาณสูงที่ไวต่อความหน่วงแบบเดียวกับที่เป็นเหตุผลสนับสนุนให้คงเลเยอร์ที่อยู่เหนือมันไว้เป็นแบบไม่ผูกกับโมเดลใดโมเดลหนึ่ง

อะไรที่ยังไม่ได้รับการพิสูจน์

มีสามประเด็นที่ยังเป็นคำถามเปิดอยู่จริง ๆ ประการแรก การแยกผู้พูด (diarization): โมเดลแบบแบตช์รวมการระบุผู้พูดไว้ด้วยกัน โดยไม่มีการเผยแพร่อัตราความผิดพลาดในการแยกผู้พูด และเอกสารเกี่ยวกับสตรีมมิ่งของ Microsoft ไม่ได้กล่าวอ้างเรื่องการแยกผู้พูดเลย — สำหรับโมเดลเรียลไทม์ที่ป้อนระบบช่วยเหลือเจ้าหน้าที่แบบสดหรือคำบรรยาย การรู้ว่าใครพูดอะไร มักเป็นคุณสมบัติที่สำคัญกว่า WER ดิบ ๆ ประการที่สอง รายละเอียดการรองรับหลายภาษา: การรองรับ 60 ภาษาพร้อมการตรวจจับภาษาแบบต่อเนื่องอัตโนมัติเป็นข้ออ้างที่กว้าง และความหน่วงรายภาษาของโมเดลสตรีมมิ่งอาจแปรผันได้มากกว่าของโมเดลแบบแบตช์มาก เพราะคุณภาพบทถอดความบางส่วนขึ้นอยู่กับว่าโมเดลตัดสินใจเลือกภาษาได้เร็วเพียงใด Microsoft ไม่ได้เผยแพร่ตารางสตรีมมิ่งรายภาษาเลย ประการที่สาม WER ของสตรีมมิ่งวัดจากเสียง benchmark ที่สะอาด; รูปแบบความล้มเหลวที่ส่งผลเสียต่อการใช้งานจริงคือสตรีมฟาร์ฟิลด์ที่มีเสียงรบกวน และไม่มีการเปรียบเทียบสตรีมมิ่งฟาร์ฟิลด์ที่เป็นอิสระในวันเปิดตัว

จุดที่มันออกจากสแต็กของคุณ

สิ่งที่น่าสนใจเกี่ยวกับการเปิดตัวครั้งนี้ไม่ใช่ว่า Microsoft มีข้อความถอดเสียงแบบสตรีมมิ่งที่แม่นยำที่สุด แต่เป็นจังหวะ: แบตช์ในเดือนกันยายน สตรีมมิ่งในเดือนตุลาคม ในตระกูลเดียวกัน บนพื้นผิวเอกสารเดียวกัน โดยมีโครงสร้างราคาที่ครอบคลุมตั้งแต่ $1.67 ถึง $9.00 ต่อ 1,000 นาทีสำหรับความสามารถพื้นฐานเดียวกัน สิ่งนี้ทำให้ทีมต่างๆ มีทางเลือกจริงเป็นครั้งแรก — จ่ายสำหรับเรียลไทม์เฉพาะจุดที่เรียลไทม์มีความสำคัญ และใช้แบตช์กับทุกอย่างที่เหลือ — แต่มันยังหมายความว่าเลเยอร์การถอดเสียงตอนนี้เป็นสิ่งที่คุณปรับแต่งตามเวิร์กโหลด แทนที่จะกำหนดมาตรฐานเพียงครั้งเดียว

อ่านข้อกล่าวอ้างในพาดหัวข่าวตามตัวอักษรแล้ว มันก็ถือเป็นคำแถลงของผู้ขายได้ว่า: Microsoft กล่าวว่า MAI-Transcribe-2-Streaming เป็นอันดับหนึ่งทั้งในด้านความแม่นยำของทรานสคริปต์สุดท้ายและความแม่นยำของผลลัพธ์บางส่วนครั้งแรก และว่ามันอยู่บนพรมแดนพาเรโต เครื่องหมายดอกจันคือ กระดานของ tracker ยังไม่ได้พล็อตโมเดล ความได้เปรียบที่มันอ้างว่ามีเหนือผู้นำปัจจุบันนั้นน้อยพอที่จะหายไปในการรันซ้ำ ความได้เปรียบด้านราคาเป็นศูนย์ และเรื่องราวเกี่ยวกับการแยกผู้พูด (diarization) ยังไม่ถูกเล่า นั่นคือสิ่งที่ต้องจับตามอง ไม่ใช่ตำแหน่งมงกุฎ

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube