การ์ดฮีโร่บทความที่อ่านว่า 'MAI-Transcribe-2-Streaming vs MAI-Transcribe-2' พร้อมป้าย 'ตระกูลเดียวกัน · สองระดับราคา' และคำบรรยายย่อย 'จ่ายแพงขึ้น 5.4 เท่าสำหรับการจับเวลาระดับคำ' สร้างเป็นสองการ์ดชื่อโมเดลคั่นด้วยป้าย VS โดยมีแถบชิปแสดง $9.00 เทียบกับ $1.67 ต่อ 1,000 นาที อัตราความผิดพลาดระดับคำที่อ้างว่า 2.5% เทียบกับที่ตรวจสอบแล้ว 2.0% ใช้เวลา 0.13 วินาทีถึงบทถอดความสุดท้าย เทียบกับความเร็วประมาณ 411 เท่าของเวลาจริง และมีตราเวลาและการแยกผู้พูดเฉพาะในระดับแบตช์เท่านั้น บนพื้นหลังไล่ระดับสีขาวถึงน้ำเงินพร้อมโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

MAI-Transcribe-2-Streaming กับ MAI-Transcribe-2: จ่าย 5.4 เท่าเพื่อการจับเวลาระดับคำ

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

MAI-Transcribe-2-Streaming และ MAI-Transcribe-2 เป็นตระกูลโมเดลเดียวกันที่แยกออกเป็นสองระดับราคา และการแยกนีั่ชัดเจนพอที่จะใช้วางแผนได้ MAI-Transcribe-2 เปิดตัวเมื่อวันที่ 3 กันยายน 2026 ในฐานะโมเดลแบบแบตช์: อัตราความผิดพลาดระดับคำ 2.0% บนบอร์ดแบบไม่สตรีมมิ่งของ Artificial Analysis ประมาณ 411 เท่าของเวลาจริง และ $0.10 ต่อชั่วโมงเสียง — ประมาณ $1.67 ต่อ 1,000 นาที MAI-Transcribe-2-Streaming เปิดตัวเมื่อวันที่ 1 ตุลาคม 2026 ในฐานะตัวแปรแบบเรียลไทม์: อัตราความผิดพลาดระดับคำแบบสตรีมมิ่งที่อ้างว่า 2.5% ใช้เวลา 0.13 วินาทีถึงบทถอดเสียงฉบับสุดท้าย ซึ่ง Microsoft อธิบายว่าเป็นเจ้าแรกในด้านความแม่นยำทั้งบทถอดเสียงฉบับสุดท้ายและฉบับบางส่วน โดยวัดตามวิธีการสตรีมมิ่งของ Artificial Analysis มากกว่าที่จะถูกนำมาพล็อตเป็นแถวบนบอร์ดของตัวติดตามในตอนนี้ $0.54 ต่อชั่วโมงเสียง — ประมาณ $9.00 ต่อ 1,000 นาที ภาษาเดียวกัน 60 ภาษา การเผยแพร่แบบ API-only เหมือนกัน ไม่มีค่าน้ำหนักโมเดลเผยแพร่ สตรีมมิ่งมีค่าใช้จ่าย 5.4 เท่าของอัตราแบบแบตช์ และจากตัวเลขของ Microsoft เอง ความแม่นยำลดลง 0.5 จุด ไม่ว่าสิ่งนั้นจะเป็นข้อเสนอที่คุ้มค่าหรือเป็นภาษีที่ต้องจ่าย ย่อมขึ้นอยู่กับคำถามเดียวทั้งหมด: มีอะไรในไปป์ไลน์ของคุณที่ต้องการบทถอดเสียงก่อนที่ประโยคจะจบหรือไม่?

เนื่องจากโมเดลทั้งสองมาจากผู้ขายรายเดียวและแหล่งเอกสารชุดเดียว การเปรียบเทียบจึงสะอาดผิดปกติ — ไม่ต้องเดาความเสมอภาคของคุณสมบัติ ไม่มีความคลาดเคลื่อนของเวอร์ชันเบนช์มาร์ก ไม่มี "ตัวเลขของพวกเขากับตัวเลขของเรา" มันคือผู้ขายรายเดียวที่ตั้งราคาความสามารถเดียวกันในสองระดับความเร็ว และงานที่น่าสนใจคือการหาว่าเวิร์กโหลดแบบใดที่ระดับราคาถูกครอบคลุมจริง ๆ

ครอบครัว ในสองแถว

• MAI-Transcribe-2 — แบบแบตช์, เสียงที่บันทึกไว้ล่วงหน้า, เปิดตัวเมื่อวันที่ 3 กันยายน 2026. AA-WER 2.0%, เป็นอันดับสองในลีดเดอร์บอร์ดแบบไม่สตรีมมิ่งของ Artificial Analysis. ประมาณ 411 เท่าของเวลาจริง, เป็นอันดับสองเช่นกัน. $0.10 ต่อชั่วโมงเสียง, ประมาณ $1.67 ต่อ 1,000 นาที, เป็นข้อเสนอแบบจำกัดเวลาถึงสิ้นปี โดยไม่มีราคามาตรฐานเผยแพร่. รวมการแยกผู้พูดและส่งคืนการประทับเวลาระดับคำ. 60 ภาษาพร้อมการระบุภาษาอัตโนมัติ.

• MAI-Transcribe-2-Streaming — การถอดเสียงแบบต่อเนื่องแบบเรียลไทม์ในสไตล์ WebSocket เปิดตัวเมื่อวันที่ 1 ตุลาคม 2026 Microsoft รายงานค่า WER ของทรานสคริปต์ฉบับสุดท้ายที่ 2.5% ภายใน 0.13 วินาทีหลังสิ้นสุดการพูด และ 2.5% เท่ากันในทรานสคริปต์บางส่วนครั้งแรกที่ 0.12 วินาที ซึ่งอธิบายว่าเป็นครั้งแรกที่มีความแม่นยำในทั้งสองกรณี — เป็นคำกล่าวอ้างของผู้จำหน่ายที่วัดตามระเบียบวิธีสตรีมมิ่งของ Artificial Analysis แม้ว่า ณ เวลาที่ร่าง กระดานของตัวติดตามเอง (37 โมเดล) ยังไม่ได้พลอตโมเดลนี้ และผู้นำปัจจุบันคือ Grok Voice Transcribe 2.0 ที่ 2.73% และ 0.49 วินาที $0.54 ต่อชั่วโมงเสียง ประมาณ $9.00 ต่อ 1,000 นาที ในราคาเปิดตัวถึงสิ้นปี 60 ภาษาพร้อมการตรวจจับภาษาต่อเนื่องอัตโนมัติ ไม่มีข้ออ้างเรื่องการแยกผู้พูดที่เผยแพร่ ไม่มีข้ออ้างเรื่องการประทับเวลาคำที่เผยแพร่

ความไม่สมมาตรเพียงอย่างเดียวที่ไม่เกี่ยวกับความเร็วหรือราคาคือความสามารถ: การแยกผู้พูด (diarization) และการประทับเวลาระดับคำของโมเดลแบบแบตช์เป็นฟีเจอร์ที่ระบุไว้ในเอกสาร ส่วนของโมเดลแบบสตรีมมิงไม่ได้ระบุไว้ เรื่องนี้สำคัญกว่าช่องว่างความแม่นยำ 0.5 จุด และเป็นเหตุผลที่หลายทีมจะลงเอยด้วยการรันทั้งสองแบบ

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

5.4× ให้อะไรได้จริง

ที่ $1.67 ต่อ 1,000 นาที การถอดเสียงแบบแบตช์ในระดับความแม่นยำนี้แทบไม่มีต้นทุนส่วนเพิ่ม ที่ $9.00 ต่อ 1,000 นาที การสตรีมกลายเป็นรายจ่ายจริงจัง — ประมาณค่าใช้จ่ายในการถอดเสียงไฟล์เดียวกันห้ารอบ บวกกับความแม่นยำอีกครึ่งจุด ดังนั้น คำถามไม่ใช่ว่าเรียลไทม์คุ้มค่ามากกว่าหรือไม่ แต่เป็นว่านาทีใดบ้างที่ต้องการมัน

เวิร์กโหลดที่ชัดเจนว่าต้องใช้คือ คำบรรยายสดที่คนอ่านขณะผู้พูดกำลังพูด ซึ่ง 0.13 วินาทีเมื่อเทียบกับการรอจนจบไฟล์คือผลิตภัณฑ์ทั้งหมด การช่วยเหลือเอเจนต์แบบเรียลไทม์และการให้คะแนนด้านการปฏิบัติตามกฎ ซึ่งการแทรกแซงที่มาถึงหลังสายจบลงก็ไร้ค่า และแอปพลิเคชันเสียงเชิงโต้ตอบ ซึ่งรอบสนทนาหนึ่งจะเสร็จสมบูรณ์ไม่ได้จนกว่าบทถอดความจะเสร็จ ในทั้งสามกรณี โมเดลแบบแบตช์ไม่ใช่ตัวเลือกที่ถูกกว่า แต่เป็นตัวเลือกที่ใช้ไม่ได้เลย — ไม่มีราคาใดที่ทำให้การถอดความย้อนหลังกลายเป็นเรียลไทม์ได้

เวิร์กโหลดที่เห็นได้ชัดว่าไม่ใช่: การบันทึกการประชุมและการสนทนาที่ประมวลผลภายหลัง คลังสื่อ การตรวจสอบคุณภาพแบบแบตช์ของศูนย์ติดต่อ การตรวจสอบการปฏิบัติตามข้อกำหนดของสายที่เสร็จสิ้นแล้ว การใส่คำบรรยายพอดแคสต์และวิดีโอ เหล่านี้คือไปป์ไลน์ที่โมเดลแบบแบตช์ซึ่งมีความเร็ว 411 เท่าของเวลาจริงและเรต $1.67 ถูกสร้างมาเพื่อชนะโดยเฉพาะ และการจ่ายแพงขึ้น 5.4 เท่าเพื่อลดเวลาแค่ไม่กี่ร้อยมิลลิวินาทีจากทรานสคริปต์ที่ไม่มีใครอ่านจนถึงพรุ่งนี้ถือเป็นการสิ้นเปลืองโดยตรง เพิ่มคุณสมบัติการแยกผู้พูดและการประทับเวลาเป็นคำ — โมเดลแบบแบตช์มีคุณสมบัติเหล่านี้ในเอกสาร ส่วนโมเดลแบบสตรีมมิงไม่มี — และกรณีการประมวลผลภายหลังก็ยิ่งแข็งแกร่งขึ้น ไม่ใช่อ่อนลง

จุดที่น่าสนใจคือตรงกลาง ซึ่งเป็นจุดที่ทั้งสองวิธีเสริมกันอย่างแท้จริง: ใช้สตรีมมิ่งกับส่วนที่ต้องใช้งานสด และใช้แบตช์กับส่วนที่ต้องเก็บเป็นบันทึก สายสนับสนุนที่ถูกถอดเสียงแบบเรียลไทม์เพื่อขับเคลื่อนแผงช่วยเหลือเอเจนต์ แล้วถูกถอดเสียงซ้ำแบบแบตช์ข้ามคืนเพื่อสร้างบทถอดเสียงฉบับเก็บถาวรพร้อมการแยกผู้พูดและตราเวลา มีค่าใช้จ่ายเพิ่มขึ้นเล็กน้อยเมื่อเทียบกับใช้แบตช์อย่างเดียว และได้พฤติกรรมทั้งสองแบบ รูปแบบนั้นเพิ่งเป็นไปได้ในเดือนกันยายน และรีลีสเดือนตุลาคมคือสิ่งที่ทำให้มันสมบูรณ์

จุดที่โครงสร้างแบบแบ่งสองส่วนปรากฏให้เห็น

สองสิ่งเกี่ยวกับครอบครัวนี้ที่ควรค่าแก่การสังเกต เพราะมันเป็นเรื่องเชิงโครงสร้างมากกว่าเป็นเรื่องบังเอิญ

ประการแรก ลำดับชั้นความแม่นยำกลับตาลปัตรจากรูปแบบปกติ โมเดลแบบสตรีมมิงโดยทั่วไปต้องจ่ายภาษีความแม่นยำก้อนใหญ่เพื่อแลกกับเอาต์พุตแบบเรียลไทม์ แต่ในกรณีนี้ภาษีอยู่ที่ 0.5 จุด จาก 2.0% บนกระดานแบบแบตช์ ไปเป็น 2.5% ที่อ้างบนกระดานแบบสตรีมมิง Microsoft ได้โมเดลเรียลไทม์ที่มีคะแนนห่างจากเรือธงแบบแบตช์ของตนไม่ถึงครึ่งจุด เมื่อดูจากตัวเลขของบริษัทเอง ซึ่งนี่คือความสำเร็จทางวิศวกรรมที่แท้จริงของการเปิดตัวในเดือนตุลาคม หากตัวเลขนี้ยังคงอยู่ — ไม่ใช่ตำแหน่งบนสุดของกระดาน ซึ่งการรันซ้ำที่ดีอาจทำให้ตำแหน่งเปลี่ยนไป และซึ่งตัวติดตามยังไม่ได้ยืนยัน

ประการที่สอง การกำหนดราคาก็สวนทางกับรูปแบบปกติเช่นกัน โดยทั่วไปผู้ขายมักให้ส่วนลดกับระดับปริมาณที่สูงกว่า แต่ Microsoft ตั้งราคาสตรีมมิ่งไว้ที่ 5.4 เท่าของแบตช์ และปล่อยให้ทั้งสองแบบอยู่ในราคาช่วงเริ่มต้นที่หมดอายุพร้อมกัน ซึ่งอ่านแล้วไม่ค่อยเหมือนการตั้งราคาพรีเมียมสำหรับสตรีมมิ่งโดยเจตนา แต่เหมือนการเปิดตัวสองครั้งแยกกัน โดยแต่ละครั้งมีส่วนลดเปิดตัว และไม่มีอัตรามาตรฐานที่ประกาศไว้สำหรับทั้งสองแบบ ทีมที่กำลังวางแผนงบประมาณปี 2027 ควรถือว่าตัวเลขทั้งสองเป็นตัวเลขชั่วคราว — ทั้ง $1.67 และ $9.00 ต่างมีป้ายกำกับว่าเป็นราคาจำกัดเวลา และทั้งคู่ยังไม่มีราคาสืบทอดที่ประกาศไว้

A generated two-column scoreboard card titled 'One family, two divisions' contrasting MAI-Transcribe-2 (batch) — non-streaming, 2.0% AA-WER at #2, roughly 411x real time at #2, $1.67 per 1,000 minutes ($0.10 per audio-hour), bundled diarization, returned word timestamps, 60 languages with automatic ID, released September 3, 2026 — with MAI-Transcribe-2-Streaming — streaming, 2.5% claimed word error rate, 0.13s to final transcript, $9.00 per 1,000 minutes ($0.54 per audio-hour), diarization not published, word timestamps not published, 60 languages with continuous detection, released October 1, 2026, with the OrcaRouter logo bottom right.

อะไรที่ยังไม่ได้รับการพิสูจน์

คำถามที่ยังไม่มีคำตอบของโมเดลแบบแบตช์จากเดือนกันยายนยังคงค้างอยู่: ไม่มีอัตราความผิดพลาดในการแยกผู้พูดที่เผยแพร่ ไม่มีรายละเอียดแยกตามภาษาที่รองรับคำกล่าวอ้างเรื่อง 60 ภาษา และมีราคาโปรโมชันโดยไม่มีชื่อรุ่นสืบทอด โมเดลสตรีมมิ่งเพิ่มอีกหนึ่งข้อที่เฉพาะกับงานเรียลไทม์ — WER ของสตรีมมิ่งวัดบนเสียงสะอาด และคุณภาพของบทถอดความบางส่วนในสตรีมระยะไกลที่มีเสียงรบกวนคือจุดล้มเหลวที่สำคัญที่สุดในการใช้งานจริง และถูกกล่าวถึงน้อยที่สุดในเอกสารเปิดตัว นอกจากนี้ยังสืบทอดความใกล้ชิดของกระดานจัดอันดับสตรีมมิ่ง: สามอันดับแรกบนกระดาน 37 โมเดลของ tracker อยู่ห่างกันเพียงเศษเสี้ยวคะแนน ดังนั้น "อันดับหนึ่ง" จึงเป็นสถานะที่การรันซ้ำสามารถเปลี่ยนแปลงได้ — และอันดับหนึ่งของ Microsoft เป็นคำกล่าวอ้างมากกว่าเป็นแถวในตาราง

อย่างไรก็ตาม คำถามระดับตระกูลผลิตภัณฑ์คือสิ่งที่ต้องจับตามอง ตอนนี้ Microsoft ขายความสามารถเดียวกันในสองราคาที่ต่างกันถึงห้าเท่า โดยระดับราคาแพงขาดสองฟีเจอร์ที่ระดับราคาถูกระบุไว้ในเอกสาร หากการแยกผู้พูด (diarization) และการประทับเวลาเป็นคำ (word timestamps) มาสู่ SKU แบบสตรีมมิ่ง ช่องว่างจะแคบลงเหลือเพียงการแลกเปลี่ยนระหว่างความหน่วงกับราคา ซึ่งเป็นการตัดสินใจที่ง่ายกว่ามาก หากไม่มา โครงสร้างแบบสองส่วนจะคงอยู่ถาวร และสถาปัตยกรรมควรถูกสร้างขึ้นโดยยึดโครงสร้างนั้นเป็นหลัก

สิ่งนี้ทำให้สแต็กการถอดเสียงอยู่ตรงไหน

A generated routing card titled 'Which minutes go on which tier' splitting workloads into a streaming column (live captions a person reads while the speaker talks, real-time agent assist, compliance or quality scoring that must land before the call ends, interactive voice turns) and a batch column (meeting and call recordings processed after the fact, media archives, contact-centre batch QA, podcast and video captioning, anything needing bundled diarization or word-level timestamps), with a note that a stream-and-reprocess pattern covers both and a footer stating that neither tier is on OrcaRouter and both are served through Microsoft's own speech stack, with the OrcaRouter logo bottom right.

ผลลัพธ์ในทางปฏิบัติก็คือ การถอดเสียงไม่ได้เป็นแค่รายการเดียวในเดือนกันยายนอีกต่อไป และกลายเป็นการตัดสินใจเรื่องการกำหนดเส้นทางในเดือนตุลาคม ไปป์ไลน์ที่เคยใช้ API เดียวเป็นมาตรฐาน ตอนนี้ต้องการสตรีมมิ่งสำหรับงานที่ใช้งานสด แบตช์สำหรับการจัดเก็บเป็นบันทึก และกฎว่าออดิโอใดควรไปเส้นทางใด — และกฎนั้นเองก็เป็นปัญหาการกำหนดเส้นทาง ซึ่งเป็นความซับซ้อนในระดับที่แปลกที่จะไปลงเอยในรอบการเปิดตัวของผู้ขายรายเดียว

มันกระทบหนักที่สุดกับสิ่งที่อยู่เหนือทรานสคริปต์ขึ้นไป ไม่ว่าจะเป็น tier ใดที่สร้างข้อความ ข้อความนั้นก็จะถูกสรุป จำแนกประเภท ปกปิดข้อมูลอ่อนไหว และจัดเส้นทาง และขั้นตอนเหล่านั้นรันบนโมเดลภาษาที่มีโปรไฟล์ความหน่วงและต้นทุนเป็นของตัวเอง — ทรานสคริปต์สดต้องการโมเดลที่เร็วและราคาถูก ส่วนทรานสคริปต์แบบเก็บถาวรสามารถใช้โมเดลที่แข็งแกร่งกว่าได้ OrcaRouter ครอบคลุมเลเยอร์นั้นพอดี: API เดียวที่ใช้ได้กับโมเดล 200+ ตัว, ราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยมี markup 0%, การ failover อัตโนมัติ, และ routing DSL ที่เลือกโมเดลต่อเวิร์กโหลดแทนที่จะต่อไปป์ไลน์ ทั้ง MAI-Transcribe-2-Streaming และ MAI-Transcribe-2 ต่างก็ไม่ได้อยู่ในรายชื่อนั้น — ทั้งคู่ให้บริการผ่านสแต็กเสียงพูดของ Microsoft เอง — แต่เลเยอร์ถอดเสียงแบบสองส่วนนี้เป็นข้อโต้แย้งที่แข็งแกร่งที่สุดเท่าที่เคยมีมา สำหรับการทำให้ทุกอย่างที่อยู่ปลายน้ำของมันสามารถพกพาไปใช้ที่อื่นได้

สรุปตามจริง: สตรีมมิ่งไม่ใช่ MAI-Transcribe-2 ที่ดีกว่า แต่เป็นผลิตภัณฑ์ตัวที่สองในราคาที่สอง ซื้อมันสำหรับนาทีที่จำเป็นต้องเป็นเรียลไทม์จริง ๆ เท่านั้น ปล่อยส่วนที่เหลือไว้บนระดับราคาถูก และเผื่องบไว้สำหรับอัตราทั้งสองที่จะถูกปรับราคาใหม่เมื่อช่วงแนะนำสิ้นสุดลง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube