
MAI-Transcribe-2-Streaming กับ MAI-Transcribe-2: จ่าย 5.4 เท่าเพื่อการจับเวลาระดับคำ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 221 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
MAI-Transcribe-2-Streaming และ MAI-Transcribe-2 เป็นตระกูลโมเดลเดียวกันที่แยกออกเป็นสองระดับราคา และการแยกนีั่ชัดเจนพอที่จะใช้วางแผนได้ MAI-Transcribe-2 เปิดตัวเมื่อวันที่ 3 กันยายน 2026 ในฐานะโมเดลแบบแบตช์: อัตราความผิดพลาดระดับคำ 2.0% บนบอร์ดแบบไม่สตรีมมิ่งของ Artificial Analysis ประมาณ 411 เท่าของเวลาจริง และ $0.10 ต่อชั่วโมงเสียง — ประมาณ $1.67 ต่อ 1,000 นาที MAI-Transcribe-2-Streaming เปิดตัวเมื่อวันที่ 1 ตุลาคม 2026 ในฐานะตัวแปรแบบเรียลไทม์: อัตราความผิดพลาดระดับคำแบบสตรีมมิ่งที่อ้างว่า 2.5% ใช้เวลา 0.13 วินาทีถึงบทถอดเสียงฉบับสุดท้าย ซึ่ง Microsoft อธิบายว่าเป็นเจ้าแรกในด้านความแม่นยำทั้งบทถอดเสียงฉบับสุดท้ายและฉบับบางส่วน โดยวัดตามวิธีการสตรีมมิ่งของ Artificial Analysis มากกว่าที่จะถูกนำมาพล็อตเป็นแถวบนบอร์ดของตัวติดตามในตอนนี้ $0.54 ต่อชั่วโมงเสียง — ประมาณ $9.00 ต่อ 1,000 นาที ภาษาเดียวกัน 60 ภาษา การเผยแพร่แบบ API-only เหมือนกัน ไม่มีค่าน้ำหนักโมเดลเผยแพร่ สตรีมมิ่งมีค่าใช้จ่าย 5.4 เท่าของอัตราแบบแบตช์ และจากตัวเลขของ Microsoft เอง ความแม่นยำลดลง 0.5 จุด ไม่ว่าสิ่งนั้นจะเป็นข้อเสนอที่คุ้มค่าหรือเป็นภาษีที่ต้องจ่าย ย่อมขึ้นอยู่กับคำถามเดียวทั้งหมด: มีอะไรในไปป์ไลน์ของคุณที่ต้องการบทถอดเสียงก่อนที่ประโยคจะจบหรือไม่?
เนื่องจากโมเดลทั้งสองมาจากผู้ขายรายเดียวและแหล่งเอกสารชุดเดียว การเปรียบเทียบจึงสะอาดผิดปกติ — ไม่ต้องเดาความเสมอภาคของคุณสมบัติ ไม่มีความคลาดเคลื่อนของเวอร์ชันเบนช์มาร์ก ไม่มี "ตัวเลขของพวกเขากับตัวเลขของเรา" มันคือผู้ขายรายเดียวที่ตั้งราคาความสามารถเดียวกันในสองระดับความเร็ว และงานที่น่าสนใจคือการหาว่าเวิร์กโหลดแบบใดที่ระดับราคาถูกครอบคลุมจริง ๆ
ครอบครัว ในสองแถว
• MAI-Transcribe-2 — แบบแบตช์, เสียงที่บันทึกไว้ล่วงหน้า, เปิดตัวเมื่อวันที่ 3 กันยายน 2026. AA-WER 2.0%, เป็นอันดับสองในลีดเดอร์บอร์ดแบบไม่สตรีมมิ่งของ Artificial Analysis. ประมาณ 411 เท่าของเวลาจริง, เป็นอันดับสองเช่นกัน. $0.10 ต่อชั่วโมงเสียง, ประมาณ $1.67 ต่อ 1,000 นาที, เป็นข้อเสนอแบบจำกัดเวลาถึงสิ้นปี โดยไม่มีราคามาตรฐานเผยแพร่. รวมการแยกผู้พูดและส่งคืนการประทับเวลาระดับคำ. 60 ภาษาพร้อมการระบุภาษาอัตโนมัติ.
• MAI-Transcribe-2-Streaming — การถอดเสียงแบบต่อเนื่องแบบเรียลไทม์ในสไตล์ WebSocket เปิดตัวเมื่อวันที่ 1 ตุลาคม 2026 Microsoft รายงานค่า WER ของทรานสคริปต์ฉบับสุดท้ายที่ 2.5% ภายใน 0.13 วินาทีหลังสิ้นสุดการพูด และ 2.5% เท่ากันในทรานสคริปต์บางส่วนครั้งแรกที่ 0.12 วินาที ซึ่งอธิบายว่าเป็นครั้งแรกที่มีความแม่นยำในทั้งสองกรณี — เป็นคำกล่าวอ้างของผู้จำหน่ายที่วัดตามระเบียบวิธีสตรีมมิ่งของ Artificial Analysis แม้ว่า ณ เวลาที่ร่าง กระดานของตัวติดตามเอง (37 โมเดล) ยังไม่ได้พลอตโมเดลนี้ และผู้นำปัจจุบันคือ Grok Voice Transcribe 2.0 ที่ 2.73% และ 0.49 วินาที $0.54 ต่อชั่วโมงเสียง ประมาณ $9.00 ต่อ 1,000 นาที ในราคาเปิดตัวถึงสิ้นปี 60 ภาษาพร้อมการตรวจจับภาษาต่อเนื่องอัตโนมัติ ไม่มีข้ออ้างเรื่องการแยกผู้พูดที่เผยแพร่ ไม่มีข้ออ้างเรื่องการประทับเวลาคำที่เผยแพร่
ความไม่สมมาตรเพียงอย่างเดียวที่ไม่เกี่ยวกับความเร็วหรือราคาคือความสามารถ: การแยกผู้พูด (diarization) และการประทับเวลาระดับคำของโมเดลแบบแบตช์เป็นฟีเจอร์ที่ระบุไว้ในเอกสาร ส่วนของโมเดลแบบสตรีมมิงไม่ได้ระบุไว้ เรื่องนี้สำคัญกว่าช่องว่างความแม่นยำ 0.5 จุด และเป็นเหตุผลที่หลายทีมจะลงเอยด้วยการรันทั้งสองแบบ

5.4× ให้อะไรได้จริง
ที่ $1.67 ต่อ 1,000 นาที การถอดเสียงแบบแบตช์ในระดับความแม่นยำนี้แทบไม่มีต้นทุนส่วนเพิ่ม ที่ $9.00 ต่อ 1,000 นาที การสตรีมกลายเป็นรายจ่ายจริงจัง — ประมาณค่าใช้จ่ายในการถอดเสียงไฟล์เดียวกันห้ารอบ บวกกับความแม่นยำอีกครึ่งจุด ดังนั้น คำถามไม่ใช่ว่าเรียลไทม์คุ้มค่ามากกว่าหรือไม่ แต่เป็นว่านาทีใดบ้างที่ต้องการมัน
เวิร์กโหลดที่ชัดเจนว่าต้องใช้คือ คำบรรยายสดที่คนอ่านขณะผู้พูดกำลังพูด ซึ่ง 0.13 วินาทีเมื่อเทียบกับการรอจนจบไฟล์คือผลิตภัณฑ์ทั้งหมด การช่วยเหลือเอเจนต์แบบเรียลไทม์และการให้คะแนนด้านการปฏิบัติตามกฎ ซึ่งการแทรกแซงที่มาถึงหลังสายจบลงก็ไร้ค่า และแอปพลิเคชันเสียงเชิงโต้ตอบ ซึ่งรอบสนทนาหนึ่งจะเสร็จสมบูรณ์ไม่ได้จนกว่าบทถอดความจะเสร็จ ในทั้งสามกรณี โมเดลแบบแบตช์ไม่ใช่ตัวเลือกที่ถูกกว่า แต่เป็นตัวเลือกที่ใช้ไม่ได้เลย — ไม่มีราคาใดที่ทำให้การถอดความย้อนหลังกลายเป็นเรียลไทม์ได้
เวิร์กโหลดที่เห็นได้ชัดว่าไม่ใช่: การบันทึกการประชุมและการสนทนาที่ประมวลผลภายหลัง คลังสื่อ การตรวจสอบคุณภาพแบบแบตช์ของศูนย์ติดต่อ การตรวจสอบการปฏิบัติตามข้อกำหนดของสายที่เสร็จสิ้นแล้ว การใส่คำบรรยายพอดแคสต์และวิดีโอ เหล่านี้คือไปป์ไลน์ที่โมเดลแบบแบตช์ซึ่งมีความเร็ว 411 เท่าของเวลาจริงและเรต $1.67 ถูกสร้างมาเพื่อชนะโดยเฉพาะ และการจ่ายแพงขึ้น 5.4 เท่าเพื่อลดเวลาแค่ไม่กี่ร้อยมิลลิวินาทีจากทรานสคริปต์ที่ไม่มีใครอ่านจนถึงพรุ่งนี้ถือเป็นการสิ้นเปลืองโดยตรง เพิ่มคุณสมบัติการแยกผู้พูดและการประทับเวลาเป็นคำ — โมเดลแบบแบตช์มีคุณสมบัติเหล่านี้ในเอกสาร ส่วนโมเดลแบบสตรีมมิงไม่มี — และกรณีการประมวลผลภายหลังก็ยิ่งแข็งแกร่งขึ้น ไม่ใช่อ่อนลง
จุดที่น่าสนใจคือตรงกลาง ซึ่งเป็นจุดที่ทั้งสองวิธีเสริมกันอย่างแท้จริง: ใช้สตรีมมิ่งกับส่วนที่ต้องใช้งานสด และใช้แบตช์กับส่วนที่ต้องเก็บเป็นบันทึก สายสนับสนุนที่ถูกถอดเสียงแบบเรียลไทม์เพื่อขับเคลื่อนแผงช่วยเหลือเอเจนต์ แล้วถูกถอดเสียงซ้ำแบบแบตช์ข้ามคืนเพื่อสร้างบทถอดเสียงฉบับเก็บถาวรพร้อมการแยกผู้พูดและตราเวลา มีค่าใช้จ่ายเพิ่มขึ้นเล็กน้อยเมื่อเทียบกับใช้แบตช์อย่างเดียว และได้พฤติกรรมทั้งสองแบบ รูปแบบนั้นเพิ่งเป็นไปได้ในเดือนกันยายน และรีลีสเดือนตุลาคมคือสิ่งที่ทำให้มันสมบูรณ์
จุดที่โครงสร้างแบบแบ่งสองส่วนปรากฏให้เห็น
สองสิ่งเกี่ยวกับครอบครัวนี้ที่ควรค่าแก่การสังเกต เพราะมันเป็นเรื่องเชิงโครงสร้างมากกว่าเป็นเรื่องบังเอิญ
ประการแรก ลำดับชั้นความแม่นยำกลับตาลปัตรจากรูปแบบปกติ โมเดลแบบสตรีมมิงโดยทั่วไปต้องจ่ายภาษีความแม่นยำก้อนใหญ่เพื่อแลกกับเอาต์พุตแบบเรียลไทม์ แต่ในกรณีนี้ภาษีอยู่ที่ 0.5 จุด จาก 2.0% บนกระดานแบบแบตช์ ไปเป็น 2.5% ที่อ้างบนกระดานแบบสตรีมมิง Microsoft ได้โมเดลเรียลไทม์ที่มีคะแนนห่างจากเรือธงแบบแบตช์ของตนไม่ถึงครึ่งจุด เมื่อดูจากตัวเลขของบริษัทเอง ซึ่งนี่คือความสำเร็จทางวิศวกรรมที่แท้จริงของการเปิดตัวในเดือนตุลาคม หากตัวเลขนี้ยังคงอยู่ — ไม่ใช่ตำแหน่งบนสุดของกระดาน ซึ่งการรันซ้ำที่ดีอาจทำให้ตำแหน่งเปลี่ยนไป และซึ่งตัวติดตามยังไม่ได้ยืนยัน
ประการที่สอง การกำหนดราคาก็สวนทางกับรูปแบบปกติเช่นกัน โดยทั่วไปผู้ขายมักให้ส่วนลดกับระดับปริมาณที่สูงกว่า แต่ Microsoft ตั้งราคาสตรีมมิ่งไว้ที่ 5.4 เท่าของแบตช์ และปล่อยให้ทั้งสองแบบอยู่ในราคาช่วงเริ่มต้นที่หมดอายุพร้อมกัน ซึ่งอ่านแล้วไม่ค่อยเหมือนการตั้งราคาพรีเมียมสำหรับสตรีมมิ่งโดยเจตนา แต่เหมือนการเปิดตัวสองครั้งแยกกัน โดยแต่ละครั้งมีส่วนลดเปิดตัว และไม่มีอัตรามาตรฐานที่ประกาศไว้สำหรับทั้งสองแบบ ทีมที่กำลังวางแผนงบประมาณปี 2027 ควรถือว่าตัวเลขทั้งสองเป็นตัวเลขชั่วคราว — ทั้ง $1.67 และ $9.00 ต่างมีป้ายกำกับว่าเป็นราคาจำกัดเวลา และทั้งคู่ยังไม่มีราคาสืบทอดที่ประกาศไว้

อะไรที่ยังไม่ได้รับการพิสูจน์
คำถามที่ยังไม่มีคำตอบของโมเดลแบบแบตช์จากเดือนกันยายนยังคงค้างอยู่: ไม่มีอัตราความผิดพลาดในการแยกผู้พูดที่เผยแพร่ ไม่มีรายละเอียดแยกตามภาษาที่รองรับคำกล่าวอ้างเรื่อง 60 ภาษา และมีราคาโปรโมชันโดยไม่มีชื่อรุ่นสืบทอด โมเดลสตรีมมิ่งเพิ่มอีกหนึ่งข้อที่เฉพาะกับงานเรียลไทม์ — WER ของสตรีมมิ่งวัดบนเสียงสะอาด และคุณภาพของบทถอดความบางส่วนในสตรีมระยะไกลที่มีเสียงรบกวนคือจุดล้มเหลวที่สำคัญที่สุดในการใช้งานจริง และถูกกล่าวถึงน้อยที่สุดในเอกสารเปิดตัว นอกจากนี้ยังสืบทอดความใกล้ชิดของกระดานจัดอันดับสตรีมมิ่ง: สามอันดับแรกบนกระดาน 37 โมเดลของ tracker อยู่ห่างกันเพียงเศษเสี้ยวคะแนน ดังนั้น "อันดับหนึ่ง" จึงเป็นสถานะที่การรันซ้ำสามารถเปลี่ยนแปลงได้ — และอันดับหนึ่งของ Microsoft เป็นคำกล่าวอ้างมากกว่าเป็นแถวในตาราง
อย่างไรก็ตาม คำถามระดับตระกูลผลิตภัณฑ์คือสิ่งที่ต้องจับตามอง ตอนนี้ Microsoft ขายความสามารถเดียวกันในสองราคาที่ต่างกันถึงห้าเท่า โดยระดับราคาแพงขาดสองฟีเจอร์ที่ระดับราคาถูกระบุไว้ในเอกสาร หากการแยกผู้พูด (diarization) และการประทับเวลาเป็นคำ (word timestamps) มาสู่ SKU แบบสตรีมมิ่ง ช่องว่างจะแคบลงเหลือเพียงการแลกเปลี่ยนระหว่างความหน่วงกับราคา ซึ่งเป็นการตัดสินใจที่ง่ายกว่ามาก หากไม่มา โครงสร้างแบบสองส่วนจะคงอยู่ถาวร และสถาปัตยกรรมควรถูกสร้างขึ้นโดยยึดโครงสร้างนั้นเป็นหลัก
สิ่งนี้ทำให้สแต็กการถอดเสียงอยู่ตรงไหน

ผลลัพธ์ในทางปฏิบัติก็คือ การถอดเสียงไม่ได้เป็นแค่รายการเดียวในเดือนกันยายนอีกต่อไป และกลายเป็นการตัดสินใจเรื่องการกำหนดเส้นทางในเดือนตุลาคม ไปป์ไลน์ที่เคยใช้ API เดียวเป็นมาตรฐาน ตอนนี้ต้องการสตรีมมิ่งสำหรับงานที่ใช้งานสด แบตช์สำหรับการจัดเก็บเป็นบันทึก และกฎว่าออดิโอใดควรไปเส้นทางใด — และกฎนั้นเองก็เป็นปัญหาการกำหนดเส้นทาง ซึ่งเป็นความซับซ้อนในระดับที่แปลกที่จะไปลงเอยในรอบการเปิดตัวของผู้ขายรายเดียว
มันกระทบหนักที่สุดกับสิ่งที่อยู่เหนือทรานสคริปต์ขึ้นไป ไม่ว่าจะเป็น tier ใดที่สร้างข้อความ ข้อความนั้นก็จะถูกสรุป จำแนกประเภท ปกปิดข้อมูลอ่อนไหว และจัดเส้นทาง และขั้นตอนเหล่านั้นรันบนโมเดลภาษาที่มีโปรไฟล์ความหน่วงและต้นทุนเป็นของตัวเอง — ทรานสคริปต์สดต้องการโมเดลที่เร็วและราคาถูก ส่วนทรานสคริปต์แบบเก็บถาวรสามารถใช้โมเดลที่แข็งแกร่งกว่าได้ OrcaRouter ครอบคลุมเลเยอร์นั้นพอดี: API เดียวที่ใช้ได้กับโมเดล 200+ ตัว, ราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยมี markup 0%, การ failover อัตโนมัติ, และ routing DSL ที่เลือกโมเดลต่อเวิร์กโหลดแทนที่จะต่อไปป์ไลน์ ทั้ง MAI-Transcribe-2-Streaming และ MAI-Transcribe-2 ต่างก็ไม่ได้อยู่ในรายชื่อนั้น — ทั้งคู่ให้บริการผ่านสแต็กเสียงพูดของ Microsoft เอง — แต่เลเยอร์ถอดเสียงแบบสองส่วนนี้เป็นข้อโต้แย้งที่แข็งแกร่งที่สุดเท่าที่เคยมีมา สำหรับการทำให้ทุกอย่างที่อยู่ปลายน้ำของมันสามารถพกพาไปใช้ที่อื่นได้
สรุปตามจริง: สตรีมมิ่งไม่ใช่ MAI-Transcribe-2 ที่ดีกว่า แต่เป็นผลิตภัณฑ์ตัวที่สองในราคาที่สอง ซื้อมันสำหรับนาทีที่จำเป็นต้องเป็นเรียลไทม์จริง ๆ เท่านั้น ปล่อยส่วนที่เหลือไว้บนระดับราคาถูก และเผื่องบไว้สำหรับอัตราทั้งสองที่จะถูกปรับราคาใหม่เมื่อช่วงแนะนำสิ้นสุดลง
