
MAI-Transcribe-2-Streaming Sudah Live: Microsoft Merebut Mahkota Transkripsi Streaming dengan WER 2,5%
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 221 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
MAI-Transcribe-2-Streaming adalah jawaban Microsoft AI atas satu pertanyaan yang dibiarkan terbuka oleh rilis September-nya, dan pertanyaan itu dijawabnya dalam 28 hari. Dirilis pada 1 Oktober 2026, MAI-Transcribe-2-Streaming adalah model speech-to-text real-time yang mentranskripsikan begitu kata-kata datang, bukan setelah file selesai. Microsoft mengatakan model ini berada di peringkat pertama untuk akurasi pada transkrip final maupun parsial dalam evaluasi AA-WER Streaming milik Artificial Analysis, dengan tingkat kesalahan kata (word error rate) 2,5%, dengan transkrip final siap 0,13 detik setelah akhir ucapan. Itu adalah klaim vendor atas metodologi sebuah tracker, bukan baris yang diterbitkan tracker tersebut — pada saat penyusunan draf, 37 model di papan peringkat tersebut belum memasukkannya, dan model yang akan tergeser adalah Grok Voice Transcribe 2.0 (Streaming) pada 2,73% dan 0,49 detik. Model yang menjadi landasannya, MAI-Transcribe-2, diluncurkan pada 3 September sebagai model batch dengan WER 2,0% tanpa SKU real-time; varian streaming menutup celah itu tanpa mengorbankan banyak akurasi yang membuat versi batch tersebut menonjol. Yang memang dikorbankannya adalah harga: streaming 5,4× tarif batch saat peluncuran.
Pembingkaian yang diinginkan Microsoft adalah sapu bersih di papan peringkat streaming. Pembingkaian yang didukung angka-angkanya lebih sempit dan lebih menarik — sebuah model yang mengklaim memimpin dalam akurasi dan latensi sekaligus, di sebuah garis terdepan di mana entri paling akurat di papan tersebut empat kali lebih lambat untuk stabil daripada entri-entri tercepatnya, dan tak satu pun dari yang tercepat itu berada di bawah 3% kesalahan kata, dibanderol setara dengan pemain yang ada alih-alih lebih rendah darinya. Berikut adalah peluncurannya sebagaimana terjadi, dengan klaim vendor diberi label.
Apa yang dirilis Microsoft pada 1 Oktober
MAI-Transcribe-2-Streaming dilayani melalui stack ucapan Microsoft di layanan Azure AI Speech, dengan dokumentasi atas nama modelnya sendiri dan model distribusi hanya-API, tanpa-bobot yang sama seperti rilis batch. Model ini mentranskripsikan 60 bahasa dengan deteksi bahasa berkelanjutan otomatis, sehingga sesi yang berganti bahasa di tengah streaming tidak perlu dideklarasikan di awal. Microsoft memposisikannya pada frontier Pareto akurasi versus latensi dari bagan streaming Artificial Analysis — pembacaan vendor sendiri atas data pelacak tersebut, dan pembacaan yang didukung oleh bagan milik pelacak itu sendiri.
Model streaming bukanlah keseluruhan perilisan itu. Microsoft juga merilis dua model suara bersamanya: MAI-Voice-2.1, yang mencakup 23 bahasa di 26 locale, dan MAI-Voice-2.1-Flash, yang menangani audio hingga 45 detik dengan latensi sekitar 150 ms. Jika dibaca sebagai satu kesatuan, peluncuran 1 Oktober adalah stack percakapan real-time yang lengkap — dengar, pahami, bicara — bukan sekadar peluncuran satu model.

Membaca papan peringkat streaming
AA-WER Streaming mengukur dua hal per model: seberapa salah transkrip akhirnya, dan berapa lama setelah pembicara berhenti sampai prosesnya selesai. Klaim Microsoft adalah bahwa MAI-Transcribe-2-Streaming unggul pada keduanya: tingkat kesalahan kata 2,5% pada transkrip akhir pada 0,13 detik setelah akhir ucapan, dan 2,5% yang sama pada transkrip parsial pertama pada 0,12 detik, yang menurut Microsoft merupakan yang pertama untuk akurasi pada keduanya. Anggaplah itu sebagai angka vendor — pada saat penyusunan, papan streaming milik pelacak itu sendiri belum memplot model tersebut, jadi tidak ada baris MAI-Transcribe-2-Streaming independen untuk dibaca. Yang ditunjukkan papan itu adalah medan yang diklaim ingin dikalahkannya, dan medan itu lebih ketat daripada yang disiratkan oleh pembingkaian "mahkota":
• Grok Voice Transcribe 2.0 — WER transkrip akhir 2,73% pada 0,49 detik setelah akhir ucapan, menurut Artificial Analysis, dan pemimpin saat ini di papan peringkat. Itu tertinggal 0,23 poin dari klaim Microsoft sebesar 2,5%, dan sekitar empat kali lebih lambat untuk stabil — perbedaan antara takarir yang mampu mengikuti dan yang tertinggal.
• Muse Voice Transcribe — 3,06% dalam 0,16 detik, menurut Artificial Analysis. Pesaing terdekat dalam hal latensi: tertinggal sekitar 30 milidetik, dan 0,5 poin lebih buruk dalam akurasi daripada klaim Microsoft.
• ElevenLabs Scribe v2 Realtime — 3,59% pada 0,14 detik, menurut Artificial Analysis. Praktis imbang dalam kecepatan, tertinggal lebih dari satu poin dalam akurasi.
• Gemini 3.5 Transcribe Live — WER streaming 4,00% pada 0,40 detik, angka yang diterbitkan Artificial Analysis dan yang dikutip Google untuk model Live API miliknya sendiri. Itu adalah selisih 1,5 poin, dan itulah perbandingan yang menjadi sasaran rilis ini.
Kolom first-partial adalah tempat klaim paling tidak mirip dengan bagian lain dari papan skor. Pada pelacak yang sama, first partial Grok Voice Transcribe 2.0 berada di 3,36% dan Gemini 3.5 Transcribe Live di 5,77% — hasil parsial seharusnya lebih buruk daripada transkrip final, sering kali selisih satu poin atau lebih, karena model menetapkan sebelum kalimat berakhir. First partial yang cocok dengan angka final adalah bagian yang benar-benar tidak biasa dari peluncuran Microsoft, dan itulah bagian yang belum dapat dikonfirmasi oleh data pelacaknya sendiri. Kutip sebagai klaim sampai ada baris.
Catatan jujur yang perlu disampaikan adalah bahwa 0,13 detik dan 0,16 detik adalah pengalaman produk yang sama bagi manusia yang membaca takarir, dan 2,5% berbanding 2,73% yang saat ini memimpin papan peringkat adalah sekitar 2 kesalahan per 1.000 kata. Keunggulan sebesar itu nyata tetapi kecil, dan apakah itu keunggulan yang bisa dirasakan siapa pun bergantung pada beban kerja. Yang benar-benar terasa dampaknya adalah bagian ekornya: aliran contact center yang berjalan delapan jam sehari pada 2,73% versus 2,5% berarti puluhan ribu kata salah tambahan per tahun, dan kesalahan kata dalam transkrip tidak tersebar merata — kesalahan itu mengelompok tepat pada nama diri dan angka yang membuat transkrip berguna.

Apa yang bisa didapat dengan $9,00 per 1.000 menit
Streaming lebih mahal daripada batch, dan Microsoft menetapkannya di puncak tier real-time, bukan di bawahnya. MAI-Transcribe-2-Streaming terdaftar pada $0,54 per jam audio, yang setara dengan $9,00 per 1.000 menit audio yang di-streaming, digambarkan sebagai tarif perkenalan yang berlaku hingga akhir tahun. Sebagai perbandingan, MAI-Transcribe-2 batch adalah $0,10 per jam audio — $1,67 per 1.000 menit — jadi transkripsi real-time berbiaya sekitar 5,4× tarif berbasis file untuk keluarga dasar yang sama dan 0,5 poin lebih tinggi dalam word error. Itu bukan markup yang disembunyikan Microsoft; itu harga jujur dari koneksi persisten dan transkrip parsial yang harus sudah benar sebelum kalimatnya selesai.
Dibandingkan dengan bagian lain di tingkat streaming, gambarannya beragam. MAI-Transcribe-2-Streaming sejajar dengan Gemini 3.5 Transcribe Live pada sekitar $9 per 1.000 menit — lebih akurat, biaya sama. Posisinya berada di atas ElevenLabs Scribe v2 Realtime dan Deepgram Flux pada sekitar $6,50 per 1.000 menit, di atas Cartesia Ink-2 pada sekitar $4, dan sekitar tiga kali Muse Voice Transcribe yang dibanderol sekitar $3. Jadi peluncuran ini adalah strategi akurasi-dan-latensi dengan harga setara, bukan perang harga; tim yang sudah menjalankan model streaming lebih murah akan menukar dolar demi poin WER.
Pertukaran itu layak disebut secara tepat, karena itu adalah pertukaran yang sama yang dibalik oleh peluncuran batch. Pada September, Microsoft membuat akurasi menjadi murah. Pada Oktober, Microsoft membuat akurasi real-time berbiaya sama seperti milik semua orang lain. Jika pipeline Anda hanya membutuhkan transkrip pada akhirnya, tidak ada apa pun tentang 1 Oktober yang mengubah tagihan Anda. Jika pipeline Anda membutuhkannya saat panggilan masih berlangsung, kalkulasinya baru saja bergeser ke kualitas.

Membangun di atas transkrip adalah separuh lain dari keputusan itu, dan di situlah lapisan multi-model membuktikan nilainya. Transkrip waktu nyata jarang menjadi akhir pipeline — transkrip itu diringkas, dinilai, dicari, dirutekan, dan dieskalasi, dan langkah-langkah tersebut menginginkan model berbeda dengan biaya berbeda. OrcaRouter hadir untuk lapisan itu: satu API untuk 200+ model, harga daftar penyedia diteruskan dengan markup 0%, failover otomatis, dan DSL perutean yang dapat mengirim transkrip langsung ke satu model untuk penyaringan kepatuhan dan ke model lain untuk catatan rapat tanpa integrasi kedua. MAI-Transcribe-2-Streaming sendiri tidak ada dalam daftar tersebut — layanan ini disediakan melalui stack speech milik Microsoft sendiri — tetapi transkrip streaming yang dihasilkannya adalah persis jenis input bervolume tinggi dan sensitif terhadap latensi yang menjadi alasan untuk menjaga lapisan di atasnya tetap agnostik model.
Apa yang belum terbukti
Ada tiga hal yang benar-benar terbuka. Pertama, diarisasi: model batch menggabungkan atribusi pembicara tanpa laju kesalahan diarisasi yang dipublikasikan, dan materi streaming Microsoft sama sekali tidak membuat klaim diarisasi — untuk model real-time yang memasok bantuan agen langsung atau takarir, siapa mengatakan apa sering kali merupakan fitur yang lebih penting daripada WER mentah. Kedua, rincian multibahasa: 60 bahasa dengan deteksi bahasa kontinu otomatis adalah klaim yang luas, dan latensi per bahasa model streaming dapat jauh lebih bervariasi daripada padanan batch-nya, karena kualitas transkrip parsial bergantung pada seberapa cepat model menetapkan suatu bahasa. Microsoft belum menerbitkan tabel streaming per bahasa. Ketiga, WER streaming diukur pada audio tolok ukur yang bersih; mode kegagalan yang merugikan penerapan nyata adalah aliran medan jauh yang bising, dan tidak ada perbandingan streaming medan jauh independen pada hari peluncuran.
Di mana hal itu meninggalkan stack Anda
Hal yang menarik dari peluncuran ini bukanlah bahwa Microsoft memiliki transkrip streaming paling akurat. Yang menarik adalah iramanya: batch pada September, streaming pada Oktober, dalam keluarga yang sama, di permukaan dokumentasi yang sama, dengan struktur harga yang kini berkisar dari $1,67 hingga $9,00 per 1.000 menit untuk kemampuan dasar yang sama. Itu memberi tim pilihan nyata untuk pertama kalinya — bayar untuk real-time hanya di tempat real-time penting, dan proses batch untuk semua yang lain — tetapi itu juga berarti lapisan transkripsi kini menjadi sesuatu yang Anda sesuaikan per beban kerja alih-alih menstandardisasi sekali saja.
Baca klaim utamanya secara literal dan itu berlaku sebagai pernyataan vendor: Microsoft mengatakan MAI-Transcribe-2-Streaming adalah yang pertama dalam akurasi transkrip akhir maupun parsial pertama, dan bahwa model itu berada di frontier Pareto. Tanda bintangnya adalah bahwa papan pelacak belum memplot model tersebut, keunggulan yang diklaimnya atas pemimpin saat ini cukup kecil untuk hilang dalam pengujian ulang, keunggulan harganya nol, dan cerita diarisasi belum diceritakan. Itulah hal-hal yang perlu diperhatikan, bukan mahkotanya.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
