Kartu hero artikel bertuliskan 'MAI-Transcribe-2-Streaming Kini Live' dengan badge 'MODEL BARU · MICROSOFT AI' dan subjudul 'Microsoft merebut takhta transkrip streaming dengan WER 2,5%', dengan strip statistik yang menampilkan tingkat kesalahan kata streaming 2,5% pada 0,13 detik setelah akhir ucapan, dilabeli di kartu sebagai klaim Microsoft dan yang pertama untuk transkrip final maupun parsial; 60 bahasa dengan deteksi bahasa otomatis yang berkelanjutan; dan $9,00 per 1.000 menit, dijelaskan sebagai $0,54 per jam audio sebagai harga perkenalan hingga 2026; di atas gradien putih ke biru dengan logo OrcaRouter di kanan bawah.
Guides & Insights

MAI-Transcribe-2-Streaming Sudah Live: Microsoft Merebut Mahkota Transkripsi Streaming dengan WER 2,5%

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

MAI-Transcribe-2-Streaming adalah jawaban Microsoft AI atas satu pertanyaan yang dibiarkan terbuka oleh rilis September-nya, dan pertanyaan itu dijawabnya dalam 28 hari. Dirilis pada 1 Oktober 2026, MAI-Transcribe-2-Streaming adalah model speech-to-text real-time yang mentranskripsikan begitu kata-kata datang, bukan setelah file selesai. Microsoft mengatakan model ini berada di peringkat pertama untuk akurasi pada transkrip final maupun parsial dalam evaluasi AA-WER Streaming milik Artificial Analysis, dengan tingkat kesalahan kata (word error rate) 2,5%, dengan transkrip final siap 0,13 detik setelah akhir ucapan. Itu adalah klaim vendor atas metodologi sebuah tracker, bukan baris yang diterbitkan tracker tersebut — pada saat penyusunan draf, 37 model di papan peringkat tersebut belum memasukkannya, dan model yang akan tergeser adalah Gro​k Voice Transcribe 2.0 (Streaming) pada 2,73% dan 0,49 detik. Model yang menjadi landasannya, MAI-Transcribe-2, diluncurkan pada 3 September sebagai model batch dengan WER 2,0% tanpa SKU real-time; varian streaming menutup celah itu tanpa mengorbankan banyak akurasi yang membuat versi batch tersebut menonjol. Yang memang dikorbankannya adalah harga: streaming 5,4× tarif batch saat peluncuran.

Pembingkaian yang diinginkan Microsoft adalah sapu bersih di papan peringkat streaming. Pembingkaian yang didukung angka-angkanya lebih sempit dan lebih menarik — sebuah model yang mengklaim memimpin dalam akurasi dan latensi sekaligus, di sebuah garis terdepan di mana entri paling akurat di papan tersebut empat kali lebih lambat untuk stabil daripada entri-entri tercepatnya, dan tak satu pun dari yang tercepat itu berada di bawah 3% kesalahan kata, dibanderol setara dengan pemain yang ada alih-alih lebih rendah darinya. Berikut adalah peluncurannya sebagaimana terjadi, dengan klaim vendor diberi label.

Apa yang dirilis Microsoft pada 1 Oktober

MAI-Transcribe-2-Streaming dilayani melalui stack ucapan Microsoft di layanan Azure AI Speech, dengan dokumentasi atas nama modelnya sendiri dan model distribusi hanya-API, tanpa-bobot yang sama seperti rilis batch. Model ini mentranskripsikan 60 bahasa dengan deteksi bahasa berkelanjutan otomatis, sehingga sesi yang berganti bahasa di tengah streaming tidak perlu dideklarasikan di awal. Microsoft memposisikannya pada frontier Pareto akurasi versus latensi dari bagan streaming Artificial Analysis — pembacaan vendor sendiri atas data pelacak tersebut, dan pembacaan yang didukung oleh bagan milik pelacak itu sendiri.

Model streaming bukanlah keseluruhan perilisan itu. Microsoft juga merilis dua model suara bersamanya: MAI-Voice-2.1, yang mencakup 23 bahasa di 26 locale, dan MAI-Voice-2.1-Flash, yang menangani audio hingga 45 detik dengan latensi sekitar 150 ms. Jika dibaca sebagai satu kesatuan, peluncuran 1 Oktober adalah stack percakapan real-time yang lengkap — dengar, pahami, bicara — bukan sekadar peluncuran satu model.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models as accurate, fast and low cost, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

Membaca papan peringkat streaming

AA-WER Streaming mengukur dua hal per model: seberapa salah transkrip akhirnya, dan berapa lama setelah pembicara berhenti sampai prosesnya selesai. Klaim Microsoft adalah bahwa MAI-Transcribe-2-Streaming unggul pada keduanya: tingkat kesalahan kata 2,5% pada transkrip akhir pada 0,13 detik setelah akhir ucapan, dan 2,5% yang sama pada transkrip parsial pertama pada 0,12 detik, yang menurut Microsoft merupakan yang pertama untuk akurasi pada keduanya. Anggaplah itu sebagai angka vendor — pada saat penyusunan, papan streaming milik pelacak itu sendiri belum memplot model tersebut, jadi tidak ada baris MAI-Transcribe-2-Streaming independen untuk dibaca. Yang ditunjukkan papan itu adalah medan yang diklaim ingin dikalahkannya, dan medan itu lebih ketat daripada yang disiratkan oleh pembingkaian "mahkota":

• Grok Voice Transcribe 2.0 — WER transkrip akhir 2,73% pada 0,49 detik setelah akhir ucapan, menurut Artificial Analysis, dan pemimpin saat ini di papan peringkat. Itu tertinggal 0,23 poin dari klaim Microsoft sebesar 2,5%, dan sekitar empat kali lebih lambat untuk stabil — perbedaan antara takarir yang mampu mengikuti dan yang tertinggal.

• Muse Voice Transcribe — 3,06% dalam 0,16 detik, menurut Artificial Analysis. Pesaing terdekat dalam hal latensi: tertinggal sekitar 30 milidetik, dan 0,5 poin lebih buruk dalam akurasi daripada klaim Microsoft.

• ElevenLabs Scribe v2 Realtime — 3,59% pada 0,14 detik, menurut Artificial Analysis. Praktis imbang dalam kecepatan, tertinggal lebih dari satu poin dalam akurasi.

• Gemini 3.5 Transcribe Live — WER streaming 4,00% pada 0,40 detik, angka yang diterbitkan Artificial Analysis dan yang dikutip Google untuk model Live API miliknya sendiri. Itu adalah selisih 1,5 poin, dan itulah perbandingan yang menjadi sasaran rilis ini.

Kolom first-partial adalah tempat klaim paling tidak mirip dengan bagian lain dari papan skor. Pada pelacak yang sama, first partial Grok Voice Transcribe 2.0 berada di 3,36% dan Gemini 3.5 Transcribe Live di 5,77% — hasil parsial seharusnya lebih buruk daripada transkrip final, sering kali selisih satu poin atau lebih, karena model menetapkan sebelum kalimat berakhir. First partial yang cocok dengan angka final adalah bagian yang benar-benar tidak biasa dari peluncuran Microsoft, dan itulah bagian yang belum dapat dikonfirmasi oleh data pelacaknya sendiri. Kutip sebagai klaim sampai ada baris.

Catatan jujur yang perlu disampaikan adalah bahwa 0,13 detik dan 0,16 detik adalah pengalaman produk yang sama bagi manusia yang membaca takarir, dan 2,5% berbanding 2,73% yang saat ini memimpin papan peringkat adalah sekitar 2 kesalahan per 1.000 kata. Keunggulan sebesar itu nyata tetapi kecil, dan apakah itu keunggulan yang bisa dirasakan siapa pun bergantung pada beban kerja. Yang benar-benar terasa dampaknya adalah bagian ekornya: aliran contact center yang berjalan delapan jam sehari pada 2,73% versus 2,5% berarti puluhan ribu kata salah tambahan per tahun, dan kesalahan kata dalam transkrip tidak tersebar merata — kesalahan itu mengelompok tepat pada nama diri dan angka yang membuat transkrip berguna.

A generated comparison card titled 'The streaming field, by the numbers' with a left column for MAI-Transcribe-2-Streaming (final-transcript word error rate 2.5% flagged as Microsoft's claim, time to final transcript 0.13s after speech end, first-partial word error rate 2.5% at 0.12s flagged as claimed, $9.00 per 1,000 minutes introductory, 60 languages with automatic detection, and 'not yet plotted' for the tracker's board) and a right column headed 'The field it claims to beat' listing Grok Voice Transcribe 2.0 at 2.73% and 0.49s, Muse Voice Transcribe at 3.06% and 0.16s, ElevenLabs Scribe v2 Realtime at 3.59% and 0.14s, Qwen3 ASR Flash Realtime at 3.73% and 0.48s, Gemini 3.5 Transcribe Live at 4.00% and 0.40s, and a board size of 37 models, with a footer noting that Microsoft's figures are the vendor's own claim measured on Artificial Analysis's streaming methodology while the right-hand column is what Artificial Analysis currently publishes, all times being after detected end of speech, and the OrcaRouter logo bottom right.

Apa yang bisa didapat dengan $9,00 per 1.000 menit

Streaming lebih mahal daripada batch, dan Microsoft menetapkannya di puncak tier real-time, bukan di bawahnya. MAI-Transcribe-2-Streaming terdaftar pada $0,54 per jam audio, yang setara dengan $9,00 per 1.000 menit audio yang di-streaming, digambarkan sebagai tarif perkenalan yang berlaku hingga akhir tahun. Sebagai perbandingan, MAI-Transcribe-2 batch adalah $0,10 per jam audio — $1,67 per 1.000 menit — jadi transkripsi real-time berbiaya sekitar 5,4× tarif berbasis file untuk keluarga dasar yang sama dan 0,5 poin lebih tinggi dalam word error. Itu bukan markup yang disembunyikan Microsoft; itu harga jujur dari koneksi persisten dan transkrip parsial yang harus sudah benar sebelum kalimatnya selesai.

Dibandingkan dengan bagian lain di tingkat streaming, gambarannya beragam. MAI-Transcribe-2-Streaming sejajar dengan Gemini 3.5 Transcribe Live pada sekitar $9 per 1.000 menit — lebih akurat, biaya sama. Posisinya berada di atas ElevenLabs Scribe v2 Realtime dan Deepgram Flux pada sekitar $6,50 per 1.000 menit, di atas Cartesia Ink-2 pada sekitar $4, dan sekitar tiga kali Muse Voice Transcribe yang dibanderol sekitar $3. Jadi peluncuran ini adalah strategi akurasi-dan-latensi dengan harga setara, bukan perang harga; tim yang sudah menjalankan model streaming lebih murah akan menukar dolar demi poin WER.

Pertukaran itu layak disebut secara tepat, karena itu adalah pertukaran yang sama yang dibalik oleh peluncuran batch. Pada September, Microsoft membuat akurasi menjadi murah. Pada Oktober, Microsoft membuat akurasi real-time berbiaya sama seperti milik semua orang lain. Jika pipeline Anda hanya membutuhkan transkrip pada akhirnya, tidak ada apa pun tentang 1 Oktober yang mengubah tagihan Anda. Jika pipeline Anda membutuhkannya saat panggilan masih berlangsung, kalkulasinya baru saja bergeser ke kualitas.

A single-column scoreboard card titled 'MAI-Transcribe-2-Streaming — the launch scoreboard' listing 2.5% final-transcript WER at 0.13s, 2.5% first-partial WER at 0.12s, an accuracy rank claimed at #1 for final and partial transcripts, tracker status 'not yet plotted on the 37-model board', $9.00 per 1,000 minutes ($0.54 per audio-hour) introductory through 2026, 60 languages with automatic continuous detection, no published diarization or word-level timestamp claim for the streaming SKU, and the batch sibling MAI-Transcribe-2 at 2.0% AA-WER, roughly 411x real time and $1.67 per 1,000 minutes, with the OrcaRouter logo bottom right.

Membangun di atas transkrip adalah separuh lain dari keputusan itu, dan di situlah lapisan multi-model membuktikan nilainya. Transkrip waktu nyata jarang menjadi akhir pipeline — transkrip itu diringkas, dinilai, dicari, dirutekan, dan dieskalasi, dan langkah-langkah tersebut menginginkan model berbeda dengan biaya berbeda. OrcaRouter hadir untuk lapisan itu: satu API untuk 200+ model, harga daftar penyedia diteruskan dengan markup 0%, failover otomatis, dan DSL perutean yang dapat mengirim transkrip langsung ke satu model untuk penyaringan kepatuhan dan ke model lain untuk catatan rapat tanpa integrasi kedua. MAI-Transcribe-2-Streaming sendiri tidak ada dalam daftar tersebut — layanan ini disediakan melalui stack speech milik Microsoft sendiri — tetapi transkrip streaming yang dihasilkannya adalah persis jenis input bervolume tinggi dan sensitif terhadap latensi yang menjadi alasan untuk menjaga lapisan di atasnya tetap agnostik model.

Apa yang belum terbukti

Ada tiga hal yang benar-benar terbuka. Pertama, diarisasi: model batch menggabungkan atribusi pembicara tanpa laju kesalahan diarisasi yang dipublikasikan, dan materi streaming Microsoft sama sekali tidak membuat klaim diarisasi — untuk model real-time yang memasok bantuan agen langsung atau takarir, siapa mengatakan apa sering kali merupakan fitur yang lebih penting daripada WER mentah. Kedua, rincian multibahasa: 60 bahasa dengan deteksi bahasa kontinu otomatis adalah klaim yang luas, dan latensi per bahasa model streaming dapat jauh lebih bervariasi daripada padanan batch-nya, karena kualitas transkrip parsial bergantung pada seberapa cepat model menetapkan suatu bahasa. Microsoft belum menerbitkan tabel streaming per bahasa. Ketiga, WER streaming diukur pada audio tolok ukur yang bersih; mode kegagalan yang merugikan penerapan nyata adalah aliran medan jauh yang bising, dan tidak ada perbandingan streaming medan jauh independen pada hari peluncuran.

Di mana hal itu meninggalkan stack Anda

Hal yang menarik dari peluncuran ini bukanlah bahwa Microsoft memiliki transkrip streaming paling akurat. Yang menarik adalah iramanya: batch pada September, streaming pada Oktober, dalam keluarga yang sama, di permukaan dokumentasi yang sama, dengan struktur harga yang kini berkisar dari $1,67 hingga $9,00 per 1.000 menit untuk kemampuan dasar yang sama. Itu memberi tim pilihan nyata untuk pertama kalinya — bayar untuk real-time hanya di tempat real-time penting, dan proses batch untuk semua yang lain — tetapi itu juga berarti lapisan transkripsi kini menjadi sesuatu yang Anda sesuaikan per beban kerja alih-alih menstandardisasi sekali saja.

Baca klaim utamanya secara literal dan itu berlaku sebagai pernyataan vendor: Microsoft mengatakan MAI-Transcribe-2-Streaming adalah yang pertama dalam akurasi transkrip akhir maupun parsial pertama, dan bahwa model itu berada di frontier Pareto. Tanda bintangnya adalah bahwa papan pelacak belum memplot model tersebut, keunggulan yang diklaimnya atas pemimpin saat ini cukup kecil untuk hilang dalam pengujian ulang, keunggulan harganya nol, dan cerita diarisasi belum diceritakan. Itulah hal-hal yang perlu diperhatikan, bukan mahkotanya.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari