
MAI-Transcribe-2-Streaming vs MAI-Transcribe-2: Bayar 5,4× untuk Penentuan Waktu Tingkat Kata
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 221 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
MAI-Transcribe-2-Streaming dan MAI-Transcribe-2 adalah keluarga model yang sama yang terbagi ke dalam dua tingkat harga, dan pembagiannya cukup jelas untuk dijadikan dasar perencanaan. MAI-Transcribe-2 dirilis pada 3 September 2026 sebagai model batch: tingkat kesalahan kata 2,0% pada papan non-streaming Artificial Analysis, sekitar 411× waktu nyata, dan $0,10 per jam audio — sekitar $1,67 per 1.000 menit. MAI-Transcribe-2-Streaming dirilis pada 1 Oktober 2026 sebagai varian real-time: klaim tingkat kesalahan kata streaming 2,5% pada 0,13 detik hingga transkrip final, yang oleh Microsoft disebut sebagai yang pertama untuk akurasi pada transkrip final maupun parsial, diukur menggunakan metodologi streaming Artificial Analysis, bukan yang sudah diplot sebagai baris di papan pelacak. $0,54 per jam audio — sekitar $9,00 per 1.000 menit. Bahasa yang sama, 60 bahasa, distribusi hanya API yang sama, tanpa bobot yang dipublikasikan. Streaming berbiaya 5,4× tarif batch dan, menurut angka Microsoft sendiri, 0,5 poin akurasi. Apakah itu penawaran menarik atau pajak sepenuhnya bergantung pada satu pertanyaan: apakah ada sesuatu dalam pipeline Anda yang membutuhkan transkrip sebelum kalimat selesai?
Karena kedua model berasal dari satu vendor dan satu sumber dokumentasi, perbandingannya luar biasa bersih — tidak ada tebakan kesetaraan fitur, tidak ada ketidakcocokan versi benchmark, tidak ada "angka mereka versus angka kami." Ini adalah satu vendor yang menetapkan harga untuk dua kecepatan dari kemampuan yang sama, dan pekerjaan yang menarik adalah mencari tahu beban kerja mana yang sebenarnya dicakup oleh tier murah.
Keluarga itu, dalam dua baris
• MAI-Transcribe-2 — batch, audio prarekaman, dirilis 3 September 2026. 2,0% AA-WER, peringkat kedua di papan peringkat non-streaming Artificial Analysis. Sekitar 411× waktu nyata, juga peringkat kedua. $0,10 per jam audio, sekitar $1,67 per 1.000 menit, sebagai penawaran waktu terbatas hingga akhir tahun tanpa harga standar yang dipublikasikan. Mencakup diarisasi pembicara dan mengembalikan stempel waktu tingkat kata. 60 bahasa dengan identifikasi bahasa otomatis.
• MAI-Transcribe-2-Streaming — transkripsi berkelanjutan bergaya WebSocket secara real-time, dirilis 1 Oktober 2026. Microsoft melaporkan WER transkrip akhir 2,5% pada 0,13 detik setelah akhir ucapan, dan 2,5% yang sama pada parsial pertama pada 0,12 detik, yang digambarkannya sebagai yang pertama untuk akurasi pada keduanya — klaim vendor yang diukur dengan metodologi streaming Artificial Analysis, meskipun pada saat penulisan, papan pelacak itu sendiri (37 model) belum memplot model tersebut, dan pemimpinnya saat ini adalah Grok Voice Transcribe 2.0 pada 2,73% dan 0,49 detik. $0,54 per jam audio, sekitar $9,00 per 1.000 menit, sebagai harga perkenalan hingga akhir tahun. 60 bahasa dengan deteksi bahasa berkelanjutan otomatis. Tidak ada klaim diarisasi yang dipublikasikan, tidak ada klaim stempel waktu kata yang dipublikasikan.
Satu-satunya asimetri yang bukan tentang kecepatan atau harga adalah kemampuan: diarisasi dan stempel waktu kata milik model batch adalah fitur yang didokumentasikan, sedangkan milik model streaming tidak. Itu lebih penting daripada selisih akurasi 0,5 poin, dan itulah alasan banyak tim pada akhirnya akan menjalankan keduanya.

Apa yang sebenarnya Anda dapatkan dari 5,4×
Dengan $1,67 per 1.000 menit, transkripsi batch pada tingkat akurasi ini hampir gratis secara marginal. Dengan $9,00 per 1.000 menit, streaming menjadi pos biaya nyata — kira-kira setara dengan biaya transkripsi audio yang sama sebanyak lima kali, ditambah setengah poin akurasi. Jadi, pertanyaannya bukan apakah real-time bernilai lebih; melainkan menit spesifik mana yang membutuhkannya.
Beban kerja yang jelas membutuhkannya: takarir langsung yang dibaca seseorang saat pembicara berbicara, di mana 0,13 detik versus akhir file adalah keseluruhan produknya; bantuan agen waktu nyata dan penilaian kepatuhan, di mana intervensi yang tiba setelah panggilan berakhir tidak ada gunanya; dan aplikasi suara interaktif, di mana satu giliran tidak dapat selesai sampai transkripnya selesai. Dalam ketiganya, model batch bukanlah opsi yang lebih murah, melainkan bukan opsi sama sekali — tidak ada harga yang membuat transkripsi pasca-kejadian menjadi waktu nyata.
Beban kerja yang jelas bukan untuk itu: perekaman rapat dan panggilan yang diproses setelah kejadian, arsip media, QA batch pusat kontak, tinjauan kepatuhan atas panggilan yang telah selesai, serta pemberian takarir podcast dan video. Inilah tepatnya alur kerja yang menjadi sasaran utama model batch dengan kecepatan 411× real time dan tarif $1,67, dan membayar 5,4× untuk memangkas beberapa ratus milidetik dari transkrip yang tidak dibaca siapa pun sampai besok adalah pemborosan belaka. Tambahkan fitur diarisasi dan stempel waktu kata — model batch mendokumentasikannya, model streaming tidak — dan argumen pasca-kejadian menjadi lebih kuat, bukan lebih lemah.
Bagian tengah yang menarik adalah ketika keduanya benar-benar saling melengkapi: jalankan streaming untuk antarmuka langsung dan batch untuk pencatatan. Panggilan dukungan yang ditranskripsikan secara real time untuk menggerakkan panel bantuan agen, lalu ditranskripsikan ulang secara batch pada malam hari untuk menghasilkan transkrip arsip dengan diarisasi dan stempel waktu, berbiaya sedikit lebih tinggi daripada batch saja dan mendapatkan kedua perilaku tersebut. Pola itu baru menjadi mungkin pada bulan September, dan rilis Oktober adalah yang melengkapinya.
Di mana struktur dua divisi terlihat
Ada dua hal tentang keluarga ini yang perlu diperhatikan karena keduanya bersifat struktural, bukan insidental.
Pertama, hierarki akurasi terbalik dari pola biasanya. Model streaming biasanya membayar penalti akurasi yang substansial untuk output real-time; di sini penaltinya adalah 0,5 poin, dari 2,0% pada papan batch menjadi 2,5% yang diklaim pada papan streaming. Microsoft mendapatkan model real-time dalam selisih setengah poin dari model unggulan batch-nya berdasarkan data mereka sendiri, yang merupakan pencapaian rekayasa sebenarnya dari rilis Oktober jika itu bertahan — bukan posisi teratas di papan peringkat, yang dapat berubah dengan pengujian ulang yang baik dan yang belum dikonfirmasi oleh pelacak.
Kedua, penetapan harganya juga terbalik dari pola yang biasa. Vendor biasanya memberi diskon untuk tier volume yang lebih tinggi; Microsoft menetapkan harga streaming 5,4× batch dan membiarkan keduanya pada tarif perkenalan yang berakhir pada waktu yang sama. Itu lebih tampak sebagai dua peluncuran terpisah yang masing-masing membawa diskon peluncuran, bukan sebagai premi streaming yang disengaja, tanpa tarif standar yang dipublikasikan untuk salah satu pun. Tim yang merencanakan anggaran 2027 harus memperlakukan kedua angka itu sebagai sementara — $1,67 dan $9,00 keduanya dilabeli waktu terbatas, dan tidak ada satu pun yang memiliki harga pengganti yang diumumkan.

Apa yang belum terbukti
Pertanyaan terbuka model batch dari September masih terbuka: tidak ada tingkat kesalahan diarisasi yang dipublikasikan, tidak ada rincian per bahasa di balik klaim 60 bahasa, dan harga promosi tanpa penerus yang disebutkan. Model streaming menambahkan satu lagi yang khusus untuk pekerjaan real-time — WER streaming diukur pada audio bersih, dan kualitas transkrip parsial dalam aliran far-field yang bising adalah mode kegagalan yang paling penting dalam penerapan dan paling sedikit dibahas oleh materi peluncuran. Model ini juga mewarisi kedekatan papan streaming: tiga teratas di papan 37 model milik pelacak berada dalam selisih kurang dari sepersekian poin, jadi "pertama" adalah status yang dapat berubah jika dijalankan ulang — dan posisi pertama Microsoft adalah klaim, bukan baris.
Namun, pertanyaan di tingkat keluarga adalah yang perlu diperhatikan. Microsoft kini menjual kemampuan yang sama dengan dua harga yang selisihnya lima kali lipat, dengan tier mahal tidak memiliki dua fitur yang didokumentasikan oleh tier murah. Jika diarisasi dan stempel waktu kata hadir pada SKU streaming, kesenjangannya menyempit menjadi sekadar pertukaran latensi dan harga, yang merupakan keputusan jauh lebih sederhana. Jika tidak, struktur dua divisi itu bersifat permanen dan arsitektur harus dibangun di sekitarnya.
Apa dampaknya bagi stack transkripsi

Hasil praktisnya adalah transkripsi tidak lagi menjadi satu butir tersendiri pada September dan menjadi keputusan perutean pada Oktober. Sebuah pipeline yang dulu menjadikan satu API sebagai standar kini menginginkan streaming untuk permukaan live, batch untuk rekaman, dan aturan tentang audio mana yang menempuh jalur mana — dan aturan itu sendiri adalah masalah perutean, yang merupakan tingkat kompleksitas yang aneh untuk masuk ke dalam siklus rilis satu vendor.
Dampaknya paling terasa pada apa yang berada di atas transkrip. Tingkat mana pun yang menghasilkan teks, teks itu kemudian diringkas, diklasifikasikan, diredaksi, dan dirutekan, dan langkah-langkah tersebut berjalan pada model bahasa dengan profil latensi dan biaya masing-masing — transkrip langsung menginginkan model yang cepat dan murah, sedangkan transkrip arsip mampu memakai model yang lebih kuat. OrcaRouter menangani tepat lapisan itu: satu API untuk 200+ model, harga daftar penyedia diteruskan dengan markup 0%, failover otomatis, dan DSL perutean yang memilih model per beban kerja, bukan per pipeline. Baik MAI-Transcribe-2-Streaming maupun MAI-Transcribe-2 tidak ada dalam daftar itu — keduanya dilayani melalui stack ucapan milik Microsoft sendiri — tetapi lapisan transkripsi dua-divisi adalah argumen terkuat sejauh ini untuk menjaga agar semua yang berada di hilirnya tetap portabel.
Ringkasan jujurnya: streaming bukanlah MAI-Transcribe-2 yang lebih baik, melainkan produk kedua dengan harga tersendiri. Belilah untuk menit-menit yang benar-benar perlu real-time, biarkan sisanya di tier murah, dan anggarkan bahwa kedua tarif akan ditetapkan ulang harganya saat periode perkenalan berakhir.
