Kartu hero artikel bertuliskan 'MAI-Transcribe-2-Streaming vs MAI-Transcribe-2' dengan badge 'KELUARGA YANG SAMA · DUA TINGKAT HARGA' dan subjudul 'Bayar 5,4x untuk timing tingkat kata', dibuat sebagai dua kartu nama model yang dipisahkan oleh badge VS, dengan strip chip yang menampilkan $9,00 versus $1,67 per 1.000 menit, tingkat kesalahan kata yang diklaim 2,5% versus yang diaudit 2,0%, 0,13 dtk ke transkrip akhir versus sekitar 411x waktu nyata, serta timestamp plus diarisasi hanya pada tier batch, di atas gradien putih ke biru dengan logo OrcaRouter di kanan bawah.
Guides & Insights

MAI-Transcribe-2-Streaming vs MAI-Transcribe-2: Bayar 5,4× untuk Penentuan Waktu Tingkat Kata

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

MAI-Transcribe-2-Streaming dan MAI-Transcribe-2 adalah keluarga model yang sama yang terbagi ke dalam dua tingkat harga, dan pembagiannya cukup jelas untuk dijadikan dasar perencanaan. MAI-Transcribe-2 dirilis pada 3 September 2026 sebagai model batch: tingkat kesalahan kata 2,0% pada papan non-streaming Artificial Analysis, sekitar 411× waktu nyata, dan $0,10 per jam audio — sekitar $1,67 per 1.000 menit. MAI-Transcribe-2-Streaming dirilis pada 1 Oktober 2026 sebagai varian real-time: klaim tingkat kesalahan kata streaming 2,5% pada 0,13 detik hingga transkrip final, yang oleh Microsoft disebut sebagai yang pertama untuk akurasi pada transkrip final maupun parsial, diukur menggunakan metodologi streaming Artificial Analysis, bukan yang sudah diplot sebagai baris di papan pelacak. $0,54 per jam audio — sekitar $9,00 per 1.000 menit. Bahasa yang sama, 60 bahasa, distribusi hanya API yang sama, tanpa bobot yang dipublikasikan. Streaming berbiaya 5,4× tarif batch dan, menurut angka Microsoft sendiri, 0,5 poin akurasi. Apakah itu penawaran menarik atau pajak sepenuhnya bergantung pada satu pertanyaan: apakah ada sesuatu dalam pipeline Anda yang membutuhkan transkrip sebelum kalimat selesai?

Karena kedua model berasal dari satu vendor dan satu sumber dokumentasi, perbandingannya luar biasa bersih — tidak ada tebakan kesetaraan fitur, tidak ada ketidakcocokan versi benchmark, tidak ada "angka mereka versus angka kami." Ini adalah satu vendor yang menetapkan harga untuk dua kecepatan dari kemampuan yang sama, dan pekerjaan yang menarik adalah mencari tahu beban kerja mana yang sebenarnya dicakup oleh tier murah.

Keluarga itu, dalam dua baris

• MAI-Transcribe-2 — batch, audio prarekaman, dirilis 3 September 2026. 2,0% AA-WER, peringkat kedua di papan peringkat non-streaming Artificial Analysis. Sekitar 411× waktu nyata, juga peringkat kedua. $0,10 per jam audio, sekitar $1,67 per 1.000 menit, sebagai penawaran waktu terbatas hingga akhir tahun tanpa harga standar yang dipublikasikan. Mencakup diarisasi pembicara dan mengembalikan stempel waktu tingkat kata. 60 bahasa dengan identifikasi bahasa otomatis.

• MAI-Transcribe-2-Streaming — transkripsi berkelanjutan bergaya WebSocket secara real-time, dirilis 1 Oktober 2026. Microsoft melaporkan WER transkrip akhir 2,5% pada 0,13 detik setelah akhir ucapan, dan 2,5% yang sama pada parsial pertama pada 0,12 detik, yang digambarkannya sebagai yang pertama untuk akurasi pada keduanya — klaim vendor yang diukur dengan metodologi streaming Artificial Analysis, meskipun pada saat penulisan, papan pelacak itu sendiri (37 model) belum memplot model tersebut, dan pemimpinnya saat ini adalah Grok Voice Transcribe 2.0 pada 2,73% dan 0,49 detik. $0,54 per jam audio, sekitar $9,00 per 1.000 menit, sebagai harga perkenalan hingga akhir tahun. 60 bahasa dengan deteksi bahasa berkelanjutan otomatis. Tidak ada klaim diarisasi yang dipublikasikan, tidak ada klaim stempel waktu kata yang dipublikasikan.

Satu-satunya asimetri yang bukan tentang kecepatan atau harga adalah kemampuan: diarisasi dan stempel waktu kata milik model batch adalah fitur yang didokumentasikan, sedangkan milik model streaming tidak. Itu lebih penting daripada selisih akurasi 0,5 poin, dan itulah alasan banyak tim pada akhirnya akan menjalankan keduanya.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

Apa yang sebenarnya Anda dapatkan dari 5,4×

Dengan $1,67 per 1.000 menit, transkripsi batch pada tingkat akurasi ini hampir gratis secara marginal. Dengan $9,00 per 1.000 menit, streaming menjadi pos biaya nyata — kira-kira setara dengan biaya transkripsi audio yang sama sebanyak lima kali, ditambah setengah poin akurasi. Jadi, pertanyaannya bukan apakah real-time bernilai lebih; melainkan menit spesifik mana yang membutuhkannya.

Beban kerja yang jelas membutuhkannya: takarir langsung yang dibaca seseorang saat pembicara berbicara, di mana 0,13 detik versus akhir file adalah keseluruhan produknya; bantuan agen waktu nyata dan penilaian kepatuhan, di mana intervensi yang tiba setelah panggilan berakhir tidak ada gunanya; dan aplikasi suara interaktif, di mana satu giliran tidak dapat selesai sampai transkripnya selesai. Dalam ketiganya, model batch bukanlah opsi yang lebih murah, melainkan bukan opsi sama sekali — tidak ada harga yang membuat transkripsi pasca-kejadian menjadi waktu nyata.

Beban kerja yang jelas bukan untuk itu: perekaman rapat dan panggilan yang diproses setelah kejadian, arsip media, QA batch pusat kontak, tinjauan kepatuhan atas panggilan yang telah selesai, serta pemberian takarir podcast dan video. Inilah tepatnya alur kerja yang menjadi sasaran utama model batch dengan kecepatan 411× real time dan tarif $1,67, dan membayar 5,4× untuk memangkas beberapa ratus milidetik dari transkrip yang tidak dibaca siapa pun sampai besok adalah pemborosan belaka. Tambahkan fitur diarisasi dan stempel waktu kata — model batch mendokumentasikannya, model streaming tidak — dan argumen pasca-kejadian menjadi lebih kuat, bukan lebih lemah.

Bagian tengah yang menarik adalah ketika keduanya benar-benar saling melengkapi: jalankan streaming untuk antarmuka langsung dan batch untuk pencatatan. Panggilan dukungan yang ditranskripsikan secara real time untuk menggerakkan panel bantuan agen, lalu ditranskripsikan ulang secara batch pada malam hari untuk menghasilkan transkrip arsip dengan diarisasi dan stempel waktu, berbiaya sedikit lebih tinggi daripada batch saja dan mendapatkan kedua perilaku tersebut. Pola itu baru menjadi mungkin pada bulan September, dan rilis Oktober adalah yang melengkapinya.

Di mana struktur dua divisi terlihat

Ada dua hal tentang keluarga ini yang perlu diperhatikan karena keduanya bersifat struktural, bukan insidental.

Pertama, hierarki akurasi terbalik dari pola biasanya. Model streaming biasanya membayar penalti akurasi yang substansial untuk output real-time; di sini penaltinya adalah 0,5 poin, dari 2,0% pada papan batch menjadi 2,5% yang diklaim pada papan streaming. Microsoft mendapatkan model real-time dalam selisih setengah poin dari model unggulan batch-nya berdasarkan data mereka sendiri, yang merupakan pencapaian rekayasa sebenarnya dari rilis Oktober jika itu bertahan — bukan posisi teratas di papan peringkat, yang dapat berubah dengan pengujian ulang yang baik dan yang belum dikonfirmasi oleh pelacak.

Kedua, penetapan harganya juga terbalik dari pola yang biasa. Vendor biasanya memberi diskon untuk tier volume yang lebih tinggi; Microsoft menetapkan harga streaming 5,4× batch dan membiarkan keduanya pada tarif perkenalan yang berakhir pada waktu yang sama. Itu lebih tampak sebagai dua peluncuran terpisah yang masing-masing membawa diskon peluncuran, bukan sebagai premi streaming yang disengaja, tanpa tarif standar yang dipublikasikan untuk salah satu pun. Tim yang merencanakan anggaran 2027 harus memperlakukan kedua angka itu sebagai sementara — $1,67 dan $9,00 keduanya dilabeli waktu terbatas, dan tidak ada satu pun yang memiliki harga pengganti yang diumumkan.

A generated two-column scoreboard card titled 'One family, two divisions' contrasting MAI-Transcribe-2 (batch) — non-streaming, 2.0% AA-WER at #2, roughly 411x real time at #2, $1.67 per 1,000 minutes ($0.10 per audio-hour), bundled diarization, returned word timestamps, 60 languages with automatic ID, released September 3, 2026 — with MAI-Transcribe-2-Streaming — streaming, 2.5% claimed word error rate, 0.13s to final transcript, $9.00 per 1,000 minutes ($0.54 per audio-hour), diarization not published, word timestamps not published, 60 languages with continuous detection, released October 1, 2026, with the OrcaRouter logo bottom right.

Apa yang belum terbukti

Pertanyaan terbuka model batch dari September masih terbuka: tidak ada tingkat kesalahan diarisasi yang dipublikasikan, tidak ada rincian per bahasa di balik klaim 60 bahasa, dan harga promosi tanpa penerus yang disebutkan. Model streaming menambahkan satu lagi yang khusus untuk pekerjaan real-time — WER streaming diukur pada audio bersih, dan kualitas transkrip parsial dalam aliran far-field yang bising adalah mode kegagalan yang paling penting dalam penerapan dan paling sedikit dibahas oleh materi peluncuran. Model ini juga mewarisi kedekatan papan streaming: tiga teratas di papan 37 model milik pelacak berada dalam selisih kurang dari sepersekian poin, jadi "pertama" adalah status yang dapat berubah jika dijalankan ulang — dan posisi pertama Microsoft adalah klaim, bukan baris.

Namun, pertanyaan di tingkat keluarga adalah yang perlu diperhatikan. Microsoft kini menjual kemampuan yang sama dengan dua harga yang selisihnya lima kali lipat, dengan tier mahal tidak memiliki dua fitur yang didokumentasikan oleh tier murah. Jika diarisasi dan stempel waktu kata hadir pada SKU streaming, kesenjangannya menyempit menjadi sekadar pertukaran latensi dan harga, yang merupakan keputusan jauh lebih sederhana. Jika tidak, struktur dua divisi itu bersifat permanen dan arsitektur harus dibangun di sekitarnya.

Apa dampaknya bagi stack transkripsi

A generated routing card titled 'Which minutes go on which tier' splitting workloads into a streaming column (live captions a person reads while the speaker talks, real-time agent assist, compliance or quality scoring that must land before the call ends, interactive voice turns) and a batch column (meeting and call recordings processed after the fact, media archives, contact-centre batch QA, podcast and video captioning, anything needing bundled diarization or word-level timestamps), with a note that a stream-and-reprocess pattern covers both and a footer stating that neither tier is on OrcaRouter and both are served through Microsoft's own speech stack, with the OrcaRouter logo bottom right.

Hasil praktisnya adalah transkripsi tidak lagi menjadi satu butir tersendiri pada September dan menjadi keputusan perutean pada Oktober. Sebuah pipeline yang dulu menjadikan satu API sebagai standar kini menginginkan streaming untuk permukaan live, batch untuk rekaman, dan aturan tentang audio mana yang menempuh jalur mana — dan aturan itu sendiri adalah masalah perutean, yang merupakan tingkat kompleksitas yang aneh untuk masuk ke dalam siklus rilis satu vendor.

Dampaknya paling terasa pada apa yang berada di atas transkrip. Tingkat mana pun yang menghasilkan teks, teks itu kemudian diringkas, diklasifikasikan, diredaksi, dan dirutekan, dan langkah-langkah tersebut berjalan pada model bahasa dengan profil latensi dan biaya masing-masing — transkrip langsung menginginkan model yang cepat dan murah, sedangkan transkrip arsip mampu memakai model yang lebih kuat. OrcaRouter menangani tepat lapisan itu: satu API untuk 200+ model, harga daftar penyedia diteruskan dengan markup 0%, failover otomatis, dan DSL perutean yang memilih model per beban kerja, bukan per pipeline. Baik MAI-Transcribe-2-Streaming maupun MAI-Transcribe-2 tidak ada dalam daftar itu — keduanya dilayani melalui stack ucapan milik Microsoft sendiri — tetapi lapisan transkripsi dua-divisi adalah argumen terkuat sejauh ini untuk menjaga agar semua yang berada di hilirnya tetap portabel.

Ringkasan jujurnya: streaming bukanlah MAI-Transcribe-2 yang lebih baik, melainkan produk kedua dengan harga tersendiri. Belilah untuk menit-menit yang benar-benar perlu real-time, biarkan sisanya di tier murah, dan anggarkan bahwa kedua tarif akan ditetapkan ulang harganya saat periode perkenalan berakhir.