Kartu hero artikel bertuliskan 'MAI-Transcribe-2-Streaming vs Gemini 3.5 Transcribe Live' dengan badge 'BERHADAPAN LANGSUNG · UCAPAN-KE-TEKS STREAMING' dan subjudul 'Sama-sama $9, trade-off berbeda', dengan chip yang menunjukkan 2,5% diklaim versus 4,00% diaudit, 0,13 detik versus 0,40 detik hingga final, 60 bahasa versus 85+, dan tidak ada diarisasi yang dipublikasikan pada keduanya, di atas gradien putih ke biru dengan logo OrcaRouter di kanan bawah.
Guides & Insights

MAI-Transcribe-2-Streaming vs Gemini 3.5 Transcribe Live: Harga $9 Sama, Trade-off Berbeda

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

MAI-Transcribe-2-Streaming dan Gemini 3.5 Transcribe Live berbiaya sama dan dibangun atas teori yang berlawanan tentang untuk apa sebuah transcriber streaming digunakan. Keduanya berada di sekitar $9,00 per 1.000 menit audio yang dialirkan. Model Microsoft, yang dirilis 1 Oktober 2026, adalah instrumen presisi: tingkat kesalahan kata streaming yang diklaim 2,5% pada 0,13 detik menuju transkrip final, peringkat pertama untuk akurasi pada transkrip final maupun parsial menurut klaim Microsoft sendiri, diukur dengan metodologi streaming Artificial Analysis tetapi belum diplot sebagai baris di papan tersebut. Model lainnya, dalam pratinjau publik sejak 26 Agustus 2026 dan dilayani melalui Live API, adalah instrumen cakupan: 85+ bahasa dengan peralihan di tengah stream, tier gratis, dan tingkat kesalahan kata streaming 4,00% pada 0,40 detik, angka yang diukur Artificial Analysis untuknya. Tidak ada yang menjadi pilihan yang jelas, dan alasannya adalah keduanya sebenarnya tidak bersaing untuk beban kerja yang sama.

Berikut adu langsungnya sebagaimana angka sebenarnya terbaca — angka yang dilaporkan vendor diberi label, angka tracker disertai atribusi, dan bagian-bagian ketika satu model unggul pada dimensi yang sama sekali tidak diperebutkan oleh model lainnya.

Versi satu baris

• Akurasi dan latensi — MAI-Transcribe-2-Streaming, berdasarkan angka yang dipublikasikan. Microsoft mengklaim WER streaming 2,5% pada 0,13 detik hingga transkrip final, pertama dalam hal akurasi untuk transkrip final maupun parsial, dan 2,5% pada transkrip parsial pertama pada 0,12 detik. Sebagai pembanding, Artificial Analysis menempatkan Gemini 3.5 Transcribe Live pada 4,00% di 0,40 detik. Keunggulan yang diklaim Microsoft adalah 1,5 poin dan sekitar tiga kali lebih cepat untuk mencapai hasil akhir. Catatannya, pelacak tersebut belum memplot MAI-Transcribe-2-Streaming itu sendiri — pemimpin papan saat ini adalah Grok Voice Transcribe 2.0 pada 2,73% dan 0,49 detik, dengan Muse Voice Transcribe pada 3,06% dan 0,16 detik — jadi angka 2,5% itu adalah angka vendor yang dibaca terhadap bidang yang memang diukur oleh pelacak. Ini bukan hasil yang nyaris imbang pada dimensi yang dipublikasikan kedua model, tetapi hanya satu sisinya yang dipublikasikan secara independen.

• Keluasan bahasa — Gemini 3.5 Transcribe Live. 85+ bahasa dengan deteksi otomatis dan kemampuan untuk mengganti bahasa di tengah streaming tanpa memulai ulang sesi, yang merupakan klaim utama Google untuk Live API. MAI-Transcribe-2-Streaming mencakup 60 bahasa dengan deteksi bahasa berkelanjutan otomatis. Batas bawah Microsoft lebih tinggi; batas atas Google lebih luas, dan selisih 25 bahasa itu sebagian besar berada pada bahasa yang model streaming satu bahasanya sama sekali tidak dapat digunakan.

• Bentuk sesi — Gemini 3.5 Transcribe Live, dan yang ini bisa menguntungkan sekaligus merugikan. Live API adalah sesi WebSocket yang dibatasi hingga 10 menit, yang tidak masalah untuk satu giliran agen suara tetapi janggal untuk rapat berdurasi satu jam; Microsoft tidak menerbitkan batas sesi yang setara untuk model streamingnya, yang penting jika unit kerja Anda adalah panggilan, bukan giliran percakapan.

• Biaya masuk — Gemini 3.5 Transcribe Live. Ada tier gratis, dan tarif campuran Google menjadi sekitar $0,009 per menit pada penetapan harga berbasis token. $0,54 per jam audio milik Microsoft adalah tarif perkenalan yang menurut Microsoft berlaku hingga akhir tahun, tanpa harga standar yang diungkapkan — struktur yang sama seperti peluncuran batch September-nya.

Screenshot of the Artificial Analysis Speech-to-Text leaderboard page showing the AA-WER Streaming Index chart, which plots final-transcript word error rate against time to final transcription after end of speech across the streaming field; MAI-Transcribe-2-Streaming does not appear on the chart.

Mengapa kesenjangan akurasi lebih besar daripada yang terlihat

Selisih tingkat kesalahan kata sebesar 1,5 poin terdengar seperti perbedaan pembulatan sampai Anda menghitung biayanya. Pada WER streaming 4,00%, Gemini 3.5 Transcribe Live salah sekitar 40 kata per 1.000; pada 2,5% yang diklaim Microsoft, MAI-Transcribe-2-Streaming salah 25 kata. Pada volume yang dihasilkan pipeline waktu nyata — organisasi dukungan yang menjalankan 5.000 jam panggilan per bulan adalah 300.000 menit, lebih dari 45 juta kata pada kecepatan percakapan — selisih itu berarti jutaan kata salah setiap tahun, terkonsentrasi pada entitas yang diandalkan sistem hilir: nama akun, nomor tiket, dosis, alamat.

Perbedaan latensi adalah yang lebih sulit untuk dijual. 0,13 detik versus 0,40 detik setelah akhir ucapan dapat terpersepsi dalam aliran takarir langsung — di bawah sekitar 0,2 detik terbaca sebagai simultan, dan sepertiga detik terbaca sebagai transkrip yang mengejar pembicara — tetapi tidak dapat terpersepsi dalam panel bantuan agen yang menyegarkan pada skala waktu manusia. Jika konsumen Anda adalah orang yang membaca sambil mengikuti, keunggulan latensi Microsoft adalah produknya. Jika konsumen Anda adalah model yang menerima transkrip akhir saat giliran berakhir, itu hanyalah angka.

Kedua angka itu membawa catatan yang sama, dan perlu dinyatakan sekali: ini adalah angka dari satu kali eksekusi pada papan pelacakan yang memuat 37 model, dan selisih antara peringkat pertama dan ketiga di papan itu kurang dari satu poin. Menjalankannya ulang dapat mengacak posisi teratas papan peringkat streaming dengan cara yang tidak dapat dilakukan oleh selisih dua poin di papan batch. Lagipula, 2,5% milik Microsoft belum ada di papan itu sama sekali — itu adalah klaim vendor yang diukur berdasarkan metodologi pelacak, yang merupakan hal berbeda dari baris yang diterbitkan pelacak.

Batas-batas itulah tempat keputusan itu sebenarnya berada.

Batasan fitur memisahkan keduanya lebih cepat daripada benchmark, dan keduanya bergerak ke arah yang berlawanan.

Gemini 3.5 Transcribe Live memiliki tiga batasan yang terdokumentasi: batas sesi 10 menit pada Live API, tidak ada diarisasi pembicara, dan tidak ada stempel waktu tingkat kata. Yang pertama bersifat arsitektural — streaming melalui sesi WebSocket memiliki batas maksimum secara desain — dan itu berarti transkripsi live berdurasi panjang harus disambung antarsesi, dengan penanganan sambungannya diserahkan kepada Anda. Dua yang terakhir bersifat mutlak: jika produk Anda perlu mengaitkan ucapan ke pembicara, atau menempatkan kata pada stempel waktu untuk pencarian atau sinkronisasi subtitle, Gemini 3.5 Transcribe Live tidak melakukannya berapa pun harganya.

Batasan MAI-Transcribe-2-Streaming kurang terdokumentasi, yang itu sendiri merupakan informasi. Microsoft tidak mengklaim diarisasi untuk model streaming dan juga tidak mengklaim stempel waktu kata; MAI-Transcribe-2 batch menyertakan diarisasi dan mengembalikan stempel waktu tingkat kata, tetapi itu adalah produk batch, dan mengasumsikan SKU streaming mewarisinya adalah persis jenis inferensi yang keberadaan materi peluncuran dimaksudkan untuk mencegah. Yang diklaim Microsoft adalah 60 bahasa dengan deteksi bahasa berkelanjutan dan penempatan Pareto-frontier pada akurasi versus latensi — keduanya pernyataan vendor yang konsisten dengan data pelacak.

Jadi, pembacaan fitur yang jujur adalah: tidak ada model streaming yang mempublikasikan diarisasi atau stempel waktu kata. Gemini 3.5 Transcribe Live memiliki batas sesi yang dipublikasikan dan tier gratis; MAI-Transcribe-2-Streaming memiliki jumlah bahasa yang dipublikasikan dan tidak memiliki batas yang dipublikasikan. Jika kebutuhan Anda mencakup diarisasi, tidak ada dari keduanya yang menjadi jawabannya, dan yang Anda hadapi adalah transkripsi batch dengan lapisan streaming yang dipasang di depannya.

Apa yang sebenarnya coba disampaikan paritas harga kepada Anda

Dua vendor yang mencapai angka $9 yang sama per 1.000 menit dari arah yang berlawanan adalah fakta paling menarik dalam perbandingan ini. Google mencapainya melalui penetapan harga berbasis token pada sesi Live API: audio masuk seharga $3,50 per juta token, teks keluar seharga $21 per juta, dan konsumsi kasar 175 token teks per menit, yang jika digabungkan menjadi sekitar $0,009 per menit. Microsoft mencapainya dengan mencantumkan tarif flat $0,54 per jam audio untuk model dalam keluarga yang versi batch-nya berjalan pada $0,10. Yang satu adalah sesi real-time terukur; yang lain adalah tarif flat per menit dengan diskon perkenalan.

Struktur-struktur itu berperilaku berbeda saat Anda melakukan penskalaan. Tarif tetap dapat diprediksi dan mudah dianggarkan; sesi yang diukur berdasarkan token berubah mengikuti seberapa banyak model membalas dan berapa lama sesi dibiarkan terbuka tanpa aktivitas. Untuk pipeline bervolume tinggi, tarif tetap adalah tagihan yang lebih ramah; untuk prototipe atau fitur bervolume rendah, tier gratis dan penagihan per token adalah pintu masuk yang lebih ramah.

A generated bar-comparison card titled 'Two routes to $9.00 per 1,000 minutes' showing MAI-Transcribe-2-Streaming at a flat $0.54 per audio-hour introductory rate and Gemini 3.5 Transcribe Live at roughly $0.009 per minute blended from token pricing, both at $9.00, with MAI-Transcribe-2 (batch sibling) at $1.67, and a note that neither streaming rate has an announced post-promotional successor and that Gemini's blended figure uses $3.50 per million audio-in and $21 per million text-out at about 175 text tokens per minute, with the OrcaRouter logo bottom right.

Apa yang tidak diubah oleh kedua struktur itu adalah lapisan di atas transkrip. Model apa pun yang menghasilkannya, transkrip langsung menjadi masukan untuk peringkasan, klasifikasi, penyuntingan, dan perutean, dan langkah-langkah tersebut memiliki kurva biaya dan kualitasnya sendiri — biasanya dijalankan di beberapa model, bukan hanya satu. Itulah lapisan yang dicakup OrcaRouter: satu API untuk 200+ model, harga daftar penyedia diteruskan dengan markup 0%, failover otomatis, dan DSL perutean yang dapat mengirim transkrip ke model berbeda per beban kerja. Baik MAI-Transcribe-2-Streaming maupun Gemini 3.5 Transcribe Live tidak ada dalam daftar tersebut — keduanya dilayani melalui stack suara milik Microsoft dan Google masing-masing — dan intinya bukan untuk merutekannya, melainkan menjaga agar semua yang berada di hilirnya tetap portabel.

A generated three-axis comparison card titled 'Streaming speech-to-text, on three axes' contrasting MAI-Transcribe-2-Streaming (2.5% streaming WER as a claim, 0.13s to final, 60 languages with automatic detection, no published session cap, diarization not published, word timestamps not published, $9.00 per 1,000 minutes introductory) with Gemini 3.5 Transcribe Live (4.00% streaming WER per Artificial Analysis, 0.40s to final, 85+ languages with mid-stream switching, a 10-minute session cap on the Live API, no diarization, no word timestamps, no session cap published), with the OrcaRouter logo bottom right.

Mana yang harus dipilih

Pilih MAI-Transcribe-2-Streaming ketika akurasi dan waktu penyelesaian adalah produknya: takarir langsung yang dibaca manusia, penilaian kepatuhan atau kualitas secara real-time ketika entitas yang salah didengar menimbulkan biaya, atau sesi panjang yang akan memaksa Anda menyambung-nyambung karena batas 10 menit Gemini. Pilih Gemini 3.5 Transcribe Live ketika cakupan adalah produknya: deployment global lintas bahasa yang tidak dapat Anda daftar sebelumnya, peralihan bahasa di tengah aliran, atau prototipe yang tier gratis dan penagihan per tokennya menghilangkan komitmen. Tim yang membutuhkan keduanya tidak terjebak — keduanya adalah API berbeda dengan model sesi yang berbeda, dan arsitektur yang jujur adalah merutekan berdasarkan beban kerja alih-alih menstandarkan pada satu pilihan.

Klaim yang layak diambil dari perbandingan ini bukanlah bahwa Microsoft menang. Melainkan bahwa transkripsi streaming kini memiliki dua opsi terdepan yang kredibel dengan harga yang identik, yang berarti keputusan telah bergeser dari "apa yang tersedia" ke "apa yang dibutuhkan oleh beban kerja spesifik ini." Itu masalah yang lebih baik untuk dimiliki.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari