
Voxtral Mini 4B Realtime Arabic vs MAI-Transcribe-2-Streaming: Dua Kedatangan Oktober, Dua Masalah Bukti
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Tujuh hari memisahkan kedua model ucapan real-time ini, dan keduanya hadir dengan cara yang berlawanan. MAI-Transcribe-2-Streaming adalah model transkripsi streaming pertama Microsoft AI, diumumkan pada 1 Oktober 2026 dengan tulisan peluncuran, listing pratinjau Azure, harga $0,54 per jam audio sebagai harga perkenalan hingga akhir tahun, dan klaim sebagai yang pertama di papan streaming Artificial Analysis untuk akurasi transkrip final maupun parsial pada tingkat kesalahan kata 2,5% dengan teks final siap 0,13 detik setelah akhir ucapan. Voxtral Mini 4B Realtime Arabic adalah model streaming dialek Arab milik Mistral AI, diterbitkan ke Hugging Face pada 8 Oktober 2026 tanpa pengumuman sama sekali — tanpa posting blog, tanpa harga, tanpa layanan, hanya bobot Apache 2.0 dan kartu model yang melaporkan rata-rata Character Error Rate 8,82% di tujuh tolok ukur Arab pada jeda 480 milidetik. Model Microsoft adalah produk jadi dengan klaim utama yang tidak dapat diverifikasi. Model Mistral adalah artefak yang dapat diverifikasi tanpa produk di sekitarnya. Keduanya layak dipahami justru karena keduanya meninggalkan pertanyaan sentral — seberapa baik ini menangani bahasa Arab — yang hanya dijawab oleh vendor.
Perbandingan ini tetap layak dilakukan, karena kedua model membingkai keputusan rekayasa yang sama dari ujung yang berlawanan. Microsoft menjual keluasan dan layanan terkelola: 60 bahasa dengan deteksi bahasa berkelanjutan otomatis, berjalan di dalam Azure AI Speech, dihargai per jam, dalam pratinjau. Mistral memberikan kedalaman secara gratis: enam belas varietas Arab yang dinamai, cukup kecil untuk dijalankan pada satu akselerator, dengan skrip normalisasi sehingga Anda dapat mengaudit penilaiannya sendiri. Jika Anda sedang membangun pipeline transkripsi Arab bulan ini, Anda memilih di antara dua posisi tersebut, dan pilihannya bergantung pada bukti yang belum Anda miliki dalam kedua kasus tersebut.
Apa yang sebenarnya dikatakan masing-masing vendor, dan apa yang dikatakan dewan-dewan
Kesenjangan bukti adalah fitur terpenting dalam pertemuan ini, jadi itu didahulukan.
• MAI-Transcribe-2-Streaming — tingkat kesalahan kata transkrip akhir 2,5% pada 0,13 detik setelah akhir ucapan, dan 2,5% yang sama pada parsial pertama pada 0,12 detik, keduanya disajikan sebagai peringkat pertama untuk akurasi pada metodologi AA-WER Streaming milik Artificial Analysis. Pembingkaian Microsoft sendiri. Pada saat penulisan artikel ini, papan streaming pelacak tersebut belum memplot baris untuk model itu, sehingga klaim tersebut bersandar pada metodologi pelacak tanpa angka terbitan pelacak yang mendukungnya.
Voxtral Mini 4B Realtime Arabic — rata-rata Character Error Rate 8,82% pada tujuh tolok ukur Arab dengan penundaan terkonfigurasi 480 milidetik. Kartu milik Mistral sendiri, dengan kode evaluasi yang disertakan. Belum ada pihak ketiga yang mereproduksinya, dan model ini baru berusia dua hari.
Jadi, dua angka utama dalam artikel ini, secara berturut-turut, adalah klaim vendor atas penggaris milik orang lain dan klaim vendor dengan penggarisnya sendiri yang turut disertakan. Keduanya bukan pengukuran independen. Yang membedakan adalah angka Mistral datang bersama skrip normalisasi yang Anda perlukan untuk menurunkannya kembali, sedangkan angka Microsoft datang bersama papan yang belum mencantumkannya di bagan. Jika Anda sedang mengambil keputusan pengadaan, perbedaan itu lebih penting daripada selisih 2,5 versus 8,82, yang toh tidak berarti — tingkat kesalahan kata dan tingkat kesalahan karakter tidak bisa dikonversi, dan ortografi Arab memperlebar kesenjangan keduanya secara signifikan.
Satu perbandingan di dalam kartu Mistral yang benar-benar meyakinkan adalah perbandingan terhadap saudara offlinenya sendiri: Voxtral Transcribe Arabic pada CER 7,91% di tujuh benchmark yang sama dengan normalisasi yang sama, sehingga streaming membuat model ini kehilangan 0,91 poin persentase. Microsoft menerbitkan angka setara untuk keluarganya sendiri saat merilis batch MAI-Transcribe-2 pada 3 September 2026 dengan tingkat kesalahan kata 2,0% — varian streaming-nya mengorbankan setengah poin dibandingkan model batch sambil menambahkan penyampaian real-time. Baca kedua delta internal vendor itu secara berdampingan dan Anda akan mendapatkan satu-satunya pernyataan yang benar-benar setara di artikel ini: pada benchmark mereka sendiri, SKU streaming masing-masing lab tertinggal dari saudara batch-nya, sekitar satu poin dalam satu kasus dan setengah poin dalam kasus lainnya, dan keduanya mengukur bahasa yang berbeda.

Cakupan bahasa: 60 banding 16, dan celah tanpa nama yang sama di kedua sisi
• MAI-Transcribe-2-Streaming — 60 bahasa dengan deteksi bahasa berkelanjutan otomatis, sehingga sesi yang berganti bahasa di tengah aliran tidak perlu menyatakan bahasanya di awal. Materi peluncuran Microsoft memberikan jumlahnya, bukan daftarnya; dokumentasi dukungan bahasa Azure untuk keluarga MAI-Transcribe adalah tempat cakupannya dirinci, dan dokumentasi itu mencantumkan bahasa Arab di antara bahasa yang didukung untuk keluarga tersebut.
• Voxtral Mini 4B Realtime Arabic — enam belas ragam bahasa Arab, disebutkan satu per satu: Arab Standar Modern, Maroko, Libya, Tunisia, Aljazair dan Hassaniya, Teluk, Najdi, Oman dan Sanaani, Mesir dan Sudan, Mesopotamia serta Levantine Selatan dan Utara, dan Chad. Di luar kumpulan tersebut, model ini didokumentasikan sebagai di luar cakupan, dengan penunjuk ke Voxtral Mini 4B Realtime umum.
Tidak satu pun dari kedua angka itu memberi tahu Anda apa yang Anda butuhkan. Angka 60 Microsoft adalah hitungan cakupan yang memasukkan bahasa Arab tanpa menjelaskan kinerja bahasa Arab; posting peluncurannya menyebut total bahasa itu sekali lalu lanjut. Angka 16 Mistral adalah enumerasi target pelatihan dengan satu tingkat kesalahan agregat di tujuh set benchmark, yang berarti rincian di tingkat dialek — hal yang sebenarnya menentukan apakah audio panggilan Maroko Anda dapat ditranskripsikan — juga tidak dipublikasikan. Dua model, dua vendor, dan dalam kedua kasus jawaban jujur atas "seberapa bagus model ini secara khusus untuk bahasa Arab Teluk" adalah: tidak disebutkan.
Yang diberikan oleh enumerasi itu kepada Anda memang adalah sebuah prior. Model dengan bahasa Arab Chad dan bahasa Arab Hassaniya sebagai target bernama telah disetel terhadap distribusi Afrika Utara; Mistral mengembangkannya bersama Ministère de la Transition Numérique et de la Réforme Administrative Maroko dan membangun dua dari tujuh tolok ukur bersama kementerian itu — ISMA dan Darija in the Wild — khusus untuk mengukur kasus-kasus sulit. Model umum 60 bahasa meningkat lebih dulu pada Bahasa Arab Standar Modern, karena di situlah volume sinyal pelatihan berada. Jika audio Anda adalah Darija atau bahasa Arab Teluk, itu adalah masalah yang berbeda, dan hanya satu dari dua vendor ini yang telah mencantumkan angka untuk salah satunya.
Latensi dan bentuk penundaan
• MAI-Transcribe-2-Streaming — 0,13 detik dari akhir ucapan hingga transkrip akhir, dan parsial pertama pada 0,12 detik, yang cukup cepat sehingga latensi parsial dan akhir pada dasarnya sama. Klaim Microsoft, diukur berdasarkan metodologi pelacak.
• Voxtral Mini 4B Realtime Arabic — 480 milidetik penundaan terkonfigurasi pada titik akurasi yang dipublikasikan, dengan penundaan yang dapat disesuaikan. Itu sekitar tiga setengah kali angka Microsoft, dan itu adalah parameter yang dipilih operator, bukan properti tetap.
Tiga persepuluh detik adalah perbedaan yang nyata bagi agen suara yang perlu merespons di tengah ucapan dan nyaris tak terlihat bagi manusia yang membaca takarir. Ini juga perbedaan antara tombol putar dan angka. Parameter delay Mistral berarti Anda dapat beroperasi lebih ketat dan menerima lebih banyak kesalahan atau lebih longgar dan mendapatkan kembali akurasi — model dasar yang menjadi sumber fine-tuning checkpoint ini menyatakan rentang dari 240 milidetik hingga 2,4 detik — sementara titik operasi Microsoft adalah yang dikirimkan Azure. Itu membuat angka Microsoft lebih mudah dicerna dan angka Mistral lebih mudah disetel, dan itu berarti perbandingan apa pun antara kedua angka akurasi sebenarnya adalah perbandingan dua titik yang dipilih pada satu kurva dan satu titik tetap pada kurva lain.
Permukaan fitur juga berbeda sama tajamnya, dan ada baiknya hal ini diperiksa terhadap persyaratan pipeline Anda sebelum pembahasan soal akurasi menjadi menarik.
• MAI-Transcribe-2-Streaming — dihadirkan melalui Azure AI Speech dengan rangkaian fitur yang didokumentasikan keluarga ini: diarisasi, stempel waktu tingkat kata, pembiasan kata kunci dan frasa, gaya keluaran verbatim versus bersih, dan identifikasi bahasa otomatis. Dokumentasi SKU streaming itu sendiri untuk diarisasi dan stempel waktu lebih tipis dibandingkan model batch, jadi konfirmasikan hal tersebut per endpoint alih-alih mengasumsikan paritas.

• Voxtral Mini 4B Realtime Arabic — kartu ini mendokumentasikan transkripsi dengan encoder audio kausal, penyajian vLLM melalui WebSocket di /v1/realtime, dukungan asli Transformers dari versi 5.2.0, dan modul normalisasi. Ini tidak mendokumentasikan diarisasi atau stempel waktu tingkat kata untuk checkpoint ini.
Model penyampaian: layanan pratinjau versus bobot yang dapat diunduh
• MAI-Transcribe-2-Streaming — pratinjau Azure, yang berarti tidak ada SLA dan rekomendasi vendor agar tidak bergantung pada produksi. Dihargai $0,54 per jam audio sebagai tarif perkenalan yang berlaku hingga akhir 2026, dengan tarif standar tidak dipublikasikan; batch MAI-Transcribe-2 diluncurkan pada $0,10 per jam audio dengan dasar waktu terbatas yang sama. Streaming berbiaya 5,4 kali tarif batch.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0, sekitar 4,4 miliar parameter dalam BF16, dapat diunduh, dapat di-fine-tune, dan dapat dijalankan pada satu akselerator. Tanpa harga, tanpa SLA, dan tanpa komitmen dukungan, karena tidak ada layanan di baliknya.
Kedua kalimat itu berisi keputusan. Layanan pratinjau dengan tarif perkenalan dan harga standar yang tidak diungkapkan adalah komitmen yang akan berakhir; premi streaming 5,4× dan jendela hingga 2026 keduanya ada di tangan Microsoft untuk diubah, dan rasio batch terhadap streaming adalah angka yang perlu diperhatikan saat tarif standar mulai berlaku. Bobot Apache 2.0 tanpa pengumuman adalah kebalikannya: artefak yang tidak dapat ditarik kembali oleh siapa pun, terikat pada hubungan vendor yang belum dijelaskan siapa pun. Apakah checkpoint akan dipelihara tidak dapat diketahui, tetapi file yang Anda miliki hari ini tetap berfungsi terlepas dari semua itu.
Batasan yang spesifik untuk industri adalah hal yang biasanya menentukan pertanyaan-pertanyaan ini dalam praktik. Penerapan pusat panggilan berbahasa Arab di dalam institusi yang teregulasi mungkin sama sekali tidak dapat mengirim audio ke endpoint cloud pratinjau; tim yang sudah menstandarkan pada Azure AI Speech mungkin tidak menginginkan tumpukan on-premises kedua untuk satu keluarga bahasa. Kedua batasan tersebut sah, dan tidak satu pun berkaitan dengan angka 2,5% dan 8,82% yang menjadi sorotan utama dari kedua peluncuran itu.
Di atas lapisan transkripsi, poin yang sama berlaku untuk keduanya. OrcaRouter tidak merutekan salah satu dari model ucapan ini — ini adalah perbandingan dua sistem yang tidak kami layani — tetapi peringkas, pengklasifikasi, atau agen yang mengonsumsi transkrip dapat dirutekan: lebih dari 200 model dalam satu kunci API dengan harga daftar penyedia dan markup 0%, sehingga perubahan harga vendor sampai ke sisi kami pada hari yang sama, dan failover otomatis jika penyedia mengalami degradasi. Yang membantu secara spesifik di sini adalah fase uji coba: mengarahkan kedua kandidat transkripsi ke satu pipeline hilir, di balik satu kunci, adalah cara Anda menjalankan adu langsung tanpa harus menyiapkan dua integrasi.
Ujian yang akan menyelesaikan ini
Tidak ada vendor yang telah mempublikasikan performa khusus untuk bahasa Arab, dan tidak ada yang dievaluasi secara independen pada audio dialek. Oleh karena itu, perbandingan ini bermuara pada tiga fakta dan satu rekomendasi.
Faktanya: model streaming Microsoft lebih cepat pada 0,13 detik dan mengklaim akurasi agregat yang lebih baik pada papan yang belum memplotnya; model Mistral memublikasikan daftar dialek, tingkat kesalahan bahasa Arab, dan kode normalisasi untuk menurunkannya kembali, pada 480 milidetik; dan kedua angka akurasi itu tidak dapat dibandingkan karena yang satu adalah tingkat kesalahan kata dan yang lain tingkat kesalahan karakter pada korpus yang berbeda.
Rekomendasinya: siapa pun yang membuat keputusan ini harus menjalankan keduanya pada audio mereka sendiri, karena itulah satu-satunya pengukuran yang masih terbuka bagi kedua vendor. Bangun set evaluasi dari rekaman nyata — campuran dialek yang benar-benar Anda terima, codec yang benar-benar Anda gunakan, kosakata domain yang benar-benar Anda butuhkan — dan nilai keduanya dengan normalisasi Mistral terhadap referensi yang Anda percayai. Uji dua jam pada rekaman Anda sendiri akan memberi tahu Anda lebih banyak daripada kedua postingan peluncuran jika digabungkan, dan itu satu-satunya cara untuk mengetahui apakah keunggulan 0,13 detik layak mendapatkan ketergantungan pratinjau dan biaya tambahan streaming 5,4×, atau apakah model 4,4B yang dapat diunduh pada 480 milidetik sudah cukup baik untuk pekerjaan itu.

OrcaRouter tidak menyediakan satu pun dari model bicara ini, dan tulisan ini tidak menyiratkan sebaliknya - yang dibahasnya adalah lapisan bahasa yang membaca transkrip: lebih dari 200 model di balik satu kunci dengan harga daftar penyedia dengan markup 0%, sehingga perubahan harga vendor pada model hilir sampai kepada Anda pada hari diumumkan.
Failover otomatismemungkinkan kedua kandidat transkripsi mengisi satu pipeline hilir alih-alih dua integrasi, yang juga merupakan cara termurah untuk menjalankan perbandingan head-to-head.
