
Voxtral Mini 4B Realtime Arabic vs Gemini 3.5 Transcribe Live: Dialek vs Cakupan
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Dua model speech-to-text streaming, dua taruhan yang sepenuhnya berbeda tentang apa bagian tersulit dari transkripsi. Voxtral Mini 4B Realtime Arabic adalah fine-tune 4,4 miliar parameter yang diunggah Mistral AI ke repositori publik pada 8 Oktober 2026 tanpa pos peluncuran, entri blog, atau satu baris pun di indeks berita perusahaan, dilatih secara khusus pada Bahasa Arab Standar Modern dan lima belas dialek yang disebutkan, dirilis di bawah Apache 2.0 dengan bobot BF16 yang dapat diunduh. Gemini 3.5 Transcribe Live adalah endpoint streaming milik Gogle dari Gemini 3.5 Transcribe, diumumkan pada Agustus 2026 dengan perangkat lengkap sebuah peluncuran platform, mencakup 85+ locale, dan tertutup — API pratinjau tanpa bobot dan batas sesi sepuluh menit. Satu model mendalami satu keluarga bahasa dan mengatakannya di bagian keterbatasannya sendiri; model lainnya melangkah luas dan membiarkan jaminan tingkat aksen tidak dinyatakan. Model mana yang Anda inginkan bergantung pada sumbu yang tidak diutamakan oleh pemasaran kedua vendor: bagaimana audio Anda sebenarnya terdengar.
Ini bukan perbandingan yang simetris, dan perlu dikatakan sejak awal daripada disembunyikan. Model Mistral baru berusia 48 jam pada saat penulisan, tidak memiliki pengumuman vendor, tidak ada evaluasi independen, dan tidak ada harga yang dipublikasikan. Model Google telah berada dalam pratinjau publik sejak akhir Agustus dan diukur pada pelacak pihak ketiga. Anggap sisi Mistral sebagai sekumpulan klaim dari kartu model dan sisi Google sebagai sekumpulan pengukuran ditambah sekumpulan klaim, maka perbandingannya tetap jujur.
Apa itu setiap model, sebelum angka-angkanya
• Voxtral Mini 4B Realtime Arabic — model ASR streaming yang di-fine-tune dari Voxtral-Mini-4B-Realtime-2602, dengan sekitar 4,4 miliar parameter dalam BF16, menerima audio 16 kHz melalui encoder audio kausal dan decoder bahasa. Model ini mengeluarkan teks saat audio tiba, dengan penundaan transkripsi yang dapat dikonfigurasi, dan bersifat Apache 2.0 dengan bobot di Hugging Face. Mistral mengembangkannya bersama dengan Kementerian Transisi Digital dan Reformasi Administrasi Maroko di bawah kemitraan yang ditandatangani pada Januari 2026, dan menggambarkan model tersebut sebagai aset AI berdaulat.
• Gemini 3.5 Transcribe Live — bagian streaming dari rilis dua model. Endpoint Live API mengalirkan audio mikrofon secara berkelanjutan melalui WebSocket, mengembalikan transkrip parsial saat pembicara masih berbicara, dan menghasilkan transkrip final tidak lama setelah setiap ucapan berakhir. Pasangan batch-nya, gemini-3.5-transcribe, melayani file yang sudah direkam hingga satu jam. Keduanya dalam pratinjau publik, keduanya hanya tersedia melalui API, dan tidak satu pun telah menerbitkan bobotnya.
Perbedaan struktural yang pertama bukanlah akurasi. Perbedaannya adalah salah satu dari ini adalah file yang bisa Anda unduh malam ini dan yang lainnya adalah layanan yang harus Anda diterima dulu untuk menggunakannya.

Cakupan bahasa: 16 berbanding 85 lebih, dan selisihnya bukan inti persoalannya
Menghitung jumlah bahasa membuat model Mistral tampak sempit dan model Google tampak luar biasa besar. Kedua hitungan itu mengukur hal yang berbeda, dan membaca keduanya secara berdampingan tanpa catatan itu adalah kesalahan paling umum yang ditimbulkan oleh perbandingan ini.
• Voxtral Mini 4B Realtime Arabic — 16 varietas bahasa Arab, yang masing-masing disebutkan di kartu model berdasarkan rumpun dialeknya: Arab Standar Modern, ditambah Arab Maroko, Libya, Tunisia, Aljazair, dan Hassaniya dari Maghreb; Arab Teluk, Najdi, Oman, dan Sanaani dari Teluk; Arab Mesir dan Sudan dari Lembah Nil; Arab Mesopotamia serta Levantin Selatan dan Utara; dan Arab Chad. Kerangka pada kartu itu sendiri adalah bahwa model ini menyasar transkripsi bahasa Arab, dan bahwa alih kode — penutur yang bergantian bahasa di tengah percakapan — adalah kemampuan yang dirancang untuk dilakukan dengan tepat, bukan efek samping.
• Gemini 3.5 Transcribe Live — deteksi bahasa otomatis di lebih dari 85 lokal, dengan alih kode dalam kalimat dan antarkalimat. Dokumentasi Google mencantumkan bahasa Arab dalam himpunan tersebut; tabel lokal menamai Arab (Mesir) sebagai entri bahasa Arab, dan cakupan lokal bahasa Arab yang lebih luas tidak dirinci dalam dokumentasi model itu sendiri.
Bacalah itu dengan jujur, dan bentuk trade-off-nya pun tampak. Angka 85-plus Google adalah klaim keluasan cakupan: jika audio Anda berada dalam bahasa selain Arab, endpoint Google mencakupnya dan model Mistral akan menolaknya — kartu itu menyatakan terus terang bahwa untuk bahasa lain Anda harus menggunakan Voxtral Mini 4B Realtime asli, bukan checkpoint ini. Angka 16 Mistral adalah klaim kedalaman. Ia tidak mengklaim dapat mentranskripsikan bahasa Arab; ia mengklaim dapat mentranskripsikan Darija Maroko, Arab Teluk, Arab Mesir, dan Arab Chad sebagai target yang berbeda, yang merupakan masalah yang secara substansial lebih sulit daripada mentranskripsikan Arab Standar Modern dan berharap dialeknya muncul dengan sendirinya dari situ. Tolok ukur yang berbobot bahasa Inggris dan mengutamakan keluasan tidak akan pernah menunjukkan perbedaan itu kepada Anda, karena kumpulan dialeknya tidak ada di dalamnya.
Bagi pusat panggilan Maroko atau saluran dukungan pelanggan Teluk, model yang menangani 16 dialek dan tidak menangani apa pun selain itu dapat mengalahkan model yang menangani 85 lokal pada akurasi per-dialek yang tidak disebutkan. Bagi perusahaan Eropa yang mentranskripsikan rapat dalam lima bahasa, persamaannya langsung terbalik. Tidak ada vendor yang salah; mereka memilih pelanggan yang berbeda.

Angka-angka yang dapat Anda bandingkan, dan angka-angka yang tidak dapat.
Di sinilah asimetri itu menimbulkan masalah. Kedua model melaporkan satuan yang berbeda, pada korpus yang berbeda, dengan bukti yang berbeda yang mendasarinya, dan tidak ada pihak ketiga yang menguji keduanya secara langsung.
• Voxtral Mini 4B Realtime Arabic — rata-rata 8,82% Tingkat Kesalahan Karakter di tujuh tolok ukur bahasa Arab, pada penundaan transkripsi yang dikonfigurasi sebesar 480 milidetik. Menurut kartu Mistral sendiri, dan tidak direproduksi secara independen.
• Model yang sedang dikejarnya — Voxtral Transcribe Arabic pada 7,91% CER di tujuh tolok ukur yang sama dengan pengukuran yang sama, sehingga model realtime tersebut tertinggal 0,91 poin persentase di belakang model Arab offline dari vendor yang sama. Kesenjangan itu adalah perbandingan Mistral sendiri, yang membuatnya sangat informatif: vendor tersebut memberi tahu Anda berapa biaya akurasi dari streaming pada rumpun bahasa ini.
• Gemini 3.5 Transcribe Live — tingkat kesalahan kata streaming 4,0%, diukur oleh Artificial Analysis dan dikutip oleh Google, dengan transkrip akhir yang tiba 0,40 detik setelah akhir ucapan. Juga diukur: 2,6% pada papan non-streaming pelacak yang sama, dan 5,50% streaming pada FLEURS menurut laporan Google sendiri.
Jangan menaruh 8,82% CER di sebelah 4,0% WER lalu menyimpulkan apa pun. Tingkat kesalahan karakter dan tingkat kesalahan kata memiliki penyebut yang berbeda — ortografi Arab membuat selisih di antara keduanya lebih besar daripada pada bahasa beraksara Latin — dan korpusnya tidak sama, normalisasinya tidak sama, dan satu angka disertai skrip yang dapat direproduksi sementara angka lainnya berasal dari campuran tetap pelacak yang bobotnya lebih condong ke obrolan agen berbahasa Inggris.
Perbandingan yang lebih berguna adalah yang ada di dalam kartu Mistral sendiri: 8,82% streaming versus 7,91% offline, pada benchmark yang identik dengan normalisasi yang identik. Itu adalah pengukuran yang bersih tentang apa yang diperoleh dan apa yang harus dikorbankan dari latensi rendah khusus untuk bahasa Arab, dan nilainya lebih besar daripada persentase lintas vendor mana pun. Yang belum diterbitkan oleh siapa pun adalah pengujian bahasa Arab yang setara untuk model Google dan Mistral pada audio yang sama. Sampai seseorang melakukannya, "mana yang lebih akurat dalam bahasa Arab" adalah pertanyaan terbuka, dan satu-satunya jawaban yang dapat dipertahankan adalah: coba keduanya pada rekaman Anda.
Satu detail di kartu Mistral layak disebut karena bertentangan dengan kepentingan vendor itu sendiri. Di situ disebutkan bahwa filter keamanan Gemini memblokir transkripsi beberapa sampel audio FLEURS. Itu adalah pengamatan nyata dan dapat diperiksa tentang pipeline pesaing, dan itu juga tepat jenis hal yang tidak pernah muncul di papan peringkat — model yang menolak mentranskripsikan sampel dinilai sebagai kegagalan atau sebagai tidak ada, dan tidak ada dari kedua tafsir itu yang adil. Jika audio Anda memuat materi yang mungkin tertangkap filter konten, itu adalah risiko penerapan yang tidak akan terungkap oleh angka WER mana pun.
Latensi: tombol putar versus angka tetap
Model streaming biasanya dibandingkan berdasarkan satu angka latensi. Keduanya tidak memiliki satu pun yang sama.
• Voxtral Mini 4B Realtime Arabic — penundaan transkripsi yang dapat dikonfigurasi. Angka CER 8,82% dikutip pada 480 milidetik, dan penundaannya dapat disesuaikan, yang berarti angka akurasi tersebut adalah satu titik pada kurva yang dipilih operator, bukan properti model. Model dasarnya menawarkan rentang dari 240 milidetik hingga 2,4 detik.
• Gemini 3.5 Transcribe Live — 0. detik dari akhir ucapan hingga transkrip final, diukur oleh Artificial Analysis, dengan hasil parsial yang terus berdatangan selama ucapan. Google secara terpisah mengklaim peningkatan 70% dalam waktu hingga transkripsi final dibandingkan Chirp 3, yang merupakan angka vendor dan belum direproduksi.
Keduanya berada dalam kisaran yang sama — sekitar setengah detik — tetapi makna tekniknya berbeda. Model Mistral menyerahkan trade-off latensi-akurasi kepada Anda sebagai parameter, sehingga Anda dapat berjalan pada 240 ms ketika takarir sub-detik lebih penting daripada beberapa poin akurasi terakhir dan memperbesar penundaan saat tidak demikian. Endpoint Google menyajikan titik operasi tetap dengan perilaku filter konten milik Google sendiri yang melekat. Untuk agen suara, sebuah pengatur lebih berharga daripada angka tetap yang sedikit lebih baik, karena pengaturan yang tepat bergantung pada audio dan pengguna Anda dan tidak ada vendor yang dapat memilihnya untuk Anda.
Pembeda sebenarnya: bobot terbuka versus endpoint pratinjau
Perbedaan lisensi dan distribusi lebih besar daripada kesenjangan benchmark mana pun dalam perbandingan ini, dan hal itu menentukan sebagian besar penerapan nyata sebelum akurasi dibahas.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0, bobot BF16 di Hugging Face, dapat dilayani dengan vLLM melalui WebSocket di /v1/realtime, dan didukung secara native di Transformers mulai versi 5.2.0. Kartu model ini menyertakan contoh Python dan modul normalisasi sehingga Anda dapat mereproduksi sendiri perhitungan CER bahasa Arab. Tidak ada bagian dari pipeline yang memerlukan server Mistral, dan modelnya cukup kecil sehingga pertanyaan operasionalnya adalah GPU mana, bukan apakah Anda mampu membelinya.
• Gemini 3.5 Transcribe Live — hanya API, pratinjau publik, tidak ada komitmen harga yang dipublikasikan di luar tarif yang tercantum, dan batas sesi sepuluh menit yang berarti apa pun yang lebih lama harus dipecah menjadi potongan, disambungkan ulang, dan disatukan kembali oleh kode Anda sendiri. Tiga kendala yang dilaporkan bersamaan dengan peluncuran ini khususnya penting untuk deployment bahasa Arab: endpoint streaming tidak mengembalikan diarisasi pembicara dan tidak mengembalikan stempel waktu tingkat kata, keduanya tersedia di endpoint batch tetapi tidak di endpoint ini. Jika transkrip bahasa Arab Anda perlu mengetahui siapa mengatakan apa, atau perlu diselaraskan waktunya dengan audio, endpoint Live tidak dapat menghasilkannya, apa pun bahasanya.
Kedua kendala itu adalah argumen terkuat untuk model terbuka kecil dalam penerapan bahasa Arab di dunia nyata, dan keduanya sama sekali tidak berkaitan dengan akurasi. Pipeline pusat panggilan menginginkan atribusi pembicara, pipeline kepatuhan menginginkan stempel waktu, dan model Arab offline dengan skrip normalisasi yang Anda kendalikan memberi Anda keduanya tanpa perlu berdebat soal kontrak endpoint. Kartu model Mistral juga mencantumkan hal itu sebagai keterbatasan, bukan fitur — model ini menyasar transkripsi, merupakan fine-tune dari model realtime umum, dan secara jujur menyatakan bahwa ada model yang lebih luas di sisi upstream jika Anda membutuhkannya.
Berapa biaya masing-masing, dan apa yang tidak diketahui
• Gemini 3.5 Transcribe Live — sekitar $0,009 per menit audio gabungan, berasal dari harga daftar $3,50 per juta token input dan $21 per juta token output, dengan audio dihitung pada 25 token per detik dan transkrip sekitar 175 token per menit. Endpoint batch sekitar $0,005 per menit. Kedua angka tersebut adalah perkiraan dari tokenisasi yang diasumsikan Google, sehingga dapat berubah jika penghitungannya berubah. Saat ini tersedia tier gratis.
• Voxtral Mini 4B Realtime Arabic — tidak ada harga yang dipublikasikan, karena tidak ada layanan yang dipublikasikan. Biayanya adalah sebesar biaya perangkat keras Anda. Model BF16 dengan 4,4 miliar parameter muat di satu akselerator modern, sehingga biaya marginal per jam audio adalah listrik dan utilisasi, dan biaya tetapnya adalah mesin tersebut. Itu lebih murah daripada API per menit mana pun pada volume tinggi dan lebih mahal daripada API per menit mana pun pada volume nol, yang merupakan bentuk lazim dari trade-off open-weights.
Hal yang belum diketahui yang paling penting di sisi Mistral bukanlah harga. Yang menjadi pertanyaan adalah apakah repositori ini merupakan awal dari sebuah lini produk atau hasil sekali pakai untuk kemitraan Maroko. Model yang dirilis secara senyap tanpa pengumuman, tanpa penetapan harga, dan tanpa layanan adalah model tanpa komitmen dukungan di belakangnya. Apache 2.0 berarti lisensi tidak dapat ditarik untuk bobot yang sudah Anda miliki, tetapi itu tidak mengatakan apa pun tentang apakah checkpoint tersebut akan dipelihara, dan penunjuk base-model pada kartunya sendiri menunjukkan bahwa model realtime umum masih menjadi lini yang didukung.
Untuk lapisan di atas transkrip, lapisan routing membuktikan manfaatnya dengan cara yang sama sekali tidak berkaitan dengan transkripsi. Tidak satu pun dari model ini adalah layanan speech-to-text yang kami hosting — OrcaRouter tidak merutekan satu pun dari kedua endpoint tersebut — tetapi perangkum, pengklasifikasi intent, atau agen yang mengonsumsi stream adalah model yang dapat Anda rutekan: satu kunci API untuk lebih dari 200 model pada harga daftar penyedia dengan markup 0%, sehingga penurunan harga vendor langsung terasa di sisi kami pada hari yang sama, ditambah failover otomatis jika penyedia mengalami degradasi. Jika Anda sudah menggabungkan dua vendor speech untuk cakupan dialek, menempatkan model bahasa hilir di balik satu kunci alih-alih dua kontrak adalah bagian integrasi yang murah.
Yang mana yang akan dijadikan dasar
Jika audio Anda adalah bahasa Arab — satu dialek, beberapa dialek, atau beralih kode antara bahasa Arab dan bahasa lain — model Mistral adalah kandidat yang lebih serius, dan alasannya bersifat struktural, bukan numerik. Model ini menyebutkan dialek yang menjadi sasaran pembuatannya, cukup kecil untuk dijalankan di perangkat keras Anda sendiri, menghasilkan teks mentah yang dapat Anda pascaproses dengan normalisasi Anda sendiri, dan tidak berada di balik batas sesi sepuluh menit atau filter konten yang tidak dapat Anda periksa. Konsekuensinya adalah model ini hanya menangani satu rumpun bahasa dan menolak yang lainnya, serta belum ada yang menerbitkan evaluasi independen terhadapnya.
Jika audio Anda mencakup beberapa bahasa, atau jika Anda membutuhkan layanan dengan jalur dukungan dan kartu tarif yang dipublikasikan hari ini, Gemini 3.5 Transcribe Live dapat dipanggil sekarang, diukur pada pelacak pihak ketiga, dan mencakup bahasa-bahasa yang akan ditolak oleh checkpoint Mistral. Biayanya adalah batas sesi, diarisasi dan stempel waktu yang hilang pada endpoint streaming, dan fakta bahwa akurasi khusus bahasa Arab merupakan klaim yang harus Anda uji sendiri — daftar lokal menyebut Mesir, dan performa dialek tidak dirinci.
Hal yang perlu diperhatikan bukanlah sebuah benchmark. Yang perlu diperhatikan adalah apakah Mistral mengumumkan model ini sama sekali, dan jika ya, dengan harga berapa dan peta jalan bahasa seperti apa. Repositori yang senyap dengan lisensi Apache 2.0 adalah artefak yang berguna dan komitmen yang lemah. Jika peta jalan dialek Arab menyusul — Levantine, Teluk, dan Mesir sebagai checkpoint terpisah — jalur model kecil menjadi jawaban yang benar-benar lengkap untuk kawasan ini, dan argumen tentang keluasan cakupan menjadi jauh lebih sulit diajukan.

Tidak satu pun dari ini adalah model ucapan yang kami host, tetapi lapisan di atas transkrip dapat dirutekan - lebih dari 200 model di balik satu kunci API dengan harga daftar penyedia tanpa markup 0%, sehingga pemotongan harga vendor pada model penalaran di hilir transkrip Anda langsung berlaku pada hari yang sama.
Failover otomatis berarti pipeline wicara yang disatukan memiliki satu domain kegagalan lebih sedikit, karena perangkum atau pengklasifikasi intent yang mengonsumsi transkrip dapat dialihkan rutenya alih-alih ikut tumbang bersama penyedia.
