
Voxtral Mini 4B Realtime Arabic vs Grok Voice Transcribe 2.0: Pemimpin Papan Peringkat Bertemu Spesialis Dialek
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Titik awal yang jujur untuk perbandingan ini adalah bahwa Voxtral Mini 4B Realtime Arabic dan Grok Voice Transcribe 2.0 tidak bersaing untuk tugas yang sama, dan cara tercepat untuk melihatnya adalah dengan melihat apa yang masing-masing vendor bersedia terbitkan. Mistral AI menempatkan Voxtral Mini 4B Realtime Arabic di Hugging Face pada 8 Oktober 2026 tanpa pengumuman — bobot Apache 2.0, kartu model yang menyebut enam belas ragam bahasa Arab, dan satu angka akurasi berupa rata-rata Character Error Rate 8,82% di tujuh tolok ukur bahasa Arab pada penundaan 480 milidetik. Grok Voice Transcribe 2.0 milik xAI dirilis pada 18 September 2026 dengan postingan peluncuran, harga, dan hasil papan peringkat pihak ketiga: tingkat kesalahan kata 2,7% pada transkrip akhir dengan teks final 0,49 detik setelah pembicara berhenti, peringkat pertama di papan speech-to-text streaming Artificial Analysis saat dirilis. Satu model memberi tahu Anda dengan tepat dialek mana yang ditanganinya dan menolak menebak di luar itu. Model lainnya memberi tahu Anda bahwa ia mencakup 38+ bahasa dan tidak merinci satu pun.
Asimetri itulah keseluruhan perbandingannya. Jika Anda membeli kapasitas transkripsi dalam jumlah besar untuk audio multibahasa, model xAI adalah produk yang jauh lebih lengkap. Jika audio Anda berbahasa Arab — dan secara khusus jika itu adalah bahasa Arab dialek, bukan Bahasa Arab Standar Modern yang digunakan dalam siaran — checkpoint Mistral ditujukan pada masalah yang tidak diukur oleh papan peringkat yang dipuncaki oleh model xAI, dan menganggap fakta bahwa ia berada di urutan kedua di papan itu, bukan pertama, sebagai putusan adalah sebuah kesalahan.
Perhitungan harganya, karena di sini luar biasa bersih
xAI menerbitkan tarif. Mistral menerbitkan unduhan. Perbedaan itulah yang menentukan segala hal di hilir, jadi mulailah dari angka yang sudah ada.
• Grok Voice Transcribe 2.0 — $0,10 per jam audio melalui REST untuk file rekaman, $0,20 per jam audio melalui WebSocket streaming. Itu sekitar $1,67 per seribu menit untuk batch dan $3,33 per seribu menit untuk streaming, tidak berubah dari Grok Voice Transcribe 1.0 pada titik harga yang sama.
• Voxtral Mini 4B Realtime Arabic — tidak ada harga yang dipublikasikan, karena tidak ada layanan yang dipublikasikan. Bobotnya berlisensi Apache 2.0 dan sekitar 4,4 miliar parameter dalam BF16, yang berarti biayanya adalah GPU yang Anda pasang untuknya dan utilisasi yang Anda dapatkan darinya. Pada volume yang berkelanjutan, itu murah; pada volume nol, itu opsi termahal dalam artikel ini, karena Anda membayar untuk perangkat keras yang menganggur.
Titik impasnya tidak samar. Tarif streaming $0,20 per jam adalah sekitar sepertiga sen per menit. Akselerator apa pun yang akan Anda gunakan untuk menjalankan model 4,4B biayanya lebih dari itu per jam kecuali Anda mendorong lalu lintas berkelanjutan melaluinya, yang berarti rute open-weights baru unggul dalam hal biaya setelah Anda memiliki volume bahasa Arab yang cukup untuk menjaga sebuah mesin tetap sibuk — dan kalah di setiap dimensi lain selagi Anda menuju ke sana, karena API tidak punya belanja modal, tidak punya perencanaan kapasitas, dan tidak punya beban operasional.

Satu-satunya area yang membuat perhitungan berbalik lebih awal adalah kepatuhan. Checkpoint Mistral memproses audio pada perangkat keras yang Anda kendalikan, jadi tidak ada yang keluar dari jaringan Anda, dan kartunya menyertakan modul normalisasi sehingga pipeline penilaian bahasa Arab dapat Anda audit. Grok Voice Transcribe 2.0 berjalan di wilayah xAI dan, menurut dokumentasinya, memproses audio secara real-time tanpa menyimpannya atau menggunakannya untuk pelatihan, didukung oleh SOC 2 Type II dan kelayakan HIPAA. Kedua narasi sama-sama dapat dipertahankan; hanya salah satunya yang memungkinkan regulator memeriksa jalur kode.
Apa yang sebenarnya bisa dibeli dengan $0,20 per jam, dan model Mistral tidak dirilis
Kesenjangan fitur di sini lebih besar daripada kesenjangan akurasi dan jauh lebih jarang dibahas. Grok Voice Transcribe 2.0 adalah produk dengan antarmuka; Voxtral Mini 4B Realtime Arabic adalah checkpoint yang mengeluarkan teks.
• Diarisasi pembicara — tersedia pada Grok Voice Transcribe 2.0, serta transkripsi multisaluran hingga delapan saluran independen. Kartu Mistral tidak mencantumkan kemampuan diarisasi; model ini menghasilkan transkrip, bukan transkrip dengan atribusi.
• Stempel waktu tingkat kata — Grok membawanya dengan skor keyakinan yang terlampir, sehingga Anda dapat menetapkan ambang batas pada rentang berkeyakinan rendah alih-alih mempercayai seluruh transkrip secara setara. Kartu Mistral tidak mengklaim stempel waktu untuk checkpoint ini.
• Pembobotan istilah kunci — hingga 100 istilah domain per permintaan di endpoint Grok, itulah cara Anda membuat model menangani nama produk, kode akun, dan nama tempat dengan benar tanpa fine-tuning. Rute Mistral menuju hasil yang sama adalah fine-tuning pada data Anda sendiri, yang diizinkan Apache 2.0 dan tidak diizinkan oleh endpoint yang dihosting.
• Normalisasi teks invers — Grok memformat angka, tanggal, mata uang, nomor telepon, dan alamat email ke dalam bentuk tertulis dalam 25 bahasa. Kartu Mistral menyertakan skrip normalisasi, tetapi tujuan yang dinyatakan adalah untuk menilai benchmark bahasa Arab, bukan memformat keluaran untuk ditampilkan.
• Permukaan antarmuka — REST untuk file hingga 500 MB, streaming WebSocket di wss://api.x.ai/v1/stt dengan hasil sementara kira-kira setiap 500 ms, batas terdokumentasi 10 permintaan per detik dan 100 sesi streaming bersamaan, serta satu region untuk saat ini. Di sisi Mistral, penyajian vLLM dengan WebSocket di /v1/realtime, atau Transformers native dari versi 5.2.0, tanpa batas laju selain perangkat keras Anda.
Jika Anda membutuhkan diarisasi dan stempel waktu, perbandingannya sudah selesai sebelum akurasi masuk ke dalamnya. Itu bukan celaan terhadap model Mistral — spesialis bahasa Arab 4B yang dilatih untuk menghasilkan teks dialek yang akurat adalah target rekayasa yang berbeda dari layanan transkripsi umum — tetapi itu memang berarti keduanya baru bisa saling dipertukarkan jika pipeline Anda memperlakukan transkrip sebagai bahan mentah untuk pascapemrosesan Anda sendiri.
Masalah daftar bahasa
Kedua vendor menggambarkan dukungan bahasa dengan cara yang membuat pertanyaan yang sama tidak terjawab, dari arah yang berlawanan.
• Grok Voice Transcribe 2.0 — lebih dari 38 bahasa, deteksi bahasa otomatis dengan pengalihan bahasa di tengah perekaman dalam satu kali proses, di 12 format audio dari 8 kHz hingga 48 kHz. Dokumentasinya memberikan jumlahnya, bukan daftarnya. Bahasa Arab tidak disebutkan secara individual di mana pun dalam materi tersebut, yang berarti dukungan bahasa Arab tersirat oleh jumlahnya dan tidak dikonfirmasi oleh vendor.
• Voxtral Mini 4B Realtime Arabic — enam belas varietas bahasa Arab yang disebutkan secara eksplisit: Bahasa Arab Standar Modern; Maroko, Libya, Tunisia, Aljazair, dan Hassaniya dari Maghreb; Teluk, Najdi, Oman, dan Sanaani dari kawasan Teluk; Mesir dan Sudan dari Lembah Nil; Mesopotamia serta Levantin Selatan dan Utara; dan Arab Chad. Semua di luar kumpulan itu berada di luar cakupan, dan kartu tersebut menyatakan untuk menggunakan model realtime umum sebagai gantinya.
Jadi pertanyaan "mana dari ini yang menangani bahasa Arab lebih baik" memiliki struktur yang aneh. Model Mistral adalah spesialis bahasa Arab yang terdokumentasi dengan tingkat kesalahan bahasa Arab yang dipublikasikan dan tanpa verifikasi independen. Model xAI adalah pemimpin papan peringkat yang terdokumentasi yang vendornya sama sekali belum mengonfirmasi bahwa bahasa Arab termasuk dalam cakupan. Hitungan 38 bahasa yang mencakup bahasa Arab dan daftar enam belas dialek yang hanya mencakup bahasa Arab sama-sama menjawab pertanyaan "apakah ini menangani bahasa Arab" — tetapi hanya salah satunya yang menjawab "apakah ini menangani Darija."

Papan peringkat tidak membantu di sini. Evaluasi speech-to-text Artificial Analysis adalah campuran tetap yang bobotnya condong ke obrolan agen berbahasa Inggris, desain yang tepat untuk memeringkat transkripsi umum dan keliru untuk menonjolkan kemenangan dialek Arab. Sebuah model bisa benar-benar lebih baik pada bahasa Arab Teluk dan Arab Maroko tetapi hanya tampil sekadar baik di papan itu. Ini bukan kritik terhadap papan tersebut; ini alasan untuk tidak menjadikannya satu-satunya masukan bagi penerapan regional.
Akurasi, dalam satuan yang tidak dikonversi
• Grok Voice Transcribe 2.0 — tingkat kesalahan kata transkrip akhir 2,7% dengan 0,49 detik hingga final, dan 3,4% pada parsial pertama, keduanya diukur pada indeks AA-WER v2 milik Artificial Analysis, yang memadukan kumpulan data obrolan agen privat dengan VoxPopuli dan Earnings22. Angka parsial pertama adalah yang menonjol: angka itu turun dari 18,3% pada Grok Voice Transcribe 1.0, yang merupakan perbedaan antara transkrip parsial yang dapat Anda jadikan dasar perutean dan transkrip yang hanya dapat Anda tampilkan.
• Voxtral Mini 4B Realtime Arabic — rata-rata Tingkat Kesalahan Karakter 8,82% pada tujuh tolok ukur bahasa Arab dengan penundaan 480 milidetik, dalam evaluasi milik vendor sendiri dengan skrip normalisasi yang disertakan bersamanya. Mistral melaporkan bahwa ini hanya terpaut 0,91 poin persentase dari Voxtral Transcribe Arabic pada 7,91% CER, yang merupakan model bahasa Arab offline dari lab yang sama — perbandingan yang lebih bernilai daripada perbandingan lintas vendor karena tolok ukur, normalisasi, dan pengukurannya identik di kedua sisi.
Menempatkan 2,7% di samping 8,82% bukanlah sebuah perbandingan; itu adalah kekeliruan kategori. Tingkat kesalahan kata menghitung kata yang salah terhadap referensi, tingkat kesalahan karakter menghitung karakter yang salah, dan ortografi Arab — ketika kata yang sama dapat ditulis dengan berbagai ejaan yang sah dan klitik menempel dengan bebas — memperlebar jarak antara kedua metrik jauh melampaui yang ditunjukkan bahasa-bahasa beraksara Latin. Korpornya berbeda, normalisasinya berbeda, dan hanya satu angka yang berasal dari pihak ketiga. Apa yang secara sah dapat diberitahukan oleh kedua angka itu kepada Anda adalah bahwa model xAI adalah pentranskripsi umum yang terukur dan berperingkat baik, sedangkan model Mistral adalah model yang diklaim khusus untuk bahasa Arab. Keduanya tidak dapat memberi tahu Anda mana yang lebih baik mentranskripsikan audio Anda.
Perbandingan yang benar-benar meyakinkan adalah perbandingan di dalam kartu model Mistral sendiri: streaming 8,82% versus offline 7,91%, tujuh tolok ukur yang sama, normalisasi yang sama, lab yang sama. Streaming mengorbankan sekitar satu poin akurasi pada bahasa Arab dibandingkan model batch. Apakah itu pertukaran yang baik terserah Anda, dan sekarang keputusan itu sudah berbasis informasi.
Di mana model kecil unggul, dan itu bukan pada papan skor
Tiga hal tentang checkpoint Mistral bernilai lebih daripada yang disiratkan angka-angka, dan tidak satu pun darinya muncul di papan peringkat mana pun.
Yang pertama adalah taksonomi dialek itu sendiri. Menamai enam belas varietas sebagai target pelatihan yang berbeda, termasuk Hassaniya dan Arab Chad, merupakan pernyataan tentang di mana kesalahan model diukur. Model multibahasa umum yang menyertakan bahasa Arab sebagai salah satu dari 38 bahasa terlebih dahulu meningkatkan Bahasa Arab Standar Modern, karena di sanalah sebagian besar sinyal pelatihan dan bobot benchmark berada. Model yang dibangun untuk kemitraan Maroko bersama kementerian Afrika Utara dioptimalkan untuk distribusi yang berbeda, dan dikembangkan bersama dengan dua benchmark — ISMA dan Darija in the Wild — yang dibangun khusus untuk mengukur hal itu.
Yang kedua adalah penundaan yang dapat dikonfigurasi. Angka 8,82% dikutip pada 480 milidetik, dan penundaannya dapat disesuaikan, bukan tetap, sehingga angka akurasi berubah menjadi sebuah titik pada kurva yang dipilih operator. Untuk pekerjaan takarir langsung, Anda dapat memperpendeknya dan menerima lebih banyak kesalahan; untuk pipeline perekaman panggilan, Anda dapat memperpanjangnya dan mengambil kembali akurasinya. Grok Voice Transcribe 2.0 menyajikan titik operasi tetap, dan jalur peningkatan versi milik vendor sendiri menunjukkan mengapa hal itu memiliki konsekuensi — beralih dari 1.0 ke 2.0 memakan sekitar sepertiga detik baik pada latensi parsial pertama maupun final, dan perbaikan yang tersedia bagi Anda adalah menyematkan model lama, bukan menyetel tombol.
Yang ketiga adalah bahwa lisensi Apache 2.0 bersifat tanpa syarat untuk bobot yang Anda miliki. Apa pun yang terjadi pada checkpoint di hulu — entah diumumkan, diberi harga, dihentikan, atau tidak pernah disebutkan lagi — artefak tersebut tetap dapat diunduh, di-fine-tune, dan dirilis di dalam produk Anda sendiri. Daftar tarif endpoint yang dihosting dan jadwal penghentian modelnya sama-sama berada di tangan vendor untuk diubah, dan xAI telah memberi sinyal niatnya untuk menjadikan Grok Voice Transcribe 2.0 sebagai default serta menghentikan 1.0, yang akan memindahkan setiap integrasi yang tidak pernah menyertakan parameter model ke profil latensi baru sekaligus.
Pada lapisan routing di atas transkrip, satu catatan praktis: tidak ada satu pun dari model tersebut yang merupakan speech-to-text yang kami hosting, dan artikel ini tidak mengklaim sebaliknya. Yang dicakup OrcaRouter adalah lapisan language-model yang mengonsumsi stream — perangkum, pengklasifikasi, agen — di balik satu API key di lebih dari 200 model pada harga daftar penyedia dengan markup 0%, sehingga perubahan harga vendor sampai di sini pada hari yang sama. Tim yang menjalankan dua vendor speech untuk cakupan bahasa sudah membawa dua kontrak dan dua jalur autentikasi; menggabungkan separuh hilir ke satu key adalah kemenangan yang murah.
Apa yang harus dilakukan dengan ini
Bangunlah di atas Grok Voice Transcribe 2.0 jika audio Anda multibahasa, jika Anda memerlukan diarisasi, stempel waktu, atau pembobotan istilah kunci yang siap pakai, atau jika Anda menginginkan layanan dengan tarif yang dipublikasikan dan jalur dukungan yang tersedia saat ini. Produk ini lebih lengkap, kinerjanya diukur oleh pihak ketiga, dan tarif streaming $0.20 per jam audio cukup rendah sehingga argumen biaya open-weight tidak akan terasa mengganggu sampai Anda menjalankan volume yang besar.
Bangun di atas Voxtral Mini 4B Realtime Arabic jika audio Anda berbahasa Arab dan secara khusus dialektal, jika Anda memerlukan model tersebut di dalam jaringan Anda sendiri karena alasan kepatuhan, atau jika Anda berniat melakukan fine-tuning — karena hanya salah satu dari ini yang memungkinkannya. Terima tiga hal terlebih dahulu: tidak ada diarisasi, tidak ada stempel waktu, dan tidak ada evaluasi independen yang dipublikasikan oleh siapa pun. Dua hari setelah bobotnya muncul, yang terakhir itu bukan tanda bahaya; itu hanyalah posisi bukti saat ini.
Yang paling cepat mengubah perbandingan ini adalah evaluasi khusus bahasa Arab pada audio dialek nyata, dijalankan di luar kedua vendor, dengan normalisasi yang sama diterapkan pada kedua sistem. Sampai itu ada, keputusan bergantung pada daftar dialek milik satu vendor dibandingkan dengan daftar milik vendor lain yang tidak diungkapkan, dan satu-satunya uji yang dapat diandalkan adalah rekaman Anda.

Tidak ada satu pun endpoint yang kami layani — ini adalah perbandingan dua sistem di luar katalog kami — tetapi model yang mengonsumsi transkrip dapat dirutekan: lebih dari 200 model pada satu kunci API dengan harga daftar penyedia tanpa markup 0%, sehingga perubahan tarif pada summariser atau classifier berlaku pada hari yang sama saat diumumkan.
Failover otomatis adalah yang mencegah penyiapan suara dua vendor membawa dua titik kegagalan tunggal ke lapisan bahasa yang bergantung padanya.
