Kartu judul hero bertuliskan 'Voxtral Realtime Arabic', dengan subjudul 'Mistral menerbitkan model tersebut pada 8 Oktober 2026 dan tidak pernah mengumumkannya', tiga chip statistik bertuliskan '16 ragam bahasa Arab', 'jeda 480 ms', dan 'bobot Apache 2.0', serta ikon garis datar berupa gelombang suara yang mengalir ke aliran baris-baris teks pendek. Logo OrcaRouter berada di strip putih di kanan bawah.
Engineering & Research

Voxtral-Mini-4B-Realtime-Arabic: Mistral Merilis Model ASR Dialek Arab dan Tidak Mengatakan Apa Pun

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Lima puluh sembilan detik adalah seluruh pengumuman publik untuk Voxtral-Mini-4B-Realtime-Arabic. Pada 11:36:06 UTC tanggal 8 Oktober 2026, sebuah repositori bernama mistralai/Voxtral-Mini-4B-Realtime-Arabic muncul di Hugging Face. Pada 11:37:05 — lima puluh sembilan detik kemudian — repositori kedua, mistralai/LIDstral-Arabic, muncul di sampingnya. Keduanya memiliki stempel waktu modifikasi yang sama, keduanya berada di nol unduhan dan tiga suka saat ini ditulis pada 10 Oktober, dan tidak ada satu pun yang memiliki pos peluncuran, halaman harga, entri blog, atau baris di indeks berita Mistral yang mendukungnya. Voxtral-Mini-4B-Realtime-Arabic adalah model pengenalan suara ke teks streaming untuk bahasa Arab — Arab Standar Modern plus lima belas dialek yang disebutkan — disetel halus dari Voxtral-Mini-4B-Realtime-2602 dan diterbitkan di bawah Apache 2.0 dengan bobot BF16 yang dapat diunduh. Sejauh itu yang dibuktikan oleh repositori. Apakah Mistral berniat mendukungnya, menetapkan harganya, atau mengatakan apa pun tentangnya sama sekali belum dapat diketahui, dan tulisan ini dengan sengaja memisahkan kedua kategori tersebut.

Versi singkatnya: arsitektur ASR realtime yang sudah diketahui baik diarahkan ke satu rumpun bahasa dan dialek-dialeknya, bobot serta kedua jalur penyajiannya bersifat publik dan dapat dijalankan hari ini, dan perusahaan di baliknya belum angkat bicara. Yang menyusul adalah pembacaan atas apa yang benar-benar ada — stempel waktu repositori, file konfigurasi, angka-angka dari kartu model itu sendiri — ditambah garis tegas mengenai apa yang tidak diberitahukan semua itu kepada Anda.

Apa yang ada di hub, dan bagaimana itu sampai di sana

Artefak utamanya adalah satu repositori Hugging Face, mistralai/Voxtral-Mini-4B-Realtime-Arabic, yang membawa kartu model, bobot safetensors dalam BF16, serta file prosesor dan konfigurasi yang diperlukan untuk memuatnya. Stempel waktu pembuatannya adalah 2026-10-08T11:36:06Z. Modifikasi terakhirnya adalah 2026-10-09T17:11:35Z — repositori itu masih disentuh sehari setelah kemunculannya.

Waktu kemunculan repo saudaranya adalah detail yang mengubah satu unggahan sunyi menjadi sesuatu yang layak dibaca. mistralai/LIDstral-Arabic dibuat pada 2026-10-08T11:37:05Z, kurang dari satu menit setelahnya, dengan stempel waktu modifikasi yang identik dan jumlah engagement yang identik, serta tag pipeline berupa text-classification, bukan pengenalan suara. Dua repositori, dua tugas berbeda, berselang enam puluh detik. Itu bukan cara sebuah eksperimen sekali jalan dipublikasikan; itu cara sebuah batch di-push.

Kesenjangan yang lebih lebar itulah yang membuat pasangan ini terasa aneh. Sebelum 8 Oktober, repositori model Mistral terbaru dalam bentuk apa pun adalah Shieldstral-1.0-3B pada 2026-07-16 — sekitar dua belas minggu hub kosong, yang disela oleh dua unggahan dalam waktu satu menit. Sebuah checkpoint ASR dialek Arab dan pengklasifikasi identifikasi bahasa Arab yang datang bersamaan, tanpa nama dan tanpa penjelasan, adalah ciri khas rilis yang dikoordinasikan secara internal dan tidak diumumkan secara eksternal. Ini bukan ciri khas kebocoran, dan ada baiknya kita tepat tentang alasannya: kebocoran adalah bobot tanpa lisensi, tanpa konfigurasi, tanpa jalur penyajian. Ini memiliki ketiganya.

A generated scoreboard card titled 'Voxtral-Mini-4B-Realtime-Arabic - the scoreboard', listing six rows: Parameters ~4.4B BF16; Languages 16 Arabic varieties; Transcription delay 480 ms, configurable; Average CER 8.82% on 7 benchmarks; Offline sibling 7.91% CER, no delay; Hosted API none found. A footer line reads 'All figures vendor-reported from the model card; no independent run yet.', and the OrcaRouter logo sits in a white strip at the bottom right.

Kartu model ini ditulis agar siap dirilis. Dokumen ini mendokumentasikan penggunaan, tolok ukur, keterbatasan, dan lisensi dalam format biasa, serta menyebutkan pengembang bersamanya: Ministère de la Transition Numérique et de la Réforme Administrative milik Maroko, berdasarkan kemitraan strategis yang ditandatangani antara Mistral dan Maroko pada Januari 2026, dengan model tersebut digambarkan sebagai aset AI berdaulat. Pembingkaian itu konsisten dengan luaran yang ada karena kontrak mengharuskannya ada, yang merupakan salah satu alasan masuk akal mengapa bobotnya dapat dipublikasikan sementara tidak ada tulisan peluncuran. Itu alasan yang masuk akal. Itu bukan alasan yang terkonfirmasi, dan kartu tersebut tidak menyatakannya.

Daftar dialek adalah keputusan produk yang sebenarnya

Kartu itu memuat enam belas tag bahasa. Hanya satu di antaranya yang merupakan bahasa dalam pengertian biasa.

• Arab Standar Modern — ar tag, ragam yang sudah ditangani setiap sistem ASR bahasa Arab.

• Maghreb — Maroko (ary), Libya (ayl), Tunisia (aeb), Aljazair (arq) dan Hassaniya, ragam Mauritania (mey).

• Teluk — Bahasa Arab Teluk di Bahrain, Kuwait, Qatar, dan UEA (afb), Najdi (ars), Omani (acx) dan Sanaani, ragam Yaman (ayn).

• Lembah Nil — Mesir (arz) dan Sudan (apd).

• Levantin dan Irak — Mesopotamia (acm), Levantin Selatan untuk Yordania dan Palestina (ajp) dan Levantin Utara untuk Lebanon dan Suriah (apc).

• Lainnya — Bahasa Arab Chad (shu).

Baca itu sebagai spesifikasi, dan intinya bukanlah "ia bisa bahasa Arab." Banyak model bisa bahasa Arab. Intinya adalah bahwa Darija Maroko, Arab Teluk, Arab Mesir, dan Arab Chad didaftarkan sebagai target pelatihan yang terpisah, bukan sebagai aksen yang diharapkan diserap oleh satu model Arab Standar Modern. Itu adalah masalah yang secara signifikan lebih sulit, dan masalah itulah yang sebenarnya membuat sistem ucapan Arab gagal di produksi — pusat panggilan Maroko dan saluran dukungan Teluk bukanlah audio yang sama, dan model yang disetel pada fusḥā cenderung gagal pada keduanya. Kartu itu juga menyatakan bahwa alih kode, ketika penutur berganti bahasa di tengah percakapan, merupakan fokus pelatihan, bukan efek samping.

Batasan itu dinyatakan sama gamblangnya, dan ada baiknya mengutip isinya secara langsung daripada melunakannya: model ini menargetkan transkripsi bahasa Arab, dan untuk bahasa lain, kartu tersebut mengarahkan Anda ke Voxtral-Mini-4B-Realtime-2602 yang asli. Ini adalah checkpoint spesialis, bukan checkpoint umum. Tidak ada ambiguitas di dalamnya dan tidak ada petunjuk bahwa versi multibahasa akan datang.

Arsitekturnya, dibaca dari konfigurasi, bukan dari prosanya

Prosa di kartu model berbentuk materi pemasaran; file konfigurasinya bersifat mekanis, dan di sanalah batasan operasional berada. Semua berikut ini dibaca langsung dari config.json, params.json dan processor_config.json milik repositori.

• Dua tumpukan, bukan satu — encoder audio kausal dengan 32 lapisan pada lebar tersembunyi 1280 dan 32 kepala atensi, yang menyuapi decoder bahasa dengan 26 lapisan pada lebar tersembunyi 3072 dengan 32 kepala query terhadap 8 kepala key-value. "sekitar 4,4 miliar parameter" pada kartu tersebut adalah jumlah totalnya; encoder adalah separuh yang lebih kecil darinya.

• Front end audio — input 16 kHz, 128 bin mel, FFT 400 sampel dengan hop 160 sampel, menghasilkan laju bingkai encoder 12,5 per detik, atau satu bingkai setiap 80 milidetik. Arsitektur ini terdaftar sebagai voxtral_realtime dengan head VoxtralRealtimeForConditionalGeneration.

• Penundaan adalah jumlah token, bukan bidang milidetik — default_num_delay_tokens adalah 6. Enam bingkai encoder pada 80 milidetik masing-masing adalah 480 milidetik, yang persis sama dengan penundaan yang digunakan kartu untuk mengutip angka akurasinya. Angka latensi dalam materi pemasaran karena itu adalah nilai konfigurasi yang dapat Anda ubah, dan angka utama pada kartu hanyalah satu titik pada kurva, bukan properti dari model.

• Perhatian encoder dibatasi pada jendela 750 frame — sekitar enam puluh detik audio — sementara decoder menjalankan jendela geser 8.192 token terhadap penyematan posisi maksimum 131.072. Jendela encoder adalah angka pertama yang perlu diperiksa terhadap beban kerja Anda sendiri: sesi streaming yang lebih lama dari satu menit beroperasi pada jendela bergulir, bukan pada konteks tanpa batas, dan bagaimana model berperilaku saat rekaman panjang bergulir melewati batas tersebut bukanlah hal yang dibahas oleh kartu model.

• Kuantisasi tidak disertakan — dtype yang dipublikasikan adalah bfloat16 di seluruh bagian. Siapa pun yang menginginkan deployment int8 atau fp8 membangunnya sendiri.

Angka 8,82%, dan siapa yang berada di baliknya

Setiap angka akurasi yang disertakan pada model ini berasal dari kartu model. Tidak ada apa pun di sini yang telah direproduksi oleh pihak ketiga, dan angka-angka di bawah ini harus dibaca sebagai klaim vendor sendiri, bukan sebagai hasil pengukuran.

• Rata-rata tingkat kesalahan karakter — 8,82% pada tujuh tolok ukur bahasa Arab, dengan penundaan transkripsi bawaan 480 milidetik, temperature 0,0.

• Dibandingkan dengan versi offline-nya sendiri — Voxtral Transcribe Arabic berada di 7,91% pada tujuh tolok ukur yang sama, sehingga model realtime tertinggal 0,91 poin persentase di belakang model bahasa Arab non-streaming dari vendor yang sama. Perbandingan itu milik Mistral sendiri, dan itulah yang membuatnya berguna: ini adalah pengukuran yang bersih tentang berapa biaya latensi sub-detik pada keluarga bahasa ini, dengan data identik dan penilaian identik.

• Benchmark baru dalam bauran — ketujuhnya mencakup ISMA dan Darija in the Wild, yang menurut kartu tersebut dikembangkan bersama MTNRA Maroko. Vendor yang memperkenalkan set evaluasinya sendiri bersamaan dengan sebuah model adalah hal yang normal, dan itu juga berarti sebagian dari rangkaian benchmark tidak memiliki riwayat eksternal untuk dibandingkan.

• Normalisasi adalah catatan penting yang menopang — angka CER dihitung dengan skema normalisasi yang juga dikembangkan bersama MTNRA, mencakup ejaan khas dialek, klitik, kata serapan, dan angka lisan, dan kartu tersebut menyatakan secara gamblang bahwa skor dapat berbeda dengan metode normalisasi lain. Kode ini tersedia di repositori sebagai normalization.py. Pahami itu sebagai ajakan untuk memeriksa, sekaligus sebagai peringatan: dua tim dapat menjalankan model ini pada audio yang sama dan menerbitkan angka CER yang berbeda tanpa salah satunya keliru.

• Satu catatan kaki merugikan pesaing — kartu itu mencatat bahwa filter keamanan Gemini memblokir transkripsi beberapa sampel audio FLEURS. Itu adalah pengamatan yang spesifik dan dapat diverifikasi tentang pipeline pesaing, dan inilah jenis perilaku yang diratakan oleh papan peringkat: sampel yang ditolak model untuk ditranskripsikan terbaca sebagai kegagalan atau sebagai data yang hilang, dan tidak ada dari kedua penafsiran itu yang merupakan skor yang adil.

A screenshot of the Hugging Face model page for mistralai/Voxtral-Mini-4B-Realtime-Arabic (captured October 10, 2026), showing the repository header with a like count of 3, the tags 'vllm' and 'automatic-speech-recognition', the licence line 'License: apache-2.0', a banner reading 'You need to agree to share your contact information to access this model', and the model card prose describing the streaming Arabic-dialect ASR model, its 480 ms transcription delay, the 8.82% average character error rate and the 0.91 percentage-point gap to Voxtral Transcribe Arabic's 7.91%.

Dua hal hilang dari basis bukti dan keduanya penting. Tidak ada evaluasi independen, jadi tidak ada satu pun angka di sini yang pernah teruji oleh pihak ketiga. Dan tidak ada harga, karena tidak ada layanan — tidak ada yang dijual, jadi tidak ada yang perlu diberi harga. Model yang dirilis dengan klaim angka dan tanpa penawaran komersial adalah model yang angkanya tidak dimiliki alasan oleh siapa pun di luar lab untuk diuji.

Menjalankannya hari ini

Inilah bagian yang membedakan checkpoint asli dari placeholder, dan repositori ini luar biasa lengkap untuk sesuatu yang belum diumumkan. Dua jalur yang didukung disertakan pada kartu.

• vLLM — pasang vLLM dengan ekstra audio dari mistral-common, lalu sajikan checkpoint berdasarkan namanya, dan streaming audio melalui WebSocket ke endpoint /v1/realtime. Kartu ini mengarah ke contoh speech-to-text realtime vLLM sebagai hal yang perlu diadaptasi, yang berarti kontrak streaming-nya adalah antarmuka yang terdokumentasi dan terpelihara, bukan sesuatu yang direkatkan untuk demo.

• Transformers — dukungan native dari versi 5.2.0, memuat AutoProcessor dan VoxtralReForConditionalGeneration dalam bfloat, dengan contoh Python lengkap di assets/bank-take-2.wav, yang setidaknya merupakan pilihan klip demo yang jujur untuk model ini.

Kedua jalur ini bersifat self-hosted. Tidak ada endpoint terhosting untuk checkpoint ini di mana pun yang dapat kami verifikasi, tidak ada API vendor, dan tidak ada tarif yang dipublikasikan. Dukungan di ekosistem yang lebih luas memang sengaja minim: dukungan native Transformers pada 5.2.0 adalah hal terbaru di sini, dan jalur vLLM bergantung pada ekstra audio. Operator yang menginginkan ini di produksi menyediakan GPU, proses serving, dan klien WebSocket, serta mewarisi checkpoint tanpa komitmen dukungan yang melekat padanya.

A screenshot of the vLLM documentation page for realtime speech-to-text (captured October 10, 2026), showing the heading 'Realtime Speech-to-Text with Voxtral Realtime', the install commands 'pip install --upgrade vllm mistral-common[audio]' and 'vllm serve mistralai/Voxtral-Mini-4B-Realtime-Arabic', the instruction to stream audio over WebSocket to the /v1/realtime endpoint, and a following section on the OpenAI Realtime Client.

Kesenjangan itulah tempat lapisan perutean benar-benar berguna, dan penting untuk tepat mengenai batasnya. OrcaRouter tidak melayani Voxtral-Mini-4B-Realtime-Arabic — checkpoint-nya tidak ada di katalog kami, dan kami tidak akan menyiratkan sebaliknya. Yang dapat dijangkau router dalam penerapan ini adalah segala hal di hilir transkrip: peringkas, pengklasifikasi maksud, agen yang mengonsumsi stream. Itu adalah model-model yang dapat Anda panggil melalui satu kunci API di lebih dari 200 model dengan harga daftar penyedia dengan markup 0%, dengan failover otomatis saat penyedia mengalami degradasi dan DSL perutean untuk menyusun beberapa model menjadi satu panggilan. Jika Anda membangun layanan ASR Arab yang dihosting sendiri, bagian ucapan dari tumpukan itu menjadi tanggung jawab Anda untuk menjalankannya; bagian bahasa tidak memerlukan kontrak kedua, SDK kedua, atau hubungan penagihan kedua yang menyertainya.

Apa yang akan membuat ini menjadi sebuah cerita?

Ini adalah artefak nyata dan rilis yang tidak lengkap, dan ketidaklengkapannya adalah bagian yang menarik. Apache 2.0 tidak dapat ditarik dari bobot yang sudah diunduh, jadi risiko lisensinya sudah beres. Yang belum beres adalah segala hal yang tidak dicakup oleh lisensi itu.

Tiga hal akan mengubah gambaran, dan tak satu pun darinya sudah ada. Sebuah pengumuman: postingan blog, tier harga, atau satu baris di indeks berita Mistral akan menjelaskan apakah ini produk atau hasil kontrak, dan hampir pasti akan memuat detail yang dihilangkan kartu itu. Sebuah uji independen: angka 8,82% dan selisih 0,91 poin dengan Voxtral Transcribe Arabic adalah klaim yang paling layak direproduksi, dan kode normalisasi yang disertakan membuatnya sangat mudah bagi siapa pun yang ingin mencoba. Dan checkpoint kedua: hadirnya model Levantine, Gulf, atau Egyptian secara terpisah akan mengubah satu spesialis dialek menjadi sebuah keluarga, yang menjadi pembeda antara artefak riset yang menjanjikan dan sesuatu yang benar-benar dapat dijadikan standar untuk penerapan regional.

Sampai setidaknya salah satu dari hal-hal itu terwujud, ringkasan yang akurat tentang Voxtral-Mini-4B-Realtime-Arabic adalah ini: sebuah checkpoint ASR dialek Arab yang lengkap, dapat dijalankan, dan berlisensi Apache-2.0, diterbitkan dengan kartu model lengkap dan dua jalur penyajian yang didukung, hadir tanpa pengumuman dari perusahaan yang membuatnya, tanpa evaluasi independen, tanpa harga, dan tanpa komitmen dukungan — di samping model identifikasi bahasa Arab yang muncul lima puluh sembilan detik kemudian dan mengisyaratkan bahwa lebih banyak hal seperti ini akan datang, bukan lebih sedikit.