
Voxtral Mini 4B Realtime Arabic vs Voxtral 4B TTS: Dua Ujung dari Percakapan yang Sama
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Kedua model ini berbagi nama, jumlah parameter, dan berkas lisensi yang berperilaku berbeda, dan di situlah kemiripannya berakhir. Voxtral Mini 4B Realtime Arabic, yang diunggah ke Hugging Face pada 8 Oktober 2026 tanpa pengumuman yang menyertai, menerima audio sebagai masukan dan menghasilkan teks Arab — sebuah fine-tune streaming dari Voxtral-Mini-4B-Realtime-2602 yang dibangun untuk Bahasa Arab Standar Modern dan lima belas dialek bernama, Apache 2.0, rata-rata Character Error Rate 8,82% pada penundaan 480 milidetik. Voxtral 4B TTS, yang diumumkan oleh Mistral AI pada Maret 2026, melakukan kebalikannya: teks masuk, ucapan keluar, dua puluh suara preset plus adaptasi dari klip referensi pendek, sembilan bahasa termasuk Arab, dan lisensi — CC BY-NC 4.0 — yang melarang penggunaan komersial atas bobot itu sendiri. Keduanya bukan alternatif dan bukan varian. Keduanya adalah dua bagian dari loop suara, dan alasan untuk melihat keduanya bersama-sama adalah bahwa keputusan yang Anda buat tentang salah satunya membatasi yang lain lebih dari yang diperkirakan sebagian besar tim.
Sebagian besar halaman perbandingan akan memberi tahu Anda bahwa model-model ini tidak berkaitan karena yang satu ASR dan yang lain TTS, lalu berhenti di situ. Itu benar tetapi tidak berguna. Yang sebenarnya layak diketahui adalah titik temu keduanya: agen suara membutuhkan keduanya, kedua lisensinya mengarah ke arah yang berlawanan, dua jejak perangkat kerasnya serupa sementara karakteristik throughput-nya tidak, dan klaim cakupan bahasa Arabnya memiliki bentuk yang sepenuhnya berbeda. Semua yang di bawah ini membahas keempat titik temu tersebut.
Apa setiap model itu, dalam istilah yang penting untuk sebuah pipeline
• Voxtral Mini 4B Realtime Arabic — pengenalan suara otomatis streaming. Masukan audio 16 kHz, keluaran teks, sekitar 4,4 miliar parameter dalam BF16, dilayani melalui vLLM dengan WebSocket di /v1/realtime atau secara native di Transformers sejak versi 5.2.0. Encoder audio kausal dan dekoder bahasa, penundaan transkripsi yang dapat dikonfigurasi disebut sebesar 480 milidetik untuk angka akurasi yang dipublikasikan, dan modul normalisasi yang disertakan bersama sehingga tingkat kesalahan karakter Arab dapat diturunkan kembali. Apache 2.0.
• Voxtral 4B TTS — text-to-speech streaming dan batch. Teks masuk, audio 24 kHz keluar dalam format WAV, PCM, FLAC, MP3, AAC, atau Opus, dengan sekitar 4 miliar parameter, serta daftar preset 20 suara dan adaptasi suara dari klip referensi yang berdurasi sesingkat tiga detik. Tolok ukur milik Mistral sendiri pada satu H200 yang menjalankan vLLM-Omni 0.18.0 dengan input 500 karakter dan referensi sepuluh detik melaporkan latensi 70 milidetik dan faktor waktu nyata 0,103 pada konkurensi 1, meningkat menjadi 331 milidetik dan 0,237 pada konkurensi 16, serta 552 milidetik pada konkurensi 32. Diakses sebagai API dengan biaya $0,016 per seribu karakter.
Pengamatan pertama dari kedua paragraf tersebut adalah bahwa pasangan ini kecil. Kedua model berada dalam rentang 4 miliar parameter dan keduanya muat pada satu akselerator dalam BF16, yang berarti agen suara Arab yang dibangun sepenuhnya di atas open weights paling banyak merupakan penerapan dua GPU, dan secara masuk akal merupakan penerapan satu GPU dengan kuantisasi di kedua sisi. Itulah alasan praktis untuk melihat keduanya sebagai satu kesatuan, bukan sebagai dua keputusan produk yang terpisah.

Asimetri lisensi adalah temuannya, bukan catatan kaki
Inilah hal yang mengejutkan orang-orang yang menganggap model dari lab yang sama dengan konvensi penamaan yang sama membawa ketentuan yang sama.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0. Penggunaan komersial, modifikasi, redistribusi, dan fine-tuning semuanya diizinkan, dengan syarat mematuhi pembatasan standar terhadap pelanggaran hak pihak ketiga.
• Voxtral 4B TTS — CC BY-NC 4.0, diwarisi dari dataset suara referensi di baliknya. Nonkomersial. Kartu model Mistral secara eksplisit menyatakan bahwa model ini mewarisi lisensi dari referensi suaranya, yang diambil dari sumber-sumber termasuk EARS, CML-TTS, IndicVoices-R, dan kumpulan audio alami berbahasa Arab. Bobotnya dapat diunduh dan lisensinya bukan lisensi komersial.
Ini adalah batasan keras pada arsitektur persis yang pertama kali dipilih semua orang. Jika Anda membangun agen suara Arab yang bagian speech-to-text-nya adalah Voxtral Mini 4B Realtime Arabic dan bagian text-to-speech-nya adalah Voxtral 4B TTS, Anda memiliki pipeline yang separuh komponennya bebas untuk penggunaan komersial dan separuhnya tidak, dan separuh yang restriktif mengatur produk tersebut. Model ASR yang berlisensi Apache 2.0 tidak menyelamatkan sisi TTS. Menjalankan pasangan itu secara lokal tidak mengubah lisensinya, dan tidak mengirimkan bobotnya juga tidak mengubahnya — batasan itu melekat pada penggunaannya, bukan pada distribusinya.

Jalur komersial yang ditawarkan Mistral untuk sisi suara adalah API terhosting dengan tarif $0,016 per seribu karakter, yang merupakan perjanjian layanan, bukan pemberian lisensi. Bagi tim produk, konsekuensi praktisnya adalah separuh loop yang dapat dikomersialkan secara bebas adalah separuh yang mendengarkan, dan separuh yang berbicara merupakan entah dependensi API atau pembicaraan lisensi. Hal itu membalikkan apa yang diasumsikan sebagian besar tim ketika mereka mulai membangun stack suara terbuka, dan hal itu layak diketahui sebelum Anda menulis integrasinya, bukan sesudahnya.
Klaim-klaim berbahasa Arab itu tidak selaras, dan hanya satu di antaranya yang merupakan janji cakupan.
Kedua model mencantumkan bahasa Arab. Daftar tersebut berarti hal yang berbeda.
• Voxtral Mini 4B Realtime Arabic — Bahasa Arab adalah keseluruhan cakupannya. Enam belas varietas disebutkan sebagai target pelatihan: Arab Standar Modern, Arab Maroko, Arab Libya, Arab Tunisia, Arab Aljazair dan Arab Hassaniya, Arab Teluk, Arab Najdi, Arab Oman dan Arab Sanaani, Arab Mesir dan Arab Sudan, Arab Mesopotamia serta Arab Levantin Selatan dan Utara, dan Arab Chad. Apa pun di luar kumpulan itu didokumentasikan sebagai di luar cakupan. Satu angka akurasi agregat, 8,82% CER, dirata-ratakan di seluruh tujuh tolok ukur bahasa Arab.
• Voxtral 4B TTS — Bahasa Arab adalah salah satu dari sembilan bahasa yang didukung, bersama dengan bahasa Inggris, Prancis, Spanyol, Jerman, Italia, Portugis, Belanda, dan Hindi. Kartu tersebut menjelaskan "dialek yang beragam" dalam dukungan itu, tanpa menyebutkannya satu per satu, dan tidak ada angka kualitas per bahasa yang dipublikasikan untuk bahasa Arab maupun untuk delapan bahasa lainnya.
Dibaca bersama, pasangan ini memberi Anda pernyataan terperinci tentang seberapa baik sistem Anda akan mendengar bahasa Arab dan hampir tidak ada pernyataan sama sekali tentang seberapa baik sistem itu akan mengucapkannya. Asimetri itu memiliki konsekuensi nyata bagi agen suara bahasa Arab Darija atau Teluk: sisi input memiliki tolok ukur yang dipublikasikan dan daftar dialek yang dapat Anda evaluasi, sedangkan sisi output memiliki lencana bahasa dan daftar suara. Tidak ada yang telah mempublikasikan pengukuran keterpahaman bahasa Arab dialektal untuk Voxtral 4B TTS, dan fitur adaptasi suara tidak menyelesaikannya — mengadaptasi suara mengubah suara itu terdengar seperti siapa, bukan dialek mana yang dihasilkannya.
Ada poin kedua yang lebih halus tentang angka akurasi model ASR itu sendiri yang juga berlaku di sisi TTS. Mistral melaporkan CER streaming 8,82% versus 7,91% untuk Voxtral Transcribe Arabic offline pada tujuh tolok ukur yang sama dengan normalisasi yang sama, jadi streaming memakan sekitar satu poin. Pertukaran yang setara di sisi TTS — berapa biaya inferensi streaming terhadap kualitas keluaran dibandingkan batch — sama sekali tidak dikuantifikasi dalam materi tersebut. Angka latensinya ada; delta kualitasnya tidak.
Throughput: satu model dirancang untuk dipacu, yang lain tidak
Mistral menerbitkan data throughput untuk tepat satu dari model-model ini, dan angka-angkanya menjelaskan mengapa.
• Voxtral 4B TTS — diukur pada satu H200 dengan vLLM-Omni, input 500 karakter dan referensi audio sepuluh detik, throughput berkisar dari sekitar 119 karakter per detik waktu GPU pada konkurensi 1 hingga sekitar 879 pada konkurensi 16 dan sekitar 1.431 pada konkurensi 32, dengan latensi meningkat dari 70 milidetik ke 331 lalu 552. Itu adalah kurva throughput yang dapat Anda jadikan acuan perencanaan kapasitas, dan bentuknya sesuai dengan yang Anda harapkan dari model yang dirancang sebagai layanan suara produksi.
• Voxtral Mini 4B Realtime Arabic — kartu tersebut tidak melaporkan angka throughput, perilaku konkurensi, maupun tolok ukur perangkat keras. Yang dinyatakannya adalah arsitektur: encoder kausal dan skema atensi jendela geser pada encoder dan decoder, yang dijelaskan pada model dasar sebagai mendukung streaming yang secara efektif tak terbatas. Angka akurasinya dikutip pada penundaan 480 milidetik, yang menyiratkan bahwa model mampu mengikuti audio waktu nyata pada perangkat keras yang sesuai, dan itulah sejauh mana rentang kinerja yang dipublikasikan.
Kesenjangan ini bukanlah kritik terhadap model mana pun, melainkan lebih sebagai pernyataan tentang kematangan. Model TTS memiliki tabel SLO yang dipublikasikan karena dirilis sebagai produk dengan postingan blog, demo, API, dan harga. Model ASR bahasa Arab tidak memiliki rentang kinerja yang dipublikasikan karena hadir sebagai repositori dengan kartu model. Jika Anda hari ini sedang memperkirakan kapasitas armada transkripsi bahasa Arab, angka throughput yang Anda butuhkan belum ada, dan satu-satunya cara untuk mendapatkannya adalah menjalankan jalur penyajian vLLM di perangkat keras Anda sendiri dengan audio Anda sendiri.
Itulah juga tempat lapisan perutean mengubah bentuk penerapan, bukan sekadar penagihan. OrcaRouter tidak merutekan kedua model ini — kami tidak menghosting endpoint suara Mistral mana pun, dan artikel ini tidak mengklaim sebaliknya — tetapi lapisan model bahasa di antara keduanya justru merupakan lapisan yang diuntungkan dengan dirutekan: satu kunci API untuk lebih dari 200 model pada harga daftar penyedia dengan markup 0%, sehingga perubahan harga vendor mendarat di sisi kami pada hari yang sama saat diumumkan, dan failover otomatis sehingga setelah tengah hari yang buruk dari satu penyedia hulu, hal itu menjadi pengalihan rute alih-alih pemadaman di loop suara Anda. Agen suara yang dirakit dari dua model Mistral yang dihosting sendiri plus satu model penalaran yang dihosting memiliki tiga domain kegagalan; lapisan peruteanlah yang membuat domain tengahnya membosankan.
Biaya, berdampingan, dengan catatan bahwa satu sisi tidak memiliki harga
• Voxtral 4B TTS — $0.016 per seribu karakter melalui API Mistral, atau biaya GPU jika Anda menghosting sendiri dengan ketentuan yang mengizinkan kasus penggunaan Anda. Sebagai gambaran kasar skalanya, seribu karakter adalah beberapa ratus kata, jadi satu menit keluaran lisan berada di kisaran pecahan sen yang rendah pada harga daftar, sebelum keunggulan konkurensi apa pun dari menjalankannya sendiri.
• Voxtral Mini 4B Realtime Arabic — tidak ada harga yang dipublikasikan, tidak ada layanan hosted, tidak ada daftar tarif. Biayanya adalah perangkat keras dan utilisasi. Model 4,4B BF16 pada satu akselerator modern adalah biaya bulanan tetap yang Anda amortisasi ke sebanyak mungkin audio yang dapat diproses mesin, yang murah pada volume berkelanjutan dan murni pemborosan pada volume sesekali.
Perbandingan yang mungkin lebih penting adalah terhadap alternatif yang akan Anda pilih sebagai gantinya. Di sisi mendengarkan, checkpoint Arab bersaing dengan API streaming per jam yang tarifnya dipublikasikan dan rendah — MAI-Transcribe-2-Streaming milik Microsoft dengan harga perkenalan $0,54 per jam audio, Grok Voice Transcribe 2.0 milik xAI dengan $0,20 per jam audio streaming — yang berarti layanan transkripsi Arab dapat dibeli dengan beberapa persepuluh sen per menit dan argumen untuk open-weights harus dibuat berdasarkan akurasi dialek, residensi data, atau fine-tuning, bukan pada biaya per unit. Di sisi berbicara, model TTS yang di-host sendiri dengan biaya marginal nol adalah keunggulan nyata dibandingkan API per karakter pada volume besar, itulah sebabnya lisensi CC BY-NC menjadi faktor pembatas, bukan harganya.
Satu catatan struktural bagi siapa pun yang menganggarkan peralihan berbasis harga: router yang meneruskan harga daftar penyedia dengan markup 0% adalah permukaan tempat perubahan tarif vendor muncul pada hari yang sama saat diumumkan, bukan pada siklus penetapan harga ulang berikutnya. Hal itu lebih penting di sisi mendengarkan daripada sisi berbicara, karena transkripsi diberi harga per jam audio dan itu adalah angka yang dapat diubah vendor.
Bagaimana cara berpikir tentang memilih di antara mereka
Anda tidak memilih di antara keduanya. Pertanyaannya adalah separuh loop mana yang dapat Anda bangun di atas bobot terbuka, dan lisensinya menjawabnya.
Jika kebutuhan Anda adalah agen suara berbahasa Arab yang mandiri, di mana audio tidak pernah meninggalkan infrastruktur Anda, sisi pendengarannya tersedia bagi Anda tanpa syarat: Apache 2.0, dapat diunduh, dapat di-fine-tune, dengan daftar dialek yang dapat Anda uji dan tingkat kesalahan bahasa Arab yang telah dipublikasikan. Sisi bicaralah yang menjadi titik kendalanya, dan Anda punya dua opsi jujur — pindahkan sintesis suara ke layanan yang dihosting berdasarkan perjanjian komersial, atau hapus Voxtral 4B TTS dari arsitektur dan cari model sintesis berlisensi permisif untuk bahasa Arab.
Jika kebutuhan Anda adalah layanan transkripsi produksi dan bahasanya adalah bahasa Arab, keputusannya ada di antara checkpoint 4.4B yang dapat diunduh dengan taksonomi dialek yang dipublikasikan dan satu tingkat kesalahan agregat, versus API streaming yang dihosting dengan tarif yang dipublikasikan, latensi yang dipublikasikan, dan papan pihak ketiga. Model terbuka menang dalam hal kontrol, residensi, dan fine-tuning; opsi yang dihosting menang dalam hal bukti, dukungan, dan kesederhanaan operasional. Dua hari setelah bobot tersebut muncul, belum ada pihak di luar Mistral yang mengukurnya, dan itu adalah alasan untuk menjalankan benchmark Anda sendiri, bukan alasan untuk mengabaikan checkpoint tersebut.
Hal yang paling akan mengubah gambaran ini adalah rilis sintesis bahasa Arab dengan ketentuan yang mengizinkan penggunaan komersial — pola yang sama yang sudah diikuti sisi pendengaran. Sampai itu ada, lingkarannya tetap setengah terbuka, dan kerja praktisnya adalah memutuskan separuh mana yang bersedia Anda sewa.

Kami tidak menghosting satu pun dari kedua model ucapan Mistral ini dan artikel ini tidak mengklaim sebaliknya; yang dibutuhkan oleh loop suara di atas keduanya adalah lapisan bahasa, dan itu dapat dirutekan - satu kunci API untuk lebih dari 200 model dengan harga daftar penyedia dan markup 0%, sehingga perubahan tarif vendor sampai ke sisi kami pada hari yang sama saat diumumkan.
Failover otomatis mencegah bagian tengah dari agen suara tiga komponen - satu model penalaran upstream di antara dua model Mistral yang dihosting sendiri - menjadi bagian yang menjatuhkan produk.
