Generierte Hero-Titelkarte für einen Vergleich von Voxtral Mini 4B Realtime Arabic und Voxtral 4B TTS, untertitelt mit „zwei Enden derselben arabischen Sprachschleife, zwei verschiedene Lizenzen“, mit dem Badge „Spracheingabe versus Sprachausgabe“, mit drei Stat-Chips, die 8,82 % arabische Zeichenfehlerrate bei 480 ms gegenüber 70 ms Zeit bis zum ersten Audio, 16 arabische Dialekte gegenüber 9 Sprachen einschließlich Arabisch und Apache-2.0-Gewichte gegenüber CC BY-NC-4.0-Gewichte anzeigen, sowie dem OrcaRouter-Logo, das in einen weißen Streifen unten rechts eingefügt ist.
Engineering & Research

Voxtral Mini 4B Realtime Arabic vs. Voxtral 4B TTS: Zwei Enden desselben Gesprächs

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Diese beiden Modelle teilen einen Namen, eine Parameteranzahl und eine Lizenzdatei, die sich anders verhält, und dort endet die Ähnlichkeit. Voxtral Mini 4B Realtime Arabic, am 8. Oktober 2026 ohne begleitende Ankündigung auf Hugging Face veröffentlicht, nimmt Audio entgegen und erzeugt arabischen Text — ein Streaming-Fine-Tuning von Voxtral-Mini-4B-Realtime-2602, entwickelt für modernes Standardarabisch und fünfzehn namentlich genannte Dialekte, Apache 2.0, 8,82 % durchschnittliche Zeichenfehlerrate bei einer Verzögerung von 480 Millisekunden. Voxtral 4B TTS, von Mistral AI im März 2026 angekündigt, macht das Gegenteil: Text hinein, Sprache hinaus, zwanzig voreingestellte Stimmen plus Anpassung anhand eines kurzen Referenzclips, neun Sprachen einschließlich Arabisch, und eine Lizenz — CC BY-NC 4.0 —, die die kommerzielle Nutzung der Gewichte selbst verbietet. Sie sind keine Alternativen und keine Varianten. Sie sind die beiden Hälften eines Voice-Loops, und der Grund, sie zusammen zu betrachten, ist, dass die Entscheidungen, die man in Bezug auf eines von ihnen trifft, das andere stärker einschränken, als die meisten Teams erwarten.

Die meisten Vergleichsseiten werden Ihnen sagen, dass diese Modelle nichts miteinander zu tun haben, weil das eine ASR und das andere TTS ist, und dann aufhören. Das stimmt, ist aber nicht hilfreich. Wirklich wissenswert ist, wo sie sich treffen: Ein Voice-Agent braucht beides, die beiden Lizenzen weisen in entgegengesetzte Richtungen, die beiden Hardware-Footprints sind ähnlich, die Durchsatzeigenschaften hingegen nicht, und die Angaben zur arabischen Abdeckung sind völlig unterschiedlich geartet. Alles im Folgenden dreht sich um diese vier Berührungspunkte.

Was jedes Modell ist, in den Begriffen, die für eine Pipeline von Bedeutung sind

• Voxtral Mini 4B Realtime Arabic — streamingfähige automatische Spracherkennung. 16-kHz-Audio-Eingang, Text-Ausgang, rund 4,4 Milliarden Parameter in BF16, bereitgestellt über vLLM mit einem WebSocket unter /v1/realtime oder nativ in Transformers ab Version 5.2.0. Ein kausaler Audio-Encoder und ein Sprachdecoder, eine konfigurierbare Transkriptionsverzögerung, die für die veröffentlichte Genauigkeitsangabe mit 480 Millisekunden angegeben wird, sowie ein mitgeliefertes Normalisierungsmodul, damit die arabische Zeichenfehlerrate erneut hergeleitet werden kann. Apache 2.0.

• Voxtral 4B TTS — Streaming- und Batch-Text-to-Speech. Text rein, 24-kHz-Audio raus in WAV, PCM, FLAC, MP3, AAC oder Opus, rund 4 Milliarden Parameter, mit einem Preset-Kader von 20 Stimmen und Stimmadaption anhand eines Referenzclips von nur drei Sekunden. Mistrals eigener Benchmark auf einer einzelnen H200 mit vLLM-Omni 0.18.0, einer Eingabe von 500 Zeichen und einer zehnsekündigen Referenz meldet 70 Millisekunden Latenz und einen Echtzeitfaktor von 0,103 bei Parallelität 1, steigend auf 331 Millisekunden und 0,237 bei Parallelität 16 sowie 552 Millisekunden bei Parallelität 32. Als API für 0,016 US-Dollar pro tausend Zeichen abrufbar.

Die erste Beobachtung aus diesen beiden Absätzen ist, dass das Paar klein ist. Beide Modelle liegen im Bereich von 4 Milliarden Parametern, und beide passen in BF16 auf einen einzelnen Beschleuniger, was bedeutet, dass ein arabischer Sprachagent, der vollständig auf offenen Gewichten aufbaut, höchstens ein Zwei-GPU-Deployment ist und plausibel ein Ein-GPU-Deployment mit Quantisierung auf beiden Seiten. Das ist der praktische Grund, sie als Set statt als zwei getrennte Produktentscheidungen zu betrachten.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Die Lizenzasymmetrie ist das Ergebnis, nicht eine Fußnote

Das ist die Sache, die Menschen überrascht, die annehmen, dass Modelle aus demselben Labor mit derselben Namenskonvention dieselben Bedingungen haben.

• Voxtral 4B Realtime Arabic — Apache 2.0. Kommerzielle Nutzung, Modifikation, Weitergabe und Fine-Tuning sind allesamt erlaubt, vorbehaltlich der üblichen Einschränkung, keine Rechte Dritter zu verletzen.

• Voxtral 4B TTS — CC BY-NC 4.0, übernommen von den Referenzstimmdatensätzen dahinter. Nicht kommerziell. Mistrals Modellkarte stellt ausdrücklich klar, dass das Modell die Lizenz seiner Stimmreferenzen erbt, die aus Quellen wie EARS, CML-TTS, IndicVoices-R und einem arabischen Natural-Audio-Datensatz stammen. Die Gewichte sind herunterladbar, und die Lizenz ist keine kommerzielle.

Dies ist eine harte Einschränkung für genau die Architektur, zu der jeder zuerst greift. Wenn du einen arabischen Voice-Agenten baust, dessen Speech-to-Text-Teil Voxtral Mini 4B Realtime Arabic und dessen Text-to-Speech-Teil Voxtral 4B TTS ist, hast du eine Pipeline, in der die eine Hälfte der Komponenten frei kommerziell nutzbar ist und die andere nicht, und die restriktive Hälfte bestimmt das Produkt. Dass das ASR-Modell unter Apache 2.0 steht, rettet den TTS-Teil nicht. Das Paar lokal laufen zu lassen ändert die Lizenz nicht, und die Gewichte nicht auszuliefern ebenso wenig – die Einschränkung hängt an der Nutzung, nicht an der Verbreitung.

Screenshot of the Hugging Face model card for mistralai/Voxtral-4B-TTS-2603, captured 10 October 2026, showing the model name, the mistralai organisation, the Text-to-Speech pipeline tag, 922 likes, a language badge, and the CC BY-NC 4.0 licence inherited from the reference-voice datasets.

Der kommerzielle Weg, den Mistral für die Sprachseite anbietet, ist die gehostete API zu 0,016 US-Dollar pro tausend Zeichen, was eher eine Dienstleistungsvereinbarung als eine Lizenzgewährung ist. Für ein Produktteam ist die praktische Konsequenz, dass die frei kommerzialisierbare Hälfte der Schleife die Hälfte ist, die zuhört, und die Hälfte, die spricht, ist entweder eine API-Abhängigkeit oder ein Lizenzgespräch. Das stellt auf den Kopf, was die meisten Teams annehmen, wenn sie sich daran machen, einen offenen Voice-Stack zu bauen, und es lohnt sich, das zu entdecken, bevor man die Integration geschrieben hat, statt danach.

Die arabischen Behauptungen passen nicht zusammen, und nur eine davon ist ein Deckungsversprechen.

Beide Modelle listen Arabisch auf. Die Einträge bedeuten jeweils etwas anderes.

Voxtral Mini 4B Realtime Arabic — Arabisch ist der gesamte Umfang. Sechzehn Varietäten werden als Trainingsziele aufgeführt: Modernes Hocharabisch, Marokkanisch, Libysch, Tunesisch, Algerisch und Hassania-Arabisch, Golf-, Nadschdi-, Omani- und Sanaani-Arabisch, Ägyptisch und Sudanesisch, Mesopotamisch sowie sowohl Süd- als auch Nordlevantinisch und Tschadisch. Alles außerhalb dieser Menge wird als außerhalb des Geltungsbereichs dokumentiert. Ein aggregierter Genauigkeitswert, 8,82 % CER, gemittelt über sieben arabische Benchmarks.

• Voxtral 4B TTS — Arabisch ist eine von neun unterstützten Sprachen, neben Englisch, Französisch, Spanisch, Deutsch, Italienisch, Portugiesisch, Niederländisch und Hindi. Die Modellkarte beschreibt „vielfältige Dialekte“ innerhalb dieser Unterstützung, ohne sie aufzuzählen, und es wurde kein Qualitätswert pro Sprache für Arabisch oder für eine der anderen acht veröffentlicht.

Zusammen gelesen liefern die beiden eine detaillierte Aussage darüber, wie gut Ihr System Arabisch hören wird, und so gut wie gar keine Aussage darüber, wie gut es es sprechen wird. Diese Asymmetrie hat eine reale Konsequenz für einen Voice-Agenten für Darija- oder Golf-Arabisch: Die Eingabeseite hat einen veröffentlichten Benchmark und eine Dialektliste, gegen die Sie evaluieren können, und die Ausgabeseite hat ein Sprach-Badge und eine Stimmenliste. Niemand hat eine Verständlichkeitsmessung für dialektales Arabisch für Voxtral 4B TTS veröffentlicht, und die Stimmanpassungsfunktion löst das nicht – die Anpassung einer Stimme ändert, nach wem sich die Sprache anhört, nicht, welchen Dialekt sie erzeugt.

Es gibt einen zweiten, subtileren Punkt zum Genauigkeitswert des ASR-Modells selbst, der sich auf die TTS-Seite überträgt. Mistral berichtet 8,82 % CER im Streaming gegenüber 7,91 % für das Offline-Voxtral Transcribe Arabic auf denselben sieben Benchmarks mit derselben Normalisierung, sodass Streaming etwa einen Punkt kostet. Der entsprechende Trade-off auf der TTS-Seite – was Streaming-Inferenz im Vergleich zum Batch-Betrieb an Ausgabequalität kostet – wird im Material überhaupt nicht quantifiziert. Die Latenzwerte existieren; das Qualitätsdelta nicht.

Durchsatz: Das eine Modell ist darauf ausgelegt, an seine Grenzen getrieben zu werden, das andere nicht.

Mistral hat Durchsatzdaten für genau eines dieser Modelle veröffentlicht, und die Zahlen erklären, warum.

• Voxtral 4B TTS — gemessen auf einer H200 mit vLLM-Omni, bei einer Eingabe von 500 Zeichen und einer zehnsekündigen Audio-Referenz, reicht der Durchsatz von etwa 119 Zeichen pro Sekunde GPU-Zeit bei Nebenläufigkeit 1 bis ungefähr 879 bei Nebenläufigkeit 16 und etwa 1.431 bei Nebenläufigkeit 32, wobei die Latenz von 70 Millisekunden auf 331 und dann auf 552 steigt. Das ist eine Durchsatzkurve, anhand derer Sie die Kapazität planen können, und es ist die Form, die man von einem Modell erwarten würde, das als produktiver Sprachdienst konzipiert ist.

• Voxtral Mini 4B Realtime Arabic — die Karte nennt weder eine Durchsatzrate noch ein Nebenläufigkeitsverhalten und auch keinen Hardware-Benchmark. Was sie jedoch angibt, ist die Architektur: einen kausalen Encoder und ein Sliding-Window-Attention-Schema sowohl beim Encoder als auch beim Decoder, das im Basismodell als effektiv unbegrenztes Streaming unterstützend beschrieben wird. Der Genauigkeitspunkt wird mit 480 Millisekunden Verzögerung angegeben, was impliziert, dass das Modell bei geeigneter Hardware mit Echtzeit-Audio mithält, und das ist der Umfang der veröffentlichten Leistungshülle.

Die Kluft ist weniger eine Kritik an einem der beiden Modelle als vielmehr eine Aussage über Reife. Das TTS-Modell hat eine veröffentlichte SLO-Tabelle, weil es als Produkt mit einem Blogbeitrag, einer Demo, einer API und einem Preis veröffentlicht wurde. Das arabische ASR-Modell hat kein veröffentlichtes Leistungsprofil, weil es als Repository mit einer Karte ankam. Wenn Sie heute eine arabische Transkriptionsflotte dimensionieren, gibt es die Durchsatzzahl, die Sie benötigen, noch nicht, und der einzige Weg, sie zu bekommen, ist, den vLLM-Serving-Pfad auf Ihrer eigenen Hardware mit Ihrem eigenen Audio auszuführen.

Das ist auch der Punkt, an dem eine Routing-Schicht die Form des Deployments verändert und nicht nur die Abrechnung. OrcaRouter routet keines dieser Modelle – wir hosten keinen Mistral-Speech-Endpoint, und dieser Artikel behauptet nichts anderes –, doch die Sprachmodellschicht zwischen ihnen ist genau die Schicht, die vom Routing profitiert: ein API-Schlüssel für mehr als 200 Modelle zum Listenpreis des Anbieters mit 0 % Aufschlag, sodass eine Preisänderung eines Anbieters am Tag ihrer Ankündigung auf unserer Seite landet, plus automatisches Failover, sodass der schlechte Nachmittag eines einzelnen Upstream-Anbieters ein Rerouting statt eines Ausfalls in Ihrer Voice-Schleife ist. Ein Voice-Agent, der aus zwei selbst gehosteten Mistral-Modellen plus einem gehosteten Reasoning-Modell zusammengesetzt ist, hat drei Fehlerdomänen; die Routing-Schicht ist das, was die mittlere langweilig macht.

Kosten, Seite an Seite, mit dem Vorbehalt, dass eine Seite keinen Preis hat

• Voxtral 4B TTS — $0,016 pro tausend Zeichen über Mistrals API oder die Kosten der GPU, wenn Sie selbst hosten, unter Bedingungen, die Ihren Anwendungsfall zulassen. Für ein grobes Gefühl für die Größenordnung: Tausend Zeichen sind ein paar hundert Wörter, sodass eine Minute gesprochener Ausgabe zum Listenpreis im niedrigen Bruchteil eines Cents liegt – noch bevor ein Vorteil durch parallele Ausführung beim Selbstbetrieb hinzukommt.

• Voxtral Mini 4B Realtime Arabic — kein veröffentlichter Preis, kein gehosteter Dienst, keine Preisliste. Die Kosten sind Hardware und Auslastung. Ein 4,4B-BF16-Modell auf einem modernen Beschleuniger ist eine feste monatliche Ausgabe, die man über so viel Audio amortisiert, wie die Maschine verarbeiten kann – bei dauerhaftem Volumen günstig, bei gelegentlichem Volumen reine Verschwendung.

Der Vergleich, der wahrscheinlich wichtiger ist, ist der mit den Alternativen, zu denen man stattdessen greifen würde. Auf der Hörseite konkurriert der arabische Checkpoint mit stündlich abgerechneten Streaming-APIs, deren Preise veröffentlicht und niedrig sind – Microsofts MAI-Transcribe-2-Streaming zu 0,54 $ pro Audio-Stunde als Einführungspreis, xAIs Grok Voice Transcribe 2.0 zu 0,20 $ pro Audio-Stunde im Streaming – was bedeutet, dass ein arabischer Transkriptionsdienst für ein paar Zehntelcent pro Minute gekauft werden kann und der Open-Weights-Fall auf Dialektgenauigkeit, Datenresidenz oder Fine-Tuning statt auf Stückkosten gestützt werden muss. Auf der Sprechseite ist ein selbst gehostetes TTS-Modell mit marginalen Kosten von null bei hohem Volumen ein echter Vorteil gegenüber zeichenbasierten APIs, weshalb die CC BY-NC-Lizenz und nicht der Preis der einschränkende Faktor ist.

Ein struktureller Hinweis für alle, die einen preisbasierten Wechsel kalkulieren: Ein Router, der den Listenpreis des Anbieters mit 0 % Aufschlag durchreicht, ist die Stelle, an der eine Tarifänderung eines Anbieters noch am Tag ihrer Ankündigung sichtbar wird statt erst im nächsten Preisanpassungszyklus. Das ist auf der Hörseite wichtiger als auf der Sprechseite, weil Transkription pro Stunde Audio abgerechnet wird und das eine Zahl ist, die Anbieter verändern.

Wie man darüber nachdenkt, zwischen ihnen zu wählen

Du wählst nicht zwischen ihnen. Die Frage ist, welche Hälfte der Schleife du auf offenen Gewichten aufbauen kannst, und die Lizenz beantwortet sie.

Wenn Ihre Anforderung ein eigenständiger arabischsprachiger Voice-Agent ist, bei dem Audio Ihre Infrastruktur nie verlässt, steht Ihnen der zuhörende Teil bedingungslos zur Verfügung: Apache 2.0, herunterladbar, feinjustierbar, mit einer Dialektliste, gegen die Sie testen können, und einer veröffentlichten Fehlerrate für Arabisch. Der sprechende Teil ist der Punkt, an dem die Einschränkung greift, und Sie haben zwei ehrliche Optionen – die Sprachsynthese im Rahmen einer kommerziellen Vereinbarung auf einen gehosteten Dienst zu verlagern oder Voxtral 4B TTS aus der Architektur zu entfernen und ein Synthesemodell für Arabisch mit permissiver Lizenz zu finden.

Wenn Ihre Anforderung ein Produktions-Transkriptionsdienst ist und Arabisch die Sprache ist, fällt die Entscheidung zwischen einem herunterladbaren 4,4-Mrd.-Parameter-Checkpoint mit veröffentlichter Dialekt-Taxonomie und einer aggregierten Fehlerrate sowie einer gehosteten Streaming-API mit veröffentlichtem Preis, veröffentlichter Latenz und einem Drittanbieter-Board. Das offene Modell gewinnt bei Kontrolle, Datenresidenz und Fine-Tuning; die gehosteten Optionen gewinnen bei Evidenz, Support und operativer Einfachheit. Zwei Tage nach Erscheinen der Gewichte hat niemand außerhalb von Mistral sie gemessen, und das ist ein Grund, einen eigenen Benchmark durchzuführen, statt ein Grund, den Checkpoint zu verwerfen.

Was dieses Bild am stärksten verändern würde, ist eine Veröffentlichung arabischer Synthese zu Bedingungen, die kommerzielle Nutzung erlauben – dasselbe Muster, dem die Hörseite bereits folgt. Solange es die nicht gibt, bleibt die Schleife halb offen, und die praktische Arbeit besteht darin, zu entscheiden, welche Hälfte du zu mieten bereit bist.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Voxtral 4B TTS across six shared rows: task speech to text against text to speech with 24 kHz audio output; Arabic claim 16 named dialects at 8.82% character error rate against 1 of 9 languages with no quality figure; licence Apache 2.0 permitting commercial use against CC BY-NC 4.0 non-commercial weights; service price none published against $0.016 per 1,000 characters; published throughput none against 119 to 1,431 characters per second per GPU; and hardware roughly 4.4B in BF16 on a single accelerator against roughly 4B in BF16 on a single accelerator. A footer reads that all figures are Mistral's own and unreproduced, and that the two models are complementary rather than competing. The OrcaRouter logo sits in a white strip at the bottom right.

Keines dieser Mistral-Sprachmodelle hosten wir, und dieser Artikel behauptet auch nichts anderes; was die Voice-Loop darüber hinaus braucht, ist die Sprachschicht, und die ist routbar – ein API-Schlüssel über mehr als 200 Modelle zum Listenpreis des Anbieters mit 0 % Aufschlag, sodass eine Preisänderung eines Anbieters am selben Tag, an dem sie angekündigt wird, bei uns ankommt.

Automatischer Failover hält den mittleren Teil eines aus drei Komponenten bestehenden Voice-Agents – ein vorgelagertes Reasoning-Modell zwischen zwei selbst gehosteten Mistral-Modellen – davon ab, der Teil zu sein, der das Produkt lahmlegt.