
Voxtral Mini 4B Realtime Arabic vs. Gemini 3.5 Transcribe Live: Dialekte vs. Breite
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Zwei Streaming-Speech-to-Text-Modelle, zwei völlig unterschiedliche Wetten darauf, worin der schwierige Teil der Transkription besteht. Voxtral Mini 4B Realtime Arabic ist ein Fine-Tune mit 4,4 Milliarden Parametern, das Mistral AI am 8. Oktober 2026 ohne Launch-Post, Blogeintrag oder eine Zeile im News-Index des Unternehmens in ein öffentliches Repository geschoben hat – speziell trainiert auf Modern Standard Arabic und fünfzehn namentlich genannte Dialekte, veröffentlicht unter Apache 2.0 mit herunterladbaren BF16-Gewichten. Gemini 3.5 Transcribe Live ist Googles Streaming-Endpunkt von Gemini 3.5 Transcribe, im August 2026 mit dem vollen Apparat eines Plattform-Releases angekündigt, deckt über 85 Locales ab und ist geschlossen – eine Preview-API ohne Gewichte und mit einer Obergrenze von zehn Minuten pro Sitzung. Das eine Modell ging tief in eine einzelne Sprachfamilie und sagte das in seinem eigenen Abschnitt zu Einschränkungen; das andere ging in die Breite und ließ die Garantien auf Akzentebene unerwähnt. Welches Modell man möchte, hängt von einer Achse ab, die das Marketing keines Anbieters an die erste Stelle setzt: wie das eigene Audio tatsächlich klingt.
Dies ist kein symmetrischer Vergleich, und es ist angebracht, das gleich zu Beginn zu sagen, statt es zu verschweigen. Das Mistral-Modell ist zum Zeitpunkt des Schreibens 48 Stunden alt, es gibt keine Anbieterankündigung, keine unabhängige Bewertung und keinen veröffentlichten Preis. Das Google-Modell befindet sich seit Ende August in der öffentlichen Vorschau und wird auf einem Drittanbieter-Tracker gemessen. Betrachtet man die Mistral-Seite als eine Reihe von Behauptungen aus einer Modellkarte und die Google-Seite als eine Reihe von Messungen plus eine Reihe von Behauptungen, bleibt der Vergleich ehrlich.
Was jedes Modell ist, bevor es an die Zahlen geht
• Voxtral Mini 4B Realtime Arabic — ein aus Voxtral-Mini-4B-Realtime-2602 feinabgestimmtes Streaming-ASR-Modell mit etwa 4,4 Mrd. Parametern in BF16, das 16-kHz-Audio durch einen kausalen Audio-Encoder und einen Sprachdecoder führt. Es gibt Text aus, während Audio eintrifft, mit einer konfigurierbaren Transkriptionsverzögerung, und es ist Apache 2.0 mit Gewichten auf Hugging Face. Mistral hat es gemeinsam mit dem marokkanischen Ministerium für den digitalen Wandel und die Verwaltungsreform im Rahmen einer im Januar 2026 unterzeichneten Partnerschaft entwickelt und beschreibt das Modell als souveränes KI-Asset.
• Gemini 3.5 Transcribe Live — die Streaming-Hälfte einer Veröffentlichung mit zwei Modellen. Der Live-API-Endpunkt überträgt kontinuierliches Mikrofon-Audio über einen WebSocket, liefert Teiltranskripte zurück, während die sprechende Person noch spricht, und liefert kurz nach dem Ende jeder Äußerung ein endgültiges Transkript. Das Batch-Schwestermodell gemini-3.5-transcribe verarbeitet vorab aufgezeichnete Dateien von bis zu einer Stunde. Beide befinden sich in der öffentlichen Vorschau, beide sind ausschließlich über die API verfügbar, und für keines wurden Gewichte veröffentlicht.
Der erste strukturelle Unterschied ist nicht die Genauigkeit. Er besteht darin, dass eines davon eine Datei ist, die man heute Abend herunterladen kann, und das andere ein Dienst, für den man erst zugelassen werden muss, bevor man ihn nutzen kann.

Sprachabdeckung: 16 gegenüber 85-plus, und die Lücke ist nicht der eigentliche Punkt
Das Zählen der Sprachen lässt das Mistral-Modell schmal und das Google-Modell riesig erscheinen. Die Zahlen messen unterschiedliche Dinge, und sie ohne diesen Vorbehalt nebeneinanderzustellen, ist der häufigste Fehler, zu dem dieser Vergleich verleitet.
• Voxtral Mini 4B Realtime Arabic — 16 arabische Varietäten, auf der Modellkarte einzeln nach Dialektfamilie benannt: Modernes Hocharabisch sowie Marokkanisches, Libysches, Tunesisches, Algerisches und Hassaniya-Arabisch aus dem Maghreb; Golf-, Najdi-, Omanisches und Sanaani-Arabisch aus dem Golfraum; Ägyptisches und Sudanesisch-Arabisch aus dem Niltal; Mesopotamisches sowie sowohl süd- als auch nordlevantinisches Arabisch; und Tschadisch-Arabisch. Die Modellkarte selbst beschreibt es so, dass das Modell auf arabische Transkription abzielt und dass Code-Switching — Sprecher, die mitten im Gespräch die Sprache wechseln — die Fähigkeit ist, die es korrekt beherrschen sollte, und nicht bloß ein Nebeneffekt.
• Gemini 3.5 Transcribe Live — automatische Erkennung der Sprache über mehr als 85 Locales hinweg, mit satzinternem und satzübergreifendem Code-Switching. In der Dokumentation von Google wird Arabisch in dieser Gruppe aufgeführt; die Locale-Tabelle nennt Arabic (Egypt) als den arabischen Eintrag, und die breitere Abdeckung arabischer Locales wird in der Dokumentation des Modells selbst nicht einzeln aufgeschlüsselt.
Wenn man das ehrlich liest, zeigt sich die Gestalt des Kompromisses. Googles 85-plus ist ein Breitenanspruch: Wenn Ihr Audio in einer anderen Sprache als Arabisch vorliegt, deckt der Google-Endpunkt sie ab, und das Mistral-Modell wird sie ablehnen — die Karte sagt unmissverständlich, dass Sie für andere Sprachen das ursprüngliche Voxtral Mini 4B Realtime verwenden sollten, nicht diesen Checkpoint. Mistrals 16 ist ein Tiefenanspruch. Es erhebt nicht den Anspruch, Arabisch zu transkribieren; es erhebt den Anspruch, marokkanisches Darija, Golf-Arabisch, Ägyptisch-Arabisch und Tschadisch-Arabisch als eigenständige Ziele zu transkribieren, was ein wesentlich schwierigeres Problem ist als Modernes Hocharabisch zu transkribieren und zu hoffen, dass der Dialekt sich dabei von selbst ergibt. Ein englischgewichteter, auf Breite ausgerichteter Benchmark wird Ihnen diesen Unterschied niemals zeigen, weil die Dialekt-Sets nicht darin enthalten sind.
Für ein marokkanisches Callcenter oder eine Kundensupport-Hotline in der Golfregion kann ein Modell, das 16 Dialekte und sonst nichts abdeckt, ein Modell schlagen, das 85 Locales mit einer nicht angegebenen Genauigkeit pro Dialekt abdeckt. Für ein europäisches Unternehmen, das Meetings in fünf Sprachen transkribiert, kehrt sich die Gleichung sofort um. Keiner der Anbieter liegt falsch; sie haben sich für unterschiedliche Kunden entschieden.

Die Zahlen, die man vergleichen kann, und die, die man nicht vergleichen kann
Hier schlägt die Asymmetrie zu. Die beiden Modelle geben unterschiedliche Einheiten an, auf unterschiedlichen Korpora, gestützt auf unterschiedliche Evidenz, und kein Dritter hat sie gegeneinander getestet.
• Voxtral Mini 4B Realtime Arabic — 8,82 % durchschnittliche Zeichenfehlerrate über sieben arabische Benchmarks, bei einer konfigurierten Transkriptionsverzögerung von 480 Millisekunden. Laut Mistrals eigener Modellkarte und nicht unabhängig reproduziert.
• Das Modell, das es zu erreichen versucht — Voxtral Transcribe Arabic mit 7,91 % CER bei denselben sieben Benchmarks nach derselben Messmethode, sodass das Echtzeitmodell 0,91 Prozentpunkte hinter einem Offline-Arabischmodell desselben Anbieters landet. Diese Lücke ist Mistrals eigener Vergleich, was sie ungewöhnlich aussagekräftig macht: Der Anbieter verrät Ihnen damit, was Streaming bei dieser Sprachfamilie an Genauigkeit kostet.
• Gemini 3.5 Transcribe Live — 4,0 % Wortfehlerrate im Streaming, gemessen von Artificial Analysis und zitiert von Google, wobei das endgültige Transkript 0,40 Sekunden nach dem Ende des Sprechens eintrifft. Ebenfalls gemessen: 2,6 % auf dem Non-Streaming-Board desselben Trackers und 5,50 % im Streaming auf FLEURS laut Googles eigenen Angaben.
Setze 8,82 % CER nicht neben 4,0 % WER und ziehe daraus irgendwelche Schlüsse. Die Zeichenfehlerrate und die Wortfehlerrate haben unterschiedliche Nenner – die arabische Orthografie lässt die Lücke zwischen ihnen größer werden, als es bei Sprachen mit lateinischer Schrift der Fall ist – und die Korpora sind nicht dieselben, die Normalisierung ist nicht dieselbe, und die eine Zahl kommt mit einem reproduzierbaren Skript, während die andere aus einer festen Mischung eines Trackers stammt, die zugunsten englischen Agenten-Talks gewichtet ist.
Der nützlichere Vergleich ist der in Mistrals eigener Model Card: 8,82 % Streaming gegenüber 7,91 % Offline, bei identischen Benchmarks mit identischer Normalisierung. Das ist eine saubere Messung dessen, was geringe Latenz speziell bei Arabisch bringt und kostet, und sie ist mehr wert als jede herstellerübergreifende Prozentangabe. Was bisher niemand veröffentlicht hat, ist ein direkt vergleichbarer arabischer Durchlauf der Google- und Mistral-Modelle mit demselben Audio. Bis jemand das tut, ist „welches auf Arabisch genauer ist“ eine offene Frage, und die einzig vertretbare Antwort lautet: Probieren Sie beide mit Ihren Aufnahmen aus.
Ein Detail in Mistrals Modellkarte verdient eine Erwähnung, weil es gegen die eigenen Interessen des Anbieters spricht. Darin wird angemerkt, dass die Sicherheitsfilter von Gemini die Transkription einiger FLEURS-Audiosamples blockieren. Das ist eine reale, überprüfbare Beobachtung zur Pipeline eines Wettbewerbers, und es ist zugleich genau die Art von Sache, die nie auf einem Leaderboard auftaucht – ein Modell, das die Transkription eines Samples verweigert, wird als Fehler oder als fehlend gewertet, und keine der beiden Lesarten ist fair. Wenn Ihr Audio Material enthält, das ein Inhaltsfilter erfassen könnte, ist das ein Deployment-Risiko, das keine WER-Zahl zutage fördern wird.
Latenz: ein Regler gegen eine feste Zahl
Streaming-Modelle werden üblicherweise anhand eines einzelnen Latenzwerts verglichen. Diese beiden haben keinen gemeinsamen.
• Voxtral Mini 4B Realtime Arabic — konfigurierbare Transkriptionsverzögerung. Der CER-Wert von 8,82 % wird bei 480 Millisekunden angegeben, und die Verzögerung ist anpassbar, was bedeutet, dass die Genauigkeitszahl ein Punkt auf einer Kurve ist, die der Bediener wählt, und keine Eigenschaft des Modells. Sein Basismodell wirbt mit einem Bereich von 240 Millisekunden bis zu 2,4 Sekunden.
• Gemini 3.5 Transcribe Live — 0,40 Sekunden vom Ende des Sprechens bis zu einem finalen Transkript, gemessen von Artificial Analysis, wobei Zwischenergebnisse kontinuierlich während des Sprechens eintreffen. Google behauptet separat eine Verbesserung um 70 % bei der Zeit bis zur finalen Transkription gegenüber Chirp 3, was eine Herstellerangabe und nicht reproduziert ist.
Beide liegen im selben Bereich – ungefähr eine halbe Sekunde –, doch die technische Bedeutung unterscheidet sich. Das Mistral-Modell überlässt Ihnen den Kompromiss zwischen Latenz und Genauigkeit als Parameter, sodass Sie mit 240 ms arbeiten können, wenn Untertitel unter einer Sekunde wichtiger sind als die letzten paar Genauigkeitspunkte, und die Verzögerung erhöhen können, wenn dies nicht der Fall ist. Der Google-Endpunkt bietet einen festen Betriebspunkt mit daran angehängtem eigenem Content-Filter-Verhalten von Google. Für einen Voice-Agenten ist ein Regler mehr wert als eine etwas bessere feste Zahl, denn die richtige Einstellung hängt von Ihrem Audio und Ihren Nutzern ab, und kein Anbieter kann sie für Sie auswählen.
Die eigentliche Kluft: offene Gewichte gegen einen Vorschau-Endpunkt
Der Unterschied bei Lizenzierung und Vertrieb ist größer als jede Benchmark-Lücke in diesem Vergleich, und er entscheidet die meisten realen Einsätze, noch bevor über Genauigkeit gesprochen wird.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0, BF16-Gewichte auf Hugging Face, mit vLLM über einen WebSocket unter /v1/realtime bereitstellbar und ab Version 5.2.0 nativ in Transformers unterstützt. Die Modellkarte enthält ein Python-Beispiel und ein Normalisierungsmodul, sodass Sie die Berechnung des arabischen CER selbst reproduzieren können. Nichts an der Pipeline erfordert Mistrals Server, und das Modell ist klein genug, dass die operative Frage lautet, welche GPU, nicht, ob Sie sich eine leisten können.
• Gemini 3.5 Transcribe Live — nur API, öffentliche Vorschau, keine veröffentlichte Preisbindung jenseits der Listenpreise und eine Sitzungsobergrenze von zehn Minuten, was bedeutet, dass alles Längere von Ihrem eigenen Code in Abschnitte aufgeteilt, neu verbunden und zusammengesetzt werden muss. Drei zusammen mit dem Start gemeldete Einschränkungen sind speziell für arabische Bereitstellungen relevant: Der Streaming-Endpunkt liefert keine Sprecherdiarisierung und keine Zeitstempel auf Wortebene; beides gibt es beim Batch-Endpunkt, bei diesem jedoch nicht. Wenn Ihr arabisches Transkript wissen muss, wer was gesagt hat, oder mit dem Audio zeitlich ausgerichtet werden muss, kann der Live-Endpunkt dies unabhängig von der Sprache nicht liefern.
Diese beiden Einschränkungen sind das stärkste Argument für das kleine offene Modell in einem realen arabischen Deployment, und sie haben nichts mit Genauigkeit zu tun. Eine Callcenter-Pipeline will Sprecherzuordnung, eine Compliance-Pipeline will Zeitstempel, und ein Offline-Arabischmodell mit einem Normalisierungsskript, das Sie kontrollieren, liefert beides, ohne sich mit einem Endpoint-Vertrag herumzuschlagen. Mistrals Modellkarte führt das außerdem als Einschränkung statt als Feature auf – es zielt auf Transkription ab, es ist ein Fine-Tuning eines allgemeinen Echtzeitmodells, und sie ist ehrlich, dass es upstream ein breiteres Modell gibt, falls Sie eines brauchen.
Was jedes einzelne kostet und was unbekannt ist
• Gemini 3.5 Transcribe Live — ungefähr 0,009 $ pro Minute für gemischtes Audio, abgeleitet aus Listenpreisen von 3,50 $ pro Million Eingabe-Tokens und 21 $ pro Million Ausgabe-Tokens, wobei Audio mit 25 Tokens pro Sekunde und das Transkript mit etwa 175 Tokens pro Minute veranschlagt werden. Der Batch-Endpunkt kostet etwa 0,005 $ pro Minute. Beide Werte sind Schätzungen auf Basis der von Google angenommenen Tokenisierung, sie verschieben sich also, wenn sich die Abrechnung ändert. Derzeit gibt es eine kostenlose Stufe.
• Voxtral Mini 4B Realtime Arabic — kein veröffentlichter Preis, weil es keinen veröffentlichten Dienst gibt. Die Kosten entsprechen dem, was Ihre Hardware kostet. Ein BF16-Modell mit 4,4 Milliarden Parametern passt auf einen einzelnen modernen Beschleuniger, sodass die Grenzkosten pro Audio-Stunde Strom und Auslastung sind und die Fixkosten die Maschine. Das ist bei hohem Volumen günstiger als jede API mit Minutenpreis und bei null Volumen teurer als jede API mit Minutenpreis, was die gewöhnliche Form des Open-Weights-Handels ist.
Die wichtigste Unbekannte auf Seiten von Mistral ist nicht der Preis. Sie ist die Frage, ob dieses Repository der Beginn einer Produktlinie ist oder ein einmaliges Ergebnis im Rahmen der Marokko-Partnerschaft. Ein Modell, das still und ohne Ankündigung, ohne Preisgestaltung und ohne Service ausgeliefert wird, ist ein Modell, hinter dem keine Support-Verpflichtung steht. Apache 2.0 bedeutet, dass die Lizenz für die Gewichte, die Sie bereits haben, nicht zurückgezogen werden kann, aber es sagt nichts darüber aus, ob der Checkpoint gepflegt wird, und der Basis-Modell-Verweis der Modellkarte selbst legt nahe, dass das allgemeine Echtzeitmodell weiterhin die unterstützte Linie ist.
Für die Ebene über dem Transkript zahlt sich eine Routing-Schicht auf eine Weise aus, die nichts mit Transkription zu tun hat. Keines dieser Modelle ist ein von uns gehosteter Speech-to-Text-Dienst – OrcaRouter routet keinen der beiden Endpunkte –, aber der Summariser, der Intent-Klassifikator oder der Agent, der den Stream konsumiert, ist ein Modell, das Sie routen können: ein API-Schlüssel über mehr als 200 Modelle zum Listenpreis des Anbieters mit 0 % Aufschlag, sodass eine Preissenkung eines Anbieters noch am selben Tag bei uns ankommt, plus automatisches Failover, falls ein Anbieter beeinträchtigt ist. Wenn Sie bereits zwei Speech-Anbieter für die Dialektabdeckung zusammenstückeln, ist es der günstige Teil der Integration, die nachgelagerten Sprachmodelle hinter einen Schlüssel statt hinter zwei Verträge zu stellen.
Auf welches aufbauen?
Wenn es sich bei Ihrem Audio um Arabisch handelt – ein Dialekt, mehrere oder Code-Switching zwischen Arabisch und etwas anderem –, ist das Mistral-Modell der ernsthaftere Kandidat, und der Grund dafür ist struktureller, nicht numerischer Natur. Es benennt die Dialekte, für die es entwickelt wurde, es ist klein genug, um auf Ihrer eigenen Hardware zu laufen, es liefert Rohtext, den Sie mit Ihrer eigenen Normalisierung nachbearbeiten können, und es steht nicht hinter einem Sitzungslimit von zehn Minuten oder einem Inhaltsfilter, den Sie nicht einsehen können. Der Preis dafür ist, dass es nur eine Sprachfamilie abdeckt und den Rest verweigert, und dass noch niemand eine unabhängige Bewertung davon veröffentlicht hat.
Wenn Ihr Audio mehrere Sprachen umfasst oder wenn Sie heute einen Dienst mit einem Support-Weg und einer veröffentlichten Preisliste benötigen: Gemini 3.5 Transcribe Live ist jetzt aufrufbar, gemessen auf einem Drittanbieter-Tracker, und deckt die Sprachen ab, die der Mistral-Checkpoint ablehnen wird. Die Kosten sind die Sitzungsobergrenze, die fehlende Diarisierung und fehlende Zeitstempel am Streaming-Endpunkt und die Tatsache, dass die arabischspezifische Genauigkeit eine Behauptung ist, die Sie selbst testen müssen — die Locale-Liste nennt Ägypten, und die Dialektleistung wird nicht aufgeschlüsselt.
Worauf man achten muss, ist kein Benchmark. Es ist die Frage, ob Mistral dieses Modell überhaupt ankündigt und, falls ja, mit welchem Preis und welcher Sprach-Roadmap. Ein stilles Repository mit einer Apache-2.0-Lizenz ist ein nützliches Artefakt und eine schwache Verpflichtung. Wenn eine Roadmap für arabische Dialekte folgt — Levantinisch, Golf, Ägyptisch als separate Checkpoints —, wird der Weg über kleine Modelle zu einer wirklich vollständigen Antwort für die Region, und das Breitenargument wird viel schwerer zu vertreten.

Keines davon ist ein Speech-Modell, das wir hosten, doch die Ebene über dem Transkript lässt sich routen – mehr als 200 Modelle hinter einem einzigen API-Schlüssel zum Listenpreis der Anbieter bei 0 % Aufschlag, sodass eine Preissenkung eines Anbieters für das Reasoning-Modell, das Ihrem Transkript nachgelagert ist, noch am selben Tag live ist.
Automatisches Failoverbedeutet, dass eine zusammengesetzte Sprach-Pipeline eine Ausfalldomäne weniger hat, weil der Summarizer oder Intent-Klassifikator, der das Transkript verarbeitet, umgeleitet werden kann, anstatt mit einem Anbieter auszufallen.
