Generierte Hero-Titelkarte für einen Vergleich von Voxtral Mini 4B Realtime Arabic und Grok Voice Transcribe 2.0, mit dem Untertitel „ein Spitzenreiter des Label-Leaderboards trifft auf einen arabischen 16-Dialekt-Spezialisten“, mit dem Badge „Mistral-Repository, 8. Oktober 2026“, mit drei Stat-Chips, die 8,82 % arabische Zeichenfehlerrate bei 480 ms gegenüber 2,7 % Wortfehlerrate bei 0,49 s, 16 benannte Dialekte gegenüber 38+ undokumentierten Sprachen sowie Apache-2.0-Gewichte gegenüber 0,20 $ pro Audio-Stunde anzeigen, und dem OrcaRouter-Logo, das in einem weißen Streifen unten rechts eingefügt ist.
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs. Grok Voice Transcribe 2.0: Ein Leaderboard-Spitzenreiter trifft auf einen Dialekt-Spezialisten

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Der ehrliche Ausgangspunkt für diesen Vergleich ist, dass Voxtral Mini 4B Realtime Arabic und Grok Voice Transcribe 2.0 nicht um dieselbe Aufgabe konkurrieren, und der schnellste Weg, das zu erkennen, ist ein Blick darauf, was jeder Anbieter bereit war zu veröffentlichen. Mistral AI stellte Voxtral Mini 4B Realtime Arabic am 8. Oktober 2026 ohne Ankündigung auf Hugging Face — Apache-2.0-Gewichte, eine Modellkarte, die sechzehn arabische Varietäten benennt, und eine einzige Genauigkeitsangabe von 8,82 % durchschnittlicher Character Error Rate über sieben arabische Benchmarks bei einer Verzögerung von 480 Millisekunden. xAIs Grok Voice Transcribe 2.0 erschien am 18. September 2026 mit einem Launch-Beitrag, einem Preis und einem Ergebnis eines Drittanbieter-Leaderboards: 2,7 % Wortfehlerrate bei finalen Transkripten, wobei der Text 0,49 Sekunden nachdem der Sprecher aufhört feststeht, und auf Platz eins von Artificial Analysis' Streaming-Speech-to-Text-Board, als es erschien. Das eine Modell sagt Ihnen genau, welche Dialekte es abdeckt, und weigert sich, außerhalb dieser zu raten. Das andere sagt Ihnen, dass es mehr als 38 Sprachen abdeckt, und listet keine einzige davon einzeln auf.

Diese Asymmetrie ist der ganze Vergleich. Wenn Sie Transkriptionskapazität in großem Umfang für gemischtsprachiges Audio einkaufen, ist das xAI-Modell mit großem Abstand das vollständigere Produkt. Wenn es bei Ihrem Audio um Arabisch geht – und insbesondere um dialektales Arabisch, nicht um hocharabische Nachrichtensprache –, dann zielt der Mistral-Checkpoint auf ein Problem, das die Rangliste, an deren Spitze das xAI-Modell steht, nicht misst, und die Tatsache, dass er in dieser Rangliste Zweiter und nicht Erster ist, wäre ein Fehler, als Urteil zu lesen.

Die Preisarithmetik, weil sie hier ungewöhnlich sauber ist

xAI veröffentlicht einen Preis. Mistral veröffentlicht einen Download. Dieser Unterschied bestimmt alles Nachgelagerte, also fang mit der Zahl an, die es gibt.

• Grok Voice Transcribe 2.0 — 0,10 $ pro Audio-Stunde über REST für aufgezeichnete Dateien, 0,20 $ pro Audio-Stunde über den Streaming-WebSocket. Das entspricht ungefähr 1,67 $ pro tausend Minuten für Batch und 3,33 $ pro tausend Minuten für Streaming, unverändert gegenüber Grok Voice Transcribe 1.0 bei denselben Preispunkten.

• Voxtral Mini 4B Realtime Arabic — kein veröffentlichter Preis, weil es keinen veröffentlichten Dienst gibt. Die Gewichte stehen unter Apache 2.0 und umfassen in BF16 ungefähr 4,4 Milliarden Parameter, was bedeutet, dass die Kosten aus der GPU bestehen, die Sie daran anschließen, und aus der Auslastung, die Sie daraus herausholen. Bei anhaltendem Volumen ist das günstig; bei null Volumen ist es die teuerste Option in diesem Artikel, weil Sie für ungenutzte Hardware bezahlen.

Der Break-even-Punkt ist alles andere als subtil. Eine Streaming-Rate von 0,20 $ pro Stunde entspricht etwa einem Drittel Cent pro Minute. Jeder Beschleuniger, auf dem Sie ein 4,4B-Modell betreiben würden, kostet mehr als das pro Stunde, es sei denn, Sie leiten dauerhaft Traffic durch ihn, was bedeutet, dass die Open-Weights-Route bei den Kosten erst gewinnt, nachdem Sie genug arabisches Volumen haben, um eine Maschine auszulasten — und auf jeder anderen Achse verliert, während Sie dorthin gelangen, weil die API keine Investitionsausgaben, keine Kapazitätsplanung und keinen Betriebsaufwand hat.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Die eine Stelle, an der die Rechnung früh kippt, ist die Compliance. Der Mistral-Checkpoint verarbeitet Audio auf Hardware, die Sie kontrollieren, sodass nichts Ihr Netzwerk verlässt, und die Karte wird mit einem Normalisierungsmodul ausgeliefert, sodass die arabische Scoring-Pipeline von Ihnen geprüft werden kann. Grok Voice Transcribe 2.0 läuft in den Regionen von xAI und verarbeitet laut seiner Dokumentation Audio in Echtzeit, ohne es zu speichern oder für das Training zu nutzen, gestützt auf SOC 2 Type II und HIPAA-Eignung. Beide Darstellungen sind vertretbar; nur eine davon erlaubt es einer Aufsichtsbehörde, den Codepfad zu inspizieren.

Was 0,20 $ pro Stunde tatsächlich kaufen – und das Mistral-Modell wird nicht ausgeliefert

Die Funktionslücke ist hier größer als die Genauigkeitslücke und wird weit weniger diskutiert. Grok Voice Transcribe 2.0 ist ein Produkt mit einer Schnittstelle; Voxtral Mini 4B Realtime Arabic ist ein Checkpoint, der Text ausgibt.

• Sprecherdiarisierung — in Grok Voice Transcribe 2.0 enthalten, plus Mehrkanaltranskription von bis zu acht unabhängigen Kanälen. Die Mistral-Karte führt keine Diarisierungsfähigkeit auf; das Modell erzeugt ein Transkript, kein zugeordnetes.

• Zeitstempel auf Wortebene — Grok liefert sie mit angehängten Konfidenzwerten, sodass Sie Spans mit geringer Konfidenz anhand eines Schwellenwerts filtern können, anstatt einem gesamten Transkript gleichermaßen zu vertrauen. Mistrals Karte gibt keine Zeitstempel für diesen Checkpoint an.

• Key-Term-Biasing — bis zu 100 Domänenbegriffe pro Anfrage am Grok-Endpunkt; damit bringt man ein Modell dazu, Produktnamen, Kontocodes und Ortsnamen ohne Fine-Tuning korrekt zu erfassen. Der Mistral-Weg zum selben Ergebnis ist das Fine-Tuning mit eigenen Daten, was Apache 2.0 erlaubt und der gehostete Endpunkt nicht.

• Inverse Textnormalisierung — Grok formatiert Zahlen, Datumsangaben, Währungen, Telefonnummern und E-Mail-Adressen in 25 Sprachen in Schriftform. Die Mistral-Karte enthält ein Normalisierungsskript, dessen angegebener Zweck jedoch darin besteht, arabische Benchmarks zu bewerten, nicht die Ausgabe für die Anzeige zu formatieren.

• Schnittstellenoberfläche — REST für Dateien bis zu 500 MB, WebSocket-Streaming unter wss://api.x.ai/v1/stt mit Zwischenergebnissen etwa alle 500 ms, dokumentierte 10 Anfragen pro Sekunde und 100 gleichzeitige Streaming-Sitzungen sowie vorerst eine einzige Region. Auf der Mistral-Seite: vLLM-Serving mit einem WebSocket unter /v1/realtime oder native Transformers ab Version 5.2.0, ohne Rate Limit außer Ihrer Hardware.

Wenn Sie Diarisierung und Zeitstempel benötigen, ist der Vergleich vorbei, bevor es überhaupt um Genauigkeit geht. Das ist kein Seitenhieb gegen das Mistral-Modell – ein auf Arabisch spezialisiertes 4B-Modell, das darauf trainiert ist, akkuraten dialektalen Text zu erzeugen, verfolgt ein anderes Engineering-Ziel als ein allgemeiner Transkriptionsdienst –, aber es bedeutet, dass die beiden nur dann austauschbar werden, wenn Ihre Pipeline das Transkript als Rohmaterial für Ihre eigene Nachbearbeitung behandelt.

Das Sprachlistenproblem

Beide Anbieter beschreiben die Sprachunterstützung auf eine Weise, die dieselbe Frage unbeantwortet lässt – nur aus entgegengesetzten Richtungen.

• Grok Voice Transcribe 2.0 — über 38 Sprachen, automatische Sprachenerkennung mit Sprachumschaltung während der Aufnahme in einem einzigen Durchgang, über 12 Audioformate von 8 kHz bis 48 kHz hinweg. Die Dokumentation nennt die Anzahl, aber nicht die Liste. Arabisch wird an keiner Stelle im Material einzeln genannt, was bedeutet, dass die Unterstützung von Arabisch durch die Anzahl impliziert und nicht vom Anbieter bestätigt wird.

• Voxtral Mini 4B Realtime Arabic — sechzehn arabische Varietäten ausdrücklich benannt: Modernes Standardarabisch; Marokkanisch, Libysch, Tunesisch, Algerisch und Hassania aus dem Maghreb; Golfarabisch, Nadschdi, Omanisch und Sanaani aus dem Golfraum; Ägyptisch und Sudanesisch aus dem Niltal; Mesopotamisch sowie sowohl Süd- als auch Nordlevantinisch; und Tschadisches Arabisch. Alles außerhalb dieser Gruppe liegt außerhalb des Geltungsbereichs, und auf der Karte steht, stattdessen das allgemeine Echtzeitmodell zu verwenden.

Die Frage „welches davon mit Arabisch besser umgeht“ hat eine seltsame Struktur. Das Mistral-Modell ist ein dokumentierter Arabisch-Spezialist mit einer veröffentlichten arabischen Fehlerquote und ohne unabhängige Überprüfung. Das xAI-Modell ist ein dokumentierter Spitzenreiter in Bestenlisten, dessen Anbieter gar nicht bestätigt hat, dass Arabisch überhaupt zum Leistungsumfang gehört. Eine Zählung von 38 Sprachen, die Arabisch einschließt, und eine Liste von sechzehn Dialekten, die nur Arabisch umfasst, beantworten beide die Frage „beherrscht es Arabisch“ – aber nur eine von ihnen beantwortet die Frage „beherrscht es Darija“.

Screenshot of the xAI documentation page for the grok-voice-transcribe-2.0 model, captured 10 October 2026, showing the Speech to Text entry in the Voice documentation navigation, the model page slug grok-voice-transcribe-2.0, its audio-to-text modality, and the us-east-1 region listing with rate-limit sections.

Das Leaderboard hilft hier nicht weiter. Die Speech-to-Text-Evaluierung von Artificial Analysis ist eine feste Mischung, die auf englischen Agent-Talk ausgerichtet ist – das ist das richtige Design, um allgemeine Transkription zu bewerten, und das falsche, um einen Erfolg bei dialektalem Arabisch sichtbar zu machen. Ein Modell könnte bei Golf-Arabisch und Marokkanischem Arabisch tatsächlich besser sein und auf diesem Board nur als gut erscheinen. Das ist keine Kritik am Board; es ist ein Grund, es nicht als einzige Grundlage für einen regionalen Einsatz zu verwenden.

Genauigkeit, in Einheiten, die nicht konvertieren

• Grok Voice Transcribe 2.0 — 2,7 % Wortfehlerrate des finalen Transkripts bei 0,49 Sekunden bis zur Finalisierung und 3,4 % bei den ersten Teiltranskripten, beide gemessen am AA-WER-v2-Index von Artificial Analysis, der ein privates Agent-Talk-Set mit VoxPopuli und Earnings22 kombiniert. Die Zahl für die ersten Teiltranskripte ist die bemerkenswerte: Sie fiel von 18,3 % in Grok Voice Transcribe 1.0, was der Unterschied zwischen einem Teiltranskript, auf das man routen kann, und einem, das man nur anzeigen kann, ist.

• Voxtral Mini 4B Realtime Arabic — durchschnittliche Zeichenfehlerrate von 8,82 % über sieben arabische Benchmarks bei 480 Millisekunden Verzögerung, auf der eigenen Evaluierung des Anbieters mit einem mitgelieferten Normalisierungsskript. Mistral berichtet, dass dieser Wert nur 0,91 Prozentpunkte von Voxtral Transcribe Arabic bei 7,91 % CER entfernt ist, dem Offline-Arabisch-Modell aus demselben Labor — ein Vergleich, der mehr wert ist als ein anbieterübergreifender, weil die Benchmarks, die Normalisierung und die Messung auf beiden Seiten identisch sind.

2,7 % neben 8,82 % zu stellen ist kein Vergleich; es ist ein Kategorienfehler. Die Wortfehlerrate zählt falsche Wörter gegen eine Referenz, die Zeichenfehlerrate zählt falsche Zeichen, und die arabische Orthografie – in der dasselbe Wort mehrere legitime Schreibweisen zulässt und Klitika frei anhängen – vergrößert die Kluft zwischen den beiden Metriken weit über das hinaus, was Sprachen mit lateinischem Alphabet zeigen. Die Korpora sind unterschiedlich, die Normalisierung ist unterschiedlich, und nur eine der Zahlen stammt von einem Dritten. Was die beiden Zahlen legitim aussagen können, ist, dass das xAI-Modell ein gemessener, gut eingestufter allgemeiner Transkribierer ist und das Mistral-Modell ein beanspruchter, arabischspezifischer. Sie können Ihnen nicht sagen, welches Ihr Audio besser transkribiert.

Der Vergleich, der überzeugt, ist der in Mistrals eigener Modellkarte: 8,82 % Streaming gegenüber 7,91 % Offline, dieselben sieben Benchmarks, dieselbe Normalisierung, dasselbe Labor. Streaming kostet etwa einen Punkt Genauigkeit bei Arabisch im Vergleich zu einem Batch-Modell. Ob das Ihre Entscheidung ist, und es ist Ihre Entscheidung.

Wo das kleine Modell gewinnt – und zwar nicht auf der Anzeigetafel

Drei Dinge am Mistral-Checkpoint sind mehr wert, als die Zahlen vermuten lassen, und keines davon erscheint in irgendeinem Leaderboard.

Das erste ist die Dialekt-Taxonomie selbst. Sechzehn Varietäten als eigenständige Trainingsziele zu benennen, darunter Hassaniya und Tschadisch-Arabisch, ist eine Aussage darüber, wo die Fehler des Modells gemessen wurden. Ein allgemeines mehrsprachiges Modell, das Arabisch als eine von 38 Sprachen enthält, erzielt zuerst beim Modernen Hocharabischen Verbesserungen, weil dort der Großteil des Trainingssignals und des Benchmark-Gewichts liegt. Ein Modell, das für die Marokko-Partnerschaft an der Seite eines nordafrikanischen Ministeriums entwickelt wurde, optimiert auf eine andere Verteilung, und es wurde gemeinsam mit zwei Benchmarks – ISMA und Darija in the Wild – entwickelt, die speziell dafür gebaut wurden, diese zu messen.

Der zweite Punkt ist die konfigurierbare Verzögerung. Die Angabe von 8,82 % bezieht sich auf 480 Millisekunden, und die Verzögerung ist anpassbar statt fest, wodurch die Genauigkeitszahl zu einem Punkt auf einer Kurve wird, den der Bediener auswählt. Bei einer Live-Untertitelungsaufgabe können Sie sie verkürzen und mehr Fehler in Kauf nehmen; bei einer Pipeline zur Anrufaufzeichnung können Sie sie verlängern und die Genauigkeit zurückgewinnen. Grok Voice Transcribe 2.0 bietet einen festen Betriebspunkt, und der Upgrade-Pfad des Anbieters selbst zeigt, warum das Konsequenzen hat – der Wechsel von 1.0 auf 2.0 kostete etwa eine Drittelsekunde sowohl bei der Latenz des ersten Teil- als auch des Endergebnisses, und die Ihnen zur Verfügung stehende Abhilfe besteht darin, das alte Modell festzuhalten, nicht an einem Regler zu drehen.

Die dritte ist, dass die Apache-2.0-Gewährung für die Gewichte, die Sie haben, bedingungslos ist. Was auch immer stromaufwärts mit dem Checkpoint geschieht – ob er angekündigt, bepreist, abgekündigt oder nie wieder erwähnt wird –, das Artefakt bleibt herunterladbar, feinabstimmbar und innerhalb Ihres eigenen Produkts auslieferbar. Die Preiskarte eines gehosteten Endpunkts und sein Zeitplan für die Modellabkündigung liegen beide in der Hand des Anbieters, und xAI hat bereits seine Absicht signalisiert, Grok Voice Transcribe 2.0 zum Standard zu machen und 1.0 abzukündigen, wodurch jede Integration, die nie einen Modellparameter übergeben hat, auf einmal auf das neue Latenzprofil umzieht.

Auf der Routing-Ebene über dem Transkript eine praktische Anmerkung: Keines der beiden Modelle ist ein von uns gehostetes Speech-to-Text-Modell, und dieser Artikel behauptet auch nichts anderes. Was OrcaRouter abdeckt, ist die Sprachmodell-Schicht, die den Stream konsumiert – der Summarizer, der Klassifikator, der Agent – hinter einem einzigen API-Schlüssel über mehr als 200 Modelle hinweg zum Listenpreis des Anbieters mit 0 % Aufschlag, sodass eine Preisänderung eines Anbieters hier noch am selben Tag ankommt. Teams, die zwei Speech-Anbieter für die Sprachabdeckung einsetzen, tragen bereits zwei Verträge und zwei Authentifizierungspfade mit sich; die nachgelagerte Hälfte auf einen einzigen Schlüssel zu reduzieren, ist der einfache Erfolg.

Was soll man damit machen?

Setzen Sie auf Grok Voice Transcribe 2.0, wenn Ihr Audio mehrsprachig ist, wenn Sie Diarisierung, Zeitstempel oder Key-Term-Biasing von Haus aus benötigen oder wenn Sie heute einen Dienst mit veröffentlichtem Tarif und einem Support-Kanal wünschen. Es ist das vollständigere Produkt, es wird von einem Dritten gemessen, und der Streaming-Tarif von 0,20 $ pro Audio-Stunde ist niedrig genug, dass das Kostenargument für Open-Weights erst greift, wenn Sie ernsthaftes Volumen fahren.

Bauen Sie auf Voxtral Mini 4B Realtime Arabic auf, wenn es bei Ihrem Audio um Arabisch und speziell um einen Dialekt geht, wenn Sie das Modell aus Compliance-Gründen in Ihrem eigenen Netzwerk benötigen oder wenn Sie ein Fine-Tuning planen — denn nur einer davon lässt es zu. Akzeptieren Sie zuerst drei Dinge: keine Diarisierung, keine Zeitstempel und keine von irgendjemandem veröffentlichte unabhängige Evaluierung. Zwei Tage, nachdem die Gewichte erschienen sind, ist Letzteres kein Warnsignal; es ist schlicht der Stand der Beweislage.

Was diesen Vergleich am schnellsten verändern würde, ist eine arabischspezifische Evaluation mit echten dialektalen Audioaufnahmen, durchgeführt außerhalb beider Anbieter, wobei auf beide Systeme dieselbe Normalisierung angewendet wird. Solange es die nicht gibt, beruht die Entscheidung auf der eigenen Dialektliste eines Anbieters gegen die eigene, nicht genannte eines Anbieters, und der einzige verlässliche Test sind Ihre Aufnahmen.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Grok Voice Transcribe 2.0 across six shared rows: price none published and self-host only against $0.10 per audio-hour over REST and $0.20 streaming; accuracy 8.82% Arabic character error rate vendor-reported against 2.7% final word error rate per Artificial Analysis; delay configurable with 480ms quoted against 0.49s to final and 0.49s to first partial; languages 16 named Arabic varieties against 38+ with none itemised by the vendor; diarization and timestamps not documented against included with confidence scores; and distribution Apache 2.0 weights on Hugging Face against API only. A footer reads that Mistral figures are vendor-reported and unverified while Grok figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

Keiner der beiden Endpunkte ist einer, den wir anbieten – dies ist ein Vergleich zweier Systeme außerhalb unseres Katalogs –, doch die Modelle, die das Transkript verarbeiten, sind routbar: mehr als 200 Modelle mit einem einzigen API-Schlüssel zum Listenpreis des Anbieters mit 0 % Aufschlag, sodass eine Tarifänderung beim Summarizer oder beim Klassifikator am selben Tag greift, an dem sie angekündigt wird.

Automatisches Failover ist das, was ein Sprach-Setup mit zwei Anbietern davor bewahrt, zwei Single Points of Failure in die Sprachschicht zu tragen, die davon gespeist wird.