
Voxtral Mini 4B Realtime Arabic vs. MAI-Transcribe-2-Streaming: Zwei Oktober-Neuerscheinungen, zwei Evidenzprobleme
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Sieben Tage trennen diese beiden Echtzeit-Sprachmodelle, und sie kamen auf gegensätzliche Weise an. MAI-Transcribe-2-Streaming ist Microsoft AIs erstes Streaming-Transkriptionsmodell, angekündigt am 1. Oktober 2026 mit einem Launch-Post, einem Azure-Preview-Eintrag, einem Preis von 0,54 US-Dollar pro Audio-Stunde als Einführungspreis bis zum Ende des Jahres und dem Anspruch, auf dem Streaming-Board von Artificial Analysis sowohl bei der Genauigkeit finaler als auch partieller Transkripte an erster Stelle zu stehen, mit einer Wortfehlerrate von 2,5 % und einem finalen Text, der 0,13 Sekunden nach Ende der Sprache bereitsteht. Voxtral Mini 4B Realtime Arabic ist Mistral AIs Streaming-Modell für arabische Dialekte, veröffentlicht am 8. Oktober 2026 auf Hugging Face, ohne jegliche Ankündigung – kein Blogbeitrag, kein Preis, kein Service, nur Apache-2.0-Gewichte und eine Modellkarte, die eine durchschnittliche Zeichenfehlerrate von 8,82 % über sieben arabische Benchmarks bei einer Verzögerung von 480 Millisekunden angibt. Das Microsoft-Modell ist ein fertiges Produkt mit einer nicht verifizierbaren Schlagzeile. Das Mistral-Modell ist ein verifizierbares Artefakt ohne Produkt drumherum. Beide sind es wert, verstanden zu werden, gerade weil beide die zentrale Frage – wie gut kommt das mit Arabisch zurecht – nur vom Anbieter beantwortet lassen.
Der Vergleich lohnt sich trotzdem, denn die beiden Modelle ordnen dieselbe Engineering-Entscheidung aus entgegengesetzten Richtungen ein. Microsoft verkauft Breite und einen Managed Service: 60 Sprachen mit automatischer kontinuierlicher Sprachenerkennung, die in Azure AI Speech laufen, stundenweise abgerechnet, in der Vorschau. Mistral verschenkt Tiefe: sechzehn benannte arabische Varietäten, klein genug, um auf einem einzigen Beschleuniger zu laufen, mit einem Normalisierungsskript, damit Sie die Bewertung selbst nachvollziehen können. Wenn Sie in diesem Monat eine arabische Transkriptionspipeline aufsetzen, wählen Sie zwischen diesen beiden Positionen, und die Entscheidung hängt von Belegen ab, die Sie in beiden Fällen noch nicht haben.
Was jeder Anbieter tatsächlich gesagt hat und was die Gremien sagen
Die Beweislücke ist das wichtigste Merkmal dieses Duells, deshalb kommt sie zuerst.
• MAI-Transcribe-2-Streaming — 2,5 % Wortfehlerrate beim finalen Transkript 0,13 Sekunden nach Ende der Sprache und dieselben 2,5 % bei den ersten Teiltranskripten nach 0,12 Sekunden; beides wird als erster Platz bei der Genauigkeit in der AA-WER-Streaming-Methodik von Artificial Analysis präsentiert. Microsofts eigene Darstellung. Zum Zeitpunkt der Abfassung dieses Beitrags hat das Streaming-Board des Trackers noch keine Zeile für das Modell eingezeichnet, sodass die Behauptung auf der Methodik des Trackers steht, ohne dass eine vom Tracker veröffentlichte Zahl dahintersteht.
• Voxtral Mini 4B Realtime Arabic — durchschnittliche Zeichenfehlerrate von 8,82 % über sieben arabische Benchmarks bei einer konfigurierten Verzögerung von 480 Millisekunden. Mistrals eigene Modellkarte, mit dem mitgelieferten Evaluierungscode. Keine Drittpartei hat es reproduziert, und das Modell ist zwei Tage alt.
Die beiden Kernzahlen in diesem Artikel sind also zum einen eine Anbieterangabe, die auf dem Maßstab eines anderen beruht, und zum anderen eine Anbieterangabe, bei der der eigene Maßstab gleich mitgeliefert wird. Keine von beiden ist eine unabhängige Messung. Der Unterschied ist, dass Mistrals Zahl mit dem Normalisierungsskript kommt, das man braucht, um sie nachzurechnen, während Microsofts Zahl mit einem Board kommt, das sie noch nicht ins Chart aufgenommen hat. Wenn Sie eine Beschaffungsentscheidung treffen, ist dieser Unterschied wichtiger als die Spanne von 2,5 gegenüber 8,82, die sowieso bedeutungslos ist — Wortfehlerrate und Zeichenfehlerrate lassen sich nicht ineinander umrechnen, und die arabische Orthographie vergrößert den Abstand zwischen ihnen erheblich.
Der einzige Vergleich in Mistrals Model Card, der tatsächlich überzeugt, ist der gegen das eigene Offline-Geschwistermodell: Voxtral Transcribe Arabic mit 7,91 % CER auf denselben sieben Benchmarks mit derselben Normalisierung, sodass Streaming dieses Modell 0,91 Prozentpunkte kostet. Microsoft veröffentlichte eine entsprechende Zahl für die eigene Modellfamilie, als es das Batch-Modell MAI-Transcribe-2 am 3. September 2026 mit 2,0 % Wortfehlerrate auslieferte — die Streaming-Variante gibt gegenüber dem Batch-Modell einen halben Punkt preis und bietet dafür Echtzeit-Bereitstellung. Liest man diese beiden herstellerinternen Deltas nebeneinander, hat man die einzige Aussage in diesem Artikel, bei der Äpfel mit Äpfeln verglichen werden: In ihren eigenen Benchmarks bleibt die Streaming-SKU jedes Labors hinter ihrem Batch-Geschwistermodell zurück, im einen Fall um etwa einen Punkt und im anderen um einen halben Punkt, und beide messen unterschiedliche Sprachen.

Sprachabdeckung: 60 gegen 16, und dieselbe unbenannte Lücke auf beiden Seiten
• MAI-Transcribe-2-Streaming — 60 Sprachen mit automatischer kontinuierlicher Sprachidentifikation, sodass bei einer Sitzung, die mitten im Stream die Sprache wechselt, die Sprache nicht im Voraus deklariert werden muss. Das Launch-Material von Microsoft nennt die Anzahl, aber nicht die Liste; die Dokumentation zur Sprachunterstützung für die MAI-Transcribe-Familie ist die Stelle, an der die Sprachabdeckung aufgeschlüsselt ist, und darin wird Arabisch unter den unterstützten Sprachen der Familie aufgeführt.
• Voxtral Mini 4B Realtime Arabic — sechzehn arabische Varietäten, einzeln benannt: Modernes Hocharabisch, Marokkanisch, Libysch, Tunesisch, Algerisch und Hassaniya-Arabisch, Golf-, Najdi-, Omani- und Sanaani-Arabisch, Ägyptisch und Sudanesisch-Arabisch, Mesopotamisch sowie sowohl Süd- als auch Nordlevantinisch-Arabisch und Tschadisch-Arabisch. Außerhalb dieser Gruppe ist das Modell als außerhalb des Geltungsbereichs dokumentiert, mit einem Verweis auf das allgemeine Voxtral Mini 4B Realtime.
Keine der beiden Zahlen sagt Ihnen, was Sie brauchen. Microsofts 60 ist eine Breitenangabe, die Arabisch einschließt, ohne die Leistung für Arabisch zu beschreiben; im Launch-Beitrag wird die Gesamtzahl der Sprachen einmal genannt und dann nicht weiter ausgeführt. Mistrals 16 ist eine Aufzählung von Trainingszielen mit einer einzigen aggregierten Fehlerquote über sieben Benchmark-Sets, was bedeutet, dass die Aufschlüsselung nach Dialekten – also genau das, was tatsächlich bestimmt, ob Ihr marokkanisches Anrufaudio transkribiert wird – ebenfalls nicht veröffentlicht ist. Zwei Modelle, zwei Anbieter, und in beiden Fällen lautet die ehrliche Antwort auf die Frage „Wie gut ist es speziell für Golf-Arabisch?“: nicht angegeben.
Was die Aufzählung Ihnen tatsächlich liefert, ist ein Prior. Ein Modell mit Tschad-Arabisch und Hassaniya-Arabisch als benannten Zielsprachen wurde auf eine nordafrikanische Verteilung abgestimmt; Mistral hat es gemeinsam mit dem marokkanischen Ministère de la Transition Numérique et de la Réforme Administrative entwickelt und zwei der sieben Benchmarks mit diesem Ministerium erstellt – ISMA und Darija in the Wild –, eigens, um die schwierigen Fälle zu messen. Ein allgemeines 60-Sprachen-Modell erzielt zuerst beim Modernen Standardarabisch Verbesserungen, weil dort das Gros des Trainingssignals liegt. Wenn es sich bei Ihrem Audio um Darija oder Golf-Arabisch handelt, sind das andere Probleme, und nur einer dieser beiden Anbieter hat eine der beiden beziffert.
Latenz und die Form der Verzögerung
• MAI-Transcribe-2-Streaming — 0,13 Sekunden vom Ende des Sprechens bis zum endgültigen Transkript und erste Teilresultate bei 0,12 Sekunden, was schnell genug ist, dass Teil- und Endergebnis praktisch dieselbe Latenz haben. Microsofts Angabe, gemessen nach der Methodik des Trackers.
• Voxtral Mini 4B Realtime Arabic — 480 Millisekunden konfigurierte Verzögerung am veröffentlichten Genauigkeitspunkt, wobei die Verzögerung anpassbar ist. Das ist ungefähr dreieinhalb Mal der Microsoft-Wert, und es ist der Parameter, den der Bediener wählt, statt eine feste Eigenschaft.
Drei Zehntelsekunden sind ein echter Unterschied für einen Sprachagenten, der mitten in einer Äußerung antworten muss, und nahezu unsichtbar für einen Menschen, der Untertitel liest. Es ist auch der Unterschied zwischen einem Regler und einer Zahl. Mistrals Verzögerungsparameter bedeutet, dass Sie strenger fahren und mehr Fehler akzeptieren oder lockerer fahren und die Genauigkeit zurückgewinnen können – das Basismodell, auf dem dieser Checkpoint feinabgestimmt wurde, gibt einen Bereich von 240 Millisekunden bis zu 2,4 Sekunden an –, während Microsofts Betriebspunkt der ist, den Azure ausliefert. Das macht Microsofts Zahl leichter nachzuvollziehen und Mistrals leichter abzustimmen, und es bedeutet, dass jeder Vergleich der beiden Genauigkeitszahlen in Wirklichkeit ein Vergleich zweier gewählter Punkte auf einer Kurve und eines festen Punkts auf einer anderen ist.
Die Feature-Oberfläche unterscheidet sich ebenso stark, und es lohnt sich, sie gegen Ihre Pipeline-Anforderungen abzugleichen, bevor die Genauigkeitsdiskussion interessant wird.
• MAI-Transcribe-2-Streaming — bereitgestellt über Azure AI Speech mit dem dokumentierten Funktionsumfang der Familie: Diarisierung, Zeitstempel auf Wortebene, Keyword- und Phrasen-Bias, wörtliche versus bereinigte Ausgabestile und automatische Sprachenerkennung. Die eigene Dokumentation der Streaming-SKU zu Diarisierung und Zeitstempeln ist dünner als die des Batch-Modells; bestätigen Sie diese daher pro Endpunkt, statt von Parität auszugehen.

• Voxtral Mini 4B Realtime Arabic — die Model Card dokumentiert Transkription mit einem kausalen Audio-Encoder, vLLM-Serving über einen WebSocket unter /v1/realtime, native Transformers-Unterstützung ab Version 5.2.0 und ein Normalisierungsmodul. Sie dokumentiert weder Diarisierung noch Zeitstempel auf Wortebene für diesen Checkpoint.
Bereitstellungsmodell: ein Vorschaudienst im Gegensatz zu herunterladbaren Gewichten
• MAI-Transcribe-2-Streaming — Azure-Vorschau, was bedeutet: kein SLA und eine Empfehlung des Anbieters, nicht auf den Produktionseinsatz zu setzen. Der Preis liegt bei 0,54 US-Dollar pro Audio-Stunde als Einführungstarif, der bis Ende 2026 gilt; der Standardtarif wurde nicht veröffentlicht; das Batch-MAI-Transcribe-2 startete auf derselben zeitlich begrenzten Basis bei 0,10 US-Dollar pro Audio-Stunde. Streaming kostet damit das 5,4-Fache des Batch-Tarifs.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0, etwa 4,4 Milliarden Parameter in BF16, herunterladbar, feinabstimmbar und auf einem einzelnen Beschleuniger bereitstellbar. Kein Preis, kein SLA und keine Support-Zusage, denn dahinter steht kein Dienst.
Diese beiden Sätze enthalten die Entscheidung. Ein Preview-Dienst mit einem Einführungstarif und einem nicht offengelegten Standardpreis ist eine Zusage, die ausläuft; der 5,4-fache Streaming-Aufschlag und das Fenster bis 2026 können beide von Microsoft geändert werden, und das Verhältnis von Batch zu Streaming ist die Kennzahl, die man im Auge behalten muss, wenn der Standardtarif feststeht. Apache-2.0-Gewichte ohne Ankündigung sind das Gegenteil: ein Artefakt, das niemand zurücknehmen kann, gebunden an eine Anbieterbeziehung, die niemand beschrieben hat. Ob der Checkpoint gepflegt wird, ist nicht absehbar, aber die Datei, die Sie heute haben, funktioniert unabhängig davon weiter.
Die branchenspezifische Einschränkung ist diejenige, die diese Fragen in der Praxis meist entscheidet. Der Betrieb eines arabischsprachigen Callcenters in einer regulierten Institution kann möglicherweise überhaupt keine Audiodaten an einen Preview-Cloud-Endpunkt senden; ein Team, das Azure AI Speech bereits als Standard eingeführt hat, möchte vielleicht keine zweite On-Premises-Lösung für eine einzige Sprachfamilie. Beide Einschränkungen sind legitim, und keine von beiden hat etwas mit den 2,5-%- und 8,82-%-Zahlen der beiden Markteinführungen zu tun.
Oberhalb der Transkriptionsebene gilt für beide dasselbe. OrcaRouter routet keines dieser beiden Sprachmodelle — dies ist ein Vergleich zweier Systeme, die wir nicht anbieten —, aber der Summarizer, der Klassifikator oder der Agent, der das Transkript verarbeitet, ist routingfähig: mehr als 200 Modelle über einen API-Schlüssel zum Listenpreis des Anbieters mit 0 % Aufschlag, sodass eine Preisänderung eines Anbieters unsere Seite noch am selben Tag erreicht, und automatisches Failover, falls ein Anbieter schlechter wird. Wo das hier konkret hilft, ist die Testphase: beide Transkriptionskandidaten auf eine nachgelagerte Pipeline auszurichten, hinter einem Schlüssel, ist die Art und Weise, wie man den direkten Vergleich durchführt, ohne zwei Integrationen aufzusetzen.
Der Test, der das klären würde
Keiner der Anbieter hat arabischspezifische Leistungsdaten veröffentlicht, und keiner wurde unabhängig anhand dialektalen Audiomaterials bewertet. Der Vergleich läuft daher auf drei Fakten und eine Empfehlung hinaus.
Die Fakten: Das Streaming-Modell von Microsoft ist mit 0,13 Sekunden schneller und beansprucht eine bessere aggregierte Genauigkeit auf einem Board, das es noch nicht eingezeichnet hat; Mistrals Modell veröffentlicht eine Dialektliste, eine arabische Fehlerrate und den Normalisierungscode, um sie neu herzuleiten, bei 480 Millisekunden; und die beiden Genauigkeitswerte lassen sich nicht vergleichen, weil es sich bei dem einen um die Wortfehlerrate und bei dem anderen um die Zeichenfehlerrate auf einem anderen Korpus handelt.
Die Empfehlung: Wer auch immer diese Entscheidung trifft, sollte beide auf eigenem Audiomaterial laufen lassen, denn das ist die einzige Messung, die beide Anbieter noch offen gelassen haben. Stellen Sie das Evaluierungsset aus echten Aufnahmen zusammen – die Dialektmischung, die Sie tatsächlich erhalten, der Codec, den Sie tatsächlich verwenden, das Fachvokabular, das Sie tatsächlich benötigen – und bewerten Sie beide mit Mistrals Normalisierung gegen eine Referenz, der Sie vertrauen. Ein zweistündiger Test mit Ihren eigenen Aufnahmen wird Ihnen mehr sagen als beide Launch-Posts zusammen, und er ist die einzige Möglichkeit herauszufinden, ob der Vorsprung von 0,13 Sekunden eine Abhängigkeit von einer Preview und einen 5,4-fachen Streaming-Aufpreis wert ist oder ob ein herunterladbares 4.4B-Modell mit 480 Millisekunden für die Aufgabe bereits gut genug ist.

OrcaRouter bietet keines dieser Sprachmodelle an, und dieser Artikel legt nichts anderes nahe – was er behandelt, ist die Sprachschicht, die das Transkript liest: mehr als 200 Modelle hinter einem Schlüssel zum Listenpreis des Anbieters mit 0 % Aufschlag, sodass eine Preisänderung des Anbieters beim nachgelagerten Modell Sie am Tag ihrer Ankündigung erreicht.
Automatisches Failover ermöglicht es, dass beide Transkriptionskandidaten eine einzige nachgelagerte Pipeline statt zwei Integrationen speisen, was zugleich die kostengünstigste Art ist, den Direktvergleich durchzuführen.
