Artikel-Hero-Karte mit der Aufschrift „Grok Voice Transcribe 2.0 vs. MAI Transcribe 2“, dem Badge „MODELLVERGLEICH“ und dem Untertitel „Zwei Wege, keine zwei Rivalen“, mit Chips, die 3,4 % vs. keine Streaming-SKU, 2,29 % vs. 2,04 % Batch-WER, 162x vs. 333x Echtzeit und jeweils 1,67 $ pro 1.000 Minuten anzeigen, über einem Weiß-zu-Blau-Verlauf mit dem OrcaRouter-Logo unten rechts.
Guides & Insights

Grok Voice Transcribe 2.0 vs. MAI Transcribe 2: Zwei Wege, nicht zwei Rivalen

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Diese beiden Modelle wurden im Abstand von fünfzehn Tagen veröffentlicht und bis auf den Cent gleich bepreist, und sie werden fast nie in derselben Beschaffungsentscheidung auftauchen. Grok Voice Transcribe 2.0, am 18. September 2026 von SpaceXAI veröffentlicht, ist das Modell, das Sie aufrufen, wenn Audio noch eintrifft – es streamt über einen WebSocket, liefert etwa alle 500 ms Zwischenergebnisse und führt das AA-WER-Streaming-Board von Artificial Analysis mit 2,7 % Wortfehlerrate für endgültige Transkripte und 3,4 % für erste Teilresultate an. MAI-Transcribe-2, am 3. September 2026 von Microsoft AI veröffentlicht, ist das Modell, das Sie aufrufen, wenn das Audio bereits eine Datei ist – es arbeitet nur im Batchbetrieb, und auf dem Nicht-Streaming-Board von Artificial Analysis ist es das genaueste Managed-Modell, gemessen mit 2,04 % AA-WER, vor Grok Voice Transcribe 2.0 mit 2,29 %, und beim Durchsatz rund 2× schneller. Beide sind mit 0,10 US-Dollar pro Audiostunde gelistet, etwa 1,67 US-Dollar pro 1.000 Minuten. Wenn Ihre Anforderung Echtzeit ist, gibt es keinen Vergleich anzustellen. Wenn Ihre Anforderung eine Datei ist, gibt es einen.

Die Grenze, die keiner der beiden Anbieter für Sie ziehen wird

Streaming-Unterstützung ist kein Funktionsschalter. Grok Voice Transcribe 2.0 bedient dasselbe Modell über REST für aufgezeichnete Dateien und über `wss://api.x.ai/v1/stt` für Live-Audio, sodass die Genauigkeit, die Sie an Ihrem Archiv messen, jener Genauigkeit entspricht, die Sie bei einem Live-Anruf erhalten. MAI-Transcribe-2 hat überhaupt keine Streaming-SKU: Microsofts Launch-Materialien positionieren es ausdrücklich für langformatiges und Batch-Audio, und obwohl die Modellkarte Echtzeit-Untertitelung unter ihren Anwendungsszenarien aufführt, besteht der Weg dorthin darin, Audio zu segmentieren und jedes Segment durch die Batch-API zu schicken – eine Pipeline, die Sie selbst bauen und betreiben, nicht eine Latenzgarantie, die Sie kaufen. Microsofts Spitzendurchsatz von ungefähr dem 411-Fachen der Echtzeit ist eine Verarbeitungsgeschwindigkeitszahl, keine Antwortzeitzahl, und die beiden werden in der Berichterstattung zu diesem Release ständig vermischt.

Die praktische Konsequenz: Wenn Sie Voice-Agenten mit Sprecherwechsel, Live-Untertitelung oder irgendetwas bauen, bei dem ein Mensch oder ein Modell auf laufende Sprache reagiert, kommt MAI-Transcribe-2 nicht infrage, egal wie gut seine Genauigkeit auch sein mag. Wenn Sie Meetings im Nachhinein transkribieren, Contact-Center-Aufzeichnungen über Nacht, Medienarchive oder Compliance-Backlogs, ist Streaming Ballast, und die Batch-Zahlen sagen alles.

Wo MAI-Transcribe-2 wirklich voraus ist

Zuerst die Genauigkeit bei Dateien. Die Lücke von 2,04 % gegenüber 2,29 % wird auf demselben unabhängigen Prüfstand gemessen – dem AA-WER v2 von Artificial Analysis, 50 % AA-AgentTalk und je 25 % VoxPopuli und Earnings22 –, was sie zum saubersten Fakt in diesem Vergleich macht. Es ist ein Unterschied von 0,25 Punkten, etwa zweieinhalb Fehler weniger pro tausend Wörter. Ob das eine Rolle spielt, hängt davon ab, was Sie mit dem Transkript machen; für ein durchsuchbares Archiv nicht, bei einer juristischen oder medizinischen Aufzeichnung könnte es das durchaus.

Der Durchsatz – an zweiter Stelle – und mit größerem Abstand als bei der Genauigkeit: 333× Echtzeit gegenüber 162× bei Grok Voice Transcribe 2.0. Beide Zahlen sind Messungen von Artificial Analysis – transkribierte Sekunden eingehenden Audios pro Sekunde – keine Herstellerangaben. Bei diesem Tempo ist ein Archiv von tausend Stunden nach rund drei Rechenstunden auf dem Microsoft-Modell fertig und nach rund sechs auf dem von SpaceXAI. Für eine einmalige Migration ist das irrelevant; für eine Pipeline, die kontinuierlich Daten aufnimmt, ist die halbierte Laufzeit ein echter Kapazitätsunterschied.

Sprachabdeckung, drittens. Microsoft gibt 60 Sprachen an – mit automatischer Erkennung, Code-Switching innerhalb einer Aufnahme und einer durchschnittlichen Wortfehlerrate von 5,2 % über diese hinweg bei FLEURS – eine vom Anbieter gemeldete Zahl, nicht unabhängig reproduziert, aber zumindest beschreibt sie den mehrsprachigen Fall über eine angegebene Sprachliste hinweg. SpaceXAI dokumentiert Dutzende Sprachen mit Sprachwechsel mitten in der Aufnahme und Formatierung der Schriftform bei 25. Wenn Ihr Audio außerhalb der gut abgedeckten Gruppe aus Englisch und den großen europäischen Sprachen liegt, ist die FLEURS-Zahl aussagekräftiger als eine Bestenliste, die englischlastig und stark von Agentengesprächen geprägt ist.

Zwei weitere Unterschiede, die operativ relevant sind. MAI-Transcribe-2 bietet konfigurierbare Transkriptionsstile – wörtlich, wobei Unflüssigkeiten beibehalten werden, gegenüber bereinigt, wodurch sie entfernt werden – während Grok Voice Transcribe 2.0 dasselbe Problem mit einem Flag zum Entfernen von Füllwörtern löst. Und Microsofts Modell befindet sich in der öffentlichen Vorschau auf Microsoft Foundry, was bedeutet, dass es keinen SLA gibt und eine dauerhafte Empfehlung gegen den Produktionseinsatz besteht, bis es allgemein verfügbar ist; SpaceXAIs Modell ist allgemein verfügbar mit veröffentlichten Ratenlimits von 10 Anfragen pro Sekunde und 100 gleichzeitigen Streaming-Sitzungen pro Team.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs MAI Transcribe 2 — the scoreboard': the left column gives Grok Voice Transcribe 2.0 WebSocket streaming with 500ms interim results, 2.29% batch WER, 162x real time throughput, $1.67 per 1,000 minutes, included diarization and general availability; the right column gives MAI Transcribe 2 no announced streaming, 2.04%, 333x, a $1.67 launch offer, included diarization and public preview with no SLA.

Wo Grok Voice Transcribe 2.0 wirklich überlegen ist

• Echtzeit-Streaming — ein WebSocket-Endpunkt mit Zwischenergebnissen etwa alle ~500 ms, im Vergleich zu reinem Batch-Betrieb ohne angekündigtes Echtzeit-SKU

• Genauigkeit des ersten Teiltranskripts — 3,4 % WER bei 0,49 s auf AA-WER Streaming, einer Kategorie, in der MAI-Transcribe-2 nicht antritt

• Batch-Genauigkeit bei Agent-Talk-Audio — insgesamt 2,29 %, doch auf der AA-AgentTalk-Teilmenge des Non-Streaming-Boards ist die Rangfolge enger, als die Schlagzeile vermuten lässt, und im agentenlastigen Mix des Streaming-Boards führt Grok klar.

• Voice-Agent-Infrastruktur — Smart Turn End-of-Turn-Erkennung und Füllwort-Entfernung sind im Modell enthalten, während MAI-Transcribe-2 die Turn-Logik dem Aufrufer überlässt

• Mehrkanal-Audio — bis zu 8 unabhängige Kanäle, die in einem einzigen Durchgang transkribiert werden, was bei Stereo- oder Mehrparteien-Anrufaufzeichnungen entscheidend ist

• Konfidenz auf Wortebene — Zeitstempel enthalten einen Konfidenzwert pro Wort, sodass Bereiche mit geringer Konfidenz markiert werden können, statt ihnen gleichermaßen zu vertrauen

• Verfügbarkeitsbedingungen — allgemein verfügbar mit veröffentlichten Parallelitätsgrenzen, im Gegensatz zu einer öffentlichen Vorschau ohne SLA

• Preisbeständigkeit — 0,10 $ pro Stunde ist der reguläre Tarif sowohl für Batch als auch die Basis für die 0,20-$-Streaming-Stufe, wobei die identischen 0,10 $ von Microsoft ein zeitlich begrenztes Einführungsangebot sind, für das kein Standardtarif für 2027 angekündigt wurde

Der letzte Punkt ist derjenige, den die meisten Vergleiche auslassen. Die beiden Modelle kosten heute gleich viel, und einer dieser Preise hat ein Ablaufdatum, der andere nicht. Microsoft hat keinen Preis nach der Aktion veröffentlicht, und die Berichterstattung ist sich uneinig darüber, ob das Angebot bis Ende 2026 läuft oder gar kein festgelegtes Ende hat. Wenn Sie ein dreijähriges Transkriptionsbudget auf Basis von 1,67 $ pro 1.000 Minuten von Microsoft kalkulieren, kalkulieren Sie eine Zahl, zu der sich der Anbieter nicht verpflichtet hat.

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard, showing MAI-Transcribe-2 at 2.04% AA-WER and 333x real time, Grok Voice Transcribe 2.0 at 2.29% and 161.77x, Gemini 3.5 Transcribe at 2.60%, GPT Transcribe at 3.31% and Whisper Large v3 at 4.07%.

Die Überschneidung ist real, und sie macht den Großteil der Funktionsliste aus

Blendet man die Streaming-Frage aus, rücken die beiden Produkte stark zusammen. Beide führen Sprecherdiarisierung durch. Beide liefern Zeitstempel auf Wortebene. Beide beherrschen inverse Textnormalisierung – Zahlen, Datumsangaben, Währungen, Kontaktdaten in schriftlicher Form. Beide akzeptieren Domänenterminologie, Grok Voice Transcribe 2.0 als bis zu 100 Schlüsselbegriffe pro Anfrage und MAI-Transcribe-2 als Domänenterminologie- und Abkürzungslisten. Beide erkennen die Sprache automatisch und folgen einem Sprecher, der mitten in der Aufnahme die Sprache wechselt. Beide verarbeiten 8-kHz-Telefonieaudio, also den Fall, an dem die meisten Transkriptionsmodelle still scheitern, und denjenigen, auf den SpaceXAI am härtesten optimiert hat – sein interner Telefonie-Datensatz verbesserte sich zwischen den Versionen von 10,6 % auf 7,1 % WER, eine vom Unternehmen gemeldete Zahl für unternehmenseigenes Audio.

Beide bringen zudem Eingabelimits mit, die eher Architekturen prägen als nur Budgets. Grok Voice Transcribe 2.0 akzeptiert Dateien bis zu 500 MB in 12 Audioformaten mit Abtastraten von 8 kHz bis 48 kHz. Die Limits von MAI-Transcribe-2 werden eher durch den Foundry-Pfad als durch das Modell festgelegt, und Teams sollten für die aktuelle Obergrenze Microsofts eigene Dokumentation lesen, statt Parität mit einem dedizierten STT-Dienst anzunehmen.

Was diese Konvergenz bedeutet, ist, dass sich die Entscheidung der Reihe nach auf drei Fragen reduziert: Muss es live sein, wie viele Sprachen haben Sie tatsächlich, und wie viel kostet Sie die Genauigkeitslücke. Die erste Frage ist binär und schließt eine Option von vornherein aus. Die zweite lässt sich meist anhand einer Stichprobe Ihres eigenen Audiomaterials beantworten. Die dritte ist klein genug, dass sie für die meisten dateibasierten Workloads nichts entscheiden wird – die Lücke von 0,25 Punkten ist real, aber ebenso die Tatsache, dass beide Modelle innerhalb eines halben Punkts des besten Werts liegen, den jemals jemand gemessen hat.

Screenshot of the Microsoft learn.microsoft.com MAI-Transcribe-2 model page, showing the September 3 2026 launch, the 60-language list with automatic detection and code-switching, the 5.2% FLEURS word error rate, the configurable verbatim and clean transcription styles, and the public-preview availability on Microsoft Foundry.

Was soll man damit machen?

Betrachten Sie sie als zweispurigen Stack statt als direkten Vergleich. Ein Contact-Center, das Live-Agent-Unterstützung und ein nächtliches Compliance-Archiv betreibt, entscheidet sich nicht zwischen Grok Voice Transcribe 2.0 und MAI-Transcribe-2 – es betreibt beide, und die einzige Frage ist, ob das zwei Anbieterbeziehungen, zwei Sätze Zugangsdaten, zwei Rechnungen und zwei Rate-Limits kostet. Keines der Modelle ist heute im Katalog von OrcaRouter, die Transkriptionsaufrufe selbst gehen also an die jeweilige eigene API des Anbieters. Was ein einzelner OrcaRouter-Schlüssel abdeckt, ist alles Nachgelagerte: den Summarizer, den Klassifikator, den Agenten, der über das Transkript schlussfolgert, und den Eval-Job, der die Ausgaben der beiden Anbieter für dieselbe Aufnahme vergleicht. Letzterer ist der Grund, warum es wichtig ist – man kann nicht anhand eines Leaderboards zwischen diesen Modellen entscheiden, denn das Leaderboard besteht aus acht Stunden englischem Agenten-Sprech, und Ihr Audio ist das nicht.

Behalten Sie zwei Dinge im Blick. Erstens, ob Microsoft MAI-Transcribe-2 einen Standardpreis zuweist, wenn das Einführungsangebot endet; ein dauerhafter Preis von 1,67 $ pro 1.000 Minuten würde es allein aufgrund der Kosten zur Standardwahl im Batch-Betrieb machen, und eine Rückkehr zu den 0,36 $ pro Stunde von MAI-Transcribe-1 würde dies zu einem viel kürzeren Gespräch machen. Zweitens, ob Microsoft eine Streaming-SKU auf den Markt bringt. Die Modellkarte nennt Echtzeit-Untertitelung bereits als Zielszenario, und das Einzige, was zwischen MAI-Transcribe-2 und der Streaming-Lane steht, ist ein Endpunkt — wenn dieser kommt, hören diese beiden auf, Lanes zu sein, und werden zu Rivalen.