Artikel-Hero-Karte mit der Aufschrift „Grok Voice Transcribe 2.0 vs. Gemini 3.5 Transcribe“, dem Badge „MODELLVERGLEICH“ und dem Untertitel „Die Streaming-Spur gehört einem von ihnen“, mit Chips, die 2,7 % vs. 4,0 % Streaming-WER, 3,4 % vs. 5,8 % erste Teilausgabe, 0,49 s vs. 0,40 s final und 1,67 $ vs. 5,00 $ pro 1.000 Minuten anzeigen, über einem Weiß-zu-Blau-Verlauf mit dem OrcaRouter-Logo unten rechts.
Guides & Insights

Grok Voice Transcribe 2.0 vs. Gemini 3.5 Transcribe: Die Streaming-Spur gehört einem von ihnen

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Grok Voice Transcribe 2.0 und Gemini 3.5 Transcribe sind die zwei neuesten Frontier-Speech-to-Text-Modelle aus konkurrierenden Labors, und die ehrliche Art, sie zu vergleichen, ist, gleich vorweg zuzugeben, dass sie nicht für dieselbe Aufgabe gebaut wurden. SpaceXAIs Grok Voice Transcribe 2.0, veröffentlicht am 18. September 2026, ist ein Streaming-First-Modell mit angehängtem Batch-Modus: Es führt das AA-WER-Streaming-Board mit 2,7 % Wortfehlerrate für finale Transkripte und 3,4 % für erste Teiltranskripte an, wobei beide 0,49 Sekunden nach Sprachende eintreffen. Gemini 3.5 Transcribe, veröffentlicht am 26. August 2026, ist ein Batch-First-Modell mit angehängter Streaming-SKU, und seine beiden Hälften verhalten sich sehr unterschiedlich — der Pfad für vorab aufgezeichnete Audiodaten erreicht 2,6 % AA-WER auf dem Non-Streaming-Board von Artificial Analysis, während der separate gemini-3.5-transcribe-live Endpunkt 4,0 % auf dem Streaming-Board bei 0,40 Sekunden erreicht. Setzt man diese vier Zahlen nebeneinander, ist die Form dieses Vergleichs offensichtlich: Sie liegen bei der Genauigkeit dicht beieinander, wo Gemini 3.5 Transcribe stark ist, und sie liegen nicht dicht beieinander, wo Grok Voice Transcribe 2.0 stark ist.

Die einzige Lane, in der sie beide kämpfen

Beide Modelle können Live-Audio transkribieren, daher ist Streaming der eine Bereich, in dem ein direkter Vergleich etwas bedeutet. Dort liegt Grok Voice Transcribe 2.0 bei der Genauigkeit finaler Transkripte um 1,3 Punkte vor Gemini 3.5 Transcribe Live — 2,7 % gegenüber 4,0 % WER im selben Testaufbau, mit denselben rund acht Stunden Audio und derselben 50/25/25-Gewichtung über AA-AgentTalk, VoxPopuli und Earnings22. Das ist kein Rundungsunterschied; bei diesen Fehlerraten ist es ungefähr ein zusätzliches falsches Wort pro fünfundsiebzig vom Google-Modell transkribierten Wörtern. Bei ersten Teiltranskripten ist der Abstand noch größer: 3,4 % gegenüber 5,8 %, und Teiltranskripte sind die Transkripte, auf die ein Live-Sprachagent reagieren muss, bevor der Sprecher fertig ist.

Die Latenz wirkt in die andere Richtung, und das ist der Teil des Vergleichs, der untergeht. Gemini 3.5 Transcribe Live liefert sein finales Transkript 0,40 Sekunden nach dem Ende der Äußerung gegenüber 0,49 bei Grok und sein erstes Teiltranskript in 0,25 Sekunden gegenüber 0,49 bei Grok – etwa doppelt so schnell bis zum ersten brauchbaren Wort. Keines der beiden Modelle konkurriert mit dem wirklich schnellen Ende dieses Feldes, wo Deepgram Flux 0,02 Sekunden und Soniox v5 0,05 Sekunden erreicht, doch zwischen diesen beiden ist der Trade-off eindeutig: Google spricht schneller, SpaceXAI liegt dafür eher richtig, wenn es spricht. Für einen Turn-Taking-Agenten, der einen Anrufer nicht ins Wort fallen darf, sind 0,24 Sekunden zusätzliche Latenz bei Teiltranskripten ein echter Preis, den der Genauigkeitsgewinn rechtfertigen muss.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% streaming final WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and a 100-concurrent-session cap; the right column gives Gemini 3.5 Transcribe 4.0%, 5.8%, 0.40s, $5.00, about $5.40 and a 10-minute session cap.

Wo Gemini 3.5 Transcribe tatsächlich gewinnt

Die Sprachabdeckung ist der eindeutigste Punkt – und das mit großem Abstand. Googles Modell verarbeitet 85+ Sprachen; Grok Voice Transcribe 2.0 unterstützt Dutzende Sprachen, mit Formatierung in Schriftform – die inverse Textnormalisierung, die gesprochene Zahlen, Datumsangaben, Währungen und E-Mail-Adressen in ihre geschriebene Form bringt – dokumentiert für 25 Sprachen. Wenn es sich bei Ihrem Audio um Portugiesisch, Vietnamesisch oder einen Code-Switching-Mix aus zwei Sprachen innerhalb eines Satzes handelt, ist die Frage, welches Modell auf dem Artificial Analysis Board genauer abschneidet, weitgehend akademisch, denn dieses Board ist englischlastig und stark von Agenten-Gesprächen geprägt. Google meldet 5,50 % Streaming-WER und 5,04 % Non-Streaming-WER auf FLEURS in seiner eigenen mehrsprachigen Suite – Zahlen, die vom Anbieter gemeldet und nicht unabhängig reproduziert wurden, aber zumindest den mehrsprachigen Fall überhaupt beschreiben.

Der zweite Vorteil ist die kostenlose Stufe. Gemini 3.5 Transcribe bietet kostenlose Eingabe- und Ausgabe-Token über Googles API, mit der Einschränkung, dass Inhalte der kostenlosen Stufe zur Verbesserung von Google-Produkten verwendet werden, Inhalte der kostenpflichtigen Stufe hingegen nicht. Für einen Prototyp, ein Nebenprojekt oder ein internes Tool, das Audio verarbeitet, das man sonst nicht bezahlen würde, um es zu transkribieren, ist das eine echte Option, die kein Anbieter mit Stundenabrechnung bieten kann. Grok Voice Transcribe 2.0 ist ab der ersten Audio-Stunde kostenpflichtig.

Und das dritte ist, dass Gemini 3.5 Transcribe ein allgemeines multimodales Modell mit einem Transkriptionsmodus ist, kein speziell für ASR entwickelter Dienst. Es kann mit Prompts gesteuert werden, es kann Text als Kontext aufnehmen, und es befindet sich in derselben API-Oberfläche wie alles andere, was Google ausliefert. Wenn die Transkription ein Schritt in einer Pipeline ist, die außerdem Reasoning über das Transkript erfordert, ist es etwas wert, beides in einem einzigen Modellaufruf zu belassen, was eine Fehlerrate pro Wort nicht erfasst.

Die Preiskalkulation pro tausend Minuten

Artificial Analysis normalisiert beide Modelle auf Kosten pro 1.000 Minuten Audio, was die einzige Möglichkeit ist, einen pauschalen Stundensatz mit der Token-Abrechnung zu vergleichen:

• Batch, voraufgezeichnet — Grok Voice Transcribe 2.0 bei 1,67 $ pro 1.000 Minuten (0,10 $/Stunde) vs. Gemini 3.5 Transcribe bei 5,00 $ pro 1.000 Minuten (0,30 $/Stunde, ab 2,00 $ pro 1 Mio. Input- und 12,00 $ pro 1 Mio. Output-Tokens)

• Streaming — Grok Voice Transcribe 2.0 mit 3,33 $ pro 1.000 Minuten (0,20 $/Stunde) gegenüber Gemini 3.5 Transcribe Live mit etwa 5,40 $ pro 1.000 Minuten, kombiniert aus 3,50 $ pro 1 Mio. Audioeingabe- und 21,00 $ pro 1 Mio. Textausgabe-Tokens

• Batch-Durchsatz — Grok Voice Transcribe 2.0 mit etwa 162× Echtzeit gegenüber Gemini 3.5 Transcribe mit etwa 88× auf derselben Hardware, sodass das günstigere Modell für Dateiarbeit auch das schnellere ist

• Begrenzung für Live-Sitzungen — Grok Voice Transcribe 2.0 streamt über einen WebSocket ohne veröffentlichte Sitzungsobergrenze außer 100 gleichzeitigen Sitzungen pro Team, im Vergleich zu Gemini 3.5 Transcribe Live, das auf 10 Minuten pro Sitzung begrenzt ist

Diese letzte Zeile ist das operative Detail, das mehr über Architekturen entscheidet als die Genauigkeitszahlen. Eine Obergrenze von 10 Minuten für eine Live-Sitzung bedeutet, dass lange Anrufe, lange Meetings und lange Streams aufgeteilt und neu aufgebaut werden müssen, und jeder Neuaufbau ist eine Nahtstelle, an der Kontext verloren geht. Der Streaming-Endpunkt von Grok hat eine Dateigrößen-Obergrenze von 500 MB auf dem Batch-Pfad und eine Parallelitätsgrenze von 100 Sitzungen pro Team auf dem Streaming-Pfad, was eine andere Art von Einschränkung ist – Durchsatz statt Dauer.

Die Token-Abrechnung sollte man verstehen, bevor man sich auf die Google-Seite festlegt, denn sie macht Ihre Rechnung zu einer Funktion zweier Variablen statt einer. Gemini berechnet Audio-Eingabe und Text-Ausgabe getrennt, daher kostet ein Modell, das ausführliche Formatierungen erzeugt oder sich wiederholt, mehr als eines, das das nicht tut, und eine Sprache mit längeren Wörtern kostet mehr als eine mit kürzeren. Der Pauschalstundensatz von Grok ändert sich durch nichts davon. Bei Workloads mit hohem Volumen ist der Pauschaltarif leichter zu prognostizieren, und da OrcaRouter die Listenpreise der Anbieter mit 0 % Aufschlag durchreicht, schlägt sich eine Änderung auf Seiten eines der beiden Anbieter schon am Tag ihres Inkrafttretens in Ihrer Rechnung nieder und nicht erst bei der nächsten Vertragsverlängerung.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first at 2.728% final-transcript word error rate and 0.490s, Gemini 3.5 Transcribe Live at 3.998% and 0.395s with a 5.774% first-partial figure, and the faster Deepgram Flux and Soniox v5 rows for latency context.

Feature-Formen: was jede einzelne zu tun verweigert

Die Fähigkeitslisten weichen stärker voneinander ab, als die Genauigkeitszahlen nahelegen, und die Lücken liegen an Stellen, die für bestimmte Anwendungen relevant sind:

• Sprecherdiarisierung – ohne Aufpreis in Grok Voice Transcribe 2.0 enthalten; wird von Gemini 3.5 Transcribe Live nicht unterstützt, sodass Live-Transkripte mit Sprecherzuordnung an diesem Endpunkt überhaupt nicht verfügbar sind

• Zeitstempel auf Wortebene — Grok Voice Transcribe 2.0 liefert sie zusammen mit Konfidenzwerten pro Wort; Gemini 3.5 Transcribe Live liefert keine, was eine Filterung nach Konfidenzschwellenwerten und eine präzise Untertitelausrichtung ausschließt

• Mehrkanal-Audio — Grok Voice Transcribe 2.0 transkribiert bis zu 8 unabhängige Kanäle in einem Durchgang; Gemini 3.5 Transcribe Live hat kein Äquivalent, daher erfordern Mehrkanal-Anrufaufzeichnungen Sitzungen pro Kanal

• Key-Term-Biasing — Grok Voice Transcribe 2.0 akzeptiert bis zu 100 Domänenbegriffe pro Anfrage; Gemini 3.5 Transcribe akzeptiert benutzerdefiniertes Vokabular und optionale Sprachhinweise

• Voice-Agent-Infrastruktur — Grok Voice Transcribe 2.0 bietet Füllwortentfernung und Smart-Turn-Erkennung des Turn-Endes; Gemini 3.5 Transcribe Live deckt den Streaming-Fall ab, überlässt die Turn-Logik jedoch der Anwendung

• Eingabeverarbeitung — Grok Voice Transcribe 2.0 akzeptiert direkte Datei-Uploads bis zu 500 MB in 12 Audioformaten; der Pfad für vorab aufgezeichnete Dateien von Gemini 3.5 Transcribe erwartet eine öffentliche HTTPS-URL mit einer Obergrenze von 15 Minuten und 300 MB und kann den Smart-Formatierungsmodus nicht mit Wort-Zeitstempeln oder Sprecherbezeichnungen kombinieren

Das Muster in dieser Liste ist, dass SpaceXAI ein Transkriptionsprodukt gebaut hat und Google eine Transkriptionsfähigkeit. Diarisierung, Zeitstempel, Kanaltrennung und Sprecherwechsel-Erkennung sind die Funktionen, die man braucht, wenn die Transkription die gesamte Anwendung ist; Prompt-Fähigkeit, Sprachenbreite und eine API für alles sind das, was man will, wenn die Transkription ein Schritt innerhalb einer größeren ist. Keine der beiden Listen ist abstrakt besser, und ein Team, das allein nach Genauigkeit auswählt, wird am Ende genau das Set vermissen, das es nicht gebraucht hat.

Screenshot of the Google ai.google.dev speech-generation documentation for Gemini 3.5 Transcribe, showing the pre-recorded and live transcription endpoints, the token-based audio-input and text-output pricing, the supported-language list and the 10-minute live session ceiling.

Die Wahl zwischen ihnen und was die Antwort verändert

Greifen Sie zu Grok Voice Transcribe 2.0, wenn das Transkript stimmen muss, während das Audio noch läuft: Live-Turn-Taking von Agenten, Echtzeit-Untertitelung, die sich keine Fehler leisten darf, Contact-Center-Streams, bei denen Sprecherzuordnung und Kanaltrennung Teil der Anforderung sind, oder jede Batch-Pipeline, bei der sowohl 1,67 $ pro 1.000 Minuten als auch 162× Durchsatz zählen. Greifen Sie zu Gemini 3.5 Transcribe, wenn das Audio mehrsprachig ist und eine Sprache umfasst, die nicht zu den von Grok dokumentierten Sprachen gehört, wenn das Transkript ein Modell speist, das ebenfalls darüber schlussfolgern muss, wenn Sie mit einem kostenlosen Tarif prototypen möchten, oder wenn die 2,6 % AA-WER des Batch-Pfads für das, was Sie tun, einfach ausreichen und die zusätzliche Sprahabdeckung mehr wert ist als der Preisunterschied.

Was die meisten Teams hier tatsächlich tun, ist nicht, sich für eines zu entscheiden. Beide Modelle sind über einen einzigen OrcaRouter-API-Schlüssel erreichbar, zusammen mit über 200 weiteren Modellen, was bedeutet, dass Sie Live-Agent-Traffic an Grok Voice Transcribe 2.0 und lange mehrsprachige Archive an Gemini 3.5 Transcribe weiterleiten können, ohne zwei Anbieterverträge, zwei Abrechnungsbeziehungen und zwei Sätze von Zugangsdaten pflegen zu müssen. Das ist auch der Weg, wie Sie die Genauigkeitsfrage für Ihr eigenes Audio klären: Lassen Sie beide auf denselben Aufnahmen laufen, vergleichen Sie die Transkripte, die Sie tatsächlich erhalten haben, und lassen Sie die Routing-DSL den Traffic dorthin senden, wo er hingehört. Das Leaderboard sagt Ihnen, welches Modell bei acht Stunden englischem Agenten-Talk von jemand anderem gewinnt; nur Ihr eigenes Audio sagt Ihnen, welches bei Ihrem Audio gewinnt.

Die offene Frage ist, was mit dieser Streaming-Lücke passiert, wenn Google den Live-Endpunkt als Nächstes überarbeitet. Gemini 3.5 Transcribe Live startete in der öffentlichen Vorschau, und seine 4,0%-Zahl wurde etwa einen Tag nachdem es aufrufbar wurde gemessen – ein starkes frühes Signal, aber eines, das weniger Zeit hatte, sich zu festigen als die Grok-Zahl, hinter der es jetzt steht. Wenn Google die 1,3-Punkte-Streaming-Lücke schließt und gleichzeitig die 0,25-Sekunden-Latenz für Teilresultate beibehält, ist der Kompromiss kein Kompromiss mehr und Groks Vorteil schrumpft auf Preis und Funktionen. Bis dahin ist die Aufteilung klar: Die schnellsten Teilresultate stammen von Google, die genauesten von SpaceXAI, und kein Modell auf dem Board ist beides.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert