
Grok Voice Transcribe 2.0 vs. Granite Speech 5.0 470M TurboCTC: 12.600-fache Echtzeit trifft auf eine halbe Sekunde
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Granite Speech 5.0 470M TurboCTC transkribiert auf einer einzelnen H200 etwa 3,5 Stunden Audio pro Sekunde, und Grok Voice Transcribe 2.0 liefert 0,49 Sekunden, nachdem Sie aufhören zu sprechen, ein erstes Teiltranskript. Diese beiden Zahlen werden in Vergleichsbeiträgen nebeneinandergestellt, als wären sie dieselbe Art von Messung, und sie sind bei Weitem nicht dieselbe Art von Messung — die eine ist eine Durchsatzzahl für gebündelte Verarbeitung im Rechenzentrum ohne zugehörige Latenz, die andere ist eine Latenzangabe für ein Modell, dessen Durchsatz niemand veröffentlicht hat. IBM veröffentlichte Granite Speech 5.0 470M TurboCTC am 25. August 2026 unter Apache 2.0, ließ den Decoder des Sprachmodells vollständig entfallen und dekodiert mit einem einzigen nicht-autoregressiven CTC-Durchlauf. SpaceXAI lieferte Grok Voice Transcribe 2.0 am 18. September 2026 als verwaltete API aus, zu 0,10 US-Dollar pro Audio-Stunde für Batch und 0,20 US-Dollar pro Stunde für Streaming. Beide sind hervorragende Transkriptionsmodelle, die entgegengesetzte Hälften desselben Problems lösen, und die Wahl zwischen ihnen fällt leichter, sobald man aufhört, die Zahlen direkt zu vergleichen.
12.600× Echtzeit und die Wörter, die sie näher bestimmen
Der Granite-Wert liegt bei 12.600 RTFx, gemessen auf einer einzelnen NVIDIA H200 mit Batch-Inferenz – eine Zahl von IBM, die bei der Markteinführung genannt und seither nicht unabhängig reproduziert wurde. RTFx ist ein Verhältnis von Audiodauer zu Verarbeitungszeit, 12.600 bedeutet also grob 3,5 Stunden Audio pro Sekunde an Wanduhrzeit. IBMs eigene Darstellung ist, dass dies mehr als das 20-Fache des Durchsatzes früherer Granite-Speech-Versionen ist, und das ist die Behauptung, auf die es hier tatsächlich ankommt: Die Beschleunigung entstand durch das Entfernen von Arbeit, nicht durch das Hinzufügen von Hardware.
Was es nicht ist, ist ein Latenzwert. Ein gebündelter Job, der 3,5 Stunden Audio pro Sekunde abschließt, kann trotzdem lange brauchen, um das erste Token einer einzelnen Datei zurückzugeben – je nachdem, wie der Batch zusammengestellt wird und wie viel Audio man ihm zuführt, bevor er startet. IBM veröffentlicht überhaupt keine Latenzwerte für TurboCTC. In der Far-Field-Bestenliste sind die beiden Checkpoints die beiden schnellsten Einträge, aber der Durchsatz wurde dort auf einer einzelnen NVIDIA L4 gemessen, einem Accelerator aus dem Datacenter-Umfeld und nicht einem Smartphone.
Der Grund, warum das wichtig ist, ist, dass das Modell ausdrücklich für Laptops, Telefone und Edge-Geräte positioniert ist – IBMs eigene Darstellung –, und niemand hat Single-Stream-Leistung auf irgendeinem davon veröffentlicht. Bis jemand das tut, sollte man „12,600ד als eine Aussage darüber behandeln, wie günstig man einen Backfill auf gemieteten GPUs durchpflügen kann, was eine wirklich wertvolle und gut belegte Behauptung ist, und nicht als eine Aussage darüber, wie schnell ein Nutzer einen Satz zurückbekommt.
Was IBM entfernt hat – und was Sie das kostet
TurboCTC ist ein Encoder-only-Design: ein 16-schichtiger Conformer-Akustik-Encoder, trainiert mit CTC, gierig in einem einzigen nicht-autoregressiven Durchlauf dekodiert, mit einer Subwort-Ausgabeschicht mit 16.384 Einheiten. Es gibt kein Sprachmodell im Ablauf. Daher kommt die Geschwindigkeit, und daher kommen auch die Einschnitte bei den Fähigkeiten, und sie sind nicht klein. Im Vergleich zu früheren Granite-Speech-Modellen lässt TurboCTC Sprachübersetzung weg, lässt Keyword-Biasing weg und bringt keine Zeitstempel- oder Interpunktionswerkzeuge mit.
Hält man das neben das, was das Managed Model zu seinem Listenpreis umfasst, wird die Kontur des Geschäfts greifbar:
• Key-Term-Biasing – Granite Speech 5.0 470M TurboCTC bietet keine, gegenüber bis zu 100 Schlüsselbegriffen pro Anfrage bei Grok Voice Transcribe 2.0
• Zeitstempel auf Wortebene — nicht mit TurboCTC ausgeliefert vs. mit Konfidenzwerten enthalten
• Sprachübersetzung – in früheren Granite Speech-Modellen vorhanden, hier entfernt vs. gar nicht angeboten
• Sprachabdeckung – nur Englisch vs. automatische Erkennung über einen breit gefächerten mehrsprachigen Eingabesatz hinweg mit Formatierungsunterstützung in 25 Sprachen
• Diarisierung — ein separates Problem, das Sie selbst lösen, vs. im Preis der Anfrage enthalten
• Kanäle — ein Stream pro Durchgang vs. bis zu acht Audiokanäle in einer Anfrage
• Textnormalisierung — keine vs. inverse Textnormalisierung, die gesprochene Datumsangaben, Währungen und Telefonnummern in schriftliche Form bringt
• Deployment — Gewichte, die Sie herunterladen und ausführen, vs. einen verwalteten Endpoint in us-east-1
Lesen Sie diese Liste als Beschreibung zweier unterschiedlicher Produkte, nicht als Bewertungsliste. Der Durchsatz wurde durch das Entfernen von Diarisierung, Biasing und Normalisierung erkauft. Ein Batch-Backfill von 40.000 Anrufaufzeichnungen in einen Suchindex braucht keine Zeitstempel oder Sprecherwechsel – es muss günstig sein und es muss fertig werden – und für diese Aufgabe fehlen die fehlenden Funktionen nicht, sie sind gestrichenes Gewicht.
Für alles, was live ist, gilt das Gegenteil. Wenn Sie einen Voice-Agent bauen, ist eine Key-Term-Liste der Weg, um „Kubernetes“, „Granola“ und Kundennamen korrekt geschrieben zu bekommen, und ein Transkriptor ohne Bias-Mechanismus wird sie jedes Mal falsch erfassen, ohne Möglichkeit, das zu beheben, außer durch Fine-Tuning, ein anderes Projekt mit einem anderen Budget. Diese eine fehlende Funktion disqualifiziert TurboCTC für einige Workloads und ist für andere irrelevant, weshalb ein Modellvergleich weniger nützlich ist als ein Workload-Vergleich.

Der Genauigkeitsvergleich, der nicht sauber vorgenommen werden kann
IBM meldet eine aggregierte Wortfehlerrate von 5,00 % für den Apache-2.0-Checkpoint und 4,85 % für das nicht-kommerzielle Geschwistermodell im Open ASR Leaderboard, gemessen über öffentliche englischsprachige Kurzform-Datensätze. Das sind Batch-Zahlen auf einem Leaderboard, dessen Evaluierungen AMI und Earnings22 sowie lange konversationelle Datensätze umfassen, und sie sind vom Anbieter gemeldet — durch das Tooling des Leaderboards gelaufen, aber noch nicht in die offizielle Tabelle aufgenommen, die auch private Testsets enthält. Die veröffentlichte Aufschlüsselung pro Datensatz auf der Model Card ist lesenswert, denn der Durchschnitt verdeckt viel: LS Clean 1,42 %, LS Other 2,66 %, SPGISpeech 3,18 %, Voxpopuli-Cleaned-AA 4,88 %, Earnings22-Cleaned-AA-chunked 6,69 %, AMI-Cleaned 7,52 % und Gigaspeech-Cleaned 8,67 %, was im Durchschnitt genau 5,00 % ergibt. Dieselbe Model Card nennt einen durchschnittlichen RTFx von 13.042,98, gemessen auf einer H200 — höher als der Wert von 12.600, den IBMs Launch-Post verwendete, und beide Zahlen stammen vom selben Unternehmen, aus derselben Woche, auf derselben Hardware.
Die 2,7 % für das finale Transkript von Grok Voice Transcribe 2.0 sind keine vergleichbare Messgröße. Sie stammen aus dem AA-WER-Streaming-Board von Artificial Analysis, einem gewichteten Composite aus AA-AgentTalk zu 50 %, VoxPopuli zu 25 % und Earnings22 zu 25 % – rund acht Stunden agentengewichtetes englischsprachiges Konversationsaudio, gemessen über eine Streaming-Schnittstelle. Andere Datensätze, andere Gewichtung, andere Betriebsart. 2,7 % neben 5,00 % zu stellen und daraus zu schließen, dass das verwaltete Modell ungefähr doppelt so genau ist, ist der mit Abstand häufigste Fehler, der in diesem Vergleich möglich ist.
Was sich ehrlich sagen lässt, ist enger gefasst und dennoch nützlich. Beide Modelle sind stark bei dem Audio, auf dem jedes gemessen wurde. Grok Voice Transcribe 2.0 führt ein unabhängig betriebenes Streaming-Board an, auf dem auch andere Modelle gemessen werden, was seine Platzierung überprüfbar macht, selbst wenn sein exakter Wert nicht übertragbar ist. Granite Speech 5.0 470M TurboCTC hat einen aggregierten WER-Wert auf den standardmäßigen offenen ASR-Sets und, separat, ein Far-Field-Ergebnis, bei dem der nicht-kommerzielle Checkpoint bei der Genauigkeit Platz fünf belegt und der Apache-Checkpoint Platz neun – gemessen an verrauschter und halliger Sprache, was die härteste Bedingung im Set und wohl das Ehrlichste in den Zahlen beider Modelle ist.
Wenn es sich bei Ihrem Audio um sauberes, vorgelesenes Englisch handelt, ist die Genauigkeitslücke zwischen diesen beiden wahrscheinlich kleiner, als die Platzierungen in der Bestenliste vermuten lassen. Wenn es verrauscht, akzentbehaftet, telefonisch oder nicht englisch ist, sagt Ihnen keine der beiden Bestenlisten viel, und nur Ihr eigener Testdatensatz ist das Instrument, das dies tut.
Freihanteln gegen 1,67 $ pro Stunde
Der Kostenvergleich ist der eine Punkt, an dem sich diese beiden Modelle wirklich leicht auseinanderhalten lassen, und die Zahl, die üblicherweise genannt wird, ist in beide Richtungen falsch.
• Batch-Transkription — Grok Voice Transcribe 2.0 zu 0,10 $ pro Audio-Stunde bzw. etwa 1,67 $ pro 1.000 Minuten im Vergleich zu Granite Speech 5.0 470M TurboCTC ohne Lizenzkosten, plus GPU-Zeit
• Streaming — 0,20 $ pro Audio-Stunde, etwa 3,33 $ pro 1.000 Minuten im Vergleich zu keinem von IBM veröffentlichten gehosteten Streaming-Pfad
• Lizenz — eine kommerzielle API ohne Gewichte vs. Apache 2.0 für den Haupt-Checkpoint und CC-BY-NC-SA-4.0 für die genauere nichtkommerzielle Variante
„Free“ leistet in dieser ersten Zeile eine Menge Arbeit. Ein Encoder-only-Modell mit 470M Parametern ist klein genug, um auf bescheidener Hardware zu laufen – das ist der Sinn des Designs und der Grund, warum IBM es in zehn Tagen auf acht H100s trainiert und gegen `transformers>=5.16.0` mit einer WebGPU-Demo ausgeliefert hat –, aber irgendjemand bezahlt trotzdem für die GPU, den Serving-Stack, das Autoscaling, die Wiederholungsversuche und die On-Call-Rotation. Bei kleinen Volumina ist der Managed-Preis meist günstiger als die Engineering-Zeit. Bei großen, stetigen Volumina gewinnt der Weg über gemietete Hardware, und der Übergangspunkt ist eine Funktion Ihrer Auslastung und nicht Ihres Audiovolumens: Eine GPU, die Sie beschäftigt halten, ist pro Stunde günstig, und eine, die Sie für Spitzenlast warm halten, ist es nicht.
Ein Lizenzdetail sollte man anmerken, bevor irgendjemand seine Architektur darauf auslegt. Der genauere der beiden Checkpoints, der mit 4,85 % WER, ist der nichtkommerzielle unter CC-BY-NC-SA-4.0. Der Apache-2.0-Checkpoint ist der mit 5,00 %, und er ist derjenige, den man in einem Produkt ausliefern darf. Das ist ein Genauigkeitsunterschied von 0,15 Punkten, der gegen das Recht eingetauscht wird, das Modell überhaupt verwenden zu dürfen, und außerdem bedeutet es, dass jeder Vergleich, der 4,85 % für „Granite Speech 5.0“ angibt und dann den kommerziellen Einsatz erörtert, den falschen Checkpoint angibt.

Die Entscheidungsregel
Drei Fragen trennen diese beiden Modelle schneller als jede Benchmark-Tabelle.
Wird das Transkript live konsumiert, während die sprechende Person noch spricht? Wenn ja, ist TurboCTC nicht der Kandidat – nicht weil es langsam ist, sondern weil es keine Streaming-Schnittstelle und keine Teilausgabe hat, und ein Teiltranskript ist eine andere architektonische Festlegung als eine schnelle Batch-Dekodierung. Wenn nein, wird der Durchsatzvorteil zur ganzen Geschichte, und IBMs Modell ist bei den Kosten pro Stunde verarbeiteten Audios sehr schwer zu schlagen.
Braucht die Arbeit Domänenvokabular? Wenn ja, gewinnt ein Modell mit Biasing standardmäßig, und das Fehlen von Schlüsselbegriff-Biasing in TurboCTC ist disqualifizierend statt bloß unbequem. Wenn nein, zahlen Sie auf der Managed-Seite für eine Funktion, die Sie nicht nutzen werden.
Handelt es sich bei dem Audio um englische vorgelesene Sprache auf ordentlicher Hardware? Wenn ja, sind beide stark und die Wahl ist eine Frage des Betriebs. Wenn nein, sind beide Boards nicht aussagekräftig und nur Ihre eigene Bewertung zählt.
Wie auch immer das ausgeht – die Betriebsebene ist der Punkt, an dem diese Entscheidung günstig wird. OrcaRouter stellt über 200 Modelle hinter einen einzigen OpenAI-kompatiblen Schlüssel mit automatischem Failover über Anbieter hinweg, sodass ein verwalteter Speech-Endpunkt in einer einzigen Region, der einen schlechten Nachmittag erwischt, nicht länger Ihr Ausfall ist, und der Listenpreis der Anbieter mit 0 % Aufschlag durchgereicht wird – was bedeutet, dass eine Preisänderung eines Anbieters oder ein neuer Checkpoint am selben Tag auf unserer Seite live ist. Für eine Workload, bei der die richtige Antwort wirklich unklar ist, beseitigt das die Kosten, falsch zu liegen: Benchmarken Sie beide gegen Ihr eigenes Audio hinter einem einzigen Endpunkt, behalten Sie den, der gewinnt, und ändern Sie den Model-String, sobald der nächste ausgeliefert wird.

Die Kurzfassung: Granite Speech 5.0 470M TurboCTC ist die bessere Antwort auf „alles zu transkribieren, was wir je aufgezeichnet haben, kostengünstig, auf Hardware, die wir kontrollieren“, und Grok Voice Transcribe 2.0 ist die bessere Antwort auf „dies in Echtzeit zu transkribieren, präzise, ohne dass wir den Serving-Stack betreiben“. Die 12.600-fache Schlagzeile und die 0,49-Sekunden-Schlagzeile sind beide wahr, und keine von beiden ist ein Beleg für die andere.
