Hero-Titelkarte für Granite Speech 5.0 470M TurboCTC mit einem Sprachwellenform-Symbol, einem Abzeichen mit der Aufschrift „12.600 RTFx auf 1 H200“, Beschriftungen, die „470M Parameter“, „Encoder-only CTC“ und „Apache 2.0“ anzeigen, einem Untertitel „IBMs Apache-2.0-Englisch-ASR“, einer Fußzeile mit der Angabe „Veröffentlicht am 25. August 2026“ und dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Granite Speech 5.0 470M TurboCTC: IBMs Apache-2.0-ASR gibt 12.600 RTFx an

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Granite Speech 5.0 470M TurboCTC ist das Modell aus IBMs neuem Speech-Release, das du tatsächlich ausliefern darfst – und genau das sollte man zuerst darüber wissen. IBM hat am 25. August 2026 zwei englischsprachige Spracherkennungs-Checkpoints auf Hugging Face veröffentlicht: Granite Speech 5.0 470M TurboCTC unter Apache 2.0 und Granite Speech 5.0 470M TurboCTC-NC unter einer nicht-kommerziellen CC-BY-NC-SA-4.0-Lizenz. Gleiche 470-Millionen-Parameter-Architektur, andere Daten, gegensätzliche Lizenzierung. Das Apache-Modell ist dasjenige, das IBM für „andere Anwendungsfälle“ empfiehlt – was in der Sprache der Anbieter kommerzielle Produktion bedeutet – und es trägt auch die Schlagzeilenzahl: IBM meldet einen aggregierten Durchsatz von über 12.600 RTFx auf einer einzelnen NVIDIA H200, was laut IBM mehr als dreieinhalb Stunden englischsprachiges Audio pro Sekunde bei Batch-Inferenz entspricht.

Diese Geschwindigkeitsangabe ist eine einen Tag alte Herstellerbehauptung, die von keiner dritten Partei reproduziert wurde. Betrachten Sie sie also als starken Papierwert, nicht als geprüfte Tatsache. Der Grund, warum sie dennoch Ihre Aufmerksamkeit verdient, ist das Design dahinter: Granite Speech 5.0 TurboCTC verzichtet auf den Language-Model-Decoder, den jedes bisherige Granite-Speech-Modell verwendet hat, und lässt einen reinen Conformer-Encoder übrig, der mit Connectionist Temporal Classification (CTC) trainiert und nicht-autoregressiv dekodiert wird. Gerade das Fehlen einer Token-für-Token-Generierungsschleife führt dazu, dass ein Modell mit 470 Millionen Parametern einen Durchsatz beansprucht, der Modelle übertrifft, die um ein Vielfaches größer sind – und genau deshalb ist diese Veröffentlichung für alle wichtig, die Sprach-zu-Text-Systeme entwickeln, und nicht nur für die Benchmark-Tabelle.

Was tatsächlich ausgeliefert wurde

Zwei Checkpoints, {{1}}beide veröffentlicht am 25. August 2026 auf der ibm-granite Hugging Face Org,{{/1}} {{2}}beide Englisch-only-ASR mit derselben reinen Encoder-Architektur:{{/2}}

• Granite Speech 5.0 470M TurboCTC — Apache 2.0, kommerzielle Nutzung gestattet, trainiert mit etwa 60.000 Stunden englischem Audiomaterial.

• Granite Speech 5.0 470M TurboCTC-NC — CC-BY-NC-SA-4.0, nur für Forschung und nicht-kommerzielle Zwecke, trainiert auf etwa 75.000 Stunden englischem Audio.

Dieser Artikel befasst sich mit dem Apache-Modell – dem, auf das sich ein Produkt rechtlich verlassen kann – wobei der -NC-Zwilling dort erwähnt wird, wo es die Lizenzgeschichte erfordert. Beide Checkpoints werden als Safetensors in F32 und BF16 ausgeliefert, und beide werden in Hugging Face Transformers über AutoModelForCTC und AutoProcessor nativ unterstützt. Die Funktion erscheint im nächsten Transformers-Release; bis dahin installiert man Transformers aus dem Quellcode, lädt Prozessor und Modell und führt Greedy-Decoding aus. IBM verlinkt zudem eine browserbasierte WebGPU-Streaming-Demo, die der schnellste Weg ist, um zu hören, wie niedrig die Latenz tatsächlich ist.

Die Architektur-Wette: ein Encoder, kein Decoder, 12,5 Tokens pro Sekunde

Die Designänderung ist die Geschichte hinter der Geschwindigkeitsbehauptung. Frühere Granite Speech-Versionen kombinierten einen akustischen Encoder mit einem Projektor und einem Sprachmodell-Decoder, und genau dieser Decoder wurde entfernt. Granite Speech 5.0 470M TurboCTC ist ein 16-lagiger Conformer-Encoder, der mit CTC trainiert wurde, und die Inferenz ist ein einzelner nicht-autoregressiver Greedy-Durchlauf. Es gibt nichts zu sampeln, also gibt es keine Generierungslatenz, auf die man warten müsste.

Drei Konfigurationsdetails machen es schnell statt nur klein:

• Zeitliche Unterabtastung um den Faktor 8. Das Front-End läuft mit 100 Bildern pro Sekunde; das Modell gibt 12,5 Token pro Sekunde aus. Durch das Stapeln und Überspringen von Log-Mel-Frames sowie durch Faltungen mit Schrittweite und gepoolte Residuen in den ersten beiden Conformer-Blöcken wird die Ausgaberate in drei 2x-Stufen reduziert.

• Ein Subwort-Vokabular anstelle von Zeichen. Frühere Granite-Speech-Encoder erzeugten 50 Zeichen pro Sekunde; 5.0 erzeugt 12,5 Subwort-Token pro Sekunde aus einem BPE-Vokabular mit 16.384 Einheiten (SentencePiece in der -NC-Variante). Weniger Ausgabeeinheiten pro Sekunde Audio bedeutet, dass der CTC-Decoder weniger Entscheidungen treffen muss.

• Selbstkonditioniertes CTC. Die mittlere Conformer-Schicht verfeinert die eigenen Zwischenrepräsentationen des Modells, was der Trick ist, der es einem kleinen Encoder ermöglicht, seine Genauigkeit zu halten, während der Decoder weggelassen wird.

All das steht in der Model Card und der technischen Beschreibung von IBM. Zusammengefasst ergibt sich ein Checkpoint, der für Laptops, Telefone und Streaming-Pipelines konzipiert ist, in denen ein schwergewichtiger autoregressiver Decoder keinen Platz hätte — die Ausrichtung auf Edge-Geräte ist in IBMs eigener Beschreibung explizit genannt.

Die Zahlen, die IBM angibt.

Alles in diesem Abschnitt ist von IBM gemeldet, wurde über den öffentlichen Harness des Open ASR Leaderboards auf der Hugging-Face-Infrastruktur (Stand: 25. August 2026) ausgeführt und nicht unabhängig reproduziert. Behandeln Sie sie als glaubwürdig wirkende Herstellerangaben, nicht als gesicherte Wahrheit:

• Durchsatz — über 12.600 RTFx auf einer einzelnen NVIDIA H200 mit Batch-Inferenz, was IBM als mehr als 3,5 Stunden Audio pro Sekunde übersetzt. IBM fügt hinzu, dass dies über dem 20-fachen Durchsatz früherer Granite Speech Modelle liegt. Dies ist ein Wert für Rechenzentrums-GPUs und Batch-Inferenz, nicht das, was ein Laptop liefert.

• Genauigkeit — eine aggregierte Wortfehlerrate von 5,00 % für das Apache-Modell auf den öffentlichen englischen Kurzform-Testsets des Open-ASR-Leaderboards (die -NC-Variante erreicht 4,85 % auf denselben Testsets). Die Inferenz wurde über die Jobs-Infrastruktur von Hugging Face ausgeführt und mit den Werkzeugen des Leaderboards bewertet. IBM erwartet daher, dass diese mit der offiziellen Tabelle übereinstimmen, sobald die neuen Modelle in diese aufgenommen wurden.

• Fernfeld – auf der FFASR-Bestenliste für verrauschte und nachhallende Bedingungen belegt das Apache-Modell den neunten Platz bei der Genauigkeit und das -NC-Modell den fünften, und die beiden sind die schnellsten Einträge auf dieser Liste (Durchsatz gemessen auf einer einzelnen NVIDIA L4).

• Training — rund 60.000 Stunden öffentliches englischsprachiges Audio für das Apache-Modell, durchgeführt in zehn Tagen mit acht NVIDIA H100s auf dem IBM-Blue-Vela-Cluster.

A generated single-column scoreboard titled 'Granite Speech 5.0 470M TurboCTC — the scoreboard' with rows reading Release Aug 25 2026, License Apache 2.0, Params 470M, Speed 12,600 RTFx (1 H200), WER 5.00% Open ASR, FFASR rank 9 fastest on board, and a footer reading 'IBM-reported as of Aug 25 2026; not yet independently reproduced.'

Was Ihnen Apache 2.0 tatsächlich bringt

Die Lizenz ist das, was diese Veröffentlichung ungewöhnlich macht. Open-Weight-Sprachmodelle kommen in der Regel unter Forschungslizenzen heraus oder mit Verpflichtungen, die der Rechtsabteilung eines Produktionsteams Bauchschmerzen bereiten; hier ist der kommerziell nutzbare Zwilling derjenige, bei dem IBM bei der Genauigkeit etwas schlechter abschnitt. Man tauscht 0,15 Punkte der aggregierten WER (5,00 % gegenüber 4,85 %) gegen das Recht, das Modell in einem Produkt einzusetzen, den Output zu monetarisieren, es feinzutunen und die abgeleiteten Gewichte für sich zu behalten und es in der Cloud-Infrastruktur zu verwenden – ohne dass eine Nur-Forschung-Klausel im Weg steht.

Diesen Tausch kann man leicht in die falsche Richtung machen, wenn man der Bestenliste hinterherjagt. Die 4,85 % des -NC-Modells stammen aus etwa 15.000 zusätzlichen Stunden Trainingsdaten (GigaSpeech und SPGI Speech), und es ist die Version, die IBM wörtlich als „nur für Forschungs- und nichtkommerzielle Zwecke“ kennzeichnet. Es ist ein gutes Benchmark-Modell, aber eine schlechte Produktabhängigkeit. Das Apache-Modell verliert ein wenig Genauigkeit und gewinnt die Fähigkeit, die Grundlage einer kommerziellen Transkriptions-Pipeline, eines Callcenter-QA-Systems oder eines Edge-Geräts zu sein. Wenn Sie diese Familie evaluieren, steht die Lizenzentscheidung vor der Benchmark-Entscheidung.

A screenshot of the Hugging Face model page for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 license tag, the automatic-speech-recognition and English pipeline tags, a model card summary describing a compact 470 million parameter English ASR model trained on approximately 60,000 hours of English audio using CTC with non-autoregressive greedy decoding, and an Open ASR leaderboard evaluation line dated August 25 2026.

Was du aufgibst

Das Weglassen des Sprachmodells ist nicht kostenlos, und die Modellkarte ist ehrlich, was die Kürzungen angeht:

• Keine Sprachübersetzung. Frühere Granite-Speech-Generationen konnten ein Sprachmodell durchlaufen, um beim Transkribieren zu übersetzen; 5.0 ist reine Transkription.

• Kein Keyword-Biasing. Das LM übernahm auch das Biasing hin zu Domänenbegriffen und Namen; ohne dieses erhält man, was das Subwort-Vokabular natürlich erzeugt.

• Nur Englisch. In dieser Version gibt es keinen mehrsprachigen Checkpoint und keine Anzeichen, dass einer in naher Zukunft erscheint.

• Der WER von 5,00 % bezieht sich auf kurze, saubere Audiodaten. Das FFASR-Ergebnis (Rang neun bei verrauschter Fernfeldsprache) ist der realistischere Indikator für den Einsatz in Besprechungsräumen und im Freisprechbetrieb – und es ist ein Rang, keine Schlagzeilenzahl.

Für eine eng begrenzte Transkriptionsaufgabe – Anruf-Audio, Meetings, Sprachmemos, Untertitel, Diktate – ist nichts davon ein Hindernis. Sie sind nur dann relevant, wenn man gehofft hat, dass ein einziges kleines Modell auch übersetzen oder ein benutzerdefiniertes Vokabular ohne Weiteres zuverlässig transkribieren würde.

So führen Sie es heute aus.

Du brauchst keine Cloud-API, die es noch nicht gibt. Das Modell läuft lokal:

• Installieren Sie Transformers aus dem Quellcode (das CTC-Feature-Set ist noch nicht in der neuesten Version enthalten), dann AutoModelForCTC plus AutoProcessor und Greedy-Decodierung – die Standard-Pipeline. Der Prozessor kann Log-Mel-Features auf dem Gerät des Modells berechnen und spart dadurch eine Host-zu-Device-Kopie.

• Das Beispiel auf der Model Card ist ein Zweizeiler per Pipeline: automatic-speech-recognition mit dem Modell „ibm-granite/granite-speech-5.0-470m-turboctc“.

• Eine WebGPU-Streaming-Demo läuft in einem Browser-Tab und ist der schnellste Weg, die Latenz zu messen, bevor man einen Nachmittag in ein Benchmark-Harness investiert.

• Für die Produktion ist die praktische Frage das Serving. Offene ASR-Modelle dieser Klasse werden typischerweise auf CPU oder einer kleinen GPU mit etwas wie Batch-Streaming-Inferenz ausgeführt — die 12.600-RTFx-Schlagzeile ist eine H200-Batch-Zahl; eine realistische Single-Stream-Zahl für Laptops wird deutlich niedriger sein, und IBM hat keine Time-to-First-Token-Werte veröffentlicht.

In dieser Serving-Ebene liegen die tatsächlichen Kosten und die Komplexität offener ASR, und genau hier bewährt sich eine Routing-Plattform. Das Modell von OrcaRouter ist eine API für über 200 Modelle, wobei der Listenpreis des Anbieters ohne Aufschlag durchgereicht wird – wenn ein Anbieter also den Preis senkt, ist die Senkung noch am selben Tag live – sowie automatisches Failover zwischen Anbietern und eine Routing-DSL, um mehrere Modelle in einem einzigen Aufruf zu kombinieren. Davon trifft nichts speziell auf Granite Speech 5.0 470M TurboCTC zu, denn keine der beiden Varianten ist bisher bei OrcaRouter verfügbar: Die Gewichte sind einen Tag alt, und kein kommerzieller Anbieter stellt sie bereit. Wenn ein offenes Sprachmodell wie dieses einen gehosteten Zugang bekommt – oder wenn man es mit den bereits vorhandenen gehosteten ASR-APIs vergleicht –, ist eine Routing-Ebene der Weg, es auszuprobieren und ohne Umschreiben der Integration zurückzufallen, und die Durchreichpreisgestaltung sorgt dafür, dass der Vergleich fair bleibt.

Was ist noch unbestätigt

Ein Modell, das erst einen Tag alt ist, hat eine kurze Papierspur, und es lohnt sich, genau aufzulisten, was noch nicht bekannt ist:

• Kein Drittanbieter-Benchmark. Die 12.600 RTFx, die 5,00 % WER und die FFASR-Rankings stammen alle aus IBMs eigenen Läufen durch die öffentliche Leaderboard-Umgebung. Keine unabhängige Stelle hat Zahlen veröffentlicht.

• Keine IBM-gehostete API. Es gibt keine watsonx-Modellseite, keinen verwalteten Endpunkt, keine Preise und kein Datum dafür, wann etwas davon verfügbar sein wird.

Keine Streaming-Latenzzahlen. Streaming-Unterstützung und eine WebGPU-Demo sind vorhanden; Time-to-First-Token- und Chunk-Latenzzahlen dagegen nicht.

• Kein Vergleich mit denselben Benchmark-Bedingungen gegen die anderen schnellen Open-ASR-Modelle. Die entscheidenden Vergleiche – gegen Whisper large-v3, NVIDIA Parakeet TDT 0.6B und die gehosteten Transkriptions-APIs – wurden von niemandem bisher auf identischen Daten durchgeführt.

Was als Nächstes ansehen

Die kurzfristigen Signale sind die unabhängigen Reproduktionen. Das Open-ASR-Leaderboard ist öffentlich, die Testumgebung ist Standard, und die Gewichte sind auf Hugging Face verfügbar – eine Auswertung durch Dritte sollte also innerhalb von Tagen vorliegen. Man sollte beobachten, ob 5,00 % Bestand haben und ob die 12.600 RTFx auf einer einzelnen H200 außerhalb von IBMs eigenem Batch-Setup überleben. Die andere Sache, die man beobachten sollte, ist, ob IBM das Apache-Pendant in einen Managed Service verwandelt, denn ein watsonx-Endpunkt würde dies sofort zur Open-ASR-Lösung mit dem glaubwürdigsten kommerziellen Weg machen. Granite Speech 5.0 470M TurboCTC ist am ersten Tag eine wirklich schnelle, wirklich permissive englische ASR mit einer wirklich dünnen Verifikationsspur. Die ersten beiden sind real; die dritte ist eine Frage der Zeit.

A generated infographic titled '3.5 hours of audio in 1 second' showing an H200 GPU card, an audio stack and a finished transcript connected by arrows, with tags reading over 12,600 RTFx, batched inference, Apache 2.0, and IBM-reported Aug 25 2026, and the OrcaRouter logo in the bottom-right corner.
© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube