Eine generierte Hero-Titelkarte für „VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC: die beiden stillen Open-Weights-Streaming-Wetten", untertitelt mit „Zwei Open-Weights-Streaming-ASR-Modelle, acht Tage auseinander", mit zwei Modellkarten — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2. September 2026 · MIT · ~3B gesamt · Speech-LLM) und Granite Speech 5.0 470M TurboCTC (IBM · 25. August 2026 · Apache-2.0 · 470M · reiner CTC-Encoder) — sowie Tags mit der Aufschrift „Edge-Klassen-Geschwindigkeit (IBM)", „Nur Englisch (IBM)" und „Wer-sagte-was in 10 Sprachen (Microsoft, unbestätigt)". Das OrcaRouter-Logo ist in der unteren rechten Ecke eingebettet.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs. Granite Speech 5.0 470M TurboCTC: die beiden unauffälligen Open-Weight-Streaming-Wetten

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die beiden interessantesten Streaming-Sprache-zu-Text-Veröffentlichungen mit offenen Gewichten Ende August 2026 erschienen beide ohne Launch-Event. Am 25. August stellte IBM Granite Speech 5.0 470M TurboCTC auf Hugging Face bereit – Gewichte, Modellkarte und ein Blogbeitrag, mehr nicht –, und am 2. September lud Microsoft Research VibeVoice-ASR-Streaming-1.5B im microsoft-Namespace hoch, ohne jede Ankündigung, abgesehen von einer News-Zeile im VibeVoice-GitHub-Repository. Es handelt sich um dieselbe Art von Sache und zugleich um gegensätzliche Engineering-Wetten: IBMs Modell ist ein reiner CTC-Encoder mit 470 Millionen Parametern, der dafür ausgelegt ist, mit Edge-Geschwindigkeit auf einem Laptop zu laufen, während Microsofts ein Speech-Language-Modell der 1,5B-Klasse ist, eingehüllt in Audio-Tokenizer und einen Diffusions-Head – insgesamt etwa drei Milliarden Parameter – und darauf ausgelegt, Sprache als Sprache zu verstehen, während sie transkribiert wird.

Vor den Zahlen stehen die Quellenangaben, die für die Ehrlichkeit dieses Vergleichs sorgen. Alles, was als „von IBM gemeldet“ gekennzeichnet ist, stammt aus der Modellkarte des Granite Speech 5.0 470M TurboCTC und den zugehörigen Einträgen im Open ASR Leaderboard; IBM hat die Werte am Erscheinungstag mit der offiziellen Testumgebung ermittelt, unabhängig reproduziert wurden sie bislang nicht. Alle Angaben zu VibeVoice-ASR-Streaming-1.5B stammen aus der Lektüre des Repositorys – aus den Konfigurationsdateien, der Modellkarte und Microsofts Streaming-Dokumentation. Denn Microsoft hat weder Genauigkeits- noch Latenzzahlen schriftlich veröffentlicht, und niemand außerhalb von Microsoft hat den Checkpoint bisher einem Benchmark unterzogen. Die beiden Modelle wurden nicht in einer gemeinsamen Testumgebung ausgeführt; dieser Vergleich stellt beide denselben öffentlichen Belegen gegenüber – und genau diese sind alles, was die beiden Unternehmen bislang vorgelegt haben.

Zwei stille Veröffentlichungen, acht Tage auseinander

Beide Modelle wurden ohne großes Aufheben veröffentlicht, was man unumwunden sagen sollte, da keines der beiden Unternehmen seither viel von sich hören ließ. IBMs Granite Speech 5.0 470M TurboCTC ist die Apache-2.0-Variante einer Zwei-Varianten-Veröffentlichung – IBM hat außerdem ein nicht-kommerzielles -NC-Pendant mit leicht besseren Eckdaten herausgebracht – und die zugehörige Modellkarte trägt ein Veröffentlichungsdatum vom 25. August 2026, mit nativer Transformers-Unterstützung und einer Open-ASR-Leaderboard-Meldung vom selben Tag. Microsofts Streaming-Paar VibeVoice-ASR-Streaming-7B und VibeVoice-ASR-Streaming-1.5B wurde am 2. September innerhalb derselben Minute auf Hugging Face erzeugt; die GitHub-News-Zeile, die „ein einheitliches Streaming-ASR-Modell ankündigt, das kontinuierlich transkribiert, wer was sagt, sobald Sprache eintrifft“, ist auf den 3. September datiert und nennt die 7B, wobei die hier behandelte 1.5B als das kleinere Geschwistermodell übrig bleibt, das still daneben veröffentlicht wurde.

Das Interessante ist, dass zwei Teams zum Wort „Streaming“ griffen und gegensätzliche Dinge bauten. Granite Speech 5.0 470M TurboCTC ist ein Conformer-Encoder, der mit CTC trainiert und in einem einzigen nicht-autoregressiven Durchlauf dekodiert wird – es gibt keinen Decoder, der Text Token für Token erzeugt, daher ist das Modell strukturell günstig und strukturell schnell. VibeVoice-ASR-Streaming-1.5B ist ein Speech-LLM: Zwei konvolutionale Tokenizer wandeln 24-kHz-Audio in einen ~7,5-Hz-Sprach-Token-Strom um, ein Decoder der Qwen2-Familie (28 Schichten, 1.536 versteckte Einheiten – die 1.5B-Klasse) liest ihn, und ein Diffusions-Head erzeugt das Transkript in Blöcken von etwa 2,9 Sekunden mit ungefähr einer halben Sekunde Vorausschau. Das eine ist ein Rennwagen; das andere ist ein kleines Sprachmodell, das zufällig zuhört.

Spec-Prüfung

• Parameter — Granite Speech 5.0 470M TurboCTC: 470M, nur Encoder vs. VibeVoice-ASR-Streaming-1.5B: ~3B gesamt (1,5B-Klasse-LM-Backbone plus Tokenizer und Diffusions-Head).

• Architektur — Conformer-Encoder mit Block-Self-Attention und Self-Conditioning, CTC-trainiert, nicht-autoregressive Greedy-Dekodierung vs. duale akustische/semantische Tokenizer, die einen kausalen Decoder der Qwen2-Familie mit einem DDPM-Diffusionskopf speisen.

• Ausgabetakt — ~12,5 Ausgabeframes pro Sekunde (chunkweises Streaming) gegenüber ~7,5 Hz Sprachtokens; Textausgabe pro ~2,9-s-Chunk mit ~0,5 s Vorausschau.

• Sprachen — nur Englisch vs. zehn: Chinesisch, Englisch, Französisch, Deutsch, Italienisch, Japanisch, Koreanisch, Portugiesisch, Russisch und Spanisch.

• Gewichte — etwa 0,5 Milliarden Parameter / ein Bruchteil eines GB (Edge-Klasse) vs. ~5,6 GB bf16 (NVIDIA-GPU-Klasse).

• Genauigkeit im Druck — IBM meldete durchschnittlich ~5,00 % WER bei den Open-ASR-Kurzform-Sets, während im Text keine WER-Zahl veröffentlicht wurde.

• Lizenz — Apache-2.0 vs. MIT.

• Veröffentlicht — 25. August 2026 vs 2. September 2026.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total / 1.5B-class LM, Architecture speech LLM + diffusion, Languages 10, Streaming ~2.9 s chunks + ~0.5 s lookahead, WER none published, License MIT. Right column Granite Speech 5.0 470M TurboCTC: Released Aug 25 2026, Params 470M, Architecture conformer CTC, Languages English only, Streaming chunkwise ~12.5 frames/s, WER ~5.00% (IBM-reported), License Apache-2.0. Footer reads 'Granite figures IBM-reported, unverified; VibeVoice specs read from the HF repo; no independent benchmark of either exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

Geschwindigkeit: Das eine ist darauf ausgelegt, klein zu sein, das andere darauf, ein Sprachmodell zu sein.

Der architektonische Unterschied zeigt sich zuerst in Geschwindigkeit und Hardware. Granite Speech 5.0 470M TurboCTC ist auf Laptops, Smartphones und andere Edge-Geräte ausgerichtet. Da ein reiner CTC-Encoder nichts abtastet – die Ausgabe ist ein einziger Greedy-Durchlauf über einen BPE-Head mit 16.384 Einheiten – ist er äußerst kostengünstig zu betreiben, und IBMs Modellkarte weist für die TurboCTC-Linie einen auf einer einzelnen H200 gemessenen Open-ASR-Durchsatzwert aus, der bei mehreren Zehntausend RTFx liegt, zusammen mit einer WebGPU-Demo, die live in einem Browser-Tab transkribiert. Diese Werte wurden bei IBM gemessen und sind nicht unabhängig reproduziert, aber der strukturelle Punkt steht für sich allein: Ein 470M-Encoder ohne autoregressiven Decoder ist ein Modell, das man auf Hardware ausführen kann, die ein Telefon mitbringt.

VibeVoice-ASR-Streaming-1.5B geht den entgegengesetzten Kompromiss ein. Sein Decoder ist ein kausales Sprachmodell, was bedeutet, dass Text in einer schwereren Schleife erzeugt wird als bei einem CTC-Argmax, und die dokumentierten Ausführungsmethoden sind Self-Hosting auf NVIDIA-GPUs – die Python-Demos des microsoft/VibeVoice-Repositorys oder sein vLLM-Plugin – mit etwa 5,6 GB bf16-Gewichten vor jeglichem KV-Cache. Microsoft hat keinen Durchsatz- oder Echtzeitfaktor-Anspruch veröffentlicht, es gibt also keine Herstellerzahl, die man gegen die von IBM stellen könnte. Was die LLM-Architektur stattdessen erkauft, ist Kontext: Das Modell trägt Sprecher- und Inhaltsverständnis über das Transkript hinweg, so wie es ein Sprachmodell tut, und genau das ist der Unterschied zwischen dem Transkribieren von Ton und dem Verfolgen eines Gesprächs.

Genauigkeit: Ein Anbieter druckte Zahlen, der andere druckte ein Bild.

Den Belegen nach liegt Granite Speech 5.0 470M TurboCTC um eine ganze veröffentlichbare Benchmark vor VibeVoice-ASR-Streaming-1.5B. IBM hat sein Modell am Tag der Veröffentlichung durch die offizielle Testumgebung des Open-ASR-Leaderboards laufen lassen und berichtet eine durchschnittliche Wortfehlerrate von etwa 5,00 % auf den öffentlichen englischen Kurzform-Sets – ein Wert, der vom Anbieter gemessen, von keiner dritten Partei verifiziert und auf der Microsoft-Seite dieses Vergleichs gänzlich fehlt. Die Modellkarte von VibeVoice-ASR-Streaming-1.5B enthält eine Abbildung der Auswertungsergebnisse, aber keine numerischen WER-, RTF- oder Latenzwerte im Fließtext; der einzige numerische Anker in der VibeVoice-Familie ist die vom Anbieter berichtete durchschnittliche WER von 7,77 % über acht englische Test-Sets auf der Karte des Batch-Modells VibeVoice-ASR, die das Nicht-Streaming-Modell beschreibt und nicht übertragbar ist. Wie auch immer die letztendlichen unabhängigen Läufe ausgehen, die ehrliche Zusammenfassung lautet heute: IBM hat eine Zahl veröffentlicht, und Microsoft hat ein Bild veröffentlicht.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Sprachen und Ausgabe: Nur Englisch versus Wer-sagte-was in zehn

Granite Speech 5.0 470M TurboCTC unterstützt nur Englisch und liefert rohen transkribierten Text. Das ist für die Workloads, die IBM anvisiert – englischsprachige Transkription in Unternehmen auf Edge-Hardware – kein Manko, aber es beendet den Vergleich in dem Moment, in dem Ihr Audio nicht Englisch ist. VibeVoice-ASR-Streaming-1.5B listet zehn Sprachen und beansprucht Streaming-Ausgabe mit Sprecherzuordnung: Die Modellkarte sagt, dass es „kontinuierlich transkribiert, wer was gesagt hat, während Sprache eintrifft", mit Hotwords für Domänenbegriffe, die als Kontext-Prompt übergeben werden. Beide Extras verdienen eine skeptische Betrachtung – Streaming-Diarisierung über Chunk-Grenzen hinweg ist wirklich schwierig, und die Behauptung ist unverifiziert –, aber sie sind der Grund, warum ein Team mit Live-Mehrsprach-Meetings überhaupt einen Blick auf Microsofts Modell werfen würde.

Lizenzierung und Ökosystem: Apache-2.0 versus MIT, Transformers versus ein Forschungs-Repository

Beide Lizenzen erlauben kommerzielle Nutzung, was dieses Paar bereits von IBMs eigener -NC-Variante derselben Architektur unterscheidet. Granite Speech 5.0 470M TurboCTC ist Apache-2.0 mit der üblichen Patentgewährung und nativ in Hugging Face Transformers verfügbar (AutoModelForCTC von transformers >= 5.16) sowie über mlx-audio für Apple Silicon — das heißt, es läuft überall dort, wo die größte Deployment-Community des Ökosystems läuft, auf Hardware beliebiger Anbieter. VibeVoice-ASR-Streaming-1.5B ist MIT, was noch einfacher ist, aber sein Serving-Pfad ist ein Research-Setup aus dem Quellcode: Die Architekturklasse des Checkpoints, VibeVoiceForASRStreamingTraining, ist nicht in der öffentlichen Transformers-Dokumentation, und Microsofts eigene Streaming-Dokumentation verweist auf den Demo-Code des Repos und ein vLLM-Plugin statt auf einen Standard-Library-Load. Für ein Produktionsteam ist der Unterschied real: Das eine Modell lässt sich heute in eine bestehende Transformers-Pipeline integrieren, und das andere verlangt, dass man ein Research-Repo aufsetzt und den Ladepfad selbst verifiziert.

A screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the model title Granite-Speech-5.0-470M-TurboCTC, the Apache-2.0 license tag, the English-language tag, the automatic-speech-recognition pipeline tag, and the model summary describing a compact 470 million parameter English ASR model for edge deployment.

Welche stille Veröffentlichung sollten Sie bewerten?

Bewerten Sie Granite Speech 5.0 470M TurboCTC zuerst, wenn Ihre Arbeitslast Englisch ist, Ihre Hardware Edge-Klasse oder CPU-gebunden ist und Sie ein Modell möchten, das sich in Transformers einfügen lässt und eine Kennzahl auf der Karte als Vergleichsbasis zur Plausibilitätsprüfung bietet. Es ist in jeder Hinsicht die risikoärmere Wahl, außer in einer: Es hilft Ihnen nicht bei einer zweiten Sprache oder einem Live-Besprechungsprotokoll, das wissen muss, wer gerade spricht.

Wenn Sie mehrsprachiges Streaming benötigen, Funktionen wie die Zuordnung, wer was gesagt hat, oder Hotwords testen möchten oder bei der Spracherkennung lieber auf einen Sprachmodell-Ansatz als auf einen reinen Encoder setzen, sollten Sie VibeVoice-ASR-Streaming-1.5B evaluieren. Rechnen Sie mit einer NVIDIA-GPU, einer Installation aus dem Quellcode, rund 5,6 GB Gewichten und einer Evaluierung, die Sie selbst entwerfen — denn niemand, auch Microsoft nicht, hat bislang eine Zahl veröffentlicht, auf die Sie sich verlassen können.

Was keine der ruhigen Veröffentlichungen ändert, ist der Wert, die ASR-Schicht austauschbar zu halten, während Sie herausfinden, welche Wette sich auszahlt. Beide Modelle sind jung, und keines wird derzeit über OrcaRouter angeboten; wenn ein Anbieter eines von beiden hostet, ist der risikoarme Weg, es zu testen, hinter einer Routing-Ebene, die über 200 Modelle zum Listenpreis des Anbieters anbietet – 0 % Aufschlag, sodass Preisänderungen am selben Tag wirksam werden – mit automatischem Failover auf das, dem Sie bereits vertrauen. Leiten Sie einen Teil echter Audiodaten an das neue Modell, lesen Sie die Transkripte, und lassen Sie Ihren eigenen Datenverkehr – nicht ein Benchmark-Blatt vom Veröffentlichungstag – entscheiden, welche stille Wette die richtige war.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube