Ein generiertes Hero-Titelbild für ‚VibeVoice-ASR-Streaming-1.5B vs. Whisper Large v3 Turbo: natives Streaming gegen das Arbeitstier für 99 Sprachen‘, mit dem Untertitel ‚Natives Streaming gegen das Arbeitstier für 99 Sprachen‘,{{1}} mit zwei Modellkarten{{/1}} — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2. Sept. 2026 · MIT · Streaming-nativ · 10 Sprachen){{2}} und{{/2}} Whisper Large v3 Turbo (OpenAI · Okt. 2024 · MIT · Stapelverarbeitung · 99 Sprachen){{3}} — sowie{{/3}} Tags mit ‚~2,9-s-Chunks + ~0,5-s-Vorausschau‘,{{4}} ‚Über 7 Mio. Downloads/Monat (Whisper)‘{{/4}} und ‚Noch kein Benchmark veröffentlicht‘.{{5}} Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.{{/5}}
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs. Whisper Large v3 Turbo: Natives Streaming gegen das Arbeitstier für 99 Sprachen

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die Chancen stehen gut, dass das Speech-to-Text-Modell, das Sie heute betreiben, Whisper Large v3 Turbo ist – und ein neues Modell stellt die Frage, ob das so bleiben sollte. OpenAIs Whisper Large v3 Turbo – der im Oktober 2024 veröffentlichte, destillierte 809M-Parameter-Checkpoint – ist das Open-Weight-Arbeitstier: 99 Sprachen, etwa vier- bis achtmal schneller als das ursprüngliche large-v3, klein genug für einen Laptop, MIT-lizenziert und unterstützt vom größten Transkriptions-Ökosystem, das es gibt. VibeVoice-ASR-Streaming-1.5B, am 2. September 2026 von Microsoft Research hochgeladen, ist der Herausforderer, der für genau das gebaut wurde, was Whisper nicht nativ kann: Streaming. Es transkribiert in Häppchen, während das Audio eintrifft, statt feste Fenster zu verschlucken, gibt eine sprecherattribuierte Ausgabe an – und hat zehn Sprachen und keinen einzigen veröffentlichten Benchmark vorzuweisen.

Eben diese letzte Aussage ist der Grund, warum diese Seite um eine Migrationsfrage herum aufgebaut ist und nicht um ein direktes Duell. Die Messwerte von Whisper Large v3 Turbo sind gemessen und öffentlich – LibriSpeech, der Open-ASR-Composite, Common Voice – während die Modellkarte von VibeVoice-ASR-Streaming-1.5B weder WER- noch Latenzzahlen in Textform veröffentlicht und zum Zeitpunkt der Erstellung dieses Textes kein unabhängiger Benchmark existiert. Alles, was im Folgenden über die Microsoft-Seite gesagt wird, ist das, was aus ihrem Repository ersichtlich ist: die Konfigurationsdateien, die Modellkarte und Microsofts Streaming-Dokumentation. Alles über die Whisper-Seite ist eine feststehende öffentliche Tatsache. Die beiden wurden nicht direkt gegeneinander getestet; der Vergleich findet statt zwischen dem, was bewiesen ist, und dem, was versprochen wird.

Das Modell, das Sie wahrscheinlich bereits ausführen.

Whisper Large v3 Turbo hat sich seinen Platz auf die unglamouröse Art verdient: Es ist schnell, klein, mehrsprachig und in der Art langweilig, wie Produktionsteams es mögen. Aus dem Whisper large-v3 mit 1,55 Milliarden Parametern auf 809 Millionen Parameter destilliert, deckt es weiterhin 99 Sprachen ab und erreicht rund 95 % der Genauigkeit von large-v3 – etwa 2,1 % WER auf LibriSpeech clean, rund 7,7–7,8 % im Open-ASR-Gesamtwert, mit den größten Einbußen bei ressourcenarmen und tonalen Sprachen. Dabei läuft es um ein Vielfaches schneller und kommt mit etwa 1,6 GB VRAM in FP16 aus. Es ist MIT-lizenziert, läuft über faster-whisper, whisper.cpp und Integrationen aus drei Jahren. Seine Hugging-Face-Seite verzeichnet über sieben Millionen Downloads in einem einzigen Monat. Wenn Sie Transkription selbst hosten, steckt dahinter sehr wahrscheinlich genau dieses Modell.

Was Whisper Large v3 Turbo nicht ist — und auch nie behauptet hat zu sein —, ist ein Streaming-Modell. Es verarbeitet Audio in festen 30-Sekunden-Fenstern und gibt pro Fenster ein Transkript zurück; es verfügt über keine native Sprachaktivitätserkennung, kein Endpointing, keine Sprecherdiarisierung und keinen Hotword-Mechanismus. Live-Transkription mit Whisper ist immer ein Retrofit, das man selbst baut — und genau in diesem Retrofit liegen die Latenz und der Entwicklungsaufwand.

Was ändert sich eigentlich, wenn du wechselst?

• Latenzmodell — VibeVoice-ASR-Streaming-1.5B gibt Text jedes Mal aus, sobald ein Chunk von etwa 2,9 Sekunden aufgelöst ist, mit ca. 0,5 s Vorausschau – bewusst anders als Whisper Large v3 Turbo, einem Batch-Modell mit 30-Sekunden-Fenster, das eine Chunking- und Stitching-Ebene benötigt, um Live-Ausgaben zu approximieren.

• Sitzungsform — unbegrenzte Live-Sitzungen, bei denen der Kontext über Chunks hinweg in einem Präfix-Cache mitgeführt wird, gegenüber diskreten 30-Sekunden-Fenstern ohne fensterübergreifenden Konversationszustand.

• Sprachen — zehn (Chinesisch, Englisch, Französisch, Deutsch, Italienisch, Japanisch, Koreanisch, Portugiesisch, Russisch, Spanisch) vs. 99.

• Genauigkeit in der Literatur — keine veröffentlicht vs. ~2,1 % LibriSpeech clean, ~7,7–7,8 % Open ASR composite, alle gemessen und öffentlich.

• Ausgabe-Extras — wirbt mit Streaming-Zuordnung, wer was gesagt hat, und Hotwords; Wort-Zeitstempel verfügbar, aber keine Diarisierung und keine nativen Hotwords.

• Hardware — ~5,6 GB bf16-Gewichte auf einer NVIDIA-GPU (Installation aus dem Quellcode) vs. ~1,6 GB FP16; läuft auf Laptops und CPUs über whisper.cpp und faster-whisper.

• Lizenz — MIT, beides.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Streaming native ~2.9 s chunks, Languages 10, WER none published, Extras who-said-what + hotwords, Hardware ~5.6 GB NVIDIA GPU, License MIT. Right column Whisper Large v3 Turbo: Released Oct 2024, Streaming none / 30 s windows, Languages 99, WER ~2.1% LibriSpeech clean, Extras timestamps, no diarization, Hardware ~1.6 GB laptop-class, License MIT. Footer reads 'Whisper figures measured and public; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

Das Streaming-Retrofit-Problem

Die ehrliche Betrachtung dieses Matchups ist, dass Whisper Large v3 Turbo ein Streaming-Problem hat, für das man bereits bezahlt hat – oder noch bezahlt. Eine Live-Pipeline mit Whisper bedeutet: einen Sprachaktivitätsdetektor, um Sprache zu finden, einen Chunker, der Audio in Whisper-große Fenster schneidet, überlappende Fenster, damit an den Grenzen keine Wörter verloren gehen, und einen Stitcher, der die Teiltranskripte zusammenführt. Community-Implementierungen dieses Stacks liegen bei etwa einer bis fünf Sekunden End-to-End-Latenz – für Besprechungsnotizen brauchbar, aber unter der Messlatte für Telefonagenten und Live-Untertitelung.

VibeVoice-ASR-Streaming-1.5B macht das Retrofit durch seine Konstruktion überflüssig. Seine Preprocessor-Konfiguration legt für einen Sprach-Token-Stream mit etwa 7,5 Hz einen Chunk von 22 Frames und einen Lookahead von 4 Frames fest — also etwa 2,9 Sekunden Audio pro ausgegebenem Segment und eine halbe Sekunde Kontext aus der Zukunft. Microsofts Dokumentation beschreibt, dass der Kontext früherer Chunks über den KV-Cache erhalten bleibt, sodass eine Live-Sitzung die Berechnung nicht von Grund auf neu durchführen muss. Aber das Wort „Streaming“ sollte man auf beiden Seiten dieses Vergleichs genau lesen: Keines der Modelle ist eine Engine für wortweise Teilergebnisse, wie sie die kommerziellen APIs mit der geringsten Latenz anbieten. Das Transkript von VibeVoice wächst konstruktionsbedingt in Schritten von etwa drei Sekunden, was für Besprechungen ein anderer und meist akzeptabler Rhythmus ist, aber nicht im Sub-Sekundenbereich liegt. Wenn Ihre Anforderung lautet, dass Wörter innerhalb einer Sekunde auf dem Bildschirm erscheinen, sollten Sie diese Chunk-Geometrie an diesem Budget messen, bevor Sie darauf aufbauen.

Genauigkeit: Worauf Sie verzichten, um auf natives Streaming umzusteigen

Hier ist die Lücke, die für die Entscheidung maßgeblich sein sollte. Whisper Large v3 Turbo hat einen öffentlichen Genauigkeitsnachweis, den Sie prüfen können — und wenn die Aufnahme in einer seiner 99 Sprachen liegt, ist dieser Nachweis stark. VibeVoice-ASR-Streaming-1.5B hat keinen solchen Nachweis: Die Bewertung auf der Modellkarte ist ein Bild, Microsoft hat keinen Streaming-WER in Textform veröffentlicht, und der einzige numerische Anker in der Familie ist der vom Anbieter gemeldete durchschnittliche WER von 7,77 % über acht englische Testdatensätze auf der Karte des Batch-Modells VibeVoice-ASR, das ein anderes, nicht-streaming Modell beschreibt. Die ehrliche Aussage ist, dass die Umstellung Ihrer Transkription auf VibeVoice-ASR-Streaming-1.5B heute bedeutet, ein unbekanntes Genauigkeitsniveau für Ihre eigenen Audiodaten zu akzeptieren — genau deshalb muss jede Bewertung des Modells von Ihnen selbst an Ihren schwierigsten realen Aufnahmen durchgeführt werden, bevor es Produktionsverkehr verdient.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Sprachen und Sprecherzuordnung: Die Funktionslücke wirkt in beide Richtungen.

Der Funktionsvergleich ist nicht einseitig, und genau das macht die Entscheidung wirklich interessant. Wenn Ihr Audio mehrsprachig ist, endet die Entscheidung sofort: Die 99 Sprachen von Whisper Large v3 Turbo decken ab, was VibeVoice-ASR-Streaming-1.5Bs zehn nicht abdecken, und eine Obergrenze von zehn Sprachen ist disqualifizierend für jede Pipeline, die ein breites Spektrum an Sprache verarbeitet. Wenn Ihre Arbeitslast jedoch innerhalb dieser zehn Sprachen liegt und Sie eigentlich wissen müssen, wer in einem Live-Meeting was gesagt hat, zeigt der Pfeil in die andere Richtung: Whisper bietet keine native Diarisierung und keine Hotwords, während VibeVoice-ASR-Streaming-1.5B beides beansprucht — Streaming-Sprecherattribuierung und domänenspezifische Hotwords als Kontext-Prompt. Der Anspruch ist unverifiziert, und Streaming-Diarisierung über Chunk-Grenzen hinweg ist schwer genug, dass sie Skepsis verdient, aber es ist das konkrete Feature, das Ihnen keine noch so große Whisper-Entwicklungsarbeit out of the box liefert.

Die Mathematik der Migration.

Kosten und Aufwand sprechen für das etablierte System. Whisper Large v3 Turbo läuft bereits in Ihrem Stack auf Hardware, die Ihnen gehört — einem Laptop, einer CPU, einer bescheidenen GPU — und der Wechsel zu VibeVoice-ASR-Streaming-1.5B bedeutet, eine Forschungsinstallation aus dem Quellcode auf einer NVIDIA-GPU mit ~5,6 GB Gewichten aufzusetzen, einen Ladepfad zu verifizieren, dessen Architekturklasse noch nicht in der öffentlichen Transformers-Dokumentation enthalten ist, und den Benchmark, von dem Ihre Entscheidung abhängt, von Grund auf neu zu erstellen. Das ist ein echtes Projekt, und der Nutzen stellt sich nur dann ein, wenn die unverifizierten Funktionen für Sie tatsächlich relevant sind.

A screenshot of the Hugging Face model card for openai/whisper-large-v3-turbo, showing the OpenAI namespace, the model title Whisper, the MIT license tag, the 99-languages tag, and the automatic-speech-recognition pipeline tags, with the description of Whisper as a state-of-the-art automatic speech recognition model.

Der günstige Weg, dieses Projekt zu betreiben, ist, es nicht als Austausch zu behandeln. Behalten Sie Whisper Large v3 Turbo als Standard und leiten Sie einen Teil des Live-Audios über eine einzige API an VibeVoice-ASR-Streaming-1.5B weiter – das Muster, für das eine Routing-Schicht gedacht ist: 200+ Modelle hinter einem einzigen Endpunkt zum Listenpreis des Anbieters ohne Aufschlag, automatisches Failover, wenn das neue Modell ins Stocken gerät, und eine Routing-DSL, die es verschiedenen Workloads ermöglicht, aus einem einzigen Aufruf verschiedene Transkriptoren auszuwählen. Das ist das Modell von OrcaRouter, und es ist der Unterschied zwischen dem Setzen Ihrer Produktionspipeline auf einen zwei Tage alten Checkpoint und dem Zulassen, dass dieser Checkpoint sich seinen Platz gegenüber dem Arbeitstier anhand Ihrer eigenen Transkripte verdient.

Häufig gestellte Fragen

Kann Whisper Large v3 Turbo überhaupt Live-Streaming machen?

Nur als Nachrüstung. Whisper Large v3 Turbo ist ein Batch-Modell, das feste 30-Sekunden-Fenster verarbeitet. Für Live-Transkription müssen Sie daher einen Sprachaktivitätsdetektor, einen Chunker, eine Überlappungsstrategie und einen Stitcher darum herum aufbauen. Arbeitsfähige Implementierungen existieren und erreichen Latenzen von etwa einer bis fünf Sekunden, was für Besprechungsnotizen passt, aber die Sub-Sekunden-Anforderungen für Telefonagenten und Live-Untertitelung verfehlt. VibeVoice-ASR-Streaming-1.5B ist streaming-nativ — es gibt pro ~2,9-Sekunden-Chunk Text mit ~0,5 Sekunden Vorausschau aus — aber es handelt sich um Chunk-Streaming, nicht um wortweise Teilergebnisse. Prüfen Sie diesen Takt also auch gegen Ihr eigenes Latenzbudget.

Ist VibeVoice-ASR-Streaming-1.5B genauer als Whisper Large v3 Turbo?

Niemand kann das bisher beantworten, auch Microsoft nicht. Die Genauigkeit von Whisper Large v3 Turbo ist gemessen und öffentlich — etwa 2,1 % WER auf LibriSpeech clean und 7,7–7,8 % auf dem Open-ASR-Verbund. VibeVoice-ASR-Streaming-1.5B hat zum Zeitpunkt dieses Schreibens keine veröffentlichte Streaming-WER-Zahl in Textform und keinen unabhängigen Benchmark. Der einzige Weg, die Frage zu beantworten, besteht darin, den Checkpoint auf Ihrem eigenen Audiomaterial auszuführen und die Transkripte mit Ihrem bisherigen System zu vergleichen — genau das ist der Test, den diese Seite vor jeder Migration empfiehlt.

Welche Sprachen unterstützen die beiden?

Whisper Large v3 Turbo unterstützt 99 Sprachen mit einem einzigen Gewichtssatz. VibeVoice-ASR-Streaming-1.5B listet zehn auf: Chinesisch, Englisch, Französisch, Deutsch, Italienisch, Japanisch, Koreanisch, Portugiesisch, Russisch und Spanisch. Für jegliches Audio außerhalb dieser Zehn-Sprachen-Gruppe ist Whisper in dieser Kombination die einzige Option, und die Lücke bei der Mehrsprachigkeit ist der mit Abstand deutlichste Grund, warum die meisten Teams bei ihrer bisherigen Lösung bleiben.

Whisper Large v3 Turbo ist für die meisten Teams die meiste Zeit das richtige Modell, und ein zwei Tage alter Checkpoint ohne Benchmarks ist kein Grund, die Plattform zu wechseln. Es ist ein Grund, ein Experiment durchzuführen. Wenn Ihre Audioinhalte in seinen zehn Sprachen liegen und eine Live-Sprecherzuordnung Ihr Produkt verändern würde, setzen Sie VibeVoice-ASR-Streaming-1.5B hinter einem Router auf, lenken Sie einen Teil des echten Datenverkehrs darauf und lassen Sie die Transkripte – nicht das Fehlen eines Benchmarks auf beiden Seiten – die Entscheidung treffen.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube