Eine Hero-Titelkarte, die „VibeVoice-ASR-Streaming-7B vs. Whisper Large v3 Turbo“ vergleicht. Überzeile: „ASR mit offenen Gewichten – Sept. 2026“. Untertitel: Microsofts Streaming-Checkpoint trifft auf das Standardmodell mit offenen Gewichten – was Streaming zusätzlich bringt und was 0,8B im Vergleich zu 9B Parametern kostet. Chips: „Gewichte unter MIT-Lizenz – 2. Sept.“, „Gewichte unter MIT-Lizenz – 2024“ und „Whisper: 99 Sprachen“. Fußnote: „Whispers Rekord ist öffentlich“. Das OrcaRouter-Logo ist unten rechts eingefügt.
Guides & Insights

VibeVoice-ASR-Streaming-7B vs. Whisper Large v3 Turbo: Was Microsofts Streaming-Checkpoint zum Open-Weight-Standard hinzufügt

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

In den letzten zwei Jahren lautete die Antwort auf „selbst transkribieren, kostengünstig" zumeist Whisper Large v3 Turbo — OpenAIs Modell mit offenen Gewichten und 809 Millionen Parametern, MIT-lizenziert, 99 Sprachen, klein genug für eine Workstation und kostenlos, sobald man die Hardware besitzt. Am 2. September 2026 hat Microsoft Research einen Herausforderer für diesen Standard hochgeladen: VibeVoice-ASR-Streaming-7B, einen MIT-lizenzierten Streaming-Checkpoint auf Hugging Face, der transkribiert, während das Audio eintrifft, eine sprecherattribuierte Ausgabe beansprucht und — anders als das Modell, das die meisten Teams bereits ausführen — nie als Batch-Job konzipiert war. Beide Modelle haben offene Gewichte von großen Laboren. Fast alles andere an ihnen ist ein Kompromiss, und auf dieser Seite geht es darum, welchen Kompromiss du tatsächlich eingehst.

Eine Asymmetrie prägt den gesamten Vergleich, also kommt sie zuerst. Whisper Large v3 Turbo ist das am unabhängigsten reproduzierte Sprachmodell der Welt: Seine Wortfehlerraten wurden jahrelang von Tausenden von Teams auf öffentlichen Benchmarks und mit ihrem eigenen Audiomaterial erneut ermittelt, und seine Schwächen sind ebenso dokumentiert wie seine Stärken. VibeVoice-ASR-Streaming-7B ist einen Tag alt, hat nirgendwo einen unabhängigen Benchmark, und Microsoft hat keine Streaming-Wortfehlerrate in lesbarem Text veröffentlicht. Alles auf der Microsoft-Seite unten stammt aus dem Repository – Konfiguration, Modellkarte und Microsofts Streaming-Dokumentation – und ist entsprechend gekennzeichnet.

Der Open-Weights-Standard und warum er Bestand hat

Whisper Large v3 Turbo ist das destillierte Geschwistermodell von Whisper Large v3: Es behält den Encoder mit 32 Schichten bei und reduziert den Decoder von 32 auf vier Schichten, wodurch die Parameterzahl auf 809 M sinkt und sich der Durchsatz auf GPUs etwa vervierfacht, während die Genauigkeit nahezu gleich bleibt. Da die Gewichte unter der MIT-Lizenz stehen und das Modell klein ist, wurde es zur Standard-Engine für eingebettete Transkription in Meeting-Bots, Untertitel-Tools und Call-Logging-Pipelines. Seine Grenzen sind ebenso bekannt. Es ist ein Batch-Modell – es nimmt eine Audiodatei entgegen und liefert ein Transkript, anstatt Wörter während des Sprechens zu erzeugen. Es wurde nicht für Übersetzung trainiert, und bei dieser Aufgabe lässt die Leistung stark nach. Seine Genauigkeit bei verrauschter, akzentbehafteter oder überlappender Sprache ist uneinheitlich, und es liefert reinen Text: standardmäßig keine Zeichensetzung oder Großschreibung, keine Sprecher-Diarisierung, keine Zeitstempel in dieser Variante, kein Keyword-Biasing. Produktionsumgebungen, die auf Whisper aufbauen, setzen diese Komponenten separat zusammen, wobei jede ihre eigene Latenz und eigene Fehlermodi mit sich bringt.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

Die Spec-Lücke

• Parameter — 809M (destillierter Decoder) gegenüber etwa 9B insgesamt (ein Qwen2-7B-Sprach-Backbone plus Sprach-Encoder; die „7B“ beziehen sich auf das LLM, während die Hugging-Face-Seite 9B angibt).

• Lizenz — MIT, offene Gewichte, beides.

• Streaming — grundsätzlich batchbasiert: Selbst gehostete Streaming-Implementierungen kommen typischerweise auf 1–5 Sekunden Latenz; streaming-native Lösungen dagegen: ~2,9-Sekunden-Chunks mit ~0,5-Sekunden-Lookahead; Text wird pro Chunk ausgegeben; der Kontext bleibt in einem KV-Cache erhalten.

• Sprachen — 99 mit jahrelanger Community-Reproduktion gegenüber einer angegebenen 10 (en, zh, es, pt, de, ja, ko, fr, ru, it).

• Jenseits des Transkripts — standardmäßig keine vs. behauptete Streaming-Ausgabe mit Wer-hat-was-gesagt-Zuordnung und individualisierte Hotwords (unverifiziert).

• Veröffentlichte Genauigkeit — 2,1 % WER bei LibriSpeech test-clean, 4,2 % bei test-other, ~7,7 % bei der Open-ASR-Gesamtauswertung, 8–12 % bei verrauschtem Audio in Community-Tests, alles unabhängig reproduziert — wohingegen keinerlei Streaming-WER-Zahl als Text veröffentlicht wurde.

• Ressourcenbedarf — läuft auf einem Laptop oder einer einzelnen moderaten GPU, verglichen mit etwa 18 GB bf16-Gewichten vor dem KV-Cache; planen Sie eine GPU der 24-GB-Klasse ein.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): parameters - about 9B (Qwen2-7B + encoders); streaming - native, ~2.9 s chunks; WER in print - none in text; output extras - claimed speaker IDs + hotwords; languages - 10 declared; hardware - ~18 GB bf16, 24 GB-class GPU. Right column Whisper Large v3 Turbo (open weights, released 2024): 809M distilled; batch, 1-5 s self-host streaming; 2.1% / 4.2% LibriSpeech, ~7.7% Open ASR; none by default; 99; laptop to small GPU. Footer: 'Whisper WER independently reproduced. VibeVoice specs read from the HF repo; no benchmark exists yet.'

Was Streaming tatsächlich hinzufügt

Der Grund, überhaupt über Whisper Large v3 Turbo hinauszusehen, ist die Live-Spur – und genau hier hören die beiden Modelle auf, vergleichbar zu sein. Whisper ist batch-orientiert: Um Wörter zu erhalten, während noch gesprochen wird, müssen Teams Chunking, Voice-Activity-Erkennung und Klebecode nachrüsten, und selbst gehostete Streaming-Implementierungen kommen typischerweise auf Latenzen von ein bis fünf Sekunden. Die Sub-Sekunden-Marke für Telefonagenten und Live-Untertitelung verfehlen sie damit ohne ernsthafte Entwicklungsarbeit. VibeVoice-ASR-Streaming-7B ist für genau diese Spur gebaut. Seine Konfiguration zeigt Audio, das um das 3.200-Fache auf einen Token-Stream mit 7,5 Frames pro Sekunde komprimiert und in Chunks von 22 Frames mit einem Vorausschau-Fenster von vier Frames verarbeitet wird – also etwa 2,9 Sekunden Audio pro Chunk. Text wird ausgegeben, sobald ein Chunk aufgelöst ist, und früherer Kontext wird im KV-Cache mitgeführt, sodass eine Sitzung nicht von Grund auf neu berechnet werden muss. Dieser Takt ist eine aus der Konfiguration abgeleitete Designvorgabe, keine gemessene Latenz, und bislang hat niemand einen End-to-End-Wert dafür veröffentlicht. Die Architektur ist jedoch eindeutig eine Live-Transkriptionsarchitektur – Whisper ist das nicht.

Whispers Aufzeichnung ist lang und öffentlich; die des neuen Checkpoints ist leer.

Genauigkeit ist der Bereich, in dem das Alter von Whisper Large v3 Turbo ein Vorteil ist. Seine 2,1 % WER bei LibriSpeech test-clean und 4,2 % bei test-other sind Open-Weights-Werte, die von unzähligen Teams reproduziert wurden; seine etwa 7,7 % im Open-ASR-Leaderboard-Composite liegen etwa einen Punkt hinter dem vollständigen Large v3; und seine dokumentierten 8–12 % bei verrauschtem Audio in Community-Tests bedeuten, dass niemand davon überrascht ist. Diese Schwächen sind Teil der Bilanz – sie zeigen dir genau, wo das Modell Hilfe benötigt, bevor du darauf aufbaust.

VibeVoice-ASR-Streaming-7B hat keinerlei derartige Referenzen. Seine Modellkarte enthält eine Bewertungsgrafik als Bild, und Microsofts technischer Streaming-Bericht ist ein PDF, aber es gibt keine zitierbare Streaming-Wortfehlerrate in Prosa. Der einzige numerische Anker in der Familie ist die vom Anbieter gemeldete Tabelle der Batch-VibeVoice-ASR-Modellkarte – 7,77 % durchschnittliche Wortfehlerrate über acht englische Testdatensätze und 2,20 % auf LibriSpeech clean –, was nicht der Wert dieses Checkpoints ist. Auch die Rezeption des Batch-Modells selbst in der Community war gemischt: gelobt für die Diarisierung ohne weitere Konfiguration, kritisiert als schwergewichtig und gelegentlich halluzinationsanfällig. Davon überträgt sich nichts auf das Streaming-Modell, und genau das ist der Punkt: Bei Whisper kennt man die Fehlermodi im Voraus; bei VibeVoice-ASR-Streaming-7B ist man der erste Tester.

Sprachen und Footprint: 99 gegenüber 10, 0,8 Mrd. gegenüber 9 Mrd.

Die beiden konkretesten Kosten eines Umstiegs sind Sprachen und Größe. Whisper Large v3 Turbo transkribiert 99 Sprachen; Sprachen mit geringen Ressourcen und tonale Sprachen lassen nach – Thai, Kantonesisch und Walisisch sind die am häufigsten genannten Schwachstellen –, aber hinter der Liste liegen Jahre der Reproduktion durch die Community. VibeVoice-ASR-Streaming-7B nennt zehn: Englisch, Chinesisch, Spanisch, Portugiesisch, Deutsch, Japanisch, Koreanisch, Französisch, Russisch und Italienisch. Wenn Ihr Datenverkehr in diese zehn Sprachen fällt, ist die Abdeckung kein Thema; wenn nicht, endet der Vergleich hier. Größe ist der zweite Kostenfaktor: Ein Modell mit 809M Parametern läuft auf einem Laptop, während ein Modell mit etwa 9B Gesamtparametern in bf16 ungefähr 18 GB an Gewichten vor dem KV-Cache und eine GPU der 24-GB-Klasse erfordert, um es komfortabel zu betreiben. Für Teams, die Whisper bereits auf bescheidener Hardware betreiben, ist das ein echter Infrastruktursprung, der nur durch eine echte Live-Transkriptionsanforderung gerechtfertigt ist.

Wenn Freiheit nicht der Punkt ist

Whisper Large v3 Turbo ist kostenlos ausführbar; die Kosten entstehen durch die Hardware und das Engineering darum herum. Eine faster-whisper-Bereitstellung auf einer einzelnen T4 kostet bei den üblichen GPU-Preisen in der Größenordnung von 0,05 bis 0,10 US-Dollar pro Audiostunde, und bei einer Dauerlast kommt der Diarisierungs- und Interpunktions-Stack hinzu, den man bauen muss, weil Whisper nur reinen Text liefert. VibeVoice-ASR-Streaming-7B ist ebenfalls kostenlos ausführbar, allerdings auf teurerer Hardware, im Gegenzug für eine Streaming-Architektur, die Sprecherzuordnung und Kontextsteuerung bietet, die Whisper fehlen – Behauptungen, die man selbst verifizieren müsste, da es keinen unabhängigen Benchmark gibt. Für die Stapeltranskription großer Mengen haben weiterhin der Durchsatz von Whisper und sein geringer Ressourcenbedarf die Nase vorn. Für Live-Audio mit mehreren Sprechern, bei dem das Transkript während des Gesprächs verfügbar sein muss, arbeitet Whisper gegen sein Design und der Streaming-Checkpoint im Einklang damit – falls er überhaupt funktioniert, und genau das ist die Frage, die man mit eigenem Audio auf eigener GPU beantworten muss.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

Der pragmatische Stack

Die häufigste Antwort in der Praxis lautet nicht „Entweder-oder“, sondern „beides“ — und genau das ist hier die Empfehlung: Whisper Large v3 Turbo als Batch-Pfad für hohe Volumina beibehalten, wo seine Erfolgsbilanz und sein Footprint unschlagbar sind, und VibeVoice-ASR-Streaming-7B auf dem Live-Pfad evaluieren, den Whisper mit der geforderten Latenz nicht bedienen kann — mit einem expliziten Evaluierungs-Gate, denn es gibt keinen Benchmark, auf den man sich stützen könnte. Beide können sich ein GPU-Budget und eine Codebasis teilen. Eine Routing-Ebene verdient ihren Platz in diesem Stack auf der Ebene oberhalb der Transkripte, nicht bei der Transkription selbst: OrcaRouter routet heute keine Sprach-zu-Text-Anfragen und keines der beiden Modelle steht in seinem Katalog, aber die Zusammenfasser, Alarmregeln und Agentenplaner, die ein Live-Transkript verarbeiten, sind genau die 200+ Sprachmodelle, die es über eine einzige API zugänglich macht — zu den Listenpreisen der Anbieter, ohne Aufschlag und mit automatischem Failover zwischen den Anbietern. Ein Streaming-Checkpoint, der ohne einen einzigen Benchmark veröffentlicht wird, verdient dieselbe Behandlung wie jedes unbewiesene Modell: einen Teil des realen Datenverkehrs hinter einem Fallback, der Ihr Vertrauen anhand der Ergebnisse aus Ihren eigenen Besprechungen gewinnt oder verliert, nicht anhand einer Modellkarte.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube