Ett genererat hero-titelkort för 'VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo: nativ streaming mot arbetshästen för 99 språk', med undertexten 'Nativ streaming mot arbetshästen för 99 språk', med två modellkort — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 september 2026 · MIT · Streaming-nativ · 10 språk) och Whisper Large v3 Turbo (OpenAI · oktober 2024 · MIT · Batch · 99 språk) — samt taggar som lyder '~2,9 s chunks + ~0,5 s lookahead', '7M+ nedladdningar/månad (Whisper)' och 'Ingen benchmark publicerad ännu'. OrcaRouter-logotypen är kompositerad i nedre högra hörnet.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo: nativ strömning mot arbetshästen för 99 språk

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det finns en god chans att den tal-till-text-modell du kör idag är Whisper Large v3 Turbo, och det finns en ny modell som ställer frågan om den borde vara det. OpenAIs Whisper Large v3 Turbo – den destillerade 809M-parameters-checkpointen som släpptes i oktober 2024 – är arbetshästen med öppna vikter: 99 språk, ungefär fyra till åtta gånger snabbare än den ursprungliga large-v3, tillräckligt liten för en bärbar dator, MIT-licensierad och understödd av det största transkriptionsekosystem som finns. VibeVoice-ASR-Streaming-1.5B, uppladdad av Microsoft Research den 2 september 2026, är utmanaren byggd för det enda Whisper inte gör inbyggt: streama. Den transkriberar i bitar när ljudet kommer in i stället för att svälja fasta fönster, den hävdar talarattribuerad utdata, och den har tio språk och ingen publicerad benchmark till sitt namn.

Den sista klausulen är anledningen till att den här sidan är uppbyggd kring en migrationsfråga snarare än en kraftmätning. Siffrorna för Whisper Large v3 Turbo är uppmätta och offentliga — LibriSpeech, Open ASR:s sammansatta mått, Common Voice — medan modellkortet för VibeVoice-ASR-Streaming-1.5B inte publicerar något WER- eller latensvärde i text, och inget oberoende benchmark finns i skrivande stund. Allt om Microsoft-sidan nedan är vad som går att utläsa ur dess repository: konfigurationsfilerna, modellkortet och Microsofts streamingdokumentation. Allt om Whisper-sidan är väletablerad offentlig information. De två modellerna har inte körts mot varandra; jämförelsen står mellan det bevisade och det utlovade.

Den modell du förmodligen redan kör.

Whisper Large v3 Turbo förtjänade sin plats på det oglamorösa sättet: den är snabb, liten, flerspråkig och tråkig på de sätt som produktionsteam gillar. Destillerad från Whisper large-v3 med 1,55 miljarder parametrar ner till 809 miljoner parametrar behåller den täckning för 99 språk och ungefär 95 % av large-v3:s noggrannhet — cirka 2,1 % WER på LibriSpeech clean, runt 7,7–7,8 % på Open ASR-kompositen, med den största försämringen på lågresursspråk och tonspråk — samtidigt som den körs flera gånger snabbare och ryms i cirka 1,6 GB VRAM i FP16. Den är MIT-licensierad, den körs via faster-whisper, whisper.cpp och tre års integrationer, och dess Hugging Face-sida visar över sju miljoner nedladdningar på en enda månad. Om du själv hostar transkribering är detta med största sannolikhet modellen som gör jobbet.

Det Whisper Large v3 Turbo inte är, och aldrig har hävdat sig vara, är en streamingmodell. Den tar emot ljud i fasta 30-sekundersfönster och returnerar en transkription per fönster; den har ingen inbyggd röstaktivitetsdetektering, ingen endpointing, ingen talardiarisering och ingen hotword-mekanism. Live-transkribering på Whisper är alltid en efterkonstruktion som du bygger – och det är i efterkonstruktionen som latensen och den tekniska kostnaden ligger.

Vad förändras egentligen om du byter?

• Latensmodell — VibeVoice-ASR-Streaming-1.5B är konstruerad för att generera text en gång per färdigställt segment på cirka 2,9 sekunder med ~0,5 s framförhållning, till skillnad från Whisper Large v3 Turbo: en batchmodell med 30-sekundersfönster som kräver ett segmenterings- och sammanfogningslager för att approximera realtidsutdata.

• Sessionsform — obegränsade livesessioner, där kontexten förs vidare mellan segment i en prefixcache, jämfört med separata 30-sekundersfönster utan konversationstillstånd mellan fönstren.

• Språk — tio (kinesiska, engelska, franska, tyska, italienska, japanska, koreanska, portugisiska, ryska, spanska) vs 99.

• Noggrannhet i tryck — ingen publicerad vs ~2,1 % LibriSpeech clean, ~7,7–7,8 % Open ASR composite, allt uppmätt och offentligt.

• Extra utdata — man hävdar strömmande vem-sa-vad-attribuering och hotwords, medan ordtidsstämplar finns tillgängliga, men ingen diarisering och inga hotwords inbyggt.

• Hårdvara — ~5,6 GB bf16-vikter på en NVIDIA GPU, installation från källkod jämfört med ~1,6 GB FP16, körs på bärbara datorer och CPU:er via whisper.cpp och faster-whisper.

• Licens — MIT, båda.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Streaming native ~2.9 s chunks, Languages 10, WER none published, Extras who-said-what + hotwords, Hardware ~5.6 GB NVIDIA GPU, License MIT. Right column Whisper Large v3 Turbo: Released Oct 2024, Streaming none / 30 s windows, Languages 99, WER ~2.1% LibriSpeech clean, Extras timestamps, no diarization, Hardware ~1.6 GB laptop-class, License MIT. Footer reads 'Whisper figures measured and public; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

Problemet med streaming-retrofit

Det ärliga sättet att se på den här uppställningen är att Whisper Large v3 Turbo har ett strömningsproblem som du redan har betalat för eller fortfarande betalar för. En live-pipeline med Whisper innebär en röstaktivitetsdetektor för att hitta tal, en styckare som skär ljudet i Whisper-stora fönster, överlappande fönster så att ord inte går förlorade vid gränserna, och en sammanfogare som stämmer av de partiella transkriptionerna. Community-implementationer av denna stack hamnar på ungefär en till fem sekunders end-to-end-latens – fungerar för mötesanteckningar, men når inte upp till ribban för telefonagenttjänster och live-textning.

VibeVoice-ASR-Streaming-1.5B är konstruerad så att någon retroanpassning inte behövs. Dess förprocessorkonfiguration fastställer ett block på 22 ramar och en lookahead på 4 ramar för en ström med tal-token på cirka 7,5 Hz – ungefär 2,9 sekunders ljud per genererat segment, en halv sekunds framtida kontext – och Microsofts dokumentation beskriver att kontext från tidigare block bevaras genom KV-cachen, så en livesession behöver inte beräkna om från grunden. Men läs ordet ”streaming” noga på båda sidor av den här jämförelsen: ingen av modellerna är en ordvis delresultatsmotor av det slag som de kommersiella API:erna med lägst latens säljer. VibeVoices transkript växer i ungefär tre sekunders steg till sin design, vilket är en annan och oftast acceptabel kadens för möten, men det är inte under en sekund, och om ditt krav är ord på skärmen inom en sekund bör du mäta den här blockgeometrin mot den budgeten innan du bygger på den.

Noggrannhet: vad du ger upp för att gå över till native-streaming

Här är glappet som bör styra beslutet. Whisper Large v3 Turbo har en offentlig noggrannhetshistorik du kan granska – och när inspelningen är på ett av dess 99 språk är den historiken stark. VibeVoice-ASR-Streaming-1.5B har ingen sådan historik: modellkortets utvärdering är en bild, Microsoft har inte publicerat något strömmande WER i text, och den enda numeriska referenspunkten i VibeVoice-familjen är det leverantörsrapporterade genomsnittliga WER på 7,77 % för batchmodellen VibeVoice-ASR över åtta engelska testset, vilket beskriver en annan, icke-strömmande modell. Det ärliga konstaterandet är att en övergång till VibeVoice-ASR-Streaming-1.5B för din transkribering idag innebär att du accepterar en okänd noggrannhetsnivå på ditt eget ljudmaterial – vilket är precis anledningen till att varje utvärdering av den måste genomföras av dig, på dina svåraste verkliga inspelningar, innan den förtjänar produktionstrafik.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Språk och talarattribuering: funktionsgapet slår åt båda hållen

Funktionsjämförelsen är inte ensidig, och det är just det som gör valet genuint intressant. Om ditt ljud är flerspråkigt är beslutet omedelbart: Whisper Large v3 Turbo täcker med sina 99 språk det som VibeVoice-ASR-Streaming-1.5B inte täcker med sina tio, och en gräns på tio språk diskvalificerar varje pipeline som hanterar en bred blandning av tal. Men om det ljud du bearbetar ligger inom dessa tio språk och det du faktiskt behöver är att veta vem som sa vad i ett live-möte, pekar pilen åt andra hållet: Whisper erbjuder ingen inbyggd talarattribuering och inga hotwords, medan VibeVoice-ASR-Streaming-1.5B hävdar sig ha båda — strömmande talarattribuerad utdata och domänspecifika hotwords som skickas som en kontextprompt. Påståendet är overifierat, och strömmande talarattribuering över chunkgränser är svårt nog att förtjäna skepsis, men det är den konkreta funktion som ingen mängd Whisper-utveckling ger dig direkt ur lådan.

Migrationsmatematiken

Kostnad och ansträngning talar för den nuvarande lösningen. Whisper Large v3 Turbo kör redan i din stack på hårdvara du äger — en laptop, en CPU, en blygsam GPU — och att gå över till VibeVoice-ASR-Streaming-1.5B innebär att sätta upp en forskningsinstallation från källkod på en NVIDIA GPU med ~5,6 GB vikter, verifiera en inladdningsväg vars arkitekturklass ännu inte finns med i den offentliga Transformers-dokumentationen, och bygga det riktmärke ditt beslut är beroende av från grunden. Det är ett reellt projekt, och avkastningen är villkorad av att de overifierade funktionerna verkligen spelar roll för dig.

A screenshot of the Hugging Face model card for openai/whisper-large-v3-turbo, showing the OpenAI namespace, the model title Whisper, the MIT license tag, the 99-languages tag, and the automatic-speech-recognition pipeline tags, with the description of Whisper as a state-of-the-art automatic speech recognition model.

Det billiga sättet att driva det projektet är att inte behandla det som ett rakt byte. Behåll Whisper Large v3 Turbo som standard och dirigera en del av live-ljudet till VibeVoice-ASR-Streaming-1.5B genom ett enda API — det mönster som ett routningslager finns till för: 200+ modeller bakom en enda slutpunkt till leverantörens listpris utan påslag, automatisk failover när den nya modellen snubblar, och en routnings-DSL som låter olika arbetsbelastningar välja olika transkriberare från ett enda anrop. Det är OrcaRouters modell, och det är skillnaden mellan att satsa din produktionspipeline på en två dagar gammal checkpoint och att låta den checkpointen förtjäna sin plats i konkurrens med arbetshästen på dina egna transkript.

Vanliga frågor

Kan Whisper Large v3 Turbo överhuvudtaget livestreama?

Endast som en eftermontering. Whisper Large v3 Turbo är en batchmodell som bearbetar fasta 30-sekundersfönster, så direkttranskribering kräver att du bygger en röstaktivitetsdetektor, en segmenterare, en överlappningsstrategi och en sammanfogare ovanpå den. Fungerande implementationer finns och landar på ungefär en till fem sekunders latens, vilket passar mötesanteckningar men missar under-sekundsribban för telefonagenter och live-textning. VibeVoice-ASR-Streaming-1.5B är strömningsnativ – den avger text per cirka 2,9-sekunderssegment med cirka 0,5 sekunders framförhållning – men det är segmentbaserad strömning, inte ordvisa delresultat, så kontrollera den takten mot din egen latensbudget också.

Är VibeVoice-ASR-Streaming-1.5B mer exakt än Whisper Large v3 Turbo?

Ingen kan svara på det ännu, inte ens Microsoft. Whisper Large v3 Turbos noggrannhet är uppmätt och offentlig — ungefär 2,1 % WER på LibriSpeech clean och 7,7–7,8 % på Open ASR composite. VibeVoice-ASR-Streaming-1.5B har ingen publicerad streaming-WER-siffra i text och inget oberoende riktmärke i skrivande stund. Det enda sättet att besvara frågan är att köra checkpointen på ditt eget ljud och jämföra transkriptionerna mot din nuvarande modell — vilket är precis det test som den här sidan rekommenderar innan någon migrering.

Vilka språk stöder de två?

Whisper Large v3 Turbo stödjer 99 språk med en enda uppsättning vikter. VibeVoice-ASR-Streaming-1.5B listar tio: kinesiska, engelska, franska, tyska, italienska, japanska, koreanska, portugisiska, ryska och spanska. För allt ljud utanför den tiospråkiga uppsättningen är Whisper det enda alternativet i denna jämförelse, och den flerspråkiga klyftan är den enskilt tydligaste anledningen till att de flesta team kommer att stanna där de är.

Whisper Large v3 Turbo är rätt modell för de flesta team större delen av tiden, och en två dagar gammal checkpoint utan benchmarks är inte ett skäl att byta plattform. Det är ett skäl att köra ett experiment. Om ditt ljud ligger inom dess tio språk och attribuering av talare i realtid skulle förändra din produkt, sätt upp VibeVoice-ASR-Streaming-1.5B bakom en router, peka en del av den verkliga trafiken mot den, och låt transkripten – inte avsaknaden av ett benchmark på någon sida – avgöra.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube