
VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo: Vad Microsofts streaming-checkpoint tillför standardutgåvan med öppna vikter
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2658Intelligens72Kodning
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
Under större delen av de senaste två åren har svaret på ”transkribera det själva, billigt” varit Whisper Large v3 Turbo — OpenAIs öppna viktmodell med 809 miljoner parametrar, MIT-licensierad, 99 språk, tillräckligt liten för att köras på en arbetsstation och gratis när du väl äger hårdvaran. Den 2 september 2026 laddade Microsoft Research upp en utmanare till den standarden: VibeVoice-ASR-Streaming-7B, en MIT-licensierad strömmande checkpoint på Hugging Face som transkriberar när ljudet anländer, gör anspråk på talarattribuerad utdata och — till skillnad från modellen de flesta team redan kör — aldrig designades som ett batchjobb. Båda modellerna är öppna vikter från stora labb. Nästan allt annat med dem är en avvägning, och den här sidan handlar om vilken avvägning du faktiskt gör.
En enda asymmetri präglar hela jämförelsen, så kommer den först. {{1}}Whisper Large v3 Turbo är världens mest oberoende reproducerade talmodell: dess ordfelssiffror har räknats fram på nytt av tusentals team på offentliga benchmarks och sitt eget ljud i åratal, och dess svagheter är lika väldokumenterade som dess styrkor.{{/1}} VibeVoice-ASR-Streaming-7B är en dag gammal, har inga oberoende benchmarks någonstans, och Microsoft har inte publicerat någon ordfelsfrekvens för strömning i läsbar text. {{2}}Allt på Microsoft-sidan nedan är hämtat från repot — config, model card och Microsofts strömningsdokumentation — och märkt som sådant.{{/2}}
Standardinställningen för öppna vikter, och varför den består
Whisper Large v3 Turbo är den destillerade syskonmodellen till Whisper Large v3: den behåller encoderns 32 lager och minskar decodern från 32 lager till fyra. Därför sjunker parametrantalet till 809M och genomströmningen på GPU ungefär fyrdubblas, med i stort sett bibehållen noggrannhet. Eftersom vikterna är MIT-licensierade och modellen är liten har den blivit den förvalda motorn för inbäddad transkribering i mötesbotar, undertextverktyg och pipeliner för samtalsloggning. Dess begränsningar är lika välkända. Den är en batchmodell: den tar emot en ljudfil och returnerar en transkription, i stället för att generera orden allt eftersom de talas. Den är inte tränad för översättning, och på den uppgiften försämras kvaliteten kraftigt. Noggrannheten är ojämn när talet är brusigt, har brytning eller överlappar, och den returnerar ren text – utan interpunktion eller versaler som standard, utan talardiarisering, utan tidsstämplar i den här varianten och utan biasering mot nyckelord. Produktionsstackar byggda på Whisper sätter samman dessa delar var för sig, och varje del bidrar med sin egen latens och sina egna feltillstånd.

Spec-gapet
• Parametrar — 809M (destillerad avkodare) jämfört med cirka 9B totalt (en språkryggrad från Qwen2-7B plus talenkodare; ”7B” syftar på LLM:en, medan Hugging Face-sidan listar 9B).
• Licens — MIT, öppna vikter, både och.
• Streaming — batch till sin design: självhostade streamingimplementationer hamnar vanligtvis på 1–5 sekunders latens jämfört med streaming-nativt: ~2,9 sekunders chunkar med ~0,5 sekunders framförhållning, text som avges per chunk, kontext som bevaras i en KV-cache.
• Språk — 99 med år av community-reproduktion jämfört med en deklarerad 10 (en, zh, es, pt, de, ja, ko, fr, ru, it).
• Utöver transkriptet — inget som standard; däremot utlovas strömmande ”vem sa vad”-utdata och anpassade hotwords (overifierat).
• Noggrannhet i tryck — 2.1% WER på LibriSpeech test-clean, 4.2% på test-other, ~7.7% på Open ASR-kompositen, 8–12% på brusigt ljud i communitytestning, allt oberoende reproducerat, medan ingen strömmande WER-siffra publicerats som text.
• Fotavtryck — körs på en laptop eller ett enda blygsamt grafikkort jämfört med cirka 18 GB bf16-vikter före KV-cache; budgetera för ett grafikkort i 24 GB-klassen.

Vad streaming faktiskt tillför
Anledningen att överhuvudtaget se förbi Whisper Large v3 Turbo är live-spåret, och det är här de två modellerna slutar vara jämförbara. Whisper är batchorienterad: för att få ord medan en talare fortfarande pratar måste utvecklingsteam lägga till uppdelning i block, röstaktivitetsdetektering och limkod, och egenhostade streamingimplementationer hamnar vanligtvis på en till fem sekunders latens – vilket innebär att de missar under-sekundskravet för telefonagenter och realtidstextning utan betydande ingenjörsarbete. VibeVoice-ASR-Streaming-7B är byggd för just det. Dess konfiguration visar att ljud komprimeras 3 200× till en tokenström på 7,5 bildrutor per sekund, bearbetas i block om 22 bildrutor med en framförhållning på fyra bildrutor – ungefär 2,9 sekunders ljud per block – med text som matas ut allt eftersom varje block blir klart och tidigare kontext som behålls i KV-cachen, så att en session inte beräknas om från grunden. Den takten är en designegenskap som härrör från konfigurationen, inte en uppmätt latens, och ingen har ännu publicerat ett totalvärde för den; men arkitekturen är otvetydigt en livetranskriptionsarkitektur på ett sätt som Whisper inte är.
Whispers historik är lång och offentlig; den nya kontrollpunktens är tom.
Noggrannhet är där Whisper Large v3 Turbos ålder är en tillgång. Dess 2,1 % WER på LibriSpeech test-clean och 4,2 % på test-other är open-weights-siffror som reproducerats av otaliga team; dess ungefär 7,7 % på Open ASR-ledartavlans sammansatta mätning ligger ungefär en procentenhet efter den fullständiga Large v3; och dess dokumenterade 8–12 % på brusigt ljud i communitytestning innebär att ingen blir förvånad över det. Dessa svagheter är en del av facit – de talar om för dig exakt var modellen behöver hjälp innan du bygger vidare på den.
VibeVoice-ASR-Streaming-7B kan inte uppvisa någon sådan meritlista. Dess modellkort innehåller en utvärderingssiffra i form av en bild, och Microsofts tekniska streamingrapport är en PDF, men det finns ingen citerbar ordfelsfrekvens (WER) för streaming i löptext. Den enda numeriska hållpunkten i familjen är den leverantörsrapporterade tabellen i modellkortet för batch-VibeVoice-ASR — 7,77 % genomsnittlig WER över åtta engelska testset och 2,20 % på LibriSpeech clean — vilket inte är siffran för den här checkpojnten — och batchmodellen i sig har fått ett blandat mottagande i communityn: hyllad för diarisering direkt ur lådan, kritiserad för att vara tung och ibland hallucinationsbenägen. Inget av detta överförs till streamingmodellen, och det är just poängen: med Whisper känner du till felscenarierna i förväg; med VibeVoice-ASR-Streaming-7B är du den första testaren.
Språk och fotavtryck: 99 mot 10, 0,8B mot 9B
De två mest konkreta kostnaderna för ett byte är språk och storlek. Whisper Large v3 Turbo transkriberar 99 språk; språk med låga resurser och tonspråk försämras – thai, kantonesiska och walesiska är de oftast nämnda svaga punkterna – men listan har år av community-reproduktion bakom sig. VibeVoice-ASR-Streaming-7B deklarerar tio: engelska, kinesiska, spanska, portugisiska, tyska, japanska, koreanska, franska, ryska och italienska. Om din trafik ligger inom dessa tio är täckningen inget problem; om den inte gör det slutar jämförelsen här. Storlek är den andra kostnaden: 809M parametrar körs på en bärbar dator, medan cirka 9B totala parametrar i bf16 innebär ungefär 18 GB vikter före KV-cache och ett GPU-kort i 24 GB-klassen för att hantera det bekvämt. För team som redan kör Whisper på blygsam hårdvara är det ett rejält kliv upp i infrastruktur, rättfärdigat endast av ett verkligt krav på livetranskribering.
När gratis inte är poängen.
Whisper Large v3 Turbo är gratis att köra; kostnaden är hårdvaran och ingenjörsarbetet runt omkring. En faster-whisper-driftsättning på en enda T4 ligger i storleksordningen {{1}}$0.05–$0.10 per ljudtimme{{/1}} till GPU:ns gällande timpris, och en kontinuerlig arbetsbelastning tillkommer {{2}}diariserings- och interpunktionsstacken{{/2}} du måste bygga eftersom Whisper returnerar ren text. VibeVoice-ASR-Streaming-7B är också gratis att köra, på dyrare hårdvara, {{3}}i utbyte mot en strömmande arkitektur{{/3}} som påstår sig erbjuda {{4}}talartilldelningen och kontextkontrollerna{{/4}} som Whisper saknar – påståenden du själv får verifiera, eftersom {{5}}ingen oberoende benchmark{{/5}} finns. För {{6}}batchtranskribering i stor volym{{/6}} vinner Whisper fortfarande på genomströmning och minimalt fotavtryck. För {{7}}live-ljud med flera talare{{/7}} där transkriptionen måste levereras under samtalets gång arbetar Whisper mot sin design medan streaming-checkpointen arbetar med den – om den över huvud taget fungerar, vilket är just den fråga du bör besvara {{8}}med ditt eget ljud på din egen GPU{{/8}}.

Den pragmatiska stacken
Det vanligaste verkliga svaret är inte "antingen/eller" utan "både och", och det är rekommendationen här: behåll Whisper Large v3 Turbo som det högvolymiga batch-spåret där dess resultat och fotavtryck gör den oslagbar, och utvärdera VibeVoice-ASR-Streaming-7B på live-spåret som Whisper inte kan betjäna med den krävda latensen – med en explicit utvärderingsgrind, eftersom det inte finns något riktmärke att luta sig mot. De två kan dela en GPU-budget och en kodbas. Där ett routningslager gör skäl för sin plats i den stacken är lagret ovanför transkripten, inte själva transkriberingen: OrcaRouter routar inte tal-till-text i dag och ingen av modellerna finns i dess katalog, men de sammanfattare, larmregler och agentplanerare som konsumerar ett live-transkript är exakt de 200+ språkmodeller som den förmedlar med ett API till leverantörernas listpriser utan påslag, och med automatisk redundans mellan leverantörer. En strömmande kontrollpunkt som levereras utan ett enda riktmärke förtjänar samma behandling som vilken obevisad modell som helst – en skiva av verklig trafik bakom en reserv, som vinner eller förlorar ditt förtroende baserat på bevis från dina egna möten snarare än från ett modellkort.
