
Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B: Siffran Microsoft inte publicerade
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
VibeVoice ASR Streaming 7B är Microsofts enhetliga strömmande taligenkännare, uppladdad till Hugging Face den 2 september 2026 och tillkännagiven i microsoft/VibeVoice-repositoriet en dag senare under MIT-licensen, och den gör något som varken Grok Voice Transcribe 2.0 eller de flesta av dess konkurrenter gör: den avger talarattribuerad text allt eftersom ljud anländer, utan ett separat diariseringssteg. Microsofts tekniska rapport säger att 7B-checkpointen uppnår lägst genomsnittlig WER och CER över fem utvärderingsuppsättningar och den bästa eller delat bästa talarattribueringen i 12 av 13 utvärderingsinställningar. Vad modellkortet inte gör är att publicera en enda siffra i text — ingen WER, ingen RTF, ingen latenssiffra; resultaten finns endast som bilder i rapporten. Grok Voice Transcribe 2.0, som lanserades sexton dagar senare den 18 september 2026 för 0,10 USD per ljudtimme för batch och 0,20 USD per timme för streaming, redovisar allt: 2,7 % WER för slutlig transkription och 3,4 % WER för första partiella resultat på Artificial Analysis streamingtavla, 0,49 sekunder till vardera. Så den ärliga utgångspunkten för den här jämförelsen är att en av de två modellerna är mätbart bättre dokumenterad än den andra, och att den asymmetrin i sig är det mest beslutsrelevanta faktumet i jämförelsen.
Vad Microsoft publicerade, och vad en läsare kan göra med det
VibeVoice-rapporten är riktig forskning, och påståendena i den är specifika till sin form, om än inte till sitt värde. Den utvärderade fyra mötesbenchmarkar – AliMeeting, AISHELL-4, AMI-SDM och AMI-IHM – samt MLC-Challenge, över nio språk, och rapporterar två huvudresultat: 7B-modellen hade lägst genomsnittlig WER/CER över de fem uppsättningarna, och bäst eller delat bäst talartillskrivning i 12 av 13 utvärderingsinställningar. Båda är relativa påståenden, vilket är en meningsfull typ av påstående: "lägst bland dessa fem uppsättningar" är ett uttalande om rangordning, och rangordning är vad en köpare behöver.
Det som saknas är samtliga absoluta siffror. Det finns ingen WER-procentsats att jämföra mot något, inget genomströmningstal, ingen latensmätning och ingen uppdelning per set i texten. En jämförelsetabell som ställer VibeVoice bredvid Grok Voice Transcribe 2.0 och tilldelar Microsoft-modellen en siffra hittar på den siffran. Det som kan sägas är att VibeVoice vann sin egen utvärdering med fem set och att ingen utanför Microsoft har återkört den – ingen oberoende benchmark, ingen tredjepartsutvärdering och, vid tiden för skrivandet, ingen hostad inferensleverantör som överhuvudtaget listar modellen. Jämförelsen står därför mellan en dokumenterad siffra och en odokumenterad rangordning, och den odokumenterade rangordningen är inte den svagare av de två bara för att den saknar en decimalpunkt.
Grok Voice Transcribe 2.0:s dokumentation har det motsatta problemet. Dess 2,7 % och 3,4 % kommer från AA-WER Streaming-resultattavlan från Artificial Analysis, ett viktat sammansatt mått av AA-AgentTalk till 50 % tillsammans med VoxPopuli och Earnings22 till 25 % vardera – cirka åtta timmar agentformat engelskt samtalsljud, med oberoende körning, vilket är en genuint starkare härkomst än en leverantörs egen utvärdering. Men det är en enda smal skiva av engelska, och själva resultattavelsidan plottar 27 av de 33 modeller som SpaceXAI räknar när den gör anspråk på förstaplatsen bland 32. Ett exakt nummer på ett smalt test och ett oprecist påstående på ett bredare test är inte direkt jämförbara, och den här artikeln kommer inte att låtsas annat.
Två och en halv sekund mot en halv sekund
Latensjämförelsen är det enda stället där de två modellerna kan ställas sida vid sida utan något förbehåll om dataset, eftersom båda publicerar sin streamingkonfiguration – och skillnaden är arkitektonisk snarare än ett tuningval.
VibeVoice ASR Streaming 7B arbetar i chunkar. Dess släppta checkpoints använder 22 latenta ramar per chunk, vilket vid modellens 7,5 latenta ramar per sekund är ungefär 2,9 sekunders ljud per chunk, med en lookahead på fyra latenta ramar – ungefär 0,5 sekunders framtida ljud – och en förväntad latens för talarattribuering på omkring 2,00 sekunder. Den avger text en gång per chunk. Det är ett riktigt streamingsystem, men kadensen mäts i sekunder, inte millisekunder.
Grok Voice Transcribe 2.0 returnerar sin första partiella transkription 0,49 sekunder efter att talaren har slutat, och slutför 0,49 sekunder efter talets slut. Den köpte den snabbheten med noggrannhet – felkvoten för den första partiella transkriptionen sjönk från 18,3 % i version 1.0 till 3,4 % i 2.0, på bekostnad av att gå från 0,25 sekunder till 0,49 sekunder på samma mått.
Ställ bredvid varandra:
• Strömningstakt — Grok Voice Transcribe 2.0 skickar delresultat kontinuerligt med en latens på 0,49 sekunder till första delresultatet, jämfört med VibeVoice ASR Streaming 7B som skickar ett textstycke ungefär var 2,9:e sekund
• Latens för talarattribution — ingår i samma 0,49-sekundersbana jämfört med cirka 2,00 sekunder enligt konstruktionen
• Lookahead — inte publicerad mot fyra latenta ramar, ungefär 0,5 sekunder framtida ljud
• Praktisk effekt – en röstagent kan agera på en pågående mening jämfört med ett system som tar emot ett talarmärkt stycke var tredje sekund
Ingen av dessa är fel. En chunk på 2,9 sekunder är en fullt rimlig design för mötestranskribering, där resultatet är ett dokument och värdet ligger i att dokumentet kommer under mötet i stället för efter det. Det är fel design för en konversationsagent, där en tystnad på tre sekunder inte är en paus, utan ett misslyckande. Skillnaden mellan de två kadenserna är ungefär sexfaldig, och den motsvarar nästan exakt skillnaden mellan att transkribera ett samtal och att delta i ett.

Talarattribuering som utdata, inte ett pipeline-steg
Det är här Microsoft-modellen verkligen ligger före, och designen är värd att förstå eftersom den är anledningen till att chunkningen är grov.
VibeVoice använder två förtränade tokeniserare – en akustisk kodare och en semantisk kodare – som körs vid 24 kHz med 3 200× nedsampling för att producera 7,5 latenta ramar per sekund, en var 133:e millisekund. Dessa ramar projiceras in i stommen hos en Qwen2.5-språkmodell, och inkommande tal och genererad text flätas samman till en enda sekvens, med tidigare observerat tal och text bevarade i modellens kontext. Konsekvensen är att talaridentitet aldrig är ett separat problem: modellen transkriberar inte och bestämmer sedan vem som talade, utan genererar text betingat på en ljudhistorik som fortfarande innehåller rösterna. Det är därför det inte finns något diariseringssteg att linjera, och därför Microsofts påstående om talarattribution över 12 av 13 inställningar är arkitektoniskt trovärdigt snarare än ett påbyggt resultat.
Kostnaden för den designen är att historiken behålls och växer linjärt med inspelningens längd, vilket är anledningen till att de släppta checkpoints riktar sig mot inspelningar på upp till åtta minuter. Det är ett verkligt tak, och det sägs rakt ut. Det utesluter modellen för långformat arbete – en två timmar lång resultatkonferens, en hel dags ljud från ett kontaktcenter – om du inte bygger din egen segmentering och återinitiering, vilket återinför precis den komplexitet som arkitekturen var utformad att ta bort.
Grok Voice Transcribe 2.0 löser samma problem på ett annat sätt och med en annan uppsättning begränsningar. Den inkluderar diarisering utan extra kostnad och stöder upp till åtta oberoende ljudkanaler i en och samma begäran. För kontaktcentertelefoni, där varje deltagare ofta kommer in på sin egen kanal, är kanalseparering mer tillförlitlig än diarisering och har ingen felprocent kopplad till sig. För mixat ljud beror det på kvaliteten på diariseringen, och till skillnad från Metas Muse Voice Transcribe – som publicerade en genomsnittlig diariseringsfelkvot på 17,5 % – har SpaceXAI inte publicerat någon diariseringssiffra alls. Så båda modellerna lämnar en lucka i diariseringsbevisningen: den ena publicerar en rangordning utan ett värde, den andra publicerar en funktionslista utan en mätning.
Arton gigabyte, tio språk, MIT
Fakta om driftsättningen skiljer sig så fullständigt att de nästan inte går att jämföra. VibeVoice ASR Streaming 7B är ungefär 18 GB bf16-vikter – Hugging Face-kortet anger 9B totala parametrar för checkpointen med 7B i namnet, med en 1,5B-syskonmodell på cirka 5,6 GB – MIT-licensierad, med Python-demos och en vLLM-plugin för servering. Tio språk: kinesiska, engelska, franska, tyska, italienska, japanska, koreanska, portugisiska, ryska och spanska. Microsoft positionerar den för forskning och utveckling.
Grok Voice Transcribe 2.0 är en hanterad slutpunkt utan vikter att ladda ner, 12 indataformat från 8 kHz telefonljud till 48 kHz, upp till åtta kanaler, 100 nyckeltermer per begäran, automatisk språkidentifiering med växling mitt under inspelningen, invers textnormalisering för 25 språk, filer upp till 500 MB och tjänstegränser på 10 begäranden per sekund och 100 samtidiga streamingsessioner per team. Den körs i us-east-1 och endast i us-east-1.
• Vikter — MIT, 18 GB, dina att köra var som helst vs inga, endast leverantörsdrift
• Språk — 10 namngivna språk jämfört med automatisk identifiering med formateringsstöd över 25
• Nyckeltermsbiasering — stöds via hotwords kontra upp till 100 nyckeltermer per begäran
Inspelningslängd — cirka åtta minuter per kontrollpunkt innan historikbevarandet blir begränsningen, kontra ingen publicerad övre gräns, filer upp till 500 MB
• Regionkontroll — vad du än distribuerar på kontra us-east-1
• Kostnad — ingen licensavgift, plus 18 GB GPU-minne och en serveringsstack mot 0,10 USD per batchtimme och 0,20 USD per streamingtimme
En 18 GB-modell är inget man kör på en laptop, och vLLM-pluginen innebär en GPU med rejält minne. Mot detta står att en MIT-licens på en modell av den storleken är ovanlig och värdefull: det är den enda av de två som du kan köra i ditt eget nätverk helt utan någon leverantörsrelation, vilket för reglerat ljud inte är en preferens utan ett krav. Det hanterade alternativet är billigt per timme och omöjligt att driftsätta lokalt.

Var routingbeslutet hör hemma
Kostnaden är den punkt där de två modellerna till slut blir jämförbara på ett sätt som ger ett tal. Grok Voice Transcribe 2.0:s batchväg kostar 0,10 USD per ljudtimme, cirka 1,67 USD per 1 000 minuter, och dess streamingväg kostar 0,20 USD, cirka 3,33 USD. VibeVoice ASR Streaming 7B har ingen licenskostnad alls; vad den i stället har är ungefär 18 GB resident GPU-minne och en vLLM-serveringsstack som du driftar. En modell i 7B-klassen av den storleken kommer inte att vara billig per ljudtimme på hyrd hårdvara, och utnyttjandekurvan är oförlåtande — ett GPU-kort som hålls varmt för topptrafik kostar lika mycket oavsett om det transkriberar eller är inaktivt.
Det är den vanliga formen av argumentet bygga-eller-köpa, och det faller olika ut beroende på volym och på huruvida ljudet tillåts lämna ditt nätverk. Det som har förändrats den senaste månaden är hur snabbt svaret rör sig: ledaren för strömningsnoggrannhet bytte ägare två gånger på tre veckor, och en modell som släpptes i början av september trängdes undan i mitten av september. Varje arkitektur som gör modellvalet dyrt att ångra är nu fel arkitektur för den här kategorin.
OrcaRouter är där den omkastningen blir billig. En OpenAI-kompatibel nyckel täcker 200+ modeller med automatisk redundans över leverantörer, så att en hanterad endpoint i en enda region som fallerar är en routinghändelse snarare än ett avbrott, och leverantörernas listpris förs vidare med 0 % påslag – vilket innebär att en leverantörsprisändring eller en ny checkpoint är live hos oss samma dag. För ett team som vill testa VibeVoice mot Grok Voice Transcribe 2.0 på sitt eget ljud, eller behålla en självhostad fallback bakom samma gränssnitt som en hanterad primär, upphör anropsstället att vara det som måste ändras.

Den ärliga domen: VibeVoice ASR Streaming 7B är den mer intressanta modellen och Grok Voice Transcribe 2.0 är den mer användbara produkten, och gapet mellan dessa två påståenden förklaras helt av att en leverantör publicerar diagram och den andra publicerar siffror. Om ditt krav är lokal, talarattribuerad transkribering av möten som är kortare än åtta minuter, är Microsoft-checkpointen den enda av de två som uppfyller kravet. Om ditt krav är en röstagent som svarar inom en samtalspaus, utesluter en chunk-kadens på 2,9 sekunder den innan noggrannhet ens diskuteras. Och om du väntar på jämförelsen som skulle avgöra saken – samma ljud genom båda modellerna, bedömd av någon som inte arbetar för något av företagen – finns den mätningen ännu inte, vilket är värt att komma ihåg nästa gång en tabell sätter en siffra bredvid namnet VibeVoice.
