
VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC: de två tysta streaming-satsningarna med öppna vikter
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2658Intelligens72Kodning
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
De två mest intressanta utgivningarna av öppna viktmodeller för strömmande tal-till-text i slutet av augusti 2026 kom båda utan ett lanseringsevent. Den 25 augusti publicerade IBM Granite Speech 5.0 470M TurboCTC på Hugging Face — vikter, modellkort och ett blogginlägg, inget mer — och den 2 september laddade Microsoft Research upp VibeVoice-ASR-Streaming-1.5B under namnrymden microsoft utan något tillkännagivande utöver en nyhetsrad i sitt VibeVoice GitHub-repositorium. De är samma typ av företeelse och motsatta ingenjörssatsningar: IBMs modell är en ren CTC-kodare med 470 miljoner parametrar designad för att köra i edge-hastigheter på en bärbar dator, medan Microsofts är en tal-språkmodell i 1,5B-klassen insvept i ljudtokeniserare och ett diffusionshuvud — totalt cirka tre miljarder parametrar — byggd för att förstå tal som språk medan den transkriberar.
Innan siffrorna kommer källmärkningarna som håller detta ärligt. Allt som är markerat som IBM-rapporterat kommer från Granite Speech 5.0 470M TurboCTC-modellkortet och dess Open ASR-ledartavleposter, körda genom den officiella testmiljön av IBM på releasedagen och ännu inte oberoende reproducerade. Allt om VibeVoice-ASR-Streaming-1.5B kommer från att läsa repot — konfigurationsfilerna, modellkortet och Microsofts strömningsdokumentation — eftersom Microsoft inte har publicerat några noggrannhets- eller latenssiffror i text och ingen utanför Microsoft har benchmarkat checkpointen. De två kördes inte i en gemensam testmiljö; denna jämförelse läser båda mot samma offentliga underlag, vilket är allt som något av företagen hittills har erbjudit.
Två tysta releaser, med åtta dagars mellanrum
Båda modellerna anlände på samma odramatiska sätt, vilket är värt att säga rakt ut eftersom inget av företagen har sagt mycket sedan dess. IBMs Granite Speech 5.0 470M TurboCTC är Apache-2.0-varianten i en lansering med två varianter — IBM publicerade också en icke-kommersiell -NC-syskonmodell med något bättre rubriksiffror — och dess kort har ett releasedatum den 25 augusti 2026, med inbyggt Transformers-stöd och en Open ASR-ledartavleinskickning daterad samma dag. Microsofts strömmande par, VibeVoice-ASR-Streaming-7B och VibeVoice-ASR-Streaming-1.5B, skapades på Hugging Face inom samma minut den 2 september; GitHub-nyhetsraden som tillkännager "en enhetlig strömmande ASR-modell som kontinuerligt transkriberar vem som sa vad när tal anländer" är daterad den 3 september och nämner 7B, vilket lämnar 1.5B som behandlas här som den mindre syskonmodellen som släpptes tyst vid sidan av.
Det intressanta är att två team grep efter ordet ”streaming” och byggde motsatta saker. Granite Speech 5.0 470M TurboCTC är en konformer-encoder tränad med CTC och avkodad i ett enda icke-autoregressivt steg – det finns ingen avkodare som genererar text token för token, så modellen är strukturellt billig och strukturellt snabb. VibeVoice-ASR-Streaming-1.5B är en tal-LLM: två konvolutionella tokenizers omvandlar 24 kHz-ljud till en ~7,5 Hz-tal-token-ström, en avkodare från Qwen2-familjen (28 lager, 1 536 dolda enheter – klassen 1.5B) läser den, och ett diffusionshuvud producerar transkriptionen i block på cirka 2,9 sekunder med ungefär en halv sekunds lookahead. Den ena är en racerbil; den andra är en liten språkmodell som råkar lyssna.
Spec-kontrollen
• Parametrar — Granite Speech 5.0 470M TurboCTC: 470M, endast encoder, jämfört med VibeVoice-ASR-Streaming-1.5B: ~3B totalt (1.5B-klass LM-stomme plus tokenizers och diffusionshuvud).
• Arkitektur — conformer-kodare med blockvis självuppmärksamhet och självkonditionering, CTC-tränad, girig icke-autoregressiv avkodning jämfört med dubbla akustiska/semantiska tokeniserare som matar en kausal avkodare från Qwen2-familjen med ett DDPM-diffusionshuvud
• Utdatatakt — ~12,5 utdataframes per sekund, strömmande chunkvis, jämfört med ~7,5 Hz tal-token; text emitteras per ~2,9 s-chunk med ~0,5 s framförhållning.
• Språk — endast engelska vs tio: kinesiska, engelska, franska, tyska, italienska, japanska, koreanska, portugisiska, ryska och spanska.
• Vikter — cirka 0,5 miljarder parametrar / en bråkdel av en GB, edge-klass jämfört med ~5,6 GB bf16, NVIDIA-GPU-klass.
Noggrannhet i tryck — IBM rapporterade ~5,00 % genomsnittlig WER på Open ASR:s kortformsset, medan ingen WER-siffra publicerades i text.
• Licens — Apache-2.0 vs MIT.
• Släppt — 25 augusti 2026 jämfört med 2 september 2026.

Hastighet: den ena är byggd för att vara liten, den andra för att vara en språkmodell
Den arkitektoniska klyftan visar sig först i hastighet och hårdvara. Granite Speech 5.0 470M TurboCTC riktar sig till bärbara datorer, smartphones och andra kantenheter. Eftersom en ren CTC-kodare inte samplar något — utmatningen är ett enda girigt svep över ett BPE-huvud med 16 384 enheter — är den extremt billig att köra, och IBMs modellkort rapporterar en Open ASR-genomströmningssiffra uppmätt på en enda H200 som ligger i tiotusentals RTFx för TurboCTC-serien, tillsammans med en WebGPU-demo som transkriberar live i en webbläsarflik. Dessa siffror är uppmätta av IBM och har inte reproducerats, men den strukturella poängen står för sig själv: en 470M-kodare utan autoregressiv avkodare är en modell du kan köra på hårdvara som en telefon levereras med.
VibeVoice-ASR-Streaming-1.5B gör den motsatta avvägningen. Dess avkodare är en kausal språkmodell, vilket innebär att text genereras i en mer beräkningstung loop än en CTC-argmax, och de dokumenterade sätten att köra den är självhostade på NVIDIA GPU:er – microsoft/VibeVoice-repositoriets Python-demoer eller dess vLLM-plugin – med ~5,6 GB bf16-vikter innan någon KV-cache. Microsoft har inte publicerat några påståenden om genomströmning eller realtidsfaktor, så det finns inget leverantörstal att ställa mot IBMs. Vad LLM-arkitekturen istället ger är kontext: modellen bär med sig förståelse av talare och innehåll genom transkriptionen på samma sätt som en språkmodell gör, vilket är skillnaden mellan att transkribera ljud och att följa en konversation.
Noggrannhet: en leverantör skrev ut siffror, den andra skrev ut en bild.
Enligt tillgängliga bevis ligger Granite Speech 5.0 470M TurboCTC före VibeVoice-ASR-Streaming-1.5B med en hel publicerbar benchmark. IBM körde sin modell genom den officiella Open ASR-leaderboardens testmiljö på releasedagen och rapporterar en genomsnittlig ordfelsfrekvens på cirka 5,00 % på de publika engelska kortformsseten — en siffra som är leverantörsuppmätt, inte verifierad av någon tredje part och helt saknas från Microsofts sida av jämförelsen. Modellkortet för VibeVoice-ASR-Streaming-1.5B innehåller en utvärderingsfigur som bild men inga numeriska WER-, RTF- eller latensvärden i löptext; det enda numeriska ankaret i VibeVoice-familjen är batch-VibeVoice-ASR-kortets leverantörsrapporterade genomsnittliga WER på 7,77 % över åtta engelska testset, vilket beskriver den icke-strömmande modellen och inte kan överföras. Oavsett hur de oberoende körningarna till slut utfaller är den ärliga sammanfattningen i dag att IBM publicerade en siffra och Microsoft publicerade en bild.

Språk och utdata: endast engelska kontra vem-sa-vad i tio
Granite Speech 5.0 470M TurboCTC stödjer endast engelska och returnerar rå transkriberad text. Det är ingen brist för de arbetsuppgifter IBM riktar in sig på — transkribering av engelskt tal i företagsmiljöer på edge-hårdvara — men det sätter punkt för jämförelsen i samma ögonblick som din ljudinspelning inte är på engelska. VibeVoice-ASR-Streaming-1.5B listar tio språk och hävdar att den kan leverera strömmande utdata med talarattribuering: modellkortet säger att den ”kontinuerligt transkriberar vem som sa vad allteftersom tal anländer” och att hotwords för domäntermer kan skickas som en kontextprompt. Båda extrafunktionerna förtjänar ett skeptiskt mottagande — strömmande diarisering över chunkgränser är genuint svårt, och påståendet är obekräftat — men de är anledningen till att ett team som hanterar flerspråkiga möten i realtid överhuvudtaget skulle titta på Microsofts modell.
Licensiering och ekosystem: Apache-2.0 jämfört med MIT, Transformers jämfört med ett forskningsrepo
Båda licenserna tillåter kommersiell användning, vilket redan skiljer detta par från IBM:s egen -NC-variant av samma arkitektur. Granite Speech 5.0 470M TurboCTC är Apache-2.0 med den sedvanliga patentlicensen och stöds inbyggt i Hugging Face Transformers (AutoModelForCTC från transformers >= 5.16) samt mlx-audio för Apple Silicon — vilket innebär att den körs överallt där den största communityn för driftsättning i ekosystemet kör, på hårdvara från vilken leverantör som helst. VibeVoice-ASR-Streaming-1.5B är MIT, vilket är ännu enklare, men dess serveringsväg är en forskningsinstallation från källkod: arkitekturklassen för checkpointen, VibeVoiceForASRStreamingTraining, finns inte i den offentliga Transformers-dokumentationen, och Microsofts egen streamingdokumentation pekar på repots demokod och en vLLM-plugin snarare än på en inläsning via ett standardbibliotek. För ett produktionsteam är skillnaden påtaglig: den ena modellen kan idag pluggas in i en befintlig Transformers-pipeline, medan den andra kräver att du sätter upp ett forskningsrepo och själv verifierar inläsningsvägen.

Which quiet release should you evaluate?
Utvärdera Granite Speech 5.0 470M TurboCTC först om din arbetsbelastning är engelska, din hårdvara är edge-klass eller CPU-bunden, och du vill ha en modell som passar in i Transformers med en siffra på kortet att verifiera mot. Den är det lägre riskvalet i varje dimension utom en — den hjälper dig inte med ett andra språk eller en live-mötestranskription som behöver veta vem som talar.
Utvärdera VibeVoice-ASR-Streaming-1.5B om du behöver flerspråkig streaming, om vem-sa-vad-utdata eller hotwords är funktioner du vill testa, eller om du hellre satsar på en metod för tal som bygger på språkmodeller än på en ren encoder. Budgetera för en NVIDIA-GPU, en installation från källkod, ~5,6 GB vikter och en utvärdering du själv utformar, eftersom ingen — Microsoft inkluderat — ännu har publicerat en siffra du kan lita på.
Vad varken tysta releaser förändrar är värdet av att hålla ASR-lagret utbytbart medan du tar reda på vilket spel som ger utdelning. Båda modellerna är unga, och ingen av dem levereras via OrcaRouter i skrivande stund; när en leverantör hostar någon av dem är det lågrisksättet att prova den bakom ett routinglager som frontar 200+ modeller till leverantörens listpris — 0 % påslag, så prisförändringar slår igenom samma dag — med automatisk redundans till det du redan litar på. Dirigera en del av din riktiga ljudtrafik till den nya modellen, läs transkriptionerna och låt din egen trafik – inte ett prestandatest från releasedagen – avgöra vilken tyst satsning som var den rätta.
