
VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe: Två streamingutmanare, en dag emellan
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2658Intelligens72Kodning
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
Inom ungefär trettiosex timmar i början av september 2026 släppte två stora labb strömmande tal-till-text-modeller som ger samma rubriklöfte – en live-transkription som också berättar vem som sa vad, medan orden yttras. Den 1 september lanserade Meta Superintelligence Labs Muse Voice Transcribe som ett värdbaserat API prissatt till 3,00 dollar per 1 000 ljudminuter, cirka 0,18 dollar i timmen, med strömmande igenkänning, diarisering av 20+ talare och endpointing i ett enda steg. Den 2 september laddade Microsoft Research upp VibeVoice-ASR-Streaming-7B till Hugging Face: MIT-licensierade öppna vikter, inget tillkännagivande, ett modellkort som gör anspråk på strömmande talarattribuerad transkription med hotwords och tio språk, och ingen värdplats någonstans. Samma pitch, motsatta affärsmodeller, och bevis på båda sidor som är tunnare än något av labben vill att du ska märka.
Den här sidan är skriven som vad-vi-vet-hittills, eftersom ingen av modellerna har en oberoende verifierad noggrannhetssiffra. Muse Voice Transcribes siffror är Metas påståenden från lanseringsdagen — leverantörsrapporterade och inte reproducerade; VibeVoice-ASR-Streaming-7B har inte publicerat någon siffra för strömningsnoggrannhet i text överhuvudtaget. Jämförelsen nedan lutar sig därför mot det som är strukturellt och kännbart — arkitektur, pris, licens, dokumenterat beteende — och märker ut de få leverantörssiffror som förekommer.
Två utmanare till batch-pipelinen, med en dags mellanrum
Båda modellerna är angrepp på samma antagande: att tal-till-text är något man kör på en färdig inspelning. Muse Voice Transcribe är den första produkt som Meta kallar en ”realtidsmodell för ljudperception” – ett enda strömmande pass som utför igenkänning, talardiarisering över fler än tjugo röster och slutpunktsdetektering, det vill säga att avgöra när en talare faktiskt har slutat prata snarare än bara pausat. Den lanseras på tre ytor samtidigt: Meta Model API för 0,18 dollar per ljudtimme, Meta AI för Mac där ett tryck på Fn-tangenten dikterar i valfritt program, och Muse Code. Microsofts VibeVoice-ASR-Streaming-7B är den strömmande medlemmen i den öppna VibeVoice-familjen, och dess släpp har gått betydligt tystare till: ett Hugging Face-arkiv skapat den 2 september (tidsstämplar visar 15:46 UTC, senast ändrat tre minuter senare), åtta safetensors-delar under MIT-licens och en nyhetsloggrad daterad den 3 september i microsoft/VibeVoice GitHub-arkivet som kallar den ”en enhetlig strömmande ASR-modell som kontinuerligt transkriberar vem som sa vad medan tal anländer, med stöd för anpassade hotwords och 10 språk.” En dag efter uppladdningen visade den fortfarande noll nedladdningar.

Funktionskollisionen
• Strömningsmekanism — Muse Voice Transcribe förbrukar ljud i 80-millisekunderssegment och fastställer ord i takt med att de stabiliseras, medan VibeVoice-ASR-Streaming-7B bearbetar segment på cirka 2,9 sekunder med cirka 0,5 sekunders framförhållning och avger text en gång per färdigbehandlat segment.
• Talartilldelning — 20+ talare i en enda körning, leverantörsrapporterat 17,5 % genomsnittligt diariseringsfel jämfört med strömmande vem-sa-vad-utdata som anges på modellkortet, overifierat.
• Endpointing — inbyggd: strömmen bär en gräns för avslutat yttrande jämfört med att inte dokumenteras som en utsignal.
• Kontextkontroller — språk-, nyckelords- och kontextanpassning jämfört med anpassade hotwords via en kontextprompt (--context_info).
• Språk — tränat på 70+, 25 omfattande verifierade vid lansering, nativ kodväxling jämfört med en deklarerad 10 (en, zh, es, pt, de, ja, ko, fr, ru, it).
Evidens — leverantörens anspråk vid lansering: 3,1 % WER på slutresultat vid 0,16 s efter tal, 3,6 % på första delresultat, med hänvisning till Artificial Analysis streaming-topplista, jämfört med att ingen siffra för streaming-WER eller latens har publicerats som text.
• Kostnad och licens — 0,18 USD per ljudtimme, hostad, stängda vikter jämfört med 0 USD för vikterna (MIT), ungefär 18 GB bf16, självhostad.

Två mycket olika idéer om "streaming"
Ordet streaming täcker ett brett spektrum av takter, och gapet mellan dessa två är tillräckligt stort för att ändra vad du kan bygga på vardera. Muse Voice Transcribe streamar på ordnivå. Metas arkitektur konsumerar ljud i block om 80 millisekunder och använder vad den kallar ”adaptiv fördröjning” – en fördröjningspolicy som lärts in genom förstärkningsinlärning och som släpper varje ord så snart modellen är säker och håller kvar mer kontext för ord som den är mindre säker på, i stället för att tillämpa en fast latensbudget. Leverantören hävdar att slutgiltiga transkript levereras 0,16 sekunder efter att talaren har slutat och att de första delresultaten levereras 0,13 sekunder in i talet. Den takten är byggd för interaktiva loopar: live-textning, diktamen, en röstagent som måste svara på ett avslutat yttrande nästan omedelbart.
VibeVoice-ASR-Streaming-7B strömmar med grövre granularitet. Dess förprocessorkonfiguration visar att ljud anländer vid 24 kHz, komprimeras 3 200× till token vid ungefär 7,5 bildrutor per sekund, och bearbetas sedan i block om 22 bildrutor med 4 bildrutors framförhållning — ungefär 2,9 sekunder ljud per block, cirka en halv sekunds framförhållning, siffror som härrör från konfigurationen snarare än uppmätt latens. Text avges när varje block löses, med kontext från tidigare block bevarad genom KV-cachen så att en lång session inte beräknar om från början. En utskrift som växer i ungefär tresekunderssteg är fullt tillräcklig för mötesanteckningar och samtalsanalys; det är en annan produkt än ordströmning under en sekund för livekonversation. Ingen av laboratorierna har publicerat en end-to-end-latensmätning för strömningskontrollpunkten, så betrakta kadensen som designen och den verkliga känslan som otestad.
Talaretiketter och endpointing: inbyggda i den ena, påstådda i den andra
Talartilldelning är det område där strömningsprodukter oftast överdriver, och båda dessa gör anspråket. Muse Voice Transcribes version är konkret och strukturell: diarisering körs i samma strömningspass som igenkänningen, så en inspelning av ett samtal med tjugo personer kan bära per-talare-etiketter utan ett separat steg med "ladda upp, vänta, få tillbaka talare", och Meta rapporterar en genomsnittlig diariseringsfelfrekvens på 17,5 % — en leverantörssiffra, ej oberoende reproducerad, men en siffra kopplad till en verklig mekanism. Den avger också yttrandegränser, den tystare förmågan: en applikation får en tydlig signal om att "denna talares tur är slut" utan att behöva bygga en röstaktivitetsdetektor, vilket är anledningen till att röstagenter byggda på rå ASR så ofta avbryter personer.
VibeVoice-ASR-Streaming-7B gör anspråk på strömmande vem-sa-vad-utdata på sitt modellkort, i linje med batch-VibeVoice-ASR:ns strukturerade Vem/När/Vad-utdata — men för streaming-checkpointen är påståendet overifierat, inget oberoende test har reproducerat det, och det finns ingen dokumenterad endpointing-signal av det slag som Muse levererar. Om din arbetsbelastning verkligen är live-ljud med flera talare, erbjuder Muse en mer komplett mekanism idag; om du utvärderar huruvida en modell med öppna vikter kan göra samma jobb på hårdvara som du kontrollerar, är VibeVoice-påståendet precis den typ av sak att testa med dina egna mötesinspelningar innan du tror på det.
Beviset: lanseringsdagens påståenden mot ett tomt kort
Det är värt att vara precis om vad varje sida har, eftersom ingen av dem har vad en köpare faktiskt vill ha. Muse Voice Transcribe har en tät uppsättning leverantörssiffror — 3,1 % ordfelsfrekvens på slutgiltiga transkriptioner, 3,6 % på de första delutskrifterna, 0,16 sekunders slutlig latens, 17,5 % genomsnittligt diariseringsfel — alla publicerade av Meta på lanseringsdagen och pekande på Artificial Analysis streaming speech-to-text-ledartavla, där Meta gör anspråk på förstaplatsen. Det är påståenden, som inte har återproducerats av någon utanför labbet, men de är tillräckligt specifika för att kunna falsifieras, vilket är ett slags framsteg.
VibeVoice-ASR-Streaming-7B har inget av det där. Dess modellkort levererar en utvärderingssiffra som bild och den tekniska streamingrapporten är en PDF, men det finns ingen citerbar streaming-WER- eller latenssiffra i löptext. Det enda numeriska ankaret i VibeVoice-familjen är den leverantörsrapporterade tabellen i batch-VibeVoice-ASR-kortet — 7,77 % genomsnittlig WER över åtta engelska testset, 2,20 % på LibriSpeech clean — vilket uttryckligen inte är den här checkpointens siffra. När ett lanseringsdagsanspråk möter ett tomt kort är den ärliga utslagsfaktorn allt utom rubrikens WER: pris, licens, streamingtakt och de funktioner som varje sida faktiskt dokumenterar.
Språk: 25 verifierade mot 10 deklarerade
Språkstödet skiljer de två åt mer än rubrikernas noggrannhetspåståenden gör. Muse Voice Transcribe tränades på 70+ språk, men Meta validerar 25 vid lanseringen – och den verifierade listan, inte träningslistan, är produktionsstödet, med inbyggd kodväxling som särskiljande faktor: den är utformad för att växla språk mitt i en mening utan att bli tillsagd. VibeVoice-ASR-Streaming-7B deklarerar 10 språk i sitt modellkort – engelska, kinesiska, spanska, portugisiska, tyska, japanska, koreanska, franska, ryska, italienska – jämfört med 50+ för batchversionen VibeVoice-ASR. Om din trafik innehåller kodväxlande konversation har Muse ett mer specifikt erbjudande; om den ligger inom dessa tio språk är Microsoft-modellens stöd åtminstone explicit, vilket är mer än de flesta lanseringsmaterial erbjuder.
Kostnad och vad du behåller.
Det tydligaste sättet att avgöra är skillnaden i affärsmodell. Muse Voice Transcribe har med 0,18 dollar per ljudtimme ett lägre listpris än alla större API:er för strömmande transkribering – ingen GPU, ingen drift, slutna vikter, och priset är satt av Meta. VibeVoice-ASR-Streaming-7B är gratis att ladda ner, men att driva den själv på en GPU i 24 GB-klassen kräver cirka 18 GB bf16-vikter, och därtill kommer KV-cache. De dokumenterade sätten att servera den är antingen demoskripten från microsoft/VibeVoice eller vLLM-pluginet, och ingen inferensleverantör hostar den ännu. MIT-licensen är den bestående tillgången: vikterna är dina att behålla och finjustera, vilket ingen API-prenumeration kan erbjuda. Det är också där prisbilden kan bli intressant – i samma stund som en leverantör faktiskt hostar den öppna checkpointen blir frågan om 0,18 dollar i timmen ett marknadspris snarare än en enda leverantörs listpris, vilket är precis den situation där en pass-through-router gör skäl för sig. OrcaRouter dirigerar inte tal-till-text i dag, och ingen av dessa modeller finns i dess katalog; vad den däremot gör är att släppa igenom leverantörernas listpriser med 0 % påslag för de 200+ språkmodeller som konsumerar en live-transkription, så slår en prissänkning var som helst i stacken igenom på köparsidan samma dag som den tillkännages.

Vanliga frågor
Betyder Muse Voice Transcribes 3,1% WER att den är mer exakt än VibeVoice-ASR-Streaming-7B?
Nej, och jämförelsen är inte meningsfull ännu. Metas 3,1 % är ett påstående från lanseringsdagen för strömningsvägen, leverantörsrapporterat och ej reproducerat. VibeVoice-ASR-Streaming-7B har inte publicerat någon siffra för strömningsnoggrannhet i text överhuvudtaget. Tills båda modellerna har körts genom samma publika testbänk på samma ljud, är den enda ärliga slutsatsen att Muse har ett specifikt påstående som kan testas och att VibeVoice ännu inte har något.
Kan jag använda någon av modellerna på ljud som redan är inspelat?
Ja till båda, i olika former. Muse Voice Transcribe hanterar inspelningar som är längre än en timme genom samma strömnings-API. VibeVoice-ASR-Streaming-7B:s vLLM-plugin exponerar en ändpunkt för transkribering av hela filer vid sidan av sin WebSocket-strömningsändpunkt. Men båda är utformade och prissatta för realtidsanvändning – Muse genom sin affärsmodell som enbart bygger på strömning, VibeVoice genom den blockbaserade arkitekturen som sänder ut resultat i takt med att ljudet anländer – så om din arbetsbelastning enbart består av batchfiler, är ett dedikerat API för filtranskribering vanligtvis billigare och mer exakt mätbart än något av dem.
