
MAI-Transcribe-2-Streaming är live: Microsoft tar hem kronan för streamingtranskription vid 2,5 % WER
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 221 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
MAI-Transcribe-2-Streaming är Microsoft AI:s svar på den enda fråga som dess septemberlansering lämnade öppen, och man besvarade den på 28 dagar. MAI-Transcribe-2-Streaming släpptes den 1 oktober 2026 och är en tal-till-text-modell i realtid som transkriberar allteftersom orden kommer in i stället för efter att filen har slutförts. Microsoft säger att den rankas först i noggrannhet för både slutliga och partiella transkript i utvärderingen AA-WER Streaming från Artificial Analysis, med 2,5 % ordfelsfrekvens och den slutliga transkriptionen klar 0,13 sekunder efter att talet har upphört. Det är ett leverantörspåstående utifrån en trackers metodik snarare än en rad som trackern publicerar – i skrivande stund finns den inte med bland resultattavlans 37 modeller, och modellen den skulle tränga undan är Grok Voice Transcribe 2.0 (Streaming) med 2,73 % och 0,49 sekunder. Modellen som den bygger på, MAI-Transcribe-2, släpptes den 3 september som en batchmodell med 2,0 % WER och utan realtids-SKU; streamingvarianten stänger det gapet utan att göra avkall på särskilt mycket av den noggrannhet som gjorde batchversionen anmärkningsvärd. Det den däremot ger avkall på är priset: streaming kostar 5,4× batchpriset vid lanseringen.
Den vinkling Microsoft vill ha är att sopa rent på streamingtavlan. Den vinkling som siffrorna stöder är snävare och mer intressant – en modell som hävdar att den leder på både noggrannhet och latens samtidigt, på en front där tavlans mest noggranna post är fyra gånger långsammare att stabiliseras än dess snabbaste poster, och ingen av de snabba posterna ligger under 3 % i ordfel, prissatt i paritet med den etablerade aktören snarare än under den. Här är lanseringen som den utspelade sig, med leverantörspåståenden markerade.
Vad Microsoft släppte den 1 oktober
MAI-Transcribe-2-Streaming levereras via Microsofts talstack i Azure AI Speech-tjänsten, med dokumentation under modellens eget namn och samma distributionsmodell med endast API och inga vikter som batchutgåvan. Den transkriberar 60 språk med automatisk kontinuerlig språkidentifiering, så en session som byter språk mitt i strömmen behöver inte deklareras i förväg. Microsoft placerar den på Paretofronten för noggrannhet kontra latens i streamingdiagrammet från Artificial Analysis – leverantörens egen tolkning av trackerns data, och den tolkning som trackerns eget diagram stöder.
Strömningsmodellen var inte hela lanseringen. Microsoft släppte två röstmodeller tillsammans med den: MAI-Voice-2.1, som täcker 23 språk över 26 språkversioner, och MAI-Voice-2.1-Flash, som hanterar upp till 45 sekunders ljud vid en latens på ungefär 150 ms. Sett som en helhet är släppet den 1 oktober en komplett stack för realtidskonversation – höra, förstå, tala – snarare än en enskild modellansering.

Läser streamingtopplistan
AA-WER Streaming mäter två saker per modell: hur fel den färdiga transkriptionen är, och hur lång tid efter att talaren slutar det tar innan den är färdig. Microsofts påstående är att MAI-Transcribe-2-Streaming leder inom båda: 2,5 % ordfelsfrekvens på den slutliga transkriptionen vid 0,13 sekunder efter talets slut, och samma 2,5 % på den första partiella transkriptionen vid 0,12 sekunder, vilket Microsoft säger är först när det gäller noggrannhet på båda. Läs det som en leverantörssiffra – när detta skrivs har trackerns egen streamingtavla ännu inte plottat modellen, så det finns ingen oberoende MAI-Transcribe-2-Streaming-rad att läsa. Vad tavlan däremot visar är det fält som den gör anspråk på att slå, och fältet är tätare än vad en "kronings"-framställning antyder:
• Grok Voice Transcribe 2.0 — 2,73 % WER för slutlig transkription vid 0,49 sekunder efter talets slut, enligt Artificial Analysis, och den nuvarande ledaren på resultattavlan. Det är 0,23 punkter efter Microsofts påstådda 2,5 %, och ungefär fyra gånger långsammare att stabiliseras – skillnaden mellan en undertext som hänger med och en som släpar.
• Muse Voice Transcribe — 3,06 % vid 0,16 sekunder, enligt Artificial Analysis. Den närmaste konkurrenten i latens: cirka 30 millisekunder efter, och 0,5 punkter sämre i noggrannhet än Microsofts påstående.
• ElevenLabs Scribe v2 Realtime — 3,59 % vid 0,14 sekunder, enligt Artificial Analysis. I praktiken lika snabb, men mer än en procentenhet efter i noggrannhet.
• Gemini 3.5 Transcribe Live — 4,00 % strömnings-WER vid 0,40 sekunder, siffran som Artificial Analysis publicerade och som Google citerar för sin egen Live API-modell. Det är en skillnad på 1,5 punkter, och det är den jämförelse som den här utgåvan riktar sig mot.
Kolumnen för första delresultat är där påståendet är minst likt resten av resultattavlan. I samma tracker ligger Grok Voice Transcribe 2.0:s första delresultat på 3,36 % och Gemini 3.5 Transcribe Live:s på 5,77 % — delresultat ska vara sämre än den slutliga transkriptionen, ofta med en procentenhet eller mer, eftersom modellen låser sig innan meningen är slut. Ett första delresultat som matchar den slutliga siffran är den genuint ovanliga delen av Microsofts lansering, och det är den del som trackerns egna data ännu inte kan bekräfta. Ange det som ett påstående tills en rad finns.
Det ärliga förbehållet är att 0,13 sekunder och 0,16 sekunder är samma produktupplevelse för en människa som läser undertexter, och 2,5 % mot de 2,73 % som för närvarande toppar listan är ungefär 2 fel per 1 000 ord. Ett försprång av den storleken är verkligt men litet, och om det är ett försprång som någon kan känna beror på arbetsbelastningen. Där det verkligen biter är i svansen: en kontaktcenterström som kör åtta timmar om dagen med 2,73 % mot 2,5 % är tiotusentals extra felaktiga ord per år, och ordfel i en transkription är inte jämnt fördelade — de klumpar sig kring just de egennamn och siffror som gör en transkription användbar.

Vad 9,00 $ per 1 000 minuter ger
Strömning kostar mer än batch, och Microsoft prissatte det högst upp i realtidsnivån i stället för under den. MAI-Transcribe-2-Streaming har ett listpris på 0,54 USD per ljudtimme, vilket motsvarar 9,00 USD per 1 000 minuter strömmat ljud, beskrivet som ett introduktionspris som gäller till slutet av året. Som jämförelse kostar batch-MAI-Transcribe-2 0,10 USD per ljudtimme – 1,67 USD per 1 000 minuter – så realtidstranskribering kostar ungefär 5,4 gånger det filbaserade priset för samma underliggande familj och 0,5 procentenheter mer ordningsfel. Det är inte ett påslag som Microsoft döljer; det är det ärliga priset för en beständig anslutning och en partiell transkription som måste stämma innan meningen är över.
Jämfört med resten av streamingnivån är bilden blandad. MAI-Transcribe-2-Streaming tangerar Gemini 3.5 Transcribe Live på ungefär 9 USD per 1 000 minuter – mer exakt, samma pengar. Det ligger över ElevenLabs Scribe v2 Realtime och Deepgram Flux på omkring 6,50 USD per 1 000 minuter, över Cartesia Ink-2 på omkring 4 USD och ungefär tre gånger så dyrt som Muse Voice Transcribe på omkring 3 USD. Lanseringen är alltså en satsning på noggrannhet och latens till samma pris, inte ett priskrig; team som redan kör en billigare streamingmodell kommer att växla dollar mot WER-poäng.
Den avvägningen förtjänar att benämnas exakt, för det är samma avvägning som batchlanseringen vände på. I september gjorde Microsoft noggrannhet billigt. I oktober gjorde det att realtidsnoggrannhet kostade lika mycket som alla andras. Om din pipeline bara behöver transkriptioner så småningom förändrar inget den 1 oktober din faktura. Om den behöver dem medan samtalet fortfarande pågår har kalkylen precis förskjutits till kvalitet.

Att bygga vidare på en transkription är den andra halvan av det beslutet, och det är där ett lager med flera modeller förtjänar sin plats. En realtidstranskription är sällan slutet på pipelinen – den sammanfattas, poängsätts, söks igenom, dirigeras och eskaleras, och dessa steg vill ha olika modeller till olika kostnader. OrcaRouter finns för det lagret: ett API över 200+ modeller, leverantörernas listpriser som förs vidare med 0 % påslag, automatisk failover och en routing-DSL som kan skicka en live-transkription till en modell för efterlevnadskontroll och en annan för mötesanteckningar utan en andra integration. MAI-Transcribe-2-Streaming finns inte själv med på den listan – den tillhandahålls via Microsofts egen talstack – men den strömmande transkription som den producerar är precis den typ av indata med hög volym och latenskänslighet som talar för att hålla lagret ovanför det modellagnostiskt.
Vad som inte är bevisat ännu
Tre saker är genuint öppna. För det första, diarisering: batchmodellen inkluderar talarattribution utan någon publicerad diariseringsfelfrekvens, och Microsofts strömningsmaterial gör inte ens något anspråk på diarisering — för en realtidsmodell som förser live-agentstöd eller undertexter är vem-som-sa-vad ofta funktionen som betyder mer än rå WER. För det andra, den flerspråkiga uppdelningen: 60 språk med automatisk kontinuerlig språkidentifiering är ett vittgående påstående, och en strömmande modells latens per språk kan variera mycket mer än motsvarande batchmodells, eftersom kvaliteten på partiella transkript beror på hur snabbt modellen låser sig vid ett språk. Microsoft har inte publicerat någon strömningstabell per språk. För det tredje mäts WER för strömning på rent benchmark-ljud; den felmod som skadar verkliga driftsättningar är en brusig fjärrfältsström, och ingen oberoende jämförelse av fjärrfältsströmning fanns på lanseringsdagen.
Där det lämnar din stack
Det intressanta med den här lanseringen är inte att Microsoft har den mest exakta strömningstranskriptionen. Det är kadensen: batch i september, strömning i oktober, i samma familj, på samma dokumentationsyta, med en prismodell som nu sträcker sig från 1,67 till 9,00 dollar per 1 000 minuter för samma underliggande kapacitet. Det ger team ett verkligt val för första gången – betala för realtid endast där realtid spelar roll, och batcha allt annat – men det innebär också att transkriptionslagret nu är något man finjusterar per arbetsbelastning i stället för att standardisera en gång.
Läs rubrikpåståendet bokstavligt och det håller som ett leverantörsuttalande: Microsoft säger att MAI-Transcribe-2-Streaming är först när det gäller både sluttranskriptionsnoggrannhet och noggrannhet för första partial, och att den ligger på Paretofronten. Asteriskerna betyder att trackerns resultattavla ännu inte har plottat modellen, att övertaget som den gör anspråk på över den nuvarande ledaren är så litet att det kan försvinna vid en ny körning, att prisfördelen är noll, och att historien om diarisering inte har berättats. Det är dessa saker man bör bevaka, inte kronan.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
