Artikelns hero-kort med texten "MAI-Transcribe-2-Streaming är live", med märket "NY MODELL · MICROSOFT AI" och underrubriken "Microsoft tar kronan för streamingtranskript med 2,5 % WER", med en statistikrad som visar en ordfelsfrekvens för streaming på 2,5 % 0,13 s efter talets slut, märkt på kortet som Microsofts påstående och att företaget är först med både slutliga och partiella transkript; 60 språk med automatisk kontinuerlig språkidentifiering; och 9,00 USD per 1 000 minuter, beskrivet som 0,54 USD per ljudtimme i introduktionspris till och med 2026; över en gradient från vitt till blått med OrcaRouter-logotypen nere till höger.
Guides & Insights

MAI-Transcribe-2-Streaming är live: Microsoft tar hem kronan för streamingtranskription vid 2,5 % WER

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

MAI-Transcribe-2-Streaming är Microsoft AI:s svar på den enda fråga som dess septemberlansering lämnade öppen, och man besvarade den på 28 dagar. MAI-Transcribe-2-Streaming släpptes den 1 oktober 2026 och är en tal-till-text-modell i realtid som transkriberar allteftersom orden kommer in i stället för efter att filen har slutförts. Microsoft säger att den rankas först i noggrannhet för både slutliga och partiella transkript i utvärderingen AA-WER Streaming från Artificial Analysis, med 2,5 % ordfelsfrekvens och den slutliga transkriptionen klar 0,13 sekunder efter att talet har upphört. Det är ett leverantörspåstående utifrån en trackers metodik snarare än en rad som trackern publicerar – i skrivande stund finns den inte med bland resultattavlans 37 modeller, och modellen den skulle tränga undan är Gro​k Voice Transcribe 2.0 (Streaming) med 2,73 % och 0,49 sekunder. Modellen som den bygger på, MAI-Transcribe-2, släpptes den 3 september som en batchmodell med 2,0 % WER och utan realtids-SKU; streamingvarianten stänger det gapet utan att göra avkall på särskilt mycket av den noggrannhet som gjorde batchversionen anmärkningsvärd. Det den däremot ger avkall på är priset: streaming kostar 5,4× batchpriset vid lanseringen.

Den vinkling Microsoft vill ha är att sopa rent på streamingtavlan. Den vinkling som siffrorna stöder är snävare och mer intressant – en modell som hävdar att den leder på både noggrannhet och latens samtidigt, på en front där tavlans mest noggranna post är fyra gånger långsammare att stabiliseras än dess snabbaste poster, och ingen av de snabba posterna ligger under 3 % i ordfel, prissatt i paritet med den etablerade aktören snarare än under den. Här är lanseringen som den utspelade sig, med leverantörspåståenden markerade.

Vad Microsoft släppte den 1 oktober

MAI-Transcribe-2-Streaming levereras via Microsofts talstack i Azure AI Speech-tjänsten, med dokumentation under modellens eget namn och samma distributionsmodell med endast API och inga vikter som batchutgåvan. Den transkriberar 60 språk med automatisk kontinuerlig språkidentifiering, så en session som byter språk mitt i strömmen behöver inte deklareras i förväg. Microsoft placerar den på Paretofronten för noggrannhet kontra latens i streamingdiagrammet från Artificial Analysis – leverantörens egen tolkning av trackerns data, och den tolkning som trackerns eget diagram stöder.

Strömningsmodellen var inte hela lanseringen. Microsoft släppte två röstmodeller tillsammans med den: MAI-Voice-2.1, som täcker 23 språk över 26 språkversioner, och MAI-Voice-2.1-Flash, som hanterar upp till 45 sekunders ljud vid en latens på ungefär 150 ms. Sett som en helhet är släppet den 1 oktober en komplett stack för realtidskonversation – höra, förstå, tala – snarare än en enskild modellansering.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models as accurate, fast and low cost, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

Läser streamingtopplistan

AA-WER Streaming mäter två saker per modell: hur fel den färdiga transkriptionen är, och hur lång tid efter att talaren slutar det tar innan den är färdig. Microsofts påstående är att MAI-Transcribe-2-Streaming leder inom båda: 2,5 % ordfelsfrekvens på den slutliga transkriptionen vid 0,13 sekunder efter talets slut, och samma 2,5 % på den första partiella transkriptionen vid 0,12 sekunder, vilket Microsoft säger är först när det gäller noggrannhet på båda. Läs det som en leverantörssiffra – när detta skrivs har trackerns egen streamingtavla ännu inte plottat modellen, så det finns ingen oberoende MAI-Transcribe-2-Streaming-rad att läsa. Vad tavlan däremot visar är det fält som den gör anspråk på att slå, och fältet är tätare än vad en "kronings"-framställning antyder:

• Grok Voice Transcribe 2.0 — 2,73 % WER för slutlig transkription vid 0,49 sekunder efter talets slut, enligt Artificial Analysis, och den nuvarande ledaren på resultattavlan. Det är 0,23 punkter efter Microsofts påstådda 2,5 %, och ungefär fyra gånger långsammare att stabiliseras – skillnaden mellan en undertext som hänger med och en som släpar.

• Muse Voice Transcribe — 3,06 % vid 0,16 sekunder, enligt Artificial Analysis. Den närmaste konkurrenten i latens: cirka 30 millisekunder efter, och 0,5 punkter sämre i noggrannhet än Microsofts påstående.

• ElevenLabs Scribe v2 Realtime — 3,59 % vid 0,14 sekunder, enligt Artificial Analysis. I praktiken lika snabb, men mer än en procentenhet efter i noggrannhet.

• Gemini 3.5 Transcribe Live — 4,00 % strömnings-WER vid 0,40 sekunder, siffran som Artificial Analysis publicerade och som Google citerar för sin egen Live API-modell. Det är en skillnad på 1,5 punkter, och det är den jämförelse som den här utgåvan riktar sig mot.

Kolumnen för första delresultat är där påståendet är minst likt resten av resultattavlan. I samma tracker ligger Grok Voice Transcribe 2.0:s första delresultat på 3,36 % och Gemini 3.5 Transcribe Live:s på 5,77 % — delresultat ska vara sämre än den slutliga transkriptionen, ofta med en procentenhet eller mer, eftersom modellen låser sig innan meningen är slut. Ett första delresultat som matchar den slutliga siffran är den genuint ovanliga delen av Microsofts lansering, och det är den del som trackerns egna data ännu inte kan bekräfta. Ange det som ett påstående tills en rad finns.

Det ärliga förbehållet är att 0,13 sekunder och 0,16 sekunder är samma produktupplevelse för en människa som läser undertexter, och 2,5 % mot de 2,73 % som för närvarande toppar listan är ungefär 2 fel per 1 000 ord. Ett försprång av den storleken är verkligt men litet, och om det är ett försprång som någon kan känna beror på arbetsbelastningen. Där det verkligen biter är i svansen: en kontaktcenterström som kör åtta timmar om dagen med 2,73 % mot 2,5 % är tiotusentals extra felaktiga ord per år, och ordfel i en transkription är inte jämnt fördelade — de klumpar sig kring just de egennamn och siffror som gör en transkription användbar.

A generated comparison card titled 'The streaming field, by the numbers' with a left column for MAI-Transcribe-2-Streaming (final-transcript word error rate 2.5% flagged as Microsoft's claim, time to final transcript 0.13s after speech end, first-partial word error rate 2.5% at 0.12s flagged as claimed, $9.00 per 1,000 minutes introductory, 60 languages with automatic detection, and 'not yet plotted' for the tracker's board) and a right column headed 'The field it claims to beat' listing Grok Voice Transcribe 2.0 at 2.73% and 0.49s, Muse Voice Transcribe at 3.06% and 0.16s, ElevenLabs Scribe v2 Realtime at 3.59% and 0.14s, Qwen3 ASR Flash Realtime at 3.73% and 0.48s, Gemini 3.5 Transcribe Live at 4.00% and 0.40s, and a board size of 37 models, with a footer noting that Microsoft's figures are the vendor's own claim measured on Artificial Analysis's streaming methodology while the right-hand column is what Artificial Analysis currently publishes, all times being after detected end of speech, and the OrcaRouter logo bottom right.

Vad 9,00 $ per 1 000 minuter ger

Strömning kostar mer än batch, och Microsoft prissatte det högst upp i realtidsnivån i stället för under den. MAI-Transcribe-2-Streaming har ett listpris på 0,54 USD per ljudtimme, vilket motsvarar 9,00 USD per 1 000 minuter strömmat ljud, beskrivet som ett introduktionspris som gäller till slutet av året. Som jämförelse kostar batch-MAI-Transcribe-2 0,10 USD per ljudtimme – 1,67 USD per 1 000 minuter – så realtidstranskribering kostar ungefär 5,4 gånger det filbaserade priset för samma underliggande familj och 0,5 procentenheter mer ordningsfel. Det är inte ett påslag som Microsoft döljer; det är det ärliga priset för en beständig anslutning och en partiell transkription som måste stämma innan meningen är över.

Jämfört med resten av streamingnivån är bilden blandad. MAI-Transcribe-2-Streaming tangerar Gemini 3.5 Transcribe Live på ungefär 9 USD per 1 000 minuter – mer exakt, samma pengar. Det ligger över ElevenLabs Scribe v2 Realtime och Deepgram Flux på omkring 6,50 USD per 1 000 minuter, över Cartesia Ink-2 på omkring 4 USD och ungefär tre gånger så dyrt som Muse Voice Transcribe på omkring 3 USD. Lanseringen är alltså en satsning på noggrannhet och latens till samma pris, inte ett priskrig; team som redan kör en billigare streamingmodell kommer att växla dollar mot WER-poäng.

Den avvägningen förtjänar att benämnas exakt, för det är samma avvägning som batchlanseringen vände på. I september gjorde Microsoft noggrannhet billigt. I oktober gjorde det att realtidsnoggrannhet kostade lika mycket som alla andras. Om din pipeline bara behöver transkriptioner så småningom förändrar inget den 1 oktober din faktura. Om den behöver dem medan samtalet fortfarande pågår har kalkylen precis förskjutits till kvalitet.

A single-column scoreboard card titled 'MAI-Transcribe-2-Streaming — the launch scoreboard' listing 2.5% final-transcript WER at 0.13s, 2.5% first-partial WER at 0.12s, an accuracy rank claimed at #1 for final and partial transcripts, tracker status 'not yet plotted on the 37-model board', $9.00 per 1,000 minutes ($0.54 per audio-hour) introductory through 2026, 60 languages with automatic continuous detection, no published diarization or word-level timestamp claim for the streaming SKU, and the batch sibling MAI-Transcribe-2 at 2.0% AA-WER, roughly 411x real time and $1.67 per 1,000 minutes, with the OrcaRouter logo bottom right.

Att bygga vidare på en transkription är den andra halvan av det beslutet, och det är där ett lager med flera modeller förtjänar sin plats. En realtidstranskription är sällan slutet på pipelinen – den sammanfattas, poängsätts, söks igenom, dirigeras och eskaleras, och dessa steg vill ha olika modeller till olika kostnader. OrcaRouter finns för det lagret: ett API över 200+ modeller, leverantörernas listpriser som förs vidare med 0 % påslag, automatisk failover och en routing-DSL som kan skicka en live-transkription till en modell för efterlevnadskontroll och en annan för mötesanteckningar utan en andra integration. MAI-Transcribe-2-Streaming finns inte själv med på den listan – den tillhandahålls via Microsofts egen talstack – men den strömmande transkription som den producerar är precis den typ av indata med hög volym och latenskänslighet som talar för att hålla lagret ovanför det modellagnostiskt.

Vad som inte är bevisat ännu

Tre saker är genuint öppna. För det första, diarisering: batchmodellen inkluderar talarattribution utan någon publicerad diariseringsfelfrekvens, och Microsofts strömningsmaterial gör inte ens något anspråk på diarisering — för en realtidsmodell som förser live-agentstöd eller undertexter är vem-som-sa-vad ofta funktionen som betyder mer än rå WER. För det andra, den flerspråkiga uppdelningen: 60 språk med automatisk kontinuerlig språkidentifiering är ett vittgående påstående, och en strömmande modells latens per språk kan variera mycket mer än motsvarande batchmodells, eftersom kvaliteten på partiella transkript beror på hur snabbt modellen låser sig vid ett språk. Microsoft har inte publicerat någon strömningstabell per språk. För det tredje mäts WER för strömning på rent benchmark-ljud; den felmod som skadar verkliga driftsättningar är en brusig fjärrfältsström, och ingen oberoende jämförelse av fjärrfältsströmning fanns på lanseringsdagen.

Där det lämnar din stack

Det intressanta med den här lanseringen är inte att Microsoft har den mest exakta strömningstranskriptionen. Det är kadensen: batch i september, strömning i oktober, i samma familj, på samma dokumentationsyta, med en prismodell som nu sträcker sig från 1,67 till 9,00 dollar per 1 000 minuter för samma underliggande kapacitet. Det ger team ett verkligt val för första gången – betala för realtid endast där realtid spelar roll, och batcha allt annat – men det innebär också att transkriptionslagret nu är något man finjusterar per arbetsbelastning i stället för att standardisera en gång.

Läs rubrikpåståendet bokstavligt och det håller som ett leverantörsuttalande: Microsoft säger att MAI-Transcribe-2-Streaming är först när det gäller både sluttranskriptionsnoggrannhet och noggrannhet för första partial, och att den ligger på Paretofronten. Asteriskerna betyder att trackerns resultattavla ännu inte har plottat modellen, att övertaget som den gör anspråk på över den nuvarande ledaren är så litet att det kan försvinna vid en ny körning, att prisfördelen är noll, och att historien om diarisering inte har berättats. Det är dessa saker man bör bevaka, inte kronan.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen