
MAI-Transcribe-2 mot Muse Voice Transcribe: Samma vecka, två motsatta satsningar på ljud
- openaiNYOpenAI: GPT-6 Astra2026-09-0455Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0247Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0247Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0157Intelligens82Kodning
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2646Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1541Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1251Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0547Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligens69Kodning
Veckan den 1 september 2026 producerade två talmodeller från två frontier-labb, och MAI-Transcribe-2 och Muse Voice Transcribe förstås bäst som motsatta svar på frågan om var ljudintelligens ska leva. Muse Voice Transcribe, släppt av Meta Superintelligence Labs den 1 september, är en realtidsmodell för ljudperception: den transkriberar, separerar fler än tjugo talare och upptäcker när en talare har avslutat, allt i ett strömmande pass över 80-millisekunders segment av levande ljud, och den toppar den strömmande tal-till-text-listan den mättes på. MAI-Transcribe-2, släppt av Microsoft två dagar senare, den 3 september, är den motsatta satsningen: en batchmotor som inte alls jagar realtidslatens, utan istället lägger allt på att transkribera förinspelade filer med bästa ord-felfrekvensen på den oberoende icke-strömmande listan, ungefär 411× realtid, för cirka 1,67 USD per 1 000 minuter. Att jämföra dem sida vid sida som "transkriptionsmodeller" döljer det faktiska beslutet, som handlar om ögonblicket i ljudets liv då du behöver orden: medan det händer, eller efter att det är över.
Två produkter pekade vid olika tidpunkter
Muse Voice Transcribe är byggt för ögonblicket när ljudet fortfarande pågår. Det är en autoregressiv multimodal modell i Metas Muse-familj som förenar tre uppgifter i en enda genomkörning – automatisk taligenkänning, talardiarisering för fler än tjugo talare och endpointing, detekteringen av att en talare har slutat prata så att systemet kan svara. Meta rapporterar att den slutgiltiga transkriptionen levereras ungefär 0,16 sekunder efter att en talare har slutat, med 3,1 % ordfelsfrekvens för de slutgiltiga transkriptionerna och 3,6 % för de första partiella transkriptionerna – siffror som Meta publicerade på lanseringsdagen med hänvisning till Artificial Analysis strömningstopplista och som inte hade oberoende reproducerats när detta skrivs. Den hanterar ljud som är längre än en timme i en enda ström, växlar språk mitt i en mening och tränades på över 70 språk, varav 25 omfattande verifierades vid lanseringen. Priset är 3,00 USD per 1 000 minuter ljud, cirka 0,18 USD i timmen, via Meta Model API. Meta har bekräftat att vikterna inte kommer att göras öppna.
MAI-Transcribe-2 är byggd för när ljudet redan är en fil. Microsofts modell uppnår 2,0 % AA-WER på Artificial Analysis ledartavla för icke-strömmande modeller — andra plats och den bästa siffran bland de hanterade batch-API:erna — och körs cirka 411 gånger snabbare än realtid, vilket är en genomströmningssiffra, inte ett löfte om låg latens. Den transkriberar på 60 språk med automatisk språkidentifiering, inkluderar talardiarisering, tidsstämplar på ordnivå, nyckelordsbias och stilar för verbatim respektive ren text, och hanterar kodväxling som Hinglish och Spanglish. Den finns tillgänglig via Microsoft Foundry i offentlig förhandsversion och i MAI Playground för 0,10 USD per ljudtimme som ett tidsbegränsat lanseringserbjudande till och med årets slut, utan att någon streamingprodukt har aviserats. Microsofts lanseringsinlägg positionerar den uttryckligen för långformat och batchbearbetat ljud — arbetsbelastningar där en strömmande modells låga latens är värdelös, men dess kostnad per minut inte är det.

Varför de två noggrannhetssiffrorna inte strider
Den naturliga instinkten är att jämföra 2,0 % med 3,1 % och utse en vinnare, och det skulle vara fel av två skäl. För det första mäter siffrorna olika uppgifter: MAI-Transcribe-2:s 2,0 % är icke-strömmande noggrannhet på förinspelat ljud, där modellen kan titta på hela filen; Muse Voice Transcribe:s 3,1 % är strömmande noggrannhet på slutliga transkriptioner, producerade under villkoret att transkribera allt eftersom ljudet kommer in. Strömning är det svårare problemet, vilket är anledningen till att strömningslistan och icke-strömningslistan är separata listor med separata poäng. För det andra har etiketterna olika tyngd: MAI-Transcribe-2:s siffra är en Artificial Analysis-mätning av modellen, medan Muse Voice Transcribe:s är Metas rapport från lanseringsdagen om vad Artificial Analysis mätte – leverantörsrapporterad och inte reproducerad. Den ärliga slutsatsen är att båda modellerna trovärdigt kan göra anspråk på en topplacering i sina respektive listor, och ingen av siffrorna säger något om den andra kategorin.
Diariseringen är där den verkliga jämförelsen ligger, eftersom det är den enda funktion som båda produkterna har och den där deras ambitioner tydligt skiljer sig åt. Muse Voice Transcribe separerar fler än tjugo talare som en central strömningsfunktion, med Meta som rapporterar en genomsnittlig felfrekvens för talardiarisering på 17,5 % jämfört med ett konkurrentintervall på 21,1 % till 28,6 % som Meta själv citerar — återigen Meta-rapporterat och overifierat. MAI-Transcribe-2 inkluderar också diarisering, men Microsoft publicerar varken något tak för antal talare eller någon diarieringsfelfrekvens över huvud taget. För ett samtal med två deltagare fungerar båda produkterna bra och skillnaden är oväsentlig. För en fokusgrupp med tolv personer eller en panelinspelning är Muse Voice Transcribe den enda av de två vars tak för antal talare över huvud taget är angivet, och MAI-Transcribe-2:s omätta diarisering är det enskilt största skälet att testa den innan du anförtror den åt dina svårare ljudfiler.
Prisjämförelsen som är vettig.
Prismässigt ligger de två närmare varandra än vad uppdelningen i batch kontra strömning antyder, eftersom såväl 1,67 USD per 1 000 minuter (MAI-Transcribe-2, early-bird) som 3,00 USD per 1 000 minuter (Muse Voice Transcribe) ligger i den billiga delen av hanterad taligenkänning. Jämförelsen är bara meningsfull inom samma kategori. För förinspelad batchtranskribering är MAI-Transcribe-2 mindre än hälften så dyr som den strömningsbaserade modellen, samtidigt som den har bättre WER för icke-strömmande transkribering – men du skulle bara dirigera inspelade filer till Muse Voice Transcribe om du specifikt ville ha dess strömningspipeline, vilket inte är det effektiva sättet att bearbeta ett arkiv. För ljud från direktsända möten är Muse Voice Transcribe den enda produkt i den här artikeln som över huvud taget fungerar, och dess taxa på 3,00 USD underskrider de andra realtids-API:erna för transkribering som den lanserades mot – Gemini 3.5 Transcribe Live på cirka 9 USD per 1 000 minuter, GPT Live Transcribe på 17 USD – samtidigt som den erbjuder talardiarisering för fler än tjugo talare, något som de produkterna inte matchar. Den ärliga prissammanfattningen är att Meta satte strömningspriset lågt och Microsoft satte batchpriset ännu lägre, och båda siffrorna är introduktionspriser som kommer att justeras när respektive leverantör tillkännager sin ordinarie taxa.

Vilken för vilket ljud?
Om ditt ljud är live — möten som transkriberas i realtid, röstagenter, live-textning, allt där ord behövs medan de talas — är Muse Voice Transcribe valet, och det är inte nära. Det är den enda strömmande modellen här, den separerar fler än tjugo talare i samma pass, och den var prissatt för att vinna den banan från dag ett. Dess svagheter är de man bör ta med i en utvärdering: noggrannhets- och diariseringssiffrorna är Meta-rapporterade, och en veckogammal strömmande modell har ännu inte visat hur den beter sig på det röriga ljud som finns utanför lanseringsbenchmarks.
Om ditt ljud redan är filer — arkiv, samtalsinspelningar, mediebibliotek, allt som bearbetas i bulk — är MAI-Transcribe-2 det bättre valet på varje dimension som räknas: lägre uppmätt WER, ungefär en storleksordning högre genomströmning och ett pris per 1 000 minuter som understiger streamingmodellens. Dess risker är spegelbilden av Muses: fyra dagars ålder, ingen streaming-SKU, ouppmätt diariseringskvalitet och ett early-bird-pris med ett ej offentliggjort ordinarie pris bakom.
Microsofts lanseringssida som introducerar MAI-Transcribe-2 listar funktioner som Microsoft paketerar, vilka streamingkonkurrenten inte erbjuder i samma omgång, och det är dokumentet att kontrollera när du avgör vilka påståenden som utgör produktens faktiska funktionsyta och vilka som fortfarande är benchmarklöften.

Och om transkriptet bara är den första halvan av din pipeline spelar valet mellan dessa två mindre roll än valet du gör ovanför dem. Live-mötesljud som transkriberats av Muse Voice Transcribe behöver fortfarande sammanfattas, åtgärdspunkter extraheras och uppföljningar utformas innan det är användbart; arkiverade samtal som transkriberats av MAI-Transcribe-2 behöver fortfarande sökas, maskeras eller dirigeras till rätt efterföljande system. Det är i det lagret som en multimodellplattform visar sitt värde — OrcaRouters enda API för 200+ modeller, med leverantörernas listpriser som förs vidare utan påslag, gör att det nedströms arbetet kan anropa en annan modell per arbetsbelastning via en enda integration, så oavsett vilken talmodell som vinner din pilot behöver stacken ovanför transkriptet inte byggas om för att byta. Varken Muse Voice Transcribe eller MAI-Transcribe-2 står på den listan idag; båda ligger på sina leverantörers egna API:er. Det som verkligen avgjordes den här veckan är snävare och mer användbart: realtids- och batchtranskribering har båda just blivit tillräckligt billiga för att differentieringen inte längre handlar om orden — det handlar om vad du gör med dem.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
