
Grok Voice Transcribe 2.0 mot MAI Transcribe 2: Två spår, inte två rivaler
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
De här två modellerna släpptes med femton dagars mellanrum och prissattes till samma pris på öret, och de kommer nästan aldrig att ingå i samma upphandlingsbeslut. Grok Voice Transcribe 2.0, som släpptes av SpaceXAI den 18 september 2026, är modellen du anropar när ljud fortfarande anländer – den strömmar över en WebSocket, avger interimsresultat ungefär var 500:e ms och toppar AA-WER Streaming-tavlan från Artificial Analysis med en ordfelsfrekvens på 2,7 % för slutliga transkriptioner och 3,4 % för första partiella resultat. MAI-Transcribe-2, som släpptes av Microsoft AI den 3 september 2026, är modellen du anropar när ljudet redan är en fil – den är endast för batchkörning, och på den icke-strömmande listan från Artificial Analysis är den den mest exakta hanterade modellen som uppmätts, med 2,04 % AA-WER, före Grok Voice Transcribe 2.0:s 2,29 % och ungefär 2× snabbare i genomströmning. Båda har ett listpris på 0,10 USD per ljudtimme, cirka 1,67 USD per 1 000 minuter. Om ditt krav är realtid finns det ingen jämförelse att göra. Om ditt krav är en fil, finns det en sådan.
Gränsen som ingen av leverantörerna kommer att dra åt dig
Stöd för strömning är inte en funktionsflagga. Grok Voice Transcribe 2.0 betjänar samma modell via REST för inspelade filer och via `wss://api.x.ai/v1/stt` för ljud i realtid, så den noggrannhet du mäter upp på ditt arkiv är den noggrannhet du får i ett samtal i realtid. MAI-Transcribe-2 har ingen strömnings-SKU över huvud taget: Microsofts lanseringsmaterial positionerar den uttryckligen för långformat ljud och batchljud, och även om modellkortet listar undertextning i realtid bland sina användningsscenarier är vägen dit att segmentera ljudet och skicka varje segment genom batch-API:et — vilket är en pipeline som du bygger och driver, inte en latensgaranti som du köper. Microsofts framträdande genomströmning på ungefär 411× realtid är en siffra för bearbetningshastighet, inte för svarstid, och de två sammanblandas ständigt i rapporteringen om den här lanseringen.
Den praktiska konsekvensen: om du bygger röstagenter med turtagning, direkttextning eller något annat där en människa eller en modell reagerar på tal som pågår, är MAI-Transcribe-2 inte ett alternativ, oavsett hur bra dess noggrannhet är. Om du transkriberar möten i efterhand, inspelningar från kontaktcenter över natten, mediearkiv eller regelefterlevnadseftersläp, är streaming en onödig belastning och batch-siffrorna är hela historien.
Där MAI-Transcribe-2 verkligen ligger före
Noggrannhet på filer, först. Skillnaden mellan 2,04 % och 2,29 % mäts på samma oberoende testbänk — Artificial Analysis AA-WER v2, 50 % AA-AgentTalk och 25 % vardera av VoxPopuli och Earnings22 — vilket gör det till det renaste faktumet i den här jämförelsen. Det är en skillnad på 0,25 punkter, ungefär två och en halv färre fel per tusen ord. Om det spelar roll beror på vad du gör med transkriptionen; för ett sökbart arkiv gör det inte det, och för ett juridiskt eller medicinskt dokument kan det göra det.
Genomströmning, för det andra, och med större marginal än noggrannhetsgapet: 333× realtid mot Grok Voice Transcribe 2.0:s 162×. Båda siffrorna är Artificial Analysis-mätningar av antalet sekunder inmatat ljud som transkriberas per sekund, inte leverantörernas påståenden. Vid den takten blir ett tusentimmarsarkiv klart på ungefär tre timmars beräkningstid med Microsoft-modellen och ungefär sex med SpaceXAI-modellen. För en engångsmigrering är det irrelevant; för en pipeline som kontinuerligt tar in data är den halverade väggklockstiden en verklig kapacitetsskillnad.
Språktäckning, för det tredje. Microsoft anger 60 språk med automatisk identifiering, kodväxling inom en inspelning och en genomsnittlig ordfelsfrekvens på 5,2 % för dem på FLEURS – en av leverantören rapporterad siffra, inte oberoende reproducerad, men den beskriver åtminstone det flerspråkiga fallet över en angiven språklista. SpaceXAI dokumenterar dussintals språk med växling mitt i inspelningen och formatering av skriftlig form över 25. Om ditt ljud ligger utanför den vältäckta uppsättningen engelska och större europeiska språk är FLEURS-siffran mer informativ än en resultattavla som är engelskviktad och dominerad av agenttal.
Ytterligare två skillnader som har betydelse operativt. MAI-Transcribe-2 erbjuder konfigurerbara transkriberingsstilar – ordagrann, som bevarar disfluenser, kontra ren, som tar bort dem – medan Grok Voice Transcribe 2.0 hanterar samma problem med en flagga för borttagning av utfyllnadsord. Och Microsofts modell är i offentlig förhandsversion på Microsoft Foundry, vilket innebär ingen SLA och en stående rekommendation mot produktionsanvändning tills den blir allmänt tillgänglig; SpaceXAI:s modell är allmänt tillgänglig med publicerade hastighetsgränser på 10 förfrågningar per sekund och 100 samtidiga strömningssessioner per team.

Där Grok Voice Transcribe 2.0 verkligen ligger steget före
• Realtidsströmning – en WebSocket-slutpunkt med preliminära resultat var ~500:e ms, jämfört med enbart batch där ingen realtids-SKU har aviserats
• Noggrannhet för första partiella transkript — 3,4 % WER vid 0,49 s på AA-WER Streaming, en kategori som MAI-Transcribe-2 inte tävlar i
• Batch-noggrannhet på agent-talk-ljud — 2,29 % totalt, men på delmängden AA-AgentTalk i den icke-strömmande tavlan är ordningen tätare än rubriken antyder, och i den strömmande tavlans agent-tunga mix leder Grok ohotat
• Infrastruktur för röstagenter — Smart Turn-detektering av turavslut och borttagning av utfyllnadsord ingår i modellen, medan MAI-Transcribe-2 lämnar turlogiken till anroparen
• Flerkanaligt ljud — upp till 8 oberoende kanaler transkriberas i en enda omgång, vilket är viktigt för stereo- eller samtalsinspelningar med flera ben
• Konfidens på ordnivå – tidsstämplar har en konfidenspoäng per ord, så intervall med låg konfidens kan flaggas i stället för att litas på lika mycket
• Tillgänglighetsvillkor — allmänt tillgänglig med publicerade samtidighetsgränser, mot en offentlig förhandsversion utan SLA
• Prisets varaktighet — $0.10 per timme är det gällande priset för både batch och basen för streamingnivån på $0.20, där Microsofts identiska $0.10 är ett tidsbegränsat lanserbjudande utan meddelat standardpris för 2027
Den sista punkten är den som de flesta jämförelser hoppar över. De två modellerna kostar lika mycket i dag, och ett av dessa priser har ett utgångsdatum som det andra inte har. Microsoft har inte publicerat någon taxa efter kampanjen, och rapporteringen går isär om erbjudandet löper till slutet av 2026 eller inte har något angivet slutdatum alls. Om du modellerar en treårig transkriberingsbudget utifrån 1,67 dollar per 1 000 minuter från Microsoft, modellerar du en siffra som leverantören inte har förbundit sig till.

Överlappningen är verklig, och den utgör större delen av funktionslistan.
Om vi bortser från streamingfrågan konvergerar de två produkterna kraftigt. Båda utför talardiarisering. Båda returnerar tidsstämplar på ordnivå. Båda hanterar invers textnormalisering – siffror, datum, valutor och kontaktuppgifter återgivna i skriven form. Båda accepterar domänterminologi: Grok Voice Transcribe 2.0 i form av upp till 100 nyckeltermer per begäran och MAI-Transcribe-2 i form av listor över domänterminologi och förkortningar. Båda identifierar språk automatiskt och följer en talare som byter språk mitt under inspelningen. Båda hanterar telefoniljud i 8 kHz, vilket är det fall som de flesta transkriberingsmodeller tyst misslyckas med och det som SpaceXAI har finjusterat hårdast mot – dess interna telefonidataset gick från 10,6 % till 7,1 % WER mellan versionerna, en siffra som företaget själv rapporterat för företagets egen ljuddata.
Båda har också indatagränser som formar arkitekturer snarare än bara budgetar. Grok Voice Transcribe 2.0 accepterar filer på upp till 500 MB i 12 ljudformat med samplingsfrekvenser från 8 kHz till 48 kHz. MAI-Transcribe-2:s gränser bestäms av Foundry-vägen snarare än av modellen, och team bör läsa Microsofts egen dokumentation för den aktuella övre gränsen i stället för att anta likvärdighet med en dedikerad STT-tjänst.
Vad den konvergensen innebär är att beslutet reduceras till tre frågor i ordning: behöver det vara live, hur många språk har du faktiskt, och hur mycket kostar noggrannhetsgapet dig. Den första frågan är binär och utesluter ett alternativ direkt. Den andra går vanligtvis att besvara utifrån ett urval av ditt eget ljud. Den tredje är tillräckligt liten för att den inte kommer att avgöra något för de flesta filbaserade arbetsbelastningar — gapet på 0,25 punkter är verkligt, men det är också faktumet att båda modellerna ligger inom en halv punkt från det bästa tal någon har uppmätt.

Vad ska man göra med detta
Betrakta dem som en tvåfilig stack snarare än en direkt konfrontation. Ett kontaktcenter som kör live-agentassistans och ett nattligt compliance-arkiv väljer inte mellan Grok Voice Transcribe 2.0 och MAI-Transcribe-2 — det kör båda, och den enda frågan är om det kostar dem två leverantörsrelationer, två uppsättningar autentiseringsuppgifter, två fakturor och två hastighetsgränser. Ingen av modellerna finns i OrcaRouters katalog idag, så själva transkriberingsanropen går till varje leverantörs eget API. Vad en OrcaRouter-nyckel däremot täcker är allt nedströms: sammanfattaren, klassificeraren, agenten som resonerar kring transkriptet, och utvärderingsjobbet som jämför de två leverantörernas utdata på samma inspelning. Det sista är anledningen att bry sig — du kan inte avgöra mellan dessa modeller utifrån en topplista, eftersom topplistan är åtta timmar av engelskt agentprat och ditt ljud är det inte.
Håll ögonen på två saker. För det första: om Microsoft sätter ett standardpris på MAI-Transcribe-2 när lanserbjudandet tar slut; ett permanent pris på 1,67 dollar per 1 000 minuter skulle göra den till standardvalet för batch enbart av kostnadsskäl, och en återgång till MAI-Transcribe-1:s 0,36 dollar per timme skulle göra det här till ett mycket kortare samtal. För det andra: om Microsoft lanserar en streaming-SKU. Modellkortet anger redan realtidstextning som ett målscenario, och det enda som står mellan MAI-Transcribe-2 och streaming-spåret är en endpoint – om den kommer på plats slutar dessa två att vara spår och blir konkurrenter.
