
Grok Voice Transcribe 2.0 tar förstaplatsen för streamingnoggrannhet till oförändrat pris
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 är tal-till-text-modellen som SpaceXAI släppte den 18 september 2026, och det enda numret som spelar roll med den är inte det som lanseringsinlägget inleder med. Det är detta: den första partiella transkriptionen – texten som en röstagent faktiskt kan agera på medan den som ringer fortfarande blir överpratad – gick från 18,3 % ordfelsfrekvens i Grok Voice Transcribe 1.0 till 3,4 %. Det är mätningen på Artificial Analysis AA-WER Streaming-tavlan, där den nya modellen nu toppar både Final Transcript-rankingen (2,7 % WER, 0,49 sekunder efter talets slut) och First Partial Transcript-rankingen (3,4 %, 0,49 sekunder). Även sluttranskriptionens noggrannhet förbättrades, från 3,9 % till 2,7 %, vilket är en verklig men blygsam förbättring. Språnget i den partiella transkriptionen är det som förändrar vad du kan bygga.
Vad ändrades egentligen mellan 1.0 och 2.0?
De två versionerna är samma produkt i samma API, och SpaceXAI gjorde inga ändringar i gränssnittet: Grok Voice Transcribe 2.0 väljs genom att skicka grok-voice-transcribe-2.0 till /v1/stt i stället för grok-voice-transcribe-1.0, eller genom att välja den när WebSocket-anslutningen skapas för strömning. Befintliga integrationer som utelämnar modellparametern fortsätter att få 1.0 tills SpaceXAI ändrar standardinställningen, vilket företaget säger kommer att ske under de kommande veckorna i samband med att den äldre versionen avvecklas. Fram till dess är 2.0 opt-in och 1.0 kan låsas medvetet, vilket är rätt form för en sådan här ändring: du kan A/B-testa den på ditt eget ljud innan den blir din produktionsstandard oavsett om du bad om det eller inte.
Siffrorna från Artificial Analysis, lästa sida vid sida, berättar en mer specifik historia än ”dubbelt så träffsäker”:
• Slutlig transkriptionsnoggrannhet — Grok Voice Transcribe 2.0 vid 2,7 % WER jämfört med Grok Voice Transcribe 1.0 vid 3,9 % på AA-WER Streaming, båda uppmätta efter talets slut
• Noggrannhet för första partiella transkriptionen — 3,4 % WER jämfört med 18,3 %, den största enskilda skillnaden mellan de två versionerna
• Tid till slutlig transkription — 0,49 s mot 0,37 s, så den nya modellen är långsammare att fastställa än den som den ersätter
• Tid till första partiella — 0,49s vs 0,25s, likaså långsammare
• Batch (icke-strömmande) noggrannhet — 2,3 % AA-WER på Artificial Analysiss icke-strömmande resultattavla, mot 4,07 % för Whisper Large v3 och 3,31 % för GPT Transcribe
Batchgenomströmning — ungefär 162× realtid på samma kort, efter MAI-Transcribe-2:s 333× och före Gemini 3.5 Transcribes 88×
Den fjärde och femte raden är det ärliga förbehållet i den här utgåvan. SpaceXAI köpte noggrannhet till priset av latens. Den nya modellen är ungefär en tredjedels sekund långsammare på att returnera sitt första delresultat och sin slutliga transkription än 1.0 var. På en resultattavla där Deepgram Flux returnerar ett delresultat på 0,02 sekunder och Soniox v5 på 0,05, konkurrerar Grok Voice Transcribe 2.0 inte alls på hastighet — den konkurrerar om att ha rätt, och den vinner den avvägningen med bred marginal. Huruvida det är rätt avvägning beror helt och hållet på om din applikation är en röstagent i realtid som behöver börja tala tillbaka, eller en transkriberingspipeline där en halv sekund är osynlig.

Påståendet om "dubbelt så träffsäker", granskat
SpaceXAI:s huvudbudskap är att 2.0 är dubbelt så noggrann som 1.0 till samma pris, och företagets egen utvärderingstabell backar upp det på de uppsättningar företaget valde. På engelskspråkiga kundsupportssamtal i 8 kHz sjönk ordfelsfrekvensen från 10,6 % till 7,1 %. I konversationer med Grok, från 8,7 % till 3,3 %. För talade autentiseringsuppgifter – kontokoder, telefonnummer, e-postadresser – från 7,2 % till 3,2 %. För korta kommandon på 19 språk, från 20,6 % till 6,8 %, en minskning av felen med ungefär två tredjedelar. Dessa fyra uppsättningar är hämtade från SpaceXAI:s produktionstrafik och jämförelserna är SpaceXAI:s egna; ingen utanför företaget har reproducerat dem. Betrakta tabellen som en karta över var modellen har trimmats, inte som en allmän noggrannhetsgaranti.
Resultatet från Artificial Analysis är den del som inte är leverantörsrapporterad: en oberoende testrigg körd mot ungefär åtta timmars ljud, viktat med 50 % mot den privata AA-AgentTalk-uppsättningen och 25 % vardera mot VoxPopuli och Earnings22. Det stöder ett snävare och mer användbart påstående än ”dubbelt så träffsäkert” – att den här modellen på just den mixen är den mest träffsäkra strömmande transkriberaren som uppmätts. En hake värd att nämna: SpaceXAI:s inlägg beskriver en förstaplats ”bland 32 strömmande modeller”, medan själva resultattavlan visar 27 av 33 modeller. Placeringen är verklig; fältets storlek i marknadsföringstexten är företagets räkning, inte tavlans.
Det är också värt att vara precis om vad en förstaplats på AA-WER Streaming täcker och inte täcker. Listan är engelsktung och präglad av agenttal. Den mäter inte din accent, din codec, din domänvokabulär eller ditt åttakanaliga callcenter-ljud. En modell som toppar den kan fortfarande förlora stort på dina inspelningar, och det är precis därför som opt-in-fönstret spelar roll.

Priset är oförändrat, och det är det näst största faktumet här
Grok Voice Transcribe 2.0 kostar lika mycket som 1.0 kostade: 0,10 USD per ljudtimme för batch och inspelade filer via REST-slutpunkten, 0,20 USD per ljudtimme för streaming via WebSocket. På Artificial Analysiss pristavla hamnar streaming-SKU:n på 3,33 USD per 1 000 minuter och batch-SKU:n på 1,67 USD – samma batchpris som Microsoft tar för MAI-Transcribe-2, och ungefär en tredjedel av vad ElevenLabs Scribe v2 Realtime kostar per streamingminut.
Diarisering, ordnivå-tidsstämplar med konfidenspoäng och nyckelterm-viktning ingår alla i den taxan i stället för att mätas separat, vilket inte är universellt på den här marknaden. Gemini 3.5 Transcribe Live fakturerar per token för både ljudinmatning och textutdata, så din kostnad rör sig med hur mycket modellen säger, inte bara hur länge ljudet varade. En fast timtaxa är lättare att prognostisera och lättare att jämföra mellan leverantörer – och eftersom OrcaRouter för vidare leverantörernas listpriser med 0 % påslag skulle en ändring av den taxan från leverantörens sida synas hos oss samma dag i stället för efter en omprissättningscykel.
Vad API:et faktiskt ger dig
Listan över kapaciteter är bred och mestadels ärvd snarare än ny, vilket är värt att veta om du utvärderar uppgraderingen enbart utifrån funktioner:
• Batch och streaming i en och samma modell – REST för inspelade filer upp till 500 MB, WebSocket på wss://api.x.ai/v1/stt med preliminära resultat som skickas ut ungefär var 500:e ms
• Talardiariisering ingår, plus flerkanalig transkribering av upp till 8 oberoende kanaler
• Tidsstämplar på ordnivå med konfidenspoäng, så att du kan sätta ett tröskelvärde för intervall med låg konfidens i stället för att lita lika mycket på hela transkriptionen
• Biasering av nyckeltermer för upp till 100 domäntermer per begäran, var och en på upp till 50 tecken
• Invers textnormalisering för nummer, datum, valutor, telefonnummer och e-postadresser, med skriftlig formatering som stöds på 25 språk
• Borttagning av utfyllnadsord och Smart Turn-detektion av tursslut, direkt riktade mot röstagenter
• Automatisk språkdetektering med språkbyte mitt under inspelning i en enda omgång, över 12 ljudformat och samplingsfrekvenser från 8 kHz till 48 kHz
• Tjänstebegränsningar på 10 förfrågningar per sekund för både REST och streaming, samt 100 samtidiga streamingsessioner per team, som hostas i us-east-1
Den enda produktionsanteckningen som inte finns på funktionslistan: tjänsten körs i en enda region. Om ditt ljud har sitt ursprung utanför USA är nätverkssträckan nu en del av din latensbudget, och AA-WER Streaming räknar uttryckligen in nätverksfördröjningen i sin tidsberäkning. SpaceXAI erbjuder villkor för noll datalagring och hänvisar till SOC 2 Type II, BAA:er och alternativ för datalagring inom EU, så efterlevnadsberättelsen är mer utvecklad än den geografiska.

Vem bör flytta, och vad man ska hålla koll på
Om du redan använder Grok Voice Transcribe 1.0 och din applikation agerar på partiella transkriptioner – turndetektering, barge-in, svar från liveagenter – är gapet i träffsäkerhet för partiella transkriptioner från 18,3 % till 3,4 % tillräckligt stort för att testning av 2.0 inte är valfritt. Att siffran går från ”oftast fel” till ”oftast rätt” är skillnaden mellan en partiell transkription som du kan routa på och en som du bara kan visa. Om din applikation väntar på slutliga transkriptioner för inspelade filer är förbättringen verklig men mindre, och den tillkommande finaliseringslatensen på 0,12 sekunder är priset för det.
Om du använder en helt annan leverantör är anledningen att titta på den här utgåvan inte placeringen på topplistan – det är att ett frontier-labb just förbättrade sin transkriptionsmodell med stor marginal utan att höja priset, vilket är hur en marknad ser ut när noggrannhet slutar vara det man tar betalt för. Uppgraderingsvägen är också den billigaste sorten: en parameter, ingen kodändring, inget nytt avtal och en möjlighet att låsa versionen om det går fel.
Det du bör hålla koll på härnäst är standardväxlingen. När SpaceXAI gör 2.0 till standard och börjar fasa ut 1.0 kommer varje integration som aldrig har angett en modellparameter att flyttas över till den nya modellen på en gång, inklusive ändrad latens. Team som är beroende av den gamla partiella tidsstyrningen på 0,25 sekunder bör låsa nu i stället för att upptäcka ändringen i produktion. Det andra att hålla koll på är oberoende reproduktion: posten hos Artificial Analysis är en verklig mätning, men det är en enda resultattavla på en enda ljudmix, och ingen tredje part har ännu publicerat en likvärdig körning av 1.0 mot 2.0 på produktionsljud.
