Artikelhjältekort med texten ”Grok Voice Transcribe 2.0 vs GPT Transcribe”, med märket ”MODELLJÄMFÖRELSE” och underrubriken ”Samma streamingpris, olika noggrannhet”, med chips som visar 2,7 % vs 3,9 % streaming-WER, 3,4 % vs 6,3 % första delresultat, $1,67 vs $4,50 per 1 000 minuter och 162x vs 41x realtid, över en gradient från vitt till blått med OrcaRouter-logotypen nere till höger.
Guides & Insights

Grok Voice Transcribe 2.0 vs GPT Transcribe: Samma streamingpris, olika noggrannhet

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Sammanträffandet är nästan för snyggt. På Artificial Analysis AA-WER Streaming-resultattavla listas Grok Voice Transcribe 2.0 och GPT Live Transcribe — slutpunkten för streamingtranskribering — båda till exakt 3,33 dollar per 1 000 minuter ljud. SpaceXAI:s Grok Voice Transcribe 2.0, släppt den 18 september 2026, returnerar en slutlig transkription med 2,7 % ordfelsfrekvens, 0,49 sekunder efter talslut, och ett första delresultat vid 3,4 %. GPT Live Transcribe, som släpptes tillsammans med GPT Transcribe den 28 juli 2026, returnerar sin slutliga transkription vid 3,9 % och sitt första delresultat vid 6,3 %. Samma pris, och ungefär 1,2 procentenheter bättre noggrannhet för slutlig transkription plus 2,9 procentenheter bättre noggrannhet för partiella transkriptioner till SpaceXAI:s fördel. Batch-sidan av samma matchning är inte något sammanträffande alls: GPT Transcribe kostar 4,50 dollar per 1 000 minuter mot Grok Voice Transcribe 2.0:s 1,67 dollar, en skillnad på 63 % på vägen för inspelade filer.

Två olika satsningar på hur transkribering blir bättre

OpenAI:s svar på noggrannhet är kontext. GPT Transcribe och GPT Live Transcribe accepterar båda fritt formulerade promptar, nyckelordslistor och listor över förväntade språk, och i Realtime-sessioner matas tidigare transkriberade turer tillbaka in som kontext för senare. På OpenAI:s egen Context Aware ASR-benchmark lyfte denna villkorning GPT Live Transcribes semantiska noggrannhet från 38,5 % till 44,6 % – en siffra som rapporterats av leverantören, och som mäter huruvida betydelsen bevarades snarare än huruvida orden var rätt. Avvägningen OpenAI erbjuder är explicit: ge modellen information om vad den är på väg att höra, och den kommer att transkribera din domän bättre än en allmän modell med samma råa noggrannhet skulle göra.

SpaceXAI:s svar är modellen själv. Grok Voice Transcribe 2.0 har faktiskt en biaseringsmekanism – upp till 100 nyckeltermer per begäran, var och en på upp till 50 tecken – men det är en vokabulärlista, inte en prompt. Du kan tala om för den att "OrcaRouter" och "Kubernetes" är riktiga ord; du kan inte ge den ett stycke som förklarar att det här är ett supportärende om en återbetalning. Noggrannhetsförbättringen i 2.0 kommer i stället från omträning: på SpaceXAI:s egna produktionshärledda utvärderingsset sjönk ordfelsfrekvensen från 8,7 % till 3,3 % för samtalsljud, från 10,6 % till 7,1 % för 8 kHz-telefoni, från 7,2 % till 3,2 % för talade autentiseringsuppgifter och från 20,6 % till 6,8 % för korta kommandon över 19 språk. Det är företagets siffror på företagets ljud, och ingen utanför företaget har reproducerat dem, och de beskriver en modell som blev bättre på det akustiska problemet snarare än en som blev bättre på att bli tillsagd vad den kan förvänta sig.

Den praktiska skillnaden visar sig under den andra timmen av arbete. En kontextbetingad modell kan vara dramatiskt mycket bättre än vad dess råa benchmarkresultat antyder, eftersom du tillhandahöll vokabulären och domänen. Den kan också hallucinera de nyckelord du tillhandahöll: skriver du "OrcaRouter" i prompten kan en modell som inte hör ordet tydligt ändå producera det. En modell med bias för nyckeltermer försämras mer elegant, eftersom biasering förskjuter sannolikheten för en term i stället för att hävda att den finns. Inget av fellägena syns på en topplista, och båda kommer att synas i dina loggar.

Siffrorna, sida vid sida

• Slutlig transkriptionsnoggrannhet (streaming) — Grok Voice Transcribe 2.0 vid 2,7 % WER mot GPT Live Transcribe vid 3,9 % på AA-WER Streaming, båda enligt Artificial Analysis

• Första partiella träffsäkerhet (streaming) – 3,4 % vs 6,3 %, den största skillnaden i jämförelsen och den som avgör röstagentens beteende

• Tid till slutlig transkription – 0,49 s mot 0,81 s efter talets slut, så den mer exakta modellen är också den snabbare att slutföra.

• Tid till första delresultat — 0,49 s vs 0,26 s, den enda latenskolumnen som OpenAI vinner ohotat

Streamingpris — $3,33 per 1 000 minuter för båda, normaliserat av Artificial Analysis från Groks $0,20/timme och OpenAIs $0,017/minut

• Batch-noggrannhet (icke-strömmande) — Grok Voice Transcribe 2.0 med 2,3 % AA-WER jämfört med GPT Transcribe med 3,31 %

• Batchpris — 1,67 $ per 1 000 minuter mot 4,50 $ per 1 000 minuter, från 0,10 $/timme mot 0,0045 $/minut

• Batchgenomströmning — ungefär 162× realtid mot ungefär 41× på samma kort

Läs den listan som två kolumner snarare än ett enda omdöme. OpenAI vinner kategorin latens till första partiella resultat med klar marginal och erbjuder en kontextmekanism som Grok inte har. SpaceXAI vinner slutlig noggrannhet i båda lägena, partiell noggrannhet vid strömning, genomströmning och batchpriset med stor marginal. Det finns ingen kolumn där GPT Live Transcribe är både snabbare och mer noggrann än Grok Voice Transcribe 2.0; det finns en kolumn där den är snabbare, och det är den tidigaste.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs GPT Transcribe — the scoreboard': the left column gives Grok Voice Transcribe 2.0 a 2.7% streaming final WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives GPT Transcribe 3.9%, 6.3%, 0.81s, $4.50, $3.33 and 41x real time.

Vilken batchväg du faktiskt befinner dig på

Gapet mellan $1,67 och $4,50 är den minst tvetydiga siffran här, och det är värt att vara precis om varför det finns. OpenAI sänkte priset på denna produktlinje med 25 % från GPT-4o Transcribe-eran när företaget lanserade GPT Transcribe, och resultatet blev $0,0045 per minut. SpaceXAI lät sin batchtaxa vara oförändrad på $0,10 per timme när företaget gick från version 1.0 till 2.0 – man förbättrade modellen och tog samma pris, vilket är svårare att göra och en bättre signal om vart marknaden är på väg. Microsofts MAI-Transcribe-2 landade på exakt samma $0,10 per timme som ett tidsbegränsat erbjudande, så $1,67 per 1 000 minuter har blivit frontier-labbens prisgolv för batchtranskribering snarare än en enskild leverantörs kampanjsiffra.

Vid tiotusen timmar ljud per månad är den skillnaden ungefär 2 830 dollar mot 450 dollar. För ett poddarkiv, en eftersläpning av samtalsinspelningar eller ett mediebibliotek som transkriberas i efterhand, är prisskillnaden mycket större än någon noggrannhetsskillnad mellan 2,3 % och 3,31 % WER. För en streamande agent, där de två produkterna kostar lika mycket, är noggrannhet och latens det enda som återstår att tvista om.

Det finns en strukturell skillnad bakom dessa priser som är värd att nämna: Grok Voice Transcribe 2.0 fakturerar ett fast pris per ljudtimme, och GPT Live Transcribe fakturerar per minut, men Gemini 3.5 Transcribe Live fakturerar per token för både ljudinmatning och textutmatning. Endast en av dessa tre gör din faktura till en funktion av vad modellen väljer att säga. Om din volym är tillräckligt stor för att prognoser spelar roll, är de fasta priserna lättare att försvara för den som undertecknar fakturan — och eftersom OrcaRouter förmedlar leverantörernas listpriser med 0 % påslag, skulle en leverantörsrabatt som OpenAIs 25 % vara aktiv på vår sida samma dag som den meddelas, inte vid nästa förnyelse.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard showing the identical $3.33 per 1,000 minutes streaming price for Grok Voice Transcribe 2.0 and GPT Live Transcribe, next to their 2.728% versus 3.918% final-transcript word error rates and 0.490s versus 0.812s times to final transcript.

Vad ingen av modellerna är

GPT Transcribe och GPT Live Transcribe är två produkter, inte en produkt med en växel. Batchmodellen hanterar slutförda filer, strömmade filtranskript och bekräftade turer i Realtime-sessioner, och bearbetar ljud ungefär 34 gånger snabbare än realtid enligt OpenAI:s egen siffra – Artificial Analysis mäter 41× i sin testrigg. Den strömmande modellen är den dyrare av de två, med $0.017 per minut, och den med 10× högre felkvot på delresultat. Att välja OpenAI innebär att välja vilket av dessa två problem du har, eftersom den billigare slutpunkten inte kan göra den andras jobb.

Grok Voice Transcribe 2.0 är en modell med två transportvägar: samma vikter betjänar /v1/stt över REST för filer upp till 500 MB och wss://api.x.ai/v1/stt över WebSocket för ljud i realtid, med delresultat som sänds ut ungefär var 500:e ms. Strömningshastigheten är exakt dubbelt så hög som batchhastigheten snarare än en separat utvecklad produkt, vilket innebär att den noggrannhet du mäter på ditt arkiverade ljud är den noggrannhet du kan förvänta dig i realtid. Det innebär också att det inte finns någon andra modell att utvärdera — en uppsättning promptar, en uppsättning nyckeltermer, en uppsättning förväntningar.

Funktionspariteten är nära men inte identisk. Båda returnerar tidsstämplar på ordnivå; Grok Voice Transcribe 2.0 kopplar en konfidenspoäng till varje ord, vilket gör att du kan sätta tröskelvärden för avsnitt med låg konfidens i stället för att lita lika mycket på hela transkriptionen. Båda utför talardiarisering, och Groks ingår utan extra kostnad. Båda hanterar omvänd textnormalisering för siffror, datum, valutor och kontaktuppgifter. Grok Voice Transcribe 2.0 lägger till flerkanalig transkribering över upp till 8 oberoende kanaler, borttagning av utfyllnadsord och Smart Turn-detektering av turslut; GPT Transcribes utmärkande tillägg är kontextkonditionering på promptnivå och, på Realtime-sidan, automatisk överföring av tidigare turer. OpenAI har inte publicerat något antal språk som stöds för någon av modellerna; Grok Voice Transcribe 2.0 dokumenterar dussintals språk med växling under pågående inspelning och formatering i skriven form för 25.

Screenshot of the OpenAI developers.openai.com GPT Transcribe model page describing the batch and streaming transcription endpoints, the $0.0045 per minute batch and $0.017 per minute streaming rates, the prompt and keyword context conditioning, and the Context Aware ASR accuracy figures.

Hur man beslutar, och hur man testar det

Om du bygger en röstagent som måste svara innan den som ringer har talat färdigt, är kolumnen för partialtranskript din beslutsvariabel, och den delar de två modellerna tydligt: Grok Voice Transcribe 2.0 är 2,9 punkter mer korrekt på partialer men 0,23 sekunder långsammare på att producera dem. Välj SpaceXAI om en felaktig partial är värre än en sen — routning, eskalering, compliance-utlösta svar. Välj OpenAI om en sen partial är värre än en felaktig, och om du har domänvokabulären för att mata kontextmekanismen så att noggrannhetsgapet minskar. Mät sedan båda, eftersom ingen av leverantörernas beteende för partialtranskript på åtta timmars engelskt agenttal förutsäger vad endera kommer att göra med din accent, din codec och din jargong.

Om du transkriberar filer är beslutet mycket enklare: $1,67 mot $4,50 per 1 000 minuter och 2,3 % mot 3,31 % WER, båda pekar åt samma håll. Det enda skälet att stanna kvar på GPT Transcribe för batchjobb är om mekanismen för kontextkonditionering gör något för ditt ljud som den råa noggrannhetsskillnaden inte kan uppväga — vilket är en verklig möjlighet vid mycket domänspecifika inspelningar, och en testbar sådan.

Ingen av transkriberingsmodellerna finns i OrcaRouters katalog i dag, så själva anropen går till leverantörens eget API. Det som däremot ligger bakom en enda OrcaRouter-nyckel är allt som transkriptet matar: agentmodellen, sammanfattaren, klassificeraren, koden som avgör vad som ska göras med texten. Det är där det andra avtalet vanligtvis dyker upp – en leverantör för tal, en annan för modellen som resonerar kring det – och det behöver inte vara så. En nyckel över 200+ modeller, automatisk failover om en leverantör försämras, och routing-DSL:en om du vill skicka en begäran genom flera modeller och jämföra innan du bestämmer dig. Det är ett mindre påstående än "vi routar din transkribering", och det är det sanna.

Det man bör hålla ögonen på är huruvida OpenAI svarar an på noggrannhet snarare än kontext. Företaget har nu lanserat två transkriptionsgenerationer på ett år och sänkt priserna en gång; kontextmekanismen är verkligen särskiljande, men på den tavla som mäter rå transkription ligger man för närvarande efter både SpaceXAI och Microsoft. Om en GPT Transcribe 2 kommer med kontextmekanismen intakt och felprocenten nedbringad till 2-procentsintervallet, vänder den här jämförelsen på batch-sidan över en natt — och streamingpriset, som redan är identiskt, gör det till en kapplöpning värd att följa.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen