Artikelns hero-kort med texten 'Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe', med badgen 'MODELLJÄMFÖRELSE' och undertiteln 'Strömningsspåret tillhör en av dem', med chips som visar 2,7 % vs 4,0 % strömnings-WER, 3,4 % vs 5,8 % första partiella resultat, 0,49 s vs 0,40 s slutresultat och 1,67 $ vs 5,00 $ per 1 000 minuter, över en gradient från vitt till blått med OrcaRouter-logotypen längst ner till höger.
Guides & Insights

Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe: Streamingbanan tillhör en av dem

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Grok Voice Transcribe 2.0 och Gemini 3.5 Transcribe är de två nyaste frontier-modellerna för tal-till-text från rivaliserande labb, och det ärliga sättet att jämföra dem är att redan från början erkänna att de inte är byggda för samma uppgift. SpaceXAI:s Grok Voice Transcribe 2.0, som släpptes den 18 september 2026, är en streaming-first-modell med ett batchläge kopplat till sig: den toppar AA-WER Streaming-tavlan med 2,7 % ordfelsfrekvens för slutliga transkriptioner och 3,4 % för första partiella resultat, båda kommer 0,49 sekunder efter talets slut. Gemini 3.5 Transcribe, som släpptes den 26 augusti 2026, är en batch-first-modell med en streaming-SKU kopplad till sig, och de två halvorna av den beter sig mycket olika – den förinspelade vägen mäter 2,6 % AA-WER på Artificial Analysis icke-streaming-tavla, medan den separata gemini-3.5-transcribe-live endpointen mäter 4,0 % på streaming-tavlan vid 0,40 sekunder. Ställ de fyra siffrorna bredvid varandra och formen på den här duellen är uppenbar: de ligger nära varandra i noggrannhet där Gemini 3.5 Transcribe är stark, och de ligger inte nära varandra där Grok Voice Transcribe 2.0 är det.

Den enda banan de båda slåss i

Båda modellerna kan transkribera ljud i realtid, så streaming är den enda arenan där en direkt jämförelse betyder något. Där ligger Grok Voice Transcribe 2.0 1,3 punkter före Gemini 3.5 Transcribe Live i noggrannhet för slutlig transkription – 2,7 % mot 4,0 % WER i samma testbänk, samma ungefär åtta timmar ljud och samma 50/25/25-viktning över AA-AgentTalk, VoxPopuli och Earnings22. Det är inte en avrundningsskillnad; vid de felfrekvenserna är det ungefär ett extra felaktigt ord per sjuttiofem transkriberade ord från Google-modellen. För första partiella transkriptioner är gapet ännu större, 3,4 % mot 5,8 %, och partiella transkriptioner är de transkriptioner som en röstagent i realtid måste agera på innan talaren har talat klart.

Latensen slår åt andra hållet, och det är den delen av jämförelsen som glöms bort. Gemini 3.5 Transcribe Live returnerar sin slutgiltiga transkription 0,40 sekunder efter att talet har upphört, mot Groks 0,49, och sitt första delresultat på 0,25 sekunder mot Groks 0,49 – ungefär dubbelt så snabbt till det första användbara ordet. Ingen av modellerna konkurrerar med den verkligt snabba änden av den här resultattavlan, där Deepgram Flux ligger på 0,02 sekunder och Soniox v5 på 0,05, men mellan dessa två är avvägningen explicit: Google är snabbare att tala, SpaceXAI har större sannolikhet att ha rätt när den väl gör det. För en agent med turtagning som inte får tala över en uppringare är 0,24 sekunders extra partiell latens en verklig kostnad som noggrannhetsvinsten måste motivera.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% streaming final WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and a 100-concurrent-session cap; the right column gives Gemini 3.5 Transcribe 4.0%, 5.8%, 0.40s, $5.00, about $5.40 and a 10-minute session cap.

Där Gemini 3.5 Transcribe faktiskt vinner

Språktäckning är den tydligaste, och det är inte nära. Googles modell hanterar 85+ språk; Grok Voice Transcribe 2.0 stöder dussintals, med skriftlig formatering — den inversa textnormaliseringen som omvandlar talade siffror, datum, valutor och e-postadresser till deras skrivna former — dokumenterad i 25 språk. Om ditt ljud är portugisiska, vietnamesiska eller en kodväxlande blandning av två språk inom en mening, är frågan om vilken modell som är mer exakt på Artificial Analysis-tavlan i stort sett akademisk, eftersom den tavlan är viktad mot engelska och tung av agentprat. Google rapporterar 5,50 % streaming och 5,04 % icke-streaming WER på FLEURS över sin egen flerspråkiga svit, siffror som är leverantörsrapporterade och inte oberoende reproducerade men som åtminstone beskriver det flerspråkiga fallet överhuvudtaget.

Det andra övertaget är gratisnivån. Gemini 3.5 Transcribe har kostnadsfria indata- och utdatatokens på Googles API, med förbehållet att innehåll på gratisnivån används för att förbättra Googles produkter medan innehåll på betalnivån inte gör det. För en prototyp, ett sidoprojekt eller ett internt verktyg som bearbetar ljud som du annars inte skulle betala för att transkribera, är det ett verkligt alternativ som ingen leverantör med timpris kan matcha. Grok Voice Transcribe 2.0 kostar från första ljudtimmen.

Och det tredje är att Gemini 3.5 Transcribe är en allmän multimodal modell med ett transkriptionsläge, inte en specialbyggd ASR-tjänst. Den kan promptas, den kan ta text som kontext, och den finns i samma API-yta som allt annat Google levererar. Om transkription är ett steg i en pipeline som också behöver resonera över transkriptionen, är det värt något att hålla båda i ett och samma modellanrop som en felfrekvens per ord inte fångar.

Prismatematiken, per tusen minuter

Artificial Analysis normaliserar båda modellerna till kostnad per 1 000 minuter ljud, vilket är det enda sättet att jämföra en fast timtaxa mot tokenfakturering:

• Batch, förinspelat — Grok Voice Transcribe 2.0 till $1.67 per 1 000 minuter ($0.10/timme) jämfört med Gemini 3.5 Transcribe till $5.00 per 1 000 minuter ($0.30/timme, från $2.00 per 1M indatatokens och $12.00 per 1M utdatatokens)

• Streaming – Grok Voice Transcribe 2.0 för $3,33 per 1 000 minuter ($0,20/timme) jämfört med Gemini 3.5 Transcribe Live för cirka $5,40 per 1 000 minuter, sammanvägt från $3,50 per 1M ljudindata och $21,00 per 1M textutdatatoken

• Batch-genomströmning – Grok Voice Transcribe 2.0 vid ungefär 162× realtid jämfört med Gemini 3.5 Transcribe vid ungefär 88× på samma kort, så den billigare modellen är också den snabbare för filbearbetning

• Maxtak för livesession — Grok Voice Transcribe 2.0 strömmar över en WebSocket utan något publicerat sessionsmaxtak utöver 100 samtidiga sessioner per team, jämfört med Gemini 3.5 Transcribe Live som är begränsad till 10 minuter per session

Den sista raden är den operativa detaljen som avgör fler arkitekturer än vad noggrannhetssiffrorna gör. Ett tak på 10 minuter för en live-session innebär att långa samtal, långa möten och långa strömmar måste delas upp och återupprättas, och varje återupprättande är en skarv där kontext går förlorad. Groks strömmande slutpunkt har ett tak för filstorlek på 500 MB på batch-vägen och en samtidighetsgräns på 100 sessioner per team på strömningsvägen, vilket är en annan typ av begränsning – genomströmning snarare än varaktighet.

Tokenfakturering är värd att förstå innan du binder dig vid Google-sidan, eftersom den gör din faktura till en funktion av två variabler i stället för en. Gemini debiterar för ljudinmatning och textutdata separat, så en modell som producerar mångordig formatering eller upprepar sig kostar mer än en som inte gör det, och ett språk med längre ord kostar mer än ett med kortare. Groks fasta timtaxa påverkas inte av något av detta. För arbetsbelastningar med hög volym är den fasta taxan lättare att prognostisera, och eftersom OrcaRouter för vidare leverantörernas listpriser med 0 % påslag når en ändring hos endera leverantören din faktura samma dag som den inträffar i stället för vid nästa avtalsförnyelse.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first at 2.728% final-transcript word error rate and 0.490s, Gemini 3.5 Transcribe Live at 3.998% and 0.395s with a 5.774% first-partial figure, and the faster Deepgram Flux and Soniox v5 rows for latency context.

Funktionsformer: vad var och en vägrar att göra

Kapabilitetslistorna skiljer sig mer än vad noggrannhetssiffrorna antyder, och luckorna finns på platser som har betydelse för specifika tillämpningar:

• Talardiisering – ingår utan extra kostnad i Grok Voice Transcribe 2.0; stöds inte i Gemini 3.5 Transcribe Live, så talarattribuerade live-transkriptioner finns inte alls på den slutpunkten

• Tidsstämplar på ordnivå — Grok Voice Transcribe 2.0 returnerar dem med konfidenspoäng per ord; Gemini 3.5 Transcribe Live returnerar inga, vilket utesluter konfidenströskling och exakt undertextjustering

• Flerkanaligt ljud — Grok Voice Transcribe 2.0 transkriberar upp till 8 oberoende kanaler i en enda körning; Gemini 3.5 Transcribe Live har ingen motsvarighet, så flerkanaliga samtalsinspelningar kräver sessioner per kanal

• Biasering av nyckeltermer — Grok Voice Transcribe 2.0 accepterar upp till 100 domäntermer per begäran; Gemini 3.5 Transcribe accepterar anpassad vokabulär och valfria språktips

• Infrastruktur för röstagenter — Grok Voice Transcribe 2.0 levererar borttagning av utfyllnadsord och Smart Turn-detektering av turslut; Gemini 3.5 Transcribe Live täcker strömningsfallet men lämnar turlogiken till applikationen

• Indatahantering — Grok Voice Transcribe 2.0 tar emot direkt filuppladdning på upp till 500 MB i 12 ljudformat; Gemini 3.5 Transcribes väg för förinspelat material kräver en offentlig HTTPS-URL med en gräns på 15 minuter och 300 MB, och kan inte kombinera sitt Smart formateringsläge med ordtidsstämplar eller talaretiketter

Mönstret i den listan är att SpaceXAI byggde en transkriptionsprodukt och Google byggde en transkriptionsförmåga. Diarisering, tidsstämplar, kanaluppdelning och turdetektering är de funktioner du behöver när transkription är hela applikationen; promptbarhet, språkbredd och ett-API-för-allt är vad du vill ha när transkription är ett steg i en större sådan. Ingen av listorna är bättre i abstrakt mening, och ett team som enbart väljer utifrån noggrannhet kommer till slut att sakna den uppsättning det inte behövde.

Screenshot of the Google ai.google.dev speech-generation documentation for Gemini 3.5 Transcribe, showing the pre-recorded and live transcription endpoints, the token-based audio-input and text-output pricing, the supported-language list and the 10-minute live session ceiling.

Att välja mellan dem, och vad som ändrar svaret

Välj Grok Voice Transcribe 2.0 när transkriptionen måste bli rätt medan ljudet fortfarande spelas upp: turtagning mellan agenter i realtid, realtidsundertexter som inte får bli fel, strömmar från kontaktcenter där talarattribution och kanalseparering ingår i kravet, eller vilken batch-pipeline som helst där $1,67 per 1 000 minuter och 162× genomströmning båda spelar roll. Välj Gemini 3.5 Transcribe när ljudet är flerspråkigt på ett språk utanför Groks dokumenterade språkuppsättning, när transkriptionen matar en modell som också måste resonera kring den, när du vill ha en gratisnivå att prototypa mot, eller när 2,6 % AA-WER i batchvägen helt enkelt räcker för det du gör och den extra språktäckningen är värd mer än prisskillnaden.

Det de flesta team faktiskt gör här är inte att välja. Båda modellerna är nåbara via en enda OrcaRouter API-nyckel tillsammans med 200+ andra modeller, vilket innebär att du kan dirigera live-agenttrafik till Grok Voice Transcribe 2.0 och långa flerspråkiga arkiv till Gemini 3.5 Transcribe utan att underhålla två leverantörsavtal, två faktureringsrelationer och två uppsättningar autentiseringsuppgifter. Det är också så du avgör noggrannhetsfrågan för ditt eget ljud: kör båda på samma inspelningar, jämför transkriptionerna du faktiskt fick och låt routnings-DSL:en skicka trafiken dit den hör hemma. Topplistan säger vilken modell som vinner på åtta timmar av någon annans engelska agentprat; bara ditt eget ljud säger vilken som vinner på ditt.

Den öppna frågan är vad som händer med det där streaminggapet när Google nästa gång reviderar Live-slutpunkten. Gemini 3.5 Transcribe Live lanserades i offentlig förhandsvisning, och dess siffra på 4,0 % mättes ungefär en dag efter att den blev anropbar – en stark tidig signal, men en som har haft kortare tid att stabilisera sig än Grok-siffran som den nu ligger bakom. Om Google stänger streaminggapet på 1,3 punkter samtidigt som man behåller latensen för delresultat på 0,25 sekunder, upphör avvägningen att vara en avvägning och Groks fördel begränsas till pris och funktioner. Fram till dess är uppdelningen tydlig: de snabbaste delresultaten är Googles, de mest träffsäkra är SpaceXAI:s, och ingen modell på resultattavlan är båda.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen