
Realtime-Venus vs Grok Voice Think Fast 2.0: Endast en av dessa har ett pris
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ställ Realtime-Venus och Grok Voice Think Fast 2.0 bredvid varandra och den första skillnaden är inte ett benchmark, det är en inköpsorder. Grok Voice Think Fast 2.0 är en hostad tal-till-tal-modell som började säljas den 29 juli 2026 för 0,08 USD per ljudminut med en publicerad tid till första ljud på 0,70 sekunder och benchmarkresultat från en tredje part. Realtime-Venus är ett 9B full-duplex-system från Ant Groups Venus Team och Tsinghua University som finns som Apache-2.0-vikter, en teknisk rapport daterad den 12 september 2026, och ingenting du kan ringa. En av dessa kan du koppla in i en telefonlinje före veckans slut. Den andra kan du läsa. Den asymmetrin visar sig vara en mycket mer användbar jämförelse än en resultattavla skulle vara, eftersom de två modellerna gjorde nästan samma arkitektoniska satsning och sedan gick helt isär om vad de skulle göra med den.
Det korta svaret
Välj Grok Voice Think Fast 2.0 om du behöver en fungerande röstagent nu, i produktion, med en prislista du kan lägga in i en budget och en latensgaranti du kan testa. Välj Realtime-Venus om du behöver äga stacken — om dina data inte får lämna din infrastruktur, om du behöver finjustera frontend, eller om du utvärderar arkitekturen snarare än att lansera en produkt. Det finns inget tredje fall där de konkurrerar, eftersom den ena har ett API och den andra inte.
De är överens om det svåra problemet.
Det intressanta är hur likartad diagnosen är. Båda modellerna finns på grund av samma motsägelse: samtalskontroll måste ske på subsekundnivå, medan resonemang tar sekunder. En modell som stannar upp för att tänka slutar kännas närvarande.
Grok Voice Think Fast 2.0 löser det genom att resonera medan den talar. Think Fast-serien byggdes på idén att modellen inte bör dra slutsatser först och generera tal därefter; i stället strömmar den tal och tänker parallellt, så att ett verktygsanrop kan utlösas innan agenten har avslutat sin första mening. xAI rapporterar att version 2.0 använder ungefär 0,4 gånger så många resonemangstokens som sin föregångare, vilket presenteras som en förbättring av kostnad och latens snarare än av kvalitet.
Realtime-Venus löser det genom att inte lösa det i frontend alls. Dess dual-loop-runtime håller en interaktionsloop på en sekund igång — perception, turkontroll, talgenerering — och skickar allt dyrt till en separat komponent som kallas Realtime-Venus-Harness genom asynkrona delegeringsmarkörer som sänds ut i modellens egen dolda sekvens. Förgrundssamtalet pausar aldrig. Bakgrundsresultat återintegreras när de anländer.
Det är olika ingenjörsmässiga svar på samma fråga, och de har olika felmoder. Att resonera medan man talar lägger bördan på modellen att hålla båda trådarna sammanhängande. Delegering lägger bördan på körtidsmiljön att hindra de två looparna från att korrumpera varandra — vilket är anledningen till att Realtime-Venus-artikelns kausala uppgiftsfångst, en isolerad tillståndsögonblicksbild per delegerad uppgift, är detaljen som bär designen.
Det enda mått som de båda kan mätas på
Full-duplex-benchmarks är det enda stället där dessa två överlappar varandra, och de överlappar inte snyggt.
• Avbrottshantering — Realtime-Venus rapporterar att den svarar på 75 % av användarnas avbrott i Full-Duplex-Bench v1.5. Grok Voice Think Fast 2.0 får 95,1 % på Full Duplex Bench enligt Artificial Analysis, upp från 77,8 % för version 1.0.
• Fortsättning under överlappning – Realtime-Venus rapporterar 97 % fortsättning under backchannels, 88 % under tal riktat till andra och 86 % under bakgrundstal, och uppger att den överträffar Gemini 3.1 Live och GPT-4o på alla tre.
• Olika instrument, olika författare – Realtime-Venus-siffrorna kommer från dess egen tekniska rapport utan extern reproduktion. Grok-siffrorna kommer från en tredje part som körde modellen. Att jämföra ett självrapporterat nummer med ett oberoende uppmätt sådant är inte en jämförelse, och gapet ovan är lika sannolikt metodologiskt som verkligt.
Den ärliga tolkningen: utifrån tillgänglig bevisning är Grok Voice Think Fast 2.0 den enda av de två vars full-duplex-beteende har mätts av någon som inte har något intresse i resultatet.
Där de oberoende siffrorna placerar Grok Voice Think Fast 2.0
Den renaste aktuella mätningen kommer från Artificial Analysis Speech Agent Arena, som poängsätter modeller utifrån blind preferens i live-röstsamtal i uppgifter som att boka tandläkartid och beställa hämtmat. Den 18 september 2026 ligger Grok Voice Think Fast 2.0 High på sjunde plats av fler än tjugo poster med ett Elo på 1 011 över 552 sampel – bakom Googles Gemini 3.1 Flash Live Minimal på 1 096, Gemini 3.8 Live på 1 083 och GPT-Live-1 på 1 053, och klart före sin egen föregångare, Grok Voice Think Fast 1.0, på 908.
Kolumnen bredvid Elo är den mer intressanta. När det gäller andelen lyckade uppgifter noterar Grok Voice Think Fast 2.0 94,6 %, den högsta siffran någonstans i den synliga topp tjugo – över Gemini 3.8 Live:s 93,2 %, GPT-Realtime-2.1 High:s 91,5 % och GPT-Live-1:s 90,9 %. Sjua i preferens, etta när det gäller att slutföra uppgifter, är en ovanlig och ganska specifik profil: lyssnarna älskar inte rösten, men den gör jobbet klart. Om din produkt gör saker snarare än chattar, är det kolumnen som förutsäger ditt utfall, och det är det starkaste oberoende beviset någon av dessa två modeller har.

Siffrorna som xAI publicerade vid lanseringen är ett annat mätinstrument och bör läsas separat: 82,9 % på Artificial Analysis kvalitetsindex för tal-till-tal, första plats på den agentiska benchmarken τ-Voice med 56,5 %, 97,2 % på Big Bench Audio och 95,1 % på Full Duplex Bench. Det var ställningen när modellen släpptes i slutet av juli 2026, och topplistorna i den här kategorin förändras varje månad – vilket är precis varför arenatabellen ovan, läst idag, är värd mer än lanseringssiffrorna.

Notan, och de delar av den som inte finns på notan
Grok Voice Think Fast 2.0 kostar 0,08 USD per minut ljud, ungefär 4,80 USD i timmen, plus 0,004 USD för varje textinmatningsmeddelande. Det är en ökning med 60 % jämfört med de 0,05 USD per minut som version 1.0 tog vid lanseringen, och xAI flyttade det rullande grok-voice-latest aliaset till 2.0 automatiskt den 5 augusti 2026, så team som ville stanna kvar på det gamla priset måste låsa en explicit version före det datumet. Modellen per minut innebär också att effektivitetsförbättringar tillfaller leverantören: om modellen blir bättre på att avsluta samtal snabbare sjunker din räkning per samtal, men din kostnad per minut gör det inte.
Realtime-Venus har ingen faktura, eftersom den inte har någon tjänst. Vad den i stället har är ett hårdvarugolv. Två 9B-checkpoints i BF16 är ungefär arton gigabyte vikter vardera före aktiveringsminnet, och kortet dokumenterar en strömningsloop per sekund som måste köras kontinuerligt. En GPU-nod som klarar det har en månadskostnad, och den är fast – du betalar den oavsett om någon anropar eller inte. För en produkt med jämn trafik är det billigare än 4,80 dollar i timmen. För en produkt med intermittent trafik är det dramatiskt mycket dyrare, och brytpunkten är den enda ekonomiska fråga som spelar roll här.
Vikter, kontroll och vad var och en låter dig ändra
Det är här de två modellerna slutar vara jämförbara överhuvudtaget.
• Finjustering — Realtime-Venus levereras med vikter. Du kan finjustera dem, kvantisera dem, köra dem i luftgap och inspektera varje lager. Grok Voice Think Fast 2.0 är en sluten hostad modell; det du kan ändra är prompten, röstvalet och de verktyg du registrerar.
• Röst — Grok Voice Think Fast 2.0 levereras med förinställda röster och stöder anpassad röstkloning från ungefär en minut av tal. Realtime-Venus levereras med en referensröst och en medföljande token-till-vågform-dekoder, och allt utöver det är ditt problem.
• Räckvidd — Grok Voice Think Fast 2.0 stöder över 25 språk och talar PCM16 vid 24 kHz som standard med μ-law för telefoni, över en WebSocket-session som är kompatibel med OpenAI Realtime. Den kompatibiliteten är en verklig tillgång vid migrering: det mesta av befintlig realtidsröstkod behöver en ändring av bas-URL och nyckel. Realtime-Venus dokumenterar engelska och kinesiska.
• Video — Realtime-Venus-Omni tar emot strömmande video och bilder via en SigLIP2-encoder och utför kontinuerlig visuell perception. Grok Voice Think Fast 2.0 hanterar ljud och text; det finns ingen kameraväg.
• Lång kontext — Realtime-Venus har en kontext på 40 960 token och ett träningsfritt långvideominne som kan aktiveras över ett fyrtiominutersfönster. Grok Voice Think Fast 2.0 är en sessionsmodell utan jämförbar publicerad minnesfunktion.

Där var och en brister
De misslyckanden som är värda att planera för är motsatta. Grok Voice Think Fast 2.0:s exponering är leverantörskoncentration och overifierbar marknadsföring: xAI:s Starlink A/B-resultat, dess multiplikatorer för transkriberingsnoggrannhet och dess hastighetsinramning är alla företagsrapporterade utan publicerade underliggande data, och en per-minut-modell som ändrar priset med 60 % mellan versioner har visat att den kommer att ändra priset. Lås din version och kör dina egna utvärderingar på ditt eget ljud.
Realtime-Venus svaghet är att ingen har kört det. Dess benchmarkresultat är självrapporterade, dess testramverk är odokumenterat i förhållande till sin betydelse, och dess latens vid verklig driftsättning är okänd — rapporten beskriver en interaktionskadens på en sekund, vilket är en designparameter, inte en uppmätt tid till första ljud. En modell utan API och utan reproduktion har ingen dokumenterad historik, bara en specifikation.
Det finns en mellanväg som är värd att säga rakt ut, eftersom det är vad de flesta team faktiskt kommer att göra. Om du bygger ett delegationsbaserat system – välj din egen front end, lämna det dyra arbetet till en textmodell – behöver front end och resonemangsbenet inte komma från samma ställe. OrcaRouter har varken Realtime-Venus eller Grok Voice Think Fast 2.0; båda röstlagren ligger utanför det vi tillhandahåller, och vi säger det i stället för att antyda något annat. Det delegerade benet är en annan sak. Nästan 200 textmodeller ligger bakom en enda nyckel till leverantörens listpris utan påslag, med automatisk failover så att ett avbrott uppströms inte bryter ett pågående samtal, ett routing-DSL för att sätta samman flera modeller till ett samtal, och modellfusion för beslut som förtjänar mer än en åsikt. Det är den del av en röstagent som tjänar på att vara utbytbar, och det är den del du kan ändra utan att röra modellen som håller samtalet.
Vilken ska man välja?
Välj Grok Voice Think Fast 2.0 det här kvartalet. Den är tillgänglig, den är oberoende benchmarkad, den ligger först i den agentiska utvärdering som förutsäger om din agent kan göra något användbart, och 0,70 sekunder till första ljud är en siffra du kan bygga en användarupplevelse kring. Budgetera för prishöjningen på 60 % jämfört med 1.0 och lås din modellversion.
Välj Realtime-Venus endast om begränsningen är ägande. Om din driftsättning inte kan anropa ett externt API, om du behöver finjustera den konversationella fronten, eller om du behöver kameran – dessa tre fall utgör hela argumentet, och de är starka när de är tillämpliga.
Det som inte bör avgöra saken är benchmarktabellen, eftersom dess två sidor togs fram av olika personer under olika förhållanden. Siffrorna för Grok Voice Think Fast 2.0 mättes av någon annan. Det gjorde inte siffrorna för Realtime-Venus. Tills det ändras är den jämförelse som faktiskt finns tillgänglig mellan en produkt och en artikel.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
