Hero-titelkort för "Realtime-Venus vs Grok Voice Think Fast 2.0", med undertexten "En går att köpa i eftermiddag. En är en nedladdning.", med tre kort som lyder "Grok Voice Think Fast 2.0: $0.08 per ljudminut, 0,70 s till första ljudet", "Realtime-Venus: Apache-2.0-vikter, inget API, ingen prislista" och "Den gemensamma satsningen: resonera medan du talar, inte innan", ovanför en sidfotsremsa som lyder "Grok-siffror enligt Artificial Analysis och xAI-dokumentation; Realtime-Venus-siffror från dess tekniska rapport, ej reproducerade." OrcaRouter-logotypen är inkomponerad i nedre högra hörnet.
Guides & Insights

Realtime-Venus vs Grok Voice Think Fast 2.0: Endast en av dessa har ett pris

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ställ Realtime-Venus och Grok Voice Think Fast 2.0 bredvid varandra och den första skillnaden är inte ett benchmark, det är en inköpsorder. Grok Voice Think Fast 2.0 är en hostad tal-till-tal-modell som började säljas den 29 juli 2026 för 0,08 USD per ljudminut med en publicerad tid till första ljud på 0,70 sekunder och benchmarkresultat från en tredje part. Realtime-Venus är ett 9B full-duplex-system från Ant Groups Venus Team och Tsinghua University som finns som Apache-2.0-vikter, en teknisk rapport daterad den 12 september 2026, och ingenting du kan ringa. En av dessa kan du koppla in i en telefonlinje före veckans slut. Den andra kan du läsa. Den asymmetrin visar sig vara en mycket mer användbar jämförelse än en resultattavla skulle vara, eftersom de två modellerna gjorde nästan samma arkitektoniska satsning och sedan gick helt isär om vad de skulle göra med den.

Det korta svaret

Välj Grok Voice Think Fast 2.0 om du behöver en fungerande röstagent nu, i produktion, med en prislista du kan lägga in i en budget och en latensgaranti du kan testa. Välj Realtime-Venus om du behöver äga stacken — om dina data inte får lämna din infrastruktur, om du behöver finjustera frontend, eller om du utvärderar arkitekturen snarare än att lansera en produkt. Det finns inget tredje fall där de konkurrerar, eftersom den ena har ett API och den andra inte.

De är överens om det svåra problemet.

Det intressanta är hur likartad diagnosen är. Båda modellerna finns på grund av samma motsägelse: samtalskontroll måste ske på subsekundnivå, medan resonemang tar sekunder. En modell som stannar upp för att tänka slutar kännas närvarande.

Grok Voice Think Fast 2.0 löser det genom att resonera medan den talar. Think Fast-serien byggdes på idén att modellen inte bör dra slutsatser först och generera tal därefter; i stället strömmar den tal och tänker parallellt, så att ett verktygsanrop kan utlösas innan agenten har avslutat sin första mening. xAI rapporterar att version 2.0 använder ungefär 0,4 gånger så många resonemangstokens som sin föregångare, vilket presenteras som en förbättring av kostnad och latens snarare än av kvalitet.

Realtime-Venus löser det genom att inte lösa det i frontend alls. Dess dual-loop-runtime håller en interaktionsloop på en sekund igång — perception, turkontroll, talgenerering — och skickar allt dyrt till en separat komponent som kallas Realtime-Venus-Harness genom asynkrona delegeringsmarkörer som sänds ut i modellens egen dolda sekvens. Förgrundssamtalet pausar aldrig. Bakgrundsresultat återintegreras när de anländer.

Det är olika ingenjörsmässiga svar på samma fråga, och de har olika felmoder. Att resonera medan man talar lägger bördan på modellen att hålla båda trådarna sammanhängande. Delegering lägger bördan på körtidsmiljön att hindra de två looparna från att korrumpera varandra — vilket är anledningen till att Realtime-Venus-artikelns kausala uppgiftsfångst, en isolerad tillståndsögonblicksbild per delegerad uppgift, är detaljen som bär designen.

Det enda mått som de båda kan mätas på

Full-duplex-benchmarks är det enda stället där dessa två överlappar varandra, och de överlappar inte snyggt.

• Avbrottshantering — Realtime-Venus rapporterar att den svarar på 75 % av användarnas avbrott i Full-Duplex-Bench v1.5. Grok Voice Think Fast 2.0 får 95,1 % på Full Duplex Bench enligt Artificial Analysis, upp från 77,8 % för version 1.0.

• Fortsättning under överlappning – Realtime-Venus rapporterar 97 % fortsättning under backchannels, 88 % under tal riktat till andra och 86 % under bakgrundstal, och uppger att den överträffar Gemini 3.1 Live och GPT-4o på alla tre.

• Olika instrument, olika författare – Realtime-Venus-siffrorna kommer från dess egen tekniska rapport utan extern reproduktion. Grok-siffrorna kommer från en tredje part som körde modellen. Att jämföra ett självrapporterat nummer med ett oberoende uppmätt sådant är inte en jämförelse, och gapet ovan är lika sannolikt metodologiskt som verkligt.

Den ärliga tolkningen: utifrån tillgänglig bevisning är Grok Voice Think Fast 2.0 den enda av de två vars full-duplex-beteende har mätts av någon som inte har något intresse i resultatet.

Där de oberoende siffrorna placerar Grok Voice Think Fast 2.0

Den renaste aktuella mätningen kommer från Artificial Analysis Speech Agent Arena, som poängsätter modeller utifrån blind preferens i live-röstsamtal i uppgifter som att boka tandläkartid och beställa hämtmat. Den 18 september 2026 ligger Grok Voice Think Fast 2.0 High på sjunde plats av fler än tjugo poster med ett Elo på 1 011 över 552 sampel – bakom Googles Gemini 3.1 Flash Live Minimal på 1 096, Gemini 3.8 Live på 1 083 och GPT-Live-1 på 1 053, och klart före sin egen föregångare, Grok Voice Think Fast 1.0, på 908.

Kolumnen bredvid Elo är den mer intressanta. När det gäller andelen lyckade uppgifter noterar Grok Voice Think Fast 2.0 94,6 %, den högsta siffran någonstans i den synliga topp tjugo – över Gemini 3.8 Live:s 93,2 %, GPT-Realtime-2.1 High:s 91,5 % och GPT-Live-1:s 90,9 %. Sjua i preferens, etta när det gäller att slutföra uppgifter, är en ovanlig och ganska specifik profil: lyssnarna älskar inte rösten, men den gör jobbet klart. Om din produkt gör saker snarare än chattar, är det kolumnen som förutsäger ditt utfall, och det är det starkaste oberoende beviset någon av dessa två modeller har.

A screenshot of the Artificial Analysis Speech Agent Arena Leaderboard captured 18 September 2026. The table reads, in rank order: Gemini 3.1 Flash Live Minimal Elo 1,096 with a 74.6% task success rate; Gemini 3.8 Live Elo 1,083 and 93.2%; Gemini 3.1 Flash Live High Elo 1,063 and 71.8%; GPT-Live-1 (Sol, low) Elo 1,053 and 90.9%; GPT-Live-1 (Astra, medium) Elo 1,048 and 87.4%; Cartesia Line Elo 1,027 and 77.5%; Grok Voice Think Fast 2.0 High Elo 1,011, 552 samples and 94.6%; GPT-Realtime-1.5 Elo 1,000 and 85.1%; and further down Grok Voice Think Fast 1.0 at Elo 908 with 80.7%.

Siffrorna som xAI publicerade vid lanseringen är ett annat mätinstrument och bör läsas separat: 82,9 % på Artificial Analysis kvalitetsindex för tal-till-tal, första plats på den agentiska benchmarken τ-Voice med 56,5 %, 97,2 % på Big Bench Audio och 95,1 % på Full Duplex Bench. Det var ställningen när modellen släpptes i slutet av juli 2026, och topplistorna i den här kategorin förändras varje månad – vilket är precis varför arenatabellen ovan, läst idag, är värd mer än lanseringssiffrorna.

A two-column comparison scoreboard titled 'Realtime-Venus vs Grok Voice Think Fast 2.0 — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Availability: Apache-2.0 weights, no API', 'Price: none published', 'Modality: audio, video and text', 'Interruption response: 75% reported', 'Continuation under overlap: 97 / 88 / 86% reported', 'Independent scores: none'. The right column, labelled Grok Voice Think Fast 2.0, reads 'Availability: hosted API since 29 July 2026', 'Price: $0.08 per audio minute', 'Modality: audio and text', 'Interruption handling: 95.1% Full Duplex Bench at launch', 'Time to first audio: 0.70 s', 'Independent scores: Elo 1,011 and 94.6% task success on the Speech Agent Arena'. The footer reads 'Realtime-Venus figures from its technical report, unreproduced; Grok figures per Artificial Analysis and xAI documentation.'

Notan, och de delar av den som inte finns på notan

Grok Voice Think Fast 2.0 kostar 0,08 USD per minut ljud, ungefär 4,80 USD i timmen, plus 0,004 USD för varje textinmatningsmeddelande. Det är en ökning med 60 % jämfört med de 0,05 USD per minut som version 1.0 tog vid lanseringen, och xAI flyttade det rullande grok-voice-latest aliaset till 2.0 automatiskt den 5 augusti 2026, så team som ville stanna kvar på det gamla priset måste låsa en explicit version före det datumet. Modellen per minut innebär också att effektivitetsförbättringar tillfaller leverantören: om modellen blir bättre på att avsluta samtal snabbare sjunker din räkning per samtal, men din kostnad per minut gör det inte.

Realtime-Venus har ingen faktura, eftersom den inte har någon tjänst. Vad den i stället har är ett hårdvarugolv. Två 9B-checkpoints i BF16 är ungefär arton gigabyte vikter vardera före aktiveringsminnet, och kortet dokumenterar en strömningsloop per sekund som måste köras kontinuerligt. En GPU-nod som klarar det har en månadskostnad, och den är fast – du betalar den oavsett om någon anropar eller inte. För en produkt med jämn trafik är det billigare än 4,80 dollar i timmen. För en produkt med intermittent trafik är det dramatiskt mycket dyrare, och brytpunkten är den enda ekonomiska fråga som spelar roll här.

Vikter, kontroll och vad var och en låter dig ändra

Det är här de två modellerna slutar vara jämförbara överhuvudtaget.

• Finjustering — Realtime-Venus levereras med vikter. Du kan finjustera dem, kvantisera dem, köra dem i luftgap och inspektera varje lager. Grok Voice Think Fast 2.0 är en sluten hostad modell; det du kan ändra är prompten, röstvalet och de verktyg du registrerar.

• Röst — Grok Voice Think Fast 2.0 levereras med förinställda röster och stöder anpassad röstkloning från ungefär en minut av tal. Realtime-Venus levereras med en referensröst och en medföljande token-till-vågform-dekoder, och allt utöver det är ditt problem.

• Räckvidd — Grok Voice Think Fast 2.0 stöder över 25 språk och talar PCM16 vid 24 kHz som standard med μ-law för telefoni, över en WebSocket-session som är kompatibel med OpenAI Realtime. Den kompatibiliteten är en verklig tillgång vid migrering: det mesta av befintlig realtidsröstkod behöver en ändring av bas-URL och nyckel. Realtime-Venus dokumenterar engelska och kinesiska.

• Video — Realtime-Venus-Omni tar emot strömmande video och bilder via en SigLIP2-encoder och utför kontinuerlig visuell perception. Grok Voice Think Fast 2.0 hanterar ljud och text; det finns ingen kameraväg.

• Lång kontext — Realtime-Venus har en kontext på 40 960 token och ett träningsfritt långvideominne som kan aktiveras över ett fyrtiominutersfönster. Grok Voice Think Fast 2.0 är en sessionsmodell utan jämförbar publicerad minnesfunktion.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Any-to-Any, Transformers, Safetensors, audio, video, speech, streaming and full-duplex tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Där var och en brister

De misslyckanden som är värda att planera för är motsatta. Grok Voice Think Fast 2.0:s exponering är leverantörskoncentration och overifierbar marknadsföring: xAI:s Starlink A/B-resultat, dess multiplikatorer för transkriberingsnoggrannhet och dess hastighetsinramning är alla företagsrapporterade utan publicerade underliggande data, och en per-minut-modell som ändrar priset med 60 % mellan versioner har visat att den kommer att ändra priset. Lås din version och kör dina egna utvärderingar på ditt eget ljud.

Realtime-Venus svaghet är att ingen har kört det. Dess benchmarkresultat är självrapporterade, dess testramverk är odokumenterat i förhållande till sin betydelse, och dess latens vid verklig driftsättning är okänd — rapporten beskriver en interaktionskadens på en sekund, vilket är en designparameter, inte en uppmätt tid till första ljud. En modell utan API och utan reproduktion har ingen dokumenterad historik, bara en specifikation.

Det finns en mellanväg som är värd att säga rakt ut, eftersom det är vad de flesta team faktiskt kommer att göra. Om du bygger ett delegationsbaserat system – välj din egen front end, lämna det dyra arbetet till en textmodell – behöver front end och resonemangsbenet inte komma från samma ställe. OrcaRouter har varken Realtime-Venus eller Grok Voice Think Fast 2.0; båda röstlagren ligger utanför det vi tillhandahåller, och vi säger det i stället för att antyda något annat. Det delegerade benet är en annan sak. Nästan 200 textmodeller ligger bakom en enda nyckel till leverantörens listpris utan påslag, med automatisk failover så att ett avbrott uppströms inte bryter ett pågående samtal, ett routing-DSL för att sätta samman flera modeller till ett samtal, och modellfusion för beslut som förtjänar mer än en åsikt. Det är den del av en röstagent som tjänar på att vara utbytbar, och det är den del du kan ändra utan att röra modellen som håller samtalet.

Vilken ska man välja?

Välj Grok Voice Think Fast 2.0 det här kvartalet. Den är tillgänglig, den är oberoende benchmarkad, den ligger först i den agentiska utvärdering som förutsäger om din agent kan göra något användbart, och 0,70 sekunder till första ljud är en siffra du kan bygga en användarupplevelse kring. Budgetera för prishöjningen på 60 % jämfört med 1.0 och lås din modellversion.

Välj Realtime-Venus endast om begränsningen är ägande. Om din driftsättning inte kan anropa ett externt API, om du behöver finjustera den konversationella fronten, eller om du behöver kameran – dessa tre fall utgör hela argumentet, och de är starka när de är tillämpliga.

Det som inte bör avgöra saken är benchmarktabellen, eftersom dess två sidor togs fram av olika personer under olika förhållanden. Siffrorna för Grok Voice Think Fast 2.0 mättes av någon annan. Det gjorde inte siffrorna för Realtime-Venus. Tills det ändras är den jämförelse som faktiskt finns tillgänglig mellan en produkt och en artikel.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen