Card del titolo principale per 'Realtime-Venus vs Grok Voice Think Fast 2.0', con sottotitolo 'Uno è acquistabile questo pomeriggio. L'altro è un download.', con tre card che recitano 'Grok Voice Think Fast 2.0: $0,08 al minuto audio, 0,70 s al primo audio', 'Realtime-Venus: pesi Apache-2.0, nessuna API, nessun listino tariffe', e 'La scommessa condivisa: ragionare mentre si parla, non prima', sopra una striscia a piè di pagina che recita 'Dati Grok secondo Artificial Analysis e la documentazione xAI; dati Realtime-Venus dal suo rapporto tecnico, non riprodotti.' Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Realtime-Venus vs Grok Voice Think Fast 2.0: Solo uno di questi ha un prezzo

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Metti Realtime-Venus e Grok Voice Think Fast 2.0 uno accanto all'altro e la prima differenza non è un benchmark, è un ordine d'acquisto. Grok Voice Think Fast 2.0 è un modello speech-to-speech ospitato che è stato messo in vendita il 29 luglio 2026 a 0,08 $ per minuto audio, con un time-to-first-audio dichiarato di 0,70 secondi e punteggi di benchmark forniti da terzi. Realtime-Venus è un sistema full-duplex da 9B del Venus Team di Ant Group e dell'Università Tsinghua che esiste sotto forma di pesi Apache-2.0, un rapporto tecnico datato 12 settembre 2026 e nulla che si possa chiamare. Uno di questi lo puoi collegare a una linea telefonica entro la fine della settimana. L'altro lo puoi leggere. Quell'asimmetria si rivela un confronto molto più utile di quanto lo sarebbe un tabellone dei punteggi, perché i due modelli hanno fatto quasi la stessa scommessa architetturale e poi si sono completamente divisi su cosa farne.

La risposta breve

Scegli Grok Voice Think Fast 2.0 se ti serve subito un agente vocale funzionante, in produzione, con un listino prezzi che puoi inserire in un budget e una garanzia di latenza che puoi testare. Scegli Realtime-Venus se devi possedere lo stack — se i tuoi dati non possono uscire dalla tua infrastruttura, se devi mettere a punto il front end, o se stai valutando l'architettura invece di rilasciare un prodotto. Non esiste un terzo caso in cui competano, perché uno ha un'API e l'altro no.

Concordano sul problema difficile

La cosa interessante è quanto sia simile la diagnosi. Entrambi i modelli esistono a causa della stessa contraddizione: il controllo della conversazione deve funzionare a una granularità inferiore al secondo, mentre il ragionamento richiede secondi. Un modello che si ferma a pensare smette di sembrare presente.

Grok Voice Think Fast 2.0 lo risolve ragionando mentre parla. La linea Think Fast è stata costruita sull'idea che il modello non debba prima inferire e poi generare il parlato; invece trasmette il parlato in streaming e pensa in parallelo, così una chiamata a uno strumento può scattare prima che l'agente abbia finito la sua prima frase. xAI riferisce che la versione 2.0 utilizza circa 0,4 volte i token di ragionamento del suo predecessore, il che viene presentato come un miglioramento in termini di costi e latenza anziché di qualità.

Realtime-Venus lo risolve non risolvendolo affatto nel frontend. Il suo runtime a doppio loop mantiene in esecuzione un loop di interazione da un secondo — percezione, controllo del turno, generazione del parlato — e affida qualsiasi cosa costosa a un componente separato chiamato Realtime-Venus-Harness tramite marcatori di delega asincrona emessi nella sequenza nascosta del modello stesso. La conversazione in primo piano non si interrompe mai. I risultati in background vengono reintegrati quando arrivano.

Quelle sono risposte ingegneristiche diverse alla stessa domanda, e hanno modalità di fallimento diverse. Ragionare mentre si parla addossa al modello l'onere di mantenere coerenti entrambi i fili. La delega addossa al runtime l'onere di evitare che i due cicli si corrompano a vicenda — ed è per questo che la cattura causale dei task del paper Realtime-Venus, un'istantanea di stato isolata per ogni task delegato, è il dettaglio che regge il design.

L'unica metrica sulla quale possono essere misurati entrambi

I benchmark full-duplex sono l'unico punto in cui questi due si sovrappongono, e non si sovrappongono in modo netto.

• Gestione delle interruzioni — Realtime-Venus dichiara di rispondere al 75% delle interruzioni dell'utente su Full-Duplex-Bench v1.5. Grok Voice Think Fast 2.0 ottiene il 95,1% su Full Duplex Bench secondo Artificial Analysis, in aumento dal 77,8% della versione 1.0.

• Continuazione in caso di sovrapposizione — Realtime-Venus riporta una continuazione del 97% in presenza di backchannel, dell'88% con il parlato rivolto ad altri e dell'86% con il parlato in sottofondo, e afferma di superare Gemini 3.1 Live e GPT-4o su tutti e tre.

• Strumenti diversi, autori diversi — i valori di Realtime-Venus provengono dalla sua stessa relazione tecnica, senza riproduzione esterna. I valori di Grok provengono da una terza parte che ha eseguito il modello. Confrontare un numero autodichiarato con uno misurato in modo indipendente non è un confronto, e il divario sopra è tanto probabilmente di natura metodologica quanto reale.

Lettura onesta: sulla base delle prove disponibili, Grok Voice Think Fast 2.0 è l'unico dei due il cui comportamento full-duplex sia stato misurato da qualcuno senza alcun interesse in gioco nel risultato.

Dove i numeri indipendenti collocano Grok Voice Think Fast 2.0

La lettura attuale più nitida proviene dalla Speech Agent Arena di Artificial Analysis, che assegna un punteggio ai modelli in base alla preferenza in cieco in conversazioni vocali dal vivo su attività come prenotare una visita dentistica e ordinare cibo da asporto. Al 18 settembre 2026, Grok Voice Think Fast 2.0 High si trova al settimo posto su più di venti voci con un Elo di 1.011 su 552 campioni — dietro a Gemini 3.1 Flash Live Minimal di Google a 1.096, Gemini 3.8 Live a 1.083 e GPT-Live-1 a 1.053, e ben al di sopra del suo stesso predecessore, Grok Voice Think Fast 1.0, a 908.

La colonna accanto all'Elo è quella più interessante. Sul tasso di successo nelle attività, Grok Voice Think Fast 2.0 registra il 94,6%, il valore più alto in tutta la top venti visibile — superiore al 93,2% di Gemini 3.8 Live, al 91,5% di GPT-Realtime-2.1 High e al 90,9% di GPT-Live-1. Settimo per preferenza, primo per completamento delle attività: un profilo insolito e piuttosto specifico: gli ascoltatori non amano la voce, ma porta a termine il lavoro. Se il vostro prodotto fa cose invece di chiacchierare, è quella la colonna che predice il vostro risultato, ed è la prova indipendente più solida di cui disponga uno di questi due modelli.

A screenshot of the Artificial Analysis Speech Agent Arena Leaderboard captured 18 September 2026. The table reads, in rank order: Gemini 3.1 Flash Live Minimal Elo 1,096 with a 74.6% task success rate; Gemini 3.8 Live Elo 1,083 and 93.2%; Gemini 3.1 Flash Live High Elo 1,063 and 71.8%; GPT-Live-1 (Sol, low) Elo 1,053 and 90.9%; GPT-Live-1 (Astra, medium) Elo 1,048 and 87.4%; Cartesia Line Elo 1,027 and 77.5%; Grok Voice Think Fast 2.0 High Elo 1,011, 552 samples and 94.6%; GPT-Realtime-1.5 Elo 1,000 and 85.1%; and further down Grok Voice Think Fast 1.0 at Elo 908 with 80.7%.

I dati pubblicati da xAI al lancio sono uno strumento diverso e vanno letti separatamente: 82,9% sull'indice di qualità speech-to-speech di Artificial Analysis, primo posto nel benchmark agentico τ-Voice con il 56,5%, 97,2% su Big Bench Audio e 95,1% su Full Duplex Bench. Quelle erano le posizioni quando il modello è stato rilasciato alla fine di luglio 2026, e le classifiche in questa categoria cambiano ogni mese — ed è esattamente per questo che la tabella dell'arena qui sopra, letta oggi, vale più dei numeri del lancio.

A two-column comparison scoreboard titled 'Realtime-Venus vs Grok Voice Think Fast 2.0 — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Availability: Apache-2.0 weights, no API', 'Price: none published', 'Modality: audio, video and text', 'Interruption response: 75% reported', 'Continuation under overlap: 97 / 88 / 86% reported', 'Independent scores: none'. The right column, labelled Grok Voice Think Fast 2.0, reads 'Availability: hosted API since 29 July 2026', 'Price: $0.08 per audio minute', 'Modality: audio and text', 'Interruption handling: 95.1% Full Duplex Bench at launch', 'Time to first audio: 0.70 s', 'Independent scores: Elo 1,011 and 94.6% task success on the Speech Agent Arena'. The footer reads 'Realtime-Venus figures from its technical report, unreproduced; Grok figures per Artificial Analysis and xAI documentation.'

Il conto, e le parti di esso che non sono sul conto

Grok Voice Think Fast 2.0 costa $0,08 al minuto di audio, circa $4,80 all'ora, più $0,004 per ogni messaggio di testo in input. Si tratta di un aumento del 60% rispetto ai $0,05 al minuto che la versione 1.0 applicava al lancio, e xAI ha spostato l'alias rolling grok-voice-latest sulla 2.0 automaticamente il 5 agosto 2026, quindi i team che volevano rimanere al vecchio prezzo hanno dovuto fissare una versione esplicita prima di quella data. Il modello a consumo al minuto significa anche che i miglioramenti di efficienza vanno a vantaggio del fornitore: se il modello diventa più bravo a concludere le chiamate più rapidamente, la bolletta per chiamata diminuisce, ma il costo al minuto no.

Realtime-Venus non ha una fattura, perché non ha un servizio. Quello che ha invece è un requisito hardware minimo. Due checkpoint da 9B in BF16 sono all'incirca diciotto gigabyte di pesi ciascuno, prima della memoria per le attivazioni, e la scheda documenta un ciclo di streaming al secondo che deve funzionare in modo continuo. Un nodo GPU in grado di sostenere tutto ciò ha un costo mensile, ed è un costo fisso — lo paghi indipendentemente dal fatto che qualcuno effettui chiamate o meno. Per un prodotto con traffico costante, è più economico di $4.80 all'ora. Per un prodotto con traffico intermittente, è drasticamente più costoso, e il punto di crossover è l'unica questione finanziaria che conti qui.

Pesi, controllo e cosa ciascuno ti consente di modificare

È qui che i due modelli smettono del tutto di essere comparabili.

• Fine-tuning — Realtime-Venus fornisce i pesi. Puoi eseguirne il fine-tuning, quantizzarli, eseguirli in ambiente air-gapped e ispezionare ogni livello. Grok Voice Think Fast 2.0 è un modello hosted chiuso; ciò che puoi modificare sono il prompt, la selezione della voce e gli strumenti che registri.

• Voce — Grok Voice Think Fast 2.0 include voci preimpostate e supporta la clonazione vocale personalizzata da circa un minuto di parlato. Realtime-Venus include una voce di riferimento e un decoder token-to-waveform integrato, e tutto ciò che va oltre è un problema tuo.

• Reach — Grok Voice Think Fast 2.0 supporta oltre 25 lingue e parla PCM16 a 24 kHz per impostazione predefinita con μ-law per la telefonia, tramite una sessione WebSocket compatibile con OpenAI Realtime. Questa compatibilità è un vero vantaggio per la migrazione: la maggior parte del codice vocale in tempo reale esistente necessita di una modifica dell'URL di base e della chiave. Realtime-Venus documenta inglese e cinese.

• Video — Realtime-Venus-Omni riceve video in streaming e immagini tramite un encoder SigLIP2 ed esegue una percezione visiva continua. Grok Voice Think Fast 2.0 è audio e testo; non esiste un percorso per la videocamera.

• Contesto lungo — Realtime-Venus dispone di un contesto di 40.960 token e di una memoria per video lunghi senza addestramento che può essere abilitata su una finestra di quaranta minuti. Grok Voice Think Fast 2.0 è un modello di sessione senza una funzionalità di memoria pubblicata comparabile.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Any-to-Any, Transformers, Safetensors, audio, video, speech, streaming and full-duplex tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Dove ciascuno si rompe

I guasti per cui vale la pena pianificare sono opposti. L'esposizione di Grok Voice Think Fast 2.0 è la concentrazione dei fornitori e il marketing non verificabile: i risultati A/B di Starlink di xAI, i suoi moltiplicatori di accuratezza della trascrizione e il suo modo di presentare la velocità sono tutti autodichiarati, senza che i dati alla base siano pubblicati, e un modello con tariffazione al minuto che cambia prezzo del 60% tra una versione e l'altra ha dimostrato che cambierà prezzo. Fissa la tua versione ed esegui le tue valutazioni sul tuo audio.

Il punto debole di Realtime-Venus è che nessuno l'ha eseguito. I suoi benchmark sono autodichiarati, il suo harness è privo di documentazione rispetto alla sua importanza, e la sua latenza in un deployment reale è sconosciuta — il rapporto descrive una cadenza di interazione di un secondo, che è un parametro di progettazione, non un tempo al primo audio misurato. Un modello senza API e senza riproducibilità non ha alcun track record, solo una specifica.

Esiste una via di mezzo che vale la pena enunciare chiaramente, perché è ciò che la maggior parte dei team farà davvero. Se stai costruendo un sistema basato sulla delega — scegli tu il front end, affida il lavoro costoso a un modello testuale — il front end e il ramo di ragionamento non devono per forza provenire dallo stesso posto. OrcaRouter non offre né Realtime-Venus né Grok Voice Think Fast 2.0; entrambi i livelli vocali restano fuori da ciò che serviamo, e lo diciamo apertamente anziché lasciar intendere il contrario. Il ramo delegato è una questione diversa. Quasi 200 modelli testuali sono accessibili con una sola chiave al prezzo di listino del provider, senza ricarichi, con failover automatico, così un'interruzione a monte non fa cadere una chiamata in corso, un DSL di routing per comporre più modelli in un'unica chiamata e la fusione di modelli per le decisioni che meritano più di un parere. Questa è la metà di un agente vocale che trae vantaggio dall'essere intercambiabile, ed è la metà che puoi cambiare senza toccare il modello che sta sostenendo la conversazione.

Quale scegliere?

Scegli Grok Voice Think Fast 2.0 questo trimestre. È disponibile, ha benchmark indipendenti, è primo nella valutazione agentica che prevede se il tuo agente può fare qualcosa di utile, e 0,70 secondi al primo audio è un numero su cui puoi costruire un'esperienza utente. Metti in budget l'aumento di prezzo del 60% rispetto alla 1.0 e fissa la versione del tuo modello.

Scegli Realtime-Venus solo se il vincolo è la proprietà. Se il tuo deployment non può chiamare un'API esterna, se devi fare fine-tuning del front end conversazionale, o se ti serve la telecamera — quei tre casi sono l'intero argomento, e sono forti quando si applicano.

Ciò che non dovrebbe deciderlo è la tabella di benchmark, perché le sue due parti sono state prodotte da persone diverse in condizioni diverse. I numeri di Grok Voice Think Fast 2.0 sono stati misurati da qualcun altro. Quelli di Realtime-Venus no. Finché la situazione non cambia, il confronto effettivamente disponibile è tra un prodotto e un paper.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno