
Realtime-Venus vs Grok Voice Think Fast 2.0 : Un seul d'entre eux a un prix
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Mettez Realtime-Venus et Grok Voice Think Fast 2.0 côte à côte et la première différence n'est pas un benchmark, c'est un bon de commande. Grok Voice Think Fast 2.0 est un modèle parole-à-parole hébergé, mis en vente le 29 juillet 2026 à 0,08 $ par minute audio, avec un délai jusqu'au premier audio publié de 0,70 seconde et des scores de benchmark fournis par un tiers. Realtime-Venus est un système full-duplex de 9B de l'équipe Venus d'Ant Group et de l'Université Tsinghua, qui existe sous forme de poids Apache-2.0, d'un rapport technique daté du 12 septembre 2026, et de rien que vous puissiez appeler. L'un des deux, vous pouvez le raccorder à une ligne téléphonique avant la fin de la semaine. L'autre, vous pouvez le lire. Cette asymétrie s'avère être une comparaison bien plus utile qu'un tableau de scores, car les deux modèles ont fait presque le même pari architectural, puis ont complètement divergé sur ce qu'il fallait en faire.
La réponse courte
Choisissez Grok Voice Think Fast 2.0 si vous avez besoin dès maintenant d'un agent vocal opérationnel, en production, avec une grille tarifaire que vous pouvez inscrire dans un budget et une garantie de latence que vous pouvez tester. Choisissez Realtime-Venus si vous devez posséder la pile — si vos données ne peuvent pas quitter votre infrastructure, si vous devez affiner le front-end, ou si vous évaluez l'architecture plutôt que de livrer un produit. Il n'existe pas de troisième cas où ils se font concurrence, car l'un dispose d'une API et l'autre non.
Ils sont d’accord sur le problème difficile.
Ce qui est intéressant, c’est à quel point le diagnostic est similaire. Les deux modèles existent à cause de la même contradiction : le contrôle de la conversation doit fonctionner à une granularité inférieure à la seconde, alors que le raisonnement prend des secondes. Un modèle qui s’arrête pour réfléchir cesse de donner l’impression d’être présent.
Grok Voice Think Fast 2.0 résout cela en raisonnant pendant qu’il parle. La gamme Think Fast repose sur l’idée que le modèle ne doit pas d’abord inférer puis générer la parole ; il diffuse au contraire la parole et réfléchit en parallèle, de sorte qu’un appel d’outil peut se déclencher avant que l’agent ait terminé sa première phrase. xAI indique que la version 2.0 utilise environ 0,4 fois le nombre de jetons de raisonnement de son prédécesseur, ce qui est présenté comme une amélioration en termes de coût et de latence plutôt que de qualité.
Realtime-Venus résout le problème en ne le résolvant pas du tout dans le frontend. Son runtime à double boucle maintient une boucle d'interaction d'une seconde — perception, contrôle du tour de parole, génération de parole — et confie tout ce qui est coûteux à un composant distinct appelé Realtime-Venus-Harness, via des marqueurs de délégation asynchrone émis dans la propre séquence cachée du modèle. La conversation au premier plan ne s'interrompt jamais. Les résultats en arrière-plan sont réintégrés lorsqu'ils arrivent.
Ce sont différentes réponses d’ingénierie à la même question, et elles ont des modes de défaillance différents. Le fait de raisonner tout en parlant impose au modèle la charge de maintenir la cohérence des deux fils. La délégation impose au runtime la charge d’empêcher les deux boucles de se corrompre mutuellement — c’est pourquoi la capture causale des tâches de l’article Realtime-Venus, un instantané d’état isolé par tâche déléguée, est le détail qui porte la conception.
Le seul critère sur lequel on peut les mesurer tous les deux
Les benchmarks full-duplex sont le seul endroit où ces deux se recoupent, et ils ne se recoupent pas proprement.
• Gestion des interruptions — Realtime-Venus rapporte répondre à 75 % des interruptions des utilisateurs sur Full-Duplex-Bench v1.5. Grok Voice Think Fast 2.0 obtient un score de 95,1 % sur Full Duplex Bench selon Artificial Analysis, contre 77,8 % pour la version 1.0.
• Continuation en cas de chevauchement — Realtime-Venus rapporte 97 % de continuation sous les backchannels, 88 % sous la parole adressée à autrui, et 86 % sous la parole en arrière-plan, et affirme qu’il dépasse Gemini 3.1 Live et GPT-4o sur les trois.
• Des instruments différents, des auteurs différents — les chiffres de Realtime-Venus proviennent de son propre rapport technique, sans reproduction externe. Les chiffres de Grok proviennent d’une tierce partie qui a exécuté le modèle. Comparer un chiffre auto-déclaré à un chiffre mesuré indépendamment n’est pas une comparaison, et l’écart ci-dessus a autant de chances d’être méthodologique que réel.
Lecture honnête : au vu des éléments disponibles, Grok Voice Think Fast 2.0 est le seul des deux dont le comportement en duplex intégral a été mesuré par quelqu'un n'ayant aucun intérêt dans le résultat.
Où les chiffres indépendants placent Grok Voice Think Fast 2.0
La lecture la plus nette actuellement provient de la Speech Agent Arena d’Artificial Analysis, qui évalue les modèles selon les préférences en aveugle lors de conversations vocales en direct sur des tâches telles que la prise d’un rendez-vous chez le dentiste et la commande de plats à emporter. Au 18 septembre 2026, Grok Voice Think Fast 2.0 High se classe septième sur plus de vingt entrées, avec un Elo de 1 011 sur 552 échantillons — derrière Gemini 3.1 Flash Live Minimal de Google à 1 096, Gemini 3.8 Live à 1 083 et GPT-Live-1 à 1 053, et nettement devant son propre prédécesseur, Grok Voice Think Fast 1.0, à 908.
La colonne à côté de l'Elo est la plus intéressante. En taux de réussite des tâches, Grok Voice Think Fast 2.0 enregistre 94,6 %, le chiffre le plus élevé de tout le top 20 visible — au-dessus des 93,2 % de Gemini 3.8 Live, des 91,5 % de GPT-Realtime-2.1 High et des 90,9 % de GPT-Live-1. Septième en termes de préférence, premier en achèvement des tâches : voilà un profil inhabituel et très spécifique : les auditeurs n'adorent pas la voix, mais elle fait le travail. Si votre produit fait des choses plutôt que de discuter, c'est cette colonne qui prédit votre résultat, et c'est la preuve indépendante la plus solide que possède l'un ou l'autre de ces deux modèles.

Les chiffres publiés par xAI au lancement relèvent d'un autre instrument de mesure et doivent être lus séparément : 82,9 % sur l'indice de qualité parole-à-parole d'Artificial Analysis, première place sur le benchmark agentique τ-Voice à 56,5 %, 97,2 % sur Big Bench Audio et 95,1 % sur Full Duplex Bench. Tels étaient les classements lorsque le modèle est sorti fin juillet 2026, et les classements de cette catégorie évoluent chaque mois — c'est précisément pourquoi le tableau de l'arène ci-dessus, lu aujourd'hui, vaut plus que les chiffres du lancement.

La facture, et les parties de celle-ci qui ne figurent pas sur la facture
Grok Voice Think Fast 2.0 coûte 0,08 $ par minute d'audio, soit environ 4,80 $ de l'heure, plus 0,004 $ pour chaque message texte envoyé en entrée. Cela représente une hausse de 60 % par rapport aux 0,05 $ par minute facturés par la version 1.0 à son lancement, et xAI a fait basculer automatiquement l'alias évolutif grok-voice-latest vers la version 2.0 le 5 août 2026, si bien que les équipes qui souhaitaient conserver l'ancien tarif ont dû épingler une version explicite avant cette date. Le modèle à la minute signifie aussi que les gains d'efficacité profitent au fournisseur : si le modèle devient plus rapide pour terminer les appels, votre facture par appel baisse, mais votre coût par minute, non.
Realtime-Venus n'a pas de facture, parce qu'il n'a pas de service. Ce qu'il a à la place, c'est un socle matériel. Deux points de contrôle de 9 milliards de paramètres en BF16 représentent chacun environ dix-huit gigaoctets de poids, avant même la mémoire d'activation, et la fiche technique documente une boucle de streaming à la seconde qui doit tourner en continu. Un nœud GPU capable de cela a un coût mensuel, et ce coût est fixe — vous le payez, que quelqu'un fasse des appels ou non. Pour un produit au trafic régulier, c'est moins cher que 4,80 $ de l'heure. Pour un produit au trafic intermittent, c'est nettement plus cher, et le point de bascule est la seule question financière qui compte ici.
Pondérations, contrôle et ce que chacun vous permet de modifier
C'est à ce stade que les deux modèles cessent complètement d'être comparables.
• Fine-tuning — Realtime-Venus fournit les poids. Vous pouvez les affiner, les quantiser, les exécuter en air-gap et inspecter chaque couche. Grok Voice Think Fast 2.0 est un modèle hébergé fermé ; ce que vous pouvez modifier, c’est le prompt, la sélection de voix et les outils que vous enregistrez.
• Voix — Grok Voice Think Fast 2.0 est livré avec des voix prédéfinies et prend en charge le clonage vocal personnalisé à partir d'environ une minute de parole. Realtime-Venus est livré avec une voix de référence et un décodeur token-vers-forme d'onde intégré, et tout ce qui va au-delà, c'est votre problème.
• Portée — Grok Voice Think Fast 2.0 prend en charge plus de 25 langues et parle PCM16 à 24 kHz par défaut avec μ-law pour la téléphonie, via une session WebSocket compatible avec OpenAI Realtime. Cette compatibilité est un véritable atout de migration : la plupart du code vocal temps réel existant n’a besoin que d’un changement d’URL de base et de clé. Realtime-Venus documente l’anglais et le chinois.
• Vidéo — Realtime-Venus-Omni reçoit de la vidéo en streaming et des images via un encodeur SigLIP2 et effectue une perception visuelle continue. Grok Voice Think Fast 2.0 est audio et texte ; il n'existe aucune voie caméra.
• Contexte long — Realtime-Venus dispose d'un contexte de 40 960 tokens et d'une mémoire de vidéo longue sans entraînement qui peut être activée sur une fenêtre de quarante minutes. Grok Voice Think Fast 2.0 est un modèle de session sans fonctionnalité de mémoire publiée comparable.

Là où chacun se brise
Les défaillances qu'il vaut la peine d'anticiper sont de nature opposée. L'exposition de Grok Voice Think Fast 2.0, c'est la concentration sur un seul fournisseur et un marketing invérifiable : les résultats de tests A/B Starlink de xAI, ses multiplicateurs de précision de transcription et sa présentation de la vitesse sont tous déclarés par l'entreprise, sans données sous-jacentes publiées, et un modèle facturé à la minute qui change de prix de 60 % entre les versions a démontré qu'il changera de prix. Figez votre version et lancez vos propres évaluations sur votre propre audio.
L’exposition de Realtime-Venus, c’est que personne ne l’a exécuté. Ses benchmarks sont auto-déclarés, son harnais n’est pas documenté au regard de son importance, et sa latence en déploiement réel est inconnue — le rapport décrit une cadence d’interaction d’une seconde, qui est un paramètre de conception, et non un temps jusqu’au premier audio mesuré. Un modèle sans API ni reproduction n’a aucun antécédent, seulement une spécification.
Il existe une voie médiane qu'il vaut la peine d'énoncer clairement, car c'est ce que la plupart des équipes feront réellement. Si vous construisez un système basé sur la délégation — choisissez votre propre front-end, confiez le travail coûteux à un modèle texte — le front-end et la branche de raisonnement ne doivent pas nécessairement venir du même endroit. OrcaRouter ne propose ni Realtime-Venus ni Grok Voice Think Fast 2.0 ; les deux couches vocales se situent en dehors de ce que nous servons, et nous le disons plutôt que de laisser entendre le contraire. La branche déléguée est une autre question. Près de 200 modèles texte se trouvent derrière une seule clé au prix catalogue du fournisseur, sans majoration, avec un basculement automatique pour qu'une panne en amont n'interrompe pas un appel en cours, un DSL de routage pour combiner plusieurs modèles en un seul appel, et une fusion de modèles pour les décisions qui méritent plus d'un avis. C'est la moitié d'un agent vocal qui gagne à être interchangeable, et c'est la moitié que vous pouvez changer sans toucher au modèle qui tient la conversation.
Lequel choisir
Choisissez Grok Voice Think Fast 2.0 ce trimestre. Il est disponible, il est évalué de manière indépendante, il arrive en tête de l’évaluation agentique qui prédit si votre agent peut faire quoi que ce soit d’utile, et 0,70 seconde jusqu’au premier son est un chiffre sur lequel vous pouvez bâtir une expérience utilisateur. Prévoyez la hausse de prix de 60 % par rapport à 1.0 et fixez la version de votre modèle.
Ne choisissez Realtime-Venus que si la contrainte est la propriété. Si votre déploiement ne peut pas appeler une API externe, si vous devez fine-tuner le front-end conversationnel, ou si vous avez besoin de la caméra — ces trois cas constituent à eux seuls toute la justification, et ils sont solides lorsqu’ils s’appliquent.
Ce qui ne devrait pas être décisif, c’est le tableau de benchmark, car ses deux côtés ont été produits par des personnes différentes dans des conditions différentes. Les chiffres de Grok Voice Think Fast 2.0 ont été mesurés par quelqu’un d’autre. Ceux de Realtime-Venus ne l’ont pas été. Tant que cela ne change pas, la comparaison réellement disponible est entre un produit et un article.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
