
Realtime-Venus vs Grok Voice Think Fast 2.0: Solo uno de estos tiene un precio
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Pon Realtime-Venus y Grok Voice Think Fast 2.0 uno junto al otro y la primera diferencia no es una prueba de referencia, es una orden de compra. Grok Voice Think Fast 2.0 es un modelo alojado de voz a voz que se puso a la venta el 29 de julio de 2026 a 0,08 $ por minuto de audio, con un tiempo hasta el primer audio publicado de 0,70 segundos y puntuaciones de pruebas de referencia de un tercero. Realtime-Venus es un sistema full-duplex de 9B del Venus Team de Ant Group y la Universidad de Tsinghua que existe como pesos Apache-2.0, un informe técnico fechado el 12 de septiembre de 2026, y nada a lo que puedas llamar. A uno de estos puedes conectarlo a una línea telefónica antes de que termine la semana. Al otro puedes leerlo. Esa asimetría resulta ser una comparación mucho más útil de lo que sería un marcador, porque los dos modelos hicieron casi la misma apuesta arquitectónica y luego divergieron por completo en qué hacer con ella.
La respuesta corta
Elige Grok Voice Think Fast 2.0 si necesitas un agente de voz funcional ahora, en producción, con una tabla de tarifas que puedas incluir en un presupuesto y una garantía de latencia que puedas probar. Elige Realtime-Venus si necesitas ser dueño del stack — si tus datos no pueden salir de tu infraestructura, si necesitas ajustar el front end, o si estás evaluando la arquitectura en lugar de lanzar un producto. No hay un tercer caso en el que compitan, porque uno tiene una API y el otro no.
Están de acuerdo sobre el problema difícil.
Lo interesante es lo parecido que es el diagnóstico. Ambos modelos existen debido a la misma contradicción: el control de la conversación tiene que ejecutarse con una granularidad inferior al segundo, y el razonamiento tarda segundos. Un modelo que se detiene a pensar deja de sentirse presente.
Grok Voice Think Fast 2.0 lo resuelve razonando mientras habla. La línea Think Fast se construyó sobre la idea de que el modelo no debería inferir primero y generar voz después; en cambio, transmite voz y piensa en paralelo, de modo que una llamada a herramienta puede dispararse antes de que el agente haya terminado su primera frase. xAI informa que la versión 2.0 usa aproximadamente 0,4 veces los tokens de razonamiento de su predecesora, lo que se presenta como una mejora en costo y latencia más que en calidad.
Realtime-Venus lo resuelve no resolviéndolo en el frontend en absoluto. Su runtime de doble bucle mantiene en marcha un bucle de interacción de un segundo —percepción, control de turnos, generación de voz— y pasa todo lo costoso a un componente separado llamado Realtime-Venus-Harness mediante marcadores de delegación asíncrona emitidos en la propia secuencia oculta del modelo. La conversación en primer plano nunca se pausa. Los resultados en segundo plano se reintegran cuando llegan.
Esas son respuestas de ingeniería diferentes a la misma pregunta, y tienen modos de fallo distintos. El razonamiento mientras se habla pone la carga en el modelo, que debe mantener coherentes ambos hilos. La delegación pone la carga en el runtime, que debe evitar que los dos bucles se corrompan entre sí — por eso la captura causal de tareas del artículo Realtime-Venus, una instantánea de estado aislada por cada tarea delegada, es el detalle que sostiene el diseño.
La única métrica en la que ambos pueden medirse
Los benchmarks full-duplex son el único punto en el que estos dos se solapan, y no se solapan de forma limpia.
• Gestión de interrupciones — Realtime-Venus informa que responde al 75 % de las interrupciones del usuario en Full-Duplex-Bench v1.5. Grok Voice Think Fast 2.0 obtiene una puntuación del 95,1 % en Full Duplex Bench según Artificial Analysis, frente al 77,8 % de la versión 1.0.
• Continuación bajo solapamiento — Realtime-Venus informa un 97% de continuación bajo señales de apoyo, un 88% bajo habla dirigida a otros, y un 86% bajo habla de fondo, y afirma que supera a Gemini 3.1 Live y GPT-4o en las tres.
• Diferentes instrumentos, diferentes autores — las cifras de Realtime-Venus provienen de su propio informe técnico, sin reproducción externa. Las cifras de Grok provienen de un tercero que ejecutó el modelo. Comparar un número autoinformado con uno medido de forma independiente no es una comparación, y es tan probable que la brecha anterior sea metodológica como real.
La lectura honesta: según las pruebas disponibles, Grok Voice Think Fast 2.0 es el único de los dos cuyo comportamiento dúplex completo ha sido medido por alguien sin interés alguno en el resultado.
Dónde sitúan los números independientes a Grok Voice Think Fast 2.0
La lectura actual más clara proviene de Speech Agent Arena de Artificial Analysis, que puntúa los modelos según la preferencia a ciegas en conversaciones de voz en vivo en tareas como reservar una cita con el dentista y pedir comida para llevar. A 18 de septiembre de 2026, Grok Voice Think Fast 2.0 High ocupa el séptimo puesto entre más de veinte entradas, con un Elo de 1.011 sobre 552 muestras —por detrás del Gemini 3.1 Flash Live Minimal de Google, con 1.096, de Gemini 3.8 Live, con 1.083, y de GPT-Live-1, con 1.053, y muy por delante de su propio predecesor, Grok Voice Think Fast 1.0, con 908.
La columna junto al Elo es la más interesante. En tasa de éxito en tareas, Grok Voice Think Fast 2.0 registra un 94,6%, la cifra más alta de todo el top veinte visible —por encima del 93,2% de Gemini 3.8 Live, el 91,5% de GPT-Realtime-2.1 High y el 90,9% de GPT-Live-1—. Séptimo por preferencia, primero por finalización de tareas: un perfil inusual y bastante específico: a quienes escuchan no les encanta la voz, pero hace el trabajo. Si tu producto hace cosas en lugar de conversar, esa es la columna que predice tu resultado, y es la evidencia independiente más sólida que tiene cualquiera de estos dos modelos.

Las cifras que xAI publicó en el lanzamiento corresponden a un instrumento distinto y deben interpretarse por separado: 82,9 % en el índice de calidad de voz a voz de Artificial Analysis, primer puesto en el benchmark agéntico τ-Voice con 56,5 %, 97,2 % en Big Bench Audio y 95,1 % en Full Duplex Bench. Esas eran las posiciones cuando el modelo se lanzó a finales de julio de 2026, y los rankings de esta categoría cambian todos los meses —que es exactamente por lo que la tabla de la arena que aparece arriba, leída a día de hoy, vale más que las cifras de lanzamiento.

La cuenta, y las partes de ella que no están en la cuenta.
Grok Voice Think Fast 2.0 cuesta $0,08 por minuto de audio, aproximadamente $4,80 por hora, más $0,004 por cada mensaje de texto de entrada. Eso representa un aumento del 60 % respecto a los $0,05 por minuto que cobraba la versión 1.0 en su lanzamiento, y xAI trasladó el grok-voice-latest alias rotativo a la 2.0 automáticamente el 5 de agosto de 2026, por lo que los equipos que querían mantenerse en el precio anterior tuvieron que fijar una versión explícita antes de esa fecha. El modelo por minuto también significa que las mejoras de eficiencia benefician al proveedor: si el modelo mejora y termina las llamadas más rápido, tu factura por llamada baja, pero tu costo por minuto no.
Realtime-Venus no tiene factura, porque no tiene servicio. Lo que tiene en cambio es un piso de hardware. Dos checkpoints de 9B en BF16 son aproximadamente dieciocho gigabytes de pesos cada uno antes de la memoria de activación, y la tarjeta documenta un bucle de streaming por segundo que debe ejecutarse continuamente. Un nodo de GPU capaz de eso tiene un costo mensual, y es fijo: lo pagas llamen o no llamen. Para un producto con tráfico constante, eso es más barato que $4.80 por hora. Para un producto con tráfico intermitente, es dramáticamente más caro, y el punto de cruce es la única cuestión financiera que importa aquí.
Pesos, control y qué te permite cambiar cada uno
Aquí es donde los dos modelos dejan de ser comparables en absoluto.
• Ajuste fino — Realtime-Venus incluye los pesos. Puedes ajustarlos, cuantizarlos, ejecutarlos en un entorno aislado e inspeccionar cada capa. Grok Voice Think Fast 2.0 es un modelo alojado cerrado; lo que puedes cambiar es el prompt, la selección de voz y las herramientas que registras.
• Voz — Grok Voice Think Fast 2.0 incluye voces predefinidas y admite la clonación de voz personalizada a partir de aproximadamente un minuto de habla. Realtime-Venus incluye una voz de referencia y un decodificador de token a forma de onda integrado, y cualquier cosa más allá de eso es problema tuyo.
• Alcance — Grok Voice Think Fast 2.0 admite más de 25 idiomas y habla PCM16 a 24 kHz de forma predeterminada con μ-law para telefonía, a través de una sesión de WebSocket compatible con OpenAI Realtime. Esa compatibilidad es un verdadero activo de migración: la mayoría del código de voz en tiempo real existente solo necesita un cambio de URL base y de clave. Realtime-Venus documenta inglés y chino.
• Video — Realtime-Venus-Omni recibe video en streaming e imágenes a través de un codificador SigLIP2 y realiza percepción visual continua. Grok Voice Think Fast 2.0 es de audio y texto; no hay ruta de cámara.
• Contexto largo: Realtime-Venus cuenta con un contexto de 40.960 tokens y una memoria para videos largos sin entrenamiento que se puede habilitar en una ventana de cuarenta minutos. Grok Voice Think Fast 2.0 es un modelo de sesión que no tiene una función de memoria publicada comparable.

Dónde se rompe cada uno
Los fallos para los que vale la pena planificar son los opuestos. La exposición de Grok Voice Think Fast 2.0 es la concentración de proveedores y el marketing no verificable: los resultados A/B de Starlink de xAI, sus multiplicadores de precisión de transcripción y su encuadre de velocidad son todos reportados por la empresa, sin datos subyacentes publicados, y un modelo por minuto que cambia el precio un 60 % entre versiones ha demostrado que cambiará de precio. Fija tu versión y ejecuta tus propias evaluaciones con tu propio audio.
La exposición de Realtime-Venus es que nadie lo ha ejecutado. Sus benchmarks son autoinformados, su arnés de pruebas no está documentado en relación con su importancia, y su latencia en un despliegue real es desconocida: el informe describe una cadencia de interacción de un segundo, que es un parámetro de diseño, no un tiempo hasta el primer audio medido. Un modelo sin API y sin reproducción no tiene historial, solo una especificación.
Hay un camino intermedio que vale la pena decir con claridad, porque es lo que la mayoría de los equipos hará en realidad. Si estás construyendo un sistema basado en delegación —elige tu propio front end, entrega el trabajo costoso a un modelo de texto—, el front end y la pata de razonamiento no tienen que venir del mismo lugar. OrcaRouter no incluye ni Realtime-Venus ni Grok Voice Think Fast 2.0; ambas capas de voz quedan fuera de lo que servimos, y lo decimos en lugar de insinuar lo contrario. La pata delegada es otro asunto. Casi 200 modelos de texto están detrás de una sola clave al precio de lista del proveedor, sin recargo, con conmutación por error automática para que una interrupción del proveedor upstream no corte una llamada en vivo, un DSL de enrutamiento para componer varios modelos en una sola llamada, y fusión de modelos para decisiones que merecen más de una opinión. Esa es la mitad de un agente de voz que se beneficia de poder intercambiarse, y es la mitad que puedes cambiar sin tocar el modelo que mantiene la conversación.
¿Cuál elegir?
Elige Grok Voice Think Fast 2.0 este trimestre. Está disponible, cuenta con evaluaciones independientes, ocupa el primer lugar en la evaluación agéntica que predice si tu agente puede hacer algo útil, y 0,70 segundos hasta el primer audio es una cifra sobre la que puedes construir una experiencia de usuario. Presupuesta el aumento de precio del 60 % respecto a 1.0 y fija la versión de tu modelo.
Elige Realtime-Venus solo si la restricción es la propiedad. Si tu despliegue no puede llamar a una API externa, si necesitas afinar el front end conversacional, o si necesitas la cámara — esos tres casos son todo el caso, y son sólidos cuando se aplican.
Lo que no debería decidirlo es la tabla de benchmark, porque sus dos lados fueron producidos por personas diferentes en condiciones diferentes. Los números de Grok Voice Think Fast 2.0 los midió otra persona. Los de Realtime-Venus, no. Hasta que eso cambie, la comparación que realmente está disponible es entre un producto y un artículo.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
