
GPT-Live-1 lidera el índice de voz a voz con 81,5 — pero el ranking pertenece a su backend
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GPT-Live-1, el modelo de voz dúplex completo que se lanzó por primera vez dentro de ChatGPT el 8 de julio de 2026, ahora ocupa el primer puesto en el Artificial Analysis Speech to Speech Index con 81.5 — una fila que existe solo porque el modelo apuntaba a GPT-6 Astra para hacer su razonamiento. Si ejecutas el mismo front end de voz con GPT-5.6 Sol como backend delegado con bajo esfuerzo de razonamiento, obtiene 80.1, lo que lo sitúa en tercer lugar. El segundo puesto, con 81.3, pertenece a Grok Voice Think Fast 2.0 High.
Dos aclaraciones honestas antes de los números. El modelo no es nuevo: GPT-Live-1 llegó a la API para desarrolladores el 10 de septiembre de 2026, tras dos meses como la voz predeterminada de ChatGPT. Lo que sí es nuevo, medido el 15 de septiembre, es que un evaluador externo lo ha puntuado, lo único que faltaba en todos los análisis de este modelo hasta ahora, incluido el nuestro, donde las únicas cifras disponibles eran las que OpenAI publicó sobre sí misma. Y el margen de 0,2 puntos sobre el segundo puesto es menor que la diferencia de 1,4 puntos entre las dos configuraciones del propio GPT-Live-1, que es la cifra más útil de la tabla.
Así que el titular «GPT-Live-1 es el mejor modelo de voz» no es exactamente lo que dice el índice. Dice que GPT-Live-1 con GPT-6 Astra en esfuerzo medio lo es, por una quinta parte de un punto, y que la elección de backend influye en el resultado más que cualquier modelo competidor.
Lo que el índice realmente mide
Artificial Analysis construye el Speech to Speech Index como un compuesto de igual ponderación de cuatro partes: Speech Reasoning, medido por Big Bench Audio; Agentic Performance, medido por τ-Voice; Arena Preference, un Elo de preferencia humana por pares; y Task Success Rate. Solo los modelos que tienen los cuatro componentes disponibles obtienen un valor de índice; todo lo demás muestra un guion, y por eso la tabla tiene muchas más filas que puntuaciones. El propio índice se lanzó el 23 de junio de 2026 y se ha revisado dos veces desde entonces, la más reciente para sustituir Conversational Dynamics por Task Success, por lo que una puntuación de una revisión no es estrictamente comparable con una puntuación de otra.
Dos detalles metodológicos adicionales importan cuando se lee la clasificación. El Elo de Arena queda congelado en el valor que tenía cuando un modelo se volvió publicable por primera vez, así que el componente de preferencia premia llegar pronto en lugar de ser el mejor hoy. Y el índice puntúa un sistema completo en vez de un solo modelo: en el caso de GPT-Live-1, la cifra abarca la interfaz de voz más el modelo de backend al que derive el trabajo. Es una decisión de diseño deliberada, y es la razón por la que el mismo modelo aparece dos veces con puntuaciones diferentes.
La cima del campo, tal como se publicó:
• GPT-Live-1 (Astra, medium) — índice 81.5, primero
• Grok Voice Think Fast 2.0 High — índice 81,3, segundo
• GPT-Live-1 (Sol, low) — índice 80.1, tercero
• GPT-Realtime-2.1 High — índice 73.9, cuarto
• GPT-Realtime-2 High — índice 73.6, quinto
• Grok Voice Think Fast 1.0 — índice 72,3, sexto
• Gemini 3.1 Flash Live High — índice 71.5, séptimo

Para ponerlo en perspectiva, el modelo al que reemplaza GPT-Live-1 se sitúa 7,6 puntos por debajo de él. Es una verdadera brecha generacional, y no está en disputa.
La victoria por 0.2 puntos proviene de exactamente un componente.
Separa el compuesto y los dos líderes dejan de parecer el mismo tipo de modelo. En cuanto a los componentes, según Artificial Analysis:
• Rendimiento agéntico (τ-Voice) — GPT-Live-1 67,9 % vs Grok Voice Think Fast 2.0 High 56,5 %
• Razonamiento del habla (Big Bench Audio) — 90 % vs 97 %
• Tasa de éxito de tareas — 87,4 % vs 94,6 %
• Arena Elo — 1048 vs 1011
• Tiempo hasta el primer audio — 1.34s vs 0.70s
• Costo por hora, backend incluido — $5,83 vs $4,80

GPT-Live-1 gana dos de seis líneas y pierde cuatro, pero aun así se lleva el índice. La aritmética no es ningún misterio: la brecha de τ-Voice es de 11.4 puntos, mucho mayor que cualquier otra separación en la tabla, y con igual ponderación arrastra la puntuación compuesta más allá de la línea. En términos sencillos, GPT-Live-1 es el mejor agente y Grok Voice Think Fast 2.0 High es el mejor oyente y el más rápido, y resulta que el índice pondera lo que GPT-Live-1 hace bien lo suficientemente fuerte como para ponerlo en primer lugar.
Si tu producto es un agente de voz que reserva, resuelve o realiza transacciones, la ventaja de 11,4 puntos en τ-Voice es la cifra que predice tu experiencia. Si tu producto es una conversación que tiene que sentirse instantánea y nunca hablar por encima del usuario, el tiempo de 0,70 segundos hasta el primer audio es la cifra que predice tu experiencia, y Grok lo gana por aproximadamente un factor de dos. En la ejecución de tareas reguladas hay una segunda advertencia: la tasa de éxito en tareas del 94,6 % de Grok es la más alta de la tabla visible, y el 87,4 % de GPT-Live-1 significa que aproximadamente una de cada ocho tareas no se completa. Ambos representan mejoras respecto a la generación anterior. Ninguno de los dos es un problema resuelto.
La fila n.º 1 es una configuración de enrutamiento, no un modelo
Esta es la parte que merece más atención que la posición en la clasificación. GPT-Live-1 es una capa de voz full-duplex que se encarga por sí misma de escuchar, hablar, las interrupciones y la toma de turnos, y delega el razonamiento, las llamadas a herramientas y la búsqueda a un modelo de backend independiente mientras la conversación continúa. Artificial Analysis puntuó dos de esos emparejamientos como entradas separadas. Astra con esfuerzo medio produjo 81,5. Sol con esfuerzo bajo produjo 80,1.
Esa diferencia de 1,4 puntos es la historia. La brecha entre el primer y el segundo puesto es de 0,2 puntos. La brecha entre las dos configuraciones puntuadas de GPT-Live-1 es siete veces mayor. Nada del modelo de voz cambió entre esas filas: solo qué modelo hacía el razonamiento y con qué nivel de esfuerzo. Una tabla de clasificación que clasifica sistemas te está diciendo, con precisión, que la configuración es el producto.
También revisa nuestros propios informes. El 11 de septiembre de 2026 registramos GPT-Live-1 con un 69,8 % en este índice, por detrás tanto de GPT-Realtime-2.1 como de Grok. Esa era la lectura disponible en ese momento, y respaldaba una conclusión razonable: que OpenAI había construido la mejor mecánica conversacional y no el mejor agente de voz. El índice ahora incluye dos configuraciones delegadas de GPT-Live-1 con 81,5 y 80,1. Artificial Analysis no publica un registro de cambios, y revisó los componentes del índice en agosto, así que no podemos decir con certeza si la cifra anterior era una configuración no puntuada o parcialmente puntuada, o una ejecución bajo la ponderación anterior; lo que es observable es que los emparejamientos delegados ahora aparecen como sus propias filas completas, y que la respuesta cambió cuando estos lo hicieron.
La consecuencia práctica es que «qué modelo de voz» es la pregunta equivocada y «qué modelo de voz más qué backend, con qué nivel de esfuerzo» es la correcta. Esa es una cuestión de enrutamiento, y es precisamente la que nuestro propio producto existe para responder. OrcaRouter expone el backend de delegación de GPT-Live-1, GPT-6 Astra, a través del mismo endpoint compatible con OpenAI que otros más de 200 modelos, por lo que cambiar la capa de razonamiento es un cambio de ID de modelo y no una integración. DSL de enrutamiento combina varios modelos en una sola llamada, y la conmutación por error automática hace que una combinación no probada no sea una apuesta de producción: si el backend se degrada, la solicitud acaba en otro sitio en lugar de fallar. Para ser precisos sobre lo que no hacemos: GPT-Live-1 en sí no está en nuestro catálogo y no lo servimos. El backend al que delega es otro asunto.
Lo que cuesta una hora de esto
El front end de GPT-Live-1 se factura a $0.05 por minuto de voz, cobrado por segundo, lo que equivale a $3.00 por una hora de línea abierta. Esa no es la factura completa: el razonamiento delegado, las llamadas a herramientas y la búsqueda web se miden por separado según lo que cobre el modelo de backend. Artificial Analysis midió la cifra total, por lo que su columna de costos es la que hay que usar:
• GPT-Live-1 (Sol, low) — $4.47 por hora
• Grok Voice Think Fast 2.0 High — $4.80 por hora
• GPT-Live-1 (Astra, medio) — $5.83 por hora
• GPT-Realtime-2.1 High — $10.75 por hora
El ganador del ranking es la opción más cara de las tres actuales, y la configuración que ganó cuesta un 30 % más por hora que la configuración que quedó en tercer lugar. Leído al revés, el desglose es revelador: $3.00 de cada hora corresponden a la capa de voz, y el resto —$1.47 en Sol, $2.83 en Astra— son tokens de backend. La capa de pensamiento representa entre un tercio y la mitad de tu factura, lo cual es una proporción grande para un componente que la tabla de clasificación trata como una nota al pie.

Frente al modelo al que reemplaza, no obstante, toda la familia cuesta aproximadamente la mitad: el front end de $0.05 por minuto es un recorte genuino, no un reempaquetado. Como los tokens de backend se facturan a tarifas de backend, el costo de una implementación de GPT-Live-1 depende en gran medida del modelo de razonamiento al que enrutes, y los backends pueden ser modelos propios de OpenAI o modelos de terceros. En OrcaRouter, esos backends se pasan a precio de lista del proveedor con 0 % de margen, así que un cambio de precio del proveedor en la capa de razonamiento se aplica el mismo día, en lugar de en el siguiente ciclo de facturación.
Lo que el índice no resuelve
Tres salvedades, declaradas por la fuente y no inferidas. Tanto las entradas de GPT-Live-1 como Grok Voice Think Fast 2.0 High están marcadas como basadas en un único ensayo, lo cual es poco sólido para una decisión de 0,2 puntos: una nueva ejecución podría reordenar el primer y el segundo puesto sin que cambiara nada en ninguno de los dos modelos. Arena Elo, como se indicó, se congeló en la primera medición publicable de cada modelo. Y el índice no tiene ninguna entrada sobre cómo se comportan estos sistemas en una llamada larga: los componentes son de horizonte corto por construcción, mientras que el modo de fallo que realmente mata a los agentes de voz en producción es la deriva a lo largo de una conversación de veinte minutos.
Por separado, y según el proveedor más que según el índice: la API de GPT-Live-1 se lanzó sin entrada de imágenes o video, sin salidas estructuradas y sin nivel gratuito, y sus límites de velocidad se cuentan en sesiones concurrentes en lugar de solicitudes por minuto. Esas son restricciones del día de lanzamiento que puede que ya hayan cambiado; compruébalas antes de diseñar en función de ellas.
Qué hacer con esto
Si esta semana estás eligiendo una arquitectura en lugar de un modelo, el índice premia el patrón delegado en el trabajo agéntico y el patrón en cascada en la latencia. GPT-Live-1 con 81,5 es la evidencia más contundente hasta la fecha de que separar la conversación del razonamiento es la forma correcta para los agentes de voz que completan tareas. Grok Voice Think Fast 2.0 High con 81,3, con 0,70 segundos hasta el primer audio y una tasa de éxito en tareas del 94,6 %, es la evidencia más contundente de que la forma delegada no es la única que funciona —y de que todavía no es la más rápida.
La decisión que se desprende de las cifras es más económica de lo que parece. Ambas configuraciones de GPT-Live-1, y el modelo que lo superó en cuatro de seis componentes, se sitúan dentro de un margen de $1.36 por hora entre sí. Con esa diferencia, lo correcto es dejar de leer tablas de clasificación y pasar tus propias transcripciones por ambos. El índice te dice la forma de la disyuntiva; no puede decirte en qué lado de ella están tus usuarios.
Preguntas que invita el número
¿Es GPT-Live-1 el mejor modelo de voz ahora?
En el compuesto, sí: por 0,2 puntos y con una sola prueba que lo respalde. Por componentes, depende enteramente de lo que estés construyendo: lidera en rendimiento agéntico y preferencia en la arena, y va por detrás en razonamiento del habla, tasa de éxito en tareas y tiempo hasta el primer audio. Una ventaja de 0,2 puntos en el compuesto que se apoya en una única ventaja de 11,4 puntos en un componente es un primer lugar defendible, no decisivo.
¿Tienes que usar GPT-6 Astra para obtener el 81.5?
Para esa fila exacta, sí: el 81.5 pertenece a GPT-Live-1 configurado con Astra con un esfuerzo de razonamiento medio. Sol con esfuerzo bajo es una alternativa documentada con 80.1 y $1.36 por hora más barata, y OpenAI admite traer modelos de terceros como backend, así que las entradas de la tabla de clasificación son dos puntos en una curva en lugar de las únicas opciones. Cuál es la mejor combinación para tu carga de trabajo no es algo que un índice público pueda responder por ti.
¿Por qué el mismo modelo obtuvo una puntuación de 69,8 en nuestra cobertura anterior y de 81,5 ahora?
Las dos cifras abarcan cosas distintas. La lectura anterior situaba GPT-Live-1 en el índice como una única entrada; la tabla actual incluye sus dos configuraciones delegadas como filas separadas y con puntuación completa, con el emparejamiento Astra en 81,5 y el emparejamiento Sol en 80,1. Artificial Analysis revisó los componentes del índice en agosto y no publica un registro de cambios, así que considere el delta como un cambio en lo que se midió, y no como evidencia de que el modelo haya mejorado — y considere cualquier puntuación compuesta única para un modelo delegador como una afirmación sobre una configuración.
