Una tarjeta de título principal que dice 'GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B' con el subtítulo 'Una factura por minuto o una GPU de 80 GB' y la línea '$0.05 por minuto frente a un acelerador de 80 GB', sobre dos paneles: el izquierdo muestra el contorno de una nube con un dial de medición y un icono de moneda, el derecho muestra una placa aceleradora de servidor con un icono de chip y la etiqueta '80 GB VRAM', con el logotipo de OrcaRouter compuesto en la esquina.
Guides & Insights

GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B: ¿Una factura por minuto o una GPU de 80 GB?

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La elección entre GPT-Live-1 y NVIDIA Nemotron VoiceChat 11B no es una elección entre dos modelos de voz. Es una elección entre dos modelos de negocio disfrazados de modelos de voz. GPT-Live-1 es una API alojada que OpenAI puso a disposición de los desarrolladores el 10 de septiembre de 2026, facturada a 0,05 USD por minuto de audio sin que intervenga ningún hardware tuyo. NVIDIA Nemotron VoiceChat 11B —publicado como NVIDIA-NemotronLabs-VoiceChat-11B, con un contenedor NGC fechado el 21 de julio de 2026 y un checkpoint de Hugging Face junto a él— es un modelo de voz full-duplex de pesos abiertos y 11 mil millones de parámetros que no funcionará en nada que no sea una GPU de 80 GB. Uno de estos te cuesta dinero por cada minuto de conversación; el otro te cuesta dinero haya o no alguien que llame.

El punto de equilibrio es más simple de lo que sugieren las presentaciones de los proveedores

Empieza por el único número en el que ambas partes coinciden. GPT-Live-1 a $0.05 por minuto son $3.00 por una hora de línea abierta continua. Ese es el precio de una conversación de voz siempre activa.

Ahora, pongámosle precio a la alternativa. Nemotron VoiceChat 11B necesita una GPU con al menos 80 GB de VRAM —una A100, H100, H200, B100, B200 o una tarjeta de la clase RTX 6000, en Linux—. Alquilar una de esas en el mercado abierto cuesta unos pocos dólares por hora, y poseer una se amortiza hasta una cifra similar una vez que se tiene en cuenta la utilización. Así que una única línea de voz siempre activa viene a salir más o menos igual: la GPU alquilada cuesta aproximadamente lo que cuesta la API, antes de haber pagado nada para que se ejecute en ella.

Esa es la comparación incorrecta, y es donde se detienen la mayoría de los análisis de construir frente a comprar. La comparación correcta es por GPU, no por línea, y depende de una cifra que NVIDIA no ha publicado.

• GPT-Live-1 en una cuenta Tier 1 — 25 sesiones simultáneas, lo que equivale a $1.25 por minuto, o $75 por hora, cuando las 25 líneas están activas

• Nemotron VoiceChat 11B en una GPU de 80 GB — tantas sesiones concurrentes como quepan en 80 GB para un modelo híbrido Mamba/Transformer de 11B, a aproximadamente el costo de alquiler de la tarjeta

Un modelo 11B en un acelerador de 80 GB deja mucho margen, y 80 GB es un requisito que, en la práctica, aporta una gran capacidad de batching. Si una tarjeta atiende incluso seis conversaciones concurrentes, el autoalojamiento es drásticamente más barato que la API a plena carga. Si atiende una y media, no lo es. Hasta que alguien mida la concurrencia con tráfico real, la postura honesta es que es probable que el punto de equilibrio favorezca el autoalojamiento en volumen y que ninguno de los proveedores te ha dado la cifra para demostrarlo.

A two-column comparison scoreboard titled 'GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B - the scoreboard'. The GPT-Live-1 column lists Shape hosted API; Cost $0.05 / minute; Turn-taking 0.8 s, vendor-reported; Voices 12; Tool calling delegated to backend model; Ops burden none, vendor runs it. The Nemotron VoiceChat 11B column lists Shape open weights; Cost one 80 GB GPU, billed while idle; Turn-taking 448 ms on Full-Duplex-Bench 1.0; Voices 1 fixed voice, Aria; Tool calling in-session, separate output channel; Ops burden you run the GPU on Linux. A footer reads 'Nemotron turn-taking figure is a published benchmark; GPT-Live-1 latency is OpenAI's own and unreproduced.'

Donde el modelo abierto es genuinamente mejor, no solo más barato

La comparación de latencia merece más cuidado que la de precio, porque en este eje el modelo abierto cuenta con mejor evidencia.

• Latencia de alternancia de turnos — Nemotron VoiceChat 11B reporta 448 ms para una alternancia de turnos fluida en Full-Duplex-Bench 1.0, con 480 ms de latencia de interrupción y cesión y una tasa de toma de control por interrupción del usuario de 1,00. La cifra de GPT-Live-1 es de 0,8 segundos, frente a 1,4, según OpenAI.

Lee esos dos números uno junto al otro con las fuentes adjuntas y el panorama se invierte. Las cifras de NVIDIA proceden de una suite de benchmarks publicada y especificada públicamente. Las de Ope​nAI proceden de Ope​nAI, que compara su nuevo modelo con su propia generación anterior, y no han sido reproducidas de forma independiente. Con la evidencia disponible, el modelo de pesos abiertos es mensurablemente más rápido en aquello que hace que un agente de voz parezca humano, y el modelo alojado es más rápido solo según sus propios materiales de prensa.

NVIDIA también afirma una primicia: Nemotron VoiceChat 11B se describe como el primer modelo abierto full-duplex que admite el llamado de herramientas en tiempo real durante la conversación, utilizando un canal de salida independiente y frases de espera predefinidas para que el agente pueda seguir hablando mientras espera una API externa. La ficha del modelo incluye tres muestras de audio que te invitan a escuchar exactamente eso: turnos de conversación naturales descritos como una respuesta de aproximadamente 450 ms, interrupciones en las que el modelo cede al instante y herramientas invocadas en vivo a mitad de la conversación. Esas muestras son del proveedor y corroboran la cifra de 448 ms en lugar de verificarla de forma independiente, pero al menos son evidencia audible adjunta a un checkpoint descargable y no un número en una publicación de lanzamiento. Ese es el mismo problema arquitectónico que GPT-Live-1 resuelve mediante delegación, respondido de otra manera: el modelo abierto mantiene la línea por sí mismo; el modelo alojado delega la tarea a un modelo de razonamiento independiente y deja que la capa de voz mantenga viva la conversación.

Las similitudes son tan instructivas como las diferencias. Ambos hacen dúplex completo, lo que significa que ambos escuchan mientras hablan en lugar de tomar turnos. Ambos admiten interrupción y barge-in. Ambos se entrenaron con habla a una escala que hace que las antiguas canalizaciones en cascada de ASR, luego LLM y luego TTS parezcan tres productos separados atornillados entre sí — el checkpoint de NVIDIA vio aproximadamente 550.000 horas de habla.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-VoiceChat-11B, showing the openmdw-1.1 license tag, a model size of 11B params, 3,630 downloads last month, an inference-providers row stating the model isn't deployed by any Inference Provider, a model tree descending from NVIDIA-Nemotron-Nano-12B-v2-Base, three audio samples labelled natural turn-taking at roughly 450 ms response, barge-in where the model yields instantly, and tool calling live, and the description that NVIDIA NemotronLabs VoiceChat is an 11B end-to-end real-time speech full duplex model and the first open full-duplex model to support tool calling.

Lo que sacrificas, y no es solo dinero

Lo primero a lo que renuncias con el modelo abierto es la voz. El checkpoint publicado usa una única voz fija, llamada Aria, y no admite clonación de voz ni una biblioteca de voces. GPT-Live-1 incluye doce voces que abarcan distintos acentos, dialectos e idiomas, y OpenAI las remasterizó específicamente para este modelo. Si la voz de tu producto forma parte de su identidad, o si necesitas atender varios mercados con agentes que suenen distintos desde un único despliegue, esto es casi motivo de descarte por sí solo — y es la limitación menos visible en una comparación de especificaciones, porque parece un recuento de funciones y no una decisión de producto.

Lo segundo a lo que renuncias es al techo de contexto. El modelo tiene un límite de enunciado en tiempo de entrenamiento de unos 142 segundos y una limitación práctica para mantener más de aproximadamente dos minutos de contexto de audio. Una llamada telefónica que dura veinte minutos no es un único contexto continuo para este punto de control; es una secuencia de segmentos que el sistema circundante tiene que gestionar. Los modelos alojados normalmente absorben esa gestión por ti.

El tercero es lo que se te permite hacer con él. La tarjeta de modelo de Hugging Face lleva la licencia openmdw-1.1, mientras que parte de la cobertura del lanzamiento lo describió como solo para uso en investigación, y la página del contenedor de NGC presenta los componentes como listos para uso comercial o no comercial. Tres fuentes, tres lecturas diferentes, y solo el texto de la licencia es el que rige. Esa discrepancia es el tipo de cosa que sale a la luz en una revisión legal tres semanas antes del lanzamiento. Resuélvela antes de construir, no después.

El cuarto es operaciones. Una GPU de 80 GB no es una partida que puedas apagar un domingo tranquilo: incluso con cero tráfico, sigues pagando por la tarjeta, y tú asumes la curva de escalado, las actualizaciones de controladores, la planificación de capacidad y la rotación de guardias para una ruta de audio en tiempo real en la que una conexión caída es un cliente perdido. Tampoco hay un respaldo alojado en el que apoyarte mientras llegas hasta ahí —la fila de proveedores de inferencia de la ficha de Hugging Face indica claramente que ningún proveedor de inferencia despliega el modelo, así que no hay una versión de pago por minuto de este checkpoint con la que puedas prototipar. O lo autoalojas, o no lo usas. Ese trabajo es invisible en la comparación por minuto y muy visible en un plan de contratación.

El híbrido que la mayoría de los equipos debería considerar realmente

El enfoque que hace que esta decisión sea manejable es que los dos modelos no tienen que ser una elección binaria. Un agente de voz normalmente tiene una capa de voz y una capa de razonamiento, y la capa de razonamiento es donde está la flexibilidad.

GPT-Live-1 está construido así por diseño. Su capa de voz mantiene viva la conversación mientras el pensamiento se delega, a través de la API de Responses, a un modelo de texto corriente — el propio ejemplo de WebRTC publicado por Ope​nAI conecta ese backend a GPT-5.6 Terra. Esa mitad de tu stack es una llamada de API normal, con precio por token y una elección real de proveedores. GPT-5.6 Terra se sirve a través de OrcaRouter a $2.00 por millón de tokens de entrada y $12.00 por millón de salida, con un contexto de 1M de tokens y tanto /v1/chat/completions como /v1/responses expuestos, junto a unos 190 modelos más accesibles con una sola clave.

Eso importa para un proyecto de autoalojamiento en concreto porque cambia el perfil de riesgo. Si pones en marcha Nemotron VoiceChat 11B y no aguanta tu tráfico, la mitad de voz es un costo de GPU irrecuperable, pero la mitad de razonamiento se puede mover, conmutar por error o dividir entre un modelo barato para turnos rutinarios y uno potente para escalamientos sin tocar la ruta de audio en absoluto. La conmutación automática por error entre proveedores upstream es la diferencia entre una tarde mala y un trimestre malo cuando una dependencia de fuente única se cae.

Indica claramente qué está y qué no está disponible, y dónde: ni GPT-Live-1 ni Nemotron VoiceChat 11B son servidos por OrcaRouter. Ambos provienen de su propio origen — el endpoint Live Sessions de OpenAI en un caso, tu propia GPU en el otro. La ventaja del enrutamiento está totalmente aguas abajo del audio.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

¿Sobre cuál construir?

• Elige GPT-Live-1 si quieres lanzar este trimestre, si necesitas más de una voz, si tus conversaciones suelen durar más de dos minutos de contexto continuo, o si el volumen aún no es lo suficientemente alto como para justificar una GPU que factura mientras está inactiva.

• Elige NVIDIA Nemotron VoiceChat 11B si ya usas GPU de 80 GB, si necesitas una alternancia de turnos inferior a 500 ms basada en evidencia y no en afirmaciones, si necesitas que el audio permanezca dentro de tu propia infraestructura por motivos de residencia de datos, o si tienes un volumen de llamadas en el que el medidor por minuto de la API es la línea más grande de la factura.

• Crea un prototipo sobre la API y evalúa el checkpoint con benchmarks. La decisión depende de un número no publicado —sesiones concurrentes por tarjeta de 80 GB— y la única forma de tenerlo es medirlo con la forma de tráfico propia. Eso es una semana de trabajo, y es la diferencia entre una decisión de infraestructura defendible y una conjetura disfrazada de tal.