Tarjeta principal de título para 'GPT-Live-1 vs VoxCPM2', con el subtítulo 'Una conversación alquilada o una GPU propia', con una insignia que dice 'Uno es dúplex completo, el otro es texto a voz: trabajos distintos' y tres tarjetas: 'GPT-Live-1 — 0,05 $ por minuto de voz, solo API, nada que instalar', 'VoxCPM2 — Apache-2.0, 2 mil millones de parámetros, ~8 GB de VRAM, ningún proveedor de inferencia lo despliega' y 'Rendimiento de autoalojamiento — unas 7,7 horas de audio por hora de GPU con RTF 0,13, 393.079 descargas en los últimos 30 días', sobre una franja de pie de página que dice 'Los benchmarks de VoxCPM2 son reportados por OpenBMB; las cifras de voz de GPT-Live-1 son reportadas por OpenAI y no han sido reproducidas.' El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Engineering & Research

GPT-Live-1 vs VoxCPM2: uno cuesta $0.05 por minuto, el otro cuesta una GPU de 24 GB

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La forma más clara de comparar GPT-Live-1 con VoxCPM2 es darse cuenta de que solo parecen competidores hasta que se le pone un número al hardware. GPT-Live-1 es el modelo de voz full-duplex de OpenAI, disponible en la API desde el 10 de septiembre de 2026 a $0.05 por minuto de voz y sin nada que instalar. VoxCPM2 es el modelo de texto a voz de pesos abiertos de 2000 millones de parámetros de OpenBMB, publicado bajo Apache 2.0 en abril de 2026, que se ejecuta con unos 8 GB de VRAM y no lo despliega ningún proveedor de inferencia; así que, si lo quieres, la máquina es tuya. Uno es una conversación que alquilas por segundos; el otro es un sintetizador que tú operas. La cuestión no es cuál es mejor, sino cuál puede absorber realmente tu carga de trabajo.

A two-column scoreboard titled 'GPT-Live-1 vs VoxCPM2 - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Access: hosted API, no weights', 'Price: $0.05 per voice minute', 'Independent score: 69.8% on the AA Speech to Speech Index', 'Hardware you need: none', 'Catch: delegated reasoning bills separately'. Right column VoxCPM2: 'Job: text-to-speech', 'Access: Apache-2.0 weights, self-host only', 'Price: $0 per call plus a GPU', 'Independent score: none, OpenBMB benchmarks only and contested by third-party runs', 'Hardware you need: ~8 GB VRAM, 22 GB peak when serving', 'Catch: no inference provider deploys it'. Footer: 'GPT-Live-1 voice figures OpenAI-reported; VoxCPM2 figures are the model card's own.'

Dos modelos, dos trabajos, una línea de especificaciones honesta cada uno

• Función — GPT-Live-1 mantiene una conversación: escucha y habla simultáneamente, toma turnos, gestiona interrupciones y señales de retroalimentación, y devuelve transcripciones. VoxCPM2 convierte texto en voz. Nunca oye nada.

• Acceso — GPT-Live-1 está alojado y es cerrado, con un único ID de modelo detrás del endpoint Live Sessions, y el ejemplo de integración publicado se ejecuta sobre WebRTC. VoxCPM2 es un checkpoint descargable en Hugging Face y ModelScope, Apache 2.0, gratuito para uso comercial.

• Precio — GPT-Live-1 cuesta $0,05 por minuto de voz, con cobro por segundo, y el backend de delegación se factura por separado. VoxCPM2 cuesta $0 por llamada más una GPU, y el alojamiento de código abierto constituye todo el modelo de costos.

• Huella — GPT-Live-1 no necesita hardware tuyo. VoxCPM2 necesita aproximadamente 8 GB de VRAM (6–8 GB en Q4), Python 3.10+, PyTorch 2.5+ y CUDA 12+.

• Puntos de referencia — cada cifra de voz de GPT-Live-1 es de Ope​nAI, no reproducida; el único panel independiente lo sitúa en séptimo lugar de once. Las cifras publicadas de VoxCPM2 son de OpenBMB, y las mediciones independientes que existen sobre sus afirmaciones multilingües apuntan en sentido contrario.

La cuestión de los 24 GB, con precio

Las cifras de servicio de VoxCPM2 son las que deciden si el autoalojamiento es un pasatiempo o una arquitectura. En una sola RTX 4090, el modelo se ejecuta con un factor de tiempo real de aproximadamente 0,30 en PyTorch puro y de aproximadamente 0,13 con la ruta Nano-VLLM, lo que significa aproximadamente 7,7 horas de audio generado por hora de tiempo de GPU en la configuración más rápida. Esas son las propias cifras de la tarjeta del modelo, no una medición externa; una receta de servicio independiente validada en una 4090 con CUDA 12.9 reporta factores de tiempo real en régimen estacionario de aproximadamente 0,120 para síntesis zero-shot y 0,139 para clonación, con un pico de memoria GPU cercano a 22 GB de 24 GB. Ambos conjuntos son de régimen estacionario, no de arranque en frío: la primera solicitud en un proceso nuevo es mucho más lenta, y esa es la cifra que cita la gente cuando dice que el modelo es inutilizable.

Pon eso junto a la API. GPT-Live-1 a $0.05 el minuto son $3.00 por una hora de conversación continua. Una tarjeta de 24 GB alquilada en el mercado abierto se sitúa en unos pocos dólares por hora, y poseer una se amortiza a algo similar una vez contabilizada la utilización. Así que la comparación acaba donde suelen acabar estas comparaciones, con una asimetría incómoda: la factura de la GPU llega tanto si alguien habla con tu producto como si no, mientras que la factura de la API escala a cero en un día tranquilo y a cinco cifras en uno ajetreado. La síntesis por lotes de un catálogo fijo encaja a la perfección con la GPU. Una línea telefónica siempre activa encaja a la perfección con el medidor.

Lo que VoxCPM2 hace que no hace ningún otro abierto.

La razón por la que VoxCPM2 merece tanta atención no es que gane en los benchmarks —en su mayoría no lo hace—, sino que diseña una voz a partir de una descripción textual sin ninguna referencia de audio. Esa es una capacidad genuinamente nueva en pesos abiertos, y cambia el flujo de trabajo para cualquiera que necesite una voz que aún no existe: pruébala en prosa, itera en prosa y solo entonces decide si clonarla. Alrededor de eso, acumula 30 idiomas más nueve dialectos chinos, salida de 48 kHz mediante una etapa de superresolución integrada, y ajuste fino con tan solo 5 a 10 minutos de audio.

La base de evidencia es más débil que la lista de características. El propio informe de OpenBMB indica una tasa de error de palabras en inglés del 1,84% y una tasa de error de caracteres en chino del 0,97%, y un error promedio del 1,68% en 30 idiomas, medido en su propio conjunto de 500 enunciados por idioma y puntuado por el modelo de otro proveedor. Donde existe una prueba independiente, la diferencia es grande: en el conjunto de pruebas multilingüe de MiniM​ax puntuado con Whisper-large-v3, el hindi obtiene 19,70 y el árabe 13,05 — varias veces peor que las cifras autoinformadas. OpenBMB también advierte que el diseño de voz y el control de estilo producen resultados variables entre ejecuciones y sugiere generar de una a tres veces para obtener el resultado deseado, lo cual es una forma silenciosa de decir que el costo por llamada de un resultado utilizable no es una sola llamada.

El impuesto de integración que nadie incluye en la comparación

Un detalle poco glamuroso decide si VoxCPM2 supone una semana de trabajo o un mes. Su repositorio de Hugging Face está etiquetado voxcpmen lugar de transformers, lo que significa que la biblioteca con la que carga casi todo lo demás de ese sitio no puede cargar este modelo. La solicitud de extracción para corregirlo se abrió el 4 de agosto de 2026 y aún no se había fusionado la última vez que lo comprobamos. Las solicitudes de extracción para añadirlo a otras pilas de servicio sí se han fusionado, y su adopción no está en duda: 393.079 descargas en los últimos treinta días en el momento de esta captura, con 27 adaptadores, 30 ajustes finos, 12 cuantizaciones y 100 Spaces construidos sobre el checkpoint.

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, captured September 2026: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data', with 1.6k likes, 4.95k followers, 393,079 downloads last month, 2B params in BF16, 27 adapter models, 30 finetunes, 12 quantisations, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

El impuesto equivalente de GPT-Live-1 es una reescritura del transporte. Sus sesiones se construyen en torno a una conexión en vivo en lugar de un endpoint de audio de solicitud-respuesta, y la facturación de dos medidores significa que cada llamada de razonamiento delegada, invocación de herramienta y búsqueda web se cobra a las tarifas propias del modelo de backend además del minuto de voz. Los equipos que migran desde una integración en tiempo real medida por tokens deberían presupuestar el cambio como una tarea de ingeniería, no como un simple cambio de ID de modelo.

Cuándo una capa de enrutamiento realmente ayuda

OrcaRouter no incluye ni GPT-Live-1 ni VoxCPM2, y vale la pena decirlo claramente en lugar de dejar que el resto de esta sección implique lo contrario. La capa de voz de GPT-Live-1 está detrás del propio endpoint de Ope​nAI; VoxCPM2 no tiene ningún proveedor alojado en absoluto. Ninguno de los dos se puede llamar con nuestra clave.

La razón por la que la pregunta sobre el enrutamiento sigue surgiendo es que ambos modelos se sitúan en el borde de una canalización cuyo centro es texto. Un despliegue de VoxCPM2 normalmente responde a algo —un generador de guiones, un paso de traducción, un normalizador de texto, un modelo de diálogo que decide qué se dirá a continuación—, y esas son llamadas a modelos corrientes. Una sesión de GPT-Live-1 delega su razonamiento a un modelo de backend indicado en la configuración de la sesión, y en la propia documentación de Ope​nAI ese backend es GPT-5.6 Terra, que está disponible a través de OrcaRouter al precio de lista de Ope​nAI. La delegación del cliente va aún más lejos, ya que permite que tu propia aplicación proporcione el backend, lo que significa que el modelo que hay detrás de la voz puede ser cualquier endpoint que controles. Alrededor de 190 modelos de once proveedores upstream se encuentran detrás de una única clave a precio de lista y sin margen añadido —de modo que cuando un proveedor recorta un precio, la rebaja está activa aquí el mismo día en lugar de en la renovación—, con conmutación automática por error entre proveedores y un DSL de enrutamiento para componer varios modelos en una sola llamada. Un seguro barato para la mitad del stack que cambia con más frecuencia.

Una advertencia debe ir en esta sección en lugar de quedar enterrada en ella, porque es el detalle que hace que la parte de GPT-Live-1 en esta comparación esté menos resuelta de lo que sugieren los benchmarks de su proveedor. En el índice independiente Artificial Analysis Speech to Speech Index, GPT-Live-1 obtiene un 69,8 % —séptimo de once—, por detrás de GPT-Realtime-2.1 con un 73,9 % y de Grok Voice Think Fast 2.0 con un 79,0 %. El modelo es el más barato de esa tabla por hora de audio de entrada, a 4,42 $, y no es el mejor. Contempla la posibilidad de que la capa de voz que adoptes como estándar no sea la que conserves.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with a cost chart placing GPT-Live-1 at $4.42 and GPT-Realtime-2.1 at $10.75 per hour of input audio.

¿Cuál, para qué?

Elige VoxCPM2 si el texto existe antes de que exista el audio. Narración, audiolibros, doblaje, accesibilidad, líneas de voz para videojuegos, un producto que necesita una voz que nadie ha grabado aún — y, en especial, cualquier carga de trabajo en la que el volumen sea alto, predecible y justifique un coste de capital fijo. Acepta que lo ejecutarás tú mismo, que las herramientas que lo rodean aún se están asentando y que las afirmaciones sobre la calidad multilingüe merecen tu propia prueba de escucha antes de que lleguen a un cliente.

Usa GPT-Live-1 si hay una persona al otro lado. Agentes de voz, soporte telefónico, flujos de admisión, cualquier cosa donde el modelo tenga que decidir en tiempo real si la persona terminó de hablar. Paga la tarifa por minuto por el privilegio de no ser dueño del problema, y presupuesta el backend delegado como una partida separada, porque ahí es donde la llamada se vuelve barata o cara.

El error es tratarlos como alternativas en una comparación cara a cara. Son dos capas del mismo producto para la mayoría de los equipos que necesitan ambos, y la única respuesta realmente incorrecta es elegir la autoalojada porque la licencia dice gratis sin calcular el costo de la GPU que lo hace realidad.