Una tarjeta destacada generada para 'Gemini 3.8 TTS vs VoxCPM2' sobre un fondo blanco con suaves acentos en degradado azul y cian. La tarjeta izquierda, 'Gemini 3.8 Flash TTS', enumera un endpoint de API, Elo 1.260 en la posición 2 y 16,50 $ por 1 M de caracteres normalizados; la tarjeta derecha, 'VoxCPM2', enumera Apache 2.0, 2B parámetros, aproximadamente 8 GB de VRAM para ejecutarse, un factor de tiempo real de 0,30 en PyTorch puro y ningún endpoint alojado. Una línea de pie de página dice: 'Elo según Artificial Analysis Provider Voice Arena, septiembre de 2026; cifras de VoxCPM2 según su model card.' El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Gemini 3.8 TTS vs VoxCPM2: alquilar una voz o ejecutar la propia, en números reales

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

No hay ninguna fila de la tabla de clasificación que ponga Gemini 3.8 Flash TTS y VoxCPM2 uno al lado del otro, y esa ausencia es el dato más útil de esta comparación. Gemini 3.8 Flash TTS es un endpoint alojado con un Elo de 1.260 en el puesto 2 de la Artificial Analysis Provider Voice Arena y una tarifa publicada en tokens. VoxCPM2 es un checkpoint de OpenBMB —2 mil millones de parámetros, Apache 2.0, publicado en abril de 2026— que ningún proveedor de inferencia aloja. No puedes alquilarlo. Lo ejecutas.

Así que la pregunta no es qué modelo suena mejor. Es si tu carga de trabajo se sirve mejor pagando por carácter por las GPUs de otra persona o siendo dueño de las GPUs y pagando por ellas estén trabajando o no. Esa es una cuestión aritmética y, a diferencia de la mayoría de las comparaciones de modelos, tiene una respuesta que puedes calcular antes de comprometerte.

A generated comparison scoreboard for Gemini 3.8 Flash TTS and VoxCPM2, showing access (a hosted API against self-hosted only), size (undisclosed against 2B parameters), licence (vendor terms against Apache 2.0), price ($16.50 per 1M characters against a GPU-hour cost), throughput (not applicable against a real-time factor of 0.13 to 0.30) and independent Elo (1,260 against none).

Uno de estos lo alquilas, el otro lo operas

Empieza por lo que cada uno realmente te entrega.

• Acceso — Gemini 3.8 Flash TTS es solo por API, al que se llama a través de la API de Gemini y las superficies de Google nombradas en su anuncio del 23 de septiembre de 2026. VoxCPM2 no tiene ningún endpoint propio en uso de producción ni ningún proveedor de inferencia que lo sirva; el checkpoint es el producto.

• Licencia — VoxCPM2 se distribuye bajo Apache 2.0, que permite el uso comercial sin un acuerdo por separado. Es una licencia genuinamente permisiva, y no es la opción predeterminada para los pesos abiertos de voz, varios de los cuales se distribuyen bajo términos exclusivos para investigación que canalizan el uso comercial a través de una API alojada.

• Tamaño — VoxCPM2 tiene 2000 millones de parámetros y cabe en aproximadamente 8 GB de VRAM a precisión reducida para desarrollo, con un pico de servicio de alrededor de 22 GB en una tarjeta de 24 GB. Google no ha publicado ninguna cifra de parámetros para ninguno de los dos modelos Gemini 3.8 TTS.

• Creación de voces — Gemini 3.8 Flash TTS hace diseño de voz a partir de una descripción escrita, replicación de voz a partir de una muestra de 30 segundos y diálogo de dos hablantes en una sola llamada. VoxCPM2 es un modelo de texto a voz de una sola voz; una conversación son dos ejecuciones empalmadas.

• Puntuación independiente: Flash TTS tiene una. VoxCPM2 no aparece entre las filas clasificadas del Provider Voice Arena capturado el 24 de septiembre de 2026. La ausencia en una tabla no es un veredicto sobre la calidad —normalmente significa que nadie ha inscrito el modelo—, pero sí significa que no hay una cifra de preferencia de terceros que sopesar.

A screenshot of the Hugging Face model card for OpenBMB/VoxCPM2, showing the Apache 2.0 licence, the 2 billion parameter checkpoint size, the 30-language coverage, 48 kHz output and the 2 million hours of training audio recorded on the card.

Ese último punto tiene doble filo y merece decirse con claridad en lugar de restarle importancia: si necesitas una señal independiente de calidad antes de comprometerte, solo uno de estos dos la ofrece.

El número que lo decide: el factor de tiempo real

Alojar un modelo de voz en tus propios servidores convierte una factura por carácter en una factura por hora de GPU, y el tipo de cambio entre esas dos unidades es el factor de tiempo real del modelo: cuántos segundos de cómputo se necesitan para producir un segundo de audio.

Las cifras publicadas de VoxCPM2 son 0,30 en PyTorch estándar y 0,13 con Nano-VLLM. Interprétalas como rendimiento, no como latencia: con 0,13, una hora de GPU de tiempo real produce del orden de 7,7 horas de audio terminado. Con 0,30, la misma hora de GPU produce más bien unas 3,3 horas. Esas son las cifras de la propia tarjeta del modelo, medidas por OpenBMB, y son el dato más importante para cualquier decisión de construir frente a comprar en este caso.

De ellos se derivan tres cosas.

• La pila de servicio importa más que el modelo. Pasar de PyTorch simple a Nano-VLLM más que duplica el rendimiento en hardware idéntico. Cualquier modelo de costos construido sobre la cifra de 0.30 sobreestima el costo de autohospedaje en un factor de aproximadamente 2.3.

• La utilización lo es todo. Una GPU alquilada que está inactiva el 90 % del tiempo no es más barata que una API a ningún precio. El punto de equilibrio solo aparece cuando mantienes la tarjeta ocupada.

• El procesamiento por lotes cambia la aritmética de nuevo. El factor de tiempo real se mide por flujo; un servidor que maneja solicitudes concurrentes amortiza el costo fijo entre ellas, que es exactamente el régimen en el que el autoalojamiento empieza a ganar.

Cuánto cuesta una hora de audio, en ambos sentidos

Pon los dos modelos de facturación en el mismo eje. Una hora de audio terminado son 3600 segundos de salida.

En el lado de alquiler, Google factura en tokens en lugar de caracteres: $0.50 por millón de tokens de texto de entrada y $9.00 por millón de tokens de audio de salida hasta el 31 de diciembre de 2026, y luego $18.00; Flash-Lite TTS cuesta $0.50 y $6.00, y luego $12.00. Batch y Flex cuestan $0.25 y $4.50 para Flash TTS, frente a $0.25 y $3.00 para Flash-Lite TTS, y Priority cuesta $0.90 y $16.00. Artificial Analysis normaliza las tarifas estándar a $16.50 y $11.00 por millón de caracteres, que es la conversión del tablero y no una cotización de Google, y es la cifra que debe usarse al comparar con un modelo que factura en caracteres.

Del lado propio no existe ninguna tarifa por carácter. El costo es la hora de GPU, multiplicada por cuantas horas necesites con el rendimiento anterior, más la pila de servicio, más las personas que lo mantienen en funcionamiento. La ventaja de VoxCPM2 es que el costo marginal de la milésima hora es el mismo que el de la primera, y su desventaja es que el costo marginal de la primera hora es una GPU.

Por eso la decisión es inusualmente clara:

• Por debajo de cierto volumen, la API gana, y no hay comparación. Estás pagando una cifra de un solo dígito de dólares por hora de audio frente a un costo de capital, y la tarifa promocional de Google amplía aún más esa brecha hasta el 1 de enero de 2027.

• Por encima de ese volumen, en hardware que ya posee y puede mantener ocupado, el checkpoint con licencia Apache 2.0 gana de forma decisiva — y, a diferencia de un checkpoint con licencia de investigación, nada en la licencia le impide distribuirlo.

• En el medio, la respuesta honesta es que estás comprando opcionalidad en lugar de ahorros. El autoalojamiento te da la capacidad de fijar una versión, mantener el audio en tu propia infraestructura y dejar de preocuparte por el cambio de tarifas de un proveedor.

Donde cada uno es la respuesta correcta

Elige Gemini 3.8 Flash TTS cuando quieras el producto mejor documentado. Tiene una puntuación independiente, un precio publicado, diálogo de dos voces en una sola llamada, diseño y replicación de voz, y ninguna superficie operativa más allá de una clave de API. Su hermano Flash-Lite TTS te ofrece un segundo punto de precio dentro de la misma interfaz a un precio normalizado de $11.00 por millón de caracteres. Lo que aceptas a cambio es una tarifa que se duplica el 1 de enero de 2027 y la imposibilidad de ejecutar el modelo en ningún sitio.

Elige VoxCPM2 cuando el trabajo operativo sea lo que importa. Apache 2.0 significa que el uso comercial está permitido sin más, el tamaño de 2B significa que basta con un solo acelerador, y el factor de tiempo real de 0.13 bajo Nano-VLLM significa que una tarjeta modesta produce varias horas de audio por cada hora de reloj. Lo que aceptas es que nadie más lo va a ejecutar por ti: sin endpoint alojado, sin fila en la arena, sin tarjeta de tarifas de proveedor, y cada garantía de calidad que obtengas es una que construyes y mides tú mismo.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, with Gemini 3.8 Flash-Lite TTS at rank 6 and no VoxCPM2 row on the board.

Ninguno de los dos modelos está alojado por OrcaRouter, y vale la pena decirlo directamente en lugar de insinuar lo contrario. El lugar para llamar a Gemini 3.8 Flash TTS es la propia API de Google y las superficies que Google nombró; VoxCPM2 es un checkpoint que despliegas tú mismo. Lo que cubre OrcaRouter es la capa por encima de esa decisión — más de 200 modelos detrás de una sola clave a precio de lista del proveedor sin margen adicional, de modo que un cambio en el precio de un proveedor se aplica en nuestro lado el mismo día en lugar de en el siguiente ciclo de facturación, conmutación automática por fallo para que un modelo en evaluación nunca tenga que ser una dependencia de producción, y un DSL de enrutamiento que compone varios modelos en una sola llamada cuando una sola voz no cubre todo el trabajo.

Qué ver a continuación

Dos cosas cambiarían esta comparación de manera sustancial, y ninguna ha ocurrido todavía.

El primero es que alguien aloje VoxCPM2. Su ausencia en el mercado de inferencia es la razón principal por la que los dos modelos se comparan en términos económicos y no de calidad; si un proveedor lo adopta, la aritmética de alquilar frente a poseer deja de ser el factor decisivo y la fila ausente en la arena pasa a ser la que uno quiere que se rellene.

El segundo es el cambio de tarifas de enero por parte de Google. Con la tarifa promocional, la API es lo bastante barata como para que la mayoría de las cargas de trabajo no deba alojar nada por su cuenta; con la tarifa posterior al periodo promocional, la diferencia se reduce hasta el punto de que un equipo con capacidad de GPU ya existente y un volumen constante debería rehacer los cálculos en lugar de dar por sentado que la API sigue ganando.

Hasta que uno de esos factores cambie, el dato decisivo no es una tabla de clasificación. Es cuántas horas de audio produces al mes y si la tarjeta está ocupada.