
Gemini 3.8 TTS vs VoxCPM2: alquilar una voz o ejecutar la propia, en números reales
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
No hay ninguna fila de la tabla de clasificación que ponga Gemini 3.8 Flash TTS y VoxCPM2 uno al lado del otro, y esa ausencia es el dato más útil de esta comparación. Gemini 3.8 Flash TTS es un endpoint alojado con un Elo de 1.260 en el puesto 2 de la Artificial Analysis Provider Voice Arena y una tarifa publicada en tokens. VoxCPM2 es un checkpoint de OpenBMB —2 mil millones de parámetros, Apache 2.0, publicado en abril de 2026— que ningún proveedor de inferencia aloja. No puedes alquilarlo. Lo ejecutas.
Así que la pregunta no es qué modelo suena mejor. Es si tu carga de trabajo se sirve mejor pagando por carácter por las GPUs de otra persona o siendo dueño de las GPUs y pagando por ellas estén trabajando o no. Esa es una cuestión aritmética y, a diferencia de la mayoría de las comparaciones de modelos, tiene una respuesta que puedes calcular antes de comprometerte.

Uno de estos lo alquilas, el otro lo operas
Empieza por lo que cada uno realmente te entrega.
• Acceso — Gemini 3.8 Flash TTS es solo por API, al que se llama a través de la API de Gemini y las superficies de Google nombradas en su anuncio del 23 de septiembre de 2026. VoxCPM2 no tiene ningún endpoint propio en uso de producción ni ningún proveedor de inferencia que lo sirva; el checkpoint es el producto.
• Licencia — VoxCPM2 se distribuye bajo Apache 2.0, que permite el uso comercial sin un acuerdo por separado. Es una licencia genuinamente permisiva, y no es la opción predeterminada para los pesos abiertos de voz, varios de los cuales se distribuyen bajo términos exclusivos para investigación que canalizan el uso comercial a través de una API alojada.
• Tamaño — VoxCPM2 tiene 2000 millones de parámetros y cabe en aproximadamente 8 GB de VRAM a precisión reducida para desarrollo, con un pico de servicio de alrededor de 22 GB en una tarjeta de 24 GB. Google no ha publicado ninguna cifra de parámetros para ninguno de los dos modelos Gemini 3.8 TTS.
• Creación de voces — Gemini 3.8 Flash TTS hace diseño de voz a partir de una descripción escrita, replicación de voz a partir de una muestra de 30 segundos y diálogo de dos hablantes en una sola llamada. VoxCPM2 es un modelo de texto a voz de una sola voz; una conversación son dos ejecuciones empalmadas.
• Puntuación independiente: Flash TTS tiene una. VoxCPM2 no aparece entre las filas clasificadas del Provider Voice Arena capturado el 24 de septiembre de 2026. La ausencia en una tabla no es un veredicto sobre la calidad —normalmente significa que nadie ha inscrito el modelo—, pero sí significa que no hay una cifra de preferencia de terceros que sopesar.

Ese último punto tiene doble filo y merece decirse con claridad en lugar de restarle importancia: si necesitas una señal independiente de calidad antes de comprometerte, solo uno de estos dos la ofrece.
El número que lo decide: el factor de tiempo real
Alojar un modelo de voz en tus propios servidores convierte una factura por carácter en una factura por hora de GPU, y el tipo de cambio entre esas dos unidades es el factor de tiempo real del modelo: cuántos segundos de cómputo se necesitan para producir un segundo de audio.
Las cifras publicadas de VoxCPM2 son 0,30 en PyTorch estándar y 0,13 con Nano-VLLM. Interprétalas como rendimiento, no como latencia: con 0,13, una hora de GPU de tiempo real produce del orden de 7,7 horas de audio terminado. Con 0,30, la misma hora de GPU produce más bien unas 3,3 horas. Esas son las cifras de la propia tarjeta del modelo, medidas por OpenBMB, y son el dato más importante para cualquier decisión de construir frente a comprar en este caso.
De ellos se derivan tres cosas.
• La pila de servicio importa más que el modelo. Pasar de PyTorch simple a Nano-VLLM más que duplica el rendimiento en hardware idéntico. Cualquier modelo de costos construido sobre la cifra de 0.30 sobreestima el costo de autohospedaje en un factor de aproximadamente 2.3.
• La utilización lo es todo. Una GPU alquilada que está inactiva el 90 % del tiempo no es más barata que una API a ningún precio. El punto de equilibrio solo aparece cuando mantienes la tarjeta ocupada.
• El procesamiento por lotes cambia la aritmética de nuevo. El factor de tiempo real se mide por flujo; un servidor que maneja solicitudes concurrentes amortiza el costo fijo entre ellas, que es exactamente el régimen en el que el autoalojamiento empieza a ganar.
Cuánto cuesta una hora de audio, en ambos sentidos
Pon los dos modelos de facturación en el mismo eje. Una hora de audio terminado son 3600 segundos de salida.
En el lado de alquiler, Google factura en tokens en lugar de caracteres: $0.50 por millón de tokens de texto de entrada y $9.00 por millón de tokens de audio de salida hasta el 31 de diciembre de 2026, y luego $18.00; Flash-Lite TTS cuesta $0.50 y $6.00, y luego $12.00. Batch y Flex cuestan $0.25 y $4.50 para Flash TTS, frente a $0.25 y $3.00 para Flash-Lite TTS, y Priority cuesta $0.90 y $16.00. Artificial Analysis normaliza las tarifas estándar a $16.50 y $11.00 por millón de caracteres, que es la conversión del tablero y no una cotización de Google, y es la cifra que debe usarse al comparar con un modelo que factura en caracteres.
Del lado propio no existe ninguna tarifa por carácter. El costo es la hora de GPU, multiplicada por cuantas horas necesites con el rendimiento anterior, más la pila de servicio, más las personas que lo mantienen en funcionamiento. La ventaja de VoxCPM2 es que el costo marginal de la milésima hora es el mismo que el de la primera, y su desventaja es que el costo marginal de la primera hora es una GPU.
Por eso la decisión es inusualmente clara:
• Por debajo de cierto volumen, la API gana, y no hay comparación. Estás pagando una cifra de un solo dígito de dólares por hora de audio frente a un costo de capital, y la tarifa promocional de Google amplía aún más esa brecha hasta el 1 de enero de 2027.
• Por encima de ese volumen, en hardware que ya posee y puede mantener ocupado, el checkpoint con licencia Apache 2.0 gana de forma decisiva — y, a diferencia de un checkpoint con licencia de investigación, nada en la licencia le impide distribuirlo.
• En el medio, la respuesta honesta es que estás comprando opcionalidad en lugar de ahorros. El autoalojamiento te da la capacidad de fijar una versión, mantener el audio en tu propia infraestructura y dejar de preocuparte por el cambio de tarifas de un proveedor.
Donde cada uno es la respuesta correcta
Elige Gemini 3.8 Flash TTS cuando quieras el producto mejor documentado. Tiene una puntuación independiente, un precio publicado, diálogo de dos voces en una sola llamada, diseño y replicación de voz, y ninguna superficie operativa más allá de una clave de API. Su hermano Flash-Lite TTS te ofrece un segundo punto de precio dentro de la misma interfaz a un precio normalizado de $11.00 por millón de caracteres. Lo que aceptas a cambio es una tarifa que se duplica el 1 de enero de 2027 y la imposibilidad de ejecutar el modelo en ningún sitio.
Elige VoxCPM2 cuando el trabajo operativo sea lo que importa. Apache 2.0 significa que el uso comercial está permitido sin más, el tamaño de 2B significa que basta con un solo acelerador, y el factor de tiempo real de 0.13 bajo Nano-VLLM significa que una tarjeta modesta produce varias horas de audio por cada hora de reloj. Lo que aceptas es que nadie más lo va a ejecutar por ti: sin endpoint alojado, sin fila en la arena, sin tarjeta de tarifas de proveedor, y cada garantía de calidad que obtengas es una que construyes y mides tú mismo.

Ninguno de los dos modelos está alojado por OrcaRouter, y vale la pena decirlo directamente en lugar de insinuar lo contrario. El lugar para llamar a Gemini 3.8 Flash TTS es la propia API de Google y las superficies que Google nombró; VoxCPM2 es un checkpoint que despliegas tú mismo. Lo que cubre OrcaRouter es la capa por encima de esa decisión — más de 200 modelos detrás de una sola clave a precio de lista del proveedor sin margen adicional, de modo que un cambio en el precio de un proveedor se aplica en nuestro lado el mismo día en lugar de en el siguiente ciclo de facturación, conmutación automática por fallo para que un modelo en evaluación nunca tenga que ser una dependencia de producción, y un DSL de enrutamiento que compone varios modelos en una sola llamada cuando una sola voz no cubre todo el trabajo.
Qué ver a continuación
Dos cosas cambiarían esta comparación de manera sustancial, y ninguna ha ocurrido todavía.
El primero es que alguien aloje VoxCPM2. Su ausencia en el mercado de inferencia es la razón principal por la que los dos modelos se comparan en términos económicos y no de calidad; si un proveedor lo adopta, la aritmética de alquilar frente a poseer deja de ser el factor decisivo y la fila ausente en la arena pasa a ser la que uno quiere que se rellene.
El segundo es el cambio de tarifas de enero por parte de Google. Con la tarifa promocional, la API es lo bastante barata como para que la mayoría de las cargas de trabajo no deba alojar nada por su cuenta; con la tarifa posterior al periodo promocional, la diferencia se reduce hasta el punto de que un equipo con capacidad de GPU ya existente y un volumen constante debería rehacer los cálculos en lugar de dar por sentado que la API sigue ganando.
Hasta que uno de esos factores cambie, el dato decisivo no es una tabla de clasificación. Es cuántas horas de audio produces al mes y si la tarjeta está ocupada.
