
Eleven v4 vs VoxCPM2: Un modelo clasificado frente a un checkpoint que no puedes alquilar
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 982 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 197 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
El dato más útil de esta comparativa es una fila que no existe. ElevenLabs Eleven v4 ocupa el puesto 1 en Provider Voice Arena de Artificial Analysis con un Elo de 1.319 en 1.674 apariciones, a 80,00 $ por millón de caracteres. VoxCPM2, el checkpoint de OpenBMB publicado en abril de 2026, no aparece en ninguna de las dos tablas de voz —ni clasificado, ni sin clasificar, ni como entrada de vista previa. Eso no es un veredicto sobre la calidad. Significa que, cualquiera que sea el número que esperabas comparar con 1.319, nadie lo ha producido, y la comparación tiene que hacerse en función de algo distinto de la preferencia. Lo que queda es la propiedad, el ajuste fino y una cuestión de licencias que un endpoint alojado no te permite plantear.
Lo que cada lado realmente te entrega
Estas son clases diferentes de producto, y la diferencia no es cosmética.
• Acceso — Eleven v4 es un endpoint alojado al que se accede a través de la propia API de ElevenLabs, con facturación por carácter. VoxCPM2 es un checkpoint en Hugging Face bajo openbmb/VoxCPM2; lo descargas y lo ejecutas, y no hay ningún endpoint propio al que llamar.
• Licencia — VoxCPM2 se distribuye bajo Apache 2.0, explícitamente gratuito para uso comercial. Eleven v4 es una API comercial cuyos términos son de ElevenLabs. Esa diferencia importa si tu revisión legal pregunta si puedes hacer fine-tuning, redistribuir o entregar los pesos; con el checkpoint, la respuesta está escrita y es estática.
• Tamaño y hardware — VoxCPM2 tiene 2B de parámetros sobre una base MiniCPM-4 y la tarjeta indica aproximadamente 8 GB de VRAM en bfloat16, con una longitud máxima de secuencia de 8.192 tokens. ElevenLabs no publica un recuento de parámetros para Eleven v4, y la huella de hardware de un modelo alojado no es algo que gestiones.
• Cadena de salida: VoxCPM2 acepta audio de referencia de 16 kHz y emite 48 kHz mediante la superresolución integrada de AudioVAE V2, sin ningún sobremuestreador externo en la ruta. El TTS alojado te entrega un flujo a la tasa que el proveedor haya elegido.
• Puntuación independiente — Eleven v4 tiene una, y está en primer lugar. VoxCPM2 no tiene ninguna. La ausencia no es una puntuación baja; es un modelo sin puntuación, y nunca debería hablarse de los dos en la misma frase como si el segundo fuera un número.

El número que reemplaza al Elo que falta
Si no puedes comparar preferencias, compara lo que sí puedes calcular, y para un modelo autoalojado eso es el rendimiento. La ficha de VoxCPM2 indica un factor de tiempo real de aproximadamente 0.30 en PyTorch estándar sobre una RTX 4090, que baja a aproximadamente 0.13 con Nano-VLLM. El factor de tiempo real son segundos de cómputo por segundo de audio, así que esas dos cifras significan que una hora de GPU produce aproximadamente 3.3 horas de habla finalizada en el primer caso y unas 7.7 horas en el segundo.

Dos consecuencias se derivan de inmediato. La pila de servicio importa más que el modelo: el mismo checkpoint en la misma tarjeta más que duplica su rendimiento cuando cambias el motor de inferencia, así que cualquier modelo de costes que use la cifra de 0,30 está sobreestimando tu coste de autoalojamiento en un factor de aproximadamente 2,3. Y la utilización lo es todo: una tarjeta que permanece inactiva no supera a una API por carácter a ningún precio, porque la factura de la API escala con lo que dices, mientras que la factura de la tarjeta escala con cuándo la compraste.
Por eso, la versión honesta de esta decisión no es «cuál suena mejor». Es «cuántas horas de audio produces al mes, y si el hardware está ocupado». Por debajo del volumen en el que una tarjeta permanece cargada, la API gana, y no por poco. Por encima, en hardware que ya posees, el coste marginal del checkpoint por milésima de hora es el mismo que su coste por la primera hora —y esa es una ventaja estructural que ninguna tarifa puede igualar.
La capacidad que un endpoint alojado no te venderá
Aquí es donde la comparación deja de ser una imagen especular, porque hay algo que VoxCPM2 hace y que Eleven v4 fundamentalmente no puede: puedes reentrenarlo. La ficha del modelo documenta tanto el ajuste fino completo con SFT como el ajuste fino con LoRA con tan solo entre cinco y diez minutos de audio, con un script de entrenamiento y una configuración proporcionados para cada uno.
Eso cambia la forma de un programa de voz. Una API alojada te da un modelo fijo más cualquier clonación que el proveedor exponga —diez segundos de audio de referencia en el caso de Eleven v4 para clones instantáneos, con un nivel profesional por encima—. Un checkpoint ajustable con LoRA te da un modelo que nunca ha visto los datos de nadie más y cuyo comportamiento puedes fijar por versión. Para una voz de marca, un dominio regulado o un idioma que el elenco del proveedor maneja mal, esa es una categoría de solución distinta, no una más barata.
La contrapartida es explícita y vale la pena mencionarla: con VoxCPM2 aceptas que ningún tercero ha puntuado nunca el modelo, que las garantías de calidad son las que tú mismo construyes y mides, y que el límite de secuencia de 8.192 tokens y la advertencia de la propia tarjeta —que el diseño de voz y el control de estilo varían entre ejecuciones y que se recomiendan de una a tres generaciones— ahora son tu problema de control de calidad.
Qué te ofrece Eleven v4 que el checkpoint no puede
A la inversa, las ventajas del modelo alojado son las que aparecen en un calendario de lanzamientos en lugar de en una ficha técnica.
• Una clasificación medida —primera en una tabla con 1.674 muestras que respaldan la estimación, y un intervalo de aproximadamente ±19 puntos a su alrededor. Independientemente de lo que mida esa tabla, es independiente de ambos proveedores y es la única señal de calidad de terceros en esta comparación.
• Dirección de interpretación en el texto — etiquetas de audio en línea como [risas], [susurra] y [dicho con enojo con acento francés], además de indicaciones de locución en lenguaje natural y soporte mejorado para el Alfabeto Fonético Internacional. Conseguir un cambio de estado de ánimo de un modelo autoalojado implica una regeneración o un ajuste fino; aquí es un token en el guion.
• Cobertura que no tiene que verificar —más de 90 idiomas frente a los 30 de VoxCPM2, con la salvedad de que la lista del checkpoint es explícita y con nombres (incluidos los dialectos chinos), mientras que el «más de 90» del proveedor es un recuento sin lista.
• Sin superficie operativa — sin GPU, sin stack de servicio, sin deriva de versiones, y una tarifa promocional de $0,022 por cada 1.000 caracteres hasta el 12 de octubre, frente a una tarifa de lista de $0,08 después.

Ninguno de estos es nuestro, y ese es el punto de esta sección.
OrcaRouter no aloja ninguno de los dos modelos. No hay ningún endpoint de ElevenLabs ni ningún endpoint de VoxCPM2 en nuestro catálogo, y la respuesta honesta de enrutamiento es que se accede a Eleven v4 a través de la propia API de ElevenLabs, mientras que VoxCPM2 es algo que se despliega en tu propio hardware. No vamos a insinuar lo contrario para que una comparación quede más ordenada.
Donde una sola clave sí ayuda es en la decisión previa a la decisión. La razón por la que las conversaciones sobre el autoalojamiento se estancan es que nunca se evalúa la alternativa: una API es una sola llamada y un checkpoint es una pila de servicio, así que la API gana por defecto en lugar de por aritmética. La aportación de OrcaRouter es que la mitad alojada de esa comparación es barata de probar — más de 200 modelos tras una sola clave de API, con los precios de lista de los proveedores trasladados con un 0% de recargo, de modo que la opción alojada se evalúa a su tarifa real y no a una estimada, con conmutación por error automática si colocas un candidato detrás de una ruta activa antes de haber terminado de decidir.
Cómo decidir en una sola pasada
Elige Eleven v4 si la voz tiene que ser buena al primer intento y quieres tenerlo listo esta semana. Obtienes lo más alto de una tabla independiente, una sintaxis de instrucciones documentada, la mayor cantidad documentada de idiomas en esta comparación y cero infraestructura. Pagas $0.08 por cada 1000 caracteres a partir del 13 de octubre, y aceptas que no puedes reentrenarlo, fijar su versión ni mantener el audio en tu propio hardware.
Elige VoxCPM2 si el modelo tiene que ser tuyo. Apache 2.0, 2B de parámetros en unos 8 GB de VRAM, salida de 48 kHz sin upsampler en la cadena, y una ruta de fine-tuning que funciona con entre cinco y diez minutos de audio: son capacidades que un endpoint alojado no ofrece a ningún precio, y la ausencia de una fila en la arena es el costo de tenerlas. Mide los números de throughput en tu propia tarjeta antes de comprometerte, porque los factores de tiempo real de 0.30 y 0.13 son mediciones de la propia ficha del modelo y tu stack de servicio no los reproducirá exactamente.
Y si la respuesta honesta es que no conoces tu volumen de audio mensual, ese es el número que debes ir a buscar. Es lo que decide esta comparación. Ninguna de las dos placas te lo dirá.
