
VoxCPM2: 900,000 descargas al mes, y Transformers todavía no puede cargarlo
- metaNUEVOMeta: Muse Spark 1.22026-08-05$1.25 / $4.25 por 1M de tokens · 705 tok/s
- qwenNUEVOQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 por 1M de tokens · 57 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4 Flash 07312026-07-3150Inteligencia69Código
- qwenNUEVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 201 tok/s
- orcaNUEVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNUEVOAnthropic: Claude Opus 52026-07-2461Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2150Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1651Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1557Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligencia77Código
- grokxAI: Grok 4.52026-07-0854Inteligencia72Código
- tencentTencent: Hy32026-07-0641Inteligencia59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencia42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencia39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligencia72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencia52Código57Matemáticas
- z-aiZ.ai: GLM 5.22026-06-1651Inteligencia69Código60Matemáticas
Los metadatos de Hugging Face para VoxCPM2 indican que su biblioteca es voxcpm — no transformers. Ese único campo explica un extraño vacío en el mundo del habla de código abierto en estos momentos: el modelo de texto a voz de 2B parámetros de OpenBMB acumuló 900.282 descargas en los últimos treinta días, generó 25 afinaciones públicas, 10 cuantizaciones, 7 adaptadores y más de 100 Spaces, y aun así no puede cargarse con la biblioteca con la que se cargan casi todos los demás modelos de ese sitio. La pull request para corregir eso se abrió el 4 de agosto de 2026 y sigue abierta a día de hoy.
Esa brecha merece entenderse antes de que llegue el arreglo, porque determina lo que te cuesta integrar este modelo esta semana en comparación con el próximo trimestre. Y se asienta sobre una pregunta más interesante: si VoxCPM2 está realmente tan por delante como sugiere la cobertura. Todo lo que sigue se extrae de tres fuentes primarias: la openbmb/VoxCPM2 tarjeta de modelo y los metadatos del repositorio, el README de OpenBMB/VoxCPM en GitHub y el Informe Técnico de VoxCPM2 (arXiv:2606.06928, enviado el 5 de junio de 2026). Cada cifra de referencia en este artículo es propia de OpenBMB, ejecutada por OpenBMB y — como el propio documento afirma en su tabla de comparación principal — las cifras de la competencia en ella se copiaron de otros artículos en lugar de volver a ejecutarse en condiciones equivalentes. Hasta donde hemos podido encontrar, ningún laboratorio independiente ha publicado una reproducción de nada de esto.
La ficha de especificaciones, en una sola pantalla.
VoxCPM2 se lanzó en abril de 2026 (el repositorio de Hugging Face se creó el 3 de abril y se modificó por última vez el 16 de abril) como la tercera generación de la línea VoxCPM. En comparación con su predecesor inmediato:
• Tamaño — 2B de parámetros frente a los 0.8B de backbone de VoxCPM1.5 y los 0.6B de backbone de VoxCPM-0.5B.
• Idiomas — 30 más 9 dialectos chinos, frente a solo chino e inglés en ambas versiones anteriores.
• Audio — acepta una referencia de 16 kHz, emite 48 kHz, frente a los simétricos 44.1 kHz de entrada y salida de VoxCPM1.5.
• Columna vertebral — MiniCPM-4-1B (28 capas, ancho 2048) como modelo de lenguaje semántico de texto, frente a MiniCPM-4-0.5B (24 capas, ancho 1024).
• Presupuesto de secuencia — 8192 tokens a una tasa de tokens de 6,25 Hz del lado del modelo de lenguaje, lo que equivale a aproximadamente 20 minutos de audio en un contexto.
• Costo de un segundo de habla — factor de tiempo real 0.30 en PyTorch puro y 0.13 mediante Nano-vLLM en una RTX 4090, con aproximadamente 8 GB de VRAM. VoxCPM1.5 logró 0.15 con 0.8B y 6 GB.
• Licencia — Apache-2.0 sobre los pesos, el código de ajuste fino y las herramientas de inferencia. Sin restricción de acceso, sin cláusula de uso aceptable, uso comercial permitido.
• Datos de entrenamiento — «más de 2 millones de horas» de habla multilingüe, sin que se nombre ningún corpus ni se indique su procedencia.
Lee la línea RTF dos veces, porque va en el sentido contrario. VoxCPM2 es aproximadamente el doble de lento por segundo de audio generado que el modelo de 0.8B al que reemplaza, y necesita un tercio más de VRAM. El 2B no compró rendimiento; compró idiomas y control, y cobró latencia por ellos. Si estás ejecutando un agente en tiempo real, ese intercambio es lo primero que hay que valorar.
Lo que realmente cambia el PR #47756
Hoy en día, ejecutar VoxCPM2 significa instalar el paquete propio de OpenBMB — pip install voxcpm, Python 3.10 a 3.12, PyTorch 2.5 o superior, CUDA 12 o superior — y cargar el modelo mediante una VoxCPM.from_pretrained llamada que no tiene nada que ver con la API de Transformers. Todo lo que sigue a esa decisión es a medida: tu propio batching, tu propio pegamento de servicio, tu propio manejo de los cinco modos de generación.
El trabajo en curso cambiaría eso. El issue #47695, «Añadir soporte nativo para OpenBMB VoxCPM2», se registró el 31 de julio. El PR #47756, «soporte para VoxCPM2», le siguió el 4 de agosto y se actualizó por última vez el 5 de agosto. Lleva la etiqueta «New model» y añade una implementación modular de configuración y modelado, un tokenizador y procesador personalizados, codificación y decodificación de AudioVAE con streaming, acondicionamiento por voz de referencia, continuación de audio con prompt, registros automáticos de clases y una entrada de canalización de texto a forma de onda, con 64 pruebas del modelo reportadas como aprobadas. Está apilado sobre el PR #47736, que añade el propio MiniCPM4; el backbone de texto tiene que aterrizar antes de que pueda hacerlo el modelo de habla que lo envuelve.

Dos detalles merecen atención, y ambos juegan en contra del optimismo. Primero, los tres elementos — el issue y ambas pull requests — fueron abiertos por el mismo colaborador individual de la comunidad, no por OpenBMB ni por un mantenedor de Hugging Face. No hay ningún compromiso del proveedor detrás de esto y, por lo tanto, no hay un cronograma sobre el que puedas planificar. Segundo, una pila de dos PR con 203 commits que tocan una nueva modalidad no es una revisión rápida. Los PR de modelos nuevos en Transformers normalmente requieren semanas de idas y venidas con los mantenedores, y este solo tiene cuatro comentarios hasta ahora.
La lectura práctica: si una clase nativa de Transformers es esencial para tu arquitectura — porque estandarizas en AutoModel, o porque tu capa de servicio solo habla Transformers — VoxCPM2 no está listo para ti, y no existe fecha. Si puedes vivir dentro del voxcpm paquete, el modelo es totalmente utilizable hoy, y el ecosistema ha votado claramente que esto es tolerable: 900,282 descargas ocurrieron sin que existiera soporte nativo en absoluto. También hay un camino intermedio que la mayoría de la cobertura pasa por alto. OpenBMB ofrece una integración vLLM-Omni que expone un compatible con OpenAI /v1/audio/speech endpoint, además de una compilación de llama.cpp-omni con pesos GGUF que se ejecuta en CPU, Metal, CUDA o Vulkan sin ninguna dependencia de Python. Si lo que realmente querías de Transformers era una superficie de servicio estándar en lugar de la clase en sí, eso ya existe.
«Tokenizer-free» no significa no cuantizado.
La frase que aparece en todos los titulares sobre este modelo es la que más a menudo se lee mal. VoxCPM2 no tiene un códec de audio discreto externo — no hay un vocabulario aprendido de tokens de habla situado entre el modelo de lenguaje y la forma de onda, como ocurre en las líneas de CosyVoice o Moshi. Esa es la afirmación, y es cierta.
Aún hay cuantización dentro del modelo. El backbone ejecuta un cuello de botella semidiscreto diferenciable basado en Finite Scalar Quantization, y el artículo es explícito sobre su función: el modelo de lenguaje semántico de texto produce estados ocultos, FSQ los cuantiza escalarmente por dimensión en un «esqueleto semántico», un modelo de lenguaje acústico residual recupera el detalle fino que FSQ descartó, y un transformer de difusión local convierte ambas corrientes de condicionamiento en el siguiente parche latente continuo mediante flow matching. Las cuatro etapas que ves abreviadas como LocEnc, TSLM, RALM y LocDiT son exactamente esa cadena.
La distinción que importa en la práctica no es «cuantizado versus no». Es que el cuello de botella se entrena de extremo a extremo con todo lo que lo rodea, en lugar de congelarse de antemano como un códec separado con su propia pérdida. {{1}}Eso es lo que elimina el modo de fallo habitual en el que un modelo de lenguaje aprende a predecir tokens que un códec no puede decodificar fielmente.{{/1}} VoxCPM2 amplió ese cuello de botella FSQ de 256 a 512 dimensiones y reemplazó la antigua suma elemento a elemento que alimentaba al modelo residual con una proyección de concatenación aprendible — {{2}}cambios pequeños, y entre los pocos del informe respaldados por un mecanismo declarado en lugar de una diferencia en los benchmarks.{{/2}}
La salida de 48 kHz está parcialmente inventada, y ese es el diseño.
"Salida de calidad de estudio de 48 kHz" es la especificación más citable del modelo y la más malinterpretada. AudioVAE V2 es asimétrico: el codificador opera a 16 kHz, el decodificador reconstruye a 48 kHz. El artículo llama a esto "superresolución implícita", que es un nombre honesto para lo que es.
Sigue la consecuencia. Un codificador de 16 kHz tiene un límite de Nyquist de 8 kHz, por lo que nada por encima de 8 kHz en tu audio de referencia llega al modelo. Cada bit de energía en las dos octavas superiores de la salida — el aire en una voz, la sibilancia, el brillo del borde del platillo — es generado por el decodificador a partir de un prior plausible, no heredado del hablante que clonaste. Para la mayoría del trabajo de narración y agentes, esto es invisible o una mejora, porque un buen prior aprendido supera un tope fijo de 8 kHz. Para cualquiera cuyo trabajo sea la fidelidad a una voz grabada específica, es un hecho a tener en cuenta en el diseño, y no es algo que una prueba de escucha en los altavoces de tu portátil vaya a revelar.
La justificación del artículo es el argumento de ingeniería más creíble del informe, y merece la pena repetirla porque no es marketing: mantener el codificador a 16 kHz permite a OpenBMB reutilizar íntegramente el corpus de entrenamiento original de VoxCPM a 16 kHz, elimina el desajuste latente entre fuentes grabadas a diferentes frecuencias de muestreo y evita la explosión de longitud de secuencia que una tasa de entrada más alta impondría en un bucle autorregresivo. Elevar solo el decodificador compra fidelidad de salida sin pagar por ella en la parte costosa del modelo. Ese es un buen intercambio, hecho deliberadamente. También significa que los usuarios de VoxCPM1.5 pasan de un codificador de 44.1 kHz a uno de 16 kHz: una degradación del lado de entrada vendida dentro de una mejora del lado de salida. La propia tabla de reconstrucción de OpenBMB muestra esa forma: el códec de VoxCPM1.5 sigue publicando la mejor distancia mel de banda completa de las tres generaciones, 1.139 frente a 1.335 de AudioVAE V2, porque opera de forma nativa a una alta frecuencia de muestreo en lugar de reconstruir hasta una.
Leer el marcador de OpenBMB de la manera en que OpenBMB lo escribió
Competitivo, no primero
En Seed-TTS-Eval, el estándar de referencia de clonación de voz zero-shot, VoxCPM2 reporta una tasa de error de palabras del 1.84% con una similitud de hablante del 75.3% en el conjunto en inglés, una tasa de error de caracteres del 0.97% con una similitud del 79.5% en chino, y un CER del 8.13% con una similitud del 75.3% en el subconjunto chino difícil. La propia palabra del artículo para esto es "competitive", y la tabla respalda esa palabra en lugar de las más fuertes que circulan.

Entre los sistemas de código abierto en esa misma tabla, Fish Audio S2 registra una mejor tasa de error en los tres subconjuntos (0.99 / 0.54 / 5.99). Qwen3-TTS lo supera en WER en inglés con 1.23. Y LongCat-Audio-DiT lo barre por completo en cinco de las seis celdas — 1.50 de WER y 78.6 de similitud en inglés, 81.8 de similitud en chino, 6.04 de CER y 79.7 de similitud en chino difícil. Donde VoxCPM2 sí destaca es en el equilibrio: es uno de los pocos sistemas que está simultáneamente cerca de la cima en similitud y con una inteligibilidad respetable, y es el único en esa lista que además hace diseño de voz en lenguaje natural. Pero «state-of-the-art» no es lo que muestra su propia tabla principal, y la forma honesta de enmarcarlo es que se trata de un generalista sólido, no de un líder en benchmarks.
3.3 veces más parámetros apenas aportaron inteligibilidad
La fila más útil de esa tabla es la que nadie cita. VoxCPM-0.5B, la primera generación de 0.6B de septiembre de 2025, consigue un 1.85% de WER en inglés y un 0.93% de CER en chino. VoxCPM2, con 2B, obtiene un 1.84% y un 0.97%. Dentro del margen de ruido en inglés, y ligeramente peor en chino.
Lo que los parámetros adicionales realmente aportaron es visible en las columnas de similitud y en ningún otro lugar: el SIM en inglés subió de 72.9 a 75.3, y el chino de 77.2 a 79.5. Todo lo demás que el 2B aporta queda completamente fuera de este benchmark: 28 idiomas más, diseño de voz a partir de una descripción de texto, clonación con control de estilo, salida de 48 kHz. Eso es mucho, y es el argumento honesto para la actualización. Pero si tu carga de trabajo es la clonación en inglés o chino y eliges según la tasa de error, VoxCPM2 no te da nada que el modelo 0.6B no te diera ya, con el triple de pesos y el doble de latencia. Curiosamente, VoxCPM1.5 es el peor de los tres en este benchmark (2.12 / 1.18), lo que hace que la progresión de la familia parezca menos una escalera y más tres productos distintos.
Un modelo, dos evaluaciones, separadas por un orden de magnitud
Aquí es donde se requiere cuidado, porque los dos resultados multilingües de este informe discrepan violentamente y ambos se citan como si zanjaran el asunto.
El titular es una tasa de error media del 1,68 % en 30 idiomas. Eso proviene de un conjunto de pruebas que OpenBMB construyó por sí mismo — 500 enunciados por idioma — y evaluado con Gemini 3.1 Flash Lite como reconocedor. En él, VoxCPM2 registra inglés 0,42, chino 0,92, hindi 0,79, árabe 1,23.
El informe también ejecuta MiniMax-MLS-Test, un conjunto de 24 idiomas de terceros evaluado con Whisper-large-v3. Mismo modelo. Allí, VoxCPM2 registra Hindi 19.70 y Árabe 13.05 — veinticinco veces y diez veces peor respectivamente de lo que dice su propio benchmark, en idiomas que soporta oficialmente. También en esa columna: Cantonés 38.58, Checo 24.13, Rumano 21.58, Ucraniano 6.32.
Tres cosas reconcilian la mayor parte de esto, y vale la pena separarlas porque la versión ampliamente compartida de esta historia las presenta mal:
• Checo, rumano y ucraniano no son idiomas admitidos. Consulta las propias etiquetas de idioma del repositorio: 30 códigos, y ninguno de ellos es cs, ro o uk. Criticar a VoxCPM2 por un WER del 24 % en checo es criticarlo por un idioma que nunca afirmó soportar. El cantonés probablemente se engloba en los "9 Chinese dialects", pero todos los sistemas de esa columna superan el 30 % en él, lo que apunta al reconocedor más que a cualquiera de los modelos.
• El árabe y el hindi están soportados, y son el verdadero hallazgo. Estas son las dos lenguas en las que OpenBMB afirma tener cobertura y sus dos evaluaciones difieren en un orden de magnitud. La propia explicación del artículo es que estos idiomas tienen un "volumen de datos relativamente limitado" en el corpus de entrenamiento y que "parte del WER más alto puede deberse a la precisión limitada del reconocedor". Esa es una hipótesis razonable y no comprobada. Si estás implementando soporte de voz en árabe o hindi, el rango publicado para este modelo es del 0,79% al 19,70% y ninguno de los extremos está verificado de forma independiente. Reserva un día para tu propia medición; no te bases en ninguno de los dos números.
• Las métricas ni siquiera usan la misma unidad.El hindi se califica como tasa de error de caracteres en el conjunto interno y como tasa de error de palabras en MiniMax-MLS. Esas no son cantidades comparables, lo cual es una razón más por la que la brecha de 25x no es una acusación clara — y una razón más por la que el promedio de 1,68 % no debería leerse como una puntuación equivalente.
La misma precaución se aplica a la afirmación que hace el mayor trabajo numérico en la cobertura de este modelo: que VoxCPM2 supera a ElevenLabs en similitud de hablante, con un 85,4% frente al 61,3% en inglés, ganando en 22 de los 24 idiomas. Eso es genuinamente lo que dice la tabla. También es una tabla que el artículo ensambla en parte a partir de resultados previamente reportados, y en la que la columna de inteligibilidad de ElevenLabs contiene un 73,94% de WER en tailandés, un 73,42% en vietnamita y un 16,03% en chino. Esos no son los números de un producto comercial funcional; son la firma de un desajuste de puntuación o configuración. Una tabla tan rota en una columna no se vuelve confiable en otra porque el resultado favorezca al modelo sobre el que estás leyendo.
Cinco modos desde una sola base — y la receta que impulsa tus cifras
La idea más limpia de la arquitectura es que VoxCPM2 no tiene modelos ni cabezales separados para sus capacidades. Los cinco modos son los mismos parámetros con la secuencia de entrada dispuesta de manera diferente, por lo que un solo checkpoint de 2B cubre lo que normalmente requiere una pequeña flota:
• TTS básico — texto de entrada, audio de salida.
• Diseño de voz — una descripción entre paréntesis simplemente se antepone al texto, de modo que "(un hombre de mediana edad, cansado, con voz grave, hablando lentamente)" y la propia línea pasan por el mismo modelo de lenguaje sin ningún módulo adicional. No hay ninguna referencia de audio en absoluto.
• Clonación de referencia — un clip de referencia aislado condiciona la identidad del hablante, sin requerir transcripción.
• Clonación controlable — un clip de referencia más una descripción de estilo, para que puedas clonar una voz y luego pedirle que suene apresurada o divertida.
• Clonación de continuación — clip de referencia emparejado con su transcripción, tratado como un prefijo de audio que el modelo continúa, que es el modo de máxima fidelidad.
En el informe hay un parámetro oculto que la mayoría de los artículos omiten, y es el que tiene más probabilidades de cambiar sus resultados. Las dos vías de condicionamiento — referencia aislada y prefijo de continuación — pueden usarse por separado o juntas, y se compensan entre sí. En la propia ablación de OpenBMB, usar ambas juntas ofrece la mejor similitud de hablante en cada subconjunto. Eliminar el prefijo de continuación y pasar solo la referencia aislada da la mejor inteligibilidad en texto chino difícil, 6.85% CER frente al 7.44%, a costa de sacrificar unos cinco puntos de similitud. La explicación del artículo es sensata: sin un prefijo de audio temporal que fije la prosodia, el modelo tiene más libertad para elegir una entrega que supere textos difíciles.
Así que el valor predeterminado es una elección, no un límite. El trabajo de emparejamiento de voz requiere ambas vías; el texto difícil o inusual requiere solo referencia. Un detalle honesto: las cifras absolutas en esa tabla de ablación no concuerdan con la tabla principal para la receta que el artículo dice haber utilizado en todo momento, lo que en un preprint es más probablemente un error de contabilidad que algo siniestro — pero es una tercera razón para tratar cada número aquí como una dirección a probar, no como un valor para citar.
Diseño de voz: más obediente que natural
El diseño de voz es la característica que hace que esta versión sea interesante en lugar de incremental, y es aquella en la que las propias cifras del proveedor resultan más reveladoras sobre una verdadera disyuntiva.
En InstructTTSEval, VoxCPM2 obtiene 84.2 en especificación de parámetros acústicos, 83.2 en directivas de estilo descriptivo y 71.4 en juego de roles para inglés — esa última cifra es la mejor de la tabla, por delante de Qwen3-TTS-1.7B-VD con 68.4 y Gemini-TTS-Pro con 67.2. En chino es más débil y el orden se invierte: 85.2 / 71.5 / 60.8, frente a los 89.0 / 90.1 / 75.5 de Gemini-TTS-Pro. Por lo tanto, la afirmación más contundente disponible es que VoxCPM2 lidera en juego de roles en inglés y está por detrás de un sistema cerrado de frontera en casi todos los demás aspectos del seguimiento de instrucciones.
El panel de escucha humana — 50 oyentes, aleatorizado y doble ciego, según el informe — lo afina. En generación controlable, VoxCPM2 logra un seguimiento de instrucciones de 4.50 frente al 4.41 de Qwen3-TTS-VD, y pierde en naturalidad con 4.48 frente a 4.61. En clonación zero-shot simple, gana en similitud del hablante (4.74 frente a 4.69) y empata o queda por detrás en naturalidad (4.78 frente al 4.80 de Qwen3-TTS, con intervalos de confianza superpuestos).
El patrón es lo bastante consistente como para planificar en torno a él: VoxCPM2 hace lo que le indicas y suena algo menos humano al hacerlo, mientras que Qwen3-TTS suena algo mejor y sigue las instrucciones con algo menos de precisión. Cuál es el correcto depende por completo de si el valor de tu producto reside en el control preciso o en la entrega sin esfuerzo. OpenBMB señala el corolario en sus propias limitaciones, y es el tipo de cosa que los proveedores suelen omitir: el diseño de voz y la clonación controlable «pueden producir resultados variables entre ejecuciones», y lograr la voz que deseas puede requerir varios intentos. Integra un reintento en tu proceso y, si la voz importa, una compuerta de revisión humana.
Lo que cuesta operarlo, y cuándo alquilar es la decisión correcta
No hay VoxCPM2 alojado en ningún sitio. La propia barra lateral de Hugging Face lo afirma claramente: «Este modelo no está desplegado por ningún Proveedor de Inferencia», y eso nos incluye a nosotros: OrcaRouter no sirve VoxCPM2, y por mucho que se quiera, eso no cambia que un modelo TTS de 2B sin socio de inferencia es o pesos que tú alojas o nada.
Lo que convierte la cuestión del coste en una cuestión de GPU, y la aritmética es clara. Con el factor de tiempo real de 0,13 de Nano-vLLM en una sola RTX 4090, una hora de GPU produce aproximadamente 7,7 horas de audio, por lo que tu coste por hora de audio es tu tarifa horaria por una tarjeta de 24 GB dividida por unos 7,7. En PyTorch puro, con un RTF de 0,30, eso se reduce a unas 3,3 horas de audio por hora de GPU. Ambas cifras son de OpenBMB, medidas en su hardware y con su texto, y ambas variarán con el tuyo: el tamaño del lote, la dificultad del texto y cuántos reintentos exija tu filtro de calidad son multiplicadores que el número RTF no incluye. La tasa de reintentos es la que la gente olvida: un modelo que el proveedor te advierte que puede necesitar varios intentos para lograr una voz objetivo no cuesta lo que implica su RTF.

La comparación que la gente quiere en este punto es contra una API de alquiler, y la respuesta honesta es que ambas cosas no se convierten limpiamente. openai/tts-1-hd cobra $30.00 por millón de tokens de entrada y salida — ese es el precio de lista del proveedor transmitido directamente en OrcaRouter, ya que aplicamos un margen del 0%, así que la cifra en nuestra página de modelos es la cifra que OpenAI cobra. Pero los tokens no son segundos, y ninguna tarifa publicada convierte uno en el otro con la suficiente fiabilidad como para basar una hoja de cálculo en ello. Cualquiera que te muestre una comparación limpia por hora entre un modelo TTS de pesos abiertos autoalojado y una API facturada por tokens ha hecho una suposición que no te ha mostrado.
{{1}}Lo que merece la pena señalar es dónde se traza la línea a nivel arquitectónico.{{/1}} Autoalojar VoxCPM2 tiene sentido cuando necesitas una voz clonada específica, cuando el volumen de audio es lo bastante constante como para mantener una GPU ocupada, cuando los datos no pueden salir de tu infraestructura, o cuando pretendes hacerle fine-tuning LoRA — y lo soporta con entre 5 y 10 minutos de audio objetivo, lo cual es realmente barato. Alquilar tiene sentido cuando el volumen presenta picos, cuando no tienes personal para operar una GPU, o cuando la voz es intercambiable. {{2}}La mayoría de los productos de voz reales son dos sistemas, no uno: una capa de síntesis y un modelo de lenguaje que hace el razonamiento entre las orejas.{{/2}} La parte del razonamiento es la que vale la pena poner detrás de una única clave con conmutación automática ante fallos entre proveedores, de modo que un cambio de modelo sea un cambio de cadena en lugar de un ciclo de contratación; esa es la forma para la que está pensado OrcaRouter, con más de 200 modelos. La parte de la síntesis, cuando se trata de una voz específica que posees y ajustas, tiene que estar en tu propio hardware. {{3}}VoxCPM2 está de lleno en esa segunda categoría, y el hecho de que nadie lo sirva es una consecuencia de lo que es, no un descuido.{{/3}}
Lo que OpenBMB te dice que no esperes
La sección de limitaciones es inusualmente franca para un lanzamiento con tanto impulso, y es lo suficientemente breve como para tomarla en serio:
• La calidad de clonación es una superficie de uso indebido.La tarjeta lo dice directamente: el modelo produce voz lo bastante realista para la suplantación de identidad y el fraude, y el audio generado por IA debería etiquetarse. Apache-2.0 no impone ninguna restricción al respecto — a diferencia de las licencias de varios modelos de voz open-weight de la competencia, no hay ninguna cláusula de uso aceptable tras la que esconderse. Tu política de consentimiento y divulgación debes redactarla tú.
• La variación entre ejecuciones es esperada en las dos funciones de control, no es un error que deba reportarse.
• Los 30 idiomas son un límite real. Todo lo que esté fuera de ellos puede funcionar y no está probado; espera ajustar.
• La consistencia del control de estilo se describe como aún en desarrollo por las personas que la construyeron.
Y las lagunas que la tarjeta no menciona: ninguna divulgación del corpus de entrenamiento en absoluto, por lo que una licencia Apache-2.0 sobre los pesos resuelve la cuestión del código y nada sobre la procedencia de los datos. No hay evaluación independiente de ninguna cifra en este artículo. No hay latencia publicada en milisegundos — el RTF es una relación de rendimiento, y un agente de voz vive o muere según el tiempo hasta el primer audio, que no aparece en ningún lugar del informe.
Tres preguntas que la tarjeta del modelo no resuelve
¿Debería cambiar de VoxCPM1.5 o VoxCPM-0.5B?
Solo para las nuevas capacidades, y solo después de medir. Si necesitas idiomas más allá del chino y el inglés, diseño de voz o clonación con control de estilo, la actualización existe precisamente para eso, y no hay alternativa dentro de la familia. Si hoy ejecutas clonación en inglés o chino y estás satisfecho, el argumento es débil a primera vista: el mismo benchmark muestra que VoxCPM-0.5B iguala a VoxCPM2 en tasa de error, y estarías pagando el doble de latencia y un tercio más de VRAM por unos 2,4 puntos de similitud de hablante. También hay un detalle de migración fácil de pasar por alto: si le estabas pasando a VoxCPM1.5 audio de referencia de 44,1 kHz, el codificador de VoxCPM2 acepta 16 kHz, así que tu pipeline de referencia cambia y la parte alta de tu material de origen deja de importar.
¿Puedo realmente lanzar un producto de voz comercial con esto?
Legalmente, la licencia es de las más permisivas que existen: Apache-2.0, sin barreras de acceso, sin restricciones de uso, uso comercial explícitamente permitido, y tanto los pesos como el código de ajuste fino están cubiertos. La pregunta abierta no es el texto de la licencia, sino lo que falta detrás de ella. OpenBMB no menciona ningún corpus de entrenamiento, lo que significa que nadie puede decirte de quién son las voces en las 2 millones de horas. Para un modelo cuya característica principal es reproducir la voz de una persona específica, esa es una pregunta para tu propio asesor legal y no para una ficha del modelo — y es la misma pregunta que todo modelo de voz de peso abierto elude actualmente. En la práctica, los obstáculos más difíciles son operativos: todavía no hay una clase nativa de Transformers, ningún endpoint alojado en ningún lugar, variabilidad entre ejecuciones en las características de control, y ninguna cifra de tiempo hasta el primer audio si estás construyendo algo conversacional.
¿Es lo suficientemente bueno como para reemplazar a un proveedor de TTS de pago?
Para narración en inglés y chino, contenido pregrabado y cualquier carga de trabajo donde controles una voz específica y puedas procesar el trabajo por lotes: sí, según la evidencia disponible, y la licencia hace que probarlo sea casi gratis. Para agentes conversacionales en tiempo real: mide tú mismo el tiempo hasta el primer audio antes de comprometerte, porque nadie lo ha publicado y el RTF no te lo dirá. Para árabe, hindi o cualquier idioma en la cola larga: las dos evaluaciones del propio proveedor discrepan en un orden de magnitud, así que considera el modelo como no probado allí, sin importar qué cifra hayas visto citada. Y para cualquier cosa donde una mala pronunciación sea un incidente de negocio en lugar de una molestia, ten en cuenta que VoxCPM2 no es el líder en inteligibilidad ni siquiera en su propia tabla: Fish Audio S2 y LongCat-Audio-DiT están por delante en ese aspecto, y además también son de pesos abiertos.
Qué ver
Dos cosas, en relojes distintos. La más cercana es el PR #47756 y el PR de MiniCPM4 que está debajo de él. Si se fusionan, VoxCPM2 se convierte en un AutoModel call y el coste de integración para todos los que están estandarizados en Transformers se reduce a casi nada de la noche a la mañana — y dado que 900.282 descargas al mes ya se producen por la vía difícil, eso es un desbloqueo significativo. Si se estancan, la respuesta para esos equipos sigue siendo "usar el paquete de OpenBMB o el endpoint de vLLM-Omni", y el colaborador de la comunidad que lleva ambos PRs no tiene ninguna influencia para cambiar eso.
La más lenta es si alguien fuera de OpenBMB publica alguna vez un número. Cuatro meses después del lanzamiento, con 900.000 descargas mensuales, 25 ajustes finos y más de 100 Spaces construidos sobre él, cada cifra de rendimiento en circulación sigue remontándose a un único informe técnico escrito por las personas que entrenaron el modelo. Eso no es una crítica a OpenBMB, que documentó su trabajo de forma más exhaustiva y honesta que la mayoría — el informe expone sus elecciones de reconocedor, sus debilidades de volumen de datos y su propia inestabilidad. Es una crítica al resto de nosotros. Lo más valioso que cualquiera en la comunidad de voz de código abierto podría publicar este mes es una ejecución de Seed-TTS-Eval y MiniMax-MLS con puntuación de Whisper sobre VoxCPM2, Qwen3-TTS, Fish Audio S2 y LongCat-Audio-DiT en condiciones idénticas. Hasta que eso exista, el resumen justo de VoxCPM2 es que es el modelo de voz de pesos abiertos más capaz por checkpoint que nadie haya publicado, que no es el más preciso, y que ambas mitades de esa frase se apoyan en la palabra del proveedor.
