
Voxtral Mini 4B Realtime Arabic vs Voxtral 4B TTS: Dos extremos de la misma conversación
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Estos dos modelos comparten un nombre, un número de parámetros y un archivo de licencia que se comporta de manera diferente, y ahí es donde termina el parecido. Voxtral Mini 4B Realtime Arabic, publicado en Hugging Face el 8 de octubre de 2026 sin ningún anuncio que lo acompañara, recibe audio y produce texto en árabe: un ajuste fino en streaming de Voxtral-Mini-4B-Realtime-2602 creado para árabe estándar moderno y quince dialectos con nombre, Apache 2.0, 8.82% de tasa media de error de caracteres con un retardo de 480 milisegundos. Voxtral 4B TTS, anunciado por Mistral AI en marzo de 2026, hace lo contrario: texto de entrada, voz de salida, veinte voces predefinidas más adaptación a partir de un breve clip de referencia, nueve idiomas, incluido el árabe, y una licencia — CC BY-NC 4.0 — que prohíbe el uso comercial de los propios pesos. No son alternativas y no son variantes. Son las dos mitades de un bucle de voz, y la razón para considerarlos juntos es que las decisiones que tomas sobre uno de ellos condicionan al otro más de lo que la mayoría de los equipos espera.
La mayoría de las páginas de comparación te dirán que estos modelos no tienen relación porque uno es ASR y el otro es TTS, y ahí se detendrán. Eso es cierto y no sirve de nada. Lo que realmente vale la pena saber es dónde se encuentran: un agente de voz necesita ambos, las dos licencias apuntan en direcciones opuestas, las dos huellas de hardware son similares mientras que las características de rendimiento no lo son, y las afirmaciones sobre cobertura del árabe son de formas completamente distintas. Todo lo que sigue trata sobre esos cuatro puntos de encuentro.
Qué es cada modelo, en los términos que importan para un pipeline
• Voxtral Mini 4B Realtime Arabic — reconocimiento automático de voz en streaming. Entrada de audio de 16 kHz, salida de texto, aproximadamente 4.4 mil millones de parámetros en BF16, servido a través de vLLM con un WebSocket en /v1/realtime o de forma nativa en Transformers desde la versión 5.2.0. Un codificador de audio causal y un decodificador de lenguaje, un retardo de transcripción configurable indicado en 480 milisegundos para la cifra de precisión publicada, y un módulo de normalización incluido junto con él para que se pueda recalcular la tasa de error de caracteres en árabe. Apache 2.0.
• Voxtral 4B TTS: conversión de texto a voz en streaming y por lotes. Entrada de texto, salida de audio de 24 kHz en WAV, PCM, FLAC, MP3, AAC u Opus, con aproximadamente 4 mil millones de parámetros, una lista de 20 voces predefinidas y adaptación de voz a partir de un clip de referencia de tan solo tres segundos. El propio benchmark de Mistral en una sola H200 ejecutando vLLM-Omni 0.18.0 con una entrada de 500 caracteres y una referencia de diez segundos reporta 70 milisegundos de latencia y un factor de tiempo real de 0,103 con concurrencia 1, que sube a 331 milisegundos y 0,237 con concurrencia 16, y 552 milisegundos con concurrencia 32. Se consulta como API a $0,016 por cada mil caracteres.
La primera observación que se desprende de esos dos párrafos es que el par es pequeño. Ambos modelos están en el rango de los 4000 millones de parámetros y ambos caben en un único acelerador en BF16, lo que significa que un agente de voz árabe construido íntegramente con pesos abiertos es, como máximo, un despliegue de dos GPU y, plausiblemente, un despliegue de una sola GPU con cuantización en ambos lados. Esa es la razón práctica para considerarlos como un conjunto y no como dos decisiones de producto separadas.

La asimetría de licencias es el hallazgo, no una nota al pie.
Esto es lo que sorprende a quienes asumen que los modelos del mismo laboratorio con la misma convención de nombres tienen los mismos términos.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0. El uso comercial, la modificación, la redistribución y el ajuste fino están permitidos, todo ello sujeto a la restricción estándar contra la infracción de derechos de terceros.
• Voxtral 4B TTS — CC BY-NC 4.0, heredada de los conjuntos de datos de voces de referencia que la sustentan. No comercial. La tarjeta de Mistral es explícita en que el modelo hereda la licencia de sus referencias de voz, extraídas de fuentes que incluyen EARS, CML-TTS, IndicVoices-R y un conjunto de audio natural en árabe. Los pesos son descargables y la licencia no es comercial.
Esta es una restricción severa sobre la arquitectura exacta a la que todo el mundo recurre primero. Si construyes un agente de voz en árabe cuya parte de voz a texto sea Voxtral Mini 4B Realtime Arabic y cuya parte de texto a voz sea Voxtral 4B TTS, tienes un pipeline en el que la mitad de los componentes son libres para uso comercial y la otra mitad no, y la mitad restrictiva gobierna el producto. Que el modelo ASR sea Apache 2.0 no salva la parte de TTS. Ejecutar el par en local no cambia la licencia, y tampoco lo hace no distribuir los pesos: la restricción se aplica al uso, no a la distribución.

La vía comercial que ofrece Mistral para la parte de voz es la API alojada a $0.016 por cada mil caracteres, lo cual es un acuerdo de servicio en lugar de una concesión de licencia. Para un equipo de producto, la consecuencia práctica es que la mitad libremente comercializable del bucle es la que escucha, y la que habla es o una dependencia de API o una conversación sobre licencias. Eso invierte lo que la mayoría de los equipos asumen cuando se proponen construir una pila de voz abierta, y vale la pena descubrirlo antes de haber escrito la integración en lugar de después.
Las afirmaciones en árabe no coinciden, y solo una de ellas es una promesa de cobertura.
Ambos modelos listan árabe. Los listados significan cosas distintas.
• Voxtral Mini 4B Realtime Arabic — El árabe es todo el alcance. Se enumeran dieciséis variedades como objetivos de entrenamiento: árabe estándar moderno, marroquí, libio, tunecino, argelino y hassanía, del Golfo, najdí, omaní y sananí, egipcio y sudanés, mesopotámico y tanto levantino meridional como septentrional, y chadiano. Todo lo que quede fuera de ese conjunto se documenta como fuera del alcance. Una cifra de precisión agregada, 8,82 % CER, promediada en siete benchmarks árabes.
• Voxtral 4B TTS — El árabe es uno de los nueve idiomas compatibles, junto con el inglés, el francés, el español, el alemán, el italiano, el portugués, el neerlandés y el hindi. La ficha describe "dialectos diversos" dentro de esa compatibilidad, sin enumerarlos, y no se ha publicado ninguna cifra de calidad por idioma para el árabe ni para los otros ocho.
Leídos en conjunto, el par ofrece una declaración detallada sobre lo bien que tu sistema escuchará el árabe y casi ninguna declaración sobre lo bien que lo hablará. Esa asimetría tiene una consecuencia real para un agente de voz de Darija o árabe del Golfo: el lado de entrada tiene un punto de referencia publicado y una lista de dialectos contra la que puedes evaluar, y el lado de salida tiene una insignia de idioma y una lista de voces. Nadie ha publicado una medición de inteligibilidad de árabe dialectal para Voxtral 4B TTS, y la función de adaptación de voz no lo resuelve: adaptar una voz cambia a quién suena, no qué dialecto produce.
Hay un segundo punto más sutil sobre la propia cifra de precisión del modelo ASR que también se traslada al lado de TTS. Mistral reporta un CER de streaming del 8,82 % frente al 7,91 % del Voxtral Transcribe Arabic offline en los mismos siete benchmarks y con la misma normalización, así que el streaming cuesta alrededor de un punto. El equilibrio equivalente en el lado de TTS —cuánto cuesta la inferencia en streaming en calidad de salida frente al procesamiento por lotes— no se cuantifica en absoluto en el material. Los números de latencia existen; la diferencia de calidad, no.
Rendimiento: un modelo está hecho para exigirlo al máximo, el otro no.
Mistral publicó datos de rendimiento para exactamente uno de estos modelos, y las cifras explican por qué.
• Voxtral 4B TTS — medido en una H200 con vLLM-Omni, una entrada de 500 caracteres y una referencia de audio de diez segundos, el rendimiento va desde unos 119 caracteres por segundo de tiempo de GPU con concurrencia 1 hasta aproximadamente 879 con concurrencia 16 y alrededor de 1.431 con concurrencia 32, mientras que la latencia aumenta de 70 milisegundos a 331 y luego a 552. Esa es una curva de rendimiento con la que se puede planificar la capacidad, y es la forma que cabría esperar de un modelo diseñado como servicio de voz de producción.
• Voxtral Mini 4B Realtime Arabic — la ficha no informa ninguna cifra de rendimiento, ningún comportamiento de concurrencia ni ningún benchmark de hardware. Lo que sí indica es la arquitectura: un codificador causal y un esquema de atención de ventana deslizante tanto en el codificador como en el decodificador, descrito en el modelo base como compatible con streaming efectivamente ilimitado. El dato de precisión se cita a 480 milisegundos de retraso, lo que implica que el modelo sigue el audio en tiempo real en hardware adecuado, y ese es el alcance de la envolvente de rendimiento publicada.
La diferencia no es tanto una crítica a ninguno de los dos modelos como una constatación sobre su madurez. El modelo TTS tiene una tabla de SLO publicada porque se lanzó como producto con una entrada de blog, una demo, una API y un precio. El modelo de ASR en árabe no tiene un envolvente de rendimiento publicado porque llegó como un repositorio con una ficha. Si hoy estás dimensionando una flota de transcripción en árabe, la cifra de rendimiento que necesitas todavía no existe, y la única forma de obtenerla es ejecutar la ruta de servicio de vLLM en tu propio hardware con tu propio audio.
Ahí es también donde una capa de enrutamiento cambia la forma del despliegue, y no solo la facturación. OrcaRouter no enruta ninguno de estos modelos —no alojamos ningún endpoint de voz de Mistral, y este artículo no afirma lo contrario—, pero la capa de modelos de lenguaje entre ellos es exactamente la capa que se beneficia de ser enrutada: una sola clave de API para más de 200 modelos al precio de lista del proveedor con un 0% de margen, de modo que un cambio de precio de un proveedor llega a nuestro lado el mismo día en que se anuncia, y conmutación por error automática para que una mala tarde de un único proveedor ascendente sea un redireccionamiento en lugar de una interrupción en tu bucle de voz. Un agente de voz ensamblado a partir de dos modelos Mistral autoalojados más un modelo de razonamiento alojado tiene tres dominios de fallo; la capa de enrutamiento es lo que hace que el del medio sea aburrido.
Costo, lado a lado, con la salvedad de que un lado no tiene precio
• Voxtral 4B TTS — 0,016 $ por cada mil caracteres a través de la API de Mistral, o el coste de la GPU si lo autoalojas bajo términos que permitan tu caso de uso. Para hacerse una idea aproximada de la escala, mil caracteres son un par de cientos de palabras, por lo que un minuto de salida hablada se sitúa en las fracciones bajas de un centavo a precio de lista, antes de cualquier ventaja de concurrencia por ejecutarlo tú mismo.
• Voxtral Mini 4B Realtime Arabic — sin precio publicado, sin servicio alojado, sin tarifa. El costo es hardware y utilización. Un modelo 4.4B BF16 en un acelerador moderno es un costo mensual fijo que se amortiza a lo largo de todo el audio que la máquina pueda procesar, lo cual resulta barato con volumen sostenido y puro desperdicio con volumen ocasional.
La comparación que probablemente importa más es con las alternativas a las que recurrirías en su lugar. En el lado de la escucha, el checkpoint árabe compite con API de streaming por hora cuyas tarifas son públicas y bajas —MAI-Transcribe-2-Streaming de Microsoft a 0,54 USD por hora de audio como precio introductorio, Grok Voice Transcribe 2.0 de xAI a 0,20 USD por hora de audio en streaming—, lo que significa que se puede contratar un servicio de transcripción en árabe por unas pocas décimas de centavo por minuto y el argumento a favor de los pesos abiertos tiene que basarse en la precisión dialectal, la residencia de datos o el ajuste fino, y no en el coste por unidad. En el lado del habla, un modelo TTS autoalojado con coste marginal cero es una ventaja real frente a las API facturadas por carácter cuando se usa a gran volumen, por lo que la licencia CC BY-NC es el factor limitante en lugar del precio.
Una nota estructural para quien esté presupuestando un cambio basado en el precio: un enrutador que traslada el precio de lista del proveedor con un 0 % de margen es el punto donde un cambio de tarifa del proveedor se refleja el mismo día en que se anuncia, en lugar de en el siguiente ciclo de reajuste de precios. Eso importa más del lado de la escucha que del lado del habla, porque la transcripción se cobra por hora de audio, y esa es una cifra que los proveedores cambian.
Cómo pensar a la hora de elegir entre ellos
No estás eligiendo entre ellos. La cuestión es qué mitad del bucle puedes construir sobre pesos abiertos, y la licencia lo responde.
Si tu requisito es un agente de voz árabe autocontenido en el que el audio nunca sale de tu infraestructura, la parte de escucha está disponible para ti sin condiciones: Apache 2.0, descargable, ajustable con fine-tuning, con una lista de dialectos contra la que puedes probar y una tasa de error publicada para el árabe. La parte de habla es donde recae la restricción, y tienes dos opciones honestas —mover la síntesis de voz a un servicio alojado bajo un acuerdo comercial, o eliminar Voxtral 4B TTS de la arquitectura y encontrar un modelo de síntesis para árabe con licencia permisiva.
Si tu requisito es un servicio de transcripción en producción y el idioma es el árabe, la decisión está entre un checkpoint descargable de 4,4B con una taxonomía de dialectos publicada y una única tasa de error agregada, y una API de streaming alojada con una tarifa publicada, una latencia publicada y una tabla de terceros. El modelo abierto gana en control, residencia y ajuste fino; las opciones alojadas ganan en evidencia, soporte y simplicidad operativa. Dos días después de que aparecieran los pesos, nadie fuera de Mistral los ha medido, y eso es una razón para ejecutar tu propio benchmark en lugar de una razón para descartar el checkpoint.
Lo que más cambiaría este panorama sería un lanzamiento de síntesis en árabe bajo términos que permitan el uso comercial — el mismo patrón que ya sigue el lado de la escucha. Hasta que eso exista, el ciclo permanece medio abierto, y el trabajo práctico consiste en decidir qué mitad estás dispuesto a alquilar.

No alojamos ninguno de estos dos modelos de voz de Mistral y este artículo no afirma lo contrario; lo que el bucle de voz necesita por encima de ellos es la capa de lenguaje, y esa sí es enrutable: una sola clave de API para más de 200 modelos al precio de lista del proveedor con un 0 % de recargo, de modo que un cambio de tarifas del proveedor nos afecta el mismo día en que se anuncia.
La conmutación automática por error evita que el componente intermedio de un agente de voz de tres componentes —un modelo de razonamiento upstream entre dos modelos Mistral autoalojados— sea la parte que deje el producto fuera de servicio.
