
Voxtral Mini 4B Realtime Arabic vs. Gemini 3.5 Transcribe Live: dialectos vs. amplitud
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Dos modelos de voz a texto en streaming, dos apuestas completamente distintas sobre cuál es la parte difícil de la transcripción. Voxtral Mini 4B Realtime Arabic es un ajuste fino de 4,4 mil millones de parámetros que Mistral AI subió a un repositorio público el 8 de octubre de 2026 sin una publicación de lanzamiento, una entrada de blog ni una línea en el índice de noticias de la empresa, entrenado específicamente con árabe estándar moderno y quince dialectos con nombre, publicado bajo Apache 2.0 con pesos BF16 descargables. Gemini 3.5 Transcribe Live es el endpoint de streaming de Google para Gemini 3.5 Transcribe, anunciado en agosto de 2026 con todo el aparato de un lanzamiento de plataforma, que abarca más de 85 locales y es cerrado: una API de vista previa sin pesos y con un límite de sesión de diez minutos. Un modelo se adentró a fondo en una sola familia lingüística y lo dijo en su propia sección de limitaciones; el otro apostó por la amplitud y dejó sin especificar las garantías a nivel de acento. Cuál quieres depende de un eje que el marketing de ninguno de los dos proveedores pone en primer lugar: cómo suena realmente tu audio.
Esta no es una comparación simétrica, y vale la pena decirlo desde el principio en lugar de enterrarlo. El modelo Mistral tiene 48 horas en el momento de escribir esto, no tiene anuncio del proveedor, ni evaluación independiente, ni precio publicado. El modelo de Google está en vista previa pública desde finales de agosto y se mide en un rastreador de terceros. Trata el lado de Mistral como un conjunto de afirmaciones de una ficha de modelo y el lado de Google como un conjunto de mediciones más un conjunto de afirmaciones, y la comparación se mantiene honesta.
Qué es cada modelo, antes de los números
• Voxtral Mini 4B Realtime Arabic — un modelo ASR en streaming ajustado a partir de Voxtral-Mini-4B-Realtime-2602, de aproximadamente 4400 millones de parámetros en BF16, que procesa audio de 16 kHz mediante un codificador de audio causal y un decodificador de lenguaje. Emite texto a medida que llega el audio, con un retardo de transcripción configurable, y tiene licencia Apache 2.0, con pesos en Hugging Face. Mistral lo codesarrolló con el Ministère de la Transition Numérique et de la Réforme Administrative de Marruecos en el marco de una asociación firmada en enero de 2026, y describe el modelo como un activo de IA soberano.
• Gemini 3.5 Transcribe Live — la mitad en streaming de un lanzamiento de dos modelos. El endpoint de la Live API transporta audio continuo de micrófono a través de un WebSocket, devuelve transcripciones parciales mientras quien habla aún está hablando y fija una transcripción final poco después de que termina cada intervención. Su variante por lotes, gemini-3.5-transcribe, procesa archivos pregrabados de hasta una hora. Ambos están en vista previa pública, ambos son exclusivamente de API y ninguno ha publicado sus pesos.
La primera diferencia estructural no es la precisión. Es que uno de estos es un archivo que puedes descargar esta noche y el otro es un servicio en el que tienes que ser aceptado para poder usarlo.

Cobertura de idiomas: 16 frente a más de 85, y la brecha no es lo importante
Contar idiomas hace que el modelo Mistral parezca limitado y que el modelo de Google parezca enorme. Los recuentos miden cosas diferentes, y leerlos uno al lado del otro sin esa salvedad es el error más común al que invita esta comparación.
• Voxtral Mini 4B Realtime Arabic: 16 variedades de árabe, nombradas individualmente en la tarjeta del modelo por familia dialectal: árabe estándar moderno, además de árabe marroquí, libio, tunecino, argelino y hassaniya del Magreb; el del Golfo, el najdi, el omaní y el sanaani, todos del Golfo; el egipcio y el sudanés, del valle del Nilo; el mesopotámico y tanto el levantino meridional como el septentrional; y el árabe chadiano. El propio planteamiento de la tarjeta es que el modelo está orientado a la transcripción del árabe, y que el cambio de código —hablantes que alternan idiomas a mitad de una conversación— es la capacidad que se diseñó para hacer bien, y no un efecto secundario.
• Gemini 3.5 Transcribe Live — detección automática de idioma en más de 85 locales, con alternancia de código intraoracional e interoracional. La documentación de Google incluye el árabe dentro de ese conjunto; la tabla de locales designa Árabe (Egipto) como la entrada árabe, y la cobertura más amplia de locales árabes no se desglosa en la documentación propia del modelo.
Lee eso con honestidad y aparece la forma del intercambio. El 85-plus de Google es una afirmación de amplitud: si tu audio está en un idioma distinto del árabe, el endpoint de Google lo cubre y el modelo de Mistral lo rechazará; la ficha dice sin rodeos que, para otros idiomas, deberías usar el Voxtral Mini 4B Realtime original, no este checkpoint. El 16 de Mistral es una afirmación de profundidad. No afirma transcribir árabe; afirma transcribir dariya marroquí, árabe del Golfo, árabe egipcio y árabe chadiano como objetivos distintos, lo cual es un problema materialmente más difícil que transcribir árabe estándar moderno y esperar que el dialecto se desprenda de ello. Un benchmark ponderado hacia el inglés y centrado primero en la amplitud nunca te mostrará esa diferencia, porque los conjuntos de dialectos no están en él.
Para un centro de llamadas marroquí o una línea de atención al cliente del Golfo, un modelo que maneja 16 dialectos y nada más puede superar a un modelo que maneja 85 configuraciones regionales con una exactitud por dialecto no declarada. Para una empresa europea que transcribe reuniones en cinco idiomas, la ecuación se invierte al instante. Ningún proveedor está equivocado; eligieron clientes diferentes.

Los números que puedes comparar, y los que no
Aquí es donde la asimetría pasa factura. Los dos modelos reportan unidades distintas, sobre corpus distintos, con evidencia distinta detrás de cada uno, y ningún tercero los ha enfrentado entre sí.
• Voxtral Mini 4B Realtime Arabic — 8,82 % de tasa promedio de error de caracteres en siete benchmarks de árabe, con un retardo de transcripción configurado de 480 milisegundos. Según la propia ficha de Mistral, y no reproducido de forma independiente.
• El modelo al que persigue —Voxtral Transcribe Arabic, con un 7,91 % de CER en los mismos siete benchmarks con la misma medición—, así que el modelo en tiempo real queda 0,91 puntos porcentuales por detrás de un modelo de árabe sin conexión del mismo proveedor. Esa diferencia es la propia comparación de Mistral, lo que la hace inusualmente informativa: el proveedor te está diciendo cuánto cuesta en precisión el streaming en esta familia de idiomas.
• Gemini 3.5 Transcribe Live — tasa de error de palabras en streaming del 4,0 %, medida por Artificial Analysis y citada por Google, con una transcripción final que llega 0,40 segundos después de que finaliza el habla. También se midió: 2,6 % en la tabla no streaming del mismo rastreador, y 5,50 % en streaming en FLEURS según los propios informes de Google.
No pongas 8,82 % de CER junto a 4,0 % de WER y extraigas conclusión alguna. La tasa de error de caracteres y la tasa de error de palabras tienen denominadores distintos —la ortografía árabe hace que la brecha entre ambas sea mayor que en las lenguas de escritura latina—, y los corpus no son los mismos, la normalización no es la misma, y una cifra viene con un script reproducible mientras que la otra proviene de una mezcla fija de un rastreador que está ponderada hacia el habla de agentes en inglés.
La comparación más útil es la que aparece dentro de la propia ficha de Mistral: 8,82 % en streaming frente a 7,91 % sin conexión, sobre pruebas de referencia idénticas y con idéntica normalización. Esa es una medición limpia de lo que la baja latencia aporta y lo que cuesta específicamente en árabe, y vale más que cualquier porcentaje entre proveedores. Lo que nadie ha publicado es una prueba en árabe, en igualdad de condiciones, de los modelos de Google y Mistral sobre el mismo audio. Hasta que alguien lo haga, «cuál es más preciso en árabe» es una pregunta abierta, y la única respuesta defendible es: prueba ambos con tus grabaciones.
Un detalle en la ficha de Mistral merece mención porque va en contra del propio interés del proveedor. Señala que los filtros de seguridad de Gemini bloquean la transcripción de algunas muestras de audio de FLEURS. Esa es una observación real y verificable sobre el pipeline de un competidor, y además es exactamente el tipo de cosa que nunca aparece en una tabla de clasificación: un modelo que se niega a transcribir una muestra puntúa como fallo o como ausencia, y ninguna de las dos lecturas es justa. Si tu audio incluye material que un filtro de contenido podría capturar, ese es un riesgo de despliegue que ninguna cifra de WER sacará a la luz.
Latencia: un dial frente a un número fijo
Los modelos de streaming se suelen comparar con una única cifra de latencia. Estos dos no tienen ninguna en común.
• Voxtral Mini 4B Realtime Arabic — retardo de transcripción configurable. La cifra de CER del 8,82 % se cita a 480 milisegundos, y el retardo es ajustable, lo que significa que el número de precisión es un punto en una curva que el operador elige en lugar de una propiedad del modelo. Su modelo base anuncia un rango desde 240 milisegundos hasta 2,4 segundos.
• Gemini 3.5 Transcribe Live — 0,40 segundos desde el final del habla hasta una transcripción final, medido por Artificial Analysis, con parciales que llegan de forma continua durante el habla. Google afirma por separado una mejora del 70 % en el tiempo hasta la transcripción final frente a Chirp 3, lo cual es una cifra del proveedor y no ha sido replicada.
Ambos se sitúan en el mismo rango —aproximadamente medio segundo—, pero su significado en términos de ingeniería es distinto. El modelo de Mistral te entrega el equilibrio entre latencia y precisión como un parámetro, así que puedes operar a 240 ms cuando los subtítulos de menos de un segundo importan más que los últimos puntos de precisión y aumentar el retraso cuando no sea así. El endpoint de Google presenta un punto de operación fijo con el comportamiento de filtrado de contenido propio de Google incorporado. Para un agente de voz, un control ajustable vale más que un número fijo ligeramente mejor, porque la configuración adecuada depende de tu audio y de tus usuarios, y ningún proveedor puede elegirla por ti.
La verdadera división: pesos abiertos frente a un endpoint de vista previa
La diferencia en licencia y distribución es mayor que cualquier brecha de benchmark en esta comparación, y decide la mayoría de los despliegues reales antes de que se discuta la precisión.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0, pesos BF16 en Hugging Face, se puede servir con vLLM a través de un WebSocket en /v1/realtime, y es compatible de forma nativa con Transformers desde la versión 5.2.0. La tarjeta incluye un ejemplo en Python y un módulo de normalización para que puedas reproducir tú mismo el cálculo del CER en árabe. Nada del pipeline requiere los servidores de Mistral, y el modelo es lo bastante pequeño como para que la cuestión operativa sea qué GPU, no si puedes permitirte una.
• Gemini 3.5 Transcribe Live — solo API, vista previa pública, sin compromiso de precio publicado más allá de las tarifas de lista, y un límite de sesión de diez minutos que implica que cualquier cosa más larga tiene que dividirse en fragmentos, reconectarse y recomponerse mediante tu propio código. Tres restricciones reportadas junto con el lanzamiento son relevantes específicamente para despliegues en árabe: el endpoint de streaming no devuelve diarización de hablantes ni marcas de tiempo a nivel de palabra, y ambas existen en el endpoint por lotes, pero no en este. Si tu transcripción en árabe necesita saber quién dijo qué, o necesita estar alineada en el tiempo con el audio, el endpoint Live no puede generarlo, independientemente del idioma.
Esas dos restricciones son el argumento más sólido a favor del modelo abierto pequeño en un despliegue real en árabe, y no tienen nada que ver con la precisión. Un pipeline de centro de llamadas quiere atribución de hablante, un pipeline de cumplimiento quiere marcas de tiempo, y un modelo de árabe sin conexión con un script de normalización que tú controlas te da ambos sin discutir con un contrato de endpoint. La tarjeta del modelo de Mistral también lo incluye como una limitación en lugar de una característica: está orientado a la transcripción, es un ajuste fino de un modelo general en tiempo real, y es honesto al señalar que existe un modelo más amplio aguas arriba si necesitas uno.
Cuánto cuesta cada uno, y qué es desconocido
• Gemini 3.5 Transcribe Live — aproximadamente $0.009 por minuto de audio combinado, derivado de los precios de lista de $3.50 por millón de tokens de entrada y $21 por millón de tokens de salida, con el audio calculado a 25 tokens por segundo y la transcripción a unos 175 tokens por minuto. El endpoint por lotes cuesta aproximadamente $0.005 por minuto. Ambas cifras son estimaciones basadas en la tokenización supuesta de Google, así que cambian si cambia la contabilidad. Hoy hay un nivel gratuito.
• Voxtral Mini 4B Realtime Arabic — sin precio publicado, porque no hay un servicio publicado. El coste es lo que cueste tu hardware. Un modelo BF16 de 4,4 mil millones de parámetros cabe en un único acelerador moderno, así que el coste marginal por hora de audio es electricidad y utilización, y el coste fijo es la máquina. Eso es más barato que cualquier API por minuto a escala y más caro que cualquier API por minuto a volumen cero, que es la forma habitual de la economía de los pesos abiertos.
Lo desconocido que más importa del lado de Mistral no es el precio. Es si este repositorio es el comienzo de una línea de productos o un entregable único para la asociación con Marruecos. Un modelo que se lanza silenciosamente sin anuncio, sin precios y sin servicio es un modelo sin compromiso de soporte detrás. Apache 2.0 significa que la licencia no se puede retirar para los pesos que ya tienes, pero no dice nada sobre si el checkpoint se mantiene, y el propio puntero al modelo base de la tarjeta sugiere que el modelo general en tiempo real sigue siendo la línea con soporte.
Para la capa situada por encima de la transcripción, una capa de enrutamiento se justifica de una forma que no tiene nada que ver con la transcripción. Ninguno de estos modelos es un servicio de voz a texto que alojemos nosotros —OrcaRouter no enruta ninguno de los dos endpoints—, pero el resumidor, el clasificador de intenciones o el agente que consume el flujo sí es un modelo que puedes enrutar: una única clave de API para más de 200 modelos al precio de lista del proveedor con un 0 % de recargo, de modo que un recorte de precios de un proveedor se refleja de nuestro lado el mismo día, además de conmutación por error automática si un proveedor se degrada. Si ya estás combinando dos proveedores de voz para cubrir dialectos, poner los modelos de lenguaje posteriores detrás de una sola clave en lugar de dos contratos es la mitad barata de la integración.
¿Sobre cuál construir?
Si tu audio es árabe —un dialecto, varios, o con alternancia de código entre árabe y algo más—, el modelo Mistral es el candidato más serio, y la razón es estructural más que numérica. Nombra los dialectos para los que fue construido, es lo suficientemente pequeño como para ejecutarse en tu propio hardware, devuelve texto sin formato que puedes posprocesar con tu propia normalización, y no está detrás de un límite de sesión de diez minutos ni de un filtro de contenido que no puedas inspeccionar. El costo es que hace una sola familia de idiomas y rechaza el resto, y que nadie ha publicado todavía una evaluación independiente de él.
Si tu audio abarca varios idiomas, o si necesitas hoy un servicio con una ruta de soporte y una tabla de precios publicada, Gemini 3.5 Transcribe Live ya se puede invocar, está medido en un rastreador de terceros y cubre los idiomas que el checkpoint de Mistral rechazará. Los costes son el límite de sesión, la falta de diarización y de marcas de tiempo en el endpoint de streaming, y el hecho de que la precisión específica para árabe es una afirmación que tendrás que comprobar por tu cuenta: la lista de locales nombra Egipto, y el rendimiento por dialecto no está desglosado.
Lo que hay que observar no es un benchmark. Es si Mistral anuncia este modelo o no y, de hacerlo, con qué precio y qué hoja de ruta lingüística. Un repositorio silencioso con licencia Apache 2.0 es un artefacto útil y un compromiso débil. Si le sigue una hoja de ruta de dialectos árabes —levantino, del Golfo y egipcio como checkpoints independientes—, la vía de los modelos pequeños se convierte en una respuesta genuinamente completa para la región, y el argumento de la amplitud se vuelve mucho más difícil de sostener.

Ninguno de estos es un modelo de voz que alojemos nosotros, pero la capa por encima de la transcripción es enrutable: más de 200 modelos detrás de una sola clave de API al precio de lista del proveedor con un 0 % de recargo, así que una bajada de precio del proveedor en el modelo de razonamiento que hay por debajo de tu transcripción se refleja el mismo día.
Conmutación por error automática significa que una canalización de voz ensamblada tiene un dominio de fallo menos, porque el resumidor o clasificador de intenciones que consume la transcripción puede redirigirse en lugar de caer junto con un proveedor.
