Tarjeta de título principal generada para una comparación de Voxtral Mini 4B Realtime Arabic y MAI-Transcribe-2-Streaming, con el subtítulo «dos llegadas de octubre, dos problemas de evidencia», con la insignia «octubre de 2026, ambos reportados por el proveedor», con tres chips de estadísticas que muestran una tasa de error de caracteres en árabe del 8,82 % a 480 ms frente a una tasa de error de palabras del 2,5 % a 0,13 s, 16 dialectos frente a 60 idiomas, y pesos de Apache 2.0 frente a la versión preliminar de Azure a $0,54 por hora de audio, y el logotipo de OrcaRouter compuesto en una franja blanca en la parte inferior derecha.
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs MAI-Transcribe-2-Streaming: Dos llegadas de octubre, dos problemas de evidencia

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Siete días separan a estos dos modelos de voz en tiempo real, y llegaron de maneras opuestas. MAI-Transcribe-2-Streaming es el primer modelo de transcripción en streaming de Microsoft AI, anunciado el 1 de octubre de 2026 con una publicación de lanzamiento, un listado de vista previa en Azure, un precio introductorio de 0,54 USD por hora de audio hasta fin de año, y la afirmación de ser el primero en la tabla de streaming de Artificial Analysis tanto en precisión de transcripción final como parcial, con una tasa de error de palabras del 2,5 % y el texto final listo 0,13 segundos después del final del habla. Voxtral Mini 4B Realtime Arabic es el modelo de streaming para dialectos árabes de Mistral AI, publicado en Hugging Face el 8 de octubre de 2026 sin ningún anuncio —sin publicación de blog, sin precio, sin servicio, solo pesos Apache 2.0 y una tarjeta de modelo que reporta una tasa media de error de caracteres del 8,82 % en siete benchmarks de árabe con un retardo de 480 milisegundos. El modelo de Microsoft es un producto terminado con un titular no verificable. El modelo de Mistral es un artefacto verificable sin ningún producto en torno a él. Ambos merecen ser comprendidos precisamente porque ambos dejan la pregunta central —qué tan bien se maneja con el árabe— respondida solo por el proveedor.

Vale la pena hacer la comparación de todos modos, porque los dos modelos enmarcan la misma decisión de ingeniería desde extremos opuestos. Microsoft vende amplitud y un servicio gestionado: 60 idiomas con detección automática y continua del idioma, ejecutándose dentro de Azure AI Speech, con precio por hora, en versión preliminar. Mistral regala profundidad: dieciséis variedades de árabe con nombre, lo bastante pequeñas como para ejecutarse en un solo acelerador, con un script de normalización para que puedas auditar la puntuación tú mismo. Si este mes vas a montar un pipeline de transcripción de árabe, estás eligiendo entre esas dos posturas, y la elección depende de evidencia que aún no tienes en ninguno de los dos casos.

Lo que cada proveedor dijo en realidad, y lo que dicen los foros

El vacío de evidencia es la característica más importante de este enfrentamiento, por lo que va primero.

• MAI-Transcribe-2-Streaming — tasa de error de palabras de la transcripción final del 2,5 % a los 0,13 segundos después del final del habla, y el mismo 2,5 % en los primeros parciales a los 0,12 segundos, ambos presentados como primer lugar en precisión según la metodología AA-WER Streaming de Artificial Analysis. El propio encuadre de Microsoft. Al momento de redactar este artículo, el panel de streaming del tracker no ha trazado una fila para el modelo, por lo que la afirmación se apoya en la metodología del tracker sin un número publicado por el tracker que la respalde.

• Voxtral Mini 4B Realtime Arabic — 8,82% de tasa media de error de caracteres en siete benchmarks de árabe con un retardo configurado de 480 milisegundos. La propia ficha de Mistral, con el código de evaluación proporcionado. Ningún tercero lo ha reproducido, y el modelo tiene dos días.

Entonces, los dos números principales de este artículo son, respectivamente, una afirmación de proveedor sobre la regla de otra persona y una afirmación de proveedor con su propia regla adjunta. Ninguno es una medición independiente. Lo que difiere es que el número de Mistral llega con el script de normalización que necesitas para volver a derivarlo, y el de Microsoft llega con un tablero que aún no lo ha puesto en el gráfico. Si estás tomando una decisión de compra, esa distinción importa más que la diferencia entre 2.5 y 8.82, que de todos modos no tiene sentido — la tasa de error de palabras y la tasa de error de caracteres no se convierten, y la ortografía árabe amplía considerablemente su brecha.

La única comparación dentro de la ficha de Mistral que sí convence es la que se hace contra su propio equivalente offline: Voxtral Transcribe Arabic con un 7.91% de CER en los mismos siete benchmarks y con la misma normalización, así que el streaming le cuesta a este modelo 0.91 puntos porcentuales. Microsoft publicó una cifra equivalente para su propia familia cuando lanzó la versión por lotes de MAI-Transcribe-2 el 3 de septiembre de 2026 con una tasa de error de palabras del 2.0%: la variante de streaming cede medio punto frente al modelo por lotes mientras añade entrega en tiempo real. Lee esas dos diferencias internas de los proveedores una al lado de la otra y tienes la única afirmación comparable en igualdad de condiciones en este artículo: en sus propios benchmarks, la SKU de streaming de cada laboratorio va por detrás de su equivalente por lotes, por alrededor de un punto en un caso y medio punto en el otro, y ambos están midiendo idiomas distintos.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Cobertura de idiomas: 60 frente a 16, y la misma brecha sin nombre en ambos lados

• MAI-Transcribe-2-Streaming — 60 idiomas con detección automática y continua del idioma, por lo que una sesión que cambia de idioma a mitad de la transmisión no necesita que el idioma se declare de antemano. El material de lanzamiento de Microsoft proporciona el recuento, no la lista; la documentación de compatibilidad de idiomas de Azure para la familia MAI-Transcribe es donde se detalla la cobertura, y documenta el árabe entre los idiomas compatibles de la familia.

• Voxtral Mini 4B Realtime Arabic — dieciséis variedades de árabe, nombradas individualmente: árabe estándar moderno, marroquí, libio, tunecino, argelino y árabe hassaniya, árabe del Golfo, najdí, omaní y árabe sanaani, árabe egipcio y sudanés, árabe mesopotámico y tanto el árabe levantino meridional como el septentrional, y árabe chadiano. Fuera de ese conjunto, el modelo se documenta como fuera de alcance, con una referencia al Voxtral Mini 4B Realtime general.

Ninguno de los dos números te dice lo que necesitas. El 60 de Microsoft es un recuento de amplitud que incluye el árabe sin describir su rendimiento; la publicación de lanzamiento menciona el total de idiomas una vez y pasa a otra cosa. El 16 de Mistral es una enumeración de objetivos de entrenamiento con una única tasa de error agregada en siete conjuntos de referencia, lo que significa que el desglose por dialecto —lo que en realidad determina si tu audio de llamadas marroquíes se transcribe— tampoco se publica. Dos modelos, dos proveedores y, en ambos casos, la respuesta honesta a «¿qué tan bueno es específicamente en árabe del Golfo?» es: no se indica.

Lo que la enumeración sí te da es un prior. Un modelo con árabe chadiano y árabe hassaniya como objetivos nombrados se ajustó contra una distribución norteafricana; Mistral lo codesarrolló con el Ministère de la Transition Numérique et de la Réforme Administrative de Marruecos y construyó dos de los siete benchmarks con ese ministerio —ISMA y Darija in the Wild— específicamente para medir los casos difíciles. Un modelo general de 60 idiomas mejora primero en árabe estándar moderno, porque ahí es donde está el volumen de señal de entrenamiento. Si tu audio es darija o árabe del Golfo, esos son problemas distintos, y solo uno de estos dos proveedores le ha puesto un número a cualquiera de los dos.

Latencia y la forma del retardo

• MAI-Transcribe-2-Streaming — 0,13 segundos desde el final del habla hasta la transcripción final, y los primeros parciales a los 0,12 segundos, lo cual es lo suficientemente rápido como para que el parcial y el final tengan efectivamente la misma latencia. Afirmación de Microsoft, medida con la metodología del tracker.

• Voxtral Mini 4 Realtime Arabic: 480 milisegundos de retardo con la precisión publicada, y con el retardo ajustable. Eso es aproximadamente tres veces y media la cifra de Microsoft, y es el parámetro que elige el operador en lugar de una propiedad fija.

Tres décimas de segundo son una diferencia real para un agente de voz que necesita responder a mitad de una frase y casi invisible para una persona que lee subtítulos. También es la diferencia entre un dial y un número. El parámetro de retardo de Mistral significa que puedes ir más ajustado y aceptar más errores, o más holgado y recuperar la precisión —el modelo base a partir del cual se ajustó este checkpoint anuncia un rango que va de 240 milisegundos a 2,4 segundos—, mientras que el punto de operación de Microsoft es el que Azure distribuye. Eso hace que la cifra de Microsoft sea más fácil de interpretar y la de Mistral, más fácil de ajustar, y significa que cualquier comparación de las dos cifras de precisión es en realidad una comparación entre dos puntos elegidos en una curva y un punto fijo en otra.

La superficie de características difiere igual de marcadamente, y vale la pena contrastarla con los requisitos de tu pipeline antes de que la discusión sobre la precisión se vuelva interesante.

• MAI-Transcribe-2-Streaming — se ofrece a través de Azure AI Speech con el conjunto de características documentado de la familia: diarización, marcas de tiempo a nivel de palabra, sesgo de palabras clave y frases, estilos de salida literal frente a limpio, e identificación automática del idioma. La documentación propia de la SKU de streaming para diarización y marcas de tiempo es más escasa que la del modelo por lotes, así que confirme esos aspectos por punto de conexión en lugar de asumir paridad.

Screenshot of the Microsoft Learn documentation page 'Use a MAI-Transcribe model' in Azure AI Speech, captured 10 October 2026, showing the public preview notice that the feature is provided without a service-level agreement and is not recommended for production workloads, alongside the statement that MAI-Transcribe is a next-generation speech-to-text model built in-house by the Microsoft AI team covering 60 languages.

• Voxtral Mini 4B Realtime Arabic — la ficha documenta la transcripción con un codificador de audio causal, servicio de vLLM a través de un WebSocket en /v1/realtime, soporte nativo de Transformers desde la versión 5.2.0, y un módulo de normalización. No documenta la diarización ni las marcas de tiempo a nivel de palabra para este checkpoint.

Modelo de entrega: un servicio de vista previa frente a pesos descargables

• MAI-Transcribe-2-Streaming — versión preliminar de Azure, lo que significa que no hay SLA y que el proveedor recomienda no depender de ella para producción. Con un precio de $0,54 por hora de audio como tarifa introductoria vigente hasta finales de 2026, sin que se haya publicado la tarifa estándar; el MAI-Transcribe-2 por lotes se lanzó a $0,10 por hora de audio bajo la misma condición de tiempo limitado. El streaming cuesta 5,4 veces la tarifa por lotes.

Voxtral Mini 4B Realtime Arabic — Apache 2.0, aproximadamente 4,4 mil millones de parámetros en BF16, descargable, ajustable con fine-tuning y se puede servir en un único acelerador. Sin precio, sin SLA y sin compromiso de soporte, porque no hay ningún servicio detrás.

Esas dos frases contienen la decisión. Un servicio en vista previa con una tarifa introductoria y un precio estándar no revelado es un compromiso que expira; el sobreprecio de streaming de 5,4× y la ventana hasta 2026 son potestad de Microsoft cambiarlos, y la proporción entre procesamiento por lotes y streaming es el número que hay que vigilar cuando llegue la tarifa estándar. Los pesos de Apache 2.0 sin ningún anuncio son lo contrario: un artefacto que nadie puede retirar, ligado a una relación con un proveedor que nadie ha descrito. Que el checkpoint se mantenga o no es algo imposible de saber, pero el archivo que tienes hoy sigue funcionando de todos modos.

La restricción específica del sector es la que suele decidir estas cuestiones en la práctica. Una implementación de centro de llamadas en árabe dentro de una institución regulada puede que no pueda enviar audio a un endpoint en la nube de versión preliminar en absoluto; un equipo que ya ha adoptado Azure AI Speech como estándar puede que no quiera una segunda pila local para una sola familia de idiomas. Ambas restricciones son válidas, y ninguna tiene nada que ver con las cifras del 2,5 % y del 8,82 % que encabezan los dos lanzamientos.

Por encima de la capa de transcripción, el mismo argumento se aplica a ambos. OrcaRouter no enruta ninguno de estos modelos de voz —esta es una comparación de dos sistemas que no servimos—, pero el resumidor, el clasificador o el agente que consume la transcripción sí es enrutable: más de 200 modelos con una sola clave de API al precio de lista del proveedor con 0,0 %, así que un cambio de precio del proveedor llega a nuestro lado el mismo día, y conmutación por error automática si un proveedor se degrada. Donde eso ayuda específicamente aquí es en la fase de transcripción: apuntar ambos candidatos de transcripción a un mismo pipeline posterior, con una sola clave, es la forma de hacer el cara a cara sin levantar dos integraciones.

La prueba que resolvería esto

Ninguno de los dos proveedores ha publicado datos de rendimiento específicos para el árabe, y ninguno ha sido evaluado de forma independiente con audio dialectal. Por lo tanto, la comparación se reduce a tres hechos y una recomendación.

Los hechos: el modelo de streaming de Microsoft es más rápido, con 0,13 segundos, y afirma tener una mejor precisión agregada en una tabla que aún no lo ha graficado; el modelo de Mistral publica una lista de dialectos, una tasa de error en árabe y el código de normalización para recalcularla, con 480 milisegundos; y las dos cifras de precisión no se pueden comparar porque una es una tasa de error de palabras y la otra es una tasa de error de caracteres en un corpus diferente.

La recomendación: quien sea que esté tomando esta decisión debería ejecutar ambos con su propio audio, porque esa es la única medición que ambos proveedores han dejado abierta. Construye el conjunto de evaluación a partir de grabaciones reales —la mezcla de dialectos que realmente recibes, el códec que realmente usas, el vocabulario del dominio que realmente necesitas— y evalúa ambos con la normalización de Mistral contra una referencia en la que confíes. Una prueba de dos horas con tus propias grabaciones te dirá más que los dos anuncios de lanzamiento combinados, y es la única forma de averiguar si la ventaja de 0,13 segundos vale la pena frente a una dependencia de una versión preliminar y un sobrecoste de streaming de 5,4×, o si un modelo descargable de 4,4B a 480 milisegundos ya es suficientemente bueno para el trabajo.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and MAI-Transcribe-2-Streaming across six shared rows: price none published and self-host only against $0.54 per audio-hour introductory through the end of 2026; accuracy 8.82% Arabic character error rate at 480ms against a claimed 2.5% final word error rate at 0.13s; board status none because the model is days old against claimed first but not yet plotted; languages 16 named Arabic varieties against 60 with the list unpublished; delivery Apache 2.0 self-hosted weights against Azure preview with no SLA; and diarization and timestamps not documented against family documentation that requires per-SKU confirmation. A footer reads that both accuracy figures are vendor-reported and that no independent Arabic evaluation of either model exists. The OrcaRouter logo sits in a white strip at the bottom right.

OrcaRouter no ofrece ninguno de estos modelos de voz, y este artículo no sugiere lo contrario; lo que sí cubre es la capa de lenguaje que lee la transcripción: más de 200 modelos detrás de una sola clave al precio de lista del proveedor con un 0 % de recargo, por lo que un cambio de precio del proveedor en el modelo descendente te llega el mismo día en que se anuncia.

La conmutación por error automática permite que ambos candidatos de transcripción alimenten una única canalización descendente en lugar de dos integraciones, lo que además es la forma más económica de ejecutar la comparación directa.