Tarjeta de título principal generada para una comparación entre Voxtral Mini 4B Realtime Arabic y Grok Voice Transcribe 2.0, con el subtítulo «un líder de la clasificación de etiquetas se encuentra con un especialista en árabe de 16 dialectos», con la insignia «repositorio de Mistral, 8 de octubre de 2026», con tres chips de estadísticas que indican una tasa de error de caracteres en árabe del 8,82 % a 480 ms frente a una tasa de error de palabras del 2,7 % a 0,49 s, 16 dialectos con nombre frente a más de 38 idiomas no documentados, y pesos Apache 2.0 frente a 0,20 $ por hora de audio, y el logotipo de OrcaRouter compuesto en una franja blanca en la parte inferior derecha.
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs Grok Voice Transcribe 2.0: un líder de la clasificación se encuentra con un especialista en dialectos

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El punto de partida honesto para esta comparación es que Voxtral Mini 4B Realtime Arabic y Grok Voice Transcribe 2.0 no compiten por el mismo trabajo, y la forma más rápida de verlo es mirar lo que cada proveedor estaba dispuesto a publicar. Mistral AI publicó Voxtral Mini 4B Realtime Arabic en Hugging Face el 8 de octubre de 2026 sin anuncio alguno: pesos Apache 2.0, una tarjeta de modelo que nombra dieciséis variedades de árabe y una única cifra de precisión de 8,82 % de tasa media de error de caracteres en siete benchmarks de árabe con un retardo de 480 milisegundos. El Grok Voice Transcribe 2.0 de xAI se lanzó el 18 de septiembre de 2026 con una publicación de lanzamiento, un precio y un resultado de tabla de clasificación de terceros: 2,7 % de tasa de error de palabras en las transcripciones finales, con el texto estabilizado 0,49 segundos después de que el hablante se detiene, y ocupó el primer puesto en la tabla de clasificación de voz a texto en streaming de Artificial Analysis cuando llegó. Un modelo te dice exactamente qué dialectos maneja y se niega a adivinar fuera de ellos. El otro te dice que cubre más de 38 idiomas y no desglosa ni uno solo.

Esa asimetría resume por completo la comparación. Si compras capacidad de transcripción al por mayor para audio con mezcla de idiomas, el modelo de xAI es el producto más completo por un amplio margen. Si tu audio es árabe —y en concreto, si es árabe dialectal, no árabe estándar moderno de radiodifusión—, el checkpoint de Mistral está orientado a un problema que la tabla de clasificación que encabeza el modelo de xAI no mide, y sería un error interpretar como un veredicto el hecho de que esté segundo en esa tabla en lugar de primero.

La aritmética de los precios, porque aquí es inusualmente limpia.

xAI publica una tarifa. Mistral publica una descarga. Esa diferencia condiciona todo lo que viene después, así que empieza por el número que existe.

• Grok Voice Transcribe 2.0 — $0.10 por hora de audio a través de REST para archivos grabados, $0.20 por hora de audio a través del WebSocket en streaming. Eso es aproximadamente $1.67 por cada mil minutos para procesamiento por lotes y $3.33 por cada mil minutos en streaming, sin cambios respecto a Grok Voice Transcribe 1.0 en los mismos puntos de precio.

• Voxtral Mini 4B Realtime Arabic — sin precio publicado, porque no hay ningún servicio publicado. Los pesos son Apache 2.0 y tienen aproximadamente 4.4 mil millones de parámetros en BF16, lo que significa que el costo es la GPU que le conectes y la utilización que le saques. Con un volumen sostenido, eso es barato; con volumen cero, es la opción más cara de este artículo, porque estás pagando por hardware inactivo.

El punto de equilibrio no es sutil. Una tarifa de streaming de $0.20 por hora es aproximadamente un tercio de centavo por minuto. Cualquier acelerador en el que ejecutarías un modelo de 4.4B cuesta más que eso por hora, a menos que le estés enviando tráfico sostenido, lo que significa que la ruta de pesos abiertos solo gana en costo después de que tengas suficiente volumen de árabe para mantener una máquina ocupada —y pierde en todos los demás ejes mientras llegas ahí, porque la API no tiene CAPEX, ni planificación de capacidad, ni carga operativa.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

El único punto en el que la aritmética se invierte de entrada es el cumplimiento normativo. El checkpoint de Mistral procesa el audio en hardware que tú controlas, así que nada sale de tu red, y la tarjeta incluye un módulo de normalización, de modo que puedes auditar tú mismo el pipeline de puntuación en árabe. Grok Voice Transcribe 2.0 se ejecuta en las regiones de xAI y, según su documentación, procesa el audio en tiempo real sin retenerlo ni usarlo para entrenamiento, con el respaldo de SOC 2 Type II y elegibilidad para HIPAA. Ambas narrativas son defendibles; solo una de ellas permite que un regulador inspeccione la ruta del código.

Lo que realmente se compra con $0,20 por hora, y el modelo Mistral no se lanza

La brecha de funcionalidades aquí es mayor que la brecha de precisión y se discute mucho menos. Grok Voice Transcribe 2.0 es un producto con una interfaz; Voxtral Mini 4B Realtime Arabic es un checkpoint que emite texto.

• Diarización de hablantes: incluida en Grok Voice Transcribe 2.0, además de transcripción multicanal de hasta ocho canales independientes. La ficha de Mistral no indica ninguna capacidad de diarización; el modelo produce una transcripción, no una con hablantes atribuidos.

• Marcas de tiempo a nivel de palabra — Grok las incluye acompañadas de puntuaciones de confianza, así que puedes aplicar un umbral a los fragmentos de baja confianza en lugar de confiar por igual en toda una transcripción. La ficha de Mistral no declara marcas de tiempo para este checkpoint.

• Sesgo de términos clave — hasta 100 términos de dominio por solicitud en el endpoint de Grok, que es como haces que un modelo acierte con nombres de productos, códigos de cuenta y nombres de lugares sin ajuste fino. La ruta de Mistral para lograr lo mismo es el ajuste fino con tus propios datos, que Apache 2.0 permite y el endpoint alojado no.

• Normalización inversa de texto — Grok formatea números, fechas, monedas, números de teléfono y direcciones de correo electrónico en forma escrita en 25 idiomas. La tarjeta de Mistral incluye un script de normalización, pero su propósito declarado es puntuar benchmarks en árabe, no formatear la salida para su visualización.

• Superficie de interfaz — REST para archivos de hasta 500 MB, transmisión por WebSocket en wss://api.x.ai/v1/stt con resultados provisionales aproximadamente cada 500 ms, un límite documentado de 10 solicitudes por segundo y 100 sesiones de transmisión concurrentes, y una única región por ahora. Por parte de Mistral, servicio vLLM con un WebSocket en /v1/realtime, o Transformers nativos desde la versión 5.2.0, sin más límite de velocidad que tu hardware.

Si necesitas diarización y marcas de tiempo, la comparación ya está decidida antes de que la precisión entre en juego. Eso no es una crítica al modelo Mistral —un especialista en árabe de 4B entrenado para producir texto dialectal preciso es un objetivo de ingeniería distinto del de un servicio de transcripción general—, pero sí significa que ambos solo se vuelven intercambiables si tu pipeline trata la transcripción como materia prima para tu propio posprocesamiento.

El problema de la lista de idiomas

Ambos proveedores describen el soporte de idiomas de una manera que deja la misma pregunta sin responder, desde direcciones opuestas.

• Grok Voice Transcribe 2.0 — más de 38 idiomas, detección automática de idioma con cambio de idioma a mitad de la grabación en una sola pasada, en 12 formatos de audio desde 8 kHz hasta 48 kHz. La documentación da el recuento y no la lista. El árabe no se nombra individualmente en ningún lugar del material, lo que significa que el soporte de árabe se deduce del recuento y no está confirmado por el proveedor.

• Voxtral Mini 4B Realtime Arabic — dieciséis variedades de árabe nombradas explícitamente: árabe estándar moderno; marroquí, libio, tunecino, argelino y hassaniya del Magreb; del Golfo, najdí, omaní y sanaani del Golfo; egipcio y sudanés del valle del Nilo; mesopotámico y tanto el levantino meridional como el septentrional; y árabe chadiano. Todo lo que quede fuera de ese conjunto queda fuera del alcance, y la tarjeta dice que se use en su lugar el modelo general en tiempo real.

Así que la pregunta «¿cuál de estos maneja mejor el árabe?» tiene una estructura extraña. El modelo Mistral es un especialista en árabe documentado, con una tasa de error en árabe publicada y sin verificación independiente. El modelo xAI es un líder documentado de la tabla de clasificación cuyo proveedor no ha confirmado que el árabe esté siquiera dentro de su alcance. Tanto un recuento de 38 idiomas que incluye el árabe como una lista de dieciséis dialectos que solo incluye el árabe responden a la pregunta «¿maneja el árabe?», pero solo uno de ellos responde a «¿maneja el dariya?».

Screenshot of the xAI documentation page for the grok-voice-transcribe-2.0 model, captured 10 October 2026, showing the Speech to Text entry in the Voice documentation navigation, the model page slug grok-voice-transcribe-2.0, its audio-to-text modality, and the us-east-1 region listing with rate-limit sections.

La tabla de clasificación no ayuda aquí. La evaluación de voz a texto de Artificial Analysis es una mezcla fija ponderada hacia la charla de agentes en inglés, que es el diseño correcto para clasificar transcripción general y el incorrecto para sacar a la superficie una victoria en árabe dialectal. Un modelo podría ser genuinamente mejor en árabe del Golfo y árabe marroquí y aparecer como meramente bueno en esa tabla. Esto no es una crítica a la tabla; es una razón para no usarla como única entrada para un despliegue regional.

Exactitud, en unidades que no se convierten

• Grok Voice Transcribe 2.0 — tasa de error de palabras del 2,7% en la transcripción final con 0,49 segundos hasta el final, y 3,4% en las parciales iniciales, ambas medidas en el índice AA-WER v2 de Artificial Analysis, que combina un conjunto privado de conversaciones de agentes con VoxPopuli y Earnings22. La cifra de las parciales iniciales es la destacable: bajó del 18,3% en Grok Voice Transcribe 1.0, que es la diferencia entre una transcripción parcial sobre la que se puede enrutar y una que solo se puede mostrar.

• Voxtral Mini 4B Realtime Arabic — 8,82 % de tasa media de error de caracteres en siete benchmarks de árabe con 480 milisegundos de retardo, según la propia evaluación del proveedor con un script de normalización proporcionado junto a él. Mistral informa de que esto se queda a 0,91 puntos porcentuales de Voxtral Transcribe Arabic, con un 7,91 % de CER, que es el modelo de árabe sin conexión del mismo laboratorio — una comparación que vale más que una entre proveedores distintos, porque los benchmarks, la normalización y la medición son idénticos en ambos lados.

Poner 2,7 % junto a 8,82 % no es una comparación; es un error de categoría. La tasa de error de palabras cuenta palabras incorrectas contra una referencia, la tasa de error de caracteres cuenta caracteres incorrectos, y la ortografía árabe —donde una misma palabra admite múltiples grafías legítimas y los clíticos se adjuntan libremente— ensancha la brecha entre ambas métricas mucho más de lo que muestran las lenguas de escritura latina. Los corpus son distintos, la normalización es distinta, y solo una de las cifras proviene de un tercero. Lo que los dos números pueden decirte legítimamente es que el modelo de xAI es un transcriptor general medido y bien clasificado, y el modelo de Mistral es uno específico para árabe, pero solo según lo declarado. No pueden decirte cuál transcribe mejor tu audio.

La comparación que sí convence es la que aparece dentro de la propia ficha de Mistral: 8,82 % en streaming frente a 7,91 % offline, los mismos siete benchmarks, la misma normalización, el mismo laboratorio. El streaming cuesta alrededor de un punto de precisión en árabe en comparación con un modelo por lotes. Que sea un buen intercambio es decisión tuya, y ahora es una decisión informada.

Donde el modelo pequeño gana, y no es en el marcador.

Tres cosas sobre el checkpoint de Mistral valen más de lo que sugieren las cifras, y ninguna de ellas aparece en ninguna tabla de clasificación.

El primero es la propia taxonomía de dialectos. Nombrar dieciséis variedades como objetivos de entrenamiento distintos, incluidas el hassaniya y el árabe chadiano, es una declaración sobre dónde se midieron los errores del modelo. Un modelo multilingüe general que incluye el árabe como uno de 38 idiomas mejora primero en árabe estándar moderno, porque ahí es donde reside la mayor parte de la señal de entrenamiento y del peso del benchmark. Un modelo creado para la colaboración con Marruecos junto a un ministerio norteafricano está optimizando para una distribución diferente, y se codesarrolló con dos benchmarks —ISMA y Darija in the Wild— creados específicamente para medir eso.

El segundo es el retardo configurable. La cifra de 8,82 % se cita a 480 milisegundos, y el retardo es ajustable en lugar de fijo, lo que convierte el número de precisión en un punto de una curva que elige el operador. Para un trabajo de subtitulado en vivo, puedes acortarlo y aceptar más errores; para un flujo de procesamiento de grabación de llamadas, puedes alargarlo y recuperar la precisión. Grok Voice Transcribe 2.0 presenta un punto de funcionamiento fijo, y la propia ruta de actualización del proveedor muestra por qué eso tiene consecuencias: pasar de 1.0 a 2.0 costó alrededor de un tercio de segundo tanto en la latencia del primer resultado parcial como en la final, y la solución disponible para ti es fijar el modelo antiguo, no ajustar un dial.

La tercera es que la concesión de Apache 2.0 es incondicional para los pesos que tienes. Pase lo que pase con el checkpoint en upstream —ya sea que se anuncie, se le ponga precio, se deprecie o nunca más se mencione—, el artefacto sigue pudiendo descargarse, afinarse y enviarse dentro de tu propio producto. Tanto la tarifa de un endpoint alojado como su calendario de retirada del modelo son cosas que el proveedor puede cambiar a voluntad, y xAI ya ha señalado su intención de convertir Grok Voice Transcribe 2.0 en la opción predeterminada y deprecar la 1.0, lo que trasladará de inmediato al nuevo perfil de latencia a todas las integraciones que nunca hayan pasado un parámetro de modelo.

Sobre la capa de enrutamiento que está por encima de la transcripción, una nota práctica: ninguno de los modelos es un sistema de voz a texto alojado por nosotros, y este artículo no afirma lo contrario. Lo que cubre OrcaRouter es la capa de modelos de lenguaje que consume el flujo —el resumidor, el clasificador, el agente— detrás de una sola clave de API en más de 200 modelos al precio de lista del proveedor con un 0 % de recargo, de modo que un cambio de precio de un proveedor llega aquí el mismo día. Los equipos que usan dos proveedores de voz para cubrir idiomas ya cargan con dos contratos y dos rutas de autenticación; consolidar la mitad posterior en una sola clave es la ganancia fácil.

Qué hacer con esto

Desarrolla sobre Grok Voice Transcribe 2.0 si tu audio es multilingüe, si necesitas diarización, marcas de tiempo o sesgo de términos clave desde el primer momento, o si quieres un servicio con una tarifa publicada y una vía de soporte hoy mismo. Es el producto más completo, lo mide un tercero, y la tarifa de streaming de $0.20 por hora de audio es lo bastante baja como para que el argumento del costo de los pesos abiertos no tenga impacto hasta que manejes un volumen serio.

Usa Voxtral Mini 4B Realtime Arabic como base si tu audio es árabe y específicamente dialectal, si necesitas el modelo dentro de tu propia red por motivos de cumplimiento normativo, o si tienes la intención de hacer ajuste fino —porque solo una de estas opciones lo permite. Antes de nada, acepta tres cosas: sin diarización, sin marcas de tiempo y sin ninguna evaluación independiente publicada por nadie. Dos días después de que aparecieran los pesos, eso último no es una señal de alarma; es simplemente el punto en el que se encuentra la evidencia.

Lo que cambiaría esta comparación más rápidamente es una evaluación específica para el árabe sobre audio dialectal real, realizada fuera de ambos proveedores, con la misma normalización aplicada a ambos sistemas. Hasta que eso exista, la decisión se basa en la propia lista de dialectos de un proveedor frente a la no declarada de otro proveedor, y la única prueba fiable son tus grabaciones.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Grok Voice Transcribe 2.0 across six shared rows: price none published and self-host only against $0.10 per audio-hour over REST and $0.20 streaming; accuracy 8.82% Arabic character error rate vendor-reported against 2.7% final word error rate per Artificial Analysis; delay configurable with 480ms quoted against 0.49s to final and 0.49s to first partial; languages 16 named Arabic varieties against 38+ with none itemised by the vendor; diarization and timestamps not documented against included with confidence scores; and distribution Apache 2.0 weights on Hugging Face against API only. A footer reads that Mistral figures are vendor-reported and unverified while Grok figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

Ninguno de los dos endpoints es uno que sirvamos —esta es una comparación de dos sistemas fuera de nuestro catálogo—, pero los modelos que consumen la transcripción son enrutables: más de 200 modelos con una sola clave de API a precio de lista del proveedor con 0 % de recargo, de modo que un cambio de tarifa en el resumidor o el clasificador llega el mismo día en que se anuncia.

La conmutación automática por error es lo que impide que una configuración de voz con dos proveedores arrastre dos puntos únicos de fallo hasta la capa de lenguaje que se alimenta de ella.