
Grok Voice Transcribe 2.0 vs. MAI Transcribe 2: Dos carriles, no dos rivales
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Estos dos modelos se lanzaron con quince días de diferencia y tenían exactamente el mismo precio hasta el centavo, y casi nunca estarán en la misma decisión de compra. Grok Voice Transcribe 2.0, lanzado por SpaceXAI el 18 de septiembre de 2026, es el modelo al que recurres cuando el audio aún está llegando: se transmite por WebSocket, emite resultados provisionales aproximadamente cada 500 ms y encabeza la tabla AA-WER Streaming de Artificial Analysis con una tasa de error de palabras del 2,7 % para transcripciones finales y del 3,4 % para los primeros parciales. MAI-Transcribe-2, lanzado por Microsoft AI el 3 de septiembre de 2026, es el modelo al que recurres cuando el audio ya es un archivo: es solo por lotes y, en la tabla de no transmisión en tiempo real de Artificial Analysis, es el modelo gestionado más preciso medido con un AA-WER del 2,04 %, por delante del 2,29 % de Grok Voice Transcribe 2.0 y aproximadamente 2 veces más rápido en rendimiento. Ambos tienen un precio de lista de $0,10 por hora de audio, aproximadamente $1,67 por 1.000 minutos. Si tu requisito es en tiempo real, no hay comparación que hacer. Si tu requisito es un archivo, sí la hay.
La línea que ninguno de los dos proveedores trazará por ti
El soporte de streaming no es un simple interruptor que se activa o desactiva. Grok Voice Transcribe 2.0 sirve el mismo modelo mediante REST para archivos grabados y mediante `wss://api.x.ai/v1/stt` para audio en vivo, así que la precisión que mides en tu archivo es la precisión que obtienes en una llamada en vivo. MAI-Transcribe-2 no tiene ninguna SKU de streaming: los materiales de lanzamiento de Microsoft lo posicionan explícitamente para audio de formato largo y por lotes, y aunque la tarjeta del modelo incluye el subtitulado en tiempo real entre sus escenarios de aplicación, la vía para lograrlo consiste en segmentar el audio y pasar cada segmento por la API por lotes, lo cual es una canalización que tú construyes y operas, no una garantía de latencia que compras. La cifra destacada de rendimiento de Microsoft, de aproximadamente 411× el tiempo real, es un dato de velocidad de procesamiento, no de tiempo de respuesta, y ambos se confunden constantemente en la cobertura de este lanzamiento.
La consecuencia práctica: si estás creando agentes de voz que toman turnos, subtítulos en vivo o cualquier cosa en la que una persona o un modelo reaccione al habla en curso, MAI-Transcribe-2 no es una opción, por muy buena que sea su precisión. Si transcribes reuniones a posteriori, grabaciones nocturnas de centros de contacto, archivos de medios o backlogs de cumplimiento, el streaming es un peso muerto y las cifras por lotes lo son todo.
Donde MAI-Transcribe-2 está realmente por delante
La precisión en archivos, primero. La diferencia del 2,04 % frente al 2,29 % se mide con el mismo arnés independiente —AA-WER v2 de Artificial Analysis, 50 % AA-AgentTalk y 25 % cada uno de VoxPopuli y Earnings22—, lo que lo convierte en el dato más limpio de esta comparación. Es una diferencia de 0,25 puntos, aproximadamente dos errores y medio menos por cada mil palabras. Que eso importe depende de lo que hagas con la transcripción; para un archivo consultable no, y para un registro legal o médico, quizás sí.
El rendimiento, en segundo lugar, y por un margen mayor que la brecha de precisión: 333× el tiempo real frente a las 162× de Grok Voice Transcribe 2.0. Ambas cifras son mediciones de Artificial Analysis de segundos de audio de entrada transcritos por segundo, no afirmaciones de los proveedores. A ese ritmo, un archivo de mil horas se completa en unas tres horas de cómputo con el modelo de Microsoft y unas seis con el de SpaceXAI. Para una migración puntual, eso es irrelevante; para una canalización que ingiere datos de forma continua, el tiempo real reducido a la mitad supone una diferencia real de capacidad.
Cobertura de idiomas, en tercer lugar. Microsoft especifica 60 idiomas con detección automática, cambio de código dentro de una grabación y una tasa promedio de error de palabras del 5,2 % entre ellos en FLEURS —una cifra reportada por el proveedor, no reproducida de forma independiente, pero que al menos describe el caso multilingüe en una lista de idiomas declarada. SpaceXAI documenta docenas de idiomas con cambio a mitad de grabación y formato de forma escrita en 25. Si tu audio queda fuera del conjunto bien cubierto de inglés y principales lenguas europeas, la cifra de FLEURS es más informativa que una tabla de clasificación ponderada hacia el inglés y con abundante habla de agentes.
Dos diferencias más que importan desde el punto de vista operativo. MAI-Transcribe-2 ofrece estilos de transcripción configurables —literal, que conserva las disfluencias, frente a limpio, que las elimina—, mientras que Grok Voice Transcribe 2.0 aborda el mismo problema con una marca de eliminación de muletillas. Y el modelo de Microsoft está en versión preliminar pública en Microsoft Foundry, lo que significa que no tiene SLA y que hay una recomendación permanente de no usarlo en producción hasta que alcance la GA; el modelo de SpaceXAI está disponible de forma general con límites de velocidad publicados de 10 solicitudes por segundo y 100 sesiones de streaming concurrentes por equipo.

Dónde Grok Voice Transcribe 2.0 está realmente por delante
• Transmisión en tiempo real: un endpoint de WebSocket con resultados provisionales cada ~500 ms, frente a solo por lotes, sin que se anuncie ningún SKU en tiempo real
• Precisión de la primera transcripción parcial — 3,4 % de WER a 0,49 s en AA-WER Streaming, una categoría en la que MAI-Transcribe-2 no compite
• Precisión por lotes en audio de agent-talk — 2,29 % en general, pero en el subconjunto AA-AgentTalk del tablero sin streaming el orden es más ajustado de lo que sugiere el titular, y en la mezcla con alta proporción de agentes del tablero de streaming Grok lidera de forma absoluta
• Infraestructura del agente de voz — La detección de fin de turno de Smart Turn y la eliminación de muletillas se incluyen en el modelo, mientras que MAI-Transcribe-2 deja la lógica de turnos al llamador
• Audio multicanal — hasta 8 canales independientes transcritos en una sola pasada, lo que es importante para grabaciones de llamadas estéreo o con múltiples tramos
• Confianza a nivel de palabra — las marcas de tiempo llevan una puntuación de confianza por palabra, de modo que los fragmentos de baja confianza se pueden señalar en lugar de confiar en ellos por igual
• Términos de disponibilidad — disponibilidad general con límites de concurrencia publicados, frente a una versión preliminar pública sin SLA
• Durabilidad del precio — $0.10 por hora es la tarifa vigente tanto para batch como para la base del nivel de streaming de $0.20, donde el $0.10 idéntico de Microsoft es una oferta de lanzamiento por tiempo limitado sin una tarifa estándar anunciada para 2027
Ese último punto es el que la mayoría de las comparaciones omite. Los dos modelos cuestan lo mismo hoy, y uno de esos precios tiene fecha de vencimiento, mientras que el otro no. Microsoft no ha publicado una tarifa después de la promoción, y la cobertura no coincide sobre si la oferta dura hasta finales de 2026 o no tiene un final declarado en absoluto. Si estás modelando un presupuesto de transcripción a tres años con $1.67 por cada 1,000 minutos de Microsoft, estás modelando una cifra a la que el proveedor no se ha comprometido.

El solapamiento es real, y constituye la mayor parte de la lista de características.
Dejemos a un lado la cuestión del streaming y los dos productos convergen con fuerza. Ambos hacen diarización de hablantes. Ambos devuelven marcas de tiempo a nivel de palabra. Ambos manejan la normalización inversa de texto: números, fechas, monedas y datos de contacto representados en forma escrita. Ambos aceptan terminología del dominio: Grok Voice Transcribe 2.0, en forma de hasta 100 términos clave por solicitud, y MAI-Transcribe-2, en forma de listas de terminología del dominio y abreviaturas. Ambos detectan el idioma automáticamente y siguen a un hablante que cambia de idioma a mitad de la grabación. Ambos manejan audio de telefonía de 8 kHz, que es el caso en el que la mayoría de los modelos de transcripción fallan silenciosamente y contra el que SpaceXAI afinó con más ahínco: su conjunto interno de telefonía pasó de un 10,6 % a un 7,1 % de WER entre versiones, una cifra reportada por la empresa sobre audio de la empresa.
Ambos también conllevan límites de entrada que dan forma a las arquitecturas, no solo a los presupuestos. Grok Voice Transcribe 2.0 acepta archivos de hasta 500 MB en 12 formatos de audio con frecuencias de muestreo de 8 kHz a 48 kHz. Los límites de MAI-Transcribe-2 los establece la ruta de Foundry, no el modelo, y los equipos deberían consultar la documentación propia de Microsoft para conocer el límite máximo actual en lugar de asumir paridad con un servicio de STT dedicado.
Lo que esa convergencia significa es que la decisión se reduce a tres preguntas, en orden: ¿tiene que ser en vivo?, ¿cuántos idiomas tienes en realidad?, y ¿cuánto te cuesta la brecha de precisión? La primera pregunta es binaria y elimina una opción de plano. La segunda normalmente se puede responder a partir de una muestra de tu propio audio. La tercera es lo bastante pequeña como para que, en la mayoría de las cargas de trabajo basadas en archivos, no decida nada — la brecha de 0,25 puntos es real, pero también lo es el hecho de que ambos modelos están a menos de medio punto del mejor número que alguien haya medido.

Qué hacer con esto
Considéralos una pila de dos carriles en lugar de un enfrentamiento directo. Un centro de contacto que ejecuta asistencia en vivo para agentes y un archivo de cumplimiento nocturno no está eligiendo entre Grok Voice Transcribe 2.0 y MAI-Transcribe-2: está ejecutando ambos, y la única pregunta es si eso le cuesta dos relaciones con proveedores, dos conjuntos de credenciales, dos facturas y dos límites de velocidad. Ninguno de los modelos está en el catálogo de OrcaRouter hoy, así que las llamadas de transcripción en sí van a la API propia de cada proveedor. Lo que sí cubre una clave de OrcaRouter es todo lo que viene después: el resumidor, el clasificador, el agente que razona sobre la transcripción y el trabajo de evaluación que compara el resultado de los dos proveedores en la misma grabación. Ese último es la razón por la que importa: no puedes decidir entre estos modelos a partir de una tabla de clasificación, porque la tabla de clasificación son ocho horas de conversación de agentes en inglés y tu audio no lo es.
Hay que vigilar dos cosas. Primero, si Microsoft fija un precio estándar para MAI-Transcribe-2 cuando termine la oferta de lanzamiento; un precio permanente de $1.67 por cada 1000 minutos lo convertiría en la opción predeterminada por lotes basándose únicamente en el costo, y una vuelta a los $0.36 por hora de MAI-Transcribe-1 haría que esta conversación fuera mucho más corta. Segundo, si Microsoft lanza una SKU de streaming. La ficha del modelo ya menciona el subtitulado en tiempo real como escenario objetivo, y lo único que separa a MAI-Transcribe-2 del carril de streaming es un endpoint — si eso se materializa, estos dos dejan de ser carriles y pasan a ser rivales.
