
MAI-Transcribe-2-Streaming ya está disponible: Microsoft se lleva la corona de la transcripción en streaming con un 2,5% de WER
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 221 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
MAI-Transcribe-2-Streaming es la respuesta de Microsoft AI a la única pregunta que su lanzamiento de septiembre dejó abierta, y la respondió en 28 días. Lanzado el 1 de octubre de 2026, MAI-Transcribe-2-Streaming es un modelo de conversión de voz a texto en tiempo real que transcribe a medida que llegan las palabras en lugar de hacerlo después de que el archivo termina. Microsoft afirma que ocupa el primer lugar en precisión tanto en transcripciones finales como parciales en la evaluación AA-WER Streaming de Artificial Analysis, con una tasa de error de palabras del 2,5 % y la transcripción final lista 0,13 segundos después de finalizar el habla. Esa es una afirmación del proveedor basada en la metodología de un rastreador, más que una fila que el rastreador publica — al momento de redactar esto, los 37 modelos de la tabla no lo incluyen, y el modelo al que desplazaría es Grok Voice Transcribe 2.0 (Streaming), con 2,73 % y 0,49 segundos. El modelo en el que se basa, MAI-Transcribe-2, se lanzó el 3 de septiembre como un modelo por lotes con una WER del 2,0 % y sin SKU en tiempo real; la variante en streaming cierra esa brecha sin renunciar a gran parte de la precisión que hizo notable la versión por lotes. Lo que sí sacrifica es el precio: el streaming cuesta 5,4× la tarifa por lotes en el lanzamiento.
El enfoque que Microsoft quiere es una barrida total de la tabla de streaming. El enfoque que respaldan los números es más acotado y más interesante: un modelo que afirma liderar en precisión y latencia a la vez, en una frontera donde la entrada más precisa de la tabla tarda cuatro veces más en estabilizarse que las más rápidas, y ninguna de esas rápidas tiene una tasa de error de palabra inferior al 3 %, con un precio a la par del incumbente en lugar de por debajo. Aquí está el lanzamiento tal como ocurrió, con las afirmaciones del proveedor etiquetadas.
Qué lanzó Microsoft el 1 de octubre
MAI-Transcribe-2-Streaming se sirve a través de la pila de voz de Microsoft en el servicio Azure AI Speech, con documentación bajo el nombre del propio modelo y el mismo modelo de distribución solo API, sin pesos, que la versión por lotes. Transcribe 60 idiomas con detección automática y continua de idioma, por lo que una sesión que cambia de idioma a mitad del flujo no necesita declararse de antemano. Microsoft lo posiciona en la frontera de Pareto de precisión frente a latencia del gráfico de streaming de Artificial Analysis —la lectura que el propio proveedor hace de los datos del rastreador, y la lectura que respalda el propio gráfico del rastreador.
El modelo de streaming no era todo el lanzamiento. Microsoft lanzó junto a él dos modelos de voz: MAI-Voice-2.1, que cubre 23 idiomas en 26 configuraciones regionales, y MAI-Voice-2.1-Flash, que procesa hasta 45 segundos de audio con una latencia de aproximadamente 150 ms. Visto en conjunto, el lanzamiento del 1 de octubre es una pila conversacional completa en tiempo real —oír, comprender, hablar— en lugar del lanzamiento de un solo modelo.

Leyendo la clasificación de streaming
AA-WER Streaming mide dos cosas por modelo: cuán incorrecta es la transcripción final y cuánto tarda en finalizar después de que el hablante se detiene. La afirmación de Microsoft es que MAI-Transcribe-2-Streaming lidera en ambas: 2,5 % de tasa de error de palabras en la transcripción final a 0,13 segundos después del final del habla, y el mismo 2,5 % en la primera transcripción parcial a 0,12 segundos, lo que, según Microsoft, es el primero en precisión en ambas. Tómalo como una cifra de proveedor — al momento de redactar, el propio tablero de streaming del tracker aún no ha trazado el modelo, así que no hay una fila independiente de MAI-Transcribe-2-Streaming que leer. Lo que sí muestra el tablero es el campo que afirma superar, y el campo está más cerca de lo que sugiere un encuadre de «corona»:
• Grok Voice Transcribe 2.0 — 2,73% de WER en la transcripción final a los 0,49 segundos después del final del habla, según Artificial Analysis, y el líder actual de la tabla. Eso es 0,23 puntos por detrás del 2,5% que Microsoft afirma, y aproximadamente cuatro veces más lento en estabilizarse — la diferencia entre un subtítulo que sigue el ritmo y uno que se queda atrás.
• Muse Voice Transcribe — 3,06 % a 0,16 segundos, según Artificial Analysis. El competidor más cercano en latencia: unos 30 milisegundos por detrás, y 0,5 puntos peor en precisión que la afirmación de Microsoft.
• ElevenLabs Scribe v2 Realtime — 3,59 % en 0,14 segundos, según Artificial Analysis. En la práctica, empatado en velocidad, más de un punto por detrás en precisión.
• Gemini 3.5 Transcribe Live — 4,00 % de WER en streaming a 0,40 segundos, la cifra que publicó Artificial Analysis y que Google cita para su propio modelo Live API. Es una diferencia de 1,5 puntos, y es la comparación a la que apunta esta versión.
La columna de primera parcial es donde la afirmación se parece menos al resto del tablero. En la misma herramienta de seguimiento, las primeras parciales de Grok Voice Transcribe 2.0 se sitúan en 3,36 % y las de Gemini 3.5 Transcribe Live, en 5,77 % — se supone que las parciales son peores que la transcripción final, a menudo por un punto o más, porque el modelo se compromete antes de que termine la frase. Una primera parcial que coincide con el número final es la parte genuinamente inusual del lanzamiento de Microsoft, y es la parte que los propios datos de la herramienta de seguimiento aún no pueden confirmar. Cítala como una afirmación hasta que exista una fila.
La salvedad honesta es que 0,13 segundos y 0,16 segundos son la misma experiencia de producto para una persona que lee subtítulos, y un 2,5 % frente al 2,73 % que actualmente lidera la tabla equivale a unos 2 errores por cada 1.000 palabras. Una ventaja de ese tamaño es real, pero pequeña, y que sea una ventaja que alguien pueda percibir depende de la carga de trabajo. Donde de verdad muerde es en la cola: un flujo de un centro de contacto que funciona ocho horas al día con un 2,73 % frente a un 2,5 % supone decenas de miles de palabras erróneas adicionales al año, y los errores de palabras en una transcripción no se distribuyen de manera uniforme: se concentran precisamente en los nombres propios y las cifras que hacen útil una transcripción.

Lo que compran $9.00 por cada 1,000 minutos
El streaming cuesta más que el procesamiento por lotes, y Microsoft lo situó en la parte superior del nivel en tiempo real en lugar de por debajo. MAI-Transcribe-2-Streaming tiene un precio de $0.54 por hora de audio, lo que equivale a $9.00 por cada 1000 minutos de audio transmitido, descrito como una tarifa introductoria válida hasta finales de año. A modo de comparación, el procesamiento por lotes de MAI-Transcribe-2 es de $0.10 por hora de audio — $1.67 por cada 1000 minutos — por lo que la transcripción en tiempo real cuesta aproximadamente 5.4× la tarifa basada en archivos para la misma familia subyacente y 0.5 puntos más de error de palabras. Eso no es un sobreprecio que Microsoft esté ocultando; es el precio honesto de una conexión persistente y una transcripción parcial que tiene que ser correcta antes de que termine la frase.
Frente al resto del nivel de streaming, el panorama es mixto. MAI-Transcribe-2-Streaming empata con Gemini 3.5 Transcribe Live a aproximadamente $9 por 1.000 minutos: más preciso, mismo costo. Se sitúa por encima de ElevenLabs Scribe v2 Realtime y Deepgram Flux a unos $6,50 por 1.000 minutos, por encima de Cartesia Ink-2 a unos $4, y aproximadamente el triple de Muse Voice Transcribe, a unos $3. Así que el lanzamiento es una estrategia centrada en la precisión y la latencia con precios equivalentes, no una guerra de precios; los equipos que ya usan un modelo de streaming más barato estarán intercambiando dólares por puntos de WER.
Ese trade-off merece nombrarse con precisión, porque es el mismo trade-off que invirtió el lanzamiento por lotes. En septiembre, Microsoft hizo que la precisión fuera barata. En octubre, hizo que la precisión en tiempo real costara lo mismo que la de todos los demás. Si tu pipeline solo necesita transcripciones en algún momento, nada de lo del 1 de octubre cambia tu factura. Si las necesita mientras la llamada sigue ocurriendo, el cálculo acaba de pasar a la calidad.

Construir a partir de una transcripción es la otra mitad de esa decisión, y es donde una capa multimodelo se gana su lugar. Una transcripción en tiempo real rara vez es el final del pipeline —se resume, se puntúa, se busca, se enruta y se escala—, y esos pasos requieren modelos diferentes a costos diferentes. OrcaRouter existe para esa capa: una API para más de 200 modelos, precios de lista de los proveedores traspasados con 0 % de margen, conmutación por error automática, y un DSL de enrutamiento que puede enviar una transcripción en vivo a un modelo para filtrado de cumplimiento y a otro para notas de reunión sin una segunda integración. MAI-Transcribe-2-Streaming en sí no está en esa lista —se sirve a través del propio stack de voz de Microsoft—, pero la transcripción en streaming que produce es exactamente el tipo de entrada de alto volumen y sensible a la latencia que justifica mantener la capa que está por encima agnóstica respecto al modelo.
Lo que aún no está probado
Hay tres cosas que están genuinamente abiertas. Primero, la diarización: el modelo por lotes incluye la atribución de hablante sin una tasa de error de diarización publicada, y el material de streaming de Microsoft no hace ninguna afirmación sobre diarización en absoluto; para un modelo en tiempo real que alimenta asistencia en vivo para agentes o subtítulos, quién dijo qué suele ser la característica que importa más que el WER bruto. Segundo, el desglose multilingüe: 60 idiomas con detección automática y continua de idioma es una afirmación amplia, y la latencia por idioma de un modelo de streaming puede variar mucho más que la de su equivalente por lotes, porque la calidad de la transcripción parcial depende de la rapidez con que el modelo se decanta por un idioma. Microsoft no ha publicado ninguna tabla de streaming por idioma. Tercero, el WER de streaming se mide con audio de benchmark limpio; el modo de fallo que perjudica a las implementaciones reales es un flujo de campo lejano ruidoso, y el día del lanzamiento no existía ninguna comparación independiente de streaming en campo lejano.
Donde deja tu stack
Lo interesante de este lanzamiento no es que Microsoft tenga la transcripción en streaming más precisa. Es la cadencia: por lotes en septiembre, streaming en octubre, en la misma familia, en la misma superficie de documentación, con una estructura de precios que ahora abarca de $1.67 a $9.00 por 1,000 minutos para la misma capacidad subyacente. Eso les da a los equipos una elección real por primera vez —pagar por tiempo real solo donde el tiempo real importa, y usar lotes para todo lo demás—, pero también significa que la capa de transcripción ahora es algo que se ajusta por carga de trabajo en lugar de estandarizarse una vez.
Tome la afirmación del titular al pie de la letra y se sostiene como una declaración de proveedor: Microsoft dice que MAI-Transcribe-2-Streaming es el primero tanto en precisión de la transcripción final como en la del primer parcial, y que se sitúa en la frontera de Pareto. Los asteriscos son que el tablero del rastreador aún no ha graficado el modelo, la ventaja que afirma tener sobre el líder actual es lo suficientemente pequeña como para desaparecer en una nueva ejecución, la ventaja de precio es cero, y la historia de la diarización aún no se ha contado. Esas son las cosas que hay que vigilar, no la corona.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
