Tarjeta principal del artículo que dice «MAI-Transcribe-2-Streaming ya está disponible» con la insignia «NUEVO MODELO · MICROSOFT AI» y el subtítulo «Microsoft se lleva la corona de la transcripción en streaming con un 2,5 % de WER», con una tira de estadísticas que muestra una tasa de error de palabras en streaming del 2,5 % a 0,13 s después del final del habla, etiquetada en la tarjeta como afirmación de Microsoft y como una primicia tanto para transcripciones finales como parciales; 60 idiomas con detección automática continua de idioma; y 9,00 $ por 1.000 minutos, descrito como 0,54 $ por hora de audio en tarifa introductoria hasta 2026; sobre un degradado de blanco a azul con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

MAI-Transcribe-2-Streaming ya está disponible: Microsoft se lleva la corona de la transcripción en streaming con un 2,5% de WER

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

MAI-Transcribe-2-Streaming es la respuesta de Microsoft AI a la única pregunta que su lanzamiento de septiembre dejó abierta, y la respondió en 28 días. Lanzado el 1 de octubre de 2026, MAI-Transcribe-2-Streaming es un modelo de conversión de voz a texto en tiempo real que transcribe a medida que llegan las palabras en lugar de hacerlo después de que el archivo termina. Microsoft afirma que ocupa el primer lugar en precisión tanto en transcripciones finales como parciales en la evaluación AA-WER Streaming de Artificial Analysis, con una tasa de error de palabras del 2,5 % y la transcripción final lista 0,13 segundos después de finalizar el habla. Esa es una afirmación del proveedor basada en la metodología de un rastreador, más que una fila que el rastreador publica — al momento de redactar esto, los 37 modelos de la tabla no lo incluyen, y el modelo al que desplazaría es Gro​k Voice Transcribe 2.0 (Streaming), con 2,73 % y 0,49 segundos. El modelo en el que se basa, MAI-Transcribe-2, se lanzó el 3 de septiembre como un modelo por lotes con una WER del 2,0 % y sin SKU en tiempo real; la variante en streaming cierra esa brecha sin renunciar a gran parte de la precisión que hizo notable la versión por lotes. Lo que sí sacrifica es el precio: el streaming cuesta 5,4× la tarifa por lotes en el lanzamiento.

El enfoque que Microsoft quiere es una barrida total de la tabla de streaming. El enfoque que respaldan los números es más acotado y más interesante: un modelo que afirma liderar en precisión y latencia a la vez, en una frontera donde la entrada más precisa de la tabla tarda cuatro veces más en estabilizarse que las más rápidas, y ninguna de esas rápidas tiene una tasa de error de palabra inferior al 3 %, con un precio a la par del incumbente en lugar de por debajo. Aquí está el lanzamiento tal como ocurrió, con las afirmaciones del proveedor etiquetadas.

Qué lanzó Microsoft el 1 de octubre

MAI-Transcribe-2-Streaming se sirve a través de la pila de voz de Microsoft en el servicio Azure AI Speech, con documentación bajo el nombre del propio modelo y el mismo modelo de distribución solo API, sin pesos, que la versión por lotes. Transcribe 60 idiomas con detección automática y continua de idioma, por lo que una sesión que cambia de idioma a mitad del flujo no necesita declararse de antemano. Microsoft lo posiciona en la frontera de Pareto de precisión frente a latencia del gráfico de streaming de Artificial Analysis —la lectura que el propio proveedor hace de los datos del rastreador, y la lectura que respalda el propio gráfico del rastreador.

El modelo de streaming no era todo el lanzamiento. Microsoft lanzó junto a él dos modelos de voz: MAI-Voice-2.1, que cubre 23 idiomas en 26 configuraciones regionales, y MAI-Voice-2.1-Flash, que procesa hasta 45 segundos de audio con una latencia de aproximadamente 150 ms. Visto en conjunto, el lanzamiento del 1 de octubre es una pila conversacional completa en tiempo real —oír, comprender, hablar— en lugar del lanzamiento de un solo modelo.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models as accurate, fast and low cost, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

Leyendo la clasificación de streaming

AA-WER Streaming mide dos cosas por modelo: cuán incorrecta es la transcripción final y cuánto tarda en finalizar después de que el hablante se detiene. La afirmación de Microsoft es que MAI-Transcribe-2-Streaming lidera en ambas: 2,5 % de tasa de error de palabras en la transcripción final a 0,13 segundos después del final del habla, y el mismo 2,5 % en la primera transcripción parcial a 0,12 segundos, lo que, según Microsoft, es el primero en precisión en ambas. Tómalo como una cifra de proveedor — al momento de redactar, el propio tablero de streaming del tracker aún no ha trazado el modelo, así que no hay una fila independiente de MAI-Transcribe-2-Streaming que leer. Lo que sí muestra el tablero es el campo que afirma superar, y el campo está más cerca de lo que sugiere un encuadre de «corona»:

• Grok Voice Transcribe 2.0 — 2,73% de WER en la transcripción final a los 0,49 segundos después del final del habla, según Artificial Analysis, y el líder actual de la tabla. Eso es 0,23 puntos por detrás del 2,5% que Microsoft afirma, y aproximadamente cuatro veces más lento en estabilizarse — la diferencia entre un subtítulo que sigue el ritmo y uno que se queda atrás.

• Muse Voice Transcribe — 3,06 % a 0,16 segundos, según Artificial Analysis. El competidor más cercano en latencia: unos 30 milisegundos por detrás, y 0,5 puntos peor en precisión que la afirmación de Microsoft.

• ElevenLabs Scribe v2 Realtime — 3,59 % en 0,14 segundos, según Artificial Analysis. En la práctica, empatado en velocidad, más de un punto por detrás en precisión.

• Gemini 3.5 Transcribe Live — 4,00 % de WER en streaming a 0,40 segundos, la cifra que publicó Artificial Analysis y que Google cita para su propio modelo Live API. Es una diferencia de 1,5 puntos, y es la comparación a la que apunta esta versión.

La columna de primera parcial es donde la afirmación se parece menos al resto del tablero. En la misma herramienta de seguimiento, las primeras parciales de Grok Voice Transcribe 2.0 se sitúan en 3,36 % y las de Gemini 3.5 Transcribe Live, en 5,77 % — se supone que las parciales son peores que la transcripción final, a menudo por un punto o más, porque el modelo se compromete antes de que termine la frase. Una primera parcial que coincide con el número final es la parte genuinamente inusual del lanzamiento de Microsoft, y es la parte que los propios datos de la herramienta de seguimiento aún no pueden confirmar. Cítala como una afirmación hasta que exista una fila.

La salvedad honesta es que 0,13 segundos y 0,16 segundos son la misma experiencia de producto para una persona que lee subtítulos, y un 2,5 % frente al 2,73 % que actualmente lidera la tabla equivale a unos 2 errores por cada 1.000 palabras. Una ventaja de ese tamaño es real, pero pequeña, y que sea una ventaja que alguien pueda percibir depende de la carga de trabajo. Donde de verdad muerde es en la cola: un flujo de un centro de contacto que funciona ocho horas al día con un 2,73 % frente a un 2,5 % supone decenas de miles de palabras erróneas adicionales al año, y los errores de palabras en una transcripción no se distribuyen de manera uniforme: se concentran precisamente en los nombres propios y las cifras que hacen útil una transcripción.

A generated comparison card titled 'The streaming field, by the numbers' with a left column for MAI-Transcribe-2-Streaming (final-transcript word error rate 2.5% flagged as Microsoft's claim, time to final transcript 0.13s after speech end, first-partial word error rate 2.5% at 0.12s flagged as claimed, $9.00 per 1,000 minutes introductory, 60 languages with automatic detection, and 'not yet plotted' for the tracker's board) and a right column headed 'The field it claims to beat' listing Grok Voice Transcribe 2.0 at 2.73% and 0.49s, Muse Voice Transcribe at 3.06% and 0.16s, ElevenLabs Scribe v2 Realtime at 3.59% and 0.14s, Qwen3 ASR Flash Realtime at 3.73% and 0.48s, Gemini 3.5 Transcribe Live at 4.00% and 0.40s, and a board size of 37 models, with a footer noting that Microsoft's figures are the vendor's own claim measured on Artificial Analysis's streaming methodology while the right-hand column is what Artificial Analysis currently publishes, all times being after detected end of speech, and the OrcaRouter logo bottom right.

Lo que compran $9.00 por cada 1,000 minutos

El streaming cuesta más que el procesamiento por lotes, y Microsoft lo situó en la parte superior del nivel en tiempo real en lugar de por debajo. MAI-Transcribe-2-Streaming tiene un precio de $0.54 por hora de audio, lo que equivale a $9.00 por cada 1000 minutos de audio transmitido, descrito como una tarifa introductoria válida hasta finales de año. A modo de comparación, el procesamiento por lotes de MAI-Transcribe-2 es de $0.10 por hora de audio — $1.67 por cada 1000 minutos — por lo que la transcripción en tiempo real cuesta aproximadamente 5.4× la tarifa basada en archivos para la misma familia subyacente y 0.5 puntos más de error de palabras. Eso no es un sobreprecio que Microsoft esté ocultando; es el precio honesto de una conexión persistente y una transcripción parcial que tiene que ser correcta antes de que termine la frase.

Frente al resto del nivel de streaming, el panorama es mixto. MAI-Transcribe-2-Streaming empata con Gemini 3.5 Transcribe Live a aproximadamente $9 por 1.000 minutos: más preciso, mismo costo. Se sitúa por encima de ElevenLabs Scribe v2 Realtime y Deepgram Flux a unos $6,50 por 1.000 minutos, por encima de Cartesia Ink-2 a unos $4, y aproximadamente el triple de Muse Voice Transcribe, a unos $3. Así que el lanzamiento es una estrategia centrada en la precisión y la latencia con precios equivalentes, no una guerra de precios; los equipos que ya usan un modelo de streaming más barato estarán intercambiando dólares por puntos de WER.

Ese trade-off merece nombrarse con precisión, porque es el mismo trade-off que invirtió el lanzamiento por lotes. En septiembre, Microsoft hizo que la precisión fuera barata. En octubre, hizo que la precisión en tiempo real costara lo mismo que la de todos los demás. Si tu pipeline solo necesita transcripciones en algún momento, nada de lo del 1 de octubre cambia tu factura. Si las necesita mientras la llamada sigue ocurriendo, el cálculo acaba de pasar a la calidad.

A single-column scoreboard card titled 'MAI-Transcribe-2-Streaming — the launch scoreboard' listing 2.5% final-transcript WER at 0.13s, 2.5% first-partial WER at 0.12s, an accuracy rank claimed at #1 for final and partial transcripts, tracker status 'not yet plotted on the 37-model board', $9.00 per 1,000 minutes ($0.54 per audio-hour) introductory through 2026, 60 languages with automatic continuous detection, no published diarization or word-level timestamp claim for the streaming SKU, and the batch sibling MAI-Transcribe-2 at 2.0% AA-WER, roughly 411x real time and $1.67 per 1,000 minutes, with the OrcaRouter logo bottom right.

Construir a partir de una transcripción es la otra mitad de esa decisión, y es donde una capa multimodelo se gana su lugar. Una transcripción en tiempo real rara vez es el final del pipeline —se resume, se puntúa, se busca, se enruta y se escala—, y esos pasos requieren modelos diferentes a costos diferentes. OrcaRouter existe para esa capa: una API para más de 200 modelos, precios de lista de los proveedores traspasados con 0 % de margen, conmutación por error automática, y un DSL de enrutamiento que puede enviar una transcripción en vivo a un modelo para filtrado de cumplimiento y a otro para notas de reunión sin una segunda integración. MAI-Transcribe-2-Streaming en sí no está en esa lista —se sirve a través del propio stack de voz de Microsoft—, pero la transcripción en streaming que produce es exactamente el tipo de entrada de alto volumen y sensible a la latencia que justifica mantener la capa que está por encima agnóstica respecto al modelo.

Lo que aún no está probado

Hay tres cosas que están genuinamente abiertas. Primero, la diarización: el modelo por lotes incluye la atribución de hablante sin una tasa de error de diarización publicada, y el material de streaming de Microsoft no hace ninguna afirmación sobre diarización en absoluto; para un modelo en tiempo real que alimenta asistencia en vivo para agentes o subtítulos, quién dijo qué suele ser la característica que importa más que el WER bruto. Segundo, el desglose multilingüe: 60 idiomas con detección automática y continua de idioma es una afirmación amplia, y la latencia por idioma de un modelo de streaming puede variar mucho más que la de su equivalente por lotes, porque la calidad de la transcripción parcial depende de la rapidez con que el modelo se decanta por un idioma. Microsoft no ha publicado ninguna tabla de streaming por idioma. Tercero, el WER de streaming se mide con audio de benchmark limpio; el modo de fallo que perjudica a las implementaciones reales es un flujo de campo lejano ruidoso, y el día del lanzamiento no existía ninguna comparación independiente de streaming en campo lejano.

Donde deja tu stack

Lo interesante de este lanzamiento no es que Microsoft tenga la transcripción en streaming más precisa. Es la cadencia: por lotes en septiembre, streaming en octubre, en la misma familia, en la misma superficie de documentación, con una estructura de precios que ahora abarca de $1.67 a $9.00 por 1,000 minutos para la misma capacidad subyacente. Eso les da a los equipos una elección real por primera vez —pagar por tiempo real solo donde el tiempo real importa, y usar lotes para todo lo demás—, pero también significa que la capa de transcripción ahora es algo que se ajusta por carga de trabajo en lugar de estandarizarse una vez.

Tome la afirmación del titular al pie de la letra y se sostiene como una declaración de proveedor: Microsoft dice que MAI-Transcribe-2-Streaming es el primero tanto en precisión de la transcripción final como en la del primer parcial, y que se sitúa en la frontera de Pareto. Los asteriscos son que el tablero del rastreador aún no ha graficado el modelo, la ventaja que afirma tener sobre el líder actual es lo suficientemente pequeña como para desaparecer en una nueva ejecución, la ventaja de precio es cero, y la historia de la diarización aún no se ha contado. Esas son las cosas que hay que vigilar, no la corona.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario