Tarjeta de héroe de artículo que dice «MAI-Transcribe-2 ya está disponible» con la insignia «NEWS · MICROSOFT AI» y el subtítulo «La apuesta de Microsoft de $0.10 por hora para dominar el reconocimiento de voz a texto», con una franja de estadísticas que muestra AA-WER 2.0% (#2 según Artificial Analysis), velocidad ~411x en tiempo real (#2) y un precio de lanzamiento de $0.10 por hora, sobre un degradado de blanco a azul con el logotipo de OrcaRouter en la parte inferior derecha.
Guides & Insights

MAI-Transcribe-2 ya está disponible: la apuesta de Microsoft de $0.10 por hora para dominar la transcripción de voz a texto.

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

MAI-Transcribe-2 es el modelo con el que Microsoft AI apuesta a que el reconocimiento de voz se convierta en un commodity en lugar de una función premium, y las cifras con las que se lanzó están diseñadas para defender esa tesis. Publicado el 3 de septiembre de 2026 en vista previa pública en Microsoft Foundry, MAI Playground y las API propias de Microsoft, MAI-Transcribe-2 es el tercer modelo de voz de Microsoft en cinco meses —después de MAI-Transcribe-1 en abril a 0,36 USD por hora de audio y de MAI-Transcribe-1.5 en junio—, y el primero que supera a todos los rivales gestionados que menciona en las dos métricas que los equipos realmente usan para decidir sus compras. En la clasificación de tasa de error de palabras no streaming de Artificial Analysis se sitúa en un 2,0 % de AA-WER, en segunda posición, y en aproximadamente 411× tiempo real, también en segunda, lo que en conjunto lo coloca en la frontera de Pareto de precisión y velocidad: en esa tabla, ningún modelo es a la vez más preciso y más rápido. El precio de lanzamiento es aproximadamente un 72 % inferior al de su propio predecesor.

El "modelo de reconocimiento de voz más rápido, preciso y barato del mundo" es el propio titular de Microsoft para el lanzamiento, y merece leerse con los asteriscos del material original adjuntos. Esta es la historia del lanzamiento tal como ocurrió realmente, con las afirmaciones del proveedor etiquetadas y las partes que aún necesitan pruebas separadas.

Lo que Microsoft realmente lanzó

MAI-Transcribe-2 es un modelo de transcripción por lotes para audio pregrabado, orientado específicamente al audio de larga duración: reuniones, llamadas, archivos multimedia y grabaciones de centros de contacto. Microsoft lo posiciona para exactamente las cargas de trabajo donde dominan el rendimiento y el costo por minuto. Transcribe en 60 idiomas y cuenta con identificación automática de idioma, incluye diarización de hablantes que atribuye las palabras a la persona correcta, devuelve marcas de tiempo a nivel de palabra y admite ponderación de palabras clave para nombres, abreviaturas y terminología especializada. Dos estilos de transcripción configurables abarcan la división habitual: «verbatim», que conserva las muletillas y los falsos arranques para transcripciones de grado normativo, y «clean», que elimina las disfluencias para subtítulos y notas. Microsoft también destaca la alternancia de código en el habla con idiomas mezclados, como el hinglish y el espanglish, y la robustez en audio ruidoso del mundo real.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2 (dated September 3, 2026), showing the headline 'MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world' and the opening paragraph naming new features — diarization, configurable transcription styles, word-level timestamps — and comparisons against Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large and Scribe V2.

La historia de la disponibilidad importa tanto como la lista de funciones. Microsoft no está restringiendo este modelo tras su stack de voz empresarial: hoy se puede probar desde el MAI Playground y se sirve a través de Microsoft Foundry en vista previa pública, con la documentación de Foundry alojada en el servicio Azure AI Speech. Esa es una decisión de distribución deliberada: poner el modelo de frontera donde un desarrollador pueda acceder a él con una clave, no donde un ciclo de ventas empresarial tenga que aprobarlo primero. Microsoft no ha publicado los pesos, y nada en el material de lanzamiento sugiere que lo haga.

Leyendo el titular literalmente

«El más rápido, el más preciso y el más barato del mundo» son tres afirmaciones de distinta fuerza, y la propia publicación de lanzamiento rebaja discretamente dos de ellas. La versión honesta de cada una:

— Precisión: en la clasificación de Artificial Analysis, MAI-Transcribe-2 ocupa el segundo lugar con un 2,0 % de AA-WER, no el primero; el propio texto de Microsoft dice segundo. La frase de «el más preciso» solo se sostiene si se lee como «entre las API por lotes administradas que se registran en este nivel», y aun así se trata de una afirmación sobre un modelo de cuatro días, no una corona consolidada. Por separado, Microsoft informa que ocupa el primer lugar en el punto de referencia multilingüe FLEURS con un WER promedio del 5,2 % en sus 60 idiomas; esa cifra proviene de la publicación de lanzamiento de Microsoft y aún no se ha vuelto a derivar de forma independiente por idioma.

Velocidad — Según Artificial Analysis, MAI-Transcribe-2 funciona a aproximadamente 411× el tiempo real, segundo en ese ranking. Curiosamente, el anuncio de Microsoft nunca publica el número absoluto; en su lugar, abre con multiplicadores relativos más amigables — «procesamiento hasta 10× más rápido que los principales competidores, especialmente para audio de formato largo», y específicamente 10× más rápido que GPT-Transcribe de OpenAI, 7× más rápido que Scribe v2 de ElevenLabs y 5× más rápido que Gemini 3.5 Transcribe. Esas proporciones son el marco que Microsoft da a los mismos datos de Artificial Analysis, y las tasas base importan: «5× más rápido que Gemini 3.5 Transcribe» suena como una brecha modesta hasta que lo conviertes en minutos de cómputo por hora de audio.

— Más barato — Cierto solo dentro de dos límites que Microsoft indica claramente. La tarifa de $0.10 es una "oferta por tiempo limitado hasta fin de año," y no se revela ningún precio estándar posterior a la promoción en ningún lugar del material de lanzamiento. Y es el más barato entre las API gestionadas de alta precisión; un modelo abierto autoalojado como Whisper Large v3 Turbo aún transcribe por, efectivamente, el costo de la electricidad. El argumento de la mercantilización es real — solo que es más limitado de lo que sugiere el titular.

Screenshot of the Artificial Analysis Speech-to-Text leaderboard summary table showing Word Error Rate and Median Speed Factor columns for models including MAI-Transcribe-2 and MAI-Transcribe-1.5 under Microsoft AI, alongside rows for ElevenLabs Scribe v2 and Gemini 3.5 Transcribe.

Lo que se obtiene con $1.67 por cada 1,000 minutos

Con un precio de $0.10 por hora de audio, MAI-Transcribe-2 equivale a unos $1.67 por cada 1.000 minutos de audio. La comparación que hace que la cifra cobre sentido es contra las otras API de transcripción administradas que compiten en precisión. GPT-Transcribe se ofrece a $4.50 por 1.000 minutos; el nivel para audio pregrabado de Gemini 3.5 Transcribe equivale a unos $5 por 1.000 minutos según el sistema de precios por tokens de Google; y Scribe v2 de ElevenLabs tiene un precio de lista aún mayor. En 1.000 horas de audio al mes —una carga de trabajo seria pero no enorme para un centro de contacto o para medios—, la diferencia entre MAI-Transcribe-2 a la tarifa de lanzamiento y GPT-Transcribe a precio de lista es del orden de $170 al mes, todos los meses, antes de tener en cuenta cualquier diferencia de precisión. Esa es la brecha de precios que hace que la transcripción deje de ser una partida que los equipos optimizan y pase a ser una partida que ignoran.

Dos advertencias deben mencionarse de la mano. Primero, un precio promocional es un experimento de precios hasta que deja de serlo: los equipos que construyen un producto sobre la tarifa de $0.10 deben saber que la tarifa estándar no se ha revelado, y la cifra honesta para planificar un presupuesto de 2027 se sitúa en algún punto entre la oferta de lanzamiento y lo que Microsoft nombre cuando la oferta expire. Segundo, «lo más barato en este nivel de precisión» no dice nada sobre el costo total de propiedad: el modelo es solo vía API, por lo que la comparación que importa para equipos de alto volumen es $1.67 por cada 1,000 minutos frente al costo totalmente cargado de operar su propia pila de pesos abiertos, no solo frente a otras APIs.

Comprimido en un marcador, la posición de lanzamiento se ve así: cada cifra que aparece a continuación lleva la etiqueta de fuente que se le adjuntó en el texto anterior.

A single-column scoreboard titled 'MAI-Transcribe-2 — the scoreboard' listing AA-WER 2.0% (#2 per Artificial Analysis), speed ~411x real time (#2), price $1.67 per 1,000 minutes early-bird through 2026, 60 languages with automatic language ID, bundled diarization with unpublished error rate, and no streaming SKU announced, with the OrcaRouter logo bottom right.

Lo que aún no está probado

Por toda la especificidad de las afirmaciones del lanzamiento, hay tres cosas que siguen genuinamente abiertas. La primera es la transmisión en streaming: MAI-Transcribe-2 es un modelo por lotes, la historia de velocidad de Microsoft trata sobre el rendimiento de archivos, y no se ha anunciado ni demostrado ningún SKU en tiempo real — el «411×» no es una cifra de latencia de transcripción en vivo. La segunda es la calidad de la diarización: la atribución de hablantes está incluida, pero Microsoft no publica ninguna tasa de error de diarización, y esa es la función que probablemente parezca peor en las pruebas independientes de lo que lo hace la WER. La tercera es el desglose multilingüe: un único promedio de FLEURS para 60 idiomas puede ocultar una amplia variación entre idiomas, y Microsoft no ha publicado la tabla por idioma. Cada una es una razón por la que la historia no está terminada en el cuarto día.

Dónde sale de tu stack de transcripción.

Nada de esto exige elegir MAI-Transcribe-2 hoy, que es precisamente por lo que el precio merece atención por parte de equipos que no están buscando un nuevo proveedor. La conversión de voz a texto rara vez es el final del pipeline: las transcripciones se resumen, se convierten en acciones, se buscan y se enrutan, y es en esa capa posterior donde una configuración multimodelo demuestra su valor. Una plataforma como OrcaRouter existe para esa mitad del stack: una sola API entre más de 200 modelos, precios de lista del proveedor transmitidos sin margen, conmutación automática por error y un DSL de enrutamiento que permite que una transcripción alimente a un modelo distinto según la carga de trabajo — actas de reunión a un resumidor, revisión de cumplimiento a otro — sin una segunda integración. MAI-Transcribe-2 en sí no está hoy en ese catálogo; vive en la API propia de Microsoft y en las plataformas de terceros que Microsoft lista. Pero el precio de commodity que acaba de fijar es el mejor argumento hasta ahora para construir la parte por encima de la transcripción de manera que sea agnóstica al modelo.

El precio de lanzamiento lo dice todo. Microsoft no está intentando ganar en conversión de voz a texto solo por características: está intentando que la alta precisión sea tan barata que la categoría deje de ser una partida presupuestaria. MAI-Transcribe-2 merece la atención que está recibiendo; solo hay que leer "el más rápido, preciso y barato del mundo" con los tres asteriscos adjuntos: segundo en AA-WER, precios promocionales hasta fin de año, y una historia de streaming que aún no se ha contado.