
MAI-Transcribe-2-Streaming vs MAI-Transcribe-2: Paga 5,4× por la sincronización a nivel de palabra
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 221 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
MAI-Transcribe-2-Streaming y MAI-Transcribe-2 son la misma familia de modelos dividida en dos niveles de precios, y la división es lo bastante clara como para planificar en función de ella. MAI-Transcribe-2 se lanzó el 3 de septiembre de 2026 como modelo por lotes: una tasa de error de palabras del 2,0 % en la tabla sin streaming de Artificial Analysis, aproximadamente 411× en tiempo real y $0,10 por hora de audio — alrededor de $1,67 por 1000 minutos. MAI-Transcribe-2-Streaming se lanzó el 1 de octubre de 2026 como la variante en tiempo real: una tasa declarada de error de palabras en streaming del 2,5 % con 0,13 segundos hasta la transcripción final, que Microsoft describe como la primera en precisión tanto en transcripciones finales como parciales, medida según la metodología de streaming de Artificial Analysis en lugar de estar ya representada como una fila en la tabla del rastreador. $0,54 por hora de audio — alrededor de $9,00 por 1000 minutos. Los mismos 60 idiomas, la misma distribución solo por API, sin pesos publicados. El streaming cuesta 5,4× la tarifa por lotes y, según los propios números de Microsoft, 0,5 puntos de precisión. Que eso sea una ganga o un impuesto depende por completo de una pregunta: ¿algo en tu pipeline necesita la transcripción antes de que termine la frase?
Como los dos modelos provienen de un solo proveedor y una sola superficie de documentación, la comparación es inusualmente limpia: nada de adivinar paridad de funciones, nada de desajustes entre versiones de benchmarks, nada de «sus números frente a nuestros números». Es un único proveedor que pone precio a dos velocidades de la misma capacidad, y el trabajo interesante consiste en averiguar qué cargas de trabajo cubre en realidad el nivel económico.
La familia, en dos filas
• MAI-Transcribe-2 — por lotes, audio pregrabado, lanzado el 3 de septiembre de 2026. 2,0 % de AA-WER, segundo en la clasificación de modelos no de transmisión en vivo de Artificial Analysis. Aproximadamente 411× el tiempo real, también en segundo lugar. $0,10 por hora de audio, unos $1,67 por cada 1.000 minutos, como oferta por tiempo limitado hasta fin de año y sin precio estándar publicado. Incluye diarización de hablantes y devuelve marcas de tiempo a nivel de palabra. 60 idiomas con identificación automática del idioma.
• MAI-Transcribe-2-Streaming — transcripción continua en tiempo real, al estilo WebSocket, lanzado el 1 de octubre de 2026. Microsoft informa un WER de la transcripción final del 2,5 % a los 0,13 segundos tras el final del habla, y el mismo 2,5 % en el primer resultado parcial a los 0,12 segundos, lo que describe como primero en precisión en ambos — una afirmación del proveedor medida según la metodología de streaming de Artificial Analysis, aunque, al momento de redactar esto, el propio tablero del rastreador (37 modelos) aún no ha graficado el modelo, y su líder actual es Grok Voice Transcribe 2.0 con 2,73 % y 0,49 segundos. $0,54 por hora de audio, alrededor de $9,00 por 1.000 minutos, introductorio hasta fin de año. 60 idiomas con detección automática y continua del idioma. Sin afirmaciones publicadas sobre diarización ni sobre marcas de tiempo por palabra.
La única asimetría que no tiene que ver con la velocidad ni con el precio es la capacidad: la diarización y las marcas de tiempo por palabra del modelo por lotes son funciones documentadas, y las del modelo de streaming no lo son. Eso importa más que la diferencia de 0,5 puntos de precisión, y es la razón por la que muchos equipos terminarán usando ambos.

Lo que realmente ofrece 5.4×
A $1,67 por cada 1000 minutos, la transcripción por lotes en este nivel de precisión es casi gratis en el margen. A $9,00 por cada 1000 minutos, el streaming es una partida real: aproximadamente el costo de transcribir el mismo audio cinco veces, más medio punto de precisión. Así que la pregunta no es si el tiempo real vale más; es qué minutos específicos lo necesitan.
Las cargas de trabajo donde claramente lo es: subtítulos en vivo que una persona lee mientras el hablante habla, donde 0,13 segundos frente al final del archivo es todo el producto; asistencia en tiempo real para agentes y evaluación de cumplimiento, donde una intervención que llega después de que la llamada ha terminado no sirve de nada; y aplicaciones de voz interactivas, donde un turno no puede completarse hasta que lo hace la transcripción. En las tres, el modelo por lotes no es una opción más barata, sino que directamente no es una opción: no hay precio al que la transcripción a posteriori se convierta en tiempo real.
Las cargas de trabajo en las que claramente no lo es: grabaciones de reuniones y llamadas procesadas a posteriori, archivos multimedia, control de calidad por lotes de centros de contacto, revisión de cumplimiento de llamadas completadas, subtitulado de pódcasts y vídeos. Estos son exactamente los flujos de trabajo donde la tasa de 411× el tiempo real y $1.67 del modelo por lotes fue diseñada para ganar, y pagar 5.4× para recortar unos cientos de milisegundos de una transcripción que nadie lee hasta mañana es un desperdicio evidente. Añada las funciones de diarización y de marcas de tiempo por palabra —el modelo por lotes las tiene documentadas, el modelo de streaming no—, y el caso post-hoc se vuelve más fuerte, no más débil.
El punto medio interesante es donde ambos son genuinamente complementarios: usar streaming para la superficie en vivo y batch para el registro. Una llamada de soporte transcrita en tiempo real para alimentar un panel de asistencia al agente, y luego retranscrita por lotes durante la noche para producir la transcripción de archivo con diarización y marcas de tiempo, cuesta un pequeño sobrecoste frente al batch por sí solo y consigue ambos comportamientos. Ese patrón solo se volvió posible en septiembre, y la versión de octubre es la que lo completa.
Donde se muestra la estructura de dos divisiones
Dos cosas de esta familia merecen atención porque son estructurales y no incidentales.
En primer lugar, la jerarquía de precisión está invertida respecto del patrón habitual. Los modelos de streaming normalmente pagan una penalización sustancial en precisión por la salida en tiempo real; aquí la penalización es de 0,5 puntos, del 2,0 % en la tabla por lotes a un 2,5 % declarado en la de streaming. Microsoft logró un modelo en tiempo real a medio punto de su buque insignia por lotes según sus propios números, lo que constituye el verdadero logro de ingeniería del lanzamiento de octubre si se mantiene —no la posición en lo más alto de la tabla, que una buena nueva ejecución podría mover y que el rastreador aún no ha confirmado.
Segundo, el precio también está invertido respecto del patrón habitual. Los proveedores normalmente aplican descuento al nivel de mayor volumen; Microsoft puso el precio del streaming a 5,4× el de batch y dejó ambos en tarifas introductorias que vencen al mismo tiempo. Eso suena menos a un sobreprecio deliberado por streaming y más a dos lanzamientos separados, cada uno con un descuento de lanzamiento, sin una tarifa estándar publicada para ninguno de los dos. Los equipos que planifiquen un presupuesto para 2027 deberían tratar ambas cifras como provisionales: ambas, $1,67 y $9,00, están marcadas como de tiempo limitado, y ninguna de las dos tiene un precio sucesor anunciado.

Lo que aún no está probado
Las preguntas abiertas de septiembre del modelo por lotes siguen abiertas: ninguna tasa de error de diarización publicada, ningún desglose por idioma que respalde la afirmación de 60 idiomas, y un precio promocional sin sucesor nombrado. El modelo de streaming añade una más, específica del trabajo en tiempo real: el WER de streaming se mide con audio limpio, y la calidad de la transcripción parcial en un stream de campo lejano con ruido es el modo de fallo que más importa en despliegue y el que menos cubre el material de lanzamiento. También hereda lo ajustado del tablero de streaming: los tres primeros del tablero de 37 modelos del tracker se sitúan a una fracción de punto, así que «primero» es un estado que una nueva ejecución puede cambiar, y el primer puesto de Microsoft es una afirmación, no una fila.
Sin embargo, la cuestión a nivel de familia es la que hay que seguir de cerca. Microsoft ahora vende la misma capacidad a dos precios que difieren en un factor de cinco, y el nivel caro carece de dos funciones que el nivel barato documenta. Si la diarización y las marcas de tiempo por palabra llegan al SKU de streaming, la brecha se reduce a una mera disyuntiva entre latencia y precio, que es una decisión mucho más sencilla. Si no llegan, la estructura de dos divisiones es permanente y las arquitecturas deberían construirse en torno a ella.
En qué situación deja esto a un stack de transcripción

La consecuencia práctica es que la transcripción dejó de ser un solo concepto en septiembre y se convirtió en una decisión de enrutamiento en octubre. Una canalización que solía estandarizarse en una sola API ahora quiere streaming para la superficie en vivo, procesamiento por lotes para el registro, y una regla sobre qué audio toma qué ruta — y esa regla es en sí misma un problema de enrutamiento, lo cual es una cantidad extraña de complejidad para recaer en el ciclo de lanzamiento de un solo proveedor.
Donde más fuerte golpea es en lo que está por encima de la transcripción. Sea cual sea el nivel que produzca el texto, ese texto luego se resume, se clasifica, se censura y se enruta, y esos pasos se ejecutan en modelos de lenguaje con sus propios perfiles de latencia y coste: una transcripción en vivo quiere un modelo rápido y barato, mientras que una de archivo puede permitirse uno más potente. OrcaRouter cubre exactamente esa capa: una sola API para más de 200 modelos, precios de lista de los proveedores trasladados con un 0 % de recargo, conmutación por error automática y un DSL de enrutamiento que elige un modelo por carga de trabajo en lugar de por pipeline. Ni MAI-Transcribe-2-Streaming ni MAI-Transcribe-2 están en esa lista —ambos se sirven a través de la propia pila de voz de Microsoft—, pero una capa de transcripción repartida entre dos divisiones es el argumento más sólido hasta la fecha para mantener portátil todo lo que está aguas abajo de ella.
El resumen sincero: el streaming no es una mejor versión de MAI-Transcribe-2, es un segundo producto a un segundo precio. Cómpralo para los minutos que de verdad necesitan ser en tiempo real, deja el resto en el nivel económico y presupuesta el reajuste de ambas tarifas cuando termine el período introductorio.
