
MAI-Transcribe-2-Streaming vs. Gemini 3.5 Transcribe Live: los mismos $9, un intercambio diferente
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 221 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
MAI-Transcribe-2-Streaming y Gemini 3.5 Transcribe Live cuestan lo mismo y se basan en teorías opuestas sobre para qué sirve un transcriptor en streaming. Ambos cuestan aproximadamente $9,00 por cada 1.000 minutos de audio transmitido. El modelo de Microsoft, lanzado el 1 de octubre de 2026, es un instrumento de precisión: una tasa de error de palabras en streaming declarada del 2,5 % a 0,13 segundos hasta la transcripción final, el primero en precisión tanto en transcripciones finales como parciales según la propia cuenta de Microsoft, medido con la metodología de streaming de Artificial Analysis pero aún no representado como una fila en ese tablero. El otro modelo, en versión preliminar pública desde el 26 de agosto de 2026 y servido a través de la Live API, es un instrumento de cobertura: más de 85 idiomas con cambio a mitad de stream, un nivel gratuito y una tasa de error de palabras en streaming del 4,00 % a 0,40 segundos, la cifra que Artificial Analysis mide para él. Ninguno es la elección obvia, y la razón es que en realidad no compiten por la misma carga de trabajo.
Aquí está la comparación cara a cara tal como se leen realmente las cifras: cifras reportadas por el proveedor etiquetadas, cifras del rastreador atribuidas, y las partes en las que un modelo gana en una dimensión que el otro no disputa en absoluto.
La versión de una línea
• Precisión y latencia — MAI-Transcribe-2-Streaming, según las cifras publicadas. Microsoft afirma un WER en streaming del 2,5 % a 0,13 segundos hasta la transcripción final, el primero en precisión tanto en transcripciones finales como parciales, y un 2,5 % en la primera transcripción parcial a 0,12 segundos. Frente a eso, Artificial Analysis sitúa Gemini 3.5 Transcribe Live en 4,00 % a 0,40 segundos. La ventaja que Microsoft reivindica es de 1,5 puntos y aproximadamente tres veces más rápido para estabilizarse. La salvedad es que la herramienta de seguimiento aún no ha trazado al propio MAI-Transcribe-2-Streaming —el líder actual de la tabla es Grok Voice Transcribe 2.0 con 2,73 % y 0,49 segundos, mientras que Muse Voice Transcribe tiene 3,06 % y 0,16 segundos—, por lo que el 2,5 % es una cifra de proveedor contrastada con un campo que la herramienta de seguimiento sí mide. No es un resultado ajustado en el eje que ambos modelos publican, pero solo uno de sus lados se publica de forma independiente.
• Amplitud de idiomas — Gemini 3.5 Transcribe Live. Más de 85 idiomas con detección automática y la capacidad de cambiar de idioma a mitad de la transmisión sin reiniciar la sesión, que es la afirmación principal de Google para la Live API. MAI-Transcribe-2-Streaming cubre 60 idiomas con detección automática y continua del idioma. El piso de Microsoft es más alto; el techo de Google es más amplio, y la brecha de 25 idiomas se concentra principalmente en idiomas en los que un modelo de streaming de un solo idioma no es utilizable en absoluto.
• Forma de la sesión — Gemini 3.5 Transcribe Live, y esta es un arma de doble filo. La Live API es una sesión WebSocket limitada a 10 minutos, lo cual está bien para un turno de agente de voz y resulta incómodo para una reunión de una hora; Microsoft no publica un límite de sesión equivalente para su modelo de streaming, lo cual importa si tu unidad de trabajo es una llamada, no un turno conversacional.
• Costo de entrada — Gemini 3.5 Transcribe Live. Existe un nivel gratuito, y la tarifa combinada de Google equivale a unos $0.009 por minuto con el precio basado en tokens. Los $0.54 por hora de audio de Microsoft son una tarifa introductoria que, según Microsoft, está vigente hasta el final del año, sin que se divulgue un precio estándar — la misma estructura que su lanzamiento por lotes de septiembre.

Por qué la brecha de precisión es más grande de lo que parece
Una diferencia de 1,5 puntos en la tasa de error de palabras parece una diferencia de redondeo hasta que le pones precio. Con una WER en streaming del 4,00 %, Gemini 3.5 Transcribe Live comete aproximadamente 40 palabras incorrectas por cada 1000; con el 2,5 % que Microsoft afirma, MAI-Transcribe-2-Streaming comete 25. En los volúmenes que genera una canalización en tiempo real —una organización de soporte que gestiona 5000 horas de llamadas al mes son 300 000 minutos, más de 45 millones de palabras a ritmos conversacionales—, esa diferencia representa millones de palabras incorrectas al año, concentradas en las entidades de las que dependen los sistemas posteriores: nombres de cuentas, números de tickets, dosis, direcciones.
La diferencia de latencia es la más difícil de vender. 0,13 segundos frente a 0,40 segundos después del final del habla es perceptible en un flujo de subtítulos en vivo —por debajo de unos 0,2 segundos se percibe como simultáneo, y un tercio de segundo se percibe como si la transcripción fuera persiguiendo al hablante—, pero no es perceptible en un panel de asistencia al agente que se actualiza a una escala temporal humana. Si tu consumidor es una persona que va leyendo, la ventaja de latencia de Microsoft es el producto. Si tu consumidor es un modelo que recibe la transcripción final cuando termina el turno, es solo un número.
Ambas cifras conllevan la misma advertencia, y vale la pena decirla una vez: son cifras de una sola ejecución de un tablero de seguimiento con 37 modelos, y la diferencia entre el primero y el tercero en ese tablero es inferior a un punto. Una nueva ejecución puede reordenar la parte superior de la tabla de clasificación de streaming de una forma que una diferencia de dos puntos en el tablero de batch no puede. Ni siquiera el 2,5 % de Microsoft figura todavía en el tablero —es una afirmación de un proveedor medida con la metodología del sistema de seguimiento, que es algo distinto de una fila que el sistema de seguimiento publica.
Los límites son donde realmente vive la decisión
Los límites de funcionalidad separan a estos dos más rápido de lo que lo hacen los benchmarks, y van en direcciones opuestas.
Gemini 3.5 Transcribe Live tiene tres limitaciones documentadas: un límite de sesión de 10 minutos en la Live API, no hay diarización de hablantes y no hay marcas de tiempo a nivel de palabra. La primera es arquitectónica —la transmisión por streaming a través de una sesión de WebSocket tiene un techo por diseño— y significa que la transcripción en vivo de formato largo tiene que empalmarse entre sesiones, y el manejo de la unión queda a tu cargo. Las otras dos son absolutas: si tu producto necesita atribuir el habla a un hablante, o situar una palabra en una marca de tiempo para la búsqueda o la sincronización de subtítulos, Gemini 3.5 Transcribe Live no lo hace a ningún precio.
Las limitaciones de MAI-Transcribe-2-Streaming están menos documentadas, lo cual es en sí mismo información. Microsoft no hace ninguna afirmación de diarización para el modelo de streaming ni tampoco de marcas de tiempo a nivel de palabra; el MAI-Transcribe-2 por lotes incluye diarización y devuelve marcas de tiempo a nivel de palabra, pero ese es el producto por lotes, y suponer que el SKU de streaming las hereda es exactamente el tipo de inferencia que el material de lanzamiento existe para evitar. Lo que Microsoft sí afirma son 60 idiomas con detección continua de idioma y una ubicación en la frontera de Pareto en precisión frente a latencia — ambas declaraciones del proveedor con las que los datos del rastreador son consistentes.
Así que la lectura honesta de las funciones es: ninguno de los modelos de streaming publica diarización ni marcas de tiempo por palabra. Gemini 3.5 Transcribe Live tiene un límite de sesión publicado y un nivel gratuito; MAI-Transcribe-2-Streaming tiene un recuento de idiomas publicado y ningún límite publicado. Si tus requisitos incluyen diarización, ninguno de estos es la respuesta y estás ante una transcripción por lotes con una capa de streaming añadida por delante.
Lo que la paridad de precios realmente te está diciendo
Dos proveedores que llegan a los mismos $9 por cada 1000 minutos desde direcciones opuestas son el dato más interesante de esta comparación. Google llegó allí mediante precios basados en tokens en una sesión de Live API: audio de entrada a $3,50 por millón de tokens, texto de salida a $21 por millón y un consumo aproximado de 175 tokens de texto por minuto, lo que da como resultado alrededor de $0,009 por minuto. Microsoft llegó allí al listar una tarifa plana de $0,54 por hora de audio para un modelo de una familia cuyo hermano por lotes cuesta $0,10. Una es una sesión en tiempo real medida por consumo; la otra es una tarifa plana por minuto con un descuento introductorio.
Esas estructuras se comportan de manera distinta a medida que escalas. Una tarifa plana es predecible y fácil de presupuestar; una sesión medida por tokens varía según cuánto responda el modelo y cuánto tiempo permanezca la sesión inactiva y abierta. Para una canalización de alto volumen, la tarifa plana es la factura más favorable; para un prototipo o una función de bajo volumen, el nivel gratuito y la facturación por token son la puerta de entrada más favorable.

Lo que ninguna de las dos estructuras cambia es la capa que está por encima de la transcripción. Sea cual sea el modelo que la produzca, una transcripción en vivo es la entrada para el resumen, la clasificación, la redacción y el enrutamiento, y esos pasos tienen sus propias curvas de coste y calidad, y normalmente se ejecutan en varios modelos en lugar de en uno solo. Esa es la capa que cubre OrcaRouter: una única API para más de 200 modelos, precios de lista de los proveedores repercutidos con un 0 % de margen, conmutación automática por error y un DSL de enrutamiento que puede dirigir una transcripción a distintos modelos según la carga de trabajo. Ni MAI-Transcribe-2-Streaming ni Gemini 3.5 Transcribe Live están en esa lista —se ofrecen a través de las pilas de voz propias de Microsoft y Google, respectivamente—, y la idea no es enrutarlos, sino mantener portable todo lo que está aguas abajo de ellos.

¿Cuál elegir?
Elige MAI-Transcribe-2-Streaming cuando la precisión y el tiempo de estabilización son el producto: subtítulos en vivo que una persona lee, puntuación de cumplimiento o calidad en tiempo real donde una entidad mal oída tiene un costo, o sesiones largas que el techo de 10 minutos de Gemini te obligaría a empalmar. Elige Gemini 3.5 Transcribe Live cuando la cobertura es el producto: un despliegue global en idiomas que no puedes enumerar de antemano, cambio de idioma a mitad del flujo, o un prototipo donde el nivel gratuito y la facturación por token eliminan el compromiso. Los equipos que necesitan ambos no están atascados: los dos son API diferentes con modelos de sesión diferentes, y la arquitectura honesta es enrutar según la carga de trabajo en lugar de estandarizarse en una.
La conclusión que vale la pena extraer de esta comparación no es que Microsoft haya ganado. Es que la transcripción en streaming ahora tiene dos opciones de vanguardia creíbles con el mismo precio, lo que significa que la decisión ha pasado de "qué hay disponible" a "qué necesita esta carga de trabajo específica". Ese es un problema mejor que tener.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
