
MAI-Transcribe-2 vs Muse Voice Transcribe: La misma semana, dos apuestas opuestas en audio
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0455Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0247Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0247Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0157Inteligencia82Código
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2646Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1541Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1251Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0547Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligencia69Código
La semana del 1 de septiembre de 2026 produjo dos modelos de voz de dos laboratorios de frontera, y MAI-Transcribe-2 y Muse Voice Transcribe se entienden mejor como respuestas opuestas a la pregunta de dónde debería vivir la inteligencia de audio. Muse Voice Transcribe, lanzado por Meta Superintelligence Labs el 1 de septiembre, es un modelo de percepción de audio en tiempo real: transcribe, separa a más de veinte hablantes y detecta cuándo un hablante ha terminado, todo en una sola pasada de streaming sobre fragmentos de 80 milisegundos de audio en vivo, y encabeza la tabla de reconocimiento de voz en streaming en la que se midió. MAI-Transcribe-2, lanzado por Microsoft dos días después, el 3 de septiembre, es la apuesta opuesta: un motor por lotes que no persigue en absoluto la latencia en vivo y, en cambio, lo invierte todo en transcribir archivos pregrabados con la mejor tasa de error de palabra en la clasificación independiente para no streaming, aproximadamente 411 veces más rápido que el tiempo real, por unos 1,67 dólares por cada 1.000 minutos. Compararlos cara a cara como "modelos de transcripción" oculta la decisión real, que tiene que ver con el momento en la vida del audio en el que necesitas las palabras: mientras está ocurriendo, o después de que haya terminado.
Dos productos apuntados en diferentes momentos
Muse Voice Transcribe está diseñado para el momento en que el audio aún está ocurriendo. Es un modelo multimodal autorregresivo de la familia Muse de Meta que fusiona tres tareas en una sola pasada: el reconocimiento automático de voz, la diarización de hablantes para más de veinte hablantes y el endpointing, es decir, la detección de que un hablante ha dejado de hablar para que el sistema pueda responder. Meta informa que su transcripción final aparece unos 0,16 segundos después de que un hablante se detiene, con una tasa de error por palabra del 3,1% en esas transcripciones finales y del 3,6% en las primeras transcripciones parciales; cifras que Meta publicó el día del lanzamiento citando la tabla clasificatoria de streaming de Artificial Analysis y que, al momento de redactar esto, no habían sido reproducidas de forma independiente. Procesa audio de más de una hora en una sola transmisión, cambia de idioma a mitad de frase y fue entrenado con más de 70 idiomas, de los cuales 25 fueron verificados exhaustivamente en el lanzamiento. Su precio es de $3,00 por cada 1.000 minutos de audio, unos $0,18 por hora, a través de la API Meta Model. Meta ha confirmado que los pesos no se abrirán.
MAI-Transcribe-2 está diseñado para el momento en que el audio ya es un archivo. El modelo de Microsoft mide un 2,0 % de AA-WER en el ranking de no streaming de Artificial Analysis: segundo lugar y la mejor cifra entre las APIs de procesamiento por lotes gestionadas, y se ejecuta a aproximadamente 411× tiempo real, lo cual es una medida de rendimiento, no una promesa de latencia. Transcribe en 60 idiomas con identificación automática del idioma, incluye diarización de hablantes, marcas de tiempo a nivel de palabra, sesgo de palabras clave y estilos verbatim frente a limpio, y maneja el cambio de código como Hinglish y Spanglish. Está disponible a través de Microsoft Foundry en vista previa pública y en MAI Playground a 0,10 $ por hora de audio como oferta de lanzamiento por tiempo limitado hasta fin de año, sin que se haya anunciado ningún producto de streaming. La publicación de lanzamiento de Microsoft lo posiciona explícitamente para audio de formato largo y por lotes: las cargas de trabajo donde la baja latencia de un modelo de streaming es inútil, pero su costo por minuto no lo es.

Por qué los dos números de exactitud no se contradicen
El instinto natural es comparar el 2,0 % con el 3,1 % y declarar un ganador, y sería un error por partida doble. Primero, los números miden tareas distintas: el 2,0 % de MAI-Transcribe-2 es la precisión no streaming sobre audio pregrabado, donde el modelo puede examinar el archivo completo; el 3,1 % de Muse Voice Transcribe es la precisión streaming en transcripciones finales, producidas bajo la restricción de transcribir mientras el audio va llegando. El streaming es el problema más difícil, y por eso la tabla de líderes de streaming y la de no streaming son tablas separadas con puntuaciones separadas. Segundo, las etiquetas tienen distinto peso: la cifra de MAI-Transcribe-2 es una medición de Artificial Analysis sobre el modelo, mientras que la de Muse Voice Transcribe es el informe del día del lanzamiento de Meta sobre lo que Artificial Analysis midió: reportado por el proveedor y sin reproducir. La afirmación honesta es que ambos modelos son candidatos creíbles en lo alto de sus respectivas tablas, y ninguno de los dos números te dice nada sobre la otra categoría.
La diarización es donde radica la comparación real, porque es la única función que ambos productos incluyen y aquella en la que sus ambiciones difieren visiblemente. Muse Voice Transcribe separa más de veinte hablantes como capacidad central de streaming; Meta reporta una tasa media de error de diarización de hablantes del 17,5 % frente a un rango de la competencia que cita del 21,1 % al 28,6 % — de nuevo, reportado por Meta y sin verificar. MAI-Transcribe-2 también incorpora diarización, pero Microsoft no publica ningún límite de hablantes ni tasa de error de diarización alguna. Para una llamada entre dos partes, ambos productos son adecuados y la diferencia es irrelevante. Para un grupo focal de doce personas o la grabación de un panel, Muse Voice Transcribe es el único de los dos cuyo límite de múltiples hablantes siquiera se declara, y la diarización sin medir de MAI-Transcribe-2 es el motivo más importante para probarlo antes de confiarle los audios más difíciles.
La comparación de precios que tiene sentido
En cuanto al precio, los dos están más cerca de lo que sugiere el marco de comparación entre lote y streaming: 1,67 $ por cada 1.000 minutos (MAI-Transcribe-2, tarifa early-bird) y 3,00 $ por cada 1.000 minutos (Muse Voice Transcribe) están ambos en el extremo económico de la transcripción de voz administrada. La comparación solo tiene sentido dentro de una misma categoría. Para la transcripción por lotes de audio pregrabado, MAI-Transcribe-2 cuesta menos de la mitad que el modelo nativo de streaming y además ofrece la mejor WER en modo no streaming, pero solo enviarías archivos grabados a Muse Voice Transcribe si quisieras específicamente su pipeline de streaming, que no es la forma eficiente de procesar un archivo. Para el audio de reuniones en vivo, Muse Voice Transcribe es el único producto de este artículo que funciona de verdad, y su tarifa de 3,00 $ es más baja que la de las otras API de transcripción en tiempo real contra las que se lanzó — Gemini 3.5 Transcribe Live, a unos 9 $ por 1.000 minutos, y GPT Live Transcribe, a 17 $ —, al tiempo que añade una diarización de más de veinte hablantes que esos productos no igualan. La conclusión honesta sobre el precio es que Meta fijó un precio bajo para el streaming y Microsoft fijó el precio por lotes aún más bajo, y ambas cifras son precios de era promocional que cambiarán en cuanto cada proveedor anuncie su tarifa estándar.

¿Cuál para cuál audio?
Si tu audio es en vivo — reuniones transcritas en tiempo real, agentes de voz, subtitulación en directo, cualquier cosa en la que se necesiten las palabras mientras se están pronunciando — Muse Voice Transcribe es la opción, y no hay ni comparación. Es el único modelo de streaming de esta lista, separa a más de veinte hablantes en la misma pasada y, desde el primer día, tuvo un precio pensado para ganar ese segmento. Sus debilidades son las que conviene tener presentes al probarlo: las cifras de precisión y diarización provienen de Meta, y un modelo de streaming con una semana de vida aún no ha demostrado cómo se comporta con el audio complicado que existe fuera de los benchmarks de lanzamiento.
Si tu audio ya es archivos — archivos, grabaciones de llamadas, bibliotecas de audio, cualquier cosa procesada en volumen — MAI-Transcribe-2 es la mejor opción en todos los aspectos que importan: menor WER medido, un rendimiento aproximadamente un orden de magnitud mayor y un precio por cada 1.000 minutos inferior al del modelo de streaming. Sus riesgos son la imagen especular de los de Muse: cuatro días de antigüedad, sin SKU de streaming, calidad de diarización sin medir y una tarifa de lanzamiento que oculta un precio estándar no revelado.
La página de lanzamiento de Microsoft que presenta MAI-Transcribe-2 enumera las funciones que Microsoft agrupa y que el rival de streaming no ofrece en la misma pasada, y es el documento de referencia a la hora de decidir qué afirmaciones forman parte de la superficie del producto y cuáles siguen siendo promesas de benchmark.

Y si la transcripción es solo la primera mitad de tu pipeline, la elección entre estos dos importa menos que la elección que hagas por encima de ellos. El audio en vivo de reuniones transcrito por Muse Voice Transcribe todavía necesita que se resuma, que se extraigan sus elementos de acción y que se redacten los seguimientos antes de resultar útil; las llamadas archivadas transcritas por MAI-Transcribe-2 aún deben poder buscarse, expurgarse o enrutarse al sistema posterior correcto. Esa es la capa donde una plataforma multimodelo justifica su existencia: la API única de OrcaRouter da acceso a más de 200 modelos, traslada los precios de lista de los proveedores sin margen (0 %) y permite que ese trabajo posterior utilice un modelo distinto por carga de trabajo mediante una sola integración; así, gane el modelo de voz que gane tu piloto, la pila posterior a la transcripción no tiene que reconstruirse para cambiar de modelo. Ni Muse Voice Transcribe ni MAI-Transcribe-2 figuran hoy en esa lista; ambos residen únicamente en las API de sus respectivos proveedores. La apuesta que esta semana quedó realmente zanjada es más acotada y más útil: tanto la transcripción en tiempo real como la transcripción por lotes acaban de volverse lo bastante baratas como para que el diferenciador ya no esté en las palabras — está en lo que haces con ellas.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
