
Muse Voice Transcribe ya está disponible: el primer modelo de percepción de audio en tiempo real de Meta
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
Muse Voice Transcribe, el primer modelo de percepción de audio en tiempo real de Meta Superintelligence Labs, se lanzó el 1 de septiembre de 2026 y tiene un precio anticipado: $3.00 por 1,000 minutos de audio (unos $0.18 por hora) en la Meta Model API. En una sola pasada en streaming hace lo que la mayoría de los sistemas de transcripción dividen en tres componentes: reconocimiento automático del habla, diarización de hablantes en más de 20 voces y endpointing, que es la tarea de decidir cuándo un hablante realmente ha terminado en lugar de hacer una pausa a mitad de una idea. Meta dice que el modelo encabeza la tabla de clasificación de voz a texto en streaming de Artificial Analysis con una tasa de error de palabras del 3.1% en transcripciones finales, entregadas 0.16 segundos después de que el hablante deja de hablar.
Ese último número necesita su etiqueta honesta antes de hacer ningún trabajo: es la afirmación del día de lanzamiento de Meta, que apunta a una tabla de clasificación independiente, para un modelo que había sido invocable durante menos de un día cuando se hizo el anuncio. Nadie fuera del laboratorio ha reproducido el 3,1% todavía, y la afirmación de precisión es una cosa, mientras que el resto de la propuesta — más de 70 idiomas entrenados, cambio de código nativo, "retraso adaptativo" aprendido por refuerzo — es un conjunto separado de declaraciones del proveedor en el mismo barco. Todo en esta publicación es el estado del modelo en el día uno, con números del proveedor etiquetados como números del proveedor.
Los números que importan el primer día
• Precio: $3.00 por cada 1,000 minutos de audio (aproximadamente $0.18 por hora de audio) en la API de Meta Model, subcotizando a todas las principales API de transcripción en streaming que rastreamos.
• Declaración de precisión: 3,1 % de WER en transcripciones finales a 0,16 segundos después del final del habla; 3,6 % de WER en las primeras transcripciones parciales a 0,13 segundos. Reportado por el proveedor, citando la tabla de clasificación de streaming de Artificial Analysis.
• Diarización — más de 20 hablantes, emitida en streaming sin un paso de post-procesamiento separado (Meta reporta una tasa de error de diarización promedio del 17,5%).
• Idiomas — entrenado en más de 70; 25 "verificados exhaustivamente" en el lanzamiento; alternancia de código fluida dentro y entre oraciones.
• Contexto — maneja audio de más de una hora; sesgo de idioma, palabras clave y contexto para dominios con mucha jerga.

Qué significa "modelo de percepción de audio" aquí
La arquitectura es la historia. Muse Voice Transcribe consume audio en fragmentos de 80 milisegundos y transmite las palabras a medida que se estabilizan, que es lo que significa «tiempo real» en la práctica. La parte interesante es cómo decide cuándo confirmar una palabra. En lugar de un presupuesto de latencia fijo —el compromiso estándar en el que un reconocedor se adelanta y adivina, o espera más y se cubre—, el modelo utiliza lo que Meta llama «retraso adaptativo»: avanza rápido por el habla fácil y retiene más contexto de audio para las palabras de las que está menos seguro. La propia política de retraso se aprendió mediante aprendizaje por refuerzo, por lo que el modelo equilibra efectivamente velocidad y precisión por palabra, en lugar de aplicar una configuración global única.
Esa distinción es la razón por la que Meta llama a Muse Voice Transcribe un "modelo de percepción de audio" en lugar de un modelo ASR. El flujo de salida es una única transcripción en vivo que también transmite quién está hablando y cuándo se completa la emisión — tres etiquetas que los sistemas de streaming suelen ensamblar combinando un reconocedor con un detector de actividad de voz y un modelo de diarización, cada uno añadiendo su propia latencia y sus propios modos de fallo.

Diarización y endpointing, integrados
La diarización de hablantes es la parte que más merece la pena examinar, porque es la función donde los productos de streaming exageran con más frecuencia. Meta dice que el modelo separa a más de 20 hablantes en una sola grabación y reporta una tasa media de error de diarización del 17,5%, que contrasta con un rango del 21,1–28,6% que atribuye a los sistemas de la competencia. Ambas cifras son publicadas por el proveedor el día del lanzamiento, y ninguna evaluación independiente ha confirmado todavía el 17,5%. Lo que es estructuralmente real es que la diarización se ejecuta dentro de la misma pasada de streaming que el reconocimiento — no hay un segundo paso de "subir el audio, esperar, obtener los hablantes", que es la decisión de diseño que hace siquiera plausible el seguimiento de más de 20 hablantes en un entorno en vivo.
La detección de fin de locución es la capacidad más discreta y posiblemente la más útil. Las API de transcripción que exponen ASR de streaming en bruto obligan a quien las llama a implementar la detección de fin de emisión por su cuenta, razón por la cual los asistentes de voz suelen interrumpir a las personas o dejar silencios incómodos. Muse Voice Transcribe decide cuándo un turno está completo y emite ese límite como parte del flujo, de modo que una aplicación recibe una señal clara de "este hablante ha terminado" sin necesidad de crear una capa VAD.
La afirmación multilingüe, léase cuidadosamente.
Meta entrenó el modelo en más de 70 idiomas, pero valida 25 en el lanzamiento. Son cosas distintas: «entrenado en» significa que los datos los incluían; «verificado exhaustivamente» es el subconjunto que Meta realmente respalda con pruebas internas. Para uso en producción, la lista de los 25 verificados es la cobertura real, y vale la pena conocer la brecha entre 70 y 25 antes de enrutar 40 idiomas a través de él. Lo que es genuinamente inusual es la cuestión del code-switching: el modelo está diseñado para cambiar de idioma a mitad de frase y a mitad de enunciado sin que se lo pidan, lo cual es un auténtico dolor de cabeza en regiones multilingües y algo que la mayoría de los productos ASR de un solo idioma simplemente no pueden hacer. Los sesgos de idioma, palabras clave y contexto completan la historia de la personalización: puedes sesgar el reconocimiento hacia un vocabulario de dominio, que es la función que hace que el ASR en streaming sea utilizable en colas de atención médica, legal y de soporte.
Tres superficies, un modelo.
Muse Voice Transcribe llega a tres superficies a la vez. La de pago es la API Meta Model a $3.00 por cada 1,000 minutos de audio. La de consumidor es Meta AI para Mac, donde mantener presionada la tecla Fn dicta en cualquier aplicación: la respuesta de Meta al dictado integrado de Apple y el despliegue del modelo en el mundo real más visible desde el primer día. La de desarrollador es Muse Code, el agente de codificación de Meta, donde los comandos de voz dirigen sesiones multiagente y flujos de refactorización. Un modelo que impulsa una función de dictado y un agente de codificación es la versión productizada de la propuesta de "un modelo de streaming, muchas superficies".
Lo que el precio subcotiza
Con $0.18 por hora de audio, Muse Voice Transcribe subcotiza el campo de la transcripción en streaming en cuanto a precio de lista. El conjunto de comparación según lo rastreamos: Google's Gemini 3.5 Transcribe Live cuesta alrededor de $9 por 1,000 minutos, ElevenLabs' Scribe v2 Realtime está listado a $6.50 por 1,000 minutos, Cartesia's Ink-2 a $4.00, y OpenAI's GPT Live Transcribe a $17.00. Esos son los números publicados por los proveedores, y varios de esos modelos tienen evidencia independiente de precisión que Muse aún no tiene — el liderazgo en precio desde el primer día no es lo mismo que una tabla de clasificación asentada. Pero un modelo de streaming con diarización y detección de final de habla integradas, que entra a aproximadamente una quinta o una décima parte del precio de las API de streaming existentes, es el tipo de número que restablece las expectativas de todos modos.

Las advertencias honestas
Muse Voice Transcribe es propietario, y los pesos no están publicados: la opción de "ejecutarlo tú mismo" no existe, y no hay una vía de pesos abiertos para auditoría o ajuste fino. La afirmación de precisión es del día del lanzamiento y no está reproducida. Los 25 idiomas verificados pueden no coincidir con la cifra de "entrenado en" más de 70 para la cobertura de recursos limitados. Y el punto de referencia de diarización, por prometedor que sea, es una medición del proveedor hasta que una ejecución independiente lo confirme. Para equipos cuyo único requisito es la transcripción por lotes precisa de audio pregrabado, todavía existen opciones más baratas y mejor auditadas: la propuesta de transmisión se trata de interacción en tiempo real, no de superar al mundo de la transcripción por lotes en costo por hora de audio.
Qué ver a continuación
Cuatro cosas decidirán si este lanzamiento es un momento o una tendencia. Primero, si {{1}}el ranking de streaming de Artificial Analysis realmente lista a Muse Voice Transcribe en el #1 después de una verificación independiente — la afirmación del día del lanzamiento necesita una entrada consolidada en la tabla.{{/1}} Segundo, si {{2}}la diarización de más de 20 hablantes sobrevive al contacto con reuniones reales y ruidosas.{{/2}} Tercero, si {{3}}la interfaz de dictado de Mac de Meta se convierte en adopción de la API por parte de los desarrolladores.{{/3}} Cuarto, cómo responden los actores establecidos en el precio, porque {{4}}un modelo de streaming con diarización y endpointing a $0.18 la hora ejerce una presión visible sobre todos los que están por encima.{{/4}} Cuando Meta abra el modelo a socios de servicio adicionales, una pasarela de traspaso como OrcaRouter — que reenvía los precios de lista de los proveedores con un margen del 0% — mostraría la misma cifra de $3.00 por 1,000 minutos sin recargo de revendedor, el día que llegue. Hasta entonces, el único lugar para llamar a Muse Voice Transcribe es la propia API de Meta.
