Una tarjeta de título generada encabezada por REFERENCIA DEL MODELO con el título 'El modelo de transcripción de voz a texto en streaming de Meta en Model API', sobre cuatro tarjetas redondeadas que dicen '$0.18 por hora de audio', 'WebSocket de streaming + endpoint de archivo', '25 idiomas evaluados con alternancia de código' y 'marcas de tiempo a nivel de turno, a nivel de palabra', con un pie de página que dice 'Fuente: la propia página y documentación del modelo de Meta, 2026-09-29.'
Guides & Insights

Muse Voice Transcribe: el modelo de conversión de voz a texto en streaming de Meta, explicado

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Muse Voice Transcribe es el modelo de voz a texto en streaming de Meta. Se ejecuta en Meta Model API a 0,18 $ por hora de audio, con el id de modelo muse-voice-transcribe-1.0, y tiene el mismo precio tanto si transmites audio en directo como si le entregas una grabación ya terminada. Lo que hace que merezca una página de referencia en lugar de una simple consulta de precio de una línea es dónde ocurre el trabajo: la atribución de hablantes para más de veinte voces y la detección del final del habla se ejecutan dentro del modelo de reconocimiento, no en una pasada por lotes acoplada al final del stream. Es únicamente conversión de voz a texto —la documentación para desarrolladores de Meta lo dice con esas mismas palabras: no sintetiza voz y no ofrece una API de conversación de voz a voz.

Esta es la página en la que aterriza un lector después de buscar el nombre del propio modelo, así que está concebida para ser la respuesta estable a dos preguntas —qué es este modelo y cuánto cuesta una hora de audio—, y no un anuncio. Hay una fecha que debe quedar registrada antes que cualquier otra cosa, porque es un dato sobre el modelo y no la razón por la que existe la página: Meta Superintelligence Labs presentó Muse Voice Transcribe el 1 de septiembre de 2026, en la entrada de anuncio fechada Introducing Muse Voice Transcribe —la entrada a la que un lector aún puede llegar a través del índice del blog de Meta, aunque ya no responde en su propia URL. Todo lo que figura a continuación se leyó en las propias páginas de Meta el 29 de septiembre de 2026, principalmente la página del modelo y la documentación de voz a texto y de descripción general de la API. Cuando Meta no publica una cifra, esta página lo dice en lugar de recurrir a un dato aproximado.

Qué es, en términos de Meta

La documentación de Meta abre su descripción con claridad: «Muse Voice Transcribe es el modelo de voz a texto de Meta en Meta Model API. Transcribe audio en directo o una grabación existente, con detección de turnos de habla, etiquetas de hablante y sesgo de vocabulario». La página de descripción general condensa lo mismo en una sola frase: diarización de hablantes en streaming, detección nativa de puntos finales y actividad de voz, sesgo contextual y por palabras clave, y 25 idiomas evaluados con cambio de código. Así que la salida es un único flujo de transcripción que lleva tres etiquetas a la vez: las palabras, quién habla y si la intervención ha terminado. Esa es la combinación que la mayoría de las pilas de producción ensambla actualmente a partir de un reconocedor más un detector de actividad de voz aparte más un modelo de diarización aparte, cada uno con su propio presupuesto de latencia.

La página del modelo de Meta lo presenta como "latencia competitiva y precisión de transcripción en streaming con atribución en vivo para más de 20 hablantes", y la documentación para desarrolladores describe el campo de salida como "Texto de transcripción con tiempos a nivel de turno y etiquetas de hablante opcionales". De eso se derivan dos cosas, y ambas importan más que el encuadre:

• Es un modelo de entrada de audio y salida de texto. No es ni de entrada ni de salida de texto, y Meta deja claro que no es un generador de voz.

• Es ante todo un modelo de streaming. La ruta en tiempo real no es un envoltorio alrededor de la ruta de archivos; es una sesión de WebSocket con sus propios eventos, modos y límites, que se describen a continuación.

Cuánto cuesta una hora de audio

La página del modelo de Meta para Muse Voice Transcribe indica el precio como «Crea con un solo modelo a $0.18/hora», y su tabla de especificaciones incluye muse-voice-transcribe-1.0 a $0.18 por hora de audio y $3.00 por cada 1,000 minutos. Son dos formas de enmarcar una misma tarifa con distintas unidades, y ambas aparecen publicadas en la propia página de Meta tal como se leyó el 2026-09-29. La documentación para desarrolladores indica la misma tarifa de una tercera forma: «El precio es $0.18 por hora de audio procesado». Ninguna cifra de esta página proviene de una página de precios de Meta, porque no hay ninguna página de precios de Meta legible que consultar: la documentación remite la tarifa a una página de «Pricing and rate limits» que responde Esta página no está disponible tal como se leyó el 2026-09-29, por lo que la página del modelo es la fuente de referencia de la tarifa, y es la única que se usa aquí.

El detalle de facturación está en la documentación para desarrolladores y vale la pena conocerlo antes de dimensionar una carga de trabajo:

• El streaming y el no streaming cuestan lo mismo. No hay ningún recargo por el endpoint en tiempo real.

• El procesamiento con retención cero de datos tiene el mismo precio que el nivel Estándar, según la documentación; no es un concepto de recargo.

• La facturación se redondea hacia abajo a segundos enteros, así que un turno de dos segundos se factura como dos segundos y no como tres.

• Los fallos que ocurren antes de que se produzca una transcripción no se facturan, y tampoco las respuestas 429 de límite de tasa.

• Los créditos gratuitos existen a nivel de plataforma, no a nivel de modelo. La documentación de voz a texto de Meta termina su párrafo de precios con la frase «Se aplican créditos del nivel gratuito de la plataforma». Esa es la única mención a algo gratuito en las páginas de este modelo, y es deliberadamente inespecífica: apunta a un esquema de créditos de la plataforma en lugar de prometer una asignación gratuita para la transcripción, y no se publica ninguna cifra, duración ni regla de elegibilidad al respecto. Interprételo como un crédito que puede reducir una factura, no como un nivel gratuito para el modelo. La declaración de Meta dirigida al consumidor de que su agente personal es «gratis para la mayoría de lo que la gente necesita» es una frase aparte sobre la aplicación Muse y no se extiende a Model API.

Ejemplo práctico, porque el costo por hora es difícil de percibir: una entrevista grabada de dos horas son $0.36 de transcripción. Mil horas de audio de llamadas —aproximadamente el volumen mensual de un centro de contacto de tamaño medio— son $180. A esa escala, la tarifa lo es todo, y una tarifa también es lo único que puede moverse bajo tus pies: la página de Meta es la autoridad al respecto, y si la cifra cambia allí, cambia aquí.

La interfaz de streaming, endpoint por endpoint

This is the part a reference page owes a reader that a launch write-up cannot carry, so here it is in the order you meet it. Base URL for Model API is https://api.meta.ai/v1 with a Bearer token, and Muse Voice Transcribe adds two endpoints on top of it.

• Audio en vivo — wss://api.meta.ai/v1/asr/realtime. El transporte es WebSocket, y el detalle de autenticación es una trampa: te autenticas en la trama de handshake, y el Authorization encabezado se ignora. El handshake debe ser la primera trama de texto JSON y debe llegar en un plazo de 10 segundos. Una sesión dura hasta 60 minutos, un nuevo WebSocket crea una nueva sesión, y no hay token de reanudación.

• Grabaciones — POST https://api.meta.ai/v1/asr/transcribe. Carga multipart, y esta sí se autentica con el encabezado Authorization correspondiente. La entrada es restringida: solo WAV PCM mono de 16 bits a 16 o 24 kHz. Los límites son 32 MB por cuerpo y 10 minutos de audio por solicitud.

Dentro de la sesión en tiempo real, tres modos cambian lo que se te entrega. PUSH_TO_TALK es el predeterminado y realiza transcripción de un solo turno. ENDPOINTING proporciona límites de turno detectados por el modelo, un turno por cada segmento de habla detectado, emitiendo eventos speechStart repetidotranscript, speechEnd y speechComplete — con la advertencia de que speechEnd no es la transcripción. DIARIZATION añade detección y atribución automática de hablantes, emitiendo eventos speaker con etiquetas como A y B. Las transcripciones parciales llegan de forma acumulativa, donde cada parcial reemplaza a la anterior, o como deltas.

Dos detalles operativos de la misma documentación son fáciles de pasar por alto y caros de descubrir en producción:

• La diarización marca un posible nuevo hablante en lugar de un punto final de habla limpio, y Meta afirma que no está optimizada para uso de baja latencia ni para comandos de voz. Trate las etiquetas como identificadores limitados a la sesión — A en una sesión no es la misma persona que A en la siguiente.

• Los turnos pueden solaparse, por lo que el estado por turno debe indexarse según el identificador del turno en lugar del orden de llegada.

• Los límites por inquilino publicados son 128 transmisiones simultáneas y 16.000 transmisiones por hora.

Qué se ejecuta dentro del modelo y qué reemplaza

La página del modelo de Meta hace una afirmación específica sobre la arquitectura, más que sobre las puntuaciones: «La atribución de hablantes para más de 20 hablantes y la detección de fin de habla ocurren dentro del modelo de reconocimiento», y lo contrasta explícitamente con una pasada por lotes al final del flujo de audio. La diferencia práctica es que no hay una segunda etapa que esperar. Las etiquetas de hablante y los límites de turno llegan en el mismo flujo que las palabras, así que un agente de voz descendente o una interfaz de subtítulos en vivo obtiene un turno completo y una identidad sin un salto de posprocesamiento.

Las otras capacidades que, según la documentación de Meta, residen en el modelo:

• Detección nativa de punto final y detección de actividad de voz, por lo que no ejecutas tu propio VAD frente a la API. En la redacción de la documentación, obtienes una transcripción completa por cada enunciado sin ejecutar tu propia detección de actividad de voz, y un final de habla detectado no finaliza la sesión.

• Sesgo contextual y por palabras clave, sin ajuste fino. La página del modelo de Meta describe que la precisión se mantiene "mediante sesgo contextual y por palabras clave, sin ajuste fino", que es la característica que hace que el ASR en streaming sea utilizable con vocabulario de dominio —nombres de medicamentos, símbolos bursátiles, SKU de productos— en lugar de con el promedio del lenguaje general. La documentación es precisa sobre los límites: las palabras clave sesgan el reconocimiento, pero no garantizan una ortografía exacta, y tanto las palabras clave como el sesgo de idioma se fijan al inicio de la sesión.

• 25 idiomas evaluados con cambio de código. La documentación los enumera: árabe, bengalí, neerlandés, inglés, francés, alemán, hebreo, hindi, indonesio, italiano, japonés, kannada, coreano, malayo, chino mandarín, maratí, polaco, portugués, español, tagalo, tamil, telugu, tailandés, turco y vietnamita. El cambio de código —a mitad de frase y a mitad de enunciado, sin que se indique qué idioma viene a continuación— es la capacidad que los reconocedores de un solo idioma estructuralmente no pueden ofrecer. Una advertencia que conviene tener en cuenta: el sesgo de idioma es una lista de idiomas, no contexto de forma libre, y no obliga al modelo a usarlos.

La publicación de anuncio fechada va más allá: dice que el modelo se entrenó con más de 70 idiomas, con 25 «ampliamente verificados» —según lo reportado por el proveedor—, y la lista de los 25 verificados es el subconjunto que Meta respalda. Esa es la cobertura con la que hay que planificar, no los 70.

Los límites documentados

Una página de referencia es tan buena como las restricciones que imprime, y Meta imprime varias.

• Marcas de tiempo a nivel de turno, no a nivel de palabra.Tanto la página del modelo como la documentación lo indican claramente: «Devuelve marcas de tiempo a nivel de turno, pero no a nivel de palabra». Los turnos incluyen tiempos de inicio y fin en milisegundos. Si tu producto necesita hacer clic para saltar por palabra —resaltado tipo karaoke, enrutamiento de confianza por palabra, alineación forzada—, este es el modelo equivocado y ninguna cantidad de ingeniería de prompts cambia eso.

• Sin puntuaciones de confianza, sin detección de eventos sonoros, sin detección de emociones, sin reformateo de transcripciones. Meta enumera las cuatro como no disponibles. Obtienes palabras, turnos, tiempos y etiquetas de hablante, y nada sobre qué tan seguro está el modelo.

• Sin síntesis de voz ni API de conversación de voz a voz. Es solo en una dirección.

• Los formatos de audio son limitados en la ruta del archivo.WAV PCM mono de 16 bits, 16 o 24 kHz. Cualquier otra cosa debe convertirse antes de subirse.

Pesos abiertos y la confusión de Muse Glimmer

Muse Voice Transcribe es propietario y se ofrece a través de la API: no es una publicación de pesos abiertos, y la documentación de Meta nunca afirma lo contrario. Esto importa porque los lectores dirigen la ruta de pesos abiertos de la familia Muse hacia el nombre equivocado. Muse Glimmer es esa ruta: la documentación de Meta lo describe como un modelo multimodal de pesos abiertos destilado de Muse Spark, distribuido bajo una licencia permisiva Apache 2.0, que se descarga y se ejecuta en tu propio hardware mediante un entorno de ejecución como vLLM, SGLang, llama.cpp o ExecuTorch. Muse Voice Transcribe aparece agrupado en la misma página con Muse Spark, Muse Image y SAM como modelos a los que se llama en lugar de descargarse.

Así que: no hay pesos para Muse Voice Transcribe, no hay opción de autoalojamiento, ninguna vía para auditarlo o ajustarlo. Si una página te dice lo contrario, lo ha confundido con Muse Glimmer. Cuando los pesos de un modelo no se publican, la plataforma de servicio lo es todo — y de eso trata la siguiente sección.

Cómo llega un cliente a él

La Model API de Meta está diseñada para integrarse en los clientes que ya tienes. La afirmación del proveedor, impresa en la página de descripción general de la API, es que Model API "es compatible de forma inmediata con las bibliotecas de cliente compatibles con OpenAI y Anthropic, y con las CLI de agentes compatibles con OpenAI. Configura la URL base de tu cliente, añade tu clave y conserva el resto de tu código." En general, Model API ofrece tres formas de solicitud —la Responses API, la Chat Completions API y la Messages API—, por lo que una integración existente suele tener una superficie coincidente sin necesidad de reescribir. Una advertencia sobre el alcance: esa frase de compatibilidad y esas tres formas son capacidades de Model API en su conjunto, no líneas impresas en la propia página del modelo de Muse Voice Transcribe. La propia guía de inicio rápido de la página del modelo es más limitada: solo dice que "apuntes tu cliente existente compatible con OpenAI a Meta Model API" y que tendrás una primera solicitud funcional en menos de cinco minutos.

Una laguna honesta que vale la pena señalar en una página de referencia: la documentación de Meta para este modelo no menciona ninguna biblioteca cliente oficial para Muse Voice Transcribe, y su página «Client libraries» se encuentra en la sección de SAM en lugar de la de Voice. Lo que la guía de voz a texto ofrece en su lugar es una lista de dependencias concreta: Python 3.9 o posterior con los paquetes websockets y sounddevice, además de un recetario de fundamentos de la API de voz. Así que la afirmación de que se puede sustituir directamente describe la superficie de solicitudes de Model API en general; el endpoint de ASR en tiempo real es en sí mismo un WebSocket con sus propias reglas de handshake y sin ningún wrapper documentado.

A screenshot of Meta's model page for Muse Voice Transcribe (captured 2026-09-29), showing the headline 'Competitive latency and streaming transcription accuracy with live attribution for 20+ speakers. Build with a single model at $0.18/hour.', a 'Meet Muse Voice Transcribe' panel of capability cards headed 'Competitive transcription accuracy', 'Live speaker and turn awareness' and 'Production pricing', a 'Muse Voice Transcribe benchmarks' section labelled 'AA-WER Streaming Index - Final Transcription Diarization' with 3.9% and 3.9%, and the pricing row reading muse-voice-transcribe-1.0 at $3.00 per 1,000 minutes and $0.18 per hour.

Lo que Meta no ha publicado

Un benchmark ausente es un hecho sobre la documentación, por lo que aquí se declara como tal. La página del modelo de Meta para Muse Voice Transcribe no incluye ninguna tabla de precisión impresa: su evidencia de precisión se presenta como tres recursos de imagen —una tabla de clasificación de la tasa de error de palabras en streaming, una comparación de la tasa de error de diarización y un índice de precisión en streaming— sin cifras en el texto extraíble. La propia página del modelo no proporciona ninguna tasa de error de palabras, ninguna tasa de error de diarización y ningún desglose por idioma.

La publicación del anuncio sí incluye cifras reportadas por el proveedor, entre ellas una tasa de error de palabras en streaming y una tasa media de error de diarización, y esas son las cifras que redactamos cuando se lanzó el modelo; son mediciones propias de Meta y siguen sin haber sido reproducidas por un tercero. Esta página no vuelve a ejecutar esa comparación, porque volver a ejecutar un benchmark de proveedor del día del lanzamiento en una página de referencia presentaría una cifra no reproducida como si fuera una cifra ya establecida. Lo que puede decirse sin rodeos es más limitado: Meta no publica ninguna evaluación directa contra un rival con nombre propio con el mismo esfuerzo y el mismo arnés de evaluación para este modelo, así que cualquier comparación que leas en cualquier parte es una comparación de cifras de proveedor recogidas en condiciones distintas.

Una fecha también queda sin establecer a propósito. La página del modelo no incluye ninguna fecha de lanzamiento — su único marcador de versión es el -1.0 del id del modelo. La fecha 2026-09-01 de este texto proviene de esa publicación de anuncio con fecha, y aquí se usa para datar el modelo en lugar de informar sobre un evento.

A generated reference scoreboard titled 'Muse Voice Transcribe — the reference', listing six rows for the model: price $0.18 per hour of audio, interface as a realtime WebSocket at wss://api.meta.ai/v1/asr/realtime plus a file endpoint, speaker attribution for 20+ speakers inside the recognition model, turn-level timestamps without word-level times, 25 evaluated languages with code-switching, and proprietary weights with no open download.A screenshot of the Speech to text page in Meta's Model API documentation (captured 2026-09-29), showing the opening sentence 'Muse Voice Transcribe is Meta's speech-to-text model on Meta Model API', an 'Available endpoints' table contrasting wss://api.meta.ai/v1/asr/realtime for live audio against POST https://api.meta.ai/v1/asr/transcribe for a recording and noting that the Authorization header is ignored on the WebSocket, and a Features table whose rows include language biasing across 25 supported languages with code-switching, vocabulary biasing, speech-turn detection, speaker labels, partial transcripts and progress events.

Quién debería recurrir a él y quién no

El argumento a favor de Muse Voice Transcribe es limitado y sólido: audio en vivo donde necesitas palabras, identidad del hablante y finales de turno en el mismo flujo, a un precio lo suficientemente bajo como para ejecutarlo de forma continua en lugar de bajo demanda. Agentes de voz, subtitulado en vivo, inteligencia de reuniones y llamadas, dictado y transcripción de alto volumen son las cargas de trabajo que Meta menciona, y son las cargas de trabajo para las que la interfaz está realmente diseñada: un WebSocket de 60 minutos con modos de endpointing y etiquetas de hablante con alcance de sesión.

El argumento en contra es igualmente concreto. Si necesitas marcas de tiempo a nivel de palabra, confianza por palabra, detección de eventos sonoros o de emociones, o reformateo de transcripciones, este modelo no los tiene, y eso es una ausencia documentada, no un error. Si tu audio llega en formatos distintos de WAV mono de 16 bits a 16 o 24 kHz y usas el endpoint de archivos, pagas un paso de conversión que no pagarías en otro sitio. Y si tu requisito es la transcripción por lotes de grabaciones archivadas donde la precisión es el único eje, la propuesta de streaming no te aporta nada — el precio es el mismo en ambas vías, así que estás pagando por una capacidad en tiempo real que no vas a usar.

Lo único que hay que verificar antes de comprometerse con una ruta de producción es la cifra que esta página existe para responder, y es la única cifra que puede cambiar sin que el modelo cambie en absoluto: $0.18 por hora de audio, tal como figura hoy en la propia página del modelo de Meta. La página de Meta es la autoridad al respecto. Cuando se mueve, todo lo que se dimensiona en función de ella —el mes de mil horas, el costo por entrevista, la aritmética de construir frente a comprar— se mueve con ella.