Una tarjeta de título principal que compara 'VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe', con el antetítulo 'ASR en streaming - septiembre de 2026' y un subtítulo que presenta a dos rivales de streaming con un día de diferencia: la API de Meta a $0,18 por hora y el checkpoint MIT de Microsoft, que no cuenta con un servicio alojado. Además incluye los chips 'Pesos MIT - 2 de septiembre', 'API de Meta - 1 de septiembre' y 'Ambos sin verificar', así como una nota al pie 'La misma promesa del titular'. El logotipo de OrcaRouter aparece superpuesto en la esquina inferior derecha.
Guides & Insights

VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe: Dos contendientes de streaming, con un día de diferencia

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

En un lapso de unas treinta y seis horas a principios de septiembre de 2026, dos grandes laboratorios lanzaron modelos de transcripción de voz a texto en streaming que hacen la misma promesa titular: una transcripción en vivo que además te dice quién dijo qué, mientras se pronuncian las palabras. El 1 de septiembre, Meta Superintelligence Labs presentó Muse Voice Transcribe como API alojada a 3,00 USD por cada 1.000 minutos de audio, unos 0,18 USD por hora, con reconocimiento en streaming, diarización de más de 20 hablantes y detección de fin de intervención integradas en una sola pasada. El 2 de septiembre, Microsoft Research subió VibeVoice-ASR-Streaming-7B a Hugging Face: pesos abiertos con licencia MIT, sin anuncio, una ficha del modelo que afirma transcripción en streaming con atribución de hablante, hotwords y diez idiomas, y sin servicio alojado en ningún sitio. El mismo discurso, modelos de negocio opuestos y pruebas en ambos flancos más endebles de lo que a cualquiera de los dos laboratorios le gustaría que notaras.

Esta página está escrita como lo que sabemos hasta ahora, porque ninguno de los dos modelos tiene una cifra de precisión verificada de forma independiente. Las cifras de Muse Voice Transcribe son afirmaciones del día de lanzamiento de Meta, reportadas por el proveedor y no reproducidas; VibeVoice-ASR-Streaming-7B no ha publicado ninguna cifra de precisión de streaming en texto. Por lo tanto, la comparación a continuación se apoya en lo que es estructural y verificable (arquitectura, precio, licencia, comportamiento documentado) y etiqueta los pocos números del proveedor cuando aparecen.

Dos retadores al pipeline por lotes, con un día de diferencia.

Ambos modelos atacan la misma suposición: que la conversión de voz a texto es algo que se ejecuta sobre una grabación terminada. Muse Voice Transcribe es el primer producto que Meta denomina «modelo de percepción de audio en tiempo real»: una única pasada en streaming que se encarga del reconocimiento, de la diarización de hablantes entre más de veinte voces y de la detección de punto final, la tarea de decidir cuándo un hablante ha terminado de verdad y no solo ha hecho una pausa. Se lanza a la vez en tres frentes: la API Meta Model a 0,18 dólares por hora de audio, Meta AI para Mac, donde mantener pulsada la tecla Fn dicta en cualquier aplicación, y Muse Code. VibeVoice-ASR-Streaming-7B, de Microsoft, es el miembro de streaming de la familia abierta VibeVoice, y su rastro de publicación es mucho más discreto: un repositorio de Hugging Face creado el 2 de septiembre (las marcas de tiempo muestran las 15:46 UTC, tocado por última vez tres minutos después), ocho fragmentos safetensors con licencia MIT y una línea en el registro de noticias con fecha del 3 de septiembre en el repositorio de GitHub microsoft/VibeVoice que lo describe como «un modelo ASR de streaming unificado que transcribe continuamente quién dijo qué a medida que llega el habla, con soporte para hotwords personalizadas y 10 idiomas». Un día después de su subida, todavía mostraba cero descargas.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

La colisión de características

• Mecanismo de streaming — Muse Voice Transcribe consume audio en fragmentos de 80 milisegundos y confirma las palabras a medida que se estabilizan, mientras que VibeVoice-ASR-Streaming-7B procesa fragmentos de ~2,9 segundos con ~0,5 segundos de anticipación, emitiendo texto una vez por cada fragmento resuelto.

• Atribución del hablante: más de 20 hablantes en una sola pasada, error medio de diarización del 17,5 % reportado por el proveedor frente a la salida en streaming de quién dijo qué, según lo afirmado en la ficha del modelo, sin verificar.

• Endpointing — integrado: el flujo lleva un límite de enunciado finalizado frente a no documentado como señal de salida.

• Controles de contexto: idioma, palabra clave y sesgo de contexto frente a hotwords personalizados mediante un prompt de contexto (--context_info).

• Idiomas: entrenado en más de 70, 25 verificados exhaustivamente en el lanzamiento, cambio de código nativo frente a los 10 declarados (en, zh, es, pt, de, ja, ko, fr, ru, it).

• Evidencia — afirmaciones del proveedor en el día del lanzamiento: 3,1 % de WER en resultados finales a 0,16 s después del habla; 3,6 % en los primeros resultados parciales; citando la tabla de clasificación de streaming de Artificial Analysis, frente a la ausencia de cualquier cifra de WER o latencia de streaming publicada como texto.

• Costo y licencia — $0.18 por hora de audio, alojado, pesos cerrados vs $0 por los pesos (MIT), aproximadamente 18 GB de bf16, autoalojado.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): business model - open weights MIT self-hosted; streaming cadence - ~2.9 s chunks, config-derived; speaker output - claimed who-said-what, unverified; endpointing - not documented; languages - 10 declared; price - $0 weights, ~18 GB bf16. Right column Muse Voice Transcribe (released Sep 1, 2026 - Meta Model API): hosted API closed weights; 80 ms chunks, adaptive delay, finals 0.16 s (vendor); 20+ speakers, 17.5% avg DER (vendor); built-in turn-end signal; 25 verified (70+ trained); $0.18 per audio-hour. Footer: 'Muse figures are vendor-reported launch-day claims. VibeVoice specs read from the HF repo. Neither is independently benchmarked.'

Dos ideas muy diferentes de "streaming"

La palabra streaming abarca un amplio rango de cadencia, y la brecha entre estos dos extremos es lo bastante amplia como para cambiar lo que se puede construir sobre cada uno. Muse Voice Transcribe hace streaming a nivel de palabra. La arquitectura de Meta consume audio en fragmentos de 80 milisegundos y utiliza lo que denomina "adaptive delay": una política de retardo aprendida mediante aprendizaje por refuerzo que confirma cada palabra en cuanto el modelo está seguro, reteniendo más contexto para las palabras de las que está menos seguro, en lugar de aplicar un presupuesto de latencia fijo. El proveedor afirma que las transcripciones finales se obtienen 0,16 segundos después de que el hablante se detiene y que los primeros resultados parciales llegan a los 0,13 segundos. Esa cadencia está pensada para bucles interactivos: subtitulación en vivo, dictado, un agente de voz que necesita responder a un enunciado terminado casi de inmediato.

VibeVoice-ASR-Streaming-7B transmite en streaming a una granularidad más gruesa. Su configuración de preprocesador muestra que el audio llega a 24 kHz, se comprime 3200× en tokens a unas 7,5 tramas por segundo y luego se procesa en bloques de 22 tramas con una anticipación de 4 tramas — aproximadamente 2,9 segundos de audio por bloque y alrededor de medio segundo de anticipación; cifras derivadas de la configuración, no de una latencia medida. El texto se emite a medida que se resuelve cada bloque, con el contexto de bloques anteriores preservado a través de la caché KV, lo que evita que una sesión larga se recalcule desde cero. Una transcripción que crece en incrementos de unos tres segundos es suficiente para notas de reuniones y análisis de llamadas; es un producto diferente del streaming de palabras en menos de un segundo para conversación en vivo. Ninguno de los laboratorios ha publicado una medición de latencia de extremo a extremo para el checkpoint de streaming, por lo que la cadencia debe considerarse el diseño, y la sensación en el mundo real, algo no probado.

Etiquetas de hablante y endpointing: integrados en uno, solo declarados en el otro.

La atribución de hablante es donde los productos de streaming más a menudo exageran, y ambos hacen esa afirmación. La versión de Muse Voice Transcribe es concreta y estructural: la diarización se ejecuta dentro de la misma pasada de streaming que el reconocimiento, por lo que una grabación de una llamada de veinte personas puede llevar etiquetas por hablante sin un paso separado de "subir, esperar, obtener los hablantes", y Meta informa una tasa de error de diarización promedio del 17.5% — una cifra de proveedor, no reproducida, pero una cifra unida a un mecanismo real. También emite límites de endpoint, la capacidad más discreta: una aplicación recibe una señal clara de "el turno de este hablante ha terminado" sin construir un detector de actividad de voz, razón por la cual los agentes de voz basados en ASR puro tan a menudo cortan a las personas.

VibeVoice-ASR-Streaming-7B afirma en su ficha de modelo ofrecer salida de streaming con quién-dijo-qué, en línea con la salida estructurada Quién/Cuándo/Qué del VibeVoice-ASR por lotes — pero, en el caso del checkpoint de streaming, la afirmación no está verificada, ninguna prueba independiente la ha reproducido y no hay una señal de endpointing documentada como la que Muse incluye. Si tu carga de trabajo es audio en vivo genuinamente multi-hablante, Muse está ofreciendo hoy un mecanismo más completo; si estás evaluando si un modelo de pesos abiertos puede hacer el mismo trabajo en hardware que tú controlas, la afirmación de VibeVoice es exactamente el tipo de cosa que deberías poner a prueba con tus propias grabaciones de reuniones antes de creértela.

La evidencia: afirmaciones del día del lanzamiento frente a una tarjeta en blanco.

Vale la pena ser precisos sobre lo que tiene cada lado, porque ninguno tiene lo que un comprador realmente quiere. Muse Voice Transcribe tiene un denso conjunto de cifras del proveedor — 3.1% de tasa de error de palabras en transcripciones finales, 3.6% en primeras transcripciones parciales, 0.16 segundos de latencia final, 17.5% de error promedio de diarización — todo publicado por Meta el día del lanzamiento y apuntando a la tabla de clasificación de voz a texto en streaming de Artificial Analysis, donde Meta afirma ocupar el primer puesto. Esas son afirmaciones, no reproducidas por nadie fuera del laboratorio, pero son lo suficientemente específicas como para ser falsables, lo cual es una especie de progreso.

VibeVoice-ASR-Streaming-7B no tiene nada de eso. Su ficha de modelo incluye una figura de evaluación como imagen y el informe técnico de streaming es un PDF, pero no hay una cifra de WER de streaming o de latencia que se pueda citar en prosa. El único ancla numérica en la familia VibeVoice es la tabla reportada por el proveedor en la ficha del modelo por lotes VibeVoice-ASR: 7,77% de WER promedio en ocho conjuntos de prueba en inglés y 2,20% en LibriSpeech clean, que explícitamente no es el número de este checkpoint. Cuando una afirmación del día de lanzamiento se encuentra con una ficha en blanco, el desempate honesto es todo excepto el WER titular: precio, licencia, cadencia de streaming y las características que cada lado realmente documenta.

Idiomas: 25 verificados frente a 10 declarados

La cobertura de idiomas separa a ambos más de lo que afirman las cifras de precisión en los titulares. Muse Voice Transcribe fue entrenado con más de 70 idiomas, pero Meta valida 25 en el lanzamiento — y la lista verificada, no la de entrenamiento, es la cobertura de producción, con el cambio de código nativo como diferenciador: está diseñado para alternar idiomas a mitad de frase sin que se lo indiquen. VibeVoice-ASR-Streaming-7B declara 10 idiomas en su ficha de modelo — inglés, chino, español, portugués, alemán, japonés, coreano, francés, ruso, italiano — frente a los más de 50 del VibeVoice-ASR por lotes. Si tu tráfico incluye conversaciones con cambio de código, Muse tiene la propuesta más específica; si se limita a esos diez idiomas, la cobertura del modelo de Microsoft es al menos explícita, lo cual es más de lo que ofrece la mayoría de los materiales de lanzamiento.

Costo y lo que conservas

La diferencia de modelo de negocio es la manera más clara de decidir. {{1}}Muse Voice Transcribe, a 0,18 USD por hora de audio, está por debajo del precio de lista de todas las principales API de transcripción en streaming: sin GPU, sin operaciones, pesos cerrados, y el precio lo fija Meta.{{/1}} {{2}}VibeVoice-ASR-Streaming-7B no cuesta nada descargarlo, pero autoalojarlo en una GPU de clase 24 GB exige unos 18 GB de pesos bf16 sin contar la caché KV, con los scripts de demostración de microsoft/VibeVoice o el plugin de vLLM como rutas de servicio documentadas, y todavía no hay ningún proveedor de inferencia que lo aloje.{{/2}} {{3}}La licencia MIT es el activo duradero: los pesos son tuyos para conservarlos y ajustarlos, algo que ninguna suscripción a una API permite.{{/3}} {{4}}Ahí es también donde el panorama de precios podría volverse interesante: en cuanto un proveedor llegue a alojar el checkpoint abierto, la cuestión de los 0,18 USD por hora se convierte en un precio de mercado en lugar del precio de lista de un solo proveedor, que es exactamente la situación en la que un router pass-through demuestra su valor.{{/4}} {{5}}OrcaRouter no enruta voz a texto hoy en día, y ninguno de estos modelos está en su catálogo; lo que sí hace es trasladar los precios de lista de los proveedores sin margen en los más de 200 modelos de lenguaje que consumen una transcripción en vivo, de modo que un recorte de precios de cualquier proveedor en cualquier punto de esa pila se hace efectivo para el comprador el mismo día en que se anuncia.{{/5}}

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

Preguntas frecuentes

¿El WER del 3.1% de Muse Voice Transcribe significa que es más preciso que VibeVoice-ASR-Streaming-7B?

No, y la comparación aún no es significativa. El 3,1 % de Meta es una afirmación del día del lanzamiento para la ruta de streaming, reportada por el proveedor y sin reproducir. VibeVoice-ASR-Streaming-7B no ha publicado ninguna cifra de precisión de streaming en texto en absoluto. Hasta que ambos modelos se sometan al mismo banco de pruebas público con el mismo audio, la única afirmación honesta es que Muse tiene una cifra concreta que puede ponerse a prueba, y VibeVoice todavía no tiene ninguna.

¿Puedo usar cualquiera de los dos modelos en audio que ya está grabado?

Sí a ambas, con formas distintas. Muse Voice Transcribe maneja grabaciones de más de una hora a través de la misma API de streaming. El plugin vLLM de VibeVoice-ASR-Streaming-7B expone un endpoint de transcripción de archivo completo junto a su endpoint de streaming por WebSocket. Pero ambos están diseñados y tarifados para el caso en vivo —Muse por su modelo de negocio únicamente de streaming, VibeVoice por la arquitectura fragmentada que emite audio a medida que llega—, por lo que si tu carga de trabajo consiste solo en archivos por lotes, una API dedicada a la transcripción de archivos suele ser más barata y con mejor medición que cualquiera de los dos.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube