Tarjeta de título principal para el artículo 'VibeVoice-ASR-Streaming-1.5B' con la etiqueta 'Lo que sabemos hasta ahora', subtítulo 'El servicio de voz a texto en streaming de Microsoft se lanzó discretamente', y chips que dicen 'Lanzado el 2 de septiembre de 2026', 'MIT · Pesos abiertos' y '10 idiomas'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B, explicado: el ASR de streaming de Microsoft llegó sin un lanzamiento

Autor

Alistair Wren

Fecha de publicación

Volver a todas las publicaciones

El 2 de septiembre de 2026, Microsoft Research subió dos nuevos checkpoints de transcripción de voz a texto a Hugging Face sin comunicado de prensa, sin publicación de blog y sin alharacas: microsoft/VibeVoice-ASR-Streaming-1.5B y su hermano mayor microsoft/VibeVoice-ASR-Streaming-7B. Hasta ahora, el único anuncio es una entrada de noticias con fecha del 3 de septiembre de 2026 en la sección News del repositorio de GitHub de VibeVoice, el proyecto de código abierto de Microsoft, que describe el lanzamiento como un modelo ASR de streaming unificado que transcribe quién dijo qué mientras el audio todavía está llegando, con hotwords personalizadas y diez idiomas. Ambos checkpoints tienen licencia MIT, ambos se crearon con unos cinco minutos de diferencia en la cuenta oficial de microsoft en Hugging Face, y ambos mostraban cero descargas cuando lo comprobamos un día después. No pudimos encontrar cobertura de terceros de ninguno de los dos.

Eso hace que esta sea una reseña inusual: un lanzamiento real y fechable — pesos en Hugging Face con fecha del 2 de septiembre, un anuncio en el repositorio con fecha del 3 de septiembre — que el resto del mundo aún no ha llegado a conocer. Todo lo que se puede saber a continuación proviene de leer el repositorio: los archivos de configuración, la tarjeta del modelo y la propia documentación de streaming de Microsoft. Todo lo que aún no está confirmado —exactitud, latencia real, si la atribución del hablante en streaming sobrevive a una llamada real con dos interlocutores— está etiquetado como tal. No hay ningún benchmark que citar porque Microsoft aún no ha publicado uno en forma de texto.

El único anuncio es una línea de noticias.

VibeVoice es la familia de modelos de voz de código abierto con licencia MIT de Microsoft Research. Su miembro de ASR más conocido, microsoft/VibeVoice-ASR, se lanzó el 21 de enero de 2026: un modelo por lotes que procesa hasta sesenta minutos de audio en una sola pasada y devuelve transcripciones estructuradas con hablante, marcas de tiempo y contenido — desde entonces ha recibido unas 700 000 descargas en Hugging Face. El 2 de septiembre la misma organización publicó las variantes de streaming, microsoft/VibeVoice-ASR-Streaming-7B y microsoft/VibeVoice-ASR-Streaming-1.5B; la API de Hugging Face asigna al 7B la marca temporal 2026-09-02T15:46 UTC y al 1.5B, cinco minutos después, las 15:51 UTC. La tabla de modelos del repositorio de GitHub ahora incluye VibeVoice-ASR-Streaming como una entrada propia, y su sección de noticias incorpora la línea del 3 de septiembre que lo anuncia.

Lo que es genuinamente nuevo en comparación con el modelo de enero es el modelo de interacción: los puntos de control de streaming transcriben a medida que llega el audio, en lugar de esperar a un archivo completo. Todo lo demás —la arquitectura subyacente de tokens de voz, la salida con atribución al hablante, el mecanismo de hotwords— es una continuación del diseño por lotes, escalado y reorientado al uso en tiempo real. Nótese la diferencia de idiomas desde el principio: el modelo por lotes anuncia más de 50 idiomas, mientras que la tarjeta de streaming lista diez.

A screenshot of the microsoft/VibeVoice GitHub repository README showing the model table that lists VibeVoice-ASR-Streaming as a member of the family and the News section entry dated September 3, 2026 announcing the streaming ASR release.

¿Qué significa 'streaming' en este checkpoint?

El documento de streaming de Microsoft describe la intención claramente: el modelo transcribe mientras el audio aún está llegando, y emite texto una vez por cada fragmento de audio, de modo que la transcripción aparece a medida que el hablante habla. El preprocessor_config.json del repositorio 1.5B hace concreta la cadencia:

• Frecuencia de muestreo y de tokens — audio de entrada a 24 kHz, comprimido 3,200×, lo que produce un flujo de tokens de voz de aproximadamente 7.5 Hz (alrededor de un token cada 133 ms).

• Fragmento — 22 tramas, lo que a 7.5 Hz equivale a unos 2.9 segundos de audio por segmento emitido.

• Lookahead — 4 tramas, aproximadamente 0,5 segundos de audio futuro para reforzar el segmento actual.

(La aritmética es sencilla a partir del repositorio: 22 × 3.200 = 70.400 muestras ≈ 2,93 s a 24 kHz; 4 × 3.200 = 12.800 muestras ≈ 0,53 s. El propio documento de Microsoft señala que un checkpoint siempre se ejecuta sobre el fragmento con el que se entrenó, por lo que estos valores no son ajustables en tiempo de inferencia).

Eso lo sitúa en la familia de transmisión por fragmentos (chunked streaming) más que en la de palabra por palabra: una transcripción en vivo crece en incrementos de unos tres segundos con aproximadamente medio segundo de anticipación, no en parciales por token. Es un diseño legítimo y común para la transcripción de reuniones y llamadas, pero tiene un perfil de latencia distinto al de los sistemas que emiten parciales en menos de un segundo — así que trate el «streaming» como un espectro y mídalo contra su propio presupuesto de latencia antes de construir sobre él un producto de subtitulado en vivo.

Bajo el capó: un LLM de voz a escala Qwen.

Al leer el config.json del checkpoint de 1.5B, nos encontramos con la ya conocida receta de VibeVoice a menor escala:

• El decodificador es un modelo de lenguaje de la familia Qwen2 cuyas dimensiones coinciden exactamente con la clase Qwen2.5 de 1.5B: 28 capas, 1,536 unidades ocultas, 12 cabezales de atención con 2 cabezales clave-valor y una ventana de 65,536 tokens. El LLM es lo que permite que el modelo mantenga la comprensión del hablante y del contenido a lo largo de la transcripción.

• Los tokenizadores acústicos y semánticos — codificadores convolucionales profundos con stride de 8/5/5/4/2/2 — convierten el audio de 24 kHz en el flujo de tokens de habla de ~7.5 Hz que lee el decodificador.

• Una cabeza de difusión (DDPM, 20 pasos de eliminación de ruido, v-prediction) se ubica en el lado de generación, en consonancia con el resto de la línea VibeVoice.

• Honestidad sobre el tamaño: los metadatos safetensors del propio checkpoint indican alrededor de 3 mil millones de parámetros, aproximadamente 5,6 GB de pesos. El “1.5B” del nombre es la escala del backbone del lenguaje —la lectura natural de una configuración cuyo decodificador es un modelo Qwen de clase 1.5B—, mientras que los tokenizadores de audio y la cabeza de difusión añaden el resto. La cadena de arquitectura en la configuración, VibeVoiceForASRStreamingTraining, señala que este es un checkpoint de la familia de investigación.

A single-column scoreboard titled 'VibeVoice-ASR-Streaming-1.5B — the scoreboard' with the subtitle 'Key specs read from the Hugging Face checkpoint and Microsoft's repo' and six rows: 'Released: Sept 2, 2026', 'Streaming cadence: ~3 s chunks, ~0.5 s lookahead', 'Languages: 10', 'Speaker output: who said what (unverified)', 'Scale: 1.5B LM backbone, ~3B total', 'License: MIT, open weights'. Footer: 'Specs from HF config and microsoft/VibeVoice repo — no independent benchmarks yet.' The OrcaRouter logo is composited in the bottom-right corner.

Quién dijo qué, en diez idiomas

La capacidad principal de la ficha del modelo es la transcripción en streaming con atribución de hablante: “{{1}}transcribe continuamente quién dijo qué a medida que llega el habla{{/1}}”, según la propia viñeta de la ficha. También anuncia palabras clave personalizadas para términos del dominio y enumera diez idiomas compatibles: {{2}}chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso y español{{/2}}.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the MIT license tag, the automatic-speech-recognition pipeline tag, and the card description of streaming speaker-attributed transcription with customized hotwords and ten languages.

Las palabras calientes se implementan mediante el mismo mecanismo de sesgo contextual que usa el modelo por lotes. En la demo de línea de comandos de Microsoft, se pasan como información de contexto — por ejemplo --context_info "Microsoft,VibeVoice" — para sesgar el reconocimiento hacia nombres y términos técnicos sin necesidad de ajuste fino. La tarjeta no dice nada sobre la detección automática de idioma ni sobre el cambio de código para el modelo de streaming, lo que supone otra brecha frente a las afirmaciones del modelo por lotes.

Una advertencia merece énfasis. La página de documentación de streaming se centra en la emisión fragmentada y las hotwords; no detalla cómo se mantiene la atribución del hablante entre los límites de los fragmentos. La diarización en streaming es realmente difícil: los hablantes se superponen, y el límite de un fragmento es exactamente donde la atribución se desvía. El encuadre de «quién dijo qué» en la tarjeta es una afirmación del proveedor hasta que alguien haga pasar por ella una llamada real en vivo con dos hablantes y lo compruebe.

Dónde se sitúa: la familia VibeVoice y el campo de la ASR en streaming de 2026

Dentro de la familia, el lanzamiento se inserta de la siguiente manera:

• microsoft/VibeVoice-ASR (21 de enero de 2026) — el buque insignia para procesamiento por lotes: hasta 60 minutos en una sola pasada, más de 50 idiomas, salida quién/cuándo/qué, palabras calientes, aproximadamente 700 000 descargas.

• microsoft/VibeVoice-ASR-Streaming-7B y microsoft/VibeVoice-ASR-Streaming-1.5B (2 de septiembre de 2026) — las nuevas variantes de streaming; el tema de este artículo es la 1.5B.

• microsoft/VibeVoice-ASR-BitNet (23 de julio de 2026) — un motor de borde cuantizado y orientado a CPU para el modelo por lotes.

• Los modelos VibeVoice-1.5B TTS y VibeVoice-Realtime-0.5B streaming-TTS son miembros separados de la misma familia, no forman parte de la línea ASR.

El campo más amplio del ASR de pesos abiertos ha venido avanzando hacia el tiempo real durante todo el año, por lo que una nueva propuesta de streaming tiene puntos de comparación directos. Qwen3-ASR (Alibaba, ~1.7B) es un modelo unificado de streaming y offline que cubre más de 50 idiomas y dialectos. El Nemotron 3.5 ASR de NVIDIA es un modelo de streaming de 0.6B que abarca 40 idiomas, bajo la licencia OpenMDW en lugar de MIT. El Granite Speech 5.0 470M TurboCTC de IBM es Apache-2.0, con cifras de rendimiento reportadas por el proveedor que son inusualmente altas. Frente a esos, el modelo de streaming de Microsoft se diferencia en tres aspectos: la licencia MIT, un backbone de LLM que aporta comprensión del hablante y del contenido, en lugar de un modelo acústico puro, y el enfoque de transcripción en vivo atribuida al hablante. Sus preguntas abiertas son la precisión y la latencia en el mundo real: ninguna cuenta todavía con una cifra independiente.

¿Qué aún no se ha verificado?

Leer el repositorio te dice el diseño; no te dice lo bien que funciona. Específicamente:

• No hay cifras de precisión ni de latencia en el texto. La ficha del modelo incluye una figura de resultados como imagen, pero no hay una tabla numérica de WER, RTF o latencia en prosa — nada que se pueda citar de forma independiente.

• Sin evaluación de terceros. Las descargas estaban en cero un día después de la subida; no hay ningún benchmark comunitario, ni entrada en el leaderboard, ni prueba independiente que hayamos podido encontrar.

La ruta de servicio es una configuración de investigación desde el código fuente. La documentación de streaming de Microsoft se ejecuta desde un clon del repositorio de GitHub de VibeVoice dentro de un contenedor de NVIDIA PyTorch (nvcr.io/nvidia/pytorch, con flash-attention recomendado). La tarjeta del modelo también muestra un fragmento de código de pipeline de Transformers y difiere los detalles de instalación a GitHub; si la versión actual publicada de Transformers ejecuta inferencia de streaming en este checkpoint directamente, no lo hemos verificado.

• El enfoque está centrado en la investigación. El repositorio de Microsoft describe los modelos VibeVoice como destinados a fines de investigación y desarrollo. Los pesos tienen licencia MIT; la postura es "aquí está la ciencia", no "aquí hay un producto con soporte". Reserve presupuesto para su propia fase de evaluación.

¿Deberías construir sobre ello?

Para equipos que ya autoalojan ASR, esta opción merece una evaluación de fin de semana si tu audio está dentro del conjunto de diez idiomas y necesitas específicamente transcripción en vivo con atribución de hablante a partir de un modelo con licencia MIT. Presupuesta unos ~5,6 GB de pesos para el modelo de 1.5B en una GPU NVIDIA y una instalación desde el código fuente, y planifica medir la precisión tú mismo con tu propio audio antes de confiar en él.

Para los equipos que hoy implementan un pipeline de transcripción en producción, la respuesta prudente es esperar a una de tres cosas: que Microsoft publique las cifras de precisión y latencia que actualmente solo existen como imagen; un benchmark independiente; o una ruta de servicio mantenida con un runtime compatible. El ritmo fragmentado de ~3 segundos también es una especificación que conviene contrastar con tu requisito de latencia, en lugar de asumirlo por la palabra "streaming".

La forma barata de mantener la opción abierta es evitar amarrar tu aplicación a un único motor de transcripción. Una capa de enrutamiento que intermedia muchos modelos a través de una sola API significa que, cuando VibeVoice-ASR-Streaming — o el próximo ASR abierto — aterrice en un proveedor de inferencia, hacerle pruebas A/B contra el modelo actual en el mismo tráfico sea un cambio de configuración, no una migración de plataforma. Como un enrutador de paso directo cobra el precio de lista del proveedor sin margen, esa comparación sigue siendo barata, y la conmutación automática por error impide que un modelo joven y no probado se convierta en un punto único de fallo en tu pipeline. Ese es el patrón general para adoptar cualquier modelo de pocos días: deja que se gane un lugar en el tráfico real antes de apostar la producción por él.

Preguntas frecuentes

¿Es VibeVoice-ASR-Streaming-1.5B un lanzamiento real de Microsoft?

Sí. El checkpoint está alojado en la cuenta oficial de Microsoft en Hugging Face, con una marca de tiempo de creación del 2 de septiembre de 2026, y el repositorio de GitHub microsoft/VibeVoice menciona VibeVoice-ASR-Streaming en su tabla de modelos con una entrada de noticia fechada el 3 de septiembre de 2026. Lo inusual no es la procedencia, sino el silencio: no hay comunicado de prensa, ni publicación en blog, ni cobertura de terceros hasta el momento de escribir esto.

¿Por qué dos tamaños, 7B y 1.5B?

Microsoft subió ambos checkpoints en el mismo minuto, pero no ha publicado una comparación. Según las configuraciones, el de 1.5B es el extremo pequeño: un backbone de lenguaje Qwen de clase 1.5B más la pila de audio, unos 3B de parámetros y ~5.6 GB de pesos. La lectura natural es un 7B de mayor precisión y un 1.5B más barato y rápido, pero Microsoft no lo ha dicho, y no hay benchmarks que confirmen esa compensación.

¿En qué se diferencia esto del VibeVoice-ASR anterior?

El modelo del lote de enero procesa hasta 60 minutos de audio en una sola pasada y anuncia más de 50 idiomas. Los puntos de control de streaming transcriben mientras llega el audio, emitiendo una transcripción en fragmentos de ~3 segundos con ~0,5 segundos de anticipación, y la ficha del modelo enumera diez idiomas. Ambos comparten la misma arquitectura de tokens de voz, la idea de salida atribuida al hablante y el mecanismo de palabras de activación.

Por ahora, VibeVoice-ASR-Streaming-1.5B es un checkpoint más un anuncio. Lee el repo si lo autoalojas y necesitas un ASR de streaming con licencia permisiva para evaluar; espera a los números si estás eligiendo un motor de producción. La señal interesante es que Microsoft está impulsando su línea de voz hacia el tiempo real a dos tamaños a la vez — y lo hizo tan silenciosamente que un día después, el contador de descargas todavía marcaba cero.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube