Una tarjeta de título principal generada para 'VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC: las dos apuestas silenciosas de streaming con pesos abiertos', subtitulada 'Dos modelos ASR de streaming con pesos abiertos, con ocho días de diferencia', con dos tarjetas de modelo — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 sept 2026 · MIT · ~3B en total · LLM de voz) y Granite Speech 5.0 470M TurboCTC (IBM · 25 ago 2026 · Apache-2.0 · 470M · codificador CTC puro) — y etiquetas que dicen 'Velocidad de clase edge (IBM)', 'Solo inglés (IBM)' y 'Quién dijo qué en 10 idiomas (Microsoft, sin verificar)'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC: las dos apuestas silenciosas de streaming con pesos abiertos

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Los dos lanzamientos más interesantes de conversión de voz a texto en streaming con pesos abiertos de finales de agosto de 2026 se publicaron sin evento de lanzamiento. El 25 de agosto, IBM publicó Granite Speech 5.0 470M TurboCTC en Hugging Face — pesos, ficha del modelo y una entrada de blog, nada más — y el 2 de septiembre, Microsoft Research subió VibeVoice-ASR-Streaming-1.5B bajo el espacio de nombres de microsoft sin anuncio alguno, más allá de una línea de noticias en su repositorio de GitHub VibeVoice. Son el mismo tipo de cosa y apuestas de ingeniería opuestas: el modelo de IBM es un codificador CTC puro de 470 millones de parámetros diseñado para funcionar a velocidades de edge en una computadora portátil, mientras que el de Microsoft es un modelo de lenguaje de voz de clase 1.5B envuelto en tokenizadores de audio y una cabeza de difusión — unos tres mil millones de parámetros en total — construido para entender el habla como lenguaje mientras transcribe.

Antes de las cifras, las etiquetas de atribución que mantienen honesta esta comparación. Todo lo marcado como {{1}}reportado por IBM{{/1}} proviene de la ficha del modelo Granite Speech 5.0 470M TurboCTC y de sus entradas en el leaderboard de Open ASR, ejecutadas por IBM con el entorno de evaluación oficial el día del lanzamiento y aún no reproducidas de forma independiente. Todo lo relativo a {{2}}VibeVoice-ASR-Streaming-1.5B{{/2}} proviene de la lectura del repositorio — los archivos de configuración, la ficha del modelo y la documentación de streaming de Microsoft —, porque Microsoft no ha publicado cifras de precisión ni de latencia por escrito y nadie fuera de Microsoft ha sometido el checkpoint a pruebas de referencia. No se utilizó el mismo entorno de evaluación para ambos; esta comparación evalúa a los dos contra la misma evidencia pública, que es todo lo que cada empresa ha ofrecido hasta ahora.

Dos lanzamientos discretos, con ocho días de diferencia

Ambos modelos llegaron de la misma manera discreta, algo que conviene señalar sin rodeos porque ninguna de las dos empresas ha dicho mucho desde entonces. El Granite Speech 5.0 470M TurboCTC de IBM es el miembro con licencia Apache-2.0 de un lanzamiento de dos variantes — IBM también publicó una versión hermana no comercial -NC con cifras principales ligeramente mejores — y su ficha incluye una fecha de lanzamiento del 25 de agosto de 2026, con soporte nativo de Transformers y un envío al leaderboard de Open ASR con la misma fecha. El par de streaming de Microsoft, VibeVoice-ASR-Streaming-7B y VibeVoice-ASR-Streaming-1.5B, se creó en Hugging Face en el mismo minuto del 2 de septiembre; la línea de noticias en GitHub que anuncia «un modelo unificado de ASR en streaming que transcribe continuamente quién dijo qué a medida que llega el habla» está fechada el 3 de septiembre y menciona al de 7B, dejando al 1.5B, que se cubre aquí, como el hermano menor que se publicó silenciosamente a su lado.

La parte interesante es que dos equipos recurrieron a la palabra "streaming" y construyeron cosas opuestas. Granite Speech 5.0 470M TurboCTC es un codificador conformer entrenado con CTC y decodificado en una sola pasada no autorregresiva — no hay un decodificador que genere texto token por token, por lo que el modelo es estructuralmente económico y estructuralmente rápido. VibeVoice-ASR-Streaming-1.5B es un LLM de voz: dos tokenizadores convolucionales convierten audio de 24 kHz en un flujo de tokens de voz de ~7.5 Hz, un decodificador de la familia Qwen2 (28 capas, 1,536 unidades ocultas — la clase de 1.5B) lo lee, y una cabeza de difusión produce la transcripción en fragmentos de unos 2.9 segundos con aproximadamente medio segundo de anticipación. Uno es un auto de carreras; el otro es un pequeño modelo de lenguaje que resulta que escucha.

La verificación de especificaciones.

• Parámetros — Granite Speech 5.0 470M TurboCTC: 470M, solo codificador vs VibeVoice-ASR-Streaming-1.5B: ~3B en total (backbone de LM de clase 1.5B más tokenizadores y cabeza de difusión).

• Arquitectura — codificador conformer con autoatención por bloques y autocondicionamiento, entrenado con CTC, decodificación voraz no autorregresiva frente a dos tokenizadores acústicos/semánticos que alimentan un decodificador causal de la familia Qwen2 con una cabeza de difusión DDPM.

• Cadencia de salida — ~12,5 tramas de salida por segundo, transmisión por fragmentos frente a ~7,5 Hz de tokens de voz, emitiendo texto por fragmento de ~2,9 s con ~0,5 s de anticipación.

• Idiomas: solo inglés frente a diez: chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso y español.

• Pesos — aproximadamente 0.5B parámetros / una fracción de un GB, clase de borde vs ~5.6 GB bf16, clase NVIDIA-GPU.

Precisión en la impresión: IBM informó un promedio de WER de ~5,00 % en los conjuntos de formato corto de Open ASR, frente a ninguna cifra de WER publicada en el texto.

• Licencia — Apache-2.0 vs MIT.

• Lanzado — 25 de agosto de 2026 vs 2 de septiembre de 2026.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total / 1.5B-class LM, Architecture speech LLM + diffusion, Languages 10, Streaming ~2.9 s chunks + ~0.5 s lookahead, WER none published, License MIT. Right column Granite Speech 5.0 470M TurboCTC: Released Aug 25 2026, Params 470M, Architecture conformer CTC, Languages English only, Streaming chunkwise ~12.5 frames/s, WER ~5.00% (IBM-reported), License Apache-2.0. Footer reads 'Granite figures IBM-reported, unverified; VibeVoice specs read from the HF repo; no independent benchmark of either exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

Velocidad: uno está diseñado para ser pequeño, el otro para ser un modelo de lenguaje.

La brecha arquitectónica se manifiesta primero en la velocidad y el hardware. Granite Speech 5.0 470M TurboCTC está orientado a portátiles, teléfonos inteligentes y otros dispositivos de borde. Como un codificador CTC puro no muestrea nada —la salida es una única pasada codiciosa sobre una cabeza BPE de 16 384 unidades—, resulta extremadamente económico de ejecutar, y la ficha del modelo de IBM reporta una cifra de rendimiento Open ASR medida en una sola H200 que se sitúa en las decenas de miles de RTFx para la línea TurboCTC, además de una demo WebGPU que transcribe en vivo en una pestaña del navegador. Esas cifras provienen de mediciones de IBM y no han sido reproducidas, pero el punto estructural se sostiene por sí solo: un codificador de 470M sin decodificador autorregresivo es un modelo que se puede ejecutar en el hardware de serie de un teléfono.

VibeVoice-ASR-Streaming-1.5B hace la elección opuesta. Su decodificador es un modelo de lenguaje causal, lo que significa que el texto se genera en un bucle más pesado que un argmax de CTC, y las formas documentadas de ejecutarlo son autoalojadas en GPU NVIDIA — los demos en Python del repositorio microsoft/VibeVoice o su plugin de vLLM — con aproximadamente 5,6 GB de pesos bf16 antes de cualquier caché KV. Microsoft no ha publicado ninguna afirmación de rendimiento ni de factor de tiempo real, por lo que no hay ninguna cifra del proveedor que contraponer a la de IBM. Lo que la arquitectura de modelo de lenguaje ofrece a cambio es contexto: el modelo mantiene la comprensión del hablante y del contenido a lo largo de la transcripción de la misma manera que lo hace un modelo de lenguaje, que es la diferencia entre transcribir sonido y seguir una conversación.

Precisión: un proveedor imprimió números, el otro imprimió una imagen

Según la evidencia, Granite Speech 5.0 470M TurboCTC supera a VibeVoice-ASR-Streaming-1.5B por un punto de referencia completo y publicable. IBM ejecutó su modelo a través del arnés oficial del leaderboard Open ASR el día del lanzamiento y reporta una tasa media de error de palabra en torno al 5,00% en los conjuntos públicos ingleses de formato corto, una cifra medida por el proveedor, no verificada por ningún tercero y completamente ausente del lado de Microsoft en esta comparación. La ficha del modelo de VibeVoice-ASR-Streaming-1.5B incluye una figura de resultados de evaluación como imagen, pero ningún WER, RTF ni latencia numéricos en texto; el único ancla numérica en la familia VibeVoice es el promedio de WER del 7,77% reportado por el proveedor en la ficha del modelo por lotes VibeVoice-ASR, en ocho conjuntos de prueba en inglés, que describe el modelo no streaming y no es transferible. Independientemente de cómo terminen las eventuales ejecuciones independientes, el resumen honesto hoy es que IBM publicó un número y Microsoft publicó una imagen.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Idiomas y salida: solo inglés versus quién-dijo-qué en diez

Granite Speech 5.0 470M TurboCTC es exclusivo para inglés y devuelve texto transcrito en bruto. Eso no es una limitación para las cargas de trabajo a las que IBM apunta — transcripción de inglés empresarial en hardware de borde —, pero pone fin a la comparación en el momento en que el audio no está en inglés. VibeVoice-ASR-Streaming-1.5B lista diez idiomas y afirma ofrecer una salida en streaming con atribución al hablante: la ficha del modelo dice que "transcribe continuamente quién dijo qué a medida que llega el habla", con hotwords para términos del dominio que se pasan como prompt de contexto. Ambos extras merecen una lectura escéptica — la diarización en streaming a través de los límites de los fragmentos es genuinamente difícil, y la afirmación no está verificada —, pero son la razón por la que un equipo con reuniones multilingües en vivo consideraría el modelo de Microsoft.

Licencias y ecosistema: Apache-2.0 frente a MIT, Transformers frente a un repositorio de investigación

Ambas licencias permiten uso comercial, lo que ya separa a este par de la variante -NC de IBM de la misma arquitectura. Granite Speech 5.0 470M TurboCTC es Apache-2.0 con la concesión de patentes habitual, y es nativo de Hugging Face Transformers (AutoModelForCTC de transformers >= 5.16) además de mlx-audio para Apple Silicon — lo que significa que se ejecuta en cualquier lugar donde se ejecuta la mayor comunidad de implementación del ecosistema, en hardware de cualquier proveedor. VibeVoice-ASR-Streaming-1.5B es MIT, lo cual es aún más simple, pero su vía de servicio es una configuración de investigación a partir del código fuente: la clase de arquitectura del checkpoint, VibeVoiceForASRStreamingTraining, no está en la documentación pública de Transformers, y los propios documentos de streaming de Microsoft apuntan al código de demostración del repositorio y a un plugin de vLLM en lugar de una carga de biblioteca estándar. Para un equipo de producción, la diferencia es real: un modelo se integra hoy en un pipeline existente de Transformers, y el otro te pide que levantes un repositorio de investigación y verifiques tú mismo la ruta de carga.

A screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the model title Granite-Speech-5.0-470M-TurboCTC, the Apache-2.0 license tag, the English-language tag, the automatic-speech-recognition pipeline tag, and the model summary describing a compact 470 million parameter English ASR model for edge deployment.

¿Qué release silencioso deberías evaluar?

Evalúa primero Granite Speech 5.0 470M TurboCTC si tu carga de trabajo es en inglés, tu hardware es de clase edge o está limitado por CPU, y quieres un modelo que se integre en Transformers con un número en la ficha para verificar rápidamente. Es la apuesta de menor riesgo en todos los aspectos excepto uno: no te ayudará con un segundo idioma ni con una transcripción de reuniones en vivo que necesite saber quién habla.

Evalúa VibeVoice-ASR-Streaming-1.5B si necesitas streaming multilingüe, si la salida de quién dijo qué o las hotwords son funciones que quieres probar, o si prefieres apostar por un enfoque de modelo de lenguaje aplicado al habla en lugar de un codificador puro. Reserva presupuesto para una GPU de NVIDIA, una instalación desde el código fuente, ~5.6 GB de pesos y una evaluación que diseñes tú mismo, porque nadie — Microsoft incluido — ha publicado todavía una cifra en la que puedas confiar.

Lo que ningún lanzamiento silencioso cambia es el valor de mantener la capa de ASR intercambiable mientras averiguas qué apuesta da resultado. Ambos modelos son jóvenes y, al momento de escribir esto, ninguno se sirve a través de OrcaRouter; cuando un proveedor aloja alguno de los dos, la forma de probarlo con bajo riesgo es detrás de una capa de enrutamiento que da acceso a más de 200 modelos al precio de lista del proveedor — con un margen del 0 %, de modo que los cambios de precio se aplican ese mismo día — y con conmutación automática por error a lo que ya sea de tu confianza. Enruta una porción de audio real hacia el nuevo modelo, lee las transcripciones y deja que tu propio tráfico, y no una hoja de referencia del día del lanzamiento, decida qué apuesta silenciosa era la correcta.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube