
VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC: las dos apuestas silenciosas de streaming con pesos abiertos
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
Los dos lanzamientos más interesantes de conversión de voz a texto en streaming con pesos abiertos de finales de agosto de 2026 se publicaron sin evento de lanzamiento. El 25 de agosto, IBM publicó Granite Speech 5.0 470M TurboCTC en Hugging Face — pesos, ficha del modelo y una entrada de blog, nada más — y el 2 de septiembre, Microsoft Research subió VibeVoice-ASR-Streaming-1.5B bajo el espacio de nombres de microsoft sin anuncio alguno, más allá de una línea de noticias en su repositorio de GitHub VibeVoice. Son el mismo tipo de cosa y apuestas de ingeniería opuestas: el modelo de IBM es un codificador CTC puro de 470 millones de parámetros diseñado para funcionar a velocidades de edge en una computadora portátil, mientras que el de Microsoft es un modelo de lenguaje de voz de clase 1.5B envuelto en tokenizadores de audio y una cabeza de difusión — unos tres mil millones de parámetros en total — construido para entender el habla como lenguaje mientras transcribe.
Antes de las cifras, las etiquetas de atribución que mantienen honesta esta comparación. Todo lo marcado como {{1}}reportado por IBM{{/1}} proviene de la ficha del modelo Granite Speech 5.0 470M TurboCTC y de sus entradas en el leaderboard de Open ASR, ejecutadas por IBM con el entorno de evaluación oficial el día del lanzamiento y aún no reproducidas de forma independiente. Todo lo relativo a {{2}}VibeVoice-ASR-Streaming-1.5B{{/2}} proviene de la lectura del repositorio — los archivos de configuración, la ficha del modelo y la documentación de streaming de Microsoft —, porque Microsoft no ha publicado cifras de precisión ni de latencia por escrito y nadie fuera de Microsoft ha sometido el checkpoint a pruebas de referencia. No se utilizó el mismo entorno de evaluación para ambos; esta comparación evalúa a los dos contra la misma evidencia pública, que es todo lo que cada empresa ha ofrecido hasta ahora.
Dos lanzamientos discretos, con ocho días de diferencia
Ambos modelos llegaron de la misma manera discreta, algo que conviene señalar sin rodeos porque ninguna de las dos empresas ha dicho mucho desde entonces. El Granite Speech 5.0 470M TurboCTC de IBM es el miembro con licencia Apache-2.0 de un lanzamiento de dos variantes — IBM también publicó una versión hermana no comercial -NC con cifras principales ligeramente mejores — y su ficha incluye una fecha de lanzamiento del 25 de agosto de 2026, con soporte nativo de Transformers y un envío al leaderboard de Open ASR con la misma fecha. El par de streaming de Microsoft, VibeVoice-ASR-Streaming-7B y VibeVoice-ASR-Streaming-1.5B, se creó en Hugging Face en el mismo minuto del 2 de septiembre; la línea de noticias en GitHub que anuncia «un modelo unificado de ASR en streaming que transcribe continuamente quién dijo qué a medida que llega el habla» está fechada el 3 de septiembre y menciona al de 7B, dejando al 1.5B, que se cubre aquí, como el hermano menor que se publicó silenciosamente a su lado.
La parte interesante es que dos equipos recurrieron a la palabra "streaming" y construyeron cosas opuestas. Granite Speech 5.0 470M TurboCTC es un codificador conformer entrenado con CTC y decodificado en una sola pasada no autorregresiva — no hay un decodificador que genere texto token por token, por lo que el modelo es estructuralmente económico y estructuralmente rápido. VibeVoice-ASR-Streaming-1.5B es un LLM de voz: dos tokenizadores convolucionales convierten audio de 24 kHz en un flujo de tokens de voz de ~7.5 Hz, un decodificador de la familia Qwen2 (28 capas, 1,536 unidades ocultas — la clase de 1.5B) lo lee, y una cabeza de difusión produce la transcripción en fragmentos de unos 2.9 segundos con aproximadamente medio segundo de anticipación. Uno es un auto de carreras; el otro es un pequeño modelo de lenguaje que resulta que escucha.
La verificación de especificaciones.
• Parámetros — Granite Speech 5.0 470M TurboCTC: 470M, solo codificador vs VibeVoice-ASR-Streaming-1.5B: ~3B en total (backbone de LM de clase 1.5B más tokenizadores y cabeza de difusión).
• Arquitectura — codificador conformer con autoatención por bloques y autocondicionamiento, entrenado con CTC, decodificación voraz no autorregresiva frente a dos tokenizadores acústicos/semánticos que alimentan un decodificador causal de la familia Qwen2 con una cabeza de difusión DDPM.
• Cadencia de salida — ~12,5 tramas de salida por segundo, transmisión por fragmentos frente a ~7,5 Hz de tokens de voz, emitiendo texto por fragmento de ~2,9 s con ~0,5 s de anticipación.
• Idiomas: solo inglés frente a diez: chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso y español.
• Pesos — aproximadamente 0.5B parámetros / una fracción de un GB, clase de borde vs ~5.6 GB bf16, clase NVIDIA-GPU.
Precisión en la impresión: IBM informó un promedio de WER de ~5,00 % en los conjuntos de formato corto de Open ASR, frente a ninguna cifra de WER publicada en el texto.
• Licencia — Apache-2.0 vs MIT.
• Lanzado — 25 de agosto de 2026 vs 2 de septiembre de 2026.

Velocidad: uno está diseñado para ser pequeño, el otro para ser un modelo de lenguaje.
La brecha arquitectónica se manifiesta primero en la velocidad y el hardware. Granite Speech 5.0 470M TurboCTC está orientado a portátiles, teléfonos inteligentes y otros dispositivos de borde. Como un codificador CTC puro no muestrea nada —la salida es una única pasada codiciosa sobre una cabeza BPE de 16 384 unidades—, resulta extremadamente económico de ejecutar, y la ficha del modelo de IBM reporta una cifra de rendimiento Open ASR medida en una sola H200 que se sitúa en las decenas de miles de RTFx para la línea TurboCTC, además de una demo WebGPU que transcribe en vivo en una pestaña del navegador. Esas cifras provienen de mediciones de IBM y no han sido reproducidas, pero el punto estructural se sostiene por sí solo: un codificador de 470M sin decodificador autorregresivo es un modelo que se puede ejecutar en el hardware de serie de un teléfono.
VibeVoice-ASR-Streaming-1.5B hace la elección opuesta. Su decodificador es un modelo de lenguaje causal, lo que significa que el texto se genera en un bucle más pesado que un argmax de CTC, y las formas documentadas de ejecutarlo son autoalojadas en GPU NVIDIA — los demos en Python del repositorio microsoft/VibeVoice o su plugin de vLLM — con aproximadamente 5,6 GB de pesos bf16 antes de cualquier caché KV. Microsoft no ha publicado ninguna afirmación de rendimiento ni de factor de tiempo real, por lo que no hay ninguna cifra del proveedor que contraponer a la de IBM. Lo que la arquitectura de modelo de lenguaje ofrece a cambio es contexto: el modelo mantiene la comprensión del hablante y del contenido a lo largo de la transcripción de la misma manera que lo hace un modelo de lenguaje, que es la diferencia entre transcribir sonido y seguir una conversación.
Precisión: un proveedor imprimió números, el otro imprimió una imagen
Según la evidencia, Granite Speech 5.0 470M TurboCTC supera a VibeVoice-ASR-Streaming-1.5B por un punto de referencia completo y publicable. IBM ejecutó su modelo a través del arnés oficial del leaderboard Open ASR el día del lanzamiento y reporta una tasa media de error de palabra en torno al 5,00% en los conjuntos públicos ingleses de formato corto, una cifra medida por el proveedor, no verificada por ningún tercero y completamente ausente del lado de Microsoft en esta comparación. La ficha del modelo de VibeVoice-ASR-Streaming-1.5B incluye una figura de resultados de evaluación como imagen, pero ningún WER, RTF ni latencia numéricos en texto; el único ancla numérica en la familia VibeVoice es el promedio de WER del 7,77% reportado por el proveedor en la ficha del modelo por lotes VibeVoice-ASR, en ocho conjuntos de prueba en inglés, que describe el modelo no streaming y no es transferible. Independientemente de cómo terminen las eventuales ejecuciones independientes, el resumen honesto hoy es que IBM publicó un número y Microsoft publicó una imagen.

Idiomas y salida: solo inglés versus quién-dijo-qué en diez
Granite Speech 5.0 470M TurboCTC es exclusivo para inglés y devuelve texto transcrito en bruto. Eso no es una limitación para las cargas de trabajo a las que IBM apunta — transcripción de inglés empresarial en hardware de borde —, pero pone fin a la comparación en el momento en que el audio no está en inglés. VibeVoice-ASR-Streaming-1.5B lista diez idiomas y afirma ofrecer una salida en streaming con atribución al hablante: la ficha del modelo dice que "transcribe continuamente quién dijo qué a medida que llega el habla", con hotwords para términos del dominio que se pasan como prompt de contexto. Ambos extras merecen una lectura escéptica — la diarización en streaming a través de los límites de los fragmentos es genuinamente difícil, y la afirmación no está verificada —, pero son la razón por la que un equipo con reuniones multilingües en vivo consideraría el modelo de Microsoft.
Licencias y ecosistema: Apache-2.0 frente a MIT, Transformers frente a un repositorio de investigación
Ambas licencias permiten uso comercial, lo que ya separa a este par de la variante -NC de IBM de la misma arquitectura. Granite Speech 5.0 470M TurboCTC es Apache-2.0 con la concesión de patentes habitual, y es nativo de Hugging Face Transformers (AutoModelForCTC de transformers >= 5.16) además de mlx-audio para Apple Silicon — lo que significa que se ejecuta en cualquier lugar donde se ejecuta la mayor comunidad de implementación del ecosistema, en hardware de cualquier proveedor. VibeVoice-ASR-Streaming-1.5B es MIT, lo cual es aún más simple, pero su vía de servicio es una configuración de investigación a partir del código fuente: la clase de arquitectura del checkpoint, VibeVoiceForASRStreamingTraining, no está en la documentación pública de Transformers, y los propios documentos de streaming de Microsoft apuntan al código de demostración del repositorio y a un plugin de vLLM en lugar de una carga de biblioteca estándar. Para un equipo de producción, la diferencia es real: un modelo se integra hoy en un pipeline existente de Transformers, y el otro te pide que levantes un repositorio de investigación y verifiques tú mismo la ruta de carga.

¿Qué release silencioso deberías evaluar?
Evalúa primero Granite Speech 5.0 470M TurboCTC si tu carga de trabajo es en inglés, tu hardware es de clase edge o está limitado por CPU, y quieres un modelo que se integre en Transformers con un número en la ficha para verificar rápidamente. Es la apuesta de menor riesgo en todos los aspectos excepto uno: no te ayudará con un segundo idioma ni con una transcripción de reuniones en vivo que necesite saber quién habla.
Evalúa VibeVoice-ASR-Streaming-1.5B si necesitas streaming multilingüe, si la salida de quién dijo qué o las hotwords son funciones que quieres probar, o si prefieres apostar por un enfoque de modelo de lenguaje aplicado al habla en lugar de un codificador puro. Reserva presupuesto para una GPU de NVIDIA, una instalación desde el código fuente, ~5.6 GB de pesos y una evaluación que diseñes tú mismo, porque nadie — Microsoft incluido — ha publicado todavía una cifra en la que puedas confiar.
Lo que ningún lanzamiento silencioso cambia es el valor de mantener la capa de ASR intercambiable mientras averiguas qué apuesta da resultado. Ambos modelos son jóvenes y, al momento de escribir esto, ninguno se sirve a través de OrcaRouter; cuando un proveedor aloja alguno de los dos, la forma de probarlo con bajo riesgo es detrás de una capa de enrutamiento que da acceso a más de 200 modelos al precio de lista del proveedor — con un margen del 0 %, de modo que los cambios de precio se aplican ese mismo día — y con conmutación automática por error a lo que ya sea de tu confianza. Enruta una porción de audio real hacia el nuevo modelo, lee las transcripciones y deja que tu propio tráfico, y no una hoja de referencia del día del lanzamiento, decida qué apuesta silenciosa era la correcta.
