
VibeVoice-ASR-Streaming-1.5B frente a NVIDIA Parakeet TDT 0.6B: un contendiente MIT sin probar contra el campeón de Open ASR
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
Si necesitas reconocimiento de voz con pesos abiertos en producción hoy en día, hay una opción por defecto, y se llama NVIDIA Parakeet TDT 0.6B. Desde mayo de 2025, el Parakeet TDT 0.6B v2, de 600 millones de parámetros, ocupa el primer puesto en la tabla de clasificación de ASR abierto de Hugging Face con una tasa media de error de palabra del 6,05 %, una posición que terceros han replicado durante más de un año. El último aspirante es VibeVoice-ASR-Streaming-1.5B, que Microsoft Research subió el 2 de septiembre de 2026 — dieciséis meses después de Parakeet —, bajo una licencia MIT, con una propuesta de atribución de hablante en streaming y, hasta ahora, sin ninguna cifra de precisión publicada. Esta página compara al campeón y al aspirante en cuanto a evidencia, arquitectura y lo que cada uno incluye realmente de serie.
Antes de las especificaciones importan dos etiquetas, porque definen toda la forma de este enfrentamiento. Las cifras de Parakeet están establecidas: el 6.05% de WER promedio y el número de rendimiento de ~3,386 RTFx que respaldan su afirmación de «una hora de audio en aproximadamente un segundo» han permanecido en tablas de clasificación públicas y en materiales de NVIDIA durante más de un año. El lado de la página de VibeVoice-ASR-Streaming-1.5B es lo que se puede conocer desde su repositorio —model card, archivos de configuración y la documentación de streaming de Microsoft—, porque Microsoft no ha publicado WER, latencia ni rendimiento en texto, y no existe ninguna evaluación independiente del checkpoint al momento de escribir esto. Una columna de cada comparación a continuación está probada en batalla; la otra es una hoja de especificaciones.
Dieciséis meses y un reinado en la clasificación de por medio.
Parakeet TDT 0.6B v2 llegó el 5 de mayo de 2025 como la respuesta de NVIDIA al problema de ASR en streaming: un codificador FastConformer combinado con un decodificador transductor de token y duración (TDT) que predice cada token y cuánto dura en un solo paso: un truco de eficiencia que elimina la sobrecarga de tokens en blanco de un transductor convencional. Es CC-BY-4.0, permite uso comercial, y ocupó el primer lugar en la tabla de clasificación de Open ASR gracias a su tasa de error de palabra promedio del 6,05 %. También trajo funciones de producción que la tabla de clasificación no mide (puntuación, capitalización, marcas de tiempo a nivel de palabra) y un codificador de atención completa que acepta hasta 24 minutos de audio en una sola pasada, lo que lo hace útil para reuniones largas y podcasts sin necesidad de una fragmentación agresiva.
VibeVoice-ASR-Streaming-1.5B es el retador en el sentido más puro: existe, está documentado, y no se ha establecido nada sobre lo bien que funciona. La línea de noticias de Microsoft en GitHub, con fecha del 3 de septiembre, anuncia un modelo de ASR de streaming unificado que "transcribe continuamente quién dijo qué a medida que llega el habla", con hotwords y diez idiomas, y la configuración del checkpoint describe una tradición de ingeniería completamente distinta: un decodificador de modelo de lenguaje de la familia Qwen2 alimentado por tokenizadores de audio convolucionales, con una cabeza de difusión que produce salida en fragmentos de aproximadamente 2,9 segundos y aproximadamente 0,5 segundos de anticipación. Mientras que Parakeet es un modelo de habla de propósito específico perfeccionado durante un año de despliegues reales, VibeVoice-ASR-Streaming-1.5B es un checkpoint de la familia de investigación con dos días de antigüedad.
La asimetría de la evidencia es la historia
Lee el resto de esta página con un hecho presente: esta comparación tiene números solo de un lado. En el lado de Parakeet TDT 0.6B hay un año de defensa de la cima de la tabla: 6,05% de WER promedio en los conjuntos públicos de inglés de formato corto de Open ASR, ~3.386 RTFx con batch 128 en hardware NVIDIA, y un ecosistema de herramientas de despliegue de NeMo, aceleración con TensorRT y cuantización FP8 probado en producción. En el lado de VibeVoice-ASR-Streaming-1.5B están la cifra de evaluación de la ficha del modelo —que es una imagen, no texto— y el 7,77% de WER promedio reportado por el proveedor en la ficha de VibeVoice-ASR por lotes, sobre ocho conjuntos de prueba en inglés; un número que describe el modelo no streaming y no puede transferirse a este checkpoint. El contendiente bien puede ser excelente; el punto es que «bien puede ser» es toda la base de evidencia.
La verificación de especificaciones.
• Parámetros — NVIDIA Parakeet TDT 0.6B: 600M, codificador FastConformer + decodificador TDT vs VibeVoice-ASR-Streaming-1.5B: ~3B en total (backbone Qwen de clase 1.5B más tokenizadores y cabezal de difusión).
• Publicado — 5 de mayo de 2025 vs 2 de septiembre de 2026.
• Precisión — WER promedio de 6.05 %, Open ASR #1 desde mayo de 2025, reproducido por terceros frente a ninguno publicado.
• Velocidad — ~3386 RTFx con batch 128 en hardware de NVIDIA, ~1 hora de audio por segundo, frente a la ausencia de una cifra de rendimiento publicada.
• Streaming: compatible con streaming con contexto de atención completa de hasta 24 minutos por pasada, en comparación con streaming por fragmentos, con fragmentos de ~2,9 s y ~0,5 s de anticipación.
• Extras de salida — puntuación, uso de mayúsculas, marcas de tiempo a nivel de palabra frente a atribución de quién dijo qué en streaming (sin verificar) y hotwords; diez idiomas.
• Licencia — CC-BY-4.0 vs MIT.
• Ecosistema — NVIDIA NeMo con TensorRT y FP8 frente a las demostraciones del repositorio microsoft/VibeVoice y un complemento de vLLM.


Bajo el capó: dos ideas sobre para qué sirven los modelos de voz.
Las arquitecturas codifican dos creencias diferentes sobre la tarea. Parakeet TDT 0.6B trata la transcripción como un problema de procesamiento de señales resuelto de manera eficiente: un codificador FastConformer extrae la acústica y el decodificador TDT emite tokens de texto y duraciones de forma conjunta, por lo que se ejecuta miles de veces más rápido que el tiempo real y por lo que se siente cómodo en la pila de despliegue de NVIDIA. VibeVoice-ASR-Streaming-1.5B trata la transcripción como un problema de lenguaje: comprime el audio en un flujo de tokens, lo entrega a un modelo de lenguaje que ha leído una cantidad de contexto equivalente a una transcripción y deja que la comprensión del LM sobre quién dice qué y cómo encajan las conversaciones haga el trabajo. El backbone del LLM es también la razón por la que el checkpoint tiene ~3B parámetros en lugar de 600M y por la que Microsoft no ha reclamado una huella en el borde: este es un modelo que quiere una GPU y usa la memoria para transportar contexto.
Para la transcripción en vivo, la consecuencia práctica es la forma de la latencia. El codificador de atención completa de Parakeet puede procesar ventanas largas en una sola pasada, lo que supone una filosofía de streaming distinta del contrato fijo de fragmentación y lookahead de VibeVoice-ASR-Streaming-1.5B, de aproximadamente 2,9 segundos de audio por segmento emitido. Ninguno de los dos es un emisor de resultados parciales por palabra al estilo de las API comerciales de menor latencia; ambos son sistemas por fragmentos, y el adecuado depende de si tu audio llega como archivos acotados o como una sesión en vivo de duración indefinida.
El reportaje principal y las áreas de despliegue
De serie, Parakeet TDT 0.6B es el producto de transcripción más completo: la puntuación y las mayúsculas vienen incluidas en la transcripción, las marcas de tiempo a nivel de palabra están ahí para la alineación, y las ventanas de una sola pasada de 24 minutos implican menos errores de segmentación en grabaciones largas. VibeVoice-ASR-Streaming-1.5B responde con funciones que Parakeet no menciona: salida con atribución de hablante y hotwords, en diez idiomas. La afirmación de diarización en streaming es exactamente el tipo de cuestión que necesita verificación independiente —los límites de segmento son donde la atribución se desvía—, pero es la razón para considerar el modelo de Microsoft en lugar del de NVIDIA si tu requisito es saber quién dijo qué en una reunión en directo.

Los ecosistemas son tan diferentes como los propios modelos. Parakeet TDT 0.6B es un ciudadano de NVIDIA NeMo: TensorRT, FP8 y herramientas de despliegue optimizadas para las GPUs de NVIDIA, lo cual es excelente si ya estás en la infraestructura de NVIDIA. VibeVoice-ASR-Streaming-1.5B vive en un repositorio de investigación: las rutas documentadas son los demos de Python de Microsoft y un plugin de vLLM; su clase de arquitectura aún no está en la documentación pública de Transformers, y ponerlo en marcha implica una instalación desde el código fuente y tu propia verificación de que la ruta de carga funciona. Para un equipo que valora un despliegue aburrido y documentado, esa diferencia por sí sola puede superar la brecha de rendimiento.
El caso a favor del titular, el caso a favor del retador
El argumento a favor de NVIDIA Parakeet TDT 0.6B es el de una opción conocida: un año defendiendo su posición en el leaderboard, reproducción por terceros, licencia comercial, funciones de producción y un ecosistema de despliegue que ha absorbido tráfico real. Si vas a lanzar una función de transcripción en inglés este trimestre y quieres pesos abiertos, esta es la opción por defecto defendible, y la carga de la prueba recae sobre cualquier alternativa que pretenda reemplazarlo.
El caso de VibeVoice-ASR-Streaming-1.5B es más acotado y específico: necesitas atribución de hablante en streaming o hotwords, necesitas algo más que inglés, o crees que el enfoque de los modelos de lenguaje aplicado al habla se impondrá y quieres ser de los primeros. Es una apuesta, no una decisión: todavía no hay ninguna cifra que justifique mover tráfico de producción hacia él, y la postura del propio Microsoft es ante todo de investigación. Ninguno de los dos modelos se sirve hoy a través de OrcaRouter, así que la forma de bajo costo de probar la apuesta es el patrón que se aplica a cualquier modelo abierto joven: mantén la capa de ASR detrás de una API de enrutamiento que dé acceso a más de 200 modelos al precio de lista del proveedor, sin recargo y con conmutación automática por error; enruta una porción de audio real a VibeVoice-ASR-Streaming-1.5B en cuanto un proveedor lo aloje; y deja que las transcripciones de tu propio tráfico decidan si el aspirante merece la corona que Parakeet ha lucido durante dieciséis meses.
