Una tarjeta de título principal generada para 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B: un retador MIT sin probar contra el campeón de Open ASR', subtitulada 'La opción predeterminada probada frente al retador de un día', con dos tarjetas de modelo — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 de septiembre de 2026 · MIT · Sin benchmark publicado aún) y NVIDIA Parakeet TDT 0.6B (NVIDIA · 5 de mayo de 2025 · CC-BY-4.0 · Open ASR #1 desde mayo de 2025) — y etiquetas que dicen '6.05% WER promedio (Parakeet)', '16 meses de diferencia' y 'Quién dijo qué + hotwords (Microsoft, sin verificar)'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B frente a NVIDIA Parakeet TDT 0.6B: un contendiente MIT sin probar contra el campeón de Open ASR

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Si necesitas reconocimiento de voz con pesos abiertos en producción hoy en día, hay una opción por defecto, y se llama NVIDIA Parakeet TDT 0.6B. Desde mayo de 2025, el Parakeet TDT 0.6B v2, de 600 millones de parámetros, ocupa el primer puesto en la tabla de clasificación de ASR abierto de Hugging Face con una tasa media de error de palabra del 6,05 %, una posición que terceros han replicado durante más de un año. El último aspirante es VibeVoice-ASR-Streaming-1.5B, que Microsoft Research subió el 2 de septiembre de 2026 — dieciséis meses después de Parakeet —, bajo una licencia MIT, con una propuesta de atribución de hablante en streaming y, hasta ahora, sin ninguna cifra de precisión publicada. Esta página compara al campeón y al aspirante en cuanto a evidencia, arquitectura y lo que cada uno incluye realmente de serie.

Antes de las especificaciones importan dos etiquetas, porque definen toda la forma de este enfrentamiento. Las cifras de Parakeet están establecidas: el 6.05% de WER promedio y el número de rendimiento de ~3,386 RTFx que respaldan su afirmación de «una hora de audio en aproximadamente un segundo» han permanecido en tablas de clasificación públicas y en materiales de NVIDIA durante más de un año. El lado de la página de VibeVoice-ASR-Streaming-1.5B es lo que se puede conocer desde su repositorio —model card, archivos de configuración y la documentación de streaming de Microsoft—, porque Microsoft no ha publicado WER, latencia ni rendimiento en texto, y no existe ninguna evaluación independiente del checkpoint al momento de escribir esto. Una columna de cada comparación a continuación está probada en batalla; la otra es una hoja de especificaciones.

Dieciséis meses y un reinado en la clasificación de por medio.

Parakeet TDT 0.6B v2 llegó el 5 de mayo de 2025 como la respuesta de NVIDIA al problema de ASR en streaming: un codificador FastConformer combinado con un decodificador transductor de token y duración (TDT) que predice cada token y cuánto dura en un solo paso: un truco de eficiencia que elimina la sobrecarga de tokens en blanco de un transductor convencional. Es CC-BY-4.0, permite uso comercial, y ocupó el primer lugar en la tabla de clasificación de Open ASR gracias a su tasa de error de palabra promedio del 6,05 %. También trajo funciones de producción que la tabla de clasificación no mide (puntuación, capitalización, marcas de tiempo a nivel de palabra) y un codificador de atención completa que acepta hasta 24 minutos de audio en una sola pasada, lo que lo hace útil para reuniones largas y podcasts sin necesidad de una fragmentación agresiva.

VibeVoice-ASR-Streaming-1.5B es el retador en el sentido más puro: existe, está documentado, y no se ha establecido nada sobre lo bien que funciona. La línea de noticias de Microsoft en GitHub, con fecha del 3 de septiembre, anuncia un modelo de ASR de streaming unificado que "transcribe continuamente quién dijo qué a medida que llega el habla", con hotwords y diez idiomas, y la configuración del checkpoint describe una tradición de ingeniería completamente distinta: un decodificador de modelo de lenguaje de la familia Qwen2 alimentado por tokenizadores de audio convolucionales, con una cabeza de difusión que produce salida en fragmentos de aproximadamente 2,9 segundos y aproximadamente 0,5 segundos de anticipación. Mientras que Parakeet es un modelo de habla de propósito específico perfeccionado durante un año de despliegues reales, VibeVoice-ASR-Streaming-1.5B es un checkpoint de la familia de investigación con dos días de antigüedad.

La asimetría de la evidencia es la historia

Lee el resto de esta página con un hecho presente: esta comparación tiene números solo de un lado. En el lado de Parakeet TDT 0.6B hay un año de defensa de la cima de la tabla: 6,05% de WER promedio en los conjuntos públicos de inglés de formato corto de Open ASR, ~3.386 RTFx con batch 128 en hardware NVIDIA, y un ecosistema de herramientas de despliegue de NeMo, aceleración con TensorRT y cuantización FP8 probado en producción. En el lado de VibeVoice-ASR-Streaming-1.5B están la cifra de evaluación de la ficha del modelo —que es una imagen, no texto— y el 7,77% de WER promedio reportado por el proveedor en la ficha de VibeVoice-ASR por lotes, sobre ocho conjuntos de prueba en inglés; un número que describe el modelo no streaming y no puede transferirse a este checkpoint. El contendiente bien puede ser excelente; el punto es que «bien puede ser» es toda la base de evidencia.

La verificación de especificaciones.

• Parámetros — NVIDIA Parakeet TDT 0.6B: 600M, codificador FastConformer + decodificador TDT vs VibeVoice-ASR-Streaming-1.5B: ~3B en total (backbone Qwen de clase 1.5B más tokenizadores y cabezal de difusión).

• Publicado — 5 de mayo de 2025 vs 2 de septiembre de 2026.

• Precisión — WER promedio de 6.05 %, Open ASR #1 desde mayo de 2025, reproducido por terceros frente a ninguno publicado.

• Velocidad — ~3386 RTFx con batch 128 en hardware de NVIDIA, ~1 hora de audio por segundo, frente a la ausencia de una cifra de rendimiento publicada.

• Streaming: compatible con streaming con contexto de atención completa de hasta 24 minutos por pasada, en comparación con streaming por fragmentos, con fragmentos de ~2,9 s y ~0,5 s de anticipación.

• Extras de salida — puntuación, uso de mayúsculas, marcas de tiempo a nivel de palabra frente a atribución de quién dijo qué en streaming (sin verificar) y hotwords; diez idiomas.

• Licencia — CC-BY-4.0 vs MIT.

• Ecosistema — NVIDIA NeMo con TensorRT y FP8 frente a las demostraciones del repositorio microsoft/VibeVoice y un complemento de vLLM.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total, Architecture speech LLM + diffusion, WER none published, Streaming ~2.9 s chunks, Extras who-said-what + hotwords, License MIT. Right column NVIDIA Parakeet TDT 0.6B v2: Released May 5 2025, Params 600M, Architecture FastConformer + TDT, WER 6.05% Open ASR #1, Streaming full-attention up to 24 min, Extras punctuation + timestamps, License CC-BY-4.0. Footer reads 'Parakeet figures per the Open ASR leaderboard, settled since 2025; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Bajo el capó: dos ideas sobre para qué sirven los modelos de voz.

Las arquitecturas codifican dos creencias diferentes sobre la tarea. Parakeet TDT 0.6B trata la transcripción como un problema de procesamiento de señales resuelto de manera eficiente: un codificador FastConformer extrae la acústica y el decodificador TDT emite tokens de texto y duraciones de forma conjunta, por lo que se ejecuta miles de veces más rápido que el tiempo real y por lo que se siente cómodo en la pila de despliegue de NVIDIA. VibeVoice-ASR-Streaming-1.5B trata la transcripción como un problema de lenguaje: comprime el audio en un flujo de tokens, lo entrega a un modelo de lenguaje que ha leído una cantidad de contexto equivalente a una transcripción y deja que la comprensión del LM sobre quién dice qué y cómo encajan las conversaciones haga el trabajo. El backbone del LLM es también la razón por la que el checkpoint tiene ~3B parámetros en lugar de 600M y por la que Microsoft no ha reclamado una huella en el borde: este es un modelo que quiere una GPU y usa la memoria para transportar contexto.

Para la transcripción en vivo, la consecuencia práctica es la forma de la latencia. El codificador de atención completa de Parakeet puede procesar ventanas largas en una sola pasada, lo que supone una filosofía de streaming distinta del contrato fijo de fragmentación y lookahead de VibeVoice-ASR-Streaming-1.5B, de aproximadamente 2,9 segundos de audio por segmento emitido. Ninguno de los dos es un emisor de resultados parciales por palabra al estilo de las API comerciales de menor latencia; ambos son sistemas por fragmentos, y el adecuado depende de si tu audio llega como archivos acotados o como una sesión en vivo de duración indefinida.

El reportaje principal y las áreas de despliegue

De serie, Parakeet TDT 0.6B es el producto de transcripción más completo: la puntuación y las mayúsculas vienen incluidas en la transcripción, las marcas de tiempo a nivel de palabra están ahí para la alineación, y las ventanas de una sola pasada de 24 minutos implican menos errores de segmentación en grabaciones largas. VibeVoice-ASR-Streaming-1.5B responde con funciones que Parakeet no menciona: salida con atribución de hablante y hotwords, en diez idiomas. La afirmación de diarización en streaming es exactamente el tipo de cuestión que necesita verificación independiente —los límites de segmento son donde la atribución se desvía—, pero es la razón para considerar el modelo de Microsoft en lugar del de NVIDIA si tu requisito es saber quién dijo qué en una reunión en directo.

A screenshot of the Hugging Face model card for nvidia/parakeet-tdt-0.6b-v2, showing the NVIDIA namespace, the model title 'Parakeet TDT 0.6B V2 (En)', the automatic-speech-recognition and NeMo pipeline tags, and the card description of the 600-million-parameter FastConformer model with TDT decoder, punctuation and timestamps, audio segments up to 24 minutes in a single pass, and an RTFx of 3380 on the Open ASR leaderboard at batch 128.

Los ecosistemas son tan diferentes como los propios modelos. Parakeet TDT 0.6B es un ciudadano de NVIDIA NeMo: TensorRT, FP8 y herramientas de despliegue optimizadas para las GPUs de NVIDIA, lo cual es excelente si ya estás en la infraestructura de NVIDIA. VibeVoice-ASR-Streaming-1.5B vive en un repositorio de investigación: las rutas documentadas son los demos de Python de Microsoft y un plugin de vLLM; su clase de arquitectura aún no está en la documentación pública de Transformers, y ponerlo en marcha implica una instalación desde el código fuente y tu propia verificación de que la ruta de carga funciona. Para un equipo que valora un despliegue aburrido y documentado, esa diferencia por sí sola puede superar la brecha de rendimiento.

El caso a favor del titular, el caso a favor del retador

El argumento a favor de NVIDIA Parakeet TDT 0.6B es el de una opción conocida: un año defendiendo su posición en el leaderboard, reproducción por terceros, licencia comercial, funciones de producción y un ecosistema de despliegue que ha absorbido tráfico real. Si vas a lanzar una función de transcripción en inglés este trimestre y quieres pesos abiertos, esta es la opción por defecto defendible, y la carga de la prueba recae sobre cualquier alternativa que pretenda reemplazarlo.

El caso de VibeVoice-ASR-Streaming-1.5B es más acotado y específico: necesitas atribución de hablante en streaming o hotwords, necesitas algo más que inglés, o crees que el enfoque de los modelos de lenguaje aplicado al habla se impondrá y quieres ser de los primeros. Es una apuesta, no una decisión: todavía no hay ninguna cifra que justifique mover tráfico de producción hacia él, y la postura del propio Microsoft es ante todo de investigación. Ninguno de los dos modelos se sirve hoy a través de OrcaRouter, así que la forma de bajo costo de probar la apuesta es el patrón que se aplica a cualquier modelo abierto joven: mantén la capa de ASR detrás de una API de enrutamiento que dé acceso a más de 200 modelos al precio de lista del proveedor, sin recargo y con conmutación automática por error; enruta una porción de audio real a VibeVoice-ASR-Streaming-1.5B en cuanto un proveedor lo aloje; y deja que las transcripciones de tu propio tráfico decidan si el aspirante merece la corona que Parakeet ha lucido durante dieciséis meses.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube