Una tarjeta de título principal generada para 'VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo: streaming nativo contra el caballo de batalla de los 99 idiomas', subtitulada 'Streaming nativo contra el caballo de batalla de los 99 idiomas', con dos tarjetas de modelo — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 sept 2026 · MIT · Nativo de streaming · 10 idiomas) y Whisper Large v3 Turbo (OpenAI · oct 2024 · MIT · Por lotes · 99 idiomas) — y etiquetas que dicen 'Fragmentos de ~2,9 s + ~0,5 s de lookahead', '7M+ descargas / mes (Whisper)' y 'Sin benchmark publicado aún'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo: streaming nativo frente al caballo de batalla de 99 idiomas

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Hay una buena probabilidad de que el modelo de voz a texto que ejecutas hoy sea Whisper Large v3 Turbo, y hay un nuevo modelo que plantea si debería serlo. El Whisper Large v3 Turbo de OpenAI — el checkpoint destilado de 809 millones de parámetros lanzado en octubre de 2024 — es el caballo de batalla de pesos abiertos: 99 idiomas, aproximadamente de cuatro a ocho veces más rápido que el large-v3 original, lo bastante pequeño como para caber en una laptop, con licencia MIT y respaldado por el mayor ecosistema de transcripción que existe. VibeVoice-ASR-Streaming-1.5B, subido por Microsoft Research el 2 de septiembre de 2026, es el retador creado para lo único que Whisper no hace de forma nativa: streaming. Transcribe en fragmentos a medida que llega el audio, en lugar de procesar ventanas fijas, afirma tener salida con atribución de hablante y cuenta con diez idiomas y ningún benchmark publicado en su haber.

Esa última cláusula es la razón por la que esta página está estructurada en torno a una cuestión de migración y no a una comparativa. Las cifras de Whisper Large v3 Turbo están medidas y son públicas — LibriSpeech, el compuesto de Open ASR, Common Voice —, mientras que la ficha del modelo VibeVoice-ASR-Streaming-1.5B no publica ninguna cifra de WER ni de latencia en su texto, y no existe ninguna prueba de referencia independiente al momento de escribir esto. Todo lo relativo al lado de Microsoft que aparece abajo es lo que se puede saber a partir de su repositorio: los archivos de configuración, la ficha del modelo y la documentación de streaming de Microsoft. Todo lo relativo al lado de Whisper es un registro público consolidado. Los dos no se ejecutaron cara a cara; la comparación es entre lo que está probado y lo que se promete.

El modelo que probablemente ya estás ejecutando.

Whisper Large v3 Turbo se ganó su lugar de la manera poco glamorosa: es rápido, pequeño, multilingüe y aburrido en los sentidos que les gustan a los equipos de producción. Destilado del Whisper large-v3 de 1.55B parámetros hasta 809M parámetros, mantiene cobertura de 99 idiomas y aproximadamente el 95% de la precisión de large-v3 — alrededor de 2.1% WER en LibriSpeech clean, entre 7.7 y 7.8% en el compuesto Open ASR, con la mayor degradación en idiomas de bajos recursos y tonales — mientras se ejecuta varias veces más rápido y ocupa aproximadamente 1.6 GB de VRAM en FP16. Tiene licencia MIT, funciona a través de faster-whisper, whisper.cpp y tres años de integraciones, y su página de Hugging Face muestra más de siete millones de descargas en un solo mes. Si usted mismo aloja la transcripción, es muy probable que este sea el modelo que lo está haciendo.

Lo que Whisper Large v3 Turbo no es, y nunca ha pretendido ser, es un modelo de streaming. Ingiere audio en ventanas fijas de 30 segundos y devuelve una transcripción por ventana; no tiene detección nativa de actividad de voz, ni detección de final de locución, ni diarización de hablantes, ni mecanismo de palabra de activación. La transcripción en vivo con Whisper es siempre una adaptación que tú construyes — y es en esa adaptación donde residen la latencia y el costo de ingeniería.

Qué cambia realmente si cambias

• Modelo de latencia — VibeVoice-ASR-Streaming-1.5B, por diseño, emite texto una vez por cada fragmento resuelto de aproximadamente 2,9 segundos con ~0,5 s de anticipación, a diferencia de Whisper Large v3 Turbo: un modelo por lotes con ventana de 30 segundos que requiere una capa de fragmentación y concatenación para aproximarse a una salida en vivo.

• Forma de la sesión — sesiones en vivo ilimitadas, con contexto transferido a través de fragmentos en una caché de prefijo, frente a ventanas discretas de 30 segundos sin estado conversacional entre ventanas.

• Idiomas — diez (chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso, español) frente a 99.

• Precisión impresa — {{1}}ninguno publicado{{/1}} vs ~2.1% LibriSpeech clean, ~7.7–7.8% Open ASR composite, {{2}}todo medido y público{{/2}}.

Extras de salida: afirma atribución de quién dijo qué en streaming y hotwords frente a las marcas de tiempo por palabra disponibles, pero sin diarización ni hotwords de forma nativa.

• Hardware — ~5,6 GB de pesos bf16 en una GPU NVIDIA, instalación desde el código fuente vs ~1,6 GB FP16, funciona en portátiles y CPUs mediante whisper.cpp y faster-whisper.

• Licencia — MIT, ambos.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Streaming native ~2.9 s chunks, Languages 10, WER none published, Extras who-said-what + hotwords, Hardware ~5.6 GB NVIDIA GPU, License MIT. Right column Whisper Large v3 Turbo: Released Oct 2024, Streaming none / 30 s windows, Languages 99, WER ~2.1% LibriSpeech clean, Extras timestamps, no diarization, Hardware ~1.6 GB laptop-class, License MIT. Footer reads 'Whisper figures measured and public; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

El problema del streaming con Retrofit

La forma honesta de pensar en este enfrentamiento es que Whisper Large v3 Turbo tiene un problema de streaming que ya has pagado o todavía estás pagando. Un pipeline en vivo con Whisper implica un detector de actividad de voz para encontrar el habla, un fragmentador para cortar el audio en ventanas del tamaño de Whisper, ventanas superpuestas para que las palabras no se pierdan en los límites, y un ensamblador para conciliar las transcripciones parciales. Las implementaciones comunitarias de ese stack alcanzan aproximadamente de uno a cinco segundos de latencia de extremo a extremo — aceptable para notas de reuniones, pero por debajo del estándar para agentes telefónicos y subtitulado en vivo.

VibeVoice-ASR-Streaming-1.5B elimina el retrofit por construcción. Su configuración del preprocesador fija un bloque de 22 tramas y una anticipación de 4 tramas en un flujo de tokens de voz de ~7,5 Hz — aproximadamente 2,9 segundos de audio por segmento emitido, medio segundo de contexto futuro — y la documentación de Microsoft describe que el contexto de los bloques anteriores se conserva mediante la caché KV, por lo que una sesión en vivo no recalcula desde cero. Pero lea la palabra "streaming" con cuidado en ambos lados de esta comparación: ninguno de los dos modelos es un motor de resultados parciales por palabra del tipo que venden las APIs comerciales de menor latencia. La transcripción de VibeVoice crece en incrementos de aproximadamente tres segundos por diseño, lo cual es un ritmo diferente y generalmente aceptable para reuniones, pero no es de menos de un segundo; si su requisito es ver palabras en pantalla en un segundo, debe medir esta geometría de bloques contra ese presupuesto antes de construir sobre ella.

Precisión: lo que sacrificas al pasar a streaming nativo

Esta es la brecha que debería regir la decisión. Whisper Large v3 Turbo tiene un historial público de precisión que puedes auditar — y cuando la grabación se encuentra dentro de sus 99 idiomas, ese historial es sólido. VibeVoice-ASR-Streaming-1.5B no tiene tal historial: la evaluación de su tarjeta de modelo es una imagen, Microsoft no ha publicado ningún WER de streaming en texto, y el único ancla numérica de la familia es el WER promedio del 7.77% reportado por el proveedor en la tarjeta del modelo por lotes VibeVoice-ASR, en ocho conjuntos de prueba en inglés, que describe un modelo diferente, no streaming. La frase honesta es que trasladar tu transcripción a VibeVoice-ASR-Streaming-1.5B hoy significa aceptar un nivel de precisión desconocido en tu propio audio — que es exactamente la razón por la que cualquier evaluación del mismo debe ser ejecutada por ti, sobre tus grabaciones reales más difíciles, antes de que se gane el tráfico de producción.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Idiomas y atribución del hablante: la brecha de características es de doble filo

La comparativa de funciones no es unilateral, y eso es lo que hace que la elección sea genuinamente interesante. Si tu audio es multilingüe, la decisión es inmediata: los 99 idiomas de Whisper Large v3 Turbo cubren lo que no cubren los diez de VibeVoice-ASR-Streaming-1.5B, y un límite de diez idiomas es descalificante para cualquier pipeline que deba procesar una amplia mezcla de idiomas. Pero si tu carga de trabajo se encuentra dentro de esos diez idiomas y lo que realmente necesitas es saber quién dijo qué en una reunión en directo, la flecha apunta al otro lado: Whisper no ofrece diarización nativa ni hotwords, mientras que VibeVoice-ASR-Streaming-1.5B afirma ofrecer ambas: salida en streaming con atribución del hablante y hotwords de términos del dominio que se pasan como prompt de contexto. La afirmación no está verificada, y la diarización en streaming a través de los límites entre fragmentos es bastante difícil como para merecer escepticismo, pero es la característica concreta que, por mucha ingeniería que se le dedique a Whisper, este no te da de serie.

Las matemáticas de la migración

El costo y el esfuerzo favorecen al modelo actual. Whisper Large v3 Turbo ya se ejecuta en tu stack sobre hardware que ya tienes — una laptop, una CPU, una GPU modesta — y migrar a VibeVoice-ASR-Streaming-1.5B implica levantar una instalación de investigación desde el código fuente en una GPU NVIDIA con ~5.6 GB de pesos, verificar una ruta de carga cuya clase de arquitectura aún no figura en la documentación pública de Transformers y construir desde cero el benchmark del que depende tu decisión. Eso es un proyecto real, y el retorno depende de que las funcionalidades no verificadas sean relevantes para ti.

A screenshot of the Hugging Face model card for openai/whisper-large-v3-turbo, showing the OpenAI namespace, the model title Whisper, the MIT license tag, the 99-languages tag, and the automatic-speech-recognition pipeline tags, with the description of Whisper as a state-of-the-art automatic speech recognition model.

La forma económica de ejecutar ese proyecto es no tratarlo como un reemplazo directo. Mantén Whisper Large v3 Turbo como modelo por defecto y enruta una porción del audio en vivo hacia VibeVoice-ASR-Streaming-1.5B a través de una única API — el patrón para el que existe una capa de enrutamiento: más de 200 modelos detrás de un único endpoint al precio de lista del proveedor sin recargo, conmutación automática por error cuando el nuevo modelo falla, y un DSL de enrutamiento que permite que diferentes cargas de trabajo elijan diferentes transcriptores desde una sola llamada. Ese es el modelo de OrcaRouter, y es la diferencia entre apostar tu pipeline de producción a un checkpoint de dos días y dejar que ese checkpoint se gane su lugar frente al caballo de batalla con tus propias transcripciones.

Preguntas frecuentes

¿Puede Whisper Large v3 Turbo hacer transmisión en vivo en absoluto?

Solo como reequipamiento. Whisper Large v3 Turbo es un modelo por lotes que procesa ventanas fijas de 30 segundos, por lo que la transcripción en vivo requiere que construyas un detector de actividad de voz, un fragmentador, una estrategia de superposición y un unificador sobre él. Existen implementaciones funcionales y consiguen aproximadamente entre uno y cinco segundos de latencia, lo cual es adecuado para notas de reuniones, pero no alcanza el umbral de menos de un segundo para agentes telefónicos y subtitulación en vivo. VibeVoice-ASR-Streaming-1.5B es nativo de transmisión: emite texto por fragmento de ~2,9 segundos con ~0,5 segundos de anticipación, pero es transmisión fragmentada, no parciales palabra por palabra, así que verifica esa cadencia también con tu propio presupuesto de latencia.

¿Es VibeVoice-ASR-Streaming-1.5B más preciso que Whisper Large v3 Turbo?

Nadie puede responder todavía a esa pregunta, ni siquiera Microsoft. La precisión de Whisper Large v3 Turbo está medida y es pública: aproximadamente un 2,1 % de WER en LibriSpeech clean y un 7,7–7,8 % en el compuesto de Open ASR. VibeVoice-ASR-Streaming-1.5B no tiene una cifra de WER en streaming publicada por escrito ni un benchmark independiente al momento de escribir esto. La única forma de responder a la pregunta es ejecutar el checkpoint en tu propio audio y comparar las transcripciones con las de tu sistema actual, que es precisamente la prueba que esta página recomienda antes de cualquier migración.

¿Qué idiomas soportan los dos?

Whisper Large v3 Turbo admite 99 idiomas con un solo conjunto de pesos. VibeVoice-ASR-Streaming-1.5B enumera diez: chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso y español. Para cualquier audio fuera de ese conjunto de diez idiomas, Whisper es la única opción en este emparejamiento, y la brecha multilingüe es la razón más clara por la que la mayoría de los equipos se quedarán donde están.

Whisper Large v3 Turbo es el modelo adecuado para la mayoría de los equipos la mayor parte del tiempo, y un checkpoint de hace dos días sin benchmarks no es motivo para migrar de plataforma. Es un motivo para ejecutar un experimento. Si tu audio está dentro de sus diez idiomas y la atribución de hablante en vivo cambiaría tu producto, levanta VibeVoice-ASR-Streaming-1.5B detrás de un router, apunta una porción del tráfico real hacia él y deja que las transcripciones —no la ausencia de un benchmark en ninguno de los dos lados— tomen la decisión.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube