
VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo: Lo que el checkpoint de streaming de Microsoft añade al estándar de pesos abiertos
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
Durante la mayor parte de los últimos dos años, la respuesta a "transcribirlo nosotros mismos, de forma barata" ha sido Whisper Large v3 Turbo: el modelo de pesos abiertos de 809 millones de parámetros de OpenAI, con licencia MIT, 99 idiomas, lo bastante pequeño como para ejecutarse en una estación de trabajo, y gratis una vez que tienes el hardware. El 2 de septiembre de 2026, Microsoft Research subió un contendiente a esa opción predeterminada: VibeVoice-ASR-Streaming-7B, un checkpoint de streaming con licencia MIT en Hugging Face que transcribe a medida que llega el audio, afirma tener salida con atribución de hablante y — a diferencia del modelo que la mayoría de los equipos ya utiliza — nunca fue diseñado como un trabajo por lotes. Ambos modelos son de pesos abiertos de grandes laboratorios. Casi todo lo demás sobre ellos es una compensación, y esta página trata sobre qué compensación estás haciendo realmente.
Una asimetría condiciona toda la comparación, así que va primero. Whisper Large v3 Turbo es el modelo de reconocimiento de voz reproducido de forma más independiente del mundo: sus cifras de error de palabra han sido recalculadas por miles de equipos en puntos de referencia públicos y en su propio audio durante años, y sus debilidades están tan documentadas como sus fortalezas. VibeVoice-ASR-Streaming-7B tiene un día de antigüedad, no tiene ningún punto de referencia independiente en ningún sitio, y Microsoft no ha publicado una tasa de error de palabra en streaming en texto legible. Todo lo relativo a Microsoft a continuación se extrae del repositorio —configuración, ficha del modelo y documentación de streaming de Microsoft— y se indica como tal.
La opción predeterminada de pesos abiertos, y por qué perdura
Whisper Large v3 Turbo es el hermano destilado de Whisper Large v3: conserva el codificador de 32 capas y reduce el decodificador de 32 capas a cuatro, lo que reduce el número de parámetros a 809M y aproximadamente cuadruplica el rendimiento en GPU, manteniendo una precisión cercana. Debido a que los pesos son MIT y el modelo es pequeño, se convirtió en el motor de transcripción integrado por defecto para bots de reuniones, herramientas de subtítulos y canalizaciones de registro de llamadas. Sus limitaciones son igualmente conocidas. Es un modelo por lotes: toma un archivo de audio y devuelve una transcripción, en lugar de producir palabras a medida que se hablan. No se entrenó para traducción, y esa tarea se degrada gravemente. Su precisión en habla ruidosa, con acento o superpuesta es desigual, y devuelve texto plano: sin puntuación ni mayúsculas por defecto, sin diarización de hablantes, sin marcas de tiempo en esta variante, sin sesgo de palabras clave. Las pilas de producción basadas en Whisper ensamblan esas piezas por separado, cada una añadiendo su propia latencia y modos de fallo.

La brecha de especificación
• Parámetros — 809M (decodificador destilado) frente a unos 9B en total (un backbone de lenguaje Qwen2-7B más codificadores de voz; el "7B" solo cuenta el LLM; la página de Hugging Face indica 9B).
• Licencia — MIT, pesos abiertos, ambos.
• Streaming — por diseño, por lotes: las implementaciones de streaming autoalojadas suelen tener una latencia de 1–5 segundos frente a las nativas de streaming: fragmentos de ~2,9 segundos con ~0,5 segundos de anticipación, texto emitido por fragmento, contexto conservado en una caché KV.
• Idiomas: 99 con años de reproducción comunitaria frente a 10 declarados (en, zh, es, pt, de, ja, ko, fr, ru, it).
• Más allá de la transcripción: nada por defecto frente a la supuesta salida en streaming de quién dijo qué y hotwords personalizadas (sin verificar).
• Precisión por escrito: 2.1% de WER en LibriSpeech test-clean, 4.2% en test-other, ~7.7% en el compuesto Open ASR, 8–12% en audio ruidoso en pruebas comunitarias; todo ello reproducido de forma independiente, frente a la ausencia de una cifra de WER en streaming publicada como texto.
• Huella: se ejecuta en una laptop o en una sola GPU modesta, frente a unos 18 GB de pesos bf16 antes de la caché KV; presupuesta una GPU de clase 24 GB.

Qué añade realmente el streaming
La razón para siquiera mirar más allá de Whisper Large v3 Turbo es el carril en vivo, y es ahí donde los dos modelos dejan de ser comparables. Whisper está orientado a lotes: para obtener palabras mientras el hablante sigue hablando, los equipos tienen que añadir fragmentación, detección de actividad de voz y código de pegamento, y las implementaciones de streaming autoalojadas suelen quedarse en una latencia de entre uno y cinco segundos — sin alcanzar el listón de menos de un segundo para agentes telefónicos y subtitulado en vivo sin una ingeniería seria. VibeVoice-ASR-Streaming-7B está construido para ese carril. Su configuración muestra audio comprimido 3.200× a un flujo de tokens de 7,5 fotogramas por segundo, procesado en fragmentos de 22 fotogramas con una anticipación de cuatro fotogramas — unos 2,9 segundos de audio por fragmento —, con texto emitido a medida que cada fragmento se resuelve y el contexto anterior transportado en la caché KV, de modo que una sesión no se recalcula desde cero. Esa cadencia es un diseño derivado de la configuración, no una latencia medida, y nadie ha publicado todavía una cifra de extremo a extremo; pero la arquitectura es inequívocamente una arquitectura de transcripción en vivo en un sentido en que Whisper no lo es.
El historial de Whisper es largo y público; el del nuevo checkpoint está en blanco.
La precisión es donde la edad de Whisper Large v3 Turbo resulta un activo. Su 2,1% de WER en LibriSpeech test-clean y 4,2% en test-other son cifras de pesos abiertos reproducidas por innumerables equipos; su aproximadamente 7,7% en el compuesto del leaderboard Open ASR se sitúa alrededor de un punto por detrás del Large v3 completo; y su documentado 8–12% en audio ruidoso en pruebas de la comunidad significa que nadie se sorprende por ello. Esas debilidades son parte del historial: te dicen exactamente dónde necesita ayuda el modelo antes de que construyas sobre él.
VibeVoice-ASR-Streaming-7B no tiene ese historial. Su ficha de modelo incluye una figura de evaluación como imagen, y el informe técnico de streaming de Microsoft es un PDF, pero no hay una tasa de error de palabras (WER) de streaming que se pueda citar en prosa. El único ancla numérica de la familia es la tabla reportada por el proveedor en la ficha del modelo batch VibeVoice-ASR —7,77 % de WER promedio en ocho conjuntos de prueba en inglés y 2,20 % en LibriSpeech clean—, que no es el número de este checkpoint, y la recepción del modelo batch en la comunidad ha sido desigual: alabado por su diarización lista para usar, criticado por ser pesado y, en ocasiones, propenso a alucinaciones. Nada de eso se traslada al modelo de streaming, y ese es precisamente el punto: con Whisper conoces los modos de fallo de antemano; con VibeVoice-ASR-Streaming-7B eres el primer evaluador.
Idiomas y huella: 99 frente a 10, 0.8B frente a 9B
Los dos costos más concretos de cambiar son los idiomas y el tamaño. Whisper Large v3 Turbo transcribe 99 idiomas; los idiomas de bajos recursos y los tonales se degradan — el tailandés, el cantonés y el galés son los puntos débiles comúnmente citados —, pero la lista tiene años de reproducción comunitaria detrás. VibeVoice-ASR-Streaming-7B declara diez: inglés, chino, español, portugués, alemán, japonés, coreano, francés, ruso e italiano. Si tu tráfico está dentro de esos diez, la cobertura no es un problema; si no lo está, la comparación termina aquí. El tamaño es el segundo costo: el modelo de 809M de parámetros se ejecuta en una laptop, mientras que unos 9B de parámetros totales en bf16 implican aproximadamente 18 GB de pesos antes de la caché KV y una GPU de clase 24 GB para servirlo cómodamente. Para los equipos que ya ejecutan Whisper en hardware modesto, eso es un verdadero aumento en infraestructura, justificado solo por un requisito genuino de transcripción en vivo.
Cuando lo gratuito no es el punto
Whisper Large v3 Turbo es gratuito de ejecutar; el costo es el hardware y la ingeniería que lo rodea. Una implementación de faster-whisper en una sola T4 cuesta del orden de $0.05–$0.10 por hora de audio a la tarifa vigente de la GPU, y una carga de trabajo sostenida añade el stack de diarización y puntuación que tienes que construir porque Whisper devuelve texto plano. VibeVoice-ASR-Streaming-7B también es gratuito de ejecutar, aunque en hardware más caro, a cambio de una arquitectura de streaming que afirma tener la atribución de hablantes y los controles de contexto de los que Whisper carece — afirmaciones que tendrías que verificar por ti mismo, ya que no existe ningún benchmark independiente. Para transcripción por lotes a gran volumen, el rendimiento de Whisper y su pequeña huella siguen ganando. Para audio en vivo con varios hablantes, donde la transcripción debe estar disponible durante la conversación, Whisper trabaja contra su diseño y el checkpoint de streaming trabaja a su favor — si es que funciona, que es exactamente la pregunta que hay que responder con tu propio audio en tu propia GPU.

La stack pragmática
La respuesta más común en el mundo real no es "o esto o lo otro", sino "ambos", y esa es la recomendación aquí: mantener Whisper Large v3 Turbo como el carril de procesamiento por lotes de alto volumen, donde su historial y su huella lo hacen imbatible, y evaluar VibeVoice-ASR-Streaming-7B en el carril en vivo que Whisper no puede atender con la latencia requerida — con una compuerta de evaluación explícita, porque no hay ningún benchmark en el que apoyarse. Los dos pueden compartir un mismo presupuesto de GPU y un mismo código base. Donde una capa de enrutamiento demuestra su valor en esa arquitectura es en la capa superior a las transcripciones, no en la propia transcripción: OrcaRouter no enruta conversión de voz a texto hoy en día y ninguno de los dos modelos está en su catálogo, pero los resumidores, las reglas de alerta y los planificadores de agentes que consumen una transcripción en vivo son exactamente los más de 200 modelos de lenguaje a los que da acceso con una sola API, a los precios de lista de los proveedores transmitidos sin margen adicional, y con conmutación automática por error entre proveedores. Un checkpoint de streaming que se publica sin un solo benchmark merece el mismo tratamiento que cualquier modelo no probado: una porción de tráfico real detrás de un respaldo, ganándose o perdiéndose tu confianza con la evidencia de tus propias reuniones y no con una ficha de modelo.
