
VibeVoice-ASR-Streaming-7B vs Gemini 3.5 Transcribe Live: Una semana, dos tipos de transcripción de voz en streaming
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
La última semana de agosto y los primeros días de septiembre de 2026 produjeron dos sistemas de voz a texto en streaming que parecen rivales y que en realidad son respuestas muy distintas a la misma pregunta. El 26 de agosto Google puso Gemini 3.5 Transcribe Live en vista previa pública: un endpoint de voz a texto alojado y cerrado que devuelve una transcripción finalizada 0,40 segundos después de que un hablante deja de hablar, respaldado por una tasa de error por palabra en streaming del 4,0 % medida por Artificial Analysis y materiales de lanzamiento completos. El 2 de septiembre Microsoft Research subió VibeVoice-ASR-Streaming-7B a Hugging Face bajo el espacio de nombres de microsoft: pesos abiertos con licencia MIT, sin comunicado de prensa, sin página de lanzamiento y una ficha de modelo que no publica ninguna tasa de error por palabra ni cifra de latencia en texto legible. Ambos aceptan audio mientras este todavía está llegando. Eso es casi lo único que comparten.
La evidencia en ambos lados no es simétrica, por lo que esta comparación se presenta como lo que sabemos hasta ahora. Gemini 3.5 Transcribe Live es un producto de Google con precios de tokens publicados y mediciones de terceros, y esos datos se etiquetan a continuación. VibeVoice-ASR-Streaming-7B es un checkpoint cuyas afirmaciones se extraen todas directamente del repositorio: los archivos de configuración, la tarjeta del modelo y la documentación de streaming de Microsoft en el repositorio de GitHub de VibeVoice. Nada del lado de Microsoft ha sido evaluado de manera independiente todavía, y lo decimos en aquellos casos en que una cifra podría parecer que está haciendo el trabajo.
El rastro del lanzamiento: un lanzamiento de API y una subida silenciosa
Google lanzó Gemini 3.5 Transcribe Live de la forma habitual. El modelo se encuentra bajo el paraguas de Gemini Audio junto con su hermano Gemini 3.5 Transcribe (la ruta de la API de Interactions pre grabadas), el precio está en la página del modelo, y las tablas de clasificación independientes adoptaron el endpoint en vivo en cuestión de días — de ahí provienen el 4.0% de WER en streaming y la latencia final de 0.40 segundos. Existe un nivel gratuito, con la advertencia habitual de que el contenido del nivel gratuito puede utilizarse para mejorar los productos de Google.
{{1}}El lanzamiento de streaming de Microsoft no contaba con toda esa maquinaria.{{/1}} {{2}}El repositorio de Hugging Face microsoft/VibeVoice-ASR-Streaming-7B se creó el 2026-09-02 a las 15:46 UTC y se modificó por última vez tres minutos después; contiene ocho fragmentos safetensors, un tokenizador y una configuración de preprocesador bajo la licencia MIT.{{/2}} {{3}}El registro formal es una línea del registro de noticias con fecha del 3 de septiembre en el repositorio microsoft/VibeVoice que anuncia {{/3}}{{4}}"un modelo ASR de streaming unificado que transcribe continuamente quién dijo qué a medida que llega el habla, con soporte para hotwords personalizadas y 10 idiomas,"{{/4}} {{5}}con enlaces a una demo en aka.ms/vibeasr y a un informe técnico de streaming.{{/5}} {{6}}Cuando lo comprobamos un día después de la subida, el checkpoint aún mostraba cero descargas y ningún proveedor de inferencia alojado lo lista.{{/6}} {{7}}La tarjeta del modelo dice más que el anuncio, y el repositorio es la fuente de casi todo lo que aparece a continuación.{{/7}}

Las especificaciones, lado a lado
• Qué es — VibeVoice-ASR-Streaming-7B: ASR de streaming con pesos abiertos, autoalojado vs Gemini 3.5 Transcribe Live: API de streaming alojada, pesos cerrados.
• Forma de streaming — emite texto en fragmentos de aproximadamente 2,9 segundos con unos 0,5 segundos de anticipación (derivado de la configuración del checkpoint) frente a una sesión WebSocket bidireccional con transcripciones parciales continuas y un resultado final 0,40 segundos después de que el hablante deja de hablar.
• Precisión documentada — no se publica ninguna cifra de WER ni de latencia en forma de texto, en comparación con el WER de streaming del 4.0% y el 2.6% en el modelo pregrabado, según Artificial Analysis.
• Oradores: afirmación de atribución de quién dijo qué en streaming, sin verificar, frente a la ausencia de diarización de hablantes en el endpoint en vivo (disponible en el modelo pregrabado, hasta tres oradores).
• Idiomas — 10 (en, zh, es, pt, de, ja, ko, fr, ru, it) frente a detección automática en más de 85 con conmutación a mitad de flujo.
• Duración de la sesión: limitada únicamente por tu GPU y memoria, frente a un límite máximo fijo de 10 minutos por sesión de Live.
• Coste: $0 por los pesos, unos 18 GB de bf16 para autoalojar, frente a aproximadamente $0.54 por hora de audio en Live una vez que se contabilizan los tokens de salida de texto.

Qué significa "streaming" en cada lado
La palabra esconde una diferencia de diseño real, y vale la pena ser precisos porque los dos sistemas ni siquiera intentan producir la misma cadencia. La configuración del preprocesador de Microsoft materializa el ritmo de VibeVoice: el audio llega a 24 kHz y se comprime 3200× en un flujo de tokens a unas 7,5 tramas por segundo; luego define un fragmento de 22 tramas y un lookahead de 4 tramas, es decir, unos 2,9 segundos de audio por fragmento, con aproximadamente medio segundo de audio futuro para afianzarlo. El modelo emite texto una vez por fragmento resuelto, y el contexto de los fragmentos anteriores se conserva mediante la caché KV, de modo que una sesión larga no recalcula desde cero. En la práctica, la transcripción crece en incrementos de unos tres segundos.
El endpoint en vivo de Google está diseñado para un bucle más rápido e interactivo: el audio se transmite por un WebSocket en fragmentos PCM de 16 o 24 kHz, las transcripciones parciales se reciben de forma continua mientras el hablante sigue hablando, y una transcripción final formateada llega 0,40 segundos después del final del habla; esa cifra es la medición de Artificial Analysis, citada por Google. Las contrapartidas son el límite de sesión (diez minutos de audio, tras los cuales la aplicación debe reconectarse y empalmar las partes) y los extras que faltan: no hay diarización de hablantes ni marcas de tiempo a nivel de palabra en la ruta en vivo, funciones que sí están en el Transcribe pregrabado de Gemini 3.5. Así que el resumen honesto es que el modelo de streaming de Google es más rápido por enunciado, mientras que el checkpoint de streaming de Microsoft es más lento por fragmento, pero ofrece la atribución de hablante que la vía en vivo de Google omite, con una duración de sesión que Google no ofrece.
Exactitud: medida, frente a un espacio en blanco
La mayor brecha en este enfrentamiento es una brecha en la evidencia, no necesariamente en la calidad. Artificial Analysis midió Gemini 3.5 Transcribe Live con una tasa de error de palabra promedio del 4,0% en streaming y del 2,6% en el modelo no streaming, y este último ocupó el quinto puesto en su clasificación WER al momento del lanzamiento. Google, por separado, cita un 5,50% en streaming y un 5,04% en no streaming en el conjunto multilingüe FLEURS. Léanse esos datos tal como están etiquetados: Artificial Analysis es independiente de Google, pero las cifras de una API que apenas tiene un día aún son preliminares, y la prima del streaming sobre el modelo por lotes — 4,0% frente al 2,6% — es el precio habitual de la entrega en tiempo real.
VibeVoice-ASR-Streaming-7B no tiene ninguna cifra comparable en ningún sitio. La ficha del modelo incluye una gráfica de evaluación en formato de imagen, y el informe técnico de Microsoft es un PDF, pero ninguno ofrece una cifra de WER en streaming o de latencia en texto plano que pueda citarse o verificarse de forma independiente. El único anclaje numérico de toda la familia es la ficha del modelo por lotes VibeVoice-ASR, que reporta un WER promedio del 7.77 % en ocho conjuntos de prueba de inglés y del 2.20 % en LibriSpeech clean — cifras del modelo no streaming, no de este; además, los modelos de streaming suelen sacrificar algo de precisión a cambio de la ganancia en latencia. Hasta que alguien ejecute el checkpoint de streaming en un banco de pruebas público, lo justo es decir que un lado de esta comparación está medido y el otro no.
Costo: una API medida por uso frente a una GPU que ya tenías presupuestada
Google cobra Gemini 3.5 Transcribe Live por token y factura el audio a 25 tokens por segundo. Con las tarifas publicadas de Live — $3.50 por 1M de tokens de audio y $21 por 1M de tokens de salida de texto — una hora de audio combinada cuesta aproximadamente $0.54, alrededor de $9 por 1,000 minutos de audio, y el modelo pregrabado es aún más barato, a unos $0.30 por hora. El silencio solo es gratis si tu cliente no lo transmite: las reconexiones, el audio duplicado y el registro añaden tokens medidos a la factura real.
En cambio, el checkpoint de Microsoft se cobra por horas de GPU. Solo los pesos bf16 ocupan unos 18 GB antes de cualquier caché KV; las vías documentadas son las demostraciones de Python en el repositorio microsoft/VibeVoice y un plugin de vLLM que sirve endpoints compatibles con WebSocket y con OpenAI, y no hay un precio de alojamiento porque ningún proveedor aloja el modelo todavía: no está en Azure AI Foundry como sí lo ha estado el VibeVoice-ASR por lotes desde marzo. Autoalojar un speech-LLM de clase 7B implica presupuestar una GPU de clase 24 GB y tu propio tiempo de operación; a cambio obtienes duración de sesión ilimitada y unos pesos que son tuyos para conservar. Los dos modelos no son mutuamente excluyentes, lo cual es el punto de la última sección.

Mantener la elección barata
Cuál elijas depende de si necesitas un número o un código. Elige Gemini 3.5 Transcribe Live cuando quieras una transcripción que funcione hoy con una precisión publicada y sin necesidad de GPU — y cuando tu audio no se limite a diez idiomas, o estés preparado para crear tú mismo el etiquetado de hablantes porque el endpoint Live no lo proporciona. Elige VibeVoice-ASR-Streaming-7B cuando tengas autoalojamiento, cuando importe la duración de sesión ilimitada o la supuesta salida de streaming con atribución de hablante, y cuando estés dispuesto a ejecutar tu propia puerta de evaluación porque no hay ningún benchmark en el que apoyarte.
Ninguna de las dos opciones tiene que ser permanente, y ahí es donde una capa de enrutamiento demuestra su valor: para los modelos que trabajan con la transcripción, no para la transcripción en sí. OrcaRouter no enruta voz a texto hoy, y ninguno de los modelos de esta página está en su catálogo; lo que hace es ofrecer una única API a los más de 200 modelos de lenguaje que consumen una transcripción en vivo —el resumidor, el extractor de elementos de acción, el planificador del agente de voz— a precios de lista de los proveedores, trasladados sin recargo, con conmutación automática entre proveedores. Un recorte de precio de cualquier proveedor en esa pila se aplica el mismo día porque los precios de lista se trasladan directamente, sin margen. El paso de transcripción se queda donde lo hayas puesto; la pila que actúa sobre la transcripción es exactamente la capa donde una única clave y una ruta de respaldo hacen que un checkpoint de una semana, sin evaluar, pase de ser una apuesta a convertirse en una opción comprobable.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
