Tarjeta principal del artículo que dice 'Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B', con la insignia 'COMPARACIÓN DE MODELOS' y el subtítulo 'la cifra que Microsoft no publicó', con chips que dicen 2,7 % de WER en streaming, 0,49 s hasta el primer parcial, fragmentos de 2,9 s con atribución de hablante y pesos MIT a 18 GB, sobre un degradado de blanco a azul con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B: El número que Microsoft no publicó

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

VibeVoice ASR Streaming 7B es el reconocedor de voz en streaming unificado de Microsoft, subido a Hugging Face el 2 de septiembre de 2026 y anunciado en el repositorio microsoft/VibeVoice un día después bajo la licencia MIT, y hace algo que ni Grok Voice Transcribe 2.0 ni la mayoría de sus competidores hacen: emite texto con atribución de hablante a medida que llega el audio, sin una etapa de diarización separada. El informe técnico de Microsoft afirma que el checkpoint de 7B logra el WER y el CER promedio más bajos en cinco conjuntos de evaluación y la mejor atribución de hablante, o empatada en el mejor puesto, en 12 de 13 configuraciones de evaluación. Lo que la tarjeta del modelo no hace es publicar ni un solo número en texto: ni WER, ni RTF, ni cifra de latencia; los resultados solo existen como imágenes en el informe. Grok Voice Transcribe 2.0, lanzado dieciséis días después, el 18 de septiembre de 2026, a $0.10 por hora de audio en modo por lotes y $0.20 por hora en streaming, publica todo: 2.7 % de WER en la transcripción final y 3.4 % de WER en la primera parcial en el panel de streaming de Artificial Analysis, 0.49 segundos para cada una. Así que el punto de partida honesto para esta comparación es que uno de los dos modelos está mediblemente mejor documentado que el otro, y esa asimetría es en sí misma el hecho más relevante para la decisión en este enfrentamiento.

Lo que Microsoft publicó, y lo que un lector puede hacer con ello

El informe de VibeVoice es investigación real y las afirmaciones que contiene son específicas en su forma, aunque no en su valor. Evaluó cuatro benchmarks de reuniones —AliMeeting, AISHELL-4, AMI-SDM y AMI-IHM— más MLC-Challenge, en nueve idiomas, y reporta dos resultados principales: el modelo 7B tuvo el WER/CER promedio más bajo en los cinco conjuntos, y la mejor atribución de hablante, o la mejor empatada, en 12 de 13 configuraciones de evaluación. Ambas son afirmaciones relativas, lo cual es un tipo de afirmación significativo: "el más bajo en estos cinco conjuntos" es una declaración sobre el orden, y el orden es lo que un comprador necesita.

Lo que está ausente es toda cifra absoluta. No hay ningún porcentaje de WER con el que comparar nada, ni una cifra de rendimiento, ni una medición de latencia, ni un desglose por conjunto en el texto. Una tabla comparativa que coloque a VibeVoice junto a Grok Voice Transcribe 2.0 y le asigne un número al modelo de Microsoft está inventando ese número. Lo que puede decirse es que VibeVoice ganó su propia evaluación de cinco conjuntos y que nadie fuera de Microsoft la ha vuelto a ejecutar: ningún benchmark independiente, ninguna evaluación de terceros y, en el momento de escribir esto, ningún proveedor de inferencia alojada que liste el modelo siquiera. La comparación es, por lo tanto, entre un número documentado y una clasificación no documentada, y la clasificación no documentada no es la más débil de las dos solo porque le falte un punto decimal.

La documentación de Grok Voice Transcribe 2.0 tiene el problema opuesto. Sus 2,7 % y 3,4 % provienen del tablero AA-WER Streaming de Artificial Analysis, un compuesto ponderado de AA-AgentTalk al 50 % con VoxPopuli y Earnings22 al 25 % cada uno —unas ocho horas de audio conversacional en inglés con forma de agente, ejecutado de forma independiente—, lo que constituye una procedencia genuinamente más sólida que la evaluación propia de un proveedor. Pero es una porción estrecha del inglés, y la propia página del tablero representa 27 de los 33 modelos que SpaceXAI cuenta cuando afirma tener el primer puesto de 32. Un número preciso en una prueba estrecha y una afirmación imprecisa sobre una más amplia no son directamente comparables, y este artículo no pretenderá lo contrario.

Dos segundos y medio contra medio segundo

La comparación de latencia es el único punto en el que los dos modelos pueden ponerse uno al lado del otro sin ninguna salvedad sobre los conjuntos de datos, porque ambos publican su configuración de streaming, y la diferencia es arquitectónica más que una elección de ajuste.

VibeVoice ASR Streaming 7B funciona por fragmentos. Sus checkpoints publicados usan 22 tramas latentes por fragmento, lo que, a 7,5 tramas latentes por segundo del modelo, equivale a unos 2,9 segundos de audio por fragmento, con una anticipación (lookahead) de cuatro tramas latentes —aproximadamente 0,5 segundos de audio futuro— y una latencia esperada de atribución de hablante de unos 2,00 segundos. Emite texto una vez por fragmento. Eso es un sistema de streaming real, pero la cadencia se mide en segundos, no en milisegundos.

Grok Voice Transcribe 2.0 devuelve su primera transcripción parcial 0,49 segundos después de que el hablante se detiene, y la finaliza 0,49 segundos después del final del habla. Consiguió esa velocidad con precisión: la tasa de error de la primera transcripción parcial cayó del 18,3 % en la versión 1.0 al 3,4 % en la 2.0, a costa de pasar de 0,25 segundos a 0,49 segundos en la misma medida.

Pon uno al lado del otro:

• Cadencia de streaming — Grok Voice Transcribe 2.0 emite parciales continuamente con una latencia de 0,49 segundos para el primer parcial, frente a VibeVoice ASR Streaming 7B, que emite un fragmento de texto aproximadamente cada 2,9 segundos.

• Latencia de atribución del hablante — incluida dentro de la misma ruta de 0,49 segundos frente a aproximadamente 2,00 segundos por diseño

• Anticipación — no publicada vs. cuatro tramas latentes, aproximadamente 0,5 segundos de audio futuro

• Efecto práctico — un agente de voz puede actuar sobre una frase en curso, frente a un sistema que recibe un párrafo etiquetado por hablante cada tres segundos

Ninguna de estas dos es incorrecta. Un fragmento de 2,9 segundos es un diseño perfectamente razonable para la transcripción de reuniones, donde la salida es un documento y el valor radica en que el documento llegue durante la reunión y no después. Es el diseño equivocado para un agente conversacional, donde un silencio de tres segundos no es una pausa, sino un fallo. La diferencia entre ambas cadencias es de aproximadamente seis veces, y se corresponde casi exactamente con la diferencia entre transcribir una conversación y participar en ella.

Screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B, showing the MIT licence tag, the 10 languages and Streaming tags, the model card opening line 'a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the 9B parameter and BF16 tensor type fields, a notice that no inference provider deploys it, and the architecture diagram showing 2.9 second chunks with 0.5 second lookahead.

La atribución de hablante como una salida, no como una etapa del pipeline

Aquí es donde el modelo de Microsoft está genuinamente por delante, y vale la pena entender el diseño porque es la razón de que la segmentación sea tan gruesa.

VibeVoice utiliza dos tokenizadores preentrenados — un codificador acústico y un codificador semántico — que funcionan a 24 kHz con un submuestreo de 3.200× para producir 7,5 tramas latentes por segundo, una cada 133 milisegundos. Esas tramas se proyectan en una columna vertebral de modelo de lenguaje Qwen2.5, y el habla entrante y el texto generado se intercalan como una única secuencia, con el habla y el texto observados previamente retenidos en el contexto del modelo. La consecuencia es que la identidad del hablante nunca es un problema aparte: el modelo no transcribe y luego decide quién habló, sino que genera texto condicionado por un historial de audio que aún contiene las voces. Por eso no hay una etapa de diarización que alinear, y por eso la afirmación de Microsoft sobre la atribución de hablante en 12 de 13 configuraciones es arquitectónicamente creíble en lugar de un resultado añadido.

El coste de ese diseño es una retención del historial que crece linealmente con la duración de la grabación, y por eso los checkpoints publicados están pensados para grabaciones de hasta ocho minutos. Eso es un techo real y se dice con claridad. Deja el modelo fuera para trabajos de formato largo —una llamada de resultados de dos horas, un día completo de audio de un centro de contacto— a menos que construyas tu propia segmentación y reinicialización, lo que reintroduce exactamente la complejidad que la arquitectura estaba diseñada para eliminar.

Grok Voice Transcribe 2.0 resuelve el mismo problema de manera diferente y con un conjunto distinto de limitaciones. Incluye diarización sin coste adicional y admite hasta ocho canales de audio independientes en una sola solicitud. Para la telefonía de centros de contacto, donde cada participante suele llegar por su propio canal, la separación de canales es más fiable que la diarización y no tiene una tasa de error asociada. Para audio mixto, depende de la calidad de la diarización y, a diferencia de Muse Voice Transcribe de Meta —que publicó una tasa de error de diarización promedio del 17,5 %—, SpaceXAI no ha publicado ninguna cifra de diarización. Así pues, ambos modelos dejan un vacío en la evidencia de diarización: uno publica una clasificación sin un valor, el otro publica una lista de características sin una medición.

Dieciocho gigabytes, diez idiomas, MIT

Los datos de implementación divergen de forma tan absoluta que casi no admiten comparación. VibeVoice ASR Streaming 7B pesa aproximadamente 18 GB en pesos bf16 —la ficha de Hugging Face indica 9B parámetros totales para el checkpoint denominado 7B, con un hermano de 1.5B de unos 5.6 GB—, con licencia MIT, demos en Python y un plugin de vLLM para el servicio. Diez idiomas: chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso y español. Microsoft lo posiciona para investigación y desarrollo.

Grok Voice Transcribe 2.0 es un endpoint administrado sin pesos que descargar, 12 formatos de entrada, desde audio telefónico de 8 kHz hasta 48 kHz, hasta ocho canales, 100 términos clave por solicitud, detección automática del idioma con cambio a mitad de la grabación, normalización inversa de texto en 25 idiomas, archivos de hasta 500 MB y límites de servicio de 10 solicitudes por segundo y 100 sesiones de transmisión simultáneas por equipo. Se ejecuta en us-east-1 y solo en us-east-1.

• Pesos — MIT, 18 GB, tuyos para ejecutarlos donde quieras frente a ninguno, solo alojado por el proveedor

• Idiomas — 10 idiomas con nombre vs. detección automática con soporte de formato en 25

• Sesgo de términos clave — compatible mediante hotwords vs. hasta 100 términos clave por solicitud

• Duración de la grabación — alrededor de ocho minutos por punto de control antes de que la retención del historial se convierta en la limitación, frente a ningún límite publicado, archivos de hasta 500 MB

• Control de región — cualquier región en la que despliegues frente a us-east-1

• Coste — sin tarifa de licencia, además de 18 GB de memoria de GPU y una pila de servicio, frente a $0.10 por hora de procesamiento por lotes y $0.20 por hora de streaming

Un modelo de 18 GB no es algo que se ejecute en un portátil, y el complemento de vLLM implica una GPU con memoria de verdad. Frente a eso, una licencia MIT en un modelo de ese tamaño es inusual y valiosa: es el único de los dos que puedes ejecutar dentro de tu propia red sin ninguna relación con el proveedor, lo que para audio regulado no es una preferencia, sino un requisito. La alternativa gestionada es barata por hora e imposible de desplegar en local.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7% streaming, first partial 0.49s, cadence continuous partials, diarization included with no figure published, $0.10 per batch hour, managed in us-east-1. The right column gives VibeVoice ASR Streaming 7B the rows: WER lowest of five sets but unpublished, speaker attribution about 2.00s, cadence 2.9 second chunks, diarization built into streaming, MIT weights at about 18 GB, recordings up to 8 minutes. A footer reads 'VibeVoice figures Microsoft-reported with no absolute values published; Grok figures per Artificial Analysis.'

Dónde corresponde la decisión de enrutamiento

El costo es donde los dos modelos por fin se vuelven comparables de una manera que produce un número. La ruta por lotes de Grok Voice Transcribe 2.0 cuesta $0.10 por hora de audio, alrededor de $1.67 por cada 1,000 minutos, y su ruta de streaming, $0.20, alrededor de $3.33. VibeVoice ASR Streaming 7B no tiene ningún costo de licencia; lo que tiene en su lugar es aproximadamente 18 GB de memoria de GPU residente y una pila de servicio de vLLM que tú operas. Un modelo de clase 7B de ese tamaño no va a ser barato por hora de audio en hardware alquilado, y la curva de utilización no perdona: una GPU mantenida caliente para el tráfico máximo cuesta lo mismo ya sea que esté transcribiendo o inactiva.

Esa es la forma habitual del debate entre construir y comprar, y se resuelve de manera distinta según el volumen y según si se permite que el audio salga de tu red. Lo que ha cambiado en el último mes es la velocidad con la que se mueve la respuesta: el líder en precisión de streaming cambió de manos dos veces en tres semanas, y un modelo lanzado a principios de septiembre fue desplazado a mediados de septiembre. Cualquier arquitectura que haga que la elección del modelo sea costosa de revertir es ahora la arquitectura equivocada para esta categoría.

OrcaRouter es donde esa inversión se vuelve barata. Una única clave compatible con OpenAI cubre más de 200 modelos con conmutación por error automática entre proveedores, de modo que el fallo de un endpoint gestionado de una sola región es un evento de enrutamiento y no una interrupción, y el precio de lista del proveedor se traslada con un 0 % de margen — lo que significa que un cambio de precio de un proveedor o un nuevo checkpoint está activo en nuestro lado el mismo día. Para un equipo que quiere probar VibeVoice frente a Grok Voice Transcribe 2.0 con su propio audio, o mantener un respaldo autoalojado detrás de la misma interfaz que un primario gestionado, el punto de llamada deja de ser lo que tiene que cambiar.

Screenshot of the microsoft/VibeVoice GitHub repository showing the description 'Open-Source Frontier Voice AI' and the MIT licence in the About sidebar, the file listing with demo and vibevoice directories both updated with streaming ASR inference code and a vllm_plugin directory, the repository's 53.6 thousand stars, and a GitHub Trending badge reading number 1 Repository Of The Day.

El veredicto honesto: VibeVoice ASR Streaming 7B es el modelo más interesante y Grok Voice Transcribe 2.0 es el producto más usable, y la brecha entre esas dos afirmaciones se explica enteramente por el hecho de que un proveedor publica gráficos y el otro publica números. Si tu requisito es una transcripción local con atribución de hablante de reuniones de menos de ocho minutos, el checkpoint de Microsoft es el único de los dos que cumple. Si tu requisito es un agente de voz que responda dentro de una pausa conversacional, una cadencia de fragmentos de 2,9 segundos lo descarta antes de que se discuta la precisión. Y si estás esperando la comparación que lo zanjaría —el mismo audio pasado por ambos modelos, puntuado por alguien que no trabaja para ninguna de las dos empresas—, esa medición aún no existe, lo cual vale la pena recordar la próxima vez que una tabla ponga un número junto al nombre de VibeVoice.