Una tarjeta de título protagonista que compara 'VibeVoice-ASR-Streaming-7B vs GPT-Transcribe', con antetítulo 'Speech-to-text - Sept 2026', un subtítulo que indica que un checkpoint de sesión en vivo se encuentra con el endpoint de archivos auditado de OpenAI — dos momentos distintos en la vida del audio —, etiquetas 'MIT weights - Sep 2', 'OpenAI API - Jul 28' y 'GPT: 3.31% AA-WER', y una nota al pie 'Evidence is one-sided'. El logotipo de OrcaRouter aparece compuesto en la parte inferior derecha.
Guides & Insights

VibeVoice-ASR-Streaming-7B vs GPT-Transcribe: Un checkpoint de sesión en vivo frente al endpoint de archivos de OpenAI

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Los dos modelos de esta página no son rivales en el sentido que sugieren sus nombres: están diseñados para momentos distintos en la vida de una grabación de audio, y la comparación honesta trata sobre en qué momento vive tu producto. GPT Transcribe es el endpoint de transcripción asíncrona de OpenAI: subes un archivo terminado, lo procesa aproximadamente 34 veces más rápido que el tiempo real, y devuelve una transcripción, con un precio de $0.0045 por minuto de audio y una tasa de error de palabra medida de forma independiente del 3.31 % en el benchmark AA-WER de Artificial Analysis. VibeVoice-ASR-Streaming-7B tiene la forma opuesta: el checkpoint de streaming de Microsoft Research, subido silenciosamente a Hugging Face el 2 de septiembre de 2026 bajo licencia MIT, está construido para transcribir audio mientras todavía está llegando — una sesión WebSocket que emite texto en fragmentos a medida que la grabación crece. Compararlos solo por precisión no tendría sentido, porque un lado tiene una cifra auditada y el otro no ha publicado ningún dato en texto.

Todo lo que aparece a continuación está etiquetado en consecuencia. Las cifras de GPT Transcribe son el precio publicado por OpenAI y la medición independiente de Artificial Analysis, ambas en el registro público desde el lanzamiento del modelo el 28 de julio de 2026. El lado de VibeVoice-ASR-Streaming-7B es lo que se puede saber a partir del repositorio: la configuración del checkpoint, la ficha del modelo y la documentación de streaming de Microsoft, porque ningún tercero lo ha evaluado y Microsoft no ha publicado una tasa de error de palabra en streaming en texto legible.

Dos momentos diferentes en la vida del audio

GPT Transcribe está diseñado para grabaciones que ya han tenido lugar. El endpoint de OpenAI acepta archivos de audio de hasta 25 MB en los formatos habituales —mp3, mp4, mpeg, mpga, m4a, wav, webm— y devuelve la transcripción completa después del procesamiento, a aproximadamente 34× el tiempo real, por lo que una grabación de una hora se resuelve en un par de minutos. Es la vía para el procesamiento por lotes, y OpenAI lo cobra en consecuencia: $0.0045 por minuto de audio, unos $0.27 por hora de audio. Si tu necesidad es realmente en vivo, OpenAI vende un modelo aparte para eso —GPT Live Transcribe a $0.017 por minuto, casi cuatro veces el precio del lote—, que es lo más cercano en el lado de OpenAI a lo que hace VibeVoice-ASR-Streaming-7B.

VibeVoice-ASR-Streaming-7B elimina esa distinción en la otra dirección: es un checkpoint de streaming que también maneja archivos completos. Su configuración del preprocesador muestra el contrato en vivo: audio de entrada a 24 kHz, comprimido 3.200× a un flujo de tokens de 7,5 Hz, y luego procesado en fragmentos de 22 tramas con una anticipación de 4 tramas, unos 2,9 segundos de audio por fragmento con aproximadamente medio segundo de contexto futuro, emitiendo texto a medida que cada fragmento se resuelve. El contexto de la sesión se propaga mediante la caché KV, de modo que una sesión larga no se recalcula desde cero. La ruta de servicio documentada (un plugin de vLLM) expone un endpoint de stream WebSocket para sesiones en vivo y un endpoint de transcripción de archivos completos, así que los mismos pesos sirven para ambas modalidades; pero la razón de ser del modelo es la modalidad en vivo, y no hay un cobro por minuto porque no hay una API alojada: tú pones la GPU.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

El registro de evidencias es unilateral.

GPT Transcribe es una de las APIs de transcripción más exhaustivamente medidas en producción. Artificial Analysis la sitúa en una tasa de error de palabra del 3,31% en AA-WER — la novena entre aproximadamente cincuenta sistemas rastreados — con un punto débil conocido escondido en las subpuntuaciones: en el conjunto Earnings22, de acústica deliberadamente difícil, cae al 6,10%. Esas son cifras auditadas y reproducibles de una tabla de clasificación neutral, y vienen con limitaciones que, a su vez, están documentadas. El modelo se lanzó un 25% más barato que su predecesor GPT-4o Transcribe y aproximadamente 0,7 puntos mejor en el mismo punto de referencia.

VibeVoice-ASR-Streaming-7B no tiene ninguna cifra comparable en ningún sitio. Su model card incluye una figura de evaluación como imagen {{1}}y el informe técnico de Microsoft es un PDF{{/1}}, pero no hay ninguna cifra citable de WER en streaming ni de latencia en prosa, ni nada verificable de forma independiente. El único ancla numérica en la familia VibeVoice es la tabla reportada por el proveedor en la model card del modelo por lotes VibeVoice-ASR {{2}}— un promedio de 7,77% de WER en ocho conjuntos de prueba de inglés y 2,20% en LibriSpeech clean —{{/2}}, que describe el modelo no streaming y no debe leerse como la precisión de este checkpoint. Si tu decisión de compra necesita un número que puedas defender ante un colega, solo un lado de esta comparación tiene uno.

Lo que cada uno devuelve más allá de la simple transcripción

Los dos modelos hacen apuestas distintas en cuanto al contexto, y ahí es donde la comparación de características se vuelve interesante. La propuesta de GPT Transcribe es la sugerencia de contexto: puedes pasar una descripción libre de la grabación, una lista de palabras clave y nombres propios, y una lista de idiomas esperados, y OpenAI informa de que en su benchmark Context-Aware ASR la precisión semántica mejoró del 41,6 % sin contexto al 45,2 % con él. También devuelve el idioma detectado. Lo que no hace es diarización de hablantes ni marcas de tiempo a nivel de palabra: OpenAI remite a modelos separados para eso, así que una transcripción de reunión vuelve como un único muro de texto indiferenciado a menos que construyas la capa de hablantes por tu cuenta.

VibeVoice-ASR-Streaming-7B apuesta por lo contrario. Su ficha de modelo afirma una salida de atribución de hablante en streaming — quién dijo qué, emitido a medida que se resuelve el fragmento — además de palabras calientes personalizadas mediante un prompt contextual (el indicador de CLI es --context_info). Esa es la función que GPT Transcribe omite explícitamente, y es la razón por la que los dos modelos no son intercambiables para audio en vivo de múltiples hablantes. El contrapeso es la verificación: las funciones ausentes de GPT Transcribe son una decisión de producto documentada, mientras que la atribución de hablante que VibeVoice afirma es una declaración en la ficha del modelo que ninguna prueba independiente ha confirmado. Ambos lados también difieren en las marcas de tiempo — ninguno ofrece marcas temporales a nivel de palabra en la ruta que se compara, aunque el modelo por lotes de la familia VibeVoice sí las genera.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs GPT-Transcribe - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): job shape - streaming session, live audio; throughput - emits per ~2.9 s chunk; WER published - none in text; speaker output - claimed who-said-what, unverified; context controls - hotwords via --context_info; cost - /bin/bash weights, ~18 GB bf16. Right column GPT-Transcribe (released Jul 28, 2026 - hosted API): async file endpoint, files up to 25 MB; ~34x faster than real time; 3.31% AA-WER (6.10% Earnings22); no speaker output; prompt + keywords + language hints; /bin/bash.27 per audio-hour hosted. Footer: 'GPT-Transcribe price per OpenAI; WER per Artificial Analysis. VibeVoice specs read from the HF repo.'

Las formas del precio y la cuestión de la propiedad.

Las estructuras de costos difícilmente podrían ser más diferentes, y ninguna es estrictamente mejor. GPT Transcribe es una API de pago por uso: $0.27 por hora de audio, sin infraestructura, sin GPU, 25 MB por solicitud y las garantías operativas de OpenAI — el precio de no ejecutar un modelo de voz por cuenta propia. VibeVoice-ASR-Streaming-7B tiene un costo de $0 por los pesos del modelo, pero unos 18 GB de bf16 antes de la caché KV, lo que implica una GPU de la clase de 24 GB, el código de demostración de microsoft/VibeVoice o el plugin de vLLM, y su propio monitoreo y escalado. La licencia MIT es la diferencia que ninguna tarifa por minuto logra capturar: los pesos son suyos para conservarlos, ajustarlos y ejecutarlos en hardware que usted controle, sin medidor por puesto ni límite de 25 MB.

La cobertura de idiomas es el punto donde ambas partes son más vagas de lo que los compradores desearían. VibeVoice-ASR-Streaming-7B enumera 10 idiomas en su ficha de modelo —inglés, chino, español, portugués, alemán, japonés, coreano, francés, ruso, italiano— frente a los más de 50 de la versión batch de VibeVoice-ASR. OpenAI no publica una lista comparable de idiomas verificados para GPT Transcribe; reporta resultados sólidos en 22 idiomas de Common Voice en sus materiales de lanzamiento, y el punto débil acústico que le detectó la auditoría en Earnings22 es un recordatorio de que «compatible» y «maneja audio ruidoso en ese idioma» son afirmaciones distintas. Si tus necesidades de cobertura son amplias, ninguna de las dos listas lo resuelve: prueba tus dialectos reales.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

En resumen: elige por carril, no por puntuación.

Elija GPT Transcribe cuando el audio sea un archivo finalizado, cuando quiera un número de precisión documentado con límites conocidos, o cuando no ejecutar su propia infraestructura de voz valga $0.27 por hora — y combínelo con GPT Live Transcribe solo si la entrega en tiempo real justifica el precio de casi 4×. Elija VibeVoice-ASR-Streaming-7B cuando el trabajo sea en vivo y con múltiples hablantes, cuando quiera que la transcripción llegue mientras la conversación aún está sucediendo, cuando la salida de streaming con atribución por hablante sea una característica que desee evaluar, o cuando los pesos abiertos y el control de datos importen más que un benchmark medido.

Una nota estructural para los equipos que trabajan sobre cualquiera de las dos: la capa de transcripción no es algo que OrcaRouter enrute hoy — ninguno de los modelos de voz a texto de esta página está en su catálogo, por lo que la elección de ASR sigue siendo completamente tuya. Lo que el enrutamiento te aporta es la capa por encima de la transcripción. Un flujo de transcripción en vivo solo es útil cuando algo actúa sobre él — el resumidor, la regla de alerta, el planificador del agente de voz — y esa es la pila que OrcaRouter pone al frente con una única API para más de 200 modelos a precios de lista del proveedor, transmitidos sin margen adicional, más conmutación automática por error. El patrón que hace que un checkpoint no probado como VibeVoice-ASR-Streaming-7B sea asequible de probar es exactamente ese: mantener intercambiable el endpoint que consume tus transcripciones, y un modelo sin benchmarks aún puede ganarse o perder tu tráfico basándose en la evidencia de tu propio audio, en lugar de en una afirmación del día del lanzamiento.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube