Tarjeta destacada del artículo que dice 'Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo' con la insignia 'COMPARACIÓN DE MODELOS' y el subtítulo 'Lo que la línea base gratuita aún hace mejor', con chips que dicen 2.7% vs 4.07% WER, $0.20 por hora vs pesos MIT, 0.49s vs 1-5s autoalojado y gestionado vs propio, sobre un degradado de blanco a azul con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo: qué sigue haciendo mejor la versión gratuita de referencia

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Whisper Large v3 Turbo ha sido la respuesta predeterminada a "necesitamos transcripción" desde que se lanzó bajo la licencia MIT el 1 de octubre de 2024, y nada sobre Grok Voice Transcribe 2.0 cambia la razón por la que lo es. El nuevo modelo de SpaceXAI, lanzado el 18 de septiembre de 2026, es un transcriptor genuinamente mejor por un amplio margen: una tasa de error de palabras del 2.7% para transcripciones finales y del 3.4% para los primeros parciales en la tabla AA-WER Streaming de Artificial Analysis, frente a un número de la familia Whisper del 4.07% en la tabla no streaming, con el propio Turbo típicamente unos pocos décimos de punto por detrás del Large v3 completo del que fue destilado. También tiene un precio de $0.10 por hora de audio para lote y $0.20 por hora para streaming. Whisper Large v3 Turbo es un archivo de 1.6 GB de 809 millones de parámetros que se ejecuta en tu propio hardware, no mide nada, no envía audio a ningún lugar, y no tiene límite de velocidad, ni límite de concurrencia ni calendario de obsolescencia. La comparación no es entre un modelo mejor y uno peor. Es entre alquilar precisión y poseer un componente.

La ventana de treinta segundos es toda la arquitectura

Whisper Large v3 Turbo hereda la estructura de cada modelo Whisper: el audio se procesa en ventanas fijas de 30 segundos, el codificador se ejecuta una vez por ventana y el decodificador emite texto para ese fragmento. Turbo lo hizo más barato —cuatro capas de decodificador en lugar de treinta y dos, aproximadamente 8× más rápido que Large v3, unos 6 GB de VRAM en lugar de 10—, pero no cambió la forma. No existe la noción de "la oración hasta el momento" dentro del modelo, porque no hay un estado persistente entre ventanas.

Ese único hecho de diseño explica todo lo que viene después. No hay streaming nativo, porque el streaming exige comprometerse con una salida parcial a mitad del enunciado y el modelo no tiene ningún mecanismo para ello. Existen implementaciones de Whisper en tiempo real, pero son fragmentación más detección de actividad de voz más una capa de ensamblaje que alguien escribió y ahora mantiene, y la latencia que se deriva de ese pipeline se mide en segundos en lugar del medio segundo que logra Grok Voice Transcribe 2.0. No hay diarización de hablantes, porque la diarización es un problema aparte sobre quién habla, no sobre lo que se dijo. Y la variante Turbo, en concreto, devuelve texto plano: sin marcas de tiempo, sin puntuaciones de confianza, sin normalización inversa de texto que convierta números y direcciones de correo electrónico hablados en su forma escrita.

Grok Voice Transcribe 2.0 se construyó a la inversa. El streaming es el transporte principal, el modo por lotes son los mismos pesos detrás de un endpoint REST, y la lista de características se lee como una lista de cosas que Whisper dejó a la aplicación: marcas de tiempo a nivel de palabra con confianza por palabra, diarización de hablantes incluida sin coste adicional, transcripción multicanal en hasta 8 canales independientes, sesgado de términos clave de hasta 100 términos de dominio por solicitud, normalización inversa de texto en 25 idiomas, eliminación de muletillas y detección de fin de turno Smart Turn para agentes de voz. Si has estado manteniendo un pipeline de fragmentación y unión alrededor de Whisper, esa lista es una descripción del código que escribiste.

La brecha de precisión, y por qué es más pequeña de lo que parece

• Precisión final de la transcripción (streaming) — Grok Voice Transcribe 2.0 con 2,7 % de WER en AA-WER Streaming frente a la ausencia de una entrada de Whisper Large v3 Turbo, porque el modelo no puede hacer streaming de forma nativa

• Precisión por lotes — Grok Voice Transcribe 2.0 con un 2,29 % de AA-WER frente a Whisper Large v3 con un 4,07 % en la clasificación no streaming de Artificial Analysis, con Turbo normalmente 0,4 a 0,6 puntos por detrás del Large v3 completo en pruebas independientes

• Audio limpio en inglés — Whisper Large v3 Turbo alcanza aproximadamente el 2,1 % de WER en LibriSpeech test-clean y alrededor del 4,2 % en test-other, por lo que, en voz con calidad de estudio, la brecha con la API de frontera se reduce a casi nada

• Audio del mundo real — los mismos benchmarks independientes sitúan a Turbo en torno al 4,6 % en llamadas empresariales con dos hablantes y en un 8–12 % en audio con ruido, que es donde se amplía la ventaja del modelo de frontera

• Rendimiento por lotes — Grok Voice Transcribe 2.0 a aproximadamente 162× el tiempo real frente a Whisper Large v3 Turbo a aproximadamente 80× en una única GPU de consumo modesta, y con hardware de servicio más rápido se alcanzan múltiplos de eso

• Latencia de streaming — 0,49 segundos hasta el primer resultado parcial en Grok Voice Transcribe 2.0 frente a 1–5 segundos en los pipelines de streaming de Whisper autoalojados, lo que es código de pegamento más VAD, más que una capacidad del modelo

La lectura honesta de esa lista es que el argumento de precisión para pagar es real, pero condicional. Con inglés limpio, de un solo hablante y bien grabado, Whisper Large v3 Turbo es lo bastante cercano como para que la diferencia rara vez cambie un resultado. En telefonía de 8 kHz, audio ruidoso de centros de llamadas, habla con acento y frases cortas específicas de un dominio —los conjuntos exactos contra los que SpaceXAI ajustó 2.0, donde sus propias cifras reportadas pasaron de 10,6 % a 7,1 % en telefonía y de 20,6 % a 6,8 % en comandos multilingües cortos—, la brecha se convierte en la diferencia entre una transcripción sobre la que se puede enrutar y una que hay que leer. Se trata de cifras reportadas por la empresa sobre audio de la empresa, no reproducidas por nadie fuera de SpaceXAI, y la dirección en la que apuntan coincide con todas las pruebas independientes de Whisper con audio degradado.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo — the scoreboard': the left column gives Grok Voice Transcribe 2.0 native streaming with a 0.49s partial, 2.29% batch WER, included diarization, word timestamps with confidence scores, $0.20 per streaming hour and a vendor API data path; the right column gives Whisper Large v3 Turbo self-built chunking only, 4.07% for full v3, no diarization, no timestamps in Turbo, MIT weights where you pay compute, and a data path that stays on your own hardware.

La comparación de costos no es $0,10 frente a $0

La licencia de Whisper no cuesta nada; ejecutarlo, sí. Una instancia de GPU que mantiene un modelo de 1,6 GB en 6 GB de VRAM y transcribe a aproximadamente 80× el tiempo real es la verdadera partida de gasto, y a las tarifas típicas de GPU en la nube eso cae en el mismo orden de magnitud que las API alojadas para cargas de trabajo continuas — con la importante excepción de que uno paga por la capacidad tanto si hay audio fluyendo como si no. Existen endpoints alojados de Whisper a una amplia variedad de precios, desde menos de $1,20 por 1000 minutos en el extremo más barato hasta unos pocos dólares, y esa variación es un recordatorio útil de que "Whisper" es un modelo, no un nivel de servicio. El tablero de precios normalizados de Artificial Analysis sitúa los endpoints alojados más baratos de Whisper Large v3 en $0,50 y $1,15 por 1000 minutos, ambos por debajo de la tarifa por lotes de $1,67 de Grok Voice Transcribe 2.0 — pero ninguno de esos endpoints es tuyo, y ambos vienen con los límites de velocidad y la política de retención de otra persona adjuntos.

Donde el autoalojamiento gana sin discusión es en volumen con ráfagas irregulares. Un archivo multimedia de diez mil horas cuesta lo mismo en tu propia GPU tanto si lo procesas en una semana como en un año, y no hay ningún medidor por hora corriendo mientras decides. Un pipeline de cumplimiento que nunca debe enviar audio fuera de la red no tiene alternativa alojada a ningún precio, porque el requisito es arquitectónico y no financiero. Y el ajuste fino solo está a tu alcance si posees los pesos: la licencia MIT de Whisper te permite tomar el modelo de 809M de parámetros y adaptarlo a un único hablante, a un único acento o a un vocabulario de dominio limitado, una capacidad que ninguna API expone a ningún precio.

La imagen espejo es que el precio de un modelo alojado puede cambiar bajo tus pies. SpaceXAI dejó su tarifa sin cambios cuando pasó de 1.0 a 2.0 —una mejora del modelo a un precio fijo— y MAI-Transcribe-2 de Microsoft llegó al idéntico $0.10 por hora de audio, lo que te dice dónde está el piso de la frontera. Si enrutas a través de OrcaRouter, esos precios de lista pasan con un 0% de margen, por lo que un recorte de un proveedor llega a tu factura el día en que ocurre en lugar de después de un ciclo de reajuste de precios. Esa es una ventaja genuina del lado alquilado de esta comparación, y vale la pena sopesarla frente al hecho de que el lado gratuito nunca te envía una factura en absoluto.

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard showing Whisper Large v3 at 4.07% AA-WER and 118.9x real time at $1.15 per 1,000 minutes, alongside the cheaper hosted Whisper endpoints and the frontier rows for comparison.

Para qué sirve realmente cada uno

Mantén Whisper Large v3 Turbo cuando el audio ya sea un archivo, el volumen sea alto o irregular, las grabaciones sean razonablemente limpias y, o bien los datos no puedan salir de tu red, o bien el presupuesto no pueda absorber un cobro por hora. Sigue siendo la elección correcta para archivos sin conexión, la transcripción en el borde y en el dispositivo donde un modelo de 1.6 GB se cuantiza hasta caber, las canalizaciones por lotes donde la restricción es el rendimiento y no la latencia, y cualquier proyecto donde el ajuste fino con tu propio audio sea el camino hacia la precisión que necesitas. El conjunto de herramientas que lo rodea —whisper.cpp para el borde, faster-whisper para producción, compilaciones GGUF para memoria limitada— tiene dos años de refuerzo por parte de la comunidad a sus espaldas, lo cual es una forma de fiabilidad que ninguna API de dos días de antigüedad posee.

Cámbiese a Grok Voice Transcribe 2.0 cuando el audio todavía esté llegando, cuando las grabaciones estén degradadas, cuando necesite saber quién habló y cuándo, cuando el vocabulario del dominio tenga que sesgarse en lugar de ajustarse, o cuando la aplicación actúe sobre una transcripción parcial antes de que el hablante haya terminado. La ruta de actualización es un solo parámetro en una integración existente y un pin de vuelta a 1.0 si algo sale mal, lo que abarata la prueba. Cabe señalar que la migración inversa no es barata: el código escrito para una API de streaming con diarización y detección de turnos no se degrada con elegancia a un modelo por lotes que devuelve texto plano, lo cual es un argumento para probar la ruta alojada en una porción de su audio real antes de comprometer un pipeline con ella.

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

Dónde se toma realmente la decisión

La mayoría de los equipos que ejecutan Whisper a cualquier escala no eligen entre estos dos modelos, sino que ejecutan un híbrido: Whisper para el archivo porque es gratis y suficientemente bueno con audio limpio, una API de frontera para la ruta en vivo porque nada más hace streaming con un 3,4 % de WER parcial, y un tercer modelo posterior que resume, clasifica o actúa sobre el texto que salga. Ese tercer paso es donde suele ocurrir la dispersión: un segundo contrato con el proveedor para el modelo de razonamiento, un segundo conjunto de credenciales, un segundo límite de velocidad que monitorear. OrcaRouter colapsa esa capa: una sola clave para más de 200 modelos, conmutación por error automática cuando un proveedor se degrada, y un DSL de enrutamiento si quieres enviar la misma transcripción a través de varios modelos y comparar antes de elegir uno. Las llamadas de transcripción en sí siguen yendo al proveedor que hayas elegido; lo que deja de multiplicarse es todo lo que viene después.

Lo que hay que vigilar del lado de Whisper no es un nuevo checkpoint —la familia no se ha movido desde Turbo, y la atención de OpenAI se ha ido a la línea GPT Transcribe. Es la capa de servicio. Cada año, las herramientas autoalojadas se vuelven más rápidas y el hardware que necesitan se vuelve más pequeño, y cada mejora ahí reduce el argumento a favor de pagar por hora. Lo que hay que vigilar del lado de SpaceXAI es el cambio de predeterminado: cuando 2.0 se convierta en el predeterminado y 1.0 quede obsoleto, cada integración que nunca nombró un modelo se moverá a la vez, incluida la latencia. Ninguno de los dos desarrollos cambia la división fundamental. Un modelo que posees y ajustas, un modelo que alquilas y llamas, y la respuesta honesta es que la mayoría de las pilas de producción terminan ejecutando ambos.