
Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B: dos tablas de clasificación, una comparación engañosa
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA Parakeet TDT 0.6B es un transductor FastConformer-TDT de 600 millones de parámetros lanzado el 14 de agosto de 2025 bajo CC-BY-4.0, y ha sido la recomendación por defecto para cualquiera que quiera ejecutar la transcripción por su cuenta durante más de un año. Grok Voice Transcribe 2.0 es el modelo gestionado de conversión de voz a texto de SpaceXAI, lanzado el 18 de septiembre de 2026, con un precio de $0.10 por hora de audio para lotes y $0.20 por hora para streaming, con una tasa de error de palabras final del 2,7 % en la tabla de streaming de Artificial Analysis. Si buscas una comparación entre ellos, encontrarás que Parakeet aparece citado con un WER del 13,7 % y Grok Voice Transcribe 2.0 con un 2,7 %, lo que hace que el modelo gestionado parezca cinco veces más preciso y es algo genuinamente engañoso de leer. Esos dos números provienen de índices distintos de Artificial Analysis, construidos sobre conjuntos de datos diferentes, publicados con años de diferencia, y uno de ellos ha sido reemplazado por las mediciones más recientes del propio proveedor. La comparación real es más interesante, y trata sobre lo que 600 megabytes de pesos te aportan que una API no puede.
La cifra del 13,7 %, y por qué no deberías usarla
El informe State of AI del tercer trimestre de 2025 de Artificial Analysis colocó a NVIDIA Parakeet TDT en tercer lugar en su índice AA-WER, con un 13,7%, por detrás de Chirp 2 de Google, con un 11,6%, y de Canary Qwen de la propia NVIDIA, con un 13,2%. Ese índice era un promedio ponderado por la duración del audio de aproximadamente dos horas de cada uno de VoxPopuli, Earnings-22 y AMI-SDM —habla del mundo real con acentos variados, vocabulario específico del dominio y condiciones de canal difíciles, y por eso todas las cifras que contiene son altas. Un WER del 13,7% en AMI-SDM, que es audio de reuniones de campo lejano grabado en salas con reverberación, no es un mal resultado; es una prueba exigente.
Ese índice ya no existe en esa forma. Artificial Analysis lo reconstruyó como AA-WER v2, ponderó AA-AgentTalk al 50 % con VoxPopuli-Cleaned-AA y Earnings22-Cleaned-AA al 25 % cada uno, unas ocho horas de audio, y la limpieza y la reponderación movieron sustancialmente la cifra de cada modelo. En la tabla actual de modelos sin streaming, Parakeet TDT 0.6B V3 se sitúa en un porcentaje bajo de un solo dígito —la misma banda que otros líderes de modelos de pesos abiertos—, en lugar de cerca del 13,7 %, y la parte superior de la tabla está en torno al 2 %. Cualquiera que siga citando el 13,7 % para Parakeet está citando una medición retirada, y si lo comparan con una cifra de streaming de 2026, también están comparando entre dos tablas diferentes.
Lo que honestamente se puede poner lado a lado es más limitado. La propia evaluación de NVIDIA en el Open ASR Leaderboard —los conjuntos estándar públicos de inglés de formato corto, ejecutados con las herramientas de ese leaderboard— reporta un WER medio de 6,32 % para Parakeet TDT 0.6B V3 con un RTFx de 3.332,74, y una media de 6,05 % para la v2 solo en inglés. El 2,7 % de Grok Voice Transcribe 2.0 es una cifra de transcripción final en el leaderboard de streaming, medida después del final del habla, en audio conversacional en inglés ponderado por agente. Distintos conjuntos, distinto leaderboard, distinto modo. Es muy probable que el modelo gestionado sea más preciso en el audio que comparten los dos leaderboards; el tamaño de esa ventaja no es 5×, y nadie ha publicado la medición que lo resolvería.
Qué forma tienen en realidad los dos modelos
La diferencia arquitectónica explica la mayor parte de la diferencia práctica. Parakeet TDT 0.6B es un codificador FastConformer con un decodificador transductor de token y duración: predice tanto un token como cuántos fotogramas avanzar, lo que le permite saltar en lugar de emitir blancos, y esa es la principal fuente de su eficiencia. Incluye detección automática de idioma en 25 idiomas europeos, marcas de tiempo a nivel de palabra y segmento, puntuación y mayúsculas, y maneja audio largo: hasta 24 minutos con atención completa, o alrededor de tres horas con atención local. Se sirve a través de NeMo 2.2, tiene una ruta MLX para Apple Silicon, y hay compilaciones ONNX INT8 que se ejecutan en CPU convencionales.
Grok Voice Transcribe 2.0 es un servicio gestionado, así que la comparación es entre un modelo y un producto. Lo que el producto incluye a su precio de lista:
• Streaming — Grok Voice Transcribe 2.0 nativo sobre WebSocket, primera transcripción parcial a los 0,49 segundos frente a los enfoques fragmentados o en búfer de Parakeet TDT 0.6B, sin una interfaz de transcripción parcial de primera clase
• Sesgo de términos clave — hasta 100 términos clave por solicitud frente a no ser una función de Parakeet
• Diarización — incluida en el precio de la solicitud vs. un sistema aparte que añades tú mismo
• Canales — hasta ocho canales de audio en una solicitud frente a un flujo por pasada
• Normalización inversa de texto — incluida en 25 idiomas frente a solo puntuación y mayúsculas
• Despliegue — un endpoint gestionado en us-east-1 frente a pesos que descargas, ejecutas y operas en cualquier lugar
• Licencia — términos de API comercial vs CC-BY-4.0 con atribución
• Tamaño del modelo — no divulgado frente a aproximadamente 600 millones de parámetros, alrededor de 2,4 GB en fp32 o 1,2 GB en fp16
La última fila es la que decide muchas implementaciones. Parakeet TDT 0.6B cabe en un par de gigabytes, funciona de manera aceptable en la CPU de un portátil a través de la ruta INT8 ONNX y se ajusta cómodamente a cualquier GPU de consumo. Eso no es una versión más pequeña de lo que hace la API: es una capacidad distinta, porque es la diferencia entre una función de transcripción que funciona sin conexión, en un dispositivo, sin red y sin coste por hora, y una que no lo hace.

La aritmética de costos que nadie ejecuta correctamente
La comparación que se publica es «$0.10 por hora frente a gratis», y es incorrecta en ambos sentidos: la API no es lo único que pagas, y los pesos no son lo único en lo que ahorras.
• Transcripción por lotes — Grok Voice Transcribe 2.0 a $0.10 por hora de audio, alrededor de $1.67 por cada 1,000 minutos frente a Parakeet TDT 0.6B sin coste de licencia más el tiempo de GPU o CPU
• Streaming — 0,20 $ por hora de audio, unos 3,33 $ por cada 1.000 minutos frente a la opción autoalojada, donde la limitación es tu propio techo de concurrencia en lugar de una tarifa publicada
• Límites del servicio — 10 solicitudes por segundo y 100 sesiones de streaming concurrentes por equipo frente a lo que permita tu hardware, sin límite de velocidad y sin límite de concurrencia
• El costo que no figura en ninguna de las dos hojas — ni ingeniería, ni stack de servicio, ni autoescalado frente a la rotación de guardias, ni la lógica de reintentos, ni las actualizaciones del modelo, ni la GPU que mantienes caliente para el pico
Con volúmenes pequeños, el lado gestionado casi siempre es más barato, porque el costo fijo de la ruta autoalojada es una persona. Con volúmenes grandes y estables, el lado autoalojado gana de forma decisiva, y el punto de cruce es función de la utilización, no del volumen de audio: una GPU que mantienes ocupada es muy barata por hora de audio, y una que mantienes caliente para el tráfico pico no lo es. Un equipo que procesa 20.000 horas al mes paga $2,000 por la ruta gestionada por lotes y aproximadamente un mes de GPU de gama media más tiempo de ingeniería por la autoalojada, lo cual no está ni cerca.
El motivo por el que la aritmética se hace mal es que el lado autoalojado suele compararse a cero, y el lado gestionado suele compararse a precio de lista. Ninguno de los dos es un número real. Lo que sí es real es que los 3.332 RTFx de Parakeet TDT 0.6B —la cifra de NVIDIA, por lotes, sobre hardware de centro de datos, y la que hay que tomar como un límite superior en lugar de como una promesa— significan que una sola GPU modesta puede procesar más audio del que genera la mayoría de las organizaciones.
Dónde deja de ser Parakeet la respuesta correcta
Tres cosas empujan a un equipo a abandonar el modelo abierto y pasarse a uno gestionado, y ninguna de ellas es la precisión.
El primero es el sesgo de términos clave. Si tus transcripciones están llenas de nombres de productos, apellidos, símbolos bursátiles o jerga del dominio, un modelo sin mecanismo de sesgo los transcribirá mal y no habrá más solución que el ajuste fino. Grok Voice Transcribe 2.0 acepta hasta 100 términos clave por solicitud. Parakeet TDT 0.6B no tiene esa función. Para centros de contacto, atención médica y trabajo jurídico, esa sola carencia es motivo de descarte, sin importar lo que diga cualquier tabla de clasificación.
El segundo es la diarización. Parakeet te da palabras con marcas de tiempo; no te dice quién las dijo. La transcripción con varios hablantes implica ejecutar un modelo de diarización por separado y alinear la salida, lo cual es un proyecto más que una opción de configuración. El modelo gestionado devuelve texto con atribución de hablante en la misma solicitud.
La tercera es la propia interfaz de streaming. Parakeet es lo suficientemente rápido como para que la gente construya sistemas en tiempo real sobre él —fragmentando el audio, ejecutando el modelo en cada fragmento, uniendo la salida—, pero el comportamiento de transcripción parcial, la detección de fin de turno y la semántica de compromiso son cosas que uno escribe y mantiene. Grok Voice Transcribe 2.0 devuelve un primer resultado parcial 0,49 segundos después de que dejas de hablar, como una característica del producto.
También hay un detalle de licencia que a veces sorprende a los equipos: Parakeet TDT 0.6B V3 es CC-BY-4.0, lo que permite el uso comercial pero exige atribución, y algunos modelos de voz de NVIDIA han pasado desde entonces a la propia Open Model License del proveedor. Si la atribución es un problema para tu producto, lee la ficha del checkpoint específico en lugar de asumir que se aplican los términos de la familia.

Por qué la API suele ganar de todos modos, y cuándo no debería
El patrón durante el último año ha sido constante: los equipos comienzan con un modelo abierto como Parakeet TDT 0.6B porque es gratuito y controlable, lanzan la función y luego descubren que el costo continuo no es la GPU sino el mantenimiento, y migran a un endpoint gestionado. La migración inversa también ocurre, generalmente cuando el volumen cruza un umbral en el que el cargo por hora empieza a parecer un alquiler de algo que podrías poseer.
Ambas direcciones son costosas de ejecutar si el modelo está conectado directamente a tu aplicación, que es el argumento para mantener el punto de llamada aburrido. OrcaRouter expone más de 200 modelos detrás de una única clave compatible con OpenAI con conmutación por error automática entre proveedores y 0 % de recargo sobre el precio de lista del proveedor, de modo que un despliegue autoalojado y uno gestionado pueden estar detrás de la misma interfaz y cambiarse con una cadena de modelo. Eso importa más de lo habitual en voz, donde la tabla de clasificación cambia de manos cada pocas semanas y un servicio gestionado de una sola región es una interrupción de una sola región: la ruta de conmutación por error es lo que evita que una función de transcripción se convierta en una interrupción de transcripción.
Para los equipos que quieren el rendimiento del modelo abierto sin la pila de servicio, esa es también la forma de la decisión: evalúa Parakeet TDT 0.6B con tu propio audio, evalúa Grok Voice Transcribe 2.0 con el mismo audio y deja que el que gane se quede con el tráfico mientras dejas de preocuparte por qué logotipo de proveedor lleva.

Si quieres la versión de una sola línea: Parakeet TDT 0.6B sigue siendo la mejor respuesta a «transcribir cualquier cosa, en cualquier lugar, sin coste por hora, en hardware que ya tengo», y Grok Voice Transcribe 2.0 es la respuesta a «transcribir con precisión con etiquetas de hablante y mi propio vocabulario, sin ejecutar nada». La cifra del 13,7 % que hace que la brecha parezca enorme es una medición retirada, y la brecha honesta —en algún punto entre uno y tres puntos de WER en audio superpuesto— es lo bastante pequeña como para que la pregunta operativa sea la que decida.
