Tarjeta principal del artículo que dice 'Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC', con la insignia 'COMPARACIÓN DE MODELOS' y el subtítulo 'rendimiento frente a latencia', con chips que indican 12.600 RTFx, 2,7 % de WER en streaming, 470 M de parámetros y $0,20 por hora de streaming, sobre un degradado de blanco a azul con el logotipo de OrcaRouter abajo a la derecha.
Guides & Insights

Grok Voice Transcribe 2.0 vs. Granite Speech 5.0 470M TurboCTC: 12.600× en tiempo real se encuentra con medio segundo

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Granite Speech 5.0 470M TurboCTC transcribe aproximadamente 3,5 horas de audio cada segundo en una sola H200, y Grok Voice Transcribe 2.0 devuelve una primera transcripción parcial 0,49 segundos después de que dejas de hablar. Esos dos números se colocan uno al lado del otro en publicaciones comparativas como si fueran el mismo tipo de medición, y no son ni de lejos el mismo tipo de medición: uno es una cifra de rendimiento por lotes de centro de datos sin latencia asociada, el otro es una cifra de latencia de un modelo cuyo rendimiento nadie ha publicado. IBM lanzó Granite Speech 5.0 470M TurboCTC el 25 de agosto de 2026 bajo Apache 2.0, eliminando por completo el decodificador del modelo de lenguaje y decodificando con una sola pasada CTC no autorregresiva. SpaceXAI lanzó Grok Voice Transcribe 2.0 el 18 de septiembre de 2026 como API gestionada a $0,10 por hora de audio para procesamiento por lotes y $0,20 por hora para streaming. Ambos son excelentes modelos de transcripción que resuelven mitades opuestas del mismo problema, y elegir entre ellos es más fácil una vez que dejas de comparar los números directamente.

12.600× en tiempo real, y las palabras que lo califican

La cifra de Granite es 12.600 RTFx medida en una única NVIDIA H200 con inferencia por lotes: el número de IBM, reportado en el lanzamiento y no reproducido de forma independiente desde entonces. RTFx es una relación entre la duración del audio y el tiempo de procesamiento, por lo que 12.600 significa aproximadamente 3,5 horas de audio por segundo de tiempo real. El propio planteamiento de IBM es que esto es más de 20× el rendimiento de las versiones anteriores de Granite Speech, que es la afirmación que realmente importa aquí: la aceleración provino de eliminar trabajo, no de añadir hardware.

Lo que no es, es una cifra de latencia. Un trabajo por lotes que completa 3,5 horas de audio por segundo puede seguir tardando mucho en devolver el primer token de cualquier archivo individual, según cómo se ensamble el lote y cuánto audio le introduces antes de que empiece. IBM no publica ninguna cifra de latencia en absoluto para TurboCTC. En la tabla de clasificación de campo lejano, los dos checkpoints son las dos entradas más rápidas, pero el rendimiento allí se midió en una sola NVIDIA L4, que es un acelerador adyacente a centros de datos y no un teléfono.

La razón por la que esto importa es que el modelo está posicionado explícitamente para portátiles, teléfonos y dispositivos de borde —el propio planteamiento de IBM—, y nadie ha publicado el rendimiento en un solo flujo en ninguno de ellos. Hasta que alguien lo haga, trata "12,600×" como una declaración sobre lo barato que puedes procesar un backfill en GPU alquiladas, que es una afirmación genuinamente valiosa y bien fundamentada, y no como una declaración sobre la rapidez con la que un usuario recibe una frase de vuelta.

Lo que IBM eliminó, y lo que eso te cuesta

TurboCTC es un diseño solo de codificador: un codificador acústico Conformer de 16 capas entrenado con CTC, decodificado de forma voraz en una única pasada no autorregresiva, con una capa de salida de subpalabras de 16.384 unidades. No hay ningún modelo de lenguaje en el bucle. De ahí procede la velocidad y también de ahí proceden los recortes de capacidades, que no son pequeños. En comparación con modelos anteriores de Granite Speech, TurboCTC elimina la traducción de voz, elimina el sesgo de palabras clave y no incluye herramientas de marcas de tiempo ni de puntuación.

Compara eso con lo que incluye el modelo gestionado a su precio de lista, y la forma de la operación se vuelve concreta:

• Sesgo de términos clave — Granite Speech 5.0 470M TurboCTC no tiene ninguno, frente a hasta 100 términos clave por solicitud en Grok Voice Transcribe 2.0

• Marcas de tiempo a nivel de palabra — no incluidas con TurboCTC vs incluidas con puntuaciones de confianza

• Traducción de voz — presente en modelos anteriores de Granite Speech, eliminada aquí frente a no ofrecida de ninguna manera

• Cobertura de idiomas — solo inglés vs. detección automática en un conjunto de entradas ampliamente multilingüe con soporte de formato en 25 idiomas

• Diarización — un problema aparte que resuelves tú mismo vs. incluida en el precio de la solicitud

• Canales — un flujo por pasada frente a hasta ocho canales de audio en una solicitud

• Normalización de texto — ninguna frente a la normalización inversa de texto que convierte fechas, monedas y números de teléfono hablados en forma escrita

• Despliegue — pesos que descargas y ejecutas tú mismo frente a un endpoint gestionado en us-east-1

Lee esa lista como una descripción de dos productos diferentes en lugar de una tarjeta de puntuación. Eliminar la diarización, el sesgo y la normalización es lo que permitió ganar el rendimiento. Una carga retrospectiva por lotes de 40.000 grabaciones de llamadas en un índice de búsqueda no necesita marcas de tiempo ni turnos de hablante —necesita ser barata y necesita terminar—, y para ese trabajo las funciones ausentes no están ausentes, son peso eliminado.

Para cualquier cosa en vivo, ocurre lo contrario. Si estás creando un agente de voz, una lista de términos clave es la forma de conseguir que “Kubernetes”, “Granola” y los nombres de clientes se escriban correctamente, y un transcriptor sin mecanismo de sesgo los transcribirá mal todas las veces, sin más forma de arreglarlo que el ajuste fino, que es otro proyecto con otro presupuesto. Esa única característica ausente descalifica a TurboCTC para algunas cargas de trabajo y es irrelevante para otras, y por eso la comparación de modelos es menos útil que una comparación de cargas de trabajo.

Screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 licence tag, the English and automatic-speech-recognition tags, a model summary describing a 470 million parameter conformer acoustic encoder trained with CTC on 60,000 hours of English audio and decoded non-autoregressively, and a bar chart of Open ASR leaderboard WER by test set — LS Clean 1.42, LS Other 2.66, SPGISpeech 3.18, Voxpopuli-Cleaned-AA 4.88, Earnings22-Cleaned-AA-chunked 6.69, AMI-Cleaned 7.52 and Gigaspeech-Cleaned 8.67 — with an average WER of 5.00% and an average RTFx of 13,042.98 measured on one H200.

La comparación de precisión que no se puede hacer de forma limpia

IBM informa una tasa de error de palabras agregada del 5,00 % para el checkpoint de Apache 2.0 y del 4,85 % para el modelo hermano no comercial en Open ASR Leaderboard, sobre conjuntos públicos de inglés de formato corto. Esas son cifras de evaluación por lotes en una tabla cuyas evaluaciones incluyen AMI y Earnings22, y conjuntos conversacionales de formato largo, y están reportadas por el proveedor: ejecutadas con las herramientas del leaderboard pero aún no incorporadas a la tabla oficial, que también incluye conjuntos de prueba privados. Vale la pena leer el desglose por conjunto publicado en la tarjeta del modelo, porque el promedio oculta mucho: LS Clean 1,42 %, LS Other 2,66 %, SPGISpeech 3,18 %, Voxpopuli-Cleaned-AA 4,88 %, Earnings22-Cleaned-AA-chunked 6,69 %, AMI-Cleaned 7,52 % y Gigaspeech-Cleaned 8,67 %, con un promedio de exactamente 5,00 %. La misma tarjeta cita un RTFx promedio de 13.042,98 medido en una H200 —superior a la cifra de 12.600 que usó la publicación de lanzamiento de IBM—, y ambas cifras son de la empresa, de la misma semana y en el mismo hardware.

La cifra de transcripción final del 2.7% de Grok Voice Transcribe 2.0 no es una medición comparable. Proviene de la tabla AA-WER Streaming de Artificial Analysis, un compuesto ponderado de AA-AgentTalk al 50%, VoxPopuli al 25% y Earnings22 al 25% — aproximadamente ocho horas de audio conversacional en inglés ponderado por agente, medido a través de una interfaz de transmisión. Diferentes conjuntos, diferente ponderación, diferente modo de operación. Poner 2.7% junto a 5.00% y concluir que el modelo gestionado es aproximadamente el doble de preciso es el error más común que se puede cometer en esta comparación.

Lo que puede decirse honestamente es más acotado y aun así útil. Ambos modelos son sólidos en el audio con el que se midió cada uno. Grok Voice Transcribe 2.0 lidera una tabla de streaming ejecutada de forma independiente en la que también se miden otros modelos, lo que hace que su clasificación sea verificable aunque su valor exacto no sea transferible. Granite Speech 5.0 470M TurboCTC tiene un WER agregado en los conjuntos estándar abiertos de ASR y, por separado, un resultado de campo lejano en el que el checkpoint no comercial ocupa el quinto lugar en precisión y el de Apache, el noveno — medido con habla ruidosa y reverberante, que es la condición más difícil del conjunto y, posiblemente, lo más honesto de las cifras de cualquiera de los dos modelos.

Si tu audio es habla leída en inglés claro, es probable que la diferencia de precisión entre estos dos sea menor de lo que sugieren las posiciones en la tabla de clasificación. Si es ruidoso, con acento, telefónico o no está en inglés, ninguna de las tablas te dice mucho y tu propio conjunto de prueba es el único instrumento que lo hace.

Pesas libres frente a $1,67 la hora

La comparación de costos es el único punto en el que estos dos modelos son realmente fáciles de separar, y la cifra que la gente suele citar es incorrecta en ambos sentidos.

• Transcripción por lotes — Grok Voice Transcribe 2.0 a $0,10 por hora de audio, o aproximadamente $1,67 por 1.000 minutos frente a Granite Speech 5.0 470M TurboCTC sin coste de licencia, más tiempo de GPU

• Streaming — $0.20 por hora de audio, aproximadamente $3.33 por cada 1.000 minutos, frente a la ausencia de una ruta de streaming alojado publicada por IBM

• Licencia — una API comercial sin pesos frente a Apache 2.0 para el checkpoint principal y CC-BY-NC-SA-4.0 para el no comercial más preciso

«Gratis» está haciendo mucho trabajo en esa primera fila. Un modelo de 470M de solo codificador es lo suficientemente pequeño como para ejecutarse en hardware modesto —ese es el objetivo del diseño, y la razón por la que IBM lo entrenó en diez días en ocho H100 y lo lanzó para `transformers>=5.16.0` con una demo de WebGPU—, pero alguien sigue pagando por la GPU, la pila de servicio, el autoescalado, los reintentos y la rotación de guardias. Con volúmenes pequeños, el precio de la opción gestionada suele ser más barato que el tiempo de ingeniería. Con volúmenes grandes y constantes, la opción del hardware alquilado gana, y el punto de cruce es función de tu utilización más que de tu volumen de audio: una GPU que mantienes ocupada es barata por hora, y una que mantienes caliente para el tráfico pico no lo es.

Vale la pena señalar un detalle de licencia antes de que alguien diseñe su arquitectura en torno a esto. El más preciso de los dos checkpoints, el de 4,85 % de WER, es el no comercial bajo CC-BY-NC-SA-4.0. El checkpoint de Apache 2.0 es el de 5,00 %, y es el que puedes incluir en un producto. Esa es una diferencia de precisión de 0,15 puntos que se intercambia por el mero derecho a usar el modelo, y también significa que cualquier comparación que cite 4,85 % para «Granite Speech 5.0» y luego hable de despliegue comercial está citando el checkpoint equivocado.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: release September 18 2026, final WER 2.7% streaming, first partial 0.49s, 100 key terms included, diarization included, $0.20 per streaming hour. The right column gives Granite Speech 5.0 470M TurboCTC the rows: release August 25 2026, mean WER 5.00% Apache, speed 12,600 RTFx batched, no key terms, timestamps not shipped, Apache-2.0 weights where you pay compute. A footer reads 'Granite figures IBM-reported; Grok figures per Artificial Analysis.'

La regla de decisión

Tres preguntas separan a estos dos modelos más rápido que cualquier tabla de benchmarks.

¿La transcripción se consume en vivo, mientras el hablante sigue hablando? Si es así, TurboCTC no es el candidato — no porque sea lento, sino porque no tiene interfaz de streaming ni salida parcial, y una transcripción parcial es un compromiso arquitectónico distinto al de una decodificación por lotes rápida. Si no, la ventaja de rendimiento pasa a ser el factor decisivo y el modelo de IBM es muy difícil de superar en coste por hora de audio procesado.

¿El trabajo requiere vocabulario de dominio? Si la respuesta es sí, un modelo con sesgo se impone por defecto, y la ausencia de sesgo de términos clave en TurboCTC es descalificante, no solo un inconveniente. Si la respuesta es no, estás pagando por una función que no usarás del lado gestionado.

¿El audio es habla leída en inglés en hardware decente? Si sí, ambas son sólidas y la elección se trata de operaciones. Si no, ambas placas no aportan información y solo cuenta tu propia evaluación.

Sea cual sea el resultado, la capa operativa es donde esta decisión se vuelve económica. OrcaRouter pone más de 200 modelos detrás de una única clave compatible con OpenAI con conmutación automática entre proveedores, de modo que un endpoint de voz gestionado de una sola región que tiene una mala tarde deja de ser tu caída, y el precio de lista del proveedor se transfiere con un 0 % de recargo, lo que significa que un cambio de precio de un proveedor o un nuevo checkpoint está activo de nuestro lado el mismo día. Para una carga de trabajo en la que la respuesta correcta no está nada clara, eso elimina el coste de equivocarse: compara ambos con tu propio audio detrás de un único endpoint, quédate con el que gane y cambia la cadena del modelo cuando llegue el siguiente.

Screenshot of the SpaceXAI Speech to Text API documentation page showing the Quick Start section with a Python example posting an audio file to https://api.x.ai/v1/stt with the model parameter set to grok-voice-transcribe-2.0, alongside the API console navigation and an on-this-page index listing Supported Audio Formats, Limits, Streaming Speech-to-Text and Smart Turn.

La versión corta: Granite Speech 5.0 470M TurboCTC es la mejor respuesta a «transcribir todo lo que hayamos grabado alguna vez, de forma económica, en hardware que controlamos», y Grok Voice Transcribe 2.0 es la mejor respuesta a «transcribir esto a medida que ocurre, con precisión, sin que nosotros ejecutemos la pila de servicio». Tanto el titular de 12.600× como el titular de 0,49 segundos son ciertos, y ninguno de los dos es evidencia sobre el otro.