Tarjeta de título principal para Granite Speech 5.0 470M TurboCTC, que muestra un icono de forma de onda de voz, una insignia que indica 12,600 RTFx en 1 H200, etiquetas que indican 470M params, Encoder-only CTC y Apache 2.0, un subtítulo 'ASR en inglés Apache-2.0 de IBM', un pie que indica Lanzado el 25 de agosto de 2026, y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Granite Speech 5.0 470M TurboCTC: el ASR Apache-2.0 de IBM afirma 12,600 RTFx

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Granite Speech 5.0 470M TurboCTC es el modelo del nuevo lanzamiento de reconocimiento de voz de IBM que sí puedes distribuir, y eso es lo primero que hay que saber sobre él. IBM publicó dos checkpoints de reconocimiento de voz en inglés en Hugging Face el 25 de agosto de 2026: Granite Speech 5.0 470M TurboCTC bajo licencia Apache 2.0 y Granite Speech 5.0 470M TurboCTC-NC bajo una licencia no comercial CC-BY-NC-SA-4.0. Misma arquitectura de 470 millones de parámetros, datos diferentes, licencias opuestas. El modelo Apache es al que IBM apunta para "otros casos de uso", que es la forma que tienen los proveedores de decir producción comercial, y también es el que lleva la cifra principal: IBM reporta un rendimiento agregado superior a 12 600 RTFx en una sola NVIDIA H200, lo que equivale a más de tres horas y media de audio en inglés transcritas por segundo con inferencia por lotes.

Esa cifra de velocidad es una afirmación del proveedor de un día de antigüedad y no reproducida por ningún tercero, así que tómala como un número sólido sobre el papel más que como un hecho auditado. La razón por la que, aun así, merece tu atención es el diseño que hay detrás: Granite Speech 5.0 TurboCTC elimina el decodificador de modelo de lenguaje que usaba cada modelo anterior de Granite Speech, dejando un codificador Conformer puro entrenado con clasificación temporal conexionista (CTC) y decodificado de forma no autorregresiva. Que no haya un bucle de generación token por token es cómo un modelo de 470M de parámetros termina afirmando un rendimiento que supera a modelos varias veces su tamaño — y es por eso que este lanzamiento importa para cualquiera que construya voz a texto, no solo para la tabla de benchmarks.

Lo que realmente se envió

Dos checkpoints, ambos publicados el 25 de agosto de 2026 en la organización ibm-granite de Hugging Face, ambos ASR de solo inglés con la misma arquitectura de solo codificador:

• Granite Speech 5.0 470M TurboCTC — Apache 2.0, uso comercial permitido, entrenado con aproximadamente 60,000 horas de audio en inglés.

Granite Speech 5.0 470M TurboCTC-NC — CC-BY-NC-SA-4.0, solo para uso investigativo y no comercial, entrenado con aproximadamente 75,000 horas de audio en inglés.

Este artículo trata sobre el modelo Apache — aquel del que un producto puede depender legalmente — con la variante -NC mencionada donde la historia de licencias lo requiere. Ambos checkpoints se distribuyen como safetensors en F32 y BF16, y ambos tienen soporte nativo en Hugging Face Transformers a través de AutoModelForCTC y AutoProcessor. La función llega en la próxima versión de Transformers; hasta entonces, instalas Transformers desde el código fuente, cargas el procesador y el modelo, y ejecutas decodificación greedy. IBM también enlaza una demo de streaming WebGPU basada en navegador, que es la forma más rápida de comprobar lo baja que llega a ser la latencia.

La apuesta por la arquitectura: un codificador, sin decodificador, 12,5 tokens por segundo

The design change is the story behind the speed claim. Earlier Granite Speech releases paired an acoustic encoder with a projector and a language-model decoder, and that decoder is what got dropped. Granite Speech 5.0 470M TurboCTC is a 16-layer Conformer encoder trained with CTC, and inference is a single non-autoregressive greedy pass. There is nothing to sample, so there is no generation latency to wait on.

Tres detalles de configuración lo hacen rápido, no solo pequeño:

• Submuestreo temporal por un factor de 8. El front-end funciona a 100 tramas por segundo; el modelo genera 12.5 tokens por segundo. Apilar y omitir tramas log-mel, luego convoluciones con zancada y residuales con pooling en los dos primeros bloques Conformer, reducen la velocidad de salida en tres etapas de 2x.

• Un vocabulario de subpalabras en lugar de caracteres. Los codificadores anteriores de Granite Speech emitían 50 caracteres por segundo; la versión 5.0 emite 12,5 tokens de subpalabras por segundo a partir de un vocabulario BPE de 16 384 unidades (SentencePiece en la variante -NC). Menos unidades de salida por segundo de audio significa que el decodificador CTC tiene menos decisiones que tomar.

• CTC autocondicionado. La capa intermedia de Conformer refina las representaciones intermedias del propio modelo, que es el truco que permite que un codificador pequeño mantenga su precisión mientras el decodificador está ausente.

Todo eso está en la ficha del modelo y en el informe técnico de IBM. En resumen, se trata de un checkpoint creado para portátiles, teléfonos y pipelines de streaming donde un decodificador autorregresivo de gran peso no tendría cabida: el posicionamiento en el borde es explícito en la propia descripción de IBM.

Las cifras que IBM afirma

Todo el contenido de esta sección es información reportada por IBM, procesada a través del marco público de evaluación del leaderboard de Open ASR en la infraestructura de Hugging Face al 25 de agosto de 2026, y no reproducida de forma independiente. Trátalas como cifras del proveedor que parecen creíbles, no como una verdad establecida:

• Rendimiento: más de 12.600 RTFx en una única NVIDIA H200 con inferencia por lotes, lo que IBM traduce como más de 3,5 horas de audio por segundo. IBM añade que esto es más de 20 veces el rendimiento de los modelos anteriores de Granite Speech. Esta es una cifra de GPU de centro de datos con inferencia por lotes, no lo que te dará una computadora portátil.

• Precisión: una tasa de error de palabras agregada del 5,00 % para el modelo Apache en los conjuntos de prueba públicos de habla inglesa corta del Open ASR leaderboard (la variante -NC obtiene un 4,85 % en los mismos conjuntos). La inferencia se ejecutó a través de la infraestructura de trabajos de Hugging Face y se puntuó con las herramientas del leaderboard, por lo que IBM espera que estas cifras coincidan con la tabla oficial una vez que los nuevos modelos se integren en ella.

• Campo lejano: en la clasificación de FFASR con ruido y reverberación, el modelo Apache ocupa el noveno puesto en precisión y el modelo -NC el quinto, y ambos son las entradas más rápidas de esa tabla (rendimiento medido en una sola NVIDIA L4).

• Entrenamiento — aproximadamente 60.000 horas de audio público en inglés para el modelo Apache, realizado en diez días en ocho NVIDIA H100s en el clúster Blue Vela de IBM.

A generated single-column scoreboard titled 'Granite Speech 5.0 470M TurboCTC — the scoreboard' with rows reading Release Aug 25 2026, License Apache 2.0, Params 470M, Speed 12,600 RTFx (1 H200), WER 5.00% Open ASR, FFASR rank 9 fastest on board, and a footer reading 'IBM-reported as of Aug 25 2026; not yet independently reproduced.'

Lo que Apache 2.0 realmente te aporta

El aspecto inusual de esta versión está en la licencia. Los modelos de voz de peso abierto tienden a publicarse bajo licencias de investigación o con obligaciones que hacen que el departamento legal de un equipo de producción se estremezca; aquí, el gemelo comercialmente utilizable es el que IBM puntuó ligeramente más bajo en precisión. Cambias 0,15 puntos de WER agregado (5,00% frente a 4,85%) por el derecho a implementarlo en un producto, a monetizar los resultados, a ajustar el modelo y conservar tus pesos derivados en privado, y a usarlo en infraestructura en la nube sin que una cláusula de solo investigación se interponga en el camino.

Ese intercambio es fácil de hacer en la dirección equivocada si persigues la tabla de clasificación. El 4.85% del modelo -NC proviene de aproximadamente 15,000 horas adicionales de datos de entrenamiento (GigaSpeech y SPGI Speech), y es la versión que IBM literalmente etiqueta como "solo para fines de investigación y no comerciales". Es un buen modelo de referencia y una mala dependencia de producto. El modelo Apache pierde un poco de precisión y gana la capacidad de ser la base de un pipeline de transcripción comercial, un sistema de control de calidad para centros de llamadas o un dispositivo de borde. Si estás evaluando esta familia, la decisión de licenciamiento viene antes que la decisión de referencia.

A screenshot of the Hugging Face model page for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 license tag, the automatic-speech-recognition and English pipeline tags, a model card summary describing a compact 470 million parameter English ASR model trained on approximately 60,000 hours of English audio using CTC with non-autoregressive greedy decoding, and an Open ASR leaderboard evaluation line dated August 25 2026.

Lo que sacrificas

Eliminar el modelo de lenguaje no es gratis, y la tarjeta del modelo es honesta sobre los recortes:

• Sin traducción de voz. Las generaciones anteriores de Granite Speech podían pasar por un modelo de lenguaje para traducir mientras transcribían; 5.0 es solo transcripción.

Sin sesgo de palabras clave. El LM también manejaba el sesgo hacia términos de dominio y nombres; sin él, obtienes lo que el vocabulario de subpalabras produce de forma natural.

• Solo inglés. No hay ningún control multilingüe en esta versión, y no hay indicios de que vaya a haberlo pronto.

• El 5,00 % de WER es una cifra de audio limpio de formato corto. El resultado de FFASR (noveno, en habla de campo lejano con ruido) es el indicador más realista para el uso en salas de reuniones y con manos libres, y es un puesto, no un número destacado.

Para un trabajo de transcripción específico — audio de llamadas, reuniones, notas de voz, subtítulos, dictado — nada de esto es un obstáculo. Importan si esperabas que un modelo pequeño también tradujera, o que transcribiera de manera fiable un vocabulario personalizado sin configuración previa.

Cómo ejecutarlo hoy

No necesitas una API en la nube que aún no existe. El modelo se ejecuta localmente:

• Instala Transformers desde el código fuente (el conjunto de características CTC aún no está en la última versión), luego AutoModelForCTC junto con AutoProcessor y decodificación voraz — el pipeline estándar. El procesador puede calcular características log-mel en el dispositivo del modelo, ahorrando una copia de host a dispositivo.

• El ejemplo de la tarjeta del modelo es de dos líneas mediante pipeline: automatic-speech-recognition con el modelo "ibm-granite/granite-speech-5.0-470m-turboctc".

• Una demo de streaming de WebGPU se ejecuta en una pestaña del navegador y es la forma más rápida de medir la latencia antes de dedicar una tarde a un banco de pruebas.

• Para producción, la pregunta práctica es el servicio. Los modelos ASR abiertos de esta clase suelen ejecutarse en CPU o en una GPU pequeña con algo como inferencia de streaming por lotes: el titular de 12,600 RTFx es una cifra por lotes en H200; un número realista de una sola secuencia en un portátil será mucho más bajo, e IBM no ha publicado cifras de tiempo hasta el primer token.

Esa capa de servicio es donde residen el costo y la complejidad reales del ASR abierto, y también es donde una plataforma de enrutamiento demuestra su valor. El modelo de OrcaRouter es una sola API para más de 200 modelos, con el precio de lista del proveedor trasladado sin margen (0 % de recargo) —de modo que cuando un proveedor baja un precio, la rebaja se aplica ese mismo día— y añade conmutación automática por error entre proveedores y un DSL de enrutamiento para componer varios modelos en una sola llamada. Nada de eso aplica específicamente a Granite Speech 5.0 470M TurboCTC, porque todavía ninguna de sus variantes está en OrcaRouter: los pesos tienen un día de antigüedad y ningún proveedor comercial los está sirviendo. Cuando un modelo de voz abierto como este consigue una vía de alojamiento —o cuando se compara con las API de ASR alojadas que ya existen—, una capa de enrutamiento es la forma de probarlo y recurrir a un respaldo sin reescribir la integración, y el precio trasladado sin margen es lo que mantiene la comparación honesta.

¿Qué sigue sin confirmarse?

Un modelo de un día de antigüedad tiene un historial breve, y vale la pena enumerar exactamente lo que aún no se sabe:

• Sin benchmark de terceros. Los 12,600 RTFx, el 5.00% de WER y los rankings FFASR son todos ejecuciones propias de IBM a través del harness del leaderboard público. Ninguna entidad independiente ha publicado cifras.

• No hay API alojada por IBM. No hay página de modelo de watsonx, ni endpoint gestionado, ni precios, ni fecha para cuando llegue nada de eso.

• No hay cifras de latencia de streaming. Existen soporte de streaming y una demo de WebGPU, pero no cifras de latencia de tiempo hasta el primer token ni de latencia por fragmentos.

• No existe comparación en el mismo entorno de pruebas con los otros modelos ASR rápidos de código abierto. Los enfrentamientos que importan — contra Whisper large-v3, NVIDIA Parakeet TDT 0.6B y las APIs de transcripción alojadas — aún no han sido ejecutados con datos idénticos por nadie.

Qué ver a continuación

{{1}}Las señales a corto plazo son las reproducciones independientes. El leaderboard de Open ASR es público, el harness es estándar y los pesos están en Hugging Face, así que una ejecución de terceros debería llegar en cuestión de días: hay que observar si el 5.00% se mantiene y si los 12,600 RTFx sobreviven en una sola H200 fuera de la configuración por lotes de IBM. {{2}}La otra cosa a observar es si IBM convierte al gemelo Apache en un servicio gestionado, ya que un endpoint de watsonx haría que esto sea al instante el ASR abierto con la vía comercial más creíble. {{3}}Granite Speech 5.0 470M TurboCTC es, desde el primer día, un ASR inglés genuinamente rápido y genuinamente permisivo con una huella de verificación genuinamente delgada. {{4}}Las dos primeras son reales; la tercera es cuestión de tiempo.

A generated infographic titled '3.5 hours of audio in 1 second' showing an H200 GPU card, an audio stack and a finished transcript connected by arrows, with tags reading over 12,600 RTFx, batched inference, Apache 2.0, and IBM-reported Aug 25 2026, and the OrcaRouter logo in the bottom-right corner.
© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube