Cartão de título herói para Granite Speech 5.0 470M TurboCTC, mostrando um ícone de forma de onda de áudio, um selo indicando 12.600 RTFx em 1 H200, rótulos indicando 470M de parâmetros, CTC somente codificador e Apache 2.0, um subtítulo "ASR de inglês da IBM sob Apache 2.0", um rodapé indicando Lançado em 25 de agosto de 2026 e o logotipo do OrcaRouter no canto inferior direito.
Guides & Insights

Granite Speech 5.0 470M TurboCTC: o ASR Apache-2.0 da IBM afirma 12.600 RTFx

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Granite Speech 5.0 470M TurboCTC é o modelo do novo lançamento de fala da IBM que você tem permissão para distribuir, e essa é a primeira coisa que você precisa saber sobre ele. A IBM disponibilizou dois checkpoints de reconhecimento de fala em inglês no Hugging Face em 25 de agosto de 2026 — Granite Speech 5.0 470M TurboCTC sob licença Apache 2.0 e Granite Speech 5.0 470M TurboCTC-NC sob licença não comercial CC-BY-NC-SA-4.0. Mesma arquitetura de 470 milhões de parâmetros, dados diferentes, licenças opostas. O modelo Apache é aquele que a IBM indica para "outros casos de uso" — que é o termo do fornecedor para produção comercial — e também é o que carrega o número de destaque: a IBM reporta taxa de transferência agregada acima de 12.600 RTFx em uma única NVIDIA H200, o que ela traduz como mais de três horas e meia de áudio em inglês transcritas por segundo com inferência em lote.

Esse número de velocidade é uma alegação do fornecedor com apenas um dia, não reproduzida por nenhum terceiro — então leia-o como um número forte no papel, não como um fato auditado. A razão pela qual ele merece sua atenção mesmo assim é o design por trás dele: o Granite Speech 5.0 TurboCTC elimina o decodificador de modelo de linguagem que todos os modelos Granite Speech anteriores usavam, restando um codificador Conformer puro, treinado com classificação temporal conexionista (CTC) e decodificado de forma não autorregressiva. É justamente a ausência de um loop de geração token a token que permite a um modelo de 470M de parâmetros alegar uma taxa de transferência que supera modelos várias vezes maiores — e é por isso que este lançamento é relevante para qualquer pessoa que esteja desenvolvendo speech-to-text, e não apenas para a tabela de benchmarks.

O que realmente foi lançado

Dois checkpoints, ambos lançados em 25 de agosto de 2026 na organização ibm-granite Hugging Face, ambos com ASR somente em inglês e a mesma arquitetura somente de encoder:

• Granite Speech 5.0 470M TurboCTC — Apache 2.0, uso comercial permitido, treinado em aproximadamente 60.000 horas de áudio em inglês.

• Granite Speech 5.0 470M TurboCTC-NC — CC-BY-NC-SA-4.0, uso apenas para pesquisa e fins não comerciais, treinado em aproximadamente 75.000 horas de áudio em inglês.

{{1}}Este artigo é sobre o modelo Apache — aquele do qual um produto pode depender legalmente — com o gêmeo -NC referenciado onde a história do licenciamento assim o exige.{{/1}} Ambos os checkpoints são distribuídos como safetensors em F32 e BF16, e ambos têm suporte nativo no Hugging Face Transformers por meio de AutoModelForCTC e AutoProcessor. O recurso chega na próxima versão do Transformers; até lá, você instala o Transformers a partir do código-fonte, carrega o processador e o modelo e executa decodificação gulosa. {{2}}A IBM também disponibiliza uma demonstração de streaming WebGPU baseada em navegador, que é a maneira mais rápida de ouvir o quão baixa a latência realmente fica.{{/2}}

A aposta da arquitetura: um encoder, sem decoder, 12,5 tokens por segundo

A mudança de design é a história por trás da alegação de velocidade. Os lançamentos anteriores do Granite Speech combinavam um codificador acústico com um projetor e um decodificador de modelo de linguagem, e foi esse decodificador que foi descartado. O Granite Speech 5.0 470M TurboCTC é um codificador Conformer de 16 camadas treinado com CTC, e a inferência é uma única passagem gulosa não autorregressiva. Não há nada para amostrar, então não há latência de geração pela qual esperar.

Três detalhes de configuração fazem com que ele seja rápido, e não apenas pequeno:

• Subamostragem temporal por um fator de 8. O front-end opera a 100 quadros por segundo; o modelo gera 12,5 tokens por segundo. Empilhamento e salto de quadros log-mel, seguidos de convoluções com stride e resíduos com pooling nos dois primeiros blocos Conformer, reduzem a taxa de saída em três estágios de 2x.

Um vocabulário de subpalavras em vez de caracteres. Os codificadores anteriores do Granite Speech emitiam 50 caracteres por segundo; a versão 5.0 emite 12,5 tokens de subpalavras por segundo a partir de um vocabulário BPE de 16.384 unidades (SentencePiece na variante -NC). Menos unidades de saída por segundo de áudio significa que o decodificador CTC tem menos decisões a tomar.

• CTC autocondicionado. A camada intermediária do Conformer refina as representações intermediárias do próprio modelo, o que é o truque que permite que um codificador pequeno mantenha sua precisão sem o decodificador.

Tudo isso está no card do modelo e no artigo técnico da IBM. O que isso significa é um checkpoint construído para laptops, celulares e pipelines de streaming, onde um decodificador autorregressivo pesado não caberia — o posicionamento de edge é explícito na própria descrição da IBM.

Os números que a IBM está alegando

Tudo nesta seção é reportado pela IBM, executado por meio do harness público do leaderboard Open ASR na infraestrutura do Hugging Face em 25 de agosto de 2026, e não reproduzido de forma independente. Trate-os como números de fornecedor que parecem críveis, não como verdade definitiva:

• Throughput — mais de 12.600 RTFx em uma única NVIDIA H200 com inferência em lote, o que a IBM traduz como mais de 3,5 horas de áudio por segundo. A IBM acrescenta que isso é mais de 20x o throughput dos modelos Granite Speech anteriores. Este é um valor de GPU de datacenter com inferência em lote, não o que um laptop lhe dará.

• Precisão — uma taxa de erro de palavra agregada de 5,00% para o modelo Apache nos conjuntos de teste públicos de formato curto em inglês do leaderboard Open ASR (a variante -NC alcança 4,85% nos mesmos conjuntos). A inferência foi executada por meio da infraestrutura de jobs do Hugging Face e avaliada com as ferramentas do leaderboard, então a IBM espera que esses resultados correspondam à tabela oficial assim que os novos modelos forem incorporados a ela.

Campo distante — no ranking FFASR de ruído e reverberação, o modelo Apache ocupa o nono lugar em precisão e o modelo -NC o quinto, e os dois são as entradas mais rápidas nesse ranking (throughput medido em uma única NVIDIA L4).

• Treinamento — aproximadamente 60.000 horas de áudio público em inglês para o modelo Apache, realizado em dez dias em oito NVIDIA H100s no cluster Blue Vela da IBM.

A generated single-column scoreboard titled 'Granite Speech 5.0 470M TurboCTC — the scoreboard' with rows reading Release Aug 25 2026, License Apache 2.0, Params 470M, Speed 12,600 RTFx (1 H200), WER 5.00% Open ASR, FFASR rank 9 fastest on board, and a footer reading 'IBM-reported as of Aug 25 2026; not yet independently reproduced.'

O que o Apache 2.0 realmente oferece a você

A licença é onde este lançamento se mostra incomum. Modelos de fala com pesos abertos tendem a sair sob licenças de pesquisa ou com obrigações que fazem o departamento jurídico de uma equipe de produção estremecer; aqui, o gêmeo comercialmente utilizável é aquele em que a IBM obteve precisão ligeiramente inferior. Você troca 0,15 pontos de WER agregado (5,00% vs 4,85%) pelo direito de implantar em um produto, monetizar a saída, fazer fine-tuning e manter os pesos derivados apenas para si, e de usá-lo em infraestrutura de nuvem sem uma cláusula de uso exclusivo para pesquisa no caminho.

Esse trade-off é fácil de fazer na direção errada se você perseguir o leaderboard. Os 4,85% do modelo -NC vêm de aproximadamente 15.000 horas extras de dados de treinamento (GigaSpeech e SPGI Speech), e é a versão que a IBM literalmente rotula como "apenas para fins de pesquisa e uso não comercial". É um bom modelo de benchmark e uma má dependência de produto. O modelo Apache perde um pouco de precisão e ganha a capacidade de ser a base de um pipeline comercial de transcrição, de um sistema de QA de call center ou de um dispositivo de borda. Se você está avaliando esta família, a decisão de licenciamento vem antes da decisão de benchmark.

A screenshot of the Hugging Face model page for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 license tag, the automatic-speech-recognition and English pipeline tags, a model card summary describing a compact 470 million parameter English ASR model trained on approximately 60,000 hours of English audio using CTC with non-autoregressive greedy decoding, and an Open ASR leaderboard evaluation line dated August 25 2026.

O que você abre mão

Remover o modelo de linguagem não é gratuito, e o cartão do modelo é honesto sobre os cortes:

• Sem tradução de fala. As gerações anteriores do Granite Speech podiam passar por um modelo de linguagem para traduzir enquanto transcreviam; o 5.0 é apenas transcrição.

• Sem viés de palavras-chave. O LM também lidava com o viés para termos e nomes de domínio; sem isso, você obtém o que o vocabulário de subpalavras produz naturalmente.

• Somente inglês. Não há checkpoint multilíngue nesta versão, e nenhuma indicação de que um virá em breve.

Os 5,00% de WER são um valor de áudio limpo e de formato curto. O resultado FFASR (nono, em fala de campo distante ruidosa) é o indicador mais realista para uso em salas de reunião e mãos livres, e é uma classificação, não um número de destaque.

Para uma tarefa de transcrição restrita — áudio de chamadas, reuniões, notas de voz, legendas, ditado — nada disso é um obstáculo. Isso importa se você esperava que um pequeno modelo também traduzisse, ou que transcrevesse de forma confiável um vocabulário personalizado sem configuração prévia.

Como executá-lo hoje

Você não precisa de uma API em nuvem que ainda não existe. O modelo é executado localmente:

• Instale o Transformers a partir do código-fonte (o conjunto de recursos CTC ainda não está na versão mais recente), depois use AutoModelForCTC com AutoProcessor e decodificação gulosa — o pipeline padrão. O processador pode computar as características log-mel no dispositivo do modelo, evitando uma cópia do host para o dispositivo.

• O exemplo do model card é um código de duas linhas via pipeline: automatic-speech-recognition com o modelo "ibm-granite/granite-speech-5.0-470m-turboctc".

Uma demo de streaming WebGPU roda em uma aba do navegador e é a maneira mais rápida de medir a latência antes de você dedicar uma tarde a um harness de benchmark.

• Para produção, a questão prática é o serving. Modelos ASR abertos dessa classe normalmente são executados em CPU ou uma GPU pequena com algo como inferência de streaming em lote — o número de destaque de 12.600 RTFx é um valor de lote do H200; um número realista de fluxo único em laptop será muito menor, e a IBM não publicou números de tempo até o primeiro token.

É nessa camada de serviço que residem o custo e a complexidade reais do ASR aberto, e é também onde uma plataforma de roteamento mostra seu valor. O modelo de negócios do OrcaRouter é uma única API para mais de 200 modelos, com o preço de tabela do provedor repassado com 0% de markup — então, quando um fornecedor corta um preço, o corte entra em vigor no mesmo dia — além de failover automático entre provedores e uma DSL de roteamento para compor vários modelos em uma única chamada. Nada disso se aplica especificamente ao Granite Speech 5.0 470M TurboCTC, porque nenhuma das variantes está no OrcaRouter ainda: os pesos têm apenas um dia e nenhum provedor comercial está servindo esses pesos. Quando um modelo aberto de fala como esse ganha uma via hospedada — ou quando você o compara com as APIs de ASR hospedadas que já existem — uma camada de roteamento é o que permite experimentá-lo e fazer fallback sem reescrever a integração, e o repasse de preços é o que mantém a comparação honesta.

O que ainda não foi confirmado

Um modelo de um dia tem um histórico curto, e vale a pena listar exatamente o que ainda não se sabe:

• Nenhum benchmark de terceiros. Os 12.600 de RTFx, os 5,00% de WER e as classificações do FFASR são todos execuções da própria IBM por meio do harness do leaderboard público. Nenhuma entidade independente publicou números.

• Sem API hospedada pela IBM. Não há página de modelo watsonx, nem endpoint gerenciado, nem preços, nem data para quando tudo isso chegará.

• Sem números de latência de streaming. Existem suporte a streaming e uma demonstração WebGPU; já os números de tempo até o primeiro token e latência de chunks não existem.

• Não há comparação no mesmo harness contra os outros modelos ASR abertos rápidos. Os confrontos que importam — contra o Whisper large-v3, o NVIDIA Parakeet TDT 0.6B e as APIs de transcrição hospedadas — ainda não foram executados por ninguém em dados idênticos.

O que assistir em seguida

Os sinais de curto prazo são as reproduções independentes. O leaderboard do Open ASR é público, o harness é padrão e os pesos estão no Hugging Face, então uma execução de terceiros deve chegar em poucos dias — observe se os 5,00% se mantêm e se os 12.600 RTFx sobrevivem em um único H200 fora da configuração em lote da própria IBM. O outro ponto a observar é se a IBM transforma o gêmeo Apache em um serviço gerenciado, já que um endpoint watsonx o tornaria instantaneamente o ASR aberto com o caminho comercial mais viável. O Granite Speech 5.0 470M TurboCTC é, no primeiro dia, um ASR de inglês genuinamente rápido, genuinamente permissivo e com uma trilha de verificação genuinamente fina. Os dois primeiros são reais; o terceiro é uma questão de tempo.

A generated infographic titled '3.5 hours of audio in 1 second' showing an H200 GPU card, an audio stack and a finished transcript connected by arrows, with tags reading over 12,600 RTFx, batched inference, Apache 2.0, and IBM-reported Aug 25 2026, and the OrcaRouter logo in the bottom-right corner.
© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube