Karta tytułowa hero dla Granite Speech 5.0 470M TurboCTC, z ikoną przebiegu mowy, plakietką z napisem 12 600 RTFx na 1 H200, etykietami z napisami 470M parametrów, Encoder-only CTC oraz Apache 2.0, podtytułem „Angielski ASR IBM na licencji Apache-2.0”, stopką z napisem Wydano 25 sierpnia 2026 r. oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Granite Speech 5.0 470M TurboCTC: ASR IBM-a na licencji Apache-2.0 twierdzi, że osiąga 12 600 RTFx

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Granite Speech 5.0 470M TurboCTC to model z nowej odsłony rozwiązań mowy IBM, który faktycznie można wdrażać produkcyjnie, i to jest pierwsza rzecz, jaką trzeba o nim wiedzieć. IBM opublikował dwa punkty kontrolne rozpoznawania mowy angielskiej na Hugging Face 25 sierpnia 2026 roku — Granite Speech 5.0 470M TurboCTC na licencji Apache 2.0 oraz Granite Speech 5.0 470M TurboCTC-NC na niekomercyjnej licencji CC-BY-NC-SA-4.0. Ta sama architektura o 470 milionach parametrów, inne dane, przeciwstawne licencjonowanie. Model Apache to ten, który IBM wskazuje do „innych przypadków użycia” — czyli w żargonie producenta do komercyjnej produkcji — i to także ten z najważniejszą liczbą: IBM raportuje zagregowaną przepustowość powyżej 12 600 RTFx na pojedynczym NVIDIA H200, co przekłada się na transkrypcję ponad trzech i pół godziny angielskiego audio na sekundę przy wnioskowaniu wsadowym.

Ta liczba dotycząca prędkości to twierdzenie producenta sprzed jednego dnia, niepotwierdzone przez żadną trzecią stronę, więc potraktujcie ją jako solidną wartość na papierze, a nie jako zweryfikowany fakt. Powodem, dla którego mimo wszystko warto na nią zwrócić uwagę, jest stojący za nią projekt: Granite Speech 5.0 TurboCTC rezygnuje z dekodera modelu językowego, którego używał każdy poprzedni model Granite Speech, pozostawiając czysty enkoder Conformer trenowany przy użyciu klasyfikacji temporalnej opartej na połączeniach (CTC) i dekodowany nieautoregresywnie. To właśnie brak pętli generowania token po tokenie sprawia, że model z 470 milionami parametrów może pochwalić się przepustowością, która bije modele kilkakrotnie większe od niego — i dlatego to wydanie ma znaczenie dla każdego, kto buduje systemy zamiany mowy na tekst, a nie tylko dla tabeli benchmarków.

Co faktycznie zostało wydane

Dwa punkty kontrolne, oba wydane 25 sierpnia 2026 roku w organizacji ibm-granite na Hugging Face, oba przeznaczone do anglojęzycznego ASR, o tej samej architekturze wyłącznie z enkoderem:

• Granite Speech 5.0 470M TurboCTC — Apache 2.0, użycie komercyjne dozwolone, wytrenowany na około 60 000 godzin angielskiego audio.

• Granite Speech 5.0 470M TurboCTC-NC — CC-BY-NC-SA-4.0, tylko do badań i użytku niekomercyjnego, trenowany na około 75 000 godzin angielskiego audio.

Ten artykuł dotyczy modelu Apache — tego, na którym produkt może legalnie polegać — z odniesieniem do bliźniaka -NC tam, gdzie historia licencjonowania tego wymaga. Oba punkty kontrolne są dostarczane jako safetensors w formatach F32 i BF16, a oba mają natywne wsparcie w Hugging Face Transformers za pomocą AutoModelForCTC i AutoProcessor. Ta funkcja pojawi się w następnym wydaniu Transformers; do tego czasu należy zainstalować Transformers ze źródeł, wczytać procesor i model oraz uruchomić dekodowanie zachłanne. IBM udostępnia również przeglądarkowe demo strumieniowania WebGPU, które jest najszybszym sposobem, aby usłyszeć, jak niskie jest w rzeczywistości opóźnienie.

Zakład o architekturę: enkoder, bez dekodera, 12,5 tokena na sekundę.

Zmiana w konstrukcji to historia stojąca za twierdzeniem o szybkości. Wcześniejsze wydania Granite Speech łączyły akustyczny koder z projektorem i dekoderem modelu językowego, a właśnie ten dekoder został usunięty. Granite Speech 5.0 470M TurboCTC to 16-warstwowy koder Conformer trenowany z CTC, a wnioskowanie to pojedyncze, nieautoregresyjne, zachłanne przejście. Nie ma nic do próbkowania, więc nie ma opóźnienia generowania, na które trzeba by czekać.

Trzy szczegóły konfiguracji sprawiają, że jest szybki, a nie tylko mały:

• Subsamplowanie czasowe o współczynniku 8. Front-end działa z częstotliwością 100 klatek na sekundę; model generuje 12,5 tokenów na sekundę. Łączenie i pomijanie ramek log-mel, a następnie konwolucje z krokiem i spoolowane reszty w pierwszych dwóch blokach Conformer, zmniejszają tempo wyjściowe w trzech etapach o współczynniku 2.

Słownik podwyrazowy zamiast znaków. Wcześniejsze enkodery Granite Speech generowały 50 znaków na sekundę; wersja 5.0 generuje 12,5 tokenów podwyrazowych na sekundę ze słownika BPE składającego się z 16 384 jednostek (SentencePiece w wariancie -NC). Mniejsza liczba jednostek wyjściowych na sekundę audio oznacza, że dekoder CTC ma mniej decyzji do podjęcia.

• CTC z samowarunkowaniem. Środkowa warstwa Conformer udoskonala własne reprezentacje pośrednie modelu, co jest trikiem pozwalającym małemu enkoderowi utrzymać dokładność, kiedy dekoder jest nieobecny.

Wszystko to znajduje się w karcie modelu i technicznej dokumentacji IBM. Reasumując, jest to punkt kontrolny stworzony z myślą o laptopach, telefonach i potokach strumieniowych, gdzie ciężki autoregresyjny dekoder by się nie zmieścił — pozycjonowanie brzegowe jest wprost określone w opisie IBM.

Liczby, na które powołuje się IBM.

Wszystko w tej sekcji jest raportowane przez IBM, przepuszczone przez publiczny harness liderboardu Open ASR na infrastrukturze Hugging Face według stanu na 25 sierpnia 2026 roku i nie zostało niezależnie odtworzone. Traktuj je jako wiarygodnie wyglądające dane od dostawcy, a nie jako niepodważalną prawdę:

• Przepustowość — ponad 12 600 RTFx na pojedynczym NVIDIA H200 z wnioskowaniem wsadowym, co IBM przelicza jako ponad 3,5 godziny audio na sekundę. IBM dodaje, że to ponad 20-krotna przepustowość wcześniejszych modeli Granite Speech. Jest to wartość dla GPU w centrach danych i wnioskowania wsadowego, a nie to, co uzyskasz na laptopie.

• Dokładność — 5,00% zagregowany współczynnik błędów słownych dla modelu Apache na publicznych anglojęzycznych zestawach testowych krótkich wypowiedzi z rankingu Open ASR (wariant -NC osiąga 4,85% na tych samych zestawach). Inferencja została uruchomiona przez infrastrukturę zadań Hugging Face i oceniona narzędziami rankingu, więc IBM spodziewa się, że wyniki będą zgodne z oficjalną tabelą po włączeniu do niej nowych modeli.

• Dalekie pole — na liście rankingowej FFASR dotyczącej zaszumionych i pogłosowych nagrań model Apache zajmuje dziewiąte miejsce pod względem dokładności, a model -NC piąte; oba są najszybszymi wpisami na tej liście (przepustowość mierzona na pojedynczym NVIDIA L4).

• Trening — około 60 000 godzin publicznych nagrań audio w języku angielskim dla modelu Apache, przeprowadzony w dziesięć dni na ośmiu układach NVIDIA H100 w klastrze Blue Vela firmy IBM.

A generated single-column scoreboard titled 'Granite Speech 5.0 470M TurboCTC — the scoreboard' with rows reading Release Aug 25 2026, License Apache 2.0, Params 470M, Speed 12,600 RTFx (1 H200), WER 5.00% Open ASR, FFASR rank 9 fastest on board, and a footer reading 'IBM-reported as of Aug 25 2026; not yet independently reproduced.'

Co tak naprawdę daje ci Apache 2.0

To właśnie licencja czyni to wydanie nietypowym. Modele mowy o otwartych wagach zwykle pojawiają się na licencjach badawczych lub z zobowiązaniami, od których dział prawny zespołu produkcyjnego wzdryga się; tutaj jednak bliźniak nadający się do użytku komercyjnego to ten, któremu IBM przyznał nieco niższą dokładność. W zamian za 0,15 punktu zagregowanego WER (5,00% wobec 4,85%) zyskujesz prawo do wdrożenia w produkcie, zarabiania na wynikach, dostrajania modelu i zachowania pochodnych wag dla siebie oraz korzystania z niego w infrastrukturze chmurowej, bez klauzuli ograniczającej użycie wyłącznie do badań.

Łatwo źle rozstrzygnąć ten kompromis, jeśli goni się za rankingiem. Wynik 4,85% modelu -NC pochodzi z około 15 000 dodatkowych godzin danych treningowych (GigaSpeech i SPGI Speech) i jest to wersja, którą IBM dosłownie oznacza jako „wyłącznie do celów badawczych i niekomercyjnych”. To dobry model benchmarkowy, ale słaba zależność produktowa. Model Apache traci nieco dokładności, ale zyskuje możliwość bycia podstawą komercyjnego potoku transkrypcji, systemu zapewniania jakości w call center lub urządzenia brzegowego. Jeśli oceniasz tę rodzinę modeli, decyzja licencyjna jest ważniejsza niż decyzja benchmarkowa.

A screenshot of the Hugging Face model page for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 license tag, the automatic-speech-recognition and English pipeline tags, a model card summary describing a compact 470 million parameter English ASR model trained on approximately 60,000 hours of English audio using CTC with non-autoregressive greedy decoding, and an Open ASR leaderboard evaluation line dated August 25 2026.

Co tracisz

Porzucenie modelu językowego nie jest darmowe, a karta modelu jest uczciwa co do cięć:

• Brak tłumaczenia mowy. Wcześniejsze generacje Granite Speech mogły przepuszczać mowę przez model językowy, aby tłumaczyć ją podczas transkrypcji; wersja 5.0 oferuje wyłącznie transkrypcję.

• Brak ukierunkowania na słowa kluczowe. Model językowy również odpowiadał za ukierunkowanie na terminy i nazwy dziedzinowe; gdy tego zabraknie, otrzymujesz to, co naturalnie produkuje słownik podwyrazowy.

W tej wersji nie ma wielojęzycznego punktu kontrolnego i nic nie wskazuje na to, że pojawi się on wkrótce.

• Wartość WER 5,00% to wynik dla krótkich form i czystego dźwięku. Wynik FFASR (dziewiąte miejsce, na zaszumionej mowie z dalekiego pola) jest bardziej realistycznym wskaźnikiem do zastosowań w salach konferencyjnych i trybie głośnomówiącym, a przy tym jest to miejsce w rankingu, a nie liczba, którą można by zamieścić w nagłówku.

W przypadku wąsko zakrojonego zadania transkrypcji — audio z rozmów, spotkania, notatki głosowe, napisy, dyktowanie — żadna z tych rzeczy nie stanowi przeszkody. Mają znaczenie, jeśli liczyłeś, że jeden mały model będzie również tłumaczył lub niezawodnie transkrybował niestandardowe słownictwo od razu po wyjęciu z pudełka.

Jak to uruchomić dzisiaj

Nie potrzebujesz chmurowego API, które jeszcze nie istnieje. Model działa lokalnie:

• Zainstaluj Transformers ze źródła (funkcjonalność CTC nie jest jeszcze w najnowszym wydaniu), następnie AutoModelForCTC plus AutoProcessor i dekodowanie zachłanne — standardowy potok. Procesor może obliczać cechy log-mel na urządzeniu modelu, oszczędzając kopiowanie z hosta na urządzenie.

• Przykład z karty modelu to dwie linijki przez pipeline: automatic-speech-recognition z modelem "ibm-granite/granite-speech-5.0-470m-turboctc".

• Demo strumieniowania WebGPU działa w karcie przeglądarki i jest najszybszym sposobem na ocenę opóźnienia, zanim poświęcisz popołudnie na tworzenie platformy testowej.

W produkcji praktyczne pytanie dotyczy serwowania. Otwarte modele ASR tej klasy są zwykle uruchamiane na CPU lub małym GPU z czymś w rodzaju strumieniowego wnioskowania wsadowego — nagłówek 12 600 RTFx to liczba dla partii na H200; realistyczna wartość dla pojedynczego strumienia na laptopie będzie znacznie niższa, a IBM nie opublikował wskaźników czasu do pierwszego tokena.

Ta warstwa serwowania to miejsce, gdzie leży prawdziwy koszt i złożoność otwartego ASR, i to właśnie tam platforma routingu pokazuje swoją wartość. Model OrcaRouter to jedno API obejmujące ponad 200 modeli, z ceną katalogową dostawcy przekazywaną dalej z zerową marżą — więc gdy dostawca obniży cenę, obniżka obowiązuje tego samego dnia — a także automatyczne przełączanie awaryjne między dostawcami i DSL routingu do łączenia kilku modeli w jedno wywołanie. Żadne z tego nie dotyczy konkretnie Granite Speech 5.0 470M TurboCTC, ponieważ żaden wariant nie jest jeszcze w OrcaRouter: wagi mają zaledwie dzień i żaden komercyjny dostawca ich nie serwuje. Kiedy taki otwarty model mowy otrzyma w końcu hostowaną ścieżkę — lub gdy porównasz go z już istniejącymi hostowanymi API ASR — warstwa routingu pozwala go wypróbować i wrócić do innego rozwiązania bez przepisywania integracji, a ceny przekazywane dalej bez marży gwarantują uczciwość porównania.

Co nadal pozostaje niepotwierdzone

Jednodniowy model ma krótką historię i warto dokładnie wymienić, czego jeszcze nie wiadomo:

• Brak benchmarku strony trzeciej. 12 600 RTFx, 5,00% WER oraz rankingi FFASR to własne przebiegi IBM z wykorzystaniem publicznego harnessu tablicy wyników. Nikt niezależny nie opublikował liczb.

• Brak API hostowanego przez IBM. Nie ma strony modelu watsonx, zarządzanego punktu końcowego, cennika ani daty, kiedy cokolwiek z tego się pojawi.

• Brak danych o opóźnieniu strumieniowania. Wsparcie strumieniowania i demo WebGPU istnieją; brak natomiast danych dotyczących czasu do pierwszego tokena i opóźnienia fragmentów.

• Brak porównania w tym samym środowisku testowym z innymi szybkimi otwartymi modelami ASR. Porównania, które mają znaczenie — z Whisper large-v3, NVIDIA Parakeet TDT 0.6B i hostowanymi API transkrypcji — nie zostały jeszcze przez nikogo przeprowadzone na identycznych danych.

Co obejrzeć dalej

{{1}}Sygnały krótkoterminowe to niezależne reprodukcje.{{/1}} Ranking Open ASR jest publiczny, środowisko testowe jest standardowe, a wagi są na Hugging Face, więc uruchomienie przez stronę trzecią powinno nastąpić w ciągu kilku dni — obserwuj, czy {{2}}5.00%{{/2}} się utrzyma i czy {{3}}12,600 RTFx{{/3}} przetrwa na pojedynczym H200 poza własną konfiguracją wsadową IBM. Drugą rzeczą, na którą warto uważać, jest to, czy IBM przekształci bliźniaka Apache w usługę zarządzaną, ponieważ endpoint watsonx natychmiast uczyniłby z tego otwarty ASR z najbardziej wiarygodną ścieżką komercyjną. {{4}}Granite Speech 5.0 470M TurboCTC jest, od pierwszego dnia, naprawdę szybkim, naprawdę permisywnym angielskim ASR z naprawdę cienkim śladem weryfikacji.{{/4}} Pierwsze dwie są prawdziwe; trzecia to kwestia czasu.

A generated infographic titled '3.5 hours of audio in 1 second' showing an H200 GPU card, an audio stack and a finished transcript connected by arrows, with tags reading over 12,600 RTFx, batched inference, Apache 2.0, and IBM-reported Aug 25 2026, and the OrcaRouter logo in the bottom-right corner.
© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube