
Grok Voice Transcribe 2.0 kontra Granite Speech 5.0 470M TurboCTC: 12 600× czasu rzeczywistego spotyka pół sekundy
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Granite Speech 5.0 470M TurboCTC transkrybuje około 3,5 godziny audio co sekundę na pojedynczym H200, a Grok Voice Transcribe 2.0 zwraca pierwszy częściowy transkrypt 0,49 sekundy po tym, jak przestaniesz mówić. Te dwie liczby są stawiane obok siebie w postach porównawczych, jakby były tym samym rodzajem pomiaru, a nie są nawet w najmniejszym stopniu tym samym rodzajem pomiaru — jedna to wartość przepustowości przetwarzania wsadowego w centrum danych bez przypisanej latencji, druga to wartość latencji modelu, którego przepustowości nikt nie opublikował. IBM wydało Granite Speech 5.0 470M TurboCTC 25 sierpnia 2026 na licencji Apache 2.0, całkowicie rezygnując z dekodera modelu językowego i dekodując za pomocą pojedynczego nieautoregresyjnego przebiegu CTC. SpaceXAI udostępniło Grok Voice Transcribe 2.0 18 września 2026 jako zarządzane API w cenie 0,10 USD za godzinę audio w trybie wsadowym i 0,20 USD za godzinę w trybie strumieniowym. Oba są doskonałymi modelami transkrypcji, rozwiązującymi przeciwne połowy tego samego problemu, a wybór między nimi jest łatwiejszy, gdy przestaniesz bezpośrednio porównywać te liczby.
12 600× czasu rzeczywistego i słowa, które to określają
Wynik dla Granite to 12 600 RTFx zmierzone na pojedynczym NVIDIA H200 przy wnioskowaniu wsadowym — liczba podana przez IBM, ogłoszona przy premierze, a od tego czasu nie została niezależnie odtworzona. RTFx to stosunek czasu trwania materiału audio do czasu przetwarzania, więc 12 600 oznacza około 3,5 godziny materiału audio na sekundę czasu zegarowego. Samo IBM ujmuje to tak, że jest to ponad 20× większa przepustowość niż w przypadku wcześniejszych wydań Granite Speech, i to jest twierdzenie, które tak naprawdę ma tu znaczenie: przyspieszenie wynikało z usunięcia pracy, a nie z dodania sprzętu.
Nie jest to liczba określająca opóźnienie. Zadanie wsadowe, które przetwarza 3,5 godziny dźwięku na sekundę, może mimo to potrzebować dużo czasu na zwrócenie pierwszego tokenu dowolnego pojedynczego pliku — w zależności od tego, jak zbudowana jest partia i ile dźwięku dostarczysz mu, zanim zacznie. IBM nie publikuje żadnych danych dotyczących opóźnień dla TurboCTC. W rankingu far-field te dwa punkty kontrolne to dwa najszybsze wpisy, ale przepustowość mierzono tam na pojedynczym układzie NVIDIA L4, który jest akceleratorem z pogranicza centrów danych, a nie telefonem.
Ma to znaczenie, ponieważ model jest wyraźnie pozycjonowany do laptopów, telefonów i urządzeń brzegowych — to sformułowanie samego IBM — a nikt nie opublikował wydajności pojedynczego strumienia na żadnym z nich. Dopóki ktoś tego nie zrobi, traktuj „12,600×” jako stwierdzenie o tym, jak tanio można przemleć backfill na wynajętych GPU — co jest naprawdę cennym i dobrze udokumentowanym twierdzeniem — a nie jako stwierdzenie o tym, jak szybko jeden użytkownik dostaje odpowiedź na jedno zdanie.
Co IBM usunął i ile cię to kosztuje
TurboCTC to projekt oparty wyłącznie na enkoderze: 16-warstwowy akustyczny enkoder Conformer trenowany z CTC, dekodowany zachłannie w jednym przebiegu nieautoregresyjnym, z warstwą wyjściową podsłów o rozmiarze 16 384 jednostek. W pętli nie ma modelu językowego. Stąd bierze się szybkość, ale też stąd wynikają ograniczenia możliwości — i nie są one małe. W porównaniu z wcześniejszymi modelami Granite Speech TurboCTC rezygnuje z tłumaczenia mowy, rezygnuje z biasowania słów kluczowych i nie dostarcza narzędzi do znaczników czasu ani interpunkcji.
Zestaw to z tym, co obejmuje model zarządzany w swojej cenie katalogowej, a kształt transakcji staje się konkretny:
• Faworyzowanie terminów kluczowych — Granite Speech 5.0 470M TurboCTC nie ma tej funkcji, podczas gdy Grok Voice Transcribe 2.0 obsługuje do 100 terminów kluczowych na żądanie
• Znaczniki czasu na poziomie słów — niedostępne w TurboCTC vs dołączone wraz z wynikami pewności
• Tłumaczenie mowy — obecne we wcześniejszych modelach Granite Speech, tutaj usunięte vs nieoferowane tak czy inaczej
• Zasięg językowy — tylko angielski vs automatyczne wykrywanie w szerokim, wielojęzycznym zbiorze danych wejściowych z obsługą formatowania w 25 językach
• Diaryzacja — osobny problem, który rozwiązujesz samodzielnie vs wliczona w cenę zlecenia
• Kanały — jeden strumień na przebieg vs do ośmiu kanałów audio w jednym żądaniu
• Normalizacja tekstu — brak vs odwrotna normalizacja tekstu zamieniająca wypowiadane daty, waluty i numery telefonów na formę pisemną
• Wdrożenie — wagi, które pobierasz i uruchamiasz, kontra zarządzany endpoint w us-east-1
Czytaj tę listę jako opis dwóch różnych produktów, a nie jako kartę wyników. Usunięcie diaryzacji, biasowania i normalizacji to właśnie zapewniło przepustowość. Wsadowe uzupełnienie indeksu wyszukiwania o 40 000 nagrań rozmów nie wymaga znaczników czasu ani tur mówców — musi być tanie i musi zostać ukończone — a dla tego zadania brakujące funkcje nie są brakami, lecz usuniętym balastem.
W przypadku wszystkiego, co odbywa się na żywo, jest odwrotnie. Jeśli budujesz agenta głosowego, lista kluczowych terminów to sposób, w jaki „Kubernetes”, „Granola” i nazwiska klientów są zapisywane poprawnie, a system transkrypcji bez mechanizmu faworyzowania będzie je za każdym razem zapisywał błędnie i nie da się tego naprawić inaczej niż przez dostrajanie, które jest osobnym projektem z osobnym budżetem. Ta jedna brakująca funkcja dyskwalifikuje TurboCTC w przypadku niektórych obciążeń i nie ma znaczenia dla innych, dlatego porównanie modeli jest mniej przydatne niż porównanie obciążeń.

Porównanie dokładności, którego nie można przeprowadzić w sposób klarowny
IBM podaje 5,00% zbiorczego współczynnika błędów słów dla checkpointu Apache 2.0 i 4,85% dla niekomercyjnego odpowiednika na Open ASR Leaderboard, w przypadku publicznych angielskojęzycznych zestawów krótkich wypowiedzi. To wyniki w trybie wsadowym na tablicy, której ewaluacje obejmują AMI i Earnings22 oraz długie konwersacyjne zestawy, i są raportowane przez dostawcę — przetworzone za pomocą narzędzi leaderboardu, ale jeszcze nieuwzględnione w oficjalnej tabeli, która obejmuje również prywatne zestawy testowe. Opublikowany w karcie modelu podział na poszczególne zestawy warto przeczytać, ponieważ średnia wiele ukrywa: LS Clean 1,42%, LS Other 2,66%, SPGISpeech 3,18%, Voxpopuli-Cleaned-AA 4,88%, Earnings22-Cleaned-AA-chunked 6,69%, AMI-Cleaned 7,52% i Gigaspeech-Cleaned 8,67%, co daje średnią dokładnie 5,00%. Ta sama karta podaje średni RTFx na poziomie 13 042,98 zmierzony na jednym H200 — wyższy niż wartość 12 600 użyta w poście IBM z okazji premiery, a obie liczby pochodzą od tej samej firmy, z tego samego tygodnia, na tym samym sprzęcie.
Wynik 2,7% dla końcowego transkryptu w Grok Voice Transcribe 2.0 nie jest pomiarem porównywalnym. Pochodzi z tablicy AA-WER Streaming firmy Artificial Analysis — ważonego kompozytu AA-AgentTalk w 50%, VoxPopuli w 25% i Earnings22 w 25% — obejmującego około ośmiu godzin angielskiego audio konwersacyjnego ważonego pod kątem agenta, mierzonego przez interfejs strumieniowy. Inne zbiory danych, inne wagi, inny tryb działania. Stawianie 2,7% obok 5,00% i wyciąganie wniosku, że model zarządzany jest około dwa razy dokładniejszy, to najczęstszy błąd, jaki można popełnić w tym porównaniu.
To, co można uczciwie powiedzieć, jest węższe i wciąż użyteczne. Oba modele są mocne na dźwięku, na którym każdy z nich był mierzony. Grok Voice Transcribe 2.0 przewodzi niezależnie prowadzonej tablicy wyników dla strumieniowania, na której mierzone są również inne modele, co sprawia, że jego pozycja w rankingu jest weryfikowalna, nawet jeśli jego dokładna wartość nie jest przenośna. Granite Speech 5.0 470M TurboCTC ma zagregowany WER na standardowych otwartych zbiorach ASR oraz, osobno, wynik w warunkach dalekiego pola, gdzie niekomercyjny checkpoint zajmuje piąte miejsce pod względem dokładności, a ten na licencji Apache — dziewiąte — mierzony na mowie zaszumionej i pogłosowej, co jest najtrudniejszym warunkiem w zestawie i, jak można argumentować, najuczciwszą rzeczą w liczbach któregokolwiek z modeli.
Jeśli Twoje audio to czysty, czytany angielski, różnica w dokładności między tymi dwoma jest prawdopodobnie mniejsza, niż sugerują pozycje w rankingu. Jeśli jest zaszumione, z akcentem, telefoniczne lub nieangielskie, żadna z tabel nie mówi Ci wiele, a jedynym narzędziem, które to robi, jest Twój własny zbiór testowy.
Wolne ciężary kontra 1,67 dolara za godzinę
Porównanie kosztów to jedyne miejsce, w którym te dwa modele naprawdę łatwo rozróżnić, a liczba, na którą zwykle się powołują, jest błędna w obu kierunkach.
• Transkrypcja wsadowa — Grok Voice Transcribe 2.0 za 0,10 USD za godzinę audio, czyli około 1,67 USD za 1000 minut w porównaniu z Granite Speech 5.0 470M TurboCTC bez kosztów licencji, plus czas GPU
• Transmisja strumieniowa — 0,20 USD za godzinę audio, około 3,33 USD za 1000 minut w porównaniu z brakiem hostowanej ścieżki transmisji strumieniowej opublikowanej przez IBM
• Licencja — komercyjne API bez wag vs Apache 2.0 dla głównego checkpointu i CC-BY-NC-SA-4.0 dla dokładniejszego, niekomercyjnego modelu
Słowo „Free” odgrywa w tym pierwszym wierszu niemałą rolę. Model typu encoder-only z 470M parametrami jest wystarczająco mały, by działać na skromnym sprzęcie — taki jest zamysł tego projektu i powód, dla którego IBM wytrenował go w dziesięć dni na ośmiu H100 i wypuścił z myślą o `transformers>=5.16.0` oraz z demonstracją WebGPU — ale ktoś nadal płaci za GPU, stos serwowania, autoskalowanie, ponowienia i rotację dyżurów on-call. Przy małych wolumenach cena rozwiązania zarządzanego jest zwykle niższa niż koszt czasu inżynierów. Przy dużych, stabilnych wolumenach wygrywa ścieżka wynajmowanego sprzętu, a punkt przecięcia zależy od wykorzystania, a nie od wolumenu audio: GPU, które stale zajęte, jest tanie w przeliczeniu na godzinę, a takie, które trzymasz w gotowości na szczyt ruchu — już nie.
Jeden szczegół licencyjny warto podkreślić, zanim ktokolwiek zacznie opierać na nim architekturę. Dokładniejszy z dwóch checkpointów, ten z 4,85% WER, jest tym niekomercyjnym na licencji CC-BY-NC-SA-4.0. Checkpoint Apache 2.0 to ten z 5,00%, i to właśnie ten, który możesz dostarczać w produkcie. To różnica dokładności wynosząca 0,15 punktu w zamian za prawo do używania modelu w ogóle, a oznacza też, że każde porównanie, które podaje 4,85% dla „Granite Speech 5.0”, a następnie omawia wdrożenie komercyjne, podaje niewłaściwy checkpoint.

Reguła decyzyjna
Trzy pytania odróżniają te dwa modele szybciej niż jakakolwiek tabela benchmarków.
Czy transkrypcja jest wykorzystywana na żywo, gdy mówca jeszcze mówi? Jeśli tak, TurboCTC nie jest kandydatem — nie dlatego, że jest wolny, ale dlatego, że nie ma interfejsu strumieniowego ani częściowego wyniku, a częściowa transkrypcja to inne zobowiązanie architektoniczne niż szybkie dekodowanie wsadowe. Jeśli nie, przewaga przepustowości staje się całą historią i model IBM jest bardzo trudny do pobicia pod względem kosztu na godzinę przetworzonego dźwięku.
Czy praca wymaga słownictwa dziedzinowego? Jeśli tak, model z biasowaniem wygrywa domyślnie, a brak biasowania terminów kluczowych w TurboCTC jest dyskwalifikujący, a nie tylko niedogodny. Jeśli nie, płacisz za funkcję, której nie będziesz używać po stronie zarządzanej.
Czy audio to angielska mowa czytana na przyzwoitym sprzęcie? Jeśli tak, obie są mocne, a wybór dotyczy kwestii operacyjnych. Jeśli nie, obie płytki nie wnoszą informacji i liczy się tylko twoja własna ocena.
Jakkolwiek to się potoczy, to na warstwie operacyjnej ta decyzja staje się tania. OrcaRouter udostępnia ponad 200 modeli za jednym kluczem zgodnym z OpenAI, z automatycznym przełączaniem awaryjnym między dostawcami, dzięki czemu gorszy dzień zarządzanego punktu końcowego mowy w jednym regionie przestaje być twoją awarią, a ceny katalogowe dostawców są przekazywane z 0% marży — co oznacza, że zmiana ceny u dostawcy lub nowy checkpoint są dostępne po naszej stronie tego samego dnia. W przypadku obciążenia, w którym właściwa odpowiedź jest naprawdę niejasna, eliminuje to koszt błędu: porównaj oba rozwiązania na własnym audio za jednym punktem końcowym, zachowaj to, które wygrywa, i zmień ciąg modelu, gdy pojawi się następny.

W skrócie: Granite Speech 5.0 470M TurboCTC jest lepszą odpowiedzią na „transkrybuj wszystko, co kiedykolwiek nagraliśmy, tanio, na sprzęcie, który kontrolujemy”, a Grok Voice Transcribe 2.0 jest lepszą odpowiedzią na „transkrybuj to na bieżąco, dokładnie, bez konieczności utrzymywania przez nas stosu serwującego”. Nagłówek 12 600× i nagłówek 0,49 sekundy są oba prawdziwe i żaden z nich nie jest dowodem na drugi.
