Wygenerowana karta hero z tytułem 'VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC: dwóch cichych faworytów streamingu open-weights', podtytułem 'Dwa streamujące modele ASR open-weights, osiem dni różnicy', dwiema kartami modeli — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 września 2026 · MIT · ~3B łącznie · speech LLM) oraz Granite Speech 5.0 470M TurboCTC (IBM · 25 sierpnia 2026 · Apache-2.0 · 470M · czysty enkoder CTC) — oraz tagami: 'Szybkość klasy edge (IBM)', 'Tylko angielski (IBM)' oraz 'Kto mówił co w 10 językach (Microsoft, niezweryfikowane)'. Logo OrcaRouter zostało umieszczone w prawym dolnym rogu.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC: dwa niepozorne typy wśród streamingowych modeli open-weights

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa najciekawsze wydania modeli o otwartych wagach (open-weights) do strumieniowej transkrypcji mowy na tekst z końca sierpnia 2026 roku ukazały się bez wydarzenia premierowego. 25 sierpnia IBM umieścił na Hugging Face model Granite Speech 5.0 470M TurboCTC — wagi, kartę modelu i wpis na blogu, nic więcej — a 2 września Microsoft Research wgrał VibeVoice-ASR-Streaming-1.5B do przestrzeni nazw microsoft, nie ogłaszając tego w żaden sposób poza notką w swoim repozytorium VibeVoice na GitHubie. To ten sam kształt rzeczy, ale przeciwstawne zakłady inżynieryjne: model IBM-a to czysty enkoder CTC o 470 milionach parametrów, zaprojektowany do pracy na laptopie z prędkościami klasy edge; model Microsoftu to natomiast model językowy mowy z klasy 1.5B, opakowany w tokenizatory audio i głowę dyfuzyjną — łącznie około trzech miliardów parametrów — zbudowany tak, aby rozumieć mowę jako język podczas transkrypcji.

Przed liczbami znajdują się etykiety źródłowe, które zapewniają uczciwość tego zestawienia. Wszystko oznaczone jako IBM-reported pochodzi z karty modelu Granite Speech 5.0 470M TurboCTC i jego wpisów na liście liderów Open ASR, uruchomionych przez oficjalny harness firmy IBM w dniu premiery i dotychczas niezweryfikowanych niezależnie. Wszystko dotyczące VibeVoice-ASR-Streaming-1.5B pochodzi z przeczytania repozytorium — plików konfiguracyjnych, karty modelu i dokumentacji strumieniowej Microsoftu — ponieważ Microsoft nie opublikował żadnych liczb dotyczących dokładności ani opóźnień w tekście i nikt poza Microsoftem nie testował tego checkpointu. Oba modele nie były uruchamiane we wspólnym harnessie; to porównanie odnosi oba do tych samych publicznych dowodów, które są jedynymi informacjami, jakie którakolwiek z tych firm dotychczas udostępniła.

Dwa ciche wydania, w odstępie ośmiu dni

Oba modele pojawiły się w ten sam bezceremonialny sposób, co warto powiedzieć wprost, bo żadna z firm nie powiedziała od tego czasu zbyt wiele. Granite Speech 5.0 470M TurboCTC IBM to wariant Apache-2.0 dwuwariantowej premiery — IBM opublikował także niekomercyjnego bliźniaka -NC z nieco lepszymi głównymi wskaźnikami — a na jego karcie widnieje data wydania 25 sierpnia 2026 r., natywna obsługa Transformers i zgłoszenie do rankingu Open ASR z tego samego dnia. Strumieniowa para Microsoftu, VibeVoice-ASR-Streaming-7B i VibeVoice-ASR-Streaming-1.5B, powstała na Hugging Face w tej samej minucie 2 września; ogłoszenie na GitHubie o „ujednoliconym strumieniowym modelu ASR, który na bieżąco transkrybuje, kto co mówi, w miarę napływania mowy” jest datowane na 3 września i wymienia wersję 7B, pozostawiając opisywaną tutaj 1.5B jako mniejsze rodzeństwo, które wypuszczono po cichu obok niej.

Co ciekawe, dwa zespoły sięgnęły po słowo „streaming” i zbudowały przeciwstawne rzeczy. Granite Speech 5.0 470M TurboCTC to enkoder Conformer trenowany przy użyciu CTC i dekodowany w jednym nieautoregresywnym przebiegu — nie ma dekodera generującego tekst token po tokenie, więc model jest strukturalnie tani i strukturalnie szybki. VibeVoice-ASR-Streaming-1.5B to LLM do mowy: dwa konwolucyjne tokenizatory przekształcają audio 24 kHz w strumień tokenów mowy o częstotliwości ~7,5 Hz, dekoder z rodziny Qwen2 (28 warstw, 1536 ukrytych jednostek — klasa 1.5B) go odczytuje, a głowa dyfuzyjna generuje transkrypcję we fragmentach obejmujących około 2,9 sekundy dźwięku, z mniej więcej półsekundowym wyprzedzeniem. Jeden to samochód wyścigowy; drugi to mały model językowy, który akurat słucha.

Sprawdzenie specyfikacji

Parametry — Granite Speech 5.0 470M TurboCTC: 470M, architektura wyłącznie z enkoderem, w porównaniu z VibeVoice-ASR-Streaming-1.5B: ~3B łącznie (rdzeń LM klasy 1.5B plus tokenizatory i głowica dyfuzyjna).

• Architektura — enkoder Conformer z blokową samouwągią i samowarunkowaniem, trenowany CTC, zachłanne nieautoregresyjne dekodowanie w porównaniu z podwójnymi tokenizatorami akustyczno-semantycznymi zasilającymi przyczynowy dekoder z rodziny Qwen2 z głowicą dyfuzyjną DDPM.

• Kadencja wyjściowa — ~12,5 klatek wyjściowych na sekundę, strumieniowane fragmentami vs ~7,5 Hz tokenów mowy, emisja tekstu co ~2,9-sekundowy fragment z ~0,5 s wyprzedzeniem.

• Języki — tylko angielski kontra dziesięć: chiński, angielski, francuski, niemiecki, włoski, japoński, koreański, portugalski, rosyjski i hiszpański.

• Wagi — około 0,5 mld parametrów / ułamek GB, klasa edge vs ~5,6 GB bf16, klasa GPU NVIDIA.

• Dokładność w druku — IBM podał średnią WER ~5.00% na zestawach krótkich form Open ASR, podczas gdy w tekście nie opublikowano żadnej wartości WER.

• Licencja — Apache-2.0 vs MIT.

• Wydano — 25 sierpnia 2026 r. vs 2 września 2026 r.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total / 1.5B-class LM, Architecture speech LLM + diffusion, Languages 10, Streaming ~2.9 s chunks + ~0.5 s lookahead, WER none published, License MIT. Right column Granite Speech 5.0 470M TurboCTC: Released Aug 25 2026, Params 470M, Architecture conformer CTC, Languages English only, Streaming chunkwise ~12.5 frames/s, WER ~5.00% (IBM-reported), License Apache-2.0. Footer reads 'Granite figures IBM-reported, unverified; VibeVoice specs read from the HF repo; no independent benchmark of either exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

Szybkość: jeden został zbudowany tak, aby był mały, a drugi, aby był modelem językowym.

Architektoniczny podział uwidacznia się najpierw w szybkości i sprzęcie. Granite Speech 5.0 470M TurboCTC jest kierowany do laptopów, smartfonów i innych urządzeń brzegowych. Ponieważ czysty enkoder CTC niczego nie próbkuje — wynik jest pojedynczym zachłannym przejściem przez nagłówek BPE o 16 384 jednostkach — jego uruchomienie jest niezwykle tanie, a karta modelu IBM podaje przepustowość Open ASR zmierzoną na pojedynczym układzie H200, która dla linii TurboCTC wynosi dziesiątki tysięcy RTFx, wraz z demonstracją WebGPU, która transkrybuje na żywo w karcie przeglądarki. Te wartości są zmierzone przez IBM i niepowtórzone, ale sedno strukturalne broni się samo: enkoder 470M bez autoregresyjnego dekodera to model, który można uruchomić na sprzęcie, w który wyposażony jest telefon.

VibeVoice-ASR-Streaming-1.5B przyjmuje odwrotny kompromis. Jego dekoder to przyczynowy model językowy, co oznacza, że tekst jest generowany w cięższej pętli niż argmax CTC, a udokumentowane sposoby uruchamiania go to samodzielne hostowanie na kartach NVIDIA — dema w Pythonie z repozytorium microsoft/VibeVoice lub jego wtyczka do vLLM — z wagami bf16 o wielkości około 5,6 GB, zanim jeszcze dojdzie do jakiegokolwiek cache KV. Microsoft nie opublikował żadnych danych o przepustowości ani współczynniku rzeczywistego czasu, więc nie ma liczby od producenta, którą można by zestawić z tą od IBM. To, co architektura LLM daje w zamian, to kontekst: model przenosi rozumienie mówcy i treści przez cały zapis transkrypcji tak, jak robi to model językowy, a to jest różnica między transkrybowaniem dźwięku a śledzeniem rozmowy.

Dokładność: jeden sprzedawca wydrukował liczby, a drugi obrazek.

Na podstawie dostępnych dowodów Granite Speech 5.0 470M TurboCTC wyprzedza VibeVoice-ASR-Streaming-1.5B o cały publikowalny benchmark. IBM przetestował swój model za pomocą oficjalnej platformy testowej Open ASR leaderboard w dniu premiery i raportuje średni współczynnik błędów słownych (WER) na poziomie około 5,00% na publicznych angielskich zestawach krótkich wypowiedzi — wartość zmierzoną przez dostawcę, niezweryfikowaną przez żadną stronę trzecią i całkowicie nieobecną po stronie Microsoftu w tym porównaniu. Karta modelu VibeVoice-ASR-Streaming-1.5B zawiera grafikę z wynikami ewaluacji, ale nie zawiera w tekście liczbowych wartości WER, RTF ani opóźnienia; jedynym liczbowym punktem odniesienia w rodzinie VibeVoice jest raportowany przez dostawcę średni WER 7,77% dla ośmiu angielskich zestawów testowych, pochodzący z karty modelu wsadowego VibeVoice-ASR, który dotyczy modelu niestrumieniowego i nie przenosi się na model strumieniowy. Jakkolwiek potoczą się przyszłe niezależne testy, uczciwe podsumowanie na dziś jest takie: IBM opublikował liczbę, a Microsoft opublikował obrazek.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Języki i wyniki: wyłącznie angielski a to, kto co powiedział, w dziesięciu

Granite Speech 5.0 470M TurboCTC jest przeznaczony wyłącznie do języka angielskiego i zwraca surowy tekst transkrypcji. To nie jest wada w przypadku zastosowań, do których celuje IBM — transkrypcja angielskiej mowy biznesowej na urządzeniach brzegowych — ale kończy porównanie w momencie, gdy audio nie jest po angielsku. VibeVoice-ASR-Streaming-1.5B wymienia dziesięć języków i deklaruje streamingowe wyjście z przypisaniem wypowiedzi do mówców: karta modelu mówi, że „w sposób ciągły transkrybuje, kto powiedział co, w miarę napływu mowy", z hotwordami dla terminów dziedzinowych przekazywanymi jako prompt kontekstowy. Obie te dodatkowe funkcje zasługują na sceptyczne odczytanie — streamingowa diarizacja na granicach fragmentów jest naprawdę trudna, a to twierdzenie pozostaje niezweryfikowane — ale to właśnie one są powodem, dla którego zespół pracujący nad transkrypcją na żywo ze spotkań wielojęzycznych w ogóle zainteresowałby się modelem Microsoftu.

Licencjonowanie i ekosystem: Apache-2.0 kontra MIT, Transformers kontra repozytorium badawcze

Obie licencje pozwalają na użycie komercyjne, co już odróżnia tę parę od własnego wariantu -NC tej samej architektury firmy IBM. Granite Speech 5.0 470M TurboCTC jest na licencji Apache-2.0 ze zwykłym przyznaniem patentów i jest natywnie obsługiwany w Hugging Face Transformers (AutoModelForCTC z transformers >= 5.16) oraz mlx-audio dla Apple Silicon — co oznacza, że działa wszędzie tam, gdzie działa największa społeczność wdrożeniowa w ekosystemie, na sprzęcie dowolnego dostawcy. VibeVoice-ASR-Streaming-1.5B jest na licencji MIT, która jest jeszcze prostsza, ale jego ścieżka serwowania to badawcza konfiguracja ze źródeł: klasa architektury punktu kontrolnego, VibeVoiceForASRStreamingTraining, nie występuje w publicznej dokumentacji Transformers, a dokumentacja strumieniowa Microsoftu wskazuje na kod demo w repozytorium i wtyczkę do vLLM, a nie na standardowe ładowanie z biblioteki. Dla zespołu produkcyjnego różnica jest realna: jeden model wkomponowuje się w istniejący potok Transformers już dziś, a drugi wymaga postawienia repozytorium badawczego i samodzielnego zweryfikowania ścieżki ładowania.

A screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the model title Granite-Speech-5.0-470M-TurboCTC, the Apache-2.0 license tag, the English-language tag, the automatic-speech-recognition pipeline tag, and the model summary describing a compact 470 million parameter English ASR model for edge deployment.

Którą cichą wersję powinieneś ocenić?

Przede wszystkim rozważ Granite Speech 5.0 470M TurboCTC, jeśli Twoje obciążenie jest w języku angielskim, sprzęt jest klasy edge lub ograniczony wydajnością CPU, a Ty szukasz modelu, który można od razu użyć w Transformers i który ma na karcie liczbę do sanity-check. To bezpieczniejszy wybór pod każdym względem poza jednym — nie pomoże Ci w drugim języku ani przy transkrypcji spotkania na żywo, w której trzeba rozpoznać, kto mówi.

Oceń VibeVoice-ASR-Streaming-1.5B, jeśli potrzebujesz wielojęzycznego strumieniowania, jeśli chcesz przetestować funkcje takie jak informacja o tym, kto co powiedział, lub hotwords, albo jeśli wolisz postawić na podejście do mowy oparte na modelu językowym niż na czystym enkoderze. Zarezerwuj budżet na kartę NVIDIA GPU, instalację ze źródeł, ~5,6 GB wag oraz ewaluację według własnego projektu, ponieważ nikt – w tym Microsoft – nie opublikował jeszcze liczby, na której można polegać.

To, czego nie zmienia żadne z dwóch cichych wydań, to wartość utrzymywania warstwy ASR w gotowości do podmiany w trakcie sprawdzania, który zakład się opłaca. Oba modele są młode i żaden z nich nie jest obecnie dostępny przez OrcaRouter; gdy dostawca zacznie hostować którykolwiek z nich, niskoryzykownym sposobem na jego przetestowanie jest umieszczenie go za warstwą routingu, która obsługuje ponad 200 modeli po cenie katalogowej dostawcy — 0% narzutu, więc zmiany cen wchodzą w życie tego samego dnia — z automatycznym przełączaniem awaryjnym na to, czemu już ufasz. Skieruj fragment rzeczywistego audio do nowego modelu, przeczytaj transkrypcje i pozwól, aby to Twój własny ruch, a nie arkusz benchmarków z dnia premiery, zadecydował, który cichy zakład był trafny.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube