Karta hero z tytułem porównującym 'VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo', z nadtytułem 'Open-weights ASR – wrz 2026', podtytułem o treści: streamingowy checkpoint Microsoftu kontra domyślny model open-weights – co daje streaming i ile kosztuje wybór 0,8B zamiast 9B parametrów, plakietkami 'wagi MIT – 2 wrz', 'wagi MIT – 2024' i 'Whisper: 99 języków', a także przypisem 'Rekord Whispera jest publiczny'. Logo OrcaRouter umieszczono w prawym dolnym rogu.
Guides & Insights

VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo: Co strumieniowy checkpoint Microsoftu wnosi do domyślnego modelu open-weight

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Przez większość ostatnich dwóch lat odpowiedzią na „przetranskrybujemy to sami, tanio” był Whisper Large v3 Turbo — model OpenAI o otwartych wagach z 809 milionami parametrów, licencjonowany na MIT, obsługujący 99 języków, na tyle lekki, by działać na stacji roboczej, i darmowy, gdy tylko ma się własny sprzęt. 2 września 2026 roku Microsoft Research wystawił pretędenta do tej domyślnej opcji: VibeVoice-ASR-Streaming-7B, punkt kontrolny do strumieniowego rozpoznawania mowy o licencji MIT na Hugging Face, który transkrybuje na bieżąco w miarę napływu audio, deklaruje przypisywanie wypowiedzi do mówców i — inaczej niż model, który większość zespołów już uruchamia — nigdy nie był projektowany jako zadanie wsadowe. Oba modele mają otwarte wagi pochodzące z dużych laboratoriów. Niemal wszystko inne w ich przypadku to kompromis, a ta strona traktuje o tym, na który kompromis tak naprawdę się decydujesz.

Jedna asymetria kształtuje całe porównanie, więc pojawia się na początku. Whisper Large v3 Turbo to najbardziej niezależnie reprodukowany model rozpoznawania mowy na świecie: jego wskaźniki błędów słownych były przez lata ponownie wyliczane przez tysiące zespołów na publicznych benchmarkach i ich własnych nagraniach, a jego słabe strony są udokumentowane równie dobrze jak mocne. VibeVoice-ASR-Streaming-7B ma jeden dzień, nie ma żadnego niezależnego benchmarku, a Microsoft nie opublikował strumieniowego wskaźnika błędów słownych w czytelnym tekście. Wszystko poniżej po stronie Microsoftu pochodzi z repozytorium — konfiguracji, karty modelu i dokumentacji streamingu Microsoftu — i jest tak oznaczone.

Open-weights jako domyślna opcja i dlaczego się utrzymuje

Whisper Large v3 Turbo jest destylowanym odpowiednikiem Whisper Large v3: zachowuje 32-warstwowy enkoder i redukuje dekoder z 32 warstw do czterech, dzięki czemu liczba parametrów spada do 809M, a przepustowość na GPU wzrasta mniej więcej czterokrotnie, pozostając przy tym blisko pod względem dokładności. Ponieważ wagi są na licencji MIT, a model jest mały, stał się domyślnym wbudowanym silnikiem transkrypcji dla botów spotkań, narzędzi do napisów i potoków rejestrowania rozmów. Jego ograniczenia są równie dobrze znane. To model wsadowy — przyjmuje plik audio i zwraca transkrypt, zamiast generować słowa w czasie ich wypowiadania. Nie był trenowany do tłumaczenia, a to zadanie wykonuje bardzo słabo. Jego dokładność w przypadku mowy zaszumionej, z akcentem lub nakładającej się jest nierówna, a zwraca zwykły tekst: domyślnie bez interpunkcji i wielkich liter, bez diarizacji mówców, bez znaczników czasowych w tym wariancie, bez korygowania preferencji słów. Systemy produkcyjne zbudowane na Whisper składają te elementy osobno, a każdy z nich dodaje własne opóźnienia i sposoby awarii.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

Luka w specyfikacji

• Parametry — 809M (destylowany dekoder) w porównaniu z około 9B łącznie (backbone językowy Qwen2-7B plus enkodery mowy; „7B” odnosi się do LLM, a strona Hugging Face podaje 9B).

• Licencja — MIT, otwarte wagi, obie.

• Strumieniowanie — z założenia wsadowe: samodzielnie hostowane implementacje strumieniowania zwykle osiągają opóźnienie 1–5 sekund, podczas gdy implementacje natywnie strumieniowe zapewniają ~2,9-sekundowe fragmenty z ~0,5-sekundowym wyprzedzeniem, tekst emitowany fragmentami i kontekst przechowywany w pamięci podręcznej KV.

• Języki — 99 z wieloletnią reprodukcją przez społeczność vs deklarowane 10 (en, zh, es, pt, de, ja, ko, fr, ru, it).

• Poza transkryptem — domyślnie brak, w przeciwieństwie do deklarowanego strumieniowego wyjścia „kto co powiedział” i spersonalizowanych hotwordów (niezweryfikowane).

• Dokładność w publikacjach — 2,1% WER na LibriSpeech test-clean, 4,2% na test-other, ~7,7% na Open ASR composite, 8–12% na zaszumionym audio w testach społeczności — wszystko niezależnie odtworzone, podczas gdy dla trybu strumieniowego nie opublikowano żadnego wskaźnika WER w formie tekstowej.

• Wymagania pamięciowe — działa na laptopie lub pojedynczym GPU o umiarkowanej mocy, w porównaniu z ok. 18 GB wag bf16 przed pamięcią podręczną KV; przygotuj się na GPU klasy 24 GB.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): parameters - about 9B (Qwen2-7B + encoders); streaming - native, ~2.9 s chunks; WER in print - none in text; output extras - claimed speaker IDs + hotwords; languages - 10 declared; hardware - ~18 GB bf16, 24 GB-class GPU. Right column Whisper Large v3 Turbo (open weights, released 2024): 809M distilled; batch, 1-5 s self-host streaming; 2.1% / 4.2% LibriSpeech, ~7.7% Open ASR; none by default; 99; laptop to small GPU. Footer: 'Whisper WER independently reproduced. VibeVoice specs read from the HF repo; no benchmark exists yet.'

Co tak naprawdę daje streaming

Powodem, dla którego w ogóle warto wyjść poza Whisper Large v3 Turbo, jest ścieżka na żywo — i właśnie w tym miejscu oba modele przestają być porównywalne. Whisper jest nastawiony na przetwarzanie wsadowe: aby uzyskiwać słowa, podczas gdy mówca wciąż mówi, zespoły muszą dobudować dzielenie na fragmenty, detekcję aktywności głosowej i kod sklejający, a samodzielnie hostowane implementacje strumieniowe osiągają zwykle opóźnienie od jednej do pięciu sekund — co bez poważnej inżynierii oznacza nieosiągnięcie progu poniżej sekundy dla agentów telefonicznych i napisów na żywo. VibeVoice-ASR-Streaming-7B został zbudowany właśnie z myślą o tej ścieżce. Jego konfiguracja pokazuje dźwięk skompresowany 3200× do strumienia tokenów o szybkości 7,5 klatki na sekundę, przetwarzanego we fragmentach po 22 klatki z wyprzedzeniem czterech klatek — około 2,9 sekundy dźwięku na fragment — przy czym tekst jest emitowany po przetworzeniu każdego fragmentu, a wcześniejszy kontekst jest przenoszony w pamięci podręcznej KV, dzięki czemu sesja nie zaczyna obliczeń od zera. To tempo jest rozwiązaniem projektowym wywiedzionym z konfiguracji, a nie zmierzonym opóźnieniem — nikt jeszcze nie opublikował dla niego pomiaru end-to-end — jednak architektura ta jest w sposób jednoznaczny architekturą transkrypcji na żywo, czego nie można powiedzieć o Whisperze.

Historia Whispera jest długa i publiczna; nowego checkpointu — pusta.

Dokładność to obszar, w którym wiek Whisper Large v3 Turbo jest atutem. Jego 2,1% WER na LibriSpeech test-clean i 4,2% na test-other to wyniki o otwartych wagach, odtworzone przez niezliczone zespoły; jego około 7,7% w zbiorczym rankingu Open ASR plasuje się o około punkt za pełnym Large v3; a jego udokumentowane 8–12% na zaszumionym audio w testach społeczności sprawia, że nikogo to nie zaskakuje. Te słabości są częścią udokumentowanej historii — mówią ci dokładnie, gdzie model potrzebuje pomocy, zanim na nim zbudujesz.

VibeVoice-ASR-Streaming-7B nie ma takiego udokumentowanego dorobku. Na karcie tego modelu wykres ewaluacyjny jest zamieszczony jako obrazek, a raport techniczny Microsoftu o streamingu to plik PDF, ale w tekście nie ma żadnego możliwego do zacytowania współczynnika błędów słów dla trybu strumieniowego. Jedynym liczbowym punktem odniesienia w rodzinie jest tabela dostawcy na karcie modelu wsadowego VibeVoice-ASR — średni WER 7,77% w ośmiu angielskich zestawach testowych i 2,20% na LibriSpeech clean — co nie jest wynikiem tego checkpointu, a sam model wsadowy ma w społeczności mieszany odbiór: chwalony za gotową od ręki diarizację, krytykowany jako ciężki i czasem podatny na halucynacje. Nic z tego nie przenosi się na model strumieniowy i właśnie o to chodzi: z Whisper z góry znasz tryby awarii; z VibeVoice-ASR-Streaming-7B jesteś pierwszym testerem.

Języki i rozmiar: 99 kontra 10, 0,8 mld kontra 9 mld

Dwa najbardziej konkretne koszty przejścia to języki i rozmiar. Whisper Large v3 Turbo obsługuje transkrypcję w 99 językach; w językach niskozasobowych i tonalnych jakość spada — tajski, kantoński i walijski to najczęściej wymieniane słabe punkty — ale lista ma za sobą lata weryfikacji przez społeczność. VibeVoice-ASR-Streaming-7B deklaruje dziesięć języków: angielski, chiński, hiszpański, portugalski, niemiecki, japoński, koreański, francuski, rosyjski i włoski. Jeśli twój ruch mieści się w tych dziesięciu językach, pokrycie językowe nie jest problemem; w przeciwnym razie porównanie kończy się tutaj. Rozmiar to drugi koszt: model o 809 mln parametrów można uruchomić na laptopie, podczas gdy model o łącznej liczbie ok. 9 mld parametrów w bf16 potrzebuje ok. 18 GB wag przed doliczeniem pamięci podręcznej KV i GPU klasy 24 GB, by działać komfortowo. Dla zespołów, które już uruchamiają Whispera na skromnym sprzęcie, to wyraźny wzrost wymagań infrastrukturalnych, uzasadniony wyłącznie realną potrzebą transkrypcji na żywo.

Kiedy darmowość nie jest sednem

Whisper Large v3 Turbo można uruchamiać za darmo; kosztem jest sprzęt i inżynieria wokół niego. Wdrożenie faster-whisper na pojedynczym T4 kosztuje rzędu 0,05–0,10 USD za godzinę materiału audio przy aktualnej stawce za GPU, a przy ciągłym obciążeniu dochodzi do tego stos diaryzacji i interpunkcji, który trzeba zbudować, bo Whisper zwraca zwykły tekst. VibeVoice-ASR-Streaming-7B również można uruchomić za darmo — na droższym sprzęcie — w zamian otrzymując architekturę strumieniową zapewniającą przypisywanie mówców i kontrolę kontekstu, których Whisperowi brakuje. To jednak zapewnienia, które musisz zweryfikować samodzielnie, bo nie istnieje żaden niezależny benchmark. Do transkrypcji wsadowej na dużą skalę wydajność Whispera i jego niewielkie wymagania wciąż wygrywają. Przy audio na żywo od wielu mówców, gdy transkrypt musi powstawać w trakcie rozmowy, Whisper działa wbrew swojej konstrukcji, a checkpoint strumieniowy — o ile w ogóle działa — zgodnie z nią; to właśnie trzeba sprawdzić na własnym materiale audio i własnym GPU.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

Pragmatyczny stos

W praktyce najczęściej spotykana odpowiedź to nie „albo-albo”, lecz „jedno i drugie” — i taka jest właśnie rekomendacja: zachować Whisper Large v3 Turbo jako wysokowolumenowy kanał wsadowy, na którym jego osiągi i zajętość zasobów czynią go bezkonkurencyjnym, a VibeVoice-ASR-Streaming-7B poddać ocenie na kanale na żywo, którego Whisper nie obsłuży przy wymaganym opóźnieniu — z wyraźną bramką ewaluacyjną, bo nie ma żadnego benchmarku, na którym można by się oprzeć. Oba modele mogą współdzielić jeden budżet GPU i jedną bazę kodu. Warstwa routingu w tym stosie opłaca się jednak nie w samej transkrypcji, lecz w warstwie ponad transkryptami: OrcaRouter nie obsługuje dziś routingu zamiany mowy na tekst i żaden z tych modeli nie jest w jego katalogu, ale moduły streszczające, reguły alertów i agenty planujące, które korzystają z transkryptu na żywo, to dokładnie te 200+ modeli językowych, które OrcaRouter wystawia przez jedno API, po cenach katalogowych dostawców, bez marży, z automatycznym przełączaniem awaryjnym między dostawcami. Streamingowy checkpoint, który trafia do użytkowników bez ani jednego benchmarku, zasługuje na takie samo traktowanie jak każdy niesprawdzony model — na wycinek prawdziwego ruchu za mechanizmem awaryjnym, gdzie zdobywa lub traci Twoje zaufanie na podstawie dowodów z Twoich własnych spotkań, a nie karty modelu.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube