
VibeVoice-ASR-Streaming-1.5B, wyjaśnienie: streamingowe ASR Microsoftu pojawiło się bez premiery
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0259Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0258Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0166Inteligencja82Kod
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
2 września 2026 r. Microsoft Research przesłał na Hugging Face dwa nowe punkty kontrolne do zamiany mowy na tekst, bez komunikatu prasowego, bez wpisu na blog i bez fanfar: microsoft/VibeVoice-ASR-Streaming-1.5B oraz jego większy odpowiednik microsoft/VibeVoice-ASR-Streaming-7B. Jedyne dotychczasowe ogłoszenie to wpis z datą 3 września 2026 r. w sekcji News repozytorium VibeVoice na GitHubie Microsoftu, opisujący wydanie jako ujednolicony strumieniowy model ASR, który podczas odbierania dźwięku transkrybuje, kto i co mówi, oraz obsługuje konfigurowalne hotwords i dziesięć języków. Oba punkty kontrolne są objęte licencją MIT, oba zostały utworzone na oficjalnym koncie microsoft na Hugging Face w odstępie około pięciu minut od siebie, a gdy sprawdziliśmy je dzień później, oba miały zero pobrań. Nie znaleźliśmy żadnych zewnętrznych doniesień o którymkolwiek z nich.
To czyni z tego niezwykły wpis: prawdziwe, dające się datować wydanie — wagi na Hugging Face z datą 2 września, ogłoszenie w repozytorium z datą 3 września — którego szerszy świat jeszcze nie dostrzegł. Wszystko poniżej, co da się ustalić, pochodzi z lektury repozytorium: plików konfiguracyjnych, karty modelu i własnej dokumentacji Microsoftu dotyczącej streamowania. Wszystko, co nie zostało jeszcze potwierdzone — dokładność, rzeczywiste opóźnienia, to, czy przypisywanie mówcy w streamie sprawdzi się w prawdziwej rozmowie dwóch osób — jest odpowiednio oznaczone. Nie ma żadnego benchmarku, który można by przytoczyć, ponieważ Microsoft nie opublikował jeszcze żadnego w formie tekstowej.
Jedynym ogłoszeniem jest linia informacyjna.
VibeVoice to rodzina otwartoźródłowych modeli mowy Microsoft Research na licencji MIT. Jej najbardziej znany model ASR, microsoft/VibeVoice-ASR, został wydany 21 stycznia 2026 roku jako model wsadowy, który w jednym przebiegu przyjmuje do sześćdziesięciu minut dźwięku i zwraca ustrukturyzowane transkrypcje z informacjami o mówcy, czasie i treści. Od tego czasu odnotowano około 700 000 pobrań w serwisie Hugging Face. 2 września ta sama organizacja opublikowała siostrzane modele strumieniowe, microsoft/VibeVoice-ASR-Streaming-7B i microsoft/VibeVoice-ASR-Streaming-1.5B; API Hugging Face podaje dla wersji 7B czas 2026-09-02T15:46 UTC, a dla wersji 1.5B pięć minut później, o 15:51 UTC. Tabela modeli w repozytorium GitHub zawiera teraz VibeVoice-ASR-Streaming jako osobną pozycję, a sekcja News zawiera ogłoszenie o nim z 3 września.
To, co jest rzeczywiście nowe w porównaniu z modelem ze stycznia, to model interakcji: przesyłane strumieniowo punkty kontrolne transkrybują na bieżąco, gdy napływa audio, zamiast czekać na kompletny plik. Cała reszta — leżąca u podstaw architektura tokenów mowy, wynik z przypisaniem mówcy, mechanizm hotwordów — to kontynuacja projektu wsadowego, przeskalowana i przekierowana na użycie w czasie rzeczywistym. Zwróć uwagę na różnicę językową na wstępie: model wsadowy reklamuje ponad 50 języków, podczas gdy karta strumieniowa wymienia dziesięć.

Co oznacza „streaming” w tym punkcie kontrolnym?
Dokumentacja Microsoftu dotycząca streamowania wprost opisuje intencję: model transkrybuje, gdy dźwięk wciąż jeszcze dociera, i emituje tekst po każdym fragmencie audio, dzięki czemu transkrypcja pojawia się w miarę mówienia mówcy. Plik preprocessor_config.json w repozytorium 1.5B nadaje temu rytmowi konkretną postać:
• Częstotliwość próbkowania i szybkość tokenów — wejście audio 24 kHz, skompresowane 3 200×, co daje strumień tokenów mowy o częstotliwości około 7,5 Hz (mniej więcej jeden token co 133 ms).
• Fragment — 22 ramki, co przy 7,5 Hz daje około 2,9 sekundy audio na wyemitowany segment.
• Lookahead — 4 klatki, około 0,5 sekundy przyszłego audio, używane do utrwalenia bieżącego segmentu.
(Z repozytorium wprost wynikają obliczenia: 22 × 3200 = 70 400 próbek ≈ 2,93 s przy 24 kHz; 4 × 3200 = 12 800 próbek ≈ 0,53 s. Dokumentacja Microsoftu zauważa, że punkt kontrolny zawsze działa na fragmencie, na którym był trenowany, więc tych wartości nie można regulować w czasie wnioskowania.)
To umieszcza to w rodzinie strumieniowania porcjowego, a nie słowo po słowie: transkrypcja na żywo rośnie mniej więcej co trzy sekundy, z około półsekundowym wyprzedzeniem, a nie w cząstkowych tokenach. Jest to uzasadniony i powszechny projekt dla transkrypcji spotkań i rozmów, ale charakteryzuje się innym profilem opóźnień niż systemy emitujące częściowe wyniki poniżej sekundy — więc traktuj „streaming” jak spektrum i zmierz go względem własnego budżetu opóźnień, zanim zbudujesz na nim produkt do napisów na żywo.
Pod maską: LLM mowy w skali Qwen
Odczytanie pliku config.json z punktu kontrolnego 1.5B daje dobrze znany przepis VibeVoice w mniejszej skali:
• Dekoder to model językowy z rodziny Qwen2, którego wymiary dokładnie odpowiadają klasie 1.5B Qwen2.5 — 28 warstw, 1536 ukrytych jednostek, 12 głów uwagi z 2 głowami klucz-wartość oraz okno 65 536 tokenów. To właśnie LLM pozwala modelowi przenosić rozumienie mówcy i treści na przestrzeni całego transkryptu.
• Akustyczne i semantyczne tokenizatory — głębokie konwolucyjne enkodery z krokami 8/5/5/4/2/2 — przekształcają audio 24 kHz w strumień tokenów mowy o częstotliwości ~7,5 Hz, który odczytuje dekoder.
• Głowa dyfuzyjna (DDPM, 20 kroków denoisingu, v-prediction) znajduje się po stronie generowania, co jest spójne z resztą linii VibeVoice.
• Uczciwie o rozmiarze: metadane safetensors samego checkpointu podają około 3 miliardów parametrów, czyli mniej więcej 5,6 GB wag. „1.5B” w nazwie oznacza skalę backbonu językowego — to naturalny odczyt konfiguracji, w której dekoder to model Qwen z klasy 1.5B — a resztę stanowią tokenizery audio i głowa dyfuzyjna. Ciąg architektury w konfiguracji, VibeVoiceForASRStreamingTraining, wskazuje, że jest to checkpoint z rodziny badawczej.

Kto co powiedział, w dziesięciu językach
Główną funkcją reklamowaną w karcie modelu jest strumieniowa transkrypcja z przypisaniem do mówcy: „w miarę napływania mowy na bieżąco transkrybuje, kto co powiedział”, jak głosi punkt w samej karcie. Model oferuje również niestandardowe hotwordy dla terminów branżowych oraz obsługuje dziesięć języków — chiński, angielski, francuski, niemiecki, włoski, japoński, koreański, portugalski, rosyjski i hiszpański.

Hotwords są implementowane za pomocą tego samego mechanizmu ukierunkowania kontekstowego, którego używa model wsadowy. W demonstracyjnym interfejsie wiersza poleceń firmy Microsoft przekazuje się je jako informację kontekstową — na przykład --context_info "Microsoft,VibeVoice" — aby skierować rozpoznawanie na nazwy własne i terminy techniczne bez żadnego dostrajania. Karta produktu nie wspomina o automatycznym wykrywaniu języka ani przełączaniu kodów dla modelu strumieniowego, co stanowi kolejną lukę w porównaniu z deklaracjami modelu wsadowego.
Jedno zastrzeżenie zasługuje na podkreślenie. Strona dokumentacji strumieniowej skupia się na emisji fragmentów i hotwords; nie opisuje, w jaki sposób atrybucja mówcy jest utrzymywana na granicach fragmentów. Strumieniowa diaryzacja jest naprawdę trudna — mówcy nakładają się na siebie, a granica fragmentu to właśnie miejsce, w którym atrybucja zaczyna dryfować. Ujęcie „kto co powiedział” na karcie to deklaracja sprzedawcy, dopóki ktoś nie przepuści przez nią prawdziwej rozmowy na żywo z dwoma mówcami i tego nie sprawdzi.
Gdzie to się sytuuje: rodzina VibeVoice a obszar streaming-ASR w 2026 roku.
W rodzinie wydanie plasuje się następująco:
• microsoft/VibeVoice-ASR (21 stycznia 2026) — flagowy model wsadowy: do 60 minut w jednym przejściu, ponad 50 języków, wyniki Who/When/What, hotwords, około 700 tys. pobrań.
• microsoft/VibeVoice-ASR-Streaming-7B oraz microsoft/VibeVoice-ASR-Streaming-1.5B (2 września 2026 r.) — nowe warianty strumieniowe; tematem tego artykułu jest wariant 1.5B.
• microsoft/VibeVoice-ASR-BitNet (23 lipca 2026) — skwantowany, zoptymalizowany pod CPU silnik brzegowy dla modelu wsadowego.
• Modele VibeVoice-1.5B TTS i VibeVoice-Realtime-0.5B streaming-TTS są osobnymi członkami tej samej rodziny, a nie częścią linii ASR.
Szersze pole ASR z otwartymi wagami przez cały rok przesuwało się w stronę przetwarzania w czasie rzeczywistym, więc nowy model strumieniowy ma bezpośrednie punkty porównania. Qwen3-ASR (Alibaba, ~1,7B) to ujednolicony model strumieniowy i offline obejmujący ponad 50 języków i dialektów. ASR Nemotron 3.5 firmy NVIDIA to model strumieniowy 0,6B obejmujący 40 języków, na licencji OpenMDW, a nie MIT. Granite Speech 5.0 470M TurboCTC firmy IBM jest na licencji Apache-2.0, z niezwykle wysokimi deklarowanymi przez producenta wartościami przepustowości. Na ich tle model strumieniowy Microsoftu wyróżnia się trzema cechami: licencją MIT, szkieletem LLM zapewniającym rozumienie mówcy i treści, a nie czystym modelem akustycznym, oraz formatem transkrypcji na żywo z przypisaniem wypowiedzi do mówcy. Otwartymi kwestiami pozostają dokładność i rzeczywiste opóźnienia — żadna z tych wartości nie doczekała się jeszcze niezależnych pomiarów.
Co nie zostało jeszcze zweryfikowane
Przeczytanie repozytorium ukazuje projekt; nie mówi jednak, jak dobrze działa. Konkretnie:
• Brak danych liczbowych dotyczących dokładności i opóźnienia w tekście. Karta modelu zawiera rysunek z wynikami w formie obrazu, ale w tekście nie ma numerycznych wartości WER, RTF ani tabeli opóźnień — nie ma czego zacytować niezależnie.
• Brak zewnętrznej oceny. Dzień po udostępnieniu pobrania wynosiły zero; nie ma benchmarku społeczności, wpisu w rankingu ani niezależnego testu, który moglibyśmy znaleźć.
• Ścieżka serwowania to badawcze środowisko uruchamiane ze źródeł. Dokumentacja strumieniowania Microsoftu uruchamiana jest z klonu repozytorium VibeVoice na GitHubie wewnątrz kontenera NVIDIA PyTorch (nvcr.io/nvidia/pytorch, z zalecanym flash-attention). Karta modelu pokazuje również fragment kodu wykorzystujący pipeline Transformers, a szczegóły instalacji odsyła do GitHuba; czy obecnie wydana wersja Transformers wykonuje na tym punkcie kontrolnym wnioskowanie strumieniowe bez dodatkowych zmian, nie zweryfikowaliśmy.
• Podejście jest zorientowane na badania. Repozytorium Microsoftu opisuje modele VibeVoice jako przeznaczone do celów badawczo-rozwojowych. Wagi są na licencji MIT; postawa jest taka: „oto nauka”, a nie „oto wspierany produkt”. Zarezerwuj budżet na własną bramkę ewaluacyjną.
Czy powinieneś na tym budować?
Dla zespołów, które już samodzielnie hostują ASR, to jest warte weekendowej ewaluacji, jeśli twoje nagrania audio mieszczą się w zestawie dziesięciu języków i konkretnie potrzebujesz transkrypcji na żywo z przypisaniem wypowiedzi do mówców, pochodzącej z modelu na licencji MIT. Zarezerwuj ~5,6 GB wag dla wersji 1.5B na GPU NVIDIA oraz instalację ze źródeł, i zaplanuj samodzielny pomiar dokładności na własnych nagraniach, zanim mu zaufasz.
Dla zespołów wdrażających dziś produkcyjny pipeline transkrypcji najbardziej rozważnym rozwiązaniem jest czekanie na: opublikowanie przez Microsoft wskaźników dokładności i opóźnień, które obecnie istnieją tylko w formie obrazu; niezależny benchmark; lub utrzymywaną ścieżkę serwowania ze wspieranym środowiskiem uruchomieniowym. To, że wyniki są zwracane w ~3-sekundowych porcjach, to także specyfikacja, którą należy skonfrontować z własnym wymaganiem dotyczącym opóźnienia, zamiast z góry zakładać, że jest ono spełnione na podstawie słowa „streaming”.
Najtańszy sposób na pozostawienie otwartej furtki to unikanie sztywnego podpinania aplikacji pod jeden silnik transkrypcji. Warstwa routingu, która udostępnia wiele modeli przez jedno API, sprawia, że gdy VibeVoice-ASR-Streaming — albo kolejny otwarty system ASR — pojawi się u dostawcy inferencji, przetestowanie go metodą A/B względem dotychczasowego modelu na tym samym ruchu to zmiana konfiguracji, a nie przebudowa platformy. Ponieważ router pass-through pobiera opłatę według cennika dostawcy, bez marży, takie porównanie pozostaje tanie, a automatyczne przełączanie awaryjne sprawia, że młody, niesprawdzony model nie staje się pojedynczym punktem awarii w potoku. To ogólny wzorzec postępowania przy wdrażaniu każdego świeżego modelu: pozwól mu zapracować na miejsce w obsłudze prawdziwego ruchu, zanim powierzysz mu produkcję.
Często zadawane pytania
Czy VibeVoice-ASR-Streaming-1.5B to faktyczne wydanie Microsoftu?
Tak. Checkpoint znajduje się na oficjalnym koncie microsoft w serwisie Hugging Face z datą utworzenia 2 września 2026 r., a repozytorium microsoft/VibeVoice w serwisie GitHub wymienia VibeVoice-ASR-Streaming w swojej tabeli modeli, z wpisem datowanym na 3 września 2026 r. Co niezwykłe, to nie pochodzenie, ale cisza: żadnego komunikatu prasowego, żadnego wpisu na blogu i żadnych doniesień zewnętrznych w chwili pisania tego tekstu.
Dlaczego dwa rozmiary, 7B i 1.5B?
Microsoft przesłał oba checkpointy w tej samej minucie, ale nie opublikował porównania. Z konfiguracji wynika, że 1.5B to mniejszy wariant — językowa baza Qwen klasy 1.5B plus warstwa audio, około 3B parametrów i ~5,6 GB wag. Naturalna interpretacja jest taka, że 7B oferuje wyższą dokładność, a 1.5B jest tańszy i szybszy, ale Microsoft tego nie potwierdził i nie ma benchmarków, które potwierdzałyby ten kompromis.
Czym to się różni od wcześniejszego VibeVoice-ASR?
Model ze styczniowej partii przetwarza do 60 minut audio w jednym przebiegu i oferuje obsługę ponad 50 języków. Strumieniowe punkty kontrolne transkrybują audio w trakcie jego docierania, generując transkrypt w około 3-sekundowych fragmentach z około 0,5 sekundy wyprzedzenia, a karta modelu wymienia dziesięć języków. Oba dzielą tę samą architekturę tokenów mowy, koncepcję wyników przypisanych mówcy oraz mechanizm słów wyzwalających.
Na razie VibeVoice-ASR-Streaming-1.5B to checkpoint i wpis w aktualnościach. Jeśli hostujesz model u siebie i potrzebujesz strumieniowego ASR na liberalnej licencji do oceny, zajrzyj do repozytorium; jeśli wybierasz silnik produkcyjny, poczekaj na liczby. Najciekawszy sygnał jest taki, że Microsoft jednocześnie w dwóch rozmiarach popycha swoją linię głosową ku czasowi rzeczywistemu — i zrobił to tak cicho, że dzień później licznik pobrań wciąż wskazywał zero.
