
VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe: Dwóch streamingowych pretendentów w odstępie jednego dnia
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
W ciągu mniej więcej trzydziestu sześciu godzin na początku września 2026 roku dwa duże laboratoria wypuściły modele strumieniowej zamiany mowy na tekst, które składają tę samą obietnicę nagłówkową — transkrypcję na żywo, która także mówi, kto co powiedział, w trakcie wypowiadania słów. 1 września Meta Superintelligence Labs udostępniło Muse Voice Transcribe jako hostowane API w cenie 3,00 USD za 1000 minut audio, czyli około 0,18 USD za godzinę, ze strumieniowym rozpoznawaniem, diarizacją ponad 20 mówców i wykrywaniem końca wypowiedzi w jednym przebiegu. 2 września Microsoft Research wgrało VibeVoice-ASR-Streaming-7B do Hugging Face: otwarte wagi na licencji MIT, bez ogłoszenia, karta modelu, która deklaruje strumieniową transkrypcję z przypisaniem do mówcy, z hotwordami i dziesięcioma językami, i nigdzie żadnego hostowanego środowiska. Ten sam przekaz, przeciwstawne modele biznesowe i dowody po obu stronach, które są cieńsze, niż którekolwiek laboratorium chciałoby, żebyś zauważył.
Ta strona jest napisana w formie „co wiemy na razie”, ponieważ żaden z modeli nie ma niezależnie zweryfikowanej wartości dokładności. Liczby Muse Voice Transcribe to deklaracje Meta z dnia premiery — podane przez dostawcę i niezweryfikowane; VibeVoice-ASR-Streaming-7B w ogóle nie opublikował żadnej wartości dokładności przetwarzania strumieniowego w formie tekstowej. Poniższe porównanie opiera się zatem na tym, co strukturalne i możliwe do ustalenia — architekturze, cenie, licencji, udokumentowanym zachowaniu — i oznacza nieliczne liczby pochodzące od dostawców tam, gdzie się pojawiają.
Dwóch konkurentów potoku wsadowego, w odstępie jednego dnia.
Oba modele atakują to samo założenie: że zamiana mowy na tekst to coś, co uruchamia się na gotowym nagraniu. Muse Voice Transcribe to pierwszy produkt, który Meta nazywa „modelem percepcji audio w czasie rzeczywistym” — jeden strumieniowy przebieg, który zajmuje się rozpoznawaniem, diarizacją mówców dla ponad dwudziestu głosów oraz wykrywaniem końca wypowiedzi, czyli ustalaniem, kiedy mówca faktycznie skończył, a nie tylko zrobił pauzę. Jest dostępny na trzech powierzchniach jednocześnie: Meta Model API za 0,18 dolara za godzinę audio, Meta AI dla Maca, gdzie przytrzymanie klawisza Fn dyktuje tekst w dowolnej aplikacji, oraz Muse Code. VibeVoice-ASR-Streaming-7B od Microsoftu to strumieniowy członek otwartej rodziny VibeVoice, a jego ślad wydawniczy jest znacznie spokojniejszy: repozytorium na Hugging Face utworzone 2 września (znaczniki czasu pokazują 15:46 UTC, ostatnia modyfikacja trzy minuty później), osiem shardów safetensors na licencji MIT oraz linia w dzienniku aktualizacji z 3 września w repozytorium GitHub microsoft/VibeVoice, która opisuje go jako „ujednolicony strumieniowy model ASR, który w sposób ciągły transkrybuje, kto co powiedział, w miarę napływu mowy, z obsługą niestandardowych słów budzących i 10 języków”. Dzień po publikacji wciąż pokazywał zero pobrań.

Kolizja cech
• Mechanizm strumieniowania — Muse Voice Transcribe pobiera dźwięk w 80-milisekundowych fragmentach i zatwierdza słowa w miarę ich stabilizacji, podczas gdy VibeVoice-ASR-Streaming-7B przetwarza ~2,9-sekundowe fragmenty z ~0,5 sekundy wyprzedzenia, generując tekst po każdym przetworzonym fragmencie.
• Przypisywanie mówców — 20+ mówców w jednym przebiegu; według dostawcy średni błąd diarizacji 17,5% w porównaniu ze strumieniowym wynikiem „kto co mówi” deklarowanym na karcie modelu — niezweryfikowane.
• Endpointing — wbudowany: strumień przenosi granicę zakończonej wypowiedzi, która nie jest udokumentowana jako sygnał wyjściowy.
• Kontrolki kontekstu — faworyzowanie języka, słów kluczowych i kontekstu w porównaniu ze spersonalizowanymi hotwords za pomocą promptu kontekstowego (--context_info).
• Języki — trenowany na 70+, 25 dokładnie zweryfikowanych przy premierze, natywne przełączanie kodów wobec deklarowanych 10 (en, zh, es, pt, de, ja, ko, fr, ru, it).
• Dowody — twierdzenia dostawcy z dnia premiery: 3,1% WER dla wyników końcowych 0,16 s po zakończeniu wypowiedzi, 3,6% dla pierwszych wyników częściowych, powołując się na ranking streamingu Artificial Analysis, podczas gdy nie opublikowano w formie tekstowej żadnej wartości WER ani opóźnienia dla streamingu.
• Koszt i licencja — 0,18 USD za godzinę audio, hostowane, zamknięte wagi vs 0 USD za wagi (MIT), około 18 GB w bf16, samodzielnie hostowane.

Dwie bardzo różne koncepcje „streamingu”.
Słowo strumieniowanie obejmuje szeroki zakres tempa, a przepaść między tymi dwoma podejściami jest na tyle duża, że zmienia to, co można na każdym z nich zbudować. Muse Voice Transcribe transmituje strumieniowo z ziarnistością pojedynczych słów. Architektura Meta pobiera dźwięk w 80-milisekundowych porcjach i stosuje to, co nazywa „adaptacyjnym opóźnieniem” — polityką opóźnień wyuczoną przez uczenie przez wzmacnianie, która finalizuje każde słowo, gdy tylko model jest go pewny, przechowując więcej kontekstu dla słów, co do których ma mniejszą pewność, zamiast narzucać jeden stały budżet opóźnienia. Producent twierdzi, że ostateczne transkrypcje pojawiają się 0,16 sekundy po tym, jak mówca zamilknie, a pierwsze wyniki częściowe już po 0,13 sekundy. To tempo zostało zaprojektowane z myślą o pętlach interaktywnych: transkrypcji na żywo, dyktowaniu, agencie głosowym, który musi odpowiedzieć na zakończoną wypowiedź niemal natychmiast.
VibeVoice-ASR-Streaming-7B działa w grubszej granulacji. Jego konfiguracja preprocessora pokazuje, że audio dociera z częstotliwością 24 kHz, jest kompresowane 3200× do tokenów z szybkością około 7,5 klatek na sekundę, a następnie przetwarzane w porcjach po 22 klatki z wyprzedzeniem 4 klatek — to mniej więcej 2,9 sekundy audio na porcję i około pół sekundy wyprzedzenia; wartości te wynikają z konfiguracji, a nie z pomiaru opóźnień. Tekst jest emitowany po rozliczeniu każdej porcji, a kontekst z wcześniejszych porcji jest zachowywany przez pamięć podręczną KV, dzięki czemu długa sesja nie przelicza wszystkiego od zera. Transkrypt rosnący mniej więcej co trzy sekundy wystarcza do notatek ze spotkań i analityki rozmów; to inny produkt niż strumieniowanie słów poniżej sekundy na potrzeby rozmowy na żywo. Żadne z laboratoriów nie opublikowało pomiaru opóźnień end-to-end dla tego punktu kontrolnego strumieniowania, więc potraktuj ten rytm jako zamierzony, a realne odczucia jako nieprzetestowane.
Etykiety mówców i wykrywanie końca wypowiedzi: wbudowane w jednym, a w drugim jedynie deklarowane.
Przypisywanie wypowiedzi do mówców to dziedzina, w której produkty strumieniowe najczęściej przesadzają, i oba to twierdzą. Rozwiązanie Muse Voice Transcribe jest konkretne i strukturalne: diaryzacja odbywa się w tym samym przebiegu strumieniowym co rozpoznawanie mowy, dzięki czemu nagranie rozmowy z dwudziestoma osobami może zawierać etykiety poszczególnych mówców bez osobnego etapu „wgraj, poczekaj, odbierz mówców”, a Meta podaje średni wskaźnik błędów diaryzacji wynoszący 17,5% — to liczba producenta, niepotwierdzona niezależnie, ale powiązana z realnym mechanizmem. Rozwiązanie to generuje też granice wypowiedzi, czyli tę mniej nagłaśnianą funkcję: aplikacja otrzymuje wyraźny sygnał „tura tego mówcy dobiegła końca” bez budowania detektora aktywności głosowej, co wyjaśnia, dlaczego agenty głosowe oparte na surowym ASR tak często przerywają rozmówcom.
VibeVoice-ASR-Streaming-7B twierdzi na swojej karcie modelu, że zapewnia strumieniowe wyjście typu kto-co-powiedział, zgodnie ze strukturalnym wyjściem Who/When/What w wersji wsadowej VibeVoice-ASR — ale w przypadku punktu kontrolnego do strumieniowania to twierdzenie nie jest zweryfikowane, żaden niezależny test go nie potwierdził i nie ma udokumentowanego sygnału wykrywania końca wypowiedzi tego rodzaju, jaki dostarcza Muse. Jeśli twoje zadanie to rzeczywiście wielomówcowe audio na żywo, Muse oferuje obecnie pełniejszy mechanizm; jeśli oceniasz, czy model z otwartymi wagami może wykonać to samo na sprzęcie, który kontrolujesz, twierdzenie VibeVoice to dokładnie coś, co warto przetestować na własnych nagraniach spotkań, zanim w to uwierzysz.
Dowody: twierdzenia z dnia premiery kontra pusta karta
Warto być precyzyjnym co do tego, co ma każda ze stron, ponieważ żadna z nich nie ma tego, czego naprawdę chce kupujący. Muse Voice Transcribe ma rozbudowany zestaw liczb producenta — 3,1% współczynnik błędów słownych w transkrypcjach końcowych, 3,6% w pierwszych transkrypcjach częściowych, 0,16-sekundowe opóźnienie końcowe, 17,5% średniego błędu diaryzacji — wszystkie opublikowane przez Metę w dniu premiery i wskazujące na ranking Artificial Analysis dotyczący strumieniowej zamiany mowy na tekst, w którym Meta rości sobie pierwsze miejsce. To są twierdzenia, których nikt poza laboratorium nie powtórzył, ale są one wystarczająco konkretne, by można je było sfalsyfikować, co jest pewnym rodzajem postępu.
VibeVoice-ASR-Streaming-7B nie ma nic z tych rzeczy. Jego karta modelu zawiera wykres z wynikami ewaluacji jako obraz, a raport techniczny dotyczący streamingu to plik PDF; w tekście nie ma jednak żadnej cytowalnej wartości WER dla streamingu ani wskaźnika opóźnienia. Jedynym liczbowym punktem odniesienia w rodzinie VibeVoice jest tabela podana przez producenta w karcie wsadowego modelu VibeVoice-ASR — średni WER 7,77% na ośmiu anglojęzycznych zbiorach testowych i 2,20% na LibriSpeech clean — która wprost nie jest wartością dla tego checkpointu. Gdy deklaracja z dnia premiery spotyka się z pustą kartą modelu, uczciwym kryterium rozstrzygającym jest wszystko poza WER-em z nagłówka: cena, licencja, częstotliwość streamingu oraz funkcje, które każda ze stron faktycznie dokumentuje.
Języki: 25 zweryfikowanych wobec 10 zadeklarowanych
Zasięg językowy różnicuje te dwa rozwiązania bardziej niż nagłówkowe twierdzenia o dokładności. Muse Voice Transcribe był trenowany na ponad 70 językach, ale Meta waliduje 25 na starcie — a lista zweryfikowana, a nie lista treningowa, jest realnym zasięgiem produkcyjnym. Czynnikiem różnicującym jest natywne przełączanie kodów: model zaprojektowano tak, aby przełączał język w środku zdania bez polecenia. VibeVoice-ASR-Streaming-7B deklaruje w swojej karcie modelu 10 języków — angielski, chiński, hiszpański, portugalski, niemiecki, japoński, koreański, francuski, rosyjski, włoski — wobec ponad 50 języków w wersji batch VibeVoice-ASR. Jeśli Twój ruch obejmuje rozmowy z przełączaniem kodów, Muse ma bardziej konkretną propozycję; jeśli mieści się w tych dziesięciu językach, zasięg modelu Microsoftu jest przynajmniej jawny, co jest czymś więcej, niż oferuje większość materiałów premierowych.
Koszt i to, co zachowujesz
Różnica w modelu biznesowym to najczystsze kryterium decyzji. Muse Voice Transcribe za 0,18 USD za godzinę audio przebija pod względem ceny listowej wszystkie liczące się API transkrypcji strumieniowej — bez GPU, bez obsługi operacyjnej, zamknięte wagi, a cenę ustala Meta. VibeVoice-ASR-Streaming-7B można pobrać za darmo, ale do samodzielnego hostowania na GPU z 24 GB pamięci potrzeba około 18 GB wag w bf16 — i to jeszcze przed uwzględnieniem KV cache. Udokumentowane ścieżki serwowania to skrypty demonstracyjne z repozytorium microsoft/VibeVoice albo wtyczka vLLM, a na razie nie hostuje go żaden dostawca usług inferencji. Trwałym atutem jest licencja MIT: wagi zostają Twoją własnością i możesz je dostrajać w sposób, na jaki nie pozwala żadna subskrypcja API. I właśnie tutaj obraz cenowy może się zrobić ciekawy — w momencie, gdy jakiś dostawca zacznie hostować otwarty checkpoint, stawka 0,18 USD za godzinę stanie się ceną rynkową, a nie ceną z cennika pojedynczego dostawcy, a to dokładnie sytuacja, w której router pass-through ma rację bytu. OrcaRouter nie prowadzi dziś routingu transkrypcji mowy na tekst i żaden z tych modeli nie jest w jego katalogu — robi natomiast coś innego: przekazuje ceny listowe dostawców z zerową marżą dla ponad 200 modeli językowych konsumujących transkrypcję na żywo, dzięki czemu obniżka ceny u dowolnego dostawcy w tym stosie technologicznym jest widoczna po stronie kupującego już w dniu ogłoszenia.

Często zadawane pytania
Czy 3,1% WER Muse Voice Transcribe oznacza, że jest on dokładniejszy niż VibeVoice-ASR-Streaming-7B?
Nie, a porównanie nie jest jeszcze miarodajne. 3,1% Meta to deklaracja z dnia premiery dla ścieżki strumieniowej, podana przez dostawcę i niezweryfikowana. VibeVoice-ASR-Streaming-7B nie opublikował w tekście żadnej wartości dokładności dla strumieniowania. Dopóki oba modele nie zostaną przepuszczone przez ten sam publiczny harness na tym samym materiale audio, jedynym uczciwym stwierdzeniem jest, że Muse ma konkretny wynik, który można przetestować, a VibeVoice jeszcze go nie ma.
Czy mogę użyć któregokolwiek z tych modeli na już nagranym audio?
Tak dla obu, w różnych kształtach. Muse Voice Transcribe obsługuje nagrania dłuższe niż godzinę przez to samo API strumieniowe. Wtyczka vLLM modelu VibeVoice-ASR-Streaming-7B udostępnia endpoint transkrypcji całego pliku obok endpointu strumienia WebSocket. Ale oba są zaprojektowane i wycenione pod przypadek na żywo — Muse ze względu na model biznesowy oparty wyłącznie na streamingu, VibeVoice ze względu na architekturę fragmentaryczną, która emituje dane w miarę napływu audio — więc jeśli przetwarzasz wyłącznie pliki wsadowe, dedykowane API do transkrypcji plików będzie zwykle tańsze i lepiej dopasowane niż którekolwiek z nich.
