Karta tytułowa hero porównująca 'VibeVoice-ASR-Streaming-7B vs GPT-Transcribe', nadtytuł 'Speech-to-text - wrzesień 2026', podtytuł o treści 'Punkt kontrolny sesji na żywo spotyka audytowany punkt końcowy plików OpenAI - dwa różne momenty w życiu dźwięku', chipy 'wagi MIT - 2 września', 'OpenAI API - 28 lipca' i 'GPT: 3,31% AA-WER' oraz przypis 'Dowody są jednostronne'. Logo OrcaRouter jest skomponowane w prawym dolnym rogu.
Guides & Insights

VibeVoice-ASR-Streaming-7B kontra GPT-Transcribe: Punkt kontrolny sesji na żywo względem punktu końcowego plików OpenAI

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Te dwa modele na tej stronie nie są rywalami w sensie, jaki sugerują ich nazwy — zaprojektowano je z myślą o różnych momentach w życiu nagrania audio, a uczciwe porównanie dotyczy tego, w którym z tych momentów działa Twój produkt. GPT Transcribe to asynchroniczny endpoint transkrypcji OpenAI: wgrywasz gotowy plik, jest on przetwarzany około 34× szybciej niż w czasie rzeczywistym, a w odpowiedzi otrzymujesz transkrypt w cenie 0,0045 USD za minutę audio, z niezależnie zmierzonym wskaźnikiem błędów słownych wynoszącym 3,31% w benchmarku AA-WER platformy Artificial Analysis. VibeVoice-ASR-Streaming-7B jest jego przeciwieństwem: strumieniowy checkpoint Microsoft Research, opublikowany po cichu na Hugging Face 2 września 2026 roku na licencji MIT, został zbudowany do transkrypcji audio, które wciąż jeszcze dociera — to sesja WebSocket, która emituje tekst fragmentami w miarę rozrastania się nagrania. Porównywanie ich wyłącznie pod względem dokładności nie miałoby sensu, bo jedna strona ma zweryfikowaną liczbę, a druga nie opublikowała w tekście żadnej wartości.

Wszystko poniżej jest odpowiednio oznaczone. Wartości GPT Transcribe to opublikowana cena OpenAI i niezależny pomiar Artificial Analysis, oba w publicznym rejestrze od premiery modelu 28 lipca 2026 r. Strona VibeVoice-ASR-Streaming-7B obejmuje to, co można ustalić na podstawie repozytorium — konfigurację punktu kontrolnego, kartę modelu oraz dokumentację przesyłania strumieniowego Microsoft — ponieważ żadna strona trzecia nie przeprowadziła testów porównawczych, a Microsoft nie opublikował strumieniowego współczynnika błędów słownych w czytelnym tekście.

Dwa różne momenty w życiu audio

GPT Transcribe jest przeznaczony do nagrań, które już powstały. Endpoint OpenAI przyjmuje pliki audio do 25 MB w popularnych formatach — mp3, mp4, mpeg, mpga, m4a, wav, webm — i po przetworzeniu zwraca pełną transkrypcję, z szybkością około 34× względem czasu rzeczywistego, więc godzinne nagranie jest gotowe w kilka minut. To pasmo wsadowe i OpenAI wycenia je odpowiednio: 0,0045 USD za minutę audio, czyli około 0,27 USD za godzinę audio. Jeśli naprawdę potrzebujesz transmisji na żywo, OpenAI oferuje osobny model — GPT Live Transcribe za 0,017 USD za minutę, czyli prawie cztery razy drożej niż wersja wsadowa — który po stronie OpenAI jest najbliższym odpowiednikiem tego, co robi VibeVoice-ASR-Streaming-7B.

VibeVoice-ASR-Streaming-7B zaciera tę różnicę w drugą stronę: to strumieniowy punkt kontrolny, który obsługuje też całe pliki. Jego konfiguracja preprocesora pokazuje warunki trybu na żywo — dźwięk wchodzi z częstotliwością 24 kHz, jest kompresowany 3200× do strumienia tokenów o częstotliwości 7,5 Hz, a następnie przetwarzany w porcjach po 22 ramki z wyprzedzeniem 4 ramek, co daje około 2,9 sekundy dźwięku na porcję i mniej więcej pół sekundy przyszłego kontekstu; tekst jest emitowany w miarę rozstrzygania każdej porcji. Kontekst sesji jest przenoszony przez pamięć podręczną KV, więc długa sesja nie przelicza wszystkiego od nowa. Udokumentowana ścieżka serwowania (wtyczka vLLM) udostępnia punkt końcowy strumienia WebSocket dla sesji na żywo i punkt końcowy transkrypcji całego pliku, dzięki czemu te same wagi obsługują obie formy — ale racją bytu modelu jest ta na żywo i nie ma pomiaru za minuty, bo nie ma hostowanego API. GPU dostarczasz sam.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

Rejestr dowodów jest jednostronny.

GPT Transcribe to jedno z najdokładniej mierzonych API transkrypcyjnych w produkcji. Artificial Analysis wyceniło je na 3,31% wskaźnika błędów słownych w AA-WER — dziewiąte miejsce spośród około pięćdziesięciu monitorowanych systemów — ze znanym słabym punktem ukrytym w podwynikach: na celowo trudnym akustycznie zbiorze Earnings22 wynik spada do 6,10%. To audytowane, odtwarzalne dane z neutralnego rankingu, a ich ograniczenia również są udokumentowane. Model zadebiutował 25% taniej niż jego poprzednik GPT-4o Transcribe i o około 0,7 punktu lepiej wypada w tym samym benchmarku.

VibeVoice-ASR-Streaming-7B nie ma żadnej porównywalnej liczby w żadnym miejscu. Karta tego modelu zawiera wyniki ewaluacji jako obraz, a raport techniczny Microsoftu to plik PDF — nie ma jednak możliwej do zacytowania wartości WER dla trybu strumieniowego ani wartości opóźnienia w tekście ani niczego, co dałoby się niezależnie zweryfikować. Jedyną liczbową kotwicą w rodzinie VibeVoice jest tabela podana przez producenta w karcie modelu wsadowego VibeVoice-ASR — średnio 7,77% WER na ośmiu angielskich zestawach testowych i 2,20% na LibriSpeech clean — która opisuje model niestrumieniowy i nie może być odczytywana jako dokładność tego checkpointu. Jeśli Twoja decyzja zakupowa potrzebuje liczby, którą możesz obronić wobec współpracowników, tylko jedna strona tego porównania taką liczbę ma.

Co każda z nich zwraca poza zwykłym transkryptem

Oba modele stawiają na kontekst w odmienny sposób i to właśnie w tym miejscu porównanie funkcji robi się interesujące. Główną zaletą GPT Transcribe jest podpowiadanie kontekstu: można przekazać swobodny opis nagrania, listę słów kluczowych i nazw własnych oraz listę oczekiwanych języków, a OpenAI podaje, że w jego benchmarku Context-Aware ASR dokładność semantyczna wzrosła z 41,6% bez kontekstu do 45,2% z kontekstem. Narzędzie zwraca również wykryty język. Nie wykonuje natomiast diaryzacji mówców ani nie zwraca znaczników czasowych na poziomie słów — OpenAI wskazuje w tym celu na osobne modele — więc transkrypcja spotkania wraca jako jeden niezróżnicowany blok tekstu, chyba że samodzielnie zbudujesz warstwę mówców.

Model VibeVoice-ASR-Streaming-7B stawia na odwrotne rozwiązanie. Jego karta modelu deklaruje strumieniowe wyjście z atrybucją do mówcy — kto co powiedział, emitowane w miarę rozpoznawania fragmentu — a także dostosowane hotwords przez prompt kontekstowy (flaga CLI to --context_info). To funkcja, którą GPT Transcribe wprost pomija, i właśnie dlatego te dwa modele nie są wymienne w przypadku dźwięku na żywo z wieloma mówcami. Przeciwwagą jest weryfikacja: brakujące funkcje GPT Transcribe to udokumentowana decyzja produktowa, podczas gdy deklarowana przez VibeVoice atrybucja mówców to stwierdzenie na karcie modelu, którego nie potwierdził żaden niezależny test. Obie strony różnią się też w kwestii znaczników czasu — żadna z nich nie oferuje znaczników czasu na poziomie słów na porównywanej ścieżce, choć wsadowy model z rodziny VibeVoice zapewnia takie znaczniki.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs GPT-Transcribe - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): job shape - streaming session, live audio; throughput - emits per ~2.9 s chunk; WER published - none in text; speaker output - claimed who-said-what, unverified; context controls - hotwords via --context_info; cost - /bin/bash weights, ~18 GB bf16. Right column GPT-Transcribe (released Jul 28, 2026 - hosted API): async file endpoint, files up to 25 MB; ~34x faster than real time; 3.31% AA-WER (6.10% Earnings22); no speaker output; prompt + keywords + language hints; /bin/bash.27 per audio-hour hosted. Footer: 'GPT-Transcribe price per OpenAI; WER per Artificial Analysis. VibeVoice specs read from the HF repo.'

Formy cen a kwestia własności

Struktury kosztów nie mogłyby się bardziej różnić i żadna z nich nie jest jednoznacznie lepsza. GPT Transcribe to API rozliczane za użycie: 0,27 USD za godzinę audio, bez infrastruktury, bez GPU, 25 MB na żądanie i gwarancje operacyjne OpenAI — cena za to, że nie uruchamiasz modelu mowy samodzielnie. Z kolei VibeVoice-ASR-Streaming-7B ma wagi za 0 USD, ale wymaga około 18 GB w formacie bf16 bez uwzględnienia pamięci podręcznej KV — czyli GPU klasy 24 GB, kodu demonstracyjnego microsoft/VibeVoice lub wtyczki vLLM oraz własnego monitorowania i skalowania. Licencja MIT to różnica, której nie oddaje żadna cena za minutę: wagi możesz zatrzymać, dostroić i uruchamiać na sprzęcie, który kontrolujesz — bez licznika na użytkownika i bez limitu 25 MB.

Zakres obsługiwanych języków to obszar, w którym obie strony są bardziej niejasne, niż życzyliby sobie kupujący. VibeVoice-ASR-Streaming-7B wymienia w swojej karcie modelu 10 języków — angielski, chiński, hiszpański, portugalski, niemiecki, japoński, koreański, francuski, rosyjski, włoski — w porównaniu z ponad 50 językami w batchowym VibeVoice-ASR. OpenAI nie publikuje porównywalnej zweryfikowanej listy języków dla GPT Transcribe; w materiałach z premiery podaje mocne wyniki dla 22 języków Common Voice, a wykryty w audycie słaby punkt akustyczny tego modelu na Earnings22 przypomina, że „obsługiwany” i „radzi sobie z hałaśliwym audio w tym języku” to różne twierdzenia. Jeśli Twoje potrzeby w zakresie pokrycia językowego są szerokie, żadna z tych list tego nie rozstrzyga — przetestuj swoje rzeczywiste dialekty.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

Sedno sprawy: wybieraj według pasa, a nie według wyniku.

Wybierz GPT Transcribe, gdy dźwięk to gotowy plik, gdy zależy Ci na udokumentowanym wskaźniku dokładności o znanych ograniczeniach albo gdy niewdrażanie własnej infrastruktury rozpoznawania mowy jest warte 0,27 USD za godzinę — i łącz go z GPT Live Transcribe tylko wtedy, gdy dostarczanie w czasie rzeczywistym uzasadnia niemal 4× wyższą cenę. Wybierz VibeVoice-ASR-Streaming-7B, gdy zadanie jest realizowane na żywo i dotyczy wielu mówców, gdy chcesz, aby transkrypcja pojawiała się, podczas gdy rozmowa wciąż trwa, gdy strumieniowe wyniki z przypisaniem do mówców to funkcja, którą chcesz ocenić, albo gdy otwarte wagi i kontrola nad danymi liczą się bardziej niż zmierzony benchmark.

Jedna uwaga strukturalna dla zespołów budujących na którymkolwiek z tych rozwiązań: warstwa transkrypcji nie jest dziś obsługiwana przez routing OrcaRouter — żaden z modeli zamiany mowy na tekst na tej stronie nie znajduje się w jego katalogu, więc wybór ASR należy w pełni do Ciebie. To, co zyskujesz dzięki routingowi, to warstwa ponad transkryptem. Strumień transkrypcji na żywo jest użyteczny dopiero wtedy, gdy coś na nim działa — moduł podsumowujący, reguła alertów, planer agenta głosowego — i to właśnie dla tego stosu OrcaRouter stanowi front w postaci jednego API obejmującego ponad 200 modeli, po cenach listowych dostawców, bez narzutu, plus automatyczny failover. Wzorzec, który sprawia, że niezweryfikowany checkpoint taki jak VibeVoice-ASR-Streaming-7B można niedrogo wypróbować, jest właśnie taki: utrzymuj endpoint konsumujący Twoje transkrypty jako wymienny, a model, który nie ma jeszcze żadnego benchmarku, może zdobyć lub stracić Twój ruch na podstawie dowodów z Twojego własnego audio, a nie na podstawie deklaracji z dnia premiery.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube