
Grok Voice Transcribe 2.0 vs GPT Transcribe: ta sama cena streamingu, inna dokładność
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Zbieg okoliczności jest niemal zbyt idealny. Na tablicy AA-WER Streaming serwisu Artificial Analysis Grok Voice Transcribe 2.0 i GPT Live Transcribe — punkt końcowy transkrypcji strumieniowej — oba są wycenione dokładnie na 3,33 USD za 1000 minut audio. Grok Voice Transcribe 2.0 firmy SpaceXAI, wydany 18 września 2026 r., zwraca końcowy zapis transkrypcji przy 2,7% współczynnika błędów słów, 0,49 sekundy po zakończeniu wypowiedzi, a pierwszy wynik częściowy przy 3,4%. GPT Live Transcribe, który ukazał się razem z GPT Transcribe 28 lipca 2026 r., zwraca końcowy zapis transkrypcji przy 3,9%, a pierwszy wynik częściowy przy 6,3%. Ta sama cena, a do tego około 1,2 punktu dokładności końcowej transkrypcji plus 2,9 punktu dokładności transkrypcji częściowej na korzyść SpaceXAI. Część wsadowa tego samego starcia wcale nie jest zbiegiem okoliczności: GPT Transcribe kosztuje 4,50 USD za 1000 minut w porównaniu z 1,67 USD w przypadku Grok Voice Transcribe 2.0 — 63% różnicy na ścieżce plików nagranych.
Dwa różne zakłady o to, jak transkrypcja staje się lepsza.
Odpowiedzią OpenAI na kwestię dokładności jest kontekst. GPT Transcribe i GPT Live Transcribe przyjmują zarówno dowolne prompty, listy słów kluczowych, jak i listy oczekiwanych języków, a w sesjach Realtime wcześniej transkrybowane wypowiedzi są przekazywane z powrotem jako kontekst dla kolejnych. W opracowanym przez OpenAI benchmarku Context Aware ASR takie warunkowanie podniosło dokładność semantyczną GPT Live Transcribe z 38,5% do 44,6% — to wartość podana przez dostawcę, mierząca raczej to, czy sens został zachowany, niż to, czy słowa były właściwe. Kompromis, jaki oferuje OpenAI, jest wyraźny: daj modelowi informacje o tym, co za chwilę usłyszy, a będzie transkrybował twoją dziedzinę lepiej niż model ogólny o tej samej surowej dokładności.
Odpowiedź SpaceXAI to sam model. Grok Voice Transcribe 2.0 rzeczywiście ma mechanizm ukierunkowujący — do 100 kluczowych terminów na żądanie, każdy o długości do 50 znaków — ale to lista słownictwa, a nie prompt. Możesz mu powiedzieć, że „OrcaRouter” i „Kubernetes” to prawdziwe słowa; nie możesz przekazać mu akapitu wyjaśniającego, że to rozmowa z obsługą klienta dotycząca zwrotu pieniędzy. Poprawa dokładności w wersji 2.0 wynika natomiast z ponownego trenowania: na własnych, pochodzących z produkcji zbiorach ewaluacyjnych SpaceXAI wskaźnik błędów słownych spadł z 8,7% do 3,3% w przypadku audio konwersacyjnego, z 10,6% do 7,1% w przypadku telefonii 8 kHz, z 7,2% do 3,2% w przypadku wypowiadanych danych uwierzytelniających oraz z 20,6% do 6,8% w przypadku krótkich poleceń w 19 językach. To liczby firmy dotyczące jej własnego audio, niepowtórzone przez nikogo spoza niej, i opisują model, który poprawił się w zakresie problemu akustycznego, a nie taki, który stał się lepszy, gdy mówiono mu, czego się spodziewać.
Praktyczna różnica ujawnia się w drugiej godzinie pracy. Model warunkowany kontekstem może być dramatycznie lepszy, niż sugerują jego surowe wyniki benchmarku, ponieważ dostarczyłeś słownictwo i domenę. Może też halucynować podane przez ciebie słowa kluczowe: umieść „OrcaRouter” w prompcie, a model, który nie słyszy tego słowa wyraźnie, i tak może je wygenerować. Model z odchyleniem na rzecz kluczowych terminów degraduje się łagodniej, ponieważ odchylenie przesuwa prawdopodobieństwo terminu, zamiast twierdzić, że jest on obecny. Żaden z tych trybów awarii nie pojawia się na leaderboardzie, ale oba pojawią się w twoich logach.
Liczby, obok siebie
• Dokładność końcowej transkrypcji (strumieniowanie) — Grok Voice Transcribe 2.0 przy 2,7% WER vs GPT Live Transcribe przy 3,9% w AA-WER Streaming, oba według Artificial Analysis
• Dokładność pierwszego wyniku częściowego (strumieniowanie) — 3,4% vs 6,3%, największa różnica w porównaniu i ta, która decyduje o zachowaniu agenta głosowego
• Czas do finalnego transkryptu — 0,49 s vs 0,81 s po zakończeniu mowy, więc dokładniejszy model jest także szybszy w zatwierdzeniu
• Czas do pierwszego fragmentu — 0,49 s vs 0,26 s, jedyna kolumna opóźnienia, w której OpenAI wygrywa bezapelacyjnie
• Cena streamingu — 3,33 USD za 1000 minut w przypadku obu, znormalizowana przez Artificial Analysis na podstawie stawki Grok wynoszącej 0,20 USD/godzinę i stawki OpenAI wynoszącej 0,017 USD/minutę
• Dokładność w trybie wsadowym (bez przesyłania strumieniowego) — Grok Voice Transcribe 2.0 przy 2,3% AA-WER w porównaniu z GPT Transcribe przy 3,31%
• Cena wsadowa — 1,67 USD za 1000 minut vs 4,50 USD za 1000 minut, od 0,10 USD/godz. w porównaniu z 0,0045 USD/min
• Przepustowość wsadowa — około 162× czasu rzeczywistego w porównaniu do około 41× na tej samej płycie
Czytaj tę listę jako dwie kolumny, a nie jako jeden werdykt. OpenAI wygrywa pod względem opóźnienia pierwszego częściowego wyniku z wyraźną przewagą i oferuje mechanizm kontekstu, którego Grok nie ma. SpaceXAI wygrywa w zakresie dokładności końcowej w obu trybach, dokładności częściowej w strumieniowaniu, przepustowości i ceny wsadowej z dużą przewagą. Nie ma kolumny, w której GPT Live Transcribe jest jednocześnie szybszy i dokładniejszy niż Grok Voice Transcribe 2.0; jest jedna kolumna, w której jest szybszy, i jest to ta najwcześniejsza.

Na której ścieżce wsadowej faktycznie się znajdujesz
Różnica między 1,67 USD a 4,50 USD jest tu najmniej niejednoznaczną liczbą i warto precyzyjnie wyjaśnić, dlaczego istnieje. OpenAI obniżyło cenę tej linii produktów o 25%, gdy wprowadziło GPT Transcribe, względem ery GPT-4o Transcribe, i dało to 0,0045 USD za minutę. SpaceXAI pozostawiło swoją stawkę za przetwarzanie wsadowe na niezmienionym poziomie 0,10 USD za godzinę, przechodząc z wersji 1.0 na 2.0 — ulepszyło model i pobierało tę samą opłatę, co jest trudniejsze do zrobienia i stanowi lepszy sygnał co do tego, dokąd zmierza rynek. MAI-Transcribe-2 firmy Microsoft został wyceniony na identyczne 0,10 USD za godzinę jako oferta ograniczona czasowo, więc poziom 1,67 USD za 1000 minut stał się dolną granicą wyznaczaną przez czołowe laboratoria dla transkrypcji wsadowej, a nie promocyjną liczbą jednego dostawcy.
Przy dziesięciu tysiącach godzin audio miesięcznie ta różnica wynosi około 2 830 USD w porównaniu z 450 USD. W przypadku archiwum podcastów, zaległości w nagraniach rozmów albo biblioteki multimediów poddawanej retrotranskrypcji różnica w cenie jest nieporównywalnie większa niż jakakolwiek różnica w dokładności między 2,3% a 3,31% WER. W przypadku agenta streamingowego, w którym oba produkty kosztują tyle samo, dokładność i opóźnienie to jedyne kwestie, o które można się jeszcze spierać.
Za tymi stawkami kryje się różnica strukturalna, którą warto nazwać: Grok Voice Transcribe 2.0 rozlicza stałą stawkę za godzinę audio, a GPT Live Transcribe rozlicza za minutę, natomiast Gemini 3.5 Transcribe Live rozlicza za token zarówno w przypadku wejścia audio, jak i wyjścia tekstowego. Tylko jeden z tych trzech sprawia, że Twój rachunek jest funkcją tego, co model zdecyduje się powiedzieć. Jeśli Twój wolumen jest wystarczająco duży, aby prognozowanie miało znaczenie, stawki ryczałtowe łatwiej uzasadnić temu, kto podpisuje fakturę — a ponieważ OrcaRouter przekazuje ceny katalogowe dostawców dalej z 0% narzutu, obniżka po stronie dostawcy, taka jak 25% OpenAI, zostałaby uruchomiona po naszej stronie tego samego dnia, w którym zostanie ogłoszona, a nie dopiero przy kolejnym odnowieniu.

Czym nie jest żaden z modeli
GPT Transcribe i GPT Live Transcribe to dwa produkty, a nie jeden z przełącznikiem. Model wsadowy obsługuje ukończone pliki, transkrypcje plików przesyłanych strumieniowo oraz zatwierdzone tury w sesjach Realtime i przetwarza dźwięk około 34 razy szybciej niż czas rzeczywisty według własnych wyliczeń OpenAI — Artificial Analysis mierzy 41× w swoim środowisku testowym. Model strumieniowy jest droższym z nich, kosztującym 0,017 USD za minutę, i tym o 10× większym współczynniku błędów dla wyników częściowych. Wybór OpenAI oznacza wybór tego, z którym z tych dwóch problemów się zmagasz, ponieważ tańszy punkt końcowy nie może wykonać zadania drugiego.
Grok Voice Transcribe 2.0 to jeden model z dwoma mechanizmami przesyłu: te same wagi obsługują /v1/stt przez REST dla plików o rozmiarze do 500 MB i wss://api.x.ai/v1/stt przez WebSocket dla audio na żywo, z wynikami pośrednimi zwracanymi mniej więcej co 500 ms. Stawka za strumieniowanie jest dokładnie dwukrotnością stawki wsadowej, a nie osobno zaprojektowanym produktem, co oznacza, że dokładność, którą mierzysz na zarchiwizowanym audio, jest dokładnością, której powinieneś oczekiwać na żywo. Oznacza to również, że nie ma drugiego modelu do oceny — jeden zestaw promptów, jeden zestaw kluczowych terminów, jeden zestaw oczekiwań.
Parytet funkcji jest bliski, ale nie identyczny. Oba zwracają znaczniki czasu na poziomie słów; Grok Voice Transcribe 2.0 dołącza wynik pewności do każdego słowa, co pozwala ustawić próg dla fragmentów o niskiej pewności, zamiast jednakowo ufać całemu transkryptowi. Oba wykonują diaryzację mówców, a diaryzacja w Grok Voice Transcribe 2.0 jest dostępna bez dodatkowych kosztów. Oba obsługują odwrotną normalizację tekstu dla liczb, dat, walut i danych kontaktowych. Grok Voice Transcribe 2.0 dodaje transkrypcję wielokanałową obejmującą do 8 niezależnych kanałów, usuwanie słów wypełniających i wykrywanie końca tury Smart Turn; charakterystyczne dodatki GPT Transcribe to warunkowanie kontekstem na poziomie promptu oraz, po stronie Realtime, automatyczne przenoszenie wcześniejszych tur. OpenAI nie opublikowało liczby obsługiwanych języków dla żadnego z tych modeli; Grok Voice Transcribe 2.0 dokumentuje dziesiątki języków z przełączaniem w trakcie nagrywania i formatowaniem formy pisanej w 25 z nich.

Jak zdecydować i jak to przetestować
Jeśli budujesz agenta głosowego, który musi odpowiedzieć, zanim rozmówca skończy mówić, kolumna transkrypcji częściowej jest twoją zmienną decyzyjną i wyraźnie rozdziela oba modele: Grok Voice Transcribe 2.0 jest o 2,9 punktu dokładniejszy w przypadku transkrypcji częściowych, ale tworzy je o 0,23 sekundy wolniej. Wybierz SpaceXAI, jeśli błędna transkrypcja częściowa jest gorsza niż spóźniona — kierowanie, eskalacja, odpowiedzi wyzwalane wymogami zgodności. Wybierz OpenAI, jeśli spóźniona transkrypcja częściowa jest gorsza niż błędna, oraz jeśli dysponujesz słownictwem dziedzinowym, które możesz podać mechanizmowi kontekstowemu, tak aby różnica w dokładności się zmniejszyła. Potem zmierz oba, bo zachowanie żadnego z dostawców w zakresie transkrypcji częściowej na ośmiu godzinach angielskojęzycznych rozmów agenta nie pozwala przewidzieć, jak każdy z nich poradzi sobie z twoim akcentem, twoim kodekiem i twoim żargonem.
Jeśli transkrybujesz pliki, decyzja jest znacznie łatwiejsza: 1,67 USD wobec 4,50 USD za 1000 minut i 2,3% wobec 3,31% WER — oba wskazują w tym samym kierunku. Jedynym powodem, by pozostać przy GPT Transcribe w pracy wsadowej, jest to, że mechanizm warunkowania kontekstem robi dla twojego audio coś, czego różnica w surowej dokładności nie jest w stanie zrekompensować — co jest realną możliwością w przypadku nagrań silnie dziedzinowych i możliwą do przetestowania.
Żaden z modeli transkrypcji nie znajduje się dziś w katalogu OrcaRouter, więc same wywołania trafiają do własnego API dostawcy. To, co jednak stoi za jednym kluczem OrcaRouter, to wszystko, co zasila transkrypcja: model agenta, moduł streszczania, klasyfikator, kod, który decyduje, co zrobić z tekstem. Tu zwykle pojawia się druga umowa — jeden dostawca do mowy, drugi do modelu, który ją rozumuje — a wcale nie musi. Jeden klucz do ponad 200 modeli, automatyczne przełączanie awaryjne, jeśli dostawca zacznie zawodzić, oraz DSL routingu, jeśli chcesz wysłać żądanie przez kilka modeli i porównać, zanim się zdecydujesz. To skromniejsze twierdzenie niż „routujemy twoją transkrypcję”, ale za to prawdziwe.
Na co warto patrzeć, to czy OpenAI odpowie dokładnością, a nie kontekstem. Firma wypuściła już dwie generacje transkrypcji w ciągu roku i raz obniżyła ceny; mechanizm kontekstu naprawdę się wyróżnia, ale w rankingu mierzącym surową transkrypcję obecnie plasuje się za SpaceXAI i Microsoft. Jeśli GPT Transcribe 2 pojawi się z nienaruszonym mechanizmem kontekstu i wskaźnikiem błędów obniżonym do okolic 2%, to porównanie odwróci się po stronie wsadowej z dnia na dzień — a cena streamingu, już identyczna, czyni to wyścigiem wartym obserwowania.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
