Karta tytułowa hero z napisem „GPT-Live-1 dociera do API”, z podtytułem „$0,05 za minutę za głos pełnodupleksowy” i wierszem „Model pochodzi z 8 lipca 2026 r.; API dla deweloperów zostało udostępnione 10 września 2026 r.”, obok dwie nakładające się fale dźwiękowe ze strzałkami zakrzywionymi w obu kierunkach, a w rogu nałożone logo OrcaRouter.
Guides & Insights

GPT-Live-1 trafia do API: głos pełnodupleksowy za 0,05 dolara za minutę, bez możliwości bezpośredniego przejścia z GPT-Realtime-2.1

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

GPT-Live-1 jest dostępny w API od 10 września, a liczbą, która naprawdę przekształci budżety, nie jest benchmark — jest nią jednostka rozliczeniowa. Pełnodupleksowy model głosowy OpenAIOpe​nAI jest teraz rozliczany według stałej stawki 0,05 USD za minutę głosu, naliczanej za sekundę, podczas gdy model, z którym się go porównuje, GPT-Realtime-2.1, był rozliczany w tokenach audio: 32 USD za milion na wejściu i 64 USD za milion na wyjściu. Sam model nie jest nowy: GPT-Live-1 trafił do ChatGPT 8 lipca 2026 r. jako zamiennik Advanced Voice Mode. Nowością jest to, że programiści mogą go wreszcie wywoływać — i że wywoływanie go nie wygląda prawie wcale jak integracja Realtime, którą ma już większość zespołów. Własna dokumentacja OpenAIOpe​nAI łączy warstwę głosową z osobnym backendem rozumowania, a w opublikowanym przykładzie WebRTC tym backendem jest GPT-5.6 Terra.

Co zostało wydane 10 września, a co nie

Interfejs API jest celowo wąski. Istnieje dokładnie jeden identyfikator modelu, gpt-live-1, który jest również własnym domyślnym snapshotem — brak datowanych wariantów do przypięcia. Istnieje dokładnie jeden punkt końcowy, punkt końcowy Live Sessions pod adresem v1/live/sessions. Wszystko inne na platformie OpenAI jest wyłączone dla tego modelu: brak Chat Completions, brak Responses, brak Realtime (w tym wariantów tłumaczenia i transkrypcji), brak Assistants, brak Batch, brak dostrajania, brak embeddingów, brak generowania obrazów lub wideo, brak punktów końcowych mowy lub transkrypcji audio, brak moderacji.

Wejścia i wyjścia to audio i tekst. Obsługiwane są strumieniowanie i wywoływanie funkcji; ustrukturyzowane wyjścia, dostrajanie i przewidywane wyjścia nie są. Dane wejściowe w postaci obrazu i wideo są wyraźnie nieobsługiwane — więc funkcja „voice with video”, którą OpenAIOpe​nAI zapowiedziało, nie jest częścią tego wydania. Plan Free nie może go w ogóle wywołać, a limity szybkości są mierzone w sesjach współbieżnych, a nie w liczbie żądań na minutę: 25 w Tier 1, rosnąc do 50, 200, 300 i 500 w Tierach od 2 do 5.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

To ujęcie współbieżności to pierwsza wskazówka, że nie jest to zamiennik typu plug-in. Limity szybkości wyrażane w jednoczesnych rozmowach na żywo mówią ci, jaką jednostkę skali OpenAIOpe​nAI uważa za właściwą: linię telefoniczną, a nie pojedyncze żądanie.

Zmiana cen to cichsza, większa historia.

Ryczałtowe rozliczanie za minutę to prawdziwe odejście od dotychczasowego modelu. W rozliczaniu opartym na tokenach trzeba było modelować zużycie audio — ile tokenów kosztuje sekunda ciszy, jak dzwoniący, który ciągle wchodzi agentowi w słowo, zmienia długość wyjścia — zanim dało się prognozować choćby jedną rozmowę. Przy 0,05 USD za minutę arytmetyka sprowadza się do mnożenia:

• 5-minutowa rozmowa z pomocą techniczną — 0,25 USD za czas głosowy

• 10-minutowa rozmowa — 0,50 USD

• Średnio 4 minuty na 1000 połączeń dziennie — 200 USD dziennie, około 6000 USD miesięcznie

• Jedna godzina ciągłej otwartej linii — $3.00

Trzy szczegóły to podkreślają. Po pierwsze, czas trwania nie jest zaokrąglany w górę do najbliższej pełnej minuty, więc 40-sekundowe połączenie kosztuje około 3,3 centa, a nie pełne pięć centów. Po drugie, inicjalizacja sesji rozlicza z góry 15 sekund czasu trwania głosu — ale jest to zaliczane na poczet późniejszych opłat za czas trwania, a nie dodawane na wierzch, więc połączenie krótsze niż 15 sekund i tak kończy się ceną 15 sekund. Po trzecie, głos to tylko połowa rachunku. Model rozumowania działający w backendzie, jego wywołania narzędzi oraz wszelkie wyszukiwanie w sieci są rozliczane osobno według standardowych stawek tego modelu, co oznacza, że „tani model głosowy” nadal może wygenerować drogie połączenie, jeśli skierujesz delegowanie do rozumującego modelu klasy frontier i pozwolisz mu wyszukiwać w każdej turze.

Ta dwumetrowa struktura to miejsce, w którym routing przestaje być miłym dodatkiem. W OrcaRouter backendowa połowa sesji GPT-Live-1 to po prostu kolejne wywołanie modelu — około 190 modeli od jedenastu dostawców upstream za jednym kluczem, w cenie katalogowej dostawcy przekazywanej bez marży, z automatycznym przełączaniem awaryjnym, jeśli wybrany backend zwróci błąd lub przekroczy limit czasu. Samej warstwy głosowej nie da się routować; endpoint Live Sessions należy wyłącznie do OpenAIOpe​nAI. Możesz natomiast routować wszystko, co warstwa głosowa deleguje — czyli tę połowę, która skaluje się wraz z tym, jak intensywnie myślą twoi rozmówcy.

Tylko WebRTC — dlaczego Twój kod Realtime nie da się przenieść

To praktyczny koszt migracji, a większość materiałów o premierze to pomija. Sesje GPT-Live-1 działają przez WebRTC, a nie przez transport WebSocket, na którym opiera się wiele istniejących integracji Realtime. Testowanie starszej ścieżki z identyfikatorem modelu GPT-Live zwraca błąd, który wprost mówi, że sesje wymagają WebRTC.

Uścisk dłoni, zgodnie z przewodnikiem OpenAI dotyczącym WebRTC: Twoja przeglądarka otwiera RTCPeerConnection, dołącza ścieżki mikrofonu, otwiera kanał danych i rejestruje nasłuchiwacze przed złożeniem oferty, ustawia opis lokalny, czeka na zebranie ICE i wysyła ofertę do własnego serwera. Twój serwer następnie wywołuje POST /v1/live/sessions z konfiguracją sesji oraz transport: { type: "webrtc", sdp: ... }. Sukces zwraca HTTP 201 z session.id i transport.sdp, który przeglądarka stosuje jako opis zdalny. Media podróżują po wynegocjowanych ścieżkach; kanał danych — etykieta oai-events — przenosi transkrypcje, aktualizacje sesji i zlecone zadania. Aby zakończyć połączenie, wysyłasz session.close i czytasz dalej, aż nadejdzie session.closed.

Dwie pułapki, które warto przykleić na monitor. Samo wywołanie HTTP rozpoczyna sesję, więc nie wolno również wysyłać session.start przez kanał danych. Nie należy też dołączać wejściowego dźwięku ani czekać na delty wyjściowego dźwięku przez ten kanał — pozostaw audio.format poza konfiguracją i pozwól, aby SDP się tym zajęło. Przykłady serwera ograniczają treść żądania do 64 KB, ustawiają limit czasu zbierania ICE na 10 sekund, a finalizacji sesji na 15.

Nic z tego nie jest trudne. To wszystko to nowy kod. Jeśli Twój produkt to agent czasu rzeczywistego działający w trybie turowym, migracja do GPT-Live-1 to przepisanie transportu plus przepisanie delegowania, a nie zamiana identyfikatora modelu — warto zaplanować na to sprint, a nie jedno popołudnie.

Benchmarki i kto przeprowadził każdy z nich

Każda z poniższych liczb pochodzi od samego OpenAIOpe​nAI, została opublikowana wraz z wydaniem API i nie została przez nikogo niezależnie odtworzona w momencie pisania tego tekstu. To zastrzeżenie ma tu większe znaczenie niż zwykle, ponieważ różnice są tak duże, że aż proszą się o cytowanie ich jako ustalonego faktu.

A two-column comparison scoreboard titled 'GPT-Live-1 vs GPT-Realtime-2.1 — the scoreboard'. The GPT-Live-1 column lists price $0.05 per minute, billing unit per second, interactivity 80.1%, turn-taking latency 0.8 s, tool-calling accuracy 87%, and endpoint 'Live Sessions only'. The GPT-Realtime-2.1 column lists price $32 / $64 per 1M audio tokens, billing unit per audio token, interactivity 45.4%, turn-taking latency 1.4 s, tool-calling accuracy 60%, and endpoint 'Realtime + WebSocket'. A footer reads 'GPT-Live-1 figures are OpenAI's own, unreproduced; Realtime-2.1 pricing per OpenAI API docs.'

• Interaktywność pełnodupleksowa — GPT-Live-1 80,1% vs 45,4% w przypadku GPT-Realtime-2.1

• Latencja naprzemienności mówienia — 0,8 s vs 1,4 s

• Dokładność wywoływania narzędzi — 87% vs 60%

• Benchmark obsługi głosowej w bankowości, wskaźnik zaliczeń — 32% vs 12,4%

Przeczytaj ostatnią linijkę dwa razy. Wskaźnik zaliczeń na poziomie 32% to duża poprawa w porównaniu z 12,4% i wciąż oznacza, że system nie wykonał około dwóch trzecich zadań w tej ocenie. Skoki w interaktywności i wywoływaniu narzędzi to te, które opisują naprawdę inny produkt; liczba dotycząca bankowości jest tą uczciwą, jeśli chodzi o to, jak daleko jeszcze agentom głosowym do obsługi regulowanego przepływu pracy bez nadzoru.

Dowody od klientów są skromniejsze niż tabela benchmarków i wskazują ten sam kierunek. Yelp używa GPT-Live-1 do rezerwacji telefonicznych, a CTO Alex Levy jest cytowany w związku z poprawą obsługi połączeń. Platforma do nauki języków Speak poinformowała o blisko 80% mniejszej liczbie przerwań niż w przypadku jej poprzedniego systemu opartego na turach — to liczba podana przez samą firmę, która ma interes w tym wyniku, a mimo to wciąż najbardziej konkretna dostępna liczba dotycząca wdrożenia.

Warstwa głosowa to frontend; mózg wybierasz sam

Zakład architektoniczny to delegacja i to właśnie ta część tego wydania, w którą naturalnie wpasowuje się warstwa routingu. GPT-Live-1 nie zajmuje się głębokim myśleniem. Gdy rozmówca pyta o coś, co wymaga rozumowania, wyszukiwania lub użycia narzędzia, model przekazuje zadanie przez asynchroniczną granicę do osobnego backendu, który pracuje dalej, podczas gdy rozmowa głosowa trwa, a następnie włącza odpowiedź z powrotem, gdy jest gotowa.

Konfiguracja jest jednoznaczna i warto uważnie przeczytać przykład z dokumentacji. Obok model: "gpt-live-1" i instrukcji sesja zawiera obiekt delegation typu responses, którego wewnętrzny responses blok określa model backendu, jego własne instrukcje, jego narzędzia — w przykładzie użyto web_search — oraz tool_choice W opublikowanym przez OpenAIOpeAI przykładzie WebRTC tym modelem backendu jest GPT-5.6 Terra.

A screenshot of the OrcaRouter model page for GPT-5.6 Terra, showing the model ID openai/gpt-5.6-terra, OpenAI as the provider with a 2026-07-09 release date, a 1M-token context window with 128K max output, pricing of $2.00 per 1M input tokens and $12.00 per 1M output tokens, a p50 TTFT of 2.38 s, and the exposed endpoints /v1/chat/completions and /v1/responses.

To jest prawdziwa teza tego projektu: wystarczy wymienić backend, a doświadczenie głosowe staje się inteligentniejsze bez ponownego trenowania modelu mowy. Oznacza to również, że backend delegacji jest przenośny, czego nie można powiedzieć o warstwie głosowej. OrcaRouter nie obsługuje gpt-live-1 — punkt końcowy Live Sessions jest dostępny wyłącznie w OpenAIOpe​nAI, a my nie kierujemy żadnej jego części. Ale połowa odpowiedzialna za delegację mówi w Responses API, a tę połowę w pełni wybierasz sam. GPT-5.6 Terra jest już dostępny w OrcaRouter w cenie katalogowej OpenAIOpe​nAI — 2,00 USD za milion tokenów wejściowych i 12,00 USD za milion tokenów wyjściowych, z udostępnionym punktem końcowym Responses — więc dokładny model z przykładu samego OpenAIOpe​nAI można wywołać od razu, bez drugiej umowy czy SDK.

W praktyce zamienia to wybór backendu w konfigurację. Możesz przeprowadzić test A/B taniego modelu rozumującego przeciwko modelowi z czołówki na żywym ruchu połączeń, edytując jedną linię i obserwując rachunek za połączenia, albo trzymać model delegowania za automatycznym przełączaniem awaryjnym, żeby zły dzień u dostawcy upstream nie pociągnął za sobą Twojej linii telefonicznej. Warstwa głosowa, za którą płacisz 0,05 USD za minutę, zostaje tam, gdzie jest; wszystko, co deleguje, działa przez jeden klucz w ramach około 190 modeli od jedenastu dostawców upstream, w cenie katalogowej dostawcy, bez marży.

Czego jeszcze brakuje?

• Brak wejścia obrazu lub wideo — zdjęcia i udostępnianie ekranu nie wchodzą w skład tego wydania, więc multimodalny interfejs głosowy, który nadal mają starsze tryby ChatGPT, pozostaje nieuwzględniony

• Brak ustrukturyzowanych wyników — jeśli Twój agent potrzebuje argumentów narzędzi walidowanych względem schematu, ta walidacja musi znajdować się w modelu backendu, a nie w warstwie głosowej

• Brak dostępu w planie darmowym i brak dostrajania — koszt oraz dostosowanie zaczynają się dopiero w planach płatnych

• Brak niezależnej oceny jakiejkolwiek kluczowej liczby — każda z powyższych wartości pochodzi od dostawcy

• Pułap 25 jednoczesnych sesji w Tier 1 — hojny jak na pilotaż, ciasny dla centrum obsługi telefonicznej już pierwszego dnia

Kto powinien się ruszyć, a kto powinien czekać

Przechodź już teraz, jeśli tworzysz rozwiązania telefoniczne — linie rezerwacyjne, rezerwację wizyt, wsparcie pierwszej linii — a Twój obecny stos technologiczny to klasyczna kaskada ASR → LLM → TTS. Opóźnienia i obsługa przerwań to dokładnie to, co traci ten potok, cena za minutę jest na tyle przewidywalna, że można ją wpisać do arkusza kalkulacyjnego, a własna dokumentacja OpenAIOpe​nAI zawiera teraz przykład serwera wzorowanego na Twilio do skopiowania. Przechodź już teraz również wtedy, jeśli już korzystasz z modelu Realtime, a Twój produkt jest naprawdę konwersacyjny, a nie oparty na turach, ponieważ obsługa przerwań to ta część, w której GPT-Realtime-2.1 radził sobie najgorzej.

Zaczekaj, jeśli twoja integracja jest turowa i działa. Przepisanie transportu to prawdziwa praca, endpoint nie obsługuje niczego innego, i nie ma ścieżki migracji, która zachowałaby twój istniejący kod WebSocket. Zaczekaj również, jeśli twój przypadek użycia zależy od ustrukturyzowanych wyników narzędzi lub wejścia wideo, których tutaj brakuje.

Na co uważać w najbliższych kilku tygodniach: pierwsza niezależna reprodukcja wskaźnika interaktywności na poziomie 80,1%, czy stawka $0.05 jest promocyjna, czy mniejszy GPT-Live-1 mini trafi do API tak, jak stało się to po stronie konsumenckiej, oraz czy wprowadzanie obrazu i ekranu domknie lukę. Dopóki jakieś zewnętrzne laboratorium nie przeprowadzi tej ewaluacji, uczciwym podsumowaniem jest to, że to najzdolniejszy model głosowy, jaki ktokolwiek udostępnił deweloperom, a pokwitowanie tego twierdzenia wystawili ludzie, którzy go sprzedają.