Główna karta tytułowa artykułu 'Wrześniowy Dzień Platformy OpenAI', z podtytułem 'GPT-Live-1 trafia do API, Agents API otwiera się w wersji beta', z plakietką o treści 'Obie zapowiedzi datowane na 10 września 2026' oraz trzema kartami o treści 'GPT-Live-1 w API: 0,05 USD za minutę głosu, endpoint Live Sessions, jedno ID modelu', 'Agents API: publiczna beta, Codex harness, hostowane sandboxy albo przynieś własne' i 'Dlaczego to ważne: model staje się komponentem, który wybierasz, a harness staje się produktem, który wynajmujesz', nad paskiem stopki o treści 'Dane głosowe podane przez OpenAI i nieodtworzone; cennik Agents API jest przekazywany dalej.' Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

Wrześniowy Dzień Platformy OpenAI: GPT-Live-1 trafia do API, gdy Agents API wchodzi w fazę beta

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwie rzeczy opuściły platformę OpenAI 10 września 2026 r., a ta cichsza ma większy zasięg rażenia. GPT-Live-1 — model głosowy pełnodupleksowy, który działa w ChatGPT od 8 lipca — jest teraz dostępny dla deweloperów za 0,05 USD za minutę głosu. Obok niego, i wspomniany znacznie rzadziej w relacjach, Agents API wszedł do publicznej bety: ten sam mechanizm, który obsługuje Codex, udostępniony jako hostowany produkt z zarządzanymi piaskownicami. Jedno to lepszy głos. Drugie to OpenAI sprzedające to, co kiedyś było najtrudniejszą częścią budowania agenta.

Jedno i drugie odczytano ze źródeł pierwotnych do tego tekstu: ogłoszenia Ope​nAI o Agents API, jego wpisu na forum społeczności deweloperskiej wprowadzającego GPT-Live-1 do API oraz dokumentacji deweloperskiej dla obu. Jeśli liczba pochodzi od Ope​nAI, a nie od zewnętrznego ewaluatora, została poniżej oznaczona jako taka — a jedna wartość rzeczywiście pochodzi z zewnątrz, co nieco zmienia historię.

A two-column scoreboard titled 'September 10, 2026 — what Ope​nAI shipped'. The left column, labelled GPT-Live-1 in the API, reads 'What it is: full-duplex voice model', 'Access: Live Sessions API, one model ID', 'Price: $0.05 per voice minute', 'Status: generally available since Sept 10, 2026', 'Independent score: 69.8% on the Artificial Analysis Speech to Speech Index', 'Catch: delegates its thinking to a backend model'. The right column, labelled Agents API, reads 'What it is: hosted agent runtime', 'Access: public beta, Codex harness', 'Price: no API fee; sandbox time is billed', 'Status: public beta since Sept 10, 2026', 'Evidence: Ope​nAI documentation only, no independent evaluation', 'Catch: US-only data residency, no Zero Data Retention'. The footer reads 'GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced; the AA index figure is independently run.' The OrcaRouter logo is composited in the bottom-right corner.

Artificial Analysis zaczęło w tym roku publikować Indeks Mowa do Mowy, a GPT-Live-1 ma w nim swój wiersz: 69,8% — średnia ważona obejmująca rozumowanie głosowe, skuteczność agentową, preferencje w arenie i powodzenie w zadaniach. Daje mu to siódme miejsce wśród jedenastu ocenianych modeli — za GPT-Realtime-2.1 z wynikiem 73,9%, czyli modelem, który zastępuje, oraz za Gr​ok Voice Think Fast 2.0 z wynikiem 79,0%. Niezależna tablica wyników i własna tabela testów Ope​nAI nie opowiadają tej samej historii, a prawdziwe są obie.

Co zostało wydane, w kolejności, w jakiej zmieni to twoją architekturę

• Głos — GPT-Live-1 jest dostępny w API jako gpt-live-1, rozliczany po $0,05 za minutę głosu, naliczany co sekundę, a model rozumowania po stronie zaplecza rozliczany jest osobno według własnych stawek.

• Agenci — API Agents jest w publicznej becie. OpenAI twierdzi, że nie ma dodatkowej opłaty za samo API; płacisz za tokeny modelu, narzędzia i czas hostowanego kontenera sandbox.

• Sandboxy — OpenAI hostuje teraz środowisko wykonawcze, ponownie wykorzystując tę samą infrastrukturę sandboxingu co Codex i ChatGPT, konfigurowalne za pomocą plików, pakietów, umiejętności i wtyczek.

• Środowiska — oprócz własnego sandboxa Ope​nAI, zespoły mogą kierować agentów do własnej infrastruktury lub do zewnętrznych dostawców sandboxów z listy partnerów beta.

Wydanie głosowe to historia modelu. Agents API to historia platformy, a historie platformowe to te, które po cichu na nowo ukierunkowują bazę kodu.

Agents API: agent w jednym żądaniu POST

Podstawowe wywołanie to POST /v1/agents/sessions, wysyłane z nagłówkiem Ope​nAI-Beta: agents=v1, a obietnica jest taka, że zadanie, model, narzędzia i środowisko wystarczą, aby otrzymać działającego agenta. Zestawy SDK obejmują Pythona, TypeScript/JavaScript, Go, Javę i Ruby.

To, co czyni go czymś więcej niż wrapperem, to fakt, że OpenAI obsługuje ten harness, zamiast go dostarczać. Harness AgentKit jest open source i można go analizować, ale działająca kopia należy do OpenAI — kompaktowanie kontekstu w długich sesjach, wyszukiwanie narzędzi, programowe wywoływanie narzędzi, obsługa MCP, funkcje niestandardowe, wbudowane wyszukiwanie w sieci i orkiestracja podagentów z konfigurowalną współbieżnością. Wersjonowane możliwości harnessu pojawiają się równolegle z premierami modeli, co jest ciekawym zobowiązaniem: ta struktura pomocnicza rozwija się w tym samym tempie co modele.

Dla każdego, kto spędził kwartał, utrzymując pętlę — logikę ponownych prób, przycinanie kontekstu, routing narzędzi, fan-out podagentów, w którym zawsze wycieka stan — to jest właściwy produkt. Nie wywołanie modelu. Ta hydraulika wokół tego, której już nie piszesz.

Hostowane sandboxy to ta część, do której dołączony jest rachunek.

Agenty, które wykonują kod, potrzebują miejsca, w którym mogą go wykonać, a wersja beta dostarcza własną odpowiedź OpenAI: zarządzaną piaskownicę, która uruchamia kod, pracuje na plikach i tworzy artefakty, konfigurowalną za pomocą pakietów, umiejętności i wtyczek. Deweloperzy, którzy mają już wzmocnione środowisko wykonawcze, nie są do niej zmuszani — bring-your-own-infrastructure oraz zestaw nazwanych partnerów piaskownic są dostępne w wersji beta.

Dwa zastrzeżenia operacyjne warto odnotować, zanim zaczniesz na tym budować. Rezydencja danych w wersji beta jest ograniczona do USA, a Zero Data Retention nie jest obsługiwane. W przypadku obciążenia podlegającego regulacjom te dwa zdania decydują, czy będzie to pilotaż, czy ścieżka produkcyjna, i to są szczegóły, które zwykle odkrywa się późno.

GPT-Live-1 w API: stała opłata za minutę to prawdziwa zmiana

Sam model głosowy nie jest nowy — 8 lipca zastąpił Advanced Voice Mode w ChatGPT — nowa jest natomiast jego forma komercyjna. W ramach linii Realtime dźwięk był rozliczany w tokenach, co oznaczało, że prognozowanie kosztów połączenia wymagało modelowania zużycia audio: ile tokenów kosztuje sekunda ciszy, jak rozmówca mówiący równocześnie z agentem zmienia długość odpowiedzi. Stała stawka 0,05 USD za minutę głosu sprowadza to do mnożenia. Godzina nieprzerwanego otwartego połączenia to 3,00 USD. Przy średniej czterech minut na rozmowę i tysiącu rozmów dziennie daje to około 200 USD dziennie.

Sesje działają z punktu końcowego Live Sessions z jednym identyfikatorem modelu i bez datowanych migawek do przypięcia. Dokumentacja obejmuje WebRTC, WebSockets oraz telefonię/SIP jako ścieżki połączenia, a opublikowany quickstart dotyczy budowy ścieżki WebRTC. Rozliczenia mają dwa liczniki i tylko jeden z nich odpowiada za głos: każde delegowane wywołanie rozumowania, wywołanie narzędzia i wyszukiwanie w sieci jest rozliczane według normalnych stawek modelu backendowego.

Architektura opiera się na delegacji. GPT-Live-1 prowadzi konwersację — decydując wiele razy na sekundę, czy dalej słuchać, czy wstrzymać, przerwać lub przekazać pracę — i przekazuje wszystko, co wymaga prawdziwego rozumowania, przez asynchroniczną granicę do osobnego backendu, który kontynuuje pracę, gdy rozmowa głosowa trwa. Dokumentacja definiuje dwa tryby: delegację Responses, w której Ope​nAI wywołuje za Ciebie obsługiwany model Responses i dostarcza kontekst rozmowy, oraz delegację po stronie klienta, w której Twoja własna aplikacja dostarcza backend i zachowuje kontrolę nad wykonaniem, kontekstem oraz tym, które wyniki trafiają do warstwy głosowej. W opublikowanym przykładzie Responses tym backendem jest GPT-5.6 Terra, wymieniony w delegacyjnym obiekcie wraz z jego własnymi instrukcjami i narzędziami. Na lipcowej premierze dla konsumentów był to GPT-5.5; społecznościowe opracowania od tego czasu wskazują na GPT-6 Astra.

A screenshot of Ope​nAI's developer documentation page 'Agents' under the API section, headed 'Choose a runtime, connect tools, and manage multi-step work', showing a routing row reading 'Run an agent with the Codex harness managed by Ope​nAI — Agents API', and a comparison table with columns Agents API, Agents SDK and Responses API whose rows read 'Where the agent runs: Ope​nAI runs a managed Codex harness', 'State between tasks: saved session configuration, turns, and items' and 'Execution environment: Ope​nAI hosted sandbox, self-hosted sandbox, or no sandbox'.

Każda kluczowa liczba dla warstwy głosowej pochodzi od samego OpenAI i w chwili pisania nie została niezależnie odtworzona przez nikogo: 80,1% w zakresie interaktywności w Full Duplex Bench v1.5 wobec 45,4% dla GPT-Realtime-2.1, 0,798 sekundy opóźnienia przełączania tur wobec 1,41 sekundy, 87% skuteczności wywoływania narzędzi oraz 32% wskaźnika zaliczeń w ocenie głosowego wsparcia bankowego wobec 12,4% dla modelu, który zastępuje. Ta ostatnia para jest uczciwa — duża poprawa, a mimo to system, który zawodzi w około dwóch trzecich regulowanego procesu. Istnieją dowody od klientów zewnętrznych, ale są skąpe i interesowne: Yelp w przypadku rezerwacji telefonicznych, EliseAI oraz platforma edukacyjna Speak zgłaszają blisko 80% mniej przerwań niż ich poprzedni stos oparty na turach.

Niezależny wynik jest mniej pochlebny i wart umieszczenia obok powyższej listy, a nie pod nią. W Artificial Analysis Speech to Speech Index — jednym zbiorczym wyniku obejmującym rozumowanie mowy, działanie agentowe, preferencje w arenie i skuteczność w zadaniach — GPT-Live-1 plasuje się na poziomie 69,8%, poniżej 73,9% GPT-Realtime-2.1 i znacznie poniżej 79,0% Grok Voice Think Fast 2.0. Zestawiając oba wyniki, kształt produktu staje się jasny: OpenAI zbudowało najlepszą dostępną mechanikę konwersacyjną, ale nie zbudowało najlepszego agenta głosowego, ponieważ rozumowanie jest delegowane do modelu, który indeks ocenia osobno.

A screenshot of the Artificial Analysis Speech to Speech Index chart, updated September 2026, ranking eleven speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success rate. Bars run left to right: Grok Voice Think Fast 2.0 at 79.0%, GPT-Realtime-2.1 at 73.9%, GPT-Realtime-2 at 73.6%, Grok Voice Think Fast at 72.3%, Gemini 3.1 Flash Live at 71.5%, GPT-Live-1 mini at 70.3%, GPT-Live-1 at 69.8%, Qwen-Audio-Omni at 66.8%, RealTime Omni at 64.2%, Qwen 3.x Omni at 63.9% and Gemini 2.5 Flash at 52.6%. Companion charts show time to first audio, where GPT-Live-1 sits mid-pack at 0.78 seconds, and cost per hour of input audio, where GPT-Live-1 is $4.42 against GPT-Realtime-2.1 at $10.75.

Te dwa ogłoszenia to jedno ogłoszenie

Czytane razem, te wydania opisują tę samą reorganizację z dwóch stron. Agents API przenosi pętlę, piaskownicę i zarządzanie kontekstem do hostowanego produktu. GPT-Live-1 przenosi warstwę konwersacyjną do cienkiego frontendu, który deleguje swoje myślenie gdzie indziej. W obu przypadkach model przestaje być tym, wokół czego się buduje, i staje się komponentem, który się wybiera — a w obu przypadkach wybór to wiersz konfiguracji, a nie zobowiązanie architektoniczne.

To dokładnie ta szczelina, w której osadza się warstwa routingu. OrcaRouter nie obsługuje gpt-live-1: endpoint Live Sessions należy wyłącznie do Ope​nAI i nie routujemy go w żadnym zakresie. Część dotycząca delegacji to inna historia. Backend, któremu warstwa głosowa przekazuje pracę, mówi językiem Responses API, a to zwykłe wywołanie modelu — model, który w swoim przykładzie wymienia Ope​nAI, GPT-5.6 Terra, jest dostępny przez OrcaRouter w cenie katalogowej Ope​nAI wynoszącej 2,00 USD za milion tokenów wejściowych i 12,00 USD za milion tokenów wyjściowych, z udostępnionym endpointem Responses. Delegacja po stronie klienta idzie dalej: pozwala Twojej aplikacji dostarczyć backend samodzielnie, co oznacza, że model stojący za głosem może być dowolnym endpointem, który kontrolujesz. To samo dotyczy slotu modelu w Agents API: harness należy do Ope​nAI, ale model w nim to wybór, który zachowujesz, a około 190 modeli od jedenastu dostawców upstream kryje się za jednym kluczem w cenie katalogowej dostawcy bez żadnej doliczonej marży.

Konkretnie wynikają z tego trzy rzeczy. Backendy można testować metodą A/B na ruchu na żywo, edytując jedną linię — w ten sposób sprawdzasz, czy tani moduł wnioskujący jest wystarczająco dobry, zanim przydzielisz mu linię telefoniczną. Przełączanie awaryjne może działać w ramach modelu delegowania, dzięki czemu zły dzień po stronie nadrzędnej nie pociąga za sobą zerwania rozmowy. A zadanie można uruchomić na kilku backendach w jednym wywołaniu przez DSL routingu albo zlecić jego odpowiedzenie panelowi modeli naraz za pomocą fuzji modeli — przydatne w momencie, gdy wynik działania agenta musi być godny zaufania, a nie tylko wygenerowany.

Czego nie ma w żadnym z wydań?

• Brak wprowadzania obrazu lub wideo w GPT-Live-1 — multimodalna powierzchnia głosowa, którą dysponują starsze tryby ChatGPT, wciąż pozostaje nierozwiązana.

• Brak ustrukturyzowanych danych wyjściowych w warstwie głosowej, więc argumenty narzędzi walidowane względem schematu muszą być wymuszane w modelu backendowym.

• Brak dostępu do GPT-Live-1 w warstwie darmowej, a limity szybkości są wyrażane w liczbie równoczesnych sesji — 25 na poziomie 1, rosnąc do 500 na poziomie 5.

• Brak Zero Data Retention i brak rezydencji danych poza USA w wersji beta Agents API.

• Brak niezależnego odtworzenia jakiegokolwiek wyniku benchmarku GPT-Live-1.

Zakład, który OpenAI zawarł 10 września, polega na tym, że deweloperzy chcą kupować uprząż i osobno wybierać mózg. Pierwsza połowa tego jest już osobną pozycją. Druga połowa to miejsce, w którym w ciągu najbliższych dwunastu miesięcy skupi się presja konkurencyjna — ponieważ hostowana uprząż z wymiennym slotem na model jest tylko tak dobra, jak modele, które można do niej włożyć, a obecnie to właśnie ten jeden element stosu, którego OpenAI nie kontroluje w pojedynkę.

Połowa związana z delegowaniem to inna historia — backend, któremu warstwa głosowa przekazuje pracę, to zwykłe wywołanie modelu, a GPT-5.6 Terrajest dostępny przez OrcaRouter w cenie katalogowej Ope​nAI, z udostępnionym endpointem Responses.