
Wrześniowy Dzień Platformy OpenAI: GPT-Live-1 trafia do API, gdy Agents API wchodzi w fazę beta
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Dwie rzeczy opuściły platformę OpenAI 10 września 2026 r., a ta cichsza ma większy zasięg rażenia. GPT-Live-1 — model głosowy pełnodupleksowy, który działa w ChatGPT od 8 lipca — jest teraz dostępny dla deweloperów za 0,05 USD za minutę głosu. Obok niego, i wspomniany znacznie rzadziej w relacjach, Agents API wszedł do publicznej bety: ten sam mechanizm, który obsługuje Codex, udostępniony jako hostowany produkt z zarządzanymi piaskownicami. Jedno to lepszy głos. Drugie to OpenAI sprzedające to, co kiedyś było najtrudniejszą częścią budowania agenta.
Jedno i drugie odczytano ze źródeł pierwotnych do tego tekstu: ogłoszenia OpenAI o Agents API, jego wpisu na forum społeczności deweloperskiej wprowadzającego GPT-Live-1 do API oraz dokumentacji deweloperskiej dla obu. Jeśli liczba pochodzi od OpenAI, a nie od zewnętrznego ewaluatora, została poniżej oznaczona jako taka — a jedna wartość rzeczywiście pochodzi z zewnątrz, co nieco zmienia historię.

Artificial Analysis zaczęło w tym roku publikować Indeks Mowa do Mowy, a GPT-Live-1 ma w nim swój wiersz: 69,8% — średnia ważona obejmująca rozumowanie głosowe, skuteczność agentową, preferencje w arenie i powodzenie w zadaniach. Daje mu to siódme miejsce wśród jedenastu ocenianych modeli — za GPT-Realtime-2.1 z wynikiem 73,9%, czyli modelem, który zastępuje, oraz za Grok Voice Think Fast 2.0 z wynikiem 79,0%. Niezależna tablica wyników i własna tabela testów OpenAI nie opowiadają tej samej historii, a prawdziwe są obie.
Co zostało wydane, w kolejności, w jakiej zmieni to twoją architekturę
• Głos — GPT-Live-1 jest dostępny w API jako gpt-live-1, rozliczany po $0,05 za minutę głosu, naliczany co sekundę, a model rozumowania po stronie zaplecza rozliczany jest osobno według własnych stawek.
• Agenci — API Agents jest w publicznej becie. OpenAI twierdzi, że nie ma dodatkowej opłaty za samo API; płacisz za tokeny modelu, narzędzia i czas hostowanego kontenera sandbox.
• Sandboxy — OpenAI hostuje teraz środowisko wykonawcze, ponownie wykorzystując tę samą infrastrukturę sandboxingu co Codex i ChatGPT, konfigurowalne za pomocą plików, pakietów, umiejętności i wtyczek.
• Środowiska — oprócz własnego sandboxa OpenAI, zespoły mogą kierować agentów do własnej infrastruktury lub do zewnętrznych dostawców sandboxów z listy partnerów beta.
Wydanie głosowe to historia modelu. Agents API to historia platformy, a historie platformowe to te, które po cichu na nowo ukierunkowują bazę kodu.
Agents API: agent w jednym żądaniu POST
Podstawowe wywołanie to POST /v1/agents/sessions, wysyłane z nagłówkiem OpenAI-Beta: agents=v1, a obietnica jest taka, że zadanie, model, narzędzia i środowisko wystarczą, aby otrzymać działającego agenta. Zestawy SDK obejmują Pythona, TypeScript/JavaScript, Go, Javę i Ruby.
To, co czyni go czymś więcej niż wrapperem, to fakt, że OpenAI obsługuje ten harness, zamiast go dostarczać. Harness AgentKit jest open source i można go analizować, ale działająca kopia należy do OpenAI — kompaktowanie kontekstu w długich sesjach, wyszukiwanie narzędzi, programowe wywoływanie narzędzi, obsługa MCP, funkcje niestandardowe, wbudowane wyszukiwanie w sieci i orkiestracja podagentów z konfigurowalną współbieżnością. Wersjonowane możliwości harnessu pojawiają się równolegle z premierami modeli, co jest ciekawym zobowiązaniem: ta struktura pomocnicza rozwija się w tym samym tempie co modele.
Dla każdego, kto spędził kwartał, utrzymując pętlę — logikę ponownych prób, przycinanie kontekstu, routing narzędzi, fan-out podagentów, w którym zawsze wycieka stan — to jest właściwy produkt. Nie wywołanie modelu. Ta hydraulika wokół tego, której już nie piszesz.
Hostowane sandboxy to ta część, do której dołączony jest rachunek.
Agenty, które wykonują kod, potrzebują miejsca, w którym mogą go wykonać, a wersja beta dostarcza własną odpowiedź OpenAI: zarządzaną piaskownicę, która uruchamia kod, pracuje na plikach i tworzy artefakty, konfigurowalną za pomocą pakietów, umiejętności i wtyczek. Deweloperzy, którzy mają już wzmocnione środowisko wykonawcze, nie są do niej zmuszani — bring-your-own-infrastructure oraz zestaw nazwanych partnerów piaskownic są dostępne w wersji beta.
Dwa zastrzeżenia operacyjne warto odnotować, zanim zaczniesz na tym budować. Rezydencja danych w wersji beta jest ograniczona do USA, a Zero Data Retention nie jest obsługiwane. W przypadku obciążenia podlegającego regulacjom te dwa zdania decydują, czy będzie to pilotaż, czy ścieżka produkcyjna, i to są szczegóły, które zwykle odkrywa się późno.
GPT-Live-1 w API: stała opłata za minutę to prawdziwa zmiana
Sam model głosowy nie jest nowy — 8 lipca zastąpił Advanced Voice Mode w ChatGPT — nowa jest natomiast jego forma komercyjna. W ramach linii Realtime dźwięk był rozliczany w tokenach, co oznaczało, że prognozowanie kosztów połączenia wymagało modelowania zużycia audio: ile tokenów kosztuje sekunda ciszy, jak rozmówca mówiący równocześnie z agentem zmienia długość odpowiedzi. Stała stawka 0,05 USD za minutę głosu sprowadza to do mnożenia. Godzina nieprzerwanego otwartego połączenia to 3,00 USD. Przy średniej czterech minut na rozmowę i tysiącu rozmów dziennie daje to około 200 USD dziennie.
Sesje działają z punktu końcowego Live Sessions z jednym identyfikatorem modelu i bez datowanych migawek do przypięcia. Dokumentacja obejmuje WebRTC, WebSockets oraz telefonię/SIP jako ścieżki połączenia, a opublikowany quickstart dotyczy budowy ścieżki WebRTC. Rozliczenia mają dwa liczniki i tylko jeden z nich odpowiada za głos: każde delegowane wywołanie rozumowania, wywołanie narzędzia i wyszukiwanie w sieci jest rozliczane według normalnych stawek modelu backendowego.
Architektura opiera się na delegacji. GPT-Live-1 prowadzi konwersację — decydując wiele razy na sekundę, czy dalej słuchać, czy wstrzymać, przerwać lub przekazać pracę — i przekazuje wszystko, co wymaga prawdziwego rozumowania, przez asynchroniczną granicę do osobnego backendu, który kontynuuje pracę, gdy rozmowa głosowa trwa. Dokumentacja definiuje dwa tryby: delegację Responses, w której OpenAI wywołuje za Ciebie obsługiwany model Responses i dostarcza kontekst rozmowy, oraz delegację po stronie klienta, w której Twoja własna aplikacja dostarcza backend i zachowuje kontrolę nad wykonaniem, kontekstem oraz tym, które wyniki trafiają do warstwy głosowej. W opublikowanym przykładzie Responses tym backendem jest GPT-5.6 Terra, wymieniony w delegacyjnym obiekcie wraz z jego własnymi instrukcjami i narzędziami. Na lipcowej premierze dla konsumentów był to GPT-5.5; społecznościowe opracowania od tego czasu wskazują na GPT-6 Astra.

Każda kluczowa liczba dla warstwy głosowej pochodzi od samego OpenAI i w chwili pisania nie została niezależnie odtworzona przez nikogo: 80,1% w zakresie interaktywności w Full Duplex Bench v1.5 wobec 45,4% dla GPT-Realtime-2.1, 0,798 sekundy opóźnienia przełączania tur wobec 1,41 sekundy, 87% skuteczności wywoływania narzędzi oraz 32% wskaźnika zaliczeń w ocenie głosowego wsparcia bankowego wobec 12,4% dla modelu, który zastępuje. Ta ostatnia para jest uczciwa — duża poprawa, a mimo to system, który zawodzi w około dwóch trzecich regulowanego procesu. Istnieją dowody od klientów zewnętrznych, ale są skąpe i interesowne: Yelp w przypadku rezerwacji telefonicznych, EliseAI oraz platforma edukacyjna Speak zgłaszają blisko 80% mniej przerwań niż ich poprzedni stos oparty na turach.
Niezależny wynik jest mniej pochlebny i wart umieszczenia obok powyższej listy, a nie pod nią. W Artificial Analysis Speech to Speech Index — jednym zbiorczym wyniku obejmującym rozumowanie mowy, działanie agentowe, preferencje w arenie i skuteczność w zadaniach — GPT-Live-1 plasuje się na poziomie 69,8%, poniżej 73,9% GPT-Realtime-2.1 i znacznie poniżej 79,0% Grok Voice Think Fast 2.0. Zestawiając oba wyniki, kształt produktu staje się jasny: OpenAI zbudowało najlepszą dostępną mechanikę konwersacyjną, ale nie zbudowało najlepszego agenta głosowego, ponieważ rozumowanie jest delegowane do modelu, który indeks ocenia osobno.

Te dwa ogłoszenia to jedno ogłoszenie
Czytane razem, te wydania opisują tę samą reorganizację z dwóch stron. Agents API przenosi pętlę, piaskownicę i zarządzanie kontekstem do hostowanego produktu. GPT-Live-1 przenosi warstwę konwersacyjną do cienkiego frontendu, który deleguje swoje myślenie gdzie indziej. W obu przypadkach model przestaje być tym, wokół czego się buduje, i staje się komponentem, który się wybiera — a w obu przypadkach wybór to wiersz konfiguracji, a nie zobowiązanie architektoniczne.
To dokładnie ta szczelina, w której osadza się warstwa routingu. OrcaRouter nie obsługuje gpt-live-1: endpoint Live Sessions należy wyłącznie do OpenAI i nie routujemy go w żadnym zakresie. Część dotycząca delegacji to inna historia. Backend, któremu warstwa głosowa przekazuje pracę, mówi językiem Responses API, a to zwykłe wywołanie modelu — model, który w swoim przykładzie wymienia OpenAI, GPT-5.6 Terra, jest dostępny przez OrcaRouter w cenie katalogowej OpenAI wynoszącej 2,00 USD za milion tokenów wejściowych i 12,00 USD za milion tokenów wyjściowych, z udostępnionym endpointem Responses. Delegacja po stronie klienta idzie dalej: pozwala Twojej aplikacji dostarczyć backend samodzielnie, co oznacza, że model stojący za głosem może być dowolnym endpointem, który kontrolujesz. To samo dotyczy slotu modelu w Agents API: harness należy do OpenAI, ale model w nim to wybór, który zachowujesz, a około 190 modeli od jedenastu dostawców upstream kryje się za jednym kluczem w cenie katalogowej dostawcy bez żadnej doliczonej marży.
Konkretnie wynikają z tego trzy rzeczy. Backendy można testować metodą A/B na ruchu na żywo, edytując jedną linię — w ten sposób sprawdzasz, czy tani moduł wnioskujący jest wystarczająco dobry, zanim przydzielisz mu linię telefoniczną. Przełączanie awaryjne może działać w ramach modelu delegowania, dzięki czemu zły dzień po stronie nadrzędnej nie pociąga za sobą zerwania rozmowy. A zadanie można uruchomić na kilku backendach w jednym wywołaniu przez DSL routingu albo zlecić jego odpowiedzenie panelowi modeli naraz za pomocą fuzji modeli — przydatne w momencie, gdy wynik działania agenta musi być godny zaufania, a nie tylko wygenerowany.
Czego nie ma w żadnym z wydań?
• Brak wprowadzania obrazu lub wideo w GPT-Live-1 — multimodalna powierzchnia głosowa, którą dysponują starsze tryby ChatGPT, wciąż pozostaje nierozwiązana.
• Brak ustrukturyzowanych danych wyjściowych w warstwie głosowej, więc argumenty narzędzi walidowane względem schematu muszą być wymuszane w modelu backendowym.
• Brak dostępu do GPT-Live-1 w warstwie darmowej, a limity szybkości są wyrażane w liczbie równoczesnych sesji — 25 na poziomie 1, rosnąc do 500 na poziomie 5.
• Brak Zero Data Retention i brak rezydencji danych poza USA w wersji beta Agents API.
• Brak niezależnego odtworzenia jakiegokolwiek wyniku benchmarku GPT-Live-1.
Zakład, który OpenAI zawarł 10 września, polega na tym, że deweloperzy chcą kupować uprząż i osobno wybierać mózg. Pierwsza połowa tego jest już osobną pozycją. Druga połowa to miejsce, w którym w ciągu najbliższych dwunastu miesięcy skupi się presja konkurencyjna — ponieważ hostowana uprząż z wymiennym slotem na model jest tylko tak dobra, jak modele, które można do niej włożyć, a obecnie to właśnie ten jeden element stosu, którego OpenAI nie kontroluje w pojedynkę.
Połowa związana z delegowaniem to inna historia — backend, któremu warstwa głosowa przekazuje pracę, to zwykłe wywołanie modelu, a GPT-5.6 Terrajest dostępny przez OrcaRouter w cenie katalogowej OpenAI, z udostępnionym endpointem Responses.
