
Decisions API OpenAI: GPT-6 Luna przestaje rozmawiać i wybiera jedną odpowiedź
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 393 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 209 tok/s
- OrcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
GPT-6 Luna został udostępniony 22 września 2026 r. jako tani szczebel drabiny GPT-6 OpenAI. Nowością z 29 września jest zadanie dla niego, które nie ma nic wspólnego z rozmową. Decisions API OpenAI przyjmuje pytanie, które napisałeś, skończoną listę odpowiedzi, na które pozwalasz, oraz fragment kontekstu — tekst lub obraz — i zwraca jedną z tych odpowiedzi. Nie prozę. Nie akapit do przeanalizowania i liczenia na szczęście. Pojedynczy wybór, dzięki czemu zgłoszenie do pomocy technicznej trafia do jednej z pięciu kolejek, obraz ląduje w jednej kategorii moderacji albo agent wybiera swój następny ruch z polityki, którą zdefiniowałeś. Został ogłoszony na DevDay 2026 i jest teraz w ograniczonym podglądzie, a OpenAI zapowiada szerokie wydanie w najbliższych dniach.
Większość tego, czego zespół potrzebuje, zanim zacznie na tym budować, nie została jeszcze opublikowana. Nie ma ceny za wywołanie, nie podano limitu liczby odpowiedzi kandydujących, jakie może zawierać żądanie, nie ma żadnego oświadczenia, czy można dostroić to na własnych danych, a — według stanu na 30 września — nie ma o tym żadnego wpisu nigdzie w indeksie dokumentacji dla deweloperów OpenAI, dzienniku zmian ani dokumentacji API. Sprawdziliśmy wszystkie trzy. Ta możliwość istnieje obecnie w podsumowaniu DevDay OpenAI oraz w tym, co przedstawiciel OpenAI powiedział dziennikarzom w dniu premiery. Dlatego dalsza część tego artykułu wyraźnie rozdziela trzy poziomy: to, co OpenAI potwierdziło, to, co twierdzi jeden pomiar z dnia premiery, i to, czego nikt jeszcze nie może wiedzieć.
Czym właściwie jest decyzja z ograniczeniami
Dwa istniejące podejścia wykonują to zadanie źle, a Decisions API jest wymierzone w lukę między nimi. Pierwsze polega na promptowaniu modelu czatu: piszesz staranną instrukcję z prośbą o wybór z listy, on pisze ci zdanie, a jeśli masz szczęście, możesz odczytać prawdopodobieństwa tokenów z odpowiedzi, aby uzyskać coś, co przypomina wynik pewności. To działa, spala tokeny, a liczba określająca pewność jest zgrubnym oszacowaniem. Drugie to trenowanie małego klasyfikatora: szybkie, tanie, ale wymaga oznaczonych danych oraz ponownego trenowania za każdym razem, gdy zmienia się zestaw etykiet.
Model decyzyjny plasuje się pomiędzy nimi. Przyjmuje nowe etykiety w prompcie — tak samo, jak robi to prompt — ale zwraca wynik lub wybór, na podstawie którego programista może rozgałęzić logikę bez parsowania, a to właściwość, którą miał klasyfikator, a której model czatowy nigdy nie miał. OpenAI nie jest nowicjuszem w tej formie: jego API Moderation od lat zwraca wyniki dla poszczególnych kategorii zamiast tekstu, z jedną różnicą, która ma tu znaczenie. Kategorie w Moderation należą do OpenAI. Kategorie w Decisions API należą do ciebie.
Ograniczenie jest produktem i warto być precyzyjnym co do tego, co daje, a czego nie daje. Skończona przestrzeń wyjściowa oznacza, że każda dozwolona wartość jest znana z góry, więc twoja aplikacja może odrzucić odpowiedź, której nie zdefiniowała, przypisać inny poziom uprawnień do każdej gałęzi i przekazać sprawę człowiekowi, gdy pewność lub kontekst są zbyt słabe. Czyni to również ocenę offline wykonalną, ponieważ każdy przypadek testowy ma klasę docelową i mierzalny koszt w razie pomyłki. Czego natomiast nie daje, to poprawności. Ograniczony model nadal może wybrać niewłaściwą dozwoloną odpowiedź, dać się pokierować mylącym kontekstem albo odziedziczyć obciążenie kategorii, które zdefiniowałeś.
Twierdzenie o 150 milisekundach i liczba, której OpenAI nie opublikowało
OpenAI twierdzi, że Decisions API podejmuje decyzje około dziesięć razy szybciej niż GPT-6 Luna przez zwykłe API — rzędu 150 milisekund w porównaniu z około 1,6 sekundy. Ta liczba pochodzi od dostawcy i nie została odtworzona; w ciągu dwóch dni od premiery nie ma niezależnego pomiaru, a własne podsumowanie OpenAI mówi jedynie o „podejmowaniu decyzji w czasie rzeczywistym”. Liczbie tej nie towarzyszy żaden rozkład opóźnień, żaden region, żaden rozmiar danych wejściowych, żaden poziom współbieżności ani żadna umowa o poziomie usług.
Nasze własne dane o ruchu nie zastępują tego testu, ale wyjaśniają, dlaczego brakujący rozkład ma znaczenie. W ciągu siedmiu dni do 30 września GPT-6 Luna obsługiwany przez standardową trasę chat-completions OrcaRouter wykazuje medianę 699 milisekund i p95 wynoszący 7,6 sekundy w przypadku 3,23 miliarda tokenów mieszanego obciążenia — rozrzut większy niż rząd wielkości między środkiem a ogonem. To inny kształt żądania niż w przypadku ograniczonej decyzji, więc nie jest to porównanie z twierdzeniem o 150 ms. To dlatego pojedynczy nagłówkowy p50 to niewłaściwa liczba, wokół której należy projektować termin. Jeśli testujesz wersję zapoznawczą, zapisuj medianę, p95 i p99 oddzielnie dla danych wejściowych tekstowych i obrazowych, uwzględnij czas sieci i ponowne próby oraz zmierz termin, który faktycznie ma Twój produkt — decyzja o routingu dla kolejki asynchronicznej i ta znajdująca się między kliknięciem a płatnością nie mają wspólnego budżetu opóźnienia.

Cennik: ile kosztuje model bazowy i dlaczego nie jest to cena API
OpenAI nie opublikowało żadnej stawki dla Decisions API. Nie można też bezpiecznie zakładać, że mają zastosowanie stawki za tokeny Luna, ponieważ Decisions API to odrębny pakiet — inny endpoint z innymi limitami, a OpenAI zapowiedziało, że podzieli się większą liczbą szczegółów „przy szerokim wdrożeniu”. Każdy, kto podaje ci obecnie koszt za decyzję, wyciąga go w drodze domysłów.
To, co zostało opublikowane, to cennik dla modelu, na którym jest oparty, odczytany ze strony z cennikiem OpenAI w dniu 30 września 2026 r.:
• Dane wejściowe — 0,10 USD za milion tokenów, a powyżej 272 000 tokenów wejściowych stawka rośnie do 0,20 USD
• Dane wyjściowe — 0,50 USD za milion tokenów, a powyżej 272 000 tokenów wejściowych stawka rośnie do 0,75 USD
• Dane wejściowe z pamięci podręcznej — 0,01 USD za milion tokenów; zapisy do pamięci podręcznej są rozliczane po 0,125 USD, co stanowi 25% narzutu w stosunku do stawki bez pamięci podręcznej
• Przetwarzanie Batch i Flex — 50% stawek standardowych; tryb Fast — 2x obowiązujących stawek
Próg długiego kontekstu to ten, na którym ludzie się potykają, i działa dokładnie tak samo jak w całej rodzinie GPT-6: przekroczenie 272 000 tokenów wejściowych powoduje naliczenie wyższej stawki za całe żądanie, a nie tylko za nadwyżkę. API decyzyjne, które przekazuje modelowi długi dokument lub duży zestaw obrazów, to dokładnie ten rodzaj wywołania, który może przekroczyć tę granicę – a to kolejna rzecz, którą pozostawiają otwartą niepublikowane limity wersji zapoznawczej.
GPT-6 Luna na własnych zasadach
Oderwij API, a model pod spodem to model rozumujący na najniższym szczeblu rodziny o trzech szczeblach — poniżej GPT-6 Sol za $2.00/$10.00 i flagowego GPT-6 Astra za $10.00/$50.00 — z oknem kontekstowym 1 050 000 tokenów, limitem wyjściowym 128 000 tokenów, datą graniczną wiedzy 18 maja 2026 r. i wysiłkiem rozumowania ustawianym na jednej z sześciu wartości od none do max. Przyjmuje dane tekstowe i obrazowe, a zwraca tekst, a w dokumentacji deweloperskiej OpenAI domyślna wartość wysiłku to medium. Jedno praktyczne zastrzeżenie z tej samej strony, niezwiązane z Decisions API, ale istotne, jeśli podłączasz Lunę jako rozwiązanie zapasowe: w Chat Completions wywoływanie funkcji działa tylko wtedy, gdy wysiłek rozumowania jest ustawiony na none. Narzędzia przy każdym innym ustawieniu wysiłku wymagają Responses API.
Jeśli chodzi o jakość, niezależnym wskaźnikiem jest Intelligence Index firmy Artificial Analysis na poziomie 37,3 dla Luna przy maksymalnym wysiłku, w porównaniu z 47,5 dla GPT-6 Sol — różnica około dziesięciu punktów, co jest uczciwym sposobem interpretacji dwudziestokrotnej różnicy cen na wejściu. Żadna z tych liczb nie mówi nic o Decisions API, którego ograniczone zadanie jest zupełnie innym pomiarem i nie ma opublikowanego wyniku.

Jev, Laya i ujęcie „system one”
API Decisions nie pojawiło się na pustym polu. Model TypeSafe AI, Jev, wypuszczony 15 września 2026 r. przez Diogo Almeidę i powszechnie dostępny od 21 września, to ten, który uczynił tę kategorię czytelną dla deweloperów: nie generuje on żadnego tekstu, lecz zwraca zamiast tego typowane odpowiedzi z wartościami pewności, w cenie 0,042 USD za milion tokenów wejściowych, przy zerowej stawce za wyjście. Pierwsze niezależne testy Jeva, przeprowadzone przez Every, wykonały 777 rozstrzygnięć w 37 dokumentach w niecałe 0,7 sekundy za około ćwierć centa, a drugi test zmierzył medianę 0,35 sekundy na fragment wobec 8,83 sekundy dla Claude Fable 5.1 przy wysokim wysiłku — około 25 razy szybciej przy koszcie stanowiącym mniej więcej 1/580 — przy czym wychwycił sześć z siedmiu celowo umieszczonych defektów, podczas gdy Fable 5 wychwycił wszystkie siedem. „Dobry, ale nie doskonały" — tak brzmiał werdykt Every i to właściwy jednowierszowy odczyt. Laya to trzeci gracz tego samego kształtu: model decyzyjny, który odpowiada, nie zapisując ani jednego tokenu.
To, czy OpenAI zbudowało Decisions API z powodu Jev, jest spekulacją. The New Stack, relacjonując to w dniu premiery, uznał reakcję na TypeSafe za „prawdopodobną” i zauważył, że OpenAI prawdopodobnie przyspieszyło ogłoszenie przed DevDay; OpenAI nie powiedziało nic takiego, a zbieżność terminów — ogólna dostępność Jev 21 września, DevDay 29 września — jest wymowna, ale nie stanowi dowodu. Spekulacją nie jest to, że te dwa rozwiązania nie są jeszcze porównywalne na osi istotnej dla kupujących. Jev publikuje cenę, strukturę opłat za wywołanie i datę GA. Decisions API nie publikuje żadnej z tych trzech rzeczy.
Gdzie to działa i co trzymać w cieple obok tego
Decisions API to własne opakowanie OpenAI. Nie jest to model z naszego katalogu i nie kierujemy do niego ruchu, więc jeśli chcesz korzystać z tego konkretnego punktu końcowego, znajdziesz go u OpenAI. Model, na którym jest zbudowany, to inna sprawa: GPT-6 Luna to aktywna trasa w OrcaRouter w cenie katalogowej OpenAI z zerowym narzutem — 0,10 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych, a dla progu powyżej 272 tys. tokenów stawki wynoszą 0,20/0,75 USD — a przez siedem dni do 30 września obsłużył za naszym pośrednictwem 3,23 mld tokenów przy wskaźniku błędów 0,18%.
To ma znaczenie dla tego, jak ograniczasz ryzyko związane z wersją zapoznawczą. Rozsądnym sposobem testowania punktu końcowego do podejmowania ograniczonych decyzji jest utrzymywanie ścieżki opartej na promptach jako ścieżki awaryjnej, ponieważ wersja zapoznawcza może zmienić limity lub ceny bez uprzedzenia, a decyzja leżąca na ścieżce krytycznej potrzebuje miejsca, do którego może trafić. Utrzymanie tej ścieżki awaryjnej na tym samym kluczu co pozostałe modele oznacza brak drugiej umowy i brak zmian w kodzie ścieżki awaryjnej: jedno API dla ponad 200 modeli, z automatycznym przełączaniem awaryjnym między dostawcami, gdy któryś z nich zaczyna szwankować. A jeśli twoja decyzja jest jednym krokiem dłuższego łańcucha, DSL routingu komponuje modele w jedno wywołanie, co jest dokładnie wzorcem orkiestratora plus decydenta spopularyzowanym przez Jev coverage — większy model planuje, mały model wybiera każdy krok. Ten wzorzec da się dziś zbudować z modeli, które obsługujemy; samo Decisions API znalazłoby się poza nim, dopóki OpenAI go nie otworzy.
Kto powinien się ruszyć, a kto powinien czekać
Jeśli Twój problem to zadanie klasyfikacji lub routingu o dużym wolumenie, w którym błędna gałąź jest tania i odwracalna, wersja zapoznawcza jest warta w tym tygodniu opracowania kształtu żądania i oznaczonego zbioru — ta możliwość jest realna, to ograniczenie jest prawdziwą poprawą względem parsowania prozy, a wersja zapoznawcza to najtańszy możliwy moment, by dowiedzieć się, gdzie materializują się koszty jej błędów. Jeśli Twoja decyzja autoryzuje przepływ pieniędzy, wysyła wiadomość do klienta albo znajduje się między użytkownikiem a płatnością, nic w tym tygodniu nie zmienia Twoich kalkulacji: nie ma opublikowanej ceny, którą można modelować, opublikowanego limitu, wokół którego można projektować, nie ma SLA ani słowa o tym, czy można dostroić ten mechanizm na własnych danych. Te cztery luki to właśnie to, co musi wypełnić „szerokie wdrożenie”, a dopóki OpenAI ich nie nazwie, uczciwa interpretacja Decisions API to obiecujący interfejs z szybkim zegarem deklarowanym przez dostawcę i bez dołączonego rachunku.

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
