Główna karta tytułowa z napisem „OpenAI's Decisions API”, z podtytułem „GPT-6 Luna przestaje rozmawiać i wybiera jedną odpowiedź”, z trzema zaokrąglonymi kartami o treści „Jedna odpowiedź z listy, którą zdefiniujesz”, „Podane przez dostawcę ~150 ms” i „Brak opublikowanej ceny”, stopka z napisem „Dane liczbowe OpenAI pochodzą od dostawcy; brak jeszcze niezależnego pomiaru.”, a logo OrcaRouter wkomponowane w prawym dolnym rogu.
Guides & Insights

Decisions API OpenAI: GPT-6 Luna przestaje rozmawiać i wybiera jedną odpowiedź

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

GPT-6 Luna został udostępniony 22 września 2026 r. jako tani szczebel drabiny GPT-6 OpenAI. Nowością z 29 września jest zadanie dla niego, które nie ma nic wspólnego z rozmową. Decisions API OpenAI przyjmuje pytanie, które napisałeś, skończoną listę odpowiedzi, na które pozwalasz, oraz fragment kontekstu — tekst lub obraz — i zwraca jedną z tych odpowiedzi. Nie prozę. Nie akapit do przeanalizowania i liczenia na szczęście. Pojedynczy wybór, dzięki czemu zgłoszenie do pomocy technicznej trafia do jednej z pięciu kolejek, obraz ląduje w jednej kategorii moderacji albo agent wybiera swój następny ruch z polityki, którą zdefiniowałeś. Został ogłoszony na DevDay 2026 i jest teraz w ograniczonym podglądzie, a OpenAI zapowiada szerokie wydanie w najbliższych dniach.

Większość tego, czego zespół potrzebuje, zanim zacznie na tym budować, nie została jeszcze opublikowana. Nie ma ceny za wywołanie, nie podano limitu liczby odpowiedzi kandydujących, jakie może zawierać żądanie, nie ma żadnego oświadczenia, czy można dostroić to na własnych danych, a — według stanu na 30 września — nie ma o tym żadnego wpisu nigdzie w indeksie dokumentacji dla deweloperów OpenAI, dzienniku zmian ani dokumentacji API. Sprawdziliśmy wszystkie trzy. Ta możliwość istnieje obecnie w podsumowaniu DevDay OpenAI oraz w tym, co przedstawiciel OpenAI powiedział dziennikarzom w dniu premiery. Dlatego dalsza część tego artykułu wyraźnie rozdziela trzy poziomy: to, co OpenAI potwierdziło, to, co twierdzi jeden pomiar z dnia premiery, i to, czego nikt jeszcze nie może wiedzieć.

Czym właściwie jest decyzja z ograniczeniami

Dwa istniejące podejścia wykonują to zadanie źle, a Decisions API jest wymierzone w lukę między nimi. Pierwsze polega na promptowaniu modelu czatu: piszesz staranną instrukcję z prośbą o wybór z listy, on pisze ci zdanie, a jeśli masz szczęście, możesz odczytać prawdopodobieństwa tokenów z odpowiedzi, aby uzyskać coś, co przypomina wynik pewności. To działa, spala tokeny, a liczba określająca pewność jest zgrubnym oszacowaniem. Drugie to trenowanie małego klasyfikatora: szybkie, tanie, ale wymaga oznaczonych danych oraz ponownego trenowania za każdym razem, gdy zmienia się zestaw etykiet.

Model decyzyjny plasuje się pomiędzy nimi. Przyjmuje nowe etykiety w prompcie — tak samo, jak robi to prompt — ale zwraca wynik lub wybór, na podstawie którego programista może rozgałęzić logikę bez parsowania, a to właściwość, którą miał klasyfikator, a której model czatowy nigdy nie miał. OpenAI nie jest nowicjuszem w tej formie: jego API Moderation od lat zwraca wyniki dla poszczególnych kategorii zamiast tekstu, z jedną różnicą, która ma tu znaczenie. Kategorie w Moderation należą do OpenAI. Kategorie w Decisions API należą do ciebie.

Ograniczenie jest produktem i warto być precyzyjnym co do tego, co daje, a czego nie daje. Skończona przestrzeń wyjściowa oznacza, że każda dozwolona wartość jest znana z góry, więc twoja aplikacja może odrzucić odpowiedź, której nie zdefiniowała, przypisać inny poziom uprawnień do każdej gałęzi i przekazać sprawę człowiekowi, gdy pewność lub kontekst są zbyt słabe. Czyni to również ocenę offline wykonalną, ponieważ każdy przypadek testowy ma klasę docelową i mierzalny koszt w razie pomyłki. Czego natomiast nie daje, to poprawności. Ograniczony model nadal może wybrać niewłaściwą dozwoloną odpowiedź, dać się pokierować mylącym kontekstem albo odziedziczyć obciążenie kategorii, które zdefiniowałeś.

Twierdzenie o 150 milisekundach i liczba, której OpenAI nie opublikowało

OpenAI twierdzi, że Decisions API podejmuje decyzje około dziesięć razy szybciej niż GPT-6 Luna przez zwykłe API — rzędu 150 milisekund w porównaniu z około 1,6 sekundy. Ta liczba pochodzi od dostawcy i nie została odtworzona; w ciągu dwóch dni od premiery nie ma niezależnego pomiaru, a własne podsumowanie OpenAI mówi jedynie o „podejmowaniu decyzji w czasie rzeczywistym”. Liczbie tej nie towarzyszy żaden rozkład opóźnień, żaden region, żaden rozmiar danych wejściowych, żaden poziom współbieżności ani żadna umowa o poziomie usług.

Nasze własne dane o ruchu nie zastępują tego testu, ale wyjaśniają, dlaczego brakujący rozkład ma znaczenie. W ciągu siedmiu dni do 30 września GPT-6 Luna obsługiwany przez standardową trasę chat-completions OrcaRouter wykazuje medianę 699 milisekund i p95 wynoszący 7,6 sekundy w przypadku 3,23 miliarda tokenów mieszanego obciążenia — rozrzut większy niż rząd wielkości między środkiem a ogonem. To inny kształt żądania niż w przypadku ograniczonej decyzji, więc nie jest to porównanie z twierdzeniem o 150 ms. To dlatego pojedynczy nagłówkowy p50 to niewłaściwa liczba, wokół której należy projektować termin. Jeśli testujesz wersję zapoznawczą, zapisuj medianę, p95 i p99 oddzielnie dla danych wejściowych tekstowych i obrazowych, uwzględnij czas sieci i ponowne próby oraz zmierz termin, który faktycznie ma Twój produkt — decyzja o routingu dla kolejki asynchronicznej i ta znajdująca się między kliknięciem a płatnością nie mają wspólnego budżetu opóźnienia.

A single-column scoreboard titled 'GPT-6 Luna and the Decisions API - the scoreboard' with six rows: Decisions API price 'not published', candidate-answer limit 'not published', fine-tuning on your data 'no statement', stated decision latency '~150 ms vendor-reported', GPT-6 Luna input / output '$0.10 / $0.50 per 1M', and AA Intelligence Index at max effort '37.3', with a footer reading 'OpenAI figures vendor-reported; Index per Artificial Analysis; unpublished means blank, not zero.' and the OrcaRouter logo composited in the bottom-right corner.

Cennik: ile kosztuje model bazowy i dlaczego nie jest to cena API

OpenAI nie opublikowało żadnej stawki dla Decisions API. Nie można też bezpiecznie zakładać, że mają zastosowanie stawki za tokeny Luna, ponieważ Decisions API to odrębny pakiet — inny endpoint z innymi limitami, a OpenAI zapowiedziało, że podzieli się większą liczbą szczegółów „przy szerokim wdrożeniu”. Każdy, kto podaje ci obecnie koszt za decyzję, wyciąga go w drodze domysłów.

To, co zostało opublikowane, to cennik dla modelu, na którym jest oparty, odczytany ze strony z cennikiem OpenAI w dniu 30 września 2026 r.:

• Dane wejściowe — 0,10 USD za milion tokenów, a powyżej 272 000 tokenów wejściowych stawka rośnie do 0,20 USD
• Dane wyjściowe — 0,50 USD za milion tokenów, a powyżej 272 000 tokenów wejściowych stawka rośnie do 0,75 USD
• Dane wejściowe z pamięci podręcznej — 0,01 USD za milion tokenów; zapisy do pamięci podręcznej są rozliczane po 0,125 USD, co stanowi 25% narzutu w stosunku do stawki bez pamięci podręcznej
• Przetwarzanie Batch i Flex — 50% stawek standardowych; tryb Fast — 2x obowiązujących stawek

Próg długiego kontekstu to ten, na którym ludzie się potykają, i działa dokładnie tak samo jak w całej rodzinie GPT-6: przekroczenie 272 000 tokenów wejściowych powoduje naliczenie wyższej stawki za całe żądanie, a nie tylko za nadwyżkę. API decyzyjne, które przekazuje modelowi długi dokument lub duży zestaw obrazów, to dokładnie ten rodzaj wywołania, który może przekroczyć tę granicę – a to kolejna rzecz, którą pozostawiają otwartą niepublikowane limity wersji zapoznawczej.

GPT-6 Luna na własnych zasadach

Oderwij API, a model pod spodem to model rozumujący na najniższym szczeblu rodziny o trzech szczeblach — poniżej GPT-6 Sol za $2.00/$10.00 i flagowego GPT-6 Astra za $10.00/$50.00 — z oknem kontekstowym 1 050 000 tokenów, limitem wyjściowym 128 000 tokenów, datą graniczną wiedzy 18 maja 2026 r. i wysiłkiem rozumowania ustawianym na jednej z sześciu wartości od none do max. Przyjmuje dane tekstowe i obrazowe, a zwraca tekst, a w dokumentacji deweloperskiej OpenAI domyślna wartość wysiłku to medium. Jedno praktyczne zastrzeżenie z tej samej strony, niezwiązane z Decisions API, ale istotne, jeśli podłączasz Lunę jako rozwiązanie zapasowe: w Chat Completions wywoływanie funkcji działa tylko wtedy, gdy wysiłek rozumowania jest ustawiony na none. Narzędzia przy każdym innym ustawieniu wysiłku wymagają Responses API.

Jeśli chodzi o jakość, niezależnym wskaźnikiem jest Intelligence Index firmy Artificial Analysis na poziomie 37,3 dla Luna przy maksymalnym wysiłku, w porównaniu z 47,5 dla GPT-6 Sol — różnica około dziesięciu punktów, co jest uczciwym sposobem interpretacji dwudziestokrotnej różnicy cen na wejściu. Żadna z tych liczb nie mówi nic o Decisions API, którego ograniczone zadanie jest zupełnie innym pomiarem i nie ma opublikowanego wyniku.

OpenAI's developer documentation page for the gpt-6-luna model, showing the model heading with compare and playground controls, the reasoning, speed and price tiles, the '$0.1 - $0.5' price range, text and image input with text output, a 1,050,000-token context window, a 128,000-token maximum output, a May 18 2026 knowledge cutoff, the note that reasoning.effort supports none, low, medium (default), high, xhigh and max, and the note that Chat Completions supports function calling only with reasoning effort set to none.

Jev, Laya i ujęcie „system one”

API Decisions nie pojawiło się na pustym polu. Model TypeSafe AI, Jev, wypuszczony 15 września 2026 r. przez Diogo Almeidę i powszechnie dostępny od 21 września, to ten, który uczynił tę kategorię czytelną dla deweloperów: nie generuje on żadnego tekstu, lecz zwraca zamiast tego typowane odpowiedzi z wartościami pewności, w cenie 0,042 USD za milion tokenów wejściowych, przy zerowej stawce za wyjście. Pierwsze niezależne testy Jeva, przeprowadzone przez Every, wykonały 777 rozstrzygnięć w 37 dokumentach w niecałe 0,7 sekundy za około ćwierć centa, a drugi test zmierzył medianę 0,35 sekundy na fragment wobec 8,83 sekundy dla Claude Fable 5.1 przy wysokim wysiłku — około 25 razy szybciej przy koszcie stanowiącym mniej więcej 1/580 — przy czym wychwycił sześć z siedmiu celowo umieszczonych defektów, podczas gdy Fable 5 wychwycił wszystkie siedem. „Dobry, ale nie doskonały" — tak brzmiał werdykt Every i to właściwy jednowierszowy odczyt. Laya to trzeci gracz tego samego kształtu: model decyzyjny, który odpowiada, nie zapisując ani jednego tokenu.

To, czy OpenAI zbudowało Decisions API z powodu Jev, jest spekulacją. The New Stack, relacjonując to w dniu premiery, uznał reakcję na TypeSafe za „prawdopodobną” i zauważył, że OpenAI prawdopodobnie przyspieszyło ogłoszenie przed DevDay; OpenAI nie powiedziało nic takiego, a zbieżność terminów — ogólna dostępność Jev 21 września, DevDay 29 września — jest wymowna, ale nie stanowi dowodu. Spekulacją nie jest to, że te dwa rozwiązania nie są jeszcze porównywalne na osi istotnej dla kupujących. Jev publikuje cenę, strukturę opłat za wywołanie i datę GA. Decisions API nie publikuje żadnej z tych trzech rzeczy.

Gdzie to działa i co trzymać w cieple obok tego

Decisions API to własne opakowanie OpenAI. Nie jest to model z naszego katalogu i nie kierujemy do niego ruchu, więc jeśli chcesz korzystać z tego konkretnego punktu końcowego, znajdziesz go u OpenAI. Model, na którym jest zbudowany, to inna sprawa: GPT-6 Luna to aktywna trasa w OrcaRouter w cenie katalogowej OpenAI z zerowym narzutem — 0,10 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych, a dla progu powyżej 272 tys. tokenów stawki wynoszą 0,20/0,75 USD — a przez siedem dni do 30 września obsłużył za naszym pośrednictwem 3,23 mld tokenów przy wskaźniku błędów 0,18%.

To ma znaczenie dla tego, jak ograniczasz ryzyko związane z wersją zapoznawczą. Rozsądnym sposobem testowania punktu końcowego do podejmowania ograniczonych decyzji jest utrzymywanie ścieżki opartej na promptach jako ścieżki awaryjnej, ponieważ wersja zapoznawcza może zmienić limity lub ceny bez uprzedzenia, a decyzja leżąca na ścieżce krytycznej potrzebuje miejsca, do którego może trafić. Utrzymanie tej ścieżki awaryjnej na tym samym kluczu co pozostałe modele oznacza brak drugiej umowy i brak zmian w kodzie ścieżki awaryjnej: jedno API dla ponad 200 modeli, z automatycznym przełączaniem awaryjnym między dostawcami, gdy któryś z nich zaczyna szwankować. A jeśli twoja decyzja jest jednym krokiem dłuższego łańcucha, DSL routingu komponuje modele w jedno wywołanie, co jest dokładnie wzorcem orkiestratora plus decydenta spopularyzowanym przez Jev coverage — większy model planuje, mały model wybiera każdy krok. Ten wzorzec da się dziś zbudować z modeli, które obsługujemy; samo Decisions API znalazłoby się poza nim, dopóki OpenAI go nie otworzy.

Kto powinien się ruszyć, a kto powinien czekać

Jeśli Twój problem to zadanie klasyfikacji lub routingu o dużym wolumenie, w którym błędna gałąź jest tania i odwracalna, wersja zapoznawcza jest warta w tym tygodniu opracowania kształtu żądania i oznaczonego zbioru — ta możliwość jest realna, to ograniczenie jest prawdziwą poprawą względem parsowania prozy, a wersja zapoznawcza to najtańszy możliwy moment, by dowiedzieć się, gdzie materializują się koszty jej błędów. Jeśli Twoja decyzja autoryzuje przepływ pieniędzy, wysyła wiadomość do klienta albo znajduje się między użytkownikiem a płatnością, nic w tym tygodniu nie zmienia Twoich kalkulacji: nie ma opublikowanej ceny, którą można modelować, opublikowanego limitu, wokół którego można projektować, nie ma SLA ani słowa o tym, czy można dostroić ten mechanizm na własnych danych. Te cztery luki to właśnie to, co musi wypełnić „szerokie wdrożenie”, a dopóki OpenAI ich nie nazwie, uczciwa interpretacja Decisions API to obiecujący interfejs z szybkim zegarem deklarowanym przez dostawcę i bez dołączonego rachunku.

OrcaRouter's model page for openai/gpt-6-luna, showing the model name and OpenAI attribution dated 2026-09-22, capability pills for vision, tools, JSON and reasoning, the description of GPT-6 Luna as the fast cost-efficient model below GPT-6 Sol, the /v1/chat/completions route, a $0.10 input and $0.50 output rate per million tokens with a 699 ms p50 time to first token, a 1M-token context with 128K maximum output, and 3234.7M tokens of traffic.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie