
GPT-5.6 Luna Max: Jak programiści faktycznie używają go w Codex — i gdzie zawodzi
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 221 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
1 sierpnia na X zaczął krążyć czteroliniowy plik konfiguracyjny. Tworzy on agenta Codex o nazwie luna_worker, ustawia jego model na gpt-5.6-luna, ustawia poziom rozumowania na max, i przekazuje mu nudną połowę twojej pracy, podczas gdy GPT-5.6 Sol zajmuje się planem. W ciągu kilku dni ten sam przepis został ponownie opublikowany po angielsku, chińsku, japońsku, koreańsku, hiszpańsku i arabsku, a wtyczka zbudowana na tym samym pomyśle przekroczyła 1300 gwiazdek na GitHubie w cztery dni. Jest to również, mniej więcej w dniu, w którym stał się wiralny, zły sposób podłączenia: autor tamtej wtyczki publicznie usunął GPT-5.6 Lunę ze swojego projektu w ciągu 48 godzin, bo kolega po fachu powiedział mu, że nie działa jako podagent Codex — a dwa dni później dodał ją z powrotem, podłączoną w zupełnie inny sposób.
Cały ten wątek rozegrał się w ciągu jednego tygodnia i jest to najbardziej przydatna rzecz, jaką ktokolwiek opublikował na temat tego modelu. Mówi ci, że wzorzec taniego pracownika jest realny, że oczywisty sposób podłączenia go jest błędny i że różnica między tymi dwoma stanowi większość wartości. Wszystko, co w tym artykule dotyczy techniki, pochodzi od praktyków publikujących własne wyniki między 30 lipca a 5 sierpnia 2026 roku — nie z dokumentacji firmy, która opisuje GPT-5.6 Luna jako model dla „obciążeń wrażliwych na koszty i wysokowolumenowych" i nie mówi nic o żadnej z tych rzeczy. Jeśli liczba została zmierzona przez niezależną stronę trzecią, mówimy o tym wprost; jeśli to log sesji jednego dewelopera, też o tym mówimy — także wtedy, gdy są ze sobą sprzeczne. Owszem, i to często.
Czym jest "Luna Max" i dlaczego większość ludzi nigdy jej nie widzi
Nie istnieje model o nazwie Luna Max. Są dwa pokrętła, a Luna Max to jedna z ich kombinacji: najtańszy poziom rodziny GPT-5.6, uruchomiony z najgłębszym ustawieniem rozumowania. Pokrętło poziomu wybiera między GPT-5.6 Sol, GPT-5.6 Terra a GPT-5.6 Luna. Pokrętło wysiłku ma sześć pozycji — none, low, medium, high, xhigh i max — i reguluje, ile myślenia model wykonuje, zanim udzieli odpowiedzi.
Prawie nikt nie łączył taniego poziomu z głębokim ustawieniem, z prozaicznego powodu: opcja max jest domyślnie ukryta. W aplikacji desktopowej ChatGPT/Codex znajduje się ona w Settings → Configuration → Available reasoning efforts, gdzie lista domyślnie ma odznaczoną górną opcję. Sześciu różnych programistów opublikowało tę samą trzyklikową poprawkę w pierwszym tygodniu sierpnia, co dobrze pokazuje, ile osób uruchamiało Lunę na domyślnej głębokości i oceniało model na tej podstawie. Po stronie API nie ma żadnego przełącznika, którego trzeba szukać: przekazujesz identyfikator modelu gpt-5.6-luna i ustawiasz reasoning effort na max w treści żądania i to cała zmiana.
Jedna konsekwencja, którą warto sobie przyswoić, zanim przeczytasz jakikolwiek benchmark: gdy Artificial Analysis publikuje wynik inteligencji dla tego modelu, strona nosi tytuł GPT-5.6 Luna (max). Niezależna liczba, którą wszyscy cytują dla modelu Luna, pochodzi z konfiguracji maksymalnego wysiłku. Jeśli korzystałeś z domyślnej konfiguracji i zastanawiasz się, dlaczego twoje wrażenia nie odpowiadają rankingowi, to właśnie dlatego.
Pokrętło, którego nikt nie tłumaczy: wysiłek zmienia liczbę tokenów, nie cenę tokena
Zwiększenie wysiłku rozumowania nie przenosi Cię do droższego poziomu cenowego. GPT-5.6 Luna kosztuje 0,20 USD za milion tokenów wejściowych i 1,20 USD za milion tokenów wyjściowych przy każdym ustawieniu wysiłku. Zmienia się to, ile tokenów model zużywa, aby dojść do odpowiedzi — a przy maksimum zużywa ich naprawdę dużo.
Artificial Analysis zmierzyło to w trakcie prowadzenia swojego Intelligence Index, a liczby są najwyraźniejszym niezależnym potwierdzeniem tego, na co narzekali praktycy:
• Wynik — 51 w Artificial Analysis Intelligence Index, wobec mediany 17 dla modeli, które ocenia w tej klasie.
• Rozwlekłość — w trakcie przebiegu indeksu wygenerowano 130M tokenów wyjściowych, wobec mediany 61M. Artificial Analysis oznacza model jako „bardzo rozwlekły”.
• Surowa szybkość — 182,5 tokenów wyjściowych na sekundę, 16. wśród 163 modeli. Szybko na token.
• Czas do pierwszego tokena — około 136 sekund przy maksymalnym wysiłku, co — jak zauważa Artificial Analysis — jest na górnym końcu skali nawet jak na modele rozumujące w tym przedziale cenowym.
• Całkowite wydatki — $174.06 na ocenę modelu na całym indeksie.
Przeczytaj trzecią i czwartą linię razem, ponieważ ta para to całe doświadczenie użytkownika. Luna przy maksymalnym obciążeniu strumieniuje tokeny szybko, ale uruchomienie zajmuje jej minuty, a potem generuje mniej więcej dwa razy więcej tokenów niż typowy model przy tej samej pracy. Dlatego najczęstszą skargą w raportach terenowych nie jest „to jest złe", ale „to jest wolne" — i dlatego niska cena nie przekłada się na proporcjonalnie tanią sesję. Kupujesz niską stawkę przy wysokiej liczbie tokenów.
Dla kontrastu: na naszej własnej stronie modelu GPT-5.6 Luna, zaobserwowana mediana czasu do pierwszego tokena w ciągu siedmiu dni rzeczywistego ruchu wynosi 1,78 sekundy, a 95. percentyl to 9,26 sekundy. Nie jest to sprzeczność z liczbą 136 sekund — to ten sam model mierzony przy różnych ustawieniach nakładu pracy, z których większość nie jest maksymalna. Opóźnienie, które otrzymujesz, jest cechą ustawionego pokrętła, a nie wywoływanego punktu końcowego.

Czy Luna Max naprawdę jest „Sol Medium za jedną szóstą ceny”?
To twierdzenie sprawiło, że ten wzorzec stał się wiralowy, a pochodzi od Dana McAteera, który ujął to tak: Luna przy maksymalnym rozumowaniu osiąga poziom mniej więcej GPT-5.6, Sol przy średnim, a Claude Opus 5 przy średnim — za mniej więcej jedną szóstą kosztu. Powtarzało je wiele kont, czasem z usuniętymi zastrzeżeniami, i warto oddzielić to, co zmierzone, od tego, co jest tylko kwestią wrażeń.
Niezależna tablica wyników zdecydowanie potwierdza część dotyczącą kosztów, a tylko częściowo część dotyczącą możliwości. Uruchamiając ten sam zestaw benchmarków przy maksymalnym wysiłku w różnych klasach, Artificial Analysis odnotował Lunę z indeksem 51 za 174 USD, Terrę z 55 za 1403 USD, Kimi K3 z 57 za 2437 USD i Sola z 59 za 2824 USD. Luna ustępuje Solowi osiem punktów indeksowych i kosztuje około jednej szesnastej tej kwoty przy przepuszczaniu przez tę samą pracę.

Niezależna tablica wyników zaostrzyła się 13 sierpnia, kiedy DeepSWE wypuściło wersję v1.1 — rewizję swojego długoterminowego benchmarku inżynieryjnego, który zachowuje 113 oryginalnych zadań pochodzących z 91 repozytoriów w pięciu językach, ale teraz ocenia każdą poprawkę, uruchamiając zatwierdzony diff w izolowanym kontenerze, co jest trudniejsze do oszukania. Na zaktualizowanej tablicy wszystkie trzy poziomy GPT-5.6 przy maksymalnym wysiłku znalazły się tam, gdzie wskazywał je lipcowy raport: Luna Max przy 67,2% pass@1 i 0,61 USD za zadanie, Terra Max w okolicach 70%, Sol Max przy 73% za 8,39 USD — czyli o sześć punktów procentowych wyższy wskaźnik sukcesu za około czternaście razy większe pieniądze.
{{1}}Porównanie warte drugiego spojrzenia znajduje się poniżej Luny, a nie powyżej niej.{{/1}} {{2}}Claude Sonnet 5 Max uzyskuje 54% w tych samych 113 zadaniach — około trzynaście punktów za Luną Max — przy koszcie 26,40 USD za zadanie, co stanowi mniej więcej 44 razy więcej, niż Luna zapłaciła za to samo rozwiązanie.{{/2}} {{3}}Luna Max pokonuje również Gemini 3.7 Flash (65% dla konfiguracji o wysokim nakładzie w tych samych zadaniach); post społeczności, który zwrócił uwagę na tę rundę, szacuje różnicę do Gemini 3.7 Flash Medium na około 1,7 punktu.{{/3}} {{4}}DeepSWE to niezależny harness firmy Datacurve, a nie ewaluacja firmowa — twierdzenie samej firmy, że rodzina GPT-5.6 osiągnęła najnowocześniejsze wyniki w Terminal-Bench 2.1 i DeepSWE, pozostaje odrębnym oświadczeniem dostawcy.{{/4}}
Jest jeszcze dowód z praktyki, który jest rzeczywiście podzielony. Pawel Huryn przeprowadził własny benchmark naprawiania błędów — 105 celowo wprowadzonych błędów w dwóch rzeczywistych bazach kodu, ocena na ślepo, jedna runda na model — i podał, że Luna przy maksymalnym wysiłku naprawiła 33 błędy za 1,80 dolara, podczas gdy Claude Fable 5 — 24 za 68 dolarów. W przeciwnym kierunku, Diego Haz spędził dwa dni na dopasowanych sesjach i wypadł przeciwko temu schematowi: Luna kosztowała średnio 1,20 dolara za sesję, a Sol 29 dolarów, ale musiał przerabiać większość tego, co wygenerowała Luna, i dla jego przypadków użycia nie otrzymał niczego, co nadawałoby się do wdrożenia, co czyni oszczędność iluzją, a nie zniżką. Inny programista używający tego samego środowiska testowego podał, że Sol na średnim ustawieniu dawał wyraźnie lepszy wynik niż Luna na maksymalnym w około połowę czasu. Chińskojęzyczny test porównawczy na pojedynczym zadaniu sceny 3D ujął ten kształt w liczby: Sol Medium ukończył w 21 min 30 s, z najwyższą oceną jakości i najmniejszą liczbą tokenów; Luna Max zajęła 40 min 55 s, zużyła około 130 tys. tokenów, uzyskała najniższą ocenę jakości i wykorzystała połowę tygodniowego limitu subskrypcji.
Uczciwe podsumowanie stanowiska społeczności po tygodniu: Luna Max to nie jest Sol Medium. Jest sporo tańszy niż Sol Medium i jest gorszy, a to, czy ten kompromis jest dobry, zależy wyłącznie od tego, czy zadanie jest wystarczająco precyzyjnie określone, żeby „gorszy” nie miał znaczenia. Po to właśnie są poniższe schematy połączeń.
Wzorzec, który przetrwał kontakt: Sol planuje, Luna wdraża, świeży Sol dokonuje przeglądu.
Nikt, kto nadal używa Luna Max, nie używa go jako uniwersalnego agenta do kodowania. Działająca konfiguracja, do której praktycy doszli w każdej wersji, ma cztery role:
• Orchestrator — GPT-5.6 Sol przy wysokim wysiłku, działający w głównym wątku. Odpowiada za wymagania, architekturę, dekompozycję zadań i akceptację końcową. Nie pisze kodu.
• Rutynowy implementator — GPT-5.6 Luna przy maksymalnym wysiłku, przy ograniczonej, w pełni określonej pracy: mechaniczne refaktoryzacje, pisanie testów, analiza modułów, przeglądy dokumentacji, czyli rodzaj zadania, w którym cel jest jednoznaczny.
• Twardy implementator — GPT-5.6 Terra przy maksymalnym wysiłku, do kontekstochłonnych buildów, gdzie dryf instrukcji Luny staje się kosztowny.
• Recenzent — świeża, tylko do odczytu instancja GPT-5.6 Sol, która widzi wyłącznie końcowy diff i nic więcej. Sedno „świeżości” polega na tym, że recenzent mający kontekst implementacji ma tendencję do zatwierdzania własnego rozumowania.
Implementacją referencyjną jest sol-advisor, wtyczka Codex na licencji MIT autorstwa Dana McAteera, która w pierwszym tygodniu zdobyła około 1400 gwiazdek. Instalujesz ją przez marketplace wtyczek Codex, dodając DannyMac180/sol-advisor repozytorium, a następnie dodając sol-advisor wtyczkę. Jej obecny kształt jest pouczający: natywny tor przypina implementatora Terra/High, a następnie świeżego recenzenta Sol/High, podczas gdy Luna na maksimum jest jawnym torem opcjonalnym, który działa jako osobne zadanie widoczne dla użytkownika, a główna sesja Sol przegląda i akceptuje jej pracę bezpośrednio, zamiast kierować ją przez natywnego recenzenta.
Jeśli wolisz niczego nie instalować, powszechnie kopiowaną minimalną wersją jest definicja niestandardowego agenta w ~/.codex/agents/luna-worker.toml zawierająca dwa ustawienia — model = "gpt-5.6-luna" oraz model_reasoning_effort = "max" — a także opis i instrukcje, które ograniczają go do delegowanych zadań z jasno określonymi granicami, zabraniają mu zmiany ogólnego celu lub poszerzania własnego zakresu oraz odsyłają decyzje architektoniczne i niejednoznaczne wymagania z powrotem do głównego agenta. Zgodnie z krążącą radą, Sol ma napisać ten plik za Ciebie, zweryfikować go względem zainstalowanej wersji Codex i pokazać Ci diff, zanim go zaakceptujesz, co jest rozsądne niezależnie od tego, czy ufasz temu przepisowi.
Pułapka subagenta i naprawa, na którą społeczność się zgodziła.
Tutaj wiralna wersja tego wzorca i działająca wersja rozchodzą się.
Natywny system subagentów Codexa nie traktuje GPT-5.6 Luna jako pełnoprawnego obywatela. McAteer natrafił na twardy blok — Luna nie może być subagentem — i obszedł to, deklarując zamiast tego Lunę jako niestandardowego agenta, po czym publicznie wskazał koszt tego obejścia: niestandardowy agent nie dzieli kontekstu z głównym agentem tak, jak robi to natywny subagent. Kilka dni później usunął ścieżkę Luna z sol-advisor w całości, powołując się na ustalenie innego dewelopera zajmującego się Codexem, że Luna słabo sprawdza się w roli subagenta, przy założeniu, że nie została poddana post-trainingowi pod kątem protokołu v2 multi-agent. Diego Haz niezależnie opisał tę samą ścianę z drugiej strony: Sol nie może stworzyć Luny jako subagenta, więc Luna musi działać w wątku najwyższego poziomu, co utrudnia koordynację.
Rozwiązanie, które obecnie jest stanowiskiem większości, polega na zaprzestaniu walki z tym:
• Daj Lunie Max własny wątek, a nie slot w grafie subagenta. Poleć orchestratorowi Sol, aby uruchomił osobne zadanie Codex najwyższego poziomu na Lunie, monitorował je i pobrał wynik. To właśnie McAteer ponownie dodał do sol-advisor 4 sierpnia i to, na co niezależnie wpadło kilku innych.
• Zaakceptuj izolację kontekstu jako cenę. Osobny wątek oznacza osobną historię. To jest podatek, który płacisz, a także powód, dla którego przekazanie poniżej ma tu większe znaczenie niż w natywnej konfiguracji subagenta.
• Jeśli musisz na siłę wprowadzić go do multi-agent v2, to katalog jest powodem, dla którego jest odfiltrowywany. Jeden deweloper wyśledził, że przyczyną wykluczenia jest standardowy katalog modeli, który oznacza Lunę jako v1, i opisał obejście: skopiuj ~/.codex/models_cache.json, ustaw dla Luny parametr multi_agent_version na v2, wskaż model_catalog_json na swoją kopię, uruchom ponownie Codex, a następnie niech orchestrator uruchomi Lunę na maksa z szybką warstwą usług i wyłącz forkowanie. Traktuj to jako nieoficjalny hack jednej osoby na wewnętrznym pliku — to dokładnie coś, co aktualizacja Codexa może zepsuć.
Pakiet przekazania: pięć pytań, które rozwiązują najczęstszą skargę.
Najczęściej zgłaszaną wadą Luna Max jest to, że nie trzyma się ściśle instrukcji, szczególnie gdy podaje się jej konkretny przepływ pracy lub pętlę iteracyjną do uruchomienia. Ten zarzut pojawia się zarówno u deweloperów, którym model się podoba, jak i u tych, którzy go porzucili. Rozwiązanie, do którego dochodzą praktycy, nie jest lepszym promptem w sensie stylu pisania; to ściślejszy kontrakt. Zanim zacznie się wątek o Lunie, odpowiedz na pięć rzeczy:
• Jakie dokładnie zadanie powinien wykonać ten agent? Nie obszar pracy — stan ukończenia.
• Które pliki, dokumenty lub systemy wchodzą w zakres? Wyliczone, nie dorozumiane.
• Czego nie może zmienić? Interfejsów, migracji, konfiguracji i kontraktów publicznych, których nie wolno naruszać.
• Jakie dowody potwierdzają ukończenie? Nazwany test, wynik konkretnego polecenia, diff obejmujący tylko wymienione pliki.
• Która brakująca decyzja powinna to zatrzymać? Wyzwalacz powrotu zamiast zgadywania — to ten, który zapobiega wymyśleniu architektury przez zbyt gorliwy tani model.
To jest również miejsce, w którym warto uwzględnić własne wytyczne firmy dotyczące promptów, z etykietą, na którą zasługują: firma raportuje, że w jej wewnętrznych ewaluacjach agentów kodowania bardziej zwięzłe prompty systemowe poprawiły wyniki ewaluacji o 10–15%, jednocześnie zmniejszając całkowitą liczbę tokenów o 41–66% i koszty o 33–67%. Zaleca też audyt promptów odziedziczonych po GPT-5.5 lub GPT-5.4 zamiast przenoszenia ich w niezmienionej postaci. To liczby raportowane przez dostawcę. Ale kierunek jest zgodny z tym, co ustaliła branża: opisz precyzyjnie cel i usuń narrację każdego kroku. Zwróć uwagę na napięcie z powyższym akapitem — precyzja co do zakresu i ograniczeń to nie to samo co rozwlekłość, a konsensus społeczności jest taki, że Luna Max potrzebuje więcej tego pierwszego, a mniej tego drugiego.
Tryby awarii do uwzględnienia w planowaniu
• Dryf instrukcji. Potwierdzone przez wielu programistów: ignoruje części wstępnych wytycznych, a najgorzej jest, gdy wytyczne są procedurą do wykonania, a nie rezultatem do osiągnięcia.
• Spowolnienie w czasie rzeczywistym. Wielokrotnie zgłaszane i zgodne z ~136-sekundowym czasem do pierwszego tokena, który Artificial Analysis zmierzył przy maksymalnym wysiłku. Dobre do pracy, którą można zostawić uruchomioną; bolesne w interaktywnej pętli.
• Zużycie kontekstu. Jeden z deweloperów zgłosił, że Luna Max pożera okno wątku Codex o wielkości 258k w alarmującym tempie, i podejrzewał, że zużycie limitu gwałtownie rośnie, gdy Codex zaczyna kompresję w pobliżu limitu. Część o kompresji to jego wrażenie, a nie zmierzony wynik — ale tempo zużywania to oczekiwana konsekwencja rozwlekłości, którą Artificial Analysis zmierzyło niezależnie. Po stronie API uważaj na próg długiego kontekstu: cennik pass-through dla tego modelu przechodzi z $0.20/$1.20 do $0.40/$1.80, gdy żądanie przekroczy mniej więcej 272k tokenów, więc wątek, który ciągle rośnie, staje się droższy na token, a nie tylko droższy w sumie.
• Wszystko, co wizualne. To jest najostrzejsza granica w raportach terenowych. Jeden z powszechnie czytanych praktyków, rezygnując z subskrypcji Kimi K3 do kodowania na rzecz Luna Max, ocenił ją jako równie dobrą jak to, co porzucał, i znacznie tańszą — z wyraźnym wyjątkiem dla frontendu. Inny był bardziej dosadny: nie używaj Luny do prac projektowych, graficznych, formatowania ani tworzenia slajdów; podział na planowanie z Solem i wykonywanie z Luną służy do zadań instruktażowych krok po kroku, a nie do zadań estetycznych.
• Katalog subagentów. Omówiono powyżej — jeśli Luna po cichu nigdy nie zostaje wybrana w przebiegu wieloagentowym, jest filtrowana, a nie zawodzi.
• Fałszywa oszczędność. Jedyny tryb awarii, który nie pojawia się w żadnym benchmarku: sesja, która kosztowała $1.20 zamiast $29 i wyprodukowała pracę, którą przepisałeś ręcznie, kosztowała cię $1.20 plus twoje popołudnie.
Kiedy nie sięgać po maksimum
Max nie jest darmową aktualizacją, a sprawdzona wskazówka to drabina, a nie ustawienie:
• Proste przekształcenia — zmiana nazwy pola, mechaniczna ekstrakcja, poprawa formatowania. Niski lub średni nakład pracy na Lunie. Uzależnij to od przejścia nazwanego testu.
• Rutynowa implementacja — high lub xhigh. Domyślnym ustawieniem społeczności dla workera Luna jest xhigh, a nie max, właśnie dlatego, że max kosztuje czas i tokeny na zadaniach, które nigdy nie były trudne.
• Ograniczony, ale naprawdę trudny — to właśnie jest zadanie maxa. Pakiet musi być zarówno trudny, jak i ściśle określony, aby dodatkowe rozumowanie przełożyło się na lepszy wynik.
• Niejednoznaczne badanie — zmień poziom, nie suwak. Jeśli model błędnie ocenia, a nie za mało planuje, więcej myślenia na tańszym modelu tego nie naprawi; to zadanie dla Sol.
• Niejasne wytyczne — napraw kontrakt, a nie model. Żadne ustawienie wysiłku nie zrekompensuje nieokreślonego kryterium akceptacji.
Ostrzeżenie specyficzne dla subskrypcji, pochodzące z przewodnika zewnętrznego i łatwe do pomylenia: stawki kredytów, które Codex pobiera za poszczególne modele, nie mają takich samych proporcji jak cennikowe ceny API, więc nie można przenieść proporcji cen API i użyć jej jako reguły routingu subskrypcji. Zgłaszane limity wiadomości na pięć godzin w warstwie Plus ilustrują ten problem — z grubsza 15–90 lokalnych wiadomości na Sol, 20–110 na Terra, 50–280 na Luna, a zakresy są tak szerokie, ponieważ „wiadomość” nie jest stałą jednostką pracy. Jeśli Twoje decyzje routingu są podyktowane limitem subskrypcji, a nie fakturą, mierz względem limitu.
Poza Codexem: na co jeszcze ludzie to kierują
Połączenie taniego i głębokiego rozumowania okazuje się przydatne poza agentami kodującymi, a oto zastosowania z dowodami:
• Agenci przeglądarki. Jeden programista uruchomił zestaw do automatyzacji przeglądarki na GPT-5.6 Luna, aby otworzyć 15 najpopularniejszych postów na Hacker News, przeczytać każdą powiązaną stronę i napisać raport — całkowity koszt: 3 centy. Długi horyzont, niskie ryzyko, duża liczba tokenów: dokładnie pod taki profil ten model jest wyceniony.
• Łańcuchy umiejętności. Dwóch praktyków niezależnie zgłosiło, że przeprowadziło dwuetapowy potok — generowanie obrazu do konwertera obrazu na Three.js — z pojedynczego celu Luna Max, aby uzyskać interaktywny obiekt 3D o niskiej liczbie wielokątów, każdy zauważając, że ledwo wpłynęło to na ich tygodniowy licznik użycia. Warto przeczytać to razem z ostrzeżeniem „nie używaj Luny do pracy wizualnej”: Luna orkiestrowała narzędzia, które wykonywały pracę wizualną, a nie oceniała samej estetyki.
• Utrzymywanie jednej gorącej sesji. Wejście z pamięci podręcznej w tym modelu kosztuje 0,02 USD za milion tokenów, w porównaniu z 0,20 USD za świeże wejście — 90% zniżki, którą Artificial Analysis podaje na swoim panelu cenowym — a okno cache wynosi około 30 minut. Praktyczny wniosek, do którego niezależnie dochodzi kilka przewodników: jedna długo działająca sesja, która wciąż odczytuje ten sam kod, jest znacznie tańsza niż świeża sesja na każde zadanie.
• Arbitraż limitów. Najbardziej agresywne twierdzenie w całym zestawie, wyraźnie oznaczone jako twierdzenie: jeden programista raportuje, że ponieważ wysiłek jest niemal darmowy, a mnożnik poziomu jest duży, uruchomienie z maksymalnym wysiłkiem na tanim poziomie pozwoliło mu przepchnąć 4,9 miliarda tokenów przez trzy tygodnie na planie za 200 dolarów — sześć cyfr w stawkach API — i że trzyma modele Kimi K3, Grok i DeepSeek w tym samym selektorze za lokalnym routerem, tak aby trafienie na limit jednego dostawcy nie zatrzymywało pracy. Nikt niezależnie nie odtworzył tej liczby tokenów. Jednak nawyk routingu stojący za tym jest częścią wartą skopiowania.
Uruchamianie tego samego podziału bez subskrypcji Codex
Wszystko powyżej to historia w kształcie subskrypcji: powodem, dla którego ludzie dbają o Luna Max, jest to, że rozszerza tygodniowy limit. Po stronie API ta sama architektura jest prostsza do zbudowania i łatwiejsza do zrozumienia, ponieważ płacisz fakturę zamiast zarządzać przydziałem — a podział orchestrator/worker przestaje być wtyczką, a staje się zwykłym routingiem.
GPT-5.6 Luna jest dostępna przez OrcaRouter w cenie 0,20 USD za milion tokenów wejściowych i 1,20 USD za milion tokenów wyjściowych — to cena katalogowa dostawcy przekazywana dalej z zerową marżą, dlatego obniżka z 30 lipca obowiązywała u nas już tego samego dnia, w którym firma ją ogłosiła, a nie dopiero w następnym cyklu rozliczeniowym. Jest udostępniana przez kompatybilne API na /v1/chat/completions i /v1/responses, więc pole reasoning-effort jest przekazywane w treści żądania dokładnie tak, jak przy połączeniu bezpośrednim, a identyfikator modelu to openai/gpt-5.6-luna. GPT-5.6 Sol i GPT-5.6 Terra działają na tym samym kluczu, co ma znaczenie dla tego wzorca: orchestrator na jednym poziomie i worker na innym to dwa identyfikatory modeli w jednej integracji, a nie dwie umowy z dostawcami. DSL routingu pozwala wyrazić ten podział jako jedno wywołanie, zamiast ręcznie sklejać wątki, a automatyczne przełączanie awaryjne obejmuje przypadek, który osoby zajmujące się arbitrażem limitów rozwiązują lokalnym routerem — gdy jeden dostawca ulega degradacji, żądanie trafia gdzie indziej, zamiast się zatrzymać.

Dwa uczciwe zastrzeżenia. Mechanizmy specyficzne dla Codex — graf subagentów, marketplace wtyczek, katalog modeli, tygodniowy limit — są własnością firmy i żadne z nich nie jest dołączone do klucza API; jeśli wzorzec, jakiego szukasz, to sol-advisor w aplikacji Codex, potrzebujesz subskrypcji Codex. A powyższe tryby awarii są właściwościami modelu, a nie transportu: routing zmienia to, ile kosztuje wywołanie i co się dzieje, gdy dostawca pada, a nie to, czy Luna wykonuje twoje polecenia.
Kto powinien to skopiować, a kto nie powinien?
{{1}}Jeśli Twoja praca jest wielkoskalowa i mechanicznie określona — refaktoryzacje, szablony testów, ekstrakcja, dokumentacja, analizy dużego repozytorium —{{/1}} {{2}}włącz max{{/2}}, {{3}}umieść Lunę we własnym wątku z przekazaniem pięciu pytań{{/3}}, {{4}}trzymaj instancję Sola przed nią do planowania i za nią do przeglądu{{/4}} {{5}}i spodziewaj się wydać o rząd wielkości mniej{{/5}}. Osoby raportujące największe zyski wszystkie robią jakąś wersję tego, a niezależne dane kosztowe potwierdzają ten kierunek nawet tam, gdzie nie potwierdzają ramy „tak samo dobry jak Sol”.
Jeśli Twoja praca ma charakter eksploracyjny, estetyczny lub przychodzi jako mglisty brief, który z czasem staje się coraz ostrzejszy, raporty z pola mówią wprost: oszczędności wydasz dwukrotnie, przerabiając rezultaty. A jeśli pracujesz interaktywnie — siedząc i obserwując to — dwuminutowy zimny start przy maksymalnym wysiłku będzie Ci przeszkadzał bardziej, niż cena sprawi Ci przyjemność.
Na co zwrócić uwagę: czy firma doucza Lunę pod kątem protokołu subagenta v2. Każda niezręczna część obecnego scenariusza — osobny wątek, utracony wspólny kontekst, hack z katalogiem, cały epizod wycofywania i przepinania — istnieje z powodu tej jednej luki. Zamknij ją, a najlepsza wersja tego wzorca stanie się o kilka kroków prostsza.
Pytania warte prawdziwej odpowiedzi
Czy maksymalny wysiłek rozumowania kosztuje więcej za token niż domyślny?
Nie, i to jest najczęstsze nieporozumienie dotyczące tego ustawienia. GPT-5.6 Luna kosztuje 0,20 USD za milion tokenów wejściowych i 1,20 USD za milion tokenów wyjściowych, niezależnie od effort. To, co zmienia ustawienie max, to liczba zużywanych tokenów — model planuje więcej, sam się sprawdza i wprowadza poprawki, zanim odpowie. Według pomiarów Artificial Analysis ten model wygenerował 130 mln tokenów wyjściowych w zestawie testów porównawczych, w którym mediana modeli generuje 61 mln. Dlatego sesja z maksymalnym effort kosztuje więcej niż sesja ze średnim effort przy tym samym zadaniu — wyłącznie przez większą objętość — a poza tym pierwszy token pojawia się po dłuższym czasie. Effort to pokrętło liczby tokenów w przebraniu etykiety jakości.
Czy GPT-5.6 Luna może już działać jako natywny subagent Codex?
Według stanu na 5 sierpnia 2026 r. — nie, a społeczność przestała już próbować. Natywna ścieżka subagenta Codexa nie akceptuje Luny; obejście z niestandardowym agentem uruchamia ją, ale traci wspólny kontekst z głównym agentem; a twórca najbardziej znanej wtyczki dla tego wzorca usunął Lunę, po czym dodał ją ponownie jako osobno uruchamiane zadanie najwyższego poziomu monitorowane przez orkiestratora. Jeśli widzisz uruchomienie wieloagentowe, w którym Luna nigdy nie zostaje wybrana, prawdopodobnie jest filtrowana, ponieważ standardowy katalog modeli oznacza ją jako v1, a nie v2 — co jeden programista załatał ręcznie na własne ryzyko. To najbardziej prawdopodobna pozycja na liście, która zmieni się wraz z aktualizacją Codexa, więc zweryfikuj to względem swojej zainstalowanej wersji, zamiast ufać jakiemukolwiek przepisowi, w tym temu.
Czy jest wystarczająco dobre, aby zastąpić subskrypcję kodowania Claude lub Kimi K3?
Kilku programistów publicznie anulowało plan za 200 dolarów miesięcznie właśnie z tego powodu. Post, który wyprowadził to pytanie na światło dzienne, wyszedł od immunologa, który codziennie programuje: zrezygnował z subskrypcji Kimi K3 do kodowania nie dlatego, że była zła, ale dlatego, że nie potrafił jej uzasadnić, skoro GPT-5.6 Luna była — w jego doświadczeniu — równie dobra do jego pracy i znacznie tańsza, z wyjątkiem frontendu. Niezależne dane kosztowe sprawiają, że trudno zignorować ten argument: w tym samym zestawie testów porównawczych Kimi K3 przy maksymalnym wysiłku uzyskała 57 punktów za 2437 dolarów, podczas gdy GPT-5.6 Luna przy maksimum uzyskała 51 punktów za 174 dolary. Ale przeczytaj głosy sprzeciwu, zanim cokolwiek anulujesz. Deweloperzy, którzy zmierzyli porównywalne sesje i wyszli na minus, nie testowali innego modelu; testowali inny rodzaj zadania — otwartego, wizualnego lub luźno określonego — a w takim zadaniu tańszy model przegrał na tyle mocno, że zniwelował oszczędności. Rozsądna odpowiedź jest taka, że Luna Max zastępuje dużą część twojej programistycznej pracy, niekoniecznie twój najlepszy programistyczny model, i że praktycy, którzy wyciskają z niej najwięcej, to ci, którzy zachowali poziom frontier do planowania i sprawdzania.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
