Główna karta tytułowa dla GPT-6 Luna vs GPT-5.6 Luna z plakietką „GA 22 Sep 2026”, nagłówkiem „GPT-6 Luna vs GPT-5.6 Luna”, podtytułem „Ta sama nazwa, połowa ceny, gorszy rezultat” oraz trzema kartami statystyk o treści „Wejście: 0,10 USD vs 0,20 USD za MTok”, „Wyjście: 0,50 USD vs 1,20 USD za MTok” i „AA Index: 37,26 vs 37,32”, z logo OrcaRouter złożonym w prawym dolnym rogu.
Guides & Insights

GPT-6 Luna vs GPT-5.6 Luna: ta sama nazwa, połowa ceny i gorszy produkt

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa modele, jedno wspólne słowo i niezależny wynik, który jest praktycznie identyczny. GPT-6 Luna osiąga 37,26 w Artificial Analysis Intelligence Index; GPT-5.6 Luna osiągnął 37,32. Różnica 0,07 punktu to nie pomiar, lecz szum, i jest to najważniejszy fakt dotyczący tej pary. Tym, co odróżnia te dwa modele, nie jest zdolność — lecz $0,0681 za ukończone zadanie indeksowe w porównaniu z $0,1783 oraz zestaw regresji dotyczących pracy z wiedzą, o których obniżka ceny nie wspomina.

Te daty mają znaczenie przy odczytywaniu liczb. GPT-5.6 Luna trafił na rynek 9 lipca 2026 r. w cenie $0.20 za milion tokenów wejściowych i $1.20 za milion tokenów wyjściowych. GPT-6 Luna trafił na rynek 22 września 2026 r. w cenie $0.10 i $0.50 — dokładnie o połowę niższą stawkę za tokeny wejściowe i o 58% niższą stawkę za tokeny wyjściowe, którą to obniżkę OpenAI określiło jako stałą, a nie promocyjną. To autentyczna obniżka, ale to także mniejsza połowa tej historii. Większa połowa polega na tym, że nowszy model to inny model, a nie ten sam model po zmianie ceny.

Two-column comparison scoreboard titled 'GPT-6 Luna vs GPT-5.6 Luna - the scoreboard'. Left column 'GPT-6 Luna': Input per MTok $0.10; Output per MTok $0.50; Cost per index task $0.0681; Hallucination rate 76.7%; AA-Briefcase Elo 1,299.23; AA Intelligence Index 37.26. Right column 'GPT-5.6 Luna': Input per MTok $0.20; Output per MTok $1.20; Cost per index task $0.1783; Hallucination rate 92.6%; AA-Briefcase Elo 1,345.38; AA Intelligence Index 37.32. Footer reads 'Vendor price lines per OpenAI; independent figures per Artificial Analysis.' OrcaRouter logo composited bottom-right.

Co faktycznie daje migracja, w liczbach

Zestaw oba ze sobą na wymiarach, które decydują o migracji, a obraz jest nierówny. Niektóre wiersze się poprawiają, niektóre ulegają regresji, a jeden poprawia się znacznie.

• Cena — GPT-6 Luna 0,10 USD za milion tokenów wejściowych / 0,50 USD za milion tokenów wyjściowych w porównaniu z GPT-5.6 Luna 0,20 USD / 1,20 USD. O połowę taniej na wejściu, 58% taniej na wyjściu.

• Wejście z pamięci podręcznej — 0,01 USD za milion wobec 0,02 USD. Ten sam 90-procentowy rabat przy podstawie zmniejszonej o połowę, więc powtarzany prefiks kosztuje połowę tego, co kosztował w lipcu.

• Koszt na ukończone zadanie — 0,0681 USD w porównaniu z 0,1783 USD w tym samym zestawie. Redukcja o 62%, większa niż obniżka ceny tokenów, ponieważ skład zadań nie jest identyczny.

• Tokeny wyjściowe na zadanie — 50 537 w porównaniu z 41 235. Nowy model jest o 23% bardziej gadatliwy na każde ukończone zadanie, a 78% jego danych wyjściowych to rozumowanie, które nigdy nie pojawia się w odpowiedzi.

• Okno kontekstowe — 1 050 000 tokenów w porównaniu z 1 000 000. Ten sam praktyczny pułap; oba ograniczają wyjście do 128 000 tokenów.

• Wstrzymywanie się od odpowiedzi — wskaźnik halucynacji na poziomie 76,7% w AA-Omniscience w porównaniu z 92,6%. To największa pojedyncza poprawa w zestawie i nie jest to przyrost wiedzy: dokładność zmienia się z 42,7% na 43,8%, praktycznie bez zmian. Nowszy model odmawia odpowiedzi zamiast wymyślać, co stanowi zmianę behawioralną, a nie zmianę możliwości.

• Rezultaty pracy wiedzy — AA-Briefcase v1.1 spada z 1 345,38 Elo do 1 299,23, a GDPval-AA v2.1 spada z 1 443,14 do 1 367,09. Oba spadły, odpowiednio o około 46 i 76 punktów.

• Kodowanie i praca długoterminowa — Terminal-Bench 4.0 wzrasta z 11,6% do 12,6%, a SciCode z 53,6% do 54,6% — to dwa wiersze, które tutaj rosną. Przeciwwagą jest to, że Coding Agent Index spada z 43 do 41, a ewaluacje agentowe w stylu SWE zmieniają się w tym samym kierunku.

• AutomationBench-AA — 53,2% wobec 50,2%. Wzrost, i to większy niż w przypadku jakiegokolwiek innego agentowego wskaźnika w zestawie.

Screenshot of the Artificial Analysis page for GPT-6 Luna (max), dated September 2026, showing a proprietary model that accepts text and image input and outputs text with a 1M-token context window, an Artificial Analysis Intelligence Index score of 37, pricing of $0.10 per million input tokens and $0.50 per million output tokens, a 90% cache discount, and a cost rank of 20th of 183 models in its class.

Regresja jest w artefakcie, a nie w rozumowaniu.

Wzorzec widoczny w tych dwóch ostatnich wierszach wart jest nazwania, bo to on stanowi całą decyzję. Nowy model jest lepszy w jednoetapowych działaniach agentowych, a gorszy w zwracaniu gotowego dokumentu. Artificial Analysis przypisuje spadek w pracy opartej na wiedzy jakości prezentacji i dokumentom końcowym, które pomijały wymagane elementy rubryki, a nie błędom faktycznym czy rozumowania — a to dokładnie ten rodzaj regresji, który przechodzi test dymny, ale nie przechodzi przeglądu.

Połącz oba fakty, a migracja dzieli się wyraźnie według tego, co konsumuje dane wyjściowe. Jeśli twój potok odczytuje ustrukturyzowane dane wyjściowe — JSON, klasyfikację, wyodrębnione pole, decyzję o routingu — regresja w prezentacji nic cię nie kosztuje, poprawa w zakresie wstrzymywania się od odpowiedzi jest realnym zyskiem, a 62-procentowa redukcja kosztu zadania w pełni się realizuje. Jeśli produkt końcowy czyta człowiek — raport, notatkę, dokument dla klienta — nowszy model jest mierzalnie gorszy dokładnie w tym, za co płacisz, a oszczędność kupuje ci recenzenta.

Wskaźnik wstrzymywania się od odpowiedzi zasługuje na takie samo traktowanie. Model, który przechodzi od wymyślania w 93% przypadków, gdy czegoś nie wie, do wymyślania w 77%, jest istotnie innym obiektem dla mechanizmu zabezpieczającego, kontroli zgodności albo dowolnego potoku, w którym pewna siebie błędna odpowiedź propaguje się dalej. Ta poprawa jest realna, została niezależnie zmierzona i stanowi najsilniejszy argument za przeniesieniem pracy na nowy model — argument, który w ogóle nie zależy od ceny.

Co zmienia się w Twoim kodzie, a co nie

Mniej, niż sugeruje obniżka ceny o takiej skali — i to jest dobra wiadomość. Okno kontekstowe należy do tej samej klasy, maksymalna długość wyjścia jest identyczna i wynosi 128 000 tokenów, a klauzula zmiany cen dla długiego kontekstu w tej rodzinie modeli pozostaje bez zmian: żądania powyżej 272 000 tokenów wejściowych są rozliczane według 2x stawek za wejście i pamięć podręczną oraz 1,5x stawki za wyjście — za całe żądanie, a nie tylko za część powyżej tego progu. Żądanie, które było drogie przy 300 000 tokenów w GPT-5.6 Luna, jest drogie również w GPT-6 Luna — połowa stawki, ten sam próg, więc obciążenie, które powinno było zostać podzielone w lipcu, nadal powinno zostać podzielone teraz.

Drabina wysiłku to miejsce, w którym zmienia się zachowanie, a nie koszt. GPT-6 Luna udostępnia poziomy none, low, medium (domyślny), high, xhigh i max, a wartość domyślna ma znaczenie: potok dostrojony do domyślnego poziomu wysiłku jednego modelu nie jest automatycznie dostrojony do domyślnego poziomu wysiłku innego. Zespoły, które jawnie przypięły ustawienie, nie są tym dotknięte. Zespoły, które przyjęły wartość domyślną, używają innej konfiguracji niż w lipcu, a widocznym objawem będzie liczba tokenów, a nie jakość.

Jedna pułapka zasługuje na powtórzenie, bo nie znika wraz z nowym modelem. W punkcie końcowym Chat Completions wywoływanie funkcji działa tylko wtedy, gdy parametr reasoning effort ma wartość none; każdy inny poziom reasoning effort, a także każde wbudowane narzędzie, wymaga interfejsu Responses API. Zespół, który przenosi pętlę wywołań narzędzi, zmieniając jedynie ciąg modelu, odkryje, że jego narzędzia są po cichu niedostępne przy domyślnym poziomie medium, a poprawka polega na przepisaniu interfejsu wywołań, a nie na zmianie parametru.

Co możesz trasować dzisiaj, a czego nie możesz

To jest ta część migracji, która nie ma nic wspólnego z benchmarkami. GPT-5.6 Luna jest dostępny w OrcaRouter w cenie katalogowej — 0,20 USD za milion tokenów wejściowych, 1,20 USD za milion tokenów wyjściowych, okno kontekstu 1 000 000 tokenów, maksymalnie 128 000 tokenów wyjściowych oraz p50 czasu do pierwszego tokenu wynoszący 1,60 sekundy, mierzony na podstawie ruchu na żywo na naszej stronie modelu. Przekazujemy ceny katalogowe dostawców bez marży, więc w dniu, w którym OpenAI zmieniło ceny tej rodziny, zmiana była już aktywna po naszej stronie, a nie dopiero w następnym cyklu rozliczeniowym.

Screenshot of the OrcaRouter model page for openai/gpt-5.6-luna, showing GPT-5.6 Luna by OpenAI dated 2026-07-09, Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 128K maximum output, text, image and file input, pricing of $0.20 input and $1.20 output per million tokens, a p50 time to first token of 1.60 seconds and a p95 of 10.00 seconds, and the description 'GPT-5.6 Luna is the fast, cost-efficient model in OpenAI's GPT-5.6 series — tuned for high-volume, latency-sensitive workloads while retaining genuinely capable reasoning.'

GPT-6 Luna nie jest routowalny przez OrcaRouter na dzień 23 września 2026 r. Dostępność zapewniają własne API OpenAI oraz katalogi chmurowe, które obsługują tę rodzinę, a my nie umieszczamy w ofercie modelu, którego nie możemy obsłużyć. Praktyczną konsekwencją jest to, że zespół planujący tę migrację może dziś przenieść cennik, ale nie może dziś przenieść routingu — dwie połowy tej zmiany przypadają na różne daty.

To, co to umożliwia w międzyczasie, to układ, którego większość zespołów i tak ostatecznie będzie chciała. Zostaw GPT-5.6 Luna na ścieżkach, na których efektem końcowym jest produkt, używaj GPT-6 Luna wszędzie tam, gdzie wynik jest konsumowany przez kod, i traktuj tę granicę jako poziom, a nie przepisywanie od nowa. Ponieważ modele, do których możesz dotrzeć, znajdują się za jednym punktem końcowym z ponad 200 modelami na tym samym kluczu i automatycznym przełączaniem awaryjnym między dostawcami, dodanie lub usunięcie poziomu to wpis w konfiguracji, a nie druga integracja — a ścieżka eskalacji przestaje zależeć od dostępności jakiegokolwiek pojedynczego modelu.

Decyzja o migracji, wyrażona wprost

Przenieś pracę tam, gdzie dane wyjściowe są odczytywane maszynowo, a warunek sukcesu jest weryfikowalny. Klasyfikacja, ekstrakcja, decyzje o routingu, wywołania guardrails, masowe przebiegi transformacji i jednoetapowe działania agentów — wszystko to się kwalifikuje: kompozyt pozostaje niezmieniony, zachowanie abstynencyjne jest istotnie lepsze, a koszt zadania jest niższy o około 62%. Gdy Batch jest w połowie standardowych stawek, a wejście z pamięci podręcznej na poziomie jednej dziesiątej o połowę obniżonej podstawy, pipeline, który w lipcu był na granicy opłacalności, może teraz być bezproblemowy.

Nie przenoś pracy tam, gdzie ktoś zatwierdza artefakt, i nie przenoś ścieżek agentów kodujących po omacku. Spadek o 46 punktów w AA-Briefcase i spadek o 76 punktów w GDPval to małe liczby wskazujące ten sam kierunek co dwupunktowy spadek w Coding Agent Index, a opisany przez Artificial Analysis tryb awarii — pominięte elementy rubryki, słabsza prezentacja — jest niewidoczny dla automatycznej kontroli. Zachowaj poprzedni model tam, gdzie produktem końcowym jest dopracowanie.

A 0,07-punktowy remis w indeksie potraktuj jako odkrycie, którym jest. To nie jest inteligentniejszy model w niższej cenie. To model o innym kształcie w niższej cenie, a pytanie, na które musi odpowiedzieć plan migracji, brzmi: który kształt konsumuje Twoje obciążenie — a nie który wynik jest wyższy, ponieważ w niezależnym zapisie te dwa wyniki to ta sama liczba.