Wygenerowana karta tytułowa hero z napisem „GPT-6 Sol i GPT-6 Luna” pod nadtytułem „Premiera modelu – wrzesień 2026”, z podtytułem „Połowa ceny za token to nie połowa kosztu na zadanie”, z czterema plakietkami o treści „GPT-6 Sol: $2.00 / $10.00 za 1 mln”, „GPT-6 Luna: $0.10 / $0.50 za 1 mln”, „Sol: indeks 48 przy $1.06 na zadanie” i „Luna: indeks 37 przy $0.07 na zadanie”, oraz przypisem o treści „Ceny według OpenAI; indeks i koszt na zadanie według Artificial Analysis, 22 września 2026”. Prawdziwe logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

GPT-6 Sol i GPT-6 Luna: Tańszy token to nie zawsze tańsze zadanie

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dostawca wypuścił GPT-6 Sol i GPT-6 Luna 22 września 2026 r., a wszędzie głównym tematem jest cena: Sol po 2,00 USD za milion tokenów wejściowych i 10,00 USD za milion tokenów wyjściowych, Luna po 0,10 USD i 0,50 USD — obie w przybliżeniu o połowę tańsze niż to, co GPT-5.6 Sol i GPT-5.6 Lunapobierają w obecnych stawkach promocyjnych, a obie plasują się znacznie poniżej flagowego modelu GPT-6 Astra po 10,00/50,00 USD. Komunikat samego dostawcy zaczyna się od słów: „uczyniliśmy również buforowanie i wnioskowanie wydajniejszymi”. Kłopot z odczytywaniem tego jako opowieści o obniżce polega na tym, że jednostką, która faktycznie trafia na twoją fakturę, nie jest token. To zadanie. A pierwsze niezależne pomiary, opublikowane tego samego dnia, pokazują, że dwa nowe modele dryfują w przeciwnych kierunkach pod względem właśnie tej jednostki — przy czym GPT-6 Luna, tańsza z dwóch o czynnik dwudziestu na wejściu, wypada gorzej z dwóch w porównaniu z własnym poprzednikiem. Jeden z tych modeli to czyste ulepszenie, a drugi to prawdziwy kompromis, a komunikat dostawcy ich nie rozróżnia.

Zanim przejdę do liczb, zasady źródłowe tego tekstu, ponieważ dwa zbiory dowodów zasługują tu na bardzo różną wagę. Ceny, okno kontekstowe, stawki za pamięć podręczną i daty odcięcia wiedzy pochodzą z dokumentacji API i tabel cenowych OpenAI, odczytanych 23 września 2026 r., przy czym wiersze dotyczące warstw usług i zapisu do pamięci podręcznej zostały potwierdzone w zewnętrznych narzędziach śledzących koszty, a nie wzięte wyłącznie z ogłoszenia. Tabele benchmarków OpenAI — AutomationBench, DeepSWE 1.1, OSWorld 2.0, Agents' Last Exam oraz wewnętrzna ocena zgodności z faktami — są raportowane przez dostawcę i nieodtworzone, a każda pochodząca z nich liczba poniżej jest oznaczona jako taka. Niezależne dane pochodzą z Artificial Analysis, które w dniu premiery przetestowało oba modele w swoich indeksach Intelligence Index i Coding Agent Index; to na nich należy polegać przy podejmowaniu decyzji. Tam, gdzie oba źródła się różnią, artykuł mówi o tym wprost, zamiast je uśredniać.

Premiera w jednym akapicie

Sol i Luna to modele ze średniej i niskiej klasy należące do rodziny GPT-6, wytrenowane metodami, które stoją za GPT-6 Astra, i pozycjonowane jako szybsze, tańsze sposoby na osiągnięcie większości możliwości tej rodziny. OpenAI przedstawia to w kategoriach kosztu na zadanie, a nie surowych możliwości: twierdzi, że GPT-6 Sol popełnia około połowę mniej błędów niż GPT-5.6 Sol w swojej wewnętrznej ocenie faktograficznej, a GPT-6 Luna przy wyższym wysiłku rozumowania dorównuje faktograficzności GPT-5.6 Sol przy około jednej setnej kosztu zadania. Oba przyjmują tekst i obrazy na wejściu i generują tekst, oba mają okno kontekstowe o rozmiarze 1 050 000 tokenów z limitem wyjścia 128K — Artificial Analysis podaje 872 tys. dla tego samego modelu, więc górną granicę tego okna traktuj jako wartość podaną przez dostawcę — oraz oba udostępniają wysiłek rozumowania od none do max — poziom, którego GPT-6 Astra nie oferuje, ponieważ Astra nie ma none. Identyfikatory modeli to gpt-6-sol i gpt-6-luna. Dostępność odbywa się przez API, przez ChatGPT Work i Codex dla kont Plus, Pro, Business, Enterprise i Edu oraz przez Amazon Bedrock, który ogłosił ogólną dostępność obu tego samego dnia. Użytkownicy planów Free i Go otrzymują Lunę w aplikacji desktopowej; żaden z modeli nie jest jeszcze dostępny w zwykłym trybie Chat.

Co mówią cztery niezależne liczby i dlaczego się nie zgadzają

Zacznijmy od GPT-6 Sol, ponieważ jego historia jest prosta. Artificial Analysis ocenia go 48 punktami w Indeksie Inteligencji, co daje 18. miejsce spośród 212 zmierzonych modeli, przy 1,06 USD za zadanie indeksowe w porównaniu z 1,99 USD dla GPT-5.6 Sol — mniej więcej połowa kosztu przy takim samym wyniku indeksu i poprawa kosztu na zadanie, która się utrzymuje, a nie znika. Jego Indeks Agenta Kodującego rośnie z 55 do 57, przy czym Terminal-Bench 4.0 przesuwa się z 37% na 43%, a SWE-Atlas-QnA z 54% na 58%, przy 2,99 USD za zadanie na granicy Pareto. Jego wskaźnik halucynacji spada z 92% do 60%, a jego zachowanie polegające na wstrzymywaniu się od odpowiedzi zmienia się całkowicie: teraz odpowiada na 83% pytań, podczas gdy poprzednia generacja odpowiadała na 99%, a w zamian popełnia o jedną czwartą mniej błędów, przy czym dokładność spada z 59% do 54%. To model, którego nauczono milczeć, gdy czegoś nie wie, a AA-Omniscience Index przesuwający się z 22 na 27 to ten sam fakt wyrażony jako wynik.

Teraz GPT-6 Luna i historia się zmienia. Artificial Analysis przyznaje mu 37 punktów w Intelligence Index — dokładnie tyle samo, ile uzyskuje GPT-5.6 Luna. Jego koszt na zadanie indeksowe spada z 0,18 USD do 0,07 USD, około 60% mniej, i ta oszczędność jest realna. Ale jego Coding Agent Index spada, z 43 do 41, przy czym SWE-Atlas-QnA spada z 49% do 44%, a DeepSWE 1.1 spada z 66% do 64%. Jego wskaźnik halucynacji poprawia się z 93% do 77%, a zachowanie polegające na wstrzymywaniu się od odpowiedzi ledwie się zmienia — dokładność 44% wobec 43%, AA-Omniscience z −10 do 1. Czytając to razem: ta sama zmierzona inteligencja, przy mniej więcej 40% kosztu zadania, z gorszym agentem kodującym i zasadniczo niezmienioną jakością odpowiedzi.

To nie jest sprzeczność, a powód ma znaczenie. Tańszy token daje ci mniej tylko wtedy, gdy model zużywa więcej tokenów, by wykonać tę samą pracę — a niezależne dane mówią, że te modele zużywają więcej, a nie mniej. Liczba tokenów wyjściowych na zadanie indeksowania wzrosła z 29 tys. do 31 tys. w przypadku Sol i z 41 tys. do 51 tys. w przypadku Luny. 60% oszczędności GPT-6 Luna wynika w całości z obniżki ceny, a nie z oszczędniejszego działania. Dryf liczby tokenów na zadanie jest na tyle mały, że arytmetyka wciąż działa tu na twoją korzyść; nie jest jednak na tyle mały, by ignorować go jako kategorię, ponieważ to właśnie mechanizm, przez który przyszła obniżka ceny może zostać zneutralizowana przez bardziej gadatliwy model. Samo OpenAI z tego samego powodu przeszło na ujęcie kosztu na zadanie.

Dwie regresje pozostają poza dwoma głównymi indeksami i zasługują na wymienienie z nazwy, ponieważ żadna z nich nie pojawia się w ogłoszeniu OpenAI. W GDPval-AA v2.1, który mierzy rezultaty pracy opartej na wiedzy, GPT-6 Sol traci około 100 Elo względem poprzednika, a GPT-6 Luna około 75. GPT-6 Luna traci także około 45 Elo w AA-Briefcase v1.1, gdzie Sol utrzymuje stabilny poziom — Artificial Analysis przypisuje tę różnicę słabszej prezentacji i brakującym pozycjom kryteriów. Jeśli używasz tańszej warstwy do masowego streszczania, ekstrakcji i klasyfikacji, nic z tego cię nie dotyczy. Jeśli natomiast do tworzenia tekstu, który ktoś zatwierdza — to już tak.

A generated two-column scoreboard titled 'GPT-6 Sol vs GPT-6 Luna - the scoreboard'. The left column, GPT-6 Sol, lists Intelligence Index 48, cost per index task $1.06, Coding Agent Index 57, hallucination rate 60%, GDPval-AA about 100 Elo lower, and price per million tokens $2.00 / $10.00. The right column, GPT-6 Luna, lists Intelligence Index 37, cost per index task $0.07, Coding Agent Index 41, hallucination rate 77%, GDPval-AA about 75 Elo lower, and price per million tokens $0.10 / $0.50. A footer line credits Artificial Analysis for the index, cost and hallucination figures as of September 22, 2026 and OpenAI for the prices. The real OrcaRouter logo is composited in the bottom-right corner.

Prawdziwą wiadomością o API jest zmiana w cachowaniu

Pod cennikiem kryje się zmiana, która ma większe znaczenie dla rachunku za produkcję niż obniżka z nagłówka, i to jest ta część ogłoszenia, o której sam wpis OpenAI napomyka jednym zdaniem. Zmieniły się trzy rzeczy, a trzecia jest tą, którą trzeba przeczytać dwa razy.

Pierwszy to sama zniżka: odczyty z pamięci podręcznej danych wejściowych są rozliczane według 10% stawki za dane wejściowe, co daje 90% zniżki i jest tym samym warunkiem, który rodzina już miała, a nie nowym. Wejście z pamięci podręcznej Sola kosztuje 0,20 USD za milion, a Luny 0,01 USD; zapisy do pamięci podręcznej mają 1,25-krotny narzut — odpowiednio 2,50 USD i 0,125 USD — z pojedynczym 30-minutowym czasem życia.

Drugi to kontrola. Jawne buforowanie przez prompt_cache_options i prompt_cache_breakpoint — parametry, które pozwalają zadeklarować, gdzie kończy się prefiks promptu wielokrotnego użytku, zamiast liczyć, że dostawca go odgadnie — jest dostępne w obu modelach. To nie jest nowa powierzchnia API; nowe jest to, że warto go używać, ponieważ domyślne wskaźniki trafień wzrosły.

Trzecia zmiana to ta, która zmienia architekturę. Zmiana poziomu wysiłku rozumowania albo włączanie i wyłączanie narzędzi nie unieważnia już buforowanego prefiksu.Wcześniej pętla agenta, która podkręcała wysiłek na trudny krok i zmniejszała go z powrotem na łatwy, płaciła za ponowne przetworzenie całego kontekstu przy każdym obrocie pokrętła — podobnie jak ta, która dodawała lub usuwała narzędzie w trakcie rozmowy. Ten podatek jest teraz zniesiony w tych dwóch modelach. OpenAI powołuje się na GitHuba, który poinformował, że zmiany zmniejszyły udział tokenów podpowiedzi wymagających świeżego przetworzenia o ponad połowę w miliardach żądań. Traktuj to jako liczbę dostarczoną przez dostawcę — jest wiarygodna i nie została niezależnie zweryfikowana.

Zrób arytmetykę dla długiej pętli agenta, a ranking dwóch ogłoszeń się odwraca. Pętla, która przenosi 30 000-tokenowy prompt systemowy i schemat narzędzi przez 200 tur, przetwarza 6 milionów tokenów kontekstu. Bez buforowania, na GPT-6 Sol, to 12,00 USD danych wejściowych. Z prefiksem w pamięci podręcznej po 0,20 USD za milion to 1,20 USD plus jednorazowy zapis — o rząd wielkości mniej, dzięki zmianie parametru, jeszcze zanim w ogóle zastosowano obniżkę stawki. Ogłoszenie sprzedawało obniżkę stawki. To zachowanie pamięci podręcznej faktycznie przesuwa liczbę i jest powodem, dla którego stawka z nagłówka 2,00 USD zachowuje się jak coś znacznie tańszego w obciążeniach, dla których OpenAI reklamuje te modele.

Cennik, w tym części, które ogłoszenie pomija

Stawki nagłówkowe to nie cała tabela stawek, a trzy poziomy zmieniają decyzję w przypadku konkretnych obciążeń.

Base — GPT-6 Sol $2.00 za wejście / $10.00 za wyjście; GPT-6 Luna $0.10 za wejście / $0.50 za wyjście, za milion tokenów, dla promptów do 272 tys. tokenów wejściowych.

Długi kontekst — powyżej 272K tokenów wejściowych całe żądaniejest rozliczane po 2x stawce za wejście i 1,5x za wyjście: 4,00 USD/15,00 USD dla Sol i 0,20 USD/0,75 USD dla Luna. To klif, a nie stawka marginalna. Jeśli Twoje prompty sięgają 300K tokenów, płacisz podwójnie za całe żądanie, a nie za 28K powyżej progu, a podzielenie dokumentu na dwa wywołania poniżej progu jest często tańsze niż wysłanie go raz powyżej.

Poziomy usług — Flex zmniejsza rachunek o połowę ($1.00/$5.00 dla Sol, $0.05/$0.25 dla Luna) w zamian za wolniejsze przetwarzanie; Priority podwaja rachunek. Oba wybiera się przez parametr service_tier. Flex jest miejscem, w którym powinny znajdować się zadania wsadowe, a prawie nigdy się nie znajdują.

Dane wejściowe z pamięci podręcznej — 0,20 USD za milion na Sol i 0,01 USD na Luna, czyli 90% zniżki, z TTL wynoszącym 30 minut i 1,25x narzutem za zapis do pamięci podręcznej.

Kontekst i dane wyjściowe — okno 1 050 000 tokenów, maksymalnie 128 tys. tokenów wyjściowych, tekst i obraz na wejściu, tekst na wyjściu, wysiłek rozumowania: od braku do maks. ze średnim jako domyślnym.

Daty odcięcia wiedzy — 20 kwietnia 2026 r. dla GPT-6 Sol i 18 maja 2026 r. dla GPT-6 Luna, czyli miesiąc różnicy w obrębie tej samej rodziny — warto o tym wiedzieć, zanim założysz, że oba modele mają taki sam obraz świata.

Co mówi tabela benchmarków OpenAI, a czego nie

Opublikowane przez OpenAI porównania wszystkie dotyczą kosztu na zadanie, wszystkie są przeciwko Anthropic i wszystkie zostały przeprowadzone przez dostawcę. W AutomationBench 1.0.6, ewaluacji agentowej obejmującej 47 narzędzi, firma podaje, że GPT-6 Sol przy poziomie wysiłku xhigh osiąga 33,2% przy 0,27 USD na zadanie, w porównaniu z Claude Opus 5 z 26,9% i około 11-krotnie wyższym kosztem na zadanie. W DeepSWE 1.1 podaje, że Sol przy maksymalnym wysiłku osiąga 68,8% w porównaniu z Claude Fable 5 z 69,9% — strata na wyniku przy około 80% niższym koszcie na zadanie — a Luna 66,6%. W OSWorld 2.0 Sol osiąga 60,5% przy poziomie xhigh w porównaniu z 60,3% Opus 5, ponownie przy około 80% niższym koszcie na zadanie. W Agents' Last Exam Sol osiąga 56,4%, co według OpenAI przewyższa najlepszy wynik Opus 5 przy 60% niższym koszcie na zadanie.

Każda z tych liczb pochodzi od dostawcy i nie została przez nikogo odtworzona, a dwa zastrzeżenia warto zachować w pamięci, a nie odłożyć do archiwum. Po pierwsze, OpenAI porównywało się z Claude Opus 5, a nie z Claude Opus 5.5 wydanym kilka godzin przed ogłoszeniem, więc żadne porównanie w identycznych warunkach nie ustala jeszcze, który model faktycznie zapewnia niższy koszt na udane zadanie. Po drugie, koszt na zadanie to nie to samo co koszt na poprawne zadanie: model, który odpowiada w 83% przypadków, a w pozostałych się wstrzymuje, będzie wyglądał tanio na zadanie w benchmarku, który uznaje wstrzymania się za zadania. To właśnie przytoczone powyżej niezależne dane o wstrzymywaniu się pozwalają uczciwie to wycenić — GPT-6 Sol odpowiadający na 83% pytań tam, gdzie stary model odpowiadał na 99%, to świadomy kompromis, a to, czy jest dobry, zależy wyłącznie od tego, ile kosztuje cię błędna odpowiedź.

OpenAI informuje, że GPT-6 Luna przy wyższym wysiłku dorównuje GPT-5.6 Sol pod względem faktyczności przy około jednej setnej kosztu zadania. To porównanie faktyczności, a nie porównanie możliwości, a niezależny Coding Agent Index umieszcza GPT-6 Luna o dwa punkty poniżej GPT-5.6 Luna, nie mówiąc już o GPT-5.6 Sol.

Screenshot of the Artificial Analysis model page for GPT-6 Sol, captured 23 September 2026, showing the model's Intelligence Index of 48 alongside its cost per task and its output-token and speed figures for the measured reasoning-effort settings.

Co właściwie z tym zrobić

GPT-6 Sol to ten oczywisty wybór. O połowę niższy koszt zadania przy wyniku indeksu poziomu, lepszy agent do kodowania, duży spadek liczby halucynacji i autentyczna zmiana w zachowaniu polegającym na wstrzymywaniu się od odpowiedzi składają się na ulepszenie, które można zaplanować, a nie traktować jako ryzykowny zakład. Jeśli korzystasz z GPT-5.6 Sol, to migracja, a jedyne prawdziwe pytanie brzmi: które z twoich promptów zależą od gotowości starego modelu do odpowiadania na wszystko.

GPT-6 Luna to ten, którego warto przetestować, zanim przejdziesz dalej. Nie jest to wersja ściśle lepsza od GPT-5.6 Luna; ma inny kształt — jest tańszy w przeliczeniu na zadanie, bezpieczniejszy, jeśli chodzi o to, co będzie twierdzić, i mierzalnie gorszy w kodowaniu agentowym. W przypadku klasyfikacji, ekstrakcji, routingu i streszczania na dużą skalę taki kompromis to niemal darmowe pieniądze. W przypadku wszystkiego, co zasila agenta kodującego albo tworzy dokument, który człowiek zatwierdza, dwupunktowa regresja Coding Agent i spadek w GDPval to powód, by utrzymać GPT-5.6 Luna na ścieżce, dopóki nie przepuścisz własnych zadań przez oba.

To jest także argument przeciwko twardemu wiązaniu się z którymkolwiek z nich. Oba modele są obecnie dostępne wyłącznie w OpenAI, a obciążenia, którym służą te poziomy — routing, ekstrakcja, tania klasyfikacja — to dokładnie te przypadki, w których drugi dostawca za tym samym punktem końcowym zamienia regresję modelu w nieistotne zdarzenie. OrcaRouter przekazuje ceny katalogowe dostawców dalej przy 0% marży, więc zmiana stawek u dostawcy pojawia się po naszej stronie tego samego dnia, co u niego, a DSL routingu pozwala umieścić GPT-6 Luna za tańszym modelem dla łatwiejszej części ruchu, podczas gdy trudniejsza część trafia do GPT-6 Sol — z automatycznym przełączaniem awaryjnym, jeśli którakolwiek ze ścieżek ulegnie degradacji. Nie musisz wybierać zwycięzcy w dniu premiery, aby czerpać korzyści z premiery.

Szczere zastrzeżenie: GPT-6 Sol i GPT-6 Luna nie są routowalne przez OrcaRouter na dzień 23 września 2026 r. Nie hostujemy ich jeszcze i nic powyżej nie powinno być odczytywane jako twierdzenie, że to robimy. Po naszej stronie jest dziś zestaw porównawczy — GPT-5.6 Sol w cenie $4.00/$20.00, GPT-5.6 Luna w cenie $0.20/$1.20 i GPT-6 Astra w cenie $10.00/$50.00 — który jest dokładnie tym, czego potrzebujesz, aby wycenić migrację, zanim się na nią zdecydujesz.

Screenshot of the OrcaRouter model page for GPT-5.6 Luna, captured 23 September 2026, showing the model id openai/gpt-5.6-luna with its context window, input and output pricing per million tokens, measured time to first token and recent traffic.

Co obejrzeć dalej

Trzy rzeczy rozstrzygnęłyby, czym ta premiera faktycznie była. Pierwsza to czy stawka GPT-5.6 Luna na poziomie 0,20/1,20 dolara przetrwa kwartał, ponieważ trwała cena od jednego dostawcy historycznie była raczej ruchem otwierającym niż końcem — a wydanie Claude Opus 5.5 tego samego dnia sugeruje, że presja, która doprowadziła do tej obniżki, nie zniknęła. Druga to czy zmiana w zakresie wstrzymywania się od odpowiedzi utrzyma się w praktyce: GPT-6 Sol odmawiający odpowiedzi na jedno pytanie na sześć to zmiana, która w laboratorium czyta się jako poprawa, a w pipeline'ie zakładającym odpowiedź — jako zepsuty produkt. Trzecia to czy zachowanie pamięci podręcznej jest realne w Twoim ruchu, co da się zmierzyć w tym tygodniu i na co odpowiedzieć można tylko przez pomiar — rabat jest na tyle duży, że jedna godzina spędzona na oprzyrządowaniu współczynników trafień pamięci podręcznej przy Twoich najdłuższych promptach jest warta więcej niż kolejna tabela benchmarków.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie