
GPT-6.1 Sol vs GPT-6 Luna: trzynaście punktów indeksu, dziesięciokrotnie więcej pieniędzy i dwie ewaluacje, w których to się nie utrzymuje
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
OpenAI wydało GPT-6.1 Sol 29 września 2026 r., tydzień po tym, jak GPT-6 Luna pojawiła się 22 września w tym samym cyklu premier. Stanowią dwa końce tej samej generacji: Luna to tani poziom, Sol to średni poziom powyżej niej, a GPT-6 Astra plasuje się ponad oboma. Różnica w cenie między nimi to rząd wielkości — 0,10 USD i 0,50 USD za milion tokenów w porównaniu z 2,00 USD i 10,00 USD, wejście z pamięci podręcznej 0,01 USD w porównaniu z 0,10 USD — a różnica w możliwościach w niezależnym rankingu wynosi 13,7 punktu Intelligence Index, 51,8 w porównaniu z 38,1 przy maksymalnym wysiłku rozumowania. Dziesięć razy więcej pieniędzy za trzynaście punktów to w przybliżeniu najgorszy kurs wymiany w obecnej ofercie OpenAI. To, co sprawia, że porównanie jest warte opisania, to pytanie za czterdzieści dolarów, które się z tym wiąże: które to trzynaście punktów?
Dwa modele i tydzień między nimi
GPT-6 Luna to mały model z generacji GPT-6 — ten, który OpenAI opisuje jako stworzony do pracy o dużym wolumenie, wrażliwej na opóźnienia: klasyfikacji, ekstrakcji, routingu, masowego podsumowywania, wewnętrznej pętli agenta. Ma okno kontekstu o rozmiarze 1 050 000 tokenów i limit wyjścia 128 000 tokenów, przyjmuje tekst, obrazy i pliki jako dane wejściowe oraz zachowuje pełną sześciostopniową drabinkę poziomów wysiłku, w tym brak, który poziom 6.1 usunął. Cennik jest powodem, dla którego istnieje: 0,10 USD za wejście i 0,50 USD za wyjście za milion tokenów, buforowane wejście po 0,01 USD, a zapisy do pamięci podręcznej po 0,125 USD, z progiem długiego kontekstu powyżej 272 000 tokenów wejściowych do 0,20 USD, 0,75 USD i 0,02 USD za buforowane dane.
GPT-6.1 Sol to odświeżenie średniej klasy wydane tydzień później. To samo okno, ten sam limit wyjścia, te same modalności wejściowe, data odcięcia wiedzy 30 kwietnia 2026 r. w porównaniu z modelem Luna oraz drabinka wysiłku, która zaczyna się od low, ponieważ none i minimal są odrzucane z góry. Jego cena wynosi $2.00 i $10.00, a buforowane wejście po $0.10 — dwudziestokrotność stawki wejściowej modelu Luna i dwudziestokrotność jego stawki wyjściowej, przy czym linia pamięci podręcznej jest dziesięć razy droższa za każde trafienie.
Oba są w sprzedaży, oba są dostępne w ChatGPT Work i Codex, a także w API, i oba można wywołać za pomocą tego samego klucza po naszej stronie. Nic w tym zestawieniu nie wymaga dokonywania wyboru.
Co tak naprawdę daje trzynaście punktów indeksu
Wskaźnik zbiorczy jest najmniej informacyjną liczbą w tym porównaniu, ponieważ uśrednia zadania, które zachowują się bardzo różnie. Oceniany ewaluacja po ewaluacji przy maksymalnym wysiłku rozumowania w Artificial Analysis v4.3.2, kształt jest raczej podziałem niż nachyleniem:
• AA-LCR v1.1, rozumowanie na długim kontekście — GPT-6 Luna 0,833 vs GPT-6.1 Sol 0,830. Luna ma nieznaczną przewagę.
• SciCode — GPT-6 Luna 0,546 kontra GPT-6.1 Sol 0,542. Znów praktycznie remis i znowu tańszy model nominalnie prowadzi.
• Terminal-Bench 4.0 — GPT-6 Luna 0.126 kontra GPT-6.1 Sol 0.561. Różnica 43 punktów; te dwa modele grają w zupełnie innych ligach, jeśli chodzi o pracę w terminalu.
• Humanity's Last Exam — GPT-6 Luna 0,385 vs GPT-6.1 Sol 0,529.
• AutomationBench-AA — GPT-6 Luna 0.532 kontra GPT-6.1 Sol 0.649.
• GDPval-AA v2.1 — GPT-6 Luna Elo 1437,1 vs GPT-6.1 Sol Elo 1575,1, różnica 138 punktów Elo w pracy opartej na wiedzy profesjonalnej.
• GDP.pdf — GPT-6 Luna 0,228 vs GPT-6.1 Sol 0,310.
• CritPt — GPT-6 Luna 0.194 vs GPT-6.1 Sol 0.317.
• AA-Omniscience — GPT-6 Luna 0.65 vs GPT-6.1 Sol 41.5. W skali, w której zero oznacza tyle samo poprawnych odpowiedzi co niepoprawnych, Luna jest na linii wody, a Sol wyraźnie powyżej niej.
• MMMU-Pro — GPT-6 Luna 0,797 vs GPT-6.1 Sol 0,860.
• Koszt na zadanie indeksowania, niezależny — GPT-6 Luna $0.068 vs GPT-6.1 Sol $0.72; około dziesięciokrotna różnica na korzyść tańszego modelu
• Tokeny wyjściowe w przebiegu indeksu — GPT-6 Luna 144 miliony vs GPT-6.1 Sol 67 milionów, wobec mediany klasowej wynoszącej 100 milionów dla Luna i około 81 milionów dla Sol
Dwie z dziesięciu ocen to remis na korzyść taniego modelu. Osiem przypada droższemu, a w sześciu z tych ośmiu przewaga nie jest marginalna. To uczciwa interpretacja tych trzynastu punktów: to nie jednolity gradient jakości, to dwie zdolności — długotrwałe wykonywanie zadań w trybie agentowym i rzetelność faktograficzna — w których Luna po prostu nie jest modelem tej samej klasy, oraz szeroki środek, w którym różnica jest realna, ale na tyle mała, że pozostaje niewidoczna w twoim własnym zestawie ewaluacyjnym.
Wynik AA-LCR zasługuje na jedno zastrzeżenie, ponieważ to liczba, która najbardziej schlebia modelowi Luna. Rozumowanie w długim kontekście na poziomie 0,833 to mocny wynik, a oba modele dzieli mniej niż pół punktu, ale benchmark mierzy wyszukiwanie informacji i rozumowanie na długich danych wejściowych, a nie zdolność do działania w trakcie długiej sesji. Różnica na Terminal-Bench 4.0 pokazuje, jak wygląda „działanie w trakcie długiej sesji”, gdy jest oceniane, i wynosi 43 punkty.

Arytmetyka kosztu na zadanie — i gdzie przestaje być prawdziwa
Artificial Analysis wycenia każde uruchomienie indeksu na podstawie zmierzonego zużycia tokenów, więc podana kwota kosztu nie jest wnioskiem z cennika. Uruchomienie GPT-6 Luna kosztowało 0,068 USD na zadanie; GPT-6.1 Sol – 0,72 USD. Stosunek wynosi 10,7×, co jest tylko nieco gorsze od nominalnego dwudziestokrotnego stosunku cen, ponieważ Luna wygenerowała w tym uruchomieniu 144 miliony tokenów wyjściowych, podczas gdy Sol 67 milionów — tani model jest ponad dwukrotnie bardziej gadatliwy, co podkopuje jego własną przewagę. Mimo to różnica w rankingu nie jest mała, a w przypadku zadań z krótkimi odpowiedziami jeszcze by się zwiększyła: mniejsza objętość danych wyjściowych oznacza, że kara za gadatliwość Luny maleje, podczas gdy jej przewaga cenowa pozostaje stała.
Tam, gdzie ta arytmetyka przestaje się zgadzać, jest każde obciążenie, do którego ten indeks nie pasuje. Jeśli twoim zadaniem jest edycja w skali całego repozytorium, wymagająca utrzymania spójności dwudziestu wywołań narzędzi, model za 0,07 dolara, który zawodzi na tym zadaniu, kosztuje cię całą pętlę ponownych prób plus czas zegarowy, a model za 0,72 dolara, który kończy je za pierwszym razem, jest tańszy. Sam sposób, w jaki GPT-6.1 Sol został zaprezentowany na premierze, jest w całości zbudowany na tym pomyśle — koszt na ukończone zadanie — i jest to właściwe ujęcie: istotnym porównaniem nie jest stawka za token, lecz oczekiwany koszt na wynik, a w przypadku zadań, których Luna nie potrafi ukończyć, ta oczekiwana wartość jest nieograniczona.
Dwa szczegóły strukturalne wyostrzają tę granicę. Po pierwsze, proga długiego kontekstu: oba modele zmieniają cennik powyżej 272 000 tokenów wejściowych — Luna na $0.20 i $0.75, a Sol na $4.00 i $15.00 — więc bezwzględna różnica na tej granicy się powiększa, a nie zamyka, ale nowa stawka Luny nadal jest o rząd wielkości niższa niż standardowa stawka Sol. Po drugie, i łatwo to przeoczyć: drabinka poziomów wysiłku nie ma tego samego kształtu. Luna akceptuje none; Sol nie. Kaskada, która najpierw kieruje żądanie do Sol, a w razie błędu lub przekroczenia limitu czasu wraca do Luny, nie może przenosić parametru reasoning.effort żądania bez zmian, ponieważ konfiguracja, która jest poprawna w jednym modelu, zwraca błąd w drugim. To kwestia warstwy routingu, a nie jakości modelu, i dokładnie tego typu rzecz powinien pochłaniać pojedynczy endpoint z regułą routingu.
Uruchamianie obu jest sednem, a nie asekuracją.
Oba modele są dostępne w OrcaRouter w cenach katalogowych samego OpenAI, bez żadnych dodatków: GPT-6 Luna za 0,10 USD i 0,50 USD, przy czym wejście z pamięci podręcznej kosztuje 0,01 USD, GPT-6.1 Sol za 2,00 USD i 10,00 USD, przy czym wejście z pamięci podręcznej kosztuje 0,10 USD, a próg 272 000 tokenów w każdym z nich jest rozliczany dokładnie tak, jak podaje go dostawca. Ponieważ platforma przekazuje ceny katalogowe dostawcy bez narzutu, dwudziestokrotny stosunek opisany w tym artykule to stosunek, który faktycznie płacisz — w obu przypadkach.

Powód, który ma tu szczególne znaczenie, jest taki, że ta para to kaskada czekająca na napisanie. Klasyfikator, router, zadanie masowej ekstrakcji i agent kodujący w skali repozytorium nie należą do tego samego modelu, a różnica cen jest wystarczająco duża, że błędny wybór w którąkolwiek stronę jest kosztowny — dwudziestokrotnie za dużo na wywołanie w jedną stronę, nieudane zadanie w drugą. Jeden klucz, dwa modele i reguła, która kieruje łatwy ruch do Luna i eskaluje do Sol, gdy zmienia się klasa zadania lub gdy wynik Luna nie przejdzie sprawdzenia, to zmiana konfiguracji po naszej stronie, a nie drugi kontrakt z dostawcą. Automatyczne przełączanie awaryjne obejmuje przypadek, w którym jeden z dwóch jest zdegradowany, co w przypadku modelu wydanego osiem dni temu jest wciąż realną możliwością.

Decyzja, w jednym przebiegu
• Klasyfikacja, ekstrakcja, routing, masowe streszczanie, wewnętrzne pętle agenta — GPT-6 Luna, i przestań czytać. Przy $0.10/$0.50 i odczycie z pamięci podręcznej za jednego centa trzynaście punktów indeksu ogólnych możliwości nie jest warte dziesięciokrotności faktury za pracę, w której odpowiedź jest krótka i weryfikowalna.
• Kodowanie w skali repozytorium, agenci terminalowi, wieloetapowe wykonywanie — GPT-6.1 Sol. Różnica 43 punktów w Terminal-Bench 4.0 to cały argument; to właśnie ta możliwość jest kupowana za tę cenę.
• Pytania dotyczące pracy opartej na wiedzy, w których błędna odpowiedź jest kosztowna — GPT-6.1 Sol o lukach w AA-Omniscience i GDPval-AA. Wynik Luni w zakresie rzetelności faktograficznej jest na granicy.
• Długie dane wejściowe z krótką wygenerowaną odpowiedzią — GPT-6 Luna. Rozumuje na długim kontekście na poziomie modelu kosztującego dwadzieścia razy więcej, a jego kara za rozwlekłość wynosząca 144 miliony tokenów nigdy nie ma szansy zadziałać.
• Wszystko, co jest już ustawione na brak — pozostań na Luna albo zaplanuj budżet na zmianę. Ten szczebel nie istnieje w GPT-6.1 Sol.
• Powierzchnie wrażliwe na opóźnienia — GPT-6 Luna, według własnych pomiarów tablicy: 129,4 tokenów wyjściowych na sekundę i 100 sekund do pierwszego fragmentu w porównaniu z 59,7 i 332 w przypadku Sol.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
