Wygenerowana dwukolumnowa tablica wyników porównawczych zatytułowana „GPT-6.1 Sol vs GPT-6 Luna – tablica wyników”. Lewa kolumna „GPT-6.1 Sol”: wiersze o treści „Indeks inteligencji: 51,8”, „Koszt na zadanie indeksowe: 0,72 USD”, „Cena za 1 mln: 2,00 USD / 10,00 USD”, „Tokeny wyjściowe w przebiegu indeksu: 67 mln”, „Terminal-Bench 4.0: 56,1%”, „Minimalny poziom wysiłku: niski”. Prawa kolumna „GPT-6 Luna”: wiersze o treści „Indeks inteligencji: 38,1”, „Koszt na zadanie indeksowe: 0,07 USD”, „Cena za 1 mln: 0,10 USD / 0,50 USD”, „Tokeny wyjściowe w przebiegu indeksu: 144 mln”, „Terminal-Bench 4.0: 12,6%”, „Minimalny poziom wysiłku: brak”. Stopka o treści „Niezależne dane według Artificial Analysis v4.3.2 przy maksymalnym wysiłku; ceny katalogowe dostawców.”
Guides & Insights

GPT-6.1 Sol vs GPT-6 Luna: trzynaście punktów indeksu, dziesięciokrotnie więcej pieniędzy i dwie ewaluacje, w których to się nie utrzymuje

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Open​AI wydało GPT-6.1 Sol 29 września 2026 r., tydzień po tym, jak GPT-6 Luna pojawiła się 22 września w tym samym cyklu premier. Stanowią dwa końce tej samej generacji: Luna to tani poziom, Sol to średni poziom powyżej niej, a GPT-6 Astra plasuje się ponad oboma. Różnica w cenie między nimi to rząd wielkości — 0,10 USD i 0,50 USD za milion tokenów w porównaniu z 2,00 USD i 10,00 USD, wejście z pamięci podręcznej 0,01 USD w porównaniu z 0,10 USD — a różnica w możliwościach w niezależnym rankingu wynosi 13,7 punktu Intelligence Index, 51,8 w porównaniu z 38,1 przy maksymalnym wysiłku rozumowania. Dziesięć razy więcej pieniędzy za trzynaście punktów to w przybliżeniu najgorszy kurs wymiany w obecnej ofercie Open​AI. To, co sprawia, że porównanie jest warte opisania, to pytanie za czterdzieści dolarów, które się z tym wiąże: które to trzynaście punktów?

Dwa modele i tydzień między nimi

GPT-6 Luna to mały model z generacji GPT-6 — ten, który Open​AI opisuje jako stworzony do pracy o dużym wolumenie, wrażliwej na opóźnienia: klasyfikacji, ekstrakcji, routingu, masowego podsumowywania, wewnętrznej pętli agenta. Ma okno kontekstu o rozmiarze 1 050 000 tokenów i limit wyjścia 128 000 tokenów, przyjmuje tekst, obrazy i pliki jako dane wejściowe oraz zachowuje pełną sześciostopniową drabinkę poziomów wysiłku, w tym brak, który poziom 6.1 usunął. Cennik jest powodem, dla którego istnieje: 0,10 USD za wejście i 0,50 USD za wyjście za milion tokenów, buforowane wejście po 0,01 USD, a zapisy do pamięci podręcznej po 0,125 USD, z progiem długiego kontekstu powyżej 272 000 tokenów wejściowych do 0,20 USD, 0,75 USD i 0,02 USD za buforowane dane.

GPT-6.1 Sol to odświeżenie średniej klasy wydane tydzień później. To samo okno, ten sam limit wyjścia, te same modalności wejściowe, data odcięcia wiedzy 30 kwietnia 2026 r. w porównaniu z modelem Luna oraz drabinka wysiłku, która zaczyna się od low, ponieważ none i minimal są odrzucane z góry. Jego cena wynosi $2.00 i $10.00, a buforowane wejście po $0.10 — dwudziestokrotność stawki wejściowej modelu Luna i dwudziestokrotność jego stawki wyjściowej, przy czym linia pamięci podręcznej jest dziesięć razy droższa za każde trafienie.

Oba są w sprzedaży, oba są dostępne w ChatGPT Work i Codex, a także w API, i oba można wywołać za pomocą tego samego klucza po naszej stronie. Nic w tym zestawieniu nie wymaga dokonywania wyboru.

Co tak naprawdę daje trzynaście punktów indeksu

Wskaźnik zbiorczy jest najmniej informacyjną liczbą w tym porównaniu, ponieważ uśrednia zadania, które zachowują się bardzo różnie. Oceniany ewaluacja po ewaluacji przy maksymalnym wysiłku rozumowania w Artificial Analysis v4.3.2, kształt jest raczej podziałem niż nachyleniem:

• AA-LCR v1.1, rozumowanie na długim kontekście — GPT-6 Luna 0,833 vs GPT-6.1 Sol 0,830. Luna ma nieznaczną przewagę.

• SciCode — GPT-6 Luna 0,546 kontra GPT-6.1 Sol 0,542. Znów praktycznie remis i znowu tańszy model nominalnie prowadzi.

• Terminal-Bench 4.0 — GPT-6 Luna 0.126 kontra GPT-6.1 Sol 0.561. Różnica 43 punktów; te dwa modele grają w zupełnie innych ligach, jeśli chodzi o pracę w terminalu.

• Humanity's Last Exam — GPT-6 Luna 0,385 vs GPT-6.1 Sol 0,529.

• AutomationBench-AA — GPT-6 Luna 0.532 kontra GPT-6.1 Sol 0.649.

• GDPval-AA v2.1 — GPT-6 Luna Elo 1437,1 vs GPT-6.1 Sol Elo 1575,1, różnica 138 punktów Elo w pracy opartej na wiedzy profesjonalnej.

• GDP.pdf — GPT-6 Luna 0,228 vs GPT-6.1 Sol 0,310.

• CritPt — GPT-6 Luna 0.194 vs GPT-6.1 Sol 0.317.

• AA-Omniscience — GPT-6 Luna 0.65 vs GPT-6.1 Sol 41.5. W skali, w której zero oznacza tyle samo poprawnych odpowiedzi co niepoprawnych, Luna jest na linii wody, a Sol wyraźnie powyżej niej.

• MMMU-Pro — GPT-6 Luna 0,797 vs GPT-6.1 Sol 0,860.

• Koszt na zadanie indeksowania, niezależny — GPT-6 Luna $0.068 vs GPT-6.1 Sol $0.72; około dziesięciokrotna różnica na korzyść tańszego modelu

• Tokeny wyjściowe w przebiegu indeksu — GPT-6 Luna 144 miliony vs GPT-6.1 Sol 67 milionów, wobec mediany klasowej wynoszącej 100 milionów dla Luna i około 81 milionów dla Sol

Dwie z dziesięciu ocen to remis na korzyść taniego modelu. Osiem przypada droższemu, a w sześciu z tych ośmiu przewaga nie jest marginalna. To uczciwa interpretacja tych trzynastu punktów: to nie jednolity gradient jakości, to dwie zdolności — długotrwałe wykonywanie zadań w trybie agentowym i rzetelność faktograficzna — w których Luna po prostu nie jest modelem tej samej klasy, oraz szeroki środek, w którym różnica jest realna, ale na tyle mała, że pozostaje niewidoczna w twoim własnym zestawie ewaluacyjnym.

Wynik AA-LCR zasługuje na jedno zastrzeżenie, ponieważ to liczba, która najbardziej schlebia modelowi Luna. Rozumowanie w długim kontekście na poziomie 0,833 to mocny wynik, a oba modele dzieli mniej niż pół punktu, ale benchmark mierzy wyszukiwanie informacji i rozumowanie na długich danych wejściowych, a nie zdolność do działania w trakcie długiej sesji. Różnica na Terminal-Bench 4.0 pokazuje, jak wygląda „działanie w trakcie długiej sesji”, gdy jest oceniane, i wynosi 43 punkty.

A generated hero card for a GPT-6.1 Sol versus GPT-6 Luna comparison, headed 'Thirteen index points, ten times the money', with two badges reading 'GPT-6.1 Sol: 51.8 at $2.00 / $10.00 per 1M' and 'GPT-6 Luna: 38.1 at $0.10 / $0.50 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

Arytmetyka kosztu na zadanie — i gdzie przestaje być prawdziwa

Artificial Analysis wycenia każde uruchomienie indeksu na podstawie zmierzonego zużycia tokenów, więc podana kwota kosztu nie jest wnioskiem z cennika. Uruchomienie GPT-6 Luna kosztowało 0,068 USD na zadanie; GPT-6.1 Sol – 0,72 USD. Stosunek wynosi 10,7×, co jest tylko nieco gorsze od nominalnego dwudziestokrotnego stosunku cen, ponieważ Luna wygenerowała w tym uruchomieniu 144 miliony tokenów wyjściowych, podczas gdy Sol 67 milionów — tani model jest ponad dwukrotnie bardziej gadatliwy, co podkopuje jego własną przewagę. Mimo to różnica w rankingu nie jest mała, a w przypadku zadań z krótkimi odpowiedziami jeszcze by się zwiększyła: mniejsza objętość danych wyjściowych oznacza, że kara za gadatliwość Luny maleje, podczas gdy jej przewaga cenowa pozostaje stała.

Tam, gdzie ta arytmetyka przestaje się zgadzać, jest każde obciążenie, do którego ten indeks nie pasuje. Jeśli twoim zadaniem jest edycja w skali całego repozytorium, wymagająca utrzymania spójności dwudziestu wywołań narzędzi, model za 0,07 dolara, który zawodzi na tym zadaniu, kosztuje cię całą pętlę ponownych prób plus czas zegarowy, a model za 0,72 dolara, który kończy je za pierwszym razem, jest tańszy. Sam sposób, w jaki GPT-6.1 Sol został zaprezentowany na premierze, jest w całości zbudowany na tym pomyśle — koszt na ukończone zadanie — i jest to właściwe ujęcie: istotnym porównaniem nie jest stawka za token, lecz oczekiwany koszt na wynik, a w przypadku zadań, których Luna nie potrafi ukończyć, ta oczekiwana wartość jest nieograniczona.

Dwa szczegóły strukturalne wyostrzają tę granicę. Po pierwsze, proga długiego kontekstu: oba modele zmieniają cennik powyżej 272 000 tokenów wejściowych — Luna na $0.20 i $0.75, a Sol na $4.00 i $15.00 — więc bezwzględna różnica na tej granicy się powiększa, a nie zamyka, ale nowa stawka Luny nadal jest o rząd wielkości niższa niż standardowa stawka Sol. Po drugie, i łatwo to przeoczyć: drabinka poziomów wysiłku nie ma tego samego kształtu. Luna akceptuje none; Sol nie. Kaskada, która najpierw kieruje żądanie do Sol, a w razie błędu lub przekroczenia limitu czasu wraca do Luny, nie może przenosić parametru reasoning.effort żądania bez zmian, ponieważ konfiguracja, która jest poprawna w jednym modelu, zwraca błąd w drugim. To kwestia warstwy routingu, a nie jakości modelu, i dokładnie tego typu rzecz powinien pochłaniać pojedynczy endpoint z regułą routingu.

Uruchamianie obu jest sednem, a nie asekuracją.

Oba modele są dostępne w OrcaRouter w cenach katalogowych samego Open​AI, bez żadnych dodatków: GPT-6 Luna za 0,10 USD i 0,50 USD, przy czym wejście z pamięci podręcznej kosztuje 0,01 USD, GPT-6.1 Sol za 2,00 USD i 10,00 USD, przy czym wejście z pamięci podręcznej kosztuje 0,10 USD, a próg 272 000 tokenów w każdym z nich jest rozliczany dokładnie tak, jak podaje go dostawca. Ponieważ platforma przekazuje ceny katalogowe dostawcy bez narzutu, dwudziestokrotny stosunek opisany w tym artykule to stosunek, który faktycznie płacisz — w obu przypadkach.

A screenshot of the OrcaRouter model page for openai/gpt-6-luna, showing the listing dated 2026-09-22, the model described as the fast, cost-efficient tier of OpenAI's GPT-6 series for high-volume and latency-sensitive workloads, a 1M-token context with 128K maximum output, text, image and file input, and the list price of $0.10 input and $0.50 output per million tokens with a 1.45 s median time to first token.

Powód, który ma tu szczególne znaczenie, jest taki, że ta para to kaskada czekająca na napisanie. Klasyfikator, router, zadanie masowej ekstrakcji i agent kodujący w skali repozytorium nie należą do tego samego modelu, a różnica cen jest wystarczająco duża, że błędny wybór w którąkolwiek stronę jest kosztowny — dwudziestokrotnie za dużo na wywołanie w jedną stronę, nieudane zadanie w drugą. Jeden klucz, dwa modele i reguła, która kieruje łatwy ruch do Luna i eskaluje do Sol, gdy zmienia się klasa zadania lub gdy wynik Luna nie przejdzie sprawdzenia, to zmiana konfiguracji po naszej stronie, a nie drugi kontrakt z dostawcą. Automatyczne przełączanie awaryjne obejmuje przypadek, w którym jeden z dwóch jest zdegradowany, co w przypadku modelu wydanego osiem dni temu jest wciąż realną możliwością.

A screenshot of OpenAI's GPT-6 Luna documentation page, showing the model ID gpt-6-luna, the effort ladder supporting none, low, medium, high, xhigh and max, a 1,050,000-token context window with 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and the pricing table listing input at $0.10, cached input at $0.01, cache writes at $0.125 and output at $0.50 per million tokens.

Decyzja, w jednym przebiegu

• Klasyfikacja, ekstrakcja, routing, masowe streszczanie, wewnętrzne pętle agenta — GPT-6 Luna, i przestań czytać. Przy $0.10/$0.50 i odczycie z pamięci podręcznej za jednego centa trzynaście punktów indeksu ogólnych możliwości nie jest warte dziesięciokrotności faktury za pracę, w której odpowiedź jest krótka i weryfikowalna.

• Kodowanie w skali repozytorium, agenci terminalowi, wieloetapowe wykonywanie — GPT-6.1 Sol. Różnica 43 punktów w Terminal-Bench 4.0 to cały argument; to właśnie ta możliwość jest kupowana za tę cenę.

• Pytania dotyczące pracy opartej na wiedzy, w których błędna odpowiedź jest kosztowna — GPT-6.1 Sol o lukach w AA-Omniscience i GDPval-AA. Wynik Luni w zakresie rzetelności faktograficznej jest na granicy.

• Długie dane wejściowe z krótką wygenerowaną odpowiedzią — GPT-6 Luna. Rozumuje na długim kontekście na poziomie modelu kosztującego dwadzieścia razy więcej, a jego kara za rozwlekłość wynosząca 144 miliony tokenów nigdy nie ma szansy zadziałać.

• Wszystko, co jest już ustawione na brak — pozostań na Luna albo zaplanuj budżet na zmianę. Ten szczebel nie istnieje w GPT-6.1 Sol.

• Powierzchnie wrażliwe na opóźnienia — GPT-6 Luna, według własnych pomiarów tablicy: 129,4 tokenów wyjściowych na sekundę i 100 sekund do pierwszego fragmentu w porównaniu z 59,7 i 332 w przypadku Sol.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie