Wygenerowana karta hero zatytułowana „GPT-6.1 Sol kontra generacja GPT-6”, z nagłówkiem „Jedna generacja, 48-krotność kosztu”, pokazująca cztery piętrzące się szczeble oznaczone GPT-6 Astra (Indeks 52,7; 3,26 USD za zadanie), GPT-6.1 Sol (Indeks 51,8; 0,72 USD za zadanie), GPT-6 Sol (Indeks 47,6; 1,05 USD za zadanie) i GPT-6 Luna (Indeks 38,1; 0,07 USD za zadanie), ze stopką o treści „Dane: Artificial Analysis v4.3.2.” oraz logo OrcaRouter w prawym dolnym rogu.
Engineering & Research

GPT-6.1 Sol kontra generacja GPT-6: Generacja jednego

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dostawca dodał czwartą nazwę do swojej linii modeli 29 września 2026 r. i określił to mianem generacji, a najciekawsza w tym wszystkim jest arytmetyka tego zestawu: GPT-6.1 Sol to cała ta generacja. GPT-6 Luna i GPT-6 Sol, oba wydane 22 września 2026 r., pozostają bez zmian; GPT-6 Astra, dostępny od 4 września 2026 r., pozostaje bez zmian; odświeżenie 6.1 objęło dokładnie jeden poziom. Tymczasem GPT-6.1 Sol, przy cenie $2,00 za milion tokenów wejściowych i $10,00 za milion tokenów wyjściowych, uzyskuje 51,83 punktu w Artificial Analysis Intelligence Index przy koszcie $0,724 na zadanie — w odległości 0,84 punktu od GPT-6 Astra, który kosztuje $3,2575 na zadanie przy $10,00/$50,00. Ta sama generacja na etykiecie, a pod spodem cztery różne realia ekonomiczne.

To sprawia, że „czy powinienem używać generacji GPT-6” to złe pytanie. Ta linia obejmuje 48-krotny zakres kosztu na zadanie i 14,6-punktowy zakres mierzonej inteligencji, a odpowiedź zależy wyłącznie od tego, który poziom masz na myśli. Oto drabinka — zmierzona.

Cztery szczeble, według pomiaru

A chart titled 'The GPT-6 ladder - measured', subtitle 'Artificial Analysis Intelligence Index, and the measured cost of one task', with four horizontal bars whose lengths are proportional to the Intelligence Index: GPT-6 Luna Index 38.1 / $0.068 per task, GPT-6 Sol Index 47.6 / $1.05 per task, GPT-6.1 Sol Index 51.8 / $0.72 per task, GPT-6 Astra Index 52.7 / $3.26 per task; footer 'Bar length is proportional to the Intelligence Index (0-60 scale). All figures: Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

• GPT-6 Luna — Indeks 38,12, 0,10 USD / 0,50 USD za 1 mln, 0,01 USD z pamięci podręcznej, 0,0678 USD za zadanie, 50 012 tokenów wyjściowych, 100,1 s do pierwszego tokenu
• GPT-6 Sol — Indeks 47,63, 2,00 USD / 10,00 USD, 0,20 USD z pamięci podręcznej, 1,045 USD za zadanie, 31 000 tokenów wyjściowych, 124,3 s
• GPT-6.1 Sol — Indeks 51,83, 2,00 USD / 10,00 USD, 0,10 USD z pamięci podręcznej, 0,724 USD za zadanie, 38 128 tokenów wyjściowych, 332,0 s
• GPT-6 Astra — Indeks 52,67, 10,00 USD / 50,00 USD, 1,00 USD z pamięci podręcznej, 3,2575 USD za zadanie, 27 206 tokenów wyjściowych, 400,4 s

Każdy z nich ma to samo okno kontekstu wynoszące 1 050 000 tokenów i ten sam maksymalny rozmiar wyjścia wynoszący 128 000 tokenów, a każdy przyjmuje dane wejściowe w postaci tekstu, obrazu i pliku. Poziomy nie różnią się flagami możliwości. Różnią się tym, za ile myślenia jesteś gotów zapłacić, a dwa końce tej drabiny dzieli na zadanie 48-krotna różnica.

Co faktycznie zmieniło odświeżenie 6.1

Trzy rzeczy, i tylko jedna z nich jest wynikiem.

Wynik zmienił się: z 47,63 na 51,83, wzrost o 4,2 punktu w ciągu tygodnia. Stawka za buforowane dane wejściowe spadła o połowę, z 0,20 USD do 0,10 USD za milion, dlatego zmierzony koszt na zadanie spadł z 1,045 USD do 0,724 USD, mimo że ceny katalogowe były identyczne — ten sam cennik, inny rachunek. A liczba tokenów wyjściowych wzrosła z 31 000 do 38 128, podczas gdy czas rzeczywisty na zadanie wydłużył się z 321 sekund do 640, co jest jedynym miejscem, w którym odświeżenie poszło wstecz, i najmniej widoczne na jakiejkolwiek karcie specyfikacji.

W zestawieniu z Astrą to właśnie to porównanie zaskakuje ludzi. GPT-6.1 Sol ma o 0,84 punktu indeksu mniej niż flagowiec i jest 4,5 razy tańszy w przeliczeniu na zadanie. Pozostała przewaga Astry nie tkwi w jej wyniku indeksu; tkwi w zestawie ewaluacji, w których mierzy się wyłącznie ją, oraz w tej jednej zdolności, którą OpenAI opisuje jako unikalną dla niej — odkrywaniu nowych podatności bezpieczeństwa, dlatego model jest oceniany jako „krytyczny” w ramach własnego Preparedness Framework dostawcy, a jego najbardziej zaawansowane ustawienia są ograniczone do zweryfikowanych partnerów.

Karta OrcaRouter dla GPT-6 Astra to flagowy szczyt tej samej drabiny: 10,00 USD / 50,00 USD, p50 do pierwszego tokenu wynoszący 1,64 sekundy, 40,7 miliona tokenów w ciągu siedmiu dni oraz to samo okno kontekstowe o rozmiarze 1 050 000 tokenów, które ma każdy poziom.

A screenshot of the OrcaRouter model page for openai/gpt-6-astra, showing the $10.00 input and $50.00 output per-million prices, a 1.64 s p50 time to first token, 40.7M tokens over seven days, a 1,050,000-token context window and 128K max output with text/image/file input, above the OpenAI-compatible code sample.

W porównaniu z 6.0 Sol odświeżenie jest niemal jednoznaczną poprawą — więcej indeksu, mniej pieniędzy — z zastrzeżeniem, że model 6.1 to inny model, a nie checkpoint, i że ponownie emituje swoje rozumowanie bardziej rozwlekle. W porównaniu z Luna to nawet nie jest porównanie: 10,7 razy większy koszt za 13,7 punktu indeksu, co jest dobrym interesem przy ciężkiej pracy, a fatalnym przy pracy o dużym wolumenie.

Co, jak mówią nasze własne dane routingu, rynek już zdecydował

Jest jedna rzecz, którą daje to porównanie, a której nie daje karta specyfikacji: obraz rzeczywistego użycia. W ciągu siedmiu dni kończących się 7 października 2026 r. na naszej własnej warstwie routingu GPT-6.1 Sol obsłużył 284,2 mln tokenów, a zastąpiony przez niego GPT-6 Sol obsłużył 950 tys. — 300-krotna różnica między dwoma modelami różniącymi się wiekiem o tydzień, co pokazuje, jak wymiana poziomu wygląda od środka. GPT-6 Luna, tańszy poziom, obsłużył 641,6 mln — więcej niż oba modele Sol łącznie. GPT-6 Astra obsłużył 40,7 mln.

Odczytaj to jako trzy odrębne zachowania. Praca masowa trafiła do najtańszego poziomu w największym wolumenie. Poważna praca została skonsolidowana na najnowszym Solu w ciągu tygodnia od jego premiery, a model, którego miejsce zajął, porzucono. A flagowiec pozostał niszą: najbardziej zaawansowany szczebel, używany najrzadziej, przez zespoły, których problem jest tym jedynym, który potrafi rozwiązać tylko on. Ta linia produktów nie jest drabiną, po której ludzie się wspinają; to zestaw narzędzi, z których ludzie wybierają, a wybierają według poziomu, a nie generacji.

Dlatego właśnie poziom ma swoje miejsce w żądaniu, a nie w architekturze

Praktyczny problem z generacją czterech poziomów polega na tym, że właściwa odpowiedź zmienia się w zależności od zadania i tygodnia — jak pokazują powyższe liczby ruchu, rynek zdecydował ponownie w ciągu siedmiu dni. Wpisywanie na sztywno jednej nazwy modelu do aplikacji jest tym, co zamienia ofertę w zobowiązanie.

Wszystkie cztery są dostępne przez jeden punkt końcowy OrcaRouter: jedno API dla ponad 200 modeli, w którym cena katalogowa dostawcy jest przekazywana przy 0% marży. Ten ostatni element ma tu szczególne znaczenie, ponieważ trzy z czterech poziomów mają wspólną cenę katalogową lub wspólną stawkę za cache, która już raz się zmieniła — stawka za cache GPT-6.1 Sol spadła o połowę w ciągu tygodnia od premiery, a rozliczenie typu pass-through sprawia, że automatycznie trafia to na Twoją fakturę.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample.

Dwie funkcje warstwy routingu warto wymienić w tym konkretnym zestawieniu. DSL routingu pozwala, aby poziom był parametrem żądania, a nie wdrożenia — tani poziom do przebiegu ekstrakcji, 6.1 Sol do przebiegu rozumowania, Astra tylko dla wywołań, które potrzebują tego, co Astra robi wyjątkowo. A fuzja modeli pozwala, aby panel złożony z nich wspólnie odpowiadał na jedno pytanie, co jest uczciwym sposobem korzystania z flagowca, na którego nie stać cię, by kierować do niego wszystko: staje się jednym głosem w panelu zamiast całego rachunku.

Co zrobić z pokoleniem jedynaków

Nie kupuj generacji. Kup szczebel i kupuj go ponownie, gdy szczeble się przesuną.

W przypadku dużego wolumenu i pracy wrażliwej na opóźnienia GPT-6 Luna w cenie 0,0678 USD za zadanie i 100 sekund do pierwszego tokenu to poziom, który już obsługuje największy ruch, a cena jest o rząd wielkości niższa niż cokolwiek innego na drabince. W przypadku ogólnego rozumowania i kodowania GPT-6.1 Sol jest teraz domyślnym wyborem, którym kiedyś był model 6.0 — ta sama cena katalogowa, lepszy indeks, o połowę niższy koszt pamięci podręcznej, a czas zadania wynoszący 640 sekund to jedyna rzecz, którą warto przetestować na własnym obciążeniu, zanim założysz, że aktualizacja jest darmowa. W przypadku zadań wymagających pomiaru na granicy możliwości lub prac związanych z bezpieczeństwem, które wykonuje tylko flagowy model, GPT-6 Astra pozostaje jedynym szczeblem, który je wykonuje, przy koszcie 4,5 razy wyższym niż szczebel poniżej.

Na co warto uważać, to czy odświeżenie 6.1 obejmie pozostałe poziomy. Jeśli Luna lub Astra dostaną takie samo traktowanie, zmieni się kształt drabiny, a wraz z nim arytmetyka na zadanie w tym artykule. Do tego czasu „GPT-6.1” oznacza jeden model, a traktowanie go jako rodziny to sposób, w jaki zespoły kończą na płaceniu flagowych stawek za ekstrakcję.