Wygenerowana dwukolumnowa tablica wyników porównawczych zatytułowana „GPT-6.1 Sol vs GPT-5.6 Sol – tablica wyników”. Lewa kolumna „GPT-6.1 Sol”: wiersze: „Indeks inteligencji: 51,8”, „Koszt na zadanie indeksowe: 0,72 USD”, „Wejście / wyjście: 2,00 USD / 10,00 USD”, „Wejście z pamięci podręcznej: 0,10 USD”, „Tokeny wyjściowe w przebiegu indeksu: 67 mln”, „Minimalny poziom wysiłku: niski”. Prawa kolumna „GPT-5.6 Sol”: wiersze: „Indeks inteligencji: 47,0”, „Koszt na zadanie indeksowe: 1,99 USD”, „Wejście / wyjście: 4,00 USD / 20,00 USD”, „Wejście z pamięci podręcznej: 0,40 USD”, „Tokeny wyjściowe w przebiegu indeksu: 90 mln”, „Minimalny poziom wysiłku: brak”. Stopka: „Niezależne dane według Artificial Analysis v4.3.2 przy maksymalnym wysiłku; ceny katalogowe dostawców.”
Guides & Insights

GPT-6.1 Sol kontra GPT-5.6 Sol: cztery i pół punktu indeksu, o połowę niższy rachunek, dwie regresje

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

OpenAI wydało GPT-6.1 Sol w dniu 29 września 2026, jedenaście tygodni po GPT-5.6 Sol, który został wydany 9 lipca 2026 jako flagowy model poprzedniej generacji. Oba są nadal w sprzedaży, oba nadal można wywołać, a różnica między nimi na neutralnej tablicy wynosi 4,8 punktu — 51,8 w porównaniu do 47,0 w Intelligence Index firmy Artificial Analysis, oba zmierzone przy maksymalnym wysiłku rozumowania w tym samym zestawie dziesięciu ewaluacji. Różnica w cenie jest znacznie większa niż różnica w wyniku: $0,72 za ukończone zadanie indeksowe w porównaniu do $1,99 oraz $2,00/$10,00 za milion tokenów w porównaniu do $4,00/$20,00. To jest krótka wersja. Długa wersja jest taka, że aktualizacja nie jest jednolita i dwie z ewaluacji cofnęły się.

Czym jest każdy model i co czym zostało zastąpione

GPT-5.6 Sol był modelem stojącym najwyżej w linii 5.6 — zamkniętym modelem dostępnym wyłącznie przez API, z oknem kontekstowym 1 050 000 tokenów, limitem wyjścia 128 000 tokenów, wejściem tekstowym, obrazowym i plikowym oraz drabiną rozumowania rozciągającą się od none do max. OpenAI opisywało go jako poziom stworzony do najtrudniejszej pracy: długoterminowych przepływów pracy agentów, inżynierii oprogramowania obejmującej wiele plików, głębokiego rozumowania, a cena była temu odpowiednia — 4,00 i 20,00 USD za milion tokenów, z wejściem z pamięci podręcznej po 0,40 USD i zapisem do pamięci podręcznej po 5,00 USD. Powyżej 272 000 tokenów wejściowych cena zmieniała się na 8,00 i 30,00 USD, a model miał też poziom Batch w cenie 2,50 i 15,00 USD.

GPT-6.1 Sol to średnia półka generacji, która przyszła później: poniżej GPT-6 Astra, powyżej GPT-6 Luna, a teraz model, na który Open​AI wskazuje deweloperom wrażliwym na koszty. Zachowuje okno 1 050 000 tokenów i limit wyjściowy 128 000 tokenów, przesuwa datę graniczną wiedzy z 20 kwietnia na 30 kwietnia 2026 r. i skraca drabinę wysiłku z sześciu szczebli do pięciu — low, medium (domyślnie), high, xhigh, max. Wartość none, którą GPT-5.6 Sol akceptował, teraz zwraca błąd, a wytyczne Open​AI dotyczące migracji wyraźnie mówią, że substytucją jest low, a nie cicha aktualizacja.

Warto się nad tym zatrzymać, ponieważ to jedyna zmiana w wydaniu, która kosztuje pieniądze, zamiast je oszczędzać. Pipeline, który sięgał po brak, aby uzyskać tanie, szybkie wywołanie niewymagające rozumowania, nie ma już tej konfiguracji w żadnej z rodzin modeli. Najtańszy szczebel w GPT-6.1 Sol to szczebel rozumowania, a tokeny rozumowania są rozliczane jako tokeny wyjściowe, niezależnie od tego, czy je widzisz.

Drabina, szczebel po szczeblu

Niezależny panel publikuje wynik i koszt uruchomienia dla każdego ustawienia wysiłku w obu modelach, co zmienia bezpośrednie starcie w coś użyteczniejszego niż pojedyncze porównanie. Zestawione przy równoważnych ustawieniach:

• Drabinka wysiłku, GPT-6.1 Sol — max 51,8 przy 0,72 USD za zadanie indeksowe; xhigh 51,0 przy 0,39 USD; high 50,2 przy 0,32 USD; medium (domyślnie) 47,8 przy 0,21 USD • Szybkość generowania — 59,7 tokenów na sekundę dla GPT-6.1 Sol vs 87,8 dla GPT-5.6 Sol
• Czas do pierwszego fragmentu — 332 sekundy dla GPT-6.1 Sol vs szybsza wartość dla GPT-5.6 Sol, wobec mediany rankingu około 4 sekund
• Tokeny wyjściowe w przebiegu indeksowym — 67,2 miliona dla GPT-6.1 Sol vs 90,0 miliona dla GPT-5.6 Sol
• Cena wejścia / wyjścia — 2,00 USD / 10,00 USD vs 4,00 USD / 20,00 USD
• Wejście z pamięci podręcznej — 0,10 USD vs 0,40 USD; zapisy do pamięci podręcznej 2,50 USD vs 5,00 USD
• Stawka wsadowa — nie jest publikowana dla GPT-6.1 Sol vs 2,50 USD / 15,00 USD dla GPT-5.6 Sol
• Próg długiego kontekstu — GPT-6.1 Sol powyżej 272 000 tokenów wejściowych zmienia cenę na 4,00 USD / 15,00 USD za całe żądanie vs 8,00 USD / 30,00 USD dla GPT-5.6 Sol
• Dolna granica wysiłku — low vs none

Z tej listy wynikają dwie rzeczy. Po pierwsze, obniżka ceny ma charakter strukturalny, a nie promocyjny: standardowa stawka GPT-6.1 Sol wynosząca 2,00 i 10,00 USD jest niższa niż stawka wsadowa GPT-5.6 Sol wynosząca 2,50 i 15,00 USD, więc nawet poziom starego modelu z rabatem jest droższy niż cena katalogowa nowego modelu. Po drugie, aktualizacja nie jest liniowa pod względem opóźnień. GPT-6.1 Sol generuje odpowiedzi o około jedną trzecią wolniej i potrzebował 332 sekund na pierwszy fragment w testach długich promptów tablicy — ten sam rząd wielkości co 107 sekund GPT-6 Sol i około osiemdziesiąt razy więcej niż mediana tablicy. Jeśli zbudowałeś interaktywny produkt na GPT-5.6 Sol, to jest to regresja funkcjonalna niezależna od jakiegokolwiek benchmarku, a poprawka ma charakter architektoniczny, a nie parametrowy.

A generated hero card for a GPT-6.1 Sol versus GPT-5.6 Sol comparison, headed 'Four and a half index points, half the bill', with two badges reading 'GPT-6.1 Sol: $0.72 per index task' and 'GPT-5.6 Sol: $1.99 per index task', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

Dwie oceny poszły w złym kierunku

Łączny przyrost wynosi 4,8 punktu. Składniki nie są jednorodnie dodatnie, co potwierdzają wyniki ocen rady dla poszczególnych ewaluacji:

• SciCode — GPT-6.1 Sol 0,542 vs GPT-5.6 Sol 0,571. Regresja o 2,9 punktu w kodowaniu naukowym.
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575,1 vs GPT-5.6 Sol Elo 1611,3. Regresja o 36 punktów Elo w pracy opartej na wiedzy o wartości ekonomicznej.
• Humanity's Last Exam — GPT-6.1 Sol 0,529 vs GPT-5.6 Sol 0,495. Wzrost o 3,4 punktu.
• Terminal-Bench 4.0 — GPT-6.1 Sol 0,561 vs GPT-5.6 Sol 0,399. Wzrost o 16 punktów — największy pojedynczy skok w tym zestawieniu.
• AA-Omniscience — GPT-6.1 Sol 41,5 vs GPT-5.6 Sol 22,0, co dotyczy raczej wiarygodności wiedzy i halucynacji niż surowego przywoływania informacji.
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — pozostała piątka, która dopełnia kompozyt i to w niej wypracowywana jest reszta wzrostu o 4,8 punktu.

Model, który jest istotnie lepszy w pracy w terminalu, znacznie lepszy pod względem wiarygodności faktograficznej, a mierzalnie gorszy w programowaniu naukowym i w Elo dla pracy profesjonalnej, nie jest modelem ściśle lepszym. To inny punkt na froncie możliwości i został tam umieszczony celowo: własne pozycjonowanie OpenAI przy premierze GPT-6.1 Sol to koszt ukończonego zadania przy jakości niemal flagowej, a nie maksymalny wynik. Jeśli Twoje obciążenie pracą ma kształt SciCode lub GDPval, wynik złożony nie jest tym, który ma zastosowanie do Ciebie — dotyczy Cię natomiast regresja.

GPT-5.6 Sol wciąż ma opublikowany wynik dla długiego kontekstu

Jedynym miejscem, w którym starszy model ma liczbę, jakiej nie ma nowszy, jest dokładność wyszukiwania w paśmie kontekstu, w którym zmienia się cennik GPT-6.1 Sol. GPT-5.6 Sol ma opublikowany wynik MRCR v2 eight-needle na poziomie 91,5% w zakresie od 256 000 do 512 000 tokenów. GPT-6.1 Sol nie ma opublikowanego odpowiednika, a powyżej 272 000 tokenów wejściowych całe jego żądanie jest ponownie wyceniane na 2× wejście i pamięć podręczną oraz 1,5× wyjście.

Zestaw te dwa fakty, a segment, w którym ekonomika nowego modelu jest najsłabsza, jest dokładnie tym segmentem, w którym stary model ma jedyną udokumentowaną mocną stronę. Oszczędności nie znikają — $4.00 i $15.00 w warstwie po zmianie ceny w porównaniu z $8.00 i $30.00 w warstwie długiego kontekstu samego GPT-5.6 Sol to wciąż zmniejszenie o połowę — ale opowieść o połowie ceny to opowieść o ogólnych obciążeniach, a potok wyszukiwania dla długiego kontekstu nią nie jest. Jeśli twoim obciążeniem jest właśnie to, GPT-5.6 Sol w cenie $4.00 i $20.00 z opublikowanym wynikiem 91,5% to możliwa do obrony pozycja, na której warto pozostać.

Pozostałe opublikowane wyniki GPT-5.6 Sol pozostają nienaruszone i są powodem, dla którego część zespołów nie zamierza się przenosić: BrowseComp 90,4 dla agentów do badań internetowych, Terminal-Bench 2.1 na poziomie 88,8 i 88,0, SWE-Bench Pro 64,6, Agents' Last Exam 53,6, OSWorld 2.0 na poziomie 62,6. Są to wyniki raportowane przez Open​AI, na harnessie Open​AI, i zostały podane w lipcu. Od tego czasu zmieniło się to, że ranking ocenia teraz oba modele na jednym zestawie testów przy jednym zestawie ustawień, a starszy model przegrywa pod względem wyniku złożonego i kosztu.

Sama migracja to zmiana ciągu znaków, z jednym wyjątkiem.

Ten sam dostawca, ten sam zakres API, sąsiadujące pozycje w rankingu, to samo okno i limit wyjścia — więc dla większości stosów to kwestia identyfikatora modelu i ceny, która spada o połowę. Wyjątki są konkretne i warto je wymienić, zanim przestawisz przełącznik.

Jeśli Twój kod ustawia reasoning.effort na none lub minimal, zakończy się to niepowodzeniem, a nie degradacją, a low jest udokumentowanym zamiennikiem. Jeśli Twój ruch przekracza 272 000 tokenów wejściowych, sprawdź warstwę z nową ceną, zanim zaczniesz modelować oszczędności. Jeśli Twój produkt zależy od czasu do pierwszego tokenu, zmierz go przed wdrożeniem, ponieważ wartość 332 sekund z tablicy wyników nie jest błędem zaokrąglenia. A jeśli Twoje ewaluacje zawierają wycinek w kształcie SciCode lub GDPval, uruchom ten wycinek na obu modelach, zamiast ufać wynikowi zbiorczemu.

Oba modele są dostępne w OrcaRouter po własnych cenach katalogowych Open​AI — GPT-6.1 Sol po 2,00 USD i 10,00 USD, z wejściem z pamięci podręcznej po 0,10 USD; GPT-5.6 Sol po 4,00 USD i 20,00 USD, z wejściem z pamięci podręcznej po 0,40 USD — w modelu pass-through, który sprawia, że zmiana ceny Open​AI trafia po naszej stronie tego samego dnia, w którym zostaje wprowadzona, a nie dopiero po renegocjacjach resellera. Ponieważ cennik jest przekazywany bez zmian, a nie z doliczoną marżą, arytmetyka w tym artykule jest arytmetyką, którą otrzymujesz: ten sam model 0,72 USD za zadanie, to samo zmniejszenie o połowę, bez żadnej premii platformowej doliczanej po żadnej ze stron.

A screenshot of the OrcaRouter model page for openai/gpt-5.6-sol, showing the listing dated 2026-07-09, the model described as the flagship of OpenAI's GPT-5.6 series for deep multi-step reasoning and long-horizon agentic workflows, a 1.05M-token context with 128K maximum output, text, image and file input, and the list price of $4.00 input and $20.00 output per million tokens.

Praktyczna korzyść z umieszczenia obu za jednym punktem końcowym polega na tym, że porównanie pozostaje aktualne. Kieruj nowy ruch do GPT-6.1 Sol, trzymaj GPT-5.6 Sol o jedną zmianę konfiguracji od gotowości jako rozwiązanie zapasowe i ścieżkę długiego kontekstu, a automatycznemu przełączaniu awaryjnemu pozwól pokryć okno, w którym dostępność dwumiesięcznego flagowca i gotowość Enterprise wciąż się stabilizują. Migracja, która zmniejsza rachunek o połowę i cofa dwa podbenchmarki, nie jest decyzją do podjęcia raz i zapomnienia; należy ją podejmować dla każdej trasy, a to warstwa routingu sprawia, że jest to tanie.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

Gdzie każdy należy

• Ogólna praca agentowa i terminalowa — GPT-6.1 Sol. Szesnaście punktów w Terminal-Bench 4.0 i o połowę niższa cena to nie jest wyrównana rywalizacja.
• Rzetelność faktograficzna, produkty oparte na wyszukiwanych odpowiedziach — GPT-6.1 Sol, przy blisko dwudziestopunktowej różnicy w AA-Omniscience.
• Programowanie naukowe — najpierw sprawdź własne testy ewaluacyjne. Tablica wyników pokazuje regresję o 2,9 punktu, a wynik złożony jej nie ujawni.
• Praca wiedzowa o wartości ekonomicznej — ta sama ostrożność. Regresja Elo w GDPval-AA wynosi 36 punktów.
• Wyszukiwanie w długim kontekście powyżej 272 000 tokenów — GPT-5.6 Sol, dopóki GPT-6.1 Sol nie ma opublikowanego wyniku w tym przedziale.
• Interaktywne powierzchnie wrażliwe na opóźnienia — zmierz przed migracją. Szybsze wyjście, znacznie wolniejszy pierwszy token.
• Najtańsze wywołanie bez rozumowania — żadne z nich. Ta konfiguracja już nie istnieje w tej rodzinie.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie