
Pierwszy niezależny wynik GPT-6.1 Sol jest już dostępny: o 0,84 punktu za Astrą, przy mniej niż jednej czwartej kosztu zadania
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 397 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 195 tok/s
- OrcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Każdy artykuł o GPT-6.1 Sol opublikowany w dniach po premierze OpenAI na DevDay 29 września 2026 r. — w tym ten blog — miał to samo zastrzeżenie: liczby dotyczące możliwości pochodziły od dostawcy, a modelu nie oceniła żadna strona trzecia. To zastrzeżenie jest już nieaktualne. Artificial Analysis ma wiersz GPT-6.1 Sol w swoim Intelligence Index, uzyskany przy maksymalnym wysiłku rozumowania, i jest to pierwsza wartość w krótkiej historii tego modelu, której nie wygenerowało OpenAI. Wynosi 51,8 w porównaniu z 52,7 dla GPT-6 Astra i 47,5 dla GPT-6 Sol — różnica mniejsza niż jeden punkt do flagowca za 10/50 USD i poprawa o 4,3 punktu względem modelu, który zastępuje GPT-6.1 Sol. Liczbą, która czyni ten wiersz interesującym, jest ta obok: ranking wycenia przebieg ewaluacji stojący za każdym wynikiem, a przebieg indeksu GPT-6.1 Sol kosztował 0,72 USD na zadanie, podczas gdy przebieg Astry kosztował 3,26 USD. Cztery i pół razy więcej pieniędzy za 0,84 punktu to całe porównanie w jednej linijce, a teraz jest to zmierzona wartość, a nie sposób, w jaki przedstawia ją dostawca.
Sam wiersz oraz to, na czym został uruchomiony

Artificial Analysis publikuje swój Intelligence jako kompozycję dziesięciu ewaluacji, a wersja działająca 30 września 2026 r. to v4.3.2. AA-Brief v1.1, GDP-AA v2.1, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience i AA-LCR v1.1. Wszystkie trzy modele OpenAI w tym artykule opierają się na tej samej wersji, więc poniższe porównanie jest porównaniem jabłko do jabłka w sposób, w jaki własna tabela premiery dostawcy nigdy nie jest. Ranking odnotowuje również datę premiery, którą ma dla modelu — 2026-09-29, datę DevDay — i ocenia go w konfiguracji max-effort, która jest ustawieniem wymienionym w nagłówku tej strony.
• Intelligence Index — 51,8 dla modelu GPT-6.1 Sol (max), 52,7 dla modelu GPT-6 Astra (max), 47,5 dla modelu GPT-6 Sol (max).
• Koszt na zadanie indeksu — 0,72 USD dla modelu GPT-6.1 Sol, 3,26 USD dla modelu Astra, 1,05 USD dla modelu GPT-6 Sol. To wartość podana przez samą tablicę wyników, określająca, ile kosztowało przeprowadzenie jednej pełnej ewaluacji indeksu, a nie cennik.
• Tokeny wyjściowe zużyte podczas przebiegu — 67,2 miliona dla modelu GPT-6.1 Sol, 60,0 miliona dla modelu Astra, 76,8 miliona dla modelu GPT-6 Sol. Komentarz samego AA określa 67 milionów jako „dość zwięzłe” na tle mediany tablicy wynoszącej 82 miliony, co jest drugim, cichszym zwycięstwem nad modelem, który zastępuje.
• Szybkość generowania — 66,8 tokena na sekundę dla modelu GPT-6.1 Sol, 57,0 dla modelu Astra, 76,2 dla modelu GPT-6 Sol.
• Ceny zgodnie z tym, jak podaje je tablica wyników — 2,00 USD za milion tokenów wejściowych i 10,00 USD za milion tokenów wyjściowych dla modelu GPT-6.1 Sol, przy czym wejście z pamięci podręcznej po 0,10 USD, a zapisy do pamięci podręcznej po 2,50 USD. Te cztery liczby dokładnie pokrywają się ze stroną z cennikiem dostawcy, co jest najmniej spektakularną i najbardziej użyteczną rzeczą w tym wierszu: niezależna lista stawek, które już podaliśmy.
Jedna uwaga porządkująca, zanim liczby zostaną użyte jako amunicja. Indeks AA obejmuje dziesięć ewaluacji, a ewaluacje, którymi OpenAI otworzyło własne ogłoszenie — DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1 — nie należą do nich. AA prowadzi własny wariant AutomationBench, który nie jest tym samym zestawem testowym co wersja AutomationBench, na którą powołał się dostawca. Zatem niezależny rejestr nie potwierdza ani nie obala czterech głównych twierdzeń z wpisu o premierze; mierzy w dużej mierze inny zestaw zadań, a warto go czytać jako drugą opinię o kształcie modelu, a nie jako werdykt dotyczący tych konkretnych zdań.
Astra nadal wygrywa, o mniej niż punkt, za cztery i pół razy większą kwotę.

Oba modele udostępniają drabinę wysiłku, a tablica wyników opublikowała teraz wynik i koszt uruchomienia dla każdego szczebla obu. Ustawione obok siebie, drabiny mówią coś, czego nie jest w stanie przekazać pojedyncze porównanie z nagłówka: najlepsza konfiguracja GPT-6.1 Sol nie rywalizuje z najlepszą konfiguracją Astry. Rywalizuje z drugą najlepszą konfiguracją Astry.
• GPT-6.1 Sol, max — 51.8, $0.72 za zadanie indeksowania. GPT-6 Astra, max — 52.7, $3.26.
• GPT-6.1 Sol, xhigh — 51.0, $0.39. GPT-6 Astra, xhigh — 52.4, $2.31.
• GPT-6.1 Sol, high — 50.2, $0.32. GPT-6 Astra, high — 50.9, $1.73.
• GPT-6.1 Sol, medium — 47.8, $0.21. GPT-6 Astra, medium — 49.6, $1.54.
• GPT-6.1 Sol, low — 42.1, $0.13. GPT-6 Astra, low — 45.8, $0.82.
Astra prowadzi na każdym szczeblu, co jest uczciwym podsumowaniem tego starcia, a zarazem jego najmniej interesującą częścią. Ciekawy jest kurs wymiany. Jeśli chcesz najtańszą konfigurację Astry, która bije najlepszy wynik modelu GPT-6.1 Sol, jest nią Astra na poziomie xhigh: 52,4 wobec 51,8, za 2,31 USD wobec 0,72 USD. To 0,56 punktu indeksu za 1,59 USD więcej na przebieg ewaluacji — około 3,2 razy większy koszt za mniej niż jeden procent wyniku. Przejdź w drugą stronę i obniż GPT-6.1 Sol do xhigh — tracisz wtedy 0,8 punktu, a rachunek spada do 0,39 USD, co jest 5,9 razy tańsze niż xhigh Astry i jedną dziewiątą kosztu przebiegu Astry przy maksymalnym wysiłku.
Drugi odczyt tej samej drabiny przemawia przeciw kupowaniu Astry przy maksymalnym wysiłku. Cztery niższe szczeble Astry są tańsze niż jej maksimum, a jej xhigh jest tylko 0,29 punktu poniżej maksimum — to niewiele więcej niż pół procent wyniku w zamian za 29% obniżki kosztu przebiegu. Każda rozmowa zakupowa o tej parze, która zaczyna się od „Astra przy maksimum”, a kończy na „Astra kosztuje 4,5 razy więcej”, pomija tańsze szczeble samej Astry w porównaniu.
Sześć ewaluacji trafia do Astra, dwie do GPT-6.1 Sol, dwie remisują.
Zbiorczy wynik ukrywa podział. Oceniany w poszczególnych ewaluacjach przy maksymalnym wysiłku, GPT-6.1 Sol nie jest jednolicie nieco gorszą wersją Astry — jest lepszy w dwóch rzeczach i gorszy w sześciu.
• GDPval-AA — Elo 1575,1 dla GPT-6.1 Sol wobec 1541,9 dla modelu Astra, 33-punktowa przewaga w zadaniach zawodowych. To największe pojedyncze niezależne zwycięstwo tańszego modelu.
• AA-LCR v1.1, rozumowanie na długim kontekście — 0,830 wobec 0,807. GPT-6.1 Sol prowadzi.
• AA-Briefcase v1.1 — Elo 1564,2 wobec 1568,9. Astra o 4,7.
• AutomationBench-AA — 0,649 wobec 0,685. Astra o 3,6 punktu.
• Terminal-Bench 4.0 — 0,561 wobec 0,591. Astra o 3,0 punktu.
• SciCode — 0,542 wobec 0,565. Astra o 2,3 punktu.
• Humanity's Last Exam — 0,529 wobec 0,547. Astra o 1,8 punktu.
• AA-Omniscience — 41,5 wobec 43,4. Astra o 1,9 punktu.
• GDP.pdf i CritPt — dokładne remisy na poziomie 0,310 i 0,317 odpowiednio, w obu modelach.
Dwa z tych wierszy znaczą więcej, niż sugerowałaby ich pozycja na liście. Przewaga w GDPval-AA to jedyne miejsce, w którym tańszy model ma wystarczająco dużą przewagę, by przetrwać zmianę środowiska testowego, i trafia dokładnie w to obciążenie, które reklamuje hasło pozycjonujące dostawcy — profesjonalną pracę wymagającą dużej ilości dokumentów. A dwa dokładne remisy dotyczą ewaluacji o najmniejszych rozrzutach, co przypomina, że 0,84-punktowa różnica w wyniku złożonym jest składana z wierszy, które pojedynczo wahają się od 33-punktowego zwycięstwa do 3,6-punktowej straty.
W porównaniu z modelem, który zastępuje, wzrost jest realny, ale niejednolity.
Porównanie, które ma znaczenie dla każdego, kto już uruchamia GPT-6 Sol na ścieżce produkcyjnej, to to, którego 6.1 Sol dokonuje względem własnego poprzednika, a niezależny zapis jest pod tym względem ostrzejszy niż wpis dostawcy. Osiem z dziesięciu ocen się poprawia. Dwie się pogarszają.
• SciCode — GPT-6.1 Sol uzyskuje 0,542, podczas gdy GPT-6 Sol uzyskał 0,576. Nowszy model jest gorszy w kodzie naukowym o 3,5 punktu.
• AA-LCR v1.1 — 0,830 dla 6.1 Sol wobec 0,837 dla GPT-6 Sol. O włos, ale w złym kierunku, w ewaluacji długiego kontekstu.
• AA-Omniscience — 41,5 wobec 27,1. To największy ruch w tym rzędzie: skok o 14,4 punktu w ewaluacji wiedzy, a dokładność na tym zestawie wzrasta z 0,545 do 0,621.
• Wskaźnik halucynacji na tym samym zestawie — 0,543 dla GPT-6.1 Sol, w dół z 0,601 dla GPT-6 Sol i wciąż powyżej 0,513 GPT-6 Astra. AA-Omniscience dzieli swój wynik na „poprawnie” i „z przekonaniem błędnie”, a to właśnie w tym podziale odświeżenie 6.1 udowadnia swoją wartość: to znacząco mniej nieuczciwy model niż Sol, a wciąż najbardziej nieuczciwy z całej trójki.
• Terminal-Bench 4.0 — 0,561 wobec 0,439, wzrost o 12,2 punktu. AA-Briefcase — 1482,8 do 1564,2 Elo. GDP.pdf — 0,248 do 0,310.
Interpretacja jest taka, że to bardziej odświeżenie wiedzy i narzędzi niż odświeżenie rozumowania. Ewaluacje, które się poprawiły, to te, w których chodzi o wiedzę, a nie o wymyślanie; ewaluacja, która spadła, jest wąska i techniczna. Każdy, kto przeszedł na 6.1 Sol ze względu na cache, otrzymuje przyrost wiedzy jako bonus i nie powinien zakładać, że przekłada się to na każdy harness, który uruchamia.
Gdzie plasuje je tablica i co znajduje się powyżej

W domyślnym porządku Intelligence Index na liście rankingowej GPT-6 Astra przy maksymalnym wysiłku zajmuje 7. miejsce, GPT-6.1 Sol przy maksymalnym wysiłku — 10. miejsce, a GPT-6 Sol przy maksymalnym wysiłku — 20. miejsce. Dziewięć wierszy powyżej GPT-6.1 Sol to dwie konfiguracje Astra, trzy konfiguracje Claude Opus 5.5, jedna konfiguracja Claude Sonnet 5.5 i dwie konfiguracje Claude Fable 5.1 — więc model, do którego GPT-6.1 Sol jest najbliżej, to flagowiec jego własnej rodziny, a model, który faktycznie wyparł w tym porządku, to jego własny poprzednik, trzynaście miejsc niżej.
Pomiń ustawienie wysiłku, a ranking zagęszcza się w sposób istotny dla planowania kosztów: GPT-6.1 Sol przy xhigh zajmuje 13. miejsce, przy high — 15., przy medium — 19., a przy low — 35., podczas gdy Astra plasuje się na 14. miejscu przy high, 16. przy medium i 26. przy low. Innymi słowy, GPT-6.1 Sol przy xhigh wyprzedza Astrę przy high w rankingu, a GPT-6.1 Sol przy medium wyprzedza Astrę przy low. Poziom wysiłku ma tu większe znaczenie niż wybór modelu, przynajmniej w przypadku tych dwóch.
Co zrobić z tym numerem, szczerze mówiąc
Twierdzenie dostawcy, które sprawdzano w tym wierszu, głosiło, że GPT-6.1 Sol niemal dorównuje flagowcowi za około jedną piątą ceny. Niezależna wersja tego zdania brzmi: jego wynik jest oddalony od flagowca o nie więcej niż 0,84 punktu indeksu, a przebieg ewaluacji stojący za jego wynikiem kosztował 22% kosztu flagowca. To jest wystarczająco bliskie temu twierdzeniu, że nikt nie powinien czuć się przez nie wprowadzony w błąd, a jest to stwierdzenie mocniejsze niż „niezweryfikowane” w każdym aspekcie, który ma znaczenie dla kupującego.
Ten wiersz nie służy do wyceny twojego obciążenia. Uruchomienie indeksu to konkretna mieszanka zadań, a liczbą, która decyduje o rzeczywistym rachunku, jest cennik zestawiony z twoim własnym profilem tokenów — dlatego pozycja dotycząca pamięci podręcznej wciąż jest tą, którą warto modelować: 0,10 USD za wejście z pamięci podręcznej w GPT-6.1 Sol w porównaniu z 1,00 USD w modelu Astra to dziesięciokrotna różnica, której żaden wynik indeksu nie obejmuje. Po naszej stronie obowiązuje ta sama zasada przenoszenia cen: OrcaRouter udostępnia GPT-6 Astra, GPT-6 Sol i GPT-6 Luna w cenach katalogowych samego OpenAI, bez doliczania marży, więc w dniu, w którym zmieni się stawka dostawcy, stawka po naszej stronie zmienia się razem z nią, zamiast czekać na drugą umowę. GPT-6.1 Sol nie znajduje się na naszych trasach — publiczny katalog zwraca dziś „model not found” dla openai/gpt-6.1-sol, i nie ma uczciwego sposobu, aby opisać model, którego nie możemy obsłużyć. To, co jeden klucz API faktycznie daje ci teraz, to para, o którą benchmark naprawdę się spiera — Astra do najtrudniejszej pracy, Sol do wolumenu — z cenami katalogowymi dostawcy przekazywanymi bez marży i automatycznym przełączaniem awaryjnym między dostawcami, gdy któryś z nich zgłosi błąd.
Dwie rzeczy jeszcze bardziej by to wyostrzyły. Drugi niezależny zestaw testowy dla tego samego modelu pozwoliłby nam stwierdzić, czy przewaga GDPval-AA jest właściwością modelu, czy tej oceny, i jest to ten jeden najbardziej użyteczny brakujący punkt danych w tym wierszu. A niezależny pomiar poziomu długiego kontekstu 272 000 tokenów miałby większe znaczenie niż kolejny punkt złożony, ponieważ właśnie tam ceny tej rodziny przestają być tanie.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
