
GPT-6.1 Sol kontra Gemini 4 Argon: pół punktu różnicy, a tylko jeden z nich jest do kupienia
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Wszystko, co można porównać między GPT-6.1 Sol i Gemini 4 Argon, jest mierzalne, ale nic z tego nie da się przełożyć na działanie, ponieważ tylko jeden z tych dwóch modeli można kupić. Gemini 4 Argon ogłoszono 30 września 2026 r. w poście DeepMind przypisanym Korayowi Kavukcuoglu, w cenie początkowej podanej jako 2,00 USD za milion tokenów wejściowych i 10,00 USD za milion tokenów wyjściowych, i najpierw udostępniono go nazwanej grupie obrońców cyberbezpieczeństwa w ramach Fairwind Program. Nie ma identyfikatora modelu, punktu końcowego API, opublikowanej stawki za token, na podstawie której można by wystawiać rachunki, ani strony, do której można dotrzeć jako klient. GPT-6.1 Sol trafił do sprzedaży 29 września 2026 r. w cenie 2,00 i 10,00 USD i jest już dostępny. W Artificial Analysis Intelligence Index oba modele dzieli 0,8 punktu — Argon 52,6, Sol 51,8 — co czyni tę parę najbliższą w tej partii i, patrząc tylko na indeks, remisem. Według miernika, który decyduje o rzeczywistych wdrożeniach, jeden z tych modeli wcale nie jest kandydatem.
Ta asymetria nie jest szczegółem technicznym i nie jest też sensacją. To fakt, który powinien rządzić tym, jak należy odczytywać to porównanie: liczby Argon opisują model w kontrolowanym wdrożeniu u jednej kohorty, a liczby GPT-6.1 Sol opisują produkt z cennika. Porównywanie ich wciąż ma sens — Argon jest tym, co dostawca obecnie stawia na pierwszym miejscu, a jego pomiary mówią coś realnego o tym, gdzie znajduje się szczyt linii Gemini — ale każdy wniosek musi zawierać frazę „gdyby można było go kupić”, a żaden z nich nie zawiera frazy „czy powinieneś się przełączyć”.
Indeks pozwala na dokładnie jedno porównanie, a jest to niemal remis.

Oba modele pojawiają się w Artificial Analysis i oba mają wynik oraz rozliczenie kosztów jego uzyskania.
• Indeks Inteligencji, wersja 4.3.2 — Gemini 4 Argon 52,6 vs GPT-6.1 Sol 51,8, różnica 0,8 punktu
• Koszt na zadanie indeksowania — Gemini 4 Argon 1,99 USD vs GPT-6.1 Sol 0,72 USD, czyli 2,8× różnicy przy tych 0,8 punktu
• Koszt uruchomienia pełnego zestawu testów — Gemini 4 Argon $2,407 vs GPT-6.1 Sol $1,082
• Tokeny wyjściowe wyemitowane w tym zestawie — Gemini 4 Argon 110M vs GPT-6.1 Sol 67M, 1,6× różnicy w gadatliwości
• Podana cena wprowadzająca — 2,00 USD za wejście i 10,00 USD za wyjście za milion tokenów w obu przypadkach, z wejściem z pamięci podręcznej o 95% taniej w Argon
• Okno kontekstowe — GPT-6.1 Sol 1 050 000 tokenów; Argon nie został opublikowany
Czwarta linia wyjaśnia drugą. Różnica kosztów na zadanie wynosząca 2,8× przy niemal identycznych stawkach cennikowych bierze się z zapisywania 1,6× większej liczby tokenów przy porównywalnej cenie wyjścia, plus tego, ile kosztuje stojący za nimi wolumen rozumowania. Argon nie jest drogim modelem, sądząc po jego karcie. Podczas ewaluacji jest gadatliwy, a rachunek rozlicza się na wyjściu.
Konfiguracje różnią się, a kierunek tej różnicy działa na korzyść tańszego modelu. Artificial Analysis umieszcza Gemini 4 Argon na wykresie przy jego ustawieniu wysokiego wysiłku, a GPT-6.1 Sol na maks. — więc Sol jest mierzony przy swoim najdroższym ustawieniu, a Argon przy czymś poniżej swojego pułapu. Różnica 0,8 punktu jest zatem korzystną dla Sol wersją porównania: gdy Argon otrzyma swoje najwyższe ustawienie, różnica prawdopodobnie się powiększy; gdy Sol otrzyma niższe ustawienie, jego koszt spadnie jeszcze bardziej. Żaden z tych ruchów nie zmienia linii dostępności, która jako jedyna rozstrzyga decyzję o wdrożeniu.
Jakiekolwiek odczytywanie różnicy 0,8 punktu
Różnica poniżej jednego punktu w złożonym wskaźniku z dziesięciu ocen to nie ranking. To dwa modele w tym samym przedziale.
Tym, czego indeks nie publikuje dla Argonu, są szczegóły o komponentach, które uczyniłyby przedział czytelnym — które ewaluacje wygrywa, gdzie jest słaby, jak zachowuje się w podwynikach składających się na wynik złożony. Strona GPT-6.1 Sol zawiera te wiersze; strona Argonu zawiera nagłówek i koszt. Porównanie oparte wyłącznie na nagłówku może powiedzieć, że oba są na tym samym poziomie, i nic więcej, i powinno powiedzieć dokładnie to, zamiast kreować zwycięzcę z przewagi 0,8 punktu.
Jest jeszcze jeden zewnętrzny punkt danych wart dodania i wskazuje w przeciwnym kierunku. W ewaluacji programistycznej przeprowadzonej przez stronę trzecią, krążącej po ogłoszeniu, Argon zajął trzecie miejsce, za GPT-6 Astra i Claude Opus 5.5 — to mocny wynik jak na model w kontrolowanym wdrożeniu i taki, który jest spójny z wynikiem 52,6 w zestawieniu złożonym. To również pojedyncza obserwacja z pojedynczej ewaluacji, opublikowana w pierwszych dniach po ogłoszeniu, co czyni ją dowodem, a nie historią wyników. Oznacz go i idź dalej.
Do czego właściwie służą dwie karty cenowe
Podana stawka dla Argonu zasługuje na większą uwagę niż wiersz indeksu, ponieważ zawiera dwie liczby.
Stawka wprowadzająca wynosi 2,00 USD za wejście i 10,00 USD za wyjście, a wejście z pamięci podręcznej objęte jest 95% zniżką, co na karcie produktu uczyniłoby Argon dopasowaniem ceny jeden do jednego do GPT-6.1 Sol. W przypisie samego dostawcy stwierdzono, że po okresie wprowadzającym, którego nie definiuje, stawka wynosi 4,00 USD za milion tokenów wejściowych i 20,00 USD za milion tokenów wyjściowych. Ta druga para nie jest hipotetyczna — to opublikowana liczba, na której oczekuje się, że model się ustabilizuje — i trafia dokładnie w obecną cenę katalogową frontier, a nie poniżej niej. Porównanie, które podaje tylko parę wprowadzającą, podaje liczbę promocyjną dla modelu, który nie jest jeszcze ogólnodostępny, co w jednym wierszu daje dwa stopnie tymczasowości.
Karta cenowa GPT-6.1 Sol jest obiektem przeciwnego rodzaju. $2.00 i $10.00 to stała stawka, a nie promocja; próg długiego kontekstu do $4.00 / $15.00 powyżej 272 000 tokenów promptu jest opublikowany i dotyczy zdefiniowanej granicy; dane wejściowe z pamięci podręcznej po $0.10 są dostępne już dziś i podlegają rozliczeniu. Nie ma w niej niczego, co wymagałoby przypisu o okresie, którego dostawca nie chce zdefiniować.
To jest istota stojąca za linią dostępności. Nie chodzi o to, że Argon jest gorszym modelem — indeks mówi, że oba są na tym samym poziomie — ale o to, że jedna z tych dwóch kart jest zobowiązaniem, a druga intencją.
Sam rollout jest porównaniem

Fairwind Program to ta część ogłoszenia Argonu, którą porównanie techniczne zwykle pomija, i to ta część, która liczy się tu najbardziej.
Dostawca najpierw oddaje model w ręce nazwanej kohorty obrońców cyberbezpieczeństwa, przed wszystkimi innymi, bez ogłoszonej daty ogólnego udostępnienia, bez listy oczekujących dla deweloperów i bez opublikowanego identyfikatora, który klient mógłby przypiąć. To prawowity sposób wydania modelu frontier i nie jest to nic niezwykłego w przypadku możliwości tej klasy. Oznacza to również, że wszelkie twierdzenia o koszcie, opóźnieniu, przepustowości i niezawodności Argonu w rzeczywistym ruchu są obecnie niezmierzone: nie ma ruchu produkcyjnego, który można by zmierzyć. Istnieje własny przebieg benchmarku dostawcy i istnieje kompozyt Artificial Analysis, a wzięte razem są one oceną jednego laboratorium i zestawem jednego ewaluatora. To cały zapis.
Dorobek GPT-6.1 Sol liczy osiem dni i jest ubogi pod innym względem: jedna niezależna konfiguracja, brak korpusu praktyków i wdrożony produkt, którego tryby awarii nie zostały jeszcze nigdzie spisane. Żaden z modeli nie ma solidnej bazy dowodowej. Jeden z nich ma jednak fakturę.
Więc po co to porównanie?
Trzy zastosowania, a żadne z nich nie jest decyzją zakupową.
Najpierw kalibracja. Jeśli śledzisz, gdzie Argon plasuje się względem GPT-6.1 Sol, 52,6 wobec 51,8 przy 2,8× różnicy kosztów na zadanie to obecna odpowiedź, a to wskazuje, że linia Gemini 4 jest konkurencyjna pod względem możliwości, choć wciąż ustala warunki handlowe. Uważaj na moment, w którym stawka wprowadzająca zostanie zastąpiona parą $4.00 / $20.00, co zamieniłoby wyrównanie ceny w premię cenową przy niezmienionych możliwościach.
Po drugie, pozycja wyczekująca. Model, który jest ogłoszony, zmierzony i niemożliwy do wywołania w routingu, to najczystszy możliwy przypadek przemawiający za utrzymywaniem abstrakcji między Twoją aplikacją a wyborem modelu. Oba modele z tego tekstu są osiągalne w ten sam sposób z naszej strony płotu: GPT-6.1 Sol jest dostępny w OrcaRouter w swojej własnej cenie 2,00 USD / 10,00 USD z wejściem z pamięci podręcznej po 0,10 USD i bez żadnych dopłat, więc obciążenie można pod niego zbudować już dziś w cenie katalogowej dostawcy. Jeśli i kiedy Argon otrzyma identyfikator i cennik, jego ocena powinna być zmianą konfiguracji, a nie przepisaniem kodu — a do tego czasu właściwa ilość pracy inżynierskiej do zainwestowania w Argon to tyle, ile potrzeba, by to pozostało prawdą.
Po trzecie, falsyfikowalna lista obserwacyjna. Każdy z poniższych elementów zamieniłby ten tekst z materiału o tym, co na razie wiemy, w porównanie umożliwiające zakup: identyfikator modelu w dokumentacji dla deweloperów, wpis w jego indeksie kart modeli, wpis o ogólnej dostępności z opublikowanymi stawkami za token albo opublikowanie przez Artificial Analysis drugiej konfiguracji na innym poziomie wysiłku. Dopóki któryś z tych elementów się nie pojawi, tekst twierdzący, że Argon jest tańszy, szybszy lub lepszy niż GPT-6.1 Sol w produkcji, opisuje model, którego nikt spoza jednej kohorty nie uruchamiał.

Uczciwe zakończenie to jedno zdanie i dotyczy kształtu pytania, a nie wyniku. Gemini 4 Argon i GPT-6.1 Sol są wystarczająco blisko siebie w jedynym niezależnym rankingu, w którym oba się pojawiają, że indeks nie może wybrać między nimi; o wyborze między nimi decyduje to, że jeden jest dostępny, a drugi jest obietnicą, a obietnica nie jest czymś, na co kierujesz ruch produkcyjny. Śledź Argon, przyjmij Sol, jeśli cena i modalności pasują do twojej pracy, i utrzymuj warstwę abstrakcji na tyle cienką, aby w dniu, w którym Argon stanie się rzeczywisty, była to linijka konfiguracji, a nie projekt.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
