Karta tytułowa hero z napisem „Gemini 4 Argon vs GPT-6 Sol — jedna piąta ceny, czterokrotny rachunek”, z chipami o treści „Argon $2 / $10”, „Sol $2 / $10” i „Koszt na zadanie indeksowe $1.99 vs $1.05” oraz wierszem stopki o treści „Dane liczbowe dla Argonu podane przez dostawcę; dane liczbowe indeksu według Artificial Analysis, odczytano 2026-10-01.” Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

Gemini 4 Argon kontra GPT-6 Sol: jedna piąta ceny, czterokrotny rachunek

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Uruchomienie zestawu indeksów Artificial Analysis na Gemini 4 Argon kosztuje 2407 USD. Uruchomienie tego samego zestawu na GPT-6 Sol kosztuje 1546 USD. Ten sam indeks, te same zadania, ten sam tydzień. Oba modele mają identyczne ceny katalogowe — 2,00 USD za milion tokenów wejściowych i 10,00 USD za milion tokenów wyjściowych, przy czym Argon to podana przez Google stawka wprowadzająca, a Sol to obowiązująca stawka OpenAI — a jednak końcowy koszt wykonania identycznej pracy różni się o 56% na korzyść modelu, który ma o pięć punktów niższy wynik. Ta różnica jest całym powodem, dla którego warto napisać to porównanie, i nie ma nic wspólnego z cennikiem.

Google ogłosił Gemini 4 Argon 2026-09-30, nazywając go nową erą inteligencji na granicy możliwości, w cenie 2 USD za wejście i 10 USD za wyjście, przy czym wejście z cache jest o 95% tańsze, udostępniając go zaufanym obrońcom cyberprzestrzeni w ramach programu Fairwind. GPT-6 Sol jest powszechnie dostępny od 2026-09-22, kiedy OpenAI wypuściło średnią warstwę linii GPT-6 w cenie 2 USD za wejście i 10 USD za wyjście, z 90-procentowym rabatem na cache. Jednego można dziś kupić w endpoincie zgodnym z OpenAI, a drugiego nie może kupić nikt spoza wskazanej grupy, co stanowi praktyczne rozwidlenie w tym artykule. Jednak opisane powyżej odwrócenie kosztów pozostaje aktualne, nawet jeśli całkowicie odłożysz na bok kwestię dostępności, a zrozumienie, dlaczego tak jest, to przydatna część.

Inwersja, wyrażona wprost

Artificial Analysis publikuje zarówno Intelligence Index, jak i rozliczenie kosztów jego przeprowadzenia. Odczytane razem mówią one tak:

• Intelligence Index — Gemini 4 Argon 52,6 wobec GPT-6 Sol 47,5. Pięciopunktowa różnica, zmierzona przy Argonie ustawionym na wysokim poziomie wysiłku, a Sol na ustawieniu maks., więc porównanie jest korzystniejsze dla Sol niż dla Argona.

• Cena katalogowa za milion tokenów — identyczna. 2,00 USD za wejście / 10,00 USD za wyjście w obu przypadkach. Odczyty z pamięci podręcznej to jedyna różnica: 0,10 USD w przypadku Argon, 0,20 USD w przypadku Sol.

• Koszt na zadanie indeksowania — Gemini 4 Argon 1,99 USD w porównaniu z GPT-6 Sol 1,05 USD. Argon kosztuje około dwa razy więcej za zadanie, mimo że kosztuje tyle samo za token.

• Koszt uruchomienia pełnego zestawu — Gemini 4 Argon $2,407 w porównaniu z GPT-6 Sol $1,546.

• Zmierzona prędkość generowania — GPT-6 Sol 77,0 tokenów na sekundę w porównaniu z Gemini 4 Argon 48,9, różnica 1,6×, która przekłada się zarówno na opóźnienie, jak i na koszty.

Na tej liście jest jeden wiersz, który wyjaśnia wszystkie pozostałe, i nie jest to cena. To liczba tokenów. W zadaniach samego indeksu Gemini 4 Argon wygenerował około 561 000 tokenów wyjściowych na zadanie; GPT-6 Sol wygenerował około 282 000. Argon myśli dwa razy dłużej, aby odpowiedzieć na to samo pytanie, a przy identycznej stawce za token to dokładnie dwa razy większy rachunek.

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Sol. The Gemini 4 Argon column reads: AA Intelligence Index 52.6, price $2 in / $10 out per million tokens, cost per index task $1.99, output tokens per task 561K, output speed 48.9 tok/s, max output 1M tokens. The GPT-6 Sol column reads: AA Intelligence Index 47.5, price $2 in / $10 out, cost per index task $1.05, output tokens per task 282K, output speed 77.0 tok/s, max output 128K tokens. A footer line reads that the prices are vendor list prices and the index figures are per Artificial Analysis, read 2026-10-01.

Dlaczego tokeny są ceną

To korekta warta zinternalizowania, zanim ktokolwiek zaplanuje budżet migracji, ponieważ intuicja podpowiada odwrotnie. Gdy model ma taką samą cenę jak jego konkurent i zużywa dwa razy więcej tokenów wyjściowych, aby zakończyć zadanie, cena za token nie jest ceną. Cena to cena za token pomnożona przez to, ile tokenów model zdecyduje się zużyć, a ten drugi czynnik jest właściwością modelu, a nie cennika.

Marża na zadanie waha się ogromnie, co dodatkowo pogarsza sprawę — nie można zastosować jednego stałego mnożnika i po prostu przejść dalej:

• Terminal-Bench 4.0 — Argon 165 330 tokenów wyjściowych na zadanie w porównaniu z 97 372 w przypadku Sol. Argon kosztuje tutaj 6,78 USD za zadanie w porównaniu z 4,00 USD w przypadku Sol, mimo że Argon uzyskuje 57,1% wobec 43,9% Sol.

• CritPt — Argon 109 533 tokeny przeciwko 31 848 tokenom Sol. Stosunek tokenów 3,4× w zadaniu, w którym Sol faktycznie wypada lepiej, 30,9% do 27,1%.

• GDPval — Argon 74 571 tokenów wobec 41 567 u Sola, za 1,82 USD na zadanie wobec 1,32 USD.

• Omniscience — stosunek tokenów 938 do 2 662 na korzyść Argonu, przy $0,010 za zadanie w porównaniu z $0,027 Sol. Jedyna rodzina zadań, w której kierunek się odwraca.

• Rozumowanie w długim kontekście — Argon 2197 tokenów wobec 954 Sola, i jedyne zadanie w zestawie, w którym Sol wyraźnie wygrywa pod względem wyniku, 83,7% do 79,7%.

CritPt jest tym pouczającym przypadkiem. Model, który spala trzy i pół razy więcej tokenów, by na to samo pytanie udzielić nieco gorszej odpowiedzi, nie jest opowieścią o możliwościach; to opowieść o nawykach wydatkowych. Rozumowanie Argonu bywa długie, a przy niektórych kształtach zadań ta długość przekłada się na wynik, a przy innych po prostu przekłada się na dolary. Indeksowe 52,6 i Solowe 47,5 to agregat, a agregaty ukrywają dokładnie to.

Skąd tak naprawdę pochodzi tych pięć punktów

Ponieważ luka w indeksie i luka w kosztach wskazują przeciwne kierunki, warto wiedzieć, które zadania napędzają każdą z nich.

• Terminal-Bench 4.0 — Gemini 4 Argon 57,1% kontra GPT-6 Sol 43,9%. Największe pojedyncze zwycięstwo Argonu i rodzina zadań najbliższa długoterminowemu kodowaniu agentowemu.

• Wszechwiedza — Gemini 4 Argon 42,4 kontra GPT-6 Sol 27,1. Piętnastopunktowa różnica w pokryciu faktograficznym, największa proporcjonalna luka w zestawie.

• AutomationBench-AA — Gemini 4 Argon 77,5% kontra GPT-6 Sol 61,6%.

• SciCode — Gemini 4 Argon 61,8% versus GPT-6 Sol 57,6%.

• Humanity's Last Exam — Gemini 4 Argon 57,1% kontra GPT-6 Sol 47,9%.

• GDPval — Gemini 4 Argon 1611 kontra GPT-6 Sol 1487.

• ApexAgents / AA-Briefcase — GPT-6 Sol 1,482.78 Elo przeciwko wynikowi Argona 1,493.84, różnica 11 punktów, która mieści się w opublikowanych przedziałach ufności i należy uznać ją za remis.

• Rozumowanie długokontekstowe — GPT-6 Sol 83,7% versus Gemini 4 Argon 79,7%. Jedno wyraźne zwycięstwo Sola.

• CritPt — GPT-6 Sol 30,9% wobec Gemini 4 Argon 27,1%. Sol ponownie wygrywa, nieznacznie.

A więc nie chodzi o to, że „Argon jest lepszy”. Chodzi o to, że Argon jest lepszy w dwóch rzeczach, które jego materiały premierowe wysunęły na pierwszy plan — kompleksowym wykonywaniu zadań biznesowych i długofalowej inżynierii oprogramowania — a Sol jest na równym poziomie lub wyprzedza na drabinie rozumowania o akademickim zabarwieniu oraz w utrzymywaniu spójności w długim kontekście. Dla czytelnika, którego obciążenie pracą to potok wyszukiwania z promptem o rozmiarze 400K tokenów, Sol jest jednocześnie lepszym i tańszym modelem, co jest nietypową i komfortową sytuacją.

Różnice w specyfikacji, które przetrwają dyskusję o benchmarkach

• Maksymalna długość wyjścia — Gemini 4 Argon: 1 000 000 tokenów w pojedynczej trajektorii, co Google opisuje jako największą wartość w branży i wzrost względem limitu 64 tys. z poprzedniej generacji. GPT-6 Sol: 128 000 tokenów.

• Okno kontekstowe — karta producenta GPT-6 Sol podaje około 1 050 000 tokenów; w przypadku Argonu jest to 1 000 000. Artificial Analysis zmierzyło Sol na 872 000 tokenów za pomocą swojego harnessu, co jest pomiarem harnessu, a nie wartością z karty — kartę traktuj jako specyfikację, a liczbę z harnessu jako to, co oceniający faktycznie poddał testowi.

• Modalności wejściowe — oba przyjmują tekst, obrazy i pliki. Materiały premierowe Argon również opierają się na rozumieniu długich filmów, gdzie Google twierdzi, że osiąga 91,7% w LVBench, i opisuje to jako najnowocześniejsze rozwiązanie; to jednak liczba raportowana przez dostawcę i żadne niezależne gremium jeszcze jej nie odtworzyło.

• Wejście wideo — Miękkie. Artificial Analysis umieszcza Argon na wykresach z wyłączonym wejściem wideo i wprost wymienia wideo przy premierze, podczas gdy karta Sol w ogóle nie wymienia wideo. Jeśli wideo ma kluczowe znaczenie w twoim potoku, żadna z tych kart tego nie rozstrzyga i powinieneś przetestować, zanim zaprojektujesz architekturę.

• Wysiłek rozumowania — Sol udostępnia w API konfigurowalny wysiłek (od none do max, domyślnie medium) i został umieszczony na wykresie na poziomie max. Argon został umieszczony na wykresie na poziomie high; nikt nie opublikował tego samego zestawu przy jego najwyższym ustawieniu.

Limit wyjściowy 1 mln tokenów to ten, który mógłby naprawdę zmienić architekturę, a nie budżet. Wszystko, co obecnie dzielisz na tuzin połączonych wywołań, aby zmieścić się poniżej limitu 128K — zestaw poprawek obejmujący wiele plików, pełny raport z audytu, długi dokument w jednym przebiegu — staje się jednym wywołaniem z mniejszą liczbą miejsc, w których pętla agenta może zgubić stan. Czy jest to warte dwukrotności kosztu na zadanie, zależy wyłącznie od tego, czy masz takie obciążenie. Jeśli tak, prawdopodobnie warto. Jeśli Twoje wywołania to klasyfikuj-i-zwróć, to pieniądze wydane na zapas, którego nikt nie wykorzysta.

Ustawienie poziomu wysiłku, któremu nikt nie dorównał, i dlaczego to ma znaczenie

Jedno zastrzeżenie zasługuje na własny akapit, ponieważ przemawia przeciwko odczytywaniu pięciopunktowej luki w indeksie jako czystej różnicy możliwości. Artificial Analysis umieszcza Gemini 4 Argon na wysokim ustawieniu wysiłku rozumowania, a GPT-6 Sol na maksymalnym. To nie są te same szczeble na obu drabinach, a kierunek tej rozbieżności jest interesujący: Sol został uruchomiony na swoim najdroższym ustawieniu, a Argon na przeciętnym.

Możliwe są dwa odczytania i dane nie pozwalają ich rozróżnić. Albo Argon przy max uzyskałby wynik wyższy niż 52,6 — ale też spaliłby więcej tokenów niż 561 000 na zadanie i kosztowałby więcej niż 1,99 USD — albo uzyskałby mniej więcej taki sam wynik, co oznaczałoby, że pokrętło wysiłku niewiele zmienia w tym zestawie. Nie ma opublikowanego przebiegu, który by to rozstrzygał. Każdy, kto cytuje 52,6 jako pułap Argonu, cytuje konfigurację, a nie model, i jest to konfiguracja, którą jego dostawca zdecydował się opublikować jako pierwszą.

Ta sama logika dotyczy 47,5 Sola, tyle że w przeciwnym kierunku: max jest szczytem swojej drabiny, więc ta wartość jest bliżej sufitu niż podłogi. Uczciwa walka przy równym wysiłku mogłaby zmniejszyć lukę, a także odwrócić porównanie kosztów, ponieważ tokeny, które max spala, to tokeny kosztujące 10 dolarów za milion.

Rozwidlenie dostępności, które decyduje o rzeczywistej odpowiedzi

Gemini 4 Argon nie jest ogólnie dostępny. W ogłoszeniu Google napisano, że jest udostępniany grupie zaufanych obrońców cyberbezpieczeństwa w ramach programu Fairwind, że firma uczestniczy w dobrowolnym procesie dostępu do modeli przed premierą prowadzonym przez rząd USA, a ogólny dostęp dla deweloperów, przedsiębiorstw i konsumentów pojawi się „tak szybko, jak to możliwe”, począwszy od płatnych klientów API i subskrybentów Google AI Ultra. Nie ma identyfikatora modelu, punktu końcowego, limitu ani daty. Nie ma go w żadnym publicznym API, w tym w naszym — sprawdź katalog, a zwróci 404, bo jeszcze tam nie istnieje.

GPT-6 Sol to produkt wywoływalny. W OrcaRouter jest udostępniany jako openai/gpt-6-sol, na tym samym punkcie końcowym zgodnym z OpenAI co pozostałe ponad 200 modeli w katalogu, w cenie katalogowej OpenAI przekazywanej dalej z zerową marżą, więc wspomniane powyżej 2 USD/10 USD oraz próg długiego kontekstu 272 000 tokenów na poziomie 4 USD/15 USD to kwoty, które faktycznie płacisz, a nie to, co deklaruje cennik. Automatyczne przełączanie awaryjne między dostawcami obejmuje przypadek, gdy trasa ulega degradacji w trakcie działania, a DSL routingu pozwala jednej aplikacji kierować tani ruch klasyfikacyjny do mniejszego modelu, a trudny ruch rozumowania do Sol bez drugiego SDK.

A capture of the OrcaRouter model page for openai/gpt-6-sol, listed by OpenAI with a 2026-09-22 date, a 1M-token context window, a 128K-token maximum output, text, image and file input, and pricing of $2.00 per million input tokens and $10.00 per million output tokens.

To ostatnie rozwiązanie jest uczciwą odpowiedzią na to porównanie dla większości zespołów. Argument kosztowy za Argonem jest prawdziwy, ale uzależniony od obciążenia, w którym dominuje praca agenta o długim horyzoncie; argument kosztowy przeciwko niemu jest prawdziwy przy każdym innym obciążeniu; a poza tym i tak nie można go kupić w tym miesiącu. Tanim posunięciem jest zbudowanie teraz harnessu ewaluacyjnego — własnych promptów, własnego scoringu, uruchamianych na Sol przy kilku ustawieniach wysiłku — aby gdy Argon trafi do płacących klientów API, mieć zmierzoną odpowiedź na pytanie, na które wszyscy inni będą odpowiadać z leaderboardu.

Co by to rozstrzygnęło

Trzy rzeczy, w kolejności według tego, jak bardzo mogłyby zmienić werdykt. Ogólna dostępność Argonu w prawdziwej, niepromocyjnej cenie — słowo „wprowadzająca” oznacza, że $2/$10 może się zmienić, a sama kolejność Google’a stawia klientów płatnego API na pierwszym miejscu, więc pierwsza opublikowana stawka po premierze jest tym, na co trzeba patrzeć. Opublikowany przebieg Artificial Analysis dla Argonu przy jego najwyższym ustawieniu wysiłku, który powiedziałby, czy 52,6 to sufit, czy o włos od niego. I jedna niezależna reprodukcja wyniku DeepSWE v1.1 — Google twierdzi, że wynosi on 77,9%, i nazywa go nowym stanem sztuki; na dziś jest to wynik zgłoszony przez dostawcę i nieodtworzony poza Google.

Do tego czasu podział jest czysty i lekko ironiczny. GPT-6 Sol to model lepiej zweryfikowany, szybszy, tańszy w przeliczeniu na ukończone zadanie i taki, do którego możesz zadzwonić jeszcze dziś po południu. Gemini 4 Argon to model z wyższym wynikiem na tablicy, którą jego dostawca zdecydował się opublikować, około dwa razy droższy w faktycznym użyciu i jeszcze niejest w sprzedaży. Wybór między nimi nie jest oceną możliwości. To ocena tego, które z tych dwóch zdań opisuje twój miesiąc.

A capture of the Artificial Analysis model page for Gemini 4 Argon (High), dated September 2026 and credited to Google, marked a proprietary model. It reports an Artificial Analysis Intelligence Index score of 53, pricing of $2.00 per million input tokens and $10.00 per million output tokens with a 95% cache discount, an average cost of $1.99 per task on the Intelligence Index, a 1M-token context window, and text and image input.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie