
GPT-6 kontra Gemini 3.1 Pro: poziom Pro Google nie wypuścił nowego modelu od lutego
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Gemini 3.1 Pro has been on Google's price list for seven and a half months and has never left preview. It was announced on 19 February 2026, it is still served under an endpoint named Gemini 3.1 Pro Preview, and as of today there is no general-availability commitment and no shutdown date — the two dates that would tell you where the model sits in its own vendor's plan. GPT-6 Sol, by contrast, shipped on 22 September 2026, and on 7 October 2026 it became the model behind the paid tiers of ChatGPT's global rollout to more than 1.2 billion weekly users.
So the headline comparison is not between two flagship tiers. It is between a shipping product and an open-ended preview, and that difference turns out to be worth more than the benchmark gap does. Put them side by side on Artificial Analysis's Intelligence Index v4.3.2 and Google's seven-month-old preview scores 29.7 against GPT-6 Sol's 47.6 while charging 1.25× more per completed index task — $1.30 against $1.04. Both of those numbers are real, and both need a caveat attached before you spend money on them.
To, co sprawia, że warto to przeczytać, zamiast to odrzucać, to fakt, że ta wersja zapoznawcza jednak coś wygrywa. Pokonuje GPT-6 Sol w GPQA Diamond, w τ²-Bench w zakresie agentowego użycia narzędzi oraz w jednym pomiarze długiego kontekstu — a przyjmuje dźwięk i wideo jako dane wejściowe, czego GPT-6 Sol nie robi. Siedmiomiesięcznej wersji zapoznawczej, która wciąż wygrywa dwa z czterech pojedynków, nie można skreślać. To model, którego problemem jest cykl życia, a nie możliwości.
Liczby oraz zastrzeżenie dotyczące korekty, które musi im towarzyszyć.
Artificial Analysis ponownie uruchamia swój zestaw testów i ponownie publikuje wyniki w ramach aktualnej rewizji indeksu, co oznacza, że ten sam model może mieć dwie różne liczby w zależności od tego, kiedy je odczytasz. W przypadku Gemini 3.1 Pro ta rozbieżność jest wyjątkowo duża: wcześniejsze materiały o tym modelu podawały 57 w starszej rewizji, podczas gdy strona w obecnym kształcie podaje 29.7 w wersji v4.3.2. Obie wartości są autentyczne i obie znajdują się na tej samej stronie internetowej.
To ma znaczenie, ponieważ tylko wartości z tej samej wersji można od siebie odejmować. Tutaj należy użyć pary 29.7 i 47.6, ponieważ obie pochodzą z v4.3.2 — tego samego przebiegu, w którym Claude Opus 5.5 uzyskuje 57.6, a GPT-6 Astra 52.7. Odczyt z tego samego przebiegu, jedna linia na wymiar:
• Indeks Inteligencji, v4.3.2 — GPT-6 Sol 47.6 vs Gemini 3.1 Pro 29.7
• Koszt na ukończone zadanie indeksowe — Gemini 3.1 Pro $1.30 vs GPT-6 Sol $1.04; starszy model jest o 25% droższy za gotową odpowiedź
• Cena wejściowa — $2.00 za 1M w obu przypadkach, na poziomie ceny bazowej
• Cena wyjściowa — GPT-6 Sol $10.00 vs Gemini 3.1 Pro $12.00; Sol jest o 17% tańszy
• Klauzula długiego kontekstu — GPT-6 Sol przelicza całe zapytanie według $4.00/$15.00 powyżej 272,000 tokenów wejściowych; Gemini 3.1 Pro przechodzi na $4.00/$18.00 powyżej 200,000
• Okno kontekstowe — GPT-6 Sol 1,050,000 tokenów vs Gemini 3.1 Pro 1,048,576, praktycznie na tym samym poziomie
• Maksymalna długość wyjścia — GPT-6 Sol 128,000 tokenów vs Gemini 3.1 Pro 65,536; Sol to niemal dwukrotność
• Modalności wejściowe — GPT-6 Sol: tekst, obraz, plik vs Gemini 3.1 Pro: tekst, obraz, audio, wideo, PDF

Dwa wiersze tam zasługują na rozwinięcie, ponieważ odwracają oczywistą interpretację. Wiersz kosztu na zadanie mówi, że pozornie tańsza stawka należy do modelu, który jest droższy w przeliczeniu na ukończone zadanie — stawka wyjściowa Gemini 3.1 Pro w dolarach wraz z jego wolumenem rozumowania wykonuje więcej pracy, niż sugeruje podana w nagłówku stawka wejściowa 2 USD. A stopień długiego kontekstu warto odczytać ponownie po obu stronach: poziom Gemini 3.1 Pro zaczyna się od 200 000 tokenów, niżej niż 272 000 w GPT-6 Sol, ale zmienia cenę wyjścia na 18,00 USD, podczas gdy Sol zmienia ją na 15,00 USD. Żaden z nich nie jest jednolitym cennikiem, a punkty przecięcia się nie pokrywają.
Gdzie podgląd wciąż wygrywa
Google's model is not a relic. Pull the evaluations both cards carry:
• GPQA Diamond — Gemini 3.1 Pro 94,1% vs GPT-6 Sol, w tej wersji nie opublikowano porównywalnego wyniku
• τ²-Bench, agentowe użycie narzędzi — Gemini 3.1 Pro 95,6% vs GPT-6 Sol, nie opublikowano w tym samym zestawieniu
• Odtwarzanie informacji z długiego kontekstu — Gemini 3.1 Pro 82,0% vs GPT-6 Sol 83,7%, różnica 1,7 punktu
• SciCode — Gemini 3.1 Pro 58,7% vs GPT-6 Sol 57,6%, praktycznie na tym samym poziomie
• Terminal-Bench 4.0 — Gemini 3.1 Pro 4,0% vs GPT-6 Sol 43,9%; jedyna kategoria, w której wersja zapoznawcza nie jest konkurencyjna

Wyniki 94,1% w GPQA Diamond i 95,6% w użyciu narzędzi agentowych to liczby z samego frontu, a nie z poprzedniej generacji, i to właśnie one sprawiają, że 17,9-punktowa luka w indeksie wyolbrzymia praktyczny dystans. Indeks to kompozyt dziesięciu ewaluacji, a straty Gemini 3.1 Pro skupiają się tam, gdzie zestaw jest silnie obciążony inżynierią oprogramowania — Terminal-Bench 4.0 z wynikiem 4,0% to katastrofalny outlier na tle 58,7% w SciCode i 73,8% w Terminal-Bench 2.1. Model, który plasuje się blisko szczytu jednego benchmarku agentowego, a blisko dna jego następcy, mówi ci o dacie swojego treningu, a nie o swoim pułapie.
Wejście audio i wideo to kolejna konkretna przewaga — i jest to bramka, a nie gradient. Jeśli twój potok przyjmuje jako dane wejściowe nagranie ze spotkania lub zrzut ekranu, Gemini 3.1 Pro może do niego wejść, a GPT-6 Sol nie. Żadna pozycja lidera w indeksach tego nie zastąpi.
Co konkretnie kosztuje Cię „wciąż w wersji zapoznawczej”?
Status podglądu to nie kosmetyczna etykieta, a koszty są tego rodzaju, że ujawniają się dopiero po tym, jak coś na tym zbudujesz.
A preview endpoint carries no general-availability commitment, which means the vendor has not promised the model will still be there on a schedule you can plan around. It also carries no shutdown date, which sounds like the good version of that — nothing is being retired — but reads the other way too: Google has not published a lifecycle for a model that has been in this state since February while shipping Flash-tier models through the same period. Gemini 3.8 Flash, Gemini 3.5 Flash-Lite, the 3.6 and 3.8 Flash line: the Pro tier stayed where it was, and the successor arrived instead as Gemini 4 Argon, which Google announced on 30 September 2026 in a phased rollout to a named cohort of security partners with no general-availability date attached either.
That is the pattern this comparison is really about. If you build a durable pipeline on Gemini 3.1 Pro Preview, you are building on a model whose own vendor has not said when it will graduate, replace or retire it. GPT-6 Sol's position is the opposite: it is a generally available API product with a published rate card, and since 7 October 2026 it is also the default in the app most of your colleagues use. Vendor-reported and as yet unreproduced, OpenAI says that in ChatGPT GPT-6 composes answers using text, graphics, charts and interactive controls through a capability it calls Intelligent UI, answers that need web search begin 44% sooner than GPT-5.6 Instant, and the Extra High effort level begins responding as fast as GPT-5.6 at Medium. None of that changes an API integration. All of it is why GPT-6 is now the ambient default and the preview is not.
Istnieje również zwykła wersja tego argumentu. Płacisz o 25% więcej za każde ukończone zadanie, przy niższym wyniku zdolności, za model, którego cykl życia nie został zadeklarowany. Kontrargument jest prawdziwy — otrzymujesz GPQA Diamond na poziomie 94,1% i wejście audio — ale to argument dotyczący konkretnego obciążenia, a nie ogólny powód, by preferować starszy model.
Testowanie podglądu bez obstawiania go
The mistake to avoid with a model in Gemini 3.1 Pro's position is to treat "should we use it" as a single binary decision. It is not. Both Gemini 3.1 Pro Preview and GPT-6 Sol sit on OrcaRouter's catalogue behind one OpenAI-compatible endpoint and one key, at 0% markup over provider list price — so the preview is something you can put in a real request path, measure against your own workloads, and keep or drop without a second vendor contract or a code change.
Automatyczne przełączanie awaryjne sprawia, że jest to bezpieczne dla modelu objętego cyklem życia wersji zapoznawczej. Kieruj ruch audio i wideo do Gemini 3.1 Pro, bo tylko on z tej dwójki może przyjąć dane wejściowe; kieruj ruch związany z inżynierią oprogramowania i generowaniem długich odpowiedzi do GPT-6 Sol; oraz skonfiguruj mechanizm awaryjny tak, aby w przypadku wycofania, ograniczenia liczby żądań lub cichej zmiany ceny punktu końcowego wersji zapoznawczej żądanie trafiło do modelu ogólnie dostępnego, zamiast zakończyć się niepowodzeniem. To struktura, na jaką zasługuje siedmiomiesięczna wersja zapoznawcza — nie unikanie, lecz ścieżka, która od niej nie zależy.
Jeśli chcesz pójść dalej, DSL routingu łączy kilka modeli w jedno logiczne wywołanie, dzięki czemu żądanie można wypróbować na Gemini 3.1 Pro i GPT-6 Sol, a odpowiedź wybrać według własnych kryteriów, a nie kryteriów jednego dostawcy. Fuzja modeli robi to samo w drugą stronę — panel modeli odpowiadających na jedno pytanie — co jest rozsądnym sposobem, by przekonać się, gdzie konkretne mocne strony wersji zapoznawczej są warte zapłaty, zanim przeznaczy się dla niej ścieżkę produkcyjną.

Werdykt i liczba, którą warto śledzić
W przypadku nowych projektów GPT-6 Sol jest bezpieczniejszym wyborem w czterech z sześciu wymiarów decydujących o wdrożeniu, a do tego jest tańszy w przeliczeniu na ukończone zadanie, uzyskując jednocześnie o 17,9 punktu indeksowego więcej przy tej samej wersji. W przypadku obciążeń wymagających wejścia audio lub wideo albo tam, gdzie kupuje się wynik 94,1% w GPQA Diamond, Gemini 3.1 Pro Preview nadal wygrywa, a etykieta „preview” to ryzyko, którym trzeba zarządzać, a nie powód, by się wycofać.
Liczba, na którą warto zwrócić uwagę, to nie indeks. To data w nazwie endpointu Gemini 3.1 Pro. Gdy zostanie usunięty sufiks preview — albo gdy Argon osiągnie ogólną dostępność z prawdziwym identyfikatorem API — to porównanie całkowicie zmieni kształt, a siedmiomiesięczna luka między ostatnim wydaniem poziomu Pro a dniem dzisiejszym stanie się tematem artykułu.
Porównane w tym artykule3
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
