
GPT-6 vs DeepSeek V4 Pro: Jednego możesz wynająć od kogokolwiek, drugiego możesz zabrać do domu
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Jest dokładnie jedna rzecz, którą można zrobić z DeepSeek V4 Pro, a której nie można zrobić z GPT-6 Sol: zabrać go do domu. DeepSeek V4 Pro to flagowy model typu mixture-of-experts na licencji MIT — 1,6 biliona łącznych parametrów, 49 miliardów aktywnych na token — wydany 13 sierpnia 2026 r., a checkpoint można pobrać. GPT-6 Sol ma zamknięte wagi, został wydany przez OpenAI 22 września 2026 r., a od 7 października 2026 r. jest także modelem leżącym u podstaw płatnych planów globalnego wdrożenia ChatGPT dla ponad 1,2 miliarda użytkowników tygodniowo.
Wszystko inne w tym porównaniu zależy od tego, który miernik odczytujesz. Na karcie stawek te dwa różnią się czterokrotnie. Jeśli chodzi o to, ile faktycznie kosztowało wytworzenie gotowej odpowiedzi w niezależnym zestawie testów, różnią się o 1,55×. Na Intelligence Index wiersze wyglądają, jakby różniły się o szesnaście punktów, a zgodnie z udokumentowaną metodologią samego ewaluatora wcale nie można ich odejmować. Rozstrzygnięcie, która z tych trzech liczb powinna kierować decyzją, to cała robota, a odpowiedź różni się w zależności od tego, czy wybierasz dostawcę, czy wybierasz plik.
Czym jest każdy model, po jednym akapicie na każdy
GPT-6 Sol to średni poziom linii GPT-6 OpenAI — poniżej flagowego GPT-6 Astra, powyżej budżetowego GPT-6 Luna — z oknem kontekstowym o rozmiarze 1 050 000 tokenów, pułapem wyjściowym 128 000 tokenów, wejściem tekstowym, obrazowym i plikowym, natywnym wywoływaniem narzędzi, wyjściami strukturalnymi oraz możliwością wyboru wysiłku rozumowania na pięciu poziomach od niskiego do maksymalnego. To poziom, do którego OpenAI kieruje ChatGPT Plus, Pro, Business i Enterprise, a jego cena wynosi 2,00 USD za milion tokenów wejściowych i 10,00 USD za milion tokenów wyjściowych, z poziomem długiego kontekstu, który powoduje ponowną wycenę całego żądania na 4,00 USD i 15,00 USD, gdy podpowiedź przekroczy 272 000 tokenów wejściowych.
DeepSeek V4 Pro to flagowy model wyłącznie tekstowy z oknem 1 048 576 tokenów i maksymalnym wyjściem 384 000 tokenów — trzykrotnie większym niż limit GPT-6 Sol — oraz bez obsługi obrazu w żadnej cenie. Własna dokumentacja API DeepSeek podaje dla niego stawkę 0,66 USD za milion tokenów wejściowych i 1,98 USD za milion tokenów wyjściowych w godzinach szczytu, obniżoną o połowę do 0,33 USD i 0,99 USD poza szczytem, przy czym trafienia w pamięć podręczną kosztują 0,022 USD poza szczytem. Godziny szczytu to 01:00–04:00 i 06:00–10:00 UTC w dni powszednie; wszystko inne, w tym weekendy i chińskie święta państwowe, obowiązuje poza szczytem.
Te trzy metry
Zacznij od tego, który jest cytowany najczęściej, ponieważ to właśnie jego najczęściej cytuje się bez kontekstu. Artificial Analysis ocenia DeepSeek V4 Pro na 36,0, a GPT-6 Sol na 47,6 w Intelligence Index v4.3.2. Jedenaście i pół punktu to różnica, która kończy porównanie.
Nie powinno, i sam ewaluator tak twierdzi. Artificial Analysis porównuje modele o otwartych wagach wyłącznie z innymi modelami o otwartych wagach w tej samej klasie rozmiarowej, z granicą na poziomie 150 miliardów parametrów, a modele własnościowe — w obrębie przedziału cenowego przy łącznym stosunku wejścia do wyjścia wynoszącym 3:1. To dwie różne grupy odniesienia, dające dwie różne skale. 36 i 47,6 w sąsiednich wierszach tej samej tabeli to nie bezpośrednie starcie, a uczciwym posunięciem jest powiedzieć to, zamiast odejmować jedno od drugiego i nazywać to zdolnościami.

Te dwa porównywalne mierniki mówią coś bardziej użytecznego:
• Cena mieszana w stosunku 3:1 — GPT-6 Sol 4,00 USD za 1 mln vs DeepSeek V4 Pro 0,99 USD w stawce szczytowej lub 0,50 USD poza szczytem; rozrzut od 4× do 8× w zależności od tego, kiedy uruchomisz
• Koszt na ukończone zadanie indeksowania — GPT-6 Sol 1,04 USD vs DeepSeek V4 Pro 0,67 USD; rozrzut 1,55×
• Tokeny wyjściowe wygenerowane w całym zestawie — GPT-6 Sol 76,8 mln vs DeepSeek V4 Pro 162,9 mln, więc tani model pisze 2,1× więcej, aby ukończyć tę samą pracę
• Maksymalna długość wyjścia — DeepSeek V4 Pro 384 000 tokenów vs GPT-6 Sol 128 000; pułap 3×
• Wejście multimodalne — GPT-6 Sol przyjmuje tekst, obrazy i pliki vs DeepSeek V4 Pro tylko tekst
• Wagi — DeepSeek V4 Pro na licencji MIT i do pobrania vs GPT-6 Sol zamknięty

Czwarta i piąta linia wyjaśniają drugą. Rozpiętość 4× w nagłówku, która w rzeczywistej pracy spada do 1,55×, to skutek sytuacji, gdy tańszy model jest jednocześnie tym bardziej gadatliwym: DeepSeek V4 Pro wygenerował 2,1× więcej tokenów wyjściowych niż GPT-6 Sol w tym samym zestawie ewaluacyjnym. Gadatliwość to mnożnik kosztów, który nigdy nie pojawia się na stronie z cenami, a w tym starciu jest to najbardziej niedoczytana liczba.
Gdzie otwarty model naprawdę wygrywa
Dwa miejsca i oba są strukturalne, a nie marginalne.
Limit wyjściowy to pierwsza kwestia. 384 000 tokenów wobec 128 000 to trzykrotna różnica i rozstrzyga o całych kategoriach pracy: generowaniu dużego ustrukturyzowanego artefaktu w jednym wywołaniu, pisaniu długiego dokumentu bez łańcuchowania, wykonaniu dużego refaktoru w ramach jednej odpowiedzi. GPT-6 Sol nie potrafi tego zrobić za żadną cenę, ponieważ ten limit nie jest poziomem rozliczeniowym — to maksimum modelu.
Użycie narzędzi agentowych jest drugie, jeśli chodzi o jeden konkretny pomiar. DeepSeek V4 Pro uzyskuje 96,2% w τ²-Bench, ewaluacji użycia narzędzi agentowych, i tym właśnie wynikiem DeepSeek otwiera własną kartę modelu. To także liczba, którą powtarza wpis modelu w katalogu OrcaRouter, a to wersja twierdzenia, z jaką zetknęliby się nasi czytelnicy. Porównywalny wynik GPT-6 Sol w τ²-Bench nie jest publikowany na tej samej tablicy, więc porównanie należy traktować jako orientacyjne: w jednym benchmarku, który DeepSeek zdecydował się wysunąć na pierwszy plan, model otwarty jest na czele stawki, a model zamknięty nie umieścił liczby w tej samej kolumnie.
A kwestia własności, która wcale nie jest benchmarkiem. Możliwy do pobrania checkpoint na licencji MIT oznacza, że możesz uruchomić model na własnym sprzęcie, trzymać zapytanie poza czyjąkolwiek siecią, dostroić go, przypiąć wersję i wiedzieć, że nadal będzie dostępna za trzy lata. Żaden dostawca nie może go wycofać, zmienić jego ceny ani usunąć go z cennika. Dla pewnej klasy nabywców — regulowanych branż, każdego z ograniczeniem rezydencji danych, każdego, kto sparzył się na wycofaniu modelu — jest to warte więcej niż jedenaście punktów indeksu.
Gdzie GPT-6 Sol wygrywa, i nie chodzi tylko o indeks
Terminal-Bench 4.0 to najmniej pochlebna pozycja na karcie DeepSeek V4 Pro: 14,1% wobec 43,9% GPT-6 Sol. To nie jest różnica wynikająca z zaokrąglenia i wskazuje na realny profil — model otwarty jest mocny w wieloturowej orkiestracji narzędzi, a słaby w długookresowej pracy w terminalu, na której opierają się nowoczesne agenty kodujące. Jeśli Twoim obciążeniem jest agent, który musi utrzymać sesję powłoki przez dwadzieścia minut, ta pojedyncza ewaluacja jest lepszym predyktorem Twojego doświadczenia niż kompozyt indeksu.
Multimodalność jest drugim aspektem. DeepSeek V4 Pro przyjmuje tekst i zwraca tekst. GPT-6 Sol przyjmuje obrazy i pliki, a to nie jest tylko pole do odhaczenia — praca zawodowa w dużym stopniu oparta na dokumentach oznacza zrzuty ekranu, zeskanowane strony, diagramy i pliki PDF, a model wyłącznie tekstowy w ogóle nie może wejść do tej kategorii.
Trzecia to rzecz, która wydarzyła się w tym tygodniu. GPT-6 trafił do karty Chat w ChatGPT dla Plus, Pro, Business i Enterprise 7 października, a Free i Go dołączyły od 8 października, przynosząc możliwość, którą OpenAI nazywa Intelligent UI — odpowiedzi, które na potrzeby każdego pytania składają tekst, grafikę, wykresy, formularze i klikalne elementy sterujące, zamiast domyślnie sięgać po prozę. To warstwa interfejsu, a nie funkcja API, i nie zmienia ani jednej linii kodu twojej integracji. Zmienia natomiast domyślne otoczenie: model, który twój zespół ma już otwarty w karcie przeglądarki, to teraz GPT-6, a prace prototypowe dryfują w stronę modelu, do którego można dotrzeć bez klucza. Zgłoszone przez dostawcę i niepowtórzone — OpenAI twierdzi również, że GPT-6 na poziomie Extra High zaczyna odpowiadać tak szybko jak GPT-5.6 na poziomie Medium, a GPT-6 Instant zaczyna odpowiadać o 44% szybciej na pytaniach opartych na wyszukiwaniu.
Uruchamianie jednego lub obu
Powód, dla którego właśnie ta para jest łatwiejsza do zabezpieczenia niż większość, jest taki, że oba modele znajdują się w tym samym katalogu. OrcaRouter kieruje GPT-6 Sol i DeepSeek V4 Pro — wraz z ponad 200 innymi modelami — przez jeden punkt końcowy zgodny z OpenAI, na jednym kluczu, przy 0% narzutu względem ceny katalogowej dostawcy. To właśnie ten mechanizm przenoszenia sprawia, że struktura szczyt/poza szczytem jest czytelna, a nie tajemnicza: obniżka o połowę poza szczytem u DeepSeek należy do dostawcy, my jej nie ruszamy, a gdy dostawca zmienia ceny, zmiana jest tu widoczna tego samego dnia.
To również punkt, w którym decyzja o oknach szczytu staje się decyzją o routingu. Stawka DeepSeek V4 Pro poza godzinami szczytu jest o połowę niższa od stawki w godzinach szczytu, a okna szczytu to stałe godziny UTC. Zadanie wsadowe, które można przesunąć, warto planować z uwzględnieniem tych okien, a ścieżkę wrażliwą na opóźnienia warto trzymać poza nimi. Gdy oba modele są dostępne za jednym kluczem, podział jest kwestią konfiguracji, a nie drugą umową z dostawcą: kieruj zadania masowe oraz zadania z długimi wynikami do DeepSeek V4 Pro poza godzinami szczytu, kieruj ruch multimodalny i wymagający intensywnego rozumowania do GPT-6 Sol, a automatyczne przełączanie awaryjne niech obejmuje limit liczby żądań po którejkolwiek stronie, zamiast odkrywać go na produkcji.

Co tak naprawdę bym zrobił
Jeśli potrzebujesz obrazów, plików lub wyniku rozumowania na najwyższym poziomie i kupujesz API, odpowiedzią jest GPT-6 Sol, a jedenaście punktów indeksu w większości nie ma znaczenia — bramka multimodalna rozstrzyga sprawę, zanim benchmarki zdążą zagłosować. Jeśli potrzebujesz danych wyjściowych o długości 384 000 tokenów, licencji, którą możesz zachować, wdrożenia on-premise lub najniższego kosztu przypadającego na ukończone zadanie w zestawieniu, wygrywa DeepSeek V4 Pro, a różnica w indeksie należy do czyjejś innej grupy porównawczej.
Czego bym nie zrobił, to odczytanie 36 wobec 47,6 jako luki w możliwościach i kupowanie na tej podstawie. Porównywalne mierniki — $0,67 wobec $1,04 na zadanie oraz 2,1× różnica w gadatliwości ukryta w 4× rozpiętości liczb nagłówkowych — opowiadają znacznie wierniejszą historię niż wiersze indeksu, a to właśnie one pojawiają się na fakturze.
Następna rzecz, której warto wypatrywać, to czy DeepSeek nadrobi lukę w Terminal-Bench przy odświeżeniu V4 Pro, ponieważ to jedyny pomiar, w którym otwarty model wygląda na naprawdę pozostającego w tyle, a nie na takiego, którego po prostu inaczej oceniono. GPT-6 z kolei właśnie przestał być wyborem i stał się domyślnym ustawieniem, a z domyślnymi ustawieniami trudno polemizować, nawet gdy benchmark mówi coś innego.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
