Wygenerowana karta hero dla GPT-6.1 Sol vs DeepSeek V4 Pro z nagłówkiem „Trzy metryki, trzy różne odpowiedzi”, z trzema kartami metryk o treści „Cena mieszana 4x”, „Koszt na zadanie w indeksie 1,07x” i „Indeks inteligencji 16 punktów”, wierszem o treści „Jeden jest zastrzeżony i widzi obrazy. Jeden ma otwarte wagi na licencji MIT i obsługuje wyłącznie tekst.”, stopką o treści „Ceny według OpenAI i DeepSeek; wartości indeksu i kosztu na zadanie według Artificial Analysis, która porównuje modele o otwartych wagach i modele zastrzeżone w różnych grupach porównawczych.” oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

GPT-6.1 Sol vs DeepSeek V4 Pro: Trzy metry, trzy różne odpowiedzi

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Zapytaj, jak daleko od siebie są GPT-6.1 Sol i DeepSeek V4 Pro, a szczera odpowiedź brzmi: to zależy, który miernik czytasz, a trzy mierniki są bardziej niezgodne ze sobą, niż większość porównań modeli jest niezgodna co do wszystkiego. Jeśli chodzi o cenę za milion tokenów, przy mieszanym stosunku wejścia do wyjścia 3:1, wynosi ona 4,00 USD wobec 0,99 USD — czterokrotna różnica. Jeśli chodzi o rzeczywisty koszt uruchomienia tego samego zestawu ewaluacyjnego, wynosi on 0,72 USD wobec 0,67 USD na zadanie — siedem procent. W Artificial Analysis Intelligence Index wynoszą 51,8 wobec 36 — szesnaście punktów, co brzmi rozstrzygająco, dopóki nie spojrzysz, z kim porównywano każdą z tych liczb, ponieważ własna metodologia tego ewaluatora umieszcza te dwa modele w różnych ligach. GPT-6.1 Sol został wydany 29 września 2026 r. w cenie 2,00 USD za wejście i 10,00 USD za wyjście, z oknem 1 050 000 tokenów. DeepSeek V4 Pro to flagowy model typu mixture-of-experts na licencji MIT, 1,6 biliona parametrów, z czego 49 miliardów aktywnych, wydany 13 sierpnia 2026 r. w cenie 0,66 USD i 1,98 USD, z oknem 1 048 576 tokenów. Jeden to model tekstowy, który możesz pobrać. Drugi widzi obrazy. Ustalenie, którym z trzech mierników powinieneś się właściwie kierować, to cała robota.

Wiersz indeksu to nie takie porównanie, na jakie wygląda

Zacznij od liczby, którą cytuje się najczęściej, ponieważ to właśnie ona jest najczęściej cytowana błędnie.

Artificial Analysis publikuje swoją metodologię obok swojego rankingu i dwa zdania w niej mają tu znaczenie. Modele z otwartymi wagami — jak się stwierdza — są porównywane wyłącznie z innymi modelami z otwartymi wagami tej samej klasy rozmiaru: malutkie, małe, średnie, duże, z granicą na 150 miliardów parametrów. Modele zastrzeżone są natomiast porównywane w obrębie przedziału cenowego, przy łącznym stosunku wejścia do wyjścia wynoszącym 3:1. To dwie różne grupy porównawcze. DeepSeek V4 Pro 0813 ma otwarte wagi — własny FAQ ewaluatora tak mówi i wskazuje na opublikowane wagi — a przy łącznej liczbie 1,6 biliona parametrów trafia do dużej klasy modeli z otwartymi wagami. GPT-6.1 Sol jest zastrzeżony i jest oceniany na tle modeli w swoim własnym przedziale cenowym.

Wynik 51,8 i wynik 36 w sąsiednich wierszach tej samej tabeli nie są zatem bezpośrednim porównaniem. To wynik na tle jednego zbioru odniesienia i wynik na tle innego, i właśnie dlatego wartości kosztu na zadanie są porównywalne, a surowe liczby indeksu już nie. Jeśli chcesz wiedzieć, czy DeepSeek V4 Pro jest dobry jak na model do pobrania, to 36 jest liczbą, która na to odpowiada. Jeśli chcesz wiedzieć, jak wypada w porównaniu z hostowanym modelem czołowym, kolumna indeksu ci tego nie powie, a w tym przypadku uczciwym posunięciem jest powiedzieć to wprost, zamiast odejmować 36 od 51,8 i nazywać to różnicą.

Co można porównać w sposób przejrzysty: karty cenowe, limity kontekstu i danych wyjściowych, listy modalności oraz koszt uruchomienia tego samego zestawu ewaluacyjnego — ponieważ ta ostatnia wartość to rozliczenie identycznej pracy, a nie wynik punktowy.

Co mówią surowe mierniki

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, credited to DeepSeek and dated 2026-04-24, showing the model identifier, text-only input with tools, JSON and reasoning, a 1M-token context window with a 384K maximum output, and a rate row reading $0.66 input and $1.98 output per million tokens alongside a 1.92-second median latency and a 1030.7M seven-day traffic figure.

• Cena wejściowa — GPT-6.1 Sol $2.00 vs DeepSeek V4 Pro $0.66 za milion tokenów

• Cena za tokeny wyjściowe — GPT-6.1 Sol 10,00 USD vs DeepSeek V4 Pro 1,98 USD, spadająca do 1,32 USD i 3,96 USD w dwóch czterogodzinnych oknach czasowych UTC w dni robocze

• Odczyt z pamięci podręcznej — GPT-6.1 Sol 0,10 USD vs DeepSeek V4 Pro 0,022 USD za milion tokenów; oba korzystają z pamięci podręcznej, a tańsza opcja jest jeszcze 4,5× tańsza

• Koszt na zadanie indeksowania — GPT-6.1 Sol $0.72 vs DeepSeek V4 Pro $0.67

• Tokeny wyjściowe wyemitowane w zestawie indeksowym — GPT-6.1 Sol 67M vs DeepSeek V4 Pro 160M

• Maksymalna długość wyjścia — DeepSeek V4 Pro 384 000 tokenów vs GPT-6.1 Sol 128 000 tokenów

• Modalności — GPT-6.1 Sol przyjmuje tekst, obrazy i pliki; DeepSeek V4 Pro przyjmuje tylko tekst

Czwarta i piąta linia to ciekawa para. DeepSeek V4 Pro generuje 2,4 razy więcej tokenów na tym samym zestawie testów, a mimo to wypada o 7% taniej na zadanie, ponieważ jego stawka za tokeny wyjściowe stanowi jedną piątą stawki GPT-6.1 Sol. Tak wygląda model zorientowany na cenę, gdy mierzy się liczbę tokenów wyjściowych, a nie stawkę: gadatliwość jest realna i nie zaciera tej przewagi. Okno czasowe to ta gwiazdka. Dwa czterogodzinne bloki w dni powszednie — 40 z 168 godzin w tygodniu — podwajają podaną stawkę do 1,32 USD i 3,96 USD, a ta dopłata dotyczy tych samych tokenów, które w przeciwnym razie byłyby najtańsze na którejkolwiek z tych dwóch kart.

Czego nie robi tańszy model

Trzy rzeczy, a każda z nich jest twardym ograniczeniem, a nie kompromisem.

Nie widzi. DeepSeek V4 Pro przyjmuje tekst na wejściu i zwraca tekst na wyjściu. Żadnych zrzutów ekranu, żadnych zeskanowanych plików PDF, żadnego czytania wykresów, żadnego diagramu w zgłoszeniu. Obsługa komputera i przepływy pracy w dużym stopniu oparte na dokumentach — dokładnie te obciążenia, dla których pozycjonowany jest GPT-6.1 Sol — nie wchodzą w grę za żadną cenę. Jeśli twój potok przetwarzania już przekazuje obrazy do modelu wizyjnego, nie stanowi to problemu; jeśli nie, jest to decydujące ograniczenie.

Nie ma rytmu wydań, wokół którego można by planować. Nazwa „deepseek-v4-pro” od sierpnia wskazuje na build 0813, a droga do tego nie przebiegła cicho: dostawca ogłosił wycofanie tego builda na 14 września, wycofał ogłoszenie dwa dni przed tą datą i nadal udostępniał API bez zmian w rozliczeniach. Nasz własny katalog wciąż wymienia go jako flagowy model z tym samym kontekstem, limitem wyjścia i limitem współbieżności. Dostawca, który potrafi wycofać deprecację w dwa dni, może też po prostu tego nie robić; operacyjny wniosek nie jest taki, że model jest niestabilny, lecz taki, że nazwa to wskaźnik, a przypięcie zachowania do identyfikatora builda, a nie do nazwy trasy, to tanie ubezpieczenie.

Nie niesie ze sobą otaczającej wiedzy. GPT-6.1 Sol ma osiem dni i ma już opublikowaną jedną niezależną konfigurację; DeepSeek V4 Pro ma dłuższą historię ocen i znacznie większą bazę praktyków, w tym opublikowany stos serwowania i prace stron trzecich nad przepustowością. W przypadku wdrożenia self-hosted ten zbiór materiałów jest wart więcej niż wiersz indeksu, ponieważ to jego konsultujesz, gdy model zachowuje się dziwnie na twoim sprzęcie, a nie na benchmarku.

Kiedy czterokrotnie tańszy licznik jest złym licznikiem

Gdyby tańszy model był po prostu gorszy pod każdym względem, ten artykuł byłby krótki. Niewygodny fakt jest taki, że oba modele różnią się o 7% na zadanie przy identycznej pracy i o 2,4× pod względem tego, ile piszą, żeby osiągnąć ten wynik. To oznacza, że miernik tokenów mieszanych — ten, który mówi 4× — mierzy różnicę, której w większości nie płacisz, ponieważ wycenia mieszankę tokenów, której możesz nigdy nie wysłać. A miernik indeksu — ten, który mówi 16 punktów — mierzy w poprzek dwóch grup porównawczych i nie można go odjąć.

Zatem praktyczny podział to nie „model frontier do wymagających zadań, tani model do łatwych zadań”. To podział według modalności i podział według wolumenu. Wszystko, co zawiera obraz, trafia do GPT-6.1 Sol, podobnie jak wszystko, gdzie odpowiedź jest krótka, a rozumowanie jest kosztowną częścią — jego pięć poziomów wysiłku, od low do max z medium jako domyślnym, pozwala kupić rozumowanie bez kupowania prozy, a jego buforowane wejście w cenie $0.10 sprawia, że długi, powtarzany prompt jest tani. Wszystko wyłącznie tekstowe, o dużym wolumenie i tolerujące dłuższą odpowiedź — klasyfikacja, ekstrakcja, streszczanie, masowe generowanie w ramach budżetu wyjściowego wynoszącego 384 000 tokenów — trafia do DeepSeek V4 Pro, najlepiej poza dwoma oknami UTC.

Oba na jednym klawiszu, a podział to linia konfiguracji

Oba modele są dostępne w OrcaRouter po własnych, publikowanych stawkach ich dostawców, bez żadnych doliczeń: GPT-6.1 Sol za 2,00 USD / 10,00 USD, przechodząc na 4,00 USD / 15,00 USD powyżej 272 000 tokenów promptu, oraz DeepSeek V4 Pro za 0,66 USD / 1,98 USD, z dwoma oknami czasowymi uwzględnionymi zgodnie z podaną listą. Jeden klucz, jeden rachunek, jeden endpoint zgodny z OpenAI dla obu.

To jest powód, dla którego powyższy podział warto zapisać, zamiast się o niego spierać. Podział modalności można wyrazić jako regułę routingu, więc żądania zawierające obrazy trafiają do modelu wizyjnego, a tekst masowy do taniego modelu, bez zmian w aplikacji; jeśli trasa ulegnie degradacji, przełączenie awaryjne przenosi wywołanie, zamiast kończyć je błędem. A ponieważ oba są na tym samym punkcie końcowym, porównanie cen, które naprawdę się liczy — Twoje, na Twoim ruchu, przy Twoim miksie tokenów — można uzyskać z Twoich własnych faktur, a nie ze średniej z zestawu benchmarków.

A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window, 128,000 max output tokens, an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.A generated scoreboard titled 'GPT-6.1 Sol vs DeepSeek V4 Pro — the scoreboard' showing two columns on six shared rows: input price $2.00 against $0.66 per million tokens; output price $10.00 against $1.98; cache read $0.10 against $0.022; cost per index task $0.72 against $0.67; maximum output 128,000 against 384,000 tokens; modalities text, image and file against text only. A footer reads 'Prices per OpenAI and DeepSeek as listed on OrcaRouter; cost-per-task figures per Artificial Analysis, whose index compares open-weights and proprietary models in different peer groups.'

Werdykt w jednym zdaniu jest taki: odczytowi mówiącemu o czterokrotnie niższej cenie nie należy ufać, a odczyt siedmioprocentowy należy zweryfikować. Czterokrotność to to, co mieszany miernik mówi o mieszance tokenów, której możesz nie wysyłać. Siedem procent to koszt tej samej ewaluacji w obu przypadkach, a ma w sobie wpisaną 2,4× różnicę w gadatliwości. Szesnaście punktów jest prawdziwe, ale rozkładają się one na dwie grupy porównawcze, a ograniczenie, które faktycznie decyduje o większości wdrożeń tej pary, wcale nie jest liczbą: jeden z tych modeli potrafi odczytać zrzut ekranu, a drugi nie.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie