Karta tytułowa hero do porównania DeepSeek V4 Pro i Qwen3.8 Max, z podtytułem „Specjalista od rozumowania vs chiński uniwersał".
Guides & Insights

DeepSeek V4 Pro vs Qwen3.8 Max: Specjalista od rozumowania vs chiński uniwersalista

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

W odstępie dziesięciu dni zadebiutowały dwie najbardziej obserwowane w Chinach modele: Alibaba wypuścił Qwen3.8 Max 3 sierpnia 2026 roku — sztandarowy model sparse-MoE o 2,4 biliona parametrów, który producent przedstawia jako wszechstronny do agentów, pracy biurowej i rozumienia multimodalnego — a D​eepSeek udostępnił oficjalną wersję DeepSeek V4 Pro 12 sierpnia, swojego specjalistę od rozumowania i kodowania z łączną liczbą 1,6 biliona parametrów i ceną za tokeny wyjściowe wynoszącą około jednej siódmej ceny Q​wen. Oba modele celują w te same portfele programistów, ale różnią się co do tego, do czego ma służyć flagowy model. Qwen3.8 Max chce być tym jednym modelem, przez który przepuszczasz wszystko; DeepSeek V4 Pro chce być tym, do którego kierujesz najtrudniejsze zadania.

The OrcaRouter DeepSeek V4 Pro model page showing the flagship MoE badge, 1M-token context, 384K max output, per-million pricing and an OpenAI-compatible code sample.

Najważniejsze wnioski

• Qwen3.8 Max to model o wyższych surowych możliwościach na chińskich ogólnych rankingach (SuperCLUE #1, lipiec) oraz mocniejszy pakiet multimodalny/korporacyjny — wejście wideo, wbudowane narzędzia, ustrukturyzowane wyniki, wszystko w jednym API.

• DeepSeek V4 Pro jest dramatycznie tańszy (~7× na wyjściu), ma już otwarte wagi i obecnie utrzymuje wyższe wyniki w zadaniach kodowania/agentowych — Terminal-Bench 2.1 na poziomie 87,9 wobec deklarowanych przez producenta 86,6 dla modelu Q​wen.

• Uważaj na koszt rozwlekłości: niezależne testy pokazują, że Qwen3.8 Max osiąga średnio ~64 kroki i ~1,14 USD za zadanie agentowe — to problem efektywnego kosztu, który specyfikacja ukrywa.

Uczciwy nagłówek: Qwen3.8 Max to flagowy model w „wojnie możliwości", który dorównuje cenom zamkniętych modeli amerykańskich; DeepSeek V4 Pro to kontrargument w kwestii stosunku jakości do ceny.

Dwie filozofie w jednej tabeli specyfikacji

• Łączne parametry — Qwen3.8 Max 2.4T (rzadki MoE, ~95B aktywnych) vs DeepSeek V4 Pro 1.6T (MoE, ~49B aktywnych)

• Kontekst / maksymalne wyjście — oba mają 1M kontekstu; Q​wen osiąga maksymalnie około 128–131K wyjścia, a D​eepSeek 384K

• Wejścia — Q​wen obsługuje tekst, obraz i wideo; DeepSeek V4 Pro obsługuje tekst i obraz, z nowym natywnym wnioskowaniem obrazowym w oficjalnej wersji.

• Otwarte wagi — DeepSeek V4 Pro: wydany (MIT); Qwen3.8 Max: zapowiedziany na tydzień od 10 sierpnia, pierwszy w historii model Qwen klasy Max udostępniony jako open-source.

• Dodatki API — Qwen oferuje wbudowane narzędzia i ustrukturyzowane dane wyjściowe w standardzie; DeepSeek V4 Pro oferuje przełączniki myślenia, ustrukturyzowany JSON, API Responses i zgodność z Codex

• Cena — Qwen3.8 Max 2,00 USD / 6,00 USD za milion tokenów (0,25 USD z pamięci podręcznej) vs DeepSeek V4 Pro ~0,42 USD / 0,87 USD (0,0035 USD z pamięci podręcznej)

Scoreboard contrasting DeepSeek V4 Pro (Terminal-Bench 2.1 87.9 official, output price $0.87 per 1M, 1.6T total params, MIT open weights out now, 384K max output, text+image input) with Qwen3.8 Max (86.6 vendor, $6.00, 2.4T params, weights promised, ~128K max output, text+image+video input).

Gdzie Qwen3.8 Max wygrywa

Na osi ogólnej Qwen3.8 Max prowadzi i niezależne dane to potwierdzają. Artificial Analysis ocenia go na 58 punktów w indeksie inteligencji, 71,8 w indeksie kodowania i 58 w indeksie agentowym — to najlepszy wynik, jaki jakiekolwiek chińskie laboratorium osiągnęło w czołówce tego rankingu agentowego. W lipcowym rankingu chińskojęzycznym SuperCLUE zajmuje #1 z wynikiem 71,48, podczas gdy DeepSeek-V4-Pro jest #5 z 64,4. Demo startowe Alibaby — 16-dniowa autonomiczna sesja kodowania, odtworzenie artykułu naukowego, które pobiło wynik AIME24 z oryginalnej publikacji — to najmocniejszy dowód w całym cyklu wydawniczym, że jest to naprawdę wydajny agent o długim horyzoncie.

Dla dewelopera praktyczne korzyści mają charakter integracyjny: wejście wideo, wbudowane wywoływanie narzędzi, ustrukturyzowane dane wyjściowe bez konfiguracji oraz ekosystem (Model Studio, zestaw narzędzi Q​wen), którego D​eepSeek nie stara się dorównać. Jeśli obciążenie jest oparte na dokumentach, multimodalne lub wymaga integracji na poziomie przedsiębiorstwa, Qwen3.8 Max jest modelem, na który chiński rynek obecnie się decyduje.

Gdzie DeepSeek V4 Pro wygrywa

W kwestii kodowania i kosztów, oficjalny V4 Pro jest odpowiedzią. D​eepSeek podaje, że oficjalna wersja uzyskuje 87.9 w Terminal-Bench 2.1 (wzrost z 72.1 w wersji preview) oraz 62.7 w DeepSWE — wobec deklarowanych przez Q​wen 86.6 w Terminal-Bench. Wersja preview miała już 80.6 SWE-bench Verified, 90.1 GPQA Diamond i 93.5 LiveCodeBench, co jest najlepszym wynikiem w programowaniu konkurencyjnym wśród modeli open-source, a zmiany w oficjalnej wersji są skoncentrowane dokładnie na zadaniach agentowych i rozumowania, z których pochodzą te liczby.

Następnie jest kwestia ceny. Przy 0,42/0,87 USD za milion tokenów DeepSeek V4 Pro jest około 4,8× tańszy na wejściu i 6,9× tańszy na wyjściu niż Qwen3.8 Max za 2/6 USD. D​eepSeek zasygnalizował również 6 sierpnia, że nadchodzi podwyżka cen, co czyni dzisiejszą stawkę oknem, a nie obietnicą — więcej o tym poniżej.

An infographic summarizing the official DeepSeek V4 Pro release: Terminal-Bench 2.1 at 87.9 (preview 72.1), DeepSWE 62.7 (preview 12.8), AutomationBench 31.8 (preview 12.8), with native image reasoning, 1M context, 384K output and $0.87 per 1M output.

Wykonaj obliczenia na prawdziwym zadaniu agentowym.

Niezależne uruchomienia agentów to moment, w którym cena katalogowa Qwen przestaje być rzeczywistą ceną. W zadaniach agentowych Artificial Analysis Qwen3.8 Max osiągał średnio ~64 tury na zadanie i kosztował ~1,14 USD za zadanie, wobec ~0,53 USD dla poprzedniej generacji — model jest rozwlekły i dużo planuje. Uruchom ten sam typ zadania na DeepSeek V4 Pro przy 0,87 USD za milion tokenów wyjściowych, a koszt na zadanie będzie o około rząd wielkości niższy. Jeśli Twój produkt to pętla, która wywołuje model sto razy dziennie na użytkownika, to ta różnica jest Twoją marżą.

Zastrzeżenia dotyczące niezawodności po obu stronach

Uczciwość w pozyskiwaniu danych działa tu w obie strony. Niezależne testy wykazały, że wskaźnik halucynacji Qwen3.8 Max wzrósł z 23% do 40%, a wynik AA-Omniscience spadł o dziesięć punktów — model stał się bardziej wydajny, ale mniej godny zaufania w tej samej wersji. Wersja zapoznawcza D​eepSeek miała udokumentowany 94% wskaźnik udzielania odpowiedzi w AA-Omniscience, co oznacza, że zwykle generuje odpowiedź, niezależnie od tego, czy ją zna. Obie kwestie mają znaczenie dla produkcji; żadna nie dyskwalifikuje modeli w zadaniach, do których są przeznaczone.

Dlaczego moment udostępnienia otwartych wag zmienia matematykę ceny.

Premiera Qwen3.8 Max z otwartymi wagami, gdy już nastąpi, w ciągu tygodnia zmieni ekonomikę tego pojedynku — self-hosterzy zyskają flagowca z 2.4T parametrów, a presja cenowa na API będzie realna. To dokładnie scenariusz, w którym model wyceny pass-through trzyma cię w ryzach. OrcaRouter przekazuje cenę cennikową dostawcy z zerową marżą, więc w chwili, gdy Alibaba lub DeepSeek zmieni cenę — w górę lub w dół — zmiana tego samego dnia jest aktywna na jednym kluczu, bez renegocjacji i bez czytania drugiej umowy. Kierujesz ruch do tego z Qwen3.8 Max lub DeepSeek V4 Pro, który preferuje Twoja bieżąca ewaluacja, a cena pozostaje dokładnie taka, jaką faktycznie nalicza dostawca.

Który z nich przy wyborze kreatora API?

Wybierz Qwen3.8 Max, gdy zadanie wymaga pełnego spektrum — wejścia multimodalnego, wyjścia strukturalnego, wbudowanych narzędzi, jakości w języku chińskim na szczycie obecnych rankingów — a Twój model kosztów toleruje rozwlekłe przebiegi agentowe. Wybierz DeepSeek V4 Pro, gdy zadanie opiera się głównie na rozumowaniu lub kodowaniu, wolumen tokenów jest wysoki, otwarte wagi mają znaczenie dla zgodności lub samodzielnego hostingu, albo gdy to budżet jest wiążącym ograniczeniem. Najbardziej naturalne odczytanie tego pojedynku to takie, które sygnalizują same firmy: Qwen3.8 Max to flagowiec, względem którego mierzysz wszystko, a DeepSeek V4 Pro to ten, który sprawia, że benchmark wygląda na drogi.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube