Wygenerowana karta tytułowa dla artykułu 'Mistral Large 4 vs DeepSeek V4 Pro', pokazująca tytuł pogrubioną geometryczną czcionką bezszeryfową, podtytuł 'Bliźniacze architektury, przeciwne zakłady' pod nim oraz rząd trzech płaskich ikon liniowych powyżej — dwa pasujące węzły sieci, jeden ze strzałką pobierania, a drugi wyszarzony — na białym tle z niebiesko-cyjanowymi akcentami gradientowymi i logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Mistral Large 4 kontra DeepSeek V4 Pro: bliźniacze architektury, przeciwstawne zakłady

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa modele w tym porównaniu są na papierze niemal identyczne, a w praktyce nie mogłyby się bardziej różnić. Mistral Large 4 to rzadka mieszanka ekspertów o 1,05 biliona parametrów i 49 miliardach aktywnych parametrów, ogłoszona 6 października 2026 r. DeepSeek V4 Pro to rzadka mieszanka ekspertów o 1,6 biliona parametrów i 49 miliardach aktywnych parametrów, wydana 24 kwietnia 2026 r. Ten sam budżet aktywacji, ta sama rodzina architektoniczna, ta sama obietnica wydajności na poziomie czołówki przy ekonomice otwartych wag — i dokładnie jeden z nich ma wagi, które można dziś pobrać.

To zestawienie nie jest wymysłem tego artykułu. Sam Mistral w swoim wpisie premierowym wymienia z nazwy DeepSeek V4 Pro jako punkt odniesienia w trzech osobnych miejscach: kodowanie agentowe, długoterminowa praca wiedzowa i automatyzacja procesów biznesowych. Zadanie tego samego pytania drugiej stronie — co DeepSeek V4 Pro już robi, a co obiecuje Mistral Large 4 — okazuje się najszybszym sposobem, aby zobaczyć, co faktycznie wnosi wersja zapoznawcza.

Specyfikacja, obok siebie

Dane odczytane 6 października — Mistrala z jego własnego ogłoszenia i karty modelu, DeepSeeka z jego aktualnego wpisu w katalogu:

• Parametry całkowite vs aktywne — 1,05 bln całkowitych / 49 mld aktywnych vs 1,6 bln całkowitych / 49 mld aktywnych

• Modalności — tekst i obraz na wejściu, tekst na wyjściu vs tylko tekst

• Okno kontekstowe — 1 mln zadeklarowany przez Mistral, 524 288 w konfiguracji testowanej przez Artificial Analysis, w porównaniu z 1 mln obsługiwanym

• Limit wyjściowy — nie opublikowano dla wersji zapoznawczej vs 384 tys. tokenów

• Cena za milion, wejście / wyjście — 1,36 / 4,18 USD (cena katalogowa), obecnie 0,68 / 2,09 USD w promocji, w porównaniu z 0,66 / 1,98 USD

Wejście z pamięci podręcznej za milion: 0,14 USD, obecnie 0,07 USD, w porównaniu z 0,022 USD

• Wagi — obiecane na koniec października, licencja nienazwana vs dostępna teraz

• Infrastruktura treningowa — 3800 GPU NVIDIA Grace Blackwell we własnych europejskich centrach danych Mistrala w porównaniu z własnym klastrem DeepSeek

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid in which 'Mistral Large 4' appears at version v26.10 described as 'A state-of-the-art, open-weight, general-purpose multimodal model', with no licence badge, next to a Mistral Large 3 card at v25.12 that carries an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible.

Symetria liczby 49B aktywacji to główny nagłówek, a zarazem pułapka. Parametry aktywne decydują o tym, ile kosztuje wygenerowanie tokena; parametry całkowite decydują o tym, co model wie. 1,6T DeepSeeka wobec 1,05T Mistrala oznacza, że DeepSeek ma około 50% więcej pojemności na każdy obliczony token — prawdziwą przewagę w pracy wymagającej dużej wiedzy i żadnej przewagi w zadaniach, w których wąskim gardłem jest podążanie za instrukcjami lub korzystanie z narzędzi.

Co mówi niezależny indeks

Oba modele mają strony w Artificial Analysis, co czyni to jednym z nielicznych porównań w serii, w których obie strony są mierzone na tej samej platformie testowej. Intelligence Index v4.3, odczyt z 6 października:

• Indeks Inteligencji — 38,4 dla Mistral Large 4 Preview w porównaniu z 36,0 dla DeepSeek V4 Pro 0813

• Koszt na zadanie indeksowania — 1,13 USD vs 0,67 USD

• Terminal-Bench 4.0 — 26,8% vs 14,1%

• Ostatni egzamin ludzkości — 35,0% vs 41,0%

• AutomationBench, przepływy pracy biznesowe — 59,9% vs 56,7%

• τ²-Bench, agentowe użycie narzędzi — nie opublikowano dla wersji zapoznawczej vs 96,2%

• SciCode — 54.2% vs 51.0%

To znacznie bardziej wyrównany wyścig, niż sugerują metki cenowe, a rozbieżności niosą informację, a nie są szumem. Mistral Large 4 wygrywa w wierszu kodowania agentowego o prawie trzynaście punktów, a w wierszu automatyzacji przepływów pracy minimalnie, podczas gdy DeepSeek V4 Pro wygrywa w kategorii wiedzy otwartej o sześć punktów i kosztuje o 40% mniej na zadanie. Warto też zauważyć, że indeks rozkłada koszty na odczyty z pamięci podręcznej, zapisy do pamięci podręcznej, tokeny rozumowania i tokeny odpowiedzi — pamięć podręczna Mistrala ma 90% zniżki, a DeepSeek – 97%, dlatego dwa modele o podobnych stawkach katalogowych osiągają 1,13 USD i 0,67 USD na ukończone zadanie.

A generated two-column scoreboard titled 'Mistral Large 4 vs DeepSeek V4 Pro — the scoreboard'. Left column 'Mistral Large 4 Preview': total and active params 1.05T / 49B; Intelligence Index v4.3 38.4; Terminal-Bench 4.0 26.8%; AutomationBench 59.9%; modalities text and image in; weights promised end of October. Right column 'DeepSeek V4 Pro': total and active params 1.6T / 49B; Intelligence Index v4.3 36.0; Terminal-Bench 4.0 14.1%; AutomationBench 56.7%; modalities text only; weights open and available now.

Gdzie DeepSeek V4 Pro już zwyciężył

Decydująca różnica nie tkwi w benchmarku. Polega ona na tym, że DeepSeek V4 Pro ma dziś otwarte wagi, a Mistral Large 4 to wersja zapoznawcza udostępniana z własnego klastra producenta. Mistral twierdzi, że wagi pojawią się pod koniec października — to zobowiązanie, nie artefakt. Jego organizacja na Hugging Face, sprawdzona 6 października, nie zawiera nic nowszego niż z lipca. Dopóki nie pojawi się repozytorium z plikiem licencji, argument o samodzielnym wdrażaniu, który wysuwa Mistral, należy do DeepSeek.

Druga różnica to szerokość dostępności. DeepSeek V4 Pro jest dostępny w routingu od kwietnia i jest — z dużą przewagą — najczęściej używanym modelem w naszym własnym katalogu: 1,13 miliarda tokenów w ciągu ostatnich siedmiu dni w momencie pisania, w porównaniu z dziesiątkami milionów, które przepuszcza typowy model frontier. Ten wolumen ma dla kupującego znaczenie, którego nie ma ranking: oznacza, że tryby awarii są znane, charakterystyka przepustowości jest znana, a dostawcy obsługujący ten model zostali przetestowani pod obciążeniem przez cudzy ruch produkcyjny.

DeepSeek wygrywa także w nudnych szczegółach technicznych. Limit wyjściowy 384K w porównaniu z niepublikowanym, kontekst 1M realnie obsługiwany, a nie tylko deklarowany, oraz zakres wyłącznie tekstowy, który czyni przepustowość długiego kontekstu przewidywalną. Jeśli Twoim obciążeniem jest analiza dokumentów, generowanie długich tekstów lub ekstrakcja wymagająca dużej wiedzy z ponad miliona tokenów, DeepSeek V4 Pro jest tańszy, bardziej otwarty i lepiej sprawdzony niż Mistral preview pod każdym względem.

Gdzie Mistral Large 4 jest lepszym wyborem

Mistral starannie wybrał wiersze, które poddaje benchmarkom, a luka w kodowaniu nie jest kosmetyczna. 26,8% wobec 14,1% w Terminal-Bench 4.0 to mniej więcej dwa razy więcej i pokrywa się z twierdzeniem Mistrala o 61,7% na DeepSWE v1.1 oraz 59,4% na SWE-Atlas-QnA — liczbami, które, jak twierdzi, Artificial Analysis oceniło prywatnie przed publiczną premierą tego harnessu, dlatego nie ma ich jeszcze w publicznym indeksie. Kiedy te wyniki się pojawią — albo i nie — rozstrzygną kwestię kodowania.

Multimodalność to drugi wyraźny punkt podziału. Mistral Large 4 natywnie przyjmuje obrazy, z dedykowanym enkoderem wizyjnym o 1,6 mld parametrów, a Mistral twierdzi, że ma najnowocześniejsze ugruntowanie wizualne wśród otwartych modeli — podając 42% wobec 41% GPT-6 Astra na Dense 200. DeepSeek V4 Pro obsługuje wyłącznie tekst, a jego karta katalogowa mówi o tym wprost. Każdy potok przetwarzania obejmujący zrzuty ekranu, rysunki techniczne, zeskanowane dokumenty urzędowe lub odczytywanie wykresów ma tutaj jednego kandydata, a nie dwóch.

A potem jest cyber, gdzie twierdzenie Mistrala jest ostrzejsze niż cokolwiek, co opublikował DeepSeek: 82% w teście Artificial Analysis Cyber Index, który wymaga od modelu odtworzenia prawdziwej luki i jej załatania, określane jako najwyższy wynik wśród wszystkich modeli, oraz 93% w ćwiczeniach konkursowych Cybench. To liczby przytaczane przez dostawcę i należy je tak oznaczyć — ale opierają się na niezależnym indeksie, a nie opublikowano żadnego porównywalnego wyniku DeepSeeka. Jeśli chodzi o pracę związaną z bezpieczeństwem, uczciwe stanowisko jest takie, że Mistral Large 4 twierdzi, że ma przewagę, której nie wykazano jako fałszywej.

Ostatnim wyróżnikiem jest kwestia jurysdykcji. Mistral wytrenował model na 3800 układach GPU Grace Blackwell we własnych europejskich centrach danych i tam udostępnia wersję zapoznawczą, a całe wdrożenie europejskie jest obsługiwane od początku do końca zgodnie z europejskim prawem. Dla europejskiego regulowanego nabywcy, którego alternatywą jest chiński model o otwartych wagach albo amerykański model zamknięty, to kategoria sama w sobie.

Cennik, właściwie odczytany

Cena katalogowa żadnego z modeli to nie cała historia. Wpis katalogowy DeepSeek V4 Pro zawiera dwa okna czasowe — 01:00–04:00 i 06:00–10:00 UTC — w których podana stawka jest mnożona, więc obciążenie trafiające w te godziny kosztuje dwa razy więcej niż stawka nagłówkowa. Stawki 0,68 USD / 2,09 USD dla Mistral Large 4 to promocja startowa w porównaniu z cennikiem 1,36 USD / 4,18 USD; promocja to cena obowiązująca dzisiaj, a cennik to cena, według której należy modelować swój rachunek.

Tam, gdzie OrcaRouter to rozwiązuje, jest przekazywanie kosztów: 0% marży na ceny katalogowe dostawców, co oznacza, że obniżka ceny u dostawcy staje się Twoją obniżką tego samego dnia, a stawka promocyjna dostawcy jest przekazywana dalej, a nie pochłaniana. DeepSeek V4 Pro można kierować już dziś zajednym punktem końcowym zgodnym z OpenAI, w stawce jego dostawcy, przy użyciu tych samych danych uwierzytelniających co ponad 200 innych modeli, z automatycznym przełączaniem awaryjnym między dostawcami, gdy jeden z nich zawodzi. Mistral Large 4 nie znajduje się w naszym katalogu — wersja zapoznawcza jest dostępna przez własne API Mistrala oraz kilka platform zewnętrznych — więc jeśli chcesz dziś uruchomić obie strony tego porównania naraz, oznacza to jedną trasę po naszej stronie i jedną bezpośrednio.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, showing the model identity, a 1M-token context window, a 384K maximum output, text-only input with text output, the 2026-04-24 release date, a p-50 time-to-first-token figure of 2.23 seconds, pricing of $0.66 per million input and $1.98 per million output, and a code sample using the api.orcarouter.ai base URL. The page describes the model as a 1.6T-total, 49B-active flagship MoE with a 1,048,576-token context and 384,000-token maximum output that is text-only.

Który wybrać

Jeśli potrzebujesz wag, które możesz trzymać w rękach, 384K wyników, miliona tokenów obsługiwanego kontekstu, najniższego kosztu na ukończone zadanie w tej parze i modelu, którego zachowanie inni już złamali w produkcji, DeepSeek V4 Pro nie jest kompromisem — to gotowy produkt w porównaniu ze zwiastunem. To właściwy domyślny wybór do pracy z dokumentami, wiedzą i długimi formami, a jego otwarte wagi oznaczają, że pułap tego, co możesz z nim zrobić, wyznacza twoja własna infrastruktura, a nie mapa drogowa dostawcy.

Jeśli Twoje obciążenie to kodowanie agentowe, jeśli obejmuje obrazy, jeśli obejmuje prace związane z bezpieczeństwem albo jeśli jurysdykcja europejska jest wymogiem, a nie preferencją, Mistral Large 4 to model wart ryzyka związanego z wersją preview — a to ryzyko jest ograniczone, ponieważ Mistral zobowiązał się do udostępnienia wag i do okna red-teamingu z podanym terminem zakończenia. Skieruj teraz na niego część ruchu, pozostaw DeepSeek V4 Pro na resztę i pozwól, by oba rozstrzygnęły kwestię architektury na Twoich danych. Budżet aktywacji 49B będzie wyglądał tak samo z obu stron; różni się wszystko wokół niego.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie