Wygenerowana karta tytułowa do artykułu „Mistral Large 4 vs Gemini 3.1 Pro”, przedstawiająca tytuł pogrubioną geometryczną czcionką bezszeryfową, pod nim podtytuł „Osiem miesięcy, dwa kierunki”, a nad nim rząd trzech płaskich ikon liniowych — stronę kalendarza, okno terminala i ramkę obrazu — na białym tle z niebiesko-cyjanowymi akcentami gradientowymi oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Mistral Large 4 vs Gemini 3.1 Pro: Osiem miesięcy, dwa kierunki

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Gemini 3.1 Pro jest na rynku od 19 lutego 2026 r. i wciąż plasuje się w czołówce każdej szerokiej tabeli możliwości, w tym tych, w których porównuje się go z modelami wydanymi tej jesieni. Mistral Large 4 ma co najwyżej trzy tygodnie — wersja zapoznawcza zapowiedziana 6 października 2026 r., a jego wagi obiecano na koniec października; nie wskazano licencji. W Intelligence Index Artificial Analysis, odczytanym 6 października, ośmiomiesięczny Gemini 3.1 Pro uzyskuje 29,7 wobec 38,4 nowego modelu. To uczciwy punkt wyjścia dla tego porównania i zarazem przeciwieństwo tego, co sugerują daty premiery.

Wyjaśnienie nie jest tajemnicze. Gemini 3.1 Pro to flagowy model z linii preview, którego Google nigdy nie przeniosło do stabilnego wydania, a strona Artificial Analysis mu poświęcona jest oznaczona jako „Gemini 3.1 Pro Preview” — ta sama strona, na której niższy indeks sąsiaduje z czołowym wynikiem GPQA Diamond. To model zbudowany pod szerokość: bardzo duże okno kontekstu, szeroki zestaw modalności i rozumowanie, które jest mocne w pytaniach wiedzowych. Mistral Large 4 został zbudowany pod zupełnie inną mapę świata i jest odpowiednio wyceniony.

Czym jest każdy z nich

Gemini 3.1 Pro to flagowy multimodalny model rozumujący Google, o identyfikatorze API gemini-3.1-pro-preview, z oknem kontekstowym 1 048 576 tokenów i górnym limitem wyjścia 65 536 tokenów. Obsługuje tekst, obrazy, wideo, audio i pliki. Jest udostępniany w katalogu OrcaRouter w cenach Google. Dokumentacja Google nie wymienia żadnej wersji Gemini 3.1 Pro innej niż preview; to właśnie nazwa preview jest produktem.

Mistral Large 4 to rzadki model typu mixture-of-experts o 1,05 biliona parametrów, z 49 miliardami aktywnych parametrów i dedykowanym enkoderem wizyjnym o 1,6 miliarda parametrów, oferowany jako „Mistral Large 4 Preview” pod identyfikatorem API mistral-large-4-0. Dokumentacja Mistrala podaje okno kontekstu wynoszące 1 mln tokenów; Artificial Analysis odczytuje 524 288 w testowanej przez siebie konfiguracji. Maksymalna długość danych wyjściowych nie została opublikowana. Mistral opisuje go jako swój największy i najbardziej zaawansowany model do tej pory i twierdzi, że wagi pojawią się pod koniec października.

Liczby wraz z dołączoną do nich proweniencją

Oba modele mają niezależne strony, więc poniższe porównanie dotyczy tego samego stanowiska testowego, a nie porównania producentów:

• Indeks Inteligencji v4.3 — Mistral Large 4 Preview 38,4 vs Gemini 3.1 Pro 29,7

• Koszt na zadanie indeksowania — 1,13 USD vs 1,30 USD

• Rozumowanie na długim kontekście — 81,3% vs 82,0%

• GPQA Diamond — nie opublikowano dla wersji zapoznawczej vs 94,1%

• Humanity's Last Exam — 35,0% vs 47,0%

• Terminal-Bench 4.0 — 26,8% vs 4,0%

• SciCode — 54,2% vs 58,7%

• AutomationBench, przepływy pracy biznesowe — 59,9% vs 35,4%

• MMMU-Pro, rozumowanie multimodalne — 76,4% vs 82,4%

• Okno kontekstowe — 1 mln deklarowane / 524 288 przetestowane vs 1 048 576 obsługiwane

• Górny limit wyjścia — nie podano vs 65 536 tokenów

• Cena za milion, wejście / wyjście — cena katalogowa: 1,36 USD / 4,18 USD, promocyjna: 0,68 USD / 2,09 USD, w porównaniu z 2,00 USD / 12,00 USD poniżej 200 tys. tokenów i 4,00 USD / 18,00 USD powyżej

• Wagi — obiecane, licencja nienazwana, vs własnościowa

A generated two-column scoreboard titled 'Mistral Large 4 vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; GPQA Diamond not published; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Gemini 3.1 Pro': Intelligence Index v4.3 29.7; cost per index task $1.30; Terminal-Bench 4.0 4.0%; GPQA Diamond 94.1%; MMMU-Pro 82.4%; AutomationBench 35.4%.

Najbardziej uderzającym wierszem jest Terminal-Bench 4.0. Gemini 3.1 Pro uzyskuje 4,0% — to nie literówka i nie halucynacja w tabeli: odzwierciedla to model z lutego uruchomiony na harnessie agenta terminalowego, który powstał później. 26,8% Mistrala Large 4 to sześć razy wyższy wynik w tym samym teście. Każdy, kto wykluczył Gemini na podstawie starego wyniku z kodowania agentowego, powinien wziąć je ponownie pod uwagę na podstawie jego GPQA Diamond, a każdy, kto wykluczył Mistrala na podstawie pozycji w indeksie, powinien najpierw spojrzeć na wiersz terminala.

Gdzie Gemini 3.1 Pro wciąż ma lepsze karty

Wiedza i wszechstronność. Wynik 94,1% w GPQA Diamond to najwyższy wynik w całym tym artykule, po obu stronach, i jest to benchmark naukowy na poziomie absolwenckim — nie wynik, do którego model dochodzi samym gadaniem. Humanity's Last Exam na poziomie 47,0% wobec 35,0% oraz wynik SciCode, który minimalnie wyprzedza nowego gracza, mówią to samo. Jeśli Twoje zadanie polega na dokładnym odpowiadaniu na trudne pytania na podstawie korpusu wiedzy, Gemini 3.1 Pro pozostaje mocniejszym modelem osiem miesięcy po premierze.

Szerokość modalności to druga zaleta. Gemini 3.1 Pro obsługuje wideo i audio, a także tekst i obrazy. Mistral Large 4 obsługuje tekst i obrazy. Jeśli Twój potok danych przyjmuje nagrania spotkań, nagrania ekranu lub dźwięk z czujników, tylko jeden model tutaj może zobaczyć całe dane wejściowe.

Trzecia kwestia to limit wyjściowy. 65 536 tokenów to opublikowany, gwarantowany limit; Mistral nie opublikował żadnego dla wersji preview. Nic w poście o premierze nie ma większych szans ugryźć cię w produkcji niż nieujawniony limit wyjściowy.

Okno kontekstu Gemini jest rzeczywiście obsługiwane na poziomie 1 048 576 tokenów, podczas gdy 1M Mistrala to wartość podana przez dostawcę wobec niezależnie odczytanych 524 288. W przypadku obciążenia, które działa na samym końcu okna, różnica między wartością deklarowaną a zmierzoną oznacza przepisanie.

Gdzie Mistral Large 4 zmienia decyzję

Praca agentowa, a konkretnie wszystko, co dotyczy terminala, to obszar, w którym oba modele przestają być porównywalne. Własny wpis Mistrala ogłaszający premierę łączy 61,7% w DeepSWE v1.1, 59,4% w SWE-Atlas-QnA i 28,3% w Terminal-Bench 4.0 w Coding Agent Index wynoszący 49,8% i wprost stwierdza, że uplasował się przed DeepSeek V4 Pro 0813 i Qwen3.8 Max w tym łączonym pomiarze. Te trzy liczby to, jak ujmuje to Mistral, wyniki, które Artificial Analysis oceniła prywatnie, zanim jej środowisko testowe stało się publiczne; nie ma ich jeszcze w publicznym indeksie i do czasu, gdy się tam pojawią, należy je oznaczać jako opublikowane przez dostawcę.

Niezależne dowody wskazują na to samo. W AutomationBench — 657 biznesowych przepływów pracy obejmujących Gmail, Sheets, Slack i Salesforce — Mistral Large 4 uzyskuje 59,9%, wyprzedzając Kimi K3, MiMo-V2.6-Pro i DeepSeek V4 Pro, a w tym samym środowisku testowym Gemini 3.1 Pro nie pojawia się wcale, ponieważ benchmark powstał później niż on. Ślepe badanie z udziałem ludzi przeprowadzone przez Surge AI oceniło Mistral Large 4 Preview na drugim miejscu wśród pięciu modeli pod względem jakości kodowania, z wynikiem 3,74 — przed GLM-5.3 i Kimi K3, a ustępując jedynie Claude Opus 5.

Twierdzenie dotyczące cyberbezpieczeństwa jest najostrzejsze we wpisie Mistrala i warto je przytoczyć dokładnie: 82% w teście Artificial Analysis Cyber Index, który polega na tym, że model ma odtworzyć rzeczywistą lukę, a następnie ją załatać, opisywane jako najwyższy wynik spośród wszystkich modeli, plus 93% w 40 ćwiczeniach konkursowych Cybench oraz zapewnienie Mistrala, że plasuje się w globalnej pierwszej piątce w ogólnym rankingu Cyber Index, jednocześnie przewodząc modelom z otwartymi wagami rozwijanym poza Chinami. To liczby cytowane przez dostawcę na niezależnym indeksie. Ich praktyczna przewaga polega na tym, że Mistral zbudował model, aby wykonywał tę pracę, a nie odmawiał jej wykonania.

Najtańsza pozycja w tabeli również należy do Mistrala, ale tylko nieznacznie: 1,13 USD za zadanie wobec 1,30 USD — przewaga 13%, którą daje stawka promocyjna, a którą cennik zniwelowałby. Gemini 3.1 Pro to model z 2026 r. w cenach z 2026 r. i uruchomienie na nim zadania indeksowania nie jest drogie.

Rozstrzygnięcie, którego nikt nie benchmarkuje

W grze są dwie rzeczy, których tabele nie pokazują. Pierwszą z nich jest licencjonowanie. Gemini 3.1 Pro jest własnościowy i taki pozostanie; Mistral Large 4 to wersja zapoznawcza, której cały sens polega na tym, że staje się artefaktem do pobrania, który możesz uruchomić zgodnie z własnymi zasadami, na własnym sprzęcie, zgodnie z prawem europejskim — Mistral wytrenował go na 3800 procesorach graficznych Grace Blackwell we własnych centrach danych i tam udostępnia tę wersję zapoznawczą. Ten argument nie jest niczego wart, dopóki nie pojawi się repozytorium, a licencja nie będzie miała nazwy. Będzie wart bardzo wiele w dniu, w którym to nastąpi.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid with 'Mistral Large 4' listed at v26.10 as 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 carrying an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible.

Drugim jest ryzyko operacyjne. Wersja zapoznawcza, która wciąż jest dopracowywana, będzie się zmieniać pod twoimi stopami. W OrcaRouter obie strony tego porównania są osiągalne przez jeden punkt końcowy zgodny z OpenAI, po cenach katalogowych dostawcy z 0% narzutu — Gemini 3.1 Pro jest już dostępny w katalogu w cenach Google, natomiast do Mistral Large 4 trzeba się dostać przez własne API Mistrala i kilka platform zewnętrznych, ponieważ nie jest to trasa, którą obsługujemy. Przydatnym elementem jest tutaj DSL routingu: wysyłaj klasyfikację i ekstrakcję do tego modelu, który w danym tygodniu jest tańszy, eskaluj pozostałe trudne przypadki i pozwól, aby automatyczne przełączanie awaryjne pochłaniało złe dni wersji zapoznawczej, zamiast żeby pochłaniała je twoja rotacja dyżurów.

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the preview model identity, a 1M-token context window, a 65K maximum output, inputs of audio, file, image, text and video with text output, the 2026-02-19 release date, a p-50 time-to-first-token figure of 10.00 seconds, pricing of $2.00 per million input and $12.00 per million output, and a code sample against the api.orcarouter.ai base URL.

Werdykt

Zapytaj, jakie jest obciążenie, a nie który model jest lepszy. W przypadku pracy opartej na wiedzy, wejścia audio i wideo, gwarantowanego pułapu wyjściowego i serwowanego okna miliona tokenów, Gemini 3.1 Pro jest nadal silniejszym modelem, a jego wiek nie jest wadą — to osiem miesięcy, w których inni odkrywali jego granice. W przypadku kodowania agentowego, pracy w terminalu i operacji bezpieczeństwa, Mistral Large 4 wyprzedza o margines na tyle szeroki, że pozycja w indeksie jest myląca, i jest jedynym z dwóch, który może ostatecznie nadawać się do samodzielnego hostowania.

Rozstrzygnięcie, na które warto zwrócić uwagę, to koniec października. Jeśli wagi pojawią się na licencji permisywnej, Mistral Large 4 przestaje konkurować z Gemini 3.1 Pro ceną, a zaczyna konkurować z nim pod względem kontroli — a to inna walka. Jeśli pojawią się na licencji restrykcyjnej, odpowiedź zawarta w tym artykule niewiele się zmienia — ale powód już tak.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie