Wygenerowana karta tytułowa artykułu „Mistral Large 4 vs Claude Opus 5” przedstawiająca tytuł pogrubioną geometryczną czcionką bezszeryfową, pod nim podtytuł „Luka jest mniejsza niż różnica w cenie”, a nad nim rząd trzech płaskich ikon liniowych — dwa słupki o nierównej wysokości, metkę cenową i ludzką skalę ocen — na białym tle z niebiesko-cyjanowymi akcentami gradientowymi i logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Mistral Large 4 vs Claude Opus 5: Przepaść jest mniejsza niż różnica w cenie

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Jedyny bezpośredni wynik, jaki ktokolwiek opublikował w starciu Mistral Large 4 z Claude Opus 5pochodzi ze ślepej oceny ludzkiej i jest bliższy, niż sugerują tabele benchmarków. Surge AI ukryło tożsamość modeli i poprosiło profesjonalnych adnotatorów o ocenę wyników generowania kodu w skali 1–5; Claude Opus 5 zajął pierwsze miejsce z wynikiem 4,22, a Mistral Large 4 Preview drugie z 3,74, wyprzedzając Kimi K3, GLM-5.3 i GLM-5.2. W niezależnym agregacie te dwa modele wcale nie są sąsiadami — 50,8 przeciwko 38,4 w Intelligence Index Artificial Analysis, odczyt z 6 października. To, co sprawia, że to zestawienie jest warte poświęcenia popołudnia, to fakt, że koszt wykonania zadania na modelu z wynikiem o 12 punktów niższym jest około pięciokrotnie niższy.

W przypadku obu tych wartości trzeba podać ich pochodzenie, ponieważ nie są to liczby tego samego rodzaju. Ewaluacja Surge AI to badanie z udziałem ludzi przeprowadzone przez stronę trzecią, które Mistral zlecił i opublikował — silniejsza forma dowodu niż samodzielnie przeprowadzony benchmark, a jednocześnie badanie, którego publikację kontrolował Mistral. Wyniki indeksu pochodzą z testów przeprowadzonych samodzielnie przez Artificial Analysis, są porównywalne ze sobą i dlatego to właściwa para, na której należy opierać wnioskowanie. Żadna z nich nie mówi, na którym modelu budować; razem wyznaczają ramy tego pytania.

Dwa produkty, a nie dwie generacje jednego

Claude Opus 5 to flagowy model producenta o zamkniętych wagach, wydany 24 lipca 2026 r., udostępniany z oknem kontekstowym 1 mln tokenów i do 128 tys. tokenów wyjściowych, w cenie 5 USD za milion tokenów wejściowych i 25 USD za milion tokenów wyjściowych, przy odczytach z pamięci podręcznej po 0,50 USD. To najzdolniejszy model producenta w linii Opus, pozycjonowany wprost do długoterminowej pracy agentowej — zachowujący spójność w wieloetapowych sesjach z intensywnym użyciem narzędzi.

Mistral Large 4 to wersja zapoznawcza ogłoszona 6 października 2026 r., którą Mistral opisuje jako rzadki model typu mixture-of-experts o 1,05 biliona parametrów, z 49 miliardami aktywnych parametrów i 1,6-miliardowym enkoderem wizyjnym. Jego identyfikator API to mistral-large-4-0, jest natywnie multimodalny, a dokumentacja Mistrala podaje okno kontekstowe wynoszące 1 mln tokenów, podczas gdy Artificial Analysis odczytuje 524 288 w testowanej przez siebie konfiguracji. Wagi obiecano na koniec października, a licencja nie została nazwana.

A więc to nie jest nowszy model przeciw starszemu. To własnościowy model czołowy przeciw pretendentowi, który ma mieć otwarte wagi, a ceny obu są odpowiednio ustalane.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid in which 'Mistral Large 4' is listed at version v26.10 with the description 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 that does carry an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible, with the OCR MODELS section starting below.

Ten sam indeks, oba modele

Odczytane 6 października z ich stron Artificial Analysis, w Intelligence Index v4.3:

• Indeks Inteligencji — Mistral Large 4 Preview 38,4 vs Claude Opus 5 50,8

• Koszt na zadanie indeksowania — 1,13 USD dla Mistral Large 4 Preview vs 5,86 USD dla Claude Opus 5

• Terminal-Bench 4.0 — 26,8% vs 49,0%, największa pojedyncza różnica między nimi

• Humanity's Last Exam — 35,0% vs 54,9%

• MMMU-Pro, rozumowanie multimodalne — 76,4% vs 84,7%

• AutomationBench, przepływy pracy biznesowe — 59,9% vs 56,6%, jedyny wiersz, w którym prowadzi Mistral Large 4

• Okno kontekstu — 1 mln deklarowane przez Mistral i 524 288 w testowanej konfiguracji, a 1 mln w wersji serwowanej

• Limit wyjściowy — nie podano dla wersji zapoznawczej vs 128K tokenów

• Cena za milion, wejście / wyjście — 1,36 / 4,18 USD cennikowo, obecnie 0,68 / 2,09 USD w promocji, wobec 5,00 / 25,00 USD

A generated two-column scoreboard titled 'Mistral Large 4 vs Claude Opus 5 — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; Humanity's Last Exam 35.0%; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Claude Opus 5': Intelligence Index v4.3 50.8; cost per index task $5.86; Terminal-Bench 4.0 49.0%; Humanity's Last Exam 54.9%; MMMU-Pro 84.7%; AutomationBench 56.6%.

Wzorzec jest czytelny. Opus 5 jest lepszy w dwóch najtrudniejszych, wymagających rozumowania kategoriach — pracy w terminalu i wiedzy otwartej — a także lepszy w rozumieniu multimodalnym, mimo że to Mistral Large 4 jest modelem sprzedawanym za swoje możliwości wizyjne. Mistral Large 4 prowadzi w kategorii automatyzacji przepływów pracy, czyli tej najbliższej temu, o co jednostka biznesowa faktycznie prosi model, i robi to przy jednej piątej ceny za zadanie.

Gdzie Mistral Large 4 naprawdę wygrywa

Najciekawsze twierdzenie w poście Mistrala o premierze nie jest wynikiem benchmarku. Jest nim to, że w jednym z testów Artificial Analysis Cyber Index — odtworzyć rzeczywistą podatność w oprogramowaniu open source, a następnie ją załatać — Mistral Large 4 osiąga 82%, co ma być najwyższym wynikiem spośród wszystkich modeli, a kilka wiodących modeli zamkniętych osiąga niemal zero w tym samym teście, ponieważ odmawiają wykonania zadania. Mistral wymienia Claude Opus 5.5 i GPT-6 Astra jako przykłady takiej odmowy.

To interpretacja dostawcy dotycząca przytoczonej przez dostawcę wartości i tak należy ją odczytywać. To również realna różnica operacyjna, jeśli się utrzyma: model, który nie odtworzy luki, nie może zostać użyty do wykazania, że jest ona rzeczywista, co jest pierwszym krokiem większości procesów reagowania na incydenty. Mistral zestawia te 82% z wynikiem 93% w 40 ćwiczeniach konkursowych Cybench oraz kontrtwierdzeniem, że jego wskaźnik odmów w przypadku promptów dotyczących cyberbezpieczeństwa zaczerpniętych z JailbreakBench, StrongREJECT i AgentHarm jest wyższy niż w innych modelach o otwartych wagach — argument jest taki, że chce się mieć zdolność i dyscyplinę w tym samym modelu, a nie wymieniać jedno na drugie.

Poza cyberbezpieczeństwem argument za Mistral Large 4 opiera się na trzech rzeczach, których Opus 5 nie oferuje. Jest trenowany i udostępniany na europejskiej infrastrukturze zgodnie z europejskim prawem, co ma znaczenie dla nabywców z obowiązkami dotyczącymi rezydencji danych. Będzie można go pobrać — obiecuje Mistral — a to jest sedno całego przedsięwzięcia, ponieważ to właśnie samodzielne wdrożenie usuwa ryzyko dostępu w trakcie incydentu, które Mistral usilnie stara się opisać. Jest też wystarczająco tani w przeliczeniu na zadanie, że użycie go jako pierwszego przebiegu i eskalowanie trudnych resztek do modelu frontier jest ekonomicznie sensowne, a nie stanowi jedynie błędu zaokrągleń.

Gdzie Claude Opus 5 wciąż wart jest swojej ceny.

12-punktowa luka w indeksie nie jest mała, a obraz wiersz po wierszu mówi, gdzie ona leży. W Terminal-Bench 4.0 wynik jest niemal dwukrotnie wyższy — 49,0% wobec 26,8% — a praca w terminalu to najbliższy publiczny wskaźnik zastępczy dla kodowania agentowego, a to jest w tym roku główny powód, dla którego zespoły kupują modele frontier. Humanity's Last Exam dzieli je różnicą 20 punktów. Jeśli chodzi o autonomię długiego horyzontu, projekt adaptacyjnego rozumowania Opus 5, jego limit wyjściowy 128K i udostępniany kontekst 1M to konfiguracja, której chcesz, jeśli Twoje obciążenie to wielogodzinna sesja agentowa, a nie pojedyncze trudne pytanie.

Limit długości odpowiedzi to cichsza różnica. Mistral nie opublikował maksymalnej długości odpowiedzi dla wersji preview, a 128K w Opus 5 to prawdziwe zniesienie ograniczeń przy generowaniu kodu i długich dokumentów o strukturze. Jeśli Twój pipeline generuje pliki, a nie odpowiedzi, sprawdź tę liczbę, zanim przejdziesz, bo to luka, która ujawnia się dopiero na produkcji.

Koszt na zadanie to liczba, której należy się trzymać

Ceny za token schlebiają tanim modelom i wprowadzają w błąd w przypadku drogich. Własny koszt indeksu przypadający na zadanie — całkowity wydatek na ukończenie jednego zadania ewaluacyjnego, z pamięcią podręczną włącznie — to liczba, która przetrwa zderzenie z budżetem: 1,13 USD wobec 5,86 USD.

To nie jest licencja na przeniesienie wszystkiego do tańszego modelu, bo zadanie, którego tani model nie wykona, to zadanie, za które płacisz dwa razy. To licencja na to, by przestać traktować jeden model frontierowy jako jedyną opcję. W OrcaRouterClaude Opus 5 znajduje się w katalogu w cenie z cennika dostawcy z 0% marży, w tym samym punkcie końcowym zgodnym z OpenAI co ponad 200 innych modeli, i właśnie dzięki temu potok dwumodelowy to praca na jedno popołudnie, a nie drugi kontrakt z dostawcą. Mistral Large 4 nie ma dziś w katalogu — do wersji zapoznawczej można dotrzeć przez własne API Mistrala i kilka platform firm trzecich. Gdy jego wagi się pojawią i jakiś dostawca zacznie go hostować, obowiązuje ta sama zasada przekazywania kosztów: ile pobiera dostawca, tyle płacisz, a obniżka ceny dostawcy pojawi się na twoim rachunku jeszcze tego samego dnia.

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the model identity, a 1M-token context window, a 128K maximum output, input modalities of text, image and file with text output, the pre-October-2026 release date, a p-50 time-to-first-token figure of 4.82 seconds, pricing of $5.00 per million input and $25.00 per million output, and an OpenAI-compatible code sample pointing at the api.orcarouter.ai base URL.

W przypadku niesprawdzonej wersji zapoznawczej najważniejszą funkcją routingu jest przełączanie awaryjne. Wysyłanie części ruchu produkcyjnego do Mistral Large 4, podczas gdy Opus 5 obsługuje resztę, sprawia, że regresja zamienia się w przekierowanie, a nie w awarię, a prawdziwe tryby awarii modelu poznajesz na własnych danych, a nie na tabeli rankingowej.

Co rozwiązuje to w ciągu trzech tygodni?

Trzy fakty wciąż pozostają otwarte i każdy z nich zmienia odpowiedź. Jeśli wagi pojawią się na permisywnej licencji, Mistral Large 4 staje się jedynym modelem z tej pary, który można hostować samodzielnie, a kalkulacja dla regulowanych nabywców przechyla się mocno. Jeśli promocyjne ceny 0,68 USD / 2,09 USD wrócą do 1,36 USD / 4,18 USD z cennika, różnica na zadanie się zmniejszy, ale pozostanie rozstrzygająca. A jeśli Artificial Analysis przeniesie oceniane prywatnie wyniki dotyczące kodowania do swojego publicznego indeksu bez zmian, historia kodowania staje się zweryfikowana przez stronę trzecią, a nie publikowana przez dostawcę w imieniu strony trzeciej.

Do tego czasu: Opus 5 to bezpieczny domyślny wybór produkcyjny i wart swojej wielokrotności w pracy agentowej oraz mocno terminalowej. Mistral Large 4 to interesujący zakład — wystarczająco tani na zadanie, by działać obok niego, wystarczająco zdolny w automatyzacji i cyberbezpieczeństwie, by już dziś zdobywać ruch, i niosący obietnicę samodzielnego wdrożenia, której żaden zamknięty model w tym porównaniu nie dorówna.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie