Eine generierte Titelkarte für den Artikel 'Mistral Large 4 vs Claude Opus 5', die den Titel in fettgedruckter geometrischer Sans-Serif-Schrift zeigt, darunter den Untertitel 'Die Lücke ist kleiner als die Preislücke', und darüber eine Reihe von drei flachen Linien-Symbolen — zwei Balken ungleicher Höhe, ein Preisschild und eine menschliche Bewertungsskala — auf weißem Hintergrund mit blau-cyanfarbenen Verlaufsakzenten und dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Mistral Large 4 vs. Claude Opus 5: Die Lücke ist kleiner als die Preislücke

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die einzige jemals veröffentlichte Direktvergleichszahl für Mistral Large 4 gegen Claude Opus 5 stammt aus einer blinden menschlichen Bewertung, und sie liegt näher beieinander, als die Benchmark-Tabellen vermuten lassen. Surge AI verbarg die Modellidentitäten und bat professionelle Annotatoren, Coding-Output auf einer Skala von 1–5 zu bewerten; Claude Opus 5 belegte mit 4,22 den ersten Platz und Mistral Large 4 Preview mit 3,74 den zweiten, vor Kimi K3, GLM-5.3 und GLM-5.2. In der unabhängigen Gesamtauswertung sind die beiden überhaupt keine Nachbarn – 50,8 gegenüber 38,4 im Intelligence Index von Artificial Analysis, Stand 6. Oktober. Was das Paar einen Nachmittag wert macht, ist, dass das Modell, das 12 Punkte niedriger abschneidet, für die Ausführung einer Aufgabe ungefähr ein Fünftel kostet.

Beiden Werten muss ihre Provenienz beigefügt werden, denn sie sind nicht die gleiche Art von Zahl. Die Evaluation von Surge AI ist eine Humanstudie eines Dritten, die Mistral in Auftrag gegeben und veröffentlicht hat – eine stärkere Form von Evidenz als ein selbst durchgeführter Benchmark und dennoch eine Studie, deren Veröffentlichung Mistral kontrollierte. Die Indexwerte sind die eigenen Durchläufe von Artificial Analysis, untereinander vergleichbar und daher das richtige Paar, von dem aus man argumentieren sollte. Keine von beiden sagt einem, auf welchem Modell man aufbauen sollte; zusammen stecken sie den Rahmen der Frage ab.

Zwei Produkte, nicht zwei Generationen eines einzigen

Claude Opus 5 ist ein Flaggschiff mit geschlossenen Gewichten des Anbieters, veröffentlicht am 24. Juli 2026, bereitgestellt mit einem Kontextfenster von 1M Token und bis zu 128K Ausgabe-Tokens, für 5 $ pro Million Eingabe- und 25 $ pro Million Ausgabe-Tokens, mit gecachten Lesezugriffen zu 0,50 $. Es ist das leistungsfähigste Modell des Anbieters in der Opus-Reihe und ist klar auf langfristige agentische Arbeit ausgerichtet — es bleibt über mehrstufige Sitzungen mit intensiver Tool-Nutzung hinweg kohärent.

Mistral Large 4 ist eine Vorschau, angekündigt am 6. Oktober 2026, die Mistral als ein Sparse-Mixture-of-Experts-Modell mit 1,05 Billionen Parametern, 49 Milliarden aktiven Parametern und einem Vision-Encoder mit 1,6 Milliarden Parametern beschreibt. Seine API-ID lautet mistral-large-4-0, es ist nativ multimodal, und Mistrals Dokumentation gibt ihm ein Kontextfenster von 1 Mio. Token, während Artificial Analysis bei der von ihm getesteten Konfiguration 524.288 ausliest. Die Gewichte sind für Ende Oktober versprochen, und die Lizenz wurde noch nicht genannt.

Es handelt sich also nicht um ein neueres Modell gegen ein älteres. Es handelt sich um ein proprietäres Frontier-Modell gegen einen künftigen Open-Weight-Herausforderer, und die beiden werden entsprechend bepreist.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid in which 'Mistral Large 4' is listed at version v26.10 with the description 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 that does carry an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible, with the OCR MODELS section starting below.

Derselbe Index, beide Modelle

Abgelesen am 6. Oktober von ihren Artificial Analysis-Seiten, auf dem Intelligence Index v4.3:

• Intelligence Index — Mistral Large 4 Preview 38,4 vs. Claude Opus 5 50,8

• Kosten pro Indexierungsaufgabe — 1,13 $ für Mistral Large 4 Preview vs. 5,86 $ für Claude Opus 5

• Terminal-Bench 4.0 — 26,8 % vs. 49,0 %, die größte einzelne Lücke zwischen ihnen

• Humanity's Last Exam — 35,0 % vs. 54,9 %

• MMMU-Pro, multimodales Schlussfolgern — 76,4 % vs. 84,7 %

• AutomationBench, Geschäftsworkflows — 59,9 % vs. 56,6 %, die einzige Zeile, in der Mistral Large 4 führt

• Kontextfenster — 1M laut Mistral und 524.288 in der getesteten Konfiguration, gegenüber 1M bereitgestellt

• Ausgabe-Obergrenze — für die Vorschau nicht veröffentlicht vs. 128K Token

• Preis pro Million, Eingabe / Ausgabe — 1,36 $ / 4,18 $ Listenpreis, derzeit 0,68 $ / 2,09 $ im Angebot, im Vergleich zu 5,00 $ / 25,00 $

A generated two-column scoreboard titled 'Mistral Large 4 vs Claude Opus 5 — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; Humanity's Last Exam 35.0%; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Claude Opus 5': Intelligence Index v4.3 50.8; cost per index task $5.86; Terminal-Bench 4.0 49.0%; Humanity's Last Exam 54.9%; MMMU-Pro 84.7%; AutomationBench 56.6%.

Das Muster ist erkennbar. Opus 5 liegt bei den beiden schwierigsten reasoning-lastigen Zeilen vorn – Terminalarbeit und offenes Wissen – und liegt beim multimodalen Verständnis vorn, obwohl Mistral Large 4 das Modell ist, das mit seiner Vision-Fähigkeit verkauft wird. Mistral Large 4 führt die Zeile Workflow-Automatisierung an, die Zeile, die dem am nächsten kommt, was ein Geschäftsbereich tatsächlich von einem Modell verlangt, und das zu einem Fünftel des Preises pro Aufgabe.

Wo Mistral Large 4 wirklich gewinnt

Die interessanteste Behauptung in Mistrals Launch-Post ist keine Benchmark-Punktzahl. Sie ist, dass Mistral Large 4 bei einem der Tests des Artificial Analysis Cyber Index – eine echte Sicherheitslücke in Open-Source-Software reproduzieren und sie dann patchen – 82 % erreicht, was der höchste Wert aller Modelle sein soll, und dass mehrere führende geschlossene Modelle bei demselben Test nahe null erreichen, weil sie die Aufgabe verweigern. Mistral nennt Claude Opus 5.5 und GPT-6 Astra als Beispiele für diese Verweigerung.

Das ist eine Anbieterinterpretation einer vom Anbieter zitierten Zahl, und so sollte sie auch gelesen werden. Es ist außerdem ein echter operativer Unterschied, wenn er zutrifft: Ein Modell, das eine Schwachstelle nicht reproduziert, kann nicht dazu verwendet werden, zu beweisen, dass eine solche real ist – was der erste Schritt der meisten Incident-Response-Abläufe ist. Mistral kombiniert die 82 % mit einem Ergebnis von 93 % bei den 40 Wettbewerbsübungen von Cybench und einer Gegenbehauptung, dass seine Ablehnungsrate bei Cyber-Prompts aus JailbreakBench, StrongREJECT und AgentHarm höher sei als die anderer Open-Weight-Modelle – mit dem Argument, dass man die Fähigkeit und die Disziplin im selben Modell haben möchte, statt das eine gegen das andere einzutauschen.

Jenseits von Cyber stützt sich das Argument für Mistral Large 4 auf drei Dinge, die Opus 5 nicht bietet. Es wird auf europäischer Infrastruktur unter europäischem Recht trainiert und betrieben, was für Käufer mit Datenresidenzpflichten wichtig ist. Es wird, verspricht Mistral, herunterladbar sein – der eigentliche Sinn der ganzen Übung, denn Self-Deployment ist genau das, was das Zugriffsrisiko mitten im Vorfall beseitigt, das Mistral mit Nachdruck beschreibt. Und es ist pro Aufgabe günstig genug, dass die Nutzung als erster Durchlauf und die Eskalation des harten Rests an ein Frontier-Modell wirtschaftlich sinnvoll ist und nicht bloß ein Rundungsfehler.

Wo Claude Opus 5 seinen Preis immer noch wert ist

Ein 12-Punkte-Indexabstand ist nicht klein, und die zeilenweise Aufschlüsselung zeigt, wo er liegt. Terminal-Bench 4.0 ist mit 49,0 % gegenüber 26,8 % nahezu doppelt so hoch – und Terminal-Arbeit ist der engste öffentliche Proxy für agentisches Coding, worauf Teams in diesem Jahr den Großteil ihrer Käufe von Frontier-Modellen ausrichten. Humanity's Last Exam trennt beide um 20 Punkte. Bei Autonomie über lange Horizonte ist Opus 5 mit seinem adaptiven Reasoning-Design, seiner Ausgabe-Obergrenze von 128K und einem bereitgestellten 1M-Kontext die Konfiguration, die Sie wollen, wenn Ihre Arbeitslast eine mehrstündige Agent-Session statt einer einzelnen schwierigen Frage ist.

Das Ausgabelimit ist der leisere Unterschied. Mistral hat für die Preview keine maximale Ausgabelänge veröffentlicht, und die 128K von Opus 5 sind ein echter Befreiungsschlag für Codegenerierung und lange strukturierte Dokumente. Wenn Ihre Pipeline Dateien statt Antworten ausgibt, prüfen Sie diese Zahl, bevor Sie wechseln, denn es ist die Art von Lücke, die erst im Produktivbetrieb sichtbar wird.

Kosten pro Aufgabe ist die Zahl, die man im Auge behalten sollte

Preise pro Token schmeicheln günstigen Modellen und sind bei teuren irreführend. Die eigenen Kosten pro Aufgabe des Index – die Gesamtausgaben, um eine Evaluierungsaufgabe abzuschließen, inklusive Cache und allem – sind die Zahl, die den Kontakt mit einem Budget übersteht: 1,13 $ gegenüber 5,86 $.

Das ist keine Lizenz, alles auf das günstigere Modell zu verlagern, denn eine Aufgabe, an der das günstige Modell scheitert, ist eine Aufgabe, für die Sie doppelt bezahlen. Es ist eine Lizenz, damit aufzuhören, ein einzelnes Frontier-Modell als die einzige Option zu behandeln. Auf OrcaRouter liegt Claude Opus 5 im Katalog zum Listenpreis des Anbieters mit 0 % Aufschlag, im selben OpenAI-kompatiblen Endpunkt wie über 200 andere Modelle, was eine Zwei-Modell-Pipeline zu einer Arbeit für einen Nachmittag macht statt zu einem zweiten Anbietervertrag. Mistral Large 4 ist heute nicht im Katalog – die Vorschau ist über Mistrals eigene API und mehrere Drittplattformen erreichbar. Wenn seine Gewichte verfügbar sind und ein Anbieter es hostet, gilt dieselbe Weitergaberegel: Was der Anbieter verlangt, wird Ihnen berechnet, und eine Preissenkung des Anbieters zeigt sich am selben Tag auf Ihrer Rechnung.

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the model identity, a 1M-token context window, a 128K maximum output, input modalities of text, image and file with text output, the pre-October-2026 release date, a p-50 time-to-first-token figure of 4.82 seconds, pricing of $5.00 per million input and $25.00 per million output, and an OpenAI-compatible code sample pointing at the api.orcarouter.ai base URL.

Für eine unerprobte Vorschau ist die wichtigste Routing-Funktion das Failover. Wenn man einen Teil des Produktionsverkehrs an Mistral Large 4 sendet, während Opus 5 den Rest übernimmt, bedeutet das, dass eine Regression zu einem Reroute statt zu einem Ausfall wird, und man lernt die echten Fehlermodi des Modells anhand der eigenen Daten statt auf einer Bestenliste kennen.

Was löst das in drei Wochen?

Drei Fakten sind noch offen, und jeder einzelne verschiebt die Antwort. Wenn die Gewichte unter einer permissiven Lizenz erscheinen, wird Mistral Large 4 das einzige Modell in diesem Paar, das Sie selbst hosten können, und das Kalkül für regulierte Käufer kippt stark. Wenn die Aktionspreise von 0,68 $ / 2,09 $ wieder auf die 1,36 $ / 4,18 $ der Preisliste zurückfallen, wird die Lücke pro Aufgabe kleiner, bleibt aber entscheidend. Und wenn Artificial Analysis die privat evaluierten Coding-Zahlen unverändert in seinen öffentlichen Index übernimmt, wird die Coding-Story von Dritten verifiziert statt vom Anbieter im Namen eines Dritten veröffentlicht.

Bis dahin: Opus 5 ist die sichere Standardwahl für den Produktionseinsatz und seinen Preisaufschlag für agentische und terminalintensive Arbeit wert. Mistral Large 4 ist die interessante Wette – pro Aufgabe günstig genug, um parallel dazu zu laufen, leistungsfähig genug in Automatisierung und Cyber, um schon heute Traffic zu verdienen, und mit dem Versprechen der Selbstbereitstellung, das kein geschlossenes Modell in diesem Vergleich erreichen kann.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert