Eine generierte Titelkarte für den Artikel „Mistral Large 4 vs Gemini 3.1 Pro“, die den Titel in fetter geometrischer serifenloser Schrift zeigt, darunter den Untertitel „Acht Monate, zwei Richtungen“, und darüber eine Reihe von drei flachen Linien-Symbolen – eine Kalenderseite, ein Terminalfenster und einen Bildrahmen – auf weißem Hintergrund mit blau- und cyanfarbenen Farbverlaufsakzenten und dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Mistral Large 4 vs. Gemini 3.1 Pro: Acht Monate, zwei Richtungen

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Gemini 3.1 Pro ist seit dem 19. Februar 2026 auf dem Markt und rangiert weiterhin in jeder breiten Leistungstabelle ganz oben, auch in denen, in denen es mit Modellen verglichen wird, die diesen Herbst veröffentlicht wurden. Mistral Large 4 ist höchstens drei Wochen alt – eine am 6. Oktober 2026 angekündigte Vorschau, wobei die Gewichte für Ende Oktober versprochen wurden und keine Lizenz genannt wurde. Auf dem Intelligence Index von Artificial Analysis, Stand 6. Oktober, erreicht das acht Monate alte Gemini 3.1 Pro 29,7 gegenüber 38,4 des Neuankömmlings. Das ist der ehrliche Ausgangspunkt für diesen Vergleich, und es ist das Gegenteil dessen, was die Veröffentlichungsdaten nahelegen.

Die Erklärung ist nicht rätselhaft. Gemini 3.1 Pro ist ein Flaggschiff der Preview-Linie, das Google nie zu einem stabilen Release befördert hat, und die Seite von Artificial Analysis dafür trägt die Bezeichnung „Gemini 3.1 Pro Preview“ – dieselbe Seite, auf der ein niedrigerer Index neben einem GPQA Diamond der Spitzenklasse steht. Es ist ein Modell, das auf Breite ausgelegt ist: ein sehr großes Kontextfenster, eine breite Modalitätspalette und Reasoning, das bei Wissensfragen stark ist. Mistral Large 4 ist auf eine völlig andere Landkarte der Welt ausgelegt und entsprechend bepreist.

Was jedes einzelne ist

Gemini 3.1 Pro ist Googles führendes multimodales Reasoning-Modell, API-ID gemini-3.1-pro-preview, mit einem Kontextfenster von 1.048.576 Token und einer Ausgabegrenze von 65.536 Token. Es akzeptiert Text, Bilder, Videos, Audio und Dateien. Es wird aus OrcaRouters Katalog zu Googles eigenen Preisen bereitgestellt. Googles Dokumentation listet kein Gemini 3.1 Pro ohne Preview auf; der Preview-Name ist das Produkt.

Mistral Large 4 ist ein sparse Mixture-of-Experts mit 1,05 Billionen Parametern, 49 Milliarden aktiven Parametern und einem dedizierten Vision-Encoder mit 1,6 Milliarden Parametern, angeboten als „Mistral Large 4 Preview“ unter der API-ID mistral-large-4-0. In der Dokumentation von Mistral wird ein Kontextfenster von 1 Mio. Token angegeben; Artificial Analysis liest 524.288 bei der Konfiguration, die getestet wird. Die maximale Ausgabe wird nicht veröffentlicht. Mistral beschreibt es als sein größtes und leistungsfähigstes Modell bis heute und sagt, dass die Gewichte Ende Oktober erscheinen.

Die Zahlen, mit ihrer Herkunft versehen

Beide Modelle haben unabhängige Seiten, daher ist der folgende Vergleich ein Vergleich im selben Testaufbau und nicht Anbieter gegen Anbieter:

• Intelligenz-Index v4.3 — Mistral Large 4 Preview 38,4 vs. Gemini 3.1 Pro 29,7

• Kosten pro Indexierungsaufgabe — 1,13 $ vs. 1,30 $

• Langkontext-Reasoning — 81,3 % vs. 82,0 %

• GPQA Diamond — nicht für die Vorschau veröffentlicht vs. 94,1%

• Humanity's Last Exam — 35,0 % vs. 47,0 %

• Terminal-Bench 4.0 — 26,8 % vs. 4,0 %

• SciCode — 54,2 % vs. 58,7 %

• AutomationBench, Geschäftsworkflows — 59,9 % vs. 35,4 %

• MMMU-Pro, multimodales Reasoning — 76,4 % vs. 82,4 %

• Kontextfenster: 1 Mio. angegeben / 524.288 getestet vs. 1.048.576 bereitgestellt

• Ausgabeobergrenze — nicht veröffentlicht vs. 65.536 Token

• Preis pro Million, Eingabe / Ausgabe — $1,36 / $4,18 Listenpreis, $0,68 / $2,09 Aktionspreis, gegenüber $2,00 / $12,00 unter 200K Token und $4,00 / $18,00 darüber

• Gewichte — versprochen, Lizenz nicht genannt, vs. proprietär

A generated two-column scoreboard titled 'Mistral Large 4 vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; GPQA Diamond not published; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Gemini 3.1 Pro': Intelligence Index v4.3 29.7; cost per index task $1.30; Terminal-Bench 4.0 4.0%; GPQA Diamond 94.1%; MMMU-Pro 82.4%; AutomationBench 35.4%.

Die mit Abstand auffälligste Zeile ist Terminal-Bench 4.0. Gemini 3.1 Pro erreicht 4,0 % – kein Tippfehler und keine Halluzination in der Tabelle: Sie spiegelt ein Modell vom Februar wider, das auf einer Terminal-Agent-Harness ausgeführt wird, die neuer ist als es. Die 26,8 % von Mistral Large 4 sind im selben Test sechsmal so hoch. Wer Gemini aufgrund einer alten Agentic-Coding-Zahl ausgeschlossen hat, sollte es aufgrund seines GPQA Diamond wieder einbeziehen, und wer Mistral aufgrund des Indexrangs ausgeschlossen hat, sollte zuerst die Terminal-Zeile ansehen.

Wo Gemini 3.1 Pro noch die besseren Karten hat

Wissen und Breite. Ein GPQA Diamond mit 94,1 % ist die höchste Zahl im gesamten Artikel, auf beiden Seiten, und es ist ein wissenschaftlicher Benchmark auf Graduierten-Niveau – keine Zahl, die ein Modell durch bloßes Gerede erreicht. Humanity's Last Exam mit 47,0 % gegenüber 35,0 % und ein SciCode-Ergebnis, das den Neuling knapp übertrifft, erzählen dieselbe Geschichte. Wenn Ihre Workload darin besteht, schwierige Fragen präzise aus einem Wissenskorpus zu beantworten, bleibt Gemini 3.1 Pro acht Monate nach der Veröffentlichung das stärkere Modell.

Die Breite der Modalitäten ist der zweite Vorteil. Gemini 3.1 Pro verarbeitet Video und Audio sowie Text und Bilder. Mistral Large 4 verarbeitet Text und Bilder. Wenn Ihre Pipeline aufgezeichnete Meetings, Bildschirmaufzeichnungen oder Sensor-Audio aufnimmt, kann nur ein Modell hier die gesamte Eingabe sehen.

Der dritte Punkt ist die Ausgabeobergrenze. 65.536 Token sind eine veröffentlichte, garantierte Obergrenze; für die Preview hat Mistral überhaupt keine veröffentlicht. Nichts in einem Launch-Post kann dir in der Produktion eher zum Verhängnis werden als ein nicht angegebenes Ausgabelimit.

Und Geminis Kontextfenster wird tatsächlich mit 1.048.576 Token bereitgestellt, während Mistrals 1 Mio. die Herstellerangabe ist, der unabhängig ausgelesene 524.288 gegenüberstehen. Für eine Workload, die am äußersten Ende des Fensters liegt, ist der Unterschied zwischen einer angegebenen und einer gemessenen Zahl ein Rewrite.

Wo Mistral Large 4 die Entscheidung verändert

Agentische Arbeit, und insbesondere alles, was ein Terminal berührt, ist der Punkt, an dem die beiden Modelle nicht mehr vergleichbar sind. Mistrals eigener Launch-Post bündelt 61,7 % bei DeepSWE v1.1, 59,4 % bei SWE-Atlas-QnA und 28,3 % bei Terminal-Bench 4.0 zu einem Coding Agent Index von 49,8 % und erklärt unmissverständlich, dass es bei diesem kombinierten Maß vor DeepSeek V4 Pro 0813 und Qwen3.8 Max lag. Diese drei Zahlen sind, in Mistrals Worten, Zahlen, die Artificial Analysis privat ausgewertet hat, bevor der Harness von Artificial Analysis öffentlich wurde; sie stehen noch nicht im öffentlichen Index und sollten als vom Anbieter veröffentlicht gekennzeichnet werden, bis sie es sind.

Unabhängige Belege deuten in dieselbe Richtung. Bei AutomationBench – 657 Geschäftsworkflows über Gmail, Sheets, Slack und Salesforce hinweg – erreicht Mistral Large 4 59,9 % und liegt damit vor Kimi K3, MiMo-V2.6-Pro und DeepSeek V4 Pro, und im selben Harness taucht Gemini 3.1 Pro überhaupt nicht auf, weil der Benchmark später als es erschienen ist. Eine von Surge AI durchgeführte blinde Humanstudie bewertete Mistral Large 4 Preview unter fünf Modellen bei der Coding-Qualität mit 3,74 auf Platz zwei – vor GLM-5.3 und Kimi K3 und nur hinter Claude Opus 5.

Die Cyber-Behauptung ist die schärfste in Mistrals Beitrag und es lohnt sich, sie exakt wiederzugeben: 82 % im Artificial Analysis Cyber Index, der ein Modell dazu auffordert, eine echte [Schwachstelle] zu reproduzieren und sie dann zu patchen, beschrieben als der höchste Wert aller Modelle, mit 93 % bei Cybenchs 40 Wettbewerbsaufgaben und Mistrals Behauptung, dass es im Cyber Index insgesamt zu den globalen Top fünf gehört, während es bei offenen Modellen, die außerhalb entwickelt wurden, führend ist. Diese vom Nutzer zitierten Zahlen auf einem unabhängigen Index. Ihr praktischer Vorteil ist, dass Mistral das Modell darauf ausgelegt hat, die Arbeit zu erledigen, statt sie zu verweigern.

Die günstigste Zeile in der Tabelle gehört ebenfalls zu Mistral, aber nur knapp: 1,13 US-Dollar pro Aufgabe gegenüber 1,30 US-Dollar, ein Vorsprung von 13 %, den der Aktionspreis erzeugt und den die Preisliste zunichtemachen würde. Gemini 3.1 Pro ist ein Modell aus 2026 mit 2026er-Preisen, und es ist nicht teuer, darauf eine Index-Aufgabe laufen zu lassen.

Der Tiebreaker, den niemand benchmarkt

Zwei Dinge sind im Spiel, die die Tabellen nicht zeigen können. Das erste ist die Lizenzierung. Gemini 3.1 Pro ist proprietär und wird es bleiben; Mistral Large 4 ist eine Vorschau, deren ganzer Reiz darin besteht, dass sie zu einem herunterladbaren Artefakt wird, das man unter der eigenen Richtlinie, auf eigener Hardware, nach europäischem Recht ausführen kann — Mistral hat das Modell auf 3.800 Grace Blackwell GPUs in seinen eigenen Rechenzentren trainiert und stellt die Vorschau dort bereit. Dieses Argument ist nichts wert, bis das Repository erscheint und die Lizenz einen Namen hat. An dem Tag, an dem es so weit ist, ist es sehr viel wert.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid with 'Mistral Large 4' listed at v26.10 as 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 carrying an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible.

Der zweite Punkt ist das operationelle Risiko. Eine Vorschau, die noch verfeinert wird, wird sich unter Ihnen ändern. Auf OrcaRouter sind beide Seiten dieses Vergleichs über einen einzigen OpenAI-kompatiblen Endpunkt zu Listenpreisen des Anbieters mit 0 % Aufschlag erreichbar – Gemini 3.1 Pro ist im Katalog zu Googles Preisen verfügbar, während Mistral Large 4 über Mistrals eigene API und mehrere Drittplattformen erreicht werden muss, da es sich nicht um eine von uns angebotene Route handelt. Die Routing-DSL ist hier der nützliche Teil: Schicken Sie Klassifizierung und Extraktion an das Modell, das in der jeweiligen Woche günstiger ist, eskalieren Sie die harten Restfälle, und lassen Sie automatisches Failover die schlechten Tage der Vorschau auffangen, statt dass Ihre On-Call-Rotation sie auffängt.

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the preview model identity, a 1M-token context window, a 65K maximum output, inputs of audio, file, image, text and video with text output, the 2026-02-19 release date, a p-50 time-to-first-token figure of 10.00 seconds, pricing of $2.00 per million input and $12.00 per million output, and a code sample against the api.orcarouter.ai base URL.

Das Urteil

Frage, worin die Arbeitslast besteht, nicht, welches Modell besser ist. Für Wissensarbeit, Audio- und Videoeingabe, eine garantierte Obergrenze für die Ausgabe und ein bereitgestelltes Millionen-Token-Fenster ist Gemini 3.1 Pro noch immer das stärkere Modell, und sein Alter ist kein Mangel – es sind acht Monate, in denen andere seine Grenzen ausgelotet haben. Für agentisches Coding, Terminalarbeit und Sicherheitsoperationen liegt Mistral Large 4 mit einem so großen Vorsprung vorne, dass der Indexrang irreführend ist, und es ist das einzige der beiden, das am Ende selbst hostbar sein könnte.

Der entscheidende Faktor, den man im Auge behalten sollte, ist Ende Oktober. Wenn die Gewichte unter einer permissiven Lizenz erscheinen, konkurriert Mistral Large 4 nicht mehr mit Gemini 3.1 Pro über den Preis, sondern beginnt, in puncto Kontrolle mit ihm zu konkurrieren, und das ist ein anderer Kampf. Wenn sie unter einer restriktiven Lizenz erscheinen, ändert sich die Antwort dieses Artikels nicht wesentlich – aber die Begründung dafür schon.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert