
Mistral Large 4 vs. MiniMax M3: Was fünf Monate Fortschritt kosten
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 151 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 116 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 249 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
MiniMax M3 ist das günstigste Modell in dieser Klasse und das seit dem 31. Mai 2026. Bei 0,30 $ pro Million Input-Tokens, 1,20 $ pro Million Output und 0,06 $ pro Million gecachter Tokens unterbietet es Mistral Large 4 um etwa die Hälfte beim Input und um das Doppelte beim Output — und anders als das neuere Modell kann man es heute kaufen, ohne dass ein Preview-Label daran hängt. Mistral Large 4, ein Open-Weight-Modell mit 1,05 Billionen Parametern, das seit dem 6. Oktober 2026 in öffentlicher Vorschau ist, kostet 0,68 $ und 2,09 $ und stellt die Gewichte bis Ende des Monats in Aussicht. Zwei Open-Weight-Flaggschiffe, fünf Monate auseinander, und die fünf Monate sind an genau einer Stelle sichtbar: M3s unabhängiger Intelligence-Index-Wert von 29,2 gegenüber einem Mistral-Large-4-Wert, den es noch nicht gibt.
Das ist die ehrliche Gestalt dieses Vergleichs, und sie ist interessanter, als eine Preistabelle vermuten lässt. M3 wurde um eine bestimmte architektonische Wette herum gebaut – MiniMax Sparse Attention, über eine Million Token Kontext hinweg aufrechterhalten, mit Video als erstklassiger Eingabe – und gewinnt auf dem Papier in zwei Kategorien, in denen Mistral Large 4 nicht antritt: rohe Ausgabelänge und natives Video. Überall sonst ist das neuere Modell das, das ein Käufer lieber hätte, zu einem Preis, der noch niedrig genug ist, dass der Unterschied selten den Kauf entscheidet.
Zwei Architekturen, zwei Wetten.
MiniMax M3 ist MiniMax' Flaggschiff-Open-Weights-Basismodell und das erste, das Spitzenleistungen bei Coding und agentischen Fähigkeiten, ein Kontextfenster von einer Million Token und native Multimodalität in einer einzigen Veröffentlichung vereint. Es akzeptiert Text, Bilder und Video und gibt Text zurück, und es basiert auf MiniMax Sparse Attention, einer Architektur, die darauf ausgelegt ist, bis zu 1.048.576 Token Kontext mit einer garantierten Untergrenze von 512K aufrechtzuerhalten. Die Pretraining-Pipeline wurde neu aufgebaut, um über 100 Billionen Token zu skalieren – mit multimodalen Daten von Anfang an statt nachträglich angeflanscht. Die maximale Ausgabe beträgt 512.000 Token.
Mistral Large 4 geht eine andere Wette ein. Es ist ein granulares Mixture-of-Experts-Modell, 39 Milliarden Parameter von insgesamt 1,05 Billionen, mit einem 1,6 Milliarden Parameter umfassenden Vision-Encoder, von Grund auf trainiert auf 3.800 NVIDIA Grace Blackwell GPUs in Mistrals eigenen europäischen Rechenzentren auf Daten aus mehr als 160 Sprachen. Es verarbeitet Text und Bilder – kein Video – bei einem Kontext von etwa einer Million Token, und Mistral positioniert es rund um souveränen Einsatz: europäische Infrastruktur, offene Gewichte und die Möglichkeit, es nach Ihren eigenen Richtlinien zu betreiben, mit Cybersicherheit als Vorzeigeanwendungsfall.
• Kontextfenster — MiniMax M3 1.048.576 Token vs. Mistral Large 4 etwa 1.000.000
• Maximale Ausgabe — MiniMax M3 512.000 Tokens vs. Mistral Large 4 noch nicht dokumentiert
• Eingabemodalität — MiniMax M3 Text, Bild und Video vs. Mistral Large 4 Text und Bild
• Eingabepreis — MiniMax M3 0,30 $ pro 1 Mio. vs. Mistral Large 4 0,68 $ pro 1 Mio.
• Ausgabepreis — MiniMax M3 1,20 $ pro 1M vs. Mistral Large 4 2,09 $ pro 1M
• Gecachte Eingabe — MiniMax M3 0,06 $ pro 1M vs. Mistral Large 4 0,07 $ pro 1M
• Parameter — Mistral Large 4: 1,05T insgesamt / 49B aktiv vs. MiniMax M3 nicht angegeben
• Veröffentlicht — MiniMax M3 31. Mai 2026 vs. Mistral Large 4 6. Oktober 2026, Vorschau
• Gewichte — beide unter offener Lizenz, die Gewichte von Mistral Large 4 bis Ende Oktober 2026 versprochen

Der Spielstand ist nicht knapp, und er ist auch nicht fair.
Auf dem Artificial Analysis Intelligence Index v4.3.2 erzielt MiniMax M3 29,2 Punkte und belegt Platz 62 von 147 Modellen. Das ist ein Ergebnis im Mittelfeld und keine Kritik am Modell — der Index wurde nach der Veröffentlichung von M3 überarbeitet und enthält Bewertungen, die es zum Zeitpunkt des Trainings von MiniMax noch nicht gab. Sein Coding-Teilwert zeichnet ein besseres Bild: 58,6 im AA Coding Index, Platz 46 von 138, und 65,2 % bei Terminal-Bench 2.1. Es erreicht 92,9 % bei GPQA Diamond, 83 % beim Long-Context-Recall und 47,1 % bei SciCode.
Mistral Large 4 hat auf demselben Board keinen Index-Wert; die Seite ist unter dem Titel „Mistral Large 4 Preview“ live, und die Zahl fehlt. Was Mistral jedoch veröffentlicht, ist, dass ML4 DeepSeek V4 Pro 0813 und Qwen3.8 Max im kombinierten Coding Agent Index mit 49,8 % anführt und dass es auf AutomationBench – 657 Geschäftsworkflows über Gmail, Sheets, Slack und Salesforce hinweg – 59,9 % erreicht, vor Kimi K3, MiMo-V2.6-Pro und DeepSeek V4 Pro. MiniMax wird in keinem der beiden Vergleiche genannt, was für sich genommen ein Signal dafür ist, welches Modell Mistral als den echten Konkurrenten ansieht.
Die faire Lesart ist also diese: M3 ist ein leistungsfähiges, günstiges, gut dokumentiertes Modell mit einem allgemeinen Score im Mittelfeld und einem respektablen Coding-Profil, fünf Monate alt. ML4 ist ein Vorschaumodell mit einer höheren behaupteten Obergrenze, keinem veröffentlichten allgemeinen Score und einer Reihe agentischer Kennzahlen, die Artificial Analysis privat bewertet hat und auf dem Coding Agent Index veröffentlichen wird, sobald diese Testumgebung verfügbar ist. Wenn Sie heute eine Zahl brauchen, liefert M3 Ihnen eine. Wenn Sie ein paar Wochen warten können, liefert ML4 Ihnen auch eine, und Mistral wettet darauf, dass sie höher sein wird.
Wo M3 überhaupt keine Konkurrenz durch ML4 hat
Zwei Zeilen in dieser Tabelle sind kein Kompromiss, sondern eine Abwesenheit.
Videoeingabe steht an erster Stelle. M3 akzeptiert Video nativ, neben Text und Bildern. Mistral Large 4 nimmt Text und Bilder und sonst nichts – Mistrals eigener Deep Dive dreht sich um Grounding über Gigapixel-Satellitenbilder und technische Zeichnungen, was immer noch Bildarbeit ist. Wenn Ihre Pipeline Bildschirmaufzeichnungen, Überwachungsaufnahmen oder Videodokumentation aufnimmt, kann ML4 nicht das Modell sein, unabhängig von seinem Preis. Das ist keine Lücke, die Mistral mit einer Preisanpassung schließen wird.
Die Ausgabelänge steht an zweiter Stelle. M3 gibt in einer einzigen Antwort bis zu 512.000 Token aus. Mistral hat für ML4 keine Obergrenze für die Ausgabe veröffentlicht. Ein langes strukturiertes Artefakt in einem Durchgang zu erzeugen – ein vollständiger Bericht, ein umfangreiches Migrationsskript, eine vollständige Spezifikation – ist die Arbeitslast, bei der eine 512K-Grenze mehr wert ist als ein Punkt im Intelligence Index, und solange Mistral das Limit von ML4 nicht dokumentiert, ist M3 von den beiden das einzige, auf dessen Grundlage man diese Arbeitslast planen kann.
Die vom Anbieter gemeldeten agentischen Werte für M3 stützen dasselbe Profil. MiniMax gibt für M3 83,5 bei BrowseComp für autonome Webrecherche an, 70 bei OSWorld-verified für Computernutzung, 74,2 bei MCP Atlas für Tool-Nutzung, 76,7 bei GDPval-Rubriken und 59 bei SWE Bench Pro. Diese stammen aus MiniMax’ eigenen Evaluierungen und wurden nicht unabhängig reproduziert, und sie stehen merkwürdig im Kontrast zu seinem Index-Wert von 29,2 — genau deshalb ist die Unterscheidung zwischen anbietereigenen und unabhängigen Bewertungen so wichtig. Ein Modell kann bei den vom Anbieter ausgewählten Benchmarks an der Spitze stehen und bei einem neutralen Durchschnitt aus zehn Evaluierungen im Mittelfeld landen — und beides kann gleichzeitig zutreffen.
Lohnt sich das 2x?
Die Preislücke ist hier in absoluten Zahlen wirklich klein, was die Kalkulation im Vergleich zu einer Nichtübereinstimmung mit einem geschlossenen Flaggschiff verändert. Nehmen wir einen Monat mit hundert Millionen Tokens bei einer 4:1-Aufteilung von Eingabe zu Ausgabe: 80 Millionen Eingabe-Tokens und 20 Millionen Ausgabe-Tokens. M3 stellt 24 $ plus 24 $ in Rechnung, insgesamt 48 $. Mistral Large 4 stellt 54,40 $ plus 41,80 $ in Rechnung, insgesamt 96,20 $. Der Aufpreis beträgt etwa 48 $ pro Monat – echtes Geld in großem Maßstab, aber die Art von Lücke, für die ein einziger vermiedener Fehlschlag aufkommt.
Caching verringert den Abstand weiter und begünstigt M3 nur geringfügig: 0,06 $ gegenüber 0,07 $ pro Million gecachter Tokens sind bei diesem Preisniveau ein Rundungsfehler. Beide sind günstig genug, dass die Entscheidung anhand von Leistungsfähigkeit und Eignung getroffen werden sollte statt anhand der Rechnung – was das Gegenteil davon ist, wie dieser Vergleich auf den ersten Blick wirkt.
Was der Aufpreis kauft, ist span. ML4 wurde fünf Monate später auf neueren Daten trainiert, in einem Mixture-of-Experts-Layout mit einer Billion Parametern und 49 Milliarden aktiven, und Mistral betreibt darauf Reinforcement Learning mit angegebenen 33 Milliarden Tokens pro Tag in einem Lauf, der noch nicht gesättigt ist. M3 ist fertig; ML4 verbessert sich nach einem veröffentlichten Zeitplan. Wenn ein Anbieter sagt, das Modell, das Sie heute kaufen, sei die schwächste Version, für die Sie jemals bezahlen werden, und der Aufpreis gegenüber dem etablierten Modell unter einem Dollar pro Million Tokens liegt, ist das neuere Modell in der Regel die bessere Standardoption. Die Ausnahme sind die beiden oben genannten Workloads, bei denen das ältere Modell das einzige ist, das passt.
Routing um die Lücke herum

Dies ist eine Paarung, bei der beide laufen zu lassen keine Absicherung, sondern die eigentliche Antwort ist, weil die beiden Modelle an voneinander getrennten Stellen stark sind. Video rein, langes Artefakt raus oder eine Computer-Use-Schleife: M3. Dokumenten- und Bildanalyse, agentische Workflows oder alles, was auf europäischer Infrastruktur unter Ihren eigenen Richtlinien laufen muss: ML4. Es gibt keine Routing-Regel, die eines von beiden überflüssig macht.
Beide stehen hinter einem einzigen OpenAI-kompatiblen Endpoint auf OrcaRouter mit 0 % Aufschlag und die Listenpreise der Anbieter unverändert weitergegeben werden, was eine Preisspanne über fünf Monate hinweg ehrlich hält – wenn MiniMax den Tarif für M3 senkt oder Mistral den Preview-Tarif beendet, ändert sich die Zahl, an der Ihre Route gemessen wird, noch am selben Tag. Die Routing-DSL ist das, was die getrennten Stärken in eine einzige Aufruf-Oberfläche verwandelt: Eine Regel, die die Modalität der Anfrage prüft, schickt videohaltige Payloads an M3 und alles andere an ML4 – mit der Gewissheit, dass Verfügbarkeitsaussetzer eines Preview-Modells durch automatisches Failover aufgefangen werden, statt zu Ihren Nutzern durchzuschlagen. Wo eine einzelne Ausgabe mehr zählt als ein einzelner Preis, kann die Modell-Fusion beide laufen lassen und ein Gremium auswählen lassen – ein vernünftiger Weg, Mistrals beanspruchte Obergrenze zu kaufen und dabei M3s dokumentiertes Verhalten als Untergrenze zu behalten.

Urteil
MiniMax M3 ist die richtige Antwort für zwei Workloads und eine vertretbare Antwort für einen dritten. Videoeingabe, die Generierung von mehreren hunderttausend Token in einem einzigen Durchlauf und Computer-Use-Agenten sind sein Revier, sein Preis ist der niedrigste aller Flaggschiffe dieser Klasse, und seine veröffentlichten Mittelfeld-Ergebnisse bedeuten, dass Sie genau wissen, was Sie bekommen. Fünf Monate alt ist nicht alt für ein Modell, das in seiner eigenen Nische nicht abgelöst wurde.
Mistral Large 4 ist die bessere Standardwahl für alles andere. Ein Monat mit hundert Millionen Tokens kostet etwa 48 $ mehr, die Parameterzahl und die europäische Trainingsherkunft deuten auf eine höhere Obergrenze hin, die Cybersicherheitsbehauptungen sind konkret genug, um überprüfbar zu sein, und die versprochenen offenen Gewichte plus On-Premises-Deployment erfüllen Anforderungen, die M3s reine API-Unternehmensstory nicht erfüllt. Der Preis für diese Wette ist, dass Sie sich damit auf ein Modell festlegen, dessen Punktzahl im Independent Intelligence Index nicht veröffentlicht wurde und dessen Verhalten sich laut Mistral innerhalb von Wochen erheblich ändern wird.
Die beiden Termine, die dies klären: Ende Oktober 2026, wenn ML4s Gewichte entweder erscheinen oder das Open-Weights-Versprechen allmählich weich wirkt, und die Veröffentlichung des Coding Agent Index, wo Mistrals privat bewertete 49,8 % auf den öffentlichen Coding-Score von M3 von 58,6 % in derselben Revision treffen. Bis dahin ist M3 das Modell, das du verifizieren kannst, und ML4 das Modell, auf das du wettest – und bei einem monatlichen Aufpreis von 48 $ für hundert Millionen Token ist das keine große Wette.
