
Was ist MiniMax M3? MiniMaxs multimodales Flaggschiff mit 1M-Kontext
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiniMax M3 ist ein nativ multimodales Open-Weight-Sprachmodell aus dem chinesischen Labor hinter den Textmodellen der M-Serie, den Hailuo-Videomodellen und der Music-Serie. Das Labor kündigte es am 1. Juni 2026 an; es löste in der unternehmenseigenen Modellliste MiniMax M2.7 auf dem Spitzenplatz ab und bringt ein Kontextfenster von einer Million Token, native Text-, Bild- und Videoeingabe sowie eine Sparse-Attention-Architektur, die das Labor MSA nennt.
Vierzehn Artikel im Archiv dieses Blogs erwähnen MiniMax M3. Bis jetzt ging es in keinem von ihnen um es. Das Modell taucht als Gegner in einem Vergleich nach dem anderen auf – der Open-Weight-Referenzpunkt, an dem ein neueres Gemini, Qwen, Grok oder GPT gemessen wird – und es gab hier keine Seite, auf der ein Leser landen konnte, um herauszufinden, was MiniMax M3 tatsächlich ist. Dies ist diese Seite.
Das Datenblatt
MiniMax M3 ist ein Mixture-of-Experts-Modell mit insgesamt etwa 428 Milliarden Parametern und etwa 23 Milliarden pro Token aktivierten Parametern, laut der Modellkarte, die MiniMax zusammen mit den Gewichten veröffentlicht. Es ist von Grund auf multimodal und nicht textbasiert mit nachträglich angebauter Bildverarbeitung: Die Karte beschreibt das Training mit ineinander verschränkten Modalitäten vom ersten Schritt an, und das Modell akzeptiert Text-, Bild- und Videoeingaben und gibt Text aus.
• Kontextfenster: 1.048.576 Token, wobei unser eigener Katalogeintrag ein garantiertes Minimum von 512.000 Token nutzbaren Kontexts angibt
• Maximale Ausgabe: 512.000 Token auf unserer Katalogseite; MiniMax veröffentlicht in eigenen Materialien keine Angabe zur maximalen Ausgabe, daher ist 512K unsere Zahl, nicht die des Anbieters
• Modalität: Text, Bild und Video als Eingabe; Text als Ausgabe
• Parameter: insgesamt ~428B, ~23B aktiv pro Token
• Reasoning-Steuerung: ein Thinking-Parameter mit den Modi enabled, adaptive und disabled
• Empfohlenes Sampling: temperature 1.0, top_p 0.95
• Architektur: MiniMax Sparse Attention (MSA), Gegenstand des arXiv-Papiers 2606.13392
• Endpoint-Form: OpenAI-kompatible Chat-Completions
Die zentrale architektonische Behauptung betrifft die Attention-Kosten bei langem Kontext. MiniMax sagt, dass MSA bei einem Fenster von einer Million Token mehr als 9-mal schnelleres Prefilling und mehr als 15-mal schnelleres Decoding als M2 liefere und den Rechenaufwand pro Token auf etwa ein Zwanzigstel der vorherigen Generation senke. Das sind Herstellerangaben, und wir haben keine unabhängige Reproduktion davon gesehen.
Wo MiniMax M3 in der eigenen Produktlinie von MiniMax steht
Es ist das Spitzenmodell der Sprachmodellreihe, doch es lohnt sich, genau zu sein, was diese Reihe enthält, denn MiniMax hält einen längeren Long Tail weiterhin aufgeführter Modelle als die meisten Labore. Die eigene Modelldokumentation des Anbieters unterteilt sie in zwei Gruppen.
• Aktuelle Modelle: MiniMax M3, MiniMax M2.7, MiniMax M2.7-highspeed
• Legacy-Modelle, weiterhin aufgeführt: MiniMax M2.5, MiniMax M2.5-highspeed, MiniMax M2.1, MiniMax M2.1-highspeed, MiniMax M2
• MiniMax M2, das älteste von ihnen, bietet einen Kontext von 200.000 Token und eine maximale Ausgabe von 128.000 Token einschließlich Chain-of-Thought
• MiniMax veröffentlicht im selben Dokument keine Kontext- oder Ausgabegrenzen für M2.7 oder M2.1
Die Generationenlücke ist real, aber nicht enorm – gemessen an dem einen Index, auf dem beide Modelle erscheinen. Artificial Analysis vergibt MiniMax M3 29 Punkte im Intelligence Index, Revision v4.3.2, und MiniMax M2.7 23 Punkte in derselben Revision – 29 setzt M3 auf Rang 16 von 114 Modellen in der Tabelle dieser Revision, und 23 setzt M2.7 auf Rang 36. M2.7 wurde im März 2026 veröffentlicht. Der Sprung ist ein Schritt, keine Generation, und es lohnt sich, die beiden Zahlen aus derselben Revision abzulesen: Dieser Index wurde am 7. September 2026 neu kalibriert, und Werte von vor diesem Datum sind nicht mit Werten nach diesem Datum vergleichbar.
Was es kostet
MiniMax bepreist M3 auf seiner Pay-as-you-go-Preiskarte nach Anfragegröße, und die veröffentlichten Preise beinhalten einen dauerhaften Rabatt von 50 % gegenüber einem höheren Listenpreis.
• Bis zu 512K Token Eingabe: 0,30 $ pro Million Eingabe-Token, 1,20 $ pro Million Ausgabe-Token, 0,06 $ pro Million gecachte Lesevorgänge – gegenüber einem Listenpreis von 0,60 $ / 2,40 $ / 0,12 $
• Über 512K Token Eingabe: 0,60 $ pro Million Eingabe, 2,40 $ pro Million Ausgabe, 0,12 $ pro Million gecachte Lesevorgänge – gegenüber einem Listenpreis von 1,20 $ / 4,80 $ / 0,24 $
• Priority-Service-Tier: 1,5-fache des Standardtarifs, also 0,45 $ / 1,80 $ / 0,09 $ im Tier für kleine Anfragen, ausgewählt durch Setzen von service_tier auf "priority"
• Nicht veröffentlicht: MiniMax gibt keinen Cache-Schreibpreis für M3 an, nur einen Cache-Lesepreis
OrcaRouter führt MiniMax M3 zu denselben Zahlen – 0,30 $ Input, 1,20 $ Output – ohne Aufschlag auf den Anbieterpreis. Es ist ein hervorgehobenes Modell in unserem Katalog, und der Traffic ist nicht unerheblich: 153,7 Millionen Token, die zum Zeitpunkt des Verfassens in den letzten sieben Tagen geroutet wurden, mit einer p50-Zeit bis zum ersten Token von 4,26 Sekunden und einer p95 von 10,00 Sekunden.

Worin ist MiniMax M3 messbar gut?
Beginnen wir mit den Zahlen, die MiniMax für sich selbst angibt – alle vom Anbieter gemeldet, und keine davon haben wir von einem Dritten reproduziert gesehen.
• SWE-Bench Pro: 59,0 %
• Terminal-Bench 2.1: 66,0 %
• SWE-fficiency: 34,8 %
• MCP Atlas: 74,2 %
• BrowseComp: 83,5, die Zahl, mit der der Anbieter bei der agentischen Suche wirbt
• Video-MME: 84,6 bei 512 Frames, wobei die externe API die Frames bei 640 begrenzt
• KernelBench Hard: 28,8 %
• OSWorld-Verified: 68,70 % bei 100 maximalen Schritten, ansteigend auf 70,06 % bei 200
Das unabhängige Bild stimmt in der Richtung überein. Artificial Analysis setzt MiniMax M3 in Revision v4.3.2 auf einen Intelligence Index von 29, womit es auf Platz 16 von 114 Modellen liegt, bei 0,51 $, um den Index pro Modell laufen zu lassen — Rang 21 von 114 bei diesem Kostenmaß. Die Ausgabegeschwindigkeit beträgt 106,4 Token pro Sekunde gegenüber einem Median von 67,1, und die Zeit bis zum ersten Token beträgt 1,25 Sekunden gegenüber einem Median von 2,33 Sekunden. Beides ist besser als für diese Klasse typisch, und der Preis liegt deutlich darunter.
Die Wiederveröffentlichung derselben Indexfamilie durch Dritte ergänzt die Teilwerte: SWE-bench Verified bei 80,5 %, tau-squared-bench bei 88,9 %, AA-GPQA Diamond bei 92,9 %, AA-LCR bei 83,0 %, AA-IFBench bei 82,9 %, OmniDocBench 1.5 bei 91,6 % und USAMO 2026 bei 85,7 %. Dokumentenverständnis und Anweisungsbefolgung scheinen echte Stärken zu sein, und der Langkontext-Reasoning-Wert passt zur architektonischen Erzählung.

Worin es messbar schlecht ist
Die ehrlichen Schwächen konzentrieren sich an zwei Stellen, und beide sind in veröffentlichten Zahlen sichtbar.
• Die Agentic-Lücke ist die große: Bei derselben Drittanbieter-Wiederveröffentlichung erzielt MiniMax M3 58,6 im AA Coding Index, aber nur 30,8 im AA Agentic Index. Es schreibt Code weit besser, als es eine lange, mehrstufige Aufgabe autonom vorantreibt.
• Wissen und Halluzination: ein AA-Omniscience Index von 1,4, eine Genauigkeit von 16,7 % und eine Halluzinationsrate von 18,4 %. Das ist ein Modell, das selbstsicher über Dinge antwortet, die es nicht weiß.
• OSWorld 2.0: 4,6 %
• CritPt: 3,7 %, der schwächste veröffentlichte Wert, den wir für M3 irgendwo gefunden haben
• ResearchClawBench: 19,8 %
• Weitschweifigkeit: 120 Millionen Ausgabe-Tokens, um den Intelligence Index zu absolvieren, Rang 11 von 114 – es ist ein redseliges Modell, und bei reasoning-lastigen Prompts schlägt sich das auf der Rechnung nieder
• Die zusammengesetzte Untergrenze: Ein Drittanbieter-Aggregator setzt es auf 55,28 von 100, Rang 60 von 505, allerdings bei teilweiser Abdeckung von 50 von 481 Benchmarks, sodass dieser Composite-Wert eher eine Untergrenze als ein Urteil ist
Einige Dinge werden schlicht nicht gemessen, und wir sagen das lieber, als die Lücke zu füllen. Niemand außerhalb von MiniMax hat die obige Anbieter-Benchmark-Tabelle reproduziert. Artificial Analysis veröffentlicht für M3 nicht selbst einen Coding-Index- oder Agentic-Index-Wert — das Paar aus 58,6 und 30,8 stammt von einem Dritten, der dieselbe Indexfamilie erneut veröffentlicht. Artificial Analysis nennt AA-Omniscience als Bestandteil seines Index, veröffentlicht aber keinen numerischen Omniscience-Score für M3. MiniMax veröffentlicht keine Angabe zur maximalen Ausgabe, deshalb stammt die 512K-Angabe auf unserer eigenen Modellseite von uns. Und auf der Anbieter-Preisliste gibt es überhaupt keinen Cache-Write-Preis.
Wer sollte sich für MiniMax M3 entscheiden und wer sollte sich für etwas anderes entscheiden?
Wähle MiniMax M3, wenn die Aufgabe gleichzeitig langkontextuell und multimodal ist. Eine Million Token mit Videoeingabe, offene Gewichte, die du selbst herunterladen und ausführen kannst, und ein Eingabepreis von 0,30 $ pro Million Token sind eine Kombination, die nichts anderes im Open-Weight-Bereich sauber erreicht. Langdokumentanalyse, Videoverständnis, Code-Lesen im Repository-Maßstab und Dokumentextraktions-Pipelines sind die Bereiche, in denen die gemessenen Stärken liegen – 91,6 % auf OmniDocBench und 83,0 % auf AA-LCR sind die Zahlen, die dafür sprechen.
Wählen Sie in drei Fällen etwas anderes. Wenn Sie weder das Kontextfenster noch die Vision-Eingabe benötigen, kostet MiniMax M2.7 dieselben $0,30/$1,20, erzielt 23 gegenüber 29 für M3 in der aktuellen Index-Revision und ist einfacher zu betreiben — der Vorteil von M3 ist nicht kostenlos, er ist lediglich zum gleichen Listenpreis zu haben. Wenn Ihr Workload aus autonomen Agenten statt aus Coding besteht, ist die Agentic-Lücke der Grund, sich woanders umzusehen, und die eigene Vergleichstabelle von MiniMax weist auf dieselbe Stelle hin: Bei PostTrainBench meldet der Anbieter 0,37 für M3 gegenüber 0,42 für Opus 4.7 und 0,39 für GPT-5.5, der einzige veröffentlichte Benchmark, bei dem M3 gegen beide verliert. Und wenn Sie eine Lizenz ohne Bedingungen benötigen, lesen Sie den nächsten Absatz, bevor Sie sich festlegen.
Die Lizenz ist der Haken, den viele Darstellungen auslassen. MiniMax M3 erscheint unter der MiniMax Community License, nicht unter Apache oder MIT. Die nichtkommerzielle Nutzung ist kostenlos. Die kommerzielle Nutzung ist erlaubt, aber Sie müssen gut sichtbar „Built with MiniMax M3" anzeigen. Unter 20 Millionen US-Dollar Jahresumsatz reichen Sie eine einmalige Mitteilung ein; darüber benötigen Sie eine vorherige schriftliche Genehmigung von MiniMax, die per E-Mail mit dem Betreff „M3 licensing - authorization request" angefordert werden muss. Die Lizenz enthält außerdem einen Anhang mit verbotenen Nutzungen. Wenn Sie ein Produkt auf den Markt bringen, ist das eine rechtliche Prüfung, keine Formalität.
Die praktische Zusammenfassung
MiniMax M3 ist das aktuelle Flaggschiff von MiniMaxs Sprachmodellreihe: ein Mixture-of-Experts-Modell mit ca. 428 Mrd. Parametern und ca. 23 Mrd. aktiven Parametern pro Token, einem Kontext von einer Million Token, nativer Video- und Bildeingabe sowie Sparse Attention, der der Anbieter eine 20-fache Reduktion des Rechenaufwands pro Token bei vollem Kontext zuschreibt. Es wurde am 1. Juni 2026 angekündigt, es handelt sich also um ein etabliertes Modell, nicht um ein neues – die interessante Frage im September 2026 ist nicht, ob es gut ist, sondern für welche Hälfte Ihrer Arbeitslast es gut geeignet ist.
Die abgewogene Antwort lautet, dass es bei Code und Dokumenten stark, bei Wissen durchschnittlich und bei autonomer agentischer Arbeit schwach ist. Für das, was es leistet, ist es günstig, und es ist das seltene Open-Weight-Modell, bei dem die Langkontext-Behauptung einer unabhängigen Prüfung standhält. Die Lizenz ist der Teil, den die meisten Teams mit sich selbst ausverhandeln müssen.
MiniMax M3 läuft auf OrcaRouter zum Anbietertarif ohne Aufschlag, über denselben OpenAI-kompatiblen Endpunkt wie alles andere hier: Ein API-Schlüssel erreicht 200+ Modelle, mit automatischem Failover, falls ein Endpunkt ausfällt, und einer Routing-DSL, wenn Sie festlegen oder mischen möchten. Wenn Sie es vor Ihrer Entscheidung mit dem Rest des Katalogs vergleichen möchten, enthält die Modellseite die Live-Preiskarte, Time-to-First-Token-Perzentile und Traffic.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
