Eine generierte Hero-Karte mit dem Titel MiniMax M3.1, mit einem Badge mit der Aufschrift „UNVERIFIZIERT – NOCH NICHT VERÖFFENTLICHT" und dem Untertitel „Ein privater 250-GB-Checkpoint, eine durchgesickerte Architekturnotiz und ein Anbieter, der sich nicht geäußert hat". Drei Chips zeigen „Checkpoint: MiniMax-M3.1-preview-private", „62 Dateien / 48 Safetensors / 250 GB" und „Beobachtungsfenster: Woche vom 28. September 2026". Eine linke Karte zeigt „Die Behauptung: Sparse Attention, Q8KV4-Attention, NVFP4-Experten, DSpark-Spec-Decode und ein neues reasoning_effort-Feld"; eine rechte Karte zeigt „Kein Launch bestätigt: keine Gewichte, keine Modellkarte, keine Preisseite, keine API-Modell-ID". Das OrcaRouter-Logo befindet sich unten rechts.
Guides & Insights

MiniMax M3.1: Was die geleakten Vorschau-Dokumente sagen – und was niemand bestätigt hat

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Auf Hugging Face gibt es einen 250 GB großen Checkpoint namens MiniMax-M3.1-preview-private, den niemand außerhalb einer Handvoll Inferenzpartner öffnen kann. Es gibt ein auf den 22. September datiertes Dokument, das sich genau wie die Architekturnotiz des Anbieters liest und in einem öffentlichen Partner-Engineering-Repository kursiert statt auf der eigenen Website des Anbieters. Und am 26. September postete ein weithin beachteter Modellbeobachter, MiniMax M3.1 sei „das nächste kommende Modell für die kommende Woche“ und er teste bereits eine Vorschau davon. Führt man diese drei zusammen, hat man die gesamte öffentliche Beleglage zu MiniMax M3.1 – ein Modell, dessen Name, Architektur-Deltas, Gewichtszahl und Erscheinungswoche allesamt im Umlauf sind, und zu dem der Anbieter öffentlich kein Wort gesagt hat. Der Vorgänger, von dem es abstammt, MiniMax M3, ist eine andere Geschichte: Der wurde veröffentlicht, und er ist der Grund, warum sich überhaupt jemand für dieses hier interessiert.

So sieht ein unveröffentlichtes Modell von außen aus, und es lohnt sich, präzise über die Beschaffenheit der Belege zu sein, denn die drei Stränge sind nicht gleich stark. Die Existenz des Checkpoints ist gestützt: Mehrere unabhängige Spuren deuten auf denselben Namen des privaten Repositorys und dieselbe Dateianzahl hin. Das Architektur-Dokument ist nicht auf diese Weise gestützt – es ist die Transkription eines Dritten und könnte authentisch, veraltet oder teilweise erfunden sein. Die Behauptung „kommende Woche“ ist die Erwartung einer Person, kein Zeitplan. Alles in diesem Artikel ist mit der Stärke gekennzeichnet, die es tatsächlich hat, und nichts hier sollte als Veröffentlichungsankündigung gelesen werden.

Was MiniMax M3.1 einen Artikel wert macht, bevor es überhaupt existiert, ist der Vorgänger. MiniMax M3 war den meisten Berichten zufolge das stärkste Open-Weight-Modell, das MiniMax bis dahin veröffentlicht hatte — ein 1-Mio.-Token-Text-Bild-Video-Modell, das den Artificial Analysis Intelligence Index bei 29,2 erreichte und noch immer eines der wenigen offenen Modelle ist, die einen wirklich langen Kontext zusammenhalten werden. Wenn M3.1 in der letzten Septemberwoche erscheint, sind die Zahlen, die für Entwickler zählen, nicht die Plausibilität des Leaks, sondern was sich in den Layern geändert hat und was es kostet, es zu betreiben — und in beidem ist das durchgesickerte Dokument ungewöhnlich konkret.

Was ist bestätigt, und was ist nur im Umlauf?

Die ehrliche Aufteilung, Stand 27. September 2026:

• Bestätigt: Es existiert keine öffentliche Version von MiniMax M3.1. Die Organisation MiniMaxAI auf Hugging Face gibt für MiniMaxAI/MiniMax-M3.1, MiniMaxAI/MiniMax-M3.1-preview und MiniMaxAI/MiniMax-M3.1-preview-private gleichermaßen 401 zurück – die Antwort der Plattform für „nicht gefunden oder für Sie nicht sichtbar“. Ihre neuesten öffentlichen Uploads sind weiterhin MiniMax-Music3 (7. August 2026) und MiniMax-H3 (28. Juli 2026).

• Bestätigt: MiniMax M3.1 ist nirgends routingfähig, wo wir es überprüfen können. Es fehlt im OrcaRouter-Modellkatalog und in den öffentlichen Auflistungen, die wir überwachen; das MiniMax-Modell, das Sie heute tatsächlich aufrufen können, ist MiniMax M3, unter minimax/minimax-m3.

• Bestätigt: MiniMax hat nichts veröffentlicht. Keine Modellkarte, kein Blogbeitrag, keine Preisseite, keine Gewichte, keine API-Modell-ID. Es gibt keine Presseberichterstattung über einen Launch, weil es keinen Launch gegeben hat.

• Im Umlauf: das Architektur-Dokument. Es wird wortwörtlich in einem öffentlichen Repository wiedergegeben – longsco/innoferra-eval, eine Partner-Onboarding-Suite für gehostete Modell-Endpunkte, erstellt am 23. September 2026 – unter dem Dateinamen PREVIEW-20260922.md, mit einer Kopfzeile, die es als ein am 25. September geteiltes Anbieterdokument beschreibt, und einem Vorbehalt, dass „Modellname, Veröffentlichungsdatum des Anbieters und öffentlicher Launch weiterhin von der tatsächlichen Veröffentlichung abhängig bleiben.“ Das ist der eigene Vorbehalt des Dokuments, nicht unserer, und er ist der richtige: Die Kopie einer Anbieternotiz durch Dritte ist keine Aussage von MiniMax.

• Im Umlauf: der 250-GB-Checkpoint und sein zweiter Drop. Die Onboarding-Spezifikation des Repositorys verzeichnet einen privaten multimodalen Checkpoint unter MiniMaxAI/MiniMax-M3.1-preview-private — 62 Dateien, 48 safetensors-Dateien, ungefähr 250 GB, Architektur-String MiniMaxM3SparseForConditionalGeneration — und dann einen größeren zweiten Drop, MiniMax-M3.1-preview2-dspark-private, mit 101 Dateien und etwa 236 GB, der einen spekulativen fp8-Draft mit 2,3 GB hinzufügte. Beide sind privat. Wir können keinen von beiden öffnen, und Sie auch nicht.

• Im Umlauf: die zeitliche Einordnung. Der Beitrag vom 26. September ist die einzige öffentliche Datumsangabe, die jemand geliefert hat, und „kommende Woche“ ist eine Erwartung. Betrachten Sie die Woche ab dem 28. September als das Zeitfenster, das es zu beobachten gilt, nicht als Datum.

Das eine Dokument, das die technischen Details enthält

A headless Chromium screenshot of the public GitHub page for the file PREVIEW-20260922.md inside the repository longsco/innoferra-eval, showing the file path models/minimax-m3.1/PREVIEW-20260922.md, the markdown body describing MiniMax M3.1's sparse attention across all layers, the Q8KV4 attention quantisation in E2M1 blocks of 16 with a per-block E4M3 scale of amax/6 clamped to [1/512, 448] and round-half-to-even thresholds, the W4A4 NVFP4 routed experts with FC1 row scale 2688 divided by the row absolute maximum and FC2 fixed scale 16, the DSpark speculative-decoding head with no confidence head, the new reasoning_effort field taking max/xhigh/high/medium/low, and the line 'No 3.1 baselines published yet; do not reuse M3 numbers as acceptance bars.'

Alles, was über das Design von MiniMax M3.1 konkret bekannt ist, geht auf diese eine Markdown-Datei zurück, plus zwei Begleitdokumente im selben Repository: ein SGLang-Demo-Dokument, das beschreibt, wie der Checkpoint bereitgestellt werden soll, und eine spec.yaml, die ein Partner-Endpunkt erfüllen soll. Liest man das Repository als Ganzes, sieht es aus wie ein Inferenzanbieter, der genau das tut, was ein Inferenzanbieter tut – einen frühen Drop von MiniMax erhält, notiert, was sich geändert hat, und eine Validierungssuite dafür baut. Das Repository ist keine Pressemappe und es ist nicht geschrieben, um jemanden zu überzeugen.

Das ist ein Punkt zu seinen Gunsten, und es ist zugleich die Grenze dessen, was es belegt. Nichts darin ist von MiniMax signiert. Die drei Dokumente stimmen miteinander überein, wie echte Dokumente übereinstimmen – dieselben Quantisierungskonstanten, dieselben Umgebungsvariablennamen, dieselben Start-Flags –, und sie weichen voneinander ab, wie echte Drops voneinander abweichen: Die Vorschau vom 22. September besagt, dass die neue spekulative Dekodierungsmethode keinen Confidence-Head hat, und beim zweiten Checkpoint-Drop wurde eine Entwurfskonfiguration ausgeliefert, in der enable_confidence_head auf true gesetzt war. Eine Fälschung würde normalerweise keinen Korrekturverlauf enthalten. Aber „ungewöhnlich kohärent“ ist nicht „bestätigt“, und der Fehlermodus für einen Leser besteht darin, die unten stehenden Konstanten als das veröffentlichte Design von MiniMax aufzufassen, obwohl sie höchstens das private Design von MiniMax sind, wie es von jemand anderem gelesen wurde.

Die fünf technischen Änderungen, laut diesem Dokument

Hier ist der Unterschied zwischen MiniMax M3 und MiniMax M3.1, wie das Dokument ihn beschreibt. Jede Zeile stammt vom Anbieter und ist ungeprüft — keine unabhängige Partei hat eine wie auch immer geartete Ausgabe von MiniMax M3.1 gemessen.

• Attention-Abdeckung. Die Full Attention in den ersten drei Schichten wird durch Sparse Attention ersetzt, sodass alle Schichten sparse sind. Bei MiniMax M3 waren die ersten drei Schichten der Full-Attention-Anker des Sparse-Stacks.

• Attention-Präzision — "Q8KV4". Abfragen, einschließlich der Abfragen des Indexers, kommen aus der Projektion in BF16 heraus und werden nach FP8 E4M3 gecastet. Schlüssel und Werte — wiederum einschließlich derer des Indexers — werden auf E2M1 quantisiert, vier Bit, in Blöcken von 16, mit einer E4M3-Skala pro Block von amax/6, begrenzt auf [1/512, 448]. Das Dokument betont nachdrücklich, dass die Leiter Round-Half-to-Even mit asymmetrischen Schwellenwerten verwendet, dass die äußere Tensorskala genau 1 ist und dass ein Betrag von null als positive Null kodiert werden muss. M3 verwendete einen 8-Bit-KV-Pfad derselben Familie, sodass dies die KV-Bytes erneut halbiert.

• Expertenpräzision. Die gerouteten MoE-Experten wechseln von MXFP8 zu W4A4 NVFP4, wobei der gemeinsame Experte bewusst ausgenommen wird. Die beiden Expertenprojektionen erhalten unterschiedliche Aktivierungsschemata: FC1 verwendet eine dynamische Skalierung pro Zeile von 2688 geteilt durch den maximalen Absolutwert der Zeile, wobei die Zeilenskalierung nach dem GEMM, aber vor der Aktivierungsfunktion angewendet wird; FC2 verwendet eine feste äußere Skalierung von 16. Die praktische Konsequenz, ausdrücklich dargelegt im Partner-README, ist unverblümt: „Ein Anbieter, der den Checkpoint über einen generischen NVFP4-Pfad ohne diese laufen lässt, erzeugt stillschweigend abweichende Numerik.“

• Spekulative Dekodierung. Der EAGLE-artige Multi-Token-Vorhersagekopf ist weg und wurde durch eine Methode ersetzt, die MiniMax DSpark nennt – einen Vanilla-Markov-Kopf und im Dokument vom 22. September keinen Konfidenzkopf. Dies ist die Änderung mit der größten Auswirkung darauf, wie sich ein bereitgestellter Endpunkt anfühlt, denn sie ist der einzige Hebel für die Geschwindigkeit pro Stream im Design. Die Demo-Engine, die MiniMax zusammen mit dem Checkpoint ausgeliefert hat, enthält DSpark nicht, und der Anbieter hat die Lücke gemessen: Bei demselben 80.000-Token-Frame ohne Spekulation liegt der Durchsatz pro Stream bei Parallelität 1 bei 63,9 Token pro Sekunde und fällt bei Parallelität 4 unter 60; die Schlussfolgerung des Dokuments selbst ist daher, dass der Stack ohne DSpark sein Latenzziel unter Last nicht halten kann.

• Ein neues Anfragefeld. MiniMax M3.1 fügt ein Top-Level-Feld reasoning_effort hinzu, das max, xhigh, high, medium oder low annimmt und vom Chat-Template als Effort-Tag in den System-Prompt eingefügt wird. M3 hatte nur einen Thinking-Schalter mit adaptive und disabled. Das Dokument merkt seltsamerweise und ausdrücklich an, dass das Feld ohne Validierung und ohne erforderlichen Standardwert mitgeführt wird – was der Anbieter als Erlaubnis las, einen nicht aufgeführten Wert entweder zu akzeptieren oder abzulehnen, und was bedeutet, dass zwei konforme Endpunkte sich bei derselben Anfrage unterschiedlich verhalten könnten.

A generated single-column infographic titled 'MiniMax M3.1 — the scoreboard', listing six vendor-document deltas: 'Attention: all layers sparse', 'KV precision: Q8KV4, E2M1 blocks of 16', 'Routed experts: W4A4 NVFP4', 'Spec-decode: DSpark, no confidence head', 'Reasoning control: reasoning_effort max to low', and 'Benchmarks: none published'. A footer reads 'MiniMax M3.1 terms per a 2026-09-22 vendor preview document cited in partner engineering notes; unaudited, no independent scores exist.' The OrcaRouter logo sits bottom-right.

Zwei Details am Checkpoint verdienen es, separat hervorgehoben zu werden, weil sie zu der Art von Dingen gehören, die ein Launch-Post auslässt. Erstens liefert der Checkpoint sowohl eine Konfiguration für den Bild-Präprozessor als auch eine für den Video-Präprozessor mit – MiniMax M3.1 ist von der Konstruktion her ein multimodales Modell, kein Textmodell, dem nachträglich Vision angeschraubt wurde, und die eigene Empfehlung des Anbieters lautet, Bild-Eingaben auf dem neuen Stack nicht abzulehnen. Zweitens hat der zweite Checkpoint-Drop die Schlüssel MTP und NEXTN vollständig entfernt und nichts hinzugefügt, das sie ersetzt, weshalb der DSpark-Entwurf als separates 2,3-GB-Artefakt ankommen musste. Es gibt keinen Draft-Head in den Hauptgewichten, den man einschalten könnte.

Warum es keine M3.1-Benchmark-Zahlen gibt und warum das kein Versehen ist

Irgendwann erreicht jede Leak-Zusammenfassung den Punkt, an dem sie entweder eine Benchmark-Tabelle erfindet oder zugibt, dass sie keine hat. MiniMax M3.1 hat keine. Die Partner-Spezifikation sagt dies ausdrücklich, und zwar in einem Feld, das nur existiert, um zu verhindern, dass jemand diesen Fehler macht:

• "Noch keine 3.1-Baselines veröffentlicht; M3-Zahlen nicht als Akzeptanzschwellen wiederverwenden."

Diese Anweisung ist der nützlichste Satz im gesamten Korpus, denn die faule Version dieses Artikels schreibt die Artificial-Analysis-Werte von MiniMax M3 unter der Überschrift MiniMax M3.1. Das sollte sie nicht tun. Dasselbe Repository führt AIME-25- und GPQA-Diamond-Probes gegen den eigenen M3.1-Endpunkt von MiniMax durch und verzeichnet sie als Teammitglied-gegen-Anbieter-Vergleiche, wobei die Werte noch nicht feststehen: bei GPQA-Diamond 0,904 für den Lauf des Teams gegenüber 0,813 für den des Anbieters und bei einem MMLU-Pro-Subset mit 600 Fragen 0,898 gegenüber 0,821. Das sind zwei Läufe derselben Evaluation, die voneinander abweichen, kein Modellergebnis, und sie sind als Vorschau gekennzeichnet, wobei Wiederholungen mitgezählt werden. Wer heute eine einzelne Benchmark-Zahl für MiniMax M3.1 zitiert, zitiert etwas, das noch nicht existiert.

Was MiniMax M3 ist, damit die Fortsetzung bemessen werden kann

MiniMax M3 wurde Ende Mai 2026 veröffentlicht und ging am 2. Juni auf Hugging Face online — 428 Milliarden Parameter insgesamt bei 23 Milliarden aktiven, 60 Schichten, 128 geroutete Experten mit Top-4-Routing, 4 KV-Heads gegenüber 64 Attention-Heads und ein Kontextfenster von 1.048.576 Token bei einer maximalen Ausgabe von 512.000. Auf unabhängiger Seite bewertet Artificial Analysis es mit 29,2 im Intelligence Index und platziert es damit auf Platz 60 von 145 untersuchten Modellen, mit 58,6 im Coding Index und einem p50 von 3.348 Millisekunden bis zum ersten Token in unserer eigenen Routing-Telemetrie. MiniMax' eigene Schlagzeilenzahl dafür ist 83,5 bei BrowseComp, was eine Herstellerangabe und als solche ungeprüft ist.

Die Preisgestaltung ist der Teil, der in einem Leak-Zyklus am besten altert. MiniMax M3 kostet $0.30 pro Million Input-Tokens und $1.20 pro Million Output-Tokens, wobei gecachte Reads bei $0.06 liegen — und es ist live auf OrcaRouter als minimax/minimax-m3, zum Listenpreis des Anbieters mit 0 % Aufschlag, sodass, wenn MiniMax M3.1 genauso bepreist, der neue Preis bei uns live ist an dem Tag, an dem er existiert, statt einen Abrechnungszyklus später.

All das noch einmal aufzuzählen, geschieht nicht aus Nostalgie. Der Punkt ist: Der ganze Grund, warum diese Woche überhaupt jemand eine Hugging-Face-Organisationsseite neu lädt, ist, dass MiniMax M3 gut genug war, dass sein Nachfolger eine Frage des Produktionseinsatzes und kein Zuschauersport ist — und dass ein Modell mit 428 Milliarden Parametern und 1M-Kontext zu $0.30/$1.20 eine Preis-Leistungs-Messlatte setzt, die M3.1 überschreiten muss, nicht nur eine Fähigkeitsmesslatte.

Der Aspekt des anonymen Listings, und warum er möglicherweise bereits beantwortet wurde

Ein Thread von früher im September verdient es, hier abgeschlossen zu werden. Ein anonymes Stealth-Listing erschien auf einer Drittanbieter-Coding-Plattform mit 1.000.000-Token-Kontext, einem Preis von 0 $ und verpflichtenden Reasoning-Stufen, und wir berichteten darüber unter dem Namen Space Bunny Alpha, wobei wir die Basisrate anmerkten, dass jedes anonyme Listing dieser Art irgendwann von einem Anbieter für sich beansprucht wird — Pony Alpha wurde zu einem Zhipu-Modell, Hunter Alpha wurde Xiaomis, Ox Alpha wurde eine MiniMax-Veröffentlichung unter anderem Namen. Die Tokenizer- und Anomalie-Fingerabdrücke in diesem Listing deuteten auf einen MiniMax-Preview-Checkpoint hin. Wenn MiniMax M3.1 diese Woche tatsächlich erscheint, ist die wahrscheinlichste Lesart, dass das anonyme Listing sein Feldtest war, und das Rätsel löst sich durch eine Ankündigung statt durch weitere forensische Arbeit auf. Das ist eine Schlussfolgerung, kein Beleg, und sie ist die letzte Schlussfolgerung in diesem Beitrag.

A headless Chromium screenshot of OrcaRouter's own model page for minimax/minimax-m3, showing the breadcrumb 'Models - MiniMax: MiniMax M3', a summary describing a 428B-parameter MoE with 23B active parameters and a 1M-token context window powered by MiniMax Sparse Attention, a PERFORMANCE panel reading Avg Latency 3.2 s, Throughput 210.9 tok/s, Uptime 100.00%, Total Tokens 89.8M and Error Rate 0.13%, a MiniMax provider card reading 92.07M tokens routed in 7 days, P50 TTFT 4.26s and P95 TTFT 10.00s, and the listing rows 1,048,576 Context window, $0.30/M input and $1.20/M output.

Worauf man achten sollte und was diese Woche zu tun ist

Die Signale, die daraus einen Launch statt eines Leaks machen würden, sind konkret und überprüfbar – und es sind nicht die, die die meisten Kommentare verfolgen. Ein öffentliches Hugging-Face-Repository unter der Organisation MiniMaxAI – kein privates – mit einer Modellkarte ist der stärkste einzelne Indikator; die Upload-Historie der Organisation ist öffentlich und datiert jede Veröffentlichung auf den Tag genau. Eine MiniMax-Modellseite oder eine API-Modell-ID ist der zweite. Ein veröffentlichter Preis ist der dritte – und derjenige, der für ein Budget zählt. Eine Benchmark-Tabelle auf Artificial Analysis, datiert nach der Veröffentlichung, ist der vierte – und der einzige, der unabhängig ist.

Bis dahin ist die praktische Ausgangslage für alle, die bauen, unverändert gegenüber jeder anderen Woche vor einem Release: Das Modell, das du heute routen kannst, ist MiniMax M3, ein einziger API-Schlüssel erreicht es neben über 200 weiteren Modellen, automatisches Failover bedeutet, dass ein wackelnder Endpunkt nicht zu deinem Ausfall wird, und eine feste oder gemischte Route über die Routing-DSL oder ein Panel von Modellen, die per Modell-Fusion gemeinsam antworten, ist der Weg, ein Modell abzusichern, das du noch nicht in Produktion gebracht hast. Wenn M3.1 erscheint, ist das ein Austausch einer Modell-ID, keine Migration — was genau das Argument dafür ist, keine maßgeschneiderte Integration gegen ein Leak zu bauen.

Eines wird dieser Artikel nicht tun: so tun, als wüsste er, wann. Der Kontrollpunkt ist real, die Dokumente sind konkret, und die jüngste öffentliche Aussage ist eine Person, die „nächste Woche“ sagt. Von diesen drei Dingen lassen sich nur die ersten beiden selbst überprüfen.