Een gegenereerde hero-kaart met de titel MiniMax M3.1, met een badge met de tekst 'NIET GEVERIFIEERD - NOG NIET UITGEBRACHT' en de ondertitel 'Een 250 GB privé-checkpoint, een uitgelekte architectuurnotitie en een leverancier die niets heeft gezegd'. Drie chips tonen 'Checkpoint: MiniMax-M3.1-preview-private', '62 bestanden / 48 safetensors / 250 GB' en 'Volgvenster: week van 28 september 2026'. Een linkerkaart toont 'De claim: sparse attention, Q8KV4 attention, NVFP4 experts, DSpark spec-decode en een nieuw reasoning_effort-veld'; een rechterkaart toont 'Geen lancering bevestigd: geen gewichten, geen model card, geen prijspagina, geen API-model-id'. Het OrcaRouter-logo staat rechtsonder.
Guides & Insights

MiniMax M3.1: Wat de gelekte previewdocumenten zeggen — en wat niemand heeft bevestigd

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Er staat een checkpoint van 250 GB op Hugging Face met de naam MiniMax-M3.1-preview-private dat niemand buiten een handjevol inference-partners kan openen. Er is een document van 22 september dat precies leest als de architectuurnotitie van de leverancier, dat circuleert in een openbare partner-engineeringrepository in plaats van op de site van de leverancier zelf. En op 26 september postte een veelgevolgde modelwatcher dat MiniMax M3.1 "het aanstaande model voor volgende week" is en dat ze al een preview ervan testen. Leg die drie bij elkaar en je hebt het volledige publieke dossier van MiniMax M3.1 — een model waarvan de naam, architectuurwijzigingen, het aantal gewichten en de week van aankomst allemaal circuleren, en waarover de leverancier in het openbaar geen woord heeft gezegd. De voorganger waarvan het afstamt, MiniMax M3, is een ander verhaal: die is uitgebracht, en dat is de reden dat iemand zich überhaupt om deze bekommert.

Dit is hoe een nog niet uitgebracht model er van buitenaf uitziet, en het loont de moeite precies te zijn over de vorm van het bewijs, omdat de drie sporen niet even sterk zijn. Het bestaan van het checkpoint wordt gestaafd: meerdere onafhankelijke aanwijzingen wijzen op dezelfde naam van een privérepository en hetzelfde aantal bestanden. Het architectuurdocument wordt niet op die manier gestaafd — het is een transcriptie van een derde partij, en het kan authentiek, verouderd of deels verzonnen zijn. De bewering over "de komende week" is iemands verwachting, geen planning. Alles in dit artikel is gelabeld met de sterkte die het daadwerkelijk heeft, en niets hier mag worden gelezen als een aankondiging van een release.

Wat MiniMax M3.1 een artikel waard maakt voordat het bestaat, is de voorganger. MiniMax M3 was volgens de meeste bronnen het sterkste open-weightmodel dat MiniMax had uitgebracht — een model met 1M tokens voor tekst, beeld en video dat op de Artificial Analysis Intelligence Index 29,2 behaalde en nog steeds een van de weinige open modellen is die een werkelijk lange context samenhangend kan vasthouden. Als M3.1 in de laatste week van september verschijnt, zijn de cijfers die voor een ontwikkelaar van belang zijn niet de geloofwaardigheid van het lek, maar wat er in de lagen is veranderd en wat het kost om te serveren — en op beide punten is het gelekte document ongewoon specifiek.

Wat is bevestigd, en wat is alleen in omloop?

De eerlijke verdeling, per 27 september 2026:

• Bevestigd: er bestaat geen publieke versie van MiniMax M3.1. De MiniMaxAI-organisatie op Hugging Face geeft 401 terug — de reactie van het platform voor "niet gevonden of niet zichtbaar voor jou" — voor zowel MiniMaxAI/MiniMax-M3.1, MiniMaxAI/MiniMax-M3.1-preview als MiniMaxAI/MiniMax-M3.1-preview-private. De nieuwste publieke uploads zijn nog steeds MiniMax-Music3 (7 augustus 2026) en MiniMax-H3 (28 juli 2026).

• Bevestigd: MiniMax M3.1 is op geen enkele plek die we kunnen controleren routeerbaar. Het staat niet in de OrcaRouter-modelcatalogus en ook niet in de openbare vermeldingen die we monitoren; het MiniMax-model dat je vandaag daadwerkelijk kunt aanroepen is MiniMax M3, op minimax/minimax-m3.

• Bevestigd: MiniMax heeft niets gepubliceerd. Geen modelkaart, geen blogpost, geen prijspagina, geen gewichten, geen API-model-ID. Er is geen berichtgeving in de pers over een lancering, omdat er geen lancering is geweest.

• In omloop: het architectuurdocument. Het is woordelijk weergegeven in een openbare repository — longsco/innoferra-eval, een onboardingpakket voor partners voor gehoste model-endpoints, aangemaakt op 23 september 2026 — onder de bestandsnaam PREVIEW-20260922.md, met een kop die het beschrijft als een leveranciersdocument dat op 25 september is gedeeld, en een voorbehoud dat "modelnaam, releasedatum van de provider en publieke lancering onder voorbehoud zijn van de daadwerkelijke release." Dat is het eigen voorbehoud van het document, niet het onze, en het is het juiste: een kopie van een leveranciersnotitie door een derde is geen verklaring van MiniMax.

• In omloop: de 250 GB-checkpoint en de tweede release ervan. De onboarding-specificatie van de repository registreert een privé-multimodale checkpoint op MiniMaxAI/MiniMax-M3.1-preview-private — 62 bestanden, 48 safetensors-bestanden, ongeveer 250 GB, architectuurstring MiniMaxM3SparseForConditionalGeneration — en dan een grotere tweede release, MiniMax-M3.1-preview2-dspark-private, met 101 bestanden en ongeveer 236 GB, die een speculatieve fp8-draft van 2,3 GB toevoegde. Beide zijn privé. We kunnen geen van beide openen, en jij ook niet.

• In omloop: de tijdlijn. De post van 26 september is de enige publieke datering die iemand heeft gegeven, en "komende week" is een verwachting. Beschouw de week van 28 september als het venster om in de gaten te houden, niet als een datum.

Het enige document dat de technische details bevat

A headless Chromium screenshot of the public GitHub page for the file PREVIEW-20260922.md inside the repository longsco/innoferra-eval, showing the file path models/minimax-m3.1/PREVIEW-20260922.md, the markdown body describing MiniMax M3.1's sparse attention across all layers, the Q8KV4 attention quantisation in E2M1 blocks of 16 with a per-block E4M3 scale of amax/6 clamped to [1/512, 448] and round-half-to-even thresholds, the W4A4 NVFP4 routed experts with FC1 row scale 2688 divided by the row absolute maximum and FC2 fixed scale 16, the DSpark speculative-decoding head with no confidence head, the new reasoning_effort field taking max/xhigh/high/medium/low, and the line 'No 3.1 baselines published yet; do not reuse M3 numbers as acceptance bars.'

Alles wat specifiek bekend is over het ontwerp van MiniMax M3.1 gaat terug op dat ene markdownbestand, plus twee begeleidende bestanden in dezelfde repository: een SGLang-demodocument dat beschrijft hoe de checkpoint bedoeld is om te worden geserveerd, en een spec.yaml waaraan een partner-endpoint zou moeten voldoen. Lees de repository als geheel en het ziet eruit als een inferenceprovider die precies doet wat een inferenceprovider doet — een vroege drop van MiniMax ontvangen, opschrijven wat er is veranderd, en een validatiesuite ervoor bouwen. De repository is geen perskit en is niet geschreven om iemand te overtuigen.

Dat is een punt in zijn voordeel, en het is ook de grens van wat het bewijst. Niets erin is ondertekend door MiniMax. De drie documenten komen met elkaar overeen op de manier waarop echte documenten overeenkomen — dezelfde kwantisatieconstanten, dezelfde namen van omgevingsvariabelen, dezelfde opstartvlaggen — en verschillen van elkaar op de manier waarop echte releases van elkaar verschillen: de preview van 22 september zegt dat de nieuwe methode voor speculatieve decoding geen confidence head heeft, en de tweede checkpointrelease werd geleverd met een conceptconfiguratie waarin enable_confidence_head op true was ingesteld. Een verzinsel zou gewoonlijk geen correctieboog bevatten. Maar "ongewoon coherent" is niet "bevestigd", en de faalmodus voor een lezer is om de onderstaande constanten te beschouwen als het gepubliceerde ontwerp van MiniMax, terwijl ze op zijn hoogst het privéontwerp van MiniMax zijn zoals gelezen door iemand anders.

De vijf technische wijzigingen, volgens dat document

Hier is het verschil tussen MiniMax M3 en MiniMax M3.1 zoals het document het beschrijft. Elke regel is afkomstig van de leverancier en niet gecontroleerd — geen enkele onafhankelijke partij heeft een MiniMax M3.1-output van welke aard dan ook gemeten.

• Aandachtsdekking. Volledige aandacht in de eerste drie lagen wordt vervangen door sparse attention, dus alle lagen zijn sparse. Bij MiniMax M3 vormden de eerste drie lagen het anker voor volledige aandacht binnen de sparse-stack.

• Attention-precisie — "Q8KV4". Queries, inclusief die van de indexeerder, komen uit de projectie in BF16 en worden gecast naar FP8 E4M3. Keys en values — wederom inclusief die van de indexeerder — worden gekwantiseerd naar E2M1, vier bits, in blokken van 16, met een E4M3-schaal per blok van amax/6, begrensd tot [1/512, 448]. Het document benadrukt met klem dat de ladder round-half-to-even is met asymmetrische drempels, dat de buitenste tensorschaal exact 1 is, en dat een magnitude van nul als positieve nul moet worden gecodeerd. M3 gebruikte een achtbits-KV-pad uit dezelfde familie, dus dit halveert het aantal KV-bytes opnieuw.

• Precisie van experts. De MoE-gerouteerde experts stappen over van MXFP8 naar W4A4 NVFP4, waarbij de gedeelde expert bewust is uitgesloten. De twee expertprojecties krijgen verschillende activatieschema's: FC1 gebruikt een dynamische schaal per rij van 2688 gedeeld door het absolute maximum van de rij, waarbij de rijschaal na de GEMM maar vóór de activatiefunctie wordt toegepast; FC2 gebruikt een vaste buitenschaal van 16. De praktische consequentie, uiteengezet in de partner-README, is onverbloemd: "een provider die het checkpoint via een generiek NVFP4-pad uitvoert zonder deze, zal stilzwijgend afwijkende numerieke resultaten produceren."

• Speculatief decoderen. De EAGLE-achtige multi-tokenvoorspellingshead is verdwenen, vervangen door een methode die MiniMax DSpark noemt — een gewone Markov-head, en in het document van 22 september geen confidence-head. Dit is de wijziging met het grootste effect op hoe een geserveerd endpoint aanvoelt, omdat het de enige snelheidshefboom per stream in het ontwerp is. De demo-engine die MiniMax samen met de checkpoint heeft meegeleverd, bevat DSpark niet, en de provider heeft het verschil gemeten: op hetzelfde frame van 80.000 tokens zonder speculatie is de doorvoer per stream 63,9 tokens per seconde bij concurrency 1 en zakt die onder 60 bij concurrency 4, dus de eigen conclusie van het document is dat de stack zonder DSpark zijn latentiedoel onder belasting niet kan halen.

• Een nieuw verzoekveld. MiniMax M3.1 voegt een reasoning_effort-veld op het hoogste niveau toe dat max, xhigh, high, medium of low aanneemt, door de chat-template als effort-tag in de systeemprompt geïnjecteerd. M3 had alleen een denkschakelaar met adaptive en disabled. Het document merkt vreemd en specifiek op dat het veld wordt meegestuurd zonder validatie en zonder vereiste standaardwaarde — wat de provider opvatte als toestemming om een waarde die niet in de lijst staat te accepteren of te weigeren, en wat betekent dat twee conforme endpoints zich bij hetzelfde verzoek anders kunnen gedragen.

A generated single-column infographic titled 'MiniMax M3.1 — the scoreboard', listing six vendor-document deltas: 'Attention: all layers sparse', 'KV precision: Q8KV4, E2M1 blocks of 16', 'Routed experts: W4A4 NVFP4', 'Spec-decode: DSpark, no confidence head', 'Reasoning control: reasoning_effort max to low', and 'Benchmarks: none published'. A footer reads 'MiniMax M3.1 terms per a 2026-09-22 vendor preview document cited in partner engineering notes; unaudited, no independent scores exist.' The OrcaRouter logo sits bottom-right.

Twee details in de checkpoint zijn het apart vermelden waard, omdat het precies het soort dingen is dat een post over de lancering weglaat. Ten eerste wordt de checkpoint geleverd met zowel een configuratie voor beeldvoorverwerking als een configuratie voor videovoorverwerking — MiniMax M3.1 is door zijn opzet een multimodaal model, geen tekstmodel met vision er later aan vastgeschroefd, en de richtlijn van de provider zelf is om beeldinvoer op de nieuwe stack niet te weigeren. Ten tweede heeft de tweede checkpoint-drop de MTP- en NEXTN-sleutels volledig verwijderd en niets toegevoegd dat daarvoor in de plaats komt, waardoor de DSpark-draft als een apart artefact van 2,3 GB moest komen. Er zit geen draft head in de hoofdgewichten om in te schakelen.

Waarom er geen M3.1-benchmarkcijfers zijn, en waarom dat geen vergissing is

Elke leak-publicatie belandt uiteindelijk bij het punt waarop ze ofwel een benchmarktabel verzint, ofwel toegeeft dat ze er geen heeft. MiniMax M3.1 heeft er geen. De partnerspecificatie zegt dat expliciet, in een veld dat er puur bestaat om te voorkomen dat iemand die fout maakt:

"Nog geen 3.1-baselines gepubliceerd; gebruik M3-cijfers niet opnieuw als acceptatiedrempels."

Die instructie is de nuttigste zin in het hele corpus, want de luie versie van dit artikel schrijft de Artificial Analysis-scores van MiniMax M3 onder een kop voor MiniMax M3.1. Dat zou niet moeten. Dezelfde repository voert AIME-25- en GPQA-Diamond-probes uit tegen MiniMax' eigen M3.1-endpoint en registreert ze als teamgenoot-tegen-leverancier-vergelijkingen, waarbij de scores nog niet vaststaan: op GPQA-Diamond 0,904 voor de run van het team tegenover 0,813 voor die van de leverancier, en op een MMLU-Pro-subset van 600 vragen 0,898 tegenover 0,821. Dat zijn twee runs van dezelfde evaluatie die van elkaar afwijken, geen modelresultaat, en ze zijn gelabeld als een preview waarbij herhalingen zijn meegeteld. Iedereen die vandaag één enkel MiniMax M3.1-benchmarkgetal citeert, citeert iets dat nog niet bestaat.

Wat MiniMax M3 is, zodat de omvang van het vervolg kan worden bepaald.

MiniMax M3 werd eind mei 2026 uitgebracht en verscheen op 2 juni op Hugging Face — 428 miljard totale parameters met 23 miljard actieve, 60 lagen, 128 gerouteerde experts met top-4-routing, 4 KV-heads tegenover 64 attention-heads, en een contextvenster van 1.048.576 tokens met een maximale uitvoer van 512.000. Aan de onafhankelijke kant geeft Artificial Analysis het een score van 29,2 op de Intelligence Index, goed voor een 60e plaats van de 145 bemonsterde modellen, met 58,6 op de coding index en een p50 van 3.348 milliseconden tot het eerste token in onze eigen routingtelemetrie. MiniMax' eigen opvallendste cijfer ervoor is 83,5 op BrowseComp, wat een leverancierscijfer is en als zodanig niet geauditeerd.

Prijsstelling is het onderdeel dat het beste veroudert in een leakcyclus. MiniMax M3 kost $0,30 per miljoen inputtokens en $1,20 per miljoen outputtokens, met cached reads tegen $0,06 — en het is live op OrcaRouter als minimax/minimax-m3, tegen het listtarief van de provider met 0% opslag, dus als MiniMax M3.1 op dezelfde manier prijst, is het nieuwe tarief aan onze kant live op de dag dat het bestaat in plaats van een factureringscyclus later.

Het doel van al die herhaling is niet nostalgie. Het is dat de hele reden dat iemand deze week een organisatiepagina van Hugging Face ververst, is dat MiniMax M3 goed genoeg was dat zijn opvolger een productiekwestie is in plaats van een kijksport — en dat een model met 428 miljard parameters en een context van 1M tegen $0,30/$1,20 een lat voor prijs-prestatieverhouding zet die M3.1 moet halen, en niet alleen een capaciteitslat.

De invalshoek van anonieme vermeldingen, en waarom daar misschien al antwoord op is gegeven.

Eén draad van eerder in september is het waard hier af te sluiten. Een anonieme stealth-vermelding verscheen op een coderingsplatform van een derde partij met een context van 1.000.000 tokens, een prijsstelling van $0 en verplichte redeneerniveaus, en we behandelden die onder de naam Space Bunny Alpha, waarbij we de basiskans aanstipten dat elke anonieme vermelding van dit type uiteindelijk door een leverancier wordt opgeëist — Pony Alpha werd een Zhipu-model, Hunter Alpha werd dat van Xiaomi, Ox Alpha werd een MiniMax-release onder een andere naam. De tokenizer en de anomalie-vingerafdrukken in die vermelding wezen op een MiniMax-preview-checkpoint. Als MiniMax M3.1 deze week inderdaad verschijnt, is de meest waarschijnlijke interpretatie dat de anonieme vermelding de veldtest ervan was, en wordt het mysterie opgelost door een aankondiging in plaats van door verder forensisch werk. Dat is een gevolgtrekking, geen bewijs, en het is de laatste gevolgtrekking in dit stuk.

A headless Chromium screenshot of OrcaRouter's own model page for minimax/minimax-m3, showing the breadcrumb 'Models - MiniMax: MiniMax M3', a summary describing a 428B-parameter MoE with 23B active parameters and a 1M-token context window powered by MiniMax Sparse Attention, a PERFORMANCE panel reading Avg Latency 3.2 s, Throughput 210.9 tok/s, Uptime 100.00%, Total Tokens 89.8M and Error Rate 0.13%, a MiniMax provider card reading 92.07M tokens routed in 7 days, P50 TTFT 4.26s and P95 TTFT 10.00s, and the listing rows 1,048,576 Context window, $0.30/M input and $1.20/M output.

Waar je op moet letten, en wat je deze week moet doen

De signalen die dit van een lek in een lancering zouden veranderen, zijn specifiek en controleerbaar, en het zijn niet de signalen waar de meeste commentaren zich op richten. Een openbare Hugging Face-repository onder de MiniMaxAI-organisatie — niet een privé-repository — met een modelkaart is de sterkste afzonderlijke indicator; de uploadgeschiedenis van de organisatie is openbaar en dateert elke release tot op de dag nauwkeurig. Een MiniMax-modelpagina of API-model-ID is de tweede. Een gepubliceerde prijs is de derde, en degene die van belang is voor een budget. Een benchmarktabel op Artificial Analysis gedateerd na de release is de vierde, en de enige die onafhankelijk is.

Tot dan is de praktische positie voor iedereen die bouwt ongewijzigd ten opzichte van elke andere week vóór een release: het model dat je vandaag kunt routeren is MiniMax M3, één API-sleutel bereikt het naast 200+ andere modellen, automatische failover betekent dat een haperend endpoint niet jouw storing wordt, en een vastgezette of gemengde route via de routing-DSL, of een panel van modellen die via model fusion samen antwoorden, is de manier om een model dat je nog niet in productie hebt genomen minder risicovol te maken. Als M3.1 verschijnt, is dat het verwisselen van één model-ID, geen migratie — en dat is precies het argument om geen maatwerkintegratie tegen een lek te bouwen.

Eén ding zal dit artikel niet doen: doen alsof het weet wanneer. De checkpoint is echt, de documenten zijn specifiek, en de meest recente publieke claim is iemand die "volgende week" zegt. Van de drie zijn alleen de eerste twee dingen die je zelf kunt verifiëren.