
MiniMax M3.1: Vad de läckta förhandsvisningsdokumenten säger – och vad ingen har bekräftat
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 434 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 183 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Det finns en 250 GB stor checkpoint på Hugging Face som heter MiniMax-M3.1-preview-private som ingen utanför en handfull inferenspartner kan öppna. Det finns ett dokument daterat den 22 september som är formulerat precis som leverantörens arkitekturnot och som cirkulerar i ett offentligt partner-engineering-repository i stället för på leverantörens egen sajt. Och den 26 september skrev en modellbevakare med många följare att MiniMax M3.1 är "nästa kommande modell för den kommande veckan" och att de redan testar en förhandsversion av den. Lägger man ihop dessa tre har man hela det offentliga underlaget om MiniMax M3.1 – en modell vars namn, arkitekturändringar, antal vikter och ankomstvecka alla cirkulerar, och som leverantören inte har sagt ett ord om offentligt. Föregångaren som den härstammar från, MiniMax M3, är en annan historia: den släpptes, och det är anledningen till att någon bryr sig om den här.
Så här ser en ännu inte släppt modell ut utifrån, och det är värt att vara noggrann med bevisens form, eftersom de tre trådarna inte är lika starka. Checkpointens existens styrks: flera oberoende linjer pekar på samma privata repo-namn och samma filantal. Arkitekturdokumentet styrks inte på det sättet – det är en tredje parts transkription, och det kan vara äkta, inaktuellt eller delvis påhittat. Påståendet om "kommande vecka" är en persons förväntan, inte en tidplan. Allt i den här artikeln är märkt med den styrka det faktiskt har, och inget här bör läsas som ett släppmeddelande.
Det som gör MiniMax M3.1 värt en artikel innan den ens finns är föregångaren. MiniMax M3 var enligt de flesta bedömningar den starkaste open-weight-modellen MiniMax hade släppt – en 1M-token text-bild-video-modell som nådde 29,2 på Artificial Analysis Intelligence Index och fortfarande är en av få öppna modeller som kommer att hålla ihop en verkligt lång kontext. Om M3.1 landar i sista veckan i september är siffrorna som spelar roll för en utvecklare inte läckans trovärdighet utan vad som har förändrats i lagren och vad det kostar att serva – och i båda dessa avseenden är det läckta dokumentet ovanligt specifikt.
Vad är bekräftat, och vad är bara i omlopp?
Den ärliga uppdelningen, från och med den 27 september 2026:
• Bekräftat: ingen offentlig version av MiniMax M3.1 existerar. MiniMaxAI-organisationen på Hugging Face returnerar 401 – plattformens svar "hittades inte eller är inte synligt för dig" – för MiniMaxAI/MiniMax-M3.1, MiniMaxAI/MiniMax-M3.1-preview och MiniMaxAI/MiniMax-M3.1-preview-private likaså. De senaste offentliga uppladdningarna är fortfarande MiniMax-Music3 (7 augusti 2026) och MiniMax-H3 (28 juli 2026).
• Bekräftat: MiniMax M3.1 går inte att routa någonstans vi kan kontrollera. Det saknas i OrcaRouters modellkatalog och i de offentliga listningar vi bevakar; den MiniMax-modell du faktiskt kan anropa idag är MiniMax M3, på minimax/minimax-m3.
• Bekräftat: MiniMax har inte publicerat något. Inget modellkort, inget blogginlägg, ingen prissättningssida, inga vikter, inget API-modell-ID. Det finns ingen pressbevakning av en lansering eftersom det inte har skett någon lansering.
• I omlopp: arkitekturdokumentet. Det återges ordagrant i ett offentligt kodförråd – longsco/innoferra-eval, en partnerintroduktionssvit för värdbaserade modellslutpunkter, skapad den 23 september 2026 – under filnamnet PREVIEW-20260922.md, med en rubrik som beskriver det som ett leverantörsdokument som delades den 25 september och ett förbehåll om att "modellnamn, leverantörens releasedatum och offentlig lansering är alltjämt beroende av den faktiska utgivningen." Det är dokumentets eget förbehåll, inte vårt, och det är det rätta: en tredje parts kopia av en leverantörsnotis är inte ett uttalande från MiniMax.
• I omlopp: 250 GB-checkpointen och dess andra släpp. Repositoriets onboarding-specifikation dokumenterar en privat multimodalt checkpoint på MiniMaxAI/MiniMax-M3.1-preview-private — 62 filer, 48 safetensors-filer, ungefär 250 GB, arkitektursträngen MiniMaxM3SparseForConditionalGeneration — och sedan ett större andra släpp, MiniMax-M3.1-preview2-dspark-private, med 101 filer och omkring 236 GB, som lade till ett 2,3 GB fp8-spekulativt utkast. Båda är privata. Vi kan inte öppna någon av dem, och det kan inte du heller.
• I omlopp: tidslinjen. Inlägget den 26 september är den enda offentliga tidsangivelsen som någon har erbjudit, och "kommande vecka" är en förväntan. Betrakta veckan från den 28 september som fönstret att bevaka, inte som ett datum.
Det enda dokumentet som innehåller den tekniska detaljen
![A headless Chromium screenshot of the public GitHub page for the file PREVIEW-20260922.md inside the repository longsco/innoferra-eval, showing the file path models/minimax-m3.1/PREVIEW-20260922.md, the markdown body describing MiniMax M3.1's sparse attention across all layers, the Q8KV4 attention quantisation in E2M1 blocks of 16 with a per-block E4M3 scale of amax/6 clamped to [1/512, 448] and round-half-to-even thresholds, the W4A4 NVFP4 routed experts with FC1 row scale 2688 divided by the row absolute maximum and FC2 fixed scale 16, the DSpark speculative-decoding head with no confidence head, the new reasoning_effort field taking max/xhigh/high/medium/low, and the line 'No 3.1 baselines published yet; do not reuse M3 numbers as acceptance bars.'](https://cms.orcarouter.ai/api/media/file/2-1348.png)
Allt specifikt som är känt om designen hos MiniMax M3.1 kan spåras tillbaka till den där enda markdown-filen, plus två kompletterande filer i samma kodförråd: ett SGLang-demodokument som beskriver hur checkpointen är tänkt att serveras, och en spec.yaml som en partnerändpunkt förväntas uppfylla. Läser man kodförrådet som helhet ser det ut som en inferensleverantör som gör precis vad en inferensleverantör gör – tar emot en tidig version från MiniMax, skriver ned vad som ändrats och bygger en valideringssvit för den. Kodförrådet är inte ett pressmaterial och det är inte skrivet för att övertyga någon.
Det är en poäng till dess fördel, och det är också gränsen för vad det bevisar. Ingenting i det är signerat av MiniMax. De tre dokumenten stämmer överens med varandra på det sätt som riktiga dokument stämmer överens — samma kvantiseringskonstanter, samma miljövariabelnamn, samma startflaggor — och skiljer sig åt på det sätt som riktiga släpp skiljer sig åt: förhandsvisningen den 22 september säger att den nya metoden för spekulativ avkodning inte har något konfidenshuvud, och det andra checkpoint-släppet levererade en utkastkonfiguration med enable_confidence_head satt till true. En fabricering skulle vanligtvis inte innehålla en korrigeringsbåge. Men "ovanligt sammanhängande" är inte "bekräftat", och felmoden för en läsare är att absorbera konstanterna nedan som MiniMaxs publicerade design när de på sin höjd är MiniMaxs privata design såsom läst av någon annan.
De fem tekniska ändringarna, enligt det dokumentet
Här är deltat mellan MiniMax M3 och MiniMax M3.1 såsom dokumentet beskriver det. Varje rad kommer från leverantören och är ogranskad — ingen oberoende part har mätt någon form av utdata från MiniMax M3.1.
• Attention-täckning. Full attention i de första tre lagren ersätts med gles attention, så alla lager är glesa. På MiniMax M3 var de första tre lagren ankaret för full attention i den glesa stacken.
Attention-precision – "Q8KV4". Queries, inklusive indexerarens queries, kommer ut ur projektionen i BF16 och castas till FP8 E4M3. Keys och values – återigen inklusive indexerarens – kvantiseras till E2M1, fyra bitar, i block om 16, med en E4M3-skala per block på amax/6 begränsad till [1/512, 448]. Dokumentet understryker att stegen är round-half-to-even med asymmetriska trösklar, att den yttre tensorskalan är exakt 1 och att en magnitud på noll måste kodas som positiv nolla. M3 använde en 8-bitars KV-väg av samma familj, så detta halverar KV-byten igen.
• Expertprecision. De MoE-routade experterna flyttas från MXFP8 till W4A4 NVFP4, med den delade experten avsiktligt utesluten. De två expertprojektionerna får olika aktiveringsscheman: FC1 använder en dynamisk skala per rad som är 2688 dividerat med radens absoluta maximum, där radskalan tillämpas efter GEMM men före aktiveringsfunktionen; FC2 använder en fast yttre skala på 16. Den praktiska konsekvensen, som uttryckligen anges i partnerns README, är krass: "en leverantör som kör checkpointen genom en generisk NVFP4-väg utan dessa kommer att i tysthet producera avvikande numerik."
• Spekulativ avkodning. EAGLE-liknande multi-token-prediction-huvudet är borta, ersatt av en metod som MiniMax kallar DSpark — ett vanligt Markov-huvud, och i dokumentet från 22 september inget konfidenshuvud. Detta är den förändring som har störst effekt på hur en betjänad slutpunkt upplevs, eftersom det är den enda spaken för hastighet per ström i designen. Demomotorn som MiniMax levererade tillsammans med checkpointen innehåller inte DSpark, och leverantören mätte gapet: på samma 80 000-token-ram utan spekulation är genomströmningen per ström 63,9 token per sekund vid samtidighet 1 och faller under 60 vid samtidighet 4, så dokumentets egen slutsats är att utan DSpark kan stacken inte hålla sitt latensmål under belastning.
• Ett nytt förfrågningsfält. MiniMax M3.1 lägger till ett fält på toppnivå, reasoning_effort, som tar max, xhigh, high, medium eller low och injiceras i systemprompten som en effort-tagg av chattmallen. M3 hade bara en thinking-brytare med adaptive och disabled. Dokumentet noterar, märkligt och specifikt, att fältet förs vidare utan validering och utan någon obligatorisk standard — vilket leverantören tolkade som tillstånd att antingen acceptera eller avvisa ett icke listat värde, och vilket innebär att två kompatibla slutpunkter skulle kunna bete sig olika för samma begäran.

Två detaljer i checkpointen förtjänar att lyftas separat, eftersom de är sådant som ett lanseringsinlägg utelämnar. För det första levereras checkpointen med både en bildförbehandlingskonfiguration och en videoförbehandlingskonfiguration — MiniMax M3.1 är en multimodal modell från grunden, inte en textmodell med vision påmonterad i efterhand, och leverantörens egen vägledning är att inte avvisa bildindata i den nya stacken. För det andra tog den andra checkpoint-släppet bort MTP- och NEXTN-nycklarna helt och lade inte till något som ersätter dem, vilket är anledningen till att DSpark-utkastet var tvunget att komma som en separat artefakt på 2,3 GB. Det finns inget draft-huvud i huvudvikterna att aktivera.
Varför det inte finns några M3.1-benchmarksiffror, och varför det inte är ett förbiseende
Varje läckrapport når till slut den punkt där den antingen hittar på en benchmarktabell eller erkänner att den inte har någon. MiniMax M3.1 har ingen. Partnerspecifikationen säger det uttryckligen, i ett fält som finns enbart för att hindra någon från att göra misstaget:
• "Inga 3.1-baslinjer publicerade ännu; återanvänd inte M3-siffror som acceptansgränser."
Den instruktionen är den mest användbara meningen i hela korpusen, eftersom den lata versionen av den här artikeln skriver MiniMax M3:s Artificial Analysis-poäng under en rubrik för MiniMax M3.1. Det borde den inte göra. Samma kodförråd kör AIME-25- och GPQA-Diamond-prober mot MiniMaxs egen M3.1-endpoint och registrerar dem som jämförelser mellan teammedlem och leverantör, där poängen inte är fastställda: på GPQA-Diamond 0,904 för teamets körning mot 0,813 för leverantörens, och på en MMLU-Pro-delmängd med 600 frågor 0,898 mot 0,821. Det är två körningar av samma utvärdering som inte stämmer överens, inte ett modellresultat, och de är märkta som en förhandsvisning med upprepningar inräknade. Den som i dag citerar en enda benchmark-siffra för MiniMax M3.1 citerar något som ännu inte existerar.
Vad MiniMax M3 är, så att uppföljaren kan dimensioneras
MiniMax M3 släpptes i slutet av maj 2026 och lades upp på Hugging Face den 2 juni — 428 miljarder parametrar totalt, varav 23 miljarder aktiva, 60 lager, 128 routade experter med top-4-routing, 4 KV-huvuden mot 64 attention-huvuden, och ett kontextfönster på 1 048 576 token med en maximal utdata på 512 000. På den oberoende fronten ger Artificial Analysis den 29,2 på Intelligence Index, vilket placerar den på 60:e plats av 145 modeller i urvalet, med 58,6 på kodningsindexet och en p50 på 3 348 millisekunder till första token i vår egen routingtelemetri. MiniMax egen officiella siffra för modellen är 83,5 på BrowseComp, vilket är en leverantörssiffra och som sådan oreviderad.
Prissättning är den del som åldras bäst i en läckagecykel. MiniMax M3 kostar 0,30 USD per miljon indatatokens och 1,20 USD per miljon utdatatokens, med cachade läsningar för 0,06 USD — och den är tillgänglig på OrcaRouter som minimax/minimax-m3, till leverantörens listpris med 0 % påslag, så om MiniMax prissätter M3.1 på samma sätt är den nya taxan aktiv hos oss samma dag som den finns i stället för en faktureringscykel senare.
Poängen med att upprepa allt detta är inte nostalgi. Det är att hela anledningen till att någon den här veckan laddar om en organisationssida på Hugging Face är att MiniMax M3 var tillräckligt bra för att dess efterträdare är en produktionsfråga snarare än en åskådarsport – och att en modell med 428 miljarder parametrar och 1M kontext till $0,30/$1,20 sätter en ribba för pris/prestanda som M3.1 måste klara, inte bara en ribba för förmåga.
Vinkeln med anonyma annonser, och varför den kanske redan har besvarats
En tråd från tidigare i september är värd att avsluta här. En anonym stealth-listning dök upp på en tredjepartsplattform för kodning med en kontext på 1 000 000 tokens, $0-prissättning och obligatoriska resonemangsnivåer, och vi rapporterade om den under namnet Space Bunny Alpha och noterade basfrekvensen att varje anonym listning av detta slag till slut görs anspråk på av en leverantör — Pony Alpha blev en Zhipu-modell, Hunter Alpha blev Xiaomis, Ox Alpha blev en MiniMax-lansering under ett annat namn. Tokeniseraren och anomalifingeravtrycken i den listningen pekade mot en MiniMax-checkpoint för förhandsvisning. Om MiniMax M3.1 verkligen kommer den här veckan är den mest sannolika tolkningen att den anonyma listningen var dess fälttest, och mysteriet löses genom ett tillkännagivande snarare än genom ytterligare forensiskt arbete. Det är en slutledning, inte bevis, och det är den sista slutledningen i den här artikeln.

Vad du bör se upp med, och vad du bör göra den här veckan
Signalerna som skulle göra detta från en läcka till en lansering är specifika och kontrollerbara, och de är inte de som de flesta kommentarer spårar. Ett offentligt Hugging Face-arkiv under organisationen MiniMaxAI – inte ett privat – med ett modellkort är den starkaste enskilda indikatorn; organisationens uppladdningshistorik är offentlig och daterar varje släpp till dagen. En MiniMax-modellsida eller API-modell-ID är den andra. Ett publicerat pris är den tredje, och den som spelar roll för en budget. En benchmarktabell på Artificial Analysis daterad efter släppet är den fjärde, och den enda som är oberoende.
Fram till dess är det praktiska läget för alla som bygger oförändrat jämfört med vilken annan vecka före lansering som helst: modellen du kan routa till idag är MiniMax M3, en API-nyckel når den tillsammans med 200+ andra modeller, automatisk failover innebär att en endpoint som svajar inte blir ditt avbrott, och en pinnad eller blandad rutt genom routing-DSL:en eller en panel av modeller som svarar tillsammans via modellfusion är hur du minskar risken med en modell du inte har produktionssatt. Om M3.1 kommer är det ett byte av ett modell-ID, inte en migrering – vilket är hela argumentet för att inte bygga en skräddarsydd integration mot en läcka.
En sak som den här artikeln inte kommer att göra är att låtsas veta när. Kontrollpunkten är verklig, dokumenten är specifika, och det senaste offentliga påståendet är en person som säger "nästa vecka". Av de tre är det bara de två första som du själv kan verifiera.
