
MiniMax M3.1 Flash Preview vs MiniMax M3: När den nyare modellen är den riskablare
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 468 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 192 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Leverantörens egen dokumentation listar nu MiniMax-M3.1-Flash-Preview ovanför MiniMax-M3, och den ordningen gör en hel del övertalningsarbete. Det är den nyaste textmodellen i serien, den har samma kontextfönster på en miljon token och den lägger till en kontroll för tankedjup som den äldre modellen inte har. Vad tabellen inte visar är att den äldre modellen är den enda av de två som du kan ladda ner, prissätta per token, benchmarka mot vad som helst eller anropa utan prenumeration — och att den nyare har tagit bort en växel som MiniMax-M3 gav dig.
Det här är inte en berättelse om en modell som blir ersatt. Det är en berättelse om en leverantör som delar upp sin egen produktlinje i en mätarbaserad arbetshäst och en prenumerationslåst förhandsvisning, och de två är inte utbytbara åt något håll. Här är vad var och en av dem faktiskt är.
De två specifikationsbladen, sida vid sida
Börja med vad leverantörens egna sidor anger för båda, eftersom skillnadens form visar sig här snarare än i en benchmarktabell.
• Tillkännagavs — MiniMax-M3 den 1 juni 2026 med en arkitekturnot, ett benchmarkblad och en prislista; MiniMax-M3.1-Flash-Preview den 27 september 2026 med en dokumentationspost och ett inlägg på MiniMaxs agentkonto • Kontextfönster — 1 000 000 tokens för båda, enligt MiniMaxs egna modelltabeller • Maximal utdata — 512 000 tokens för MiniMax-M3 i vår katalogpost, en siffra som MiniMax inte själva publicerar; inte publicerad någonstans för MiniMax-M3.1-Flash-Preview • Indatamodaliteter — text, bild och video in, text ut, för båda • Tänkandestyrning — en tänkandeparameter som MiniMax-M3 kan instrueras att hoppa över, och som kan separeras till ett reasoning_details-fält via reasoning_split; på MiniMax-M3.1-Flash-Preview är tänkande obligatoriskt och reasoning_split kan inte stängas av • Tänkandedjup — inte tillgängligt på MiniMax-M3; en effort-stege med low, medium, high, xhigh och max, med standardvärdet max, på MiniMax-M3.1-Flash-Preview • Publicerad utdatahastighet — ungefär 100+ tokens per sekund för MiniMax-M3, enligt MiniMaxs egen modelltabell; inget publicerat för MiniMax-M3.1-Flash-Preview • Vikter — MiniMax-M3 har öppna vikter och ett offentligt repository; MiniMax-M3.1-Flash-Preview har inget • Prissättning — $0,30 per miljon indatatokens och $1,20 per miljon utdatatokens för MiniMax-M3 enligt leverantörens taxa; ingen per-token-taxa finns för MiniMax-M3.1-Flash-Preview • Åtkomst — MiniMax-M3 på pay-as-you-go och på Token Plan, och kan dirigeras via tredjepartsplattformar; MiniMax-M3.1-Flash-Preview endast på Token Plan och MiniMax Code
Två rader där tillhör en annan kategori än resten. Den publicerade utdatahastigheten är en leverantörssiffra för enbart den äldre modellen, så den nyare modellen säljs som den snabba utan att någon siffra anges. Och kontrollen över tänkandet har gått i motsatt riktning mot marknadsföringen: den nyare modellen erbjuder finare kontroll över hur mycket den tänker, samtidigt som den tar bort din möjlighet att stoppa den från att tänka alls.
Omkopplaren som MiniMax tog bort
Det här är detaljen som mest sannolikt ställer till problem, och den är dokumenterad i stället för dold. Med MiniMax-M3 hoppar thinking: {type: disabled} över tänkandet när det skickas till det OpenAI-kompatibla API:et och returnerar ett direkt svar; i det Anthropic-kompatibla API:et är tänkandet avstängt som standard och kan aktiveras med adaptive På MiniMax-M3.1-Flash-R1 returnerar den identiska begäran HTTP 400 med requires thinking. Det finns inget sätt som stöds att få ett svar utan tänkande.
I praktiken innebär det att en arbetsbelastning som använde MiniMax-M3 som en billig, snabb klassificerare eller router – kort prompt in, kort strukturerat svar ut, ingen tankekedja – inte har någon direkt uppgraderingsväg till den nyare modellen. Du kan sänka ansträngningen till låg, och MiniMax vägledning är tydlig med att sänka ansträngningen är det avsedda sättet att minska tankelatensen och tokens i stället för att inaktivera det. Men tokens och latensen går inte till noll, och för ett extraktionsjobb med hög volym som skriver fyra fält per anrop är "tänker alltid först" en annan kostnadsform än "tänker när den ombeds".

Vad mäts egentligen på varje
Den ena sidan av den här jämförelsen har siffror och den andra har en tom kolumn, och det är värt att vara noggrann med vilka siffror som tillhör vem.
MiniMax-M3:s oberoende resultat är verkliga: Artificial Analysis placerar den på 29,2 i Intelligence Index — 60:e av 145 — med 58,6 i Coding Index, 59,18 i dess Math-index, 92,9 % på GPQA Diamond inom samma indexfamilj, 83 % långkontextsåterkallelse och 82,9 % på IFBench. Det är tredjepartsutvärderingar av en modell som vem som helst kan ladda ner och köra igen. MiniMaxs egna lanseringssiffror för M3 — BrowseComp på 83,5 %, SWE-Bench Pro på 59,0 %, Terminal-Bench 2.1 på 66,0 %, MCP Atlas på 74,2 %, OSWorld-Verified på 70 % — är leverantörssiffror och vi har inte sett dem reproducerade.
MiniMax-M3.1-Flash-Preview har varken det ena eller det andra. MiniMax publicerade ingen benchmarktabell, och modellen finns inte med i Artificial Analysis-indexet, så det finns ingen oberoende poäng, inget kodningsindex, ingen siffra för långkontextsåterkallning och ingen hallucinationsmätning. Varje beskrivning av den som är i omlopp – "snabb", "pålitlig", "byggd för vardaglig utveckling" – är leverantörens eget adjektiv från lanseringsinlägget. Avsaknaden är värd att säga rakt ut eftersom den går åt båda hållen: inget har visats vara sämre, och inget har visats vara bättre.
Den asymmetrin är hela beslutet. Du kan utvärdera MiniMax-M3 i eftermiddag genom att ladda ner det eller anropa det, och du kan jämföra den utvärderingen med en offentlig resultattavla. Med MiniMax-M3.1-Flash-Preview kan du bara använda det och bilda dig en privat uppfattning.
Där den nyare modellen verkligen vinner
Det skulle vara lätt att läsa ovanstående som ett argument för att ignorera den nya modellen, och det är inte heller rätt slutsats. Tre saker är verkliga och specifika för den.
Ansträngningstrappan är en genuin förmåga, inte en på/av-knapp. Fem nivåer – låg till max – låter en och samma modell hantera en rutinmässig namnändring och en refaktorering i hela kodbasen till olika beräkningskostnader, och den är dokumenterad som effektiv enbart för MiniMax-M3.1-Flash-Preview. På MiniMax-M3 är ditt val binärt. Om problemet är att du inte kan förutsäga latensen per uppgift, är ett justerbart djup exakt den kontroll du ville ha.
Det är leverantörens nuvarande toppmodell, vilket innebär att den ärver allt som M-serien har lärt sig sedan juni, och MiniMax säger uttryckligen att den är den senaste modellen för agentiskt resonemang, verktygsanvändning, kodning och uppgifter med lång kontext. Maskineriet för verktygsanvändning med sammanflätat tänkande som M3 introducerade förs vidare, inklusive kravet att lägga tillbaka hela svaret – tankeblock och allt – i meddelandehistoriken.
Och den tar emot video, till en Flash-prisnivå, inom en prenumeration. Det gör MiniMax-M3 också, till ett pris per token. Om du redan betalar för en Token Plan-plats och det enda som hindrade dig från att använda videoinmatning var marginalkostnaden per anrop, tar M3.1-Flash-Preview bort det hindret.
Där den äldre modellen fortfarande är den som gäller
Tre fall, alla om förutsägbarhet snarare än kvalitet
När du behöver räkna på kostnad. MiniMax-M3 har en prislista: 0,30 USD per miljon indatatoken, 1,00 USD per miljon utdatatoken och en cacheavgift på 0,06 USD per miljon i vår katalog. Du kan räkna ut en arbetsbelastnings månadsräkning på öret innan du kör den. MiniMax-M3.1-Flash-Preview har inget pris per token någonstans på MiniMaxs sidor, så dess kostnad blir din prenumeration delad med hur mycket du än använder den – bra för en fast budget, värdelös för enhetskostnadsekonomi.
När du behöver att modellen ska vara modellen. MiniMax-M3 har öppna vikter: du kan ladda ner den, köra den på din egen hårdvara och veta att artefakten som svarar på dina anrop om sex månader är samma som svarar på dem idag. MiniMax-M3.1-Flash-Preview har ingen checkpoint, och åtkomst av förhandsversionstyp innebär att serveringsstacken, kvotsammansättningen och tillgängligheten alla är leverantörsstyrda och uttryckligen kan komma att ändras.
När du behöver ett svar utan resonemang. Som ovan – detta är den enda kapacitetsregressionen i jämförelsen, och det är den som förvånar folk, eftersom en nyare modell som inte klarar något som den äldre kunde inte är ett fall som någon planerar för.

Ringer båda från en och samma plats
Det besvärliga här är att de två modellerna köps på olika sätt – en användningsbaserad, en via prenumeration – och den naturliga instinkten är att välja sida. Det mer användbara draget är att routa mellan dem beroende på uppgiftens karaktär, vilket bara fungerar om den användningsbaserade sidan är nåbar från samma plats som allt annat.
MiniMax-M3 på OrcaRouter har MiniMax listpris med 0 % påslag, så $0,30 och $1,20 på prislistan är vad ett anrop kostar, utan någon plattformsmarginal ovanpå. Den ligger på samma OpenAI-kompatibla slutpunkt som MiniMax M2.7 — samma prislapp på $0,30/$1,20 över ett fönster på 200 000 tokens, också med öppna vikter — och som 200+ andra modeller, bakom en enda API-nyckel, med automatisk failover mellan leverantörer när en slutpunkt krånglar. Jämfört med vår egen telemetri, som är en annan sorts siffra än en leverantörs: under de senaste sju dagarna har M3 svarat på ungefär 238 utdatatokens per sekund vid ett p50 på cirka 4,1 sekunder till första token, med en felfrekvens nära 0,15 %, mätt i OrcaRouter-lekplatsen. Om du vill hålla MiniMax-M3 som den pålitliga halvan av en pipeline och behandla MiniMax-M3.1-Flash-Preview som den experimentella halvan, är den pålitliga halvan en enda rad konfiguration i stället för en andra leverantörsrelation. MiniMax-M3.1-Flash-Preview finns inte i vår katalog; vägen dit är leverantörens egen Token Plan och kodningsprodukt.
Det som skulle förändra den här artikeln är konkret och lätt att hålla utkik efter. En publicerad prislista för MiniMax-M3.1-Flash-Preview skulle undanröja det främsta skälet att föredra M3 av ekonomiska skäl. En uppsättning oberoende betyg skulle ersätta den tomma kolumnen med något jämförbart. En nedladdningsbar checkpoint skulle undanröja reproducerbarhetsinvändningen. Tills åtminstone en av dessa kommer, förblir MiniMax-M3 modellen i det här paret som du kan ställa till svars — och den nyare förblir den snabbare, bättre kontrollerade, omätta förhandsversionen som MiniMax har beslutat att ta betalt för per månad i stället för per token.

