Een gegenereerde hero-kaart met de titel MiniMax M3.1 Flash Preview vs MiniMax M3, met als ondertitel 'Het nieuwste model in de reeks is niet de veiligste om aan te roepen'. Op een linkerkaart staat: 'MiniMax M3.1 Flash Preview: Token Plan van $22-$132 per maand, geen gepubliceerd tarief per token, geen gewichten, denkmodus altijd aan'; op een rechterkaart staat: 'MiniMax M3: $0,30 / $1,20 per miljoen tokens, open gewichten, denkmodus kan worden uitgeschakeld'. Een voettekst luidt: 'Beide hebben een contextvenster van 1M tokens. Cijfers voor MiniMax M3.1 Flash Preview volgens platform.minimax.io.'
Guides & Insights

MiniMax M3.1 Flash Preview vs MiniMax M3: Wanneer het nieuwere model het riskantere is

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De eigen documentatie van de leverancier vermeldt MiniMax-M3.1-Flash-Preview nu boven MiniMax-M3, en die ordening doet veel overtuigingswerk. Het is het nieuwste tekstmodel in de reeks, het heeft hetzelfde contextvenster van een miljoen tokens, en het voegt een instelling voor denkdiepte toe die het oudere model niet heeft. Wat de tabel niet laat zien, is dat het oudere model het enige van de twee is dat je kunt downloaden, per token kunt prijzen, tegen van alles kunt benchmarken of zonder abonnement kunt aanroepen — en dat het nieuwere model een schakelaar heeft weggenomen die MiniMax-M3 je gaf.

Dit is geen verhaal over een model dat wordt vervangen. Het is een verhaal over een leverancier die zijn eigen productlijn opsplitst in een op verbruik afgerekend werkpaard en een alleen via abonnement toegankelijke preview, en die twee zijn in geen van beide richtingen uitwisselbaar. Dit is wat elk van hen feitelijk is.

De twee specificatiebladen, naast elkaar

Begin met wat de eigen pagina's van de leverancier voor beide aangeven, want de vorm van het verschil komt hier naar voren en niet in een benchmarktabel.

• Aangekondigd — MiniMax-M3 op 1 juni 2026 met een architectuurnota, een benchmarkblad en een tariefkaart; MiniMax-M3.1-Flash-Preview op 27 september 2026 met een documentatie-item en een bericht op MiniMax' agent-account • Contextvenster — 1.000.000 tokens voor beide, volgens MiniMax' eigen modeltabellen • Maximale uitvoer — 512.000 tokens voor MiniMax-M3 in onze catalogusvermelding, een cijfer dat MiniMax zelf niet publiceert; nergens gepubliceerd voor MiniMax-M3.1-Flash-Preview • Invoermodaliteiten — tekst, afbeelding en video in, tekst uit, voor beide • Denksturing — een denkparameter die MiniMax-M3 kan overslaan, en die kan worden gescheiden in een reasoning_details-veld via reasoning_split; bij MiniMax-M3.1-Flash-Preview is denken verplicht en kan reasoning_split niet worden uitgeschakeld • Denkdiepte — niet beschikbaar op MiniMax-M3; een effort-ladder van low, medium, high, xhigh en max, standaard max, op MiniMax-M3.1-Flash-Preview • Gepubliceerde uitvoersnelheid — ongeveer 100+ tokens per seconde voor MiniMax-M3, volgens MiniMax' eigen modeltabel; niets gepubliceerd voor MiniMax-M3.1-Flash-Preview • Gewichten — MiniMax-M3 is open-weight met een openbare repository; MiniMax-M3.1-Flash-Preview heeft er geen • Prijzen — $0,30 per miljoen invoertokens en $1,20 per miljoen uitvoertokens voor MiniMax-M3 tegen het providertarief; er bestaat geen tarief per token voor MiniMax-M3.1-Flash-Preview • Toegang — MiniMax-M3 op pay-as-you-go en op Token Plan, en routeerbaar via platforms van derden; MiniMax-M3.1-Flash-Preview alleen op Token Plan en MiniMax Code

Twee rijen daarin horen in een andere categorie dan de rest. De gepubliceerde outputsnelheid is een leverancierscijfer voor alleen het oudere model, dus het nieuwere model wordt als het snelle verkocht zonder dat er een cijfer aan hangt. En de denkcontrole is de tegenovergestelde richting op bewogen dan de marketing: het nieuwere model biedt fijnere controle over hoeveel het nadenkt, terwijl het je vermogen wegneemt om het helemaal te laten stoppen met nadenken.

De schakelaar die MiniMax wegnam

Dit is het detail dat het meest waarschijnlijk problemen oplevert, en het is gedocumenteerd in plaats van verborgen. Bij MiniMax-M3 slaat het verzenden van thinking: {"type": "disabled"} naar het OpenAI-compatibele endpoint thinking over en retourneert een direct antwoord; op het Anthropic-compatibele endpoint staat thinking standaard uit en kan worden ingeschakeld met adaptive. Op MiniMax-M3.1-Flash-Preview retourneert het identieke verzoek HTTP 400 met de melding vereist adaptief denken. Er is geen ondersteunde manier om een niet-redenerend antwoord te krijgen.

Praktisch gezien betekent dit dat een workload die MiniMax-M3 gebruikte als een goedkope, snelle classifier of router — korte prompt erin, kort gestructureerd antwoord eruit, geen gedachteketen — geen kant-en-klare upgrade-route naar het nieuwere model heeft. Je kunt inspanningnaar laag, en de richtlijn van MiniMax is expliciet dat het verlagen van de inspanning de bedoelde manier is om denklatentie en tokens te verminderen in plaats van het denken uit te schakelen. Maar de tokens en de latentie gaan niet naar nul, en voor een hoogvolume-extractietaak die vier velden per aanroep schrijft, is "denkt altijd eerst" een ander kostenprofiel dan "denkt wanneer erom gevraagd wordt".

A generated two-column scoreboard titled 'MiniMax M3.1 Flash Preview vs MiniMax M3 — the scoreboard'. The left column, MiniMax M3.1 Flash Preview, reads 'AA Intelligence: none published', 'Thinking off: not allowed (HTTP 400)', 'Thinking depth: effort low to max', 'Published speed: none', 'Open weights: no', 'Per-token price: not published'. The right column, MiniMax M3, reads 'AA Intelligence: 29.2', 'Thinking off: supported', 'Thinking depth: not available', 'Published speed: 100+ tokens per second (vendor)', 'Open weights: yes', 'Per-token price: $0.30 / $1.20'. A footer reads 'MiniMax M3 figures per Artificial Analysis and MiniMax; MiniMax M3.1 Flash Preview has no independent scores of any kind.'

Wat wordt er eigenlijk op elk gemeten?

Eén kant van deze vergelijking bevat getallen en de andere heeft een lege kolom, en het is de moeite waard om precies te zijn over welke getallen van wie zijn.

De onafhankelijke resultaten van MiniMax-M2 zijn echt: Artificial Analysis zet het op 29,2 op de Intelligence Index — 60e van 74 — met 58,6 op de Coding Index, 59,18 op zijn Math Index, 92,9% op GPQA Diamond binnen dezelfde indexfamilie, 83% recall bij lange context en 82,9% op IFBench. Dat zijn evaluaties door derden van een model dat iedereen kan downloaden en opnieuw kan draaien. MiniMax' eigen cijfers bij de lancering van M2 — BrowseComp op 83,5%, SWE-Bench Pro op 59,0%, Terminal-Bench 2.1 op 66,0%, MCP Atlas op 74,2%, OSWorld-Verified op 70% — zijn leverancierscijfers en we hebben niet gezien dat ze zijn gereproduceerd.

MiniMax-M3.1-Flash-Preview heeft geen van beide. MiniMax heeft geen benchmarktabel gepubliceerd, en het model staat niet in de index van Artificial Analysis, dus er is geen onafhankelijke score, geen codingindex, geen cijfer voor long-context recall en geen hallucinatiemeting. Elke typering ervan die in omloop is — "snel", "betrouwbaar", "gebouwd voor dagelijkse ontwikkeling" — is het eigen adjectief van de aanbieder uit het lanceringsbericht. Het is de moeite waard die afwezigheid ronduit te vermelden, want ze werkt twee kanten op: er is niets aangetoond dat slechter is, en er is niets aangetoond dat beter is.

Die asymmetrie is de hele beslissing. Je kunt MiniMax-M3 vanmiddag evalueren door het te downloaden of door het aan te roepen, en je kunt die evaluatie vergelijken met een openbaar scorebord. Met MiniMax-M3.1-Flash-Preview kun je het alleen gebruiken en er een privémening over vormen.

Waar het nieuwere model echt wint

Het zou gemakkelijk zijn het bovenstaande te lezen als een argument om het nieuwe model te negeren, en dat is ook niet de juiste conclusie. Drie dingen zijn echt en specifiek voor dat model.

De inspanningsladder is een echte capaciteit, geen schakelaar. Vijf niveaus — laag tot en met max — laten één model een routinematige naamswijziging en een repository-brede refactor tegen verschillende rekenkosten uitvoeren, en het is gedocumenteerd als effectief voor alleen MiniMax-M3.1-Flash-Preview. Op MiniMax-M3 is je keuze binair. Als je probleem is dat je de latentie per taak niet kunt voorspellen, is een instelbare diepte precies de controle die je wilde.

Het is het huidige model dat bij de leverancier bovenaan de tabel staat, wat betekent dat het alles erft wat de M-serie sinds juni heeft geleerd, en MiniMax laat expliciet weten dat dit het nieuwste model is voor agentisch redeneren, toolgebruik, programmeren en taken met een lange context. De toolgebruikmachinerie met interleaved thinking die M3 introduceerde, wordt overgenomen, inclusief de vereiste om het volledige antwoord — denkblokken en al — terug toe te voegen aan de berichtgeschiedenis.

En het verwerkt video, tegen een Flash-prijsniveau, binnen een abonnement. MiniMax-M3 doet dat ook, tegen een prijs per token. Als je al betaalt voor een Token Plan-seat en je enige drempel voor het gebruik van video-invoer de marginale kosten per aanroep waren, dan neemt M3.1-Flash-Preview die drempel weg.

Waar het oudere model nog steeds de beste keuze is

Drie gevallen, allemaal over voorspelbaarheid in plaats van kwaliteit.

Wanneer je kosten moet modelleren. MiniMax-M3 heeft een tariefkaart: $0,30 per miljoen inputtokens, $1,20 per miljoen output, en een cache-leestarief van $0,06 per miljoen in onze catalogus. Je kunt de maandelijkse rekening van een workload tot op de cent nauwkeurig schatten voordat je die uitvoert. MiniMax-M3.1-Flash-Preview heeft nergens op de pagina's van MiniMax een tarief per token, dus de kosten zijn je abonnement gedeeld door hoeveel je het ook gebruikt — prima voor een vast budget, nutteloos voor unit economics.

Wanneer je wilt dat het model het model is. MiniMax-M3 is open-weight: je kunt het downloaden, op je eigen hardware draaien en weten dat het artefact dat over zes maanden je aanroepen beantwoordt hetzelfde is als het artefact dat ze vandaag beantwoordt. MiniMax-M3.1-Flash-Preview heeft geen checkpoint, en toegang van previewniveau betekent dat de servingstack, de quota-samenstelling en de beschikbaarheid allemaal door de leverancier worden beheerd en uitdrukkelijk aan wijziging onderhevig zijn.

Wanneer je een niet-redenerend antwoord nodig hebt. Zoals hierboven — dit is de enige capaciteitsregressie in de vergelijking, en het is juist degene die mensen verrast, want een nieuwer model dat iets niet kan wat het oudere wel kon, is geen geval waar iemand zich op voorbereidt.

A headless Chromium screenshot of MiniMax's own model documentation page, showing the note that MiniMax-M3.1-Flash-Preview is available only through Token Plan and MiniMax Code for now, followed by the language model table in which MiniMax-M3.1-Flash-Preview is listed first with a 1,000,000-token context window and the description 'Frontier multimodal coding model with 1M context window and tunable thinking depth', above MiniMax-M3 with the same 1,000,000-token window, captured 28 September 2026.

Beide vanaf één plek bellen

Het ongemakkelijke hieraan is dat de twee modellen anders worden ingekocht — het ene op verbruik, het andere via een abonnement — en de natuurlijke neiging is om een kant te kiezen. De nuttigere zet is om op basis van de vorm van de taak tussen beide te routeren, wat alleen werkt als de op verbruik gebaseerde kant vanaf dezelfde plek bereikbaar is als al het andere.

MiniMax-M3 op OrcaRouterdraagt de lijstprijs van MiniMax zonder opslag van 0%, dus de $0,30 en $1,20 op de tariefkaart zijn wat een aanroep kost, zonder platformmarge erbovenop. Het zit op hetzelfde OpenAI-compatibele endpoint als MiniMax M2.7 — dezelfde prijs van $0,30/$1,20 over een venster van 200.000 tokens, ook open-weight — en als 200+ andere modellen, achter één API-sleutel, met automatische failover tussen providers wanneer één endpoint hapert. Afgezet tegen onze eigen telemetrie, wat een ander soort cijfer is dan dat van een leverancier: in de afgelopen zeven dagen heeft M3 geantwoord met ongeveer 238 outputtokens per seconde bij een p50 van ongeveer 4,1 seconden tot het eerste token, met een foutpercentage van bijna 0,15%, gemeten op de OrcaRouter playground. Als je MiniMax-M3 wilt aanhouden als de betrouwbare helft van een pipeline en MiniMax-M3.1-Flash-Preview wilt behandelen als de experimentele helft, dan is de betrouwbare helft één regel configuratie in plaats van een tweede leveranciersrelatie. MiniMax-M3.1-Flash-Preview staat zelf niet in onze catalogus; de route ernaartoe is het eigen Token Plan en codeerproduct van de leverancier.

Wat dit artikel zou veranderen, is specifiek en gemakkelijk in de gaten te houden. Een gepubliceerde tariefkaart voor MiniMax-M3.1-Flash-Preview zou de belangrijkste reden om M3 op economische gronden te verkiezen tenietdoen. Een reeks onafhankelijke scores zou de lege kolom vervangen door iets vergelijkbaars. Een downloadbaar checkpoint zou het bezwaar van reproduceerbaarheid wegnemen. Totdat ten minste één daarvan er is, blijft MiniMax-M3 het model in dit paar dat u ter verantwoording kunt houden — en het nieuwere blijft de snellere, beter gecontroleerde, ongemeten preview waarvoor MiniMax heeft besloten per maand in plaats van per token te factureren.

A headless Chromium screenshot of the OrcaRouter model page for minimax/minimax-m3, showing the model title 'MiniMax: MiniMax M3', a context length of 1,048,576 tokens, a maximum output of 512,000 tokens, and a pricing panel reading 0.300 US dollars per million input tokens, 1.20 per million output tokens and 0.060 per million cache-read tokens, captured 28 September 2026.