
MiniMax M3.1 Flash Preview is live op het Token Plan: wat je abonnement echt ontgrendelt
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 468 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 192 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
MiniMax-M3.1-Flash-Preview ging live op 27 september 2026, en de manier waarop het live ging, is het verhaal. Het is geen pay-as-you-go-model. De leverancier heeft zijn nieuwste tekstmodel achter dezelfde Token Plan Subscription Key geplaatst die al MiniMax-M3, MiniMax M2.7 en de M2.7-highspeed-variant dekt, dus als je een plek hebt, hoef je geen nieuwe sleutel aan te maken en geen tweede contract te ondertekenen. Wat er daarnaast, vandaag de dag, ook niet is, is een prijs per token, een modelkaart, een gepubliceerde benchmark of een manier om het denken van het model uit te schakelen.
Die combinatie — frictieloze toegang gekoppeld aan volledig ongepubliceerde economische aspecten — is ongewoon genoeg om de moeite waard te zijn om te ontleden voordat iemand er een productiepipeline aan koppelt. De rest van dit stuk gaat over wat de eigen documentatie van de leverancier daadwerkelijk zegt, wat er opvallend genoeg niet in staat, en de ene regel code die je binnen een minuut vertelt of dit model past bij hoe jij werkt.
Wat is er eigenlijk op 27 september geland?
De ontwikkelaarsdocumentatie van MiniMax bevat nu een vaste opmerking, die op elke pagina over tekstmodellen wordt herhaald: MiniMax-M3.1-Flash-Preview is voorlopig alleen beschikbaar via Token Plan en MiniMax Code. Het model staat als eerste in de eigen modelltabel van de leverancier, boven MiniMax-M3, en wordt omschreven als een toonaangevend multimodaal codemodel met een contextvenster van 1M en instelbare denkdiepte.
• Contextvenster — 1.000.000 tokens, dezelfde bovengrens als MiniMax-M3
• Invoermodaliteiten — tekst, afbeelding en video, met tekst als uitvoer
• Denkdiepte — een instelling voor inspanning die de volgende waarden accepteert: laag, gemiddeld, hoog, xhigh en max, standaard ingesteld op max wanneer deze wordt weggelaten
• Protocolondersteuning — hetzelfde model-id werkt via MiniMax' Anthropic-compatibele endpoint, zijn OpenAI-compatibele endpoint en zijn OpenAI Responses-endpoint
• Beschikbaarheid — alleen Token Plan en MiniMax Code; niet bij pay-as-you-go
• Prijs — nergens een tarief per token gepubliceerd
• Gewichten — geen; de twee meest recente openbare repositories van de MiniMaxAI-organisatie blijven MiniMax-Music3 en MiniMax-H3
• Onafhankelijke benchmarks — geen; het model heeft geen vermelding in de modelindex van Artificial Analysis
Het bedrijf kondigde het diezelfde dag aan op zijn MiniMaxAgent-account en positioneerde het voor alledaagse ontwikkeling in plaats van frontier-werk: snel en betrouwbaar, van snelle bugfixes tot volledige featureontwikkeling. Dat is de briefing van een Flash-tier, niet van een flagship. Berichtgeving van derde partijen via PANews en KuCoin beschreef het in dezelfde bewoordingen en merkte op dat ontwikkelaars het model al in de MiniMax Code-kiezer hadden gespot voordat het bedrijf het bevestigde.

Welke sleutel je gebruikt, maakt meer uit dan normaal.
Dit is het onderdeel waar mensen vaak de fout mee ingaan. MiniMax hanteert twee afzonderlijke typen inloggegevens, en M3.1-Flash-Preview reageert slechts op één daarvan. De Token Plan Subscription Key komt uit Billing > Token Plan en dekt abonnementsgebruik en gekochte Credits. De pay-as-you-go API Key dekt de modellen per token. De documentatie van de leverancier stelt expliciet dat de twee niet uitwisselbaar zijn, en dat een Subscription Key kan bestaan voordat er ook maar een betaalde resource aan is gekoppeld — in welk geval het een geldige sleutel is waar niets achter zit.
De praktische test is dus niet "heb ik een MiniMax API-sleutel", maar "heb ik een Token Plan-seat". Bestaande seats zijn gedekt. De documentatie vermeldt dat een Subscription Key bruikbaar wordt wanneer een seat of Credits-toegang wordt toegewezen, en dat Credits-overloop automatisch wordt aangesproken zodra het abonnementsquotum is uitgeput.
Er is ook een documentatie-inconsistentie die het weten waard is, want die zal iedereen verwarren die eerst de prijzenpagina leest. De voetnoot over de dekking op de prijzenpagina van Token Plan noemt de in aanmerking komende line-up nog steeds M3, M2.7, afbeelding en spraak, met H3 uitgesloten — deze is niet bijgewerkt om M3.1-Flash-Preview te vermelden. De modelpagina's zeggen het tegenovergestelde: dat M3.1-Flash-Preview beschikbaar is op Token Plan en nergens anders. Beide pagina's zijn op dit moment live leverancierspagina's. Alleen de sleutel in je hand geeft de doorslag.
De 400 die je vertelt wat voor model dit is
Elk MiniMax M-serie model denkt na voordat het antwoordt, maar M3.1-Flash-Preview is de eerste die weigert te stoppen. Stuur thinking: {"type": "disabled"} of reasoning_effort: "none" en de API retourneert HTTP 400 met het bericht:
model "MiniMax-M3.1-Flash-Preview" vereist adaptief denken; thinking.type="disabled" (inclusief reasoning.effort=none) is niet toegestaan (2013)
De eigen richtlijn van de leverancier is om inspanning te verlagen in plaats van te proberen het denken uit te schakelen, en de ladder is de latentiehendel: een routinebewerking op low en een wijziging over de hele repository op xhigh zijn hetzelfde model dat verschillende afwegingen maakt. Twee verdere details zijn specifiek voor dit model. De reasoning_effort parameter wordt gedocumenteerd als alleen effectief voor MiniMax-M3.1-Flash-Preview — het is geen algemene M-serie-instelling. En de reasoning_split output-schakelaar, die het denken scheidt in een reasoning_content veld, kan momenteel niet worden ingesteld op false op dit model.
Waar de denktekst terechtkomt, is protocolafhankelijk: de Anthropic-compatibele endpoint retourneert die als een thinking-contentblok, de OpenAI-compatibele endpoint retourneert die op reasoning_content, en de Responses-endpoint retourneert die als een reasoning-uitvoeritem. Als je <think>-tags uit MiniMax-M3-uitvoer aan het parseren was, is dat werk niet meer nodig op het nieuwere model — en voor interleaved tool-use-gesprekken moet het volledige antwoord, inclusief het thinking-blok, weer aan de berichtgeschiedenis worden toegevoegd, anders breekt de redeneerketen.
De promotie die nu loopt
MiniMax Code houdt van 28 september tot 7 oktober in UTC+8 een check-inactie, waarbij de gratis credits voor dagelijkse logins worden verdubbeld en de actie openstaat voor zowel nieuwe als bestaande gebruikers. De gerapporteerde credits gelden voor de ondersteunde modellen, met M3.1-Flash-Preview en de H3-videomodellen als voorbeelden. Daarnaast zei het bedrijf dat de quota van Token Plan bij de lancering voor alle gebruikers worden gereset en dat er tijdens het evenement meer resets zijn gepland, waarbij de geschiktheid in de app wordt getoond.
Beschouw die twee als leveranciersverklaringen die via de lanceringsberichtgeving zijn doorgegeven — het zijn promotievoorwaarden met data eraan verbonden, geen productgedrag, en dezelfde berichtgeving merkt op dat de aankondiging het aantal credits per check-in of de precieze regels voor gemiste dagen niet specificeerde. De steady-state-economie is eenvoudiger te beschrijven: Token Plan heeft een prijs van $22 per maand voor Plus, $55 voor Max en $132 voor Ultra, met rollende vensters van 5 uur en wekelijkse quotavensters, door de leverancier respectievelijk geschat op ongeveer drie tot vier, vier tot vijf en zes tot zeven gelijktijdige agents. Purchased Credits gaan tegen 1.000 credits per dollar en worden afgetrokken tegen de pay-as-you-go-lijstprijs van elk model.
De vier dingen die dit model nog steeds niet heeft.
Niets van het volgende is een kritiek op het model; elk is een gat waar een team omheen moet plannen, en alle vier zijn ze vandaag verifieerbaar.
• Geen prijs. Er is geen tarief per token voor M3.1-Flash-Preview op welke MiniMax-pagina dan ook, dus het kan qua kosten per token niet worden vergeleken met de $0,30 per miljoen input en $1,20 per miljoen output van M3, of met wat dan ook.
• Geen benchmarks. MiniMax heeft bij deze release geen evaluatietabel gepubliceerd. Niemand anders ook: het model ontbreekt in de index van Artificial Analysis, dus de bijbehorende kolom is echt leeg in plaats van slechts vroeg.
• Geen gewichten. MiniMax-M3 werd uitgebracht met open gewichten; M3.1-Flash-Preview heeft geen repository en geen downloadbaar checkpoint.
• Geen onafhankelijke meting. Geen cijfers over outputsnelheid, latentie of foutpercentage van welke derde partij dan ook, en geen enkele uit onze eigen routeringstelemetrie, omdat het model niet in onze catalogus staat.
Vergeleken met de M3-lancering in juni 2026, die op dag één kwam met een architectuurnota, een benchmarkblad en een tariefkaart, is dit een bewust stille release. De aannemelijke lezing — en het is een lezing, geen uitgesproken plan — is dat MiniMax eerst echt gebruik binnen zijn eigen product wil zien voordat het bepaalt wat het model kost en of het wordt opengesteld.

Wat de uitgelekte preview-notitie goed had
Vier dagen voor de lancering circuleerde een previewdocument, overgeschreven in een openbare partnerrepository, dat een MiniMax M3.1 beschreef met sparse attention, Q8KV4-attentiekwantisatie, NVFP4-gerouteerde experts, een DSpark speculative-decoding-head en een nieuw reasoning_effort-veld met waarden van max tot low. Destijds hebben we het als ongeverifieerd opgeschreven, want dat was het: er waren geen gewichten, geen modelkaart, geen prijspagina en geen API-model-id.
Een van die vijf beweringen wordt nu bevestigd door de eigen documentatie van de leverancier, en het is het reasoning_effort-veld — inclusief de max-naar-low-ladder, die exact overeenkomt met de geleverde waarden. De andere vier blijven onbevestigd. De gepubliceerde beschrijving van MiniMax van M3.1-Flash-Preview zegt alleen dat het een frontier multimodaal codeermodel is met een contextvenster van 1M en instelbare denkdiepte; het beschrijft niet het attention-schema, de kwantisatie of de decoding-head. Wie de beweringen over sparse attention en NVFP4 als vaststaande specificatie herhaalt, herhaalt de transcriptie van een derde partij, wat precies is wat de release niet bevestigde.
Als je het wilt proberen zonder er een pipeline op te wedden
Het lastige aan een preview met alleen een Token-Plan is dat de natuurlijke manier om een nieuw model te evalueren — het aanroepen vanuit je bestaande stack en meten — precies het enige is dat je niet netjes kunt doen. Er is geen tarief per token om tegen te modelleren, geen gepubliceerd latentieprofiel, en geen failoververhaal binnen het eigen product van de leverancier als de preview wankelt.
Dat is de situatie waarvoor een routeringslaag is gebouwd. Alles wat je vandaag kunt aanroepen, bevindt zich achter één OpenAI-compatibel endpoint en één API-sleutel, en de modellen die hieraan grenzen, staan er al: MiniMax-M3 tegen het tarief van de provider van $0,30 per miljoen inputtokens en $1,20 per miljoen output, MiniMax M2.7 tegen hetzelfde tarief met een venster van 200.000 tokens en open gewichten, en de DeepSeek- en Qwen Flash-tiers in dezelfde prijsklasse. De prijzen aan onze kant zijn de lijstprijs van de provider, doorgegeven met 0% opslag, dus wanneer een leverancier een tarief verlaagt, staat het hier dezelfde dag in plaats van in een heronderhandelingscyclus. Automatische failover betekent dat een afhankelijkheid van previewkwaliteit naast een productiepad kan staan in plaats van eronder, en wanneer MiniMax een tariefkaart en een endpoint voor MiniMax-M3.1-Flash-Preview publiceert, wordt de vraag een regel in een routeringstabel in plaats van een migratieproject. MiniMax-M3.1-Flash-Preview zelf staat niet in onze catalogus, en de manier om het vandaag te bereiken is het eigen Token Plan van de leverancier en diens codingproduct.
De eerlijke samenvatting voor een team dat dit op de lanceerdag leest: het model is live, marginaal gratis als je al betaalt voor een Token Plan-seat, en volledig ongeprijsd en ongemeten op zijn eigen voorwaarden. Probeer het uit in MiniMax Code, houd de pipeline waarvan je afhankelijk bent op een model met een tariefkaart en een trackrecord, en let op de twee dingen die dit van een curiositeit in een beslissing zullen veranderen — een gepubliceerde prijs en de eerste onafhankelijke scores.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
