
Dots vs MiniMax M3: de Worker huren of de Reader downloaden
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 349 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 210 tok/s
- OrcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- xAISpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
Het goedkoopste model in deze batch is ook het model dat je mag houden, en die combinatie is de hele vergelijking. MiniMax M3, gepubliceerd op 31 mei 2026, wordt beschreven als MiniMax' flagship open-weight basismodel: tekst, afbeelding en video erin en tekst eruit, een contextvenster van 1.048.576 tokens, tot 512.000 tokens output in één enkele respons, en een lijstprijs van $0,30 per miljoen inputtokens en $1,20 per miljoen outputtokens, met gecachte reads tegen $0,06 — ongeveer een dertiende van wat de frontier voor dezelfde tokens rekent. Dots is de always-on agent van het bedrijf, aangekondigd op DevDay op 29 september 2026: hij krijgt zijn eigen cloudcomputer en browser, werkt met meer dan 4.000 verbonden apps, draait op GPT-6 Astra, en is inbegrepen bij Pro en Business Premium zonder dat ergens een tegoedbedrag is gepubliceerd. Het ene is een component die je kunt vasthouden. Het andere is een dienst waarop je je alleen kunt abonneren.
De prijs is niet het interessante getal
Dertig cent per miljoen invoertokens is de kop, maar de interessante cijfers zijn de twee die bepalen wat je kunt vragen. Het eerste is 512.000 tokens maximale uitvoer — zes keer wat GPT-5.6 Sol in één antwoord produceert, en het hoogste uitvoerplafond van alle modellen in deze vergelijkingsset. Het tweede is 83 voor long-context recall, wat hoog genoeg is om het contextvenster een bruikbaar werkoppervlak te maken in plaats van een getal op een specificatieblad.
Combineer je die, dan wordt een specifieke categorie taken goedkoop: het lange ding genereren uit de lange bron. Een technische handleiding van 400 pagina's die voor een ander publiek is herschreven. Een migratiegids die uit een volledige repository is gemaakt. Een onderzoekssamenvatting die zelf zo lang is als een rapport. Bij $0,30 en $1,20 per miljoen is een klus die op een frontier-model een regelpost van vier cijfers zou zijn hier een afrondingsfout — en het feit dat het uitvoerplafond in honderdduizenden tokens wordt gemeten in plaats van tienduizenden, is wat er één verzoek in plaats van twintig van maakt.
Er is een voorbehoud dat het vermelden waard is als het om metingen gaat. Het latentiepaneel van onze catalogus meldt een mediane tijd tot het eerste token van 10,00 seconde voor M3 over hetzelfde venster van zeven dagen dat 18,35 miljoen tokens aan verkeer laat zien, en dat cijfer zit precies op de bovengrens van het weergegeven bereik van het paneel. Zie het als een artefact van het venster, niet als een karakterisering van het model. Het verkeerscijfer is het cijfer dat aangeeft dat mensen het daadwerkelijk gebruiken.

Video is de input waar niemand op rekent
Vision is nu een basisvereiste, dus de modaliteit die nog het verschil maakt, is video. M3 accepteert die native, naast tekst en afbeeldingen, en dat verandert de vorm van een pipeline in plaats van alleen een capaciteit aan een lijst toe te voegen. Een supportarchief met schermopnames, een set dashcamclips, een semester aan hoorcollege-opnames — dat was voorheen een preprocessingprobleem, waarbij je frames met het ene hulpmiddel bemonsterde en ze met het andere beschreef. Een model dat video direct leest, voegt twee fasen samen tot één aanroep.
Het maakt de kostenberekening ook minder voorspelbaar, omdat video duur is om naar te kijken op een manier waarop tekst dat niet is, en het grootste getal op een rekening is meestal de input waar niemand op had gerekend. Een laag tarief per token is wat dat veilig maakt om mee te experimenteren: bij $0,30 per miljoen inputtokens is een incidentele verwerking van vijf uur betaalbaar genoeg om te prototypen in plaats van erover te discussiëren in een planningsvergadering.
Wat de open weights daadwerkelijk veranderen
MiniMax beschrijft M3 als een open-weightmodel, wat betekent dat de gewichten worden gepubliceerd in plaats van alleen via een dienst te worden aangeboden, en dat is een ander soort garantie dan een abonnement. Als MiniMax morgen stopt met aanbieden, of de prijs aanpast, of de identifier afschaft, zou het model niet verdwijnen — het zou blijven draaien op hardware die je al had gekocht, bij welke kwantisatie dan ook paste. Dat maakt zelf hosten in het algemeen niet goedkoper; een groot, sparse mixture-of-experts-model zelf serveren is een echt engineeringproject. Het maakt de afhankelijkheid overleefbaar, wat een andere claim is en degene die ertoe doet wanneer je besluit waarop je wilt bouwen.
Een punt biedt de tegenovergestelde garantie. OpenAI houdt de computer, de browser, de connectors en de limiet in handen, en als een van die onderdelen verandert, is je enige remedie ermee stoppen. Dat is een eerlijke regeling — huren is waar de meeste teams mee zouden moeten beginnen — maar het is niet dezelfde regeling, en het verschil wordt pas zichtbaar op de dag dat het ertoe doet.

Zes verschillen die een beslissing veranderen
• Garantie — een dienst die de voorwaarden kan wijzigen, tegenover wat je kunt behouden (MiniMax M3 wordt beschreven als open-weight; een punt is in geen enkele zin downloadbaar)
• Kosten per eenheid werk — niet gepubliceerd voor een dot, tegen $0,30 en $1,20 per miljoen tokens met gecachte reads tegen $0,06, het laagste tarief in deze vergelijkingsset
• Plafond voor één verzoek — niet gedocumenteerd, geen spat, tegenover 1.048.576 tokens aan invoer en 512.000 tokens aan uitvoer
• Modaliteiten in — berichten en gegevens van gekoppelde apps voor een dot, tegenover tekst, afbeelding en video voor het model
• Modaliteiten uit — wijzigingen in andere software, ten opzichte van tekst en alleen tekst
• Onafhankelijke positie — er bestaat geen benchmark voor een punt; M3 heeft een Artificial Analysis Intelligence Index van 29,2 en staat daarmee op de zestigste plaats van de 145 gemeten modellen, wat middenmoot is en de moeite waard om te weten voordat je aanneemt dat het lage tarief frontier-redenering oplevert. Dat is niet het geval.
Waar elk zijn plaats op de factuur verdient
De eerlijke lezing van het gepubliceerde profiel van M3 is dat het een volumemodel is, geen frontier-model: 92,9 op GPQA Diamond is concurrerend, 59 op SWE Bench Pro is respectabel, en de middenpositie op de Intelligence Index is de aanwijzing. Waarop het wint, zijn kosten per eenheid werk, outputplafond, video en inzetbaarheid, in die volgorde. Dat is een goed model om onder de dure laag van een pijplijn te zetten — de stappen voor samenvatten, extraheren, transcriberen, lange tekst genereren en fan-out met veel pogingen — en een slecht model om er bovenaan te zetten.
OrcaRouter levert het als minimax/minimax-m3 tegen MiniMax' provider-listprijs met 0% markup, in dezelfde catalogus als 200-plus modellen achter één enkele sleutel, met automatische failover tussen upstreamproviders en een routing-DSL om een individueel verzoek naar het model te sturen dat het moet afhandelen. Die opzet is wat de tweelaagse splitsing praktisch maakt in plaats van theoretisch: dezelfde sleutel die een goedkoop model bereikt voor volume, bereikt een frontiermodel voor de aanroepen die correct moeten zijn, en niets komt binnen in een dot, want dots staan helemaal niet in de catalogus — geen endpoint, geen identificator, geen vervangende intelligentie.
Wat te doen op maandag
Als je een corpus met audio of video hebt en geen betaalbare manier om ernaar te kijken, begin daar: M3 is het enige model in deze set dat video native leest voor deze prijs, en het experiment kost bijna niets. Als je een soort werk hebt dat steeds blijft liggen omdat niemand erachteraan zit, is de dot het product dat daarvoor is gemaakt, en het metered model zal niet doen alsof het dat is.
De twee komen alleen met elkaar in conflict als je aanneemt dat een van beide moet winnen. Het abonnement jaagt; de gedownloade lezer leest. Bezit de tweede, huur de eerste, en houd de grens ertussen expliciet genoeg dat je elk van beide kunt vervangen zonder de andere te herschrijven.

