Een gegenereerde herokaart getiteld 'GPT-6.1 Sol vs MiniMax M3' met twee afgeronde panelen: links 'GPT-6.1 Sol' met vermelding 'OpenAI - uitgebracht op 29 sep 2026', '$2,00 in / $10,00 uit per 1M', 'AA-index 51,8' en '$0,72 per taak'; rechts 'MiniMax M3' met vermelding 'MiniMax - uitgebracht op 31 mei 2026', '$0,30 in / $1,20 uit per 1M', 'AA-index 29,2' en '$0,51 per taak'; daartussen de regel 'Goedkopere kaart, lagere rekening - 22,6 indexpunten uit elkaar'; voettekst 'Cijfers: Artificial Analysis v4.3.2.' en het OrcaRouter-logo rechtsonder.
Guides & Insights

GPT-6.1 Sol vs MiniMax M3: de goedkopere tariefkaart verliest op de factuur

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

MiniMax M3 vraagt een fractie van wat GPT-6.1 Sol vraagt — $0,30 per miljoen inputtokens tegen $2,00, $1,20 per miljoen outputtokens tegen $10,00 — en volgens de maatstaf die daadwerkelijk wordt gehanteerd, is het goedkoper: $0,508 per taak tegen $0,724 op de v4.3.2-evaluatie van Artificial Analysis. Dat is een echte overwinning, en het is ook het hele argument, want dezelfde meting die M3 de lagere rekening bezorgt, bezorgt GPT-6.1 Sol een indexvoorsprong van 22,6 punten, en de benchmarkreeks die meet of een model agentisch werk kan afmaken in plaats van het te beschrijven, verandert de kloof in een muur. De leverancier bracht GPT-6.1 Sol uit op 29 september 2026. Het bedrijf bracht M3 uit, zijn open-weight model met 428 miljard parameters, op 31 mei 2026.

Beide zijn live, voor beide is een prijs vastgesteld, en beide zijn met één API-aanroep te bereiken. Wat volgt is de rekensom die tussen hen beslist, en de twee plekken waar de rekensom niet het hele verhaal is.

Wat elk model daadwerkelijk is

GPT-6.1 Sol is OpenAI's huidige vlaggenschip voor redeneren en software-engineering — een gesloten model, slechts één week na de GPT-6 Sol die het vervangt uitgebracht, en verkocht voor dezelfde lijstprijs van $2,00 / $10,00 als zijn voorganger. Het kent een tarief van $0,10 voor gecachte invoer, de helft van wat GPT-6 Sol in rekening bracht voor cachehits, en het is het model waar OpenAI naar verwijst wanneer het over agentic coding in plaats van chat spreekt.

MiniMax M3 is een mixture-of-experts-model met 428 miljard totale parameters en 23 miljard actieve per token, gepubliceerd onder de MiniMax Community License — een open-weights-release met een eigen licentie met een niet-commerciële inslag, geen OSI-goedgekeurde licentie. Het wordt aangeboden door een breed scala aan inference-providers: Artificial Analysis registreert vijftien hosts voor M3 tegenover acht voor GPT-6.1 Sol. Die breedte aan aanbieders is het praktische voordeel van open weights, en het is ook de reden waarom de prijsconcurrentie rond M3 sneller op gang is gekomen dan bij het gesloten model.

De tariefkaart, en de meter die deze overstemt

A generated two-column scoreboard titled 'GPT-6.1 Sol vs MiniMax M3 - the scoreboard'. Left column 'GPT-6.1 Sol': Input $2.00 / 1M, Output $10.00 / 1M, AA Index 51.8, Cost per task $0.72, Output tokens 38,128, Time per task 640 s. Right column 'MiniMax M3': Input $0.30 / 1M, Output $1.20 / 1M, AA Index 29.2, Cost per task $0.51, Output tokens 48,192, Time per task 486 s. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Leg de twee gepubliceerde tariefkaarten naast elkaar en het is geen gelijke strijd.

• Invoer — GPT-6.1 Sol $2,00 per 1 mln. vs MiniMax M3 $0,30 per 1 mln.; M3 is 85% goedkoper
• Uitvoer — $10,00 per 1 mln. vs $1,20 per 1 mln.; M3 is 88% goedkoper
• Gecachte invoer — $0,10 per 1 mln. vs $0,06 per 1 mln.
• Kosten per AA-taak — $0,724 vs $0,508; M3 is 30% goedkoper, niet 85%
• Uitvoertokens per taak — 38.128 vs 48.192; M3 schrijft 26% meer
• Tijd per taak — 640 s vs 486 s
• Contextvenster — 1.050.000 vs 1.048.576 tokens; nagenoeg gelijk
• Maximale uitvoer — 128.000 tokens vs 512.000; M3 zal één heel lang antwoord schrijven
• Geaccepteerde invoer — tekst, afbeelding en bestand vs tekst, afbeelding en video
• Rang in index — GPT-6.1 Sol 10e van 147 modellen vs MiniMax M3 62e

De twee goedkope regels bovenaan zijn de regels die een inkoopoverzicht ziet. De derde regel is degene die de rekening betaalt, en die zegt dat een voordeel van 85–88% op de tariefkaart een voordeel van 30% in de praktijk wordt, omdat M3 meer tokens per taak genereert en omdat een taak geen vaste hoeveelheid werk is. Tariefkaarten prijzen tokens; werk wordt geprijsd in taken. Elke vergelijking die bij de eerste twee regels stopt, vergelijkt de verkeerde cijfers, in de verkeerde eenheid.

Waar de dertig procent er niet meer toe doet

De taakkosten liggen dicht genoeg bij elkaar dat het indexverschil de doorslag geeft voor alles wat verder gaat dan bulktekst. Artificial Analysis plaatst GPT-6.1 Sol op 51,83 en MiniMax M3 op 29,22 — een verschil van 22,6 punten, en een dat niet gelijkmatig over de suite is verdeeld. Bij de evaluaties waarin een model een terminal moet bedienen, een repository moet bewerken en zijn eigen werk moet verifiëren, zitten de twee modellen niet in dezelfde categorie:

• Terminal-Bench 4.0 — GPT-6.1 Sol 0,5606 vs. MiniMax M3 0,0202
• Terminal-Bench Science — 0,5810 0,0048
• AA-Omniscience — 41,53 vs. 1,35
• MMLU — 0,8595 vs. 0,7856
• AutomationBench — 0,6487 vs. 0,0202
• τ²-bench — niet gepubliceerd voor GPT-6.1 Sol in deze run vs. 0,8889 voor M3
• GPQA Diamond — niet gepubliceerd voor GPT-6.1 Sol in deze run vs. 0,9293 voor M3
• CritPT — 0,3171 vs. 0,0371

Lees dat aandachtig, want het is geen volledige overwinning en de uitzonderingen zijn het interessante deel. MiniMax M3 scoort 0,8889 op τ²-bench, de evaluatie voor toolgebruik en klantenservicedialoog, en 0,9293 op GPQA Diamond — een wetenschapsscore op masterniveau die elke OpenAI-score die in deze specifieke run is gepubliceerd, overtreft. M3 is een competente redeneerder en een goede gebruiker van conversationele tools. Op Terminal-Bench 4.0 scoort M3 0,0202. Dat is niet "slechter"; dat is een model dat een repository-taak met meerdere stappen helemaal niet samenhangend kan uitvoeren, en geen enkele korting op tokens maakt een taak die het model niet aankan goedkoper dan de taak die het model afmaakt.

Er is een secundaire kost die het cijfer per taak verbergt. M3 registreert 48.192 outputtokens per taak en een tijd tot het eerste antwoord van 23,0 seconden tegenover de 332,0 seconden van GPT-6.1 Sol — het kleine model begint bijna onmiddellijk te praten en redeneert daarna uitgebreid. Als je werklast latentiegevoelig maar ondiep is, is dat een pluspunt voor M3. Als die agentisch is, is het aantal tokens wat je betaalt en de eindscore wat je krijgt.

Onze eigen modelkaart voor GPT-6.1 Sol bevat dezelfde cijfers in de vorm waartegen je daadwerkelijk zou routeren: het tarief van $2,00 / $10,00, een contextvenster van 1.050.000 tokens, een p50 van 4,54 seconden tot het eerste token, en het Artificial Analysis-index- en benchmarkblok op dezelfde pagina.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

Wat de open gewichten hier waard zijn

Dat M3 downloadbaar is, is het sterkste argument ervoor, en het loont om precies te zijn over wat dat oplevert. Het levert licentievoorwaarden op waarmee je het model binnen je eigen grens kunt draaien — handig als de data niet naar buiten mogen — en het levert de prijsconcurrentie op die van vijftien onafhankelijke hosts komt. Het bezorgt je geen goedkope deployment: 428 miljard parameters met 23 miljard actieve vraagt nog steeds serieuze inferentiehardware, en de MiniMax Community License is een aangepaste licentie met voorwaarden, geen onbeperkte. Voor de meeste teams betekent "open weights" een betere prijs voor gehoste inferentie, niet een doos in het rack.

Op de OrcaRouter-kaart voor MiniMax M3 vind je de cijfers die worden geleverd: het tarief van $0,30 / $1,20, het contextvenster van 1.048.576 tokens, de maximale uitvoer van 512.000 tokens, tekst-/afbeeldings-/video-invoer, en een volume van 56,4 miljoen tokens over zeven dagen, verdeeld over de providers die het routeren.

A screenshot of the OrcaRouter model page for minimax/minimax-m3, showing the $0.30 input and $1.20 output per-million prices, a 10.60 s p50 time to first token, 56.4M tokens over seven days, a 1,048,576-token context window, 512,000 max output and text/image/video input, above the OpenAI-compatible code sample.

Beide achter één toets

De praktische reden waarom deze vergelijking een configuratiewijziging is in plaats van een migratie, is dat beide modellen bereikbaar zijn via één OrcaRouter-endpoint — één API voor meer dan 200 modellen, waarbij de lijstprijs van de provider met 0% opslag wordt doorgegeven, wat betekent dat een tariefwijziging van MiniMax dezelfde dag op je factuur terechtkomt waarop de leverancier die publiceert, in plaats van wanneer een reseller opnieuw onderhandelt. Dat is belangrijker voor M3 dan voor zijn rivaal: de hele reden om naar een open-weightmodel te routeren is dat de prijs en de hostlijst ervan in beweging zijn, en een pass-through-meter is de enige soort die een bewegend doel volgt.

Automatische failover is de andere helft. M3 wordt geleverd door veel providers met uiteenlopende betrouwbaarheid, en de routeringslaag kan een verzoek naar een andere host verplaatsen wanneer een ervan achteruitgaat, zonder dat de aanroeper weet op welke host het terechtkwam. Dat is de eerlijke manier om een model te adopteren waarvan de Terminal-Bench-score zegt "niet voor het kritieke pad" — zet het waar een nieuwe poging goedkoop is.

Welke, als je vandaag moet kiezen?

Als het werk bulktekst is — extractie, samenvatting, classificatie, dialoog, alles waarbij de output proza is en de faalmodus een verkeerde zin is in plaats van een kapotte build — dan is MiniMax M3 de juiste standaardkeuze, en die dertig procent is echt geld. Gebruik de cijfers van GPQA en τ²-bench als je bewijs: dit is een capabel model dat toevallig goedkoop is.

Als het werk agentisch is — repositories, terminals, toolchains, alles met een verificatiestap — dan is de 0,0202 op Terminal-Bench 4.0 een diskwalificatie, en GPT-6.1 Sol met 0,5606 voor $0,724 per taak is de betere deal, zelfs bij 85% meer per token. De tariefkaart was nooit wat je kocht.

Het nuttige antwoord is dat je niet één keer hoeft te kiezen. Routeer de shallow tier naar M3, routeer de agentic tier naar GPT-6.1 Sol, en houd beide achter één credential — de routing-DSL stelt de twee samen tot één enkele aanroep wanneer een taak begint als extractie en verandert in een reparatietaak.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt