Gegenereerde herokaart met de titel Claude Sonnet 5.5 vs MiniMax M3, met als ondertitel waar het 15x goedkopere model gelijk eindigt, met drie statistiekkaarten: recall bij lange context 82,7% vs 83,0%, Terminal-Bench 4.0 63,6% vs 2,0%, en kosten per taak $7,60 vs $0,51, met een voettekst met de tekst: Alle cijfers volgens Artificial Analysis v4.3.2; specificaties van MiniMax M3 volgens MiniMax.
Guides & Insights

Claude Sonnet 5.5 vs MiniMax M3: Waar het 15× goedkopere model echt gelijkstaat

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Er is één rij op het onafhankelijke scorebord waar MiniMax M3 en Claude Sonnet 5.5 hetzelfde model zijn, en het is niet degene die je zou raden. Bij long-context recall scoort MiniMax M3 83,0% en Claude Sonnet 5.5 82,7%. MiniMax M3 kost $0,30 per miljoen inputtokens en $1,20 per miljoen output. Claude Sonnet 5.5 kost $2,00 en $10,00. Over de hele Intelligence Index bedragen de gemeten kosten van M3 $0,51 per taak tegenover $7,60 voor Claude Sonnet 5.5 — vijftien keer goedkoper, en op de enige evaluatie die meet of een model nog steeds iets kan vinden in een zeer lang document, doet het niet onder.

Dan open je de agentische evaluaties en kantelt het beeld zo sterk dat het geen vergelijking meer is. Op Terminal-Bench 4.0, waar een model een shell moet aansturen en daadwerkelijk een softwaretaak moet afronden, scoort MiniMax M3 2,0% en Claude Sonnet 5.5 63,6%. Een dertigvoudig verschil op de enige benchmark die het meest op productiewerk lijkt, is geen kwestie van prijs, en geen enkele besparing per token overleeft dat. De nuttige vraag die deze confrontatie oproept is niet "wat is beter", maar welke van deze twee faalmodi je workload kan absorberen: MiniMax M3 is het open-weight-, miljoen-token- en native-videomodel dat een frontiermodel evenaart op retrieval en instort bij uitvoering, en Claude Sonnet 5.5 is het gesloten model dat op 28 september 2026 uitkwam om het tegenovergestelde te doen.

Wat elk van hen is, eenvoudig gezegd

M​iniMax M3 is het vlaggenschip open-weight fundatiemodel van het Chinese lab, aangekondigd op 1 juni 2026 en downloadbaar onder M​iniMax' eigen communitylicentie. Het is een mixture of experts met ongeveer 428 miljard totale parameters en ongeveer 23 miljard actieve parameters per token, en het is native in de sterke zin: tekst, afbeelding en video gaan erin en tekst komt eruit, waarbij de multimodale pijplijn vanaf de eerste pretrainingsstap opnieuw is opgebouwd in plaats van er later op vastgeschroefd te worden. Het venster is 1.048.576 tokens — met een gegarandeerd bruikbaar minimum van 512.000 in onze eigen catalogusvermelding — en de maximale output is 512.000 tokens, wat ons cijfer is en niet dat van de leverancier, omdat M​iniMax er geen publiceert. De architectuur is M​iniMax Sparse Attention, het onderwerp van arXiv 2606.13392, en de bewering van de leverancier erover is meer dan 9× sneller prefilling en meer dan 15× sneller decoding dan de vorige bij een venster van een miljoen tokens. Dat zijn cijfers van de leverancier, en we hebben niet gezien dat ze onafhankelijk zijn gereproduceerd.

Artificial Analysis model page for MiniMax-M3, an open-weights model released June 2026, showing an Intelligence Index of 29, an output speed of 115.3 tokens per second, $0.30 per million input tokens and $1.20 per million output tokens, $0.51 per Intelligence Index task, a 1M-token context window, and text, image and video input.

Claude Sonnet 5.5 is A​nthropic's tweede model van de 5.5-generatie, op het moment van schrijven één dag oud, en het is gesloten. A​nthropic beschrijft het als de beste combinatie van snelheid en intelligentie in het aanbod, en de specificaties zijn 1.000.000 tokens context, 128.000 tokens synchrone uitvoer met 300.000 op de Message Batches API, tekst-, afbeeldings- en bestandsinvoer, adaptief denken met selecteerbare inspanning, een kennisafsluitdatum van juni 2026, en zero data retention beschikbaar vanaf de lancering. De prijs is niet gewijzigd ten opzichte van Claude Sonnet 5: $2,00 invoer, $10,00 uitvoer, $0,20 voor cachereads, $2,50 voor cachewrites. A​nthropic zegt dat het 30% sneller draait en tot 30% minder kost per taak dan Claude Sonnet 5 — cijfers van de leverancier, niet gereproduceerd, en te lezen als claims over tokentellingen en niet als tarieven, aangezien de tarieven identiek zijn.

De vorm van de benchmark is het hele verhaal.

Beide modellen worden gemeten op dezelfde index, revisie v4.3.2, en het zijn de resultaten per evaluatie die deze combinatie interessant maken in plaats van eenzijdig.

• Recall over lange context — MiniMax M3 83,0% vs Claude Sonnet 5.5 82,7%, een verschil van een afrondingsfout bij een echte gelijkstand

• SciCode — MiniMax M3 47,1% vs Claude Sonnet 5.5 61,0%, een reële maar overbrugbare kloof

• Humanity's Last Exam — MiniMax M3 39,0% vs Claude Sonnet 5.5 55,0%

• Terminal-Bench 4.0 — MiniMax M3 2,0% vs Claude Sonnet 5.5 63,6%, waar de vergelijking niet langer nuttig is

• Intelligence Index — MiniMax M3 29 vs Claude Sonnet 5.5 56

• Kosten per Indextaak — MiniMax M3 $0,51 vs. Claude Sonnet 5.5 $7,60

• Gegenereerde output-tokens over de Index — MiniMax M3 120M vs Claude Sonnet 5.5 410M

• Uitvoersnelheid — MiniMax M3 115,3 tokens/sec vs Claude Sonnet 5.5 138,7 tokens/sec

Lees die rijen in volgorde en er ontstaat een samenhangend model. MiniMax M3 is competent in statisch redeneren en retrieval en zwak in volgehouden uitvoering. Zijn Terminal-Bench-uitslag is geen bescheiden tekortkoming; een score van 2,0% betekent dat het model de taken in wezen niet voltooit, en hetzelfde patroon blijkt uit zijn score op de automatiseringsbenchmark van 0,21 tegenover 0,71, en uit een alwetendheidsscore van 1,35 tegenover 32,3. Waar MiniMax M3 zich wél staande houdt, is precies waar zijn architectuur een voordeel claimt: een werkelijk lange input, gelezen en beantwoord. Dat is MSA die doet waarvoor MiniMax het heeft verkocht.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs MiniMax M3, the scoreboard, with six matched rows: input price $2.00 vs $0.30, output price $10.00 vs $1.20, Intelligence Index 56 vs 29, cost per task $7.60 vs $0.51, long-context recall 82.7% vs 83.0%, and Terminal-Bench 4.0 63.6% vs 2.0%, with a footer reading All figures per Artificial Analysis v4.3.2; MiniMax M3 is open-weight under MiniMax's community licence.

De kostenlijn voegt een tweede, minder voor de hand liggend punt toe. MiniMax M3 is niet alleen goedkoper per token — 1/6,7 op invoer en 1/8,3 op uitvoer — het verbruikt ook minder tokens om een antwoord te bereiken, ruwweg 120 miljoen tegenover 410 miljoen op hetzelfde leaderboard. Twee effecten vermenigvuldigen zich tot een vijftienvoudig verschil per taak. Een deel van dat verschil is echte efficiëntie en een deel ervan is simpelweg dat MiniMax M3 eerder opgeeft bij taken waarin het faalt; een goedkope taak die het verkeerde antwoord oplevert is geen besparing, en dit is de goedkoopste les in het artikel.

De dimensie die de prijslijst niet kan tonen

MiniMax M3 heeft een eigenschap die Claude Sonnet 5.5 niet heeft en niet kan verwerven: je kunt de gewichten meenemen. Dat is van belang voor precies één categorie kopers, en voor die koper weegt het zwaarder dan alles hierboven. Als een verzoek een rechtsgebied niet kan verlaten, geen netwerkgrens kan overschrijden, of moet draaien op een plek waar helemaal geen API bereikbaar is, dan is een model zonder downloadbare gewichten tegen geen enkele prijs een optie, en een open-weightmodel met 428 miljard parameters wel. Diezelfde eigenschap is in de andere richting een nadeel: 428B parameters zelf hosten met 23B actief is een kapitaalbeslissing, geen API-sleutel, en M​iniMax' eigen beweringen over sparse attention bestaan omdat het alternatief bij een miljoen tokens onbetaalbare infrastructuur is.

Voor alle anderen is de eerlijke voorstelling van zaken dat dit een grens tussen zelf bouwen en kopen is, met een prijskaartje eraan vast. Claude Sonnet 5.5 is het betere model voor alles wat agentisch is. MiniMax M3 is het betere model voor het lezen van iets enorms en het beantwoorden van een vraag daarover, en het is met afstand het betere model voor het verwerken van video, wat Claude Sonnet 5.5 helemaal niet accepteert — het invoeroppervlak is tekst, afbeeldingen en bestanden.

• Gewichten — MiniMax M3 open onder M​iniMax' communitylicentie vs Claude Sonnet 5.5 gesloten

• Invoermodaliteit — MiniMax M3 tekst, afbeelding en video vs Claude Sonnet 5.5 tekst, afbeelding en bestand

• Maximale output — MiniMax M3 512.000 tokens volgens onze catalogus vs Claude Sonnet 5.5 128.000 synchroon, 300.000 bij Batches

• Cacheprijzen — MiniMax M3 $0,06 per miljoen bij lezen, tegenover Claude Sonnet 5.5 $0,20 bij lezen en $2,50 bij schrijven

• Inspanningbeheer — MiniMax M3-denken ingeschakeld, adaptief of uitgeschakeld vs. het adaptieve denken van Claude Sonnet 5.5, waarbij uitschakelen nu de between_tools vorm vereist

• Gegevensretentie — MiniMax M3 beheerd door je eigen deployment indien zelf gehost, versus Claude Sonnet 5.5 zero data retention beschikbaar van A​nthropic bij de lancering

Beide draaien zonder twee contracten te laten lopen

Meng een open-weight Chinees model en een gesloten Anthropic-model in één pipeline en de operationele kosten zijn meestal niet de tokens; het zijn het tweede contract, de tweede sleutel, de tweede set rate limits en de tweede plek waar een storing kan optreden. OrcaRouter vat dat samen in één OpenAI-compatibel endpoint dat meer dan 200 modellen dekt, waarbij de lijstprijs van de provider ongewijzigd wordt doorgegeven — aan geen van beide kanten wordt een markup toegevoegd — met automatische failover tussen upstreamproviders en een routing-DSL om meerdere modellen in één aanroep samen te stellen. MiniMax M3 is hier routeerbaar als minimax/minimax-m3 tegen MiniMax' $0.30 en $1.20 met $0.06 voor cache-reads, en het is qua verkeer een van de drukste modellen in de catalogus, wat op zich al een nuttig signaal is: de routeringslaag kan je vertellen hoeveel echte belasting een model draagt, niet alleen hoe het scoorde.

Claude Sonnet 5.5 staat nog niet in onze catalogus, en dit artikel zal niet doen alsof dat anders is. De route ernaartoe loopt vandaag via de eigen API van Anthropic. Claude Sonnet 5 is hier routeerbaar voor dezelfde $2,00 en $10,00 en dat is zo sinds 30 juni, en het is het natuurlijke stagingdoel en failoverpartner terwijl zijn opvolger een dag oud is.

Die combinatie — de long-context-swap en het agentische pad achter één credential — is waar een router voor dient. MiniMax M3 verwerkt via deze catalogus wekelijks 63,2 miljoen tokens aan verkeer, tegenover de 7,9 miljoen van Claude Sonnet 5, dus het goedkope model is hier geen theoretische vervanger; het neemt het volume al voor zijn rekening. Als je beide vanaf één sleutel routeert, is de verdeling een configuratiebeslissing waar je verkeer tussen kunt verschuiven, in plaats van een tweede contract dat je moet ondertekenen voordat je de goedkopere kant kunt testen.

OrcaRouter model page for minimax/minimax-m3, dated 2026-05-31, showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 512K maximum output, text, image and video input, $0.30 input and $1.20 output per million tokens, a p50 time to first token of 10.00 s, and 63.2M tokens of recent traffic.

Wat te doen met de stropdas

Als je workload het beantwoorden van vragen op documentniveau is — een zeer lange invoer, een kort feitelijk antwoord, een tolereerbare latentie — dan is de gelijkstand op het gebied van lange context reëel, en het vijftienvoudige kostenvoordeel van MiniMax M3 is dat ook. Dat is een eenvoudige overstap en deze week het testen waard.

Als je workload agentisch is, beslecht de Terminal-Bench-uitslag de zaak voordat prijs ter sprake komt. Claude Sonnet 5.5 tegen $7,60 per Index-taak versus MiniMax M3 tegen $0,51 is een premie van 15× voor een model dat zestig punten hoger scoort op de evaluatie die het meest op je productieverkeer lijkt, en de vijftien keer goedkopere optie die de taak niet aankan, is de dure optie. De meting die je op je eigen data moet uitvoeren is tokens per voltooide taak, niet tokens per verzoek, want dat is het enige cijfer in dit artikel waarbij het prijsvoordeel van MiniMax M3 standaard niet overeind blijft.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt