Genererat herokort med titeln Claude Sonnet 5.5 vs. MiniMax M3, med underrubriken där den 15x billigare modellen är jämbördig, med tre statistikkort: återkallning för lång kontext 82,7 % vs. 83,0 %, Terminal-Bench 4.0 63,6 % vs. 2,0 %, och kostnad per uppgift 7,60 $ vs. 0,51 $, med en sidfot som lyder Alla siffror enligt Artificial Analysis v4.3.2; Specifikationer för MiniMax M3 enligt MiniMax.
Guides & Insights

Claude Sonnet 5.5 vs MiniMax M3: Där den 15× billigare modellen faktiskt är lika bra

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det finns en rad på den oberoende resultattavlan där MiniMax M3 och Claude Sonnet 5.5 är samma modell, och det är inte den någon skulle gissa. Vid återkallning i lång kontext får MiniMax M3 83,0 % och Claude Sonnet 5.5 82,7 %. MiniMax M3 kostar 0,30 $ per miljon indatatoken och 1,20 $ per miljon utdata. Claude Sonnet 5.5 kostar 2,00 $ och 10,00 $. I hela Intelligence Index är M3:s uppmätta kostnad 0,51 $ per uppgift mot 7,60 $ för Claude Sonnet 5.5 – femton gånger billigare, och i den enda utvärderingen som mäter om en modell fortfarande kan hitta något i ett mycket långt dokument ligger den inte efter alls.

Sedan öppnar du de agentiska utvärderingarna och bilden vänds så kraftigt att det upphör att vara en jämförelse. På Terminal-Bench 4.0, som ber en modell att styra ett shell och faktiskt slutföra en mjukvaruuppgift, får MiniMax M3 2,0 % och Claude Sonnet 5.5 63,6 %. En trettiofaldig skillnad på det enda benchmark som mest liknar produktionsarbete är inte en prisfråga, och ingen besparing per token överlever den. Den användbara frågan som den här matchningen väcker är inte ”vilken som är bättre” utan vilket av dessa två felmoder din arbetsbelastning kan absorbera: MiniMax M3 är modellen med öppna vikter, en miljon tokens och inbyggd video som matchar en frontiermodell vid hämtning och kollapsar vid utförande, och Claude Sonnet 5.5 är den slutna modell som släpptes den 28 september 2026 för att göra motsatsen.

Vad var och en är, uttryckt klart och tydligt

MiniMax M3 är det kinesiska labbets flaggskepp bland grundmodeller med öppna vikter, tillkännagiven den 1 juni 2026 och nedladdningsbar under MiniMax egen community-licens. Det är en mixture of experts med ungefär 428 miljarder parametrar totalt och cirka 23 miljarder aktiva per token, och den är nativt multimodal i stark bemärkelse: text, bild och video går in och text kommer ut, där den multimodala pipelinen har byggts om från det första förträningssteget i stället för att ha lagts till i efterhand. Fönstret är 1 048 576 tokens – med ett garanterat användbart minimum på 512 000 i vår egen katalogpost – och den maximala utdatan är 512 000 tokens, vilket är vår siffra och inte leverantörens, eftersom MiniMax inte publicerar någon. Arkitekturen är MiniMax Sparse Attention, ämnet för arXiv 2606.13392, och leverantörens påstående om den är mer än 9× snabbare prefyllning och mer än 15× snabbare avkodning än föregående generation vid ett fönster på en miljon tokens. Det är leverantörens siffror och vi har inte sett dem reproduceras oberoende.

Artificial Analysis model page for MiniMax-M3, an open-weights model released June 2026, showing an Intelligence Index of 29, an output speed of 115.3 tokens per second, $0.30 per million input tokens and $1.20 per million output tokens, $0.51 per Intelligence Index task, a 1M-token context window, and text, image and video input.

Claude Sonnet 5.5 är A​nthropics andra 5.5-generationsmodell, en dag gammal vid skrivandet, och den är stängd. A​nthropic beskriver den som den bästa kombinationen av hastighet och intelligens i sortimentet, och specifikationerna är 1 000 000 tokens kontext, 128 000 tokens synkron utdata med 300 000 på Message Batches API, text-, bild- och filinmatning, adaptivt tänkande med valbar ansträngning, en kunskapsgräns från juni 2026, och noll datalagring tillgänglig från lansering. Priset förändrades inte från Claude Sonnet 5: $2,00 in, $10,00 ut, $0,20 för cacheläsningar, $2,50 för cache-skrivningar. A​nthropic säger att den körs 30 % snabbare och kostar upp till 30 % mindre per uppgift än Claude Sonnet 5 — leverantörens siffror, ej reproducerade, och bör läsas som påståenden om tokenantal snarare än priser, eftersom priserna är identiska.

Benchmarkens utformning är hela historien.

Båda modellerna mäts på samma index, revision v4.3.2, och resultaten per utvärdering är det som gör den här parningen intressant snarare än ensidig.

Återkallning över lång kontext — MiniMax M3 83,0 % mot Claude Sonnet 5.5 82,7 %, en avrundningsskillnad vid ett verkligt oavgjort resultat

• SciCode — MiniMax M3 47,1 % mot Claude Sonnet 5.5 61,0 %, en verklig men överlevbar klyfta

• Humanity's Last Exam — MiniMax M3 39,0 % mot Claude Sonnet 5.5 55,0 %

• Terminal-Bench 4.0 – MiniMax M3 2,0 % mot Claude Sonnet 5,5 63,6 %, där jämförelsen upphör att vara användbar

• Intelligensindex — MiniMax M3 29 vs Claude Sonnet 5.5 56

• Kostnad per Index-uppgift — MiniMax M3 $0,51 vs Claude Sonnet 5.5 $7,60

• Genererade utdatatoken i hela Index — MiniMax M3 120M vs Claude Sonnet 5.5 410M

• Utdatasthastighet — MiniMax M3 115,3 tokens/sek Sonnet 138,7 tokens/sek

Läs de raderna i ordning och en sammanhängande bild växer fram. MiniMax M3 är kompetent på statiskt resonemang och inhämtning och svag på uthållig exekvering. Dess Terminal-Bench-resultat är inte ett blygsamt tillkortakommande; en poäng på 2,0 % betyder att modellen i praktiken inte slutför uppgifterna, och samma mönster syns i dess automatiseringsbenchmark-poäng på 0,21 mot 0,71, och i en allvetenhetspoäng på 1,35 mot 32,3. Där MiniMax M3 faktiskt står sig är precis där dess arkitektur gör anspråk på en fördel: en verkligt lång indata som läses och besvaras. Det är MSA som gör det MiniMax sålde in den för.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs MiniMax M3, the scoreboard, with six matched rows: input price $2.00 vs $0.30, output price $10.00 vs $1.20, Intelligence Index 56 vs 29, cost per task $7.60 vs $0.51, long-context recall 82.7% vs 83.0%, and Terminal-Bench 4.0 63.6% vs 2.0%, with a footer reading All figures per Artificial Analysis v4.3.2; MiniMax M3 is open-weight under MiniMax's community licence.

Kostnadsraden tillför en andra, mindre uppenbar poäng. MiniMax M3 är inte bara billigare per token – 1/6,7 på indata och 1/8,3 på utdata – det gör också av med färre tokens för att nå ett svar, ungefär 120 miljoner mot 410 miljoner över samma uppsättning. Två effekter multipliceras till den femtonfaldiga skillnaden per uppgift. En del av den skillnaden är genuin effektivitet och en del är helt enkelt att MiniMax M3 ger upp tidigare på uppgifter som den misslyckas med; en billig uppgift som ger fel svar är ingen besparing, och detta är den billigaste lärdomen i artikeln.

Dimensionen som prislistan inte kan visa

MiniMax M3 har en egenskap som Claude Sonnet 5.5 inte har och inte kan förvärva: du kan ta med dig vikterna. Det spelar roll för exakt en kategori av köpare, och för den köparen väger det tyngre än allt ovanstående. Om en förfrågan inte får lämna en jurisdiktion, inte får korsa en nätverksgräns, eller måste köras där inget API över huvud taget går att nå, är en modell utan nedladdningsbara vikter inte ett alternativ till något pris, medan en öppen viktmodell med 428 miljarder parametrar är det. Samma egenskap är en belastning i motsatt riktning: att självhosta 428B parametrar med 23B aktiva är ett kapitalbeslut, inte en API-nyckel, och M​iniMax egna påståenden om sparse attention finns just för att alternativet vid en miljon tokens är oöverkomlig infrastruktur.

För alla andra är den ärliga formuleringen att det här är en skiljelinje mellan att bygga och att köpa, med en prislapp på. Claude Sonnet 5.5 är den bättre modellen för allt agentiskt. MiniMax M3 är den bättre modellen för att läsa något enormt och svara på en fråga om det, och den är dramatiskt mycket bättre på att bearbeta video, vilket Claude Sonnet 5.5 inte tar emot alls – dess indatayta är text, bilder och filer.

• Vikter — MiniMax M öppna under MiniMaxs community-licens vs Claude Sonnet 5.5 slutna

• Indatamodalitet — MiniMax M3 text, bild och video vs Claude Sonnet 5.5 text, bild och fil

• Maximal utdata — MiniMax M3 512 000 token enligt vår katalog jämfört med Claude Sonnet 5.5 128 000 synkront, 300 000 i Batches

• Cachepris — MiniMax M3 $0.06 per miljon läsningar mot Claude Sonnet 5.5 $0.20 för läsning och $2.50 för skrivning

• Ansträngningskontroll — MiniMax M3-tänkande aktiverat, adaptivt eller inaktiverat jämfört med adaptivt tänkande i Claude Sonnet 5.5, där inaktivering nu kräver between_tools-formen

• Datalagring – MiniMax M3 styrs av din egen distribution om den är självhostad, jämfört med Claude Sonnet 5.5 där noll datalagring finns tillgängligt från A​nthropic vid lansering

Köra båda utan att köra två kontrakt

Blanda en öppen viktmodell från Kina och en sluten Anthropic-modell i en och samma pipeline, och den operativa kostnaden är vanligtvis inte tokens; det är det andra avtalet, den andra nyckeln, den andra uppsättningen hastighetsbegränsningar och den andra platsen där ett fel kan uppstå. OrcaRouter komprimerar det till en OpenAI-kompatibel slutpunkt som täcker över 200 modeller, med leverantörernas listpriser vidarebefordrade oförändrade – inget påslag tillagt på någon av sidorna – automatisk redundansväxling mellan uppströmsleverantörer och ett routing-DSL för att kombinera flera modeller till ett enda anrop. MiniMax M3 kan routas här som minimax/minimax-m3 till MiniMax priser på $0,30 och $1,20 med $0,06 för cacheläsningar, och det är en av de mest trafikerade modellerna i katalogen, vilket i sig är en användbar signal: routningslagret kan berätta hur mycket verklig belastning en modell bär, inte bara hur den presterade.

Claude Sonnet 5.5 finns ännu inte i vår katalog, och artikeln kommer inte att låtsas något annat. Vägen dit i dag går via A​nthropics eget API. Claude Sonnet 5 kan routas här till samma $2.00 och $10.00 och har varit det sedan den 30 juni, och den är det naturliga målet för staging och failover-partnern medan dess efterträdare är en dag gammal.

Den kombinationen – växlingen till lång kontext och den agentiska vägen bakom en och samma autentiseringsuppgift – är vad en router är till för. MiniMax M3 bär 63,2 miljoner token i trafik per vecka genom denna katalog mot Claude Sonnet 5:s 7,9 miljoner, så den billiga modellen är inte en teoretisk ersättare här; den bär redan volymen. Att routa båda från en och samma nyckel innebär att uppdelningen är ett konfigurationsbeslut som du kan flytta trafik över, i stället för ett andra avtal som du måste teckna innan du kan testa den billigare sidan.

OrcaRouter model page for minimax/minimax-m3, dated 2026-05-31, showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 512K maximum output, text, image and video input, $0.30 input and $1.20 output per million tokens, a p50 time to first token of 10.00 s, and 63.2M tokens of recent traffic.

Vad ska man göra med slipsen

Om din arbetsbelastning är dokumentstorskalig frågebesvarande – en mycket lång indata, ett kort faktabaserat svar, en latens som är tolerabel – så är oavgjort i lång kontext på riktigt, och MiniMax M3:s femtonfaldiga kostnadsfördel är det också. Det är ett enkelt utbyte och värt att testa den här veckan.

Om din arbetsbelastning är agentisk avgör Terminal-Bench-raden saken innan priset ens kommer in i bilden. Claude Sonnet 5.5 till $7,60 per Index-uppgift mot MiniMax M3 till $0,51 är en 15× premie för en modell som får sextio poäng högre på den utvärdering som mest liknar din produktionstrafik, och det femton gånger billigare alternativet som misslyckas med uppgiften är det dyra. Mätningen du bör köra på dina egna data är tokens per slutförd uppgift, inte tokens per begäran, eftersom det är den enda siffran i den här artikeln där MiniMax M3:s prisfördel inte håller per automatik.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen