Ett hero-titelkort för MiniMax M3 vs Muse Spark 1.2, underrubriken 'Pris per token, kontext, genomströmning och var benchmarkresultaten skiljer sig åt', som visar två abstrakta rundade kort vända mot varandra över en smal vertikal avdelare, det vänstra kortet accentuerat i blått och det högra i cyan, samt OrcaRouter-logotypen i det nedre högra hörnet.
Guides & Insights

MiniMax M3 vs Muse Spark 1.2: En 4x prisskillnad mot en benchmark-svepning

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

MiniMax M3 kostar $0,30 per miljon inmatningstoken i vår katalog. Muse Spark 1.2 kostar $1,25. Det är en skillnad på 4,2x för inmatning och 3,5x för utmatning, och det är det enskilt mest användbara faktumet om den här kombinationen, för på samma katalogsidor leder Muse Spark 1.2 över MiniMax M3 i varje benchmarkrad som de två modellerna delar. Den ena är det billiga alternativet med öppna vikter och en av leverantören garanterad användbar kontext på 512K samt ett utmatningstak på 512K. Den andra är en Meta-checkpoint för resonemang som nu ligger en generation efter sin egen familj och ändå får högre poäng än den nästan överallt. Resten av den här sidan handlar om vilket av dessa två faktum som faktiskt avgör en arbetsbelastning – och svaret är inte detsamma för varje arbetsbelastning.

Vad var och en av dessa modeller faktiskt är

Båda släpptes i år och ingen av dem är ny. Det spelar roll, för en jämförelsesida som är skriven som om någon av dem vore på väg att lanseras daterar sig själv inom en månad.

A screenshot of MiniMax's own launch blog post for MiniMax M3, dated 2026-06-01, headlined 'MiniMax M3: Frontier Coding, 1M Context, Native Multimodality — All in One Model', opening with the line 'MiniMax M3 is officially released today.' and showing the MSA architecture note and two rows of benchmark bar charts including SWE-Bench Pro, Terminal-Bench 2.1, BrowseComp and OSWorld-verified.

MiniMax M3 är MiniMaxs egen lansering, tillkännagiven på leverantörens blogg den 1 juni 2026 under rubriken "MiniMax M3: Kodning i framkant, 1M-kontext, nativ multimodalitet – allt i en modell." Inlägget inleds lakoniskt: "MiniMax M3 släpps officiellt idag." MiniMaxs tre påståenden om den är att den når prestanda i framkant inom kodning och agentiskt arbete, att den använder MSA (MiniMax Sparse Attention), en ny uppmärksamhetsarkitektur som företaget har föreslagit, och att den är nativt multimodal – den tar emot bild- och videoindata och kan, med MiniMaxs ord, "styra en stationär dator." MiniMax tillägger att dessa tre förmågor är minimikrav för slutna frontier-modeller, och att M3 är "den första och enda modellen med öppna vikter som förenar alla tre." Vår katalog listar modellen som tillgänglig sedan den 31 maj 2026, en dag tidigare än bloggdatumet.

Muse Spark 1.2 är Metas. Vår katalog daterar den till 2026-08-05. Det är inte en ny nivå – det är en uppdaterad checkpoint över Muse Spark 1.1 med något högre prestanda, som körs på samma Standard-nivå till identiskt pris, vilket gör den till en drop-in-uppgradering snarare än en separat produkt. Dess utmärkande drag är inmatningsytan: text, bilder, video, ljud och PDF. Utdata är text.

En bit sammanhang hör hemma här i stället för att begravas längre fram. Meta flyttade Muse Spark-familjen vidare till en 1.3-checkpoint den 2 september 2026, vilket gör 1.2 till den tidigare generationen av dess egen linje. Det hände för tre veckor sedan, så det är inte nyheter och den här sidan behandlar det inte som nyheter – men den som idag väljer mellan dessa två bör veta att man jämför en aktuell MiniMax-modell med en ersatt Meta-modell.

Pris per miljon tokens, och vad en arbetsbelastning faktiskt kostar

A screenshot of the OrcaRouter model page for Muse Spark 1.2 (meta/muse-spark-1.2), showing the breadcrumb Home > Models > Meta > Muse Spark 1.2, the model title with a FEATURED badge, the line 'by Meta · 2026-08-05', capability chips reading Vision, Audio, Tools, JSON and Reasoning, the model description, and the stat strip reading INPUT $1.25 per 1M tokens, OUTPUT $4.25 per 1M tokens, P50 TTFT 4.82 s, P95 TTFT 10.00 s and TRAFFIC 79.6M tokens over 7 days.

De publicerade priserna, hämtade från varje modells sida i vår egen katalog, som förmedlar leverantörens listpris utan påslag:

• Indata — MiniMax M3 $0.30 per 1 miljon tokens mot Muse Spark 1.2 $1.25 per 1 miljon tokens

• Utdata — MiniMax M3 $1,20 per 1M vs Muse Spark 1.2 $4,25 per 1M

• Cache-läsning — MiniMax M3 $0,060 per 1M mot Muse Spark 1.2 $0,150 per 1M

• Förhållande — Muse Spark 1.2 är 4,2x på input, 3,5x på output, 2,5x på cacheläsningar

Dessa abstrakta förhållanden blir konkreta i kostnadskalkylatorn på varje sida. Ställ in båda på 10 miljoner tokens i månaden med 70 % andel indata – en rimlig form för ett sammanfattnings- eller extraheringsjobb, och standardvärdet som uppskattaren levereras med – och MiniMax M3 landar på 5,70 USD i månaden. Muse Spark 1.2 landar på 11,30 USD i månaden. Slå på prompt-cachning och samma arbetsbelastning landar på ungefär 4,86 USD mot ungefär 9,63 USD. Kalkylatorn märker båda som uppskattningar baserade på listpris, vilket är rätt förbehåll: verkliga tokenantal beror på leverantörens tokeniserare.

För en billig arbetsbelastning är skillnaden kaffepengar. Poängen är kurvans form, inte det absoluta talet: en arbetsbelastning på hundra miljoner output-tunga tokens i månaden går från tresiffrigt till fyrsiffrigt enbart på Muse Spark-sidan. Om kostnaden är den begränsning som fick dig att titta på den här kombinationen, är det siffran du bör modellera utifrån din egen trafik.

Eftersom vi för vidare leverantörens listpris direkt utan påslag syns en leverantörs prissänkning på vår sida samma dag som den tillkännages, och båda dessa modeller dirigeras hit – en nyckel täcker båda, så att prissätta dem mot varandra kräver varken ett andra avtal eller en kodändring.

Kontextfönster, och vad som faktiskt får plats i det

Det här är avsnittet där de två är mest lika varandra på ett specifikationsblad och minst lika varandra i praktiken.

• Kontextfönster — MiniMax M3 1 048 576 tokens mot Muse Spark 1.2 1 048 576 tokens

• Maximal utdata — MiniMax M3 512 000 tokens vs Muse Spark 1.2 131 072 tokens

• Inmatningsyta — MiniMax M3 text, bild och video vs Muse Spark 1.2 text, bild, video, ljud och PDF

• Utdatayta — båda avger enbart text

• Strukturerade parametrar — MiniMax M3 exponerar tools och tool_choice; Muse Spark 1.2 exponerar reasoning_effort och structured_outputs

Båda fönstren är på samma miljon tokens, så frågan ”vem har mer kontext” har ingen vinnare. Raden för maximal utdata är där de skiljer sig: ett svar från MiniMax M3 kan uppgå till 512 000 tokens, ungefär fyra gånger Muse Spark 1.2:s tak på 131 072. Om ditt arbete är långformsgenerering – en omskrivning av en hel fil, en lång rapport, en utdata i transkriptionsskala – är den skillnaden strukturell, inte inkrementell. Om ditt arbete är korta svar på en lång indata är den irrelevant.

Raden för indataytan går i motsatt riktning. Muse Spark 1.2 tar emot ljud och PDF direkt; MiniMax M3:s dokumenterade indatayta stannar vid bild och video. En pipeline som tar in samtalsinspelningar eller skannade dokument har olika mycket förbearbetning att göra för vardera av dessa två.

På MiniMax-sidan innehåller kontextpåståendet en arkitekturanmärkning som är värd att tydligt märkas som leverantörens egen. MiniMax tillskriver M3:s långkontextbeteende MSA (MiniMax Sparse Attention), som vår katalog beskriver som stöd för upp till 1M tokens kontext "med ett garanterat minimum på 512K". Inramningen med garanterat minimum är MiniMaxs egen; det finns ingen oberoende mätning av detta som vi kan hänvisa till, så behandla 512K-golvet som ett leverantörspåstående snarare än en testad siffra.

Latens och genomströmning på vår egen gateway

Det här är de siffror vi kan uttala oss mest direkt om, eftersom de är våra egna siffror. De täcker de sju dagarna fram till 2026-09-23 och beskriver trafiken på vår gateway, inte ett leverantörsbenchmark.

• p50 tid till första token — MiniMax M3 4,28 s vs Muse Spark 1.2 4,82 s

• p95-tid till första token — MiniMax M3 10,00 s vs Muse Spark 1.2 10,00 s

• Uthastighet — MiniMax M3 289 tok/s mot Muse Spark 1.2 507 tok/s

• Felfrekvens — MiniMax M3 0,12 % mot Muse Spark 1.2 0,15 %

• Trafik, senaste 7 dagarna — MiniMax M3 153,8 mn tokens mot Muse Spark 1.2 79,6 mn tokens

Läs det här ärligt och bilden är tudelad. När det gäller tid till första token är de två nära varandra – 4,28 mot 4,82 sekunder vid medianen, och p95 är identisk på hundradelen vid 10,00 sekunder, vilket är en avrundningsartefakt av att båda ligger nära samma tak snarare än ett verkligt oavgjort resultat. När det gäller utdatahastighet är de inte alls nära: Muse Spark 1.2 strömmar med ungefär 1,75x MiniMax M3:s hastighet, vilket förändrar hur en lång generering känns för en användare som tittar på den, även när den totala kostnaden är högre. Felfrekvenserna ligger inom ett avrundningsfel från varandra och båda är låga.

Trafikraden är värd att läsa som en signal snarare än en resultattavla: under samma sju dagar flyttade MiniMax M3 ungefär dubbelt så många tokens som Muse Spark 1.2 gjorde via vår gateway. Det är vad marknaden väljer, inte vad benchmarkarna säger, och på den här kombinationen går de två isär.

Att routa båda bakom en och samma endpoint är också det billiga sättet att ta reda på vilken din arbetsbelastning föredrar, eftersom failover innebär att en försämring på leverantörssidan för endera modellen faller vidare till en fungerande väg i stället för ett fel.

Verktygsanrop och långsiktigt agentiskt arbete

Det är här de två ligger längst ifrån varandra vad gäller uppmätta resultat, och där förbehållen har störst betydelse.

• Terminal-Bench v2.1 — MiniMax M3 52,4 mot Muse Spark 1.2 80,1

• tau_banking (verktygsanvändning) — MiniMax M3 12,3 mot Muse Spark 1.2 34,8

• MCP Atlas — MiniMax M3 74.2 (enligt leverantören) mot Muse Spark 1.2, inte mätt

• BrowseComp — MiniMax M3 83,5 (leverantörsrapporterat) mot Muse Spark 1.2 ej uppmätt

• OSWorld-Verified — MiniMax M3 70,0 (enligt leverantören) mot Muse Spark 1.2, inte uppmätt

De två första raderna kommer från benchmarkpanelen på våra egna katalogsidor och är de enda agentiska raderna som båda modellerna har fyllt i. De är inte nära varandra: Muse Spark 1.2 mer än fördubblar MiniMax M3 på tau_banking och leder Terminal-Bench v2.1 med nästan 28 poäng. Om din arbetsbelastning är en långsiktig agent med en verktygsyta, är det det största enskilda gapet på den här sidan.

De nästa tre raderna är MiniMaxs egna siffror, publicerade i lanseringsinlägget. De är inte jämförbara med de två första – olika utvärderingsramverk, ingen oberoende granskning – men de är de enda publicerade siffrorna för MiniMax M3 på dessa uppgifter, så att utesluta dem skulle underskatta modellen. Läs dem som leverantörsrapporterade och inget mer.

En avvikelse förtjänar ett eget stycke, för det är den typ av sak som en jämförelsesida vanligtvis slätar över. MiniMaxs lanseringsinlägg återger Terminal-Bench 2.1 som 66,0 för M3, i en diagrambild utan någon åtföljande numerisk tabell. Den oberoende raden för Terminal-Bench v2.1 på vår katalogsida visar 52,4 för samma modell. Uppgiftsnamnen ligger tillräckligt nära varandra för att läsare ska möta dem sida vid sida, och de två siffrorna skiljer sig med mer än 13 punkter. Vi kommer inte att utropa en av dem som felaktig: den troliga förklaringen är ett annat testramverk eller en annan körkonfiguration, och det ärliga påståendet är att leverantörens eget nummer och det granskade numret inte stämmer överens, där leverantörens är det högre.

Parameterlistorna berättar en mindre, mer praktisk historia. MiniMax M3 exponerar tools och tool_choice, så verktygsvalet kan styras från begäran. Muse Spark 1.2 exponerar reasoning_effort, så i stället är det resonemangets djup som kan styras. Ingen av dem exponerar den andras ratt. Om din applikations styrningsproblem är ”få den att anropa rätt funktion” pekar det åt ena hållet; om det är ”få den att tänka längre i de svåra fallen” pekar det åt det andra.

Kodning

Kodning är MiniMax M3:s främsta säljargument och det område där det uppmätta gapet är som mest besvärande för den.

• AA Coding Index — MiniMax M3 38,7 mot Muse Spark 1.2 72,2

• SciCode — MiniMax M3 43,1 mot Muse Spark 1,2 57,4

• SWE-Bench Pro — MiniMax M3 59,0 (leverantörsrapporterat) vs Muse Spark 1.2 inte uppmätt

• KernelBench Hard — MiniMax M3 28,8 (enligt leverantören) vs Muse Spark 1.2 ej uppmätt

MiniMaxs positionering för M3 är kodningsförst — lanseringsrubriken sätter "Frontier Coding" före kontexten på en miljon token och multimodaliteten. MiniMaxs eget rapporterade SWE-Bench Pro-resultat på 59,0 är en stark siffra i leverantörens testramverk. På de oberoende raderna Coding Index och SciCode, som båda modellerna har fyllt i, leder dock Muse Spark 1.2 med bred marginal, och gapet på 33 punkter i Coding Index är det näst största på den här sidan efter tau_banking.

Det finns inget ärligt sätt att presentera MiniMax M3 som den bättre kodningsmodellen utifrån den tillgängliga bevisningen. Vad som kan sägas är att leverantörens egna kodningssiffror är höga och att de oberoende inte är det, i samma mönster som Terminal-Bench-avvikelsen ovan. Den vars beslut hänger på kodning bör väga de granskade raderna tyngre än diagrammen i lanseringsinlägget, och bör testa i sitt eget kodförråd snarare än i någon av dem.

Där de är genuint nära

Tre rader vägrar att få fram en vinnare, och att säga det är mer användbart än att fabricera en.

• GPQA Diamond — MiniMax M3 89,9 mot Muse Spark 1.2 90,4, en lucka på 0,5 poäng som är oavgjort för alla praktiska syften

• p95-tid till första token — båda 10,00 s under de senaste sju dagarna på vår gateway

• Kontextfönster och utdatamodalitet — identiska vid 1 048 576 indatatoken och utdata endast som text

På naturvetenskapligt resonemang på avancerad nivå är de två i praktiken omöjliga att skilja åt, och det är den enda resonemangsraden där MiniMax M3:s betydligt billigare modell står sig väl mot den dyrare. Det är värt att komma ihåg när man läser de aggregerade indexen: gapet mellan dessa modeller är inte enhetligt över förmågorna, det är koncentrerat till agentiskt arbete och kodningsarbete, och det är i stort sett noll på kunskapstunga flervalsfrågor.

A self-built two-column scoreboard for MiniMax M3 vs Muse Spark 1.2: left column MiniMax M3 with Price in/out $0.30 / $1.20, Context window 1M tokens, Max output 512K tokens, AA Coding Index 38.7, tau_banking 12.3 and Output speed 289 tok/s; right column Muse Spark 1.2 with Price in/out $1.25 / $4.25, Context window 1M tokens, Max output 131K tokens, AA Coding Index 72.2, tau_banking 34.8 and Output speed 507 tok/s; footer 'Prices and speed from OrcaRouter gateway data; benchmark figures per Artificial Analysis.'

Välj MiniMax M3 om, välj Muse Spark 1.2 om

De två fakta från inledningsstycket löser sig olika beroende på vad du bygger, så här är uppdelningen utan förbehåll.

• Välj MiniMax M3 om kostnaden per token är den bindande begränsningen, om du behöver långformatsutdata över 131 072 tokens, om du behöver öppna vikter, om du vill ha videoindata utan en separat pipeline, eller om du vill utföra resonemangstungt kunskapsarbete till ungefär en fjärdedel av indatapriset — GPQA Diamond är ett dött lopp, och det är raden där den billiga modellen förtjänar sin plats.

• Välj Muse Spark 1.2 om din arbetsbelastning är en långsiktig agent med verktyg, om du behöver de högsta granskade kodningsresultaten, om du vill ha en explicit reasoning_effort-inställning, om du behöver läsa in ljud eller PDF direkt, eller om du behöver snabb strömmande utdata — 507 tok/s mot 289 tok/s är en synlig skillnad, inte en benchmark-skillnad.

• Om du ännu inte vet vilken, finns det avgörande beviset inte på den här sidan. Testa båda modellerna mot ett urval av din egen trafik och mät; priskalkylatorn på varje modellsida visar kostnadssidan på en minut, och latenssiffrorna för sju dagar ovan är det närmaste man kommer en förhandsvisning av prestandasidan.

Båda använder ett och samma API utan påslag över leverantörens listpris, så testet är ett byte av modell-id snarare än en migrering, och automatisk felväxling innebär att en dålig dag hos endera leverantören leder till ett långsammare svar snarare än ett avbrott.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen