Een hero-titelkaart voor MiniMax M3 vs Muse Spark 1.2, ondertitel 'Prijs per token, context, doorvoer, en waar de benchmarks uiteenlopen', met twee abstracte afgeronde kaarten die tegenover elkaar staan aan weerszijden van een dunne verticale scheiding, waarbij de linkerkaart een blauw accent heeft en de rechter een cyaan accent, en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

MiniMax M3 vs. Muse Spark 1.2: Een 4x prijsverschil tegen een benchmark-sweep

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

MiniMax M3 kost $0,30 per miljoen inputtokens in onze catalogus. Muse Spark 1.2 kost $1,25. Dat is een verschil van 4,2x qua input en 3,5x qua output, en het is het meest bruikbare feit over deze combinatie, want op dezelfde cataloguspagina's scoort Muse Spark 1.2 hoger dan MiniMax M3 op elke benchmarkrij die de twee modellen delen. De ene is de goedkope open-weightoptie met een door de leverancier gegarandeerde 512K bruikbare context en een outputplafond van 512K. De andere is een Meta reasoning-checkpoint dat nu één generatie achterloopt op zijn eigen familie en dat toch bijna overal beter scoort dan MiniMax M3. De rest van deze pagina gaat over welk van die twee feiten een workload daadwerkelijk bepaalt — en het antwoord is niet voor elke workload hetzelfde.

Wat elk van deze modellen eigenlijk is

Beide zijn dit jaar uitgebracht en geen van beide is nieuw. Dat is van belang, want een vergelijkingspagina die is geschreven alsof een van beide nog moet verschijnen, dateert zichzelf binnen een maand.

A screenshot of MiniMax's own launch blog post for MiniMax M3, dated 2026-06-01, headlined 'MiniMax M3: Frontier Coding, 1M Context, Native Multimodality — All in One Model', opening with the line 'MiniMax M3 is officially released today.' and showing the MSA architecture note and two rows of benchmark bar charts including SWE-Bench Pro, Terminal-Bench 2.1, BrowseComp and OSWorld-verified.

MiniMax M3 is de eigen release van MiniMax, aangekondigd op de blog van de leverancier op 2026-06-01 onder de kop "MiniMax M3: frontier-codering, 1M context, native multimodaliteit — alles in één model." De post begint ronduit: "MiniMax M3 is vandaag officieel uitgebracht." De drie claims van MiniMax voor het model zijn dat het prestaties op frontier-niveau levert op het gebied van coderen en agentisch werk, dat het MSA (MiniMax Sparse Attention) gebruikt, een nieuwe attention-architectuur die het bedrijf heeft voorgesteld, en dat het native multimodaal is — het accepteert beeld- en video-invoer en kan, in de woorden van MiniMax, "een desktopcomputer bedienen." MiniMax voegt daaraan toe dat deze drie capaciteiten basisvereisten zijn voor closed-source frontiermodellen, en dat M3 "het eerste en enige open-weight model is dat alle drie combineert." Onze catalogus vermeldt het model als beschikbaar sinds 2026-05-31, een dag eerder dan de datum van de blog.

Muse Spark 1.2 is van Meta. Onze catalogus dateert het op 2026-08-05. Het is geen nieuwe tier — het is een bijgewerkt checkpoint bovenop Muse Spark 1.1 met iets hogere prestaties, aangeboden op dezelfde Standard-tier tegen identieke prijzen, waardoor het een drop-in-upgrade is in plaats van een apart product. Het onderscheidende kenmerk is het invoeroppervlak: tekst, afbeeldingen, video, audio en PDF. De uitvoer is tekst.

Eén stuk context hoort hier thuis in plaats van later begraven te worden. Meta heeft de Muse Spark-familie op 2 september 2026 naar een 1.3-checkpoint gebracht, waardoor 1.2 de vorige generatie van zijn eigen lijn is. Dat gebeurde drie weken geleden, dus het is geen nieuws en deze pagina behandelt het niet als nieuws — maar wie vandaag tussen deze twee moet kiezen, moet weten dat hij een actueel MiniMax-model vergelijkt met een Meta-model dat is opgevolgd.

Prijs per miljoen tokens, en wat een workload daadwerkelijk kost

A screenshot of the OrcaRouter model page for Muse Spark 1.2 (meta/muse-spark-1.2), showing the breadcrumb Home > Models > Meta > Muse Spark 1.2, the model title with a FEATURED badge, the line 'by Meta · 2026-08-05', capability chips reading Vision, Audio, Tools, JSON and Reasoning, the model description, and the stat strip reading INPUT $1.25 per 1M tokens, OUTPUT $4.25 per 1M tokens, P50 TTFT 4.82 s, P95 TTFT 10.00 s and TRAFFIC 79.6M tokens over 7 days.

De gepubliceerde tarieven, overgenomen van de pagina van elk model in onze eigen catalogus, die de adviesprijs van de provider doorgeeft zonder dat er een opslag wordt toegevoegd:

• Invoer — MiniMax M3 $0,30 per 1 miljoen tokens versus Muse Spark 1.2 $1,25 per 1 miljoen tokens

• Uitvoer — MiniMax M3 $1,20 per 1M vs Muse Spark 1.2 $4,25 per 1M

• Cache-lezen — MiniMax M3 $0,060 per 1 mln. vs Muse Spark 1.2 $0,150 per 1 mln.

• Verhouding — Muse Spark 1.2 is 4,2x op invoer, 3,5x op uitvoer, 2,5x op cache-leesbewerkingen

Die abstracte verhoudingen worden concreet in de kostencalculator op elke pagina. Stel beide in op 10 miljoen tokens per maand bij een inputaandeel van 70% — een redelijke vorm voor een samenvattings- of extractietaak, en de standaardwaarde waarmee de estimator wordt geleverd — en MiniMax M3 komt uit op $5,70 per maand. Muse Spark 1.2 komt uit op $11,30 per maand. Zet je promptcaching aan, dan komt dezelfde workload uit op ongeveer $4,86 tegenover ongeveer $9,63. De calculator merkt beide aan als schattingen op basis van de lijstprijs, wat de juiste kanttekening is: werkelijke tokenaantallen hangen af van de tokenizer van de provider.

Bij een goedkope workload is het verschil een fooi. Het gaat om de vorm van de curve, niet om het absolute getal: een workload van honderd miljoen output-intensieve tokens per maand gaat alleen al aan de Muse Spark-kant van drie naar vier cijfers. Als kosten de beperking zijn waardoor je naar deze combinatie bent gaan kijken, is dat het getal om op je eigen verkeer te modelleren.

Omdat we de lijstprijs van de provider ongewijzigd en zonder opslag doorgeven, wordt een prijsverlaging van een leverancier bij ons dezelfde dag zichtbaar dat deze wordt aangekondigd, en beide modellen worden hierheen geleid — één sleutel dekt beide, dus om ze qua prijs tegen elkaar af te wegen is geen tweede contract of codewijziging nodig.

Contextvenster, en wat er nu eigenlijk in past

Dit is het gedeelte waar de twee op een specificatieblad het meest op elkaar lijken en in gebruik het minst.

• Contextvenster — MiniMax M3 1.048.576 tokens vs Muse Spark 1.2 1.048.576 tokens

• Maximale output — MiniMax M3 512.000 tokens vs Muse Spark 1.2 131.072 tokens

• Invoeroppervlak — MiniMax M3 tekst, afbeelding en video vs Muse Spark 1.2 tekst, afbeelding, video, audio en PDF

• Uitvoeroppervlak — beide zenden alleen tekst uit

• Gestructureerde parameters — MiniMax M3 biedt tools en tool_choice; Muse Spark 1.2 biedt reasoning_effort en structured_outputs

Beide contextvensters zijn hetzelfde miljoen tokens, dus de vraag "wie heeft meer context" kent geen winnaar. De rij voor maximale uitvoer is waar ze verschillen: een antwoord van MiniMax M3 kan oplopen tot 512.000 tokens, ongeveer vier keer het plafond van 131.072 van Muse Spark 1.2. Als je werk het genereren van lange teksten is — een volledige bestandsherschrijving, een lang rapport, uitvoer op transcriptieschaal — dan is dat verschil structureel, niet gradueel. Als je werk bestaat uit korte antwoorden op een lange invoer, is het irrelevant.

De rij over het invoeroppervlak wijst de andere kant op. Muse Spark 1.2 accepteert audio en pdf rechtstreeks; het gedocumenteerde invoeroppervlak van MiniMax M3 stopt bij afbeelding en video. Een pipeline die gespreksopnamen of gescande documenten opneemt, moet voor elk van deze twee een andere hoeveelheid voorbewerking uitvoeren.

Aan de MiniMax-kant gaat de contextbewering gepaard met een architectuurnoot die duidelijk als die van de leverancier zelf moet worden aangeduid. MiniMax schrijft het gedrag van M3 bij lange contexten toe aan MSA (MiniMax Sparse Attention), dat onze catalogus omschrijft als ondersteuning voor tot 1M tokens context "met een gegarandeerd minimum van 512K." De formulering met een gegarandeerd minimum is van MiniMax; er is geen onafhankelijke meting ervan waar we naar kunnen verwijzen, dus beschouw de ondergrens van 512K als een leveranciersclaim en niet als een getest cijfer.

Latentie en doorvoer op onze eigen gateway

Dit zijn de cijfers waar we het meest direct over kunnen spreken, omdat het onze eigen cijfers zijn. Ze bestrijken de zeven dagen tot 2026-09-23 en beschrijven het verkeer op onze gateway, niet een leveranciersbenchmark.

• p50 tijd tot eerste token — MiniMax M3 4,28 s vs. Muse Spark 1.2 4,82 s

• p95 tijd tot eerste token — MiniMax M3 10.00 s vs Muse Spark 1.2 10.00 s

• Uitvoersnelheid — MiniMax M3 289 tok/s vs Muse Spark 1.2 507 tok/s

Foutpercentage — MiniMax M3 0,12% vs Muse Spark 1.2 0,15%

• Verkeer, afgelopen 7 dagen — MiniMax M3 153,8 mln. tokens vs. Muse Spark 1.2 79,6 mln. tokens

Lees dit eerlijk en het beeld is verdeeld. Op tijd tot het eerste token liggen de twee dicht bij elkaar — 4,28 tegen 4,82 seconden mediaan, en de p95 is identiek tot op de honderdste op 10,00 seconden, wat een afrondingsartefact is van beide die tegen hetzelfde plafond aan zitten in plaats van een echte gelijke stand. Op uitvoersnelheid liggen ze helemaal niet dicht bij elkaar: Muse Spark 1.2 streamt met ongeveer 1,75x de snelheid van MiniMax M3, wat verandert hoe een lange generatie aanvoelt voor een gebruiker die meekijkt, zelfs wanneer de totale kosten hoger zijn. De foutpercentages liggen binnen een afrondingsfout van elkaar en beide zijn laag.

De verkeersrij is de moeite waard om te lezen als signaal, niet als scorebord: over dezelfde zeven dagen verwerkte MiniMax M3 ongeveer twee keer zoveel tokens als Muse Spark 1.2 via onze gateway. Dat is wat de markt kiest, niet wat de benchmarks zeggen, en bij deze combinatie zijn de twee het oneens.

Het routeren van beide achter één endpoint is ook de goedkope manier om erachter te komen welke jouw workload verkiest, want failover betekent dat een degradatie aan de kant van de provider bij een van beide modellen doorstroomt naar een werkend pad in plaats van naar een foutmelding.

Het aanroepen van tools en langdurig agentisch werk

Dit is waar de twee het verst uit elkaar liggen qua gemeten resultaten, en waar de kanttekeningen het zwaarst wegen.

• Terminal-Bench v2.1 — MiniMax M3 52,4 vs Muse Spark 1.2 80,1

• tau_banking (toolgebruik) — MiniMax M3 12.3 vs Muse Spark 1.2 34.8

• MCP Atlas — MiniMax M3 74.2 (opgegeven door leverancier) vs Muse Spark 1.2 niet gemeten

• BrowseComp — MiniMax M3 83,5 (door leverancier opgegeven) vs Muse Spark 1.2 niet gemeten

• OSWorld-Verified — MiniMax M3 70.0 (volgens opgave van de leverancier) vs Muse Spark 1.2 niet gemeten

De eerste twee rijen komen uit het benchmarkpaneel op onze eigen cataloguspagina's en zijn de enige agentische rijen die beide modellen hebben ingevuld. Ze liggen ver uit elkaar: Muse Spark 1.2 scoort meer dan twee keer zo hoog als MiniMax M3 op tau_banking en leidt op Terminal-Bench v2.1 met bijna 28 punten. Als je workload een langdurige agent met een tooloppervlak is, is dat het grootste enkele verschil op deze pagina.

De volgende drie rijen zijn MiniMax' eigen cijfers, gepubliceerd in de lanceringspost. Ze zijn niet vergelijkbaar met de eerste twee — andere testomgevingen, geen onafhankelijke audit — maar het zijn de enige gepubliceerde cijfers voor MiniMax M3 op die taken, dus als we ze weglieten, zou dat het model te laag inschatten. Lees ze als door de leverancier gerapporteerd en niets meer.

Eén verschil verdient een eigen alinea, want het is precies het soort ding dat een vergelijkingspagina meestal gladstrijkt. De lanceringspost van MiniMax geeft Terminal-Bench 2.1 weer als 66,0 voor M3, in een afbeelding van een grafiek zonder bijbehorende numerieke tabel. De onafhankelijke rij Terminal-Bench v2.1 op onze cataloguspagina toont 52,4 voor hetzelfde model. De taaknamen lijken zo sterk op elkaar dat lezers ze naast elkaar zullen zien, en de twee cijfers verschillen meer dan 13 punten. We gaan niet een van beide als onjuist bestempelen: de waarschijnlijke verklaring is een andere harness of een andere runconfiguratie, en de eerlijke vaststelling is dat het eigen cijfer van de leverancier en het gecontroleerde cijfer van elkaar afwijken, waarbij dat van de leverancier het hoogste is.

De parameterlijsten vertellen een kleiner, praktischer verhaal. MiniMax M3 stelt tools en tool_choice beschikbaar, dus de toolselectie is vanuit het verzoek aan te sturen. Muse Spark 1.2 stelt reasoning_effort beschikbaar, dus in plaats daarvan is de diepgang van het redeneren aan te sturen. Geen van beide stelt de knop van de andere beschikbaar. Als het sturingsprobleem van je applicatie is "zorg dat hij de juiste functie aanroept", wijst dat in de ene richting; als het "laat hem langer nadenken bij de moeilijke gevallen" is, wijst dat in de andere richting.

Coderen

Programmeren is de belangrijkste claim van MiniMax M3 en het punt waarop de gemeten kloof ervoor het meest ongemakkelijk is.

• AA Coding Index — MiniMax M3 38,7 vs Muse Spark 1.2 72,2

• SciCode — MiniMax M3 43,1 vs Muse Spark 1.2 57,4

• SWE-Bench Pro — MiniMax M3 59,0 (door leverancier gerapporteerd) vs Muse Spark 1.2 niet gemeten

• KernelBench Hard — MiniMax M3 28,8 (door leverancier gerapporteerd) vs Muse Spark 1.2 niet gemeten

De positionering van MiniMax voor M3 is coding-first — de lanceringskop zet 'Frontier Coding' vóór de miljoen-tokencontext en de multimodaliteit. Het eigen gerapporteerde SWE-Bench Pro-cijfer van 59,0 is een sterk getal op de harness van de leverancier. Op de onafhankelijke Coding Index- en SciCode-rijen die beide modellen hebben ingevuld, leidt Muse Spark 1.2 echter met een ruime marge, en het verschil van 33 punten op de Coding Index is het op een na grootste op deze pagina, na tau_banking.

Er is geen eerlijke manier om MiniMax M3 op basis van het beschikbare bewijs als het betere codeermodel te presenteren. Wat wel gezegd kan worden, is dat de eigen codeercijfers van de leverancier hoog zijn en de onafhankelijke niet, in hetzelfde patroon als de divergentie bij Terminal-Bench hierboven. Wie zijn beslissing laat afhangen van coderen, zou meer gewicht moeten toekennen aan de gecontroleerde rijen dan aan de grafieken in de aankondigingspost, en zou moeten testen op de eigen repository in plaats van op een van beide.

Waar ze oprecht dicht bij elkaar zijn

Drie rijen weigeren een winnaar op te leveren, en dat zeggen is nuttiger dan er een te fabriceren.

• GPQA Diamond — MiniMax M3 89,9 vs Muse Spark 1.2 90,4, een verschil van 0,5 punt dat voor alle praktische doeleinden een gelijkspel is

• p95 tijd tot eerste token — beide 10,00 s over de afgelopen zeven dagen op onze gateway

• Contextvenster en uitvoermodaliteit — identiek met 1.048.576 invoertokens en uitvoer in alleen tekst

Bij wetenschappelijk redeneren op masterniveau zijn de twee vrijwel niet van elkaar te onderscheiden, en dat is de enige redeneerrij waarin het veel goedkopere model van MiniMax M3 zich staande houdt tegenover het duurdere. Het is de moeite waard om dit te onthouden bij het lezen van de geaggregeerde indices: de kloof tussen deze modellen is niet uniform over de vaardigheden; ze is geconcentreerd in agentisch werk en programmeerwerk, en ongeveer nul bij kennisintensieve meerkeuzevragen.

A self-built two-column scoreboard for MiniMax M3 vs Muse Spark 1.2: left column MiniMax M3 with Price in/out $0.30 / $1.20, Context window 1M tokens, Max output 512K tokens, AA Coding Index 38.7, tau_banking 12.3 and Output speed 289 tok/s; right column Muse Spark 1.2 with Price in/out $1.25 / $4.25, Context window 1M tokens, Max output 131K tokens, AA Coding Index 72.2, tau_banking 34.8 and Output speed 507 tok/s; footer 'Prices and speed from OrcaRouter gateway data; benchmark figures per Artificial Analysis.'

Kies MiniMax M3 als, kies Muse Spark 1.2 als

De twee feiten uit de openingsparagraaf pakken anders uit, afhankelijk van wat je bouwt, dus hier is het onderscheid zonder voorbehoud.

• Kies MiniMax M3 als de kosten per token de beperkende factor zijn, als je langvormige output nodig hebt van meer dan 131.072 tokens, als je open weights nodig hebt, als je video-invoer wilt zonder een aparte pipeline, of als je redeneerintensief kenniswerk wilt voor ongeveer een kwart van de invoerprijs — GPQA Diamond is een nek-aan-nekrace en dat is de rij waarop het goedkope model zijn plek verdient.

• Kies Muse Spark 1.2 als je workload een langetermijn-agent met tools is, als je de hoogst geauditeerde codingscores nodig hebt, als je een expliciete reasoning_effort-regelaar wilt, als je rechtstreeks audio of pdf wilt inlezen, of als je snelle streaming-uitvoer nodig hebt — 507 tok/s tegenover 289 tok/s is een zichtbaar verschil, niet een benchmarkverschil.

• Als je nog niet weet welke, staat het beslissende bewijs niet op deze pagina. Laat beide modellen los op een steekproef van je eigen verkeer en meet het; de prijscalculator op elke modelpagina vertelt je binnen een minuut wat de kostenkant is, en de latentiecijfers over zeven dagen hierboven komen het dichtst in de buurt van een voorproefje van de prestatiekant.

Beide draaien op één API zonder opslag bovenop de lijstprijs van de provider, dus de proef is een wijziging van het model-id in plaats van een migratie, en automatische failover betekent dat een slechte dag bij een van beide providers uitmondt in een langzamer antwoord in plaats van een storing.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt