
MiniMax M3 vs. Muse Spark 1.2: Eine 4-fache Preisdifferenz gegenüber einem Benchmark-Sweep
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiniMax M3 kostet in unserem Katalog 0,30 $ pro Million Eingabe-Tokens. Muse Spark 1.2 kostet 1,25 $. Das ist ein 4,2-facher Abstand bei der Eingabe und ein 3,5-facher Abstand bei der Ausgabe, und es ist die nützlichste Einzeltatsache über dieses Paar, weil auf denselben Katalogseiten Muse Spark 1.2 in jeder Benchmark-Zeile, die beide Modelle gemeinsam haben, vor MiniMax M3 liegt. Das eine ist die günstige Open-Weight-Option mit anbieterseitig garantierten 512K nutzbarem Kontext und einer Ausgabeobergrenze von 512K. Das andere ist ein Meta-Reasoning-Checkpoint, der inzwischen eine Generation hinter seiner eigenen Modellfamilie zurückliegt und trotzdem fast überall besser abschneidet. Der Rest dieser Seite dreht sich darum, welche dieser beiden Tatsachen für eine Arbeitslast tatsächlich den Ausschlag gibt – und die Antwort fällt nicht für jede Arbeitslast gleich aus.
Was jedes dieser Modelle tatsächlich ist
Beide sind dieses Jahr erschienen, und keines von beiden ist neu. Das ist wichtig, denn eine Vergleichsseite, die so geschrieben ist, als würde eines von beiden gerade erst auf den Markt kommen, ist innerhalb eines Monats veraltet.

MiniMax M3 ist eine Eigenveröffentlichung von MiniMax, angekündigt am 2026-06-01 im Blog des Anbieters unter der Überschrift „MiniMax M3: Frontier-Coding, 1M-Kontext, native Multimodalität – alles in einem Modell“. Der Beitrag beginnt lapidar: „MiniMax M3 ist heute offiziell veröffentlicht.“ MiniMax erhebt drei Ansprüche für das Modell: Es erreiche Frontier-Leistung bei Coding und agentischer Arbeit, es nutze MSA (MiniMax Sparse Attention), eine neue vom Unternehmen vorgeschlagene Attention-Architektur, und es sei nativ multimodal – es akzeptiere Bild- und Videoeingaben und könne, mit MiniMax' Worten, „einen Desktop-Computer bedienen“. MiniMax ergänzt, diese drei Fähigkeiten seien für Closed-Source-Frontier-Modelle Pflicht, und M3 sei „das erste und einzige Open-Weight-Modell, das alle drei zusammenbringt“. Unser Katalog führt das Modell als verfügbar seit 2026-05-31, einen Tag früher als das Blogdatum.
Muse Spark 1.2 stammt von Meta. Unser Katalog datiert es auf den 2026-08-05. Es ist keine neue Stufe – es ist ein aktualisierter Checkpoint gegenüber Muse Spark 1.1 mit etwas höherer Leistung, der auf derselben Standard-Stufe zu identischen Preisen bereitgestellt wird, was es eher zu einem Drop-in-Upgrade als zu einem separaten Produkt macht. Sein herausragendes Merkmal ist die Eingabeoberfläche: Text, Bilder, Video, Audio und PDF. Die Ausgabe ist Text.
Ein Stück Kontext gehört hierher, statt später begraben zu werden. Meta hat die Muse-Spark-Familie am 2026-09-02 auf einen 1.3-Checkpoint weitergeführt, wodurch 1.2 die vorherige Generation ihrer eigenen Linie ist. Das ist vor drei Wochen passiert, also ist es keine Neuigkeit, und diese Seite behandelt es nicht als Neuigkeit — aber wer heute zwischen diesen beiden wählt, sollte wissen, dass er ein aktuelles MiniMax-Modell mit einem abgelösten Meta-Modell vergleicht.
Preis pro Million Tokens und was eine Workload tatsächlich kostet

Die veröffentlichten Preise, entnommen von der Seite jedes Modells in unserem eigenen Katalog, der die Listenpreise der Anbieter ohne Aufschlag weitergibt:
• Eingabe — MiniMax M3 $0.30 pro 1 Mio. Token vs. Muse Spark 1.2 $1.25 pro 1 Mio. Token
• Ausgabe — MiniMax M3 1,20 $ pro 1 Mio. vs. Muse Spark 1.2 4,25 $ pro 1 Mio.
• Cache-Lesen — MiniMax M3 $0.060 pro 1M vs. Muse Spark 1.2 $0.150 pro 1M
• Verhältnis — Muse Spark 1.2: 4,2x bei der Eingabe, 3,5x bei der Ausgabe, 2,5x bei Cache-Lesevorgängen
Diese abstrakten Verhältnisse werden im Kostenrechner auf jeder Seite konkret. Setzt man beide auf 10 Millionen Tokens pro Monat bei einem Eingabeanteil von 70 % an — eine plausible Größe für eine Zusammenfassungs- oder Extraktionsaufgabe und die Standardeinstellung, mit der der Schätzer ausgeliefert wird —, kommt MiniMax M3 auf $5.70 pro Monat. Muse Spark 1.2 kommt auf $11.30 pro Monat. Aktiviert man Prompt-Caching, landet dieselbe Arbeitslast bei ungefähr $4.86 gegenüber ungefähr $9.63. Der Rechner kennzeichnet beides als Schätzungen auf Basis des Listenpreises, was der richtige Vorbehalt ist: Die tatsächlichen Token-Zahlen hängen vom Tokenizer des Anbieters ab.
Bei einer günstigen Workload ist der Unterschied nur Kleingeld für einen Kaffee. Der Punkt ist die Form der Kurve, nicht der absolute Wert: Eine Workload von hundert Millionen output-lastigen Tokens pro Monat überschreitet allein auf der Seite von Muse Spark die Grenze von drei zu vier Stellen. Wenn die Kosten die Einschränkung sind, die dich dazu gebracht hat, dir diese Kombination anzusehen, dann ist das die Zahl, die du für deinen eigenen Traffic modellieren solltest.
Da wir die Listenpreise der Anbieter ohne Aufschlag direkt weitergeben, schlägt sich eine Preissenkung eines Anbieters bei uns noch am Tag ihrer Ankündigung nieder, und beide dieser Modelle werden hier abgewickelt – ein Schlüssel deckt beide ab, sodass ihre Bepreisung im Verhältnis zueinander weder einen zweiten Vertrag noch eine Codeänderung erfordert.
Kontextfenster und was tatsächlich hineinpasst
Dies ist der Abschnitt, in dem die beiden auf dem Datenblatt am ähnlichsten und in der Praxis am unähnlichsten wirken.
• Kontextfenster — MiniMax M3 1.048.576 Tokens vs. Muse Spark 1.2 1.048.576 Tokens
• Maximale Ausgabe — MiniMax M3 512.000 Tokens vs. Muse Spark 1.2 131.072 Tokens
• Eingabeoberfläche — MiniMax M3 Text, Bild und Video vs Muse Spark 1.2 Text, Bild, Video, Audio und PDF
• Ausgabeoberfläche — beide geben nur Text aus
• Strukturierte Parameter — MiniMax M3 stellt tools und tool_choice bereit; Muse Spark 1.2 stellt reasoning_effort und structured_outputs bereit
Beide Fenster umfassen dieselbe Million Token, also gibt es bei der Frage „Wer hat mehr Kontext?“ keinen Sieger. Die Zeile zur maximalen Ausgabe ist der Punkt, an dem sie sich unterscheiden: Eine Antwort von MiniMax M3 kann bis zu 512.000 Token umfassen, etwa das Vierfache der Obergrenze von Muse Spark 1.2 von 131.072. Wenn Ihre Arbeit die Generierung langer Texte ist – eine vollständige Dateineuschreibung, ein langer Bericht, eine Ausgabe im Umfang eines Transkripts –, ist dieser Unterschied strukturell, nicht graduell. Wenn Ihre Arbeit aus kurzen Antworten auf eine lange Eingabe besteht, ist er irrelevant.
Die Zeile zur Eingabeoberfläche schlägt in die andere Richtung aus. Muse Spark 1.2 akzeptiert Audio und PDF direkt; die dokumentierte Eingabeoberfläche von MiniMax M3 endet bei Bild und Video. Eine Pipeline, die Anrufaufzeichnungen oder gescannte Dokumente einliest, hat bei diesen beiden unterschiedlich viel Vorverarbeitung zu leisten.
Auf der MiniMax-Seite enthält die Kontextbehauptung einen Architekturhinweis, der klar als der des Anbieters selbst gekennzeichnet werden sollte. MiniMax führt das Langkontext-Verhalten von M3 auf MSA (MiniMax Sparse Attention) zurück, was unser Katalog als Unterstützung von bis zu 1M Token Kontext „mit einem garantierten Minimum von 512K“ beschreibt. Die Formulierung mit dem garantierten Minimum stammt von MiniMax; es gibt keine unabhängige Messung, auf die wir uns berufen können, also behandeln Sie die 512K-Untergrenze als Anbieterangabe und nicht als getesteten Wert.
Latenz und Durchsatz auf unserem eigenen Gateway
Dies sind die Zahlen, zu denen wir uns am direktesten äußern können, weil es unsere eigenen Zahlen sind. Sie umfassen die sieben Tage bis zum 23.09.2026 und beschreiben den Verkehr an unserem Gateway, nicht einen Anbieter-Benchmark.
• p50 Zeit bis zum ersten Token — MiniMax M3 4,28 s vs. Muse Spark 1.2 4,82 s
• p95-Zeit bis zum ersten Token — MiniMax M3 10,00 s vs. Muse Spark 1.2 10,00 s
• Ausgabegeschwindigkeit — MiniMax M3 289 Tok./s vs. Muse Spark 1.2 507 Tok./s
• Fehlerrate — MiniMax M3 0,12 % vs. Muse Spark 1.2 0,15 %
• Traffic, letzte 7 Tage — MiniMax M3 153,8 Mio. Tokens vs. Muse Spark 1.2 79,6 Mio. Tokens
Liest man das ehrlich, ist das Bild gespalten. Bei der Zeit bis zum ersten Token liegen die beiden nahe beieinander – 4,28 gegenüber 4,82 Sekunden im Median, und der p95 ist auf die Hundertstel identisch bei 10,00 Sekunden, was ein Rundungsartefakt davon ist, dass beide nahe derselben Obergrenze liegen, und kein echtes Unentschieden. Bei der Ausgabegeschwindigkeit sind sie überhaupt nicht nahe beieinander: Muse Spark 1.2 streamt mit etwa dem 1,75-Fachen der Rate von MiniMax M3, was verändert, wie sich eine lange Generierung für einen Nutzer anfühlt, der sie beobachtet, selbst wenn die Gesamtkosten höher sind. Die Fehlerraten liegen innerhalb eines Rundungsfehlers voneinander und beide sind niedrig.
Die Traffic-Zeile ist eher als Signal denn als Anzeigetafel zu lesen: Über dieselben sieben Tage hinweg hat MiniMax M3 auf unserem Gateway etwa doppelt so viele Tokens bewegt wie Muse Spark 1.2. Das ist es, wofür sich der Markt entscheidet, nicht was die Benchmarks sagen, und bei dieser Paarung sind sich die beiden uneinig.
Beide hinter einem Endpunkt zu routen ist auch der kostengünstige Weg, herauszufinden, welches Modell deine Workload bevorzugt, denn Failover bedeutet, dass eine anbieterseitige Verschlechterung bei einem der beiden Modelle auf einen funktionierenden Pfad übergeht, statt zu einem Fehler zu werden.
Tool-Aufruf und langhorizontige agentische Arbeit
Hier liegen die beiden bei den gemessenen Ergebnissen am weitesten auseinander, und hier sind die Vorbehalte am wichtigsten.
• Terminal-Bench v2.1 — MiniMax M3 52.4 vs. Muse Spark 1.2 80.1
• tau_banking (Werkzeugnutzung) — MiniMax M3 12.3 vs Muse Spark 1.2 34.8
• MCP Atlas — MiniMax M3 74.2 (vom Anbieter angegeben) vs. Muse Spark 1.2 nicht gemessen
• BrowseComp — MiniMax M3 83.5 (Anbieterangabe) vs. Muse Spark 1.2 nicht gemessen
• OSWorld-Verified — MiniMax M3 70,0 (vom Anbieter gemeldet) vs. Muse Spark 1.2 nicht gemessen
Die ersten beiden Zeilen stammen aus dem Benchmark-Panel auf unseren eigenen Katalogseiten und sind die einzigen agentischen Zeilen, die beide Modelle ausgefüllt haben. Sie liegen nicht nah beieinander: Muse Spark 1.2 erzielt auf tau_banking mehr als das Doppelte von MiniMax M3 und führt bei Terminal-Bench v2.1 mit fast 28 Punkten Vorsprung. Wenn Ihre Workload ein Long-Horizon-Agent mit einer Tool-Oberfläche ist, ist das die größte einzelne Lücke auf dieser Seite.
Die nächsten drei Zeilen sind MiniMax’ eigene Zahlen, die im Launch-Post veröffentlicht wurden. Sie sind nicht mit den ersten beiden vergleichbar – andere Testumgebungen, kein unabhängiges Audit –, aber es sind die einzigen veröffentlichten Werte für MiniMax M3 bei diesen Aufgaben; sie wegzulassen würde das Modell unterbewerten. Lies sie als vom Anbieter gemeldet und nichts weiter.
Eine Abweichung verdient einen eigenen Absatz, denn sie ist genau die Art von Sache, die eine Vergleichsseite normalerweise glattbügelt. MiniMax’ Launch-Post stellt Terminal-Bench 2.1 mit 66,0 für M3 in einem Diagrammbild ohne begleitende numerische Tabelle dar. Die unabhängige Zeile Terminal-Bench v2.1 auf unserer Katalogseite zeigt 52,4 für dasselbe Modell. Die Aufgabennamen sind sich ähnlich genug, dass Leser sie nebeneinander sehen werden, und die beiden Werte unterscheiden sich um mehr als 13 Punkte. Wir werden nicht eine davon für falsch erklären: Die wahrscheinliche Erklärung ist ein anderes Harness oder eine andere Ausführungskonfiguration, und die ehrliche Aussage ist, dass die eigene Zahl des Anbieters und die geprüfte Zahl nicht übereinstimmen, wobei die des Anbieters die höhere ist.
Die Parameterlisten erzählen eine kleinere, praktischere Geschichte. MiniMax M3 stellt tools und tool_choice bereit, sodass sich die Werkzeugauswahl direkt aus der Anfrage steuern lässt. Muse Spark 1.2 stellt reasoning_effort bereit, sodass stattdessen die Tiefe der Schlussfolgerung steuerbar ist. Keines von beiden legt den Regler des anderen offen. Wenn das Steuerungsproblem Ihrer Anwendung lautet „sorge dafür, dass es die richtige Funktion aufruft", dann weist das in die eine Richtung; wenn es lautet „sorge dafür, dass es bei den schwierigen Fällen länger nachdenkt", dann weist es in die andere.
Programmieren
Programmieren ist die zentrale Werbeaussage von MiniMax M3 und der Bereich, in dem die gemessene Lücke für das Modell am unangenehmsten ausfällt.
• AA Coding Index — MiniMax M3 38,7 vs Muse Spark 1.2 72,2
• SciCode — MiniMax M3 43.1 vs Muse Spark 1.2 57.4
• SWE-Bench Pro — MiniMax M3 59,0 (vom Anbieter angegeben) vs. Muse Spark 1.2 nicht gemessen
• KernelBench Hard — MiniMax M3 28,8 (vom Anbieter angegeben) vs. Muse Spark 1.2 nicht gemessen
Die Positionierung von MiniMax für M3 ist Coding-first – in der Launch-Schlagzeile steht „Frontier Coding“ noch vor dem Millionen-Token-Kontext und der Multimodalität. Die selbst gemeldete SWE-Bench-Pro-Zahl von 59,0 ist ein starker Wert im Harness des Anbieters. In den unabhängigen Zeilen Coding Index und SciCode, für die beide Modelle Werte eingetragen haben, führt Muse Spark 1.2 jedoch mit großem Abstand, und der Unterschied von 33 Punkten im Coding Index ist der zweitgrößte auf dieser Seite nach tau_banking.
Es gibt keine ehrliche Art und Weise, MiniMax M3 anhand der verfügbaren Belege als das bessere Coding-Modell darzustellen. Was sich sagen lässt, ist, dass die eigenen Coding-Zahlen des Anbieters hoch sind und die unabhängigen nicht – im selben Muster wie die oben erwähnte Divergenz bei Terminal-Bench. Wer seine Entscheidung anhand von Coding-Kennzahlen trifft, sollte die auditierten Zeilen stärker gewichten als die Diagramme aus dem Launch-Post und sollte eher auf dem eigenen Repository testen als auf einem von beiden.
Wo sie wirklich nah beieinanderliegen
Drei Reihen weigern sich, einen Sieger hervorzubringen, und das zu sagen ist nützlicher, als einen zu erfinden.
• GPQA Diamond — MiniMax M3 89,9 vs. Muse Spark 1.2 90,4, ein 0,5-Punkte-Abstand, der praktisch gesehen ein Gleichstand ist
• p95-Zeit bis zum ersten Token — beide 10,00 s in den letzten sieben Tagen an unserem Gateway
• Kontextfenster und Ausgabemodalität — identisch bei 1.048.576 Eingabe-Tokens und reiner Textausgabe
Beim wissenschaftlichen Schlussfolgern auf Graduiertenniveau sind die beiden praktisch nicht zu unterscheiden, und das ist die einzige Reasoning-Zeile, in der sich das deutlich günstigere Modell von MiniMax M3 gegen das teurere behauptet. Man sollte sich dessen bewusst sein, wenn man die aggregierten Indizes liest: Die Lücke zwischen diesen Modellen ist nicht über alle Fähigkeiten hinweg gleichmäßig, sie konzentriert sich auf agentische und Coding-Arbeit und ist bei wissenslastigen Multiple-Choice-Aufgaben ungefähr null.

Wähle MiniMax M3, wenn, wähle Muse Spark 1.2, wenn
Die beiden Fakten aus dem einleitenden Absatz lösen sich je nachdem, was du baust, unterschiedlich auf, also hier die Aufteilung ohne Absicherung.
• Wählen Sie MiniMax M3, wenn die Kosten pro Token der limitierende Faktor sind, wenn Sie Ausgaben in Langform jenseits von 131.072 Token benötigen, wenn Sie offene Gewichte brauchen, wenn Sie Videoeingabe ohne eine separate Pipeline wünschen oder wenn Sie wissensintensive Arbeit mit hohem Reasoning-Anteil zu etwa einem Viertel des Eingabepreises möchten — GPQA Diamond ist ein Kopf-an-Kopf-Rennen, und das ist die Zeile, in der das günstige Modell seinen Platz verdient.
• Wählen Sie Muse Spark 1.2, wenn Ihre Arbeitslast ein Long-Horizon-Agent mit Tools ist, wenn Sie die höchsten auditierten Coding-Werte benötigen, wenn Sie einen expliziten reasoning_effort-Regler wünschen, wenn Sie Audio oder PDF direkt einlesen müssen oder wenn Sie schnelle Streaming-Ausgabe benötigen — 507 tok/s gegenüber 289 tok/s ist ein sichtbarer Unterschied, kein Benchmark-Unterschied.
• Wenn Sie noch nicht wissen, welches von beiden, dann steht der entscheidende Beleg nicht auf dieser Seite. Lassen Sie beide Modelle gegen eine Stichprobe Ihres eigenen Traffics antreten und messen Sie es; der Preisrechner auf jeder Modellseite verrät Ihnen die Kostenseite in einer Minute, und die oben genannten Sieben-Tage-Latenzwerte kommen einer Vorschau auf die Leistungsseite am nächsten.
Beide laufen über eine API ohne Aufschlag auf den Listenpreis des Anbieters, sodass der Test eher eine Änderung der Modell-ID als eine Migration ist, und automatisches Failover bedeutet, dass ein schlechter Tag bei einem der beiden Anbieter in eine langsamere Antwort mündet statt in einen Ausfall.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
