
Claude Sonnet 5.5 vs. MiniMax M: Wo das 15-mal günstigere Modell tatsächlich gleichzieht
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 931 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 192 tok/s
- OrcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Auf dem unabhängigen Board gibt es eine Zeile, in der MiniMax M3 und Claude Sonnet 5.5 dasselbe Modell sind, und es ist nicht die, die irgendjemand vermuten würde. Beim Long-Context-Recall erreicht MiniMax M3 83,0 % und Claude Sonnet 5.5 82,7 %. MiniMax M3 kostet $0,30 pro Million Eingabe-Tokens und $1,20 pro Million Ausgabe-Tokens. Claude Sonnet 5.5 kostet $2,00 und $10,00. Über den gesamten Intelligence Index hinweg liegen die gemessenen Kosten von M3 bei $0,51 pro Aufgabe gegenüber $7,60 für Claude Sonnet 5.5 — fünfzehnmal günstiger, und bei der einen Bewertung, die misst, ob ein Modell in einem sehr langen Dokument noch etwas finden kann, liegt es überhaupt nicht zurück.
Dann öffnest du die agentischen Evaluierungen, und das Bild kippt so stark, dass es aufhört, ein Vergleich zu sein. Bei Terminal-Bench 4.0, wo ein Modell eine Shell steuern und tatsächlich eine Softwareaufgabe abschließen muss, erreicht MiniMax M3 2,0 % und Claude Sonnet 5.5 63,6 %. Eine dreißigfache Lücke bei dem einen Benchmark, der Produktionsarbeit am nächsten kommt, ist keine Preisfrage, und keine Ersparnis pro Token übersteht sie. Die nützliche Frage, die dieser Vergleich aufwirft, ist nicht „Welcher ist besser“, sondern welche dieser beiden Fehlermodi deine Workload verkraften kann: MiniMax M3 ist das Open-Weight-Modell mit einer Million Token und nativer Video-Unterstützung, das bei Retrieval mit einem Frontier-Modell mithält und bei der Ausführung zusammenbricht, und Claude Sonnet 5.5 ist das geschlossene Modell, das am 28. September 2026 veröffentlicht wurde, um das Gegenteil zu tun.
Was jedes einzelne ist, klar und einfach ausgedrückt.
MiniMax M3 ist das Flaggschiff-Foundation-Modell mit offenen Gewichten des chinesischen Labors, angekündigt am 1. Juni 2026 und herunterladbar unter MiniMaxs eigener Community-Lizenz. Es ist ein Mixture-of-Experts-Modell mit ungefähr 428 Milliarden Gesamtparametern und etwa 23 Milliarden aktiven Parametern pro Token, und es ist im starken Sinne nativ multimodal: Text, Bild und Video gehen hinein, Text kommt heraus, wobei die multimodale Pipeline vom ersten Pretraining-Schritt an neu aufgebaut wurde, statt nachträglich angeflanscht zu werden. Das Kontextfenster beträgt 1.048.576 Token – mit einem garantierten nutzbaren Minimum von 512.000 in unserem eigenen Katalogeintrag – und die maximale Ausgabe beträgt 512.000 Token, was unsere Zahl und nicht die des Anbieters ist, weil MiniMax keine veröffentlicht. Die Architektur ist MiniMax Sparse Attention, Gegenstand von arXiv 2606.13392, und die Behauptung des Anbieters dazu lautet: mehr als 9× schnelleres Prefilling und mehr als 15× schnelleres Decoding als die vorherige Generation bei einem Fenster von einer Million Token. Das sind Anbieterzahlen, und wir haben nicht gesehen, dass sie unabhängig reproduziert wurden.

Claude Sonnet 5.5 ist Anthropics zweites Modell der 5.5-Generation, zum Zeitpunkt des Schreibens einen Tag alt, und es ist geschlossen. Anthropic beschreibt es als die beste Kombination aus Geschwindigkeit und Intelligenz in der Produktpalette, und die technischen Daten sind 1.000.000 Token Kontext, 128.000 Token synchrone Ausgabe mit 300.000 auf der Message Batches API, Text-, Bild- und Dateieingabe, adaptives Denken mit wählbarem Aufwand, ein Wissensstand von Juni 2026 und Zero Data Retention, ab dem Start verfügbar. Sein Preis hat sich gegenüber Claude Sonnet 5 nicht verändert: 2,00 $ Eingabe, 10,00 $ Ausgabe, 0,20 $ für Cache-Lesevorgänge, 2,50 $ für Cache-Schreibvorgänge. Anthropic sagt, es läuft 30 % schneller und kostet bis zu 30 % weniger pro Aufgabe als Claude Sonnet 5 — Herstellerangaben, nicht reproduziert, und als Aussagen über Token-Anzahlen statt über Preise zu verstehen, da die Preise identisch sind.
Die Form des Benchmarks ist die ganze Geschichte.
Beide Modelle werden auf demselben Index gemessen, Revision v4.3.2, und gerade die Ergebnisse der einzelnen Bewertungen machen diese Paarung interessant statt einseitig.
• Langkontext-Recall — MiniMax M3 83,0 % vs. Claude Sonnet 5.5 82,7 %, ein rundungsbedingter Unterschied bei einem echten Gleichstand
• SciCode — MiniMax M3 47,1 % vs. Claude Sonnet 5.5 61,0 %, eine echte, aber verkraftbare Lücke
• Humanity's Last Exam — MiniMax M3 39,0 % vs. Claude Sonnet 5.5 55,0 %
• Terminal-Bench 4.0 — MiniMax M3 2,0 % vs. Claude Sonnet 5.5 63,6 %, wo der Vergleich aufhört, nützlich zu sein
• Intelligenz-Index — MiniMax M3 29 vs. Claude Sonnet 5.5 56
• Kosten pro Index-Aufgabe — MiniMax M3 0,51 $ vs. Claude Sonnet 5.5 7,60 $
• Über den Index generierte Output-Tokens — MiniMax M3 120M vs. Claude Sonnet 5.5 410M
• Ausgabegeschwindigkeit — MiniMax M3 115,3 Token/Sek. vs. Claude Sonnet 5.5 138,7 Token/Sek.
Liest man diese Zeilen der Reihe nach, entsteht ein kohärentes Modell. MiniMax M3 ist kompetent bei statischem Schlussfolgern und Abrufen und schwach bei anhaltender Ausführung. Sein Terminal-Bench-Ergebnis ist kein bescheidenes Defizit; ein Wert von 2,0 % bedeutet, dass das Modell die Aufgaben im Wesentlichen nicht erledigt, und dasselbe Muster zeigt sich in seinem Automatisierungs-Benchmark-Wert von 0,21 gegenüber 0,71 und in einem Allwissenheits-Wert von 1,35 gegenüber 32,3. Wo MiniMax M3 sich behauptet, ist genau der Punkt, an dem seine Architektur einen Vorteil beansprucht: eine wirklich lange Eingabe, gelesen und beantwortet. Das ist MSA, das genau das tut, wofür MiniMax es angepriesen hat.

Die Kostenzeile fügt einen zweiten, weniger offensichtlichen Punkt hinzu. MiniMax M3 ist nicht nur günstiger pro Token – 1/6,7 bei der Eingabe und 1/8,3 bei der Ausgabe –, sondern verbraucht auch weniger Token, um zu einer Antwort zu gelangen, nämlich rund 120 Millionen gegenüber 410 Millionen auf demselben Board. Zwei Effekte multiplizieren sich zu dem fünfzehnfachen Unterschied pro Aufgabe. Ein Teil dieser Lücke ist echte Effizienz, und ein Teil davon ist schlicht, dass MiniMax M3 bei Aufgaben, bei denen es scheitert, früher aufgibt; eine billige Aufgabe, die die falsche Antwort liefert, ist keine Ersparnis, und dies ist die billigste Lektion des Artikels.
Die Dimension, die die Preisliste nicht zeigen kann
MiniMax M3 hat eine Eigenschaft, die Claude Sonnet 5.5 nicht besitzt und auch nicht erwerben kann: Man kann die Gewichte mitnehmen. Das ist für genau eine Käuferklasse von Bedeutung, und für diese Käuferklasse wiegt es alles oben Genannte auf. Wenn eine Anfrage einen Rechtsraum nicht verlassen, keine Netzwerkgrenze überschreiten kann oder dort laufen muss, wo überhaupt keine API erreichbar ist, ist ein Modell ohne herunterladbare Gewichte zu keinem Preis eine Option – ein Open-Weight-Modell mit 428 Milliarden Parametern aber schon. Dieselbe Eigenschaft ist in die andere Richtung ein Nachteil: 428B Parameter bei 23B aktiven Parametern selbst zu hosten, ist eine Kapitalentscheidung, kein API-Schlüssel, und MiniMax’ eigene Sparse-Attention-Behauptungen existieren, weil die Alternative bei einer Million Tokens unbezahlbare Infrastruktur ist.
Für alle anderen ist die ehrliche Einordnung, dass es sich hier um eine Make-or-Buy-Grenze mit angehängtem Preisschild handelt. Claude Sonnet 5.5 ist das bessere Modell für alles Agentische. MiniMax M3 ist das bessere Modell, um etwas Enormes zu lesen und eine Frage dazu zu beantworten, und für die Verarbeitung von Videos ist es mit Abstand das bessere Modell, die Claude Sonnet 5.5 überhaupt nicht akzeptiert – seine Eingabeoberfläche besteht aus Text, Bildern und Dateien.
• Gewichte — MiniMax M3 offen unter MiniMax' Community-Lizenz vs. Claude Sonnet 5.5 geschlossen
• Eingabemodalität — MiniMax M3 Text, Bild und Video vs. Claude Sonnet 5.5 Text, Bild und Datei
• Maximale Ausgabe — MiniMax M3 512.000 Tokens laut unserem Katalog vs. Claude Sonnet 5.5 128.000 synchron, 300.000 bei Batches
• Cache-Preise — MiniMax M3 0,06 $ pro Million Lesevorgänge vs. Claude Sonnet 5.5 0,20 $ für Lesen und 2,50 $ für Schreiben
• Aufwandssteuerung — MiniMax M3 Thinking aktiviert, adaptiv oder deaktiviert vs. Claude Sonnet 5.5 adaptives Thinking, wobei zum Deaktivieren jetzt die between_tools-Form
• Datenaufbewahrung — MiniMax M3 richtet sich bei Selbsthosting nach Ihrer eigenen Bereitstellung, im Gegensatz zu Claude Sonnet 5.5, bei dem ab Launch Zero-Data-Retention von Anthropic verfügbar ist
Beide betreiben, ohne zwei Verträge zu betreiben
Kombiniert man ein offenes chinesisches Modell und ein geschlossenes Anthropic-Modell in einer einzigen Pipeline, sind die Betriebskosten meist nicht die Tokens; es sind der zweite Vertrag, der zweite Schlüssel, der zweite Satz Rate-Limits und die zweite Stelle, an der ein Fehler auftreten kann. OrcaRouter fasst das zusammen in einen einzigen OpenAI-kompatiblen Endpunkt, der über 200 Modelle abdeckt, wobei die Listenpreise der Anbieter unverändert durchgereicht werden — auf keiner der beiden Seiten wird ein Aufschlag erhoben —, mit automatischem Failover zwischen Upstream-Anbietern und einer Routing-DSL, um mehrere Modelle zu einem einzigen Aufruf zusammenzusetzen. MiniMax M3 ist hier routbar als minimax/minimax-m3 zu MiniMax' 0,30 $ und 1,20 $ mit 0,06 $ für Cache-Reads, und es ist gemessen am Verkehr eines der meistgenutzten Modelle im Katalog, was für sich genommen ein nützliches Signal ist: Die Routing-Ebene kann Ihnen sagen, wie viel echte Last ein Modell trägt, nicht nur, wie es abgeschnitten hat.
Claude Sonnet 5.5 ist noch nicht in unserem Katalog, und dieser Beitrag wird nicht so tun, als wäre es anders. Der Weg dorthin führt heute über Anthropics eigene API. Claude Sonnet 5 ist hier zu denselben 2,00 $ und 10,00 $ verfügbar und das seit dem 30. Juni, und es ist das natürliche Staging-Ziel und der Failover-Partner, während sein Nachfolger gerade einmal einen Tag alt ist.
Diese Kombination – der Long-Context-Swap und der agentische Pfad hinter einem einzigen Credential – ist genau das, wofür ein Router da ist. MiniMax M3 befördert 63,2 Millionen Tokens pro Woche durch diesen Katalog, gegenüber 7,9 Millionen bei Claude Sonnet 5, das günstige Modell ist hier also kein theoretischer Ersatz; es trägt das Volumen bereits. Beide über ein einziges Credential zu routen bedeutet, dass die Aufteilung eine Konfigurationsentscheidung ist, über die du Traffic verschieben kannst, statt eines zweiten Vertrags, den du unterschreiben musst, bevor du die günstigere Seite testen kannst.

Was tun mit der Krawatte?
Wenn Ihre Workload die Beantwortung von Fragen im Dokumentumfang ist – eine sehr lange Eingabe, eine kurze faktische Antwort, eine tolerierbare Latenz –, dann ist der Gleichstand beim Langkontext real, und der fünfzehnfache Kostenvorteil von MiniMax M3 ist damit ebenfalls real. Das ist ein unkomplizierter Wechsel und es lohnt sich, ihn diese Woche zu testen.
Wenn Ihre Workload agentisch ist, entscheidet die Terminal-Bench-Zeile die Sache, bevor der Preis überhaupt zur Sprache kommt. Claude Sonnet 5.5 mit 7,60 $ pro Index-Aufgabe gegenüber MiniMax M3 mit 0,51 $ ist ein 15-facher Aufpreis für ein Modell, das bei der Bewertung, die Ihrem Produktionsverkehr am ähnlichsten ist, sechzig Punkte mehr erreicht, und die fünfzehnmal günstigere Option, die an der Aufgabe scheitert, ist die teure. Die Messung, die Sie mit Ihren eigenen Daten durchführen sollten, ist Tokens pro abgeschlossener Aufgabe, nicht Tokens pro Anfrage, denn das ist die einzige Zahl in diesem Artikel, bei der der Preisvorteil von MiniMax M3 nicht automatisch bestehen bleibt.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
