
Claude Haiku 5.5 vs. MiniMax M3.1 Flash Preview: Der eine hat einen Preis, der andere einen Token-Plan
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
MiniMax M3.1 Flash Preview hat keinen veröffentlichten Preis pro Token. Keinen hohen, keinen Aktionspreis – gar keinen. Es ist nur über den Token-Plan des Anbieters und dessen Code-Oberfläche verfügbar, und die Entwicklerdokumentation sagt das ausdrücklich. Claude Haiku 5.5, veröffentlicht am 7. Oktober 2026, kostet 0,10 US-Dollar pro Million Input-Tokens und 0,50 US-Dollar pro Million Output-Tokens bis zu einem Prompt von 100.000 Token. Das Erste, was man zu diesem Duell sagen muss, ist also, dass es kein Preisvergleich ist, denn nur eines der beiden Modelle hat einen Preis. Stattdessen ist es ein Vergleich zwischen einer verbrauchsabhängig abgerechneten API und einem Abonnement – und dieser Unterschied entscheidet mehr über Ihre Kosten als jeder Benchmark.
Das Zweite, was zu sagen ist, ist, dass MiniMax M3.1 Flash Preview keine Modellkarte, keine veröffentlichten Benchmarks, keine Gewichte und keinen unabhängigen Score hat, den wir finden können. Es erschien am 27. September 2026 und ist, nach der Bezeichnung des Anbieters selbst, eine Preview, die über ein Abonnement statt über eine API zugänglich ist. Das ist keine Kritik am Modell; es ist eine Beschreibung dessen, was man darüber wissen kann und was nicht. Alles Folgende hält diese Linie sichtbar.
Was jedes einzelne tatsächlich ist
Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5, veröffentlicht am 7. Oktober 2026. Text- und Bildeingabe, Textausgabe. Ein Kontextfenster von 1 Mio. Token, maximale Ausgabe von 128.000 Token (300.000 über einen Beta-Header in der Batch-API), Trainings-Cutoff Juni 2026, keine Außerbetriebnahme vor dem 7. Oktober 2027. Anpassbarer Aufwand über Low, Medium, High, Xhigh und Max, Standard ist Medium, adaptives Denken standardmäßig aktiviert. Abrechnung pro Token, Cache-Lesevorgänge zu 0,01 $ pro Million und Batch zum halben Preis.
MiniMax M3.1 Flash Preview — MiniMax, verfügbar seit dem 27. September 2026. Ein Kontextfenster von 1 Mio. Tokens. Text, Bild und Video als Eingabe, Text als Ausgabe. Das Denken ist immer aktiv, mit einer Aufwandssteuerung von niedrig bis maximal. Die API ist Anthropic-kompatibel, OpenAI-kompatibel und OpenAI-Responses-kompatibel, was sie zu einem nahezu direkten Ersatz für beide SDKs macht. Der Zugang erfolgt ausschließlich über den Token Plan und MiniMax Code; es gibt keine Pay-as-you-go-Option und keine veröffentlichten Preise.

• Der Vergleich, Dimension für Dimension
Preis — Claude Haiku 5.5: 0,10 $ pro Million Eingabe-Token und 0,50 $ Ausgabe bis 100K Token, danach 0,50 $ und 2,50 $; MiniMax M3.1 Flash Preview hat keinen veröffentlichten Preis pro Token, nur ein Abonnement für den Token Plan.
• Kontextfenster — je 1.000.000 Token. Das ist die einzige Dimension, in der sie wirklich gleichauf liegen.
• Maximale Ausgabe — 128.000 Token für Claude Haiku 5.5, mit einem 300.000-Token-Beta-Pfad auf Batch; nicht veröffentlicht für MiniMax M3.1 Flash Preview.
• Eingabemodalitäten — Bild gegen Text, Bild gegen Bild. Bei der Bildeingabe liegt es vorn.
• Aufwandssteuerung — fünf Positionen, Standard Medium, bei Claude Haiku 5.5; von Low bis Max, wobei Thinking bei MiniMax M3.1 Flash Preview immer aktiviert ist.
• Unabhängige Punktzahl — Artificial Analysis Intelligence Index 43, Max-Konfiguration 43,40, an zweiter Stelle von 182 für Claude Haiku 5.5; für MiniMax M3.1 Flash Preview wurde keine veröffentlicht.
• Kosten pro abgeschlossener Aufgabe — 0,21 $ pro Analysis-Index-Aufgabe für Claude Haiku 5.5; nicht berechenbar für MiniMax M3.1 Flash Preview ohne sowohl einen Score als auch einen Tarif.
• Ausgabegeschwindigkeit — 243,4 Token pro Sekunde für Claude Haiku 5.5; nicht gemeldet für MiniMax M3.1 Flash Preview.
• Offene Gewichte — keines von beiden. Claude Haiku 5.5 ist proprietär; MiniMax hat keine Gewichte für M3.1 Flash Preview veröffentlicht.
Warum ein Abonnement schlechter passt, als es klingt
Es gibt eine Version dieses Vergleichs, in der der Token Plan die bessere Wahl ist, und es lohnt sich, ihm gegenüber fair zu sein. Wenn Sie MiniMax Code interaktiv nutzen, begrenzt ein Abonnement Ihre Kosten auf einen bekannten monatlichen Betrag, unabhängig davon, wie viel Sie verwenden, und eine Preisgestaltung pro Token hat keine entsprechende Obergrenze. Für einen intensiven interaktiven Nutzer schlägt ein Pauschalplan fast immer eine verbrauchsabhängige Abrechnung.
Diese Logik kehrt sich in dem Moment um, in dem die Arbeitslast programmatisch ist. Ein Abonnement ist auf das Nutzungsmuster eines Menschen ausgelegt – stoßweise, interaktiv, selbstbegrenzend. Ein Agent, ein Batch-Job oder ein Produktions-Endpunkt hat kein solches Muster: Er läuft so viel, wie die Warteschlange verlangt. Diesen Traffic auf einen Tarif zu legen, der für interaktive Nutzung bepreist ist, bedeutet entweder, an ein Limit zu stoßen, das man nicht sehen kann, oder für einen Sitzplatz zu zahlen, wenn man Durchsatz brauchte. Und das Problem zweiter Ordnung ist schlimmer: Ohne veröffentlichten Preis pro Token gibt es keine Möglichkeit, die Kosten bei wachsendem Volumen zu prognostizieren, keine Möglichkeit, beim Preis mit irgendeinem anderen Modell zu vergleichen, und keine Möglichkeit zu entscheiden, ob ein günstigeres Modell die Aufgabe erledigt hätte. Ein Preis, den man nicht berechnen kann, ist ein Budget, das man nicht verteidigen kann.
Claude Haiku 5.5 ist das entgegengesetzte Problem auf die bestmögliche Weise. Der Tarif ist veröffentlicht, die Stufen sind veröffentlicht, der Cache-Rabatt ist veröffentlicht, und die einzige Falle ist struktureller Natur statt versteckt: Überschreiten Sie 100.000 Prompt-Tokens, und beide Tarife multiplizieren sich mit fünf. Das ist eine Klippe, um die man herumplanen kann. Ein unveröffentlichter Tarif ist ein Nebel, um den man nicht herumplanen kann.
Der 1M-Token-Gleichstand – und warum er nicht das bedeutet, wonach es aussieht
Beide Modelle werben mit einem Kontextfenster von 1 Mio. Token, und das ist die Schlagzeile, mit der beide Anbieter vorangehen. Es ist zugleich die Dimension, in der die Gleichwertigkeit am irreführendsten ist, denn Kontextfenster sind nicht dasselbe wie nutzbarer Kontext. Claude Haiku 5.5 gibt neben seinem Fenster eine maximale Ausgabe von 128.000 Token an und berechnet oberhalb von 100.000 Eingabe-Token das Fünffache des Grundtarifs – ein Preismodell, das unmissverständlich sagt, dass lange Prompts erlaubt, aber nicht der beabsichtigte Standardfall sind. MiniMax gibt für M3.1 Flash Preview keine maximale Ausgabe und überhaupt keine Langkontext-Preisgestaltung an, weil das Unternehmen überhaupt keine Preisgestaltung veröffentlicht.
Langer Kontext ist genau der Bereich, in dem der Kostenunterschied zwischen den beiden Architekturen am deutlichsten sichtbar würde, und genau die Stelle, an der eine von ihnen Ihnen keine Zahl liefert. Wenn Ihre Workload wirklich langkontextig ist, ist dieses Fehlen die ausschlaggebende Tatsache – nicht die gemeinsame 1M-Zahl.

Wenn Sie eigentlich MiniMax M3 wollen
MiniMax M3.1 Flash Preview ist eine Preview, nur mit einem Plan zugänglich und ohne Bewertung. MiniMax M3 ist nichts davon. Es ist das Open-Weights-Flaggschiff, das MiniMax am 31. Mai 2026 veröffentlicht hat: ein 1M-Token-Kontextfenster, native Multimodalität, die Text, Bilder und Video entgegennimmt und Text zurückgibt, basierend auf MiniMax Sparse Attention, und kostet $0,30 pro Million Input-Tokens und $1,20 pro Million Output-Tokens. Artificial Analysis bewertet es mit Intelligence Index 29 bei Kosten pro Index-Aufgabe von $0,51, 91,7 Token pro Sekunde Output und einer Zeit bis zum ersten Token von 2,16 Sekunden sowie einem Cache-Rabatt von 80 %. Es ist heute in OrcaRouters Katalog als minimax/minimax-m3.
Was einen konkreten Punkt zu diesem Duell liefert, den ein Datenblatt verschweigt. Das MiniMax-Modell, das man tatsächlich pro Token kaufen kann, liegt eine Generation hinter der Preview zurück, erreicht 29 auf dem unabhängigen Index gegenüber 43 von Claude Haiku 5.5, kostet pro abgeschlossener Aufgabe etwa doppelt so viel, nämlich 0,51 $ gegenüber 0,21 $, und läuft mit etwa einem Drittel der Ausgabegeschwindigkeit. Die Preview könnte das alles durchaus übertreffen. Niemand außerhalb von MiniMax weiß es, und von einer Abonnementseite lässt sich das nicht herausfinden.

Diese beiden von einer Stelle aus aufrufen
MiniMax M3.1 Flash Preview ist über den Token Plan von MiniMax und MiniMax Code verfügbar. Claude Haiku 5.5 ist über Anthropics eigene API verfügbar und von dort aus überall dort, wo Anthropic-Modelle weiterverkauft werden. Keines von beiden steht im Katalog von OrcaRouter – was wir aus dieser Paarung routen, ist minimax/minimax-m3, neben anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 und anthropic/claude-fable-5.1, und wir werden nicht den Eindruck erwecken, dass wir die beiden Modelle führen, um die es in diesem Artikel geht.
Was die Routing-Schicht hier wirklich bietet, ist ein Ausweg aus dem Problem der zwei Abrechnungsformen. minimax/minimax-m3wird nach Verbrauch abgerechnet und steht in unserem Katalog; Claude Haiku 5.5 wird nach Verbrauch abgerechnet und steht bei Anthropic. Beide sprechen eine OpenAI-kompatible Schnittstelle, sodass das A/B zwischen ihnen ein Modell-String ist und keine Neuimplementierung, und OrcaRouter gibt die Listenpreise der Anbieter mit 0 % Aufschlag weiter, was bedeutet, dass eine Preisänderung bei MiniMax Ihre Rechnung an dem Tag erreicht, an dem sie erfolgt. Das Token-Plan-Modell ist das einzige Stück, das sich so nicht normalisieren lässt – ein Abonnement hat keinen Preis pro Token, der weitergegeben werden könnte, was dasselbe Problem von der Abrechnungsseite her formuliert ist.
Wie man ohne Punktzahl entscheidet
Wenn Sie Videoeingabe benötigen, ist MiniMax M3.1 Flash Preview die einzige der beiden, die sie akzeptiert, und wenn Ihre Arbeitslast interaktiv statt programmatisch ist, ist der Token Plan eine vernünftige Anschaffung. Wenn Sie eine Zahl benötigen, die Sie in ein Budget aufnehmen können, einen Score, den Sie überprüfen können, und ein Zeitfenster, das Sie bepreisen können, ist Claude Haiku 5.5 die einzige der beiden, die irgendetwas davon bietet. Und wenn Sie die MiniMax-Familie auf einer nutzungsabhängig abgerechneten API mit einem unabhängigen Score, der daran hängt, möchten, dann ist die ehrliche Empfehlung, die Generation zu nutzen, die tatsächlich pro Token erwerbbar ist, statt auf eine Preview zu warten, deren Bedingungen noch nicht veröffentlicht wurden.
Beide sprechen eine OpenAI-kompatible Schnittstelle, das A/B zwischen ihnen ist also ein Modell-String statt einer Neuimplementierung, und OrcaRouter gibt den Listenpreis des Anbieters mit 0 % Aufschlag weiter, was bedeutet, dass eine Preisänderung von MiniMax schon am Tag ihres Eintretens auf Ihrer Rechnung ankommt.
