Eine generierte Hero-Karte mit dem Titel MiniMax M3.1 Flash Preview vs. MiniMax M3, untertitelt mit „Das neueste Modell der Reihe ist nicht das sicherste, das man aufrufen sollte“. Eine linke Karte zeigt: „MiniMax M3.1 Flash Preview: 22–132 $ pro Monat Token Plan, kein veröffentlichter Preis pro Token, keine Gewichte, Thinking immer aktiv“; eine rechte Karte zeigt: „MiniMax M3: 0,30 $ / 1,20 $ pro Million Token, offene Gewichte, Thinking kann abgeschaltet werden“. Eine Fußzeile lautet: „Beide haben ein Kontextfenster von 1 Mio. Token. Die Zahlen für MiniMax M3.1 Flash Preview stammen von platform.minimax.io.“
Guides & Insights

MiniMax M3.1 Flash Preview vs. MiniMax M3: Wenn das neuere Modell das riskantere ist

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die eigene Dokumentation des Anbieters führt MiniMax-M3.1-Flash-Preview nun über MiniMax-M3 auf, und diese Reihenfolge leistet eine Menge Überzeugungsarbeit. Es ist das neueste Textmodell der Reihe, es besitzt dasselbe Kontextfenster von einer Million Token und ergänzt eine Steuerung der Denktiefe, die das ältere Modell nicht hat. Was die Tabelle nicht zeigt, ist, dass das ältere Modell das einzige der beiden ist, das Sie herunterladen, pro Token bepreisen, gegen irgendetwas benchmarken oder ohne Abonnement aufrufen können – und dass das neuere einen Schalter entfernt hat, den MiniMax-M3 Ihnen bot.

Dabei handelt es sich nicht um eine Geschichte darüber, dass ein Modell abgelöst wird. Es ist eine Geschichte darüber, dass ein Anbieter seine eigene Produktlinie in ein nutzungsabhängig abgerechnetes Arbeitstier und eine abonnementgebundene Vorschau aufteilt, und die beiden sind in keiner Richtung austauschbar. Hier ist, was jedes von ihnen tatsächlich ist.

Die beiden Datenblätter, nebeneinander

Beginne mit dem, was die eigenen Seiten des Anbieters für beide angeben, denn die Form des Unterschieds zeigt sich hier statt in einer Benchmark-Tabelle.

• Angekündigt — MiniMax-M3 am 1. Juni 2026 mit einem Architekturhinweis, einer Benchmark-Tabelle und einer Preisübersicht; MiniMax-M3.1-Flash-Preview am 27. September 2026 mit einem Dokumentationseintrag und einem Beitrag auf dem Agenten-Account von MiniMax • Kontextfenster — 1.000.000 Tokens für beide, laut den eigenen Modelltabellen von MiniMax • Maximale Ausgabe — 512.000 Tokens für MiniMax-M3 in unserem Katalogeintrag, ein Wert, den MiniMax selbst nicht veröffentlicht; für MiniMax-M3.1-Flash-Preview nirgends veröffentlicht • Eingabemodalitäten — Text, Bild und Video als Eingabe, Text als Ausgabe, für beide • Steuerung des Denkens — ein Denkparameter, den MiniMax-M3 überspringen kann und der sich in ein reasoning_details-Feld mittels reasoning_split auftrennen lässt; bei MiniMax-M3.1-Flash-Preview ist Denken verpflichtend und reasoning_split kann nicht deaktiviert werden • Denktiefe — bei MiniMax-M3 nicht verfügbar; eine effort-Abstufung aus low, medium, high, xhigh und max, standardmäßig max, bei MiniMax-M3.1-Flash-Preview • Veröffentlichte Ausgabegeschwindigkeit — etwa 100+ Tokens pro Sekunde für MiniMax-M3, laut der eigenen Modelltabelle von MiniMax; für MiniMax-M3.1-Flash-Preview nichts veröffentlicht • Gewichte — MiniMax-M3 ist Open-Weight mit einem öffentlichen Repository; MiniMax-M3.1-Flash-Preview hat keines • Preisgestaltung — 0,30 $ pro Million Eingabe-Tokens und 1,20 $ pro Million Ausgabe-Tokens für MiniMax-M3 zum Anbietertarif; für MiniMax-M3.1-Flash-Preview gibt es keinen Preis pro Token • Zugriff — MiniMax-M3 im Pay-as-you-go-Tarif und im Token Plan sowie über Drittanbieter-Plattformen routbar; MiniMax-M3.1-Flash-Preview nur im Token Plan und in MiniMax Code

Zwei Zeilen dort gehören in eine andere Kategorie als der Rest. Die veröffentlichte Ausgabegeschwindigkeit ist eine Herstellerangabe nur für das ältere Modell, daher wird das neuere Modell als das schnelle verkauft, ohne dass eine Zahl angegeben wird. Und die Denksteuerung hat sich in die entgegengesetzte Richtung zum Marketing entwickelt: Das neuere Modell bietet eine feinere Kontrolle darüber, wie viel es denkt, während es dir die Möglichkeit nimmt, es überhaupt am Denken zu hindern.

Der Schalter, den MiniMax weggenommen hat

Das ist das Detail, das am ehesten zum Problem wird, und es ist dokumentiert statt versteckt. Bei MiniMax-M3 wird beim Senden von thinking: {"type": "disabled"} an den OpenAI-kompatiblen Endpoint das Denken übersprungen und eine direkte Antwort zurückgegeben; beim Anthropic-kompatiblen Endpoint ist das Denken standardmäßig aus und kann mit adaptive aktiviert werden. Bei MiniMax-M3.1-Flash-Preview liefert die identische Anfrage HTTP 400 mit der Meldung erfordert adaptives Denken. Es gibt keinen unterstützten Weg, eine Antwort ohne Denkprozess zu erhalten.

Praktisch bedeutet das, dass ein Workload, der MiniMax-M3 als günstigen, schnellen Klassifikator oder Router nutzte – kurzer Prompt hinein, kurze strukturierte Antwort heraus, keine Gedankenkette –, keinen direkten Upgrade-Pfad zum neueren Modell hat. Man kann effort auf low senken, und die Anleitung von MiniMax ist eindeutig: Das Senken von effort ist der vorgesehene Weg, um Denklatenz und Token-Verbrauch zu reduzieren, statt es ganz zu deaktivieren. Doch die Tokens und die Latenz gehen nicht auf null, und für einen Extraktionsjob mit hohem Volumen, der vier Felder pro Aufruf schreibt, ist „denkt immer zuerst“ eine andere Kostenform als „denkt, wenn gefragt“.

A generated two-column scoreboard titled 'MiniMax M3.1 Flash Preview vs MiniMax M3 — the scoreboard'. The left column, MiniMax M3.1 Flash Preview, reads 'AA Intelligence: none published', 'Thinking off: not allowed (HTTP 400)', 'Thinking depth: effort low to max', 'Published speed: none', 'Open weights: no', 'Per-token price: not published'. The right column, MiniMax M3, reads 'AA Intelligence: 29.2', 'Thinking off: supported', 'Thinking depth: not available', 'Published speed: 100+ tokens per second (vendor)', 'Open weights: yes', 'Per-token price: $0.30 / $1.20'. A footer reads 'MiniMax M3 figures per Artificial Analysis and MiniMax; MiniMax M3.1 Flash Preview has no independent scores of any kind.'

Was wird tatsächlich an jedem gemessen?

Die eine Seite dieses Vergleichs enthält Zahlen, die andere eine leere Spalte, und es lohnt sich, genau darauf zu achten, welche Zahlen wem gehören.

Die unabhängige Bilanz von MiniMax-M3 ist echt: Artificial Analysis führt es mit 29,2 auf dem Intelligence Index – 60. von 145 – mit 58,6 auf dem Coding Index, 59,18 auf seinem Math-Index, 92,9 % auf GPQA Diamond in derselben Indexfamilie, 83 % Long-Context-Recall und 82,9 % auf IFBench. Das sind Drittanbieter-Evaluierungen eines Modells, das jeder herunterladen und erneut ausführen kann. MiniMax’ eigene Startzahlen für M3 – BrowseComp bei 83,5 %, SWE-Bench Pro bei 59,0 %, Terminal-Bench 2.1 bei 66,0 %, MCP Atlas bei 74,2 %, OSWorld-Verified bei 70 % – sind Herstellerangaben, und wir haben noch keine Reproduktion gesehen.

MiniMax-M3.1-Flash-Preview hat beides nicht. MiniMax hat keine Benchmark-Tabelle veröffentlicht, und das Modell hat keinen Eintrag im Index von Artificial Analysis, daher gibt es keinen unabhängigen Score, keinen Coding-Index, keine Long-Context-Recall-Kennzahl und keine Halluzinationsmessung. Jede kursierende Charakterisierung des Modells – „schnell“, „zuverlässig“, „für die alltägliche Entwicklung gemacht“ – ist das eigene Adjektiv des Anbieters aus dem Launch-Post. Es lohnt sich, das Fehlen klar zu benennen, denn es hat zwei Seiten: Nichts wurde als schlechter gezeigt, und nichts wurde als besser gezeigt.

Diese Asymmetrie macht die gesamte Entscheidung aus. Sie können MiniMax-M3 heute Nachmittag evaluieren, indem Sie es herunterladen oder aufrufen, und Sie können diese Evaluierung mit einem öffentlichen Scoreboard vergleichen. Bei MiniMax-M3.1-Flash-Preview können Sie es nur verwenden und sich eine private Meinung bilden.

Wo das neuere Modell wirklich gewinnt

Es wäre leicht, das Obige als Argument dafür zu lesen, das neue Modell zu ignorieren, und auch das ist nicht die richtige Schlussfolgerung. Drei Dinge sind real und spezifisch für dieses.

Die Aufwandsleiter ist eine echte Fähigkeit, kein Umschalter. Fünf Stufen — niedrig bis maximal — ermöglichen es einem einzigen Modell, eine routinemäßige Umbenennung und ein repositoryweites Refactoring zu unterschiedlichen Rechenkosten zu bedienen, und es ist dokumentiert, dass sie nur für MiniMax-M3.1-Flash-Preview wirksam ist. Bei MiniMax-M3 ist Ihre Wahl binär. Wenn Ihr Problem darin besteht, dass Sie die Latenz pro Aufgabe nicht vorhersagen können, ist eine einstellbare Tiefe genau die Steuerung, die Sie wollten.

Es ist das aktuelle Spitzenmodell des Anbieters, was bedeutet, dass es alles erbt, was die M-Serie seit Juni gelernt hat, und MiniMax stellt ausdrücklich klar, dass es das neueste Modell für agentisches Reasoning, Tool-Nutzung, Coding und Long-Context-Aufgaben ist. Die von M3 eingeführte Tool-Use-Maschinerie mit verschachteltem Denken wird übernommen, einschließlich der Anforderung, die vollständige Antwort — Denkblöcke und alles — wieder an den Nachrichtenverlauf anzuhängen.

Und es verarbeitet Video – zu einem Flash-Preisniveau, im Rahmen eines Abonnements. MiniMax-M3 tut das ebenfalls, zu einem Preis pro Token. Wenn Sie bereits für einen Token-Plan-Platz zahlen und Ihre einzige Hürde für die Nutzung von Videoeingabe die Grenzkosten pro Aufruf waren, beseitigt M3.1-Flash-Preview diese Hürde.

Wo das ältere Modell nach wie vor die erste Wahl ist

Drei Fälle, in denen es allen um Vorhersehbarkeit statt um Qualität geht.

Wenn Sie Kosten modellieren müssen: MiniMax-M3 hat eine Preisliste: 0,30 $ pro Million Input-Tokens, 1,20 $ pro Million Output-Tokens und einen Cache-Read-Tarif von 0,06 $ pro Million in unserem Katalog. Sie können die monatliche Rechnung einer Workload auf den Cent genau schätzen, bevor Sie sie ausführen. MiniMax-M3.1-Flash-Preview hat nirgendwo auf den Seiten von MiniMax einen Preis pro Token, daher sind seine Kosten Ihr Abonnement geteilt durch die Menge, die Sie davon nutzen – gut für ein festes Budget, nutzlos für Unit Economics.

Wenn Sie darauf angewiesen sind, dass das Modell das Modell bleibt. MiniMax-M3 ist Open-Weight: Sie können es herunterladen, auf Ihrer eigenen Hardware ausführen und wissen, dass das Artefakt, das in sechs Monaten Ihre Aufrufe beantwortet, dasselbe ist, das sie heute beantwortet. MiniMax-M3.1-Flash-Preview hat keinen Checkpoint, und Preview-Zugriff bedeutet, dass Serving-Stack, Quota-Zusammensetzung und Verfügbarkeit alle vom Anbieter kontrolliert werden und ausdrücklich Änderungen vorbehalten sind.

Wenn Sie eine Antwort ohne Reasoning benötigen. Wie oben — dies ist die einzige Fähigkeitsregression im Vergleich, und sie ist diejenige, die Menschen überrascht, denn ein neueres Modell, das etwas nicht kann, was das ältere konnte, ist kein Fall, mit dem irgendjemand rechnet.

A headless Chromium screenshot of MiniMax's own model documentation page, showing the note that MiniMax-M3.1-Flash-Preview is available only through Token Plan and MiniMax Code for now, followed by the language model table in which MiniMax-M3.1-Flash-Preview is listed first with a 1,000,000-token context window and the description 'Frontier multimodal coding model with 1M context window and tunable thinking depth', above MiniMax-M3 with the same 1,000,000-token window, captured 28 September 2026.

Beide von einem Ort aus anrufen

Das Vertrackte daran ist, dass die beiden Modelle unterschiedlich bezogen werden – eines nach Verbrauch abgerechnet, eines im Abo – und der natürliche Instinkt ist, sich für eine Seite zu entscheiden. Die nützlichere Vorgehensweise ist, je nach Form der Aufgabe zwischen ihnen zu routen, was nur funktioniert, wenn die nach Verbrauch abgerechnete Seite von derselben Stelle aus erreichbar ist wie alles andere.

MiniMax-M3 auf OrcaRouterträgt MiniMaxs Listenpreis mit 0 % Aufschlag, sodass die $0.30 und $1.20 auf der Preiskarte genau das sind, was ein Aufruf kostet – ohne Plattformmarge obendrauf. Es läuft auf demselben OpenAI-kompatiblen Endpunkt wie MiniMax M2.7 – derselbe Preis von $0.30/$1.20 über ein Fenster von 200.000 Token, ebenfalls Open-Weight – und wie 200+ weitere Modelle hinter einem einzigen API-Schlüssel, mit automatischem Failover über Anbieter hinweg, wenn ein Endpunkt ins Wanken gerät. Gemessen an unserer eigenen Telemetrie, die eine andere Art von Zahl ist als die eines Anbieters: In den letzten sieben Tagen hat M3 mit rund 238 Ausgabe-Token pro Sekunde geantwortet, bei einem p50 von etwa 4,1 Sekunden bis zum ersten Token und einer Fehlerrate von nahezu 0,15 %, gemessen im OrcaRouter Playground. Wenn Sie MiniMax-M3 als die verlässliche Hälfte einer Pipeline führen und MiniMax-M3.1-Flash-Preview als die experimentelle Hälfte behandeln möchten, ist die verlässliche Hälfte eine einzige Zeile Konfiguration statt einer zweiten Anbieterbeziehung. MiniMax-M3.1-Flash-Preview selbst ist nicht in unserem Katalog; der Weg dorthin führt über den Token Plan und das Coding-Produkt des Anbieters selbst.

Was diesen Artikel ändern würde, ist konkret und leicht zu beobachten. Eine veröffentlichte Preisliste für MiniMax-M3.1-Flash-Preview würde den wichtigsten wirtschaftlichen Grund, M3 zu bevorzugen, hinfällig machen. Eine Reihe unabhängiger Bewertungen würde die leere Spalte durch etwas Vergleichbares ersetzen. Ein herunterladbarer Checkpoint würde den Einwand der Reproduzierbarkeit ausräumen. Bis mindestens eines davon eintrifft, bleibt MiniMax-M3 das Modell in diesem Paar, das man zur Rechenschaft ziehen kann — und das neuere bleibt die schnellere, besser kontrollierte, nicht gemessene Vorschau, für die MiniMax beschlossen hat, monatlich statt pro Token abzurechnen.

A headless Chromium screenshot of the OrcaRouter model page for minimax/minimax-m3, showing the model title 'MiniMax: MiniMax M3', a context length of 1,048,576 tokens, a maximum output of 512,000 tokens, and a pricing panel reading 0.300 US dollars per million input tokens, 1.20 per million output tokens and 0.060 per million cache-read tokens, captured 28 September 2026.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert