Generierte Titelkarte mit der Aufschrift GPT-6 Sol vs. MiniMax M3, was der achtfache Ausgabepreis nicht erkauft, mit Statistik-Karten mit der Aufschrift Ausgabepreis 10,00 $ vs. 1,20 $ pro Million, Intelligence Index 47,6 vs. 29,2 und Gewichte geschlossen vs. offen, mit einer Fußzeile mit der Aufschrift Index gemäß Artificial Analysis v4.3.2; MiniMax M3-Preise gemäß MiniMax und GPT-6 Sol-Preise gemäß OpenAIs Preisliste.
Guides & Insights

GPT-6 Sol vs. MiniMax M3: Was der achtfache Output-Preis trotzdem nicht kauft

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Das Erste, was man über GPT-6 Sol gegenüber MiniMax M3 sagen muss, ist, dass die Preislinie nicht nah dran ist und die Score-Linie auch nicht, und sie zeigen in entgegengesetzte Richtungen. MiniMax M3 ist ein Open-Weight-Modell, das man herunterladen und selbst betreiben kann, und es ist mit 0,30 $ pro Million Eingabe-Tokens und 1,20 $ pro Million Ausgabe-Tokens gelistet; GPT-6 Sol, die mittlere Stufe der am 22. September 2026 veröffentlichten GPT-6-Generation, kostet 2,00 $ und 10,00 $ bezogen auf dieselben Einheiten. Das ist etwas mehr als das Achtfache des Ausgabe-Tarifs. MiniMax M3 akzeptiert außerdem Video als Eingabemodalität, was GPT-6 Sol nicht tut – das Sol-Modell nimmt Text, Bild und Datei. Was M3 nicht hat, ist ein Score, der auch nur annähernd an Sol heranreicht: 29,2 gegenüber 47,6 auf dem Intelligence Index von Artificial Analysis, auf demselben Board der Revision v4.3.2.

Diese Asymmetrie ist die ganze Geschichte, und sie ist interessanter als ein einfacher Kompromiss zwischen Preis und Qualität, denn die Open-Weight-Spalte darf etwas behalten, das die Closed-Spalte zu keinem Preis verkaufen kann: M3s Checkpoints liegen auf Hugging Face und das Modell kann innerhalb einer Netzwerkgrenze ausgeführt werden. Wenn Sie zwischen diesen beiden wählen, ist die nützliche Frage nicht, welches besser ist. Sie lautet vielmehr: Welches der vier getrennten Dinge, die Sie kaufen – Preis, Durchsatz, Kontrolle oder Leistungsfähigkeit –, können Sie sich leisten zu verlieren?

Vier Dimensionen, und sie sind nicht gleichrangig

• Ausgabepreis — GPT-6 Sol 10,00 $ pro Million vs. MiniMax M3 1,20 $ pro Million
• Eingabepreis — GPT-6 Sol 2,00 $ pro Million vs. MiniMax M3 0,30 $ pro Million
• Zwischengespeicherte Eingabe — GPT-6 Sol 0,20 $ pro Million vs. MiniMax M3 0,06 $ pro Million
• Gewichte — GPT-6 Sol geschlossen, nur API vs. MiniMax M3 Open-Weight und selbst hostbar
• Eingabemodalitäten — GPT-6 Sol Text, Bild und Datei vs. MiniMax M3 Text, Bild und Video
• Kontextfenster — GPT-6 Sol 1.050.000 Tokens vs. MiniMax M3 1.048.576 Tokens
• Maximale Ausgabe — GPT-6 Sol 128.000 Tokens vs. MiniMax M3 512.000 Tokens
• Intelligenzindex — GPT-6 Sol 47,6 vs. MiniMax M3 29,2
• Coding-Index — GPT-6 Sol in dieser Revision nicht veröffentlicht vs. MiniMax M3 58,6
• Staffel für lange Anfragen — GPT-6 Sol berechnet die gesamte Anfrage oberhalb von 272.000 Eingabe-Tokens neu vs. MiniMax M3 keine Staffel auf seiner Modellkarte

Zwei dieser Zeilen verdienen mehr als nur eine Tabellenzeile. Die Obergrenze für die maximale Ausgabe verhält sich genau entgegengesetzt zu allem anderen: M3 gibt in einer einzigen Antwort bis zu 512.000 Tokens aus, viermal so viele wie die 128.000 von GPT-6 Sol. Für einen Workload, der in einem einzigen Aufruf eine ganze Datei oder einen langen Bericht erzeugt, ist das ein struktureller Vorteil, kein Rundungsfehler. Und der Long-Request-Aufschlag ist ein echter Kostenfaktor bei GPT-6 Sol, den M3 überhaupt nicht kennt – oberhalb von 272.000 Eingabe-Tokens berechnet Sol die gesamte Anfrage neu mit 4,00 $ / 15,00 $, während die Preiskarte von M3 keine entsprechende Klausel enthält. Bei einem Prompt mit 300.000 Tokens ist der Ausgabepreis nicht achtmal, sondern zwölfeinhalbmal so hoch.

Die ehrliche Rangfolge hängt also vollständig von der Arbeitslast ab. Für Klassifizierung oder Extraktion in großen Mengen, bei der eine falsche Antwort wenig kostet, eine langsame aber teuer ist, ist M3 zu $0,30 / $1,20 ohne Aufschlag für langen Kontext die vernünftige Standardwahl, und Sol ist verbranntes Geld. Bei einer Aufgabe, bei der die erste Antwort stimmen muss – ein Migrationsplan, ein Security-Review, eine Argumentation, die von einer Person gelesen wird, die danach handelt –, ist eine 18,4-Punkte-Lücke im Index beim Achtfachen des Output-Preises ein Trade-off, den die meisten Teams eingehen, weil die Alternative darin besteht, einen Menschen dafür zu bezahlen, es zu beheben.

Generated comparison scoreboard titled GPT-6 Sol vs MiniMax M3, the scoreboard, with six matched rows. GPT-6 Sol: input $2.00 per million, output $10.00 per million, weights closed, Intelligence Index 47.6, context window 1,050,000 tokens, reprices above 272K input tokens. MiniMax M3: input $0.30 per million, output $1.20 per million, weights open and downloadable, Intelligence Index 29.2, context window 1,048,576 tokens, no long-request step. A footer reads MiniMax M3 figures per Artificial Analysis v4.3.2 and MiniMax; GPT-6 Sol figures per Artificial Analysis v4.3.2 and OpenAI.

Wo die veröffentlichten Zahlen von M3 ungewöhnlich gut sind und wo sie dünn sind

Die stärksten unabhängigen Werte von MiniMax M3 liegen nicht dort, wo man sie bei einem Modell zu diesem Preis erwarten würde. Die Erinnerungsleistung bei langem Kontext erreicht 83,0, was 0,7 unter den 83,7 von GPT-6 Sol liegt und faktisch ein Gleichstand ist – bei einem Fenster von einer Million Token und zu einem Sechstel des Eingabepreises. GPQA Diamond kommt auf 92,9, nahe genug am Frontier-Bereich, dass der Unterschied innerhalb der Spanne liegt, die man eher auf Einstellungen zum Reasoning-Aufwand als auf die Fähigkeiten zurückführen würde. Diese beiden Zeilen sind der Grund, warum man M3 ernst nehmen sollte, statt es unter „billig“ abzulegen.

Die dünnen Stellen sind ebenso klar und sollten benannt statt beschönigt werden. Tool-Nutzung im Retail-Stil ist schlecht: Bei tau-banking erzielt M3 15,3, und in der neueren Terminal-Bench-4.0-Revision erzielt es 2,0. Beide sind Drittanbieter-Messungen, und beide legen ein Modell nahe, dessen Benchmark-Durchschnitt eine spezifische, große Schwäche beim agentischen Tool-Calling gegen einen simulierten Dienst verbirgt. Die vom Anbieter selbst gemeldeten Zahlen zeichnen ein viel besseres Bild – SWE-Bench Pro 59, BrowseComp 83,5, MCP Atlas 74,2, Terminal-Bench 2.1 bei 66 – und das sind Anbieterangaben auf seinem eigenen Harness, also eine Behauptung statt einer Messung. Jede Bereitstellung, die von Tool-Nutzung abhängt, sollte das Zahlenpaar zusammen lesen und es direkt testen.

Es gibt einen Punkt zweiter Ordnung beim Benchmark-Vergleich selbst. GPT-6 Sol wird in unserem Katalog an einem kleineren Benchmark-Set gemessen als M3 – fünf Wertungen gegenüber dreiundzwanzig bei M3 –, weil der Anbieter weniger veröffentlicht und Dritte weniger der Tests damit durchgeführt haben. Ein Modell mit dreiundzwanzig veröffentlichten Zahlen wirkt immer gründlicher evaluiert als eines mit fünf, und der Unterschied ist Dokumentation, nicht Leistungsfähigkeit.

Was offene Gewichte wirklich bringen – jenseits einer niedrigeren Rechnung

Das Selbsthosting von M3 ist die Option, mit der GPT-6 Sol nicht mithalten kann, und ihr Wert ist nicht in erster Linie finanzieller Natur. Bei 0,30 $ / 1,20 $ ist die API günstiger als die Kosten der meisten Teams für den Betrieb der Hardware, daher ist der Grund für den Download eine Einschränkung und keine Tabellenkalkulation: Daten, die eine Grenze nicht verlassen dürfen, eine Workload ohne akzeptable externe Abhängigkeit, ein Fine-Tuning oder ein Latenzbudget, das ein gemeinsam genutzter Endpunkt nicht erfüllen kann. Offene Gewichte sind die einzige der vier, die das geschlossene Modell beantworten kann, und es beantwortet sie dadurch, dass es nicht verfügbar ist. GPT-6 Sols Antwort lautet, dass man es nicht ausführen muss – was ein anderes Argument ist und für eine andere Gruppe von Teams zutrifft.

Durchsatz verdient eine eigene Zeile, weil er die Zahl ist, die eine Demo nie zeigt. MiniMax M3 wird in unserem rollierenden Sieben-Tage-Fenster mit etwa 495 Ausgabe-Tokens pro Sekunde gemessen, GPT-6 Sol mit etwa 244. M3 ist in diesem Vergleich nicht nur das günstigere Modell, sondern auf unseren Routen auch das schnellere – um etwa den Faktor zwei –, was ändert, was ein Batch-Job sowohl in Wanduhrzeit als auch in Dollar kostet. Die Einschränkung ist, dass dies rollierende Fenster in einem gemeinsam genutzten Playground sind, kein kontrollierter Benchmark, und sie verschieben sich.

OrcaRouter model page for MiniMax M3 (minimax/minimax-m3) by MiniMax, dated 2026-05-31, tagged Vision, Tools, JSON and Reasoning, describing it as MiniMax's flagship open-weight foundation model with a 1M-token context window and text, image and video input, listing $0.30 per million input and $1.20 per million output, with a model-page note that it is available through OrcaRouter under the model id minimax/minimax-m3.

Das Paar als ein System betreiben

Beide Modelle stehen hinter einem einzigen OrcaRouter-Schlüssel neben über 200 weiteren, was die interessante Konfiguration hier eher zu einer Cheap-First-Kaskade als zu einer Wahl macht. Leiten Sie das Volumen an MiniMax M3, behalten Sie GPT-6 Sol dahinter für die Anfragen, die eine Prüfung nicht bestehen oder ein Schwierigkeitssignal auslösen, und die gemischten Kosten landen weit näher am Open-Weight-Tarif als am Tarif von Sol, während die schwierigen Aufrufe weiterhin das Modell bekommen, das 47,6 erreicht. OrcaRouters Routing-DSL ist der Ort, an dem diese Zusammensetzung ausgedrückt wird — ein Aufruf kann mehrere Modelle und die Bedingungen zwischen ihnen benennen, anstatt einen Endpunkt pro Aufgabe fest zu codieren.

Für Teams, die sich wirklich nicht entscheiden können, ist Modellfusion die grobe Version derselben Idee: Ein Panel von Modellen antwortet gemeinsam, und die Antworten werden kombiniert. Für Massenarbeit ist es schlecht geeignet und für einen selten ausgeführten, risikoreichen Prompt angemessen, bei dem der Unterschied zwischen einer 29,2- und einer 47,6-Antwort das Einzige ist, was auf der Seite steht.

Failover ist bei einem Open-Weight-Modell wichtiger als bei einem geschlossenen, und das aus einem bestimmten Grund: M3 wird von mehr als einem Infrastrukturanbieter bereitgestellt, und die Endpunkte unterscheiden sich. Eine im Voraus konfigurierte zweite Route bedeutet, dass ein langsamer oder beeinträchtigter Host einen Wiederholungsversuch statt einen Ausfall darstellt. Und weil unser Katalog die Listenpreise der Anbieter ohne Aufschlag weitergibt, ist eine Preisänderung eines Anbieters bei uns am selben Tag aktiv – was bei einer Output-Zeile von 1,20 $ zählt, bei der ein Anbieter, der einen einzelnen Cached-Input-Tarif ändert, eine Rechnung sichtbar verändert.

Artificial Analysis model page for MiniMax-M3, described as an open-weights model released June 2026, showing an Intelligence rank of 18 of 117 with an Intelligence Index of 29 on a comparable-model median of 18, an output speed rating above average, a 1M-token context window, and support for text, image and video input with text output.

Welche du tatsächlich anrufen solltest

Nimm MiniMax M3 für Volumen, für alles, was eine Videoeingabe möchte, für alles, was in einer einzigen Antwort mehr als 128.000 Tokens ausgeben muss, und für alles, was innerhalb des eigenen Perimeters laufen muss. Nimm GPT-6 Sol für die Anfragen, deren Antwort das Produkt ist, für werkzeuglastige agentische Schleifen, in denen die tau-banking- und Terminal-Bench-4.0-Werte von M3 eine Warnung und keine Fußnote sind, und für alles, wo ein Unterschied von 18 Indexpunkten dir das Achtfache der Ausgaberate wert ist. Nimm beide, und lass einen Router entscheiden, wenn keines von beidem deinen gesamten Traffic beschreibt.

Eine Sache sollten Sie vor beidem prüfen, und es ist derselbe Punkt, auf den dieser Blog immer wieder stößt: M3 ist seit Mai 2026 das Flaggschiff der M-Serie und nach wie vor das neueste M-Serien-Modell in unserem Katalog, ist also wirklich aktuell – aber GPT-6 Sol wurde bereits durch GPT-6.1 Sol ersetzt, bei gleichen Kurzkontext-Preisen und günstigerem gecachtem Input, und die eigene GPT-6 Sol-Seite enthält einen Hinweis darauf. Wenn Sie sich Sol hier wegen der Leistungsfähigkeit statt wegen der acht Tage alten Integration ansehen, sehen Sie sich zuerst den Nachfolger an.

In diesem Artikel verglichen3

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert