
GPT-6 Luna vs. Gemini 3.1 Pro: Eine sieben Monate alte Vorschau zum Zwanzigfachen des Eingabepreises
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Das Frontier-Reasoning-Modell wird seit Gemini 3.1 Pros Markteinführung am 19. Februar 2026 als „Preview“ geführt. Sieben Monate später ist es immer noch eine Preview, kostet weiterhin 2,00 US-Dollar pro Million Eingabe-Tokens und 12,00 US-Dollar pro Million Ausgabe-Tokens und ist nach wie vor das, was die Produktseite als das Frontier-Reasoning-Modell des Unternehmens bezeichnet. Am 22. September 2026 brachte der Anbieter GPT-6 Luna als allgemein verfügbare Small-Tier-Version für 0,10 und 0,50 US-Dollar auf den Markt. Vergleicht man die beiden Preislisten Seite an Seite, ist das neuere, günstigere GA-Modell beim Input zwanzigmal günstiger und beim Output vierundzwanzigmal günstiger – und es erzielt höhere Werte auf dem unabhängigen Index, der den Marketingabteilungen beider Anbieter wichtig ist.
Dieser letzte Satz ist der Teil, für den es sich lohnt, langsamer zu werden. GPT-6 Luna erreicht mit maximalem Aufwand 37 Punkte im Artificial Analysis Intelligence Index. Gemini 3.1 Pro Preview erreicht in derselben Revision 30. Ein Modell, das als Effizienzspiel für hohes Volumen verkauft wird, liegt sieben Punkte vor einem Modell, das als Frontier-Reasoning-System verkauft wird – bei einem Zwanzigstel des Eingabepreises. Das ist kein Fall, in dem ein günstiges Modell zu einem teuren aufholt. Auf dieser speziellen Achse liegt das günstige Modell einfach vorn, und das teure ist seit sieben Monaten in der Vorschau.
Die naheliegende Schlussfolgerung – dass Gemini 3.1 Pro überteuert ist – ist auch nicht ganz richtig, und der Rest dieses Artikels befasst sich mit den drei Punkten, an denen Googles Modell seinen Preis rechtfertigt, denn sie sind real, und sie sind nicht klein.
Die fünf Dinge, die den Ausschlag geben
Bevor es ins Detail geht, die Kurzfassung:
• GPT-6 Luna gewinnt beim Preis um rund das 20-Fache beim Input und das 24-Fache beim Output, bei gecachtem Input mit großem Abstand und beim General-Purpose-Index um sieben Punkte bei identischem maximalem Aufwand.
• Gemini 3.1 Pro gewinnt bei der Eingabemodalität — er akzeptiert Audio und Video, was GPT-6 Luna nicht tut — und damit, dass er seit sieben Monaten verfügbar ist, was für eine Vorschau eine lange Produktionsbilanz ist.
• Die Ausgabeobergrenzen liegen in keiner Richtung nahe beieinander: GPT-6 Luna gibt bis zu 128.000 Token aus, Gemini 3.1 Pro bis zu 65.000.
• Beide haben eine Long-Context-Stufengrenze, die die gesamte Anfrage neu bepreist, bei 272.000 Eingabe-Tokens für GPT-6 Luna und rund 200.000 für Gemini 3.1 Pro.
Die Default-Effort-Falle gilt nur für Luna: Ihre 37 ist ein Max-Effort-Wert, und ihre Standardeinstellung Medium erzielt 29, was unter den 30 von Gemini 3.1 Pro liegt.
Zwei Tarifkarten und die Arithmetik dazwischen
Eine Zeile pro Dimension, beide Seiten jeweils aktiviert:
• Eingabe pro 1 Mio. — GPT-6 Luna 0,10 $ vs. Gemini 3.1 Pro 2,00 $
Ausgabe pro 1 Mio. — GPT-6 Luna 0,50 $ vs. Gemini 3.1 Pro 12,00 $
• Zwischengespeicherte Eingabe — GPT-6 Luna 0,01 $ pro 1 Mio., ein Rabatt von 90 % gegenüber Gemini 3.1 Pro 0,20 $ pro 1 Mio., ein Rabatt von 90 %
• Langkontext-Grenze — GPT-6 Luna über 272K Eingabe-Tokens vs. Gemini 3.1 Pro über ungefähr 200K Eingabe-Tokens
• Long-Context-Effekt — GPT-6 Luna 2x Eingabe und Cache, 1,5x Ausgabe, auf die gesamte Anfrage bezogen vs. Gemini 3.1 Pro 4,00 $ Eingabe / 18,00 $ Ausgabe, ebenfalls auf die gesamte Anfrage bezogen
• Kontextfenster — GPT-6 Luna 1.050.000 Token vs. Gemini 3.1 Pro 1 Mio. Token
• Maximale Ausgabe — GPT-6 Luna 128.000 Token vs. Gemini 3.1 Pro 65.000 Token
• Eingabemodalität — GPT-6 Luna Text und Bild vs. Gemini 3.1 Pro Text, Bild, Audio, Video und Dateien
• AA Intelligence Index — GPT-6 Luna 37 bei maximalem Aufwand, 29 im Standard vs. Gemini 3.1 Pro 30
• Ausgabegeschwindigkeit — GPT-6 Luna 153,9 Tokens/Sek. vs. Gemini 3.1 Pro etwa 115–143 Tokens/Sek., je nach Snapshot
• Reasoning-Ausschalter — GPT-6 Luna: none bis max vs. Gemini 3.1 Pro Reasoning-first, kein Nicht-Reasoning-Modus verfügbar
• Status — GPT-6 Luna seit 2026-09-22 allgemein verfügbar vs. Gemini 3.1 Pro in der Vorschau seit 2026-02-19

Die interessante Zeile ist nicht der Preis. Es ist das Zeilenpaar ganz unten. Dass Gemini 3.1 Pro als Preview gekennzeichnet ist, ist keine Formalie – es ändert, was Google Ihnen schuldet. Ein Preview-Modell kann geändert, neu bepreist oder zurückgezogen werden, ohne die Deprecation-Benachrichtigung, die ein GA-Modell erhält, und eine Preisgestaltung, die seit sieben Monaten unverändert ist, ist ein Versprechen, das niemand schriftlich gegeben hat. Alles weiter unten darüber, dass Googles Modell die sicherere Produktionswette sei, muss vor diesem Vorbehalt gelesen werden, denn „sieben Monate Stabilität“ und „sieben Monate ohne Stabilitätsgarantie“ sind dieselben sieben Monate.
Wo Googles Modell das zusätzliche Zwanzigfache verdient
Drei Orte, und der erste ist derjenige, der für manche Teams den Vergleich direkt beendet.
Modalität. Gemini 3.1 Pro nimmt Audio- und Videoeingaben entgegen. GPT-6 Luna nimmt Text und Bilder. Wenn Ihre Pipeline Anrufaufzeichnungen, Screencasts oder Videos verarbeitet, gibt es keine Version dieses Duells, in der der Preisunterschied eine Rolle spielt, denn eines der beiden Modelle kann die Aufgabe nicht erledigen. Das ist keine Benchmark-Lücke, die sich mit einem Point Release verringert; es ist eine Fähigkeit, die entweder vorhanden oder nicht vorhanden ist, und es ist der mit Abstand stärkste Grund, warum Googles Preisliste den Kontakt mit einer echten Beschaffung übersteht.
Obergrenze der Ausgabe, in die andere Richtung. Die Ausgabeobergrenzen wirken entgegengesetzt zur Eingabemodalität, und diese hier begünstigt OpenAI. GPT-6 Luna gibt in einer Antwort bis zu 128.000 Tokens aus; Gemini 3.1 Pro bis zu 65.000. Wenn Sie lange strukturierte Artefakte generieren – ein vollständiges Dokument, ein großes Refactoring, einen Patch über mehrere Dateien –, liegt Googles Obergrenze bei etwa der Hälfte der von OpenAI, und eine Pipeline, die bei 65.000 Tokens abschneidet, ist kaputt, egal was sie pro Token zahlt.
Multimodale Arbeit an vorderster Front.Gemini 3.1 Pro positioniert sich als ein Reasoning-Modell, das zufällig multimodal ist, und die praktische Konsequenz ist, dass Aufgaben, die Reasoning über ein Diagramm, ein Schaubild oder eine Bildschirmaufnahme erfordern, bei ihm landen und nicht bei einer textorientierten kleinen Stufe. GPT-6 Luna akzeptiert Bilder, die Grenze liegt also nicht allein bei Audio und Video – sie besteht darin, dass Googles Modell auf visuelles und auditives Reasoning als primären Anwendungsfall ausgelegt ist und OpenAIs Modell auf Durchsatz.
Wo die günstige Stufe tatsächlich verliert – und zwar nicht dort, wo man es erwartet
Der Standard-Aufwand ist die Falle in dieser Paarung, und er schlägt hier härter zu, als er es gegen einen schwächeren Gegner tun würde. GPT-6 Lunas prominenter Indexwert von 37 wird bei maximalem Reasoning-Aufwand gemessen. Sein Standard ist mittel, und bei mittel erreicht es 29 — einen Punkt unter den 30 von Gemini 3.1 Pro. Der Sieben-Punkte-Vorsprung, mit dem dieser Artikel begann, ist also ein Vergleich zwischen der Obergrenze des einen Modells und der Obergrenze des anderen, und ein Team, das GPT-6 Luna installiert und die Konfiguration unangetastet lässt, betreibt ein Modell, das geringfügig hinter Googles Modell zurückliegt, sieben Monate älter ist, sich noch in der Vorschau befindet und ein Zwanzigstel des Preises kostet.
Das ist für die meisten Workloads immer noch der richtige Kompromiss – ein Indexpunkt ist kein Fähigkeitsunterschied, ein 20-facher Preisunterschied aber schon. Doch es ist ein anderer Kompromiss als der, den die Preislisten anpreisen, und er bleibt unsichtbar, wenn man nicht gezielt nach dem Effort-Parameter sucht.
Der zweite Punkt, an dem die günstige Tarifstufe verliert, ist die Arithmetik bei langem Kontext. Beide Modelle berechnen die gesamte Anfrage neu, sobald sie eine Grenze überschreitet, statt den Überschuss mit einem Aufschlag zu belegen, und beide Grenzen sind niedrig genug, um relevant zu sein: 272.000 Eingabe-Tokens bei GPT-6 Luna, ungefähr 200.000 bei Gemini 3.1 Pro. Die Klausel von GPT-6 Luna verdoppelt Eingabe und Cache und erhöht die Ausgabe um die Hälfte. Die von Gemini 3.1 Pro verschiebt den gesamten Aufruf auf 4,00 $ Eingabe und 18,00 $ Ausgabe. Keines von beiden ist ein marginaler Aufschlag, und bei einem Modell, das über den Preis verkauft wird, ist die Klausel der Preis.
Der dritte Punkt ist die Geschwätzigkeit – die Kostenzeile, die nie auf einer Preisliste auftaucht. Artificial Analysis hat gemessen, dass GPT-6 Luna über den Index-Durchlauf hinweg 150 Millionen Ausgabe-Tokens erzeugte, gegenüber einem Median von 85 Millionen – das Modell ist geschwätzig, und bei 0,50 $ pro Million Ausgabe sind das 75 $ an Tokens, wo ein prägnantes Modell 42,50 $ ausgegeben hätte. Es ist immer noch eine Größenordnung günstiger als die Alternative. Es ist auch der Grund, warum Kosten-pro-Aufgabe-Zahlen und Kosten-pro-Token-Zahlen unterschiedliche Geschichten erzählen, und der Grund, das eigene Ausgabevolumen zu messen, bevor man die Einsparung modelliert.
Wie eine Migration zwischen ihnen aussieht
Googles Modell ist über die eigene API des Anbieters und mehrere Drittanbieterplattformen erreichbar; GPT-6 Luna ist über OpenAIs eigene API erreichbar, und zum jetzigen Zeitpunkt ist keines von beiden die einfachere Hälfte des Paares, auf die man sich standardisieren sollte. Beide bieten eine OpenAI-kompatible Chat-Completions-Oberfläche, was bedeutet, dass die Form des Aufrufs nicht das Problem ist – die Parameter sind es. Die Effort-Leiter von GPT-6 Luna, seine 272.000-Token-Klausel und seine Anforderung, dass Function Calling bei Chat Completions mit auf none gesetztem Reasoning Effort ausgeführt wird, sind alles Verhaltensweisen, die Gemini 3.1 Pro nicht teilt, und eine Portierung, die nur den Modell-String ändert, wird einen funktionierenden Aufruf mit dem falschen Kostenprofil erzeugen.
Gemini 3.1 Pro Preview ist auf OrcaRouter zum Listenpreis von Google verfügbar, wobei das Pass-through-Pricing bedeutet, dass eine Änderung der Google-Preise am selben Tag auf unserer Seite live ist. GPT-6 Luna ist zum Zeitpunkt dieses Schreibens nicht in unserem Katalog. Für ein Team, das beide betreibt – Googles Modell für alles, was Audio oder Video benötigt, OpenAIs Modell für Text mit hohem Volumen –, ist das ein Schlüssel für Gemini 3.1 Pro neben dem, was Sie bereits für OpenAI verwenden, wobei die Routing-Entscheidung als Konfiguration und nicht als zwei Codepfade ausgedrückt wird. Dies ist die Paarung, bei der das am wichtigsten ist, denn die beiden Modelle sind überhaupt nicht austauschbar: Eine Route, die zwischen einer multimodalen Preview und einer Text-only-GA-Small-Stufe wählen muss, ist eine Route, die jedes Mal neu entschieden wird, wenn einer der Anbieter etwas veröffentlicht.

Was würde das ändern?
Der Vergleich in seiner aktuellen Form ist eine Momentaufnahme eines ungewöhnlichen Augenblicks: Ein GA-Modell von September schlägt ein Preview-Modell von Februar im allgemeinen Index bei einem Zwanzigstel des Eingabepreises, verliert aber bei der Modalität und bei der Reife, die ein Preview nie ganz erreicht. Drei Dinge würden ihn verändern, und jedes davon ist es wert, beobachtet statt geraten zu werden.
Das erste ist, dass Gemini 3.1 Pro die Preview verlässt. Eine GA-Veröffentlichung würde eine Deprecation-Richtlinie, eine stabile Preisliste und sehr wahrscheinlich eine Preisänderung mit sich bringen – Google hat $2.00/$12.00 über sieben Monate der Preview hinweg gehalten, während sich der Rest des Marktes ringsum halbiert hat, und diese Zurückhaltung ist eher mit einem Startpreis vereinbar, der auf ein GA-Datum wartet, als mit einer wohlüberlegten Position.
Der zweite Punkt ist, ob OpenAI die Luna-Effort-Leiter erweitert oder ihre Standardeinstellung ändert. Die Zweiundzwanzig-Punkte-Spanne zwischen dem Max-Effort-Score von GPT-6 Luna und seinem Default-Effort-Score ist die größte Konfigurationsempfindlichkeit in diesem Artikel, und eine Änderung der Standardeinstellung würde die effektive Leistungsfähigkeit des Modells für jeden Aufrufer verändern, der den Parameter nie angefasst hat.
Das Dritte ist die Modalitätslücke. Sie ist die einzige Dimension hier, die keine Frage des Grades ist, und sie ist diejenige, die verhindert, dass dies ein reiner Preisvergleich ist. Solange keines dieser Modelle kann, was das andere nicht kann, ist die zwanzigfache Lücke eine reale Zahl, die auf zwei unterschiedliche Aufgaben verweist.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
