Eine generierte Hero-Titelkarte mit der Aufschrift ‚GPT-6 Luna vs Gemini 3.1 Pro‘, dem Untertitel ‚Eine Vorschau, die sieben Monate gegen ein GA-Modell gelaufen ist, das vor drei Wochen veröffentlicht wurde.‘, mit Chips, die Luna bei $0,10/$0,50 pro 1 Mio. und GA seit dem 22. September zeigen, Gemini 3.1 Pro bei $2,00/$12,00 pro 1 Mio. und in der Vorschau seit dem 19. Februar, sowie Indexwerte von 37 gegenüber 30, mit dem OrcaRouter-Logo unten rechts.
Guides & Insights

GPT-6 Luna vs. Gemini 3.1 Pro: Eine sieben Monate alte Vorschau zum Zwanzigfachen des Eingabepreises

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Das Frontier-Reasoning-Modell wird seit Gemini 3.1 Pros Markteinführung am 19. Februar 2026 als „Preview“ geführt. Sieben Monate später ist es immer noch eine Preview, kostet weiterhin 2,00 US-Dollar pro Million Eingabe-Tokens und 12,00 US-Dollar pro Million Ausgabe-Tokens und ist nach wie vor das, was die Produktseite als das Frontier-Reasoning-Modell des Unternehmens bezeichnet. Am 22. September 2026 brachte der Anbieter GPT-6 Luna als allgemein verfügbare Small-Tier-Version für 0,10 und 0,50 US-Dollar auf den Markt. Vergleicht man die beiden Preislisten Seite an Seite, ist das neuere, günstigere GA-Modell beim Input zwanzigmal günstiger und beim Output vierundzwanzigmal günstiger – und es erzielt höhere Werte auf dem unabhängigen Index, der den Marketingabteilungen beider Anbieter wichtig ist.

Dieser letzte Satz ist der Teil, für den es sich lohnt, langsamer zu werden. GPT-6 Luna erreicht mit maximalem Aufwand 37 Punkte im Artificial Analysis Intelligence Index. Gemini 3.1 Pro Preview erreicht in derselben Revision 30. Ein Modell, das als Effizienzspiel für hohes Volumen verkauft wird, liegt sieben Punkte vor einem Modell, das als Frontier-Reasoning-System verkauft wird – bei einem Zwanzigstel des Eingabepreises. Das ist kein Fall, in dem ein günstiges Modell zu einem teuren aufholt. Auf dieser speziellen Achse liegt das günstige Modell einfach vorn, und das teure ist seit sieben Monaten in der Vorschau.

Die naheliegende Schlussfolgerung – dass Gemini 3.1 Pro überteuert ist – ist auch nicht ganz richtig, und der Rest dieses Artikels befasst sich mit den drei Punkten, an denen Googles Modell seinen Preis rechtfertigt, denn sie sind real, und sie sind nicht klein.

Die fünf Dinge, die den Ausschlag geben

Bevor es ins Detail geht, die Kurzfassung:

• GPT-6 Luna gewinnt beim Preis um rund das 20-Fache beim Input und das 24-Fache beim Output, bei gecachtem Input mit großem Abstand und beim General-Purpose-Index um sieben Punkte bei identischem maximalem Aufwand.

• Gemini 3.1 Pro gewinnt bei der Eingabemodalität — er akzeptiert Audio und Video, was GPT-6 Luna nicht tut — und damit, dass er seit sieben Monaten verfügbar ist, was für eine Vorschau eine lange Produktionsbilanz ist.

• Die Ausgabeobergrenzen liegen in keiner Richtung nahe beieinander: GPT-6 Luna gibt bis zu 128.000 Token aus, Gemini 3.1 Pro bis zu 65.000.

• Beide haben eine Long-Context-Stufengrenze, die die gesamte Anfrage neu bepreist, bei 272.000 Eingabe-Tokens für GPT-6 Luna und rund 200.000 für Gemini 3.1 Pro.

Die Default-Effort-Falle gilt nur für Luna: Ihre 37 ist ein Max-Effort-Wert, und ihre Standardeinstellung Medium erzielt 29, was unter den 30 von Gemini 3.1 Pro liegt.

Zwei Tarifkarten und die Arithmetik dazwischen

Eine Zeile pro Dimension, beide Seiten jeweils aktiviert:

• Eingabe pro 1 Mio. — GPT-6 Luna 0,10 $ vs. Gemini 3.1 Pro 2,00 $

Ausgabe pro 1 Mio. — GPT-6 Luna 0,50 $ vs. Gemini 3.1 Pro 12,00 $

• Zwischengespeicherte Eingabe — GPT-6 Luna 0,01 $ pro 1 Mio., ein Rabatt von 90 % gegenüber Gemini 3.1 Pro 0,20 $ pro 1 Mio., ein Rabatt von 90 %

• Langkontext-Grenze — GPT-6 Luna über 272K Eingabe-Tokens vs. Gemini 3.1 Pro über ungefähr 200K Eingabe-Tokens

• Long-Context-Effekt — GPT-6 Luna 2x Eingabe und Cache, 1,5x Ausgabe, auf die gesamte Anfrage bezogen vs. Gemini 3.1 Pro 4,00 $ Eingabe / 18,00 $ Ausgabe, ebenfalls auf die gesamte Anfrage bezogen

• Kontextfenster — GPT-6 Luna 1.050.000 Token vs. Gemini 3.1 Pro 1 Mio. Token

• Maximale Ausgabe — GPT-6 Luna 128.000 Token vs. Gemini 3.1 Pro 65.000 Token

• Eingabemodalität — GPT-6 Luna Text und Bild vs. Gemini 3.1 Pro Text, Bild, Audio, Video und Dateien

• AA Intelligence Index — GPT-6 Luna 37 bei maximalem Aufwand, 29 im Standard vs. Gemini 3.1 Pro 30

• Ausgabegeschwindigkeit — GPT-6 Luna 153,9 Tokens/Sek. vs. Gemini 3.1 Pro etwa 115–143 Tokens/Sek., je nach Snapshot

• Reasoning-Ausschalter — GPT-6 Luna: none bis max vs. Gemini 3.1 Pro Reasoning-first, kein Nicht-Reasoning-Modus verfügbar

• Status — GPT-6 Luna seit 2026-09-22 allgemein verfügbar vs. Gemini 3.1 Pro in der Vorschau seit 2026-02-19

A generated single-panel scoreboard card headed 'Two rate cards, seven months apart' with six rows: GPT-6 Luna $0.10 in / $0.50 out per 1M and GA since September 22, 2026; Gemini 3.1 Pro $2.00 in / $12.00 out per 1M and in preview since February 19, 2026; Intelligence Index Luna 37 at max and 29 at default against Gemini 3.1 Pro's 30; input modality Luna text and image against Gemini 3.1 Pro's text, image, audio and video; maximum output Luna 128K tokens against Gemini 3.1 Pro's 65K; and a long-context clause that reprices the whole request on both. Footer: 'Index figures per Artificial Analysis; prices per OpenAI and Google.'

Die interessante Zeile ist nicht der Preis. Es ist das Zeilenpaar ganz unten. Dass Gemini 3.1 Pro als Preview gekennzeichnet ist, ist keine Formalie – es ändert, was Google Ihnen schuldet. Ein Preview-Modell kann geändert, neu bepreist oder zurückgezogen werden, ohne die Deprecation-Benachrichtigung, die ein GA-Modell erhält, und eine Preisgestaltung, die seit sieben Monaten unverändert ist, ist ein Versprechen, das niemand schriftlich gegeben hat. Alles weiter unten darüber, dass Googles Modell die sicherere Produktionswette sei, muss vor diesem Vorbehalt gelesen werden, denn „sieben Monate Stabilität“ und „sieben Monate ohne Stabilitätsgarantie“ sind dieselben sieben Monate.

Wo Googles Modell das zusätzliche Zwanzigfache verdient

Drei Orte, und der erste ist derjenige, der für manche Teams den Vergleich direkt beendet.

Modalität. Gemini 3.1 Pro nimmt Audio- und Videoeingaben entgegen. GPT-6 Luna nimmt Text und Bilder. Wenn Ihre Pipeline Anrufaufzeichnungen, Screencasts oder Videos verarbeitet, gibt es keine Version dieses Duells, in der der Preisunterschied eine Rolle spielt, denn eines der beiden Modelle kann die Aufgabe nicht erledigen. Das ist keine Benchmark-Lücke, die sich mit einem Point Release verringert; es ist eine Fähigkeit, die entweder vorhanden oder nicht vorhanden ist, und es ist der mit Abstand stärkste Grund, warum Googles Preisliste den Kontakt mit einer echten Beschaffung übersteht.

Obergrenze der Ausgabe, in die andere Richtung. Die Ausgabeobergrenzen wirken entgegengesetzt zur Eingabemodalität, und diese hier begünstigt OpenAI. GPT-6 Luna gibt in einer Antwort bis zu 128.000 Tokens aus; Gemini 3.1 Pro bis zu 65.000. Wenn Sie lange strukturierte Artefakte generieren – ein vollständiges Dokument, ein großes Refactoring, einen Patch über mehrere Dateien –, liegt Googles Obergrenze bei etwa der Hälfte der von OpenAI, und eine Pipeline, die bei 65.000 Tokens abschneidet, ist kaputt, egal was sie pro Token zahlt.

Multimodale Arbeit an vorderster Front.Gemini 3.1 Pro positioniert sich als ein Reasoning-Modell, das zufällig multimodal ist, und die praktische Konsequenz ist, dass Aufgaben, die Reasoning über ein Diagramm, ein Schaubild oder eine Bildschirmaufnahme erfordern, bei ihm landen und nicht bei einer textorientierten kleinen Stufe. GPT-6 Luna akzeptiert Bilder, die Grenze liegt also nicht allein bei Audio und Video – sie besteht darin, dass Googles Modell auf visuelles und auditives Reasoning als primären Anwendungsfall ausgelegt ist und OpenAIs Modell auf Durchsatz.

Wo die günstige Stufe tatsächlich verliert – und zwar nicht dort, wo man es erwartet

Der Standard-Aufwand ist die Falle in dieser Paarung, und er schlägt hier härter zu, als er es gegen einen schwächeren Gegner tun würde. GPT-6 Lunas prominenter Indexwert von 37 wird bei maximalem Reasoning-Aufwand gemessen. Sein Standard ist mittel, und bei mittel erreicht es 29 — einen Punkt unter den 30 von Gemini 3.1 Pro. Der Sieben-Punkte-Vorsprung, mit dem dieser Artikel begann, ist also ein Vergleich zwischen der Obergrenze des einen Modells und der Obergrenze des anderen, und ein Team, das GPT-6 Luna installiert und die Konfiguration unangetastet lässt, betreibt ein Modell, das geringfügig hinter Googles Modell zurückliegt, sieben Monate älter ist, sich noch in der Vorschau befindet und ein Zwanzigstel des Preises kostet.

Das ist für die meisten Workloads immer noch der richtige Kompromiss – ein Indexpunkt ist kein Fähigkeitsunterschied, ein 20-facher Preisunterschied aber schon. Doch es ist ein anderer Kompromiss als der, den die Preislisten anpreisen, und er bleibt unsichtbar, wenn man nicht gezielt nach dem Effort-Parameter sucht.

Der zweite Punkt, an dem die günstige Tarifstufe verliert, ist die Arithmetik bei langem Kontext. Beide Modelle berechnen die gesamte Anfrage neu, sobald sie eine Grenze überschreitet, statt den Überschuss mit einem Aufschlag zu belegen, und beide Grenzen sind niedrig genug, um relevant zu sein: 272.000 Eingabe-Tokens bei GPT-6 Luna, ungefähr 200.000 bei Gemini 3.1 Pro. Die Klausel von GPT-6 Luna verdoppelt Eingabe und Cache und erhöht die Ausgabe um die Hälfte. Die von Gemini 3.1 Pro verschiebt den gesamten Aufruf auf 4,00 $ Eingabe und 18,00 $ Ausgabe. Keines von beiden ist ein marginaler Aufschlag, und bei einem Modell, das über den Preis verkauft wird, ist die Klausel der Preis.

Der dritte Punkt ist die Geschwätzigkeit – die Kostenzeile, die nie auf einer Preisliste auftaucht. Artificial Analysis hat gemessen, dass GPT-6 Luna über den Index-Durchlauf hinweg 150 Millionen Ausgabe-Tokens erzeugte, gegenüber einem Median von 85 Millionen – das Modell ist geschwätzig, und bei 0,50 $ pro Million Ausgabe sind das 75 $ an Tokens, wo ein prägnantes Modell 42,50 $ ausgegeben hätte. Es ist immer noch eine Größenordnung günstiger als die Alternative. Es ist auch der Grund, warum Kosten-pro-Aufgabe-Zahlen und Kosten-pro-Token-Zahlen unterschiedliche Geschichten erzählen, und der Grund, das eigene Ausgabevolumen zu messen, bevor man die Einsparung modelliert.

Wie eine Migration zwischen ihnen aussieht

Googles Modell ist über die eigene API des Anbieters und mehrere Drittanbieterplattformen erreichbar; GPT-6 Luna ist über OpenAIs eigene API erreichbar, und zum jetzigen Zeitpunkt ist keines von beiden die einfachere Hälfte des Paares, auf die man sich standardisieren sollte. Beide bieten eine OpenAI-kompatible Chat-Completions-Oberfläche, was bedeutet, dass die Form des Aufrufs nicht das Problem ist – die Parameter sind es. Die Effort-Leiter von GPT-6 Luna, seine 272.000-Token-Klausel und seine Anforderung, dass Function Calling bei Chat Completions mit auf none gesetztem Reasoning Effort ausgeführt wird, sind alles Verhaltensweisen, die Gemini 3.1 Pro nicht teilt, und eine Portierung, die nur den Modell-String ändert, wird einen funktionierenden Aufruf mit dem falschen Kostenprofil erzeugen.

Gemini 3.1 Pro Preview ist auf OrcaRouter zum Listenpreis von Google verfügbar, wobei das Pass-through-Pricing bedeutet, dass eine Änderung der Google-Preise am selben Tag auf unserer Seite live ist. GPT-6 Luna ist zum Zeitpunkt dieses Schreibens nicht in unserem Katalog. Für ein Team, das beide betreibt – Googles Modell für alles, was Audio oder Video benötigt, OpenAIs Modell für Text mit hohem Volumen –, ist das ein Schlüssel für Gemini 3.1 Pro neben dem, was Sie bereits für OpenAI verwenden, wobei die Routing-Entscheidung als Konfiguration und nicht als zwei Codepfade ausgedrückt wird. Dies ist die Paarung, bei der das am wichtigsten ist, denn die beiden Modelle sind überhaupt nicht austauschbar: Eine Route, die zwischen einer multimodalen Preview und einer Text-only-GA-Small-Stufe wählen muss, ist eine Route, die jedes Mal neu entschieden wird, wenn einer der Anbieter etwas veröffentlicht.

A screenshot of the Artificial Analysis page for GPT-6 Luna (max), showing an Intelligence rank of 6th of 183 models, a Speed rank of 35th, a Cost rank of 20th and a Verbosity rank of 36th, input pricing of $0.10 and output of $0.50 per 1M tokens, an Intelligence Index score of 37 against a comparable-model median of 12, 150M output tokens generated during the index run, 153.9 tokens per second, and a total of $122.39 spent evaluating the model.

Was würde das ändern?

Der Vergleich in seiner aktuellen Form ist eine Momentaufnahme eines ungewöhnlichen Augenblicks: Ein GA-Modell von September schlägt ein Preview-Modell von Februar im allgemeinen Index bei einem Zwanzigstel des Eingabepreises, verliert aber bei der Modalität und bei der Reife, die ein Preview nie ganz erreicht. Drei Dinge würden ihn verändern, und jedes davon ist es wert, beobachtet statt geraten zu werden.

Das erste ist, dass Gemini 3.1 Pro die Preview verlässt. Eine GA-Veröffentlichung würde eine Deprecation-Richtlinie, eine stabile Preisliste und sehr wahrscheinlich eine Preisänderung mit sich bringen – Google hat $2.00/$12.00 über sieben Monate der Preview hinweg gehalten, während sich der Rest des Marktes ringsum halbiert hat, und diese Zurückhaltung ist eher mit einem Startpreis vereinbar, der auf ein GA-Datum wartet, als mit einer wohlüberlegten Position.

Der zweite Punkt ist, ob OpenAI die Luna-Effort-Leiter erweitert oder ihre Standardeinstellung ändert. Die Zweiundzwanzig-Punkte-Spanne zwischen dem Max-Effort-Score von GPT-6 Luna und seinem Default-Effort-Score ist die größte Konfigurationsempfindlichkeit in diesem Artikel, und eine Änderung der Standardeinstellung würde die effektive Leistungsfähigkeit des Modells für jeden Aufrufer verändern, der den Parameter nie angefasst hat.

Das Dritte ist die Modalitätslücke. Sie ist die einzige Dimension hier, die keine Frage des Grades ist, und sie ist diejenige, die verhindert, dass dies ein reiner Preisvergleich ist. Solange keines dieser Modelle kann, was das andere nicht kann, ist die zwanzigfache Lücke eine reale Zahl, die auf zwei unterschiedliche Aufgaben verweist.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), showing the Vision, Audio, Tools, JSON and Reasoning badges, a 2026-02-19 catalogue date, 65K maximum output, list pricing of $2.00 input and $12.00 output per 1M tokens, a p50 time to first token of 10.60s, 111.8M tokens of traffic, and the description of the model as Google's frontier reasoning model for software engineering and agentic reliability.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert