Hero-Titelkarte für GPT-6 Luna vs. GPT-5.6 Luna mit dem Badge „GA 22. Sep. 2026“, der Schlagzeile „GPT-6 Luna vs. GPT-5.6 Luna“, dem Untertitel „Derselbe Name, halber Preis, ein schlechteres Ergebnis“ und drei Statistik-Karten mit den Angaben „Eingabe: 0,10 $ vs. 0,20 $ pro MTok“, „Ausgabe: 0,50 $ vs. 1,20 $ pro MTok“ und „AA-Index: 37,26 vs. 37,32“, wobei das OrcaRouter-Logo unten rechts eingefügt ist.
Guides & Insights

GPT-6 Luna vs. GPT-5.6 Luna: Derselbe Name, halber Preis und ein schlechteres Ergebnis

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei Modelle, ein gemeinsames Wort und ein unabhängiger Wert, der praktisch identisch ist.GPT-6 Luna erreicht 37,26 im Artificial Analysis Intelligence Index; GPT-5.6 Luna erreichte 37,32. Ein Unterschied von 0,07 Punkten ist keine Messung, sondern Rauschen, und es ist die mit Abstand wichtigste Tatsache über dieses Duo. Was die beiden Modelle unterscheidet, ist nicht die Leistungsfähigkeit — es sind 0,0681 $ pro abgeschlossener Index-Aufgabe gegenüber 0,1783 $ und eine Reihe von Regressionen bei Wissensarbeit, die bei der Preissenkung nicht erwähnt werden.

Die Datumsangaben sind entscheidend für die Einordnung der Zahlen. GPT-5.6 Luna erschien am 9. Juli 2026 zu 0,20 US-Dollar pro Million Eingabe-Token und 1,20 US-Dollar pro Million Ausgabe-Token. GPT-6 Luna erschien am 22. September 2026 zu 0,10 und 0,50 US-Dollar – genau die Hälfte des Eingabe-Preises und 58 % weniger beim Ausgabe-Preis, was OpenAI als dauerhaft und nicht als Werbeaktion beschrieben hat. Das ist eine echte Senkung, und es ist zugleich der kleinere Teil der Geschichte. Der größere Teil ist, dass das neuere Modell ein anderes Modell ist, nicht dasselbe mit neuem Preis.

Two-column comparison scoreboard titled 'GPT-6 Luna vs GPT-5.6 Luna - the scoreboard'. Left column 'GPT-6 Luna': Input per MTok $0.10; Output per MTok $0.50; Cost per index task $0.0681; Hallucination rate 76.7%; AA-Briefcase Elo 1,299.23; AA Intelligence Index 37.26. Right column 'GPT-5.6 Luna': Input per MTok $0.20; Output per MTok $1.20; Cost per index task $0.1783; Hallucination rate 92.6%; AA-Briefcase Elo 1,345.38; AA Intelligence Index 37.32. Footer reads 'Vendor price lines per OpenAI; independent figures per Artificial Analysis.' OrcaRouter logo composited bottom-right.

Was eine Migration tatsächlich bringt – in Zahlen

Vergleicht man die beiden hinsichtlich der Dimensionen, die über eine Migration entscheiden, ergibt sich ein uneinheitliches Bild. Manche Zeilen verbessern sich, manche verschlechtern sich, und eine verbessert sich erheblich.

• Preis — GPT-6 Luna 0,10 $ Eingabe / 0,50 $ Ausgabe pro Million Tokens vs. GPT-5.6 Luna 0,20 / 1,20 $. Halb so viel bei der Eingabe, 58 % weniger bei der Ausgabe.

• Gecachte Eingabe — $0,01 pro Million gegenüber $0,02. Derselbe Rabatt von 90 % auf eine halbierte Basis, sodass ein wiederholtes Präfix nur die Hälfte dessen kostet, was es im Juli gekostet hat.

• Kosten pro abgeschlossener Aufgabe — 0,0681 $ gegenüber 0,1783 $ bei derselben Suite. Eine Reduzierung um 62 %, die größer ausfällt als die Token-Preissenkung, weil der Aufgabenmix nicht identisch ist.

• Ausgabe-Tokens pro Aufgabe – 50.537 gegenüber 41.235. Das neue Modell ist pro erledigter Aufgabe 23 % geschwätziger, und 78 % seiner Ausgabe bestehen aus Überlegungen, die nie in der Antwort erscheinen.

• Kontextfenster — 1.050.000 Token gegenüber 1.000.000. Dieselbe praktische Obergrenze; beide begrenzen die Ausgabe auf 128.000 Token.

• Enthaltung – eine Halluzinationsrate von 76,7 % bei AA-Omniscience gegenüber 92,6 %. Dies ist die größte einzelne Verbesserung in diesem Set, und sie ist kein Wissenszuwachs: Die Genauigkeit steigt von 42,7 % auf 43,8 %, im Wesentlichen unverändert. Das neuere Modell enthält sich, anstatt zu erfinden, was eine Verhaltensänderung und keine Fähigkeitsänderung ist.

• Ergebnisse aus Wissensarbeit — AA-Briefcase v1.1 fällt von 1.345,38 Elo auf 1.299,23, und GDPval-AA v2.1 fällt von 1.443,14 auf 1.367,09. Beide gesunken, um etwa 46 bzw. 76 Punkte.

• Coding und langfristige Arbeit — Terminal-Bench 4.0 steigt von 11,6 % auf 12,6 % und SciCode von 53,6 % auf 54,6 %, die beiden Zeilen hier, die steigen. Dagegen fällt der Coding Agent Index von 43 auf 41 und die agentischen Evaluierungen im SWE-Stil bewegen sich in dieselbe Richtung.

• AutomationBench-AA — 53,2 % gegenüber 50,2 %. Gestiegen, und zwar stärker als bei jedem anderen agentischen Maß im Set.

Screenshot of the Artificial Analysis page for GPT-6 Luna (max), dated September 2026, showing a proprietary model that accepts text and image input and outputs text with a 1M-token context window, an Artificial Analysis Intelligence Index score of 37, pricing of $0.10 per million input tokens and $0.50 per million output tokens, a 90% cache discount, and a cost rank of 20th of 183 models in its class.

Die Regression liegt im Artefakt, nicht in der Argumentation.

Das Muster in diesen letzten beiden Zeilen verdient einen Namen, denn es ist die ganze Entscheidung. Das neue Modell ist besser bei einstufigen agentischen Aktionen und schlechter darin, ein fertiges Dokument zurückzugeben. Artificial Analysis führt den Rückgang bei der Wissensarbeit auf die Präsentationsqualität und auf Ergebnisse zurück, die erforderliche Rubrik-Elemente ausgelassen haben, statt auf faktische oder Argumentationsfehler – und genau das ist die Art von Regression, die einen Smoke-Test übersteht und eine Überprüfung nicht besteht.

Nimmt man die beiden Fakten zusammen, teilt sich die Migration sauber danach auf, was die Ausgabe konsumiert. Wenn Ihre Pipeline strukturierte Ausgaben liest – JSON, eine Klassifizierung, ein extrahiertes Feld, eine Routing-Entscheidung –, kostet Sie die Präsentationsregression nichts, die Verbesserung bei der Enthaltung ist ein echter Gewinn, und die 62%ige Senkung der Aufgabenkosten kommt voll zum Tragen. Wenn ein Mensch das Ergebnis liest – einen Bericht, ein Memo, ein kundenorientiertes Dokument –, ist das neuere Modell messbar schlechter bei genau dem, wofür Sie bezahlen, und die Ersparnis kauft Ihnen einen Prüfer.

Die Zahl der Enthaltungen verdient dieselbe Behandlung. Ein Modell, das bei dem, was es nicht weiß, von einer Erfindungsrate von 93 % auf 77 % kommt, ist ein wesentlich anderes Objekt für eine Leitplanke, einen Compliance-Filter oder jede Pipeline, in der sich eine selbstsichere falsche Antwort weiterverbreitet. Diese Verbesserung ist real, sie wird unabhängig gemessen, und sie ist das stärkste Argument dafür, Arbeit auf das neue Modell zu verlagern – ein Argument, das überhaupt nicht vom Preis abhängt.

Was ändert sich in Ihrem Code und was nicht

Es ist weniger, als eine Preissenkung dieser Größenordnung vermuten lässt, was die gute Nachricht ist. Das Kontextfenster liegt in derselben Klasse, die maximale Ausgabe ist identisch bei 128.000 Tokens, und die Klausel der Familie zur Preisneuregelung für langen Kontext ist unverändert: Anfragen über 272.000 Eingabe-Tokens werden mit dem 2-fachen Eingabe- und Cache-Tarif sowie dem 1,5-fachen Ausgabe-Tarif abgerechnet, und zwar für die gesamte Anfrage statt nur für den Teil oberhalb der Grenze. Eine Anfrage, die bei 300.000 Tokens auf GPT-5.6 Luna teuer war, ist auch auf GPT-6 Luna teuer – halber Tarif, dieselbe Kostenklippe, also sollte eine Arbeitslast, die im Juli hätte aufgeteilt werden sollen, auch jetzt noch aufgeteilt werden.

Die Effort-Leiter ist der Punkt, an dem sich das Verhalten statt der Kosten ändert. GPT-6 Luna bietet none, low, medium (den Standard), high, xhigh und max, und der Standard ist entscheidend: Eine Pipeline, die auf den Standard-Effort eines Modells abgestimmt wurde, ist nicht automatisch auf den eines anderen abgestimmt. Teams, die eine Einstellung explizit festgelegt haben, sind nicht betroffen. Teams, die den Standard übernommen haben, laufen mit einer anderen Konfiguration als im Juli, und das sichtbare Symptom wird das Token-Volumen statt der Qualität sein.

Eine Falle ist es wert, erneut erwähnt zu werden, weil sie mit dem neuen Modell nicht verschwindet. Beim Chat-Completions-Endpunkt funktioniert Function Calling nur, wenn der Reasoning-Aufwand auf none gesetzt ist; jede andere Aufwandsstufe und jedes integrierte Tool erfordert die Responses-API. Ein Team, das eine Tool-Calling-Schleife portiert, indem es die Modellzeichenfolge ändert, wird feststellen, dass seine Tools beim standardmäßigen mittleren Aufwand stillschweigend nicht verfügbar sind, und die Lösung ist eine Neufassung der Aufrufoberfläche statt eines Parameters.

Was Sie heute routen können und was nicht

Dies ist der Teil der Migration, der nichts mit Benchmarks zu tun hat. GPT-5.6 Luna ist auf OrcaRouter zum Listenpreis verfügbar — 0,20 $ pro Million Input-Tokens, 1,20 $ pro Million Output-Tokens, ein Kontextfenster von 1.000.000 Tokens, eine maximale Ausgabe von 128.000 Tokens und eine p50-Zeit bis zum ersten Token von 1,60 Sekunden, gemessen über Live-Traffic auf unserer eigenen Modellseite. Wir geben die Listenpreise der Anbieter ohne Aufschlag weiter, sodass die Änderung an dem Tag, an dem OpenAI die Preise für diese Familie anpasste, auf unserer Seite live war und nicht erst im nächsten Abrechnungszyklus.

Screenshot of the OrcaRouter model page for openai/gpt-5.6-luna, showing GPT-5.6 Luna by OpenAI dated 2026-07-09, Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 128K maximum output, text, image and file input, pricing of $0.20 input and $1.20 output per million tokens, a p50 time to first token of 1.60 seconds and a p95 of 10.00 seconds, and the description 'GPT-5.6 Luna is the fast, cost-efficient model in OpenAI's GPT-5.6 series — tuned for high-volume, latency-sensitive workloads while retaining genuinely capable reasoning.'

Stand 23. September 2026 ist GPT-6 Luna nicht über OrcaRouter routbar. Verfügbar ist es über OpenAIs eigene API und die Cloud-Kataloge, die diese Familie führen, und wir führen kein Modell, das wir nicht bedienen können. Die praktische Konsequenz ist, dass ein Team, das diese Migration plant, heute die Preisgestaltung umstellen kann, die Routing-Umstellung heute aber nicht – die beiden Hälften der Änderung fallen auf unterschiedliche Termine.

Was das in der Zwischenzeit möglich macht, ist die Aufteilung, die die meisten Teams ohnehin letztlich wollen werden. Behalten Sie GPT-5.6 Luna auf den Pfaden, auf denen das Ergebnis das Produkt ist, setzen Sie GPT-6 Luna überall dort ein, wo die Ausgabe von Code konsumiert wird, und behandeln Sie die Grenze als eine Stufe statt als eine Neuentwicklung. Weil die Modelle, die Sie erreichen können, hinter einem einzigen Endpunkt mit über 200 Modellen unter demselben Schlüssel und automatischem anbieterübergreifendem Failover liegen, ist das Hinzufügen oder Entfernen einer Stufe ein Konfigurationseintrag statt einer zweiten Integration — und der Eskalationspfad hängt nicht mehr davon ab, dass ein einzelnes Modell verfügbar ist.

Die Migrationsentscheidung, klar formuliert

Verlagern Sie die Arbeit dorthin, wo die Ausgabe maschinell gelesen wird und die Erfolgsbedingung überprüfbar ist. Klassifizierung, Extraktion, Routing-Entscheidungen, Guardrail-Aufrufe, Massentransformations-Durchläufe und einstufige Agent-Aktionen kommen alle infrage: Der Composite-Wert bleibt unverändert, das Enthaltungsverhalten ist wesentlich besser, und die Aufgabenkosten sind um etwa 62 % gesunken. Mit Batch zu halben Standardtarifen und gecachtem Input zu einem Zehntel einer halbierten Basis kann eine Pipeline, die im Juli noch grenzwertig war, jetzt unkompliziert sein.

Verschieben Sie nicht die Arbeit, bei der eine Person das Artefakt abzeichnet, und verschieben Sie Coding-Agent-Pfade nicht blind. Ein Rückgang um 46 Punkte beim AA-Briefcase und ein Rückgang um 76 Punkte bei GDPval sind kleine Zahlen, die in dieselbe Richtung weisen wie ein Rückgang um zwei Punkte beim Coding Agent Index, und das von Artificial Analysis beschriebene Fehlermuster – übersprungene Rubrikelemente, schwächere Präsentation – ist für eine automatisierte Prüfung unsichtbar. Behalten Sie das vorherige Modell in Fällen, in denen Feinschliff das Lieferergebnis ist.

Und behandeln Sie den Index-Gleichstand von 0,07 Punkten als den Befund, der er ist. Dies ist kein klügeres Modell zu einem niedrigeren Preis. Es ist ein anders geformtes Modell zu einem niedrigeren Preis, und die Frage, die ein Migrationsplan beantworten muss, lautet, welche Form Ihre Workload verbraucht – nicht, welche Punktzahl höher ist, denn im unabhängigen Datensatz sind diese beiden Punktzahlen dieselbe Zahl.