Hero-Titelkarte mit der Aufschrift 'OpenAIs Decisions API', Untertitel 'GPT-6 Luna hört auf zu chatten und wählt eine Antwort aus', mit drei abgerundeten Karten mit der Aufschrift 'Eine Antwort aus einer von Ihnen definierten Liste', 'Vom Anbieter angegebene ~150 ms' und 'Noch kein veröffentlichter Preis', eine Fußzeile mit der Aufschrift 'OpenAI-Zahlen vom Anbieter gemeldet; noch keine unabhängige Messung.', und das OrcaRouter-Logo in der unteren rechten Ecke eingefügt.
Guides & Insights

OpenAIs Decisions API: GPT-6 Luna beendet das Chatten und wählt eine Antwort

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

GPT-6 Luna kam am 22. September 2026 als die günstige Sprosse von OpenAIs GPT-6-Leiter auf den Markt. Was am 29. September neu ist, ist eine Aufgabe für das Modell, die nichts mit Konversation zu tun hat. Die Decisions API von OpenAI nimmt eine Frage, die Sie geschrieben haben, eine endliche Liste von Antworten, die Sie zulassen, und ein Stück Kontext – Text oder ein Bild – entgegen und gibt eine dieser Antworten zurück. Keine Prosa. Kein Absatz, den man parsen und auf den man hoffen muss. Eine einzige Auswahl, sodass ein Support-Ticket in einer von fünf Warteschlangen landet, ein Bild in einer von mehreren Moderationskategorien einsortiert wird oder ein Agent seinen nächsten Schritt aus einer von Ihnen definierten Richtlinie wählt. Sie wurde auf dem DevDay 2026 angekündigt und befindet sich derzeit in einer begrenzten Vorschau; OpenAI erklärt, eine breite Veröffentlichung sei in den kommenden Tagen geplant.

Das Meiste, was ein Team braucht, bevor es darauf aufbaut, ist noch nicht veröffentlicht. Es gibt keinen Preis pro Aufruf, keine angegebene Obergrenze, wie viele Kandidatenantworten eine Anfrage enthalten kann, keine Aussage darüber, ob man es mit eigenen Daten tunen kann, und – Stand 30. September – keinen Eintrag dafür irgendwo in OpenAIs eigenem Entwicklerdokumentationsindex, Changelog oder API-Referenz. Wir haben alle drei überprüft. Die Fähigkeit existiert derzeit in OpenAIs DevDay-Zusammenfassung und in dem, was ein OpenAI-Sprecher Reportern am Starttag sagte. Der Rest dieses Artikels hält daher drei Ebenen sichtbar getrennt: was OpenAI bestätigt hat, was eine Starttag-Messung behauptet und was noch niemand wissen kann.

Was eine eingeschränkte Entscheidung tatsächlich ist

Zwei bestehende Ansätze erledigen diese Aufgabe schlecht, und die Decisions API zielt auf die Lücke zwischen ihnen. Der erste ist das Prompting eines Chat-Modells: Man schreibt eine sorgfältige Anweisung, in der es aus einer Liste auswählen soll, es schreibt einem einen Satz, und mit etwas Glück kann man Token-Wahrscheinlichkeiten aus der Antwort herauslesen, um etwas zu erhalten, das einem Konfidenzwert ähnelt. Es funktioniert, es verbraucht Token, und die Konfidenzzahl ist eine grobe Schätzung. Der zweite ist das Trainieren eines kleinen Klassifikators: schnell, günstig, und er benötigt gelabelte Daten plus einen erneuten Trainingslauf, jedes Mal wenn sich das Label-Set ändert.

Ein Entscheidungsmodell liegt zwischen diesen beiden. Es akzeptiert neue Labels im Prompt – genauso wie ein Prompt –, gibt aber einen Score oder eine Auswahl zurück, auf die ein Entwickler verzweigen kann, ohne sie zu parsen; das ist die Eigenschaft, die ein Klassifikator hatte und ein Chat-Modell nie besaß. OpenAI ist mit dieser Form nicht neu: Seine Moderation API gibt seit Jahren Bewertungen pro Kategorie statt Text zurück, mit einem Unterschied, der hier von Bedeutung ist. Die Kategorien der Moderation API sind die von OpenAI. Die Kategorien der Decisions API sind Ihre.

Die Einschränkung ist das Produkt, und es lohnt sich, genau zu sein, was sie bringt und was nicht. Ein endlicher Ausgaberaum bedeutet, dass jeder zulässige Wert im Voraus bekannt ist, sodass Ihre Anwendung eine Antwort ablehnen kann, die sie nicht definiert hat, jedem Zweig eine andere Berechtigungsstufe zuweisen kann und auf einen Menschen zurückgreifen kann, wenn Konfidenz oder Kontext dünn sind. Sie macht außerdem die Offline-Evaluierung handhabbar, weil jeder Testfall eine Zielklasse und messbare Kosten hat, wenn er falsch ist. Was sie nicht bringt, ist Korrektheit. Ein eingeschränktes Modell kann immer noch die falsche gültige Antwort auswählen, sich von irreführendem Kontext steuern lassen oder den Bias der Kategorien erben, die Sie geschrieben haben.

Die 150-Millisekunden-Behauptung – und die Zahl, die OpenAI nicht veröffentlicht hat

OpenAI sagt, die Decisions API treffe Entscheidungen etwa zehnmal schneller als GPT-6 Luna über die reguläre API – in der Größenordnung von 150 Millisekunden gegenüber etwa 1,6 Sekunden. Diese Zahl ist vom Anbieter angegeben und nicht reproduziert; seit dem Start vor zwei Tagen gibt es keine unabhängige Messung dafür, und OpenAIs eigene Zusammenfassung nennt nur „Echtzeit-Entscheidungsfindung“. Keine Latenzverteilung, keine Region, keine Eingabegröße, kein Parallelitätsniveau und keine Service-Level-Vereinbarung begleiten die Zahl.

Unsere eigenen Verkehrsdaten sind kein Ersatz für diesen Test, aber sie erklären, warum die fehlende Verteilung wichtig ist. Über die sieben Tage bis zum 30. September zeigt GPT-6 Luna, bereitgestellt über OrcaRouters normale Chat-Completions-Route, einen Median von 699 Millisekunden und einen p95-Wert von 7,6 Sekunden bei 3,23 Milliarden Tokens gemischter Arbeitslast – eine Spanne von mehr als einer Größenordnung zwischen der Mitte und dem Tail. Das ist eine andere Anfrageform als die einer eingeschränkten Entscheidung, es ist also kein Vergleich mit der 150-ms-Behauptung. Es ist der Grund, warum ein einzelner p50 als Schlagzeile die falsche Zahl ist, an der man eine Deadline ausrichten sollte. Wenn Sie die Vorschau testen, erfassen Sie Median, p95 und p99 getrennt für Text- und Bildeingaben, beziehen Sie Netzwerkzeit und Wiederholungsversuche ein und messen Sie die Deadline, die Ihr Produkt tatsächlich hat – eine Routing-Entscheidung für eine asynchrone Warteschlange und eine, die zwischen einem Klick und einer Zahlung sitzt, haben kein gemeinsames Latenzbudget.

A single-column scoreboard titled 'GPT-6 Luna and the Decisions API - the scoreboard' with six rows: Decisions API price 'not published', candidate-answer limit 'not published', fine-tuning on your data 'no statement', stated decision latency '~150 ms vendor-reported', GPT-6 Luna input / output '$0.10 / $0.50 per 1M', and AA Intelligence Index at max effort '37.3', with a footer reading 'OpenAI figures vendor-reported; Index per Artificial Analysis; unpublished means blank, not zero.' and the OrcaRouter logo composited in the bottom-right corner.

Preisgestaltung: Was das zugrunde liegende Modell kostet und warum das nicht der Preis der API ist

OpenAI hat keinen Preis für die Decisions API veröffentlicht. Es ist auch nicht sicher anzunehmen, dass die Luna-Token-Preise gelten, denn die Decisions API ist ein eigenes Paket – ein anderer Endpunkt mit anderen Limits –, und OpenAI hat gesagt, dass mehr Details „beim breiten Rollout“ mitgeteilt werden. Wer Ihnen derzeit Kosten pro Entscheidung nennt, leitet sie daraus ab.

Veröffentlicht wird die Preisliste für das Modell, auf dem es basiert, entnommen von OpenAIs Preisseite am 30. September 2026:

• Eingabe — 0,10 $ pro Million Tokens, ab 272.000 Eingabe-Tokens dann 0,20 $
• Ausgabe — 0,50 $ pro Million Tokens, ab 272.000 Eingabe-Tokens dann 0,75 $
• Cache-Eingabe — 0,01 $ pro Million Tokens; Cache-Schreibvorgänge werden mit 0,125 $ abgerechnet, ein Aufschlag von 25 % auf den Tarif ohne Cache
• Batch- und Flex-Verarbeitung — 50 % der Standardtarife; Fast-Modus — das 2-Fache der jeweils geltenden Tarife

Die Long-Context-Grenze ist die, die viele überrascht, und sie funktioniert genauso wie über die gesamte GPT-6-Familie hinweg: Wer 272.000 Eingabe-Tokens überschreitet, lässt die gesamte Anfrage zum höheren Tarif neu bepreisen, nicht nur den Überschuss. Eine Entscheidungs-API, die ein langes Dokument oder eine große Bildmenge an das Modell übergibt, ist genau die Art von Aufruf, die diese Grenze überschreiten kann, was ein weiterer Punkt ist, den die unveröffentlichten Limits der Vorschau offenlassen.

GPT-6 Luna zu seinen eigenen Bedingungen

Wenn man die API wegnimmt, ist das darunterliegende Modell ein Reasoning-Modell am unteren Ende einer dreistufigen Familie – unter GPT-6 Sol zu 2,00 $/10,00 $ und dem Flaggschiff GPT-6 Astra zu 10,00 $/50,00 $ – mit einem Kontextfenster von 1.050.000 Token, einer Ausgabegrenze von 128.000 Token, einem Wissensstand vom 18. Mai 2026 und einem Reasoning-Aufwand, der über sechs Werte von none bis max einstellbar ist. Es nimmt Text- und Bildeingaben entgegen und gibt Text zurück, und in der eigenen Entwicklerdokumentation von OpenAI ist der Standardwert für den Aufwand medium. Ein praktischer Vorbehalt von derselben Seite, der nichts mit der Decisions API zu tun hat, aber relevant ist, wenn Sie Luna als Fallback einbinden: Bei Chat Completions funktioniert Function Calling nur, wenn der Reasoning-Aufwand auf none eingestellt ist. Tools bei jeder anderen Aufwands-Einstellung erfordern die Responses API.

Was die Qualität betrifft, liegt die unabhängige Kennzahl – der Intelligence Index von Artificial Analysis – bei 37,3 für Luna bei maximalem Aufwand, gegenüber 47,5 für GPT-6 Sol; eine Lücke von etwa zehn Punkten, was die ehrliche Art ist, den zwanzigfachen Preisunterschied bei Eingaben zu deuten. Keine der beiden Zahlen ist eine Aussage über die Decisions API, deren eingeschränkte Aufgabe eine völlig andere Messung ist und für die keine veröffentlichte Punktzahl vorliegt.

OpenAI's developer documentation page for the gpt-6-luna model, showing the model heading with compare and playground controls, the reasoning, speed and price tiles, the '$0.1 - $0.5' price range, text and image input with text output, a 1,050,000-token context window, a 128,000-token maximum output, a May 18 2026 knowledge cutoff, the note that reasoning.effort supports none, low, medium (default), high, xhigh and max, and the note that Chat Completions supports function calling only with reasoning effort set to none.

Jev, Laya und das Framing um „System eins“

Die Decisions API kam nicht in ein leeres Feld. TypeSafe AIs Jev, am 15. September 2026 von Diogo Almeida eingeführt und seit dem 21. September allgemein verfügbar, ist das Modell, das diese Kategorie für Entwickler lesbar machte: Es generiert überhaupt keinen Text, sondern gibt stattdessen typisierte Antworten mit Konfidenzwerten zurück, bei 0,042 $ pro Million Eingabe-Tokens, wobei die Ausgabe mit null abgerechnet wird. Der erste unabhängige Test von Jev, durchgeführt von Every, verarbeitete 777 Urteile über 37 Dokumente in unter 0,7 Sekunden für ungefähr einen Viertelcent, und ein zweiter Test maß es mit einem Median von 0,35 Sekunden pro Passage gegenüber 8,83 Sekunden für Claude Fable 5.1 bei hohem Aufwand — etwa 25-mal schneller bei ungefähr 1/580 der Kosten, wobei es sechs von sieben absichtlich platzierten Defekten erkannte, während Fable 5 alle sieben erkannte. „Gut, aber nicht perfekt“ war das Urteil von Every, und das ist die richtige Ein-Satz-Lesart. Laya ist der dritte Teilnehmer in derselben Form, ein Entscheidungsmodell, das antwortet, ohne ein Token zu schreiben.

Ob OpenAI die Decisions API wegen Jev gebaut hat, ist Spekulation. The New Stack, das am Starttag darüber berichtete, nannte eine Reaktion auf TypeSafe „wahrscheinlich“ und merkte an, dass OpenAI die Ankündigung vermutlich vor dem DevDay vorgezogen hat; OpenAI hat nichts dergleichen gesagt, und der Zeitpunkt – Jevs allgemeine Verfügbarkeit am 21. September, der DevDay am 29. September – ist vielsagend, aber kein Beweis. Was nicht Spekulation ist: Die beiden sind noch nicht auf der Achse vergleichbar, die für Käufer zählt. Jev veröffentlicht einen Preis, eine Pro-Aufruf-Struktur und ein GA-Datum. Die Decisions API veröffentlicht keines dieser drei.

Wo es läuft und was daneben warmgehalten werden sollte

Die Decisions API ist OpenAIs eigenes Packaging. Sie ist kein Modell in unserem Katalog, und wir leiten sie nicht weiter – wenn Sie also genau diesen Endpunkt möchten, dann ist OpenAI der Ort, an dem er lebt. Das Modell, auf dem sie aufbaut, ist eine andere Sache: GPT-6 Luna ist eine Live-Route auf OrcaRouter zu OpenAIs Listenpreis, ohne dass ein Aufschlag weitergegeben wird – 0,10 $ Input und 0,50 $ Output pro Million Token, wobei die >272K-Stufe mit 0,20 $/0,75 $ geführt wird – und in den sieben Tagen bis zum 30. September hat sie 3,23 Milliarden Token über uns bei einer Fehlerquote von 0,18 % bedient.

Das ist entscheidend dafür, wie du eine Preview absicherst. Der vernünftige Weg, einen Endpoint für eingeschränkte Entscheidungen zu testen, besteht darin, den promptbasierten Pfad als Fallback warmzuhalten, denn eine Preview kann Limits oder Preise ohne Vorankündigung ändern, und eine Entscheidung auf einem kritischen Pfad braucht einen Ausweichweg. Diesen Fallback unter demselben Schlüssel wie deine anderen Modelle zu betreiben bedeutet keinen zweiten Vertrag und keine Codeänderung am Fallback-Pfad: eine API für über 200 Modelle, mit automatischem Failover über Anbieter hinweg, wenn einer wackelt. Und wenn deine Entscheidung ein Schritt einer längeren Kette ist, fügt die Routing-DSL Modelle zu einem einzigen Aufruf zusammen – genau das Orchestrator-plus-Decider-Muster, das die Jev-Berichterstattung populär gemacht hat: ein größeres Modell plant, ein kleines Modell wählt jeden Schritt. Dieses Muster lässt sich heute aus Modellen konstruieren, die wir anbieten; die Decisions API selbst stünde außerhalb davon, bis OpenAI sie öffnet.

Wer sollte umziehen, und wer sollte warten

Wenn Ihr Problem eine Klassifizierungs- oder Routing-Aufgabe mit hohem Volumen ist, bei der ein falscher Zweig billig und umkehrbar ist, ist die Vorschau diese Woche eine Anfrageform und ein gelabeltes Set wert – die Fähigkeit ist real, die Einschränkung ist eine echte Verbesserung gegenüber dem Parsen von Prosa, und eine Vorschau ist der günstigste mögliche Zeitpunkt, um herauszufinden, wo ihre Fehlerkosten landen. Wenn Ihre Entscheidung Geld freigibt, einem Kunden eine Nachricht sendet oder zwischen einem Nutzer und einer Zahlung steht, ändert nichts an dieser Woche an Ihrem Kalkül: Es gibt keinen veröffentlichten Preis, den man modellieren könnte, kein veröffentlichtes Limit, um das man herum planen könnte, keine SLA und kein Wort dazu, ob Sie das Ganze mit Ihren eigenen Daten abstimmen können. Diese vier Leerstellen sind es, die ein „breiter Rollout“ füllen muss, und solange OpenAI sie nicht benennt, ist die ehrliche Lesart der Decisions API eine vielversprechende Schnittstelle mit einer schnellen, vom Anbieter angegebenen Zeitvorgabe und ohne beigefügte Rechnung.

OrcaRouter's model page for openai/gpt-6-luna, showing the model name and OpenAI attribution dated 2026-09-22, capability pills for vision, tools, JSON and reasoning, the description of GPT-6 Luna as the fast cost-efficient model below GPT-6 Sol, the /v1/chat/completions route, a $0.10 input and $0.50 output rate per million tokens with a 699 ms p50 time to first token, a 1M-token context with 128K maximum output, and 3234.7M tokens of traffic.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert