
Wo die Decisions API von OpenAI endet und Jev beginnt: Was der erste externe Kunde zeigt
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 145 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 296 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Am 6. Oktober 2026 um 23:05 UTC erschien auf PyPI ein Plugin namens llm-openai-decisions, und die eigene README enthält den Satz, den die Launch-Berichterstattung nie abdruckte: „Anders als Jev unterstützt das neue gpt-6-luna-Entscheidungsmodell zusätzlich zu Text auch Bildeingaben.“ Der Autor ist Simon Willison, der auch den ersten Client für TypeSafes Entscheidungsmodell geschrieben hat, und der Vergleich, den er zieht, ist der zwischen GPT-6 Luna – dem Modell hinter OpenAIs Decisions API – und Jev 1.13, TypeSafes rein textbasiertem System-One-Modell. Derselbe Blogbeitrag merkt an, dass das Plugin selbst von GPT-6 Astra beim Lesen von OpenAIs Dokumentation geschrieben wurde.
Das Nützliche daran, dass ein Client eine Woche nach einer API ausgeliefert wird, ist: Er ist gegen die Form der Anfrage geschrieben, nicht gegen die Keynote, und legt so die Unterschiede offen, die Marketingtexte glätten. Nichts hier ist ein Leak und nichts hier ist unbestätigt — jede Zahl unten stammt von einer Seite, die von OpenAI, TypeSafe oder dem Repository des Plugins selbst veröffentlicht wurde, alle gelesen am 2026-10-07. Was weiterhin fehlt, ist eine unabhängige Messung des Endpunkts selbst, und diese Lücke wird am Ende benannt statt übertüncht.
Die drei Oberflächen, auseinandergehalten
Zunächst einmal muss man sich klarmachen, dass es sich hier um drei verschiedene Ebenen handelt, und die Berichterstattung in den Medien verwischt sie.
• Die Endpunkte.Der von OpenAI ist POST /v1/decisions, eine dedizierte Route statt eines Modus der Responses-API. Der von TypeSafe ist POST /v1/systemone. Beide nehmen eine Belegsammlung plus eine Liste typisierter Fragen entgegen und geben pro Frage eine Antwort zurück, mit dem Namen, den Sie ihr gegeben haben, als Schlüssel.
• Die Modelle. Die Decisions API akzeptiert heute genau ein Modell, gpt-6-luna, das zugleich die günstige Stufe der allgemeinen GPT-6-Reihe von OpenAI ist und am 22.09.2026 als gewöhnliches Text- und Bildmodell veröffentlicht wurde. Jev 1.13 ist durch und durch ein Entscheidungsmodell – es kann überhaupt keinen Freitext ausgeben. TypeSafe veröffentlichte es am 15.09.2026 und es ist seit dem 21.09.2026 allgemein verfügbar.
• Die Clients.Die SDKs von OpenAI unterstützen den Endpunkt seit er am 6. Oktober 2026 in die öffentliche Beta ging, daher ist das Plugin nicht die erste Möglichkeit, ihn aufzurufen. Es ist der erste Client außerhalb von OpenAIs SDK, den wir verifizieren konnten, und der erste, der für ein Kommandozeilen-Tool statt für eine Anwendungsbibliothek geschrieben wurde.
Die beiden Meter, Seite an Seite
Hier ist das README des Kunden mehr wert als die Ankündigung, denn die Zahlen stehen direkt neben dem Wortlaut.
• Preis — die Decisions API berechnet 0,10 $ pro Million Eingabe-Tokens, ohne Ausgabegebühr, ohne Cache-Lesegebühr und ohne Cache-Schreibgebühr. Jev 1.13 berechnet 0,042 $ pro Million Eingabe-Tokens, die Ausgabe ist kostenlos. Beide berechnen, was man sendet, und nichts für das, was zurückkommt, daher kostet eine Entscheidung bei beiden Preisen einen Bruchteil eines Cents, und der Unterschied zwischen ihnen ist ein Faktor von 2,4, kein anderes Abrechnungsmodell.
• Eingabe — die Decisions API akzeptiert Text oder Benutzernachrichten, die Text mit Bildern mischen, und die README des Plugins gibt an, dass PNG-, JPEG-, WebP- und GIF-Anhänge mit höchstens 128 Bildern pro Anfrage unterstützt werden. Bilder müssen als Inline-Base64-Daten-URLs übergeben werden; gehostete HTTP- oder HTTPS-Bild-URLs und file_id Eingaben werden vom Endpunkt nicht akzeptiert, daher konvertiert das Plugin eine URL oder einen lokalen Pfad, bevor es sie sendet. Die Dokumentation von Jev 1.13 ist in der anderen Richtung unverblümt: „Keine Bild-, Audio- oder Videoeingabe“, und Nicht-Text-Eingaben sollten in Text oder strukturierte Felder vorverarbeitet werden, bevor sie den Zustand erreichen.
• Fragetypen — OpenAI dokumentiert drei: predicate (eine Wahrscheinlichkeit von 0 bis 1, dass eine angegebene Bedingung zutrifft), choice (ein Wert aus Ihrer Liste, plus eine Verteilung und ein separates Konfidenzfeld) und score (ein wahrscheinlichkeitsgewichteter Durchschnitt über geordnete Stufen). TypeSafes drei sind dieselben drei Ideen unter anderen Namen: noul für Ja/Nein, choice und score. „Noul“ ist die Kurzform für Bernoulli, und der Name ist ein fairer Hinweis auf den kulturellen Unterschied — ein Anbieter liefert ein Substantiv in einfachem Englisch, der andere einen Statistikwitz.
• Score-Arithmetik — die beiden stimmen exakt überein, was das stärkste Anzeichen dafür ist, dass es sich um eine einzige Produktkategorie und nicht um zwei handelt. OpenAIs Dokumentation führt drei Schweregraden Wahrscheinlichkeiten von 0,1, 0,7 und 0,2 zu und bekommt einen Score von 1,1 zurück — bewusst zwischen zwei Stufen liegend, statt zur nächstgelegenen Stufe zu springen. Die Stufen von TypeSafe sind auf dieselbe Weise nullindiziert, und das Plugin für Jev akzeptiert zwischen zwei und zehn geordnete Stufen. Die Seite von OpenAI nennt keine Obergrenze; das ist eine Lücke in ihrer Dokumentation, keine Grenze, die wir behaupten können.
• Budgets — Jev dokumentiert sein Fenster präzise: rund 64.000 Token pro Anfrage, etwa 32.000 davon entfallen auf den Zustand plus die längste einzelne Frage, gegenüber dem 1.050.000-Token-Kontext, den unser eigener Katalog für GPT-6 Luna als allgemeines Modell führt. OpenAIs Entscheidungsseite veröffentlicht überhaupt kein Token-Budget, nur den Hinweis, dass regionale Verarbeitungsaufschläge und Multiplikatoren für Langkontext-Eingaben weiterhin auf den Tarif angewendet werden.
Was der Kunde verrät, was die Ankündigung nicht verriet.
Drei Details im Plugin und in seiner README lohnen es, hervorgehoben zu werden, denn jedes einzelne verändert, wie man den Endpoint anbindet.
Das Erste ist, dass eine Entscheidung als Ablehnung zurückkommen kann. OpenAIs Dokumentation erklärt dies nie in Prosa, aber jedes SDK-Beispiel verzweigt darauf — answer.type === "refusal" in JavaScript, einen OpenAI::Models::Decision::Answer::Refusal Fall in Ruby — und die README des Plugins führt aus, dass eine abgelehnte Frage als {"name":"...","type":"refusal"} erhalten bleibt. Der Antworttyp hat also effektiv vier Werte, nicht drei, und jede Produktionsschleife muss einen vierten Zweig behandeln, den keine Ankündigung erwähnt hat.
Das Zweite ist das, was im Plugin fehlt, statt darin vorhanden zu sein. Willisons eigener Beitrag stellt die Arbeit so dar, dass GPT-6 Astra die neue Dokumentation liest und daraus den Client baut – von der Dokumentation zum Client, in einem Durchgang, ohne menschliches Tutorial. Das ist inzwischen eine normale Art und Weise, wie ein Client geschrieben wird, und es bedeutet, dass die Frage, ob die Dokumentation eines Endpunkts vollständig genug ist, um daraus einen funktionierenden Client zu generieren, zu einer praktischen statt einer redaktionellen Frage geworden ist. Für diesen Endpunkt lautet die Antwort größtenteils ja, wobei der Refusal-Typ die sichtbare Nahtstelle bildet.
Das Dritte ist die Form des Fragen-Arrays. OpenAI ermöglicht es, unabhängige Fragen in einer Anfrage bei gemeinsamer Eingabe zu stellen – ein Produktfoto auf Schäden prüfen und seine Kategorie im selben Aufruf klassifizieren –, verlangt aber getrennte Anfragen, wenn eine spätere Frage von einer früheren Antwort abhängt. Jev vertritt dieselbe Position aus demselben Grund: Seine Fragen werden parallel gegen einen Zustand ausgewertet, also muss alles Sequenzielle zu zwei Aufrufen werden. Beide Anbieter sind auf Fan-out ausgelegt, und beide sagen Ihnen dasselbe darüber, wohin das Latenzbudget fließt.
Die Kategorie hat jetzt drei Vertreter, und zwei davon sind keine allgemeinen Modelle.
Es lohnt sich, den dritten zu nennen, denn das Decision-Endpoint-Raster ergibt nur Sinn, wenn alle drei im Blick sind. Perplexity liefert eine eigene Decisions API aus, die von pplx-decider-v1-27b bedient wird – ein Entscheidungsmodell mit 27 Milliarden Parametern, das am 01.10.2026 unter Apache 2.0 mit Gewichten auf Hugging Face veröffentlicht wurde. Dadurch erhält die Kategorie eine deutlich andere Prägung als bei OpenAI: Jev 1.13 ist geschlossen und nur für Text, Perplexitys Decider hat offene Gewichte und akzeptiert Bilder, und GPT-6 Lunas Beitrag ist ein Rahmenwerk um ein allgemeines Modell statt eines Modells, das zum Entscheiden gebaut wurde.
Für einen Leser, der heute wählt, ist der praktische Unterschied geringer, als das Marketing vermuten lässt. Wenn es sich bei Ihrem Beleg um einen Satz oder einen Datensatz handelt und Sie die niedrigsten Kosten pro Aufruf bei der geringsten Varianz im Verhalten möchten, ist Jev 1.13 der Spezialist, und sein Preis von $0,042 ist der niedrigste der drei veröffentlichten Preise, die wir verifizieren konnten. Wenn Ihr Beleg ein Foto enthält oder Sie eine Entscheidung von einem Modell wünschen, das Sie bereits aus alltäglichen Aufgaben kennen, ist die Decisions API die einzige der beiden geschlossenen Optionen, die Bilder akzeptiert. Die Open-Weight-Option beantwortet eine andere Frage — Kontrolle und Self-Hosting — und wir haben sie nicht getestet.
Was wir tatsächlich messen können – und was niemand hat
Die Behauptung von OpenAI für den Endpoint lautet, dass er „Text, Bilder oder beides auswertet und typisierte Antworten etwa 10-mal schneller als die Responses API zurückgibt.“ Das ist vom Anbieter angegeben und nicht reproduziert: keine Region, keine Eingabegröße, keine Parallelitätsstufe, kein Service-Level-Agreement, und die Vergleichsbasis ist die Responses API im Allgemeinen statt einer bestimmten Workload. Eine einzelne Beschleunigungszahl ist der falsche Wert, um darauf eine Deadline zu stützen.
Was wir daneben stellen können, ist unser eigenes siebentägiges Serving-Fenster, das am 2026-10-07 endet, für die beiden darunterliegenden Modelle, aus unserem Playground-Traffic — und es ist wichtig zu sagen, was diese Zahlen nicht sind. Sie beschreiben gewöhnliche Generierungsanfragen, keine Entscheidungen.
• GPT-6 Luna, alle Anfrageformen: ein Median von 1.448 ms und ein p95 von 4.912 ms, eine Fehlerrate von 1,31 % über 643.394.111 Token in sieben Tagen – so sieht ein Durchsatz von etwa 125 Ausgabe-Tokens pro Sekunde aus, wenn das Modell schreibt.
• Jev 1.13: ein Median von 149 ms und ein p95 von 245 ms, eine Fehlerrate von 0,10 % bei 110.193.080 Tokens. Das ist ein wirklich schneller Endpunkt, und er ist schnell, weil er keine Antwort generiert — er gibt Zahlen für einen Zustand zurück, der einmalig eingelesen wird.
Liest man diese beiden Zeilen gegeneinander, sind sie eine Warnung, kein Vergleich. Eine Decision-Anfrage erzeugt eine Handvoll Tokens, daher ist auf der Decisions API die Ausgabedurchsatz-Kennzahl, die Lunas allgemeines Profil dominiert, nicht mehr die bindende Einschränkung, und die Zahl, auf die es nun ankommt, ist, wie lange das Modell braucht, um die Evidenz zu lesen. Wir haben das am Decisions-Endpunkt nicht gemessen, und soweit wir das beurteilen können, hat das niemand außerhalb von OpenAI veröffentlicht.
Die tiefer liegende, ungemessene Frage ist die Kalibrierung, und sie entscheidet, ob irgendetwas davon brauchbar ist. Eine Wahrscheinlichkeit von 0,92 für sichtbare Schäden ist nur dann als Grundlage für Routing etwas wert, wenn über Ihren Datenverkehr hinweg die Fotos, die nahe 0,92 bewertet wurden, in etwa 92 % der Fälle beschädigt sind. OpenAIs Dokumentation rät Ihnen, Schwellenwerte anhand gelabelter Beispiele festzulegen und sie nach den Kosten von Falsch-Positiven gegenüber Falsch-Negativen zu wählen. Das ist ein korrekter Ratschlag, und es ist zugleich ein Eingeständnis, dass die Kalibrierung dieser Zahlen etwas ist, das Sie selbst ermitteln müssen. Messen Sie für einen ersten Durchgang die Verteilung der zurückgegebenen Wahrscheinlichkeiten anhand einer Stichprobe, deren Antworten Sie bereits kennen. Wenn alles mit 0,99 oder 0,01 zurückkommt, leistet der Schwellenwert keine Arbeit und der Endpunkt ist ein sehr teurer boolescher Wert.
Wie man eines von beiden ausprobiert, ohne dafür einen Produktionspfad aufs Spiel zu setzen
Zur Quellenlage, ganz offen: Der Endpunkt-Vertrag, der Preis und die Bildregeln in diesem Beitrag stammen aus OpenAIs eigener Decisions-API-Dokumentation und dem README des Plugins, beide gelesen am 2026-10-07; die Jev-1.13-Spezifikation stammt aus TypeSafes eigener Modelldokumentation; die Serving-Zahlen sind unsere eigenen Playground-Daten aus dem Sieben-Tage-Zeitraum bis zum 2026-10-07; die Paket-Zeitstempel stammen von PyPI und aus der Git-Historie des Projekts. Die 10x-Geschwindigkeitsbehauptung stammt von OpenAI und ist als solche gekennzeichnet. Die Lizenz und das Veröffentlichungsdatum des Open-Weight-Deciders stammen aus seinem Modell-Repository.
Die Decisions API selbst ist OpenAIs eigenes Packaging, und wir routen sie nicht; wenn du genau diesen Endpoint willst, ist OpenAI der Ort, an dem er zu Hause ist. Die Modelle darunter sind eine andere Sache. GPT-6 Luna ist eine Live-Route auf OrcaRouter zu OpenAIs Listenpreis, ohne durchgereichten Aufschlag, und typesafe/jev-1.13 zum Listenpreis liegt auf demselben Schlüssel, was den Vergleich in diesem Artikel zu etwas macht, das man ausführen statt lesen kann: derselbe Zustand, dieselben Fragen, zwei Endpoints, ein zu verwaltender Vertrag und keine zweite Rechnung.
Das ist auch der vernünftige Weg, eine unbewährte Oberfläche einzuführen. Stellen Sie die Entscheidung hinter einen Fallback, sodass eine Ablehnung, ein Timeout oder ein Beta-Limit, das sich unter Ihren Füßen ändert, in einen promptbasierten Aufruf übergeht statt in einen Ausfall, und behalten Sie diesen Fallback auf demselben Schlüssel wie beim primären, damit nichts umkonfiguriert werden muss, wenn sich der Endpunkt in Richtung allgemeine Verfügbarkeit bewegt. OpenAI sagt, GA werde in den kommenden Wochen erwartet, und dass gpt-6-luna das einzige Modell ist, das in der Zwischenzeit verfügbar ist; beides sind Gründe, gegen diese Form zu entwickeln und sie jetzt zu instrumentieren, und keines von beiden ist ein Grund, schon jetzt eine Zahlungsautorisierung dahinter zu setzen.

Was als Nächstes ansehen
Drei Dinge würden die Fragen klären, die dieser Artikel nicht klären kann. Ein veröffentlichtes Token-Budget für den Entscheidungs-Endpunkt, sodass eine Anfrage dimensioniert statt geraten werden kann. Irgendeine GA-Ankündigung – der Punkt, an dem der Nur-Eingabe-Tarif aufhört, ein Beta-Versprechen zu sein. Und eine unabhängige Messung von Latenz und Kalibrierung am Endpunkt selbst – die erste Person, die ein paar tausend gelabelte Paare durch ihn schickt und die Zuverlässigkeitskurve veröffentlicht, wird mehr für die Kategorie tun, als es einer der beiden Launch-Posts getan hat.
Bis dahin ist die ehrliche Zusammenfassung knapp und nützlich: Wenn es sich bei dem, worüber Sie entscheiden müssen, um Text handelt, ist Jev 1.13 günstiger und liefert in unserem Traffic die Zahlen in etwa 150 Millisekunden zurück. Wenn das, worüber Sie entscheiden müssen, ein Bild enthält, ist die Decisions API von OpenAI diejenige, die es sich ansieht – zum 2,4-Fachen des Eingabepreises, mit einem Beta-Label auf der Verpackung. Beide sind seit dieser Woche von einer Kommandozeile aus aufrufbar, und das ist eine bessere Position, als sie beide vor sieben Tagen hatten.


