Carte de titre principale portant la mention « OpenAI's Decisions API », avec le sous-titre « GPT-6 Luna arrête de discuter et choisit une seule réponse », accompagnée de trois cartes arrondies indiquant « Une seule réponse issue d'une liste que vous définissez », « ~150 ms selon le fournisseur » et « Aucun prix publié pour l'instant », un pied de page indiquant « Chiffres OpenAI déclarés par le fournisseur ; pas encore de mesure indépendante. », et le logo OrcaRouter intégré dans le coin inférieur droit.
Guides & Insights

L'API Decisions d'OpenAI : GPT-6 Luna arrête de discuter et choisit une seule réponse

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

GPT-6 Luna a été lancé le 22 septembre 2026 comme l'échelon le moins cher de l'échelle GPT-6 d'OpenAI. Ce qui est nouveau le 29 septembre, c'est une tâche pour lui qui n'a rien à voir avec la conversation. L'API Decisions d'OpenAI prend une question que vous avez écrite, une liste finie de réponses que vous autorisez, et un élément de contexte — du texte ou une image — et renvoie l'une de ces réponses. Pas de la prose. Pas un paragraphe à décortiquer en espérant tomber juste. Un seul choix, de sorte qu'un ticket d'assistance soit dirigé vers l'une de cinq files d'attente, qu'une image atterrisse dans une catégorie de modération, ou qu'un agent choisisse sa prochaine action dans une politique que vous avez définie. Elle a été annoncée à DevDay 2026 et elle est actuellement en aperçu limité, OpenAI indiquant qu'une sortie généralisée est prévue dans les prochains jours.

La plupart de ce dont une équipe a besoin avant de bâtir là-dessus n'est pas encore publié. Il n'y a pas de prix par appel, aucune limite annoncée sur le nombre de réponses candidates qu'une requête peut transporter, aucune déclaration indiquant si vous pouvez l'affiner sur vos propres données et — au 30 septembre — aucune entrée à son sujet, où que ce soit, dans l'index de la documentation développeur, le journal des modifications ou la référence API d'OpenAI. Nous avons vérifié les trois. La fonctionnalité n'existe actuellement que dans le récapitulatif du DevDay d'OpenAI et dans ce qu'un porte-parole d'OpenAI a déclaré aux journalistes le jour du lancement. Le reste de cet article maintient donc trois niveaux visiblement distincts : ce qu'OpenAI a confirmé, ce qu'affirme une mesure faite le jour du lancement, et ce que personne ne peut encore savoir.

Ce qu’est réellement une décision contrainte

Deux approches existantes s’acquittent mal de cette tâche, et l’API Decisions vise précisément l’écart entre elles. La première consiste à solliciter un modèle de chat : vous rédigez une instruction soignée lui demandant de choisir dans une liste, il vous écrit une phrase et, si vous avez de la chance, vous pouvez extraire les probabilités des tokens de la réponse pour obtenir quelque chose qui ressemble à un score de confiance. Ça fonctionne, ça consomme des tokens, et le chiffre de confiance est une estimation grossière. La seconde consiste à entraîner un petit classifieur : rapide, peu coûteux, mais il nécessite des données étiquetées ainsi qu’un nouvel entraînement chaque fois que l’ensemble des étiquettes change.

Un modèle de décision se situe entre les deux. Il accepte de nouvelles étiquettes dans le prompt — de la même manière qu'un prompt — mais renvoie un score ou un choix sur lequel un développeur peut bifurquer sans avoir à l'analyser, ce qui est la propriété qu'avait un classifieur et qu'un modèle de chat n'a jamais eue. OpenAI n'est pas étranger à ce format : son API Moderation renvoie des scores par catégorie plutôt que du texte depuis des années, avec une différence qui compte ici. Les catégories de Moderation sont celles d'OpenAI. Les catégories de l'API Decisions sont les vôtres.

La contrainte est le produit, et il vaut la peine d'être précis sur ce qu'elle apporte et ce qu'elle n'apporte pas. Un espace de sortie fini signifie que chaque valeur autorisée est connue à l'avance, de sorte que votre application peut rejeter une réponse qu'elle n'a pas définie, attacher un niveau d'autorisation différent à chaque branche, et se rabattre sur un humain lorsque la confiance ou le contexte est faible. Cela rend également l'évaluation hors ligne réalisable, car chaque cas de test a une classe cible et un coût mesurable en cas d'erreur. Ce qu'elle n'apporte pas, c'est l'exactitude. Un modèle contraint peut encore sélectionner la mauvaise réponse valide, être guidé par un contexte trompeur, ou hériter du biais des catégories que vous avez écrites.

L'affirmation des 150 millisecondes, et le chiffre qu'OpenAI n'a pas publié

OpenAI affirme que l’API Decisions prend des décisions environ dix fois plus vite que GPT-6 Luna ne le fait via l’API standard — de l’ordre de 150 millisecondes contre environ 1,3 seconde. Ce chiffre est avancé par le fournisseur et n’a pas été reproduit ; il n’existe aucune mesure indépendante de celui-ci dans les deux semaines qui ont suivi le lancement, et le propre récapitulatif d’OpenAI ne dit que « prise de décision en temps réel ». Aucune distribution de latence, aucune région, aucune taille d’entrée, aucun niveau de concurrence et aucun accord de niveau de service n’accompagne ce chiffre.

Nos propres données de trafic ne remplacent pas ce test, mais elles expliquent pourquoi la distribution manquante compte. Sur les sept jours jusqu'au 30 septembre, GPT-6 Luna, servi via la route normale de chat-completions d'OrcaRouter, affiche une médiane de 699 millisecondes et un p95 de 7,6 secondes sur 3,23 milliards de tokens d'une charge de travail mixte — un écart de plus d'un ordre de grandeur entre le milieu et la queue. C'est une forme de requête différente de celle d'une décision contrainte, donc ce n'est pas une comparaison avec l'affirmation de 150 ms. C'est la raison pour laquelle un unique p50 mis en avant est le mauvais chiffre pour concevoir une échéance. Si vous testez l'aperçu, enregistrez séparément la médiane, le p95 et le p99 pour les entrées texte et image, incluez le temps réseau et les réessais, et mesurez l'échéance réelle de votre produit — une décision de routage pour une file d'attente asynchrone et une décision qui se situe entre un clic et un paiement ne partagent pas le même budget de latence.

A single-column scoreboard titled 'GPT-6 Luna and the Decisions API - the scoreboard' with six rows: Decisions API price 'not published', candidate-answer limit 'not published', fine-tuning on your data 'no statement', stated decision latency '~150 ms vendor-reported', GPT-6 Luna input / output '$0.10 / $0.50 per 1M', and AA Intelligence Index at max effort '37.3', with a footer reading 'OpenAI figures vendor-reported; Index per Artificial Analysis; unpublished means blank, not zero.' and the OrcaRouter logo composited in the bottom-right corner.

Tarification : ce que coûte le modèle sous-jacent, et pourquoi ce n'est pas le prix de l'API

OpenAI n'a publié aucun tarif pour la Decisions API. Il n'est pas non plus prudent de supposer que les tarifs des tokens Luna s'appliquent, car la Decisions API relève de son propre packaging — un point de terminaison différent, avec des limites différentes — et OpenAI a déclaré qu'il communiquerait davantage de détails « lors du déploiement à grande échelle ». Quiconque vous cite aujourd'hui un coût par décision ne fait que l'inférer.

Ce qui est publié, c’est la grille tarifaire du modèle sur lequel il est construit, lue sur la page de tarification d’OpenAI le 30 septembre 2026 :

• Entrée — 0,10 $ par million de tokens, qui passe à 0,20 $ au-delà de 272 000 tokens d'entrée
• Sortie — 0,50 $ par million de tokens, qui passe à 0,75 $ au-delà de 272 000 tokens d'entrée
• Entrée mise en cache — 0,01 $ par million de tokens ; les écritures de cache sont facturées à 0,125 $, soit une majoration de 25 % par rapport au tarif non mis en cache
• Traitement Batch et Flex — 50 % des tarifs standard ; mode Fast — 2x les tarifs applicables

La limite de contexte long est celle qui prend les gens au dépourvu, et elle fonctionne exactement de la même manière dans toute la famille GPT-6 : franchir 272 000 jetons d'entrée refacture l'ensemble de la requête au tarif supérieur, et pas seulement le dépassement. Une API de décision qui confie un long document ou un vaste ensemble d'images au modèle est précisément le type d'appel susceptible de franchir cette limite, ce qui est une raison de plus pour laquelle les limites non publiées de l'aperçu laissent la question en suspens.

GPT-6 Luna à ses propres conditions

Si l'on fait abstraction de l'API, le modèle sous-jacent est un modèle de raisonnement au bas d'une famille à trois échelons — sous GPT-6 Sol à 2,00 $/10,00 $ et le modèle phare GPT-6 Astra à 10,00 $/50,00 $ — avec une fenêtre de contexte de 1 050 000 tokens, un plafond de sortie de 128 000 tokens, une date de coupure des connaissances au 18 mai 2026, et un effort de raisonnement réglable sur six valeurs allant de none à max. Il accepte du texte et des images en entrée et renvoie du texte, et dans la documentation développeur d'OpenAI, la valeur par défaut de l'effort est medium. Une mise en garde pratique issue de cette même page, sans rapport avec l'API Decisions mais pertinente si vous intégrez Luna comme solution de repli : dans Chat Completions, l'appel de fonctions ne fonctionne que lorsque l'effort de raisonnement est réglé sur none. Les outils avec tout autre réglage d'effort nécessitent l'API Responses.

Sur la qualité, le chiffre indépendant est l’Intelligence Index d’Artificial Analysis : 37,3 pour Luna en effort maximal, contre 47,5 pour GPT-6 Sol — un écart d’environ dix points, ce qui est la façon honnête de lire l’écart de prix de vingt fois en entrée. Aucun de ces chiffres ne constitue une affirmation sur l’API Decisions, dont la tâche contrainte est une mesure entièrement différente et ne dispose d’aucun score publié.

OpenAI's developer documentation page for the gpt-6-luna model, showing the model heading with compare and playground controls, the reasoning, speed and price tiles, the '$0.1 - $0.5' price range, text and image input with text output, a 1,050,000-token context window, a 128,000-token maximum output, a May 18 2026 knowledge cutoff, the note that reasoning.effort supports none, low, medium (default), high, xhigh and max, and the note that Chat Completions supports function calling only with reasoning effort set to none.

Jev, Laya et le cadrage du « système un »

L'API Decisions n'est pas arrivée dans un champ vide. Le produit de TypeSafe AI, Jev, lancé le 15 septembre 2026 par Diogo Almeida et disponible en version générale depuis le 21 septembre, est le modèle qui a rendu cette catégorie lisible pour les développeurs : il ne génère aucun texte, renvoyant à la place des réponses typées assorties de valeurs de confiance, à 0,042 $ par million de tokens d'entrée, la sortie étant facturée à zéro. Le premier test indépendant de Jev, mené par Every, a traité 777 jugements répartis sur 37 documents en moins de 0,7 seconde pour environ un quart de cent, et un second test l'a chronométré à une médiane de 0,35 seconde par passage, contre 8,83 secondes pour Claude Fable 5.1 à effort élevé — environ 25 fois plus rapide pour à peu près 1/580e du coût, tout en détectant six des sept défauts délibérément insérés, là où Fable 5 les a détectés tous les sept. « Bon mais pas parfait » a été le verdict d'Every, et c'est la bonne lecture en une phrase. Laya est le troisième acteur de la même forme, un modèle de décision qui répond sans écrire un seul token.

Que OpenAI ait construit l’API Decisions à cause de Jev relève de la spéculation. The New Stack, qui en a fait le rapport le jour du lancement, a jugé « probable » une réaction à TypeSafe et a noté qu’OpenAI avait probablement précipité l’annonce avant le DevDay ; OpenAI n’a rien dit de tel, et le calendrier — la disponibilité générale de Jev le 21 septembre, le DevDay le 29 septembre — est évocateur, mais pas une preuve. Ce qui n’est pas de la spéculation, c’est que les deux ne sont pas encore comparables sur l’axe qui importe aux acheteurs. Jev publie un prix, une structure par appel et une date de disponibilité générale. L’API Decisions ne publie aucune de ces trois informations.

Où il s’exécute, et ce qu’il faut garder au chaud à côté de lui

L'API Decisions est le packaging propre d'OpenAI. Ce n'est pas un modèle de notre catalogue et nous ne le routons pas, donc si vous voulez ce point de terminaison spécifique, c'est OpenAI qui l'héberge. Le modèle sur lequel il est construit est une autre histoire : GPT-6 Luna est une route active sur OrcaRouter au prix catalogue d'OpenAI avec zéro marge appliquée — 0,10 $ en entrée et 0,50 $ en sortie par million de tokens, avec le palier >272K facturé à 0,20 $/0,75 $ — et sur les sept jours jusqu'au 30 septembre, elle a servi 3,23 milliards de tokens via nous avec un taux d'erreur de 0,18 %.

C'est important pour la façon dont vous réduisez les risques d'une preview. La façon raisonnable de tester un endpoint de décision contrainte est de garder au chaud le chemin basé sur les prompts comme solution de repli, car une preview peut modifier les limites ou les tarifs sans préavis, et une décision qui se trouve sur un chemin critique doit pouvoir se rabattre ailleurs. Garder ce repli sur la même clé que vos autres modèles, c'est éviter un second contrat et toute modification de code sur le chemin de repli : une seule API pour plus de 200 modèles, avec basculement automatique entre fournisseurs quand l'un d'eux vacille. Et si votre décision n'est qu'une étape d'une chaîne plus longue, le DSL de routage compose les modèles en un seul appel, ce qui correspond exactement au schéma orchestrateur + décideur popularisé par la couverture de Jev — un grand modèle qui planifie, un petit modèle qui choisit chaque étape. Ce schéma est aujourd'hui constructible à partir des modèles que nous servons ; l'API Decisions elle-même resterait en dehors jusqu'à ce qu'OpenAI l'ouvre.

Qui doit bouger, et qui doit attendre

Si votre problème est une tâche de classification ou de routage à fort volume, où une mauvaise branche coûte peu et est réversible, l’aperçu vaut qu’on lui consacre une forme de requête et un jeu de données étiqueté cette semaine — la capacité est réelle, la contrainte est une véritable amélioration par rapport à l’analyse de prose, et un aperçu est le moment le moins coûteux possible pour découvrir où se situent les coûts de ses erreurs. Si votre décision engage des fonds, envoie un message à un client, ou se situe entre un utilisateur et un paiement, rien de ce qui se passe cette semaine ne change votre calcul : il n’y a pas de prix publié à modéliser, pas de limite publiée autour de laquelle concevoir, pas de SLA, et aucune indication sur la possibilité de régler l’outil sur vos propres données. Ces quatre blancs sont ce que le « déploiement généralisé » doit combler, et tant qu’OpenAI ne les nomme pas, la lecture honnête de l’API Decisions est celle d’une interface prometteuse avec une échéance rapide annoncée par le fournisseur et aucune facture attachée.

OrcaRouter's model page for openai/gpt-6-luna, showing the model name and OpenAI attribution dated 2026-09-22, capability pills for vision, tools, JSON and reasoning, the description of GPT-6 Luna as the fast cost-efficient model below GPT-6 Sol, the /v1/chat/completions route, a $0.10 input and $0.50 output rate per million tokens with a 699 ms p50 time to first token, a 1M-token context with 128K maximum output, and 3234.7M tokens of traffic.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement