ヒーロータイトルカードには「OpenAIのDecisions API」と表示され、サブタイトルは「GPT-6 Lunaはチャットをやめて1つの回答を選ぶ」。3枚の角丸カードには「自分で定義したリストから1つの回答」「ベンダー公称 約150 ms」「価格はまだ未公表」。フッターには「OpenAIの数値はベンダー報告によるもので、独立した測定はまだありません」。右下隅にOrcaRouterのロゴを合成。
Guides & Insights

OpenAIのDecisions API:GPT-6 Luna、チャットをやめて1つの回答を選ぶ

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

GPT-6 Lunaは、OpenAIのGPT-6の階層における低価格な段として、2026年9月22日に登場した。9月29日に新しくなったのは、会話とは何の関係もない、これ向けの仕事だ。OpenAIのDecisions APIは、あなたが書いた質問、あなたが許可する有限の回答リスト、そしてコンテキストの一部——テキストまたは画像——を受け取り、それらの回答のうち1つを返す。散文ではない。解析して望みを託すような段落ではない。単一の選択であり、それによってサポートチケットは5つのキューの1つに送られ、画像は1つのモデレーションカテゴリに分類され、エージェントはあなたが定義したポリシーから次の行動を選ぶ。これはDevDay 2026で発表され、現在は限定プレビュー中で、OpenAIは今後数日以内に広範なリリースを予定していると述べている。

これを基にチームが開発を始める前に必要となる情報の大半は、まだ公開されていません。呼び出しごとの価格も、1回のリクエストが保持できる候補回答の数の上限も、自社データでチューニングできるかどうかの説明もなく、さらに9月30日時点では、OpenAI自身の開発者ドキュメントの索引、変更履歴、APIリファレンスのどこにも、これに関する項目がありません。私たちはその3つすべてを確認しました。この機能は現在、OpenAIのDevDayのまとめと、ローンチ当日にOpenAIの広報担当者が記者に語った内容の中に存在します。そこで本記事の以降では、OpenAIが確認したこと、ローンチ当日の1つの測定結果が主張していること、そしてまだ誰にも分からないことという3つの層を、はっきり分けたまま扱います。

制約された意思決定とは実際に何なのか

既存の2つのアプローチはこの仕事をうまくこなせず、Decisions APIはその間のギャップを埋めることを目指しています。1つ目はチャットモデルにプロンプトを与える方法です。リストから選ぶように丁寧な指示を書き、モデルが文を返し、運が良ければ応答からトークン確率を読み取って信頼スコアらしきものを得られます。これは機能しますが、トークンを消費し、その信頼度の数値は大まかな推測にすぎません。2つ目は小さな分類器をトレーニングする方法です。高速で安価ですが、ラベル付きデータに加えて、ラベルセットが変わるたびに再トレーニングを実行する必要があります。

決定モデルはその中間に位置する。プロンプト内の新しいラベルを受け入れる点ではプロンプトと同じだが、開発者が解析せずに分岐できるスコアや選択肢を返す。これは分類器が持っていてチャットモデルが決して持たなかった特性だ。OpenAIにとってこの形は新しいものではない。そのModeration APIは何年も前からテキストではなくカテゴリごとのスコアを返してきたが、ここで重要な違いが1つある。ModerationのカテゴリはOpenAIのものだ。Decisions APIのカテゴリはあなたのものだ。

制約こそが製品であり、それが何をもたらし、何をもたらさないかについては正確に述べておく価値がある。有限の出力空間とは、許可されたすべての値があらかじめ既知であることを意味する。したがって、アプリケーションは自分が定義していない回答を拒否でき、各分岐に異なる権限レベルを割り当て、確信や文脈が薄い場合には人間にフォールバックできる。また、オフライン評価を扱いやすくする。なぜなら、すべてのテストケースには目標クラスがあり、誤った場合には測定可能なコストがあるからだ。それがもたらさないのは正しさである。制約付きモデルでも、誤った有効回答を選んだり、誤解を招く文脈に誘導されたり、あなたが書いたカテゴリのバイアスを引き継いだりする可能性がある。

150ミリ秒という数字、そしてOpenAIが公表しなかった数字

OpenAIによると、Decisions APIはGPT-6 Lunaが通常のAPIを通じて行うよりも約10倍速く意思決定を行い、その速度は150ミリ秒程度対約1.6秒だという。この数値はベンダーによる主張であり、再現されていない。開始から2日間、それを独立に測定したものはなく、OpenAI自身のまとめも「リアルタイムの意思決定」としか述べていない。この数値には、レイテンシ分布も、リージョンも、入力サイズも、同時実行数も、サービスレベル契約も添えられていない。

私たち自身のトラフィックデータはそのテストの代わりにはならないが、欠けている分布がなぜ重要かを説明してくれる。9月30日までの7日間で、OrcaRouterの通常のchat-completionsルートを通じて配信されたGPT-6 Lunaは、混在ワークロードの32.3億トークンにわたり中央値699ミリ秒、p95が7.6秒を示している — 中央値と裾の間には1桁を超える開きがある。これは制約付きの意思決定とは異なるリクエスト形状なので、150ミリ秒という主張との比較にはならない。単一の見出し的なp50が、期限を設計する基準として誤った数値である理由はここにある。プレビューをテストする場合は、テキスト入力と画像入力について中央値、p95、p99を別々に記録し、ネットワーク時間と再試行を含め、自社製品が実際に持つ期限を測定してください — 非同期キュー向けのルーティング判断と、クリックと支払いの間に位置する判断は、同じレイテンシ予算を共有しません。

A single-column scoreboard titled 'GPT-6 Luna and the Decisions API - the scoreboard' with six rows: Decisions API price 'not published', candidate-answer limit 'not published', fine-tuning on your data 'no statement', stated decision latency '~150 ms vendor-reported', GPT-6 Luna input / output '$0.10 / $0.50 per 1M', and AA Intelligence Index at max effort '37.3', with a footer reading 'OpenAI figures vendor-reported; Index per Artificial Analysis; unpublished means blank, not zero.' and the OrcaRouter logo composited in the bottom-right corner.

料金設定:基盤となるモデルのコストとは何か、そしてそれがAPIの価格ではない理由

OpenAIはDecisions APIについて料金を公表していません。また、Lunaのトークン料金が適用されると想定するのも安全ではありません。なぜなら、Decisions APIはそれ自体が独自のパッケージであり、異なる制限を持つ別のエンドポイントであり、OpenAIは「広範なロールアウト時に」さらに詳細を共有すると述べているからです。今あなたに決定あたりのコストを提示している人は、それを推測しているにすぎません。

公開されているのは、それが基づいて構築されているモデルの料金表であり、2026年9月30日にOpenAIの料金ページから読み取ったものです:

• 入力 — 100万トークンあたり$0.10、入力トークンが272,000を超えると$0.20になります
• 出力 — 100万トークンあたり$0.50、入力トークンが272,000を超えると$0.75になります
• キャッシュ済み入力 — 100万トークンあたり$0.01、キャッシュ書き込みは$0.125で課金され、非キャッシュ料金に対する25%の割増です
• バッチ処理とFlex処理 — 標準料金の50%、Fastモード — 適用料金の2倍

ロングコンテキストの境界線は、多くの人がつまずくところであり、GPT-6 ファミリー全体でも同じように作用する。272,000 入力トークンを超えると、超過分だけでなくリクエスト全体が上位ティアで再価格設定される。長い文書や大量の画像セットをモデルに渡す意思決定 API は、まさにこの境界線を超えうる種類の呼び出しであり、これはプレビュー版の未公開の制限が残しているもう一つの論点だ。

GPT-6 Lunaを独自の基準で

APIを取り除くと、その下にあるモデルは3段階のファミリーの最下位に位置する推論モデルです — $2.00/$10.00 の GPT-6 Sol と、フラッグシップの GPT-6 Astra($10.00/$50.00)の下に当たります — コンテキストウィンドウは 1,050,000 トークン、出力上限は 128,000 トークン、知識カットオフは 2026年5月18日、そして reasoning effort は none から max までの6つの値に設定できます。テキストと画像を入力として受け取りテキストを返し、OpenAI 自身の開発者ドキュメントでは effort のデフォルトは medium です。同じページにある実用的な注意点として、Decisions API とは無関係ですが、Luna をフォールバックとして組み込む場合に関係するものがあります。Chat Completions では、function calling は reasoning effort が none に設定されている場合にのみ機能します。それ以外の effort 設定でのツールには Responses API が必要です。

品質面では、独立系の指標となるのがArtificial AnalysisのIntelligence Indexで、Lunaが最大エフォート時で37.3、GPT-6 Solが47.5だ。その差は約10ポイントであり、これが入力における20倍の価格差を誠実に解釈する方法である。どちらの数値も、Decisions APIについて述べたものではない。その制約されたタスクはまったく別の測定であり、公表されたスコアはない。

OpenAI's developer documentation page for the gpt-6-luna model, showing the model heading with compare and playground controls, the reasoning, speed and price tiles, the '$0.1 - $0.5' price range, text and image input with text output, a 1,050,000-token context window, a 128,000-token maximum output, a May 18 2026 knowledge cutoff, the note that reasoning.effort supports none, low, medium (default), high, xhigh and max, and the note that Chat Completions supports function calling only with reasoning effort set to none.

ジェヴ、ラヤ、そして「システム1」という枠組み

Decisions APIは空白の分野に登場したわけではない。TypeSafe AIのJevは、2026年9月15日にDiogo Almeidaによってローンチされ、9月21日から一般提供されているモデルで、このカテゴリーを開発者にとって読めるものにした存在だ。テキストを一切生成せず、代わりに信頼値付きの型付き回答を返し、価格は入力トークン100万あたり$0.042、出力は課金ゼロ。Jevの最初の独立テストはEveryが実施し、37文書にわたる777件の判定を0.7秒未満、およそ0.25セントで処理した。2回目のテストでは、1パッセージあたりの中央値が0.35秒と計測され、Claude Fable 5.1の高エフォート時の8.83秒と比較された——約25倍高速で、コストはおよそ1/580。一方で、意図的に仕込まれた7つの欠陥のうち6つを検出し、Fable 5は7つすべてを検出した。「優れているが完璧ではない」がEveryの評であり、それは正しい一行の読みだ。Layaは同じ形をした3番目の参入者であり、トークンを1つも書かずに答える意思決定モデルである。

OpenAIがJevの影響でDecisions APIを構築したかどうかは推測にすぎない。The New Stackはローンチ当日の報道で、TypeSafeへの反応を「likely」と評し、OpenAIはおそらくDevDayを前に発表を急いだと指摘したが、OpenAIはそのようなことを一切述べておらず、タイミング——Jevの一般提供が9月21日、DevDayが9月29日——は示唆的ではあるものの、証拠ではない。推測ではないのは、購入者が気にする軸において、両者がまだ比較可能ではないということだ。Jevは価格、呼び出しごとの形式、GA日を公表している。Decisions APIはその三つのいずれも公表していない。

動作する場所と、そのそばで温めておくもの

Decisions APIはOpenAI自身によるパッケージングです。当社のカタログに載るモデルではなく、当社がルーティングする対象でもないため、この特定のエンドポイントを利用したい場合は、OpenAIがその提供元です。それが基盤としているモデルは別の話です。GPT-6 LunaはOrcaRouter上のライブルートで、OpenAIの定価のまま、マークアップを一切上乗せせずに提供されています — 100万トークンあたり入力$0.10、出力$0.50、272K超のティアは$0.20/$0.75 — そして9月30日までの7日間で、当社を通じて32.3億トークンをエラー率0.18%で処理しました。

それは、プレビューのリスクをどう軽減するかに関わってきます。制約付き意思決定エンドポイントを試す賢明な方法は、プロンプトベースの経路をフォールバックとして温存しておくことです。プレビューは予告なく制限や価格を変更することがあり、クリティカルパス上にある意思決定には逃げ道が必要だからです。そのフォールバックを他のモデルと同じキーに載せておけば、2つ目の契約も、フォールバック経路のコード変更も不要です:200以上のモデルに対応する1つのAPI、そして自動フェイルオーバーにより、あるプロバイダーが不安定になったときにプロバイダー間をまたいで切り替えられます。また、あなたの意思決定がより長い連鎖の1ステップであるなら、ルーティングDSLがモデルを1回の呼び出しに組み合わせます。これはまさに、Jevの報道が広めたオーケストレーター+意思決定者パターンです — 大きなモデルが計画し、小さなモデルが各ステップを選択する。このパターンは、当社が提供するモデルで今日構築できます。Decisions API自体は、OpenAIが開放するまでその外側に位置することになります。

誰が動くべきで、誰が待つべきか

あなたの問題が、誤った分岐のコストが安く可逆的であるような大量分類またはルーティングの仕事なら、プレビューは今週、リクエストの形とラベル付きセットを用意して試す価値がある——能力は実在し、その制約は散文を解析するよりも確かな改善であり、プレビューは、そのエラーコストがどこに落ちるかを知るための可能な限り最も安価なタイミングだ。あなたの決定が金銭を承認する、顧客にメッセージを送る、あるいはユーザーと支払いの間に位置するなら、今週のことであなたの判断は何も変わらない。モデル化するための公表価格はなく、設計時に考慮すべき公表された上限もなく、SLAもなく、自社データでこれをチューニングできるかについても何も言及されていない。これら四つの空白こそが「広範な展開」の埋めなければならないものであり、OpenAIがそれらを明示するまでは、Decisions APIについての正直な解釈は、ベンダーが明言する速いスケジュールを備え、請求書が付いていない、有望なインターフェースだ。

OrcaRouter's model page for openai/gpt-6-luna, showing the model name and OpenAI attribution dated 2026-09-22, capability pills for vision, tools, JSON and reasoning, the description of GPT-6 Luna as the fast cost-efficient model below GPT-6 Sol, the /v1/chat/completions route, a $0.10 input and $0.50 output rate per million tokens with a 699 ms p50 time to first token, a 1M-token context with 128K maximum output, and 3234.7M tokens of traffic.

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新