『2つの意思決定モデル、1つの問い』という見出しの生成タイトルカード。 eyebrowは「OPENAI DECISIONS API vs JEV 1.13」、サブタイトルは「2026年10月6日にクライアントが構築したものは、発表では示されなかったことを明らかにする」。右側の3枚のカードには「価格:入力100万あたり $0.10 / $0.042」「入力:テキスト+画像 / テキストのみ」「回答:述語、選択、スコア」と表示されている。フッター行には「エンドポイントの数値は、2026年10月7日時点で参照したOpenAIおよびTypeSafeのドキュメントによる。GPT-6 Lunaは2026年9月22日に出荷」とある。OrcaRouterのロゴは右下隅に合成されている。
Guides & Insights

OpenAIのDecisions APIが終わり、Jevが始まるところ:最初の外部クライアントが示すもの

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026-10-06 23:05 UTC に、llm-openai-decisions というプラグインが PyPI に登場し、その README 自体には、ローンチ報道では決して印刷されなかった一文が含まれている:「Jev と異なり、新しい gpt-6-luna 意思決定モデルはテキストに加えて画像入力をサポートする」。著者は Simon Willison で、彼は TypeSafe の意思決定モデルの最初のクライアントも書いており、彼が対比しているのは GPT-6 Luna — OpenAI の Decisions API の背後にあるモデル — と Jev 1.13、TypeSafe のテキスト専用 System One モデルだ。同じブログ記事は、プラグイン自体が GPT-6 Astra によって OpenAI のドキュメントを読んで書かれたと述べている。

APIの1週間後にクライアントがリリースされることの有用な点は、それが基調講演ではなくリクエスト形状に基づいて書かれるため、マーケティングコピーが覆い隠してしまう差異を浮かび上がらせることだ。ここにあるものは何一つリークではなく、何一つ未確認でもない——以下のすべての数値は、OpenAI、TypeSafe、またはプラグイン自身のリポジトリが公開したページに由来し、いずれも2026-10-07に閲覧したものである。まだ欠けているのは、エンドポイントそのものの独立した測定であり、そのギャップは取り繕われるのではなく最後に明記されている。

三つの表面、隔てられたまま

まずはっきりさせておくべきことは、これらは三つの異なる層であり、報道がそれらを混同しているということだ。

• エンドポイント。OpenAI のものは POST /v1/decisionsで、Responses API のモードではなく専用のルートです。TypeSafe のものは POST /v1/systemoneです。どちらも証拠の本文と型付きの質問のリストを受け取り、質問ごとに 1 つの回答を、あなたが付けた名前をキーとして返します。

• モデルについて。Decisions API が現在受け付けるモデルは gpt-6-luna ただ一つで、これは OpenAI の汎用 GPT-6 シリーズの低価格ティアでもあり、2026年9月22日に通常のテキスト・画像モデルとして提供開始されました。Jev 1.13 は完全に意思決定モデルであり、自由記述テキストを一切出力できません。TypeSafe は 2026年9月15日にこれを提供開始し、2026年9月21日から一般提供されています。

• クライアント。OpenAI 自身の各 SDK は、このエンドポイントが 2026-10-06 にパブリックベータで公開されて以来、これをサポートしてきたため、このプラグインはそれを呼び出す最初の方法ではありません。これは、OpenAI 自身の SDK 以外で当社が確認できた最初のクライアントであり、アプリケーションライブラリではなくコマンドラインツール向けに書かれた最初のものでもあります。

二つの韻律が、並んで

ここが、クライアントのREADMEが告知よりも価値を持つところです。なぜなら、数字が文言のすぐ隣に並んでいるからです。

• 価格 — Decisions API は入力トークン100万個あたり $0.10 を課金し、出力、キャッシュ読み取り、キャッシュ書き込みの課金はありません。Jev 1.13 は入力トークン100万個あたり $0.042 を課金し、出力は無料です。どちらも送信したものに対して課金し、返ってくるものには課金しないため、どちらの価格でも1回の意思決定にかかるコストは1セントの何分の一かにとどまり、両者の違いは2.4倍であって、異なる課金モデルではありません。

入力 — Decisionsはテキスト、またはテキストと画像を組み合わせたユーザーメッセージを受け取ります。また、プラグインのREADMEには、PNG、JPEG、WebP、GIF添付ファイルがサポートされており、1リクエストにつき最大20枚の画像が可能であると記載されています。画像はインラインbase64データURLとして入力する必要があります。ホストされたHTTPまたはHTTPSの画像URLおよびfile_idはエンドポイントで受け付けられません。そのため、プラグインは送信前にURLまたはローカルパスを変換します。Jev 1.13のドキュメントは逆の方向ではっきりと述べています。「画像、音声、ビデオの入力は不可」であり、非テキストは状態に到達する前にテキストまたは構造化フィールドに前処理する必要があります。

• 質問タイプ — OpenAIは3つを記載しています:predicate(述べられた条件が成立する0〜1の確率)、choice(あなたのリストから1つの値、さらに分布と別個の信頼度フィールド)、およびscore(順序付けられたレベル全体の確率加重平均)。TypeSafeの3つは、異なる名前で同じ3つの考え方です:noulははい/いいえ用、choice、そしてscore。「Noul」はベルヌーイの略で、その名前は文化的差異をよく示しています — 一方のベンダーは平易な英語の名詞を提供し、もう一方は統計のジョークを提供しています。

• スコアの算術 — 両者は完全に一致しており、これはこれが2つではなく1つの製品カテゴリであることを示す最も強い兆候です。OpenAIのドキュメントは3つの重大度レベルに0.1、0.7、0.2の確率を与え、スコア1.1を返します — 最も近いレベルにスナップするのではなく、意図的に2つのレベルの間に収まります。TypeSafeのレベルも同じようにゼロインデックスされており、Jev用のプラグインは2から10までの順序付きレベルを受け取ります。OpenAIのページには上限が記載されていません。それはドキュメントにおける欠落であり、我々が断言できる制限ではありません。

• 予算 — Jevは自身のウィンドウを正確に記録している。1リクエストあたりおよそ64,000トークンで、そのうち約32,000トークンが状態と最長の単一質問を合わせた分に充てられ、これは当社自身のカタログが汎用モデルとしてのGPT-6 Lunaについて掲げる1,050,000トークンのコンテキストと対比される。OpenAIの決定事項ページにはトークン予算が一切公表されておらず、地域別処理プレミアムと長コンテキスト入力の乗数が依然として料金に適用されるという注記だけがある。

クライアントが明かす、発表では明かされなかったこと

プラグインとそのREADMEにある3つの詳細は、それぞれがエンドポイントの接続方法を変えるため、取り上げる価値があります。

第一の点は、decisionが拒否(refusal)として返ってくることがある、ということです。OpenAIのドキュメントはこれを文章で説明することは決してありませんが、どのSDKサンプルもそれで分岐しています — answer.type === "refusal"(JavaScriptの場合)、OpenAI::Models::Decision::Answer::Refusal(Rubyのcase)— そしてプラグインのREADMEには、拒否された質問は{"name":"...","type":"refusal"}として保存されると明記されています。つまり、answer typeは事実上3つではなく4つの値であり、あらゆる本番のループは、どの告知にも一切触れられていなかった4つ目の分岐を処理しなければなりません。

二つ目は、プラグインに存在するものではなく、プラグインに欠けているものだ。ウィリソン自身の投稿は、GPT-6 Astra に新しいドキュメントを読ませ、そこからクライアントを構築させる作業として捉えている——ドキュメントからクライアントへ、一発で、人間によるチュートリアルなしに。これは今やクライアントが書かれる通常の方法であり、エンドポイントのドキュメントが、動作するクライアントを生成するのに十分完全かどうかという問いが、編集上のものではなく実践的なものになったことを意味する。このエンドポイントについて、答えはおおむねイエスであり、拒否型が目に見える継ぎ目として残っている。

第三は、questions 配列の形状です。OpenAI では、共有入力に対して独立した質問を 1 つのリクエストにまとめられます — 商品写真の損傷を確認し、そのカテゴリを同じ呼び出しで分類するなど — ただし、後続の質問が先行する回答に依存する場合は、別々のリクエストが必要です。Jev も同じ理由で同じ立場を取っています。その質問は 1 つの状態に対して並列に評価されるため、逐次的なものはすべて 2 回の呼び出しに分ける必要があります。どちらのベンダーもファンアウトを前提に設計しており、どちらもレイテンシ予算がどこに費やされるかについて同じことを伝えています。

そのカテゴリには現在3つの項目があり、そのうち2つは汎用モデルではありません。

第三のものにも名前を付ける価値がある。なぜなら、decision-endpoint という枠組みは、三つすべてを視野に入れて初めて意味を成すからだ。Perplexity は独自の Decisions API を提供しており、それを担うのが pplx-decider-v1-27b だ——2026年10月1日に Hugging Face 上で Apache 2.0 の下に重みが公開された、270億パラメータの意思決定モデルである。これにより、このカテゴリーは OpenAI とは実に異なる形となる。Jev 1.13 はクローズドでテキスト専用、Perplexity の decider はオープンウェイトで画像も受け付け、GPT-6 Luna の参入は、意思決定のために作られたモデルではなく、汎用モデルの周囲に構築されたハーネスである。

今から選ぶ読者にとって、実用上の分かれ目はマーケティングが謳うよりも狭い。証拠が一文または一件の記録で、動作のばらつきを最小にしつつ呼び出しあたりのコストを最も安く抑えたいなら、Jev 1.13 がその専門特化型であり、その $0.042 という料金は、確認できた3つの公表価格のうち最も低い。証拠に写真が含まれる場合、または普段のタスクで既に知っているモデルに判断を求めたいなら、Decisions API は2つのクローズドな選択肢のうち画像を受け付ける唯一のものだ。オープンウェイトの選択肢は別の問い——制御とセルフホスティング——に答えるもので、われわれはそれを試していない。

実際に測定できるもの、そして誰も持っていないもの

OpenAI のこのエンドポイントに関する主張は、「テキスト、画像、またはその両方を評価し、Responses API より約 10 倍高速に型付きの回答を返す」というものだ。これはベンダーによる主張であり、再現されていない。リージョンも、入力サイズも、同時実行レベルも、サービスレベル契約も示されておらず、ベースラインは特定のワークロードではなく Responses API 全般である。単一の高速化数値は、期限を設定する根拠にするには不適切な数字だ。

それと併記できるのは、下にある2つのモデルにおける、2026-10-07に終わる当社自身の7日間のサービング期間で、当社のプレイグラウンドのトラフィックから得たものです。そして、これらの数字が何ではないかを明確にしておくことが重要です。これらは通常の生成リクエストを表すものであり、意思決定ではありません。

• GPT-6 Luna、すべてのリクエスト形状:中央値1,448 ms、p95 4,912 ms、7日間で643,394,111トークンにわたるエラー率1.31%。これは、モデルが生成しているときの毎秒約125出力トークンというスループットがどのようなものかを示している。

• Jev 1.13: 中央値149 ms、p95は245 ms、110,193,080トークンあたりのエラー率は0.10%。これは本当に高速なエンドポイントであり、高速なのは応答を生成しないからだ — 一度だけ取り込まれる状態に対する数値を返すのである。

それら2つの行を互いに突き合わせて読むと、それは比較ではなく警告だ。決定リクエストは一握りのトークンしか出力しないため、Decisions APIでは、Lunaの一般的なプロファイルを支配している出力スループットの数値は、拘束的な制約ではなくなる。そして重要になり始める数値は、モデルがエビデンスを読むのにかかる時間だ。私たちはdecisionsエンドポイントでそれを測定しておらず、私たちが確認できる限り、OpenAIの外部でそれを公表した者はいない。

より深く、まだ測られていない問いはキャリブレーションであり、これがこの仕組みを使い物にできるかどうかを決める。可視損傷に対する確率0.92は、あなたのトラフィック全体で、0.92付近とスコアされた写真が実際に約92%の割合で損傷している場合にのみ、ルーティングに使う価値がある。OpenAIのドキュメントは、ラベル付き事例からしきい値を設定し、偽陽性と偽陰性のコストを比較して選ぶよう指示している。それは正しい助言であり、同時に、これらの数値のキャリブレーションは自分で確立しなければならないものだという告白でもある。最初の段階では、答えがすでに分かっているサンプル上で、返された確率の分布を測定せよ。すべてが0.99か0.01で返ってくるなら、しきい値は何も機能しておらず、エンドポイントは非常に高コストなブール値にすぎない。

本番パスを賭けずにどちらかを試す方法

出典を明示すると、本記事のエンドポイント契約、価格、画像ルールは、OpenAI自身のDecisions APIドキュメントとプラグインのREADMEに基づいており、いずれも2026-10-07に閲覧しました。Jev 1.13仕様は、TypeSafe自身のモデルドキュメントによるものです。サービングの数値は、2026-10-07で終わる7日間における当方のプレイグラウンドデータです。パッケージのタイムスタンプは、PyPIとプロジェクトのGit履歴によるものです。10倍高速という主張はOpenAIによるもので、そのように明記されています。オープンウェイトのdeciderのライセンスとリリース日は、そのモデルリポジトリによるものです。

Decisions API自体はOpenAI自身のパッケージングであり、当社がルーティングしているわけではありません。その特定のエンドポイントが必要なら、それが存在するのはOpenAIです。その下のモデルはまた別の話です。GPT-6 LunaはOrcaRouter上のライブルートで、OpenAIの定価のまま、マークアップは一切上乗せされずに提供されています、そしてtypesafe/jev-1.13も定価で同じキー上にあります。つまり、この記事の比較は読むだけでなく実際に実行できるものになっています。同じ状態、同じ質問、2つのエンドポイント、管理する契約は1つ、2つ目の請求書はなしです。

それは、実績のないサーフェスを採用するうえでも賢明な方法です。判断はフォールバック経由で行い、拒否、タイムアウト、またはベータ制限が足元で変わった場合でも、停止ではなくプロンプトベースの呼び出しに縮退するようにしてください。また、そのフォールバックをプライマリと同じキーに載せておけば、エンドポイントが一般提供へ向かっても、配線をやり直す必要がありません。OpenAIは、GAが数週間以内に予定されていると述べており、また gpt-6-lunaがその間利用可能な唯一のモデルであると述べています。これらの両方とも、その形に合わせて構築し、今それを計装する理由であり、どちらも、まだ支払い承認をそれに委ねる理由にはなりません。

A generated two-column scoreboard titled 'GPT-6 Luna vs Jev 1.13 - the scoreboard' comparing the decision endpoints of GPT-6 Luna and Jev 1.13. The left column, headed 'GPT-6 Luna (Decisions API)', reads 'Price: $0.10 per M input', 'Output charge: none', 'Input: text + images', 'Answer types: predicate, choice, score', 'Model ids: gpt-6-luna only' and 'Status: public beta, GA promised'. The right column, headed 'Jev 1.13 (TypeSafe)', reads 'Price: $0.042 per M input', 'Output charge: none', 'Input: text only', 'Answer types: noul, choice, score', 'Model ids: jev-1.13 only' and 'Status: GA since 2026-09-21'. A footer line reads 'Per OpenAI and TypeSafe documentation read 2026-10-07; no independent endpoint measurement exists.' The OrcaRouter logo is composited in the bottom-right corner.

次に見るもの

この記事が答えられない問いに決着をつけるものは3つある。decisionsエンドポイントのトークン予算が公開されること — それがあれば、リクエストを当て推量ではなく見積もりで設計できる。GAの発表 — それは、入力のみの料金がベータ版の約束ではなくなる時点だ。そして、エンドポイントそのもののレイテンシとキャリブレーションに関する独立した測定が1つ — 数千のラベル付きペアをそこに通し、信頼性曲線を公開する最初の人物は、どちらのローンチ記事よりもこのカテゴリに大きく貢献するだろう。

それまでは、正直な要約は限定的だが役に立つ。判断する必要があるものがテキストなら、Jev 1.13の方が安く、私たちのトラフィックでは約150ミリ秒で数値を返す。判断する必要があるものに画像が含まれるなら、それを見てくれるのはOpenAIのDecisions APIで、入力価格の2.4倍、箱にはベータ版のラベルが付いている。どちらも今週からコマンドラインから呼び出せるようになり、それは7日前のどちらの状況よりも良い立場だ。

A headless-browser capture of the GitHub repository page for simonw/llm-openai-decisions at github.com/simonw/llm-openai-decisions, showing the repository name with the description 'LLM plugin for the OpenAI Decisions API', a sidebar reading 1 branch, 1 tag, 7 stars and 0 forks with an Apache-2.0 licence label, a file list in which five entries carry the commit message 'Plugin, built by GPT-6 Astra Medium', and below it the rendered README opening 'Use the OpenAI Decisions API with LLM to evaluate text and images with predicates,' under an Installation heading with the commands 'llm install llm-openai-decisions' and 'llm keys set openai'.A headless-browser capture of the OrcaRouter model page for OpenAI: GPT-6 Luna, showing the breadcrumb 'Home » Models » OpenAI', the slug openai/gpt-6-luna, the badges 'ctx 1M tokens' and 'Max output 128K', the release date 2026-09-22 with a p50 TTFT figure beside the 'Public benchmarks by OpenAI' heading, the vendor blurb describing GPT-6 Luna as the fast, cost-efficient model in OpenAI's GPT-6 series positioned below GPT-6 Sol, a Python code sample using base_url https://api.orcarouter.ai/v1 with the ORCAROUTER_API_KEY environment variable, and a seven-day tile strip reading $0.10, $0.50, 1.45 s, 4.91 s and 643.7M tokens.