Титульная карточка с надписью «OpenAI's Decisions API», подзаголовок «GPT-6 Luna перестаёт болтать и выбирает один ответ», три скруглённые карточки с надписями «Один ответ из заданного вами списка», «Заявлено поставщиком ~150 мс» и «Опубликованной цены пока нет», нижний колонтитул «Показатели OpenAI заявлены поставщиком; независимых измерений пока нет.» и логотип OrcaRouter, размещённый в правом нижнем углу.
Guides & Insights

Decisions API от OpenAI: GPT-6 Luna перестаёт общаться и выбирает один ответ

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

GPT-6 Luna вышла 22 сентября 2026 года как дешёвая ступень лестницы GPT-6 от OpenAI. Что нового 29 сентября — это задача для неё, никак не связанная с разговором. Decisions API от OpenAI принимает вопрос, который вы написали, конечный список ответов, которые вы допускаете, и фрагмент контекста — текст или изображение — и возвращает один из этих ответов. Не прозу. Не абзац, который нужно разобрать и на что-то надеяться. Один-единственный выбор: так что заявка в поддержку уходит в одну из пяти очередей, изображение попадает в одну категорию модерации, или агент выбирает свой следующий шаг из заданной вами политики. Он был анонсирован на DevDay 2026, и сейчас находится в ограниченном предпросмотре; OpenAI говорит, что широкий выпуск планируется в ближайшие дни.

Большая часть того, что нужно команде, прежде чем строить на этом, ещё не опубликована. Нет цены за вызов, нет заявленного ограничения на то, сколько кандидатных ответов может содержать запрос, нет утверждения о том, можно ли настраивать это на собственных данных, и — по состоянию на 30 сентября — нет записи об этом нигде в собственном индексе документации для разработчиков OpenAI, списке изменений или справочнике API. Мы проверили все три. Сейчас эта возможность существует в итогах DevDay от OpenAI и в том, что представитель OpenAI сказал журналистам в день запуска. Поэтому остальная часть этой статьи сохраняет три уровня явно разделёнными: что OpenAI подтвердила, что утверждает одно измерение, сделанное в день запуска, и что пока никто не может знать.

Что на самом деле представляет собой решение с ограничениями

Два существующих подхода выполняют эту задачу плохо, и Decisions API нацелен на разрыв между ними. Первый — это промптинг чат-модели: вы пишете тщательно составленную инструкцию с просьбой выбрать из списка, она пишет вам предложение, и если повезёт, вы можете извлечь вероятности токенов из ответа, чтобы получить нечто похожее на оценку уверенности. Это работает, это расходует токены, а число уверенности — грубая догадка. Второй — обучение небольшого классификатора: быстро, дёшево, и ему нужны размеченные данные плюс повторное обучение каждый раз, когда меняется набор меток.

Между ними находится модель принятия решений. Она принимает новые метки в промпте — так же, как это делает промпт, — но возвращает оценку или вариант выбора, по которому разработчик может ветвить логику без парсинга; это свойство было у классификатора и никогда не было у чат-модели. OpenAI не впервые сталкивается с такой формой: её Moderation API уже много лет возвращает оценки по категориям, а не текст, с одним отличием, которое здесь важно. Категории Moderation принадлежат OpenAI. А категории Decisions API — ваши.

Ограничение — это и есть продукт, и стоит точно понимать, что оно даёт, а что не даёт. Конечное пространство выходных данных означает, что каждое допустимое значение известно заранее, поэтому ваше приложение может отклонить ответ, который оно не определило, назначить каждой ветке отдельный уровень разрешений и передать решение человеку, когда уверенности или контекста недостаточно. Это также делает офлайн-оценку выполнимой, потому что у каждого тестового случая есть целевой класс и измеримая цена ошибки. Чего оно не даёт — так это корректности. Модель с ограничениями всё ещё может выбрать неверный допустимый ответ, поддаться влиянию вводящего в заблуждение контекста или унаследовать предвзятость категорий, которые вы задали.

Утверждение о 150 миллисекундах — и число, которое OpenAI не опубликовала

OpenAI заявляет, что Decisions API принимает решения примерно в десять раз быстрее, чем GPT-6 Luna через обычный API, — порядка 150 миллисекунд против примерно 1,6 секунды. Этот показатель заявлен производителем и не воспроизведён; независимых измерений за два дня с момента запуска нет, а в собственном обзоре OpenAI говорится лишь о «принятии решений в реальном времени». К этой цифре не прилагаются ни распределение задержки, ни регион, ни размер входных данных, ни уровень параллелизма, ни соглашение об уровне обслуживания.

Наши собственные данные о трафике не заменяют этот тест, но они объясняют, почему отсутствующее распределение имеет значение. За семь дней, закончившихся 30 сентября, GPT-6 Luna, обслуживаемая через обычный маршрут chat-completions OrcaRouter, показывает медиану 699 миллисекунд и p95 7,6 секунды на 3,23 млрд токенов смешанной нагрузки — разброс более чем на порядок между серединой и хвостом. Это иная форма запроса, чем у ограниченного решения, поэтому это не сравнение с заявленными 150 мс. Именно поэтому один основной p50 — неправильное число, вокруг которого стоит проектировать дедлайн. Если вы тестируете предварительную версию, фиксируйте медиану, p95 и p99 отдельно для текстовых и графических входных данных, включайте сетевое время и повторы и измеряйте дедлайн, который действительно есть у вашего продукта — решение о маршрутизации для асинхронной очереди и решение, находящееся между кликом и платежом, не имеют общего бюджета задержки.

A single-column scoreboard titled 'GPT-6 Luna and the Decisions API - the scoreboard' with six rows: Decisions API price 'not published', candidate-answer limit 'not published', fine-tuning on your data 'no statement', stated decision latency '~150 ms vendor-reported', GPT-6 Luna input / output '$0.10 / $0.50 per 1M', and AA Intelligence Index at max effort '37.3', with a footer reading 'OpenAI figures vendor-reported; Index per Artificial Analysis; unpublished means blank, not zero.' and the OrcaRouter logo composited in the bottom-right corner.

Ценообразование: сколько стоит лежащая в основе модель и почему это не цена API

OpenAI не опубликовала никакого тарифа для Decisions API. Также небезопасно предполагать, что применяются тарифы OpenAI на токены, потому что Decisions API — это собственная упаковка, другой продукт с ограничениями, и OpenAI заявила, что представит больше подробностей «при широком развёртывании». Любой, кто прямо сейчас называет вам стоимость за одно решение, предполагает её.

То, что публикуется, — это прайс-лист для модели, на которой он построен, взятый со страницы цен OpenAI 30 сентября 2026 года:

• Ввод — $0.10 за миллион токенов, а свыше 272 000 входных токенов — $0.20
• Вывод — $0.50 за миллион токенов, а свыше 272 000 входных токенов — $0.75
• Кэшированный ввод — $0.01 за миллион токенов; запись в кэш тарифицируется по $0.125, что на 25% выше тарифа без кэширования
• Пакетная обработка и обработка Flex — 50% от стандартных тарифов; режим Fast — в 2 раза выше применимых тарифов

Порог длинного контекста — именно то, что застаёт людей врасплох, и действует он так же, как во всей линейке GPT-6: пересечение порога в 272 000 входных токенов приводит к пересчёту всего запроса по более высокой цене, а не только превышения. API для принятия решений, который передаёт модели длинный документ или большой набор изображений, — это ровно тот тип вызова, который может пересечь эту границу, а это ещё один момент, который остаётся открытым из-за неопубликованных лимитов предварительной версии.

GPT-6 Luna на своих условиях

Если убрать API, то лежащая в основе модель — это reasoning-модель на нижней ступени семейства из трёх уровней — ниже GPT-6 Sol за $2.00/$10.00 и флагманской GPT-6 Astra за $10.00/$50.00 — с контекстным окном на 1 050 000 токенов, потолком вывода в 128 000 токенов, датой отсечения знаний 18 мая 2026 года и reasoning effort, который можно задать одним из шести значений от none до max. Она принимает на вход текст и изображения и возвращает текст, а в собственной документации OpenAI для разработчиков значение reasoning effort по умолчанию — medium. Одна практическая оговорка с той же страницы, не связанная с Decisions API, но важная, если вы подключаете Luna как запасной вариант: в Chat Completions вызов функций работает только тогда, когда reasoning effort установлен в none. Инструменты при любом другом значении effort требуют Responses API.

Что касается качества, независимый показатель — это Intelligence Index от Artificial Analysis: 37,3 для Luna при максимальном усилии против 47,5 для GPT-6 Sol — разрыв примерно в десять пунктов, и это честный способ интерпретировать разницу в цене в двадцать раз на входе. Ни одна из этих цифр не относится к Decisions API, чья ограниченная задача — это совершенно иное измерение, и по ней нет опубликованной оценки.

OpenAI's developer documentation page for the gpt-6-luna model, showing the model heading with compare and playground controls, the reasoning, speed and price tiles, the '$0.1 - $0.5' price range, text and image input with text output, a 1,050,000-token context window, a 128,000-token maximum output, a May 18 2026 knowledge cutoff, the note that reasoning.effort supports none, low, medium (default), high, xhigh and max, and the note that Chat Completions supports function calling only with reasoning effort set to none.

Jev, Laya и концепция «системы один»

API решений появился не на пустом месте. Jev от TypeSafe AI, выпущенный 15 сентября 2026 года Диогу Алмейдой и общедоступный с 21 сентября, — это модель, которая сделала эту категорию понятной для разработчиков: она вообще не генерирует текст, а вместо этого возвращает типизированные ответы со значениями уверенности, по цене $0,042 за миллион входных токенов при нулевой стоимости вывода. Первое независимое тестирование Jev, проведённое Every, обработало 777 суждений по 37 документам менее чем за 0,7 секунды примерно за четверть цента, а второй тест показал медианное время 0,35 секунды на фрагмент против 8,83 секунды у Claude Fable 5.1 при высоком уровне усилий — примерно в 25 раз быстрее и примерно в 580 раз дешевле, при этом обнаружив шесть из семи намеренно внедрённых дефектов, тогда как Fable 5 поймала все семь. «Хорошо, но не идеально» — таков вердикт Every, и это верное резюме в одну строку. Laya — третий участник того же типа, модель принятия решений, которая отвечает, не написав ни одного токена.

Создала ли OpenAI Decisions API из-за Jev — это домыслы. Издание The New Stack, сообщая об этом на запуске, назвало реакцию на TypeSafe «вероятной» и отметило, что OpenAI, вероятно, поспешила с анонсом перед DevDay; OpenAI ничего подобного не говорила, а то, как совпали сроки — выход Jev в общую доступность 21 сентября, DevDay 29 сентября — наводит на размышления, но не является доказательством. А вот что не домыслы, так это то, что эти двое пока несопоставимы по параметру, который важен покупателям. Jev публикует цену, схему оплаты за вызов и дату выхода в общую доступность. Decisions API не публикует ничего из этих трёх.

Где оно выполняется, и что держать в тепле рядом с ним

Decisions API — это собственная упаковка OpenAI. Это не модель из нашего каталога, и мы её не маршрутизируем, так что если вам нужен именно этот эндпоинт, искать его нужно у OpenAI. Другое дело — модель, на которой он построен: GPT-6 Luna — это живой маршрут в OrcaRouterпо каталожной цене OpenAI с нулевой наценкой — $0.10 за вход и $0.50 за выход за миллион токенов, при этом тариф свыше 272K идёт по $0.20/$0.75, — а за семь дней, завершившихся 30 сентября, через нас прошло 3,23 млрд токенов при доле ошибок 0,18%.

Это важно для того, как вы снижаете риски при работе с превью. Разумный способ протестировать эндпоинт для принятия решений с ограничениями — держать путь на основе промптов «тёплым» в качестве резервного, потому что превью может изменить лимиты или цены без предупреждения, а решению, находящемуся на критическом пути, нужно, чтобы было куда переключиться. Если держать этот резервный путь на том же ключе, что и другие ваши модели, это означает отсутствие второго договора и отсутствие изменений кода в резервном пути: один API для 200+ моделей, с автоматическим переключением при сбое между провайдерами, когда один из них начинает сбоить. А если ваше решение — это один шаг более длинной цепочки, DSL маршрутизации объединяет модели в один вызов, что в точности представляет собой паттерн «оркестратор плюс решатель», популяризированный материалом Jev — большая модель планирует, маленькая модель выбирает на каждом шаге. Этот паттерн можно собрать уже сегодня из моделей, которые мы предоставляем; сам Decisions API оставался бы вне него, пока OpenAI не откроет его.

Кому следует двигаться, а кому — ждать

Если ваша задача — это классификация или маршрутизация с большим объёмом, где неверная ветка дёшева и обратима, то превью стоит того, чтобы уже на этой неделе заняться формой запроса и размеченным набором: возможность реальна, ограничение — это настоящее улучшение по сравнению с парсингом прозы, а превью — самый дешёвый возможный момент, чтобы узнать, где именно проявятся издержки его ошибок. Если ваше решение санкционирует трату денег, отправляет сообщение клиенту или находится между пользователем и платежом, ничто в этой неделе не меняет ваши расчёты: нет опубликованной цены, которую можно было бы смоделировать, нет опубликованного лимита, под который можно было бы проектировать, нет SLA и ни слова о том, можно ли настраивать этот инструмент на собственных данных. Эти четыре пробела — то, что должно заполнить «широкое развёртывание», и пока OpenAI не назовёт их, честное прочтение Decisions API таково: это многообещающий интерфейс с быстро объявленными вендором сроками и без счёта.

OrcaRouter's model page for openai/gpt-6-luna, showing the model name and OpenAI attribution dated 2026-09-22, capability pills for vision, tools, JSON and reasoning, the description of GPT-6 Luna as the fast cost-efficient model below GPT-6 Sol, the /v1/chat/completions route, a $0.10 input and $0.50 output rate per million tokens with a 699 ms p50 time to first token, a 1M-token context with 128K maximum output, and 3234.7M tokens of traffic.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно