Титульная карточка hero для GPT-6 Astra с текстом «Как вызвать GPT-6 Astra», подзаголовком «Идентификатор модели, эндпоинт и сколько стоит длительный запуск», строкой с датой «Модель выпущена 3 сентября 2026 года — сведения об API проверены 16 сентября 2026 года» и тремя карточками под ней: «Идентификатор модели: gpt-6-astra», «Контекст: 1 050 000 токенов» и «Стандарт: $10.00 за вход / $50.00 за выход», с логотипом OrcaRouter, наложенным в правом нижнем углу.
Guides & Insights

GPT-6 Astra API: ID модели, эндпоинт и сколько на самом деле стоит долгосрочная задача

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

The short version: GPT-6 Astra is callable today at https://api.openai.com/v1 under a single model id, gpt-6-astra, at $10.00 per million input tokens, $1.00 cached input and $50.00 output — the figures Ope​nAI's own pricing page carried on September 16, 2026. The model itself is from September 3, 2026, thirteen days before this page was written, so nothing here is launch coverage and nothing here is framed as an announcement. This is the reference page for the developer question that comes after availability: what string to pass, which endpoint takes it, what the 1,050,000-token window really buys, what the account has to look like first, and what one genuine long-horizon agent run costs on a rate card that quietly reprices itself above 272,000 input tokens. GPT-5.6 Sol appears throughout only as the price baseline it is sold above, never as the subject.

Причина, по которой тринадцатидневная модель заслуживает отдельной страницы на этой неделе, состоит в том, что пути доступа к ней изменились после запуска, и теперь API-маршрут стал обычным. Когда OpenAI выпустила Astra 3 сентября, она описала это как поэтапное развёртывание, а не как доступность; к 8 сентября она уже говорила, что модель полностью развёрнута для пользователей Plus, Pro, Business и Enterprise в Codex и ChatGPT Work, а к неделе 14 сентября AWS уже включила её в список на Bedrock, и Microsoft Foundry предлагала её как общедоступную. Для пользователя API эта последовательность значит меньше, чем кажется, — конечная точка была активна и документирована всё это время, — но это означает, что вопросы закупки, связанные с ней, теперь имеют ответы, которых не было в день запуска. Всё нижеследующее было прочитано в собственной документации OpenAI по модели, на странице цен и на странице контроля данных 16 сентября 2026 года, а всё, что взято из другого источника, указано в предложении, которое его содержит.

Идентификатор модели и честный ответ на вопрос о снапшоте

Строка для передачи: gpt-6-astra — в нижнем регистре, через дефис, без префикса производителя. Это единственный идентификатор, который OpenAI указывает в документации для этой модели.

Если вы ищете датированный снимок, который можно закрепить, — такого не существует, и мы не собираемся придумывать правдоподобно выглядящий суффикс. На странице модели GPT-6 Astra у Ope​nAI в разделе Snapshots указана ровно одна запись, и это просто gpt-6-astra. Нет -2026-09-03-подобной датированной формы и нет -latest-алиаса на стороне вендора. Во время исследования мы видели плавающий алиас вида ~openai/gpt-astra-latest в листинге роутера; это конструкция шлюза, надстроенная поверх идентификатора вендора, а не то, что публикует Ope​nAI, и её не следует вписывать в свой конфиг так, будто это так.

Практическое следствие невелико, но о нём стоит сказать. Вы можете получить объект модели, чтобы убедиться, с чем именно вы взаимодействуете:

curl https://api.openai.com/v1/models/gpt-6-astra -H "Authorization: Bearer $OPENAI_API_KEY"

Закрепите голый id в значении конфигурации, а не вписывайте его в дюжину мест вызова. Если Ope​nAI позже добавит датированные снимки, голый id станет движущейся мишенью, и ваше закреплённое значение начнёт меняться у вас под ногами — одно место для правки — это разница между двухминутным изменением и полднем, потраченным на grep.

Эндпоинт: базовый URL, совместимость и запрос, который выполняется

The base URL is https://api.openai.com/v1. Per Ope​nAI's model documentation, GPT-6 Astra is supported on Responses (/v1/responses), Chat Completions (/v1/chat/completions) and Batch (/v1/batch). It is explicitly not supported on Realtime, Assistants, Fine-tuning, Embeddings, image generation and editing, video, audio, moderation, or the legacy Completions endpoint — and those absences matter as much as the presence list, because a team that planned around the Assistants API or a fine-tuned variant has to replan rather than rewrite.

О совместимости: это собственный API OpenAI, то есть формат передачи данных, под который были написаны все SDK и клиенты, совместимые с OpenAI. Всё, что поддерживает этот формат, сможет работать с gpt-6-astra без прослойки — вы меняете строку модели и, если мигрируете с более старой модели OpenAI, названия параметров ниже. Для новых разработок следует использовать Responses API: именно в этом интерфейсе OpenAI документирует управление рассуждениями этой модели, именно там находятся встроенные инструменты, а поддержка Chat Completions для новейших моделей исторически была более поверхностной из этих двух.

Минимальный потоковый вызов с заданным уровнем рассуждений:

curl https://api.openai.com/v1/responses \

-H "Authorization: Bearer $OPENAI_API_KEY" \

-H "Content-Type: application/json" \

-d '{"model": "gpt-6-astra", "input": "Перечислите файлы, которые вы бы изменили, чтобы перевести этот сервис с устаревшего API аутентификации.", "reasoning": {"effort": "high"}, "max_output_tokens": 16000, "stream": true}'

И то же самое в Python — а ведь именно там будет жить большинство читателей:

from openai import OpenAI

client = OpenAI()

stream = client.responses.create(model="gpt-6-astra", input="Перечислите файлы, которые вы бы изменили, чтобы перевести этот сервис с устаревшего API аутентификации.", reasoning={"effort": "high"}, max_output_tokens=16000, stream=True)

for event in stream:

if event.type == "response.output_text.delta": print(event.delta, end="")

Три вещи в этом запросе специфичны для данной модели, а не скопированы из универсального руководства по быстрому старту.

Усилие рассуждений — это регулятор затрат, а не только регулятор качества. На странице модели OpenAI поддерживаемые значения перечислены как low, medium, high, xhigh и max. Обратите внимание, с чего начинается этот список: для GPT-6 Astra нет ни none, ни minimal, поэтому нижняя граница поднялась. Токены рассуждений тарифицируются как выходные токены по цене $50.00 за миллион, а значит, переключение усилия с high на max — это решение, у которого есть цена, а не бесплатное повышение качества.

Поддерживается потоковая передача, и это честный способ выполнять длинные ходы. Один запрос к этой модели может выдать до 128 000 выходных токенов. Ожидание, пока всё это придёт в одном теле ответа, без возможности видеть, продвигается ли процесс, — так вы и начинаете гадать о тайм-аутах.

Кэширование промптов здесь явное. В Responses API документирован prompt_cache_breakpoint для текстового, графического и файлового содержимого с режимом explicit, который отмечает «точный конец переиспользуемого префикса промпта» и наследует свой TTL из prompt_cache_options.ttl запроса. Для модели, у которой тариф на кэшированный ввод составляет одну десятую от тарифа на некэшированный, то, где вы проводите эту границу, — самая значимая строка в вашем запросе.

Screenshot of OpenAI's developer documentation page for GPT-6 Astra, captured 16 September 2026, showing the model id gpt-6-astra described as the company's most capable model, a 1,050,000-token context window, 128,000 maximum output tokens, an Apr 30, 2026 knowledge cutoff, reasoning token support with reasoning.effort values of low, medium, high, xhigh and max, input modalities of text and image with text output and audio and video marked not supported, Standard pricing of $10.00 input, $1.00 cached input, $12.50 cache writes and $50.00 output per million tokens, the note that prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request, and supported endpoints of Responses, Chat Completions and Batch with Fine-tuning, Assistants, Embeddings and Images marked unsupported.

Что на самом деле означает окно в 1,050,000 токенов

В документации указаны следующие числа: окно контекста в 1 050 000 токенов, максимальный объём ввода в 922 000 токенов, максимальный объём вывода в 128 000 токенов и дата отсечки знаний — 30 апреля 2026 года.

Начнём с арифметики, которую многие упускают: 922 000 плюс 128 000 равно 1 050 000. Окно делится между тем, что вы отправляете, и тем, что может вернуть модель, а потолок вывода резервируется из него. Вы не можете отправить 1 050 000 токенов входных данных; практический потолок для одного запроса — 922 000, и даже меньше, если вы хотите оставить место для реального ответа.

Что даёт миллион токенов в тех единицах, в которых вы на самом деле работаете? Преобразования токенов в текст приблизительны, и это наши оценки, а не Ope​nAI, но порядок верный: при примерно четырёх символах на токен 1 050 000 токенов — это порядка 750 000 слов или около ста тысяч строк кода. Это целый репозиторий среднего размера, и в нём ещё остаётся место для вывода инструментов, который агент генерирует во время работы. Долгосрочный сценарий, для которого и продаётся модель, — ровно такой: агент, который прочитал файл час назад и всё ещё видит, что там было сказано, а не такой, который сжал утреннюю работу в абзац пересказа.

А теперь часть, которая относится скорее к странице стоимости, чем к странице спецификаций. В документации моделей OpenAI указано, что для промптов объёмом более 272 000 входных токеновцена составляет 2x для тарифов на входные данные и кэш и 1,5x для выходных данных за весь запрос. На странице цен это приводится второй строкой: длинный контекст для GPT-6 Astra — $20.00 за вход, $2.00 за кэшированный вход и $75.00 за выход. Итак, верхние три четверти этого окна — это ценовой диапазон, а не просто запас. Прогон, транскрипт которого превышает 272 000 токенов, платит вдвое за каждый входной токен — включая кэшированные — за весь запрос, и это самое крупное единичное колебание в экономике этой модели. Ниже это разобрано полностью.

Ещё один механизм, о котором стоит знать, потому что это собственное признание вендора, что одного окна недостаточно. Для Co​dex компания Ope​nAI описывает экспериментальный подход к контексту, поставляемый с Astra, при котором заметки сохраняются между контекстными окнами вместо повторяющегося сжатия в единую сводку, а более ранние окна остаются доступными для поиска, чтобы требования и результаты тестов из более ранних сообщений и вывода инструментов можно было найти. Ope​nAI называет это экспериментальным, говорит, что это включено в Co​dex config.toml, и что это станет значением по умолчанию для Astra. Если вы сами создаёте эквивалент на API, именно эту форму и стоит копировать: долговечные заметки плюс извлекаемая история, а не один героический промпт.

И ограничение самого числа: большое окно — это ёмкость, а не гарантия внимания на всём его протяжении. Заявленные производителем показатели на длинных горизонтах лучше помогают судить о поведении, чем количество токенов, — Ope​nAI сообщает об OSWorld 2.0 на уровне 72,6% при примерно 40 минутах на задачу и о Terminal-Bench 4.0 на уровне 57,9% против 37,3% у GPT-5.6 Sol. Это собственные числа Ope​nAI, не воспроизведённые нами, и независимая картина близка, но не идентична: Artificial Analysis измерила Astra на 59,1% в Terminal-Bench v4.0 против 52,0% у Claude Fable 5.1 и 39,9% у GPT-5.6 Sol. Оба источника согласны, что разрыв на длинном горизонте по сравнению с предыдущим поколением реален; ни то, ни другое не заменяет запуск собственной задачи.

Входные модальности и вопрос о файле, честно оставленный открытым

На странице модели OpenAI указаны входные модальности: текст и изображение, а вывод — текст. В этой модели нет аудио, видео и генерации изображений.

Ввод изображения передаётся как часть содержимого внутри сообщения пользователя. Тип этой части — input_image, а изображение предоставляется либо как полный URL, либо как base64 data URL в поле image_url, либо как file_id из Files API. Есть необязательный параметр detail со значениями auto, low, high или original, по умолчанию — auto. Структура такая:

{"model": "gpt-6-astra", "input": [{"role": "user", "content": [{"type": "input_text", "text": "Что изменилось на этом скриншоте?"}, {"type": "input_image", "image_url": "data:image/png;base64,...", "detail": "high"}]}]}

В документации OpenAI по vision указаны PNG, JPEG, WEBP и неанимированный GIF как принимаемые форматы, до 512 МБ общего объёма полезной нагрузки на запрос и до 1 500 изображений на запрос, причём изображения с более чем 30 000 патчей отклоняются, а не уменьшаются. Это общие ограничения платформы для vision, а не специфичные для Astra, и изображения тарифицируются как токены, как и любой другой ввод.

Теперь вопрос, с которым читатели на самом деле приходят, и честный ответ. Можно ли отправлять файлы или PDF? Мы не смогли подтвердить ввод документов для этой модели в документации Ope​nAI и не собираемся подразумевать, что это работает. В Responses API действительно определена часть контента input_file, так что такая возможность в API в целом есть; но на странице Ope​nAI для GPT-6 Astra в качестве входных модальностей указаны текст и изображения, а файл не указан, и мы не нашли заявления Ope​nAI, документирующего ввод PDF для этой конечной точки. В листинге роутера для той же модели файл указан наряду с текстом и изображениями — считайте это данными, заявленными роутером: это то, что роутер записывает о маршруте, а не то, что гарантирует поставщик. Если приём документов критичен для вашей нагрузки, протестируйте это на реальной конечной точке, прежде чем строить на этом, и держите наготове запасной вариант с OCR-в-текст. Это разница между днём тестирования и переписыванием.

Полная линия цен и один долгосрочный прогон с рассчитанной стоимостью

Каждое число в этом разделе было взято со страницы цен самой Ope​nAI16 сентября 2026 года, и все они указаны за миллион токенов на уровне Standard, если в строке не указано иное.

Короткий контекст, до 272K входных данных — $10,00 за ввод, $1,00 за кэшированный ввод, $12,50 за запись в кэш, $50,00 за вывод.

Длинный контекст, более 272K входных данных — $20.00 за ввод, $2.00 за кэшированный ввод, $25.00 за запись в кэш, $75.00 за вывод; применяется ко всему запросу.

Batch и Flex — половина стоимости Standard: $5.00 / $0.50 / $6.25 / $25.00 короткий контекст, $10.00 / $1.00 / $12.50 / $37.50 длинный контекст.

Fast mode — вдвое дороже Standard: $20.00 / $2.00 / $25.00 / $100.00 для короткого контекста, $40.00 / $4.00 / $50.00 / $150.00 для длинного контекста. OpenAI отмечает, что Fast mode недоступен для GPT-6 Astra с размещением данных в ЕС.

Локальное размещение данных — эндпоинты, которые его используют, получают надбавку 10% для моделей, выпущенных 5 марта 2026 года или позднее. GPT-6 Astra подходит под это условие, поэтому развёртывание с локальным размещением данных обходится на 10% дороже каждого из приведённых выше значений.

Главное, что нужно усвоить, — это тариф на кэшированный ввод. $1.00 против $10.00 — это скидка 90% на ту часть промпта, которую вы отправляете повторно, а в рабочей нагрузке агента это почти весь промпт. Запись в кэш тарифицируется по $12.50, или в 1,25 раза выше тарифа на некэшированный ввод, так что точка безубыточности проста: 100 000 токенов, отправленных без кэша дважды, стоят $2.00, тогда как запись этого префикса один раз и его чтение один раз стоят $1.35. Кэширование окупается начиная со второго повторного использования, а агент, работающий с одним и тем же транскриптом сто ходов, использует его повторно сто раз.

Что подводит нас к арифметике, которая на самом деле определяет, доступна ли эта модель по цене, ведь заявленная ставка — это не та цифра, что попадёт в счёт. Вот смоделированный прогон — наш, построенный на опубликованных тарифах Ope​nAI, а не измеренный счёт, — для того класса задач, для которых модель и продаётся: автономный агент для программирования, выполняющий миграцию в масштабе репозитория за несколько часов, 120 вызовов модели, рабочий транскрипт, который по мере накопления в среднем содержит около 500 000 входных токенов на вызов, 80% этого ввода обслуживается из кэша, и 400 000 выходных токенов за прогон, включая рассуждения.

По стандартным тарифам для короткого контекста:

• Некэшированный ввод — 12 млн токенов × $10.00 = $120.00

• Кэшированный ввод — 48 млн токенов × $1.00 = $48.00

• Вывод — 0,4 млн токенов × $50,00 = $20,00

Итого ≈ $188.00 за запуск

Тот же прогон в диапазоне длинного контекста — это то, что фактически получает транскрипт, превышающий 272 000 токенов на вызов:

• Некэшированный ввод — 12 млн токенов × $20.00 = $240.00

• Кэшированный ввод — 48 млн токенов × $2.00 = $96.00

• Вывод — 0,4 млн токенов × $75,00 = $30,00

Итого ≈ $366.00 за запуск

Из этого следуют два вывода, и ни один из них не виден по ставке из заголовка. Во-первых, где хранится ваш транскрипт, стоит столько же, сколько выбор модели — одна и та же задача примерно удваивается в цене в зависимости от того, пересекает ли она порог в 272K, что делает дисциплину работы с контекстом (извлекать нужные 100K, а не тащить 600K) техникой контроля затрат на этой модели, а не только вопросом производительности. Во-вторых, кэширование приносит больше выгоды, чем предполагает скидка: при полном отсутствии попаданий в кэш первый сценарий содержит $600.00 входных данных вместо $168.00, а запуск стоит около $620 вместо $188. Включайте кэширование до того, как повышать уровень усилий рассуждения.

Для базового варианта тот же набор токенов на GPT-5.6 Sol по тарифам, которые 16 сентября были указаны на странице цен OpenAI — $4.00 за ввод, $0.40 за кэшированный ввод, $20.00 за вывод при коротком контексте — даёт примерно $75.20, а по строке длинного контекста Sol ($8.00 / $0.80 / $30.00) — примерно $146.40. То есть этот прогон примерно в 2.5x дороже на любой из этих полос. Две оговорки к этому множителю, потому что он уже вызвал путаницу в других местах: цифра Sol — это промо-тариф (OpenAI говорит, что акция доступна как минимум до 21 ноября 2026 года), тогда как у Astra это прайс-лист, так что множитель отражает сегодняшние два тарифных листа, а не устойчивый факт о моделях, и он сузится, если акция прекратится. А старое «2.5x», которое ходит для Astra, иногда считают от предпромо-прайса Sol $5.00/$30.00, что даёт 2x по вводу и около 1.67x по выводу. Уточняйте, какой тариф Sol вы имеете в виду, иначе число бесполезно.

Ещё одна строка: тариф Batch сокращает всё это вдвое, в результате чего первый запуск обходится примерно в $94. Возможность его использования зависит от следующего раздела.

Single-column scoreboard titled 'GPT-6 Astra API — the scoreboard' with six rows reading 'Model id: gpt-6-astra', 'Context window: 1,050,000 tokens', 'Max output: 128,000 tokens', 'Price (Standard): $10.00 in / $50.00 out', 'Cached input: $1.00, a 90% discount' and 'Above 272K input: 2x input, 1.5x output', above a footer reading 'All figures per OpenAI's model and pricing pages, read September 16, 2026.', with the OrcaRouter logo composited in the bottom-right corner.

Нулевое хранение данных и скидка, которая сама себя дисквалифицирует

OpenAI заявляет, что Zero Data Retention доступно для соответствующих критериям клиентов API на поддерживаемых эндпоинтах и при условии одобрения — и обе части этого утверждения имеют реальное значение. Это не переключатель для самостоятельного включения: право на использование предоставляется при условии предварительного одобрения со стороны OpenAI и принятия дополнительных требований, а начать можно, только обратившись в отдел продаж. После одобрения это настраивается на уровне организации или проекта в разделе «Настройки» → «Организация» → «Управление данными» на вкладке «Хранение данных», где проект может наследовать настройку организации по умолчанию, явно задать ZDR, выбрать Modified Abuse Monitoring или отключить и то, и другое.

Что это меняет на практике: ZDR исключает клиентский контент из журналов мониторинга злоупотреблений, заменяя стандартное хранение сроком до 30 дней, а параметр store в /v1/responses и /v1/chat/completions трактуется как false, даже если запрос пытается установить его в true.

Самая важная деталь на странице о стоимости: /v1/batches не входит в список эндпоинтов, имеющих право на ZDR. На странице контроля данных Ope​nAI он указан как несоответствующий требованиям, а состояние приложения сохраняется до его удаления. Таким образом, в GPT-6 Astra скидка 50% на уровне Batch и Zero Data Retention (нулевое хранение данных) взаимно исключают друг друга — рабочая нагрузка, ограниченная требованиями соответствия, которой необходим ZDR, должна закладывать в бюджет стандартный тариф, а не тариф batch, и указанная выше сумма $94 для неё недоступна.

Ещё три оговорки — прямо, потому что страница, которая перехваливает ZDR, хуже страницы, которая о нём умалчивает. ZDR не абсолютен: в режиме «Eyes Off» OpenAI оставляет за собой право делать модели недоступными для ZDR для отдельных клиентов, с предварительным письменным уведомлением, а в режиме «Safety Retention» контент может сохраняться и проверяться людьми, если классификаторы отметят серьёзный риск. Изображения и файлы, помеченные как потенциальный CSAM, сохраняются для ручной проверки даже при ZDR. И ZDR заканчивается на границе OpenAI — если ваш агент обращается к удалённому MCP-серверу или API другого поставщика, этот трафик регулируется политикой хранения соответствующей стороны, а не этой. Отдельно: резидентность данных — это другой контроль, не ZDR; она требует отдельного одобрения и поправки Modified Retention за пределами США и влечёт 10%-ную надбавку, упомянутую выше. Если вы полагаетесь на кэширование при ZDR, прочитайте страницу OpenAI о контроле данных, чтобы узнать, что именно сохраняется в кэше; мы не собираемся публиковать для него цифру хранения, которую сами не смогли там прочитать.

Ограничения скорости, как задокументировано, и то, которое сработает первым

На странице модели Ope​nAI публикуются следующие лимиты по уровням для GPT-6 Astra — запросы и токены в минуту, затем лимит очереди пакетной обработки:

Уровень 1 — 500 RPM, 500 000 TPM, очередь пакетов 1 500 000

Уровень 2 — 5 000 об/мин, 1 000 000 транзакций/мин, очередь пакетов 3 000 000

Уровень 3 — 5 000 RPM, 2 000 000 TPM, пакетная очередь 100 000 000

Уровень 4 — 10 000 RPM, 4 000 000 TPM, очередь пакетной обработки 200 000 000

Уровень 5 — 15 000 RPM, 40 000 000 TPM, пакетная очередь 15 000 000 000

Два лимита мы обозначим как не задокументированные, а не станем заполнять их сами: нет опубликованного лимита для бесплатного тарифа, поскольку GPT-6 Astra вообще не входит в бесплатный тариф; и мы не обнаружили опубликованного потолка выше Tier 5 и отдельной таблицы лимитов для режима Fast. Если поставщик не опубликовал лимит, считайте его отсутствие нерешённым вопросом — не предполагайте, что он безлимитный.

Первое, что даёт о себе знать при агентской нагрузке, — это 500 000 TPM на Tier 1. Один вызов этой модели может нести транскрипт на 500 000 токенов, а значит, один запрос способен израсходовать целую минуту вашего бюджета токенов на начальном уровне. Контекстное окно на миллион токенов мало чем поможет агенту, который на протяжении 120 ходов держит один и тот же транскрипт, если уровень не может прокачать эти токены. Подбирайте уровень исходя из объёма токенов из приведённого выше примера, а не из количества запросов — и учтите, что повышение уровня зависит от расходов и истории аккаунта, поэтому его стоит оформить до дедлайна, а не в его разгар.

Azure и AWS Bedrock, по одной строке каждый

Microsoft Azure — GPT-6 Astra можно развернуть в Microsoft Foundry под тем же идентификатором gpt-6-astra; в материалах Foundry датой общей доступности указано начало сентября 2026 года, там же сообщается о развертываниях в Global Standard и US Data Zone, об отсутствии EU Data Zone на старте и о тарифах на уровне или близких к прайс-листу OpenAI со строкой для длинного контекста. Мы взяли это из материалов Foundry, а не со страницы каталога самой Microsoft, до которой сегодня не удалось добраться, — проверьте текущий список развертываний, набор регионов и тариф в собственной документации Microsoft, прежде чем планировать развертывание на этой платформе.

AWS Bedrock — указан как openai.gpt-6-astra, доступен через поддерживаемые API Bedrock и подтверждён в еженедельном обзоре AWS от 15 сентября 2026 года, с собственным контуром управления Bedrock (изоляция конечных точек VPC, шифрование KMS, Guardrails) и заявлением AWS о том, что данные инференса не используются для обучения модели. По сообщениям, внутрирегиональный и географический межрегиональный инференс в Bedrock тарифицируется на 10% выше базовых ставок; эта цифра, по нашим данным, получена из вторых рук, поэтому проверьте собственную страницу цен AWS.

Ни один из этих маршрутов не меняет саму модель. Оба меняют процесс закупки — а для корпоративного читателя именно в этом вся суть: развёртывание в Foundry или Bedrock может вписаться в уже действующее облачное обязательство, унаследовать его IAM, логирование и сетевой периметр и попасть в счёт, который финансы уже утвердили, — и это нередко определяет разницу между пилотом и решением, которое действительно доходит до эксплуатации. Размен же в том, что вы принимаете жизненный цикл модели от облака и облачный тариф, а оба облака, по имеющимся данным, предлагают цены на уровне прайс-листа OpenAI или выше, а не ниже.

Где уместен маршрутизатор, включая те части, которые говорят против него

GPT-6 Astra присутствует в каталоге OrcaRouter как openai/gpt-6-astra, а OrcaRouter передаёт прейскурантную цену провайдера с наценкой 0% — цена поставщика — это наша цена, и изменение цены поставщиком отражается в вашем счёте в тот же день, а не при продлении. Для модели по такой цене это не заявление о погрешности округления: приведённая выше арифметика — та же арифметика, которую вы заплатили бы напрямую.

Screenshot of the OrcaRouter catalogue page for GPT-6 Astra, captured 16 September 2026, showing the listing openai/gpt-6-astra from provider OpenAI, a 1M-token context, 128K maximum output, input of text, image and file with text output, a p50 time to first token of 6.70 s and p95 of 10.00 s, $10.00 input and $50.00 output per million tokens, 181.0M tokens of routed traffic over seven days, and an OpenAI-compatible Python sample using base_url https://api.orcarouter.ai/v1.

Честный аргумент в пользу маршрутизации здесь — не цена, а обратимость. Astra примерно в 2,5 раза дороже модели, стоящей ниже, а её стоимость зависит от порога, которым управляет ваша архитектура, поэтому большинство команд хотят сначала опробовать её на части реального трафика, прежде чем закреплять продакшн-путь. Через один ключ вы можете разместить её за тем же эндпоинтом, что и модели, которые вы уже запускаете, направлять ей часть трафика и автоматически переключаться на что-то более дешёвое, когда она не оправдывает разницу в цене, — это изменение конфигурации, а не миграция, при этом один API охватывает более 200 моделей, DSL маршрутизации объединяет несколько моделей в один вызов, а слияние моделей доступно, когда вы хотите, чтобы отвечала целая панель.

Доводы против этого, изложенные прямо. Маршрутизатор — это ещё один переход на пути запроса и ещё один участник потока данных — и в этой модели это не гипотетическая ситуация, потому что ZDR одобряется для каждой организации в OpenAI, а маршрутизированный запрос не покрывается вашим одобрением ZDR автоматически. Если вы передаёте регулируемые данные, уточните условия обработки данных для маршрута, прежде чем отправлять их, и будьте готовы напрямую связаться с поставщиком для этой рабочей нагрузки. Маршрутизация также добавляет компонент, который может отказать или увеличить задержку, и она делает замену моделей настолько простой, что можно изменить то, что отвечает вашим пользователям, без проверки. Ничто из этого не перевешивает аргумент в пользу пробного использования и обратимости для большинства команд; всё это стоит знать, прежде чем решить, что маршрутизатор бесплатен. Мы сравнили платформы маршрутизации друг с другом в отдельном материале, а не повторяем сравнение здесь.

Три вопроса, ответы на которые не состоят из одного предложения

Можно ли дообучить GPT-6 Astra или использовать её с Assistants API? Нет, и то и другое невозможно, и это граница дизайна, а не параметр конфигурации, который вы упустили. На странице модели Ope​nAI в качестве поддерживаемых эндпоинтов перечислены Chat Completions, Responses и Batch, а Fine-tuning и Assistants явно указаны как неподдерживаемые, и в таблице цен Ope​nAI на дообучение нет строки GPT-6 Astra. Если ваша архитектура зависит от дообученной флагманской модели, Astra придётся использовать через промптинг, а это переносит затраты с обучения на входные токены — и при $10.00 за миллион при большом системном промпте это реальная статья бюджета, а не сноска.

Откажется ли модель выполнять работу по безопасности, на которую у меня есть разрешение?Иногда да, и это стоит знать до начала разработки. GPT-6 Astra — первая модель Ope​nAI, достигшая критического порога возможностей в области кибербезопасности в рамках корпоративной Preparedness Framework, и в поставляемом виде она отказывается от выполнения продвинутых киберзадач, таких как написание эксплойтов proof-of-concept. Ope​nAI заявляет, что планирует расширить доступ с менее строгими мерами защиты в рамках своей программы Daybreak. Для защитника это проявляется как отказ, который не является ни ограничением частоты запросов, ни ошибкой — закладывайте его в обработку ошибок, а не повторяйте попытки, упираясь в него.

Нужно ли мне специальное одобрение, чтобы вызывать эту модель? Для стандартной конечной точки — нет: ни списка ожидания, ни этапа одобрения для вызова gpt-6-astra не существует, достаточно аккаунта с оплатой. А вот одобрение может понадобиться на всё, что вокруг: Zero Data Retention, который предоставляется только по заявке; размещение данных за пределами США, требующее отдельного дополнения к договору; и повышение уровня, если вы собираетесь прогонять объёмы токенов агентского масштаба через аккаунт уровня Tier 1. Сама модель — самая простая часть закупки.

За чем следить и кому пора действовать

Если вы строите что-то на этой модели, четыре вещи, за которыми стоит следить, находятся на стороне вендора и все имеют дату. Опубликует ли OpenAI датированный снимок для gpt-6-astra — это превратило бы голый идентификатор в движущуюся цель и сделало бы фиксацию версии осмысленной. Сдвинется ли порог в 272 000 токенов, потому что эта одна строка значит для вашего счёта больше, чем любой бенчмарк на странице. Сойдутся ли тарифы Bedrock и Foundry с прайс-листом OpenAI или останутся выше него, поскольку это определяет способ закупки не меньше, чем сама модель. И изменит ли программа Daybreak то, от чего будет отказываться эндпоинт, — а для команд безопасности это разница между рабочим инструментом и демо.

Что касается того, кому действовать, разделение чёткое. Если вы уже платите за GPT-5.6 Sol по промо-тарифам за длинногоризонтную агентную работу, то 2.5x — это реальная величина, и вопрос узкий: перевешивает ли доля успешно выполненных задач на вашей собственной нагрузке разницу в цене? Запустите её на срезе реального трафика и выясните — разобранный выше пример подскажет, во сколько обойдётся этот срез, ещё до начала. Если ваша работа — это чат с коротким контекстом или классификация больших объёмов, эта модель не для вас; пересмотр цены для длинного контекста и ставка $50.00 за вывод делают её дорогостоящим способом делать то, что GPT-5.6 Luna выполняет за долю этой цены. А если вы предприятие с требованиями комплаенса, сначала начните разговор о ZDR, потому что от него зависят скидка Batch, надбавка за резидентность и ваш выбор маршрута — и ни одно из этих решений нельзя принять в тот день, когда оно понадобится.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно