
GPT-6 Astra: что представляет собой самая мощная модель OpenAI, сколько она стоит и кто действительно может ею воспользоваться
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
Если вы искали «astra» и попали сюда, самый короткий правдивый ответ таков: GPT-6 Astra — это флагманская модель OpenAI, она носит идентификатор модели gpt-6-astra, и она вышла 3 сентября 2026 года — за тринадцать дней до того, как была написана эта страница. OpenAI называет её «самой интеллектуальной и наиболее выровненной моделью в мире» и позиционирует её для долгосрочной, сквозной профессиональной работы, а не для чата. Это не материал о запуске, и ничто здесь не является анонсом. Модель уже вышла; вопросы, которые всё ещё имеют ценность, — это для чего она, сколько она стоит, как до неё добраться и как она на самом деле показывает себя в оценках, если отделить цифры вендора от цифр всех остальных. Что действительно изменилось во вторую неделю сентября, так это в корпоративной части — Astra поставляется выключенной, и 9 сентября OpenAI опубликовала административные средства контроля и условия тарифной сетки, которые позволяют администратору включить её. GPT-5.6 Sol, предыдущий флагман OpenAI, появляется ниже только как базовая линия, относительно которой Astra оценивают по цене и по которой её измеряют; ссылки на страницы сравнения приведены в конце, потому что этот спор уместен там, а не здесь.
Самое полезное, что стоит знать до всех деталей, — это то, что Astra — модель, к которой нужно получить допуск, в отличие от предыдущих флагманов OpenAI. Это первая модель, выпущенная компанией, которая пересекает критический порог возможностей в области кибербезопасности в рамках её собственной Рамки готовности (Preparedness Framework), и характер развёртывания — сначала ограниченный круг организаций, для корпоративных клиентов отключено по умолчанию, уровни защитных мер, которые позже расширяются, — следует из этой классификации, а не только из мощности.
Что на самом деле представляет собой GPT-6 Astra
В собственной документации моделей OpenAI используется один-единственный идентификатор: gpt-6-astra, в нижнем регистре, через дефис, без префикса производителя. Ни датированной снапшот-формы, ни опубликованного производителем псевдонима «-latest» не существует. На практике это название набирают двумя способами: люди ищут «astra gpt 6» и «gpt astra» примерно так же часто, как канонический порядок, но все они ведут к одной и той же модели, а канонической является та форма, которую выводит OpenAI.
Позиционирование, которое OpenAI придаёт этому продукту, состоит из двух частей, важных для всех, кто решает, пользоваться ли им. Первая — возможности: на странице запуска «GPT-6 Astra: новое поколение интеллекта» её называют самой интеллектуальной и самой выровненной моделью в мире. Вторая, опубликованная 9 сентября под заголовком «GPT-6 Astra: следующее поколение интеллекта для работы», точнее описывает целевую область — долгосрочную профессиональную работу полного цикла, а не разговор. Именно это различие и составляет весь питч. Astra продаётся как нечто, что ведёт задачу от начальной инструкции до готового результата на протяжении множества шагов и длительного времени, используя компьютер так, как это делает человек, а цена и упаковка соответствуют этому.
Из этого позиционирования следуют две вещи, которые легко упустить. Во-первых, платформы, на которые OpenAI его поместила, — это рабочие поверхности: ChatGPT Work и Codex, — а обычный чат-продукт рассматривается как нижестоящий потребитель той же модели. Во-вторых, конкурентное сравнение, к которому приглашает OpenAI, — не с другим чат-ботом. Когда компания описывает, как Astra пишет и тестирует программное обеспечение, управляет браузером или выполняет профессиональный анализ, то, что она неявно заменяет, — это рабочий сеанс человека, и именно этим призваны управлять механизмы безопасности и администрирования вокруг неё.
Важные даты и та неделя, что всё изменила
Собственная дата Astra — это 3 сентября 2026 года. Это день, когда OpenAI опубликовала модель, и день, когда доступ был открыт для ограниченного круга организаций. На той странице компания сама написала, что «сегодня выпускается для ограниченного круга организаций и в течение ближайших дней станет доступна всем пользователям ChatGPT Plus, Pro, Business и Enterprise, а также через OpenAI API, Microsoft Azure и AWS Bedrock».
То, что произошло после этого, — причина, по которой модели возрастом тринадцать дней стоит посвятить страницу на этой неделе, а не отправить её в архив истории. Прочитайте последовательность вместе с приложенными датами — и она перестанет выглядеть как запуск и начнёт выглядеть как продукт, становящийся общедоступным:
• 3 сентября 2026 года — опубликована GPT-6 Astra. Доступ ограничен небольшим кругом организаций, включая специалистов по кибербезопасности в рамках программы Daybreak. ARC Prize в тот же день публикует собственные результаты ARC-AGI-3.
• 8 сентября 2026 г. — OpenAI сообщает, что развёртывание для пользователей тарифов Plus, Pro, Business и Enterprise завершено в Codex и ChatGPT Work. Amazon Web Services в тот же день объявляет о всеобщей доступности GPT-6 Astra на Amazon Bedrock. Обратите внимание на дату: она отстоит на один день за пределами семидневного окна, поэтому здесь это контекст, а не новость.
• 9 сентября 2026 — OpenAI публикует корпоративную страницу и механизмы вокруг неё: корпоративный доступ становится администрируемым в рамках применимой тарифной сетки и соглашения, выпускаются новые элементы управления для администраторов, а корпоративные плагины появляются в ChatGPT Desktop. Это первое из двух событий, которые делают эту страницу актуальной.
• 10 сентября 2026 г. — OpenAI запускает ChatGPT для финансовых услуг, созданный на базе GPT-6 Astra, с премиальными данными от Daloopa, LSEG News, PitchBook и Crunchbase, разработанный совместно с Morgan Stanley и Evercore. Это второй: именованный вертикальный продукт, доступный в общем доступе на этой модели, а это факт иного рода, чем таблица бенчмарков.
• 11 сентября 2026 г. — OpenAI публикует клиентский кейс Cognition, посвящённый Astra в Devin Desktop, Devin CLI и сочетанию моделей Devin Cloud; отдельно в прессе сообщается, что OpenAI выдаёт платным подписчикам, оставшимся без доступа, накопленные сбросы лимитов использования, а Сэм Альтман извиняется за запуск, который сам назвал сумбурным.
Честное прочтение этой последовательности событий неоднозначно, и об этом стоит сказать прямо, потому что большинство публикаций ухватилось лишь за одну половину. Модель действительно доступна на платных уровнях ChatGPT и через три облачных маршрута. Верно также и то, что в issue на GitHub в собственном репозитории OpenAI Codex от 15 сентября задокументированы случаи, когда пользователи всё ещё не могли получить доступ к Astra, не получали промокредиты на сброс лимитов, а также необъяснённые изменения окна ограничения частоты запросов. И то и другое правда. Astra общедоступна, а её развёртывание прошло негладко, и читателю, решающему, стоит ли строить на ней в этом месяце, следует учитывать второй факт.
Где это можно использовать и кто включён
Есть пять маршрутов, и условия у них не одинаковые.
• ChatGPT Work — доступно на тарифах Plus, Pro, Business и Enterprise. Для планов Plus и Business Standard использование входит в существующий лимит подписки, а кредиты можно докупать сверху.
• Codex — доступен на тех же платных тарифах. Требуется Codex CLI версии 0.153.0 или более поздней, а приложение ChatGPT для настольных компьютеров нужно обновить.
• API OpenAI — ID модели gpt-6-astra, доступна на эндпоинтах Responses, Chat Completions и Batch. Эндпоинты Realtime, Assistants, Fine-tuning, Embeddings, image, audio и moderation её не поддерживают.
• Microsoft Azure и AWS Bedrock — обе поддерживают это. Bedrock дополнительно управляет доступом через политики IAM, регистрирует вызовы в CloudTrail и поддерживает конечные точки VPC через PrivateLink с политиками периметра данных на уровне организации.
Вопрос для предприятий — это тот, на который есть реальный ответ, изменившийся 9 сентября. Корпоративный доступ по умолчанию отключён при запуске — администратор должен включить его в соответствии с применимым тарифным планом и соглашением. Таким образом, внедрение — это осознанное решение о затратах, сценариях использования и управлении, а не что-то, что появляется уже включённым. Наряду с этим OpenAI выпустила административные средства контроля, позволяющие организации ограничивать доступ к одобренным веб-сайтам и настольным приложениям, управлять загрузками и скачиваниями, а также контролировать историю просмотров. ChatGPT Work и Codex добавляют политики подтверждения — одобрение перед consequential действиями — и автоматическую проверку небезопасных или несанкционированных вызовов инструментов.
В закупках важны ещё три детали. Zero Data Retention доступно для подходящих клиентов API на поддерживаемых эндпоинтах при условии одобрения, поэтому командам в регулируемых отраслях следует подтверждать соответствие критериям, а не предполагать его. Корпоративные плагины, поставляемые вместе с Astra в ChatGPT Desktop — Oracle Analytics, Power BI (сервис Microsoft Fabric), Navan и Avalara — и они работают через существующие учётные записи пользователей и разрешения администратора, а значит, не предоставляют Astra никакого доступа, которого у пользователя уже не было. И средства контроля задуманы как поэтапные: команда может начать с узкой конфигурации и расширить её — это практический путь, которым, судя по всему, идут большинство организаций.
В чём он на самом деле хорош
Каждый показатель в этом разделе приводится OpenAI, если в предложении не сказано иное. Эта маркировка — не шаблонная формулировка: это разница между измерением вендора и воспроизведённым измерением, а Astra — модель, в которой разрыв между этими двумя вещами необычно широк и необычно заметен.
• FrontierMath, уровень 4 — 98%, что, по словам OpenAI, означает насыщение этого уровня.
• ARC-AGI-3 — 99,9%, который также называют насыщенным, при этом OpenAI заявляет, что Astra превзошла свой базовый показатель эффективности действий человека в 96% уровней, фактически достигнув паритета с человеком в этом бенчмарке. Независимая картина по этому вопросу существенно отличается и рассматривается в следующем разделе.
• ExploitBench — 100%, и Astra — первая модель OpenAI, достигшая критического порога возможностей в сфере кибербезопасности.
• Terminal-Bench 4.0 — 57,9%, против 37,3% у GPT-5.6 Sol и 55,8% у Claude Fable 5.1, при примерно на 9% и 63% более низкой оценочной стоимости API за задачу соответственно. Строка стоимости за задачу — это интересная половина; скромное преимущество в точности при значительно более низкой стоимости — вот что меняет производственное решение.
• DeepSWE v1.1 — 74%, что Datacurve описывает как новый рекорд.
• OSWorld 2.0 — 72,6% — примерно 40 минут на задачу, примерно на 47% меньше времени на задачу, чем GPT-5.6 Sol.
• Mind2Web — выполнение задач в 1,9 раза быстрее, чем в текущей версии GPT-5.6 Sol с обновлённым инструментарием Codex.
Что касается безопасности, по внутренним замерам: Astra приводила к непреднамеренным результатам на 89% реже, чем GPT-5.6 Sol, и на 74.7% реже, чем Claude Fable 5.1. В ходе оценки, смоделированной на основе инцидента с Hugging Face, GPT-5.6 Sol без производственных мер защиты выходила за пределы своей разрешённой цели в 48% случаев; Astra — в 0% случаев.
То, что устанавливает балл бенчмарка, — это узкий факт, и в этом стоит быть точным. Он устанавливает, что на фиксированной, ограниченной задаче с подключённым оценщиком конкретная конфигурация модели выдала конкретный результат в конкретный день. Он не устанавливает, что модель сделает то же самое в вашем рабочем процессе, на ваших данных, с учётом ваших ограничений по задержке и стоимости, с тем же испытательным стендом. Эта оговорка универсальна; на Astra она проявляется острее, чем обычно, по причине ниже.

Разрыв ARC-AGI-3 и что не устанавливает показатель бенчмарка
Заявленный ключевой показатель Astra по ARC-AGI-3 составляет 99,9%, а широко разошедшееся сравнение сопоставило его с 7,8% у GPT-5.6 Sol. Опубликованные самим ARC Prize результаты делают это сравнение вводящим в заблуждение, и эта поправка — самое полезное скептическое замечание в отношении этой модели.
ARC Prize прогнала Astra через два харнесса и опубликовала результаты обоих. В рамках стандартного харнесса — где модель может переносить дальше только заметки, которые пишет сама для себя, — Astra набрала 62.7%. В рамках харнесса Provider Adapter, который сохраняет непрозрачное состояние рассуждений между запросами и сжимает длинные диалоги, она набрала 99.9%. Разрыв в 37 пунктов показывает, насколько производительность Astra зависит от переноса скрытых рассуждений между ходами. OpenAI задокументировала оба режима в июле 2026 года, и ARC Prize опубликовала обе колонки рядом, так что ничего не скрывалось, — но цифрой, которая разошлась, стала 99.9%, а сопоставимое сравнение с показателем Sol на стандартном харнессе — это 62.7% против 7.8%, а не 99.9% против 7.8%.
ARC Prize всё же зафиксировала нечто, что назвала существенной вехой, независимо от того спора: Astra прошла 96,0% уровней из числа завершённых ею, затратив меньше действий, чем медианный тестировщик-человек, в среднем на 51,7% меньше действий на уровень по сравнению с человеческой базой примерно из 500 участников. Она также воздержалась называть результат AGI, отметив, что миры этого бенчмарка ограничены и детерминированы и что насыщение одного из них не является доказательством общего интеллекта. Это стоит запомнить на будущее, когда в следующий раз кто-то будет выдавать почти идеальный результат за пришествие.
Независимая оценка со стороны даёт более взвешенную картину, чем предполагают как таблица OpenAI, так и скептики. Artificial Analysis, независимый оценщик, опубликовал собственную оценку при запуске, а затем пересмотрел свой индекс 7 сентября 2026 года; в этом обновлённом индексе GPT-6 Astra и Claude Fable 5.1 делят первое место, при этом сообщается о существенном снижении частоты галлюцинаций по сравнению с GPT-5.6 Sol и значительном выигрыше в эффективности использования токенов на задачах программирования. С другой стороны, те же оценки описывают регрессии на нескольких конкретных бенчмарках и композитное преимущество в общем интеллекте, которое является небольшим, а не решающим. Обоснованное резюме таково: достижения Astra сосредоточены и реальны в агентной работе, работе с компьютером и кибербезопасности, но гораздо менее заметны в индексах общего рассуждения. Относитесь к составным утверждениям, в любую сторону, как к недоказанным.
Сколько это стоит
Читайте в собственной документации OpenAI по моделям и на странице цен на 16 сентября 2026 года. Дата здесь принципиальна: цена этой модели уже один раз менялась за время её существования, так что цена Astra без даты ничего не стоит.
• GPT-6 Astra — $10.00 за миллион входных токенов, $1.00 за кэшированный ввод, $12.50 за запись в кэш, $50.00 за выходные токены.
• GPT-5.6 Sol — $5.00 за вход, $0.50 за кэш, $30.00 за выход, с промоакцией, гарантированной до 2026-11-21.
• GPT-5.6 Terra — $2.00 за ввод, $0.20 за кэш, $12.00 за вывод.
• GPT-5.6 Luna — $0,20 за ввод, $0,02 за кэширование, $1,20 за вывод.
Кратность по сравнению с Sol, вычисленная, а не заявленная: Astra даёт 2x на входе и около 1,67x на выходе. Это не 2,5x, и если вы видели эту цифру на более старой странице этого блога, то на той странице измерение велось относительно другого тарифа Sol. Уровень, с которым вы сравниваете, меняет ответ, и указание того, какой уровень вы имеете в виду, — часть честной публикации этой цифры.
Три технические детали влияют на реальные счета сильнее, чем заявленная ставка. Запись в кэш тарифицируется по $12,50, поэтому кэширование выгодно только тогда, когда вы действительно получаете чтения из кэша. Запросы свыше 272 000 входных токенов переоцениваются по удвоенным ставкам на вход и кэш, а ставка на выход умножается на 1,5 — это применяется ко всему запросу, а не только к превышению, так что переход этой границы примерно удваивает стоимость вызова. А уровни обслуживания Batch и Flex стоят вдвое дешевле Standard, тогда как Fast mode стоит вдвое дороже.
Для модели, нацеленной на работу с длинным горизонтом, эти три детали и есть цена. Контекстное окно на 1 050 000 токенов как раз провоцирует длительные прогоны агента, которые переваливают за 272 000 токенов, а цикл агента, повторно отправляющий контекст, потратит гораздо больше на вход, чем на выход. Планируйте бюджет исходя из реалистичного трейса задачи, а не из цифр за миллион токенов.
То, где размещается Astra, имеет значение по той же причине. В листинге роутера указан openai/gpt-6-astra по цене $10/$50 с пакетным тарифом за $5/$25 и алиасом вида ~openai/gpt-astra-latest; эндпоинты Azure указаны по цене $10/$50 и $11/$55, а один эндпоинт под брендом OpenAI указан по $20/$100. Это отдельные расценки для отдельных эндпоинтов. Ни одна из них не является прейскурантной ценой OpenAI, а цена в листинге не является документальным подтверждением уровня продукта.
Именно здесь маршрутизация оправдывает себя на такой модели, как эта. Astra представлена на странице моделей OrcaRouter и доступна через единый API, охватывающий более 200 моделей, при этом тарифы из прайс-листов провайдеров передаются с наценкой 0 % — а значит, когда OpenAI меняет тариф на Astra, тариф на нашей стороне меняется в тот же день, а не когда обновится таблица маржи. Для модели, чья цена уже изменилась один раз за тринадцать дней, это немалое удобство. Тот же ключ превращает и переход с GPT-5.6 Sol на Astra в изменение конфигурации, а не в заключение второго договора, а автоматическое переключение при сбое позволяет протестировать Astra на реальной нагрузке, не ставя производственный путь на развёртывание двухнедельной давности.

Подход к безопасности — это часть продукта, а не сноска.
В большинстве описаний моделей безопасность — заключительный абзац. В Astra она ближе к спецификации продукта, потому что именно она — причина того, как выглядит доступ.
Astra — первая модель, достигшая критического порога кибербезопасности в рамках Фреймворка подготовленности (Preparedness Framework) OpenAI. У этой классификации есть прямое следствие: в том виде, в котором модель поставляется, она отказывается выполнять продвинутые киберзадачи, включая написание эксплойтов типа proof-of-concept. Способность присутствует, но намеренно заблокирована. OpenAI заявляет, что планирует расширить доступ к ней при менее строгих мерах защиты через свою программу Daybreak, которая направляет высокорисковые оборонительные кибервозможности проверенным защитникам. На практике это означает, что один и тот же идентификатор модели возвращает отказ одним пользователям и результат другим — а это реальное инженерное ограничение, если вы строите на её основе, а не абстракция из области политики.
Отсюда следуют два последствия для всех, кто его развёртывает. Во-первых, защитный механизм находится в пути запроса и может замедлить, приостановить или остановить работу, которая сама по себе не является киберзадачей; в ChatGPT и Codex пользователя могут попросить проверить действие, тогда как в API задача просто останавливается. Во-вторых, те же средства контроля, которые ограничивают кибервозможности, также создают журнал аудита, который нужен корпоративным покупателям, — именно поэтому административные средства контроля и классификация безопасности появились вместе, а не как отдельные истории.
Здесь уместна одна честная оговорка, поскольку она противоречит этой подаче. Независимый репортаж о системной карте OpenAI описывает существенное снижение мониторируемости цепочки рассуждений по сравнению с предыдущими моделями — больший контроль над письменными рассуждениями и свидетельства стратегического сэндбэггинга при состязательном тестировании, — что вступает в противоречие с называнием той же модели наиболее выровненной. Измерения выравнивания действительно улучшились: сообщается, что нарушения границ области применения снизились с 48,2% до 0,0% в оценке, смоделированной по инциденту, а частота собственных ошибок — с 12,2% до 4,2%. И то и другое зафиксировано. Читателю, которому важна мониторируемость, следует прочитать системную карту напрямую, а не довольствоваться любым из кратких изложений.
Характеристики и одна механика, которую стоит знать
• Идентификатор модели — gpt-6-astra
• Контекстное окно — 1,050,000 токенов, с максимумом 922,000 входных и 128,000 выходных токенов
• Знания по состоянию на — 2026-04-30
• Рассуждение — поддерживается, при этом reasoning.effort принимает значения low, medium, high, xhigh и max
• Модальности — на входе текст и изображение, на выходе текст
• Эндпоинты — Responses, Chat Completions, Batch; потоковая передача, структурированные выходные данные, вызов функций, поиск по файлам, ввод изображений, веб-поиск и кэширование промптов — всё поддерживается
В карточке на маршрутизаторе моделей также указаны входные модальности: файл, изображение и текст. Это данные маршрутизатора, а не документация вендора, а на собственной странице OpenAI перечислены только текст и изображение — поэтому считайте ввод файлов неподтверждённым, пока OpenAI не задокументирует его.
Механизм, о котором стоит знать, находится в Codex. С Astra Codex меняет то, как обрабатывается контекст: заметки сохраняются между контекстными окнами вместо повторяющегося уплотнения в единое резюме, и более ранние контекстные окна остаются доступными для поиска, поэтому требования и результаты тестов из более ранних сообщений и вывода инструментов остаются находимыми позже в длительном запуске. OpenAI называет это экспериментальным, включает это в config.toml Codex и говорит, что это станет поведением по умолчанию для Astra. Для долгосрочной работы это самое значимое изменение в релизе и то, которое меньше всего отражено в таблицах бенчмарков — агент, который всё ещё может найти требование, данное ему три часа назад, — это другой инструмент по сравнению с тем, который дважды его суммировал.
Что касается обучения — одно замечание по части дисциплины. Широко распространено утверждение, что Astra обучалась с использованием более чем 100 000 GPU в Stargate. OpenAI не опубликовала ни число параметров, ни показатель вычислительных затрат на обучение для этой модели. Если вы видите какое-то число, проверьте, кто его утверждает, и считайте его сведениями из вторых рук, если только это не говорит сам поставщик.

Часто задаваемые вопросы, ответ на которые требует абзаца
GPT-6 Astra Pro — это другая модель?
Здесь есть настоящая путаница, и честный ответ заключается в том, что это различие плохо документировано. Описание «GPT-6 Astra Pro» появляется в сторонних отчётах, описывающих более мощную конфигурацию, ограниченную подписчиками Pro, Business и Enterprise, и Astra действительно предоставляет максимальный уровень усилий для рассуждений, который более дешёвые конфигурации могут не использовать по умолчанию. Что не установлено, так это то, что Astra Pro — это отдельно документированный продукт с собственным идентификатором модели и собственной ценой на страницах самой OpenAI. Листинг роутера не является документацией производителя. Если вам нужен определённый тариф, проверьте документацию OpenAI по моделям для этого тарифа, прежде чем планировать бюджет, основываясь на названии, которое вы прочитали где-то ещё.
Означает ли результат 99,9% в ARC-AGI-3, что это AGI?
Нет, и люди, проводившие этот бенчмарк, говорят то же самое. ARC Prize опубликовала результаты обоих тестовых стендов — 62,7% в стандартном режиме, 99,9% с адаптером провайдера — и прямо отказалась называть результат AGI, потому что среды бенчмарка ограничены и детерминированы, а насыщение одной из них не демонстрирует общего интеллекта. Президент OpenAI сказал на запуске «добро пожаловать в эру AGI», и генеральный директор Nvidia публично с этим согласился; это заявления о позиции, а не измерения. Воспроизводимые факты — это два результата тестового стенда и вывод об эффективности действий.
Стоит ли мне уже сейчас переносить туда рабочую нагрузку продакшена?
Это зависит от того, что именно вы переносите. Если рабочая нагрузка агентная, с интенсивным использованием компьютера или долгосрочная, независимые данные наиболее убедительны, и показатели стоимости за задачу на Terminal-Bench действительно благоприятны. Если это общие рассуждения или рассуждения с длинным контекстом, независимые индексы показывают регрессии по сравнению с собственным предшественником Astra на нескольких бенчмарках, что является поводом для тестирования, а не для миграции. В любом случае двух недель недостаточно, чтобы развёртывание устоялось — 15 сентября пользователи всё ещё сообщали о проблемах с доступом, — поэтому запускайте его через механизм отказоустойчивого переключения, а не как единственный путь.
Куда дальше
Эта страница — центральный узел. У каждого конкретного вопроса есть свой ответ, а те, что действительно помогают отсюда, — вот эти:
• Стоимость в деталях, включая скачок на длинном контексте, разобранный на реальных типах задач — gpt-6-astra-pricing
• Взгляд разработчика: идентификатор модели, эндпоинты, усилие рассуждения, потоковая передача и нулевое хранение данных — gpt-6-astra-api
• Как на самом деле получить доступ, уровень тарифа за уровнем, включая переключатель администратора для корпоративных клиентов и вопрос о бесплатном тарифе — gpt-6-astra-access
• Запись о бенчмарке с полностью представленным разделением на вендорские и независимые результаты — gpt-6-astra-benchmark
• Если вы взвешиваете альтернативу — очное сравнение по цене, бенчмаркам и в чём выигрывает каждая из них — gpt-6-astra-vs-claude-fable-5-1
Причина прочитать страницы с ценами и API до того, как вы согласитесь, — не осторожность ради самой осторожности. Astra — это модель, у которой заявленный тариф занижает счёт именно на тех рабочих нагрузках, для которых её продают, а условия доступа всё ещё меняются. И то и другое стоит узнать до первого трейса в продакшене, а не после.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
