
Бенчмарки GPT-6 Astra: каждый результат, кто его измерил, и где числа перестают что-либо значить
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
GPT-6 Astra набирает 98% в FrontierMath Tier 4 и 99,9% в ARC-AGI-3, и сама OpenAI называет оба бенчмарка насыщенными — из-за чего два самых часто цитируемых числа на странице модели оказываются теми двумя, которые меньше всего говорят о том, стоит ли её использовать. По сравнению с GPT-5.6 Sol и Claude Fable 5.1, строки, которые действительно различают, находятся в другом месте: 57,9% в Terminal-Bench 4.0, 74% в DeepSWE v1.1 — независимый и к тому же ничейный результат — и показатель времени на задачу, который для удобства использования значит больше, чем любой процент здесь. Сама модель вышла 3 сентября 2026 — на момент публикации ей тринадцать дней, а не новость о запуске. Это справочная страница о том, какие результаты показывает GPT-6 Astra, кто проводил каждое измерение и что каждое число доказывает, а что нет.
Причина, по которой тринадцатидневной модели всё ещё стоит посвятить страницу на этой неделе, заключается в том, что то, чем читатель может воспользоваться, появилось уже после запуска. Широкий доступ завершён: 8 сентября OpenAI сообщила, что Astra полностью развёрнута для пользователей Plus, Pro, Business и Enterprise в Codex и ChatGPT Work, тогда как 3 сентября запуск сопровождался формулировкой, что она «развёртывается сегодня для ограниченного набора организаций и в ближайшие дни станет доступна всем пользователям ChatGPT Plus, Pro, Business и Enterprise, а также через OpenAI API, Microsoft Azure и AWS Bedrock». Корпоративный доступ, отключённый по умолчанию при запуске, стал тем, что администратор может включить в рамках своего применимого тарифного плана, а страница OpenAI о корпоративной работе с этой моделью — опубликованная 9 сентября — принесла вместе с собой административные средства контроля и четыре корпоративных плагина. И появились первые независимые оценки модели — именно это превращает её из таблицы с результатами, считанной с презентации вендора, в нечто такое, что покупатель может взвесить.
Полный список бенчмарков, с источником в каждой строке
Всё ниже приведено по данным OpenAI, если в строке не указано иное. Это различие не для украшения: только одна из этих главных цифр была получена не компанией, продающей модель, а кем-то другим, и именно она оказывается ничьей.
• FrontierMath Tier 4 — 98%. Заявлено вендором OpenAI, который также описывает этот уровень как насыщенный.
• ARC-AGI-3 — 99,9%. Заявлено самим производителем; также описывается как достигший насыщения. OpenAI добавляет, что Astra «превзошла наш базовый уровень человеческой эффективности действий на 96% уровней, фактически достигнув паритета с человеком в этом бенчмарке» — утверждение более конкретное и более интересное, чем 99,9%, и всё равно основанное на собственных измерениях OpenAI.
• ExploitBench — 100%.По данным вендора — и безупречный результат.
• Terminal-Bench 4.0 — 57,9%.По данным производителя OpenAI, по сравнению с 37,3% у GPT-5.6 Sol и 55,8% у Claude Fable 5.1 — при оценочной стоимости API за задачу примерно на 9% и 63% ниже соответственно. Показатели стоимости не сопровождаются опубликованной методологией в материалах, которые мы читали.
• DeepSWE v1.1 — 74%. Измерено Datacurve, а не OpenAI. Это независимая строка.
• OSWorld 2.0 — 72,6%.По данным вендора, примерно 40 минут на задачу, что, по оценке OpenAI, примерно на 47% меньше времени на задачу, чем у GPT-5.6 Sol.
• Mind2Web — завершение задач в 1,9 раза быстрее, чем «текущий опыт работы с GPT-5.6 Sol», с обновлённым харнессом Codex. По данным вендора; при этом сравнение идёт с Sol, использующим другой харнесс, а не с той же обвязкой, в которую помещена другая модель.
• Безопасность — внутренняя информация OpenAI. Astra приводила к непреднамеренным результатам на 89% реже, чем GPT-5.6 Sol, и на 74.7% реже, чем Claude Fable 5.1. В ходе оценки, смоделированной по инциденту с Hugging Face, GPT-5.6 Sol без эксплуатационных средств защиты выходил за рамки разрешённой цели в 48% случаев; Astra — в 0% случаев.

Насыщение означает, что бенчмарк перестал быть причиной для покупки.
Когда OpenAI говорит, что FrontierMath Tier 4 и ARC-AGI-3 насыщены, он говорит нечто конкретное, и это стоит понимать буквально: тесты перестали различать. Бенчмарк оправдывает своё существование тем, что разделяет модели — создавая разрыв между лучшей системой и следующей за ней, чтобы покупатель мог прочитать число как разницу. Как только каждая передовая модель достигает потолка или оказывается в пределах шума от него, оценка перестаёт измерять модели и начинает измерять оставшийся запас теста.
Что это означает для этой страницы: 98% и 99,9% не должны использоваться для какого-либо выбора. Они не являются доказательством того, что Astra лучше, чем GPT-5.6 Sol или Claude Fable 5.1, в математике или абстрактном мышлении; они являются доказательством того, что все три модели переросли эти уровни. Разницу между 99,9% и 98% нельзя истолковать как преимущество в 1,9 пункта в сколько-нибудь значимом смысле, потому что разброс от запуска к запуску при оценках такого масштаба больше, чем этот разрыв. Число вендора на потолке — это утверждение о потолке.
Они не бесполезны. Насыщение — это подлинная информация об уровне: оно говорит вам, что бенчмарк, который вы, возможно, использовали для сравнения моделей в 2025 году, больше не будет их ранжировать, и что вам следует перестать придавать ему вес в решении о закупке. Оно также говорит, что интересное утверждение о возможностях переместилось в другое место — показатель эффективности действий человека, равный 96% от уровней, — это попытка OpenAI сказать что-то за пределами потолка, и именно с этим подтезисом стоит спорить, а не с 99,9%.
Есть и второе предостережение, которое относится ко всем трём верхним строкам. FrontierMath Tier 4 и ARC-AGI-3 опубликованы достаточно подробно, чтобы их можно было распознать, но конфигурация харнесса, сэмплирования и подсчёта баллов, которую использовал OpenAI, не изложена в материалах, которые мы читали, а 99,9% на бенчмарке, где протокол — это закрытая конфигурация, — это число, которое можно процитировать, но нельзя проверить. Если результат приводится без опубликованной методологии, скажите об этом и двигайтесь дальше. Именно так мы и поступаем с ними.
100% у ExploitBench измеряет возможность, которую большинство пользователей не может себе позволить
Идеальный результат — это тоже потолок, и у этого потолка необычная вторая половина. Astra — первая модель, достигшая критического порога кибервозможностей в рамках Preparedness Framework от OpenAI — именно поэтому её запуск вообще был ограничен. В выпущенном виде модель отказывается выполнять продвинутые киберзадачи, такие как написание proof-of-concept-эксплойтов; OpenAI заявляет, что планирует расширить доступ с помощью менее строгих защитных мер в рамках программы Daybreak.
Итак, ExploitBench — это одновременно самое впечатляющее число в списке и наименее пригодное для использования. Он подтверждает, что такая возможность существует, и что OpenAI измерила её и приняла меры по результатам измерения — что является честной интерпретацией обозначения Critical и причиной того, что развёртывание было поэтапным, а не мгновенным. Он не подтверждает, что вы можете что-либо сделать с этой возможностью через публичный API, потому что по замыслу вы в основном не можете. Если ваш сценарий использования — наступательная безопасность, то соответствующая строка в документации — это не 100%, а поведение при отказе и путь доступа программы Daybreak.
Terminal-Bench 4.0: преимущество над Sol в 24,6 пункта и разрыв в 2,1 пункта, который ничего не решает
Terminal-Bench 4.0 — это тот случай, когда вендорские цифры начинают приносить пользу, потому что разброс достаточно широк на одном конце, чтобы пережить шум, и достаточно узок на другом, чтобы ничего не сообщать. На фоне 37,3% у GPT-5.6 Sol результат Astra в 57,9% — это разрыв в 24,6 пункта, достаточно большой, чтобы различия в испытательных стендах вряд ли могли полностью его объяснить, хотя это всё ещё один вендор, измеряющий собственную модель и предшественника, которого он тоже создал. На фоне 55,8% у Claude Fable 5.1 преимущество в 2,1 пункта находится в диапазоне, где следует прямо сказать, что это ничего не решает. Две модели, измеренные в двух разных испытательных стендах, на бенчмарке, допуски по оценке которого не опубликованы на прочитанной нами странице, с разницей в два пункта — это ничья с лишними шагами. Если ваше решение зависит от этих 2,1, вы не нашли решение — вы нашли маркетинговую фразу.
Утверждение о стоимости за задачу заслуживает отдельного предложения с долей скепсиса. OpenAI оценивает Astra примерно на 9% ниже по стоимости API за задачу, чем Sol, и на 63% ниже, чем Claude Fable 5.1, на этой рабочей нагрузке. Это оценки, опубликованные без стоящего за ними учёта на уровне задач, а «стоимость за задачу» — это не свойство модели; это свойство модели, харнесса, бюджета токенов и политики повторных попыток вместе взятых. Направление правдоподобно: Fable 5.1 — это модель за $10/$50, как и Astra, но задача, на которую уходит больше шагов, стоит дороже. Воспринимайте эти проценты как собственный учёт OpenAI, а не как тарифную сетку.
DeepSWE v1.1: независимая строка и ничья внутри неё
Единственный показатель, полученный не от OpenAI, — самый ценный, и при этом именно он больше всего нуждается в оговорках. А вот у Datacurveв DeepSWE v1.1 — долгосрочном бенчмарке по программной инженерии из 113 задач в 91 репозитории на пяти языках, прогоняемом через единый харнесс mini-swe-agent, — GPT-6 Astra набрала 74% ±3% Pass@1 при средней стоимости $6,52 за задачу, выдав 30 тыс. выходных токенов за 29 шагов. Datacurve называет этот результат рекордом.
Прочитайте таблицу, и рекорд — ничья. Тот же снимок таблицы лидеров, который мы читали 16 сентября 2026 года — датированный 3 сентября 2026 года — показывает gemini-3.8-flash [high] также на 74%, с более узким интервалом ±1%, и claude-opus-5 [max] на 74% ±4%, а gpt-5.6-sol [max] отстаёт на один пункт с 73% ±3%. Три модели делят высший балл с перекрывающимися доверительными интервалами, и сама таблица отмечает, что её лучшие модели группируются в узком диапазоне. Ничто на ней не указывает на обладателя рекорда. Рекорд, который три модели удерживают одновременно, в пределах погрешности, — это совсем иное утверждение, чем «новый рекорд», и честная формулировка такова: Astra достигает верхнего кластера в самой сильной доступной независимой оценке кодинга и не отделяется от него.
Что отличает и что скрывает один лишь балл, — это как он к этому пришёл. 74% у Astra потребовали 29 шагов и 30 тыс. выходных токенов. Показавший тот же результат участник gemini-3.8-flash потребовал 166 шагов и 143 тыс. выходных токенов; claude-opus-5 — 99 шагов и 118 тыс. Тот же балл, примерно пятая часть работы — это реальное и полезное свойство для всех, кто платит за токен или ждёт агента, и цифры Datacurve подтверждают это так, как не способны вендорские строки OpenAI. Однако строка затрат говорит об обратном: при $6,52 за задачу Astra — самая дешёвая из трёх, только если не учитывать, что gemini-3.8-flash достиг того же балла при $2,36. В этом бенчмарке Astra эффективна по числу шагов и имеет среднюю цену в долларах. Берите равный балл и количество шагов; не принимайте это за «рекорд».
OSWorld 2.0 и время на задачу: число, которое решает, можно ли использовать агента
OpenAI сообщает о 72,6% на OSWorld 2.0 при примерно 40 минутах на задачу — примерно на 47% меньше времени на задачу, чем GPT-5.6 Sol. Это заслуживает большего веса, чем можно предположить по его месту в списке, потому что для агентов, работающих с компьютером, счёт — лишь половина решения. Уровень выполнения 72,6% — это хорошо; 72,6% при 40 минутах на задачу — это другой продукт по сравнению с тем же показателем при 75 минутах, и разница не в процентах. Она в том, сколько задач команда может провести за рабочий день, сколько реального времени человек ждёт, пока работает агент, и не съедает ли одна застрявшая задача остаток дня.
Две оговорки, и обе они важнее заголовка. Во-первых, эта цифра заявлена вендором, и мы не нашли независимой оценки Astra по OSWorld 2.0, с которой её можно было бы сверить, — запись в независимом индексе, которую мы читали, не включает OSWorld среди своих компонентов, так что нет второго измерения, которое можно было бы поставить рядом с этим. Во-вторых, «примерно 40 минут» — это среднее, а средние скрывают то, что операторы реально ощущают: хвост распределения. От того, завершается ли самый медленный дециль задач за час или за четыре, зависит, нужен ли агенту человек, сидящий рядом, а это распределение не публикует ни один вендор. Заявление Mind2Web — о выполнении задач в 1,9 раза быстрее, чем в текущем опыте работы с GPT-5.6 Sol, — имеет ту же проблему, немного усугублённую тем, что сравнение идёт с Sol в другой обвязке, а не с тем же каркасом с другой моделью внутри. То, что здесь быстрее, правдоподобно; насколько быстрее — на вашей рабочей нагрузке — не измерено.

Оценки безопасности — это тоже измерения, и эти — внутренние.
Показатели безопасности должны быть в справочнике по бенчмаркам, а не в сноске, потому что это утверждение того же рода, что и строки производительности: измерение, выполненное заинтересованной стороной, с указанным сравнением. Astra вызывала непреднамеренные исходы на 89 % реже, чем GPT-5.6 Sol, и на 74,7 % реже, чем Claude Fable 5.1. В ходе оценки, смоделированной по инциденту с Hugging Face, GPT-5.6 Sol без эксплуатационных мер защиты выходил за пределы своей разрешённой цели в 48 % случаев; Astra — в 0 % случаев.
Направление значимо, а арифметика несимметрична. Одна сторона этого второго сравнения — явно модель со снятыми защитными механизмами, а другая — Astra в поставляемом виде, поэтому разрыв 48 против 0 отчасти измеряет защитные барьеры, а не лежащую в основе модель, и интерпретация его как «Astra безопаснее Sol» преувеличивает то, что было протестировано. Показатели 89% и 74,7% являются внутренними для OpenAI и не имеют внешнего воспроизведения, причём на оценке, устройство которой мы не можем изучить. Все три указывают в одну сторону, и все три принадлежат самому поставщику; считайте их обнадёживающими и невоспроизведёнными. Кроме того, для корпоративного покупателя это именно те строки, которые важнее всего, чтобы они были правдой, — и именно поэтому это те строки, по которым вам следует просить поставщика представить доказательства, а не те, которые вы принимаете со страницы запуска.
Цена: $10 / $50, прочитано 16 сентября 2026 г. — и 2,5x, которому нужен знаменатель
Страница бенчмарка, где не указана цена, — это страница, которая останавливается на полпути. Согласно собственной документации OpenAI по ценам от 16 сентября 2026 года, стандартная ставка для короткого контекста для gpt-6-astra составляет $10.00 за миллион входных токенов, $1.00 за миллион кэшированных входных и $50.00 за миллион выходных. Примерно вдвое дороже обходятся запросы с длинным контекстом — около $20 за миллион входных и $75 за миллион выходных. При контексте менее 1.05M токенов не нужно планировать множитель для длинного контекста, но выше этого порога эффективная ставка меняется, и это стоит смоделировать, прежде чем предполагать, что цифра $10 применима к запуску агента на большой кодовой базе.
Сравнение, которое публикуют все, — это Astra против GPT-5.6 Sol, и именно здесь недатированный кратный показатель даёт осечку. Тариф Sol на той же странице, в тот же день, составляет $4.00 за ввод / $0.40 за кэш / $20.00 за вывод, и OpenAI заявляет, что это промо-цена, действующая как минимум до 21 ноября 2026 года. На фоне этой промо-цены Astra — это 2.5xи по вводу, и по выводу. На фоне предпромо-прайса Sol $5.00 / $0.50 / $30.00 Astra — это 2xпо вводу и примерно 1.67xпо выводу. Оба числа верны; они делятся на разные знаменатели. 2.5x — это то, что вы платите сегодня, 2x и 1.67x — то, что вы платили бы, если промо-акция Sol закончится, — а поскольку OpenAI не опубликовала тариф после окончания промо, никто не может сказать, какой из них стоит использовать в вашем бюджете на 2027 год. Если вы видите «2x» или «2.5x» без указания тарифного уровня и даты, вы читаете половину факта.
Ещё два замечания о ценах, потому что их путают с ценой по прайс-листу. Ценовые предложения для эндпоинтов отличаются от собственной карточки OpenAI: эндпоинты Azure указывались и как $10/$50, и как $11/$55, как минимум один эндпоинт указывался как $20/$100, а в листинге роутера показаны $10/$50 с пакетным тарифом $5/$25. Это ценовые предложения для отдельных эндпоинтов, а не цена OpenAI по прайс-листу, и они не взаимозаменяемы. А для понимания масштаба, на той же странице и в ту же дату: GPT-5.6 Terra — $2.00 / $0.20 / $12.00, а GPT-5.6 Luna — $0.20 / $0.02 / $1.20, — так что Astra — не та модель, через которую вы рефлекторно пропускаете массовый трафик. Её цена рассчитана на работу, которую описывают строки бенчмарка выше: долгосрочные сквозные задачи, где на 47% меньше реального времени выполнения и меньше шагов агента могут оправдать тариф за токены в 2,5 раза выше, а не для чата.
Вот та арифметика, в которой маршрутизирующий слой оправдывает своё место, и стоит конкретно объяснить, почему.openai/gpt-6-astra присутствует в каталоге OrcaRouter, а платформа передаёт прайс-листовые тарифы OpenAI с наценкой 0% — поэтому изменение цены поставщика, включая промо-тариф, от которого зависит этот раздел, вступает в силу на нашей стороне в тот же день, а не в рамках цикла пересмотра цен. Это также означает, что вопрос об уровне, поднятый выше, перестаёт быть гипотетическим: вы можете задействовать Astra на долгосрочных задачах, а Sol, Terra или Luna оставить на объёмной работе, за одним ключом, без второго контракта или изменений в коде, и переключаться между ними, если один из них деградирует.

Спецификации, изменение в Codex и то, что OpenAI не опубликовала
• Идентификатор модели — gpt-6-astra в собственной документации OpenAI.
• Контекст и вывод — контекстное окно на 1 050 000 токенов, максимум 128 000 выходных токенов.
• Дата отсечения знаний — 30 апреля 2026 года. Поддержка токенов рассуждения: да.
• Модальности — входные данные указаны как файл, изображение и текст. Это конкретное перечисление исходит от роутера, а не от OpenAI, и мы помечаем его как сообщённое роутером, а не подтверждённое вендором.
• Доступно в — ChatGPT Work, Codex и API, а также в Microsoft Azure и AWS Bedrock. Корпоративные рабочие пространства по умолчанию отключены; администратор включает доступ в соответствии с применимым тарифным планом и получает средства управления для ограничения одобренных веб-сайтов и настольных приложений, управления загрузками и скачиваниями и контроля истории просмотров. ChatGPT Work и Codex добавляют политики подтверждения перед действиями с последствиями и автоматическую проверку небезопасных или несанкционированных вызовов инструментов. Четыре корпоративных плагина поставляются вместе с ними в ChatGPT Desktop: Oracle Analytics, Power BI (сервис Microsoft Fabric), Navan и Avalara. Zero Data Retention доступно для соответствующих критериям клиентов API на поддерживаемых конечных точках при условии одобрения.
Об одном механизме стоит упомянуть, потому что он меняет поведение модели при длительных задачах, а не то, как она набирает баллы. Codex получает новый подход к контексту с Astra: заметки сохраняются между контекстными окнами, а не многократно сжимаются в одну сводку, и более ранние контекстные окна остаются доступными для поиска, поэтому требования и результаты тестов из более ранних сообщений и вывода инструментов по-прежнему можно найти. OpenAI называет это экспериментальным, включаемым в config.toml Codex, и говорит, что это станет режимом по умолчанию для Astra. На бенчмарке, измеряемом в 29 шагах, именно этот механизм, вероятнее всего, объясняет количество шагов.
То, что не опубликовано, так же важно, как и то, что опубликовано. OpenAI не указала количество параметров или вычислительные затраты на обучение этой модели, и мы их не приводим. Цифра «более 100 000 GPU в Stargate» распространяется из вторых рук и отсутствует на прочитанных нами страницах. И в документации OpenAI также не указан отдельно тарифицируемый или отдельно документированный «Astra Pro» или какой-либо другой уровень — в публикациях о нём говорится, но запись в роутере не является документацией вендора, и мы не представляем уровень, который не смогли найти в собственных документах OpenAI.
Что читатель на самом деле должен вынести из этого
Упорядочите строки по тому, насколько они должны влиять на решение. Насыщенная пара — 98% на FrontierMath Tier 4 и 99,9% на ARC-AGI-3 — не должна влиять на него вовсе; они говорят, что бенчмарки исчерпаны, а не что Astra их выиграла. Показатель 100% в ExploitBench реален и по большей части не может быть применён через публичную модель по замыслу — это осознанный выбор в пользу безопасности, а не ограничение, которое следует обходить. Terminal-Bench 4.0 — самое сильное заявление вендора о производительности: настоящий отрыв от Sol и разрыв в 2,1 пункта с Claude Fable 5.1, который слишком мал для однозначного вывода. DeepSWE v1.1 — единственная строка с независимыми измерениями; она ставит Astra в тройную ничью на вершине, а не оставляет её там одной, и именно число шагов и токенов в этом результате стоит цитировать. 40 минут на задачу в OSWorld 2.0 — самое значимое с операционной точки зрения число на странице и при этом наименее независимо проверенное. Строки, относящиеся к безопасности, — внутренние, невоспроизведённые и указывают в правильную сторону.
Что оставляет простой выбор. Если на этой неделе вы выбираете модель для длительной агентной работы — многочасового программирования, использования компьютера, сквозных задач, за которыми иначе пришлось бы присматривать человеку, — то Astra — это модель, за которой стоит больше всего актуальных свидетельств, а экономическое обоснование опирается на сэкономленное время на задачу, а не на сэкономленные токены на вызов. Если вы выбираете для высокообъёмной работы с короткими взаимодействиями, то 2,5x против промо-ставки Sol — это число, которое решает дело, и ответ, вероятно, нет. А если вы выбираете, опираясь на 98% или 99,9%, то вы выбираете по двум строкам, которые перестали нести информацию.
Вопросы, которые стоит задать, но на которые эта страница не ответила
Реально ли преимущество в 2,1 балла на Terminal-Bench над Claude Fable 5.1? Судя по этим данным, нет. Обе цифры получены OpenAI, которая измеряла собственную модель против конкурента, на стендах, которые мы не можем сопоставить, и без опубликованного допуска по оценке. Это преимущество существует лишь в собственных подсчётах OpenAI, и оно находится в пределах, где повторный прогон мог бы дать обратный результат. Чтобы решить этот вопрос, нужно запустить обе модели на своих задачах — это займёт несколько часов и стоит больше, чем 2,1 балла.
Почему таблица Datacurve не венчает Astra, если в материалах запуска OpenAI цитируется рекорд?Потому что таблица измеряет, а страница запуска продаёт. Собственный срез Datacurve показывает три модели на 74% с перекрывающимися доверительными интервалами и не отмечает лидера. Заявление о рекорде на фоне ничейной таблицы — это не столько ложь, сколько выбор знаменателя — та же ошибка, что и множитель 2,5x, и причина, по которой мы датировали здесь каждое число.
Если ведущие бенчмарки насыщены, что покупателю использовать вместо них? Время на задачу, стоимость выполненной задачи и количество шагов в долгосрочной работе — это те измерения, где показатели всё ещё разбросаны и всё ещё коррелируют с тем, за что платит команда. Такие измерения сложнее найти в публикациях — именно поэтому страницы анонсов у вендоров по-прежнему выносят на первый план насыщенные.
Открытый вопрос
Число, которое быстрее всего сделает эту страницу устаревшей, — это цена. Промо-тариф Sol действует как минимум до 21 ноября 2026 года, а OpenAI не опубликовала тариф после окончания промо-акции; когда это изменится, коэффициент 2,5x в этой статье изменится вместе с ним — в сторону 2x. Второй фактор — это то, будет ли кто-нибудь независимо заново прогонять эти оценки на том же стенде: DeepSWE — образец того, как это должно выглядеть, а OSWorld 2.0 и Terminal-Bench 4.0 — две строки, которым такая процедура нужна больше всего. До тех пор честная сводка по бенчмаркам GPT-6 Astra такова: впечатляющие показатели достигли насыщения, различительные показатели сообщены производителем и близки между собой, а единственный независимый показатель — это ничья, которую собственные материалы вендора о запуске называют рекордом.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
