
GPT-6 Astra против Qwen3.8-Max: два агентных флагмана и мелкий шрифт под каждым
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
В сентябре 2026 года выходят две истории об «агентных флагманах», и обе посвящены GPT-6 Astra и Qwen3.8-Max. OpenAI выпустила GPT-6 Astra 3 сентября, назвав её лучшей в мире моделью для работы с компьютером, разработки ПО, науки и кибербезопасности; Qwen3.8-Max от Alibaba, доступная с 3 августа, — агентный флагман сильнейшей китайской лаборатории, той самой, которую Artificial Analysis ставит в верхушку рейтинга по своему агентному индексу и которая является самым близким конкурентом среди открытых экосистем к притязаниям фронтира на автономную работу. Обе модели действительно сильны, и обе продаются с громкими цифрами, которые не выдерживают проверки: результат OpenAI в 99,9% по ARC-AGI-3 падает до 62,7%, когда ARC Prize запускает собственный нейтральный харнесс, а агентная гениальность Qwen3.8-Max сопровождается независимо измеренной регрессией по галлюцинациям и привычкой тратить 64 хода и больше доллара на задачи, с которыми её предшественница справлялась за 14. Это сравнение двух моделей — и двух способов читать бенчмарки.
Эти два заголовка.
Презентация OpenAI для GPT-6 Astra — это широта плюс автономность: единая модель, которая управляет браузером, пишет и исправляет код, проводит научный анализ и — уникально — находит новые уязвимости безопасности достаточно хорошо, чтобы OpenAI оценила всю модель как «критическую» в рамках своей структуры Preparedness Framework и ограничила наиболее мощные настройки проверенными партнёрами. В материалах запуска заявлены идеальные 100% на ExploitBench, 97,6% на FrontierMath Tier 4, 96,0% на GPQA Diamond и насыщенный балл ARC-AGI-3. Презентация Alibaba для Qwen3.8-Max более узкая, но меткая: агентная рабочая лошадка за $2/$6, которая набирает баллы на вершине или около вершины независимых агентных оценок, при этом базовые веса опубликованы (под индивидуальной лицензией), а не заперты в чёрном ящике.
Что говорит независимое табло
Artificial Analysis сейчас оценивает интеллект GPT-6 Astra (max) в 61 балл — 8-е место среди 202 моделей, которые она отслеживает, — а Qwen3.8-Max в 58 баллов, 24-е место. Этот разрыв в три балла меньше, чем разница в цене, и меньше, чем разрыв, рисуемый маркетингом любого из вендоров; в отдельном агентном индексе AA Qwen3.8-Max набирает 58 и выходит на уровень лучших проприетарных моделей переднего края, тогда как AA вообще не публикует агентный индекс для GPT-6 Astra. Честный взгляд на цифры: по чисто измеренному интеллекту эти две модели — близкие соседи, и подача «самая интеллектуальная модель в мире» в материалах запуска OpenAI не соответствует тому, что показывает независимая оценка AA.
• Интеллект — GPT-6 Astra (max): AA Intelligence 61, место #8/202. Qwen3.8-Max: AA Intelligence 58, место #24/202; AA Agentic 58.
• Цена по прайс-листу — GPT-6 Astra: $10.00 / $50.00 за 1M, $1.00 за чтение из кэша, 2× за ввод сверх 272K токенов. Qwen3.8-Max: $2.00 / $6.00 за 1M, $0.25 за чтение из кэша.
• Контекст / вывод — GPT-6 Astra: 1.05M in / 128K out. Qwen3.8-Max: 1M in / ~128K out.
• Агентные показатели — GPT-6 Astra: ARC-AGI-3 — 99,9% (харнесс OpenAI) против 62,7% (стандартный харнесс ARC Prize); WANDR — 0,682 при $11,98 за задачу (по данным Perplexity). Qwen3.8-Max: AA GDPval — 1739 Elo при 64 шагах на задачу (~$1,14 за задачу); Code Arena WebDev — №1 с 1691 Elo.
• Независимые тревожные сигналы — GPT-6 Astra: ещё нет в списке моделей ChatGPT, поэтапный API, уступка по контролируемости. Qwen3.8-Max: регресс галлюцинаций AA-Omniscience с 23% до 40% по сравнению с предыдущим поколением.
• Веса — GPT-6 Astra: проприетарные. Qwen3.8-Max: контрольная точка класса Max (Qwen3.8-2.4T-A95B), публично доступная по специальной лицензии с 12 августа; AA по-прежнему указывает размещённую флагманскую модель как проприетарную.

Мелкий шрифт с комментариями
Возьмем сначала показатель ARC-AGI-3, поскольку это самый наглядный пример того, как число может быть одновременно правдивым и вводящим в заблуждение. OpenAI сообщает о 99,9% для GPT-6 Astra на собственном провайдер-адаптерном стенде — конфигурации, настроенной под модель. ARC Prize, организация, поддерживающая этот бенчмарк, прогнала GPT-6 Astra на своем провайдер-нейтральном стандартном стенде и получила 62,7%. Оба результата являются передовыми; но на стенде, который не контролирует создатель модели, никто не получал 99,9%. Та же осторожность применима к показателю WANDR от Perplexity — 0,682. Это самый высокий результат, зафиксированный Perplexity, но он измерен компанией, которая одновременно интегрирует GPT-6 Astra в свои продукты, а значит, имеет коммерческую заинтересованность. Эту закономерность стоит назвать: самые впечатляющие цифры OpenAI получены на стендах, контролируемых OpenAI или ее партнерами, а единственный полностью независимый результат — Intelligence 61 от AA — является просто отличным.
Мелкий шрифт Qwen3.8-Max говорит об обратном: его сильные стороны измерены независимо, и его слабость тоже измерена независимо. Показатель GDPval в 1739 Эло подлинный — но в тестах Artificial Analysis Qwen3.8-Max достигает его, затрачивая 64 итерации и примерно $1,14 на задачу, тогда как предыдущее поколение укладывалось в 14 итераций и $0,53. Это налог за усилия: модель покупает свой потолок агентных возможностей токенами рассуждений, что важно для любого, кто платит за токен. А оценка Omniscience от AA зафиксировала регресс по галлюцинациям с 23% до 40% относительно предыдущего поколения Qwen — реальный независимый индикатор именно для тех автономных многошаговых нагрузок, где уверенный неверный ответ обходится дороже всего. Модель, которая за 64 итерации сама себя доводит до ошибок, не является очевидно более безопасной для запуска, чем та, чей создатель признаёт, что её контролируемость снизилась.

Цена, развертывание и честный способ выбора
По цене всё однозначно: Qwen3.8-Max по $2.00 / $6.00 за миллион токенов — это одна пятая цены ввода GPT-6 Astra и одна восьмая цены её вывода, причём с контекстом в 1 млн токенов и без надбавки Astra за длинные промпты. По доступности для развёртывания у Qwen3.8-Max на этой неделе есть ещё одно преимущество — его можно вызывать уже сегодня, и на OrcaRouter он уже работает по прайс-листу Alibaba, то есть с нулевой наценкой и автоматическим переключением при сбое. GPT-6 Astra всё ещё находится на этапе развёртывания: по состоянию на 4 сентября большинство пользователей пока не могут выбрать её в ChatGPT. При этом она уже доступна через API самой OpenAI и крупнейшие облачные маркетплейсы, и доступ к ней постепенно расширяется. Для команды, создающей агентные пайплайны, практичный подход — направлять рабочие нагрузки на модель, которую можно вызывать уже сегодня, а другую считать ориентиром, за которым стоит следить. Если вы хотите проверять заявления об «агентности», а не доверять им, слой маршрутизации — это нужный инструмент: Qwen3.8-Max, Kimi K3, Grok 4.6 и ещё 200+ моделей доступны по одному ключу на OrcaRouter, и DSL маршрутизации позволяет объединять несколько из них в один вызов — так что вы можете прогнать собственный набор задач на кандидатах и сами прочитать результаты, а не выбирать между мелким шрифтом двух вендоров.
Два вопроса, которые поднимает это противостояние
Почему OpenAI сообщает о 99,9% на ARC-AGI-3, когда ARC Prize показывает 62,7%? Потому что это не один и тот же тест. Испытательный стенд OpenAI с адаптером провайдера — это версия бенчмарка, настроенная на то, как GPT-6 Astra вызывается в продакшене; стандартный стенд ARC Prize — это нейтральная конфигурация, предназначенная для честного сравнения любых моделей. Результат 62,7% — это тот, который соответствует сценарию «что произойдёт, если я сам вызову эту модель», и он по-прежнему остаётся лучшим результатом, зафиксированным ARC Prize на этом стенде.
Открытые ли веса у Qwen3.8-Max? Частично, с оговоркой о лицензии. Alibaba опубликовала чекпоинт Max-класса Qwen3.8-2.4T-A95B 12 августа под специальной лицензией — веса доступны для загрузки, но это не открытость в стиле Apache-2.0, как у меньшей модели Qwen3.8-27B, и Artificial Analysis по-прежнему указывает хостируемую флагманскую модель как проприетарную. Если ваше требование — «я могу запустить именно ту модель, за которую плачу», это различие имеет значение; если ваше требование — «я могу изучить архитектуру и развернуть у себя близкий вариант», Qwen3.8-Max подходит, а GPT-6 Astra — нет.
Главный вывод
Выбирайте GPT-6 Astra, если вам нужны те особые возможности, которые сейчас есть только у неё — наступательная кибербезопасность, рассуждения на переднем крае науки, сложнейшие задачи автономного использования компьютера — и ваша организация может пройти её систему допусков и позволить себе её цену. Выбирайте Qwen3.8-Max, если вам нужна первоклассная агентная модель, которую действительно можно развернуть уже на этой неделе за $2/$6, с открытыми весами в качестве запасного выхода и регрессией по галлюцинациям, которую, как вы теперь знаете, нужно проверять. Более широкий урок — в самом мелком шрифте: в сентябре 2026 года два ведущих «агентных» флагмана продаются с громкими показателями, которые ни один производитель не контролирует полностью, и рациональный покупатель изучает тестовую среду, считает итерации и прогоняет собственные задачи, прежде чем выбрать сторону.

Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
