
Apodex 1.1, объясняем: 44 балла по Индексу интеллекта, реальная агентная сила — и загвоздка с надёжностью знаний.
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 177 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1323 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Apodex 1.1 появилась неделю назад; она проприетарная и до этой недели была в основном лабораторным курьёзом. Затем Artificial Analysis опубликовала свою первую независимую оценку этой модели — первую для Apodex на данной платформе, — и табло показало нечто необычное: Apodex 1.1 получила 44 балла по индексу Artificial Analysis Intelligence Index, заняв 11-е место из 177, при этом продемонстрировав результаты в агентных задачах, которые превзошли все модели её уровня интеллекта, включая DeepSeek V4 Pro, Qwen3.7 Max и Kimi K2.6. В том же отчёте всплыла вторая, куда менее приятная цифра: показатель надёжности знаний оказался достаточно слабым, чтобы пересмотреть решение о запуске на ней реальных задач. Её собрат с открытыми весами, Apodex 1.1 Mini, — модель, которую большинство людей могут реально запустить. Вот что говорит эта оценка, чего она не говорит и кому это важно.
Apodex, ИИ-компания, основанная Чэнь Тяньцяо, выпустила семейство моделей 24 августа 2026 года наряду со статьёй на arXiv, написанной 70 авторами: «Apodex 1.1: Scaling Agentic Intelligence for Complex Work» (2608.23283). Флагманская модель является проприетарной — примерно 397 млрд параметров, по данным вендора, — и построена вокруг тезиса о том, что реальным узким местом для агентов является не «сырой» интеллект, а среда, в которой они действуют. Поэтому Apodex 1.1 обучали работать напрямую с файлами, поиском и кодом на длинных горизонтах в общей среде исполнения («AgentOS»), которая координирует до 150 параллельных субагентов и сохраняет запись о происхождении каждого шага. Открытая часть — родственная модель: Apodex 1.1 Mini, MoE класса 35B, дообученная на основе модели Alibaba Qwen3.5-35B-A3B, выпущенная под лицензией Apache-2.0 вместе с сопутствующей агентной средой под названием FrontierAgent. Полная модель доступна только через собственный API Apodex и онлайн-рабочую среду; Mini — только self-hosted, иначе никак.
Что означает 44 балла по Индексу интеллекта
Индекс интеллекта Artificial Analysis — это взвешенный агрегированный показатель набора бенчмарков платформы, включая агентные тесты, такие как GDPval-AA v2 и Terminal-Bench, а также компоненты рассуждения, математики и знаний. Результат 44 ставит Apodex 1.1 на 11-е место из 177 моделей, что значительно выше медианы 18. Это также помещает модель в плотную, интересную группу: Kimi K2.6 (45), MiniMax-M3 (45) и Inkling (42) находятся в пределах трёх баллов, и Apodex 1.1 — единственная в этой группе, чьё название было неизвестно большинству пользователей ИИ неделю назад. Artificial Analysis отмечает, что страница охватывает рассуждающую версию модели и что может также существовать вариант без рассуждений.

Основной индексный показатель — не то, чем интересна эта модель. Она интересна тем, где её сильные и слабые стороны находятся относительно этого показателя — и именно это конкретизирует сравнение по уровням.
Где оно показывает результаты выше своего уровня: агентные оценки и оценки интеллектуального труда.
В двух компонентах индекса, измеряющих реальную агентскую работу, {{1}}Apodex 1.1 превосходит своих соседей на 44 пункта{{/1}}. На GDPval-AA v2 — бенчмарке, который оценивает способность агента выполнять реалистичные офисные задачи от начала до конца, — {{2}}Apodex 1.1 набирает Elo 1348, опережая DeepSeek V4 Pro (1333), Qwen3.7 Max (1308) и Kimi K2.6 (1202){{/2}}. На TerminalBench v2.1, который проверяет работу агента в терминале, он набирает 70%, опережая Kimi K2.6 (66%) и совсем немного уступая Qwen3.7 Max (75%). {{3}}Это независимые цифры, полученные Artificial Analysis, и они служат самым веским доказательством в отчёте того, что обучение с приоритетом среды работает.{{/3}}
Собственные заявления вендора о результатах тестов идут дальше, и их следует воспринимать как данные, предоставленные вендором, пока кто-то не воспроизведёт их: APEX-Agents 38.5, GDPVal 78.8, SWE-bench Verified 77.7%, Terminal-Bench 2.1 70.8%, Humanity's Last Exam 56.1% с инструментами, DeepSearchQA 92.4%, FrontierFinance 54.3 и FrontierScience-Research 63.3. Что делает агентный профиль заслуживающим доверия, а не хайпом, — это архитектура, стоящая за ним: масштабирование среды (расширение разнообразия исполняемых файлов, поисковых и кодовых сред, используемых в обучении) и масштабирование агентной координации (обучение модели декомпозировать долгосрочные задачи, делегировать параллельную работу, интегрировать асинхронные результаты и перепланировать). Режим «Agent Team» порождает до 150 субагентов для задач поиска и синтеза, а встроенный этап проверки («Statement Review») контролирует выводы перед их предоставлением. Иными словами, это модель, предназначенная для того, чтобы ошибаться, проверять себя и исправлять ошибки, — а не излагать факты по памяти.
Скрытая цена всей этой самостоятельности: многословие
Эта особенность проявляется в таблице экономической эффективности Artificial Analysis как самое явное слабое место модели после знаний: модель очень многословна. Прогон полного Intelligence Index потребовал 180 млн выходных токенов — против медианных 67 млн — и примерно 17 000 выходных токенов на эталонную задачу, тогда как у Qwen3.7 Max этот показатель составляет около 9 400, а у MiniMax-M3 — 8 100. В сумме полная оценка обошлась в $618,41 в виде расходов на API, по данным Artificial Analysis.

Ценообразование, которое даёт этот счёт: $0,30 за миллион входных токенов и $3,00 за миллион выходных — цена $0,03 за попадание в кэш для кэшированного ввода, скидка 90% — что в сумме даёт около $0,38 за миллион при типичном соотношении 7:2:1 (кэш/вход/выход). Обе цены за токен выше медианных значений платформы ($0,25 за вход, $0,90 за выход). Тем не менее оценка стоимости за задачу от Artificial Analysis по-прежнему ставит Apodex 1.1 на примерно $0,05 за эталонную задачу, что дешевле, чем Qwen3.7 Max (~$0,07) и Kimi K2.6 (~$0,06). Это соотношение важно для бюджетирования: его токены достаточно дёшевы, чтобы даже многословность оставалась конкурентоспособной в пересчёте на задачу — риск по затратам связан с объёмом, а не со ставкой. Если посадить на него долгоиграющего агента, счёт определяется тем, сколько он говорит, а говорит он много.
Одно замечание о цене, прежде чем вы составите бюджет: $0.30/$3.00 — это собственный прайс-лист вендора. Маршрутизирующая платформа, которая передаёт цены провайдеров без наценки (0%), взимает ровно эту сумму, и любое будущее снижение цен Apodex отображается в тот же день, когда оно объявлено.
Загвоздка: слабый послужной список надежности знаний.
Вот цифра, которую освещение запуска в основном упускает из виду. На AA-Omniscience — пробнике достоверности знаний от Artificial Analysis — Apodex 1.1 набирает -21.9. Он пытается ответить на 87% вопросов, а не отказывается, но правильно отвечает только на 32%, а уровень галлюцинаций составляет 78.4%. Для модели, позиционируемой как мощный решатель, это серьёзная раздвоенность личности: сильная в агентном исполнении, но слабая в фактологических знаниях.
Эти два факта связаны, а не противоречат друг другу. Агентные бенчмарки вознаграждают действия в среде — вызовы инструментов, итерации, восстановление после ошибок, — поэтому модель может показывать там высокие результаты, обладая при этом слабой памятью, потому что запоминание берёт на себя среда. Это даже заложено в дизайн: Statement Review существует для проверки выходных данных, а рабочая область построена вокруг верификации, а не вокруг того, чтобы модель давала верный ответ по памяти. Практический вывод прямолинеен: не нацеливайте Apodex 1.1 на задачи, зависящие от извлечения фактов из его собственных весов. Нацеливайте его на долгосрочные задачи, где его работу можно сверить с файлами, кодом и источниками, — и проверяйте результат.
Открытый собрат: Apodex 1.1 Mini и FrontierAgent
Если закрытая дверь флагмана — проблема, то открытая половина семейства — противовес. Apodex 1.1 Mini — это MoE-модель с ~35B суммарных и ~3B активных параметров, полученная путём дообучения Qwen3.5-35B-A3B (базовой модели, открытой Alibaba в феврале 2026 года); она выпущена под лицензией Apache-2.0, имеет контекстное окно 262K и доступна на Hugging Face в вариантах FP8, FP4 и GPTQ-Int4. Заявленные производителем ключевые показатели — 50,2 на FrontierFinance (первое место в собственном сравнении Apodex) и 27,7 на APEX-Agents с включённым харнессом Agent Team. А FrontierAgent — open-source-рантайм, который идёт в комплекте, — и есть по-настоящему интересный артефакт: терминальный харнесс с режимами ReAct и Agent Team, работой с файлами в песочнице, шлюзами одобрения, контрольными точками и трейсами, подключающийся к любому OpenAI-совместимому эндпоинту.
Две вещи, которые стоит знать, прежде чем разворачивать модель самостоятельно. Во-первых, Mini — это fine-tune, а не фронтирная модель: читайте её бенчмарки так же, как читаете вендорскую таблицу флагмана, — невоспроизводимые, с включённым харнессом и выбранные самим вендором сравнения. Во-вторых, её поведение наследуется от базовой модели: если вы хотите проверить, справляется ли базовая Qwen3.5-35B-A3B с вашей задачей, вам не нужен ни GPU, ни серверный стек, чтобы это выяснить, — база доступна в один API-запрос.
Кому следует использовать Apodex 1.1 уже сегодня
Флагманская модель пока ранняя, закрытая и доступна только через собственный API вендора и онлайн-рабочую среду; Apodex заявляет, что более широкая доступность API появится через крупные платформы, но веса не открыты. Это ограничивает круг тех, кто может действовать по итогам этой недели: команды, уже работающие в Apodex workbench, или готовые зарегистрироваться для получения собственного ключа API. Mini — более доступный путь, но он означает самостоятельное размещение.

Где модель действительно оправдывает своё место: длительные агентные конвейеры, в которых результаты проверяются на последующих этапах — исследовательские рабочие пространства, многошаговые задачи с файлами и инструментами, работа в терминале — и где профиль стоимости ~$0,05 за задачу сохраняется, несмотря на многословие. Где ей пока не место: всё, что зависит от достоверности собственных знаний модели, или производственный путь, который не может допустить некорректного поведения непроверенной семидневной модели. Именно для такой ситуации правильной обёрткой является слой маршрутизации.Один API для 200+ моделей означает, что базовую модель Qwen3.5-35B-A3B уже можно вызывать по прейскурантной цене, локально развёрнутая Mini может находиться за тем же маршрутизатором с автоматическим переключением при сбоях, и нестабильный новичок не может обрушить производственный путь — когда он показывает плохие результаты, запрос вместо этого перенаправляется на работоспособного провайдера.
Что посмотреть дальше
Эта оценка — первое прочтение, а не вердикт. Три фактора определят, будет ли Apodex 1.1 иметь значение через месяц: независимое воспроизведение агентных заявлений вендора (показатели GDPval и TerminalBench, проводимые Artificial Analysis, — единственные, полученные не самой Apodex); сузится ли разрыв в надёжности знаний в варианте без рассуждений или в последующем выпуске; и появится ли модель на дополнительных API и независимых рейтинговых площадках — после чего показатели 44 и -21.9 станут чужой задачей, которую нужно побить. Для семидневной модели с таким смешанным профилем это примерно максимум, о котором можно просить: реальное агентное преимущество, честная цена и одна слабость, о которой вы знаете ещё до подписки.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
