
Nex-N2.5 Pro против Claude Opus 5: Nex-AGI выбрал мерило, и мерило победило
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0455Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0247Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0247Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0157Интеллект82Кодинг
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2646Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1849Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1541Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1251Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0547Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0347Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2140Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Интеллект49Кодинг
Nex-AGI выбрала эталон, и эталон победил. Когда шанхайский альянс открытых моделей представил Nex-N2.5 Pro 8 сентября 2026 года, в таблице computer-use на карточке модели в колонке сравнения оказался Claude Opus 5, а Nex-N2.5 Pro занял позицию претендента: 68,3 у Claude Opus 5 против 56,4 у Nex-N2.5 Pro на OSWorld-2 — обе цифры ровно те, что Nex-AGI напечатал на собственной карточке. С тех пор независимые лидерборды скорее расширили разрыв, чем сократили его: снимок OSWorld 2.0 от 29 августа на BenchLM ставит Claude Opus 5 на первое место среди пятнадцати перечисленных моделей — с результатом 70,6. Уступать двенадцать очков лидеру поля на бенчмарке, который вы сами выбрали для публикации, — не обычная хореография запуска, поэтому самое интересное в противостоянии Nex-N2.5 Pro и Claude Opus 5 — не счёт. А то, чем на самом деле являются обе стороны этого счёта: открытая модель computer-use на 397 миллиардов параметров, которую никто за пределами альянса пока не смог запустить или проверить, и закрытый флагман Anthropic, который возглавляет бенчмарк и несёт продакшн-нагрузку с конца июля.
Честное резюме сразу: это не соперничество двух измеряемых величин, потому что только одну из них измерял кто-либо, кроме её создателя. Nex-N2.5 Pro — это разреженная модель смеси экспертов, примерно 17 миллиардов активных параметров при общем объёме 397B, прошедшая пост-обучение на основе линейки Qwen3.5 и нацеленная непосредственно на длительные операции с компьютером и браузером с петлёй визуальной обратной связи. Сегодня она доступна через бесплатные размещённые конечные точки — ссылки Nex-AGI из её карточки модели, в то время как веса Apache-2.0, на которых основано семейство, остаются помеченными как «скоро» без указания даты. Claude Opus 5 — это флагманская производственная модель Anthropic для сложных рассуждений, программирования и агентной работы: закрытая модель с контекстом на 1 млн токенов, регулятором адаптивного мышления, документированной ценой и неделями публичных записей в лидербордах и производственного трафика за плечами. Любое преимущество в этом противостоянии сводится к одному из двух фактов: одна модель запускаема и проверяема, а другая — не является ни тем, ни другим.
Бенчмарк, с которым согласны обе стороны
Бенчмарки использования компьютера вознаграждают то же поведение, ради которого создаются эти модели: агент смотрит на экран, выбирает действие, выполняет его и считывает изменившийся экран, чтобы проверить, сработало ли действие. Nex-N2.5 Pro архитектурно построен вокруг именно этого цикла — зрение для него не входная модальность, прикрученная сбоку, а канал обратной связи, по которому агент сверяет результат. Claude Opus 5 относится к тому же циклу как к одной из многих рабочих нагрузок, но так вышло, что он очень силён в нём, — именно поэтому Nex-AGI изначально взял его за точку отсчёта.
Строго говоря, эти два числа получены не в одной и той же среде тестирования. Nex-AGI получила свои показатели OSWorld-2 с помощью собственного оценочного инструментария NexCUA, который, по её словам, будет выложен в открытый доступ, но пока не выпущен, а результат 56,4 для Nex-N2.5 Pro является невоспроизведёнными данными вендора. Результат Claude Opus 5 — 70,6 на BenchLM — это независимый замер OSWorld 2.0 от 29 августа 2026 года, и он согласуется с 68,3, которые сама Nex-AGI приводит из данных лидерборда. Разные инструментарии и немного различающиеся версии бенчмарка означают, что точный разрыв — двенадцать пунктов в собственной карточке Nex-AGI и ближе к четырнадцати на BenchLM — следует воспринимать скорее как указание на направление, а не точную величину. Но не подлежит сомнению, что Nex-N2.5 Pro, по лучшим числам, доступным с любой стороны, находится ниже текущего передового агента для работы с компьютером.

Два ответа на вопрос «Могу ли я запустить это сегодня?»

Это развилка, которая на самом деле определяет исход для работающей команды, и она не в пользу новичка. На карточке Hugging Face для Nex-N2.5 Pro по-прежнему красуется баннер о том, что веса скоро появятся под лицензией Apache-2.0, но без указания даты релиза. Единственные живые сборки — это бесплатные размещённые эндпоинты, на которые ведут ссылки Nex-AGI с карточки: их можно вызывать, но они принадлежат кому-то другому, без публичной цены, без условий обслуживания, на которые команда может опереться в планировании, и без возможности воспроизвести хотя бы один показатель бенчмарка на собственном оборудовании. Когда веса наконец выйдут, документированный рецепт развёртывания — это один узел из восьми H100 на кастомном образе SGLang: реальный, но стандартный объём для MoE на 397 млрд параметров, и именно поэтому конструкция с 17 млрд активных параметров интересна. Пока этого не произошло, Nex-N2.5 Pro — это превью, к которому можно обращаться с запросами, а не модель, на которой можно строить.
Claude Opus 5 — полная противоположность по каждому из этих пунктов. Он доступен через API Anthropic и на маршрутизированных платформах с 24 июля, его цена публична и стабильна, его веса закрыты и останутся закрытыми, а любые его показатели можно проверить уже сегодня, просто запустив его. Окружающая экосистема — Claude Code, инструменты MCP и рой продакшн-агентов, которые долбили его шесть недель, — это ровно та накопленная история, которой однодневная модель похвастаться не может. Для команды, чьё требование звучит как «модель должна работать в следующем квартале», эта история — решает всё.
Спецификация, какая она есть
Положите два конверта рядом друг с другом:
• Выпущено — Nex-N2.5 Pro: 8 сентября 2026 (размещённые эндпоинты работают, веса ожидаются). Claude Opus 5: 24 июля 2026, общедоступен.
• Масштаб — Nex-N2.5 Pro: 397B всего / ~17B активных MoE. Claude Opus 5: количество параметров не раскрыто.
• Модальность — Nex-N2.5 Pro: на входе — текст и изображения, на выходе — текст; зрение занимает центральное место в его цикле использования компьютера. Claude Opus 5: на входе — текст и изображения, на выходе — текст; сильный визуальный анализ.
• Контекст / вывод — Nex-N2.5 Pro: контекст 262 144 токена (документированная длина обслуживания). Claude Opus 5: контекст 1 млн токенов, потолок вывода 128 тыс. токенов.
• Управление рассуждением — Nex-N2.5 Pro: переключатель reasoning_effort со значениями none / medium (адаптивный, по умолчанию) / high. Claude Opus 5: адаптивное мышление по умолчанию с явной регулировкой усилий от низкого до максимального.
• Веса — Nex-N2.5 Pro: Apache-2.0, скоро, без точной даты. Claude Opus 5: закрытые.
• Цена за 1 млн токенов — Nex-N2.5 Pro: бесплатный тариф с хостингом, опубликованной цены нет. Claude Opus 5: $5.00 за вход / $25.00 за вывод, $0.50 за кэшированные чтения, $6.25 за запись в кэш.
Различие между ними достаточно велико, чтобы сравнительная таблица имела реальный смысл: Opus 5 предоставляет окно контекста в миллион токенов и предел вывода 128K для длительных сессий агентов, тогда как контекст на 262K токенов у Nex-N2.5 Pro и бесплатный тариф лучше подходят для автоматизации меньшего масштаба, ориентированной на работу с экраном. Ни одна из спецификаций не делает другую лишней: модели расходятся во взглядах на то, на что агент тратит свой контекст.
Честно читая собственную таблицу результатов Nex-AGI
Остальную часть карточки стоит читать с тем же фильтром. Другие строки компьютерного использования Nex-N2.5 Pro — OSWorld-G 87.4, OSWorld-Verified 82.2, WebArena-Verified 67.6, WebTest 52.8, Vision2Web 68.2 — и его строки кодирования — Terminal-Bench 2.1 на 82.7, SWE-Bench Pro на 61.2, BrowseComp на 89.7 — всё это измерения вендора через собственный стенд альянса, не воспроизведённые в первые 48 часов. Единственный вывод, который нейтральный читатель может сделать из карточки, — что Nex-AGI считает Nex-N2.5 Pro сильной моделью среднего уровня для компьютерного использования, которая отстаёт от передового агента по самому важному показателю. Это последовательное, даже консервативное позиционирование для открытой модели на 397B. И это также утверждение, ожидающее вторую лабораторию.
Деньги, когда одна сторона не имеет цены.
Здесь невозможно провести честное сравнение цен, потому что цена есть только у одной стороны. Бесплатный размещённый тариф Nex-N2.5 Pro ни о чём не говорит относительно реальной стоимости модели: бесплатные предварительные эндпоинты — это способ, которым вендоры собирают трафик и обратную связь, а Nex-AGI не опубликовала платную ставку за токен для этого семейства. Claude Opus 5 стоит 5,00 доллара за миллион входных токенов и 25,00 доллара за миллион выходных по прейскуранту Anthropic, чтение из кэша — 0,50 доллара, и именно эту цифру должен закладывать бюджет. Если вы сегодня платите по этому счёту за компьютерных агентов и хотите понять, сможет ли открытая модель с 17B активных параметров выполнять ту же работу дешевле, ответ таков: возможно, но вы не узнаете этого, пока не появятся веса и кто-нибудь независимый не запустит её. Сравнение цен отложено, а не завершено, и считать бесплатный эндпоинт доказательством дешевизны было бы категориальной ошибкой.

Что можно сделать уже сегодня — настроить A/B-тест на тот день, когда он станет возможным. Claude Opus 5 доступна на OrcaRouter по ценам из прайс-листа Anthropic — те же $5.00 / $25.00, без наценки, так что счёт здесь совпадает со счётом Anthropic и меняется в тот день, когда его поменяет Anthropic. Один API-ключ помещает её за тот же endpoint, что и 200+ других моделей, с автоматическим переключением при сбое провайдера и DSL маршрутизации, если вы хотите отправлять Opus на сложные запросы, а более дешёвую модель — на рутинные. Модели Nex-N2.5 Pro на OrcaRouter нет — перед написанием мы проверили наш каталог моделей, и ни одной модели nex-agi там пока не значится. Как только провайдер начнёт отдавать её по прайс-листу, она в тот же день появится здесь, и честное сравнение, которое эта статья пока провести не может, станет правилом маршрутизации, а не миграцией.
Кто должен действовать, а кто должен ждать
Если ваша команда сегодня выполняет производственные рабочие нагрузки computer-use или агентного кодинга и нуждается в модели с известной ценой, известным профилем сбоев и независимым послужным списком, Claude Opus 5 — рациональный выбор в этом противостоянии, и ничего в первые 48 часов существования Nex-N2.5 Pro этого не меняет. Если ваша команда оценивает открытые модели computer-use для будущей разработки, Nex-N2.5 Pro должен быть в списке наблюдения: мультимодальная MoE на 397B параметров с вменяемыми требованиями к самостоятельному хостингу и правдоподобной историей бенчмарков среднего уровня — это именно та открытая модель, которая перекраивает кривую затрат, при условии что веса действительно появятся, а цифры на карточке переживут независимый прогон. Рациональная позиция — одновременно и то и другое: оставить проверенного лидера на критическом пути и позволить дню выхода весов решить, заслуживает ли новичок испытания. Это единственное сравнение в этом противостоянии, которое ещё не состоялось, — и именно оно в итоге будет иметь значение.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
