Hero-блок «Nex-N2.5 Pro vs Claude Opus 5» — сгенерированная титульная карточка с заголовком «Nex-N2.5 Pro vs Claude Opus 5», подзаголовком «Бесплатная открытая предварительная версия computer-use против лидера бенчмарков, к которому вы можете направлять запросы уже сегодня» и надзаголовком «Anthropic vs Nex-AGI — сентябрь 2026».
Guides & Insights

Nex-N2.5 Pro против Claude Opus 5: Nex-AGI выбрал мерило, и мерило победило

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Nex-AGI выбрала эталон, и эталон победил. Когда шанхайский альянс открытых моделей представил Nex-N2.5 Pro 8 сентября 2026 года, в таблице computer-use на карточке модели в колонке сравнения оказался Claude Opus 5, а Nex-N2.5 Pro занял позицию претендента: 68,3 у Claude Opus 5 против 56,4 у Nex-N2.5 Pro на OSWorld-2 — обе цифры ровно те, что Nex-AGI напечатал на собственной карточке. С тех пор независимые лидерборды скорее расширили разрыв, чем сократили его: снимок OSWorld 2.0 от 29 августа на BenchLM ставит Claude Opus 5 на первое место среди пятнадцати перечисленных моделей — с результатом 70,6. Уступать двенадцать очков лидеру поля на бенчмарке, который вы сами выбрали для публикации, — не обычная хореография запуска, поэтому самое интересное в противостоянии Nex-N2.5 Pro и Claude Opus 5 — не счёт. А то, чем на самом деле являются обе стороны этого счёта: открытая модель computer-use на 397 миллиардов параметров, которую никто за пределами альянса пока не смог запустить или проверить, и закрытый флагман Anthropic, который возглавляет бенчмарк и несёт продакшн-нагрузку с конца июля.

Честное резюме сразу: это не соперничество двух измеряемых величин, потому что только одну из них измерял кто-либо, кроме её создателя. Nex-N2.5 Pro — это разреженная модель смеси экспертов, примерно 17 миллиардов активных параметров при общем объёме 397B, прошедшая пост-обучение на основе линейки Qwen3.5 и нацеленная непосредственно на длительные операции с компьютером и браузером с петлёй визуальной обратной связи. Сегодня она доступна через бесплатные размещённые конечные точки — ссылки Nex-AGI из её карточки модели, в то время как веса Apache-2.0, на которых основано семейство, остаются помеченными как «скоро» без указания даты. Claude Opus 5 — это флагманская производственная модель Anthropic для сложных рассуждений, программирования и агентной работы: закрытая модель с контекстом на 1 млн токенов, регулятором адаптивного мышления, документированной ценой и неделями публичных записей в лидербордах и производственного трафика за плечами. Любое преимущество в этом противостоянии сводится к одному из двух фактов: одна модель запускаема и проверяема, а другая — не является ни тем, ни другим.

Бенчмарк, с которым согласны обе стороны

Бенчмарки использования компьютера вознаграждают то же поведение, ради которого создаются эти модели: агент смотрит на экран, выбирает действие, выполняет его и считывает изменившийся экран, чтобы проверить, сработало ли действие. Nex-N2.5 Pro архитектурно построен вокруг именно этого цикла — зрение для него не входная модальность, прикрученная сбоку, а канал обратной связи, по которому агент сверяет результат. Claude Opus 5 относится к тому же циклу как к одной из многих рабочих нагрузок, но так вышло, что он очень силён в нём, — именно поэтому Nex-AGI изначально взял его за точку отсчёта.

Строго говоря, эти два числа получены не в одной и той же среде тестирования. Nex-AGI получила свои показатели OSWorld-2 с помощью собственного оценочного инструментария NexCUA, который, по её словам, будет выложен в открытый доступ, но пока не выпущен, а результат 56,4 для Nex-N2.5 Pro является невоспроизведёнными данными вендора. Результат Claude Opus 5 — 70,6 на BenchLM — это независимый замер OSWorld 2.0 от 29 августа 2026 года, и он согласуется с 68,3, которые сама Nex-AGI приводит из данных лидерборда. Разные инструментарии и немного различающиеся версии бенчмарка означают, что точный разрыв — двенадцать пунктов в собственной карточке Nex-AGI и ближе к четырнадцати на BenchLM — следует воспринимать скорее как указание на направление, а не точную величину. Но не подлежит сомнению, что Nex-N2.5 Pro, по лучшим числам, доступным с любой стороны, находится ниже текущего передового агента для работы с компьютером.

A two-column scoreboard titled 'Nex-N2.5 Pro vs Claude Opus 5 — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Params 397B total / ~17B active; Focus computer use; OSWorld 2.0 56.4 vendor-reported; Weights Apache-2.0 pending; Price free hosted / no list price. Right column Claude Opus 5: Released Jul 24 2026; Params undisclosed; Focus general plus computer use; OSWorld 2.0 70.6 per BenchLM; Weights closed; Price $5.00 / $25.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Opus OSWorld per BenchLM Aug 29.'

Два ответа на вопрос «Могу ли я запустить это сегодня?»

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

Это развилка, которая на самом деле определяет исход для работающей команды, и она не в пользу новичка. На карточке Hugging Face для Nex-N2.5 Pro по-прежнему красуется баннер о том, что веса скоро появятся под лицензией Apache-2.0, но без указания даты релиза. Единственные живые сборки — это бесплатные размещённые эндпоинты, на которые ведут ссылки Nex-AGI с карточки: их можно вызывать, но они принадлежат кому-то другому, без публичной цены, без условий обслуживания, на которые команда может опереться в планировании, и без возможности воспроизвести хотя бы один показатель бенчмарка на собственном оборудовании. Когда веса наконец выйдут, документированный рецепт развёртывания — это один узел из восьми H100 на кастомном образе SGLang: реальный, но стандартный объём для MoE на 397 млрд параметров, и именно поэтому конструкция с 17 млрд активных параметров интересна. Пока этого не произошло, Nex-N2.5 Pro — это превью, к которому можно обращаться с запросами, а не модель, на которой можно строить.

Claude Opus 5 — полная противоположность по каждому из этих пунктов. Он доступен через API Anthropic и на маршрутизированных платформах с 24 июля, его цена публична и стабильна, его веса закрыты и останутся закрытыми, а любые его показатели можно проверить уже сегодня, просто запустив его. Окружающая экосистема — Claude Code, инструменты MCP и рой продакшн-агентов, которые долбили его шесть недель, — это ровно та накопленная история, которой однодневная модель похвастаться не может. Для команды, чьё требование звучит как «модель должна работать в следующем квартале», эта история — решает всё.

Спецификация, какая она есть

Положите два конверта рядом друг с другом:

Выпущено — Nex-N2.5 Pro: 8 сентября 2026 (размещённые эндпоинты работают, веса ожидаются). Claude Opus 5: 24 июля 2026, общедоступен.

Масштаб — Nex-N2.5 Pro: 397B всего / ~17B активных MoE. Claude Opus 5: количество параметров не раскрыто.

Модальность — Nex-N2.5 Pro: на входе — текст и изображения, на выходе — текст; зрение занимает центральное место в его цикле использования компьютера. Claude Opus 5: на входе — текст и изображения, на выходе — текст; сильный визуальный анализ.

Контекст / вывод — Nex-N2.5 Pro: контекст 262 144 токена (документированная длина обслуживания). Claude Opus 5: контекст 1 млн токенов, потолок вывода 128 тыс. токенов.

Управление рассуждением — Nex-N2.5 Pro: переключатель reasoning_effort со значениями none / medium (адаптивный, по умолчанию) / high. Claude Opus 5: адаптивное мышление по умолчанию с явной регулировкой усилий от низкого до максимального.

Веса — Nex-N2.5 Pro: Apache-2.0, скоро, без точной даты. Claude Opus 5: закрытые.

Цена за 1 млн токенов — Nex-N2.5 Pro: бесплатный тариф с хостингом, опубликованной цены нет. Claude Opus 5: $5.00 за вход / $25.00 за вывод, $0.50 за кэшированные чтения, $6.25 за запись в кэш.

Различие между ними достаточно велико, чтобы сравнительная таблица имела реальный смысл: Opus 5 предоставляет окно контекста в миллион токенов и предел вывода 128K для длительных сессий агентов, тогда как контекст на 262K токенов у Nex-N2.5 Pro и бесплатный тариф лучше подходят для автоматизации меньшего масштаба, ориентированной на работу с экраном. Ни одна из спецификаций не делает другую лишней: модели расходятся во взглядах на то, на что агент тратит свой контекст.

Честно читая собственную таблицу результатов Nex-AGI

Остальную часть карточки стоит читать с тем же фильтром. Другие строки компьютерного использования Nex-N2.5 Pro — OSWorld-G 87.4, OSWorld-Verified 82.2, WebArena-Verified 67.6, WebTest 52.8, Vision2Web 68.2 — и его строки кодирования — Terminal-Bench 2.1 на 82.7, SWE-Bench Pro на 61.2, BrowseComp на 89.7 — всё это измерения вендора через собственный стенд альянса, не воспроизведённые в первые 48 часов. Единственный вывод, который нейтральный читатель может сделать из карточки, — что Nex-AGI считает Nex-N2.5 Pro сильной моделью среднего уровня для компьютерного использования, которая отстаёт от передового агента по самому важному показателю. Это последовательное, даже консервативное позиционирование для открытой модели на 397B. И это также утверждение, ожидающее вторую лабораторию.

Деньги, когда одна сторона не имеет цены.

Здесь невозможно провести честное сравнение цен, потому что цена есть только у одной стороны. Бесплатный размещённый тариф Nex-N2.5 Pro ни о чём не говорит относительно реальной стоимости модели: бесплатные предварительные эндпоинты — это способ, которым вендоры собирают трафик и обратную связь, а Nex-AGI не опубликовала платную ставку за токен для этого семейства. Claude Opus 5 стоит 5,00 доллара за миллион входных токенов и 25,00 доллара за миллион выходных по прейскуранту Anthropic, чтение из кэша — 0,50 доллара, и именно эту цифру должен закладывать бюджет. Если вы сегодня платите по этому счёту за компьютерных агентов и хотите понять, сможет ли открытая модель с 17B активных параметров выполнять ту же работу дешевле, ответ таков: возможно, но вы не узнаете этого, пока не появятся веса и кто-нибудь независимый не запустит её. Сравнение цен отложено, а не завершено, и считать бесплатный эндпоинт доказательством дешевизны было бы категориальной ошибкой.

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5) showing the header stats $5.00 input and $25.00 output per million tokens and the byline 'by Anthropic - 2026-07-24'.

Что можно сделать уже сегодня — настроить A/B-тест на тот день, когда он станет возможным. Claude Opus 5 доступна на OrcaRouter по ценам из прайс-листа Anthropic — те же $5.00 / $25.00, без наценки, так что счёт здесь совпадает со счётом Anthropic и меняется в тот день, когда его поменяет Anthropic. Один API-ключ помещает её за тот же endpoint, что и 200+ других моделей, с автоматическим переключением при сбое провайдера и DSL маршрутизации, если вы хотите отправлять Opus на сложные запросы, а более дешёвую модель — на рутинные. Модели Nex-N2.5 Pro на OrcaRouter нет — перед написанием мы проверили наш каталог моделей, и ни одной модели nex-agi там пока не значится. Как только провайдер начнёт отдавать её по прайс-листу, она в тот же день появится здесь, и честное сравнение, которое эта статья пока провести не может, станет правилом маршрутизации, а не миграцией.

Кто должен действовать, а кто должен ждать

Если ваша команда сегодня выполняет производственные рабочие нагрузки computer-use или агентного кодинга и нуждается в модели с известной ценой, известным профилем сбоев и независимым послужным списком, Claude Opus 5 — рациональный выбор в этом противостоянии, и ничего в первые 48 часов существования Nex-N2.5 Pro этого не меняет. Если ваша команда оценивает открытые модели computer-use для будущей разработки, Nex-N2.5 Pro должен быть в списке наблюдения: мультимодальная MoE на 397B параметров с вменяемыми требованиями к самостоятельному хостингу и правдоподобной историей бенчмарков среднего уровня — это именно та открытая модель, которая перекраивает кривую затрат, при условии что веса действительно появятся, а цифры на карточке переживут независимый прогон. Рациональная позиция — одновременно и то и другое: оставить проверенного лидера на критическом пути и позволить дню выхода весов решить, заслуживает ли новичок испытания. Это единственное сравнение в этом противостоянии, которое ещё не состоялось, — и именно оно в итоге будет иметь значение.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно