Заглавная титульная карточка для 'Nex-N2.5 Mini' с подзаголовком «Открытые веса появились сразу при запуске — компактный агент для работы с компьютером», плашками 'APACHE-2.0', '35B TOTAL / ~3B ACTIVE' и '262K CONTEXT' и лентой 'IMAGE + TEXT INPUT — 2x H100 REFERENCE'; в правом нижнем углу размещён логотип OrcaRouter.
Guides & Insights

Nex-N2.5 Mini: открытые веса появились уже при запуске — самый компактный компьютерный агент Nex-AGI служит входной точкой

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Понять, готовы ли открытые агенты, использующие компьютер, теперь можно по модели, которую можно скачать в день её анонса. Nex-AGI представила семейство Nex-N2.5 8 сентября 2026 года — три агентных уровня: Nex-N2.5 Mini, Nex-N2.5 Pro и Nex-N2.5 Max, — и именно самый маленький из них можно скачать и запустить. У Nex-N2.5 Mini веса Apache-2.0 доступны на Hugging Face в виде шестнадцати шардов BF16: это примерно 35 миллиардов параметров с заявленными ~3 миллиардами активных на токен, плюс эталонное развертывание на двух H100. Его более крупный мультимодальный собрат Nex-N2.5 Pro на момент написания всё ещё помечен как «coming soon», а текстовый Nex-N2.5 Max с 1,6 триллиона параметров тоже уже доступен, но для запуска ему требуется шестнадцать H200 на двух узлах. Для тех, кто проверяет тезис, лежащий в основе семейства — что открытые агентные модели могут выдерживать длительную работу с компьютером, а не только отвечать на вопросы, — Mini служит точкой входа.

Кто такой Nex-AGI? Название новое, и запуск похож на первый публичный релиз. В освещении анонса говорится, что проект представляет собой коллаборацию нескольких шанхайских организаций — Шанхайского инновационного института, Shanghai Qiji Zhifeng, Mosi Intelligence и Kuafu Technology, — при этом семейство моделей позиционируется как открытое, а команда работает под аккаунтом @NexEcosystem. В карточке моделей указано, что Nex-N2.5-mini и Nex-N2.5-Pro продолжают «мультимодальные основы Nex-N2» — более раннего релиза Nex, веса которого уже открыты. Что здесь действительно ново, так это framing: Nex-AGI заявляет, что создавал эти модели для долгосрочных задач в реальных средах — управление компьютером, работа с браузером, написание и тестирование кода, а также коррекция действий на основе того, что модель видит на экране, — и опубликовал веса, чтобы это утверждение можно было проверить.

Три уровня, одно объявление

Семейство разделяется по масштабу и по модальности, и различия важнее, чем общее название:

• Nex-N2.5 Mini — примерно 35B всего / ~3B активных, мультимодальная модель, принимающая изображения и текст, предназначенная для визуального использования компьютера, просмотра веб-страниц и задач, требующих обратной связи от интерфейса. Эталонное развертывание — один узел с двумя H100.

• Nex-N2.5 Pro — по заявленным данным, 397 млрд параметров всего / ~17 млрд активных; также мультимодальная, для более ресурсоемких сценариев компьютерного использования. Эталонное развертывание — восемь H100. Веса модели не были доступны для скачивания на момент запуска.

• Nex-N2.5 Max — 1.6T всего / ~49B активных, только текст, и, по словам Nex-AGI, это «первая полная работа по пост-обучению в масштабе триллиона параметров». В карточке указано, что модель построена на основе DeepSeek-V4-Pro-Base. Эталонное развертывание — 16×H200 на двух узлах.

Все три — это смесь экспертов. Mini и Pro относятся к семейству моделей Qwen3.5 — в материалах запуска Nex-AGI обе описаны как пост-обученные на основе вариантов Qwen3.5, а в конфигурации самой Mini указан тег архитектуры qwen3_5_moe, — тогда как Max — исключение на базе DeepSeek. Так что перед нами не один рецепт в трёх размерах, а два рецепта: мультимодальные уровни, «работающие с экраном», имеют одну родословную, а гигант текстовых рассуждений — другую.

Что на самом деле представляет собой поставленный Nex-N2.5 Mini

Репозиторий Hugging Face для nex-agi/Nex-N2.5-mini — это настоящий скачиваемый чекпойнт, а не заглушка: 16 шардов safetensors общим объёмом около 70 ГБ, BF16, лицензия Apache-2.0, создан 8 сентября. Файл конфигурации достаточно конкретен, чтобы проектировать под него:

• Архитектура — Qwen3_5MoeForConditionalGeneration, семейство qwen3_5_moe, со vision-стеком: карточка помечает его как image-text-to-text, а репозиторий поставляет preprocessor_config.json вместе с текстовой конфигурацией.

• Форма — 40 слоёв, скрытый размер 2048, grouped-query attention с 16 головками запросов и 2 KV-головками, словарь объёмом 248 320.

• MoE — 256 маршрутизируемых экспертов с 8 активными на токен плюс общий эксперт, промежуточный размер 512 — разреженно-активируемый профиль, который позволяет запускать модель «класса 35B» с ~3B активных параметров на двух H100.

• Контекст — max_position_embeddings в 262 144 токена в опубликованной конфигурации, тот же показатель в 262K, который фигурирует в рецептах развёртывания всего семейства моделей.

• Веса и лицензия — BF16, Apache-2.0, без ограничений доступа; репозиторий также ссылается на зеркало ModelScope и на GitHub-организацию (nex-agi), в которой хранятся рецепты развёртывания данного семейства моделей.

Документация по развёртыванию Nex-AGI — это та часть, в которой ошибается большинство открытых релизов, и этот релиз справляется с ней на удивление хорошо. Mini обслуживается через кастомный Docker-образ SGLang (nexagi/sglang:v0.5.18-nex-patch) на одном узле с двумя H100 с использованием тензорного параллелизма 2. Рекомендуемые параметры сэмплирования: temperature 0.7, top_p 0.95, top_k 40. Вызов инструментов обрабатывается парсером qwen3_coder от SGLang, а модель предоставляет три режима рассуждений через поле reasoning_effort: «none» — без размышлений, «medium» — адаптивный режим по умолчанию, «high» — с постоянными размышлениями. Для небольшой агентной модели управление режимом размышлений — это разница между рабочим агентным циклом и медленным, и оно встроено в рецепт развёртывания, а не оставлено на усмотрение пользователя.

A single-column scoreboard titled 'Nex-N2.5 Mini - the scoreboard' with rows 'Params: 35B total / ~3B active (vendor-reported)', 'Architecture: qwen3_5_moe MoE - 256 experts / 8 active', 'Context: 262,144 tokens', 'Input: image + text', 'License: Apache-2.0 - BF16 weights live' and 'OSWorld-Verified: 71.2 (vendor-reported)', with a footer 'Specs from the HF config; benchmarks are Nex-AGI-reported, no independent run yet.'

Веса: что на самом деле можно скачать

Состояние трёх уровней на день запуска стоит описать точно, потому что анонс и репозитории не полностью совпадают. На момент написания статьи Mini полностью доступен для загрузки под лицензией Apache-2.0 — именно на нём основана эта статья. Nex-N2.5 Max также опубликован: его репозиторий на Hugging Face содержит 644 сегмента safetensors, хотя для воспроизведения его масштаба в триллион параметров потребуется проект на базе 16×H200. Nex-N2.5 Pro остаётся исключением: его репозиторий на Hugging Face существует, но содержит только README и изображения, без сегментов модели, а в карточке по-прежнему сказано, что веса будут позже. Если вас интересует именно большой мультимодальный уровень, то вот за каким разрывом стоит следить — в материалах запуска Pro описывают как самую сильную модель семейства для работы с компьютером, и именно её пока нельзя запустить локально.

A screenshot of the Hugging Face repository page for nex-agi/Nex-N2.5-mini (captured September 9, 2026), showing the model header with Text Generation / Transformers / Safetensors / qwen3_5_moe / image-text-to-text / conversational tags and 'License: apache-2.0', and the Files & versions tree for the main branch listing config.json, README.md, chat_template.jinja and the figures directory.

Цифры, о которых сообщил Nex-AGI, — и оговорка, которая следует за ними.

Карточка модели Nex-AGI содержит полную таблицу бенчмарков для Mini, и каждая цифра в ней — это собственные данные вендора. На момент написания этого текста не было опубликовано ни одного независимого прогона, и в карточке прямо указано, что результаты взяты из официальных лидербордов бенчмарков и последних отчётов об оценке там, где они доступны, а в остальных случаях — из собственных оценок Nex-AGI. Результаты по написанию кода были получены с помощью харнесса команды NexAU; результаты по работе с компьютером и браузером — с помощью харнесса NexCUA, который, согласно карточке, будет опубликован с открытым исходным кодом. Относитесь к ключевым строкам как к лучшему сценарию вендора, пока нейтральная сторона не воспроизведёт их.

В таком ключе заявленные показатели Mini таковы: в текстово-кодовых задачах Terminal-Bench 2.1 даёт 73,4, SWE-Bench Pro — 43,8, DeepSWE v1.1 — 36,1, AutomationBench v1.0.6 — 32,3, Toolathlon Verified — 54,6, BrowseComp — 83,4 и GDPval-AA v2 — 1446. В мультимодальном/компьютерном блоке внимание привлекают OSWorld-Verified — 71,2, WebArena-Verified — 63,4, WebTest — 48,6 (запущен в oracle-режиме с проверкой по эталонным чек-листам), OSWorld-G — 82,9 и OmniDoc — 89,7, а также более скромные результаты OSWorld-2 (30,5) и Vision2Web (52,9).

Два замечания. Во-первых, OSWorld-Verified и OSWorld-2 — это разные наборы тестов: один — верифицированное подмножество, оцениваемое по итоговому состоянию среды, другой — более новый и в целом более строгий прогон. Поэтому 71.2 в одном и 30.5 в другом не противоречат друг другу; это разные тесты, и в собственной таблице Nex они указаны в отдельных колонках. Во-вторых, в каждой строке таблицы семейства Mini показывает результаты ниже, чем Pro и Max, а верх каждой колонки принадлежит действующей передовой модели вроде Claude Opus 5 или GPT-5.6 Sol. История Mini не в том, что она бьёт передовые модели, а в том, что открытая модель с ~3B активных параметров сообщает о конкурентоспособных результатах на computer-use бенчмарках при использовании всего двух H100. Выдерживает ли это проверку — именно тот вопрос, на который вам позволяют ответить открытые веса.

Сегодня запускаю Nex-N2.5 Mini.

{{1}}Рецепт с двумя H100 делает Mini самым дешёвым способом на практике проверить ключевое утверждение семейства.{{/1}} {{2}}Поскольку архитектура — это стандартный Qwen3.5-MoE с парсером вызовов инструментов qwen3_coder, модель загружается в форке Nex-AGI SGLang без специального кода для инференса,{{/2}} {{3}}а рекомендуемые настройки опубликованы, а не оставлены для реверс-инжиниринга.{{/3}} {{4}}Честное ожидание, с которым стоит начинать: вчерашний checkpoint с совершенно новой обвязкой — это эксперимент, а не зависимость.{{/4}} {{5}}Загрузки в репозитории Mini всё ещё исчисляются единицами, и на момент написания ни одна третья сторона не представила независимой оценки —{{/5}} {{6}}что нормально для модели, выпущенной вчера, и объясняет, почему так важна конфигурация с двумя H100:{{/6}} {{7}}вы можете запустить эксперимент самостоятельно уже на этой неделе, вместо того чтобы ждать, пока это сделает кто-то другой.{{/7}}

A screenshot of the nex-agi collections page on Hugging Face (captured September 9, 2026), showing the Nex-N2.5 collection 'updated about 7 hours ago' with the three model entries nex-agi/Nex-N2.5-Max (Text Generation, 1.6T), nex-agi/Nex-N2.5-Pro and nex-agi/Nex-N2.5-mini, alongside the earlier Nex-N2, Nex-N1.1 and Nex-N1 collections listed on the left.

Если вы хотите сравнить Mini с передовыми агентами в его собственной бенчмарк-таблице, а не вручную настраивать одно развертывание, то именно здесь слой маршрутизации оправдывает себя. Когда хостинг-провайдер включает Nex-N2.5 Mini в каталог — а устоявшиеся модели, с которыми его сравнивают, уже доступны через маршрутизаторы — один API для 200+ моделей, с ценами провайдера, передаваемыми без наценки, и автоматическим фейловером, это дешевый способ прогнать одну и ту же задачу на нескольких из них без отдельной интеграции. На OrcaRouter это стандартная настройка для каждой модели, которую мы маршрутизируем: тот же ключ, тот же формат запроса, собственная цена вендора без каких-либо добавок. Это особенно важно для непроверенной модели вроде этой, потому что именно фейловер позволяет опробовать ее на реальном маршруте, не ставя сам маршрут на кон.

Кто должен тянуть эти веса?

Берите их, если ваша работа связана с агентами computer-use, автоматизацией браузера или визуально обоснованным использованием инструментов и вам нужна модель с разрешительной лицензией, разворачиваемая у себя, чтобы сравнивать её по бенчмаркам с лидирующими облачными моделями. Лицензия Apache-2.0 снимает обычные препоны для релиза китайской лаборатории; объём в два H100 по силам серьёзной агентной команде; а управление усилием рассуждения плюс настоящий парсер вызовов инструментов делают её достоверным испытательным стендом, а не игрушкой. Повремените, если вам нужна самая мощная модель computer-use в семействе, — это роль Pro, а веса Pro как раз ещё не опубликованы. И не снимайте ярлык вендора ни с одной строки бенчмарка, пока независимый прогон не подтвердит результаты: 71.2 на OSWorld-Verified от открытой модели с ~3B активных параметров — это смелое заявление, и именно такое заявление стоит проверить на собственном стенде, прежде чем строить на нём.

Что смотреть дальше. Публикация весов Pro — самый важный сигнал: она превращает семейство из «Mini плюс гигант с триллионом параметров» в полную линейку, описанную в материалах запуска. Второй сигнал — открытие исходного кода инструментария NexCUA, без которого показатели использования компьютера невозможно независимо воспроизвести по тому же протоколу. Третий — первый нейтральный прогон от Artificial Analysis, университетской лаборатории или практикующего специалиста, публикующего своё OSWorld-Verified воспроизведение. Когда произойдёт любое из этих трёх событий, вопрос, который ставит этот запуск — действительно ли открытые агентные модели сократили разрыв с облачными стеками для компьютерного использования, — перестанет зависеть от таблиц вендоров.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube