Сгенерированная титульная карточка для 'Nex-N2.5 Pro против Kimi K3' с подзаголовком 'Противостояние, в котором собственная бенчмарк-карта новичка становится судьёй', большой скруглённый документ с надписью 'КАРТА БЕНЧМАРКА ПОСТАВЩИКА', с двумя колонками моделей и строкой 'Pro уступает K3 на большинстве общих строк' над ним, и с логотипом OrcaRouter, композиционно размещённым в правом нижнем углу.
Guides & Insights

Nex-N2.5 Pro vs Kimi K3: противостояние, где судьёй выступает собственная карта бенчмарков новичка

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Посмотрите на показатели, общие для Nex-N2.5 Pro и Kimi K3, — и вы поймёте, кто их предоставил. Nex-N2.5 Pro от Nex-AGI — мультимодальный агент с 397 миллиардами параметров и ~17 миллиардами активных параметров, представленный 8 сентября 2026 года, с весами, всё ещё помеченными как «скоро», — публикует таблицу бенчмарков, в которой Kimi K3 от Moonshot AI указан прямо в тех же колонках. Kimi K3 — это флагманская модель Moonshot с открытыми весами на 2,8 триллиона параметров, выпущенная 16 июля 2026 года: в ней контекст на миллион токенов, одиннадцать дней спустя появились полные веса под лицензией Modified MIT, а 57 баллов в Artificial Analysis Intelligence Index делают её лучшей моделью с открытыми весами в таблице лидеров. И строка за строкой в этой таблице Nex-N2.5 Pro уступает Kimi K3: Terminal-Bench 2.1 — 82,7 против 88,3 у K3, BrowseComp — 89,7 против 91,2, SWE-Bench Pro — 61,2 против 63,3, AutomationBench — 44,2 против 46,7. Когда вендор публикует показатели собственной модели рядом с текущим лидером среди моделей с открытыми весами и его собственная модель проигрывает в большинстве строк, самое интересное в этом противостоянии то, что таблица, вероятно, говорит правду.

Вот в чём необычность этого сравнения. Обычно карточка новичка — то самое место, где ищут преувеличения. Здесь же карточка — это самое близкое к честному судье, что есть у обеих моделей: у Nex-AGI не было причин публиковать таблицу, которая принижает её собственный уровень Pro, — а строки, где Pro действительно обходит K3, это ровно те строки, где небольшая узкоспециализированная модель для работы с компьютером и должна обходить гораздо более крупного универсала. Поэтому реальный вопрос, на который отвечает эта страница, уже и полезнее, чем «кто лучше»: устоит ли заявленная ниша Nex-N2.5 Pro — близкая к K3 агентная производительность при примерно одной шестой активных параметров — перед фактом, что Kimi K3 уже существует, её веса уже открыты, и именно её теперь нужно превзойти?

Противник, полностью

Kimi K3 — не нишевая модель, и именно поэтому она служит правильным ориентиром. Это флагман Moonshot: 2,8 трлн суммарных параметров, из которых активны 104 млрд при архитектуре Stable LatentMoE, контекст на 1 млн токенов с соответствующим бюджетом на генерацию, нативное понимание текста, изображений и видео, постоянно включённый режим рассуждений и открытые веса, которые при достаточно мощном «железе» можно реально запустить. Её результаты сильны сами по себе: 57 баллов Intelligence Index (Artificial Analysis) — больше, чем у любой другой модели с открытыми весами, а на Frontend Code Arena она набрала 1679 Elo, обойдя Claude Fable 5 и GPT-5.6 Sol. При этом цена, составляющая $3.00 за миллион входных токенов, $15.00 за миллион выходных и $0.30 за кэшированные входные, находится в премиальной части сегмента моделей с открытыми весами. Kimi K3 — это то, как выглядит «передовая и открытая» модель, когда вендор не идёт на компромисс по масштабу: в пересчёте на выходные токены она дороже закрытых конкурентов вроде GPT-5.6 Sol, её эксплуатация обходится дорого, а оспорить её позиции в лидербордах очень трудно.

Арифметика претендента

Nex-N2.5 Pro не пытается превзойти Kimi K3 по масштабу. Он пытается превзойти её по эффективности обслуживания. Nex-AGI дообучила Pro-версию на базе модели из семейства Qwen3.5, превратив её в визуально-ориентированного агента для управления компьютерами и браузерами. Её главный аргумент — эффективность: 397B суммарно / ~17B активных, контекст 262K и схема развёртывания на одном узле с 8×H100 — против 2.8T / 104B активных у K3 и того парка серверов, который требуется модели такого масштаба. Подразумеваемый аргумент состоит в том, что специалист с 17B активных параметров, обученный именно циклу агента с визуальной обратной связью, способен обеспечить большую часть агентской производительности универсальной модели со 104B активных параметров при небольшой доле затрат на обслуживание. В собственной карточке Nex-AGI это утверждение выглядит правдоподобно, но лишь частично: Pro превосходит K3 или как минимум не уступает ей в OSWorld-G (87.4 против 79.6) и OmniDoc (92.2 против 91.1), а по остальным общим строкам уступает с разницей меньше 10 пунктов — 397B-модель, проигрывающая 2.8T-модели на 3–6 пунктов в кодинге и браузинге, если это правда, и есть именно та история эффективности, которую Nex хочет рассказать.

Если это правда. Каждое из этих чисел — собственные данные Nex-AGI, полученные по крайней мере частично через её внутренний стенд NexCUA, а Nex-N2.5 Pro сегодня независимо проверить нельзя: веса модели недоступны для скачивания. В репозитории Hugging Face — только README, папка с изображениями и баннер «веса скоро появятся», ничего больше. Эта же оговорка относится к цифрам по K3, которые приводит карточка: большинство из них Nex собрала из опубликованных отчётов Moonshot, а не измерила сама. Таблица Nex-AGI показывает не то, кто побеждает, а то, что собственные инженеры Nex-AGI, выбирая бенчмарки и стенд, не смогли заставить свою Pro-версию обойти Kimi K3 на большинстве общих тестов. Это более полезная информация, чем любой отдельный балл, потому что она задаёт верхнюю границу того, насколько маркетинг может преувеличивать.

A comparison scoreboard for Nex-N2.5 Pro and Kimi K3: Nex-N2.5 Pro rows 'Total / active: 397B / ~17B', 'Weights: coming soon', 'Context: 262K', 'Price: no rate card (free preview)', 'Terminal-Bench 2.1: 82.7 (Nex-reported)', 'OSWorld-2: 56.4 (Nex-reported)'; Kimi K3 rows 'Total / active: 2.8T / 104B', 'Weights: open, Modified MIT', 'Context: 1M', 'Price: $3 / $15, cache $0.30', 'Terminal-Bench 2.1: 88.3 (Moonshot)', 'OSWorld-2: 58.3 (Nex-compiled)'; footer 'All figures vendor-reported; Kimi K3 AA Index 57 per Artificial Analysis.'

Строки, которые имеют значение, — бок о бок

Масштаб — Nex-N2.5 Pro: 397 млрд параметров всего / ~17 млрд активных, мультимодальная модель на базе Qwen3.5. Kimi K3: 2,8 трлн параметров всего / 104 млрд активных, архитектура Stable LatentMoE, мультимодальная модель.

Веса — Nex-N2.5 Pro: обещаны, но не выпущены (на карточке указано «скоро»). Kimi K3: опубликованы 27 июля под модифицированной лицензией MIT — доступны для скачивания сегодня.

Контекст — Nex-N2.5 Pro: 262K. Kimi K3: 1M токенов, фиксированная цена.

Цена — Nex-N2.5 Pro: тарифа ещё нет; бесплатный хостинговый предпросмотр. Kimi K3: $3.00 / $15.00 за миллион, кэшированный ввод $0.30.

Независимый статус — Nex-N2.5 Pro: пока нет. Kimi K3: AA Intelligence Index 57, лучшая модель с открытыми весами в таблице лидеров.

Программирование (карточки вендоров) — Nex-N2.5 Pro: Terminal-Bench 2.1 82.7, SWE-Bench Pro 61.2. Kimi K3: 88.3 и 63.3 в тех же строках.

GUI / использование компьютера — Nex-N2.5 Pro: OSWorld-G 87.4 (превосходит K3 на его собственной карте), OSWorld-2 56.4. Kimi K3: OSWorld-G 79.6, OSWorld-2 58.3 (сборка Nex).

Требования к самохостингу — Nex-N2.5 Pro: конфигурация для одного узла с 8×H100, как только появятся веса. Kimi K3: 2.8T — это парк серверов для инференса, а не один узел.

Что означает «open» по-разному в каждом столбце

Слово «open» в этих двух случаях несёт совершенно разную смысловую нагрузку, и именно оно решает исход этого противостояния больше, чем любой бенчмарк. Kimi K3 открыта в том смысле, который важен на практике: веса лежат на хабе под довольно свободной лицензией Modified MIT, цепочки рассуждений доступны в потоковом API, и компания с ограничениями по управлению данными может запустить её на подконтрольном оборудовании и проверить, о чём думала модель. Такая открытость требует затрат — модель на 2,8 трлн параметров нуждается в серьёзной инфраструктуре, — но возможность существует уже сегодня. Nex-N2.5 Pro открыта в смысле намерения: Nex-AGI заявляет, что веса семейства будут выпущены как open source, а её младшая родственница Nex-N2.5 Mini действительно вышла в день запуска с весами под Apache-2.0. Pro пока не вышла: её лицензия объявлена на карточке, но пока не применяется ни к чему, что можно скачать, и до появления чекпоинта «open» — это пункт дорожной карты, а не свойство модели. Для команды, выбирающей между ними, это не сноска — это разница между моделью, которой можно владеть уже в этом месяце, и моделью, владение которой вам обещают.

Оценка без ожидания кнопки загрузки

Вам не нужно замораживать это решение до выхода весов Nex-N2.5 Pro — слой маршрутизации и есть то место, где такой эксперимент проводится дёшево. Kimi K3 доступен в OrcaRouter по прайс-листу Moonshot — $3.00 / $15.00, нулевая наценка; цена передаётся без изменений и обновляется в день, когда Moonshot её меняет. Так что лидер среди моделей с открытыми весами находится в одном клике рядом с остальными 200+ моделями в каталоге. Nex-N2.5 Pro через нас не предлагается, поэтому сегодня тестировать его — значит hosted-превью Nex-AGI, а позже — собственный стек из восьми H100. Подходящая схема: отдавать задачи с длинным контекстом и интенсивным аудитом на Kimi K3 через единый endpoint, который вы уже используете, направить тестовую ветку на превью Nex-N2.5 Pro и позволить автоматическому failover обходить ту из моделей, которая деградирует. Именно так вы сравниваете выпущенную фронтирную модель с претендентом, чьи веса ещё не вышли, не ставя на кон продакшн-путь ни ради одной из них. Когда веса Pro наконец появятся, проверка проста: прогоните общие строки, которые сможет воспроизвести независимая лаборатория, и посмотрите, выживет ли история об эффективности при 17B активных параметрах за пределами собственного тестового стенда Nex-AGI.

A screenshot of the Hugging Face 'Files and versions' tab for nex-agi/Nex-N2.5-Pro (captured September 9, 2026), showing the model header with Text Generation and Transformers tags, 'License: apache-2.0', and a file tree listing only figures, .gitattributes and README.md - no model weight shards, confirming the Pro checkpoint is not yet published.A screenshot of the OrcaRouter model page for kimi/kimi-k3 (captured September 9, 2026), showing the Kimi K3 card under vendor MoonshotAI with model id kimi/kimi-k3, a 1M-token context, text + image input and text output, vision/tools/reasoning chips, and a 'Public benchmarks by MoonshotAI' note dated 2026-07-15.

Где окажется это противостояние

На фоне самой крупной модели с открытыми весами из когда-либо выпущенных Nex-N2.5 Pro не обязана побеждать в войне универсальных моделей, чтобы за ней стоило следить, — ей достаточно выиграть аргумент о стоимости инференса, и её собственная карточка говорит, что этот аргумент реален, но не доказан. Kimi K3 — безопасный и по-настоящему сильный выбор на сегодня: открытые веса, верхняя строчка индекса открытых моделей, контекст на миллион токенов и цена, которую можно заложить в бюджет, — но ценой инфраструктуры, которая лишь усложняется по мере роста модели. Nex-N2.5 Pro — ставка на эффективность: агентные результаты уровня K3 при шестой части активных параметров на одном узле, согласно таблице вендора о модели, которая ещё не выпущена. Берите Kimi K3, если хотите фронтирную модель, которой реально можно владеть и которую можно проверить прямо сейчас. Следите за Nex-N2.5 Pro в ожидании дня, когда появятся её веса и кто-то независимый прогонит общие бенчмарки, — потому что если агент с 17 млрд активных параметров действительно удержится в пределах нескольких пунктов от флагмана со 104 млрд активных параметров в сценариях использования компьютера, то именно этот результат изменит экономику инференса для каждого открытого агента после неё.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно