
Nex-N2.5 Pro vs Kimi K3: противостояние, где судьёй выступает собственная карта бенчмарков новичка
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0455Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0247Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0247Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0157Интеллект82Кодинг
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2646Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1849Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1541Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1251Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0547Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0347Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2140Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Интеллект49Кодинг
Посмотрите на показатели, общие для Nex-N2.5 Pro и Kimi K3, — и вы поймёте, кто их предоставил. Nex-N2.5 Pro от Nex-AGI — мультимодальный агент с 397 миллиардами параметров и ~17 миллиардами активных параметров, представленный 8 сентября 2026 года, с весами, всё ещё помеченными как «скоро», — публикует таблицу бенчмарков, в которой Kimi K3 от Moonshot AI указан прямо в тех же колонках. Kimi K3 — это флагманская модель Moonshot с открытыми весами на 2,8 триллиона параметров, выпущенная 16 июля 2026 года: в ней контекст на миллион токенов, одиннадцать дней спустя появились полные веса под лицензией Modified MIT, а 57 баллов в Artificial Analysis Intelligence Index делают её лучшей моделью с открытыми весами в таблице лидеров. И строка за строкой в этой таблице Nex-N2.5 Pro уступает Kimi K3: Terminal-Bench 2.1 — 82,7 против 88,3 у K3, BrowseComp — 89,7 против 91,2, SWE-Bench Pro — 61,2 против 63,3, AutomationBench — 44,2 против 46,7. Когда вендор публикует показатели собственной модели рядом с текущим лидером среди моделей с открытыми весами и его собственная модель проигрывает в большинстве строк, самое интересное в этом противостоянии то, что таблица, вероятно, говорит правду.
Вот в чём необычность этого сравнения. Обычно карточка новичка — то самое место, где ищут преувеличения. Здесь же карточка — это самое близкое к честному судье, что есть у обеих моделей: у Nex-AGI не было причин публиковать таблицу, которая принижает её собственный уровень Pro, — а строки, где Pro действительно обходит K3, это ровно те строки, где небольшая узкоспециализированная модель для работы с компьютером и должна обходить гораздо более крупного универсала. Поэтому реальный вопрос, на который отвечает эта страница, уже и полезнее, чем «кто лучше»: устоит ли заявленная ниша Nex-N2.5 Pro — близкая к K3 агентная производительность при примерно одной шестой активных параметров — перед фактом, что Kimi K3 уже существует, её веса уже открыты, и именно её теперь нужно превзойти?
Противник, полностью
Kimi K3 — не нишевая модель, и именно поэтому она служит правильным ориентиром. Это флагман Moonshot: 2,8 трлн суммарных параметров, из которых активны 104 млрд при архитектуре Stable LatentMoE, контекст на 1 млн токенов с соответствующим бюджетом на генерацию, нативное понимание текста, изображений и видео, постоянно включённый режим рассуждений и открытые веса, которые при достаточно мощном «железе» можно реально запустить. Её результаты сильны сами по себе: 57 баллов Intelligence Index (Artificial Analysis) — больше, чем у любой другой модели с открытыми весами, а на Frontend Code Arena она набрала 1679 Elo, обойдя Claude Fable 5 и GPT-5.6 Sol. При этом цена, составляющая $3.00 за миллион входных токенов, $15.00 за миллион выходных и $0.30 за кэшированные входные, находится в премиальной части сегмента моделей с открытыми весами. Kimi K3 — это то, как выглядит «передовая и открытая» модель, когда вендор не идёт на компромисс по масштабу: в пересчёте на выходные токены она дороже закрытых конкурентов вроде GPT-5.6 Sol, её эксплуатация обходится дорого, а оспорить её позиции в лидербордах очень трудно.
Арифметика претендента
Nex-N2.5 Pro не пытается превзойти Kimi K3 по масштабу. Он пытается превзойти её по эффективности обслуживания. Nex-AGI дообучила Pro-версию на базе модели из семейства Qwen3.5, превратив её в визуально-ориентированного агента для управления компьютерами и браузерами. Её главный аргумент — эффективность: 397B суммарно / ~17B активных, контекст 262K и схема развёртывания на одном узле с 8×H100 — против 2.8T / 104B активных у K3 и того парка серверов, который требуется модели такого масштаба. Подразумеваемый аргумент состоит в том, что специалист с 17B активных параметров, обученный именно циклу агента с визуальной обратной связью, способен обеспечить большую часть агентской производительности универсальной модели со 104B активных параметров при небольшой доле затрат на обслуживание. В собственной карточке Nex-AGI это утверждение выглядит правдоподобно, но лишь частично: Pro превосходит K3 или как минимум не уступает ей в OSWorld-G (87.4 против 79.6) и OmniDoc (92.2 против 91.1), а по остальным общим строкам уступает с разницей меньше 10 пунктов — 397B-модель, проигрывающая 2.8T-модели на 3–6 пунктов в кодинге и браузинге, если это правда, и есть именно та история эффективности, которую Nex хочет рассказать.
Если это правда. Каждое из этих чисел — собственные данные Nex-AGI, полученные по крайней мере частично через её внутренний стенд NexCUA, а Nex-N2.5 Pro сегодня независимо проверить нельзя: веса модели недоступны для скачивания. В репозитории Hugging Face — только README, папка с изображениями и баннер «веса скоро появятся», ничего больше. Эта же оговорка относится к цифрам по K3, которые приводит карточка: большинство из них Nex собрала из опубликованных отчётов Moonshot, а не измерила сама. Таблица Nex-AGI показывает не то, кто побеждает, а то, что собственные инженеры Nex-AGI, выбирая бенчмарки и стенд, не смогли заставить свою Pro-версию обойти Kimi K3 на большинстве общих тестов. Это более полезная информация, чем любой отдельный балл, потому что она задаёт верхнюю границу того, насколько маркетинг может преувеличивать.

Строки, которые имеют значение, — бок о бок
• Масштаб — Nex-N2.5 Pro: 397 млрд параметров всего / ~17 млрд активных, мультимодальная модель на базе Qwen3.5. Kimi K3: 2,8 трлн параметров всего / 104 млрд активных, архитектура Stable LatentMoE, мультимодальная модель.
• Веса — Nex-N2.5 Pro: обещаны, но не выпущены (на карточке указано «скоро»). Kimi K3: опубликованы 27 июля под модифицированной лицензией MIT — доступны для скачивания сегодня.
• Контекст — Nex-N2.5 Pro: 262K. Kimi K3: 1M токенов, фиксированная цена.
• Цена — Nex-N2.5 Pro: тарифа ещё нет; бесплатный хостинговый предпросмотр. Kimi K3: $3.00 / $15.00 за миллион, кэшированный ввод $0.30.
• Независимый статус — Nex-N2.5 Pro: пока нет. Kimi K3: AA Intelligence Index 57, лучшая модель с открытыми весами в таблице лидеров.
• Программирование (карточки вендоров) — Nex-N2.5 Pro: Terminal-Bench 2.1 82.7, SWE-Bench Pro 61.2. Kimi K3: 88.3 и 63.3 в тех же строках.
• GUI / использование компьютера — Nex-N2.5 Pro: OSWorld-G 87.4 (превосходит K3 на его собственной карте), OSWorld-2 56.4. Kimi K3: OSWorld-G 79.6, OSWorld-2 58.3 (сборка Nex).
• Требования к самохостингу — Nex-N2.5 Pro: конфигурация для одного узла с 8×H100, как только появятся веса. Kimi K3: 2.8T — это парк серверов для инференса, а не один узел.
Что означает «open» по-разному в каждом столбце
Слово «open» в этих двух случаях несёт совершенно разную смысловую нагрузку, и именно оно решает исход этого противостояния больше, чем любой бенчмарк. Kimi K3 открыта в том смысле, который важен на практике: веса лежат на хабе под довольно свободной лицензией Modified MIT, цепочки рассуждений доступны в потоковом API, и компания с ограничениями по управлению данными может запустить её на подконтрольном оборудовании и проверить, о чём думала модель. Такая открытость требует затрат — модель на 2,8 трлн параметров нуждается в серьёзной инфраструктуре, — но возможность существует уже сегодня. Nex-N2.5 Pro открыта в смысле намерения: Nex-AGI заявляет, что веса семейства будут выпущены как open source, а её младшая родственница Nex-N2.5 Mini действительно вышла в день запуска с весами под Apache-2.0. Pro пока не вышла: её лицензия объявлена на карточке, но пока не применяется ни к чему, что можно скачать, и до появления чекпоинта «open» — это пункт дорожной карты, а не свойство модели. Для команды, выбирающей между ними, это не сноска — это разница между моделью, которой можно владеть уже в этом месяце, и моделью, владение которой вам обещают.
Оценка без ожидания кнопки загрузки
Вам не нужно замораживать это решение до выхода весов Nex-N2.5 Pro — слой маршрутизации и есть то место, где такой эксперимент проводится дёшево. Kimi K3 доступен в OrcaRouter по прайс-листу Moonshot — $3.00 / $15.00, нулевая наценка; цена передаётся без изменений и обновляется в день, когда Moonshot её меняет. Так что лидер среди моделей с открытыми весами находится в одном клике рядом с остальными 200+ моделями в каталоге. Nex-N2.5 Pro через нас не предлагается, поэтому сегодня тестировать его — значит hosted-превью Nex-AGI, а позже — собственный стек из восьми H100. Подходящая схема: отдавать задачи с длинным контекстом и интенсивным аудитом на Kimi K3 через единый endpoint, который вы уже используете, направить тестовую ветку на превью Nex-N2.5 Pro и позволить автоматическому failover обходить ту из моделей, которая деградирует. Именно так вы сравниваете выпущенную фронтирную модель с претендентом, чьи веса ещё не вышли, не ставя на кон продакшн-путь ни ради одной из них. Когда веса Pro наконец появятся, проверка проста: прогоните общие строки, которые сможет воспроизвести независимая лаборатория, и посмотрите, выживет ли история об эффективности при 17B активных параметрах за пределами собственного тестового стенда Nex-AGI.


Где окажется это противостояние
На фоне самой крупной модели с открытыми весами из когда-либо выпущенных Nex-N2.5 Pro не обязана побеждать в войне универсальных моделей, чтобы за ней стоило следить, — ей достаточно выиграть аргумент о стоимости инференса, и её собственная карточка говорит, что этот аргумент реален, но не доказан. Kimi K3 — безопасный и по-настоящему сильный выбор на сегодня: открытые веса, верхняя строчка индекса открытых моделей, контекст на миллион токенов и цена, которую можно заложить в бюджет, — но ценой инфраструктуры, которая лишь усложняется по мере роста модели. Nex-N2.5 Pro — ставка на эффективность: агентные результаты уровня K3 при шестой части активных параметров на одном узле, согласно таблице вендора о модели, которая ещё не выпущена. Берите Kimi K3, если хотите фронтирную модель, которой реально можно владеть и которую можно проверить прямо сейчас. Следите за Nex-N2.5 Pro в ожидании дня, когда появятся её веса и кто-то независимый прогонит общие бенчмарки, — потому что если агент с 17 млрд активных параметров действительно удержится в пределах нескольких пунктов от флагмана со 104 млрд активных параметров в сценариях использования компьютера, то именно этот результат изменит экономику инференса для каждого открытого агента после неё.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
