
MiniCPM5-2B против Granite 4.2 3B: специалист по рассуждениям на 3B против нового агентного стека на 2.5B
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ModelBest включила Granite 4.2 3B в собственную таблицу результатов MiniCPM5-2B ещё до того, как её об этом попросили. В карточке модели MiniCPM5-2B, которую OpenBMB опубликовала, когда веса незаметно появились на Hugging Face, самая маленькая модель рассуждений IBM указана среди базовых линий для сравнения; и на этом наборе тестов MiniCPM5-2B показывает в среднем 53,9 против 42,7 у Granite 4.2 3B. Это единственный результат прямого сравнения, который кто-либо из вендоров опубликовал для этой пары, поэтому с него естественно начать — и естественно быть осторожным. Обе модели небольшие, с открытыми весами и лицензией Apache-2.0, предназначены для самостоятельного развёртывания и нацелены на одну и ту же задачу конца 2026 года; просто они подходят к ней с противоположных сторон: одна обучена рассуждать, другая — действовать.
Эти два релиза перекликаются сильнее, чем можно предположить по маркетингу их вендоров. MiniCPM5-2B был представлен на Всемирной конференции по искусственному интеллекту 19 июля как флагманская модель ModelBest и OpenBMB для запуска на устройствах — плотная модель класса 2B, позиционируемая как агентная основа для телефонов, ПК и умных кокпитов, — а его веса появились 6 и 7 сентября без презентации, под лицензией Apache-2.0, вместе с чекпойнтами GGUF, MLX, GPTQ, base, SFT и draft и тренировочными данными, на которых они основаны. Granite 4.2 3B — рассуждающая модель IBM для ноутбуков, чьи веса появились на Hugging Face в начале августа, а карточка модели и технический блог вышли 25 августа. Ни одна из них пока не прошла независимых бенчмарков, поэтому указанные ниже метки источников важнее цифр.
Два релиза, которые рифмуются
Granite 4.2 3B — это автономная плотная модель для рассуждений, дообученная на основе Granite-4.1-3B-Base. Она содержит 40 слоёв с группированным вниманием по запросам, собственный контекст на 128K, который IBM расширяет до 512K на пятом этапе предварительного обучения, и три режима мышления для каждого запроса: полное мышление по умолчанию, режим низких усилий и путь без мышления. Её карточка модели недвусмысленно указывает, чем модель не является: в отличие от собратьев Granite 4.2 с параметрами 8B и 30B, версия 3B намеренно пропустила специализированный блок агентного обучения с подкреплением, обученный в средах SWE-agent, терминала и поиска, поэтому IBM не приводит результатов SWE-bench и позиционирует модель как специалиста по рассуждениям, а не как агента. Модель работает через vLLM, SGLang, Transformers, GGUF и Ollama (granite4.2:3b), занимает примерно 6–8 ГБ в bfloat16 или менее 2 ГБ в квантованном виде и не имеет публичного API. Её ключевые показатели — AIME 2025: 78.33; GPQA: 54.80; LiveCodeBench v6: 69.71; MMLU-Pro: 67.84 — предоставлены IBM и на сегодняшний день не воспроизведены независимо.

MiniCPM5-2B — это, напротив, готовая агентно-ориентированная модель. В карточке описана плотная трансформерная сеть с 2,52 млрд суммарных параметров (1,98 млрд без эмбеддингов), 42 слоями при скрытой размерности 2048, grouped-query attention с 16 query-головами и двумя KV-головами, а также стандартная архитектура LlamaForCausalLM без собственных ядер. В анонсе запуска акцент делался на агентных возможностях: агентный mid-training масштаба 200B, обширный агентный SFT-набор, RL-выравнивание агента и финальная дистилляция On-Policy Distillation, которая сводит шестнадцать RL-экспертных моделей обратно в одну небольшую плотную сеть, — плюс нативная поддержка длинного контекста и гибридные режимы быстрых и обдуманных ответов. В поставляемой конфигурации задано окно контекста в 131 072 токена (в июльских материалах анонсировали 512K; в выпущенной конфигурации этого нет), а в карточке заявлены XML-подобные вызовы инструментов со встроенным парсером SGLang. В собственной таблице оценок указано внутреннее среднее 53,9 по выбранному вендором набору сравнений, результат 86,5 на AIME 2025/2026, 94,6 на MATH-500 и полученный вендором результат 46,4 на SWE-bench Verified; для плотной модели на 2,5B это было бы выдающимся показателем, если он выдержит независимое тестирование.

Очная встреча, которую кто-то уже напечатал.
Because cross-vendor scoreboards are mostly apples-to-oranges, the single most useful artifact in this matchup is the one ModelBest printed itself: MiniCPM5-2B's card lists granite-4.2-3B among its baselines and reports MiniCPM5-2B averaging 53.9 to Granite's 42.7 on that suite. Read it exactly as what it is — one vendor running both models on one suite it selected, unreproduced, with every incentive for its own model to win. It is not a verdict. What it does tell you is that ModelBest was confident enough to put a competitor's 3B on its card, and the gap it claims is largest exactly where its own training invested: the agentic and long-context rows. Treat it as a directional claim, and weigh IBM's own separate card claims before you decide anything on it. Поскольку сравнения бенчмарков между разными вендорами — это по большей части сравнение несопоставимого, самый полезный артефакт в этом противостоянии — тот, что напечатал сам ModelBest: карточка MiniCPM5-2B перечисляет granite-4.2-3B среди своих бейзлайнов и сообщает, что MiniCPM5-2B набирает в среднем 53,9 против 42,7 у Granite на этом наборе тестов. Читайте это ровно как то, чем оно является — один вендор запускает обе модели на одном выбранном им наборе тестов, без какого-либо независимого воспроизведения, и у него есть все стимулы, чтобы победила именно его модель. Это не вердикт. Что это действительно показывает — ModelBest был достаточно уверен в себе, чтобы поместить чужую модель 3B на свою карточку, и заявленный разрыв максимален ровно там, куда были вложены его собственные обучение и разработка: в строки, связанные с агентными задачами и длинным контекстом. Относитесь к этому как к указанию направления, и взвесьте заявления на отдельной карточке самой IBM, прежде чем делать на основе этого какие-либо выводы.
Табло, честно подписанное
• Релиз — MiniCPM5-2B: анонс 19 июля 2026 года; веса опубликованы 6–7 сентября, тихо. Granite 4.2 3B: веса в начале августа; карточка модели и технический блог — 25 августа 2026 года.
• Роль — MiniCPM5-2B: акцент на локальном агенте и использовании инструментов, по заявлению ModelBest. Granite 4.2 3B: специалист по рассуждениям, намеренно неагентный, по заявлению IBM.
• Размер — MiniCPM5-2B: 2,52 млрд всего / 1,98 млрд без эмбеддингов, 42 слоя. Granite 4.2 3B: ~3 млрд, плотная модель, 40 слоёв.
• Контекст — MiniCPM5-2B: 131 072 токена в поставляемой конфигурации. Granite 4.2 3B: 128K нативно, с расширением до 512K.
• Пост-обучение — MiniCPM5-2B: deep-thinking SFT, специализированное RL, On-Policy Distillation. Granite 4.2 3B: reasoning SFT, GRPO RL и RLHF; без agentic-RL-блока.
• Доказательства — MiniCPM5-2B: заявления карточки ModelBest, независимых запусков не проводилось. Granite 4.2 3B: заявления карточки IBM, не воспроизведены; AIME 2025 78,33, GPQA 54,80, LiveCodeBench v6 69,71.

Таблица выше основана на тех же источниках, что и основной текст: каждая цифра в ней указана вендором, и единственное сравнение в рамках одного и того же набора тестов, опубликованное кем-либо из вендоров, — это сравнение на собственной карточке ModelBest.
Специалист по рассуждениям против стека агентов
Прежде чем смотреть на оценки, определите, какой тип малой модели нужен для вашей задачи, поскольку эти две отвечают на разные вопросы. Granite 4.2 3B создана для рассуждений и длинного контекста на ограниченном оборудовании: нативное окно 128K, расширяющееся до 512K, три режима мышления, размер, умещающийся на ноутбуке, и явное решение отказаться от агентного обучения. Если ваша задача — анализ длинных документов, контекст масштаба репозитория или надёжные многошаговые рассуждения на небольшой машине, она подходит органично, и решение IBM не указывать агентные возможности для 3B — повод доверять её карточке, а не пробел в ней. MiniCPM5-2B создана с противоположным акцентом: агентное поведение и использование инструментов на устройстве — её обучающий конвейер читается как перечень того, от чего Granite 4.2 3B намеренно отказалась. Если ваша задача — агентный цикл на устройстве, который вызывает инструменты, поддерживает длинные диалоги и переключается между быстрыми и обдуманными ответами, этот стек создан для вас, и он несёт дополнительную неопределённость чекпойнта недельной давности с непроверенной карточкой.
Данные, которые открыла OpenBMB, IBM не открыла.
Самое неприметное различие — то, которое важнее всего для команд, собирающихся дообучать модели. OpenBMB выложила в открытый доступ обучающие корпуса MiniCPM5-2B вместе с весами — семейство UltraData, включая Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math и агентные наборы SFT и RL, — всё под лицензией Apache-2.0. Это превращает 2B из чёрного ящика в воспроизводимый рецепт: видно, на чём строилось агентное пост-обучение, и его можно продолжить в своей предметной области. IBM открыла веса Granite 4.2 3B и подробно описала, как создавалась модель, но обучающие данные не предоставила. Для организации, которая хочет владеть моделью, а не арендовать её, эта асимметрия вполне реальна. А MiniCPM5-2B предлагает сценарий развёртывания, которого у Granite при таком размере нет: поддержка с первого дня девяти семейств чипов через сообщество FlagOS компании ModelBest — от Huawei Ascend и NVIDIA до целого ряда китайских ускорителей, а также ARM. Это сигнал, что ModelBest рассчитывает на запуск 2B не только на NVIDIA GPU.
Реальность маршрутизации
Ни одна из моделей сегодня не представлена в хостинг-каталоге, поэтому это сравнение живёт в мире self-hosted — но именно здесь слой маршрутизации по-прежнему оправдывает себя как страховочная сетка, а не как механизм доставки. Когда команда хочет проверить агентную 2B-модель недельной давности против рассуждающей 3B-модели на рабочей нагрузке, которую она уже обслуживает, обратимый шаг — направить тестовый маршрут на self-hosted сборку MiniCPM5-2B через единый API с автоматическим переключением при сбое, пока продакшн продолжает работать на проверенной модели: новый стек может застопориться, ничего не остановив, а прейскурантные цены провайдера на хостинг-модели, с которыми вы сравниваете, проходят с нулевой наценкой, так что A/B-тест остаётся недорогим. Этот слой не хостит ни одну из моделей; он делает эксперимент безопасным и лёгким в откате.
Какую маленькую модель вам на самом деле стоит запускать?
Запускайте Granite 4.2 3B, если ваша нагрузка — рассуждения с длинным контекстом на машине уровня ноутбука и вам нужны три режима мышления, потолок 512K и честная карточка модели, которая точно говорит, чему 3B не обучалась. Запускайте MiniCPM5-2B, если ваша нагрузка — интерактивный агент на устройстве с вызовом инструментов, где 2.5B вписывается в ваш бюджет памяти, — но заложите время на воспроизведение громких цифр, прежде чем доверять им, потому что средний балл 53.9 и заявленные 46.4 в SWE-bench — это цифры вендора и больше ничьи. Две вещи решат это противостояние быстрее любого мнения: независимый прогон MiniCPM5-2B, который подтвердит или опровергнет заявления об агентных возможностях, и показатели IBM по рассуждениям, пережившие воспроизведение сообществом. Пока ни того ни другого не случилось, Granite 4.2 3B — более безопасная и лучше документированная маленькая модель на сегодня, а MiniCPM5-2B — более интересная ставка.
