Крупная титульная карточка для сравнения MiniCPM5-2B-DSpark и Granite 4.2 3B с подзаголовком «Два тихих релиза Apache-2.0 для компактного и быстрого обслуживания»: на ней изображены две открытые картонные коробки бок о бок — левая испускает молнию с надписью «DSpark draft», а правая показывает шестерёнку с надписью «режимы рассуждений», — с лентой Apache-2.0 внизу и логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

MiniCPM5-2B-DSpark против Granite 4.2 3B: два тихих Apache-2.0-релиза для компактного, быстрого и самостоятельного хостинга

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Август и начало сентября 2026 года принесли два тихих релиза под лицензией Apache-2.0, нацеленных на одну и ту же задачу — небольшие модели, которые вы разворачиваете сами, — но подошли они к ней с противоположных сторон. Granite 4.2 3B — это компактная модель рассуждений от IBM «ноутбучного» размера: её веса появились на Hugging Face в начале августа, а карточка модели и технический блог вышли 25 августа 2026 года. MiniCPM5-2B-DSpark — это не модель в привычном смысле: это черновой чекпойнт DSpark на 323,8 млн параметров, который OpenBMB разместила 6 сентября 2026 года без какого-либо анонса; он создан, чтобы ускорить генерацию токенов у MiniCPM5-2B — плотной модели на 2,52 млрд параметров для работы на устройстве, о которой ModelBest объявила на WAIC 19 июля 2026 года, — с помощью спекулятивного декодирования. Один релиз — самостоятельная компактная модель рассуждений; другой — ускоряющий аксессуар для компактной модели. Обе живут под Apache-2.0, обе предназначены только для самостоятельного размещения, и ни одну ещё не трогал независимый бенчмарк.

Уберите маркетинговый слой — и практический вопрос перед командой оказывается простым: для небольшой self-hosted инференс-нагрузки в конце 2026 года вам нужен специалист по рассуждениям от IBM на 3B параметров или ориентированный на агентов стек ModelBest на 2B с бесплатной драфт-моделью в придачу? Доказательств меньше, чем предполагают спецификации обоих вендоров, поэтому в этой статье мы разберём факты о релизах, единственный реально существующий набор показателей внутри одной линейки и разницу в рабочих нагрузках, которая и должна определять выбор.

Два релиза: что можно узнать

Granite 4.2 3B — это самая маленькая модель рассуждений IBM, дообученная на основе Granite-4.1-3B-Base. Она плотная и работает только с текстом: 40 слоёв, внимание с группировкой запросов, родной контекст 128K, расширяющийся до 512K на пятой фазе предобучения, и три режима рассуждений: полное обдумывание по умолчанию, режим с низким уровнем усилий и путь без обдумывания. В карточке IBM явно указано, что 3B намеренно пропустила блок агентного обучения с подкреплением, который получили более крупные собратья Granite 4.2, поэтому в ней нет результатов SWE-Bench, и это модель рассуждений, а не агентная модель. Она работает через vLLM, SGLang, Transformers, GGUF и Ollama (granite4.2:3b), и у неё нет размещённого API. Её ключевые показатели из карточки — 78.33 на AIME 2025, 54.80 GPQA, 69.71 LiveCodeBench v6 — сообщены разработчиком и по состоянию на сегодняшний день не воспроизведены независимо.

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b (reused from a published sibling) showing the Model Overview with the 3B dense decoder-only architecture, 128K native context extending to 512K, and the Apache-2.0 license.

Приведённая выше карточка ibm-granite/granite-4.2-3b — публичное лицо этого релиза: модель 3B, настроенная на рассуждение, с длинным контекстом и без каких-либо агентных заявлений.

MiniCPM5-2B-DSpark, напротив, существует исключительно на службе своей целевой модели. Черновая модель представляет собой пять полных слоёв внимания с 323 776 001 параметром и размером блока в семь токенов-кандидатов за прямой проход; она обучалась шесть эпох на 7,05 млрд токенов ответов, сгенерированных MiniCPM5-2B. В её репозитории сообщается длина принятия — 5,52 принятых токена на шаг верификации в целом при жадном декодировании и 6,11 на коде, — но нет показателя токенов в секунду. Целевая модель, которую она ускоряет, MiniCPM5-2B, является более интересным продуктом: плотная модель на 2,52 млрд параметров с 42 слоями и контекстом 128K, в материалах запуска которой подчёркиваются агентные возможности — агентский mid-training в масштабе 200B, большой набор agent-SFT и RL-выравнивание агента, согласно июльскому анонсу ModelBest, — а также нативная поддержка длинного контекста и гибридных быстрых/вдумчивых режимов. В собственном сравнительном тесте ModelBest целевая модель набирает в среднем 53,9 против открытых моделей того же класса. Каждая из этих цифр — со слов самого вендора.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

Карточка openbmb/MiniCPM5-2B-DSpark выше — это вся поверхность релиза: карточка модели, конфиг, один файл Safetensors и никакого анонса.

Единственное существующее сравнение в рамках одного и того же пакета.

Кросс-вендорные сравнительные таблицы — это в основном сравнение «тёплого с мягким», но есть одно место, где Granite 4.2 3B и MiniCPM5-2B замеряли вместе: собственная таблица оценок ModelBest для MiniCPM5-2B, в которой granite-4.2-3B указан среди базовых моделей. На этом наборе тестов MiniCPM5-2B показывает в среднем 53,9 против 42,7 у Granite 4.2 3B. Читайте эту цифру ровно как то, чем она является: один вендор прогнал обе модели на одном наборе, результат никем не воспроизведён и подобран так, чтобы собственная модель выглядела хорошо. Это не вердикт. Что она действительно говорит вам — ModelBest была достаточно уверена, чтобы вынести 3B-модель конкурента на свою карточку, и заявленный ею разрыв максимален ровно там, куда были направлены её собственные инвестиции в обучение: в строки с длинным контекстом и агентными сценариями. Относитесь к этому как к указанию направления, проверяйте на своих данных и взвешивайте отдельные заявления IBM на их собственных карточках, прежде чем принимать на основе этого какие-либо решения.

Табло, честно подписанное

• {{1}}Что поставляется — MiniCPM5-2B-DSpark:{{/1}} драфт-модель на 324M для MiniCPM5-2B (плотная целевая модель на 2.52B), {{2}}не является самостоятельной{{/2}}. {{3}}Granite 4.2 3B:{{/3}} самостоятельная плотная модель рассуждений объёмом ~3B.

Роль — стек MiniCPM5-2B: упор на локальных агентов и использование инструментов, по данным ModelBest. Granite 4.2 3B: специалист по рассуждениям, намеренно без агентного режима.

• Контекст — MiniCPM5-2B: 128K нативно. Granite 4.2 3B: 128K нативно, расширение до 512K.

• Ускорение — MiniCPM5-2B-DSpark: внешняя черновая модель DSpark, семь токенов за проход, жадное принятие ~5,5 на шаг (по данным репозитория). Granite 4.2 3B: в этот релиз ничего не включено.

• Лицензия — обе Apache-2.0.

• Доказательства — показатели MiniCPM — это заявленные данные из карточки ModelBest (её набор тестов: 53,9 против 42,7 у Granite); показатели Granite — заявленные данные из карточки IBM (AIME 2025: 78,33, GPQA: 54,80). Независимых запусков ни той, ни другой модели не существует.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Granite 4.2 3B: left column MiniCPM5-2B-DSpark with What it is: 324M draft + 2.52B dense target, on-device agent and tool-use role, 128K native context, DSpark acceleration at 7 tokens per pass, Apache-2.0 license, and own-suite average 53.9; right column Granite 4.2 3B with a standalone ~3B dense reasoning model, non-agentic role, 128K native / 512K extended context, no shipped acceleration, Apache-2.0 license, and AIME 2025 78.33 / GPQA 54.80, with a footer reading All figures vendor-reported; no independent run of either and the OrcaRouter logo in the bottom-right corner.

Табло выше основано на тех же источниках, что и текст: каждая цифра на нём предоставлена вендором, и единственный показатель из того же набора тестов, который опубликовал любой из вендоров, — это собственный показатель ModelBest.

Разница, которая превосходит все показатели

Прежде чем перейти к оценкам, решите, какая именно малая модель нужна вашей рабочей нагрузке, поскольку эти два релиза отвечают на разные вопросы. Granite 4.2 3B создана для рассуждений и длинного контекста на ограниченном оборудовании: нативное окно 128K, расширяемое до 512K, три режима обдумывания на каждый запрос, размер, который работает на ноутбуке, и явное решение отказаться от агентного обучения. Если ваша задача — анализ длинных документов, контекст масштаба репозитория или надёжные рассуждения на небольшом компьютере, это подходящий вариант. MiniCPM5-2B создана с противоположным акцентом: агентное поведение и использование инструментов на устройстве — само существование драфта указывает на то, что ModelBest ожидает интерактивного использования этой модели и хочет получить обратно скорость в токенах в секунду. Если ваша работа — агентный цикл на устройстве, который вызывает инструменты и ведёт длинные диалоги, то этот стек предназначен для вас.

Черновик меняет экономику этого второго выбора так, как релиз Granite этого не затрагивает. MiniCPM5-2B — плотная модель, и спекулятивное декодирование даёт наибольший выигрыш именно в плотном режиме, ограниченном памятью: небольшая фиксированная модель предлагает токены чуть более крупной фиксированной. Внешний драфтер, добавляющий примерно 650 МБ весов BF16 к цели объёмом ~5 ГБ, с документированным путём обслуживания через SGLang и жадной частотой принятия около пяти с половиной токенов за шаг верификации, — это убедительный рычаг пропускной способности для модели, обслуживаемой в режиме одного параллельного запроса. Но оговорка неизбежна: OpenBMB не опубликовал сквозного ускорения, поэтому рычаг остаётся некалиброванным. IBM не поставляет эквивалентного внешнего драфтера для Granite 4.2 3B в рамках этого релиза — модель запускается в плотном режиме, и её история скорости сводится просто к тому, что 3B — небольшая модель.

Кто что должен запускать

• Используйте Granite 4.2 3B, если ваша задача — рассуждения над длинным контекстом на устройстве уровня ноутбука: документы, репозитории, глубокий однопоточный анализ — и вам нужны три режима мышления и потолок 512K на модели Apache-2.0, которую вы полностью контролируете. Учитывайте, что за ней нет агентного обучения и нет размещённого API.

• Запускайте стек MiniCPM5-2B с его черновиком DSpark, если ваша рабочая нагрузка — это интерактивный агент на устройстве с вызовом инструментов, целевая модель укладывается в ваш бюджет памяти, и вы хотите получить пропускную способность, которую черновик может вернуть. Заложите время на измерение реального ускорения от черновика на вашей собственной сборке SGLang, потому что ни одной цифры для него не опубликовано.

• Запустите обе модели за маршрутизирующим слоем, если вы действительно не уверены. Сегодня ни одна из моделей не доступна в hosted-каталоге — OrcaRouter тоже, — обе рассчитаны на самостоятельный хостинг. Но маршрутизатор, стоящий перед вашими собственными эндпоинтами с автоматическим переключением при сбое, позволяет держать новый черновой стек на тестовом пути, пока продакшн остаётся на проверенном, а его пропуск hosted-моделей вокруг них с нулевой наценкой удешевляет A/B-сравнение. Суть в обратимости: меняете имя модели, замеряете показатели и переключаетесь обратно, если вчерашний чекпоинт начинает зависать.

Что посмотреть дальше

Итог этого соперничества быстрее любого мнения определят две вещи. Во-первых, независимый прогон MiniCPM5-2B, который подтвердит или опровергнет средний балл 53.9 и заявления об агентных способностях: 2B-модель, показавшая такой результат на задачах в стиле SWE-Bench, стала бы действительно новой точкой данных для класса on-device-моделей. Во-вторых, показатели собственной reasoning-модели IBM должны пережить воспроизведение сообществом; 78.33 AIME 2025 у 3B — из тех заявлений, которые меняются, когда их запускает кто-то другой. Пока ни один из этих результатов не подтверждён, честная позиция такова: Granite 4.2 3B сегодня — более безопасная и лучше документированная малая модель, а стек MiniCPM5-2B — более интересная ставка: более быстрый on-device-агент, если его заявления подтвердятся, и черновик, выгоду от которого ещё не оценил даже собственный разработчик.