
MiniCPM5-2B-DSpark против Granite 4.2 3B: два тихих Apache-2.0-релиза для компактного, быстрого и самостоятельного хостинга
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Август и начало сентября 2026 года принесли два тихих релиза под лицензией Apache-2.0, нацеленных на одну и ту же задачу — небольшие модели, которые вы разворачиваете сами, — но подошли они к ней с противоположных сторон. Granite 4.2 3B — это компактная модель рассуждений от IBM «ноутбучного» размера: её веса появились на Hugging Face в начале августа, а карточка модели и технический блог вышли 25 августа 2026 года. MiniCPM5-2B-DSpark — это не модель в привычном смысле: это черновой чекпойнт DSpark на 323,8 млн параметров, который OpenBMB разместила 6 сентября 2026 года без какого-либо анонса; он создан, чтобы ускорить генерацию токенов у MiniCPM5-2B — плотной модели на 2,52 млрд параметров для работы на устройстве, о которой ModelBest объявила на WAIC 19 июля 2026 года, — с помощью спекулятивного декодирования. Один релиз — самостоятельная компактная модель рассуждений; другой — ускоряющий аксессуар для компактной модели. Обе живут под Apache-2.0, обе предназначены только для самостоятельного размещения, и ни одну ещё не трогал независимый бенчмарк.
Уберите маркетинговый слой — и практический вопрос перед командой оказывается простым: для небольшой self-hosted инференс-нагрузки в конце 2026 года вам нужен специалист по рассуждениям от IBM на 3B параметров или ориентированный на агентов стек ModelBest на 2B с бесплатной драфт-моделью в придачу? Доказательств меньше, чем предполагают спецификации обоих вендоров, поэтому в этой статье мы разберём факты о релизах, единственный реально существующий набор показателей внутри одной линейки и разницу в рабочих нагрузках, которая и должна определять выбор.
Два релиза: что можно узнать
Granite 4.2 3B — это самая маленькая модель рассуждений IBM, дообученная на основе Granite-4.1-3B-Base. Она плотная и работает только с текстом: 40 слоёв, внимание с группировкой запросов, родной контекст 128K, расширяющийся до 512K на пятой фазе предобучения, и три режима рассуждений: полное обдумывание по умолчанию, режим с низким уровнем усилий и путь без обдумывания. В карточке IBM явно указано, что 3B намеренно пропустила блок агентного обучения с подкреплением, который получили более крупные собратья Granite 4.2, поэтому в ней нет результатов SWE-Bench, и это модель рассуждений, а не агентная модель. Она работает через vLLM, SGLang, Transformers, GGUF и Ollama (granite4.2:3b), и у неё нет размещённого API. Её ключевые показатели из карточки — 78.33 на AIME 2025, 54.80 GPQA, 69.71 LiveCodeBench v6 — сообщены разработчиком и по состоянию на сегодняшний день не воспроизведены независимо.

Приведённая выше карточка ibm-granite/granite-4.2-3b — публичное лицо этого релиза: модель 3B, настроенная на рассуждение, с длинным контекстом и без каких-либо агентных заявлений.
MiniCPM5-2B-DSpark, напротив, существует исключительно на службе своей целевой модели. Черновая модель представляет собой пять полных слоёв внимания с 323 776 001 параметром и размером блока в семь токенов-кандидатов за прямой проход; она обучалась шесть эпох на 7,05 млрд токенов ответов, сгенерированных MiniCPM5-2B. В её репозитории сообщается длина принятия — 5,52 принятых токена на шаг верификации в целом при жадном декодировании и 6,11 на коде, — но нет показателя токенов в секунду. Целевая модель, которую она ускоряет, MiniCPM5-2B, является более интересным продуктом: плотная модель на 2,52 млрд параметров с 42 слоями и контекстом 128K, в материалах запуска которой подчёркиваются агентные возможности — агентский mid-training в масштабе 200B, большой набор agent-SFT и RL-выравнивание агента, согласно июльскому анонсу ModelBest, — а также нативная поддержка длинного контекста и гибридных быстрых/вдумчивых режимов. В собственном сравнительном тесте ModelBest целевая модель набирает в среднем 53,9 против открытых моделей того же класса. Каждая из этих цифр — со слов самого вендора.

Карточка openbmb/MiniCPM5-2B-DSpark выше — это вся поверхность релиза: карточка модели, конфиг, один файл Safetensors и никакого анонса.
Единственное существующее сравнение в рамках одного и того же пакета.
Кросс-вендорные сравнительные таблицы — это в основном сравнение «тёплого с мягким», но есть одно место, где Granite 4.2 3B и MiniCPM5-2B замеряли вместе: собственная таблица оценок ModelBest для MiniCPM5-2B, в которой granite-4.2-3B указан среди базовых моделей. На этом наборе тестов MiniCPM5-2B показывает в среднем 53,9 против 42,7 у Granite 4.2 3B. Читайте эту цифру ровно как то, чем она является: один вендор прогнал обе модели на одном наборе, результат никем не воспроизведён и подобран так, чтобы собственная модель выглядела хорошо. Это не вердикт. Что она действительно говорит вам — ModelBest была достаточно уверена, чтобы вынести 3B-модель конкурента на свою карточку, и заявленный ею разрыв максимален ровно там, куда были направлены её собственные инвестиции в обучение: в строки с длинным контекстом и агентными сценариями. Относитесь к этому как к указанию направления, проверяйте на своих данных и взвешивайте отдельные заявления IBM на их собственных карточках, прежде чем принимать на основе этого какие-либо решения.
Табло, честно подписанное
• {{1}}Что поставляется — MiniCPM5-2B-DSpark:{{/1}} драфт-модель на 324M для MiniCPM5-2B (плотная целевая модель на 2.52B), {{2}}не является самостоятельной{{/2}}. {{3}}Granite 4.2 3B:{{/3}} самостоятельная плотная модель рассуждений объёмом ~3B.
Роль — стек MiniCPM5-2B: упор на локальных агентов и использование инструментов, по данным ModelBest. Granite 4.2 3B: специалист по рассуждениям, намеренно без агентного режима.
• Контекст — MiniCPM5-2B: 128K нативно. Granite 4.2 3B: 128K нативно, расширение до 512K.
• Ускорение — MiniCPM5-2B-DSpark: внешняя черновая модель DSpark, семь токенов за проход, жадное принятие ~5,5 на шаг (по данным репозитория). Granite 4.2 3B: в этот релиз ничего не включено.
• Лицензия — обе Apache-2.0.
• Доказательства — показатели MiniCPM — это заявленные данные из карточки ModelBest (её набор тестов: 53,9 против 42,7 у Granite); показатели Granite — заявленные данные из карточки IBM (AIME 2025: 78,33, GPQA: 54,80). Независимых запусков ни той, ни другой модели не существует.

Табло выше основано на тех же источниках, что и текст: каждая цифра на нём предоставлена вендором, и единственный показатель из того же набора тестов, который опубликовал любой из вендоров, — это собственный показатель ModelBest.
Разница, которая превосходит все показатели
Прежде чем перейти к оценкам, решите, какая именно малая модель нужна вашей рабочей нагрузке, поскольку эти два релиза отвечают на разные вопросы. Granite 4.2 3B создана для рассуждений и длинного контекста на ограниченном оборудовании: нативное окно 128K, расширяемое до 512K, три режима обдумывания на каждый запрос, размер, который работает на ноутбуке, и явное решение отказаться от агентного обучения. Если ваша задача — анализ длинных документов, контекст масштаба репозитория или надёжные рассуждения на небольшом компьютере, это подходящий вариант. MiniCPM5-2B создана с противоположным акцентом: агентное поведение и использование инструментов на устройстве — само существование драфта указывает на то, что ModelBest ожидает интерактивного использования этой модели и хочет получить обратно скорость в токенах в секунду. Если ваша работа — агентный цикл на устройстве, который вызывает инструменты и ведёт длинные диалоги, то этот стек предназначен для вас.
Черновик меняет экономику этого второго выбора так, как релиз Granite этого не затрагивает. MiniCPM5-2B — плотная модель, и спекулятивное декодирование даёт наибольший выигрыш именно в плотном режиме, ограниченном памятью: небольшая фиксированная модель предлагает токены чуть более крупной фиксированной. Внешний драфтер, добавляющий примерно 650 МБ весов BF16 к цели объёмом ~5 ГБ, с документированным путём обслуживания через SGLang и жадной частотой принятия около пяти с половиной токенов за шаг верификации, — это убедительный рычаг пропускной способности для модели, обслуживаемой в режиме одного параллельного запроса. Но оговорка неизбежна: OpenBMB не опубликовал сквозного ускорения, поэтому рычаг остаётся некалиброванным. IBM не поставляет эквивалентного внешнего драфтера для Granite 4.2 3B в рамках этого релиза — модель запускается в плотном режиме, и её история скорости сводится просто к тому, что 3B — небольшая модель.
Кто что должен запускать
• Используйте Granite 4.2 3B, если ваша задача — рассуждения над длинным контекстом на устройстве уровня ноутбука: документы, репозитории, глубокий однопоточный анализ — и вам нужны три режима мышления и потолок 512K на модели Apache-2.0, которую вы полностью контролируете. Учитывайте, что за ней нет агентного обучения и нет размещённого API.
• Запускайте стек MiniCPM5-2B с его черновиком DSpark, если ваша рабочая нагрузка — это интерактивный агент на устройстве с вызовом инструментов, целевая модель укладывается в ваш бюджет памяти, и вы хотите получить пропускную способность, которую черновик может вернуть. Заложите время на измерение реального ускорения от черновика на вашей собственной сборке SGLang, потому что ни одной цифры для него не опубликовано.
• Запустите обе модели за маршрутизирующим слоем, если вы действительно не уверены. Сегодня ни одна из моделей не доступна в hosted-каталоге — OrcaRouter тоже, — обе рассчитаны на самостоятельный хостинг. Но маршрутизатор, стоящий перед вашими собственными эндпоинтами с автоматическим переключением при сбое, позволяет держать новый черновой стек на тестовом пути, пока продакшн остаётся на проверенном, а его пропуск hosted-моделей вокруг них с нулевой наценкой удешевляет A/B-сравнение. Суть в обратимости: меняете имя модели, замеряете показатели и переключаетесь обратно, если вчерашний чекпоинт начинает зависать.
Что посмотреть дальше
Итог этого соперничества быстрее любого мнения определят две вещи. Во-первых, независимый прогон MiniCPM5-2B, который подтвердит или опровергнет средний балл 53.9 и заявления об агентных способностях: 2B-модель, показавшая такой результат на задачах в стиле SWE-Bench, стала бы действительно новой точкой данных для класса on-device-моделей. Во-вторых, показатели собственной reasoning-модели IBM должны пережить воспроизведение сообществом; 78.33 AIME 2025 у 3B — из тех заявлений, которые меняются, когда их запускает кто-то другой. Пока ни один из этих результатов не подтверждён, честная позиция такова: Granite 4.2 3B сегодня — более безопасная и лучше документированная малая модель, а стек MiniCPM5-2B — более интересная ставка: более быстрый on-device-агент, если его заявления подтвердятся, и черновик, выгоду от которого ещё не оценил даже собственный разработчик.
