Заглавная карточка для сравнения «MiniCPM5-2B-DSpark против Gemma 4 12B» с подзаголовком «Два способа создавать черновик — два весовых класса локального ИИ», на которой слева показан небольшой чип с подписью «черновик 324M», подающий данные в блок с подписью «целевая модель 2.5B на устройстве», а справа — более широкая панель с подписью «мультимодальный универсал 11.95B»; над ними — линия потока из чипов-токенов с подписью «черновик, затем проверка», а в правом нижнем углу — логотип OrcaRouter.
Guides & Insights

MiniCPM5-2B-DSpark против Gemma 4 12B: два подхода к генерации, две весовые категории локального ИИ

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Чтобы понять, почему MiniCPM5-2B-DSpark и Gemma 4 12B должны находиться в одном ряду, быстрее всего на время забыть об их размерах и посмотреть, как каждая из них пишет предложение. Обе обманывают шину памяти с помощью драфтера: небольшая модель предлагает сразу несколько следующих токенов, а основная модель проверяет блок за один проход, так что кремний платит за загрузку весов один раз на блок, а не один раз на токен. MiniCPM5-2B-DSpark — это тот самый драфтер, который OpenBMB тихо разместил на Hugging Face 6 сентября 2026 года: сопутствующая контрольная точка с 323,8 млн параметров, ускоряющая MiniCPM5-2B — плотную модель для устройств с 2,52 млрд параметров, которую ModelBest анонсировал на WAIC 19 июля 2026 года. Gemma 4 12B — это мультимодальный универсал от Google с 11,95 млрд параметров, без энкодера, выпущенный 3 июня 2026 года со встроенными драфтерами и контекстом на 256K. В одном случае драфтер продаётся как отдельная контрольная точка Apache-2.0, которую вы загружаете сами; в другом аналогичный приём скрыт внутри одной большой модели, которую вы просто запускаете.

Честное замечание, определяющее форму этой статьи: MiniCPM5-2B-DSpark — это не модель, которую можно промптить. У неё нет токенизатора, шаблона чата и самостоятельного вывода — только карточка с перечисленными model.safetensors, конфигом и README. Это вспомогательный аксессуар сервис-слоя для целевого класса 2B, и настоящее сравнение, которое делает читатель, проходит между двумя классами весов локального ИИ: помещающийся в телефон 2B-стек, генерирующий свои токены, против 12B-универсала на 16 гигабайт, который генерирует свои токены. Всё, что ниже, — это наглядная реализация этого решения.

Что на самом деле представляет собой MiniCPM5-2B-DSpark

Карточка модели — это вся публичная поверхность релиза, поэтому именно это из нее и можно узнать. MiniCPM5-2B-DSpark — это черновой чекпойнт DSpark: пять слоев полного внимания, 323,776,001 параметр, группированное внимание запросов с 16 головками запросов и 2 головками KV, а также размер блока семь; он предлагает до семи кандидатов-токенов за один прямой проход, чтобы целевая модель MiniCPM5-2B проверила их. Конфиг объявляет архитектуру Qwen3DSparkModel с auto-map для DSparkDraftModel и поставляется со все еще включенными головой уверенности и марковской головой из метода DSpark (arXiv 2607.05147, статья D​eepSeek от июля 2026 года) — это учитывающий вычислительную нагрузку верификатор, который решает, когда суффикс не стоит проверять. Модель обучалась шесть эпох на 7.05 миллиарда токенов ответов, сгенерированных MiniCPM5-2B, на промптах по общим темам, математике и коду.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the description 'a DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B and its tokenizer', and the Model Specification table listing Target model MiniCPM5-2B, five draft layers, 323,776,001 draft parameters, and a block size of seven.

Карточка выше openbmb/MiniCPM5-2B-DSpark — это всё, что было выпущено: карточка модели, конфиг, один файл Safetensors и никаких анонсов, ни записей в блоге, ни пресс-релизов — тихий релиз весов, которому на момент написания был один день.

То, чего в карточке нет, не менее важно, чем то, что в ней есть. Она указывает длину принятия (по собственной оценке репозитория — в среднем 5,52 принятых токена за шаг верификации при жадном декодировании; для математики — 6,05, для кода — 6,11 из возможных семи токенов), но не приводит ни ускорения в реальном времени (wall-clock), ни показателя токенов в секунду, ни независимого бенчмарка. Документированный путь для обслуживания — движок DSPARK от SGLang; рядом с целевой моделью MiniCPM5-2B загружается черновик. Иными словами: качество черновика измерено, его выгода — ещё нет, и всякому, кто внедряет его, стоит сначала измерить, а потом верить.

Что Gemma 4 12B приносит на другую сторону

Gemma 4 12B — средний ребёнок в семействе Gemma 4 от Google и занимает совершенно иную точку на кривой локального ИИ. Это одна плотная модель на 11,95 млрд параметров, которая принимает на вход текст, изображения, аудио и видео без отдельных энкодеров, из коробки следует вызовам инструментов и сочетает нативный контекст на 256K с драфтерами multi-token prediction, которые проделывают тот же трюк с шиной памяти внутри — но изнутри чекпоинта, так что вам не нужно ничего лишнего скачивать или подключать. Она распространяется по лицензии Apache 2.0, на практике работает на ноутбуке с 16 ГБ ОЗУ и вышла со всей обвязкой Google: стартовые оценочные тесты, карточки моделей для базовой и инструкционной версий, поддержка экосистемы в Model Garden, LM Studio и Ollama. За ней — месяцы развёртывания в сообществе, чего нет у однодневного черновика MiniCPM.

A screenshot of the Hugging Face model page for google/gemma-4-12B-it (captured August 31, 2026, reused from a published sibling) showing the model title, the Any-to-Any and image-text-to-text tags, the Transformers and Safetensors libraries, and the Apache 2.0 license.

Приведённая выше модельная карточка Google для Gemma 4 12B — это контраст в одном кадре: зрелый мультимодальный универсал, чьи составители являются особенностью релиза, а не отдельного репозитория.

Характеристики, честно указанные

Читайте эти цифры с учётом их происхождения: показатели MiniCPM5-2B — это заявления из карточки ModelBest, не подтверждённые воспроизведением; показатели Gemma 4 12B — собственные данные Google, давно доступные сообществу.

• Что вы запускаете — MiniCPM5-2B-DSpark: драфт-модель на 324M, которая работает только в связке с MiniCPM5-2B (2.52B dense, 42 слоя). Gemma 4 12B: одна автономная dense-модель на 11.95B.

• Контекст — MiniCPM5-2B: нативный контекст 128K. Gemma 4 12B: нативный контекст 256K.

• Модальность — стек MiniCPM5-2B: только текст. Gemma 4 12B: ввод текста, изображений, аудио и видео, без энкодера.

• Драфтинг — MiniCPM5-2B-DSpark: внешний драфт DSpark, семь токенов за проход, движок SGLang DSPARK. Gemma 4 12B: внутренние драфтеры множественного предсказания токенов, ничего устанавливать не нужно.

• Объём памяти — MiniCPM5-2B: целевой объём примерно 5 ГБ в BF16 плюс черновой файл ~650 МБ; Gemma 4 12B: примерно 18 ГБ в BF16, практична на оборудовании класса 16 ГБ с квантованием.

• Доказательства — MiniCPM5-2B-DSpark: в репозитории есть только метрики acceptance-length, и они датированы одним днем назад. Gemma 4 12B: оценочные бенчмарки запуска плюс месяцы развертывания в сообществе.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Gemma 4 12B: left column MiniCPM5-2B-DSpark with 'What you run: 324M draft for a 2.52B target', text-only modality, 128K target window, external DSpark drafting at 7 tokens per pass, ~5GB target plus 650MB draft footprint, and an unannounced Hugging Face release September 6 2026; right column Gemma 4 12B with a standalone 11.95B model, text/image/audio/video input, 256K native context, internal MTP drafters, ~18GB BF16, and Google's June 3 2026 launch, with a footer reading 'MiniCPM figures from the model card, unreproduced; Gemma specs per Google' and the OrcaRouter logo in the bottom-right corner.

Табло выше — это один и тот же портрет в шесть рядов: две колонки расходятся почти во всём, кроме стратегии, которую обе используют для быстрой записи.

Какой весовой класс подходит для того кремния, который у вас действительно есть?

Поскольку MiniCPM5-2B-DSpark — это не модель, значимая развилка проходит между весовым классом целевой модели и классом Gemma 4 12B, и эта развилка по сути аппаратный вопрос. Телефон, плата умного кокпита или небольшой edge-бокс с несколькими гигабайтами DRAM не потянут модель на 11,95 млрд параметров с приемлемой скоростью; шина памяти — это ровно то узкое место, которое её задушит. Именно под такой мир и создавался стек MiniCPM5-2B — плотная модель на 2 млрд параметров, чьи веса помещаются в память устройства, с прикрученной draft-моделью, чтобы вернуть часть токенов в секунду, которые небольшие плотные модели теряют. Спекулятивное декодирование наиболее эффективно именно в этом плотном режиме, ограниченном памятью, — поэтому draft-модель — самая интересная часть релиза, а не уловка.

Gemma 4 12B — это ответ на одну весовую категорию выше. Если в вашей машине 16 ГБ и больше — ноутбук, рабочая станция, мощный edge-сервер — вам по силам мультимодальный универсал, и вы получаете три вещи, которых стек 2B предложить не может: ввод изображений, аудио и видео без энкодеров и второго пайплайна; контекстное окно 256K для работы в масштабе репозитория или документа; и зрелость, которой у однодневного чернового чекпойнта просто нет. Вы отказываетесь от возможности запуска на самых маленьких устройствах и платите примерно трёхкратным объёмом памяти.

Реальность маршрутизации для обоих

Ни одна из сторон этого противостояния сегодня не представлена в хостинг-каталоге, включая OrcaRouter. MiniCPM5-2B-DSpark — это по определению вспомогательный компонент для самостоятельного хостинга: вы сами запускаете стек SGLang, и черновик существует только в вашем локальном развертывании. Gemma 4 12B — модель с открытыми весами, так что вы обслуживаете её сами или используете там, где она уже доступна. Это как раз та ситуация, когда слой маршрутизации оправдывает себя как страховка, а не как механизм доставки: когда вы тестируете совершенно новую сборку черновика на нагрузке, которую уже обслуживаете, направление тестового пути через один API с автоматическим переключением при сбое означает, что непроверенный стек может зависнуть, не останавливая продакшн, а цены провайдеров вокруг него проходят с нулевой наценкой, поэтому изменение цены на любую хостинг-модель, с которой вы сравниваете, отображается в тот же день. Что касается самого сравнения, честный план для обеих моделей одинаков: вы размещаете их самостоятельно, поэтому значим только тот бенчмарк, который вы запускаете на собственном оборудовании.

Вердикт

MiniCPM5-2B-DSpark и Gemma 4 12B — не конкуренты в прямом сравнении: это два весовых класса локального ИИ, у которых просто есть общий приём. Выбирайте стек MiniCPM5-2B с его черновиком DSpark, когда ваше устройство не тянет модель на 12B, а вам нужна текстовая, совместимая с Apache-2.0, ориентированная на агентов модель, которая умещается в памяти устройства. Черновик — многообещающее бесплатное ускорение, но прежде чем доверять ему, проверьте его на своей сборке SGLang, потому что его выгода пока не измерена. Выбирайте Gemma 4 12B, когда у вашего железа есть запас мощности и вам нужна одна мультимодальная модель с окном на 256K и экосистемой за спиной. Вопрос не в том, какая модель умнее, — а в том, какую из них ваше железо реально сможет прокормить.