
MiniCPM5-2B-DSpark против Gemma 4 12B: два подхода к генерации, две весовые категории локального ИИ
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Чтобы понять, почему MiniCPM5-2B-DSpark и Gemma 4 12B должны находиться в одном ряду, быстрее всего на время забыть об их размерах и посмотреть, как каждая из них пишет предложение. Обе обманывают шину памяти с помощью драфтера: небольшая модель предлагает сразу несколько следующих токенов, а основная модель проверяет блок за один проход, так что кремний платит за загрузку весов один раз на блок, а не один раз на токен. MiniCPM5-2B-DSpark — это тот самый драфтер, который OpenBMB тихо разместил на Hugging Face 6 сентября 2026 года: сопутствующая контрольная точка с 323,8 млн параметров, ускоряющая MiniCPM5-2B — плотную модель для устройств с 2,52 млрд параметров, которую ModelBest анонсировал на WAIC 19 июля 2026 года. Gemma 4 12B — это мультимодальный универсал от Google с 11,95 млрд параметров, без энкодера, выпущенный 3 июня 2026 года со встроенными драфтерами и контекстом на 256K. В одном случае драфтер продаётся как отдельная контрольная точка Apache-2.0, которую вы загружаете сами; в другом аналогичный приём скрыт внутри одной большой модели, которую вы просто запускаете.
Честное замечание, определяющее форму этой статьи: MiniCPM5-2B-DSpark — это не модель, которую можно промптить. У неё нет токенизатора, шаблона чата и самостоятельного вывода — только карточка с перечисленными model.safetensors, конфигом и README. Это вспомогательный аксессуар сервис-слоя для целевого класса 2B, и настоящее сравнение, которое делает читатель, проходит между двумя классами весов локального ИИ: помещающийся в телефон 2B-стек, генерирующий свои токены, против 12B-универсала на 16 гигабайт, который генерирует свои токены. Всё, что ниже, — это наглядная реализация этого решения.
Что на самом деле представляет собой MiniCPM5-2B-DSpark
Карточка модели — это вся публичная поверхность релиза, поэтому именно это из нее и можно узнать. MiniCPM5-2B-DSpark — это черновой чекпойнт DSpark: пять слоев полного внимания, 323,776,001 параметр, группированное внимание запросов с 16 головками запросов и 2 головками KV, а также размер блока семь; он предлагает до семи кандидатов-токенов за один прямой проход, чтобы целевая модель MiniCPM5-2B проверила их. Конфиг объявляет архитектуру Qwen3DSparkModel с auto-map для DSparkDraftModel и поставляется со все еще включенными головой уверенности и марковской головой из метода DSpark (arXiv 2607.05147, статья DeepSeek от июля 2026 года) — это учитывающий вычислительную нагрузку верификатор, который решает, когда суффикс не стоит проверять. Модель обучалась шесть эпох на 7.05 миллиарда токенов ответов, сгенерированных MiniCPM5-2B, на промптах по общим темам, математике и коду.

Карточка выше openbmb/MiniCPM5-2B-DSpark — это всё, что было выпущено: карточка модели, конфиг, один файл Safetensors и никаких анонсов, ни записей в блоге, ни пресс-релизов — тихий релиз весов, которому на момент написания был один день.
То, чего в карточке нет, не менее важно, чем то, что в ней есть. Она указывает длину принятия (по собственной оценке репозитория — в среднем 5,52 принятых токена за шаг верификации при жадном декодировании; для математики — 6,05, для кода — 6,11 из возможных семи токенов), но не приводит ни ускорения в реальном времени (wall-clock), ни показателя токенов в секунду, ни независимого бенчмарка. Документированный путь для обслуживания — движок DSPARK от SGLang; рядом с целевой моделью MiniCPM5-2B загружается черновик. Иными словами: качество черновика измерено, его выгода — ещё нет, и всякому, кто внедряет его, стоит сначала измерить, а потом верить.
Что Gemma 4 12B приносит на другую сторону
Gemma 4 12B — средний ребёнок в семействе Gemma 4 от Google и занимает совершенно иную точку на кривой локального ИИ. Это одна плотная модель на 11,95 млрд параметров, которая принимает на вход текст, изображения, аудио и видео без отдельных энкодеров, из коробки следует вызовам инструментов и сочетает нативный контекст на 256K с драфтерами multi-token prediction, которые проделывают тот же трюк с шиной памяти внутри — но изнутри чекпоинта, так что вам не нужно ничего лишнего скачивать или подключать. Она распространяется по лицензии Apache 2.0, на практике работает на ноутбуке с 16 ГБ ОЗУ и вышла со всей обвязкой Google: стартовые оценочные тесты, карточки моделей для базовой и инструкционной версий, поддержка экосистемы в Model Garden, LM Studio и Ollama. За ней — месяцы развёртывания в сообществе, чего нет у однодневного черновика MiniCPM.

Приведённая выше модельная карточка Google для Gemma 4 12B — это контраст в одном кадре: зрелый мультимодальный универсал, чьи составители являются особенностью релиза, а не отдельного репозитория.
Характеристики, честно указанные
Читайте эти цифры с учётом их происхождения: показатели MiniCPM5-2B — это заявления из карточки ModelBest, не подтверждённые воспроизведением; показатели Gemma 4 12B — собственные данные Google, давно доступные сообществу.
• Что вы запускаете — MiniCPM5-2B-DSpark: драфт-модель на 324M, которая работает только в связке с MiniCPM5-2B (2.52B dense, 42 слоя). Gemma 4 12B: одна автономная dense-модель на 11.95B.
• Контекст — MiniCPM5-2B: нативный контекст 128K. Gemma 4 12B: нативный контекст 256K.
• Модальность — стек MiniCPM5-2B: только текст. Gemma 4 12B: ввод текста, изображений, аудио и видео, без энкодера.
• Драфтинг — MiniCPM5-2B-DSpark: внешний драфт DSpark, семь токенов за проход, движок SGLang DSPARK. Gemma 4 12B: внутренние драфтеры множественного предсказания токенов, ничего устанавливать не нужно.
• Объём памяти — MiniCPM5-2B: целевой объём примерно 5 ГБ в BF16 плюс черновой файл ~650 МБ; Gemma 4 12B: примерно 18 ГБ в BF16, практична на оборудовании класса 16 ГБ с квантованием.
• Доказательства — MiniCPM5-2B-DSpark: в репозитории есть только метрики acceptance-length, и они датированы одним днем назад. Gemma 4 12B: оценочные бенчмарки запуска плюс месяцы развертывания в сообществе.

Табло выше — это один и тот же портрет в шесть рядов: две колонки расходятся почти во всём, кроме стратегии, которую обе используют для быстрой записи.
Какой весовой класс подходит для того кремния, который у вас действительно есть?
Поскольку MiniCPM5-2B-DSpark — это не модель, значимая развилка проходит между весовым классом целевой модели и классом Gemma 4 12B, и эта развилка по сути аппаратный вопрос. Телефон, плата умного кокпита или небольшой edge-бокс с несколькими гигабайтами DRAM не потянут модель на 11,95 млрд параметров с приемлемой скоростью; шина памяти — это ровно то узкое место, которое её задушит. Именно под такой мир и создавался стек MiniCPM5-2B — плотная модель на 2 млрд параметров, чьи веса помещаются в память устройства, с прикрученной draft-моделью, чтобы вернуть часть токенов в секунду, которые небольшие плотные модели теряют. Спекулятивное декодирование наиболее эффективно именно в этом плотном режиме, ограниченном памятью, — поэтому draft-модель — самая интересная часть релиза, а не уловка.
Gemma 4 12B — это ответ на одну весовую категорию выше. Если в вашей машине 16 ГБ и больше — ноутбук, рабочая станция, мощный edge-сервер — вам по силам мультимодальный универсал, и вы получаете три вещи, которых стек 2B предложить не может: ввод изображений, аудио и видео без энкодеров и второго пайплайна; контекстное окно 256K для работы в масштабе репозитория или документа; и зрелость, которой у однодневного чернового чекпойнта просто нет. Вы отказываетесь от возможности запуска на самых маленьких устройствах и платите примерно трёхкратным объёмом памяти.
Реальность маршрутизации для обоих
Ни одна из сторон этого противостояния сегодня не представлена в хостинг-каталоге, включая OrcaRouter. MiniCPM5-2B-DSpark — это по определению вспомогательный компонент для самостоятельного хостинга: вы сами запускаете стек SGLang, и черновик существует только в вашем локальном развертывании. Gemma 4 12B — модель с открытыми весами, так что вы обслуживаете её сами или используете там, где она уже доступна. Это как раз та ситуация, когда слой маршрутизации оправдывает себя как страховка, а не как механизм доставки: когда вы тестируете совершенно новую сборку черновика на нагрузке, которую уже обслуживаете, направление тестового пути через один API с автоматическим переключением при сбое означает, что непроверенный стек может зависнуть, не останавливая продакшн, а цены провайдеров вокруг него проходят с нулевой наценкой, поэтому изменение цены на любую хостинг-модель, с которой вы сравниваете, отображается в тот же день. Что касается самого сравнения, честный план для обеих моделей одинаков: вы размещаете их самостоятельно, поэтому значим только тот бенчмарк, который вы запускаете на собственном оборудовании.
Вердикт
MiniCPM5-2B-DSpark и Gemma 4 12B — не конкуренты в прямом сравнении: это два весовых класса локального ИИ, у которых просто есть общий приём. Выбирайте стек MiniCPM5-2B с его черновиком DSpark, когда ваше устройство не тянет модель на 12B, а вам нужна текстовая, совместимая с Apache-2.0, ориентированная на агентов модель, которая умещается в памяти устройства. Черновик — многообещающее бесплатное ускорение, но прежде чем доверять ему, проверьте его на своей сборке SGLang, потому что его выгода пока не измерена. Выбирайте Gemma 4 12B, когда у вашего железа есть запас мощности и вам нужна одна мультимодальная модель с окном на 256K и экосистемой за спиной. Вопрос не в том, какая модель умнее, — а в том, какую из них ваше железо реально сможет прокормить.
