Hero-карточка с заголовком «MiniCPM5-2B vs Gemma 4 12B», подзаголовком «Лидер рейтинга до 4B против мультимодального универсала Google на 12B», тремя чипами: «2.5B против 11.95B», «контекст 128K против 256K» и «AA Index 17 — #1 среди моделей до 4B», и верхней плашкой «БИТВА ОТКРЫТЫХ ВЕСОВ · СЕНТ 2026».
Guides & Insights

MiniCPM5-2B против Gemma 4 12B: лидер рейтингов среди моделей до 4B против универсальной 12B-модели от Google

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В материалах запуска MiniCPM5-2B есть фраза, которая звучит так, будто закрывает любой спор ещё до того, как он успеет начаться: на Всемирной конференции по искусственному интеллекту 19 июля ModelBest и OpenBMB назвали модель лучшей в рейтинге Artificial Analysis среди моделей с параметрами менее 4B, а её открытые веса уже без лишнего шума появились на Hugging Face. Gemma 4 12B — это ответ Google из совершенно другой весовой категории: плотная мультимодальная модель-универсал без энкодера объёмом 11,95B параметров, выпущенная 3 июня, которая принимает на вход текст, изображения, аудио и видео и за которой уже стоят месяцы внедрения сообществом. Сравнивать их — это не сверка таблиц характеристик; это выбор устройства, под которое вы выпускаете продукт, потому что модель, лидирующая в своём размерном классе, и модель, которая просто больше, отвечают на разные аппаратные вопросы.

Временные рамки — единственная причина, по которой это сравнение вообще существует. MiniCPM5-2B был показан на WAIC в июле как продукт — история про чип в той же мере, что и про модель, с девятью партнёрами по кремнию с первого дня из сообщества FlagOS — а веса были обещаны «в ближайшем будущем». Семь недель спустя репозиторий openbmb/MiniCPM5-2B появился на Hugging Face (в журнале изменений OpenBMB дата релиза — 7 сентября), под лицензией Apache-2.0, без ограничений доступа, с чекпоинтом BF16, GGUF, MLX, GPTQ, базовым и SFT-чекпоинтами и обучающими датасетами — всё в одной коллекции. Никакого пресс-релиза, никакого ивента-презентации. На момент написания этого текста карточка модели и есть анонс, и ни одного независимого прогона бенчмарков ещё не опубликовано — всё количественное о 2B ниже — это либо собственное воспроизведение ModelBest, либо данные из снимка Artificial Analysis, на который она ссылается. Gemma 4 12B, напротив, вышла через обычную машинерию Google и была скачана миллионы раз. Этот пробел в доказательствах — часть сравнения, а не сноска к нему.

Что только что изменилось с каждой стороны?

MiniCPM5-2B — вторая модель в серии MiniCPM5 после MiniCPM5-1B, которую OpenBMB опубликовала в открытом доступе 19 мая. В карточке модели описан плотный трансформер с общим числом параметров 2 516 756 480 (1 981 982 720 без учёта эмбеддингов — именно эта цифра и даёт модели право на ярлык «класс 2B»), 42 слоями при скрытой размерности 2048, grouped-query attention с 16 головками запросов и всего двумя KV-головками и словарём на 130 560 токенов. Это обычная архитектура LlamaForCausalLM — в карточке прямо указано, что не нужны ни кастомные ядра, ни форк кода модели, — и весь чекпоинт поставляется одним шардом safetensors в BF16. Интересное решение было принято на этапе пост-обучения: сначала SFT на 400 млрд токенов данных «глубокого мышления», затем дистилляция по текущей политике (On-Policy Distillation), которая сворачивает шестнадцать RL-экспертных моделей, пять из которых — агентные, обратно в одну небольшую плотную сеть. Карточка приписывает связке RL + OPD средний прирост в 10,96 балла на задачах на рассуждение и общих задачах и 6,96 балла на агентных задачах. Это внутренние дельты, но они объясняют, как устроена эта модель: перед нами модель 2B, созданная как агент для работы на устройстве и нативно генерирующая вызовы инструментов в XML-стиле.

Screenshot of the Hugging Face repository page for openbmb/MiniCPM5-2B, showing the OpenBMB org header, the Text Generation tag with Transformers and Safetensors and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B. It is a dense 2B Transformer ... reaching 2B-class open-source SOTA' (captured September 7, 2026).

Gemma 4 12B занимает особое место в линейке Google. Это средний представитель семейства Gemma 4 — выше ориентированных на периферию E2B и E4B, ниже 26B MoE и флагманской 31B, — и единственная модель, построенная на архитектуре без энкодера: сырые патчи изображений и аудиосигналы проецируются напрямую в токенное пространство, так что одна плотная модель обрабатывает текст, изображения, аудио и видео без отдельной башни энкодера. Она предлагает контекстное окно 256K токенов, вызов инструментов из коробки, опциональный этап рассуждений и драфтеры с мультитокеновым предсказанием, ускоряющие декодирование прямо из чекпоинта. Модель распространяется под Apache-2.0, работает на оборудовании с 16 ГБ памяти (примерно 8 ГБ при 4-битном квантовании), а её страница на Hugging Face показывает миллионы загрузок в месяц.

Screenshot of the Hugging Face model card for google/gemma-4-12B-it, showing Google DeepMind as author, the Apache-2.0 license tag, Transformers and Safetensors tags, 'Model size 12B params', and the opening text describing the Gemma 4 12B Unified model's native text, audio, image and video input with no separate encoders (captured September 7, 2026).

Утверждение о ранжировании и размерный класс, который оно не учитывает.

Ключевая цифра ModelBest для MiniCPM5-2B — индекс Artificial Analysis Intelligence Index, равный 17; на момент запуска это первое место среди моделей с менее чем 4B параметров. К этому стоит добавить две оговорки. Показатель отражает снапшот v4.1 от AA и не поддаётся прямому сравнению со значениями индекса из более ранних снапшотов; кроме того, это цифра на момент запуска, которую вендор привёл до какого-либо независимого повторного прогона. Честная интерпретация уже, но всё равно впечатляет: на момент выхода, по методологии AA того времени, эта модель с 2,5B параметров возглавляла весь свой класс по размеру. Gemma 4 12B в этом классе не значится, а на сегодняшних страницах Artificial Analysis у неё индекс выше — около 22 для варианта с рассуждениями и 13 для инструктивной модели без рассуждений; оба показателя — «значительно выше среднего» для своей группы аналогов. Индексы из разных снапшотов не сходятся точным образом, поэтому воспринимайте это как ориентир, а не как точную величину: универсальная модель на 12B по тестам оказывается более сильной, а модель на 2B — самой сильной в своём размере. Это разные утверждения, и оба могут быть верны.

Табло, честно подписанное

Читайте эти строки с учетом источника данных — {{1}}показатели MiniCPM5-2B — это заявления из карточки ModelBest, недельной давности и никем не подтвержденные{{/1}}; {{2}}показатели Gemma 4 12B — предоставлены Google и давно доступны сообществу для использования{{/2}}:

• Размер — MiniCPM5-2B: 2,52B всего / 1,98B без эмбеддингов, плотная. Gemma 4 12B: 11,95B, плотная.

Модальность — MiniCPM5-2B: только текст. Gemma 4 12B: текст, изображения, аудио и видео на входе, без энкодера.

• Контекст — MiniCPM5-2B: 131 072 токена в поставляемой конфигурации. Gemma 4 12B: нативные 256K (некоторые рецепты развёртывания ограничивают до 128K).

• Языки — MiniCPM5-2B: карточка модели и данные ориентированы на английский и китайский. Gemma 4 12B: 140+ языков.

• Релиз — MiniCPM5-2B: анонс состоялся 19 июля 2026 года; веса стали доступны 6–7 сентября, без лишней огласки. Gemma 4 12B: запущена 3 июня 2026 года, с полными результатами оценки при запуске.

• Доказательства — MiniCPM5-2B: карточка вендора плюс AA v4.1 (Index 17, #1 sub-4B); независимого прогона пока нет. Gemma 4 12B: оценки при запуске плюс месяцы внедрения в сообществе и ~3,3 млн загрузок в месяц.

A comparison scoreboard titled 'MiniCPM5-2B vs Gemma 4 12B — the scoreboard', with left column rows 'Params: 2.52B total · 1.98B non-emb', 'Modality: Text only', 'Context: 128K (config 131,072)', 'Languages: English / Chinese', 'AA Index: 17 — #1 sub-4B at launch', 'Evidence: Vendor card · no independent run', and right column rows 'Params: 11.95B dense', 'Modality: Text + image + audio + video', 'Context: 256K native', 'Languages: 140+', 'AA Index: 22 reasoning · 13 instruct', 'Evidence: Google evals + months of use', with a footer labeling both sides' sourcing.

Табло выше — это тот же портрет в шесть строк: две модели расходятся почти по каждому измерению, и столбцы, определяющие выбор — модальность, языки, класс устройства, — это как раз те, которые не учитывает ни один средний показатель бенчмарка.

Где 12B выигрывает: то, что текстовый 2B не может сымитировать

Начнём с модальности. Gemma 4 12B изначально принимает аудио, изображения и видео; MiniCPM5-2B — только текст. Любому продукту, который транскрибирует речь, смотрит на экран или отслеживает видео, рядом с 2B нужен второй конвейер, и в этот момент преимущество «маленькой модели» частично испаряется. Вторая стена — языки: 140+ против релиза, ориентированного на английский и китайский. Для продукта, обслуживающего длинный хвост языков, 2B вообще не кандидат. И затем — доказательства. Gemma 4 12B скачивали миллионы раз, её квантовали, дообучали и три месяца использовали в продакшене; её сбои задокументированы, а её экосистема охватывает llama.cpp, Ollama, LM Studio, MLX, vLLM и SGLang. MiniCPM5-2B — репозиторий недельной давности, чьи ключевые показатели — включая полученные вендором 46.4 на SWE-bench Verified, что было бы выдающимся результатом для плотной модели на 2.5B, если бы он подтвердился независимым тестированием, — не проверял никто за пределами лаборатории. Уже по одной зрелости выбор очевиден.

Где 2B — единственный вариант.

Ничто из этого не имеет значения для того класса устройств, куда 12B просто не помещается. Телефон, плата смарт-кокпита или небольшой edge-бокс с несколькими гигабайтами DRAM не могут перемещать веса модели на 11,95B по шине памяти с приемлемой скоростью — это как раз то узкое место, которое задушило бы её. MiniCPM5-2B создан для такого мира: веса, помещающиеся в память устройства, окно на 128K для длительных агентских сессий, нативный вызов инструментов, рассчитанный на интерактивную работу, и адаптация с первого дня для девяти семейств чипов плюс ARM. Если ваша цель — NPU телефонного класса или встраиваемая плата, Gemma 4 12B не конкурирует с MiniCPM5-2B; там она вообще не разворачивается. А если ваша целевая платформа тянет 12B, но только впритык — ноутбук с 16GB, — то 2B даёт запас: меньше задержка на токен, ниже энергопотребление и возможность запустить вторую модель в том же объёме памяти.

Как узнать, какие претензии сохраняются

Поскольку оба варианта имеют открытые веса и могут быть развёрнуты самостоятельно, честный следующий шаг — измерение на собственном оборудовании, а не очередное перечитывание карточек. Если вы сравниваете MiniCPM5-2B с Gemma 4 12B на рабочей нагрузке, которую уже обслуживаете, именно здесь слой маршрутизации оправдывает своё существование: направление тестового маршрута через единый API с автоматическим переключением при сбоях на новый самостоятельно развёрнутый чекпойнт означает, что непроверенный стек может зависнуть или зациклиться, не обрушивая продакшн, а каталожные цены провайдеров на всё, с чем вы сравниваете, проходят с нулевой наценкой. Сама модель — репозиторий суточной давности, поэтому по умолчанию к ней стоит относиться как к эксперименту, но эксперимент дёшев в запуске, и два часа, которые требуются на воспроизведение SWE-bench или части вашего оценочного набора на 2B, — это именно то доказательство, которого этому сравнению не хватает.

Вердикт

{{1}}Выбирайте Gemma 4 12B, когда ваше оборудование позволяет это по запасу мощности, а ваша задача выходит за рамки текста — мультимодальный продукт, многоязычная аудитория или всё, где три месяца проверенного сообществом поведения важнее, чем корона в рейтинге.{{2}}Выбирайте MiniCPM5-2B, когда ваше устройство вообще не может потянуть 12B, или когда текст-ориентированная, агент-направленная модель на 2.5B на чипе телефонного класса позволит вам выпустить продукт, который с более крупной моделью невозможен.{{3}}Лидер рейтинга среди моделей до 4B — это настоящее достижение, а публикация открытых весов делает его доступным для тестирования уже сегодня; просто, судя по имеющимся данным, он не является заменой универсальной модели на 12B там, где 12B реально может работать.