
MiniCPM5-2B против Gemma 4 12B: лидер рейтингов среди моделей до 4B против универсальной 12B-модели от Google
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
В материалах запуска MiniCPM5-2B есть фраза, которая звучит так, будто закрывает любой спор ещё до того, как он успеет начаться: на Всемирной конференции по искусственному интеллекту 19 июля ModelBest и OpenBMB назвали модель лучшей в рейтинге Artificial Analysis среди моделей с параметрами менее 4B, а её открытые веса уже без лишнего шума появились на Hugging Face. Gemma 4 12B — это ответ Google из совершенно другой весовой категории: плотная мультимодальная модель-универсал без энкодера объёмом 11,95B параметров, выпущенная 3 июня, которая принимает на вход текст, изображения, аудио и видео и за которой уже стоят месяцы внедрения сообществом. Сравнивать их — это не сверка таблиц характеристик; это выбор устройства, под которое вы выпускаете продукт, потому что модель, лидирующая в своём размерном классе, и модель, которая просто больше, отвечают на разные аппаратные вопросы.
Временные рамки — единственная причина, по которой это сравнение вообще существует. MiniCPM5-2B был показан на WAIC в июле как продукт — история про чип в той же мере, что и про модель, с девятью партнёрами по кремнию с первого дня из сообщества FlagOS — а веса были обещаны «в ближайшем будущем». Семь недель спустя репозиторий openbmb/MiniCPM5-2B появился на Hugging Face (в журнале изменений OpenBMB дата релиза — 7 сентября), под лицензией Apache-2.0, без ограничений доступа, с чекпоинтом BF16, GGUF, MLX, GPTQ, базовым и SFT-чекпоинтами и обучающими датасетами — всё в одной коллекции. Никакого пресс-релиза, никакого ивента-презентации. На момент написания этого текста карточка модели и есть анонс, и ни одного независимого прогона бенчмарков ещё не опубликовано — всё количественное о 2B ниже — это либо собственное воспроизведение ModelBest, либо данные из снимка Artificial Analysis, на который она ссылается. Gemma 4 12B, напротив, вышла через обычную машинерию Google и была скачана миллионы раз. Этот пробел в доказательствах — часть сравнения, а не сноска к нему.
Что только что изменилось с каждой стороны?
MiniCPM5-2B — вторая модель в серии MiniCPM5 после MiniCPM5-1B, которую OpenBMB опубликовала в открытом доступе 19 мая. В карточке модели описан плотный трансформер с общим числом параметров 2 516 756 480 (1 981 982 720 без учёта эмбеддингов — именно эта цифра и даёт модели право на ярлык «класс 2B»), 42 слоями при скрытой размерности 2048, grouped-query attention с 16 головками запросов и всего двумя KV-головками и словарём на 130 560 токенов. Это обычная архитектура LlamaForCausalLM — в карточке прямо указано, что не нужны ни кастомные ядра, ни форк кода модели, — и весь чекпоинт поставляется одним шардом safetensors в BF16. Интересное решение было принято на этапе пост-обучения: сначала SFT на 400 млрд токенов данных «глубокого мышления», затем дистилляция по текущей политике (On-Policy Distillation), которая сворачивает шестнадцать RL-экспертных моделей, пять из которых — агентные, обратно в одну небольшую плотную сеть. Карточка приписывает связке RL + OPD средний прирост в 10,96 балла на задачах на рассуждение и общих задачах и 6,96 балла на агентных задачах. Это внутренние дельты, но они объясняют, как устроена эта модель: перед нами модель 2B, созданная как агент для работы на устройстве и нативно генерирующая вызовы инструментов в XML-стиле.

Gemma 4 12B занимает особое место в линейке Google. Это средний представитель семейства Gemma 4 — выше ориентированных на периферию E2B и E4B, ниже 26B MoE и флагманской 31B, — и единственная модель, построенная на архитектуре без энкодера: сырые патчи изображений и аудиосигналы проецируются напрямую в токенное пространство, так что одна плотная модель обрабатывает текст, изображения, аудио и видео без отдельной башни энкодера. Она предлагает контекстное окно 256K токенов, вызов инструментов из коробки, опциональный этап рассуждений и драфтеры с мультитокеновым предсказанием, ускоряющие декодирование прямо из чекпоинта. Модель распространяется под Apache-2.0, работает на оборудовании с 16 ГБ памяти (примерно 8 ГБ при 4-битном квантовании), а её страница на Hugging Face показывает миллионы загрузок в месяц.

Утверждение о ранжировании и размерный класс, который оно не учитывает.
Ключевая цифра ModelBest для MiniCPM5-2B — индекс Artificial Analysis Intelligence Index, равный 17; на момент запуска это первое место среди моделей с менее чем 4B параметров. К этому стоит добавить две оговорки. Показатель отражает снапшот v4.1 от AA и не поддаётся прямому сравнению со значениями индекса из более ранних снапшотов; кроме того, это цифра на момент запуска, которую вендор привёл до какого-либо независимого повторного прогона. Честная интерпретация уже, но всё равно впечатляет: на момент выхода, по методологии AA того времени, эта модель с 2,5B параметров возглавляла весь свой класс по размеру. Gemma 4 12B в этом классе не значится, а на сегодняшних страницах Artificial Analysis у неё индекс выше — около 22 для варианта с рассуждениями и 13 для инструктивной модели без рассуждений; оба показателя — «значительно выше среднего» для своей группы аналогов. Индексы из разных снапшотов не сходятся точным образом, поэтому воспринимайте это как ориентир, а не как точную величину: универсальная модель на 12B по тестам оказывается более сильной, а модель на 2B — самой сильной в своём размере. Это разные утверждения, и оба могут быть верны.
Табло, честно подписанное
Читайте эти строки с учетом источника данных — {{1}}показатели MiniCPM5-2B — это заявления из карточки ModelBest, недельной давности и никем не подтвержденные{{/1}}; {{2}}показатели Gemma 4 12B — предоставлены Google и давно доступны сообществу для использования{{/2}}:
• Размер — MiniCPM5-2B: 2,52B всего / 1,98B без эмбеддингов, плотная. Gemma 4 12B: 11,95B, плотная.
Модальность — MiniCPM5-2B: только текст. Gemma 4 12B: текст, изображения, аудио и видео на входе, без энкодера.
• Контекст — MiniCPM5-2B: 131 072 токена в поставляемой конфигурации. Gemma 4 12B: нативные 256K (некоторые рецепты развёртывания ограничивают до 128K).
• Языки — MiniCPM5-2B: карточка модели и данные ориентированы на английский и китайский. Gemma 4 12B: 140+ языков.
• Релиз — MiniCPM5-2B: анонс состоялся 19 июля 2026 года; веса стали доступны 6–7 сентября, без лишней огласки. Gemma 4 12B: запущена 3 июня 2026 года, с полными результатами оценки при запуске.
• Доказательства — MiniCPM5-2B: карточка вендора плюс AA v4.1 (Index 17, #1 sub-4B); независимого прогона пока нет. Gemma 4 12B: оценки при запуске плюс месяцы внедрения в сообществе и ~3,3 млн загрузок в месяц.

Табло выше — это тот же портрет в шесть строк: две модели расходятся почти по каждому измерению, и столбцы, определяющие выбор — модальность, языки, класс устройства, — это как раз те, которые не учитывает ни один средний показатель бенчмарка.
Где 12B выигрывает: то, что текстовый 2B не может сымитировать
Начнём с модальности. Gemma 4 12B изначально принимает аудио, изображения и видео; MiniCPM5-2B — только текст. Любому продукту, который транскрибирует речь, смотрит на экран или отслеживает видео, рядом с 2B нужен второй конвейер, и в этот момент преимущество «маленькой модели» частично испаряется. Вторая стена — языки: 140+ против релиза, ориентированного на английский и китайский. Для продукта, обслуживающего длинный хвост языков, 2B вообще не кандидат. И затем — доказательства. Gemma 4 12B скачивали миллионы раз, её квантовали, дообучали и три месяца использовали в продакшене; её сбои задокументированы, а её экосистема охватывает llama.cpp, Ollama, LM Studio, MLX, vLLM и SGLang. MiniCPM5-2B — репозиторий недельной давности, чьи ключевые показатели — включая полученные вендором 46.4 на SWE-bench Verified, что было бы выдающимся результатом для плотной модели на 2.5B, если бы он подтвердился независимым тестированием, — не проверял никто за пределами лаборатории. Уже по одной зрелости выбор очевиден.
Где 2B — единственный вариант.
Ничто из этого не имеет значения для того класса устройств, куда 12B просто не помещается. Телефон, плата смарт-кокпита или небольшой edge-бокс с несколькими гигабайтами DRAM не могут перемещать веса модели на 11,95B по шине памяти с приемлемой скоростью — это как раз то узкое место, которое задушило бы её. MiniCPM5-2B создан для такого мира: веса, помещающиеся в память устройства, окно на 128K для длительных агентских сессий, нативный вызов инструментов, рассчитанный на интерактивную работу, и адаптация с первого дня для девяти семейств чипов плюс ARM. Если ваша цель — NPU телефонного класса или встраиваемая плата, Gemma 4 12B не конкурирует с MiniCPM5-2B; там она вообще не разворачивается. А если ваша целевая платформа тянет 12B, но только впритык — ноутбук с 16GB, — то 2B даёт запас: меньше задержка на токен, ниже энергопотребление и возможность запустить вторую модель в том же объёме памяти.
Как узнать, какие претензии сохраняются
Поскольку оба варианта имеют открытые веса и могут быть развёрнуты самостоятельно, честный следующий шаг — измерение на собственном оборудовании, а не очередное перечитывание карточек. Если вы сравниваете MiniCPM5-2B с Gemma 4 12B на рабочей нагрузке, которую уже обслуживаете, именно здесь слой маршрутизации оправдывает своё существование: направление тестового маршрута через единый API с автоматическим переключением при сбоях на новый самостоятельно развёрнутый чекпойнт означает, что непроверенный стек может зависнуть или зациклиться, не обрушивая продакшн, а каталожные цены провайдеров на всё, с чем вы сравниваете, проходят с нулевой наценкой. Сама модель — репозиторий суточной давности, поэтому по умолчанию к ней стоит относиться как к эксперименту, но эксперимент дёшев в запуске, и два часа, которые требуются на воспроизведение SWE-bench или части вашего оценочного набора на 2B, — это именно то доказательство, которого этому сравнению не хватает.
Вердикт
{{1}}Выбирайте Gemma 4 12B, когда ваше оборудование позволяет это по запасу мощности, а ваша задача выходит за рамки текста — мультимодальный продукт, многоязычная аудитория или всё, где три месяца проверенного сообществом поведения важнее, чем корона в рейтинге.{{2}}Выбирайте MiniCPM5-2B, когда ваше устройство вообще не может потянуть 12B, или когда текст-ориентированная, агент-направленная модель на 2.5B на чипе телефонного класса позволит вам выпустить продукт, который с более крупной моделью невозможен.{{3}}Лидер рейтинга среди моделей до 4B — это настоящее достижение, а публикация открытых весов делает его доступным для тестирования уже сегодня; просто, судя по имеющимся данным, он не является заменой универсальной модели на 12B там, где 12B реально может работать.
