
Веса MiniCPM5-2B уже доступны: маленькая модель, завоевавшая корону в категории Sub-4B, выходит в открытый доступ
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0455Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0247Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0247Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0157Интеллект82Кодинг
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2646Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1849Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1541Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1251Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0547Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0347Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2140Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Интеллект49Кодинг
Самой модели всего семь недель. MiniCPM5-2B была представлена на Всемирной конференции по искусственному интеллекту 2026 года 19 июля, где ModelBest и OpenBMB назвали её лучшей моделью с менее чем 4 млрд параметров в рейтинге Artificial Analysis и пообещали, что веса появятся «в ближайшем будущем». На этих выходных «ближайшее будущее» наступило без какой-либо помпы: репозиторий MiniCPM5-2B стал доступен на Hugging Face 6 сентября, а в журнале изменений OpenBMB релиз датируется 7 сентября — под лицензией Apache-2.0, с полным пакетом: веса BF16, квантизации GGUF, MLX и GPTQ, базовые и SFT-чекпойнты, модель-черновик DSpark для спекулятивного декодирования и лежащие в их основе обучающие наборы данных.
Никакого пресс-релиза к нему не прилагалось, и никакого мероприятия по запуску не проводилось. Он просто появился: сначала репозиторий на Hugging Face, на следующий день — строка в журнале изменений. Поэтому это материал о том, что известно на данный момент, — с одним ранним обновлением. Из репозитория можно узнать очень многое: модель действительно можно скачать и запустить уже сегодня, а описание характеристик открыто. И независимая оценка уже появилась: Artificial Analysis приводит MiniCPM5-2B в своём Intelligence Index v4.2 с результатом 15 — это лучший результат среди моделей с открытым весом с менее чем 4 млрд суммарных параметров в этом индексе, так что рейтинг среди моделей до 4 млрд больше не основывается лишь на словах разработчика. Чего всё ещё нельзя подтвердить, так это ключевых цифр в карточке модели, которые OpenBMB воспроизвёл в своём собственном тестовом окружении и которые никто за пределами лаборатории не перепроверял. Вот что можно узнать из репозитория, что уже измерено независимо и что ещё требует проверки, прежде чем вы начнёте строить на этом свою работу.
Что только что произошло?
MiniCPM5-2B — вторая модель в серии MiniCPM5, после MiniCPM5-1B, которую OpenBMB опубликовала с открытым исходным кодом 19 мая. Когда 2B была представлена как продукт на WAIC, история касалась не только модели, но и чипов — ModelBest позиционировала её как базу агентов для устройств: телефонов, ПК и умных кокпитов, и назвала девять чипов с поддержкой с первого дня через своё сообщество FlagOS — от Huawei Ascend до NVIDIA и целого ряда отечественных ускорителей. Открытие исходного кода было анонсировано как неминуемое. Прошло семь недель.
6 сентября появился репозиторий openbmb/MiniCPM5-2B. На момент написания карточка модели является анонсом релиза и на удивление полна для тихого выпуска:
• Веса — финальный пост-обученный чекпойнт RL + OPD в формате BF16, лицензированный под Apache-2.0 и не имеющий ограничений доступа; скачать его может любой.
• Сопутствующие чекпоинты — MiniCPM5-2B-SFT, -Midtrain и -Base для тех, кому нужна модель до RL/OPD, плюс -GGUF, -MLX, -GPTQ и draft-модель -DSpark. Все они перечислены в коллекции MiniCPM5 на Hugging Face.
• Данные — обучающие корпуса тоже открыты, выпущены в составе семейства UltraData: Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-Agent-2609 и UltraData-RL-2609.
• Зеркала — в README указаны ссылки и на Hugging Face, и на ModelScope.
Одна строка в карточке важнее, чем кажется: «никаких собственных ядер, никакого форка кода модели». MiniCPM5-2B использует стандартную архитектуру LlamaForCausalLM, поэтому любой движок, который уже обслуживает модели семейства Llama, может загрузить её без ожидания специальной реализации.
Почему модель 2.5B заслуживает второго взгляда
Презентация на WAIC была посвящена рейтингам. ModelBest сообщила, что MiniCPM5-2B получил 17 баллов в Artificial Analysis Intelligence Index, что на момент запуска поставило его на первое место среди моделей с менее чем 4 млрд параметров в лидерборде AA. Эту цифру стоит сопроводить двумя оговорками. Во-первых, баллы индекса сопоставимы только в пределах одной версии методологии: более ранние 17,9 балла у MiniCPM5-1B взяты из предыдущего среза AA, так что это не доказательство того, что меньшая модель «набирает больше», и по тому же правилу более новый результат по новой методологии не является регрессом. Во-вторых, показатели AA попадают в карточку модели, но основной средний балл в карточке — это собственный результат OpenBMB, рассчитанный в собственном харнессе OpenBMB. Это различие важно, поскольку с тех пор AA перешёл на новую методологию и опубликовал свежий результат — первую внешнюю проверку этого заявления с момента релиза открытых весов.
Внешний показатель появился на той же неделе, что и веса. 4 сентября Artificial Analysis выпустила Intelligence Index v4.2 — пересмотр методологии, который повышает вес приватных закрытых тестов до 40% и добавляет два новых компонента: AA-Briefcase, агентную оценку, и Surge's GDP.pdf, задачу на рассуждение по документам с длинным контекстом. В записи AA для MiniCPM5-2B теперь стоит оценка v4.2 — 15: лучший результат среди моделей с открытыми весами с суммарным числом параметров менее 4B и первая позиция среди 47 открытых моделей этого размерного класса в списке AA. Это оставляет модель там же, куда её поместил июльский анонс, — но на этот раз на методологии, которую сложнее обмануть, и с весами, которые любой может скачать и перепроверить. 15 не сопоставимо с 17 времён запуска, полученным по v4.1: строже стала методология, а не слабее модель. Композитный индекс также не перепроверяет отдельные строки карточки модели — большинство из них OpenBMB воспроизвела в собственном стенде. Что он действительно делает — так это ложится ровно на те две оси, на которые, по словам OpenBMB, была направлена оптимизация: v4.2 делает больший упор на агентные задачи, а отслеживание многословия в AA показывает, что MiniCPM5-2B генерирует 57M выходных токенов по всем задачам индекса, оставаясь самой немногословной моделью в своём классе при медиане в 72M. В OpenBMB поблагодарили AA за прогон и описали его именно в этих терминах: производительность в агентных задачах и эффективность токенов при 2.6B — вот подо что, по их словам, оптимизировали модель.
Главный тезис — агентные способности в компактном формате: нативный вызов инструментов, глубокий поиск и генерация кода — встроенные с нуля, а не прикрученные в качестве надстройки. В карточке описан трёхэтапный конвейер: базовое обучение, промежуточное обучение, а затем постобучение, включающее SFT на 400 млрд токенов данных глубоких размышлений, специализированных RL-учителей и дистилляцию On-Policy (OPD), которая сводит шестнадцать экспертных RL-моделей, пять из которых агентные, обратно в одну небольшую плотную сеть. OpenBMB приписывает этапу RL + OPD средний прирост в 10,96 балла на задачах на рассуждение и общих задачах и 6,96 балла на агентных задачах — это внутренние дельты, но они объясняют необычную форму модели: сеть на 2,5 млрд параметров, построенная как модель рассуждений и нацеленная на использование инструментов.

Что на самом деле содержит репозиторий
Спецификация однозначна, потому что она и есть конфигурационный файл. MiniCPM5-2B содержит 2 516 756 480 параметров, из которых 1 981 982 720 — параметры вне эмбеддинг-слоёв. Когда вендоры говорят о «классе 2B», они имеют в виду именно цифру без эмбеддингов. Это плотный трансформер: 42 слоя, скрытая размерность — 2048, grouped-query attention (16 головок запросов и всего 2 головки KV), словарь на 130 560 токенов, тензоры BF16. Вся модель поставляется в виде одного шарда safetensors — достаточно компактного, чтобы скачать его по обычному интернет-соединению и запустить на одной GPU среднего класса или NPU уровня смартфона.
Параметры — 2 516 756 480 всего; 1 981 982 720 без эмбеддингов.
Архитектура — плотная LlamaForCausalLM, 42 слоя, скрытая размерность 2048, GQA 16 голов запроса / 2 KV-головы, словарь 130 560.
• Контекст — сконфигурировано 131 072 токена (max_position_embeddings), без масштабирования RoPE в конфигурации.
• Лицензия — Apache-2.0, как для модели, так и для выпущенных обучающих данных.
• Формат — BF16; версии GGUF, MLX и GPTQ публикуются отдельно.

Одно число из июльской презентации не фигурирует в checkpoint. Материалы WAIC рекламировали окно контекста в 512K токенов; в выпущенной конфигурации max_position_embeddings установлено на 131 072 (128K) без записи rope_scaling. Возможно, показатель 512K предполагается достичь через расширение на этапе инференса, как некоторые небольшие модели растягивают свой контекст, — но в поставленном виде репозиторий документирует 131 072, и именно на это число нужно ориентироваться, пока OpenBMB не опубликует рецепт расширения.
Числа, отсортированные по тому, кто их измерил.
Карточка модели внимательно относится к происхождению данных, и её сноски стоит прочитать. Оценки, отмеченные крестиком, «взяты из официального релиза Artificial Analysis» — это такие строки, как GPQA-Diamond 70.2, HLE 8.9, AA-LCR 59.0, Terminal-Bench v2.1 8.6 и GDPval-AA v2 19.6. Всё остальное описано как «воспроизведено internally», то есть OpenBMB запускала эти тесты в собственной среде. В эту категорию входят и привлекающие внимание цифры: внутреннее среднее значение 53.9 по сравнительному набору из карточки, AIME 2025/2026 — 86.5, MATH-500 — 94.6, LiveCodeBench v6 — 69.1, SWE-bench Verified — 46.4, BFCL v4 — 66.6, τ²-Bench Telecom — 97.1, GAIA (Text-103) — 88.7 и MMLU-Pro — 70.8.
Три момента не дают этим цифрам вводить в заблуждение. Средний показатель 53,9 — это относительная, а не абсолютная оценка: карточка нормализует каждую ось радарной диаграммы так, что лучшая модель в сравнении получает 100. Набор для сравнения выбран вендором: другие открытые модели размером 2B–4B, включая Qwen3.5-2B, Qwen3.5-4B, Gemma-4-E2B-it, granite-4.2-3B, LFM2.5-2.6B и LFM2.5-8B-A1B. В этом наборе карточка показывает, что MiniCPM5-2B уверенно обходит ближайшего конкурента Qwen3.5-4B с результатом 51,1 — это действительно поразительный результат для модели вдвое меньшего размера, и именно такой результат требует независимого воспроизведения, прежде чем на него можно будет опираться. К тому же пара отдельных строк плохо согласуется с маркетингом: результат 46,4 на SWE-bench Verified от плотной модели на 2,5B был бы выдающимся, если бы он воспроизводился, а HLE 8,9 напоминает, что «лидер среди моделей менее 4B» и «фронтир» — это разные лиги. Ничто из этого не противоречит самому репозиторию, а композитный показатель v4.2 от AA с тех пор подтвердил общее положение модели во главе класса открытых весов менее 4B — но эти отдельные строки принадлежат самому OpenBMB и до сих пор не проверены никем за пределами лаборатории.
Запуск MiniCPM5-2B сегодня
Так как архитектура — это обычная Llama, основные движки загружают её напрямую. В README OpenBMB есть краткие руководства для vLLM (0.21 или новее), SGLang (0.5.16 или новее) и Transformers (5.6 или новее) с рекомендуемой семплированием при температуре 1.0 и top-p 0.95, а также с включённым enable_thinking, если нужен проход рассуждений. Сопутствующие форматы GGUF и MLX охватывают llama.cpp, Ollama, LM Studio и Apple Silicon; в карточке модели также указаны среда выполнения ArcLight и стандартные стеки для тонкой настройки (TRL + PEFT, LLaMA-Factory, ms-swift, unsloth).
Перед началом работы стоит знать две детали развёртывания. Для вызова инструментов и функций рекомендуемый бэкенд — SGLang: модель формирует вызовы инструментов в XML-стиле, а встроенный в SGLang парсер minicpm5 нативно преобразует их в совместимые с OpenAI tool_calls, поэтому стандартные клиенты вызова инструментов работают без кастомной прослойки. Модель-черновик DSpark существует, чтобы удешевить проход рассуждений: запущенная в SGLang с алгоритмом спекулятивного декодирования DSPARK, она ускоряет декодирование, не изменяя выходы целевой модели, — а это как раз тот фактор, который определяет, будет ли агентский цикл с контекстом 128K на ноутбуке реально пригодным для работы или лишь теоретически возможным.

Если вы предпочитаете оценивать партию небольших открытых моделей, а не вручную настраивать одну, то маршрутизирующий слой тут окупается: когда провайдер включает MiniCPM5-2B в каталог, роутер — это дешёвый способ прогнать A/B-сравнение этой модели с Qwen3.5-2B и другими открытыми чекпоинтами размером менее 4B на той же задаче, без второй интеграции. На OrcaRouter это означает один API для более чем 200 моделей, цены провайдера передаются без наценки (0% маржи) и автоматическое переключение при сбое, если новейший чекпоинт зависает или зацикливается в рабочем процессе. Репозиторию всего два дня от роду, и ни один размещённый API, на который мы можем указать, ещё не включает MiniCPM5-2B — так что честный выбор по умолчанию сегодня — рассматривать его как самохостинговый эксперимент, а не как зависимость.
Кто должен тянуть эти веса?
Скачайте их сегодня, если ваша работа связана с локальными агентами, инструментальными вызовами на периферийных устройствах или экспериментами по кодированию и рассуждениям на малых моделях, и вам нужен самый агрессивно обученный вариант класса 2B из доступных. Лицензия Apache-2.0 и открытые обучающие данные устраняют две причины, по которым большинство команд сомневаются в небольших моделях из китайских лабораторий — отсутствие ограничений на коммерческое использование и отсутствие корпуса как «чёрного ящика». Скачивайте их с осторожностью, если вы выбираете production-модель, полагаясь только на таблицу бенчмарков: ключевые строки карточки — это собственные воспроизведения OpenBMB, и композитный показатель AA v4.2 — единственный на данный момент внешний замер — их не подтверждает. Утверждение, что модель на 2,5B превосходит Qwen3.5-4B, заслуживает двух часов, которые потребуются, чтобы самостоятельно воспроизвести SWE-bench.
Что смотреть дальше. Репозиторию всего два дня от роду, так что ближайшие сигналы всё ещё механические: подхватят ли llama.cpp и библиотека Ollama GGUF, пройдут ли без сбоев сборки для зеркала ModelScope и чипов FlagOS, появится ли MiniCPM5-2B в каком-либо внешнем API — это и есть момент, когда она перестанет быть доступной только для самостоятельного хостинга. Содержательный сигнал, отсутствие которого отмечалось в этом материале, — независимый прогон от Artificial Analysis или университетской лаборатории — теперь получен в виде оценки индекса v4.2, и она сохраняет MiniCPM5-2B на первом месте среди моделей с открытыми весами меньше 4B. По-прежнему не хватает проверки на уровне отдельных строк: никто за пределами OpenBMB не воспроизвёл внутренние цифры карточки, прежде всего SWE-bench Verified — 46,4 — и внутреннее среднее 53,9. Пока эти конкретные строки не перезапущены, относитесь к MiniCPM5-2B так же, как к любой тихо выпущенной модели с впечатляющей карточкой: как к очень многообещающей гипотезе, которую можно запустить локально уже сегодня вечером, и как к модели, чьи самые яркие числа стоит проверить, прежде чем доверять ей реальную работу.
