
MiniCPM5-2B-DSpark: OpenBMB тихо открывает веса MiniCPM5-2B с черновой моделью, созданной для скорости
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Шесть недель назад MiniCPM5-2B был лишь обещанием. MiniCPM5-2B, суб-4B-модель, занимавшая верхнюю строку Artificial Analysis Index, был представлен 19 июля 2026 года на конференции WAIC в Шанхае; в его дорожной карте тогда значилось, что открытые веса появятся «скоро». Это «скоро» наступило на этой неделе — без всякой помпы. 6 сентября 2026 года OpenBMB выложил флагманский репозиторий MiniCPM5-2B на Hugging Face под лицензией Apache-2.0, а через двадцать одну минуту — MiniCPM5-2B-DSpark, черновой чекпойнт с 323,8 млн параметров, единственное назначение которого — ускорять декодирование MiniCPM5-2B с помощью алгоритма спекулятивного декодирования DSpark. 7 сентября 2026 года последовала GPTQ-сборка. На момент написания не нашлось ни объявления, ни поста о запуске, ни записи в журнале изменений; релиз проявился лишь тем, что в течение одиннадцати дней репозитории тихо становились публичными.
Это материал в формате «что нам известно на данный момент», и подача здесь важна. MiniCPM5-2B-DSpark — не самостоятельный чат-бот и не новый флагман: это ускоритель. Небольшая быстрая модель, которая заранее предлагает токены для MiniCPM5-2B, а та затем проверяет их параллельно. Без целевой модели она бесполезна — и именно целевая модель — причина, по которой всё это заслуживает внимания. Открытый релиз весов MiniCPM5-2B, который OpenBMB анонсировал на июль, теперь действительно появился на Hugging Face, а выпущенная вместе с ним черновая модель (draft model) — это тот самый механизм, который вендор рекомендует использовать для запуска основной модели на приемлемой скорости. Всё, что ниже не атрибутировано явно, взято напрямую из двух карточек моделей и их репозиториев.
Что и когда вышло
Семейство 2B было выпущено в виде постепенного неанонсированного дропа, начиная с самых новых позиций:
• 2026-08-27 — Появляются MiniCPM5-2B-Base и MiniCPM5-2B-SFT — «сырые» предобученные и дообученные с учителем контрольные точки.
• 2026-09-01 — MiniCPM5-2B-Midtrain, этап агентного промежуточного обучения.
• 2026-09-05 — MiniCPM5-2B-MLX и MiniCPM5-2B-GGUF, форматы Apple-Silicon и llama.cpp.
• 2026-09-06 — флагманский репозиторий MiniCPM5-2B, затем MiniCPM5-2B-DSpark через двадцать одну минуту.
• 2026-09-07 — MiniCPM5-2B-GPTQ, квантованный формат обслуживания.
Все они распространяются под лицензией Apache-2.0, которую ModelBest использовала для семейства MiniCPM5-1B ещё в мае, и более ранние чекпойнты в последовательности по-прежнему показывают практически нулевую активность сообщества — по несколько загрузок и лайков на каждый. Это признак продолжающейся публикации весов, а не скоординированного запуска: артефакты появляются в порядке зависимостей (сначала базовые и SFT, последними — квантованные и draft-форматы), и ни один день не выделяется как дата релиза.
Что на самом деле представляет собой MiniCPM5-2B-DSpark
Спекулятивное декодирование разделяет генерацию на дешёвого генератора-кандидата и дорогого верификатора. Небольшая модель-черновик предсказывает следующие несколько токенов; большая модель проверяет все предсказания за один прямой проход и принимает те, с которыми согласна. Когда черновик хорошо откалиброван, вы получаете выход большой модели лишь за долю стоимости, а когда он ошибочен, вы тратите только один шаг верификации. DSpark — это конкретный рецепт этой идеи из статьи, опубликованной 2026-07-06 (arXiv 2607.05147, «Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation»). Его отличают два проектных решения: он сочетает параллельный базовый модуль-черновик с лёгким последовательным модулем, так что токены внутри предлагаемого блока зависят друг от друга, а не теряют точность к концу блока, и он определяет размер каждой проверки для каждого запроса на основе оценок уверенности и пропускной способности движка, а не всегда проверяет блок фиксированной длины.
Черновик DSpark, выпущенный OpenBMB, представляет собой пятислойный Transformer с 323,8 млн параметров в BF16 (около 648 МБ). Он относится к семейству архитектуры Qwen3, но содержит специфичные для DSpark дополнения: проектор, который считывает скрытые состояния MiniCPM5-2B с пяти слоёв целевой модели (1, 10, 20, 30 и 39), голову доверия (confidence head) и небольшую марковскую голову, моделирующую распределение следующего токена. Его конфигурация предполагает блок из семи токенов за один прямой проход. При параметрах примерно в восемь раз меньше, чем 2,5 млрд у MiniCPM5-2B, это одна из самых маленьких моделей-черновиков, выпущенных для мейнстримного открытого чекпоинта, — что и является сутью для модели, ориентированной на периферийные устройства: черновик должен быть достаточно дешёвым, чтобы запуск двух моделей на одном устройстве всё равно оказывался быстрее, чем запуск одной.

Вышеуказанный репозиторий — это вся публичная поверхность черновой модели: README, конфигурация, один файл safetensors и карточка модели, в описании обучения которой указано 1 959 525 последовательностей (7,05 млрд токенов), сгенерированных моделью MiniCPM5-2B из промптов по общей тематике, математике и коду; обучение проводилось в течение шести эпох с комбинированной целевой функцией, объединяющей кросс-энтропию, L1 и уверенность. Контрольная точка сама по себе в качестве генеративной модели не используется.
Цифры, опубликованные OpenBMB, честно обозначенные.
В карточке модели-черновика указан один важный показатель — длина принятия, то есть среднее количество предложенных токенов, которые целевая модель принимает из каждого блока по семь токенов. Оценка проводилась на выходах MiniCPM5-2B в трёх доменах, при генерации до 4096 токенов:
• Математика — в среднем принимается 6.05 токенов при жадном декодировании (T=0); 4.61 при сэмплировании (T=1.0).
• Code — 6.11 жадный; 4.44 сэмплированный.
• Общее — 4.16 жадный; 3.10 сэмплированный.
• Агрегированный — 5.52 жадный; 4.05 сэмплированный, из максимума в семь.
Эти цифры приведены вендором в карточке модели и не были независимо воспроизведены. Они также описывают частоту попаданий (hit rate) черновой модели, а не ускорение по реальному времени: скорость — это измерение в условиях эксплуатации, зависящее от того, во сколько обходится проход верификации целевой модели по сравнению с проходом предложений черновой модели, от заполненности батча и от сокращения длины верификации планировщиком уверенности DSpark. OpenBMB не публиковал показатель токенов в секунду для этой пары. Чтобы понять, где находится потолок метода, в статье DSpark сообщается о генерации на одного пользователя, которая на 60–85% быстрее при равной пропускной способности, чем у базовой линии MTP-1 в работающей системе DeepSeek, — это полезный ориентир того, чего алгоритм достиг в других условиях, а не утверждение о MiniCPM5-2B на вашем оборудовании.

Табло выше — это собственный паспорт характеристик релиза. Воспринимайте показатель приёмки как предварительную долю попаданий; множитель на реальную пропускную способность — то, что независимый прогон SGLang ещё должен измерить.
Модель, которую ускоряет черновик
MiniCPM5-2B — это плотный Transformer на 2,5 млрд параметров — всего 2 516 756 480 — с 42 слоями, 16 головками запросов и 2 KV-головками, словарём на 130 560 токенов и контекстным окном на 131 072 токена, в BF16 — около 5 ГБ. Архитектурно он намеренно скучен: стандартный LlamaForCausalLM без собственных ядер и без форка кода модели, и именно поэтому он легко переносится на множество сред выполнения и аппаратных платформ. На внутреннем бенчмарк-наборе OpenBMB карточка даёт ему средний балл 53,9 по рассуждению, следованию инструкциям, знаниям, длинному контексту, использованию инструментов, написанию кода и поисково-агентским задачам — опережая Qwen3.5-4B с 51,1 и granite-4.2-3B с 42,7 в той же таблице, причём несколько ячеек (GPQA-Diamond 70,2, HLE 8,9 и отдельные строки с длинным контекстом и агентскими задачами) помечены как взятые из Artificial Analysis, а не воспроизведённые внутри компании. Ключевые показатели по отдельным задачам включают MATH-500 на 94,6, AIME 2025 и 2026 на 86,5, IFEval на 86,7, MMLU-Pro на 70,8 и SWE-bench Verified на 46,4. Это цифры вендора на его собственном наборе тестов, и в карточке прямо указано, что часть строк взята из сторонних источников; учитывайте эту разнородность соответственно.

{{1}}На июльской презентации материалы ModelBest к запуску ссылались на индекс Artificial Analysis, равный 17, — лучший результат среди моделей с числом параметров менее 4 млрд, — а в июльских публикациях упоминалось окно в 512K токенов.{{/1}} {{2}}Фактически выпущенные чекпойнты настраивают контекст на 131 072 токена.{{/2}} {{3}}Если маркетинговый показатель на день запуска и фактически поставляемая конфигурация расходятся, то, что вы можете запустить, определяет именно конфигурация, и об этом расхождении стоит знать, прежде чем планировать рабочую нагрузку с длинным контекстом в расчёте на маркетинговый показатель.{{/3}}
Запуск MiniCPM5-2B с его драфт-моделью
Предполагаемый путь — SGLang, который поддерживает алгоритм DSpark в апстриме начиная с v0.5.16 — минимальной версии, указанной в карточке модели. Полная команда для обслуживания из карточки:
python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --speculative-algorithm DSPARK --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark --speculative-dspark-block-size 7
При жадном декодировании (T=0) проверка DSpark без потерь: выход идентичен запуску одной MiniCPM5-2B, поэтому черновик используется исключительно ради снижения задержки. При включённом сэмплировании DSpark в SGLang по умолчанию выполняет сэмплирование только целевой модели с опциональным rejection sampling. OpenBMB также документирует обычную загрузку Transformers (transformers ≥ 5.6) и отдельное обслуживание целевой модели через vLLM ≥ 0.21, а также парсер вызовов инструментов minicpm5 для агентских нагрузок; спекулятивный путь DSPARK специфичен именно для SGLang.
Ключевое здесь — аппаратное обеспечение для пары edge-класса: около 5 ГБ для MiniCPM5-2B в BF16 плюс примерно 0,65 ГБ для черновика. Связка «черновик плюс целевая модель» без проблем умещается везде, где одна модель 2B уже была жизнеспособна, — именно поэтому стоит выпускать такой маленький черновик, а не вторую, более крупную модель.
Что не подтверждено
• Никаких анонсов, которые мы могли бы найти, нет — ни в блоге OpenBMB или ModelBest, ни постов в соцсетях на английском или китайском. Определение «тихо выпущенный» здесь буквально: единственное публичное место — коллекция на Hugging Face.
• Независимой оценки не проводилось. Значения длины принятия из черновика и средний результат 53.9 по набору тестов MiniCPM5-2B — данные вендора и не были воспроизведены; ячейки с пометкой AA — сторонние, но это лишь снимки значений, а не прогоны именно этих весов.
Нигде не нашлось размещённого API, так что сегодня внедрение означает самостоятельный запуск чекпойнтов. Зеркало на ModelScope, обещанное в июльских публикациях об анонсе, на момент написания было недоступно.
• Для пары DSPARK не приведено значение ускорения по реальному времени (wall-clock). Длина принятия 5,52 — высокий показатель попаданий, но «во сколько раз быстрее» на конкретном GPU — это именно та цифра, которую OpenBMB не опубликовал.
• Неоднозначность контекстного окна, описанная выше: в маркетинговых материалах было заявлено 512K, а в поставляемой конфигурации указано 131 072, и ничто в репозиториях не связывает эти два значения.
Где тихий релиз open-weight модели вписывается в стек
Честное прочтение MiniCPM5-2B на сегодня таково: это ставка — сильные цифры от вендора, ноль независимых запусков, отсутствие истории эксплуатации и черновая модель, чьё реальное ускорение не измерено. Именно для такой ситуации и существует слой маршрутизации. Команда, которая хочет проверить, может ли вывод небольшой открытой модели заменить размещённую модель, к которой она уже обращается, может провести это сравнение через один API — OrcaRouter предоставляет более 200 размещённых моделей по ценам провайдера без наценки, так что неделя оценки ничего не стоит для развёртывания, а автоматическое переключение при сбое означает, что чекпоинту, созданному несколько дней назад, никогда не придётся удерживать производственный путь в заложниках, пока он доказывает свою состоятельность. Ничто из этого не требует, чтобы MiniCPM5-2B был где-либо размещён; это страховочная сеть вокруг моделей, на которые вы уже полагаетесь, пока вы решаете, стоит ли размещённая на своих мощностях 2B-модель затрат на GPU.
В порядке убывания важности обратите внимание на следующее: независимый прогон SGLang DSPARK, сообщающий реальные токены в секунду для этой пары, поскольку длина принятия — это лишь прокси, а не бенчмарк; официальный анонс или зеркало на ModelScope, подтверждающие, что релиз окончательный; и хостинг-провайдер, который подхватит MiniCPM5-2B, — если такой появится, цена, которую вы платите на нашей стороне, будет собственной прайсовой ценой провайдера в тот же день, потому что именно это означает pass-through. А пока более интересный из двух артефактов — это драфт-модель. Пятислойный пропозер, у которого целевая модель принимает пять с половиной токенов из семи, — это разница между небольшой edge-моделью, которая ощущается маленькой, и моделью, которая ощущается как более крупная, работающая на том же устройстве.
