Сгенерированная главная титульная карточка для MiniCPM5-2B-DSpark с подзаголовком «OpenBMB quietly opened MiniCPM5-2B weights — and shipped a small draft model to make it fast», на которой показаны телефон и ноутбук: на экране каждого — округлый чип «2B»; чип меньшего размера «Draft 0.3B» подаёт в более крупный чип семь токенов со стрелками вперёд; также присутствуют спидометр со стрелкой, направленной вверх, и значок приглушённого звонка, а в правом нижнем углу размещён логотип OrcaRouter.
Guides & Insights

MiniCPM5-2B-DSpark: OpenBMB тихо открывает веса MiniCPM5-2B с черновой моделью, созданной для скорости

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Шесть недель назад MiniCPM5-2B был лишь обещанием. MiniCPM5-2B, суб-4B-модель, занимавшая верхнюю строку Artificial Analysis Index, был представлен 19 июля 2026 года на конференции WAIC в Шанхае; в его дорожной карте тогда значилось, что открытые веса появятся «скоро». Это «скоро» наступило на этой неделе — без всякой помпы. 6 сентября 2026 года OpenBMB выложил флагманский репозиторий MiniCPM5-2B на Hugging Face под лицензией Apache-2.0, а через двадцать одну минуту — MiniCPM5-2B-DSpark, черновой чекпойнт с 323,8 млн параметров, единственное назначение которого — ускорять декодирование MiniCPM5-2B с помощью алгоритма спекулятивного декодирования DSpark. 7 сентября 2026 года последовала GPTQ-сборка. На момент написания не нашлось ни объявления, ни поста о запуске, ни записи в журнале изменений; релиз проявился лишь тем, что в течение одиннадцати дней репозитории тихо становились публичными.

Это материал в формате «что нам известно на данный момент», и подача здесь важна. MiniCPM5-2B-DSpark — не самостоятельный чат-бот и не новый флагман: это ускоритель. Небольшая быстрая модель, которая заранее предлагает токены для MiniCPM5-2B, а та затем проверяет их параллельно. Без целевой модели она бесполезна — и именно целевая модель — причина, по которой всё это заслуживает внимания. Открытый релиз весов MiniCPM5-2B, который OpenBMB анонсировал на июль, теперь действительно появился на Hugging Face, а выпущенная вместе с ним черновая модель (draft model) — это тот самый механизм, который вендор рекомендует использовать для запуска основной модели на приемлемой скорости. Всё, что ниже не атрибутировано явно, взято напрямую из двух карточек моделей и их репозиториев.

Что и когда вышло

Семейство 2B было выпущено в виде постепенного неанонсированного дропа, начиная с самых новых позиций:

• 2026-08-27 — Появляются MiniCPM5-2B-Base и MiniCPM5-2B-SFT — «сырые» предобученные и дообученные с учителем контрольные точки.

• 2026-09-01 — MiniCPM5-2B-Midtrain, этап агентного промежуточного обучения.

• 2026-09-05 — MiniCPM5-2B-MLX и MiniCPM5-2B-GGUF, форматы Apple-Silicon и llama.cpp.

• 2026-09-06 — флагманский репозиторий MiniCPM5-2B, затем MiniCPM5-2B-DSpark через двадцать одну минуту.

• 2026-09-07 — MiniCPM5-2B-GPTQ, квантованный формат обслуживания.

Все они распространяются под лицензией Apache-2.0, которую ModelBest использовала для семейства MiniCPM5-1B ещё в мае, и более ранние чекпойнты в последовательности по-прежнему показывают практически нулевую активность сообщества — по несколько загрузок и лайков на каждый. Это признак продолжающейся публикации весов, а не скоординированного запуска: артефакты появляются в порядке зависимостей (сначала базовые и SFT, последними — квантованные и draft-форматы), и ни один день не выделяется как дата релиза.

Что на самом деле представляет собой MiniCPM5-2B-DSpark

Спекулятивное декодирование разделяет генерацию на дешёвого генератора-кандидата и дорогого верификатора. Небольшая модель-черновик предсказывает следующие несколько токенов; большая модель проверяет все предсказания за один прямой проход и принимает те, с которыми согласна. Когда черновик хорошо откалиброван, вы получаете выход большой модели лишь за долю стоимости, а когда он ошибочен, вы тратите только один шаг верификации. DSpark — это конкретный рецепт этой идеи из статьи, опубликованной 2026-07-06 (arXiv 2607.05147, «Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation»). Его отличают два проектных решения: он сочетает параллельный базовый модуль-черновик с лёгким последовательным модулем, так что токены внутри предлагаемого блока зависят друг от друга, а не теряют точность к концу блока, и он определяет размер каждой проверки для каждого запроса на основе оценок уверенности и пропускной способности движка, а не всегда проверяет блок фиксированной длины.

Черновик DSpark, выпущенный OpenBMB, представляет собой пятислойный Transformer с 323,8 млн параметров в BF16 (около 648 МБ). Он относится к семейству архитектуры Q​wen3, но содержит специфичные для DSpark дополнения: проектор, который считывает скрытые состояния MiniCPM5-2B с пяти слоёв целевой модели (1, 10, 20, 30 и 39), голову доверия (confidence head) и небольшую марковскую голову, моделирующую распределение следующего токена. Его конфигурация предполагает блок из семи токенов за один прямой проход. При параметрах примерно в восемь раз меньше, чем 2,5 млрд у MiniCPM5-2B, это одна из самых маленьких моделей-черновиков, выпущенных для мейнстримного открытого чекпоинта, — что и является сутью для модели, ориентированной на периферийные устройства: черновик должен быть достаточно дешёвым, чтобы запуск двух моделей на одном устройстве всё равно оказывался быстрее, чем запуск одной.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark, captured September 7, 2026, showing the OpenBMB org, the model name, the Apache-2.0 licence, tags including Transformers, Safetensors, text-generation, edge-ai and custom_code, the linked arxiv papers, the MiniCPM5 target reference, and the opening card line "MiniCPM5-2B-DSpark is a DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B and its tokenizer."

Вышеуказанный репозиторий — это вся публичная поверхность черновой модели: README, конфигурация, один файл safetensors и карточка модели, в описании обучения которой указано 1 959 525 последовательностей (7,05 млрд токенов), сгенерированных моделью MiniCPM5-2B из промптов по общей тематике, математике и коду; обучение проводилось в течение шести эпох с комбинированной целевой функцией, объединяющей кросс-энтропию, L1 и уверенность. Контрольная точка сама по себе в качестве генеративной модели не используется.

Цифры, опубликованные OpenBMB, честно обозначенные.

В карточке модели-черновика указан один важный показатель — длина принятия, то есть среднее количество предложенных токенов, которые целевая модель принимает из каждого блока по семь токенов. Оценка проводилась на выходах MiniCPM5-2B в трёх доменах, при генерации до 4096 токенов:

• Математика — в среднем принимается 6.05 токенов при жадном декодировании (T=0); 4.61 при сэмплировании (T=1.0).

• Code — 6.11 жадный; 4.44 сэмплированный.

• Общее — 4.16 жадный; 3.10 сэмплированный.

• Агрегированный — 5.52 жадный; 4.05 сэмплированный, из максимума в семь.

Эти цифры приведены вендором в карточке модели и не были независимо воспроизведены. Они также описывают частоту попаданий (hit rate) черновой модели, а не ускорение по реальному времени: скорость — это измерение в условиях эксплуатации, зависящее от того, во сколько обходится проход верификации целевой модели по сравнению с проходом предложений черновой модели, от заполненности батча и от сокращения длины верификации планировщиком уверенности DSpark. OpenBMB не публиковал показатель токенов в секунду для этой пары. Чтобы понять, где находится потолок метода, в статье DSpark сообщается о генерации на одного пользователя, которая на 60–85% быстрее при равной пропускной способности, чем у базовой линии MTP-1 в работающей системе Deep​Seek, — это полезный ориентир того, чего алгоритм достиг в других условиях, а не утверждение о MiniCPM5-2B на вашем оборудовании.

A generated single-column scoreboard for MiniCPM5-2B-DSpark listing Draft params 323.8M, 5 layers; Draft tokens per forward pass 7; Target model MiniCPM5-2B, 42 layers; Greedy acceptance length 5.52 of 7; Confidence + Markov heads enabled; License Apache-2.0, with the footer "Acceptance figures from OpenBMB's model card; not independently reproduced" and the OrcaRouter logo composited in the bottom-right corner.

Табло выше — это собственный паспорт характеристик релиза. Воспринимайте показатель приёмки как предварительную долю попаданий; множитель на реальную пропускную способность — то, что независимый прогон SGLang ещё должен измерить.

Модель, которую ускоряет черновик

MiniCPM5-2B — это плотный Transformer на 2,5 млрд параметров — всего 2 516 756 480 — с 42 слоями, 16 головками запросов и 2 KV-головками, словарём на 130 560 токенов и контекстным окном на 131 072 токена, в BF16 — около 5 ГБ. Архитектурно он намеренно скучен: стандартный LlamaForCausalLM без собственных ядер и без форка кода модели, и именно поэтому он легко переносится на множество сред выполнения и аппаратных платформ. На внутреннем бенчмарк-наборе OpenBMB карточка даёт ему средний балл 53,9 по рассуждению, следованию инструкциям, знаниям, длинному контексту, использованию инструментов, написанию кода и поисково-агентским задачам — опережая Qwen3.5-4B с 51,1 и granite-4.2-3B с 42,7 в той же таблице, причём несколько ячеек (GPQA-Diamond 70,2, HLE 8,9 и отдельные строки с длинным контекстом и агентскими задачами) помечены как взятые из Artificial Analysis, а не воспроизведённые внутри компании. Ключевые показатели по отдельным задачам включают MATH-500 на 94,6, AIME 2025 и 2026 на 86,5, IFEval на 86,7, MMLU-Pro на 70,8 и SWE-bench Verified на 46,4. Это цифры вендора на его собственном наборе тестов, и в карточке прямо указано, что часть строк взята из сторонних источников; учитывайте эту разнородность соответственно.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B, captured September 7, 2026, showing the OpenBMB org, the model name, the Apache-2.0 licence, tags including Transformers, Safetensors, English, Chinese, long-context, tool-calling and edge-ai, the arxiv links, and the opening Highlights line "We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B."

{{1}}На июльской презентации материалы ModelBest к запуску ссылались на индекс Artificial Analysis, равный 17, — лучший результат среди моделей с числом параметров менее 4 млрд, — а в июльских публикациях упоминалось окно в 512K токенов.{{/1}} {{2}}Фактически выпущенные чекпойнты настраивают контекст на 131 072 токена.{{/2}} {{3}}Если маркетинговый показатель на день запуска и фактически поставляемая конфигурация расходятся, то, что вы можете запустить, определяет именно конфигурация, и об этом расхождении стоит знать, прежде чем планировать рабочую нагрузку с длинным контекстом в расчёте на маркетинговый показатель.{{/3}}

Запуск MiniCPM5-2B с его драфт-моделью

Предполагаемый путь — SGLang, который поддерживает алгоритм DSpark в апстриме начиная с v0.5.16 — минимальной версии, указанной в карточке модели. Полная команда для обслуживания из карточки:

python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --speculative-algorithm DSPARK --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark --speculative-dspark-block-size 7

При жадном декодировании (T=0) проверка DSpark без потерь: выход идентичен запуску одной MiniCPM5-2B, поэтому черновик используется исключительно ради снижения задержки. При включённом сэмплировании DSpark в SGLang по умолчанию выполняет сэмплирование только целевой модели с опциональным rejection sampling. OpenBMB также документирует обычную загрузку Transformers (transformers ≥ 5.6) и отдельное обслуживание целевой модели через vLLM ≥ 0.21, а также парсер вызовов инструментов minicpm5 для агентских нагрузок; спекулятивный путь DSPARK специфичен именно для SGLang.

Ключевое здесь — аппаратное обеспечение для пары edge-класса: около 5 ГБ для MiniCPM5-2B в BF16 плюс примерно 0,65 ГБ для черновика. Связка «черновик плюс целевая модель» без проблем умещается везде, где одна модель 2B уже была жизнеспособна, — именно поэтому стоит выпускать такой маленький черновик, а не вторую, более крупную модель.

Что не подтверждено

• Никаких анонсов, которые мы могли бы найти, нет — ни в блоге OpenBMB или ModelBest, ни постов в соцсетях на английском или китайском. Определение «тихо выпущенный» здесь буквально: единственное публичное место — коллекция на Hugging Face.

• Независимой оценки не проводилось. Значения длины принятия из черновика и средний результат 53.9 по набору тестов MiniCPM5-2B — данные вендора и не были воспроизведены; ячейки с пометкой AA — сторонние, но это лишь снимки значений, а не прогоны именно этих весов.

Нигде не нашлось размещённого API, так что сегодня внедрение означает самостоятельный запуск чекпойнтов. Зеркало на ModelScope, обещанное в июльских публикациях об анонсе, на момент написания было недоступно.

• Для пары DSPARK не приведено значение ускорения по реальному времени (wall-clock). Длина принятия 5,52 — высокий показатель попаданий, но «во сколько раз быстрее» на конкретном GPU — это именно та цифра, которую OpenBMB не опубликовал.

• Неоднозначность контекстного окна, описанная выше: в маркетинговых материалах было заявлено 512K, а в поставляемой конфигурации указано 131 072, и ничто в репозиториях не связывает эти два значения.

Где тихий релиз open-weight модели вписывается в стек

Честное прочтение MiniCPM5-2B на сегодня таково: это ставка — сильные цифры от вендора, ноль независимых запусков, отсутствие истории эксплуатации и черновая модель, чьё реальное ускорение не измерено. Именно для такой ситуации и существует слой маршрутизации. Команда, которая хочет проверить, может ли вывод небольшой открытой модели заменить размещённую модель, к которой она уже обращается, может провести это сравнение через один API — OrcaRouter предоставляет более 200 размещённых моделей по ценам провайдера без наценки, так что неделя оценки ничего не стоит для развёртывания, а автоматическое переключение при сбое означает, что чекпоинту, созданному несколько дней назад, никогда не придётся удерживать производственный путь в заложниках, пока он доказывает свою состоятельность. Ничто из этого не требует, чтобы MiniCPM5-2B был где-либо размещён; это страховочная сеть вокруг моделей, на которые вы уже полагаетесь, пока вы решаете, стоит ли размещённая на своих мощностях 2B-модель затрат на GPU.

В порядке убывания важности обратите внимание на следующее: независимый прогон SGLang DSPARK, сообщающий реальные токены в секунду для этой пары, поскольку длина принятия — это лишь прокси, а не бенчмарк; официальный анонс или зеркало на ModelScope, подтверждающие, что релиз окончательный; и хостинг-провайдер, который подхватит MiniCPM5-2B, — если такой появится, цена, которую вы платите на нашей стороне, будет собственной прайсовой ценой провайдера в тот же день, потому что именно это означает pass-through. А пока более интересный из двух артефактов — это драфт-модель. Пятислойный пропозер, у которого целевая модель принимает пять с половиной токенов из семи, — это разница между небольшой edge-моделью, которая ощущается маленькой, и моделью, которая ощущается как более крупная, работающая на том же устройстве.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube