
MiniCPM5-2B-DSpark vs Qwen3-8B: новый локальный стек 2.5B vs рабочая лошадка с открытыми весами
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Любое сравнение моделей скрывает в себе аппаратный вопрос, и MiniCPM5-2B-DSpark против Qwen3-8B — это именно тот вопрос в костюме бенчмарка. Qwen3-8B — рабочая лошадка Alibaba с открытыми весами, вышедшая в апреле 2025 года: примерно 8,2 млрд плотных параметров, 119 языков, родной контекст 32K, расширяемый до 131K, гибридные режимы мышления и шестнадцать месяцев накопленной практики сообщества за плечами. MiniCPM5-2B-DSpark — не самостоятельная модель, которую можно поставить рядом с ней: это черновой чекпойнт DSpark на 323,8 млн параметров, который OpenBMB без лишнего шума выложил на Hugging Face 6 сентября 2026 года для ускорения MiniCPM5-2B — плотной модели на 2,52 млрд параметров для устройств, анонсированной ModelBest на WAIC 19 июля 2026 года. Соберите эту пару вместе — и всплывает настоящий вопрос: должна ли нагрузка, которая сейчас работает на 8B, выполняться на «железе», способном потянуть только 2B, — и достаточно ли модели на 2,5 млрд с бесплатной черновой моделью, чтобы решиться на такой переход?
Если коротко, то для большинства рабочих нагрузок — пока нет, но причины уже, чем можно предположить по разнице в размерах, и есть один класс развёртывания, где 8B вообще не даёт ответа. Все количественные данные в этом материале получены от вендоров: цифры MiniCPM — собственные результаты ModelBest, никем не воспроизведённые; цифры Qwen3-8B — результаты Alibaba, давно доступные сообществу. Поэтому названия важнее цифр.
Две модели на разных участках кривой памяти
MiniCPM5-2B — это плотный каузальный трансформер размером в треть от 8B: 42 слоя, grouped-query attention, лицензия Apache-2.0 — созданный для того класса устройств, до которого большая модель не дотягивается: телефонов, умных кокпитов и небольших периферийных боксов, где шина памяти подавилась бы восемью миллиардами весов. Материалы анонса делают акцент на агентной работе и длинном контексте, а не на сырой широте: родной контекст 128K и утверждение ModelBest, что на собственном оценочном наборе модель набирает в среднем 53,9 — по словам вендора, открытая SOTA класса 2B, включая запущенный вендором результат 46,4 на SWE-bench Verified, который был бы примечателен для 2B, если переживёт независимое тестирование. Draft-модель DSpark — это ответ по пропускной способности на очевидное возражение, что маленькая плотная модель быстро загружается, но медленно генерирует, потому что каждый токен протаскивает свои веса через шину памяти. Draft предлагает до семи токенов одновременно для проверки целевой моделью, а в репозитории сообщается о жадном принятии 5,52 токена на шаг верификации в среднем — 6,11 на коде. Это число — качество draft-модели; её ускорение ещё не измерено, и ни одного значения токенов в секунду не опубликовано.

The {{1}}openbmb/MiniCPM5-2B-DSpark{{/1}} card above is the entire public surface of the {{2}}quiet September 6 release{{/2}}: a serving accessory {{3}}reporting acceptance length{{/3}}, with no announcement and no wall-clock speedup.
Qwen3-8B — это то же архитектурное семейство, втрое крупнее и на шестнадцать месяцев старше. Это плотный каузальный трансформер с grouped-query attention, обученный на многоязычном корпусе из 36 триллионов токенов, под лицензией Apache-2.0, и одна из самых широко самостоятельно развёртываемых и эксплуатируемых 8B-моделей в мире открытых весов. Её визитная карточка — гибридный режим рассуждений Qwen3: мышление включается или выключается для каждого запроса, — а профиль намеренно широкий: MMLU в верхних 70 процентах, уверенные результаты в GSM8K и кодинге, 119 языков. Ей нужен полноценный GPU или мощное edge-устройство: при практичной квантизации она занимает единицы гигабайт и уверенно работает на одной видеокарте среднего класса, но не на телефоне.

Приведённая выше карточка модели Qwen3-8B от Alibaba — это лицо действующего лидера: шестнадцать месяцев документированного, проверенного сообществом поведения на 119 языках.
Где 8B всё ещё выигрывает
Спуститесь в более низкую весовую категорию — и вы потеряете три конкретные вещи. Во-первых, языки: Qwen3-8B покрывает 119 языков; карточка MiniCPM5-2B и датасеты к ней ориентированы на английский и китайский, и о многоязычной широте не заявляется. Для продукта, обслуживающего длинный хвост языков, это жёсткая стена, а не мягкое ограничение. Во-вторых, доказательства: показатели Qwen3-8B проверяли на прочность, саму модель квантовали, дообучали и обслуживали в масштабе на протяжении шестнадцати месяцев; известны сценарии её отказов, существуют её квантованные версии, экосистема — повсюду. MiniCPM5-2B — это релиз июля 2026 года с таблицей результатов, которую ведёт вендор, и без независимого воспроизведения; и черновику всего один день. В-третьих, стек обслуживания: всё, что уже работает с Qwen3-8B, — vLLM, SGLang, llama.cpp, тысяча дообученных моделей, — работает со зрелой моделью; тогда как черновик MiniCPM требует сборки движка спекулятивного декодирования (алгоритм DSPARK от SGLang), который описан в репозитории, но в более широкой экосистеме пока не прижился.
Где 2B stack — единственный вариант.
Всё это не имеет значения на том классе устройств, где модель на 8B просто не помещается. На телефоне или edge-плате с несколькими гигабайтами DRAM Qwen3-8B не конкурирует с MiniCPM5-2B — развернуть её на практически полезной скорости невозможно. Именно для этого и существует стек 2B, и именно поэтому черновик — несущая часть этого релиза, а не гарнир. Спекулятивное декодирование максимально эффективно именно в плотном режиме с узким местом по памяти — ровно в том, в котором живёт маленькая модель на маленьком чипе: компактная черновая модель предлагает блок, целевая проверяет его за один проход, а стоимость загрузки весов платится один раз за блок, а не за каждый токен. Метод DSpark из DeepSeek (arXiv 2607.05147) создавался для высоконагруженных серверных систем, но его механика — и показатели принятия в этом репозитории — это как раз тот рычаг, который нужен модели 2B, чтобы на ограниченном железе она ощущалась интерактивной. Только не упускайте из виду честную оговорку: OpenBMB измерил принятие черновика, а не ускорение от него, так что реальный прирост токенов в секунду на вашем целевом устройстве вам всё равно предстоит измерить.
Табло, честно подписанное
• Релиз — MiniCPM5-2B: 19 июля 2026 г. (анонсирован); MiniCPM5-2B-DSpark: 6 сентября 2026 г., без анонса. Qwen3-8B: апрель 2025 г., анонсирован.
• Размер — MiniCPM5-2B: 2.52B плотных параметров, плюс draft-модель на 324M. Qwen3-8B: ~8.2B плотных параметров.
• Контекст — MiniCPM5-2B: 128K нативно. Qwen3-8B: 32K нативно, 131K через YaRN.
• Языки — MiniCPM5-2B: ориентирован на английский/китайский. Qwen3-8B: 119.
• Рассуждение — {{1}}MiniCPM5-2B:{{/1}} гибридные быстрые/обдуманные режимы согласно материалам запуска. {{2}}Qwen3-8B:{{/2}} мышление включено или выключено по запросу.
• Свидетельства — показатели MiniCPM взяты с карточки ModelBest (среднее 53,9 на собственном наборе тестов; независимых прогонов не было). Показатели Qwen3-8B предоставлены Alibaba и уже шестнадцать месяцев находятся в открытом доступе для сообщества.

Приведённая выше таблица — это честно показанное несоответствие: колонки различаются почти во всём, кроме открытой лицензии Apache-2.0, а класс устройства, для которого вы делаете поставку, определяет, какую колонку вам вообще разрешено выбирать.
Реальность маршрутизации
Ни одна из моделей сегодня не входит в хостинговый каталог OrcaRouter, так что это сравнение целиком относится к миру самостоятельного размещения — но именно там слой маршрутизации по-прежнему оправдывает своё существование. Qwen3-8B обслуживается её вендором и несколькими сторонними платформами; MiniCPM5-2B и её черновую модель вы запускаете сами. Когда команда хочет проверить, способен ли стек на 2.5B взять на себя часть нагрузки 8B, обратимым шагом будет направить тестовый путь на самодельный SGLang-билд MiniCPM5-2B-plus-draft через единый API с автоматическим переключением при сбое — производство остаётся на действующем решении, новый стек может зависнуть, ничего не останавливая, а опубликованные цены провайдеров по всему сравнению проходят с наценкой 0%, так что A/B-тест дёшев и обратим, а не ставка. Уровень не размещает ни одну из моделей; он делает эксперимент безопасным.
Кому следует двигаться, а кому — ждать
Оставайтесь на Qwen3-8B для любых многоязычных задач, для всего, где важны шестнадцать месяцев известного поведения, или для любой нагрузки, которая уже выполняется на устройствах, спокойно тянущих 8B, — разница в размере не повод мигрировать, а пробел в доказательствах говорит против неё. Всерьёз тестировать стек MiniCPM5-2B с его драфтом DSpark стоит только в том случае, если ваше целевое устройство вообще не тянет 8B либо если модель на 2.5B, которая не отстаёт на агентных и длинноконтекстных задачах, позволит сократить память и энергопотребление на устройствах, которые вы уже выпускаете. И прежде чем принять решение в пользу драфта, проведите тот замер, который OpenBMB так и не опубликовал: длина принятия — это не задержка, и именно прирост токенов в секунду на вашем устройстве — та цифра, которая на самом деле определяет, стоил ли тихий маленький чекпойнт на Hugging Face своего скачивания.
