Титульная hero-карточка для «MiniCPM5-2B против Qwen 3 8B» с подзаголовком «Сможет ли нагрузка 8B-рабочей лошадки перейти на 2.5B?», тремя чипами «2.5B против ~8.2B», «119 языков против EN/ZH» и «16 месяцев доказательств против 1 недели», и верхней плашкой «OPEN-WEIGHTS SHOWDOWN · SEPT 2026».
Guides & Insights

MiniCPM5-2B против Qwen 3 8B: Стоит ли переводить нагрузку с 8B на 2.5B?

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Любое сравнение моделей скрывает аппаратный вопрос, и MiniCPM5-2B против Qwen 3 8B — это тот самый вопрос в костюме бенчмарка. Qwen 3 8B — рабочая лошадка Alibaba с открытыми весами от апреля 2025 года: примерно 8,2 млрд плотных параметров, 119 языков, гибридное мышление, включаемое или выключаемое по каждому запросу, и шестнадцать месяцев подтверждённой практикой сообщества. MiniCPM5-2B — модель, которую ModelBest и OpenBMB представили на Всемирной конференции по искусственному интеллекту 19 июля как лучшую модель с менее чем 4 млрд параметров в рейтинге Artificial Analysis; её открытые веса тихо появились на Hugging Face 6 и 7 сентября. Вопрос, который действительно сводит их на одну страницу, — это тот, который большинство команд, запускающих открытую 8B, рано или поздно задают себе: можно ли перенести нагрузку, которую я обслуживаю на 8B, на 2.5B — и если да, то чем мне придётся пожертвовать?

Краткий ответ — пока нет для большинства рабочих нагрузок, но причины уже, чем кажется при четырёхкратной разнице в размере, и существует один класс развёртывания, где 8B не даёт ответа вовсе. Все количественные данные ниже сообщены вендором и помечены как таковые: цифры MiniCPM5-2B — это собственные заявления ModelBest на карточке модели, им неделя от роду, и никто за пределами лаборатории их не воспроизводил; цифры Qwen 3 8B — данные Alibaba, которые уже давно проверили, квантовали и прогнали заново в большом сообществе. Эта асимметрия доказательств и есть настоящий заголовок данного противостояния.

Шестнадцать месяцев Qwen 3 8B

Qwen 3 8B — представитель того же архитектурного семейства: она в три раза больше и на шестнадцать месяцев старше своего оппонента. Это плотный каузальный трансформер с группированным вниманием запросов (grouped-query attention), предобученный на многоязычном корпусе объёмом примерно 36 триллионов токенов, распространяемый под лицензией Apache-2.0, — и одна из самых широко самостоятельно разворачиваемых и обслуживаемых моделей класса 8B в мире открытых весов. Её фирменная особенность — гибридный режим рассуждений Q​wen3: мышление включается или выключается для каждого запроса, что позволяет одному развёртыванию быстро отвечать на простые вопросы и переключаться на продуманную цепочку рассуждений для математики или кода. Она поддерживает нативные Model Context Protocol и вызов функций, нативный контекст на 32K токенов, который Alibaba доводит до 131K с помощью масштабирования YaRN, а также охватывает 119 языков и диалектов. За шестнадцать месяцев её сценарии отказов задокументированы, квантованные версии существуют повсюду, а стек обслуживания вокруг неё — vLLM, SGLang, llama.cpp, тысяча файнтюнов — достиг зрелости. При практичном квантовании она занимает единицы гигабайт и уверенно работает на одной GPU среднего класса, но не на телефоне.

Screenshot of the Hugging Face model card for Qwen/Qwen3-8B, showing the Qwen org header, the Apache-2.0 license tag, Transformers and Safetensors tags, and the opening of the model card describing Qwen3's seamless switching between thinking mode and non-thinking mode within a single model (captured September 7, 2026).

Что MiniCPM5-2B утверждает в том мире?

MiniCPM5-2B подходит с противоположной стороны: мал по замыслу, агентен по обучению. Это плотный трансформер — суммарно 2,52 млрд параметров (1,98 млрд без эмбеддингов), 42 слоя со скрытой размерностью 2048, grouped-query attention, стандартная архитектура LlamaForCausalLM без кастомных ядер и окно контекста в 131 072 токена в поставляемой конфигурации (в июльских материалах запуска фигурировали 512K; в релизной конфигурации этого нет). Широта Qwen 3 8B — результат многоязычного предобучения на 36 трлн токенов; форма MiniCPM5-2B — результат пост-обучения: SFT на 400 млрд токенов данных с глубокими рассуждениями, затем on-policy дистилляция, которая сворачивает шестнадцать экспертных RL-моделей, пять из которых агентные, обратно в одну небольшую плотную сеть. Основной посыл запуска — агентная основа для on-device: нативные вызовы инструментов с XML-подобным синтаксисом, поддержка с первого дня девяти семейств чипов плюс ARM, гибридные быстрый и обдуманный режимы. В карточке модели заявлены внутреннее среднее 53,9 на выбранном вендором наборе сравнения моделей уровня 2B–4B, 86,5 на AIME 2025/2026 и вендорный прогон 46,4 на SWE-bench Verified — результат, который был бы выдающимся для модели с 2,5 млрд параметров, если независимое тестирование его подтвердит.

Screenshot of the Hugging Face repository page for openbmb/MiniCPM5-2B, showing the OpenBMB org header, the Text Generation tag with Transformers and Safetensors and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B. It is a dense 2B Transformer ... reaching 2B-class open-source SOTA' (captured September 7, 2026).

Несоответствие, измерение за измерением

Релиз — MiniCPM5-2B: анонсирован 19 июля 2026 года; веса станут доступны 6–7 сентября. Qwen 3 8B: анонсирован в апреле 2025 года.

• Размер — MiniCPM5-2B: 2.52B всего / 1.98B без эмбеддингов, плотная модель. Qwen 3 8B: ~8.2B, плотная модель.

• Контекст — MiniCPM5-2B: 131 072 токена в поставляемой конфигурации. Qwen 3 8B: нативный контекст 32K, 131K подтверждено через YaRN.

• Языки — MiniCPM5-2B: ориентирован на английский и китайский. Qwen 3 8B: 119 языков и диалектов.

• Рассуждения — MiniCPM5-2B: гибридные быстрые/обдуманные режимы, согласно материалам запуска. Qwen 3 8B: мышление Qwen3 вкл/выкл по запросу.

• Доказательства — MiniCPM5-2B: карточка вендора, независимого запуска не проводилось. Qwen 3 8B: данные от Alibaba, шестнадцать месяцев воспроизведения и развёртывания сообществом.

A comparison scoreboard titled 'MiniCPM5-2B vs Qwen 3 8B — the scoreboard', with left column rows 'Release: Announced Jul 19 · weights Sep 6', 'Params: 2.52B dense', 'Context: 128K in shipped config', 'Languages: English / Chinese centered', 'Reasoning: Hybrid fast / deliberate, claimed', 'Evidence: Vendor card · no independent run', and right column rows 'Release: April 2025 · mature', 'Params: ~8.2B dense', 'Context: 32K native · 131K YaRN', 'Languages: 119 languages', 'Reasoning: Thinking on / off per request', 'Evidence: 16 months community-tested', with a footer reading 'MiniCPM5-2B figures are ModelBest card claims; Qwen 3 8B figures are Alibaba's, community-exposed.'

Приведённая выше таблица — это честно показанное несоответствие: колонки различаются почти во всём, кроме открытой лицензии Apache-2.0, а класс устройства, для которого вы делаете поставку, определяет, какую колонку вам вообще разрешено выбирать.

Где 8B всё ещё выигрывает

Переходя в более лёгкую весовую категорию, вы отказываетесь от трёх конкретных вещей. Во-первых, языки: Qwen 3 8B покрывает 119 языков; карточка и данные MiniCPM5-2B ориентированы на английский и китайский, и никакой многоязычной широты не заявлено. Для продукта, обслуживающего длинный хвост языков, это жёсткая стена, а не мягкое ограничение. Во-вторых, доказательства: шестнадцать месяцев тестирования сообществом означают, что поведение Qwen 3 8B известно, а его экосистема представлена повсюду, тогда как MiniCPM5-2B — это репозиторий недельной давности с непроверенной карточкой, и его ключевые показатели, если они не выдержат независимых прогонов, — ровно тот тип цифр, который тихо пересматривают. В-третьих, стек инференса: всё, что уже работает с Qwen 3 8B, работает со зрелым таргетом, тогда как совершенно новый чекпоинт класса 2B означает необходимость валидировать с нуля квантования, конфигурации инференса и поведение вызова инструментов. Ни одна из этих причин не означает, что 2B не может победить на конкретном бенчмарке; они означают, что 8B — менее рискованный вариант по умолчанию везде, где он подходит.

Где 2B — единственный ответ

Ничто из этого не имеет значения на том классе устройств, где 8B просто не помещается. На телефоне, плате умного кокпита или небольшом edge-устройстве с несколькими гигабайтами DRAM Qwen 3 8B не конкурирует с MiniCPM5-2B — он вообще не развертывается с полезной скоростью. Это и есть вся причина существования 2B, и именно поэтому честная постановка этого сравнения — не «так ли хорош 2B, как 8B», а «какие из моих развертываний может обслужить только одна из этих двух моделей». Если вы поставляете агентов на устройства, где шина памяти захлебнется от восьми миллиардов весов, MiniCPM5-2B — один из самых агрессивно обученных вариантов класса 2B, и единственный вопрос, который стоит задать, — выдержат ли его заявления об агентности ваше собственное воспроизведение. Если ваша нагрузка уже работает на оборудовании, которое без труда тянет 8B, одна лишь разница в размере — не повод мигрировать, и пробел в доказательствах говорит против этого.

Если вы подумываете о переходе

Безопасный способ проверить переход — относиться к нему как к эксперименту, а не как к миграции. Запустите MiniCPM5-2B на своём оборудовании, направьте на него часть реального трафика через единый API с автоматическим переключением при сбоях и сравните с 8B на тех же запросах — здесь слой маршрутизации оправдывает своё существование, потому что контрольная точка недельной давности может зависнуть или зациклиться, не обрушивая продакшн, а цены из прайс-листа провайдера на сравниваемые размещённые модели проходят с нулевой наценкой. На самом деле вы проверяете три вещи: держится ли точность 2B на ваших данных, превосходит ли её задержка на вашем классе устройств задержку 8B на оборудовании, которое вы в противном случае купили бы, и покрывает ли англо-китайский языковой профиль ваших реальных пользователей. Сначала воспроизведите SWE-bench или часть собственного оценочного набора — два часа, которые на это уйдут, это самая дешёвая страховка, которую даёт данное сравнение.

Вердикт

Оставайтесь на Qwen 3 8B для любых многоязычных задач, для всего, что требует шестнадцати месяцев проверенного поведения, или для любой рабочей нагрузки, которую уже обслуживает оборудование, спокойно тянущее 8B. Серьёзно тестируйте MiniCPM5-2B только в том случае, если ваше целевое устройство вообще не может тянуть 8B, либо если 2.5B, который не отстаёт в агентных задачах и работе с длинным контекстом, позволил бы вам сократить объём памяти и энергопотребление на оборудовании, которое вы уже поставляете. Лидер рейтинга среди моделей меньше 4B — это настоящее достижение, а его релиз с открытыми весами делает его доступным для тестирования уже сегодня; просто, судя по имеющимся данным, это пока не повод отправлять на покой рабочую лошадку на 8B, которая уже заслужила своё место.