
MiniCPM5-2B против Qwen 3 8B: Стоит ли переводить нагрузку с 8B на 2.5B?
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Любое сравнение моделей скрывает аппаратный вопрос, и MiniCPM5-2B против Qwen 3 8B — это тот самый вопрос в костюме бенчмарка. Qwen 3 8B — рабочая лошадка Alibaba с открытыми весами от апреля 2025 года: примерно 8,2 млрд плотных параметров, 119 языков, гибридное мышление, включаемое или выключаемое по каждому запросу, и шестнадцать месяцев подтверждённой практикой сообщества. MiniCPM5-2B — модель, которую ModelBest и OpenBMB представили на Всемирной конференции по искусственному интеллекту 19 июля как лучшую модель с менее чем 4 млрд параметров в рейтинге Artificial Analysis; её открытые веса тихо появились на Hugging Face 6 и 7 сентября. Вопрос, который действительно сводит их на одну страницу, — это тот, который большинство команд, запускающих открытую 8B, рано или поздно задают себе: можно ли перенести нагрузку, которую я обслуживаю на 8B, на 2.5B — и если да, то чем мне придётся пожертвовать?
Краткий ответ — пока нет для большинства рабочих нагрузок, но причины уже, чем кажется при четырёхкратной разнице в размере, и существует один класс развёртывания, где 8B не даёт ответа вовсе. Все количественные данные ниже сообщены вендором и помечены как таковые: цифры MiniCPM5-2B — это собственные заявления ModelBest на карточке модели, им неделя от роду, и никто за пределами лаборатории их не воспроизводил; цифры Qwen 3 8B — данные Alibaba, которые уже давно проверили, квантовали и прогнали заново в большом сообществе. Эта асимметрия доказательств и есть настоящий заголовок данного противостояния.
Шестнадцать месяцев Qwen 3 8B
Qwen 3 8B — представитель того же архитектурного семейства: она в три раза больше и на шестнадцать месяцев старше своего оппонента. Это плотный каузальный трансформер с группированным вниманием запросов (grouped-query attention), предобученный на многоязычном корпусе объёмом примерно 36 триллионов токенов, распространяемый под лицензией Apache-2.0, — и одна из самых широко самостоятельно разворачиваемых и обслуживаемых моделей класса 8B в мире открытых весов. Её фирменная особенность — гибридный режим рассуждений Qwen3: мышление включается или выключается для каждого запроса, что позволяет одному развёртыванию быстро отвечать на простые вопросы и переключаться на продуманную цепочку рассуждений для математики или кода. Она поддерживает нативные Model Context Protocol и вызов функций, нативный контекст на 32K токенов, который Alibaba доводит до 131K с помощью масштабирования YaRN, а также охватывает 119 языков и диалектов. За шестнадцать месяцев её сценарии отказов задокументированы, квантованные версии существуют повсюду, а стек обслуживания вокруг неё — vLLM, SGLang, llama.cpp, тысяча файнтюнов — достиг зрелости. При практичном квантовании она занимает единицы гигабайт и уверенно работает на одной GPU среднего класса, но не на телефоне.

Что MiniCPM5-2B утверждает в том мире?
MiniCPM5-2B подходит с противоположной стороны: мал по замыслу, агентен по обучению. Это плотный трансформер — суммарно 2,52 млрд параметров (1,98 млрд без эмбеддингов), 42 слоя со скрытой размерностью 2048, grouped-query attention, стандартная архитектура LlamaForCausalLM без кастомных ядер и окно контекста в 131 072 токена в поставляемой конфигурации (в июльских материалах запуска фигурировали 512K; в релизной конфигурации этого нет). Широта Qwen 3 8B — результат многоязычного предобучения на 36 трлн токенов; форма MiniCPM5-2B — результат пост-обучения: SFT на 400 млрд токенов данных с глубокими рассуждениями, затем on-policy дистилляция, которая сворачивает шестнадцать экспертных RL-моделей, пять из которых агентные, обратно в одну небольшую плотную сеть. Основной посыл запуска — агентная основа для on-device: нативные вызовы инструментов с XML-подобным синтаксисом, поддержка с первого дня девяти семейств чипов плюс ARM, гибридные быстрый и обдуманный режимы. В карточке модели заявлены внутреннее среднее 53,9 на выбранном вендором наборе сравнения моделей уровня 2B–4B, 86,5 на AIME 2025/2026 и вендорный прогон 46,4 на SWE-bench Verified — результат, который был бы выдающимся для модели с 2,5 млрд параметров, если независимое тестирование его подтвердит.

Несоответствие, измерение за измерением
Релиз — MiniCPM5-2B: анонсирован 19 июля 2026 года; веса станут доступны 6–7 сентября. Qwen 3 8B: анонсирован в апреле 2025 года.
• Размер — MiniCPM5-2B: 2.52B всего / 1.98B без эмбеддингов, плотная модель. Qwen 3 8B: ~8.2B, плотная модель.
• Контекст — MiniCPM5-2B: 131 072 токена в поставляемой конфигурации. Qwen 3 8B: нативный контекст 32K, 131K подтверждено через YaRN.
• Языки — MiniCPM5-2B: ориентирован на английский и китайский. Qwen 3 8B: 119 языков и диалектов.
• Рассуждения — MiniCPM5-2B: гибридные быстрые/обдуманные режимы, согласно материалам запуска. Qwen 3 8B: мышление Qwen3 вкл/выкл по запросу.
• Доказательства — MiniCPM5-2B: карточка вендора, независимого запуска не проводилось. Qwen 3 8B: данные от Alibaba, шестнадцать месяцев воспроизведения и развёртывания сообществом.

Приведённая выше таблица — это честно показанное несоответствие: колонки различаются почти во всём, кроме открытой лицензии Apache-2.0, а класс устройства, для которого вы делаете поставку, определяет, какую колонку вам вообще разрешено выбирать.
Где 8B всё ещё выигрывает
Переходя в более лёгкую весовую категорию, вы отказываетесь от трёх конкретных вещей. Во-первых, языки: Qwen 3 8B покрывает 119 языков; карточка и данные MiniCPM5-2B ориентированы на английский и китайский, и никакой многоязычной широты не заявлено. Для продукта, обслуживающего длинный хвост языков, это жёсткая стена, а не мягкое ограничение. Во-вторых, доказательства: шестнадцать месяцев тестирования сообществом означают, что поведение Qwen 3 8B известно, а его экосистема представлена повсюду, тогда как MiniCPM5-2B — это репозиторий недельной давности с непроверенной карточкой, и его ключевые показатели, если они не выдержат независимых прогонов, — ровно тот тип цифр, который тихо пересматривают. В-третьих, стек инференса: всё, что уже работает с Qwen 3 8B, работает со зрелым таргетом, тогда как совершенно новый чекпоинт класса 2B означает необходимость валидировать с нуля квантования, конфигурации инференса и поведение вызова инструментов. Ни одна из этих причин не означает, что 2B не может победить на конкретном бенчмарке; они означают, что 8B — менее рискованный вариант по умолчанию везде, где он подходит.
Где 2B — единственный ответ
Ничто из этого не имеет значения на том классе устройств, где 8B просто не помещается. На телефоне, плате умного кокпита или небольшом edge-устройстве с несколькими гигабайтами DRAM Qwen 3 8B не конкурирует с MiniCPM5-2B — он вообще не развертывается с полезной скоростью. Это и есть вся причина существования 2B, и именно поэтому честная постановка этого сравнения — не «так ли хорош 2B, как 8B», а «какие из моих развертываний может обслужить только одна из этих двух моделей». Если вы поставляете агентов на устройства, где шина памяти захлебнется от восьми миллиардов весов, MiniCPM5-2B — один из самых агрессивно обученных вариантов класса 2B, и единственный вопрос, который стоит задать, — выдержат ли его заявления об агентности ваше собственное воспроизведение. Если ваша нагрузка уже работает на оборудовании, которое без труда тянет 8B, одна лишь разница в размере — не повод мигрировать, и пробел в доказательствах говорит против этого.
Если вы подумываете о переходе
Безопасный способ проверить переход — относиться к нему как к эксперименту, а не как к миграции. Запустите MiniCPM5-2B на своём оборудовании, направьте на него часть реального трафика через единый API с автоматическим переключением при сбоях и сравните с 8B на тех же запросах — здесь слой маршрутизации оправдывает своё существование, потому что контрольная точка недельной давности может зависнуть или зациклиться, не обрушивая продакшн, а цены из прайс-листа провайдера на сравниваемые размещённые модели проходят с нулевой наценкой. На самом деле вы проверяете три вещи: держится ли точность 2B на ваших данных, превосходит ли её задержка на вашем классе устройств задержку 8B на оборудовании, которое вы в противном случае купили бы, и покрывает ли англо-китайский языковой профиль ваших реальных пользователей. Сначала воспроизведите SWE-bench или часть собственного оценочного набора — два часа, которые на это уйдут, это самая дешёвая страховка, которую даёт данное сравнение.
Вердикт
Оставайтесь на Qwen 3 8B для любых многоязычных задач, для всего, что требует шестнадцати месяцев проверенного поведения, или для любой рабочей нагрузки, которую уже обслуживает оборудование, спокойно тянущее 8B. Серьёзно тестируйте MiniCPM5-2B только в том случае, если ваше целевое устройство вообще не может тянуть 8B, либо если 2.5B, который не отстаёт в агентных задачах и работе с длинным контекстом, позволил бы вам сократить объём памяти и энергопотребление на оборудовании, которое вы уже поставляете. Лидер рейтинга среди моделей меньше 4B — это настоящее достижение, а его релиз с открытыми весами делает его доступным для тестирования уже сегодня; просто, судя по имеющимся данным, это пока не повод отправлять на покой рабочую лошадку на 8B, которая уже заслужила своё место.
