
Intern-Decision-2B против MiniCPM5-2B: два 2B-чекпоинта, разделённые двадцатью днями, и противоположные способы расходования параметров
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 584 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 187 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
internlm/Intern-Decision-2B и openbmb/MiniCPM5-2B имеют одинаковый размер, выпущены с разницей в двадцать дней, лицензированы одинаковым образом и созданы отнюдь не для одной и той же задачи. Контрольная точка InternLM — это 2 213 241 664 параметра оценщика решений: она принимает состояние и типизированные вопросы, выполняет один прямой проход и возвращает калиброванные вероятности, не генерируя ни одного токена, и отклоняет любой ввод длиннее 8 192 токенов. У OpenBMB — 2 516 756 480 параметров плотного универсала: 42-слойная Llama, производная от рецепта MiniCPM5, с контекстом в 131 072 токена, пишущая код, вызывающая инструменты и занимающаяся математикой, с индексом интеллекта Artificial Analysis 12,5 и 726 518 загрузками за прошлый месяц. Их скачивание стоит одинаково, но дают они совершенно разные вещи.
Интересная часть этого сопоставления — не разрыв в бенчмарках: пересекающихся бенчмарков для сравнения почти нет. Интересно то, на что можно потратить бюджет в 2,2 млрд и 2,5 млрд параметров, и что этот выбор говорит о том, какая из моделей доведена до конца. MiniCPM5-2B — вторая модель в своей серии, следующая за MiniCPM5-1B из мая, и она появилась с полноценной инфраструктурой релиза. Intern-Decision-2B — средний из трёх размеров, которые InternLM выложила на Hugging Face в 05:36 UTC 26 сентября 2026 года без анонса, а её релизная инфраструктура — кодовая база обучения, набор для оценки с проверкой по хешу, калибровочный бенчмарк из 96 кейсов — стала публичной только сегодня утром в 08:58 UTC.
Куда ушли два бюджета
Обе модели — это дообученные версии чужой архитектуры, и обе насчитывают примерно 2,5 миллиарда параметров. На этом сходство заканчивается.

MiniCPM5-2B — это плотный трансформер с 42 слоями, размером скрытого слоя 2 048, 16 головами внимания, промежуточным размером 6 144, словарём на 130 560 токенов и контекстом на 131 072 токена, обученный на смеси открытых корпусов, опубликованных OpenBMB вместе с ним: UltraX для веб-предобучения, UltraData-Code с многоуровневым управлением кодом L0–L3, UltraData-Math и 500 000 образцов SFT для агентов с более чем 80 000 образцами RL в UltraData-RL-2609. В его постобучении сначала выполняется SFT, затем подключаются специализированные RL-учителя по математике, коду и агентным задачам, а после этого — on-policy-дистилляция обратно в одну модель. Это модель общего назначения, весь бюджет параметров которой представлен как возможность, к которой можно обращаться с помощью промптов.
Intern-Decision-2B — это Qwen3_5ForConditionalGeneration с 24 слоями — повторяющийся паттерн: три слоя линейного внимания на один слой полного внимания — размер скрытого состояния 2 048, 8 голов запросов против 2 голов ключей-значений, размерность головы 256, сохранённый слой прогнозирования нескольких токенов и потолок эмбеддингов в 262 144 позиции. Он поставляется с визуальной башней на 612,5 МБ и проектором на 50,3 МБ. Почти ничего из этого бюджета недоступно вам в качестве промпта: модель отвечает по фиксированной схеме вопросов, а её архитектура — это механизм доставки softmax, а не генератор текста.
Одна деталь из недавно опубликованного репозитория InternLM заслуживает отдельного упоминания, потому что она заставляет переосмыслить тег мультимодальности в карточке модели. Тюнинг принятия решений «дообучает языковой бэкбон Qwen3.5, замораживая визуальную башню и проектор». Оба чекпоинта тюнинга принятия решений — 2B и 4B — содержат визуальный шард размером ровно 612 517 440 байт — в обоих случаях одинаковый, — что согласуется с тем, что эти компоненты унаследованы из базы Qwen, а не обучены. Путь для изображений реален, и им можно пользоваться, но это не то, на что тюнинг принятия решений InternLM потратил свои усилия. Если ваша рабочая нагрузка — это оценка решений только по тексту, то примерно 660 МБ из этих 4,46 ГБ загрузки для вас бесполезны.
Табло

• Параметры — Intern-Decision-2B: 2 213 241 664 в BF16 плюс примерно 660 МБ визуального энкодера и проектора, около 4,46 ГБ репозитория; MiniCPM5-2B: 2 516 756 480 в BF16, один файл safetensors размером 5,03 ГБ.
• Контекст — 8 192 токена для Intern-Decision-2B, при превышении отклоняется без усечения; 131 072 токена для MiniCPM5-2B.
• Вывод — калиброванное распределение плюс argmax по каждому полю, без текста вообще; сгенерированный текст, токен за токеном.
• Обучение — настройка принятия решений для основы Qwen3.5-2B с замороженной визуальной башней, обучающие данные не раскрыты; полный проход предобучения, промежуточного обучения и SFT глубокого мышления на 400 млрд токенов, после чего следуют RL и он-политическая дистилляция, а корпуса опубликованы вместе с моделью.
• Опубликованные данные — таблица вендора из семи наборов со средним 84,68, Brier 0,437 и ECE 0,100, не воспроизведённая ни одной третьей стороной, один лайк и ноль загрузок; карточка OpenBMB со средним 53,9 в собственном наборе сравнения и независимый Artificial Analysis Intelligence Index 12,5, при 726 518 загрузках за последний месяц.
• Лицензия — Apache-2.0, при этом условия вышестоящего Qwen сохранены как LICENSE-QWEN, а в репозитории кода лицензия не указана вовсе; Apache-2.0 повсюду, включая код.
В чём каждый из них на самом деле лучше, и это даже не близко
Это сравнение асимметрично настолько, что превращается в категориальную ошибку, поэтому полезнее назвать конкретные работы.
MiniCPM5-2B побеждает во всём, что связано с порождением ответа, а не с выбором одного из вариантов. Пишет код; у Intern-Decision-2B нет кодового пути. Обрабатывает контекст в 131 072 токена; Intern-Decision-2B останавливается на 8 192 и падает с громкой ошибкой. Вызывает инструменты с оценкой 66,6 по BFCL v4 в собственной таблице OpenBMB и занимается математикой: MATH-500 — 94,6, GPQA-Diamond — 70,2 — цифры из карточки поставщика, причём в строке GPQA есть сноска, которую приводит сама карточка. Набирает 70,8 на MMLU-Pro и 84,7 на MMLU-Redux. Работает в llama.cpp и MLX, поставляется в вариантах GGUF, GPTQ и DSpark и имеет демо-Space на Hub, который общедоступен, в отличие от 401, на который указывает карточка Intern-Decision.
Intern-Decision-2B выигрывает ровно в двух вещах, и именно они — причина его существования. Во-первых, решение на закрытом множестве со схемой, которую вы пишете, возвращает вероятность, к которой можно применить порог, за один прямой проход, примерно за 33 миллисекунды, без парсера и без сэмплирования — такую форму MiniCPM5-2B не может выдать иначе, как генерируя текст и надеясь, что число внутри него ведёт себя хорошо. Во-вторых, это воспроизводимый артефакт: репозиторий теперь содержит цель обучения, семь наборов оценки точности с хешами SHA-256 и количеством строк по каждому набору, код подсчёта оценки, скрипты подгонки температуры и воспроизведения, а также бенчмарк калибровки распределения из 96 случаев с собственным генератором и офлайн-оценщиком. В руководстве по оценке InternLM отмечается, что выпущенные пресеты привязаны к бэкенду XTuner и что результаты HF следует представлять как другой режим выполнения — а это как раз та оговорка, которую набор для воспроизведения и призван сделать проверяемой.

Кому что следует скачивать
Если у вас есть задача, связанная с чтением чего-то длинного, написанием чего-либо или ответом на вопрос, варианты которого вы не перечислили заранее, MiniCPM5-2B — это та модель, и решать тут нечего. Это готовый универсал класса 2B с настоящей экосистемой, открытыми данными в основе и независимым списком оценок, а попробовать его ничего не стоит — сборки GGUF и MLX уже доступны на Hub.
Если у вас есть задача, которая по сути является выбором среди известных ответов — маршрутизация тикета, классификация письма в службу поддержки, разметка кандидата, оценка интента по порядковой шкале, — то генеративная модель — неподходящий инструмент, и Intern-Decision-2B — более интересная из двух, хотя её почти никто не запускал. Вероятность, которую можно пороговать, дешевле в эксплуатации, проще для аудита и неспособна галлюцинировать, а тот факт, что чекпойнт появился с комплектом для воспроизведения, а не с постом в таблице лидеров, делает его лучше документированным из двух по той оси, которая важна, когда нужно обосновать выбор.
Ни одна из этих моделей не представлена на OrcaRouter. Наша страница модели Intern-Decision-2B возвращает 404, а маршрута для MiniCPM5-2B не существует; ничто здесь не является заявлением о доступности, и оба варианта означают запуск собственного инференса. Практическая альтернатива есть среди размещённых у нас decision-моделей: Jev 1.13 от TypeSafe, модель, с которой InternLM сравнивала всё своё семейство, есть в каталоге по цене $0,042 за миллион входных токенов при контексте 65K и P50 времени до первого токена 178 мс. А если вам действительно нужен универсал того же размерного класса, что и MiniCPM5-2B, но без операционной работы, то наш самый компактный размещённый маршрут Qwen в несколько раз крупнее, однако это один ключ среди более чем 200 моделей, по цене из прайс-листа провайдера без наценки и автоматическим переключением при сбое за ним.
Единственное число, которое всё решает
Это не 84,68 против 53,9. Эти два средних значения получены из разных наборов тестов, измерены разными лабораториями, а в одном случае — лабораторией, чьи цифры никогда не проверялись. Число, которое всё решает, — 8192. Если ваше состояние укладывается в восемь тысяч токенов, а ваш ответ уже представляет собой список, Intern-Decision-2B — это точный инструмент с набором для воспроизведения и аномалией калибровки, о которой вам стоит знать: его ожидаемая ошибка калибровки 0,100 — худшая из трёх размеров, опубликованных InternLM, против 0,066 у модели вдвое меньшего размера, поэтому подберите собственную температуру, прежде чем доверять значению уверенности. Если ваше состояние не укладывается, вопрос закрыт ещё до начала бенчмарков, и ответ — MiniCPM5-2B.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
