
Kolibri против MiniCPM5-2B: 78 миллиардов параметров против 2,5, и почему меньшая модель — не дешёвый вариант
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 217 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Поставить Kolibriрядом с MiniCPM5-2B— и первое впечатление: это сравнение размеров, и модель на 2,5 миллиарда параметров — экономичный выбор. Это прочтение ошибочно, и поучительно, почему. Kolibri — это модель со смесью экспертов на 78,1 миллиарда параметров от Aleph Alpha, выпущенная 3 октября 2026 года, активирующая 3,46 миллиарда параметров на токен, с объёмом в FP8 около 78 ГБ и минимальной конфигурацией для обслуживания из двух карт A100 80 ГБ. MiniCPM5-2B — это плотная модель на 2,52 миллиарда параметров от ModelBest и OpenBMB, представленная на Всемирной конференции по искусственному интеллекту 19 июля 2026 года, веса которой появились на Hugging Face 6 сентября. MiniCPM5-2B в тридцать один раз меньше по числу параметров. И именно она требует бюджета на оценку, прежде чем вы ей доверитесь, потому что её самые цитируемые числа получены производителем и не воспроизведены — что как раз противоположно тому, что «маленькая модель» обычно подразумевает в плане риска.
Оба вышли тихо; лишь один из них вышел совсем недавно.
У них похожие истории происхождения и очень разные возрасты, и возраст имеет значение. Репозиторий Kolibri от Aleph Alpha был создан 2 октября 2026 года с заявленной датой релиза 3 октября, а объявление в собственном новостном разделе вендора вышло тем утром, в День германского единства. Широкая ИИ-пресса в основном пропустила это в тот день — отсюда и пошла формулировка «тихий релиз», — но карточка модели, технический отчёт и пост вендора — это не молчаливый релиз. MiniCPM5-2B действительно был тише: июльский анонс на WAIC был представлением питча и спецификаций на конференции, а сами веса появились только 6 сентября — опубликованы без релизного мероприятия, вместе с чекпойнтами GGUF, MLX, GPTQ, base, SFT и draft и обучающими корпусами, стоящими за ними.
Тот пятинедельный разрыв между анонсом и весами стоит запомнить, потому что именно из-за него для этой модели ходят два разных набора цифр. В июльских материалах расхваливали контекстное окно на 512K токенов. В поставляемом конфиге указано 131,072. Считать нужно по выпущенному артефакту.
Для чего на самом деле предназначена каждая модель
Kolibri создан для работы с немецкими и английскими документами, и Aleph Alpha необычно подробно объясняет, почему для этого потребовалась настоящая инженерная работа. Эксперименты на небольших прокси-моделях задали цель примерно 20 процентов немецкого текста в обучающей смеси, что для прогона на 20 триллионов токенов означало найти 4 триллиона немецких токенов. Открытые немецкие наборы данных после дедупликации и фильтрации дали 390 миллиардов — на порядок меньше, — поэтому лаборатория перенастроила фильтр Common Crawl специально под немецкий, получив 1,3 триллиона уникальных органических токенов, и переформулировала существующие немецкие документы в энциклопедические статьи, диалоги и фрагменты, что дало ещё около триллиона; это стало крупнейшим отдельным немецким источником. От перевода, использовавшегося для предшественника Kolibri Origin, в Kolibri отказались. Важно запомнить деталь про фильтр: стандартный конвейер языковых данных отбрасывает документы со слишком большим количеством длинных слов, а немецкая административная проза регулярно превышает английский порог средней длины слова, поэтому настройки по умолчанию тихо удаляют регистр, на котором пишет государственная администрация.
MiniCPM5-2B создавался для противоположной крайности — агента, работающего на устройстве. В карточке описывается плотный трансформер с 2,52 млрд общих параметров, 1,98 млрд без учёта эмбеддингов, 42 слоями при скрытом размере 2048, групповым запросным вниманием с 16 головками запросов и 2 головками KV и стандартной архитектурой LlamaForCausalLM без пользовательских ядер. Пайплайн обучения ориентирован на агентные сценарии: промежуточное обучение агента в масштабе 200 млрд, большой набор agent-SFT, RL-выравнивание агента и финальный этап On-Policy Distillation, который сворачивает шестнадцать RL-экспертных моделей обратно в одну небольшую плотную сеть. Он поставляется с вызовами инструментов в стиле XML и встроенным парсером SGLang, а его выпущенная конфигурация задаёт окно в 131 072 токена.
• Параметры — Kolibri: всего 78 103 074 560, активных 3 457 573 120, разреженность 22,6:1. MiniCPM5-2B: всего 2 516 756 480, 1,98 млрд без учёта эмбеддингов, плотная.
• Выпущено — Kolibri: 3 октября 2026 г. MiniCPM5-2B: анонсирована 19 июля 2026 г., веса — 6 сентября 2026 г.
• Контекст — Kolibri: 16 384 обучен, 65 536 промежуточно обучен, 262 144 нативный, 1 048 576 валидирован. MiniCPM5-2B: 131 072 в поставляемой конфигурации; заявление о 512K от июля в неё не входит.
• Занимаемая память — Kolibri: около 78 ГБ в FP8; минимум — две A100 80 ГБ, две H100 SXM5, одна H200, одна B200 или одна B300. MiniCPM5-2B: один шард BF16, класса ноутбука.
• Языки — Kolibri: немецкий и английский, по замыслу и ничего больше. MiniCPM5-2B: английский и китайский, при этом все опубликованные оценочные наборы — на английском.
• Вызов инструментов — Kolibri: в стиле Hermes с поставляемым парсером vLLM. MiniCPM5-2B: в стиле XML с парсером SGLang.
• Лицензия — обе Apache 2.0, обе без оговорки о допустимом использовании.

Табло и источники, на которых они основаны
Нигде нет прямого сопоставительного числа для этой пары — ни в материалах одного вендора, ни в материалах другого, и мы не собираемся составлять его из двух разных стендов и называть это сравнением. То, что публикует каждая сторона, стоит аккуратно разделять, потому что два набора цифр несут очень разный объём доказательств.
Показатели Kolibri взяты из собственной сравнительной таблицы Aleph Alpha по четырнадцати моделям, полученной на едином стенде при уровне усилий на рассуждение high: 75,5 по среднему для английского языка и 70,8 по среднему для немецкого. Эта таблица не льстит своему предмету — Qwen3.8 27B набирает 80,2 и 79,9 по тем же двум средним и лидирует в GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified и обоих бенчмарках длинного контекста, активируя при этом примерно восьмую часть параметров Kolibri. Объяснение этого разрыва от вендора — граница Парето качества в сопоставлении с числом декодированных токенов в секунду на GPU, которую не превосходит ни одна из сравниваемых моделей. Это аргумент экономики обслуживания, а не аргумент возможностей, и его не измерял никто из третьих сторон: записи о Kolibri в Artificial Analysis нет, как нет и воспроизведения стенда.
Цифры MiniCPM5-2B взяты из его собственной карточки: внутреннее среднее 53,9 по выбранному вендором набору для сравнения, AIME 2025/2026 — 86,5, MATH-500 — 94,6 и 46,4, полученные вендором на SWE-bench Verified, что было бы выдающимся для плотной модели с 2,5 миллиардами параметров, если она выдержит независимое тестирование. На этой карточке IBM Granite 4.2 3B имеет 42,7 против 53,9 у MiniCPM5-2B — один вендор, запускавший обе модели на одном выбранном им наборе тестов. Разные наборы тестов, разные инструменты тестирования, разные вендоры. Ничто из этого не является вердиктом относительно этой пары.
Что действительно полезно на стороне MiniCPM5-2B — это раскрытие информации. OpenBMB выпустила обучающие корпуса UltraData вместе с весами — Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, наборы SFT и RL для агентов — всё под Apache 2.0, что превращает чёрный ящик в рецепт, который можно изучить и продолжить обучение на своей предметной области. Модель также поставляется с адаптацией с первого дня для девяти семейств чипов через сообщество FlagOS от ModelBest, от Huawei Ascend до NVIDIA и ARM, — и это заявление о развёртывании, а не о бенчмарках. В противоположность этому IBM опубликовала веса Granite 4.2 3B и подробное техническое описание сборки, но не обучающие данные, а Aleph Alpha — пайплайн данных Kolibri и учёт энергозатрат — 20 триллионов токенов предобучения, 9,5×10² МВт·ч с учётом накладных расходов дата-центров и без учёта дообучения с учителем и обучения с подкреплением — но не сам корпус.
Где на самом деле проявляется разница в размерах
Самый полезный способ поставить эти два рядом — сравнить их по двум осям, которые определяют реальное развёртывание: что должно быть в помещении и что происходит, когда модель ошибается.
На аппаратном обеспечении MiniCPM5-2B побеждает, и с большим отрывом. Плотная модель с 2,52 млрд параметров в одном BF16-шарде работает на ноутбуке, edge-устройстве или одной потребительской GPU, а поддержка FlagOS для девяти семейств чипов означает, что она работает на оборудовании, которое вообще не является ускорителем NVIDIA. Нижняя граница для Kolibri — две карты A100 80 ГБ или одна B200, примерно 78 ГБ весов FP8, обслуживаемых через плагин vLLM aleph-alpha-inference или опубликованный контейнер. Для рабочей нагрузки вроде умной кабины или близкой к смартфону, 2B — единственная из двух, которая подходит, и Kolibri никогда не проектировалась для конкуренции в этой нише.
В плане проверяемости Kolibri выигрывает по более тонкой причине. Его самое цитируемое утверждение — экономика обслуживания — не проверено, но его показатели качества, по крайней мере, опубликованы в сравнении с тринадцатью названными конкурентами на одном тестовом стенде с раскрытыми настройками, и собственная таблица вендора отдаёт победу в большинстве строк оппоненту. Ключевые показатели MiniCPM5-2B — от вендора, на его же наборе тестов, без раскрытия сравнительного тестового стенда, и модель несёт дополнительную неопределённость из-за контрольной точки, возраст которой — недели, а не дни. Ни одна из моделей не проходила независимое тестирование. Разница в том, что один вендор записал сравнение, в котором его собственная модель проигрывает, а другой записал такое, в котором его собственная модель выигрывает с большим отрывом.
Намеренно здесь нет никакого соревнования. Kolibri существует для обработки немецкоязычных документов на локальной инфраструктуре, с двуязычным токенизатором, который Aleph Alpha оценивает в 4,90 среднего байта на токен на немецком веб-тексте против 4,35 у GPT-5 и 3,28 у Kimi K3 — всё измерено поставщиками, и это эффект стоимости за токен, а не заявление о качестве. MiniCPM5-2B существует для агентов, вызывающих инструменты, на английском и китайском языках на оборудовании с ограниченными ресурсами. Команда с немецкими контрактами и требованием соблюдения нормативных норм не выбирает между ними.

Реальность маршрутизации и эксперимент, который стоит провести
Ни одна из этих моделей сегодня не присутствует в размещённом каталоге, и мы проверили обе, а не стали исходить из предположений. У Kolibri нет артикула SKU в API вендора — релиз представляет собой веса, технический отчёт и образ контейнера — и её нет в OrcaRouter: мы прощупали каталог при всех вариантах написания префикса вендора и названия модели, и он возвращает «не найдено». У MiniCPM5-2B тоже нет размещённого эндпоинта от ModelBest, и у нас она не маршрутизируется. Обе модели предполагают самостоятельный хостинг, и мы предпочли бы сказать это прямо, чем намекать, будто мы предоставляем доступ к какой-либо из них.
Самое интересное здесь — это эксперимент. Агентная модель с 2,5 миллиарда параметров и документная модель с 78 миллиардами параметров решают разные задачи, и единственный способ узнать, какая нужна вашей нагрузке, — прогнать обе на ней; именно для такой ситуации и создан слой маршрутизации, даже если он не несёт ни одной из этих моделей. Направьте тестовый путь на самостоятельно размещённую сборку MiniCPM5-2B через один OpenAI-совместимый эндпоинт с автоматическим переключением при сбое, оставив продакшен на проверенной маршрутизируемой модели, — и новый стек может зависнуть или выдать бессмыслицу, ничего не уронив. Прайс-листовые цены провайдеров на модели, с которыми вы сравниваете, проходят без наценки, так что A/B остаётся дешёвым и обратимым. А если эксперимент на самом деле покажет, что вашей немецкой нагрузке не нужна ни одна из самостоятельно размещённых моделей, тот же ключ открывает доступ к уровню небольших смесей экспертов, который уже маршрутизирован, — вариант Gemma 4 26B-A4B по $0,06 за миллион входных токенов и $0,33 за миллион выходных, с окном в 262 144 токена и вводом текста, изображений и видео — это самый дешёвый способ выяснить это, прежде чем покупать два GPU.
Какой именно, и что изменило бы ответ?
Запускайте MiniCPM5-2B, если ограничение — это устройство. При 2,52 млрд параметров это единственная из двух моделей, которая помещается на ноутбук, в кабину или на периферийный вычислительный блок, и если ваша рабочая нагрузка — это интерактивный агент с вызовом инструментов на английском или китайском, то именно для неё и предназначена эта модель. Сначала заложите время на воспроизведение её показателей — средний результат 53,9 и заявленный результат 46,4 на SWE-bench принадлежат только ModelBest, а открытость обучающих корпусов делает такое воспроизведение действительно возможным, а не чисто теоретическим.
Запускайте Kolibri, если корпус на немецком языке, имеется подходящее оборудование и веса не должны покидать здание. Нативное окно контекста на 262 144 токена, FP8-кэш KV, четыре уровня усилий при рассуждении и вызов инструментов Hermes хорошо подходят для работы с документами в регулируемой сфере, а условия Apache 2.0 вместе с опубликованным конвейером данных — это та часть, которая выдерживает проверку закупок.
Две вещи уладили бы это быстрее любых споров. Независимый прогон MiniCPM5-2B на SWE-bench Verified подтвердил бы или опроверг самое неожиданное утверждение, сделанное в любой из двух карточек. А независимое измерение пропускной способности Kolibri в её рекомендуемой конфигурации с двумя H100 — или запись в Artificial Analysis, которой сегодня не существует, — превратило бы «78 миллиардов параметров» из характеристики в стоимость, а это именно то число, которое на самом деле ищет каждый, кто сопоставляет это сравнение с оборудованием. До тех пор разрыв в размере реален, разрыв в назначении ещё больше, а внешне дешёвый вариант — это тот, что несёт непроверенное утверждение.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
