Титульная карточка с заголовком «Kolibri vs Granite 4.2 3B» и подзаголовком «разреженная смесь экспертов на 78B против плотной модели рассуждений на 3B», бейджами-пилюлями с надписями «78.1B всего | 3.46B активных», «~3B плотная», «Apache 2.0 у обеих» и строкой внизу «Показатели, заявленные производителями с обеих сторон», с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Kolibri против Granite 4.2 3B: ставка на разрежённость 78B и модель 3B, которая отказывается играть в ту же игру

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Поставьте Kolibri и Granite 4.2 3B рядом друг с другом — и первое честное наблюдение будет состоять в том, что это неравный бой, причём не в ту сторону, которую вы могли бы предположить. Kolibri — это модель смеси экспертов от Aleph Alpha с 78,1 млрд параметров, выпущенная 3 октября 2026 года и активирующая 3,46 млрд параметров на токен. Granite 4.2 3B — это плотная модель рассуждений от IBM примерно с тремя миллиардами параметров, чьи веса появились на Hugging Face 7 августа 2026 года, а карточка модели и технический блог — 25 августа. Одна в двадцать шесть раз больше другой по общему числу параметров. Причина, по которой они оказываются в одном решении, в том, что обе распространяются под Apache 2.0, обе работают только с текстом, обе по своей архитектуре предназначены для самостоятельного развёртывания и обе нацелены на одного и того же покупателя: команду, которая хочет анализировать документы на контролируемом ею оборудовании и иметь подтверждаемое происхождение, способное выдержать закупочную проверку. Интересный вопрос не в том, какая из них лучше. А в том, что на самом деле даёт двадцатишестикратный бюджет параметров и чего стоит его нести.

Несоответствие, если сказать прямо

Granite 4.2 3B — это самостоятельная плотная модель, прошедшая постобучение на основе Granite-4.1-3B-Base, часть семейства Granite 4.2, выпущенного IBM в августе. Она имеет 40 слоёв с групповым вниманием запросов, нативный контекст 128K, который IBM расширяет до 512K на пятой фазе предобучения, и три режима мышления для каждого запроса: полное мышление по умолчанию, путь с низкими усилиями и путь без мышления. Карточка IBM необычно откровенна в отношении того, чем 3B не является. В отличие от своих собратьев 8B и 30B, она намеренно пропустила специализированный блок агентного обучения с подкреплением, обученный в средах SWE-agent, терминала и поиска, поэтому IBM вообще не указывает для неё показатель SWE-bench и позиционирует модель как специалиста по рассуждениям, а не как агента.

Kolibri идёт в противоположном направлении по каждой оси. Пятьдесят слоёв, и каждый из них — mixture-of-experts: 384 эксперта на слой, один общий и шесть маршрутизируемых, при коэффициенте разреженности около 22,6 к 1. Контекст изначально составляет 262 144 токена, проверен до 1 048 576; в карточке рекомендуется оставаться на уровне 262 144 или ниже для задач, чувствительных к задержке. Четыре уровня усилий при рассуждении. Вызов инструментов в стиле Hermes с парсером vLLM, поставляемым в том же репозитории, что и веса. И объём около 78 ГБ в FP8, при этом минимальная конфигурация по карточке — две карты A100 80 GB, две H100 SXM5, одна H200, одна B200 или одна B300.

• Параметры — Kolibri: всего 78 103 074 560, 3 457 573 120 активных на токен. Granite 4.2 3B: приблизительно 3 млрд плотных, все параметры активны на каждом токене.

• Контекст — Kolibri: 16 384 обученный, 65 536 промежуточно обученный, 262 144 нативный, 1 048 576 проверенный. Granite 4.2 3B: 128K нативный, расширен до 512K.

• Режимы мышления — Kolibri: нет, низкий, средний, высокий, задаётся через шаблон чата. Granite 4.2 3B: полный, с низкими усилиями и без мышления, для каждого запроса.

• Вызов инструментов — Kolibri: в стиле Hermes, с поставляемым парсером. Granite 4.2 3B: да, но не тот путь, обученный agentic-RL, который достался его более крупным собратьям.

• Языки — Kolibri: немецкий и английский, так задумано, и ничего больше. Granite 4.2 3B: ориентирован прежде всего на английский, но за ним стоит более широкое многоязычное обучение IBM.

• Занимаемая память — Kolibri: около 78 ГБ в FP8, минимум два GPU. Granite 4.2 3B: примерно 6–8 ГБ в bfloat16, менее 2 ГБ в квантованном виде, уровня ноутбука.

• Лицензия — обе под Apache 2.0, обе без дополнительного пункта о допустимом использовании и без порога по ежемесячно активным пользователям.

• Сервинг — Kolibri: плагин vLLM aleph-alpha-inference или опубликованный образ контейнера. Granite 4.2 3B: vLLM, SGLang, Transformers, GGUF и Ollama под именем granite4.2:3b.

A two-column comparison scoreboard titled 'Kolibri vs Granite 4.2 3B'. Left column Kolibri: Parameters 78.1B total / 3.46B active, Context 262,144 native / 1,048,576 validated, Thinking none / low / medium / high, Languages German and English, Licence Apache 2.0, Footprint about 78 GB FP8, two GPUs minimum. Right column Granite 4.2 3B: Parameters ~3B dense, Context 128K native / 512K extended, Thinking full / low / none, Languages English-first with IBM multilingual training, Licence Apache 2.0, Footprint 6-8 GB bfloat16 / under 2 GB quantized, laptop-class. Footer: 'Kolibri figures are Aleph Alpha's own; Granite 4.2 3B figures are IBM's own; nothing here is independently reproduced.' with the OrcaRouter logo in the bottom-right corner.

Что дают дополнительные 75 миллиардов параметров

Три вещи, и стоит точно разобраться, какие из них установлены, а какие — лишь заявлены.

Первое — это самое резкое реальное различие между моделями, и это не строка в бенчмарке. Aleph Alpha построила Kolibri на немецко-английском двуязычном корпусе — примерно 20 % немецкого в предобучении на 20 трлн токенов — и в итоге получила немецкий пул на 2,4 трлн токенов, 80 % которого лаборатория курировала или генерировала сама. В карточке объясняется, почему это потребовало работы: дедуплицированные открытые немецкие наборы данных дали лишь 390 млрд токенов — на порядок меньше, — поэтому лаборатория перенастроила фильтр Common Crawl специально для немецкого и перефразировала существующие немецкие документы в энциклопедические статьи, диалоги и фрагменты. Деталь про фильтр стоит запомнить. Стандартный конвейер обработки языковых данных отбрасывает документы со слишком большим количеством длинных слов, а немецкая административная проза регулярно превышает английский порог по средней длине слова — так что настройки по умолчанию тихо удаляют регистр, на котором пишет государственное управление. IBM не создавала Granite для этого корпуса. Granite 4.2 3B справится с немецким; она не проектировалась под немецкий юридический и административный регистр, и ни одна таблица лидеров вам об этом не скажет.

Второе — это длинный контекст, который выдерживает реальные документы. Потолок Granite в 512K действительно огромен, но две модели пришли к этому по-разному, и позиционная архитектура Kolibri — это более традиционный аргумент в пользу длинного контекста. Рассматривайте показатели RULER от IBM — 67,52 при 64K и 55,30 при 128K в опубликованных материалах семейства 4.2 — как честное раскрытие того, насколько качество извлечения падает к 128K, и помните, что у Kolibri вообще нет эквивалентной опубликованной кривой деградации.

Третье — это чистый запас для рассуждений, и именно здесь честный ответ таков: «не так много, как предполагает соотношение параметров». Тренировочный конвейер Kolibri обеспечил ей предобучение на 20 триллионах токенов на 768 NVIDIA B200 за 21 день, а собственная сравнительная таблица Aleph Alpha, где Kolibri указана при высоком уровне усилий на рассуждение, ставит её на 75,5 по среднему английскому показателю и 70,8 по среднему немецкому в сравнении четырнадцати моделей — где она проигрывает плотной модели на 27 миллиардов параметров от Alibaba в большинстве строк. Заявленные ключевые показатели Granite 4.2 3B — её собственные: AIME 2025 — 78,33, GPQA — 54,80, LiveCodeBench v6 — 69,71 и MMLU-Pro — 67,84, все заявлены IBM и не воспроизведены. Разные наборы тестов, разные тестовые стенды, разные производители. Нигде нет числа для этой пары, полученного в одной и той же тестовой обвязке, и мы не собираемся его выдумывать.

Где каждый из них действительно выигрывает

Запускайте Granite 4.2 3B, если ваше ограничение — это машина. При 6–8 ГБ в bfloat16 или менее 2 ГБ в квантованном виде он помещается на ноутбук, одну GPU рабочей станции или изолированное от сети edge-устройство, которое никогда не увидит двух H100. Он работает через пять различных сред выполнения, включая Ollama и GGUF, что важно, когда целевое устройство развёртывания — чужой ноутбук, а не ваша собственная стойка. А его карточка модели на удивление заслуживает доверия именно потому, что IBM записала, что в неё не вошло. Поставщик, который отказывается заявлять результаты SWE-bench для 3B-модели, тем самым показывает, где заканчиваются её возможности.

Запускайте Kolibri, если главное — корпус, а аппаратное обеспечение имеется. Команда, у которой есть договоры на немецком языке, техническая документация или административные документы, уже имеющийся узел с двумя GPU и требование, чтобы веса никогда не покидали организацию, — именно для неё был разработан этот выпуск. Нативное окно размером 262 144 токена, FP8 KV-кэш, четыре уровня усилий и механизм вызова инструментов Hermes — всё это указывает на работу с документами, а не на чат. Двуязычный токенизатор — часть того же аргумента: Aleph Alpha сообщает о 4,90 среднего числа байтов на токен на немецком веб-тексте против 4,35 у GPT-5 и 3,28 у Kimi K3, причём все измерения выполнены поставщиком на его собственном корпусе, а большее число символов на токен — это прямое влияние на стоимость инференса, а не оценка. Если это подтвердится, эффект будет накапливаться на каждой обрабатываемой вами странице.

Асимметрия, о которой никто не афиширует, — это данные. IBM опубликовала веса Granite 4.2 3B и подробное техническое описание того, как создавалась модель, но не обучающие данные. Aleph Alpha опубликовала пайплайн, происхождение данных и показатель энергопотребления вместе с весами Kolibri — 20 триллионов токенов предварительного обучения, 9,5×10² МВт·ч с учётом накладных расходов дата-центров и без учёта обучения с учителем и обучения с подкреплением. Для команды, которой приходится отвечать на вопрос «откуда взялся текст, сгенерированный этой моделью», эта разница не косметическая.

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the card header, the Apache 2.0 licence tag, the twelve tested languages, and the links to the Granite 4.2 Collection, the technical blog and the GitHub repository.

Реальность маршрутизации для обоих

Ни одна из этих моделей сегодня не входит в каталог хостируемых предложений. У Kolibri вообще нет вендорского SKU для API — релиз представляет собой веса плюс технический отчёт, — а Granite 4.2 3B поставляется в виде весов для пяти сред исполнения, и IBM не предлагает для него хостируемого эндпоинта. Обе модели предполагают самостоятельный хостинг, и практический вопрос для большинства команд не в том, какую из них внедрить, а в том, оправдывает ли рабочая нагрузка владение любой из них.

Именно здесь слой маршрутизации оправдывает своё существование — даже для моделей, которых нет в его каталоге. Мы проверили каталог OrcaRouter при всех вариантах написания обоих названий моделей, и ни Kolibri, ни Granite 4.2 3B там нет, так что мы не станем делать вид, будто это не так. Что OrcaRouter действительно даёт, так это дешёвый способ выяснить, оправдано ли решение о железе, прежде чем вы его примете: направить тестовый маршрут на небольшой уровень смеси экспертов, который уже маршрутизируется — вариант Gemma 4 26B-A4B по $0.06 за миллион входных токенов и $0.33 за миллион выходных при окне в 262 144 токена — и посмотреть, действительно ли вашей нагрузке с немецкими документами нужно то, что даёт Kolibri, на одном ключе, совместимом с OpenAI, по прейскурантной цене провайдера без каких-либо наценок. Если да — вы покупаете GPU, опираясь на доказательства, а не на догадки. Если нет — вы только что сэкономили на заказе оборудования.

Вердикт, и что могло бы его изменить

Это не состязание с победителем. Kolibri и Granite 4.2 3B отвечают на разные вопросы в разных ценовых категориях, и единственное честное ранжирование — по ограничению: если ограничение — аппаратное обеспечение, Granite 4.2 3B — единственный из двух, который соответствует требованиям. Если ограничение — работа с документами на немецком языке в регуляторном регистре локально, Granite 4.2 3B никогда не был в числе претендентов, а Kolibri — более интересный артефакт: полноценный релиз с открытыми весами на 78B, Apache 2.0, с конвейером данных и токенизатором, опубликованными рядом с весами.

Две вещи поставили бы точку в этом сравнении. Независимый прогон Kolibri на задаче вопросов и ответов по документам на немецком языке проверил бы утверждение, ради которого этот релиз, собственно, и создавался, поскольку сейчас ни один лидерборд этого не измеряет. А независимое воспроизведение показателей рассуждений Granite 4.2 3B сказало бы вам, способна ли машина класса ноутбука держаться на равных на том подмножестве вашей рабочей нагрузки, которому изначально не требовалось 78 миллиардов параметров. Пока не появится хотя бы один из этих результатов, выбирайте по ограничениям, а не по числу параметров.

A screenshot of IBM's technical blog announcing the Granite 4.2 family, showing the post header and the discussion of the family's dense and mixture-of-experts tiers and their reasoning and thinking modes.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube