Сгенерирована hero-карточка для Kolibri vs Gemma 4 12B с заголовком «Kolibri vs Gemma 4 12B» и подзаголовком «78B MoE против плотной модели на 11,95B», иконка колибри слева и ромб справа по обе стороны от тонкого разделителя. Логотип OrcaRouter расположен в полосе под изображением.
Guides & Insights

Kolibri против Gemma 4 12B: 78 миллиардов параметров против 12, и только у одного из них есть оценка

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Kolibri и Gemma 4 12B — это два конца спектра, которые релизы с открытыми весами обычно не позволяют сравнивать на равных. Kolibri от Aleph Alpha вышла 3 октября 2026 года: 78,1 млрд общих параметров, 3,46 млрд активных на токен, подтверждённое контекстное окно на 1 048 576 токенов, только немецкий и английский, Apache 2.0. Gemma 4 12B вышла 3 июня 2026 года: 11,95 млрд плотных параметров, контекстное окно на 262 144 токена, ввод текста, изображений, аудио и видео, Apache 2.0. У одной из них есть независимая, публично воспроизводимая оценка. У другой — таблица бенчмарков от производителя. Эта асимметрия не сноска к этому сравнению; это и есть сравнение, потому что всё остальное, что важно для покупателя — стоимость за задачу, качество на ватт, будет ли это работать с вашими документами — упирается в неё.

Нам следует быть столь же прямыми в отношении характера этого противостояния, потому что заголовок, противопоставляющий 78B-модель 12B-модели, подталкивает к неверному выводу. Это не конкуренты. Одна — это развёртывание на 78 ГБ, ориентированное на работу с документами для немецкого госсектора и промышленности на стойках, принадлежащих заказчику; другая — унифицированная мультимодальная модель на 12 миллиардов параметров, которая работает на ноутбуке и имеет независимый индекс 14. Далее следует рассказ о том, для чего на самом деле предназначена каждая из них, где опубликованные цифры позволяют, а где не позволяют их ранжировать, и чего стоит отсутствие независимой оценки.

Одно число, которому здесь можно доверять, и одно, которому нельзя.

Artificial Analysis измерила Gemma 4 12B в режиме рассуждений. Результаты, опубликованные на странице их модели, — это то, на что следует опираться:

• Интеллект — индекс интеллекта Artificial Analysis, равный 14, что помещает его в высшую категорию с позицией №21 среди 142 моделей в этом сравнении, при медиане 8 для сопоставимых моделей.

• Скорость — 112,5 выходных токенов в секунду, №21 из 142 в представлении «Скорость» и выше медианы в 91 токен для сопоставимых моделей.

• Цена — $0.10 за миллион входных токенов и $0.30 за миллион выходных, что на их странице отмечено как довольно дорого по сравнению с медианой $0.03 и $0.15 для моделей сопоставимого размера и класса.

• Характеристики — контекст в 262 144 токена, всего 12 млрд параметров, Apache 2.0, вход: текст, изображение, речь и видео; выход: текст.

Собственный итоговый вердикт Artificial Analysis на удивление прямолинеен для страницы рейтинга, и его стоит повторить: Gemma 4 12B входит в число ведущих моделей по интеллекту, но несколько дороговата по сравнению с другими моделями с открытыми весами аналогичного размера. Это реальная, независимая, воспроизводимая оценка от третьей стороны, не заинтересованной ни в одном из поставщиков.

У Kolibri нет ничего эквивалентного. Для него не существует страницы модели на Artificial Analysis, и на момент написания ни одна третья сторона не воспроизвела набор тестов. Есть лишь собственная сравнительная таблица Aleph Alpha, в которой Kolibri набирает 75,5 по английскому среднему и 70,8 по немецкому среднему по всему набору задач. Это невзвешенные процентные средние по смеси бенчмарков, выбранной вендором, на стенде, написанном вендором, при высоком уровне рассуждений. Они не являются Индексом интеллекта, и эти два числа нельзя преобразовать друг в друга или поставить рядом. Любой, кто представляет «Kolibri 75,5 против Gemma 14» как рейтинг, сравнивает процент по одной шкале с баллом по другой. Честная позиция состоит в том, что качество Gemma 4 12B измерено, а качество Kolibri заявлено.

Что таблица вендора действительно позволяет, так это читать данные по строкам. Gemma 4 26B-A4B IT, собственный собрат 12B от Google на основе смеси экспертов, фигурирует в таблице Aleph Alpha с 71,9 для английского и 66,3 для немецкого, уступая Kolibri по обоим показателям. Это самое близкое к перекрёстной проверке, что доступно, и с той же оговоркой: вендорский тестовый стенд, вендорские цифры. Это слабый сигнал, а не доказательство.

Screenshot of the Artificial Analysis model page for Gemma 4 12B (Reasoning), marked 'Open weights model, Released June 2026', showing an Intelligence Index of 14 against a median of 8, a #21/142 intelligence rank and a #21/142 speed rank, 112.5 output tokens per second against a 91-token median, input pricing $0.10 per million tokens against a $0.03 median and output pricing $0.30 against a $0.15 median, a 262k-token context window, the summary verdict that the model is amongst the leading models in intelligence but somewhat expensive compared with other open-weight models of similar size, and the 142 models in this class count.

Плотная 12B против разреженной 78B — это не такое несоответствие, каким кажется

Архитектурный разрыв больше, чем разрыв в параметрах, если учесть, что фактически вычисляется на каждый токен.

• Вычисления на токен — Gemma 4 12B активирует все 11,95 млрд параметров на каждом токене. Kolibri активирует 3 457 573 120 из своих 78 103 074 560, примерно одну двадцать вторую модели, при этом на каждом слое из 384 используется один общий эксперт и шесть маршрутизируемых экспертов.

• Память — здесь компромисс работает в обратную сторону, и это жестоко. Gemma 4 12B в bfloat16 — это порядка 24 ГБ весов. Карта Kolibri оценивает FP8-веса примерно в 78 ГБ, при минимуме в две карты A100 80 ГБ, две H100 SXM5, одну H200, одну B200 или одну B300.

• Внимание — Gemma 4 использует гибрид локального внимания со скользящим окном и полного глобального внимания, причём последний слой всегда глобальный. Kolibri использует разбиение 4:1 между вниманием со скользящим окном и вниманием с группированными запросами на 50 слоях, полностью состоящих из MoE.

• Контекст — 262 144 токена для Gemma 4 12B; 262 144 нативно для Kolibri, проверено до 1 048 576 без масштабирования позиций.

Итак, честная формулировка «78B против 12B» такова: Kolibri выигрывает в стоимости активации и проигрывает в объеме весов, и ни одно из этих преимуществ не дается бесплатно. Разреженная модель, активирующая 3,46 млрд параметров на токен, все равно должна держать все 78 млрд в памяти, поэтому минимальные требования для развертывания — пара 80-гигабайтных ускорителей, а не одна потребительская карта. Gemma 4 12B идет на противоположный компромисс: на каждом токене срабатывает большая доля модели, но она помещается на оборудование, которое человек может купить.

На стороне Kolibri есть специфический для немецкого языка нюанс, который меняет арифметику, а не рейтинг. Его токенизатор в среднем даёт 4,90 байта на токен на немецкоязычном веб-тексте против 4,13 у Gemini, 4,17 у семейства Qwen3.5–3.8 и 4,35 у GPT-5 — по собственным измерениям Aleph Alpha. Меньше токенов на немецкий документ — это прямое снижение стоимости инференса, а для рабочей нагрузки, где немецкие административные тексты исчисляются миллионами, этот эффект может стоить больше, чем несколько пунктов индекса. К тому же это целиком основано на данных самого вендора.

Generated two-column scoreboard for Kolibri and Gemma 4 12B. Left column Kolibri: independent score 'none published', context '262,144 native, 1M validated', parameters '78.1B MoE, 3.46B active', modalities 'text only', licence Apache 2.0, price 'self-host, 78 GB'. Right column Gemma 4 12B: independent score 'AA Index 14', context 262,144, parameters '11.95B dense', modalities 'text, image, audio, video', licence Apache 2.0, price '$0.10 in / $0.30 out'. The footer reads 'Kolibri figures vendor-reported; Gemma 4 12B figures per Artificial Analysis.'

Что каждый из них действительно может видеть

Здесь сравнение перестаёт быть близким, и это факт из спецификации, а не заявление о качестве. Gemma 4 12B — унифицированная мультимодальная модель: в её карточке описана архитектура без энкодеров, которая проецирует необработанные фрагменты изображений и звуковые сигналы напрямую в пространство эмбеддингов языковой модели, принимая текст, изображения, речь и видео, а выводя текст. Она создана для работы на потребительских устройствах без необходимости отдельно разворачивать энкодеры.

Kolibri читает текст на двух языках и ничего больше. Aleph Alpha намеренно представляет это как приоритет глубины над широтой: два тщательно отобранных языка, а не широкий многоязычный набор. Здесь нет визуальной башни, нет аудиотракта, нет видео. Если ваша рабочая нагрузка включает сканированные формы, записи звонков или фотографии оборудования, Gemma 4 12B — кандидат, а Kolibri — нет, что бы ни говорили строки бенчмарков. Если ваша рабочая нагрузка — это корпус немецких и английских документов, которые никогда не должны покидать здание, то ближе к истине обратное — но учтите, что требование «никогда не покидать здание» выполняется и для Gemma 4 12B, поскольку веса лицензированы под Apache 2.0 и доступны для скачивания.

Что из них дешевле, зависит от того, что вы покупаете.

Две эти модели оцениваются в валютах, которые не конвертируются. У Gemma 4 12B есть рыночная ставка: $0,10 и $0,30 за миллион токенов по измерениям Artificial Analysis у разных провайдеров, а на уровне MoE на маршрутизируемых эндпоинтах — дешевле. У Kolibri ставки нет вообще, потому что Aleph Alpha не продаёт для неё инференс — релиз включает веса, технический отчёт и карточку модели.

• Gemma 4 12B на хостинговом маршруте — $0.10 за миллион входных и $0.30 за миллион выходных по данным Artificial Analysis. В нашем собственном каталоге MoE-собрат Gemma 4 26B-A4B IT указан по цене $0.06 за вход и $0.33 за выход с окном в 262,144 токена, а более крупный плотный Gemma 4 31B IT — по $0.13 и $0.38; это прайс-листовые цены провайдеров, переданные как есть, и это единственное число, к которому мы ничего не добавляем.

• Kolibri на вашем собственном оборудовании — 78 ГБ весов, плагин vLLM из пакета aleph-alpha-inference от вендора и минимум один H200 или B200 либо пара H100 SXM5. Затраты — это капитальная закупка, слот в стойке и человек, способный запустить развёртывание vLLM, амортизируемые на столько токенов, сколько вы сгенерируете.

Это не одна и та же покупка, и сравнение не в том, «что дешевле». А в том, имеет ли рабочая нагрузка такую форму, которая оправдывает владение оборудованием. Команда, обрабатывающая фиксированный конфиденциальный корпус документов в больших объёмах, может значительно выиграть при самостоятельном размещении. Команда, разрабатывающая продуктовую функцию, которая ежедневно обращается к модели на несколько миллионов токенов, почти никогда не оказывается в выигрыше.

Один практичный промежуточный путь: уровень Gemma уже доступенOrcaRouter сегодня, на том же OpenAI-совместимом эндпоинте, что и всё остальное, с переключением при сбоях между провайдерами и прейскурантной ценой провайдера, передаваемой без каких-либо наценок за токен. Это делает его дешёвым способом измерить ваш фактический объём токенов на хостируемом маршруте, прежде чем решать, оправдано ли суверенное развёртывание на 78 ГБ. Стоит прямо сказать, чем он не является: мы не маршрутизируем Kolibri. Мы проверяли каталог при всех вариантах написания названия вендора и модели, и его там нет. Самостоятельный хостинг сейчас — единственный способ обратиться к ней.

Screenshot of the OrcaRouter model page for google/gemma-4-26b-a4b-it, showing the 262K-token context badge, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'Public benchmarks by Google - 2026-04-05', the description of Gemma 4 26B A4B IT as an instruction-tuned mixture-of-experts model from Google DeepMind with roughly 26B total parameters of which about 4B activate per token, the pricing tiles $0.06 and $0.33, and the OpenAI-compatible base URL https://api.orcarouter.ai/v1.

Кто должен выбирать

Правило принятия решения достаточно коротко, чтобы изложить его в трёх строках.

Выбирайте Gemma 4 12B, если вам нужно что-то помимо текстов на немецком и английском, если вам нужна измеренная оценка качества перед тем, как принять решение, если модель должна работать на имеющемся у вас оборудовании или если вы предпочитаете арендовать токены, а не владеть стойкой. Это единственная из двух с независимой оценкой, опубликованной скоростью и рыночной ценой.

Выбирайте Kolibri, если вам нужна модель рассуждений на 78 миллиардов параметров, у которой веса, происхождение обучающих данных, энергопотребление и лицензия полностью задокументированы, которая развёрнута в пределах вашего собственного периметра, с токенизатором, созданным для немецкоязычной административной прозы, и поведением воздержания от ответа, на которое может полагаться регулируемый рабочий процесс. Это узкая цель, и Aleph Alpha сознательно к ней стремилась.

Не выбирайте ни то, ни другое, опираясь на строку бенчмарка, которую вы увидели в посте о запуске. 14 у Gemma 4 12B — это измерение, сделанное кем-то другим, и вы можете его проверить. 75,5 у Kolibri — это заявление, сделанное его автором, и единственный, кто сейчас может его опровергнуть, — это клиент с двумя H100 и корпусом документов.