
Kolibri, объяснение: Aleph Alpha выпускает немецко-английскую модель на 78B под лицензией Apache 2.0
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 218 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Aleph Alpha выпустила Kolibri3 октября 2026 года — модель смеси экспертов с 78,1 млрд параметров, которая активирует 3,46 млрд параметров на токен, имеет проверенное контекстное окно в 1 048 576 токенов и поставляется с полными весами на Hugging Face под лицензией Apache 2.0. Гейдельбергская лаборатория опубликовала её в День германского единства вместе с техническим отчётом, карточкой модели на немецком и английском и необычно подробным описанием того, как обучалась эта модель. Модель, с которой её сравнивают во всей собственной документации Aleph Alpha, — это Kolibri Origin — предшественница с 30,6 млрд параметров и 3,27 млрд активных, которая завершила предобучение 11 июня 2026 года и так и не была публично выпущена. Две модели, отстоящие друг от друга на три месяца, и расстояние между ними — самое интересное в этом релизе.
То, что делает Kolibri достойной внимательного прочтения, — не то, что это самая сильная из доступных моделей. В собственных сравнительных таблицах Aleph Alpha это не так, и мы к этому ещё вернёмся. Примечательно то, что европейская лаборатория вообще выпустила модель с открытыми весами такого масштаба, опубликовав вместе с ней процесс обучения, происхождение данных и показатель энергопотребления, и установила лицензию Apache 2.0, а не специальную исследовательскую лицензию. Для команд, чьи правила закупок начинаются с вопроса «куда уходят данные», эта комбинация и есть продукт.
Спецификация и два числа, которые важны
Всё ниже взято из карточки модели, опубликованной Aleph Alpha вместе с весами; ничего из этого пока не было независимо воспроизведено, и на момент написания в Artificial Analysis нет строки для Kolibri.
• Всего параметров — 78 103 074 560, из них 3 457 573 120 активных на токен, соотношение примерно 22,6 к 1.
• Архитектура — 50-слойный трансформер, все слои — смесь экспертов, по 384 эксперта на слой, из которых 1 общий и 6 маршрутизируемых, и соотношение 4:1 между вниманием со скользящим окном и вниманием с группированными запросами по всему стеку.
• Контекст — обучена на 16 384 токенах, дообучена на промежуточном этапе на 65 536 и расширена до нативных 262 144. Поскольку позиционное кодирование применяется только в слоях со скользящим окном, Aleph Alpha утверждает, что окно можно расширять без масштабирования позиций, и подтвердила качество и эффективность обслуживания вплоть до 1 048 576 токенов. В карточке рекомендуется оставаться на уровне 262 144 или ниже для рабочих нагрузок, чувствительных к задержке, а также для сложных задач.
• Точность — веса FP8 в блоках 128×128 с динамически квантованными активациями, оценка с использованием кэша KV в FP8; эмбеддинги, LM head, нормы и маршрутизатор MoE остаются в bfloat16.
• Рассуждение — четыре уровня усилий: нет, низкий, средний и высокий, задаваемые через шаблон чата.
• Вызов инструментов — да, в стиле Hermes, с парсером vLLM, поставляемым в том же репозитории, что и веса.
• Языки — немецкий и английский, и ничего больше. Это заявлено как осознанное решение, а не как упущение.
• Обучение — 20 трлн токенов предварительного обучения на отфильтрованном двуязычном корпусе, примерно 62,5 % английского, 23,9 % немецкого и 13,6 % кода, плюс 3,44 трлн токенов промежуточного обучения и 201 млрд для расширения длинного контекста.
• Вычисления — 768 ускорителей NVIDIA B200 на 96 узлах HGX, 21 день предварительного обучения в течение 511 часов и 392 000 GPU-часов при заявленных 6,4×10²³ FLOPs. Промежуточное обучение добавило пять дней и 90 000 GPU-часов; расширение длинного контекста добавило 13 часов и 10 000 GPU-часов.
• Энергия — оценочно 9,5×10² МВт·ч с учётом накладных расходов дата-центра, охватывает предварительное обучение, промежуточное обучение и обучение с длинным контекстом, но не включает дообучение с учителем и обучение с подкреплением.
• Лицензия — Apache 2.0. Никаких дополнений о допустимом использовании, никаких порогов по ежемесячно активным пользователям, никаких отдельных коммерческих условий.
Две из этих строк — те, что покупателю стоит прочитать дважды. Количество активных параметров — это то, за что вы платите при инференсе, а 3,46 млрд активных из 78 млрд общих — это агрессивная степень разреженности: именно поэтому модель такого размера вообще можно обслуживать на двух GPU. А показатель контекста указан как 262 144 нативных при 1 048 576 подтверждённых — это более осторожное утверждение, чем просто «контекст 1M», которое вы увидите в большинстве публикаций об этом релизе.

Две модели с разницей в три месяца
Kolibri — вторая модель из того, что Aleph Alpha называет своей Model Factory, а опубликованная ею хронология — это та часть релиза, которую пропускает большинство публикаций.
Работа над конвейером обучения началась в январе 2026 года. Kolibri Origin завершила предварительное обучение в целевом масштабе 11 июня 2026 года — 30,6 млрд общих параметров, 3,27 млрд активных, контекстное окно на 65 536 токенов, 7,51 трлн обучающих токенов, 50 слоёв, из которых два были плотными, а 48 — MoE, и единственный режим рассуждения. Она была проверена внутренне и никогда не выпускалась публично. Kolibri завершила предварительное обучение 11 сентября 2026 года.
• Параметры — 30,6 млрд всего и 3,27 млрд активных, против 78,1 млрд всего и 3,46 млрд активных.
• Контекст — 8 192 токена контекста предварительного обучения на Origin против 16 384 на Kolibri, вплоть до нативных 262 144.
• Данные — 7,51 трлн токенов предобучения на Origin против 20 трлн, взятых из исходного пула объёмом более 200 трлн, который конвейер отфильтровал, дедуплицировал и курировал.
• Архитектура — два плотных слоя плюс 48 слоёв MoE на Origin, против 50 слоёв MoE, с изменённой конструкцией механизма внимания, втрое большим числом экспертов, более высокой разреженностью и заменённым алгоритмом маршрутизации.
• Рассуждение — один режим в Origin, в отличие от отсутствующего, низкого, среднего и высокого в Kolibri.
• Выпуск — публичного релиза для Origin не будет, 3 октября 2026 года для Kolibri.
Сильнее всего меняются показатели в наборах задач, где обе модели оценивались с помощью одного и того же оценочного стенда. В среднем по немецкому языку в наборе после дообучения Origin набрал 46,4, а Kolibri — 70,8; в среднем по английскому — 54,1 против 75,5. На AIME 2025 на немецком — 73,5 против 87,5. Во внутренних клиентских прокси-бенчмарках, которые поставщик публикует как отраслевой набор, набор для поставщиков автопрома вырос с 0,72 до 0,99, полупроводники — с 0,35 до 0,80, немецкий госсектор — с 0,54 до 0,75, промышленная приводная техника — с 0,31 до 0,60, а аэрокосмическая отрасль — с 0,14 до 0,59.
Эти внутренние отраслевые показатели получены вендорами на созданных вендорами оценочных наборах, разработанных под клиентов вендора, поэтому воспринимайте их как описание замысла, а не как оценку. Смысл их публикации в том, что они объясняют, для чего оптимизировали модель: не для рейтинговой таблицы, а для набора документов из регулируемых отраслей.

Немецкий здесь — это дизайнерское решение, а не языковой тег
У большинства «многоязычных» карточек моделей «многоязычность» означает обучающую смесь, в которую случайно затесался немецкий. Эта же устроена наоборот, и карточка конкретно описывает механику.
Aleph Alpha обнаружила в ходе экспериментов с небольшими прокси-моделями, что около 20 % немецких данных в смеси давали лучшие результаты, а для прогона на 20 трлн токенов это означало необходимость найти 4 трлн немецких токенов. Дедуплицированные и отфильтрованные открытые немецкие наборы данных дали ей 390 млрд — на порядок меньше целевого объёма. Она закрыла разрыв тремя способами: перенастройкой фильтра Common Crawl специально под немецкий, что дало 1,3 трлн уникальных органических токенов; переформулированием существующих немецких документов в статьи энциклопедического формата, вопросно-ответные диалоги и текстовые отрывки, что дало ещё около 1 трлн и стало крупнейшим немецким источником; и переводом, использовавшимся только в Kolibri Origin и исключённым для Kolibri. В итоге немецкий стал уникальным пулом объёмом 2,4 трлн токенов, 80 % которого было отобрано или сгенерировано собственными силами, а после апсемплинга его доля среди токенов предобучения составила 21,3 %.
Эту деталь про фильтр стоит процитировать, потому что это как раз то, что обнаруживается только в лаборатории, которая действительно обучалась на немецком. Стандартный конвейер обработки языковых данных отбрасывает документы со слишком большим количеством длинных слов, — но немецкая административная проза регулярно превышает английский порог средней длины слова, поэтому настройки по умолчанию тихо удаляют регистр, на котором пишет государственное управление. Очевидное коммерческое следствие: у модели, обученной на стандартном английском фильтре, практически нет немецкого юридически-административного словаря, и ни один бенчмарк вам об этом не скажет.
С токенизатором поступают так же. Aleph Alpha обучила двуязычный немецко-английский токенизатор со словарём из 128 000 токенов, используя новый метод, который она называет UniBPE. Он сохраняет слияние «снизу вверх», свойственное байтовому кодированию парами, но выбирает слияния по униграммной целевой функции. На немецком веб-тексте токенизатор показывает в среднем 4,90 байта на токен, опережая GPT-5 с 4,35, Gemini с 4,13, Qwen3.5–3.8 с 4,17, GLM 5.3 с 3,93, DeepSeek V4 с 3,72 и Kimi K3 с 3,28 — все это заявленные вендорами показатели из их собственных сравнений. Больше текста на токен означает меньше токенов на задачу; это прямой эффект на стоимость инференса, а не заявление о качестве, и это тот вид выигрыша в эффективности, который накапливается в рабочих нагрузках по обработке документов.
Что не решает таблица поставщика
Aleph Alpha опубликовала сравнение пост-обучения, охватывающее четырнадцать моделей, и оно полезнее большинства таблиц запуска, потому что не льстит предмету.
На том же тестовом стенде, с Kolibri при высоком уровне усилия рассуждения, Qwen3.8 27B набирает 80,2 в среднем по английскому против 75,5 у Kolibri и 79,9 в среднем по немецкому против 70,8. Он также лидирует по GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified и двум бенчмаркам на длинный контекст. Nemotron 3 Super 120B-A12B набирает 73,0 по английскому против 75,5 у Kolibri — ближе, и впереди по AIME 2025. Gemma 4 26B-A4B IT набирает 71,9 и 66,3 по двум средним показателям.
Итак, честное резюме релиза — не «state of the art». Оно в том, что Kolibri находится посередине между моделями, которые активируют от трёх до двенадцати миллиардов параметров на токен, что она явно превосходит гораздо меньшие из них и что она проигрывает плотной модели Alibaba на 27 миллиардов параметров по большинству строк своей собственной таблицы, активируя примерно восьмую часть параметров. Aleph Alpha объясняет это границей Парето качества и количества декодированных токенов в секунду на GPU — ни одна из сравниваемых моделей не даёт больше качества при той же стоимости обслуживания или того же качества при более низкой стоимости. Именно это утверждение и следует проверять, и это утверждение об экономике обслуживания, а не о возможностях.
Ни одна из этих цифр не подтверждена независимо. Для Kolibri нет записи в Artificial Analysis, нет воспроизведения фреймворка оценки третьей стороной, а вертикальные бенчмарки созданы вендором. Кроме того, по своей структуре сравнение благоприятно для Kolibri в одном отношении и неблагоприятно в другом: все четырнадцать моделей были прогнаны через собственный испытательный стенд Aleph Alpha с идентичными промптами и настройками few-shot, и это правильный подход, но это всё равно стенд одной лаборатории. Считайте каждое число в этом разделе заявленным вендором, пока кто-то другой не воспроизведёт его.

Что вам нужно, чтобы запустить это
Kolibri — это не модель, которую можно попробовать на ноутбуке. Веса FP8 занимают около 78 ГБ памяти модели, а минимальная конфигурация видеокарт — две карты A100 80 ГБ, две H100 SXM5, одна H200, одна B200 или одна B300; рекомендуемая конфигурация — две H100 SXM5, две H200, одна B200 или одна B300.
Чтобы запустить его, нужно установить пакет aleph-alpha-inference, который предоставляет плагин Kolibri для vLLM и фиксирует поддерживаемую версию vLLM, или загрузить образ контейнера ghcr.io/aleph-alpha/aleph-alpha-inference. После этого это стандартный вызов vLLM с FP8 KV-кэшем, парсером рассуждений Kolibri и парсером вызовов инструментов Kolibri. Контексты, превышающие 262 144 токена, требуют явного флага maximum-model-length и переопределения позиционного эмбеддинга. Рекомендуемые параметры сэмплирования: temperature 1.0, top-p 0.97 и top-k 128.
Поверхность API совместима с OpenAI, и это важнее, чем кажется: reasoning effort передаётся через шаблон чата как значение reasoning_effort, а вызовы инструментов выводятся в стандартном поле tools. Команда, которая уже говорит на языке формата chat-completions, может направить существующий код на конечную точку Kolibri на машине в своём здании без слоя-обёртки.
Чего у Kolibri пока нет
О четырёх отсутствующих вещах стоит сказать прямо, потому что в материалах о запуске их обычно пропускают.
• Независимой оценки нет. У Artificial Analysis нет страницы модели для Kolibri, и ни одна третья сторона не опубликовала воспроизведение таблицы бенчмарков вендора.
• У поставщика нет хостируемого эндпоинта. Релиз — это веса и технический отчёт; в материалах, опубликованных вместе с моделью, нет SKU API Aleph Alpha для Kolibri.
• Ни маршрута на OrcaRouter, ни на каком-либо агрегаторе, который мы бы назвали. Мы проверили каталог при всех вариантах написания префикса поставщика и названия модели — Kolibri там нет. Так что если вы хотите его вызвать, вы скачиваете 78 ГБ и сами запускаете эндпоинт vLLM. Мы лучше скажем это прямо, чем дадим понять, что обслуживаем его.
• Отсутствует мультимодальный ввод. Текст на входе, текст на выходе, два языка. Это тот компромисс, на который пошла лаборатория ради глубины в ущерб широте, и для развёртывания в сфере обработки документов он, вероятно, правильный, но это реальная граница.
Если сегодня вам действительно нужна небольшая модель смеси экспертов, которую можно вызывать, не покупая две видеокарты, то уровень Gemma 4 MoE — это самое близкое, что уже доступно на маршрутизируемой конечной точке: $0,06 за миллион входных токенов и $0,33 за миллион выходных в варианте 26B-A4B при окне в 262 144 токена. Для тех, кто сопоставляет с этим самостоятельно развёрнутое суверенное решение на 78B, полезное сравнение — не строки бенчмарков, а 78 ГБ видеопамяти и разговор с закупщиками против статьи расходов за токены.OrcaRouter маршрутизирует этот уровень через один ключ, совместимый с OpenAI, передавая прейскурантную цену провайдера без каких-либо наценок, что является дешёвым способом выяснить, оправдывает ли рабочая нагрузка владение собственным оборудованием.
Сам Kolibri — более интересный артефакт. Немецко-английская модель с 78 миллиардами параметров под лицензией Apache 2.0, у которой рядом с весами опубликованы конвейер данных, метод токенизации, показатель энергопотребления и история трёхмесячных итераций, — это релиз иного рода, чем обычная выкладка весов: раскрытие информации здесь часть продукта, а не блог-пост о нём. Выдержит ли утверждение о Парето проверку — теперь вопрос для людей с двумя H100 и секундомером, и ответ не придёт ни от кого из тех, кто писал карточку модели.
