Титульная карточка с надписью «Kolibri: модель с открытыми весами на 78B из Германии» крупным жирным шрифтом, ниже — одна меньшая строка: «78B всего / 3.46B активных / контекст 1M токенов / Apache 2.0», а также три маленькие плоские линейные иконки в ряд, размещённые на белом фоне с мягкими сине-голубыми градиентными акцентами и логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Первый день Kolibri: Aleph Alpha открыла 78B немецко-английских весов, а реакция опережает доказательства

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Через двадцать четыре часа после того, как Aleph Alpha опубликовала Kolibri, реакция свелась к одной строке, и эту строку стоит разобрать. Гейдельбергская лаборатория 3 октября 2026 года выложила на Hugging Face модель смеси экспертов на 78,1 млрд параметров под лицензией Apache 2.0, объявила об этом тем же утром в собственном новостном разделе и со своего аккаунта, и уже на следующий день сводка, ходившая по ИИ-лентам, гласила: всего 78 млрд параметров, 3,46 млрд активных на токен, открытые веса под Apache 2.0, создана для немецкого и английского языков. Каждое утверждение этого предложения можно проверить по репозиторию. Что в основном осталось несказанным, так это то, какие части релиза — измеренные факты, а какие — заявления авторов о своей собственной модели, которую никто за пределами Гейдельберга не запускал. Этот разрыв и есть история первого дня, и он важнее числа из заголовка.

Начнём с хронологии, потому что немалая часть реакции восприняла это как загадочный тихий релиз, а это было не так. Репозиторий Hugging Face Aleph-Alpha/Kolibri-1 был создан 2 октября 2026 года в 05:54:02 UTC, в карточке модели указана дата релиза 3 октября, а пост в новостном разделе вендора вышел тем же утром в 08:43:53 по Гринвичу — в День германского единства, дату, которую лаборатория явно выбрала намеренно. Собственный аккаунт Aleph Alpha написал об этом в течение нескольких минут. Ни эмбарго для прессы, ни презентационного мероприятия не было — вероятно, отсюда и взялась формулировка «тихий релиз», но пост в новостном разделе вендора, технический отчёт и официальное объявление — это не тихий релиз. Это обычный релиз, который широкая ИИ-пресса просто не осветила в тот день.

Число, которое повторяет реакция

Причина, по которой все цитируют цифру 3,46 млрд активных параметров, заключается в том, что это единственное число в релизе, которое меняет то, чем должен владеть покупатель. Kolibri — это 50-слойный трансформер, в котором каждый слой представляет собой смесь экспертов, с 384 экспертами на слой — один общий и шесть маршрутизируемых — при общем числе параметров 78 103 074 560. На каждый токен он активирует 3 457 573 120 из них — коэффициент разреженности примерно 22,6 к 1. Именно это позволяет обслуживать модель с 78 млрд параметров на паре H100, а не на целой стойке, и это самое значимое утверждение в релизе.

Вокруг него располагаются остальные ключевые показатели, все они взяты из карточки модели, а не из независимого запуска:

• Контекст — обучение на 16 384 токенах, промежуточное дообучение на 65 536, нативное окно — 262 144, валидация — вплоть до 1 048 576. В карточке рекомендуется оставаться на уровне 262 144 или ниже для задач, чувствительных к задержке. Обратите особое внимание: встречающееся в сводках простое «1M контекст» — это проверенный потолок, а не нативное окно.

• Точность — веса FP8 в блоках 128x128 с динамически квантованными активациями, вычисляемые с использованием FP8 KV-кэша; эмбеддинги, LM head, слои нормализации и маршрутизатор MoE остаются в bfloat16.

• Рассуждение — четыре уровня усилий — нет, низкий, средний, высокий — задаются через шаблон чата, с вызовом инструментов в стиле Hermes и парсером vLLM, поставляемым в том же репозитории, что и веса.

• Языки — немецкий и английский, и ничего больше.

• Обучение — 20 триллионов токенов предварительного обучения на отфильтрованном двуязычном корпусе, который примерно на 62,5 % состоит из английского, на 23,9 % — из немецкого и на 13,6 % — из кода, плюс 3,44 триллиона токенов промежуточного обучения и 201 миллиард для расширения длинного контекста.

• Вычисления и энергопотребление — 768 NVIDIA B200 на 96 узлах HGX, 21 день предварительного обучения за 511 часов и 392 000 GPU-часов при заявленных 6,4×10^23 FLOPs, а также оценочно 9,5×10^2 МВт·ч с учётом накладных расходов дата-центра, не включая дообучение с учителем и обучение с подкреплением.

• Лицензия — Apache 2.0. Никаких дополнений о допустимом использовании, никаких порогов по ежемесячно активным пользователям, никаких отдельных коммерческих условий.

Два утверждения, которые никто не проверил

Это та часть первого дня, которую реакция пропустила, и именно она решает, важен ли Kolibri или всего лишь интересен.

Первый — это утверждение об экономике обслуживания. Формулировка Aleph Alpha состоит не в том, что Kolibri — самая сильная из доступных моделей: в собственной сравнительной таблице лаборатории это не так, и лаборатория сама это признаёт. Её формулировка в том, что ни одна из сравниваемых моделей не обеспечивает более высокого качества при той же стоимости обслуживания или того же качества при более низкой стоимости — на границе Парето, где качество сопоставляется с количеством декодированных токенов в секунду на GPU. Это утверждение о пропускной способности на конкретном оборудовании, и это ровно тот тип утверждения, который может разрешить только третья сторона с секундомером и двумя H100. Никто этого не сделал. По состоянию на 4 октября 2026 года для Kolibri нет записи в Artificial Analysis и нет стороннего воспроизведения оценочного стенда.

Второе — это утверждение о токенизаторе. Aleph Alpha обучила двуязычный немецко-английский токенизатор со словарём на 128 000 токенов, используя метод, который она называет UniBPE, и сообщает о среднем показателе 4,90 байта на токен на немецкоязычных веб-текстах, в сравнении с 4,35 у GPT-5, 4,13 у Gemini, 4,17 у Qwen 3.5-3.8, 3,93 у GLM 5.3, 3,72 у DeepSeek V4 и 3,28 у Kimi K3. Все эти цифры — собственные данные вендора, полученные на его собственном корпусе и в сравнении с конкурентами, которых он сам выбрал. Больше текста на токен — это реальный эффект для стоимости инференса, а не заявление о качестве, и если он подтвердится, то будет накапливаться в любой рабочей нагрузке по обработке документов — но это измерение одной лаборатории, а не результат бенчмарка.

Главное — немецкий, и это самая интересная инженерная часть релиза.

Большинство «многоязычных» карточек моделей описывают обучающую смесь, в которую просто случайно входил немецкий. Эта же построена наоборот, и карточка необычно подробно описывает механику.

Небольшие эксперименты с прокси-моделями привели Aleph Alpha к целевой доле примерно в 20% немецких данных в смеси, что для прогона на 20 трлн токенов означало найти 4 трлн немецких токенов. Открытые немецкие датасеты после дедупликации и фильтрации дали 390 млрд — на порядок меньше нужного. Лаборатория закрыла этот разрыв тремя способами: перенастройкой фильтра Common Crawl специально под немецкий язык, что дало 1,3 трлн уникальных органических токенов; перефразированием существующих немецких документов в энциклопедические статьи, вопросно-ответные диалоги и текстовые фрагменты, что дало ещё около триллиона и стало крупнейшим отдельным немецким источником; и переводом, который использовался для модели-предшественника и был намеренно исключён для Kolibri. В итоге немецкий язык стал уникальным пулом объёмом 2,4 трлн токенов, 80% которого было отобрано или сгенерировано внутри компании, и после апсемплинга на него приходилось 21,3% токенов предобучения.

Эта деталь с фильтром — из тех, что всплывают только в лаборатории, которая действительно обучалась на немецком. Стандартный конвейер языковых данных отбрасывает документы со слишком большим количеством длинных слов, но немецкая административная проза регулярно превышает английский порог средней длины слова, поэтому настройки по умолчанию тихо удаляют регистр, на котором пишет государственное управление. Модель, обученная на стандартном английском фильтре, практически не имеет немецкой юридико-административной лексики, и ни один бенчмарк вам об этом не скажет.

Что на самом деле показывает сравнительная таблица

Aleph Alpha опубликовала сравнение посттренинга, охватывающее четырнадцать моделей, и оно полезнее большинства таблиц анонсов, потому что не льстит предмету. На одном и том же харнессе с Kolibri при высоком уровне усилий рассуждения Qwen3.8 27B набирает 80,2 по среднему баллу для английского против 75,5 у Kolibri и 79,9 по среднему баллу для немецкого против 70,8, а также лидирует в GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified и обоих бенчмарках для длинного контекста. Nemotron 3 Super 120B-A12B набирает 73,0 по английскому против 75,5 у Kolibri. Gemma 4 26B-A4B IT набирает 71,9 и 66,3 по двум средним.

Итак, честное резюме этого релиза — не «передовой уровень». Оно состоит в том, что Kolibri находится в середине поля моделей, активирующих от трёх до двенадцати миллиардов параметров на токен, что она явно превосходит гораздо меньшие из них и что она проигрывает плотной 27-миллиардной модели от Alibaba по большинству строк собственной таблицы, активируя при этом примерно одну восьмую параметров. Спасает ли этот разрыв экономика — это и есть утверждение о Парето, а утверждение о Парето не проверено.

A single-column specification scoreboard titled 'Kolibri — the scoreboard', with six rows reading 'Total parameters: 78.1B', 'Active per token: 3.46B', 'Context: 262,144 native, 1M validated', 'Licence: Apache 2.0', 'Independent score: none published' and 'Deployment floor: 2x H100 80GB', and a footer line reading 'All figures vendor-reported from the model card; no independent evaluation yet.' OrcaRouter logo in the bottom-right corner.

Как бы вы это на самом деле назвали сегодня

У вендора нет хостируемого эндпоинта — релиз представляет собой веса плюс технический отчёт, при этом в опубликованных материалах нет SKU API Aleph Alpha для Kolibri. Также для него нет маршрута на OrcaRouter: мы проверяли каталог при всех вариантах написания префикса вендора и имени модели, и Kolibri там нет, поэтому вызвать его сегодня означает скачать примерно 78 ГБ весов FP8 и самостоятельно запустить эндпоинт vLLM из aleph-alpha-inference пакета или опубликованного контейнерного образа.

Это реальное закупочное решение, а не сноска, и именно здесь слой маршрутизации оправдывает своё место даже для модели, которую он сам не предоставляет. Честное сравнение для того, кто взвешивает суверенное развёртывание на 78B на собственных мощностях, — это не строки бенчмарков, а 78 ГБ видеопамяти и разговор о закупке против статьи расходов за токен на оборудовании, принадлежащем кому-то другому. Если в этом месяце вам действительно нужна небольшая модель mixture-of-experts, которую можно вызывать, не покупая два GPU, то тариф Gemma 4 26B-A4B — это ближайшее, что уже доступно на маршрутизируемом эндпоинте: $0.06 за миллион входных токенов и $0.33 за миллион выходных при окне в 262 144 токена, и OrcaRouter направляет этот тариф по одному ключу, совместимому с OpenAI по прайсовой цене провайдера без каких-либо надбавок. Это дешёвый способ выяснить, оправдывает ли эта рабочая нагрузка владение оборудованием, ещё до того, как оборудование прибудет.

A screenshot of Aleph Alpha's newsroom post for Kolibri, showing the vendor headline about a sovereign open-weight model, the 78B parameter figure and the one-million-token context line, and the architecture comparison between Kolibri and Kolibri Origin.

За чем следить и что изменило бы вердикт

Три вещи, в порядке того, насколько они могли бы изменить картину.

Независимое измерение пропускной способности в рекомендуемой производителем конфигурации с двумя H100 подтвердило бы или опровергло утверждение о Парето — единственное утверждение в релизе, которое действительно является новым, а не пересказом спецификации. Независимое воспроизведение средних показателей по немецкому и английскому наборам задач сказало бы вам, настолько ли узок разрыв с Qwen3.8 27B, как предполагает собственная таблица производителя, или ещё уже. А оценка на немецком языке на реальных административных текстах — а не на переведённом общем бенчмарке — показала бы то, для чего на самом деле был предназначен релиз, что в настоящее время не измеряет ни один лидерборд.

Пока что-то из этого не появится, правильная трактовка — та, которую подтверждает сам репозиторий. Kolibri — это настоящий релиз с открытыми весами от европейской лаборатории, в масштабе, какого европейские лаборатории ранее не выпускали, с условиями Apache 2.0, каких не предлагал ни один из действующих игроков, с опубликованным вместе с весами пайплайном данных и с историей итераций двух моделей, которая интереснее, чем цифра из заголовка. Кроме того, на данный момент это модель, самые цитируемые цифры которой приводятся её собственными авторами. Оба этих утверждения верны с первого дня, и именно второе реакция оставила без внимания.

A screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the repository header, the Apache 2.0 licence tag, the stated release date of 3 October 2026, and the parameter, context and FP8 precision lines in the card body.
© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube