Сгенерированная hero-карточка для Kolibri vs Qwen 3.8 с заголовком «Kolibri vs Qwen 3.8» и подзаголовком «суверенный немецкий сервинг против открытого китайского семейства»: значок колибри слева и контур облака справа по обе стороны от тонкого разделителя. Логотип OrcaRouter расположен в полосе под графикой.
Guides & Insights

Kolibri против Qwen 3.8: немецкая модель проигрывает на своём собственном поле, и в этом-то и суть

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Начнём с фразы, которую большинство публикаций о запуске Kolibri обошли молчанием. В таблице бенчмарков, которую Aleph Alpha опубликовала вместе со своей моделью 3 октября 2026 года, модель, с которой её сравнивают чаще всего, — не европейский конкурент и не американский. Это Qwen3.8 27B, открытая версия того поколения от самого вендора, выпущенная 13 августа 2026 года, — и по собственным цифрам Aleph Alpha она побеждает. Qwen3.8 27B набирает 80,2 по среднему английскому показателю и 79,9 по среднему немецкому в том же наборе тестов, где Kolibri получает 75,5 и 70,8. Она лидирует в GPQA Diamond — 89,2 против 84,3. Лидирует в LiveCodeBench v6 — 93,8 против 85,9. Лидирует в SWE-Bench Verified — 72,6 против 66,4, а также в обоих бенчмарках на длинный контекст: 76,9 против 64,5 в LongBench Pro и 81,3 против 68,3 в AA-LCR. Плотная китайская модель на 27 миллиардов параметров, протестированная немецкой лабораторией, обходит флагман этой же лаборатории на 78 миллиардов параметров почти по всей её собственной таблице. Это не скандал. Это самый полезный факт в этом релизе, потому что он заставляет задаться вопросом, для чего Kolibri на самом деле нужен.

Одно уточнение, прежде чем сравнение пойдёт дальше, потому что «Qwen 3.8» обозначает семейство, а не модель, и различия здесь важны. Qwen3.8-Max — это облачный флагман Alibaba, доступный с 3 августа 2026 года, с контекстным окном в 1M токенов по цене $2,00 за миллион входных токенов и $6,00 за выходные. Qwen3.8-27B — это уровень с открытыми весами, выпущенный 13 августа 2026 года с окном в 262 144 токена. Qwen3.8-Flash — это уровень для больших объёмов, выпущенный 26 августа 2026 года с окном в 1M токенов и значительно более низкими ценами. А обычный Qwen3.8 — анонсированный 19 июля 2026 года как открытый флагман с 2,4 триллиона параметров — не выпущен; он существует в виде страницы отслеживания в каталоге и анонса. Всё нижесказанное относится к той версии, веса которой можно скачать и запустить, а именно к 27B.

Где Kolibri действительно выигрывает — это можно прочитать по той же таблице

Строки, где Kolibri опережает Qwen3.8 27B, разбросаны не случайно. Они группируются, и эта группировка — и есть продукт.

• Воздержание — на RGB Negative Kolibri набирает 85,6 против 70,6. Когда контекст не содержит ответа, Kolibri говорит об этом гораздо чаще.

• Вызов инструментов в условиях ограничений — в τ²-bench telecom: 94,7 против 82,5; в отраслевом наборе для автомобильных поставщиков: 99,0 против 97,3.

• Очень длинный контекст — на SealQA без дистракторов при объёме свыше 24k токенов: 100,0 против 94,4.

• Экономика обслуживания немецкого языка — двуязычный токенизатор с 4,90 средними байтами на токен на немецком веб-тексте против 4,17 у семейства Qwen3.5–3.8 по собственному измерению Aleph Alpha. Меньше токенов на немецкий документ — это прямое снижение стоимости инференса, которое видно в счёте и ни в одной строке бенчмарка.

Три из этих четырёх связаны с поведением, а не с возможностями. Воздержание от ответа, вызов инструментов с ограничениями и обоснованное извлечение из длинного контекста — это то, что нужно от модели, которая читает собственные материалы вашей организации и, как ожидается, признаёт, когда материалы не отвечают на вопрос. Aleph Alpha построила весь релиз вокруг этой ставки, и таблица показывает, что ставка сыграла.

Generated two-column scoreboard for Kolibri and Qwen3.8 27B. Left column Kolibri: English average 75.5, German average 70.8, abstention 85.6, GPQA Diamond 84.3, SWE-Bench Verified 66.4, licence Apache 2.0. Right column Qwen3.8 27B: English average 80.2, German average 79.9, abstention 70.6, GPQA Diamond 89.2, SWE-Bench Verified 72.6, licence Apache 2.0. The footer reads 'Both columns from Aleph Alpha's published table, vendor harness; no independent reproduction.'

Строки, в которых побеждает Qwen3.8 27B, касаются широты охвата: знания на обоих языках, научные вопросы уровня выпускника, спортивное программирование, программная инженерия на уровне репозиториев, понимание длинных документов. Если вам нужна сильная универсальная модель по низкой цене за токен с открытыми весами, Qwen3.8 27B — более подходящая модель, и таблица говорит об этом чернилами самого вендора.

Такая трактовка подтверждается, а у Kolibri — нет. Artificial Analysis независимо измерила Qwen3.8 27B в её конфигурации рассуждений Xhigh и сообщает об Intelligence Index 34 на 1-м месте среди 142 моделей в этом сравнении, 45,4 выходных токена в секунду, контексте на 256 000 токенов и лицензии Apache 2.0. Их примечание нелестно знакомым образом — очень многословна: 200 миллионов токенов, сгенерированных во время оценки индекса, против медианных 82 миллионов, и медлительна — но сама оценка представляет собой стороннее измерение оппонента. У Kolibri вообще нет страницы на Artificial Analysis. Таким образом, самая сильная модель в этом сравнении была независимо проверена, а более слабая — это слова производителя, что является обратным тому, как обычно преподносят европейский флагман первого поколения.

Два вида утверждений о цепочке поставок, направленных в противоположные стороны

Оба этих релиза — это аргументы о том, откуда происходит модель, и эти аргументы зеркально отражают друг друга.

Кейс Aleph Alpha — это происхождение как свойство. Kolibri была обучена немецкими командами на инфраструктуре в Германии и Финляндии, в соответствии с законодательством ЕС и Германии. Карточка раскрывает состав предобучения — 20 триллионов токенов, примерно 62,5 % английского, 23,9 % немецкого и 13,6 % кода — бюджеты среднего этапа обучения и длинного контекста, точный объём вычислений: 768 NVIDIA B200 на 96 узлах HGX в течение 21 дня, и оценочно 9,5×10² МВт·ч энергии, включая накладные расходы центров обработки данных. В ней метод обучения описан вплоть до слоя: 50-слойный трансформер со смесью экспертов с разбиением внимания в соотношении 4:1 между скользящим окном и групповым запросным вниманием, Muon и Exact Quantile Balancing по 384 экспертам, из которых 1 общий и 6 маршрутизируемых. Двенадцать тысяч слов раскрытий, приложенных к загрузке объёмом 78 ГБ, и заявленная позиция подписанта по Кодексу практики ЕС для ИИ общего назначения.

Случай Alibaba иного рода: не «мы можем объяснить каждое решение», а «вот веса, берите их». Открытые веса под лицензией Apache такого масштаба и качества, что Qwen стал фактическим выбором по умолчанию во всём мире, словарь на 248 077 токенов, охватывающий более сотни языков, и экосистема обслуживания, которая так долго настраивалась вокруг этих чекпоинтов, что почти каждый стек инференса поддерживает их из коробки. Аргумент о суверенитете здесь касается доступности: ни один поставщик не может отозвать модель, потому что файл уже у вас.

Оба утверждения честны, и они отвечают на разные опасения. Покупателя из государственного сектора в Баден-Вюртемберге беспокоят юрисдикция и возможность аудита, и Kolibri адресован именно этому беспокойству. Исследовательскую группу в Найроби или Сан-Паулу беспокоит, что доступ к модели закрыт кредитной картой в валюте, которой они не могут заплатить, и открытые веса Qwen адресованы этому. Нечестно делать вид, будто любое из этих утверждений — сравнение возможностей, потому что таблица возможностей уже дала свой ответ.

Screenshot of the Artificial Analysis model page for Qwen3.8 27B (Xhigh), marked 'Open weights model, Released August 2026', showing an Intelligence Index of 34 against a median of 8, a #1/142 intelligence rank, a #55/142 speed rank at 45 tokens per second against a 91-token median, input pricing $0.50 per million tokens against a $0.03 median and output pricing $3.00 against a $0.15 median, an average cost of $1.01 per task on the Intelligence Index, a verbosity rank of #22/142 having generated 200M tokens during the index evaluation against a median of 82M, a 256k-token context window, and the Apache 2.0 licence badge.

Лицензионный пробел реален, но уже, чем кажется

Kolibri распространяется под лицензией Apache 2.0. Qwen3.8 27B — это открытые веса с лицензией Apache. У обоих нет приложения о допустимом использовании, нет порога по числу ежемесячно активных пользователей и нет отдельных коммерческих условий — что выделяет их в небольшую группу и означает, что ни один из них не требует юридической проверки перед коммерческим использованием.

Их разделяет всё, что следует за лицензией. Kolibri поставляется с плагином vLLM и пакетом парсера от вендора, образом контейнера, четырьмя уровнями усилия рассуждения, настраиваемыми через шаблон чата, явным поведением воздержания от ответа и рекомендуемой конфигурацией сэмплирования. Qwen3.8 27B поставляется в виде весов, которые Transformers, vLLM и SGLang уже умеют обслуживать, с форматом вызова инструментов, к которому более широкая экосистема имела месяцы, чтобы приспособиться.

Аппаратное обеспечение для развёртывания различается в том же ключе. Веса Kolibri в FP8 занимают ~78 ГБ, а минимальные требования — две карты A100 80 ГБ, два H100 SXM5, один H200, один B200 или один B300. Qwen3.8 27B в bfloat16 — это примерно 54 ГБ весов, то есть один 80-гигабайтный ускоритель при полной точности или квантованная сборка на существенно меньшем объёме. Немецкая модель требует больше аппаратного обеспечения и даёт меньше бенчмарка взамен. Это плохой обмен только в том случае, если вы покупали бенчмарк.

Что ценники сообщают вам, а что — нет

У Kolibri нет цены, потому что Aleph Alpha не продаёт инференс для него. Релиз — это веса, технический отчёт и карточка; хостингового SKU нет. Любая цифра затрат для Kolibri — это расчёт амортизации оборудования, который вы делаете сами.

Qwen3.8 публично предлагается по трём тарифам, и средний из них — тот, что имеет значение для команды, сравнивающей собственный хостинг с арендой.

• Qwen3.8-Max — $2.00 за миллион входных токенов и $6.00 за выходные, контекст 1 млн токенов, чтение из кэша — $0.25, выпущен 3 августа 2026 г.

• Qwen3.8-27B — $0,33 за ввод и $2,40 за вывод, контекст 262 144 токена, выпущена 13 августа 2026 года. Это открытые веса, поэтому эта цена — то, что вы заплатите, если предпочтёте не запускать их самостоятельно.

• Qwen3.8-Flash — $0.15 за вход и $0.47 за выход при окне в 1M токенов, выпущена 26 августа 2026 года.

Это отпускные цены провайдеров на OrcaRouter, передаваемые как есть, без каких-либо наценок за токен, что является полезным свойством, когда вопрос в том, окупается ли развёртывание на собственном оборудовании: можно измерить свой реальный объём токенов на хостинговых тарифах, прежде чем вкладываться в железо. Мы не добавляем маржу, поэтому снижение цены поставщиком вступает в силу у нас в тот же день. Все три тарифа Qwen3.8 уже сегодня доступны для маршрутизации через один ключ, совместимый с OpenAI, с автоматическим переключением между провайдерами при сбое, а у грядущей Qwen3.8 с 2,4 триллиона параметров есть страница в каталоге, которая ждёт весов, а не заглушка, делающая вид, что обслуживает их.

Kolibri не маршрутизируется. Мы проверили каталог при всех вариантах написания вендора и модели — и его там нет, так что единственный способ вызвать Kolibri — загрузка объёмом 78 ГБ. Если вы хотите узнать, во сколько обойдётся вашей рабочей нагрузке немецкая модель, ответ — это стойка и человек, способный запустить vLLM, и сейчас ни одна третья сторона не может предложить вам ничего другого.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the 1M-token context badge, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, a p50 time-to-first-token of 2.35 seconds, the attribution 'Public benchmarks by Qwen - 2026-08-03', the description as Alibaba's newest flagship in the Qwen line positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the pricing tiles $2.00 and $6.00, and the OpenAI-compatible and Anthropic-compatible base URLs at https://api.orcarouter.ai/v1 and https://api.orcarouter.ai.

Кому что покупать

Решение зависит не от качества, поскольку этот вопрос был решён собственной таблицей поставщика в пользу Alibaba. Оно зависит от того, от какого риска вы покупаете страховку.

• Выбирайте Kolibri, если определяющим ограничением является юрисдикция, документация о происхождении данных или возможность аудита — если вам нужно быть в состоянии ответить, откуда взялись данные для обучения, где выполнялись вычисления и по какому законодательству, а также если рабочая нагрузка — это немецкие и английские документы, обрабатываемые внутри вашего собственного периметра. За это вы платите надбавку за возможности, и эта надбавка видна в таблице выше.

• Выбирайте Qwen3.8 27B, если определяющим ограничением является соотношение возможностей и цены, широта языкового покрытия или поддержка экосистемы. По собственной оценке Aleph Alpha это более сильная модель, она лицензирована по Apache, работает на одном ускорителе, а облачные тарифы начинаются с $0,33 за миллион входных токенов, если вы вообще предпочли бы её не запускать.

• Рассмотрите оба варианта в рамках одной архитектуры, если рабочая нагрузка имеет регулируемое ядро и общую периферию. Документы, которые не могут покинуть здание, направляются на самостоятельно размещённый эндпоинт Kolibri; задачи по суммаризации, переводу и работе с кодом идут на маршрутизируемый уровень Qwen3.8 по цене в треть цента за тысячу токенов. Один ключ API, одно правило маршрутизации, списочные цены провайдера передаются без наценки, а отказоустойчивость обрабатывается за вас — это гораздо более полезное решение, чем выбрать один из этих двух и делать вид, что другого не существует.