
Kolibri против Intern-Decision 4B: один пишет документы, другой отказывается писать что-либо вообще
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 217 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Самое полезное, что можно заметить о Kolibri и Intern-Decision-4B, — это то, что они не являются объектами одного и того же типа, и рассматривать это как сравнение модели с моделью было бы категориальной ошибкой. Kolibri — это языковая модель на основе смеси экспертов от Aleph Alpha с 78,1 млрд параметров, выпущенная 3 октября 2026 года, которая активирует 3,46 млрд параметров на токен и пишет текст на немецком и английском языках. Intern-Decision-4B — это мультимодальная модель структурированных решений с 4,54 млрд параметров от команды InternLM, загруженная на Hugging Face 26 сентября 2026 года, в карточке которой прямо сказано, что она «вообще не вызывает generate() и не сэмплирует свободный текст». Одна создаёт прозу. Другая выдаёт распределение вероятностей по предоставленным вами вариантам за один прямой проход и не умеет писать предложения. Они становятся конкурентами лишь в одной узкой ситуации, и знание того, что это за ситуация, оказывается самым полезным в обоих релизах.
Два релиза, два совершенно разных лаконичных утверждения
Карточка Kolibri — это спецификация большой разрежённой языковой модели: 50 слоёв, каждый — смесь экспертов, 384 эксперта на слой, один общий и шесть маршрутизируемых, нативный контекст 262 144 токена, подтверждённый до 1 048 576, четыре уровня интенсивности рассуждений, вызов инструментов в стиле Hermes с поставляемым парсером vLLM, веса FP8 в блоках 128×128 и условия Apache 2.0. Её обучение прошло на 20 триллионах токенов на 768 NVIDIA B200 за 21 день — 392 000 GPU-часов при заявленных 6,4×10²³ FLOPs и оценке 9,5×10² МВт·ч с учётом накладных расходов дата-центра, исключая supervised fine-tuning и reinforcement learning. Минимальная конфигурация для обслуживания в карточке — две карты A100 80 GB, две H100 SXM5, одна H200, одна B200 или одна B300, а занимаемый объём FP8 — около 78 ГБ. Это серьёзная инфраструктура, и она отвечает на вопросы, генерируя текст.
Intern-Decision-4B — объект противоположного типа, и карточка на удивление прямо об этом говорит. Это дообученная версия Qwen3.5-4B, в которой визуальный блок и проектор заморожены и обучается только языковой остов. Вы подаёте ему состояние, схему именованных вопросов и, опционально, до восьми изображений, и он возвращает распределение по вариантам ответов для всех вопросов сразу. Механизм необычен, и его стоит описать точно: варианты отображаются в однотокенные символы, охватывающие A–Z, a–z и 0–9 — 62 кандидата, то есть максимум 62 варианта на вопрос — промпт рендерится с одним плейсхолдером на поле, и модель считывает логиты в позиции непосредственно перед каждым плейсхолдером. Softmax выполняется только по логитам разрешённых символов этого поля, температура, специфичная для данного чекпоинта, калибрует результат, а символы отображаются обратно в исходные значения ваших вариантов в виде типизированного JSON. Здесь нет цикла декодирования, нет сэмплирования и нет связного текста.
• Вывод — Kolibri: свободно генерируемый немецкий или английский текст, вызовы инструментов, трассировки рассуждений. Intern-Decision-4B: типизированные ответы JSON с вероятностью для каждого варианта.
• Параметры — Kolibri: 78 103 074 560 всего, 3 457 573 120 активных. Intern-Decision-4B: 4,54 млрд, распределённых по четырём shard-файлам safetensors в bfloat16, с замороженным vision tower.
• Ввод — Kolibri: только текст. Intern-Decision-4B: текст плюс до восьми изображений.
• Ёмкость вопросов — Intern-Decision-4B: до 62 вариантов на поле, за один прямой проход, с типами вопросов «choice», «score» и «noul» (да/нет). Kolibri: в принципе без ограничений, на практике — по одному токену за раз.
• Язык — Kolibri: немецкий и английский по построению. Intern-Decision-4B: то, что несёт Qwen3.5-4B, со всеми опубликованными наборами тестов для оценки на английском языке.
• Задержка — Intern-Decision-4B: 44,16 мс — среднее, 44,16 мс — медиана и 44,60 мс — P95 на запрос на одной RTX 4090, согласно его собственному измерению. Kolibri: ни одного опубликованного показателя на запрос вообще.
• Лицензия — обе под Apache 2.0; Intern-Decision-4B поставляется с сохранённым файлом лицензии Qwen.

Почему вообще существует 4B-скоринг?
Аргумент в пользу Intern-Decision-4B не в том, что она мала. А в том, что запрашивать у большой генеративной модели вероятность — не то же самое, что измерять её, и эта разница измерима.
Собственная таблица бенчмарков в карточке модели приводит этот довод с необычно высокой степенью самораскрытия. По семи наборам тестов на точность Intern-Decision-4B в среднем набирает 90,02 — против 88,74 у самой сильной базовой модели, с которой она себя сравнивает, модели под названием Jev. Но точность — это неинтересная половина. Таблица также приводит оценку Бриера и ожидаемую ошибку калибровки, и там картина более строгая. У 4B оценка Бриера — 0,347, а ECE — 0,065, против 0,358 и 0,095 у Jev. Именно на младших собратьях история с калибровкой становится по-настоящему информативной. Intern-Decision-2B набирает в среднем 84,68, заметно опережая 0.8B с 79,38 — и всё же её ECE 0,100 хуже, чем 0,066 у 0.8B, и хуже, чем 0,065 у 4B, при оценке Бриера 0,437 против 0,530 у 0.8B. Самая точная из двух маленьких моделей оказывается наименее честной в отношении собственной уверенности. Если вы предполагали, что калибровка улучшается с точностью или с числом параметров, эта таблица — контрпример по обоим пунктам.
Вторая, отдельная диагностика охватывает 96 случаев, построенных на точных эталонных распределениях, а не на выборочных жёстких метках — случайные выборки, составные события, условная история, вероятностные головоломки. Ошибка модели 4B на этом пилотном наборе снизилась с 0,628 до 0,550 по указанной метрике, тогда как у модели для сравнения показатель был 0,595. В карточке прямо указано, что этот пилот не использовался для подгонки или выбора опубликованной температуры; температура модели 4B, равная 1,992418, подбиралась отдельно на калибровочном наборе. Команда InternLM также выложила сам бенчмарк в репозиторий GitHub — детерминированный генератор, эталоны и офлайн-скоринг, — а это значит, что заявление о калибровке относится к редкому типу утверждений, которые третья сторона действительно может воспроизвести, а не принимать на веру.
Ничто в релизе Kolibri не предлагает эквивалента. Его сравнительная таблица приводит точность выполнения задач для четырнадцати моделей на одном фирменном тестовом стенде, а точность — это то, что можно измерить у генеративной модели. Нигде в материалах нет ни показателя калибровки, ни Brier или ECE, и нет способа запросить у неё «вероятность того, что этот пункт договора имеет исковую силу», который не сводился бы к сэмплированию предложения и его прочтению.
Тот единственный шов, где они на самом деле встречаются
Поставьте оба рядом в реальном конвейере, и их очертания станут очевидны. Немецкому документообороту нужны обе половины, и ни один из инструментов не закрывает половину другого.
Kolibri — это та половина, что читает и пишет. Команда с немецкими контрактами или технической документацией получает нативное окно в 262 144 токена, FP8 KV-кэш, двуязычный токенизатор, который, по данным Aleph Alpha, даёт в среднем 4,90 байта на токен на немецкоязычных веб-текстах, и вызов инструментов Hermes — то есть модель, способную суммировать документ, составить ответ и управлять циклом вызова инструментов. Чего она не может, так это сообщить о своей уверенности так, чтобы это можно было проверить, потому что всё, что она выдаёт, — это строка, полученная сэмплированием.
Intern-Decision-4B — это та половина, которая принимает решение. Получив страницу немецкого текста и фиксированный набор вариантов, она возвращает калиброванное распределение за 44 миллисекунды на одной потребительской GPU, без этапа генерации и, следовательно, вообще без дисперсии выборки. Чего она не может — так это создать сам немецкий текст, а её опубликованные наборы для оценки — на английском; её поведение на немецком унаследовано от базовой модели Qwen3.5-4B, а не натренировано, что является реальным ограничением для развёртывания на немецком языке, и никто его не оценивал.
Итак, честный инженерный ответ для регулируемого рабочего процесса на немецком языке таков: это две стадии одного конвейера, а не два кандидата на один слот. Практический вопрос — где работает каждый из них. Kolibri требует двух H100 или одного B200 и около 78 ГБ. Intern-Decision-4B требует одной RTX 4090 и выполняет запрос менее чем за 45 миллисекунд. Асимметрия затрат на оборудование составляет примерно два порядка, и она указывает на архитектуру, в которой небольшой скорер работает непрерывно на каждом случае, а большой генератор вызывается только тогда, когда случаю действительно нужен связный текст. Это более дешёвая и более удобная для аудита схема, чем пропускать каждый случай через 78B-модель, чтобы получить ответ, который затем приходится интерпретировать.

Реальность хостинга для обоих и то, для чего нужен этот слой
Ни одна из моделей не доступна в виде хостируемого API, и мы это проверили, а не предположили. У Intern-Decision-4B нет вендорского эндпоинта; релиз — это веса, репозиторий на GitHub и Hugging Face Space. Его показатели скачиваний и лайков изменились с середины недели, что говорит о том, что люди начинают им пользоваться, но всё ещё нет платного вызываемого маршрута, который мы могли бы назвать.
У Kolibri также нет SKU для API Aleph Alpha — релиз включает веса, технический отчёт и образ контейнера по адресу ghcr.io/aleph-alpha/aleph-alpha-inference. И в OrcaRouter его нет: мы проверили каталог при всех вариантах написания префикса вендора и названия модели, и в ответ возвращается «не найдено»; мы предпочли бы сказать это прямо, а не подразумевать обратное.
Что здесь требуется от слоя маршрутизации — это не доступ к этим двум моделям, а экономика решения о том, стоит ли покупать оборудование для любой из них. Честная проверка перед принятием решения для генеративной части — прогнать рабочую нагрузку через небольшой уровень mixture-of-experts, который уже маршрутизируется, — вариант Gemma 4 26B-A4B по цене $0.03 за миллион входных токенов и $0.33 за миллион выходных, с окном в 262 144 токена и поддержкой текстового, графического и аудиовхода, — на одном ключе, совместимом с OpenAI, по прейскурантной цене провайдера без каких-либо надбавок, и посмотреть, действительно ли рабочей нагрузке с немецкими документами нужны 78 миллиардов параметров до того, как будут заказаны GPU. У части, отвечающей за принятие решений, такого короткого пути нет, потому что поведение с калиброванным распределением — это сама суть модели, и ни один маршрутизируемый уровень этого не делает. Но в этом и заключается вывод: он говорит вам, что 4B-скорер — это та часть, которую вы действительно будете разворачивать у себя, а генератор — та часть, которую стоит перепроверить на чём-то, что можно арендовать уже сегодня днём.
Что бы это уладило
Два измерения, и ни одного из них пока не существует.
Первый — Intern-Decision-4B на немецком входе. Все опубликованные наборы тестов — на английском, а модель представляет собой дообученную версию многоязычной базовой модели, поэтому её немецкая калибровка неизвестна — а калибровка как раз относится к тем свойствам, которые не переносятся бесплатно между языками. Немецкая версия пилота по распределению из 96 случаев стала бы самым информативным артефактом, который кто-либо мог бы опубликовать об этой модели.
Второе — это стоимость одного решения у Kolibri. Его экономика обслуживания — это фронт Парето качества в зависимости от декодированных токенов в секунду на токен, и для Kolibri нет страницы Artificial Analysis, а также нет стороннего воспроизведения испытательного стенда. Пока кто-нибудь не запустит его, «78 миллиардов параметров» — это спецификация, а не стоимость, и аргумент в пользу того, чтобы держать перед ним 4-миллисекундный скорер, остаётся доводом из области проектирования, а не измеренным.
А до тех пор эту пару следует воспринимать не как состязание. Intern-Decision-4B — более технически интересный релиз из двух: структурированный вывод с учётом калибровки — это возможность, которую почти не предлагает ни одна генеративная модель, а его карточка позволяет проверить это утверждение. Kolibri — более значимый по последствиям релиз, потому что европейская лаборатория, выпускающая модель под Apache 2.0 на 78 миллиардов параметров с опубликованным вместе с ней конвейером данных, — это событие в цепочке поставок, а не событие в мире моделей. Ни один из них не заменяет другой. Командам, которым нужны оба, следует планировать оба и соответствующим образом подбирать оборудование, а обвязка вокруг них — это то, на что на самом деле уходят инженерные усилия.

