Титульная карточка hero с надписью «Kolibri vs Intern-Decision 4B» крупным жирным шрифтом, а под ней — одна строка меньшего размера: «сгенерированный текст в сопоставлении с калиброванным распределением вероятностей»; две маленькие плоские линейные иконки рядом друг с другом — колибри слева и небольшой график в виде колоколообразной кривой справа, разделённые тонкой вертикальной линией, на белом фоне с мягкими синими и голубыми градиентными акцентами и логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Kolibri против Intern-Decision 4B: один пишет документы, другой отказывается писать что-либо вообще

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самое полезное, что можно заметить о Kolibri и Intern-Decision-4B, — это то, что они не являются объектами одного и того же типа, и рассматривать это как сравнение модели с моделью было бы категориальной ошибкой. Kolibri — это языковая модель на основе смеси экспертов от Aleph Alpha с 78,1 млрд параметров, выпущенная 3 октября 2026 года, которая активирует 3,46 млрд параметров на токен и пишет текст на немецком и английском языках. Intern-Decision-4B — это мультимодальная модель структурированных решений с 4,54 млрд параметров от команды InternLM, загруженная на Hugging Face 26 сентября 2026 года, в карточке которой прямо сказано, что она «вообще не вызывает generate() и не сэмплирует свободный текст». Одна создаёт прозу. Другая выдаёт распределение вероятностей по предоставленным вами вариантам за один прямой проход и не умеет писать предложения. Они становятся конкурентами лишь в одной узкой ситуации, и знание того, что это за ситуация, оказывается самым полезным в обоих релизах.

Два релиза, два совершенно разных лаконичных утверждения

Карточка Kolibri — это спецификация большой разрежённой языковой модели: 50 слоёв, каждый — смесь экспертов, 384 эксперта на слой, один общий и шесть маршрутизируемых, нативный контекст 262 144 токена, подтверждённый до 1 048 576, четыре уровня интенсивности рассуждений, вызов инструментов в стиле Hermes с поставляемым парсером vLLM, веса FP8 в блоках 128×128 и условия Apache 2.0. Её обучение прошло на 20 триллионах токенов на 768 NVIDIA B200 за 21 день — 392 000 GPU-часов при заявленных 6,4×10²³ FLOPs и оценке 9,5×10² МВт·ч с учётом накладных расходов дата-центра, исключая supervised fine-tuning и reinforcement learning. Минимальная конфигурация для обслуживания в карточке — две карты A100 80 GB, две H100 SXM5, одна H200, одна B200 или одна B300, а занимаемый объём FP8 — около 78 ГБ. Это серьёзная инфраструктура, и она отвечает на вопросы, генерируя текст.

Intern-Decision-4B — объект противоположного типа, и карточка на удивление прямо об этом говорит. Это дообученная версия Qwen3.5-4B, в которой визуальный блок и проектор заморожены и обучается только языковой остов. Вы подаёте ему состояние, схему именованных вопросов и, опционально, до восьми изображений, и он возвращает распределение по вариантам ответов для всех вопросов сразу. Механизм необычен, и его стоит описать точно: варианты отображаются в однотокенные символы, охватывающие A–Z, a–z и 0–9 — 62 кандидата, то есть максимум 62 варианта на вопрос — промпт рендерится с одним плейсхолдером на поле, и модель считывает логиты в позиции непосредственно перед каждым плейсхолдером. Softmax выполняется только по логитам разрешённых символов этого поля, температура, специфичная для данного чекпоинта, калибрует результат, а символы отображаются обратно в исходные значения ваших вариантов в виде типизированного JSON. Здесь нет цикла декодирования, нет сэмплирования и нет связного текста.

• Вывод — Kolibri: свободно генерируемый немецкий или английский текст, вызовы инструментов, трассировки рассуждений. Intern-Decision-4B: типизированные ответы JSON с вероятностью для каждого варианта.

• Параметры — Kolibri: 78 103 074 560 всего, 3 457 573 120 активных. Intern-Decision-4B: 4,54 млрд, распределённых по четырём shard-файлам safetensors в bfloat16, с замороженным vision tower.

• Ввод — Kolibri: только текст. Intern-Decision-4B: текст плюс до восьми изображений.

• Ёмкость вопросов — Intern-Decision-4B: до 62 вариантов на поле, за один прямой проход, с типами вопросов «choice», «score» и «noul» (да/нет). Kolibri: в принципе без ограничений, на практике — по одному токену за раз.

• Язык — Kolibri: немецкий и английский по построению. Intern-Decision-4B: то, что несёт Qwen3.5-4B, со всеми опубликованными наборами тестов для оценки на английском языке.

• Задержка — Intern-Decision-4B: 44,16 мс — среднее, 44,16 мс — медиана и 44,60 мс — P95 на запрос на одной RTX 4090, согласно его собственному измерению. Kolibri: ни одного опубликованного показателя на запрос вообще.

• Лицензия — обе под Apache 2.0; Intern-Decision-4B поставляется с сохранённым файлом лицензии Qwen.

A two-column comparison scoreboard titled 'Kolibri vs Intern-Decision 4B'. Left column Kolibri: Output freely generated text, Parameters 78.1B MoE / 3.46B active, Input text only, Context 262,144 native / 1M validated, Latency none published, Licence Apache 2.0. Right column Intern-Decision 4B: Output typed JSON with a probability per option, Parameters 4.54B bfloat16 with a frozen vision tower, Input text plus up to eight images, Options up to 62 per field in one forward pass, Latency 44.16 ms mean on one RTX 4090, Licence Apache 2.0. A footer line reads 'Kolibri figures vendor-reported; Intern-Decision 4B figures per its model card.' with the OrcaRouter logo in the bottom-right corner.

Почему вообще существует 4B-скоринг?

Аргумент в пользу Intern-Decision-4B не в том, что она мала. А в том, что запрашивать у большой генеративной модели вероятность — не то же самое, что измерять её, и эта разница измерима.

Собственная таблица бенчмарков в карточке модели приводит этот довод с необычно высокой степенью самораскрытия. По семи наборам тестов на точность Intern-Decision-4B в среднем набирает 90,02 — против 88,74 у самой сильной базовой модели, с которой она себя сравнивает, модели под названием Jev. Но точность — это неинтересная половина. Таблица также приводит оценку Бриера и ожидаемую ошибку калибровки, и там картина более строгая. У 4B оценка Бриера — 0,347, а ECE — 0,065, против 0,358 и 0,095 у Jev. Именно на младших собратьях история с калибровкой становится по-настоящему информативной. Intern-Decision-2B набирает в среднем 84,68, заметно опережая 0.8B с 79,38 — и всё же её ECE 0,100 хуже, чем 0,066 у 0.8B, и хуже, чем 0,065 у 4B, при оценке Бриера 0,437 против 0,530 у 0.8B. Самая точная из двух маленьких моделей оказывается наименее честной в отношении собственной уверенности. Если вы предполагали, что калибровка улучшается с точностью или с числом параметров, эта таблица — контрпример по обоим пунктам.

Вторая, отдельная диагностика охватывает 96 случаев, построенных на точных эталонных распределениях, а не на выборочных жёстких метках — случайные выборки, составные события, условная история, вероятностные головоломки. Ошибка модели 4B на этом пилотном наборе снизилась с 0,628 до 0,550 по указанной метрике, тогда как у модели для сравнения показатель был 0,595. В карточке прямо указано, что этот пилот не использовался для подгонки или выбора опубликованной температуры; температура модели 4B, равная 1,992418, подбиралась отдельно на калибровочном наборе. Команда InternLM также выложила сам бенчмарк в репозиторий GitHub — детерминированный генератор, эталоны и офлайн-скоринг, — а это значит, что заявление о калибровке относится к редкому типу утверждений, которые третья сторона действительно может воспроизвести, а не принимать на веру.

Ничто в релизе Kolibri не предлагает эквивалента. Его сравнительная таблица приводит точность выполнения задач для четырнадцати моделей на одном фирменном тестовом стенде, а точность — это то, что можно измерить у генеративной модели. Нигде в материалах нет ни показателя калибровки, ни Brier или ECE, и нет способа запросить у неё «вероятность того, что этот пункт договора имеет исковую силу», который не сводился бы к сэмплированию предложения и его прочтению.

Тот единственный шов, где они на самом деле встречаются

Поставьте оба рядом в реальном конвейере, и их очертания станут очевидны. Немецкому документообороту нужны обе половины, и ни один из инструментов не закрывает половину другого.

Kolibri — это та половина, что читает и пишет. Команда с немецкими контрактами или технической документацией получает нативное окно в 262 144 токена, FP8 KV-кэш, двуязычный токенизатор, который, по данным Aleph Alpha, даёт в среднем 4,90 байта на токен на немецкоязычных веб-текстах, и вызов инструментов Hermes — то есть модель, способную суммировать документ, составить ответ и управлять циклом вызова инструментов. Чего она не может, так это сообщить о своей уверенности так, чтобы это можно было проверить, потому что всё, что она выдаёт, — это строка, полученная сэмплированием.

Intern-Decision-4B — это та половина, которая принимает решение. Получив страницу немецкого текста и фиксированный набор вариантов, она возвращает калиброванное распределение за 44 миллисекунды на одной потребительской GPU, без этапа генерации и, следовательно, вообще без дисперсии выборки. Чего она не может — так это создать сам немецкий текст, а её опубликованные наборы для оценки — на английском; её поведение на немецком унаследовано от базовой модели Qwen3.5-4B, а не натренировано, что является реальным ограничением для развёртывания на немецком языке, и никто его не оценивал.

Итак, честный инженерный ответ для регулируемого рабочего процесса на немецком языке таков: это две стадии одного конвейера, а не два кандидата на один слот. Практический вопрос — где работает каждый из них. Kolibri требует двух H100 или одного B200 и около 78 ГБ. Intern-Decision-4B требует одной RTX 4090 и выполняет запрос менее чем за 45 миллисекунд. Асимметрия затрат на оборудование составляет примерно два порядка, и она указывает на архитектуру, в которой небольшой скорер работает непрерывно на каждом случае, а большой генератор вызывается только тогда, когда случаю действительно нужен связный текст. Это более дешёвая и более удобная для аудита схема, чем пропускать каждый случай через 78B-модель, чтобы получить ответ, который затем приходится интерпретировать.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the card header, the description of it as a multimodal structured decision model fine-tuned from Qwen3.5-4B that returns an answer distribution in one forward pass, and the numbered 'How inference works' steps mapping each question's options to single-token symbols.

Реальность хостинга для обоих и то, для чего нужен этот слой

Ни одна из моделей не доступна в виде хостируемого API, и мы это проверили, а не предположили. У Intern-Decision-4B нет вендорского эндпоинта; релиз — это веса, репозиторий на GitHub и Hugging Face Space. Его показатели скачиваний и лайков изменились с середины недели, что говорит о том, что люди начинают им пользоваться, но всё ещё нет платного вызываемого маршрута, который мы могли бы назвать.

У Kolibri также нет SKU для API Aleph Alpha — релиз включает веса, технический отчёт и образ контейнера по адресу ghcr.io/aleph-alpha/aleph-alpha-inference. И в OrcaRouter его нет: мы проверили каталог при всех вариантах написания префикса вендора и названия модели, и в ответ возвращается «не найдено»; мы предпочли бы сказать это прямо, а не подразумевать обратное.

Что здесь требуется от слоя маршрутизации — это не доступ к этим двум моделям, а экономика решения о том, стоит ли покупать оборудование для любой из них. Честная проверка перед принятием решения для генеративной части — прогнать рабочую нагрузку через небольшой уровень mixture-of-experts, который уже маршрутизируется, — вариант Gemma 4 26B-A4B по цене $0.03 за миллион входных токенов и $0.33 за миллион выходных, с окном в 262 144 токена и поддержкой текстового, графического и аудиовхода, — на одном ключе, совместимом с OpenAI, по прейскурантной цене провайдера без каких-либо надбавок, и посмотреть, действительно ли рабочей нагрузке с немецкими документами нужны 78 миллиардов параметров до того, как будут заказаны GPU. У части, отвечающей за принятие решений, такого короткого пути нет, потому что поведение с калиброванным распределением — это сама суть модели, и ни один маршрутизируемый уровень этого не делает. Но в этом и заключается вывод: он говорит вам, что 4B-скорер — это та часть, которую вы действительно будете разворачивать у себя, а генератор — та часть, которую стоит перепроверить на чём-то, что можно арендовать уже сегодня днём.

Что бы это уладило

Два измерения, и ни одного из них пока не существует.

Первый — Intern-Decision-4B на немецком входе. Все опубликованные наборы тестов — на английском, а модель представляет собой дообученную версию многоязычной базовой модели, поэтому её немецкая калибровка неизвестна — а калибровка как раз относится к тем свойствам, которые не переносятся бесплатно между языками. Немецкая версия пилота по распределению из 96 случаев стала бы самым информативным артефактом, который кто-либо мог бы опубликовать об этой модели.

Второе — это стоимость одного решения у Kolibri. Его экономика обслуживания — это фронт Парето качества в зависимости от декодированных токенов в секунду на токен, и для Kolibri нет страницы Artificial Analysis, а также нет стороннего воспроизведения испытательного стенда. Пока кто-нибудь не запустит его, «78 миллиардов параметров» — это спецификация, а не стоимость, и аргумент в пользу того, чтобы держать перед ним 4-миллисекундный скорер, остаётся доводом из области проектирования, а не измеренным.

А до тех пор эту пару следует воспринимать не как состязание. Intern-Decision-4B — более технически интересный релиз из двух: структурированный вывод с учётом калибровки — это возможность, которую почти не предлагает ни одна генеративная модель, а его карточка позволяет проверить это утверждение. Kolibri — более значимый по последствиям релиз, потому что европейская лаборатория, выпускающая модель под Apache 2.0 на 78 миллиардов параметров с опубликованным вместе с ней конвейером данных, — это событие в цепочке поставок, а не событие в мире моделей. Ни один из них не заменяет другой. Командам, которым нужны оба, следует планировать оба и соответствующим образом подбирать оборудование, а обвязка вокруг них — это то, на что на самом деле уходят инженерные усилия.

A screenshot of the InternLM 'Intern Large Models' organisation page on Hugging Face, showing the organisation header, its stated affiliation with Shanghai AI Laboratory, and a recent-activity feed listing models published within the last hour.
© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube