
Liquid AI d1-3B vs Intern-Decision-4B: какой калиброванный решатель вам действительно нужен?
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Две модели с открытыми весами теперь отвечают на вопросы, не написав ничего, и пока вы не поставите их схемы ввода-вывода рядом, они выглядят как одна и та же идея дважды. Liquid AI d1-3B, загруженная на Hugging Face 5 октября 2026 года и анонсированная Liquid два дня спустя, — это мультимодальная модель принятия решений на 3,12 млрд параметров, в карточке которой прямо сказано, что она «не является чат-моделью и не пишет текст». Intern-Decision-4B от InternLM, тихо загруженная в организацию InternLM 26 сентября 2026 года без поста в блоге, твита и страницы запуска, — это модель принятия решений на 4 млрд параметров, дообученная на основе Qwen3.5-4B, которая точно так же возвращает распределение ответов для каждого вопроса за один прямой проход. На поверхности — один и тот же контракт. Различия под капотом — лицензия, которая усложнит вам жизнь, контракт, который может случайно написать текст, и машины, которые никто не сравнивал, — решают, какая из них подходит для вашего стека.
Насколько близки они на самом деле
Первое, с чем нужно разобраться, — насколько это сравнение вообще является ничьей. Обе модели принимают состояние и схему именованных вопросов, обе считывают сигнал из логитов в позиции-заполнителе, а не сэмплируют, обе мультимодальны, и обе сообщают, что ничего не записали. По форме вызова они почти идентичны, а интересные различия кроются в деталях по краям.
• Размер — Liquid AI d1-3B: всего 3,12B, построена на основе LFM2.5-VL-3B от Liquid; Intern-Decision-4B — 4B (около 4,54B по количеству тензоров, указанному в карточке модели), дообучена на основе Qwen3.5-4B
• Типы вопросов — d1-3B и Intern-Decision-4B используют одни и те же три: noul для «да/нет», choice для одного из заданного набора, score для точки на упорядоченной шкале
• Поля ответа — d1-3B возвращает ответ, а также уверенность и вероятности; схема InternLM возвращает распределения и значение уверенности, о котором в карточке модели предупреждается, что это не калиброванная вероятность
• Ограничение ввода — d1-3B: 32 768 токенов контекста; Intern-Dec-4B — потолок в 8 192 токена, который отклоняет более длинные запросы сразу, а не усекает их, при этом изображения учитываются в рамках этого лимита
• Лицензия — d1-3B под Liquid's LFM Open License v1.0, Apache 2.0 со стороны InternLM
• Языки — d1-3B перечисляет 16; в карточке Intern-Decision-4B не указано ни одного
• Интерфейс — d1-3B поставляется как модель, которую вы загружаете и вызываете с trust_remote_code=True; Intern-Decision-4B поставляется как библиотека Python, которую вы устанавливаете с помощью pip install, с одним реализованным бэкендом, а собственное поле model запроса явно не может переключать чекпойнты
• Собственная оценка вендоров — d1-3B 48,57 в публичном сплите Decision Index 0.2.1; Intern-Decision-4B 90,02 в среднем по собственной таблице из семи наборов с оценкой Брайера 0,347 и ожидаемой ошибкой калибровки 0,065
Вот эти два последних числа несопоставимы, и относиться к ним как к табло было бы самой простой ошибкой, которую только можно совершить на этой странице. Они происходят из разных тестовых сред, разных наборов вопросов и разных систем оценки.

Калибровка — это весь продукт, и только один из них открыто подтверждает это в печати.
Модель принятия решений стоит своей задержки только тогда, когда число, которое она возвращает рядом с ответом, что-то означает. В этом и заключается калибровка: заявленная уверенность 0,9 должна оказываться правильной примерно в девяти случаях из десяти, а модель, которая уверена и ошибается, хуже, чем та, которая говорит, что не знает.
Именно InternLM этим и занимается. В карточке InternLM задокументирована подобранная температура 1,99241824, полученная путём минимизации отрицательного логарифмического правдоподобия по 1 728 обозначенным калибровочным случаям, при этом 1 693 отложены для валидации, и напечатана с восемью знаками после запятой, чтобы её можно было воспроизвести. В ней также публикуется пилотное исследование «до и после» на 96 случаях, которое показывает работу механизма, а не просто заявляет о ней: Brier 0,628 и ECE 0,213 до калибровки против 0,550 и 0,089 после. Brier и ECE — это две стандартные меры того, честны ли заявленные вероятности, и величина сдвига здесь велика.
Liquid не публикует ничего аналогичного. В собственной карточке d1-3B приведены бенчмарки, оценивающие точность, — SQuAD 2.0 85.3, Civil Comments 93.0, MASSIVE intent 87.3, PubMedQA 66.0, BoolQ 86.7, XNLI 85.0, PAWS-X 76.9, среднее 77.1 — наряду с его 48.57 по Decision Index, а заявленное преимущество модели — это калиброванные типизированные ответы. Но нет ни строки ECE, ни строки Brier, и не опубликовано значение подобранной температуры.
Эта асимметрия не означает, что потомок Qwen3.5-4B откалиброван лучше, чем 3B-модель, построенная на LFM2.5-VL-3B; она означает, что из этих двух карточек одна даёт вам расчёты, позволяющие воспроизвести утверждение, а другая — только само утверждение. Если ваш конвейер задаёт порог для уверенности — направлять при значении выше 0,8, эскалировать при ниже 0,4 — вы можете проверить сторону InternLM сегодня же вечером, а сторону Liquid — лишь выборочно.
Эта оговорка действует в обе стороны. Оба набора чисел — собственные. Ни одну из моделей не оценивала независимая сторона, а утверждения о калибровке InternLM опираются на собственный пилотный эксперимент InternLM на 96 случаях в сравнении с собственной подгонкой InternLM.
Лицензия, которая запрашивает у вас номер
Intern-Decision-4B распространяется под лицензией Apache 2.0, унаследованной от Qwen3.5-4B, с сохранением уведомлений исходного проекта — коммерческое использование, распространение, дообучение, и нигде в ней нет вопроса о выручке.
d1-3B распространяется под лицензией LFM Open License v1.0 от Liquid, и Раздел 5 — это та часть, которую никто не читает, пока за неё не возьмётся отдел закупок. Коммерческое использование разрешается только при условии, что вы или ваше юридическое лицо остаётесь ниже Порога, определённого в том же документе как годовая выручка в десять миллионов долларов США или более; использование выше этого порога просто не лицензируется. Для некоммерческих организаций и пользователей, занимающихся исследованиями, сделано исключение.
Для отдельного человека или небольшой команды оба бесплатны. Для всего, где есть финансовый отдел, эти два репозитория — разные продукты, а разница — это число, выше которого вы либо находитесь, либо нет.
Хвост таблицы бенчмарков d1-3B — это его настоящее утверждение.
Главная цифра на карточке Liquid — 48,57 по Decision Index 0.2.1, что опережает другие строки с моделями менее 10B в таблице, которая идёт от Winnow-12B с 50,02 до Decider 2B с 28,97. Что делает эту цифру достойной упоминания, так это индекс дискриминации, стоящий под ней. По собственным субпоказателям Decision Index модель d1-3B набирает 74,5 по категории «Инструменты» и 36,3 по категории «Искусство», но лишь 23,8 по категории «Знания» — в сравнении с Decider 35B-A3B, 36B-моделью mixture-of-experts, которая в 12 раз больше её по размеру и набирает 56,5 по «Инструментам», 32,6 по «Искусству» и 31,8 по «Знаниям».

Иными словами, 3B — это не маленькая модель, которая равномерно чуть хуже. Это маленькая модель, которая необычайно сильна в структурированных решениях в стиле инструментов и необычайно слаба в вопросах, требующих знаний о мире, и она превосходит 36B в двух категориях, которые больше всего похожи на задачу, для которой её создавали. Если ваши решения — это «какое из этих пяти названных действий» и «основано ли это на извлечённом фрагменте», разрыв в размере играет меньшую роль, чем вы ожидали бы. Если ваши решения опираются на факты, которыми модель уже должна располагать, ждите, что 23.8 проявится.
У этого аргумента есть вторая версия — со стороны зрения. d1-3B в среднем набирает 74,1 по одиннадцати публичным бенчмаркам для изображений против 73,9 у её собственной базовой модели, а если убрать изображения, те же вопросы набирают 45,1 — значит, в вопросах по изображениям ответы действительно берутся из картинки. Она на одном уровне со своей базовой моделью, а не лучше неё, и строки по отдельным бенчмаркам дают смешанную картину: CV-Bench — 82,1 против 87,6, POPE — 88,5 против 90,1, BLINK — 59,2 против 58,7.
Стоит также отметить паузу в карточке InternLM: её высокий агрегированный показатель обусловлен ориентированными на вопросы задачами, такими как Typed Decision 80.55 и ToolACE 96.45, тогда как Jevbench-Hard находится на уровне 73.87. Там, где схема становится сложной, оценка падает.
Скорость: разрыв не там, где вы его ожидаете
Для d1-3B заявлены 8 мс на один вопрос на RTX 4090 и 9 мс на MI325X, 21 мс на три вопроса с общим состоянием, 16 мс на Jetson AGX Thor, а также пакетная пропускная способность 475 решений в секунду на 4090 и 1 106 на MI325X.
У карты Intern-Decision-4B среднее сквозное время на той же RTX 4090 составляет 44,16 мс, медиана — 44,03 мс, а на уровне P95 — 44,60 мс.
Это выглядит как пятикратный выигрыш, но это не так, потому что эти два числа измеряют разные вещи. Цифры Liquid — это прогретые вызовы модели, по одному запросу за раз, с выбором ядра и компиляцией, оплаченными заранее; в карточке прямо сказано, что один вопрос стоит 16 мс на 4090 без компиляции CUDA-графа, и что первый вызов с новой формой оплачивает компиляцию. 44 мс у InternLM — это время на запрос от начала до конца через библиотеку Python, единственный реализованный бэкенд которой — локальный инференс Hugging Face, так что оно включает и всю окружающую обвязку. Ни одно из чисел не ошибочно. Поставьте оба в один стенд, на одну машину, с одной и той же формой запроса — и разрыв сожмётся до чего-то такого, что вы захотите измерить, а не предполагать.
Что не вызывает сомнений, так это потолок. 8 192 токена — это жёсткий отказ на стороне InternLM, а токены изображений расходуются из того же бюджета, поэтому длинный документ плюс скриншот — это запрос, который возвращается отклонённым, а не усечённым. d1-3B даёт вам 32 768 токенов для работы. Если ваши состояния — это тикеты и короткие обмены, этот разрыв никогда не даёт о себе знать. Если они размером со страницу, он решает вопрос раньше, чем любой бенчмарк.
Запускайте их как панель, а не как замену
Ответить на конкретный вопрос «да/нет» и ответить на вопрос «какое из шести названных это, и насколько вы уверены» — это разные задачи, а две эти карточки устроены настолько по-разному — у одной жёсткий потолок входных данных и опубликованная калибровочная подгонка, у другой 32K контекста и лучший хвост оценок — что полезное развёртывание для команды, оценивающей обе, часто оказывается не заменой, а панелью: одно и то же состояние предъявляется обеим моделям, а расхождения направляются человеку или более крупной модели.
Ни одна из этих моделей не входит в наш каталог, и это не заявление о доступности: обе — самостоятельно развёрнутые артефакты. Но панель — это ровно та конфигурация, где работу выполняет слой маршрутизации, а не бумажная волокита. OrcaRouter открывает доступ к более чем 200 моделям через один ключ API с прейскурантными ценами провайдеров, передаваемыми без наценки — 0% — поэтому, когда поставщик, которого вы маршрутизируете через нас, снижает цену, ваш счёт меняется в тот же день, а автоматическое переключение при сбоях между провайдерами не даёт панели из двух моделей превратиться в две единые точки отказа. Модели, которые вы маршрутизируете сегодня, — не эти две; это размещённые у провайдеров универсальные модели, которые вы бы заменяли, например Qwen3.5-27B по цене $0.086 за миллион входных токенов и $0.688 за миллион выходных, — именно эту цифру самостоятельно развёрнутая модель на 3B должна превзойти, когда вы посчитаете стоимость GPU.
Что делать на этой неделе
Если ваши решения — это короткие состояния, лицензия должна выдержать проверку вашей компании, и вам нужен самый широкий набор целей сборки — llama.cpp, Ollama, LM Studio, упакованный пакетный путь, который прогоняет 64 состояния за один проход, — то d1-3B — более продуктовый из двух, и его различение инструментов и искусств — сильнейшее, что демонстрирует любая из этих карточек. Если ваши решения охватывают длинные состояния, или вам нужна лицензия без пункта о выручке, или вы хотите воспроизводимую калибровочную подгонку и стенд, где сопутствующие затраты уже учтены, то Intern-Decision-4B — тот, чьи документы вы действительно можете проверить.

Неудобная часть одинакова для обоих: ни одна независимая сторона не запускала ни одну из этих моделей, и не существует калибровочного сравнения, которое не было бы заказано вендором, написавшим карточку. Для класса моделей, вся ценность которого заключается в значении числа рядом с ответом, именно этот пробел стоит закрыть, прежде чем устанавливать порог для чего бы то ни было.
