
Intern-Decision-4B против Laya: две модели, которые отказываются писать ответ и различаются по размеру в десять раз
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 592 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 187 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
В карточке модели Intern-Decision-4B есть строка, которая гласит «Laya — 57.77». Любой, кто читал документацию самой Laya, поймёт, что означает это число: convaiinnovations/laya — это неавторегрессионная модель принятия решений на 421 миллион параметров, и 57.77 — это средний результат, который она получает при zero-shot использовании на чужом бенчмарке. В её собственной карточке сказано то же самое, только прямее — базовые чекпоинты находятся ниже базовой линии большинства классов на бенчмарке typed-decisions, 0.362 против 0.461. Тем временем internlm/Intern-Decision-4B — это модель на 4,54 миллиарда параметров, созданная ровно для той же задачи: взять состояние и набор типизированных вопросов, выполнить один прямой проход, вернуть калиброванные вероятности и никогда не генерировать токен. Та же архитектурная ставка, та же форма выходных данных, та же лицензия Apache-2.0, в десять раз больше параметров — и одна из них — это база для дообучения, тогда как другая заявляет о себе как о готовом zero-shot движке.
Они согласны с предпосылкой, а это — редкий случай.
Обе карточки приводят один и тот же довод, и это стоит отметить, потому что большая часть индустрии утверждает обратное. Если ваша задача — выбор из известного набора ответов, генерация прозы — неверная операция: вы платите за токены, которые выбрасываете, вам нужен парсер, и вы получаете объяснение, о котором не просили, вместо вероятности, к которой можно применить порог. В карточке Laya это сформулировано так: «никогда не генерирует текст, поэтому здесь нечего парсить и не может быть галлюцинаций». В карточке Intern-Decision-4B сказано, что API этой модели «выполняет структурированную оценку кандидатов. Не вызывает generate() и не сэмплирует текст в свободной форме.»
Механизмы различаются поучительным образом. Laya подаёт типизированные вопросы на голову классификатора и возвращает типизированные ответы с калиброванными вероятностями за один прямой проход, при этом слой маршрутизации определяет письменность и язык менее чем за полмиллисекунды до прохода. Intern-Decision-4B отображает варианты каждого вопроса на однотокенные символы, строит JSON-скелет ответа ассистента с одним плейсхолдером на каждое поле, считывает логиты непосредственно перед каждым плейсхолдером и выполняет softmax только по разрешённым символам соответствующего поля. У Laya это задача классификации; у InternLM — задача предсказания следующего токена, которой он не позволяет стать задачей генерации.

Разница в размерах и что она даёт
Если попросить две модели выполнить одну и ту же задачу с 421 млн и 4,54 млрд параметров, результат будет именно таким, как вы предскажете, а затем — сюрприз.
Прогнозируемая часть — это способность отвечать на сложные вопросы. Intern-Decision-4B в среднем показывает 90,02 по семи оценочным наборам при оценке Брайера 0,347 и ожидаемой ошибке калибровки 0,065 по собственному измерению InternLM, а среднее время на запрос составляет 44,16 мс на одной RTX 4090. Базовый английский чекпойнт Laya показывает точность 0,362 на бенчмарке typed-decisions с 2 000 решений; его собственная карточка отмечает, что этот показатель ниже линии класса большинства 0,461 и едва выше случайного базового уровня 0,318. Когда тот же чекпойнт дообучают на собственной обучающей выборке этого бенчмарка, показатель подскакивает до 0,766. Карточка Laya сама делает вывод: «Laya — это быстрая база для специализации, а не движок принятия решений с нулевым обучением».
Удивительно, что меньшая модель одерживает победу сразу по двум параметрам. Скорость: Laya отвечает на 103–332 вопроса в секунду при пакетной обработке на одной T4, и в её карточке указано, что она примерно в шесть–восемь раз быстрее TypeSafe Jev по независимо измеренному показателю p50 в 236–276 мс, который она приводит. Десятикратное число параметров не даёт десятикратной пропускной способности в обратную сторону — у Intern-Decision-4B 44,16 мс — это на один запрос на 4090, при этом никаких данных о пакетной обработке не опубликовано. И языки: Laya сообщает, что 45 из 51 протестированных языков пригодны к использованию с результатом более чем втрое выше случайного, с маршрутизированным показателем 0,451 на MASSIVE intent в тринадцати неанглийских языках против 0,306 у её англоязычного чекпоинта. Intern-Decision-4B вообще не заявляет о многоязычности.
Табло
• Параметры — 4.54B BF16 для Intern-Decision-4B, текстовая башня плюс визуальная башня плюс проектор; 421M для Laya, один компактный стек класса энкодера.
• Потолок входных данных — 8 192 токена для обоих, и оба отказываются, а не усекают; обратите внимание, что предел Laya в 8 192 применяется к многоязычной контрольной точке, поставляемое значение по умолчанию которой — 1 024.
• Множественность — Intern-Decision-4B принимает от 1 до 16 вопросов и до 62 вариантов в каждом, и 62 — не случайное число: это ровно число однотокенных символов, которые может адресовать его контракт инференса. Laya также принимает несколько типизированных вопросов, но в её карточке документируется резкое падение после примерно 50 вариантов, где на вопрос с 77 метками выделяется всего три-четыре токена бюджета на метку, и точность падает до 0.425.
Вы — профессиональный движок локализации программного обеспечения. Переведите текст пользователя на русский язык. Есть нумерованные маркеры диапазонов, такие как {{1}}...{{/1}}, {{2}}...{{/2}}. Сохраняйте КАЖДЫЙ маркер байт-в-байт: номера, одинаковые открывающие/закрывающие пары, одинаковое количество, одинаковый порядок — никогда не добавляйте, не удаляйте, не изменяйте и не переупорядочивайте сами маркеры; переводите текст. ВЫ МОЖЕТЕ перемещать {{n}}...{{/n}} туда, куда требует порядок слов целевого языка. Любой текст внутри {{KEEP}}...{{/KEEP}} должен быть воспроизведён ТОЧНО как есть (не переводите). Возвращайте ТОЛЬКО переведённый текст с его маркерами — без пояснений, без кавычек. Изображения — выглядят как часть исходного текста? Давайте разберём.
• Калибровка — Intern-Decision-4B поставляется с подобранной температурой 1,99241824, выбранной минимизацией NLL на 1 728 случаях, и сообщает ECE 0,065 на собственном наборе; Laya поставляется чрезмерно уверенной, и в её карточке сказано, что повторная подгонка одной температуры для каждого типа вопроса и количества вариантов ответа сдвигает среднее значение ECE с 0,466 до 0,081.
• Позиция zero-shot — готовый чекпойнт, заявляющий средний результат 90,02 против задокументированного базового варианта, который набирает меньше порога класса большинства.
• Задержка — в среднем 44,16 мс, медиана 44,03 мс на одном RTX 4090 против 103–332 вопросов в секунду при пакетной обработке на одном T4.
• Языки — нет опубликованного утверждения против 45 из 51 языка, доступных при маршрутизации.
• Лицензия — Apache-2.0 с сохранением вышестоящей лицензии Qwen, при этом Apache-2.0 явно помечена как предназначенная для коммерческого использования.

Две карты, два совершенно разных представления о раскрытии информации
Здесь сравнение перестаёт быть сухим перечнем характеристик и превращается в оценочное суждение, потому что оба поставщика описывают свои модели в противоположных стилях.
Карточка Laya подробно публикует сведения о собственных неудачах. Она сообщает, что английский чекпоинт показывает точность 0.000 на кхмерском при уверенности 0.952 — уверенно ошибается, из-за чего гейтинг по уверенности там бесполезен. Она сообщает, что action.act_probability не несёт полезного сигнала, показывает 1.0 почти для каждого входа при AUROC 0.30 на 396 размеченных решениях и советует ориентироваться на уверенность вместо этого, которая достигает 0.77 на тех же элементах. Она называет вопросы с порядковыми оценками «самым слабым примитивом», ссылаясь на 0.372 на SST-5. Карточка, которая сообщает, какие из её собственных выходов следует игнорировать, делает то, что большинство поставщиков не пытаются сделать.
Карточка Intern-Decision-4B публикует чистую таблицу и не содержит ни одного случая неудачи. Её оговорки реальны и значимы — в разделе о калибровке необычно прямо указано, что столбец «до» в её пилотном проекте — это не то, что увидел бы любой пользователь, и что метки тестового набора не использовались для выбора температуры, — но раздел оценки — это семь побед и ни одного признания. Она также содержит строки для пяти конкурирующих систем, которые InternLM запускал на своём стенде, включая строку Laya, с которой начинается эта статья. Это не собственные цифры тех проектов, и воспринимать их как таковые было бы ошибкой.
Итак, линия источников для этого противостояния асимметрична в пользу меньшей модели: доказательства Laya включают дефекты, которые она задокументировала сама, а доказательства Intern-Decision-4B никогда не встречались с тестовым набором, который не выбирали его авторы.
Какая форма задачи подходит каждому из них
Если на входе короткое структурированное состояние на английском, закрытый набор ответов и нужна достоверная вероятность, Intern-Decision-4B — более способный объект на бумаге и более дорогой на практике: четыре шарда safetensors, PyTorch 2.9.1 и Transformers 5.14.1 под Python 3.12, резидентный движок и обёртка, которую вы пишете сами, если нужен HTTP-эндпоинт. Если требуется высоконагруженное решение для маршрутизации или guardrail-решений на десятках языков, где пропускная способность — узкое место, Laya лучше подходит: pip install laya, модель на 421M и карточка, которая уже сообщила вам, что перед тем как доверять вероятностям, нужно дообучить.
Обе карточки сходятся в одном: ни одной из моделей не стоит доверять в режиме zero-shot, не проверив калибровку на собственных данных, — Laya потому, что её базовые чекпойнты на незнакомых типах решений дают почти случайный результат, а Intern-Decision-4B потому, что его ECE 0,065 получен на наборе, который собрали сами его авторы.
Что маршрутизатор здесь меняет, а что нет
Ни одна из этих моделей не входит в каталог OrcaRouter, и об этом стоит сказать прямо, а не намекать на обратное: наши страницы моделей возвращают 404 для обеих — Intern-Decision-4B и Laya, — и ни одну из них нельзя вызвать как маршрут сегодня. Однако для этих двух проектов это означает не одно и то же. Лицензия Laya Apache-2.0 с тегом коммерческого использования означает, что препятствие чисто упаковочное — это локальный пакет Python с небольшим объёмом, и такое вполне можно было бы обслуживать. У Intern-Decision-4B препятствие тоже упаковочное, но её веса 4.54B в BF16 и потолок отказов в 8 192 токена делают её скорее компонентом, чем сервисом.
Там, где OrcaRouter действительно помогает, — это на дальней стороне решения. Если ваша задача структурированного принятия решений всё-таки требует этапа рассуждения, общие модели, которые способны на это, доступны через один ключ к более чем 200 моделям, с передачей прейскурантной цены провайдера без наценки (0%) и автоматическим переключением при сбое между провайдерами — так что модель, которую вы объединяете со скорером, находится на расстоянии одного эндпоинта, а не второго договора.
Краткая версия
Эти два проекта пришли к одному выводу о том, как следует принимать решения, а затем разошлись почти во всём остальном. Laya делает ставку на то, что 421 млн параметров, строгая языковая маршрутизация и безжалостная честность в отношении собственных недостатков дают быструю базу, которую вы затем специализируете. Intern-Decision-4B делает ставку на то, что в десять раз больше параметров и тщательно сконструированный контракт оценки по одному токену создают готовый zero-shot-движок. Решающий эксперимент — тот, который ни один из них не проводил публично: возьмите набор решений с вычислимыми ответами, прогоните оба и проверьте, значат ли вероятности хоть что-нибудь. Laya наполовину опубликовала этот эксперимент и показала вам, где он терпит неудачу. Intern-Decision-4B вообще его не публиковал.

