Сгенерированная титульная карточка с надписью «Intern-Decision-4B vs Laya», подзаголовком «две модели, которые отвечают без генерации токена», и тремя чипами: «4,54 млрд против 421 млн», «оба за один прямой проход» и «оба Apache-2.0». Логотип OrcaRouter наложен в правом нижнем углу.
Engineering & Research

Intern-Decision-4B против Laya: две модели, которые отказываются писать ответ и различаются по размеру в десять раз

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В карточке модели Intern-Decision-4B есть строка, которая гласит «Laya — 57.77». Любой, кто читал документацию самой Laya, поймёт, что означает это число: convaiinnovations/laya — это неавторегрессионная модель принятия решений на 421 миллион параметров, и 57.77 — это средний результат, который она получает при zero-shot использовании на чужом бенчмарке. В её собственной карточке сказано то же самое, только прямее — базовые чекпоинты находятся ниже базовой линии большинства классов на бенчмарке typed-decisions, 0.362 против 0.461. Тем временем internlm/Intern-Decision-4B — это модель на 4,54 миллиарда параметров, созданная ровно для той же задачи: взять состояние и набор типизированных вопросов, выполнить один прямой проход, вернуть калиброванные вероятности и никогда не генерировать токен. Та же архитектурная ставка, та же форма выходных данных, та же лицензия Apache-2.0, в десять раз больше параметров — и одна из них — это база для дообучения, тогда как другая заявляет о себе как о готовом zero-shot движке.

Они согласны с предпосылкой, а это — редкий случай.

Обе карточки приводят один и тот же довод, и это стоит отметить, потому что большая часть индустрии утверждает обратное. Если ваша задача — выбор из известного набора ответов, генерация прозы — неверная операция: вы платите за токены, которые выбрасываете, вам нужен парсер, и вы получаете объяснение, о котором не просили, вместо вероятности, к которой можно применить порог. В карточке Laya это сформулировано так: «никогда не генерирует текст, поэтому здесь нечего парсить и не может быть галлюцинаций». В карточке Intern-Decision-4B сказано, что API этой модели «выполняет структурированную оценку кандидатов. Не вызывает generate() и не сэмплирует текст в свободной форме.»

Механизмы различаются поучительным образом. Laya подаёт типизированные вопросы на голову классификатора и возвращает типизированные ответы с калиброванными вероятностями за один прямой проход, при этом слой маршрутизации определяет письменность и язык менее чем за полмиллисекунды до прохода. Intern-Decision-4B отображает варианты каждого вопроса на однотокенные символы, строит JSON-скелет ответа ассистента с одним плейсхолдером на каждое поле, считывает логиты непосредственно перед каждым плейсхолдером и выполняет softmax только по разрешённым символам соответствующего поля. У Laya это задача классификации; у InternLM — задача предсказания следующего токена, которой он не позволяет стать задачей генерации.

A screenshot of the convaiinnovations/laya model card on Hugging Face, showing the title 'Laya', the description of it as a multilingual non-autoregressive System 1 decision model returning typed answers with calibrated probabilities in a single forward pass across 100+ languages, the pip install laya line, and the long-documents note about laya-multilingual reading up to 8,192 tokens with max_len=8192.

Разница в размерах и что она даёт

Если попросить две модели выполнить одну и ту же задачу с 421 млн и 4,54 млрд параметров, результат будет именно таким, как вы предскажете, а затем — сюрприз.

Прогнозируемая часть — это способность отвечать на сложные вопросы. Intern-Decision-4B в среднем показывает 90,02 по семи оценочным наборам при оценке Брайера 0,347 и ожидаемой ошибке калибровки 0,065 по собственному измерению InternLM, а среднее время на запрос составляет 44,16 мс на одной RTX 4090. Базовый английский чекпойнт Laya показывает точность 0,362 на бенчмарке typed-decisions с 2 000 решений; его собственная карточка отмечает, что этот показатель ниже линии класса большинства 0,461 и едва выше случайного базового уровня 0,318. Когда тот же чекпойнт дообучают на собственной обучающей выборке этого бенчмарка, показатель подскакивает до 0,766. Карточка Laya сама делает вывод: «Laya — это быстрая база для специализации, а не движок принятия решений с нулевым обучением».

Удивительно, что меньшая модель одерживает победу сразу по двум параметрам. Скорость: Laya отвечает на 103–332 вопроса в секунду при пакетной обработке на одной T4, и в её карточке указано, что она примерно в шесть–восемь раз быстрее TypeSafe Jev по независимо измеренному показателю p50 в 236–276 мс, который она приводит. Десятикратное число параметров не даёт десятикратной пропускной способности в обратную сторону — у Intern-Decision-4B 44,16 мс — это на один запрос на 4090, при этом никаких данных о пакетной обработке не опубликовано. И языки: Laya сообщает, что 45 из 51 протестированных языков пригодны к использованию с результатом более чем втрое выше случайного, с маршрутизированным показателем 0,451 на MASSIVE intent в тринадцати неанглийских языках против 0,306 у её англоязычного чекпоинта. Intern-Decision-4B вообще не заявляет о многоязычности.

Табло

• Параметры — 4.54B BF16 для Intern-Decision-4B, текстовая башня плюс визуальная башня плюс проектор; 421M для Laya, один компактный стек класса энкодера.

• Потолок входных данных — 8 192 токена для обоих, и оба отказываются, а не усекают; обратите внимание, что предел Laya в 8 192 применяется к многоязычной контрольной точке, поставляемое значение по умолчанию которой — 1 024.

• Множественность — Intern-Decision-4B принимает от 1 до 16 вопросов и до 62 вариантов в каждом, и 62 — не случайное число: это ровно число однотокенных символов, которые может адресовать его контракт инференса. Laya также принимает несколько типизированных вопросов, но в её карточке документируется резкое падение после примерно 50 вариантов, где на вопрос с 77 метками выделяется всего три-четыре токена бюджета на метку, и точность падает до 0.425.

Вы — профессиональный движок локализации программного обеспечения. Переведите текст пользователя на русский язык. Есть нумерованные маркеры диапазонов, такие как {{1}}...{{/1}}, {{2}}...{{/2}}. Сохраняйте КАЖДЫЙ маркер байт-в-байт: номера, одинаковые открывающие/закрывающие пары, одинаковое количество, одинаковый порядок — никогда не добавляйте, не удаляйте, не изменяйте и не переупорядочивайте сами маркеры; переводите текст. ВЫ МОЖЕТЕ перемещать {{n}}...{{/n}} туда, куда требует порядок слов целевого языка. Любой текст внутри {{KEEP}}...{{/KEEP}} должен быть воспроизведён ТОЧНО как есть (не переводите). Возвращайте ТОЛЬКО переведённый текст с его маркерами — без пояснений, без кавычек. Изображения — выглядят как часть исходного текста? Давайте разберём.

• Калибровка — Intern-Decision-4B поставляется с подобранной температурой 1,99241824, выбранной минимизацией NLL на 1 728 случаях, и сообщает ECE 0,065 на собственном наборе; Laya поставляется чрезмерно уверенной, и в её карточке сказано, что повторная подгонка одной температуры для каждого типа вопроса и количества вариантов ответа сдвигает среднее значение ECE с 0,466 до 0,081.

• Позиция zero-shot — готовый чекпойнт, заявляющий средний результат 90,02 против задокументированного базового варианта, который набирает меньше порога класса большинства.

• Задержка — в среднем 44,16 мс, медиана 44,03 мс на одном RTX 4090 против 103–332 вопросов в секунду при пакетной обработке на одном T4.

• Языки — нет опубликованного утверждения против 45 из 51 языка, доступных при маршрутизации.

• Лицензия — Apache-2.0 с сохранением вышестоящей лицензии Qwen, при этом Apache-2.0 явно помечена как предназначенная для коммерческого использования.

A two-column comparison scoreboard titled 'Intern-Decision-4B vs Laya'. The left column reads: Parameters: 4.54B BF16; Output: probabilities, no text; Options per question: up to 62; Latency: 44.16 ms mean on one RTX 4090; Zero-shot: 90.02 average reported; Images: up to eight; License: Apache-2.0. The right column reads: Parameters: 421M; Output: typed answers, no text; Options per question: degrades past ~50; Latency: 103-332 q/s batched on one T4; Zero-shot: below majority class, 0.362; Images: none; License: Apache-2.0, commercial use tagged. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.

Две карты, два совершенно разных представления о раскрытии информации

Здесь сравнение перестаёт быть сухим перечнем характеристик и превращается в оценочное суждение, потому что оба поставщика описывают свои модели в противоположных стилях.

Карточка Laya подробно публикует сведения о собственных неудачах. Она сообщает, что английский чекпоинт показывает точность 0.000 на кхмерском при уверенности 0.952 — уверенно ошибается, из-за чего гейтинг по уверенности там бесполезен. Она сообщает, что action.act_probability не несёт полезного сигнала, показывает 1.0 почти для каждого входа при AUROC 0.30 на 396 размеченных решениях и советует ориентироваться на уверенность вместо этого, которая достигает 0.77 на тех же элементах. Она называет вопросы с порядковыми оценками «самым слабым примитивом», ссылаясь на 0.372 на SST-5. Карточка, которая сообщает, какие из её собственных выходов следует игнорировать, делает то, что большинство поставщиков не пытаются сделать.

Карточка Intern-Decision-4B публикует чистую таблицу и не содержит ни одного случая неудачи. Её оговорки реальны и значимы — в разделе о калибровке необычно прямо указано, что столбец «до» в её пилотном проекте — это не то, что увидел бы любой пользователь, и что метки тестового набора не использовались для выбора температуры, — но раздел оценки — это семь побед и ни одного признания. Она также содержит строки для пяти конкурирующих систем, которые InternLM запускал на своём стенде, включая строку Laya, с которой начинается эта статья. Это не собственные цифры тех проектов, и воспринимать их как таковые было бы ошибкой.

Итак, линия источников для этого противостояния асимметрична в пользу меньшей модели: доказательства Laya включают дефекты, которые она задокументировала сама, а доказательства Intern-Decision-4B никогда не встречались с тестовым набором, который не выбирали его авторы.

Какая форма задачи подходит каждому из них

Если на входе короткое структурированное состояние на английском, закрытый набор ответов и нужна достоверная вероятность, Intern-Decision-4B — более способный объект на бумаге и более дорогой на практике: четыре шарда safetensors, PyTorch 2.9.1 и Transformers 5.14.1 под Python 3.12, резидентный движок и обёртка, которую вы пишете сами, если нужен HTTP-эндпоинт. Если требуется высоконагруженное решение для маршрутизации или guardrail-решений на десятках языков, где пропускная способность — узкое место, Laya лучше подходит: pip install laya, модель на 421M и карточка, которая уже сообщила вам, что перед тем как доверять вероятностям, нужно дообучить.

Обе карточки сходятся в одном: ни одной из моделей не стоит доверять в режиме zero-shot, не проверив калибровку на собственных данных, — Laya потому, что её базовые чекпойнты на незнакомых типах решений дают почти случайный результат, а Intern-Decision-4B потому, что его ECE 0,065 получен на наборе, который собрали сами его авторы.

Что маршрутизатор здесь меняет, а что нет

Ни одна из этих моделей не входит в каталог OrcaRouter, и об этом стоит сказать прямо, а не намекать на обратное: наши страницы моделей возвращают 404 для обеих — Intern-Decision-4B и Laya, — и ни одну из них нельзя вызвать как маршрут сегодня. Однако для этих двух проектов это означает не одно и то же. Лицензия Laya Apache-2.0 с тегом коммерческого использования означает, что препятствие чисто упаковочное — это локальный пакет Python с небольшим объёмом, и такое вполне можно было бы обслуживать. У Intern-Decision-4B препятствие тоже упаковочное, но её веса 4.54B в BF16 и потолок отказов в 8 192 токена делают её скорее компонентом, чем сервисом.

Там, где OrcaRouter действительно помогает, — это на дальней стороне решения. Если ваша задача структурированного принятия решений всё-таки требует этапа рассуждения, общие модели, которые способны на это, доступны через один ключ к более чем 200 моделям, с передачей прейскурантной цены провайдера без наценки (0%) и автоматическим переключением при сбое между провайдерами — так что модель, которую вы объединяете со скорером, находится на расстоянии одного эндпоинта, а не второго договора.

Краткая версия

Эти два проекта пришли к одному выводу о том, как следует принимать решения, а затем разошлись почти во всём остальном. Laya делает ставку на то, что 421 млн параметров, строгая языковая маршрутизация и безжалостная честность в отношении собственных недостатков дают быструю базу, которую вы затем специализируете. Intern-Decision-4B делает ставку на то, что в десять раз больше параметров и тщательно сконструированный контракт оценки по одному токену создают готовый zero-shot-движок. Решающий эксперимент — тот, который ни один из них не проводил публично: возьмите набор решений с вычислимыми ответами, прогоните оба и проверьте, значат ли вероятности хоть что-нибудь. Laya наполовину опубликовала этот эксперимент и показала вам, где он терпит неудачу. Intern-Decision-4B вообще его не публиковал.

A generated comparison card titled 'Same bet, ten times the parameters'. The left side, 'Intern-Decision-4B', lists: 4.54B BF16; a finished zero-shot checkpoint claiming a 90.02 average across seven sets; fitted temperature 1.99241824; 44.16 ms mean per query on one RTX 4090; Apache-2.0 with the upstream Qwen license preserved. The right side, 'Laya', lists: 421M; a documented base below the majority-class line at 0.362, rising to 0.766 once fine-tuned on the benchmark's own training split; refitting one temperature per question type moves mean ECE from 0.466 to 0.081; 103 to 332 questions per second batched on one T4; Apache-2.0 tagged for commercial use. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.
© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube