
Intern-Decision-2B против Laya: 2,2 миллиарда параметров против 421 миллиона, и оба отказываются писать ответ
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 584 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 187 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
internlm/Intern-Decision-2B и convaiinnovations/laya — две самые похожие модели в нише небольших моделей для принятия решений, и самое полезное в этом сравнении то, что к этому они приходят противоположными путями. Чекпойнт InternLM с 2 213 241 664 параметрами считывает логит в фиксированной позиции перед плейсхолдером и никогда не вызывает generate(). Чекпойнт Convai с 421 миллионом параметров подаёт типизированные вопросы в решающую голову поверх основы ModernBERT-large и возвращает калиброванные вероятности за один прямой проход. Ни одна из них не записывает ни одного токена, обе обещают вероятности, у обеих верхний предел — около восьми тысяч токенов входных данных, а меньшая из них в пять раз меньше и примерно в тысячу раз популярнее. Их разделяет не столько возможности, сколько упаковка, и разрыв в упаковке решает вопрос о покупке для большинства читателей.
Intern-Decision-2B появилась на Hugging Face в 05:36 UTC 26 сентября 2026 года — средняя из трёх размеров, которые InternLM загрузила за сорок секунд без объявления, дообученная на основе Qwen/Qwen3.5-2B под лицензией Apache-2.0. Laya была впервые выложена 18 сентября 2026 года и с тех пор набрала более 3700 лайков, pip-пакет, HTTP-сервер, совместимый с Jev, интеграции с ONNX и LangChain и блокнот для дообучения. Именно контраст в зрелости и составляет суть статьи.
Общая для них предпосылка и различающиеся механизмы
Обе карточки утверждают, что если ваша задача — выбирать среди известных ответов, то генерация прозы — неправильная операция. Формулировка Laya такова: «никогда не генерирует текст, поэтому нечего разбирать и нечего галлюцинировать». Формулировка Intern-Decision-2B такова: его API «выполняет структурированный скоринг кандидатов. Он не вызывает generate() и не сэмплирует текст в свободной форме».
Механизмы — это то место, где они расходятся.
Laya — это классификатор. Кодировщик ModernBERT-large (395M, двунаправленный, полностью дообученный) питает решающую голову, обученную с нуля — два слоя трансформера, скорер маркеров вариантов и голову act/escalate — в сумме 421M. Варианты совместно используют фиксированный бюджет токенов (head_max_len, 192 токена в английском чекпоинте, 256 в многоязычном), а маршрутизатор определяет письменность и язык менее чем за половину миллисекунды до прохода.
Intern-Decision-2B — это next-token, которому запрещено становиться генератором. Он сопоставляет варианты каждого вопроса однотокенным символам A–Z, a–z, 0–9; формирует полный JSON-скелет ответа ассистента с одним плейсхолдером <decision> для каждого поля; выполняет один каузальный прямой проход; считывает логиты непосредственно перед каждым плейсхолдером; применяет softmax по допустимым символам этого поля; и применяет подобранную температуру 2.100509348278. В основе лежит стандартная Qwen3_5ForConditionalGeneration — 24 слоя, три слоя линейного внимания на один слой полного внимания, сохранённый слой multi-token prediction, потолок эмбеддингов в 262 144 позиции — плюс визуальная башня и проектор.
Практическое следствие этого различия — вместимость по вариантам. Фиксированный бюджет Laya's на один вариант обрушивается на широких пространствах меток; в её собственной карточке задокументирован вопрос с 77 метками, набирающий 0,425 против 0,870 у TypeSafe Jev на той же задаче, потому что 77 вариантов получают примерно по три-четыре токена каждый. Intern-Decision-2B принимает до 62 вариантов на вопрос и до шестнадцати вопросов, и 62 — это не предпочтение, а точное число однотокенных символов, которые может адресовать его контракт. Ни тому, ни другому не комфортно после нескольких десятков вариантов; формы отказа различаются.

Табло

• Параметры — Decision-2 2 213 241 664 в BF16 плюс визуальная башня и проектор, около 4,46 ГБ на диске; Laya 421M, один файл safetensors размером 842 МБ, отдельный многоязычный чекпоинт на 644 МБ.
• Потолок входных данных — 8 192 токена для обоих, оба отклоняют запрос, а не усекают его; учтите, что значение 8 192 для Laya относится к laya-multilingual и требует max_len=8192, поскольку поставляемое по умолчанию значение — 1 024.
• Изображения — до восьми для Intern-Decision-2B, учитываются в том же бюджете токенов; для Laya нет мультимодального пути.
• Скорость — в среднем 33,28 мс, P50 — 33,15 мс, P95 — 33,55 мс на запрос на одной RTX 4090 для Intern-Decision-2B; Laya сообщает примерно 33 мс на запрос и 103–332 вопроса в секунду при пакетной обработке на одной T4.
• Языки — Intern-Decision-2B вообще не заявляет о многоязычности; Laya охватывает более 100 языков, сообщая, что 45 из 51 протестированного языка пригодны для использования при более чем трёхкратном превышении случайного уровня, а также 0,451 в задаче MASSIVE intent по тринадцати неанглийским языкам против 0,306 у её англоязычного чекпоинта.
• Точность в режиме zero-shot — Intern-Decision-2B показывает 84,68 в среднем по семи вендорским наборам при Brier 0,437 и ECE 0,100, и всё это не воспроизведено; базовый английский чекпоинт Laya набирает 0,362 в бенчмарке typed-decisions на 2 000 решений, что, согласно собственной карточке Laya, ниже линии мажоритарного класса 0,461.
• Упаковка — чекпойнт, inference.py и недавно ставший публичным репозиторий GitHub с кодом для обучения и оценки, против pip install laya, HTTP-сервера, совместимого с Jev, быстрых путей ONNX Runtime и TileLang, интеграций с MCP и LangChain и ноутбука для дообучения, который работает на GPU бесплатного тарифа.
Самое честное сравнение — не то, которое предлагает таблица характеристик.
Поставить 84,68 рядом с 0,362 — это почти что нечестно, и стоит объяснить почему, а не просто оставлять эти числа как есть.
Laya 0.362 — это базовый чекпоинт, измеренный в режиме zero-shot на бенчмарке, для которого его не настраивали. В его собственной карточке вывод сформулирован прямо: «Laya — это быстрая база для специализации, а не zero-shot-движок принятия решений». После дообучения на собственном тренировочном сплите этого бенчмарка он достигает 0.766, преодолевая потолок учителя в 0.735 и превосходя опубликованный результат TypeSafe Jev 0.727 на тех же решениях. Показатель Intern-Decision-2B 84.68, тем временем, — это усреднённый по семи наборам результат вендора, чьи тестовые наборы не те, что приводит Laya; он получен лабораторией, создавшей модель, и ни одна третья сторона его не запускала — у чекпоинта один лайк и ноль загрузок. Сравнивать результат после дообучения с результатом zero-shot или среднее вендора с независимым лидербордом — это не сравнение. Это два разных измерения, набранных одним и тем же шрифтом.
Что действительно сопоставимо: обе модели малы, обе дёшевы в запуске, и обе не поддаются дообучению под ваш домен. Репозиторий, опубликованный InternLM сегодня утром, делает эту последнюю часть существенно проще, чем она была вчера, потому что в нём поставляются лаунчер обучения, целевая функция masked-next-token, проверенный по хешу набор из 10 751 тестовой строки в семи наборах, а также скрипты подгонки температуры и воспроизведения. Лаборатория, которая поставляет детерминированный генератор калибровки и утверждает, что воспроизведение не меняет ни одного решения, приглашает ровно к тому виду адаптации, который рекомендует карточка Laya.
Как бы вы на самом деле вызвали любой из них
Ни одной из этих моделей нет на OrcaRouter. Страница модели Intern-Decision-2B на OrcaRouter возвращает 404, и маршрута для Laya тоже нет; ничто здесь не является заявлением о доступности. Intern-Decision-2B означает скачать чекпойнт и запустить его встроенный движок на собственной GPU. Laya означает pip install laya и, если вам нужна совместимая с Jev поверхность, laya-serve на POST /v1/systemone.
Вопрос в форме Orchestrator, лежащий в основе, — нужна ли вам вторая операционная поверхность для скорера. Laya спроектирован для встраивания — та же форма запроса и ответа, что и у TypeSafe Jev, так что существующему клиенту достаточно сменить базовый URL, и больше ничего. Intern-Decision-2B спроектирован для воспроизведения, и сегодня это примерно день работы над окружением, прежде чем вернётся первое решение. Если закрытое решение, которое вы принимаете, близко по форме к любому из этих двух, хостингуемая альтернатива, с которой сравниваются обе карточки, — TypeSafe Jev 1.13, у которой действительно есть маршрут: $0,042 за миллион входных токенов, контекст 65K и P50 времени до первого токена 178 мс, доступная по тому же ключу, что и 200 с лишним других моделей, с прейскурантной ценой провайдера, передаваемой без наценки.

В чём выигрывает каждый
Laya побеждает по всем операционным показателям. pip-пакет против скачивания чекпоинта. Маршрутизатор для более чем сотни языков против отсутствия заявленной многоязычности. Пакетная пропускная способность, измеряемая сотнями вопросов в секунду, против показателя на один запрос при отсутствии какой-либо поддержки пакетной обработки. Два года экосистемной мощи — ONNX, TileLang, LangChain, MCP — против репозитория, который публично доступен всего два часа.
Intern-Decision-2B выигрывает по трём узким пунктам. Она принимает изображения, чего Laya не делает. У неё нет долга по дообучению: её 84,68 — это zero-shot-заявление вендора, тогда как главная цифра Laya 0,766 относится к чекпоинту, дообученному на собственной обучающей выборке бенчмарка. И она документирована набором для воспроизведения — проверяемым пакетом оценки и публичным стеком обучения, который для любого, кому приходится обосновывать модель перед кем-то другим, стоит больше, чем строка в таблице лидеров.
Ничья — это исходная посылка. Оба отказываются генерировать, оба выдают вероятности, которые можно сравнивать с порогом, и обе работают ниже той длины входа, на которой живёт большинство реальных документов. Если ваше состояние — это тикет, письмо или форма, подойдёт любой, и Laya доведёт вас до результата быстрее. Если к вашему состоянию приложен скриншот или вашей организации нужна воспроизводимость для аудита, именно средний чекпоинт InternLM отвечает на это конкретное возражение — и, по собственным цифрам InternLM, он наименее хорошо калиброван из трёх своих собратьев: ECE 0.100 против 0.066 и 0.065, так что настройте собственную температуру, прежде чем доверять сообщаемой им уверенности.
