Сгенерированная титульная карточка для сравнения Laya и Nimble, содержащая собственный подзаголовок этой статьи и строку нижнего колонтитула с указанием, чьи показатели заявлены производителем, а чьи — третьей стороной.
Engineering & Research

Laya против Nimble: контрастивные данные против более быстрого энкодера

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Laya и Nimble — это две открытовесовые модели принятия решений, авторы которых сделали больше всех, чтобы объяснить, как они устроены, и их объяснения расходятся в том, где именно кроется сложность. Convai Innovations выпустила Laya 18 сентября 2026 года под лицензией Apache 2.0 — англоязычный чекпойнт ModernBERT-large на 421M, многоязычный чекпойнт mmBERT-base на 322M, охватывающий более 100 языков, роутер между ними с субмиллисекундной задержкой и опубликованный показатель p50 в 32,8 мс на одно решение на Tesla T4. Bespoke Labs создала Nimble как LoRA-дообучение на Qwen3.5-9B, Apache 2.0, и описывает её как «open-source Jev» — вдохновлённую Jev от TypeSafe AI, но не использующую ни её веса, ни её архитектуру, ни дистилляцию её выходных данных. Ответ Convai на проблему точности — это скорость и база, доступная для дообучения. Ответ Bespoke — это обучающие данные. Эта разница заслуживает большего внимания, чем разрыв в точности на три пункта, который виден в сводных таблицах.

Утверждение, которое на самом деле делает каждый проект

Утверждение Laya носит архитектурный характер. Она неавторегрессионна в строгом смысле — двунаправленный энкодер, никакого цикла декодирования, никакого JSON для парсинга, никакого пространства, в котором можно было бы выдать текст за пределами объявленного типа. Эта структурная гарантия — та же, что предлагает Jev, только достигнутая с другой стороны, и она действительно ценна для любого, кто писал логику повторных попыток вокруг модели, которая время от времени забывает закрыть фигурную скобку. Цена в том, что энкодер на 421M с окном в 512 токенов и без генеративного предобучения за плечами знает не так уж много. Convai говорит об этом на карточке модели: «Laya — это быстрая база для специализации, а не движок принятия решений без дообучения».

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.A screenshot of the Nimble repository on GitHub, showing the description "Local typed decisions, contrastive data curation, and model evaluation", the README heading "Bespoke Nimble - Data, Model, Recipe for an open Jev", the contrastive example where changing one fact flips the correct answer, and the 2,676-example training split against the frozen 324 held-out set.

Утверждение Nimble касается данных. Метод Bespoke — это контрастивная курация, адаптированная из более ранней работы команды над Bespoke-MiniCheck: написать два почти идентичных примера, которые различаются одним «фокусным фактом», так чтобы правильная метка менялась на противоположную. В пайплайне заявлены четыре шага: проверить, что правила принятия решений действительно могут приводить к разным ответам; построить пару, изменив не более восьми слов; проверить оба примера отдельными вызовами модели плюс проверкой с удалением каждого предложения; и сгенерировать метки в коде, оставив только те пары, метки которых действительно различаются. Цель — не больше примеров, а более чёткие: заставить модель понять, какие свидетельства должны менять решение. Это другая теория того, почему небольшие модели принятия решений дают сбои, и она интереснее, чем ещё одна цифра точности.

Что на самом деле подтверждают опубликованные цифры

Nimble сообщает о 90,12% согласия с эталонными метками на 324 отложенных образцах — против 93,21% у Jev, 66,36% у нетюнингованной базовой Qwen3.5-9B и 84,88% у нетюнингованной 27B Qwen3.8. Сообщается о примерно 106 мс медианы на H100 и 444 мс медианы на M5 Pro с 64 ГБ. Это показатели собственного тестового стенда Bespoke. Набор для оценки из 324 образцов — это то, что стоит оценивать с осторожностью, и проект сам объясняет почему: образцы охватывают шесть из десяти исходных семейств обучающих данных, они были сгенерированы и проверены моделями без участия человека, и поэтому обобщение на невиданные категории не доказано. Когда модель обучают с помощью метода курирования данных, а затем оценивают на отложенной части того же курированного распределения, показатель точности говорит о внутренней согласованности метода, а не о вашем трафике.

Показатели Laya — с другого конца. В бенчмарке TypeSafe typed-decisions она набирает 0,362 в zero-shot — случайное угадывание даёт 0,318, базовая линия большинства классов — 0,461 — и 0,766 при дообучении на собственном обучающем разбиении бенчмарка. В Banking77 с 77 метками она набирает 0,425 против 0,870 у Jev — это самая яркая иллюстрация её потолка при множестве вариантов. В AG News с четырьмя метками она набирает 0,950 против 0,910 у Jev; в DAIR Emotion с шестью метками — 0,595 против 0,480. Её ошибка калибровки на момент выпуска составляет 0,466 и падает до 0,081 после перенастройки температуры для каждого типа вопроса. В одном стороннем тесте из 100 срочных сообщений Mars-base у Jev было 100/100, а у Laya — 53/100. А в независимой оценке вызовов инструментов агентом Laya достигла 100% recall отказов на опасных вызовах, но только за счёт пометки всего подряд — это провал по точности, замаскированный под победу в безопасности.

Поставьте два набора чисел рядом — и при честном прочтении становится ясно, что они измерялись на разных вещах. 90,12% у Nimble — это согласие с собственными курируемыми эталонными метками. 0,362 у Laya — это бенчмарк, который она не создавала. Ни одно из этих чисел не переносится.

Калибровка: единственное место, где оба проекта необычно откровенны

Именно здесь два проекта наиболее близки по духу и наиболее далеки по результату.

README Bespoke прямо предупреждает, что вероятности Nimble — это softmax-нормализованные логиты по предоставленным кандидатам, а не калиброванные показатели правильности: 0,9 не означает 90 % правильных ответов. В нём рекомендуется добавить вариант «ни один из перечисленных», потому что если правильного ответа нет среди кандидатов, один из них всё равно побеждает. В более новой оценке на 3 880 записей, охватывающей 13 подмножеств, у Jev была более низкая заявленная ошибка калибровки в 11 из 13 подмножеств и более низкий показатель Брайера в 10 из 13. Таким образом, сходная согласованность меток не подразумевает сходного качества вероятностей, и Bespoke об этом говорит.

Раскрытие Convai — это зеркальное отражение: ожидаемая ошибка калибровки 0,466 указана в карточке, рядом с 0,081, который получается при перенастройке температуры по типам вопросов. Ни один из проектов не поставляет модель, на чью уверенность можно опираться без дополнительной работы. Оба сообщают об этом в письменном виде. Если вы строите порог уверенности — автоматический выпуск выше 0,95, эскалация ниже 0,7 — документация обоих авторов говорит вам одно и то же: сначала подберите порог на своих собственных размеченных данных.

Сравнение, измерение за измерением

• Backbone — Laya: энкодер ModernBERT-large 421M, двунаправленный, без генеративного предобучения. Nimble: Qwen3.5-9B с LoRA-дообучением, генеративная основа сохранена.

• Языки — Laya: 100+ благодаря многоязычному чекпоинту 322M. Nimble: английский.

• Бюджет промпта — Laya: 512 токенов для английского, 1 024 для многоязычных. Nimble: максимум 2 048 токенов на промпт, только плоские схемы, перечисления ограничены 26 вариантами на поле.

• Скорость — Laya: 32,8 мс p50 на T4, 7,2 мс на вопрос при пакетной обработке по 10. Nimble: примерно 106 мс медиана на H100, 444 мс на M5 Pro 64GB.

• Аппаратное обеспечение — Laya: CPU, CUDA и Apple MPS; менее гигабайта резидентной памяти в MLX-порте. Nimble: CUDA GPU с BF16 для указанных показателей, с поддержкой путей MLX и CUDA.

Заявленная точность — Laya: 0,362 в режиме zero-shot, 0,766 после дообучения, 0,425 на Banking77. Nimble: 90,12% на 324 отобранных отложенных образцах против 93,21% у Jev.

• Метод — Laya: сначала архитектура, дообучение под каждое развёртывание. Nimble: контрастивная подготовка данных, опубликованная в виде рецепта.

• Лицензия — Apache 2.0 для обоих.

Два ограничения в том списке заслуживают того, чтобы их прочитали дважды, прежде чем принимать решение. Ограничение Nimble в 26 вариантов на одно перечисление и потолок промпта в 2 048 токенов — это жёсткие ограничения схемы, а не деградация производительности: если в вашей таксономии сорок меток или ваш промпт содержит длинный документ, Nimble — неподходящий инструмент, независимо от его точности. А поскольку Nimble оценивает каждое поле независимо, любое правило согласованности между полями — «если A истинно, то B должно быть ложно» — должно находиться в вашем коде, а не в модели.

Почему рецепт данных — более переносимый артефакт

Вот аргумент в пользу Nimble, который упускают таблицы точности. Bespoke опубликовала пайплайн курирования, а не только веса. Если у вашей задачи принятия решений есть фиксированная таксономия и вы можете записать правила, контрастивный метод — это то, что можно запустить на собственных данных с собственными фокусными фактами, поверх любой базовой модели, которую вы предпочитаете. 9B LoRA — это в равной мере демонстрация метода и продукт.

Переносимость Laya устроена иначе и дополняет другие решения. Благодаря тому, что она небольшая, работает на CPU и существуют порты ONNX и MLX, Laya — это модель, которую можно поместить внутрь процесса, где нет GPU и сети. В стороннем бенчмарке для браузерных агентов Laya выполнила 0 из 50 задач и преждевременно объявила о завершении в 33 попытках — но авторы бенчмарка отмечают, что она обучалась для работы, связанной с вынесением суждений, такой как обработка обращений в поддержку, счетов и анализ трассировок агентов, а не для навигации. Воспринимайте этот результат как заявление об области применения, а не как вердикт, и он согласуется с позиционированием обоих проектов: это компоненты для конкретного класса решений, а не универсальные агенты.

Ни Laya, ни Nimble не являются размещёнными моделями на OrcaRouter. Обе — это веса, которые вы запускаете сами, и ничто в этом материале не должно восприниматься как утверждение, будто мы их обслуживаем. Причина, по которой продукт маршрутизации вообще упоминается, та же, по которой он возникает в любой архитектуре с моделью принятия решений: модель принятия решений отвечает на один вызов, а приложению вокруг неё всё ещё нужен текст. Пайплайну, который использует Nimble, чтобы оценить, соответствует ли черновик требованиям, и Laya, чтобы маршрутизировать исключение, всё равно понадобится генеративная модель, чтобы написать черновик. Сохранение этой генеративной половины на одном endpoint, совместимом с OpenAI — 200+ моделей, цена из прайс-листа провайдера передаётся с наценкой 0%, так что снижение цены поставщиком вступает в силу в тот же день, автоматическое переключение при сбое между провайдерами — означает, что слой принятия решений можно заменить, не трогая контракт генеративного слоя.

Вердикт — и эксперимент, который мог бы его изменить

Выбирайте Nimble, если ваша таксономия фиксирована и узка, входные данные — английские и короткие, у вас есть GPU, и вам нужен рецепт данных не меньше, чем сама модель. Выбирайте Laya, если вам нужен многоязычный ввод, бюджет менее 40 мс или процесс вообще без GPU — и с самого начала закладывайте дообучение в бюджет, потому что zero-shot чекпойнт находится ниже тривиального бейзлайна, и в карточке модели так и написано.

Эксперимент, который позволил бы это решить, — это парная оценка на реальном трафике: одни и те же входные данные, одни и те же наборы опций, одни и те же пороги уверенности, оценка по человеческим меткам, с диаграммой надёжности для каждого. Собственная документация Nimble предупреждает, что его вероятности — это не показатели корректности, а карточка Laya сообщает об ошибке калибровки 0.466 до повторной подгонки, так что именно эта диаграмма — тот артефакт, который действительно подскажет, какую модель ставить перед продакшеном. Ни один из проектов не опубликовал её, и ни один не опубликовал диаграмму другого. Постройте её на своих собственных данных, прежде чем устанавливать порог.

A generated two-column scoreboard comparing Laya and Nimble across backbone, languages, prompt budget, label agreement, latency and licence, with a footer reading "Nimble's 90.12% is agreement with its own curated labels; Laya figures per its model card."