
Laya против Nimble: контрастивные данные против более быстрого энкодера
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Laya и Nimble — это две открытовесовые модели принятия решений, авторы которых сделали больше всех, чтобы объяснить, как они устроены, и их объяснения расходятся в том, где именно кроется сложность. Convai Innovations выпустила Laya 18 сентября 2026 года под лицензией Apache 2.0 — англоязычный чекпойнт ModernBERT-large на 421M, многоязычный чекпойнт mmBERT-base на 322M, охватывающий более 100 языков, роутер между ними с субмиллисекундной задержкой и опубликованный показатель p50 в 32,8 мс на одно решение на Tesla T4. Bespoke Labs создала Nimble как LoRA-дообучение на Qwen3.5-9B, Apache 2.0, и описывает её как «open-source Jev» — вдохновлённую Jev от TypeSafe AI, но не использующую ни её веса, ни её архитектуру, ни дистилляцию её выходных данных. Ответ Convai на проблему точности — это скорость и база, доступная для дообучения. Ответ Bespoke — это обучающие данные. Эта разница заслуживает большего внимания, чем разрыв в точности на три пункта, который виден в сводных таблицах.
Утверждение, которое на самом деле делает каждый проект
Утверждение Laya носит архитектурный характер. Она неавторегрессионна в строгом смысле — двунаправленный энкодер, никакого цикла декодирования, никакого JSON для парсинга, никакого пространства, в котором можно было бы выдать текст за пределами объявленного типа. Эта структурная гарантия — та же, что предлагает Jev, только достигнутая с другой стороны, и она действительно ценна для любого, кто писал логику повторных попыток вокруг модели, которая время от времени забывает закрыть фигурную скобку. Цена в том, что энкодер на 421M с окном в 512 токенов и без генеративного предобучения за плечами знает не так уж много. Convai говорит об этом на карточке модели: «Laya — это быстрая база для специализации, а не движок принятия решений без дообучения».


Утверждение Nimble касается данных. Метод Bespoke — это контрастивная курация, адаптированная из более ранней работы команды над Bespoke-MiniCheck: написать два почти идентичных примера, которые различаются одним «фокусным фактом», так чтобы правильная метка менялась на противоположную. В пайплайне заявлены четыре шага: проверить, что правила принятия решений действительно могут приводить к разным ответам; построить пару, изменив не более восьми слов; проверить оба примера отдельными вызовами модели плюс проверкой с удалением каждого предложения; и сгенерировать метки в коде, оставив только те пары, метки которых действительно различаются. Цель — не больше примеров, а более чёткие: заставить модель понять, какие свидетельства должны менять решение. Это другая теория того, почему небольшие модели принятия решений дают сбои, и она интереснее, чем ещё одна цифра точности.
Что на самом деле подтверждают опубликованные цифры
Nimble сообщает о 90,12% согласия с эталонными метками на 324 отложенных образцах — против 93,21% у Jev, 66,36% у нетюнингованной базовой Qwen3.5-9B и 84,88% у нетюнингованной 27B Qwen3.8. Сообщается о примерно 106 мс медианы на H100 и 444 мс медианы на M5 Pro с 64 ГБ. Это показатели собственного тестового стенда Bespoke. Набор для оценки из 324 образцов — это то, что стоит оценивать с осторожностью, и проект сам объясняет почему: образцы охватывают шесть из десяти исходных семейств обучающих данных, они были сгенерированы и проверены моделями без участия человека, и поэтому обобщение на невиданные категории не доказано. Когда модель обучают с помощью метода курирования данных, а затем оценивают на отложенной части того же курированного распределения, показатель точности говорит о внутренней согласованности метода, а не о вашем трафике.
Показатели Laya — с другого конца. В бенчмарке TypeSafe typed-decisions она набирает 0,362 в zero-shot — случайное угадывание даёт 0,318, базовая линия большинства классов — 0,461 — и 0,766 при дообучении на собственном обучающем разбиении бенчмарка. В Banking77 с 77 метками она набирает 0,425 против 0,870 у Jev — это самая яркая иллюстрация её потолка при множестве вариантов. В AG News с четырьмя метками она набирает 0,950 против 0,910 у Jev; в DAIR Emotion с шестью метками — 0,595 против 0,480. Её ошибка калибровки на момент выпуска составляет 0,466 и падает до 0,081 после перенастройки температуры для каждого типа вопроса. В одном стороннем тесте из 100 срочных сообщений Mars-base у Jev было 100/100, а у Laya — 53/100. А в независимой оценке вызовов инструментов агентом Laya достигла 100% recall отказов на опасных вызовах, но только за счёт пометки всего подряд — это провал по точности, замаскированный под победу в безопасности.
Поставьте два набора чисел рядом — и при честном прочтении становится ясно, что они измерялись на разных вещах. 90,12% у Nimble — это согласие с собственными курируемыми эталонными метками. 0,362 у Laya — это бенчмарк, который она не создавала. Ни одно из этих чисел не переносится.
Калибровка: единственное место, где оба проекта необычно откровенны
Именно здесь два проекта наиболее близки по духу и наиболее далеки по результату.
README Bespoke прямо предупреждает, что вероятности Nimble — это softmax-нормализованные логиты по предоставленным кандидатам, а не калиброванные показатели правильности: 0,9 не означает 90 % правильных ответов. В нём рекомендуется добавить вариант «ни один из перечисленных», потому что если правильного ответа нет среди кандидатов, один из них всё равно побеждает. В более новой оценке на 3 880 записей, охватывающей 13 подмножеств, у Jev была более низкая заявленная ошибка калибровки в 11 из 13 подмножеств и более низкий показатель Брайера в 10 из 13. Таким образом, сходная согласованность меток не подразумевает сходного качества вероятностей, и Bespoke об этом говорит.
Раскрытие Convai — это зеркальное отражение: ожидаемая ошибка калибровки 0,466 указана в карточке, рядом с 0,081, который получается при перенастройке температуры по типам вопросов. Ни один из проектов не поставляет модель, на чью уверенность можно опираться без дополнительной работы. Оба сообщают об этом в письменном виде. Если вы строите порог уверенности — автоматический выпуск выше 0,95, эскалация ниже 0,7 — документация обоих авторов говорит вам одно и то же: сначала подберите порог на своих собственных размеченных данных.
Сравнение, измерение за измерением
• Backbone — Laya: энкодер ModernBERT-large 421M, двунаправленный, без генеративного предобучения. Nimble: Qwen3.5-9B с LoRA-дообучением, генеративная основа сохранена.
• Языки — Laya: 100+ благодаря многоязычному чекпоинту 322M. Nimble: английский.
• Бюджет промпта — Laya: 512 токенов для английского, 1 024 для многоязычных. Nimble: максимум 2 048 токенов на промпт, только плоские схемы, перечисления ограничены 26 вариантами на поле.
• Скорость — Laya: 32,8 мс p50 на T4, 7,2 мс на вопрос при пакетной обработке по 10. Nimble: примерно 106 мс медиана на H100, 444 мс на M5 Pro 64GB.
• Аппаратное обеспечение — Laya: CPU, CUDA и Apple MPS; менее гигабайта резидентной памяти в MLX-порте. Nimble: CUDA GPU с BF16 для указанных показателей, с поддержкой путей MLX и CUDA.
Заявленная точность — Laya: 0,362 в режиме zero-shot, 0,766 после дообучения, 0,425 на Banking77. Nimble: 90,12% на 324 отобранных отложенных образцах против 93,21% у Jev.
• Метод — Laya: сначала архитектура, дообучение под каждое развёртывание. Nimble: контрастивная подготовка данных, опубликованная в виде рецепта.
• Лицензия — Apache 2.0 для обоих.
Два ограничения в том списке заслуживают того, чтобы их прочитали дважды, прежде чем принимать решение. Ограничение Nimble в 26 вариантов на одно перечисление и потолок промпта в 2 048 токенов — это жёсткие ограничения схемы, а не деградация производительности: если в вашей таксономии сорок меток или ваш промпт содержит длинный документ, Nimble — неподходящий инструмент, независимо от его точности. А поскольку Nimble оценивает каждое поле независимо, любое правило согласованности между полями — «если A истинно, то B должно быть ложно» — должно находиться в вашем коде, а не в модели.
Почему рецепт данных — более переносимый артефакт
Вот аргумент в пользу Nimble, который упускают таблицы точности. Bespoke опубликовала пайплайн курирования, а не только веса. Если у вашей задачи принятия решений есть фиксированная таксономия и вы можете записать правила, контрастивный метод — это то, что можно запустить на собственных данных с собственными фокусными фактами, поверх любой базовой модели, которую вы предпочитаете. 9B LoRA — это в равной мере демонстрация метода и продукт.
Переносимость Laya устроена иначе и дополняет другие решения. Благодаря тому, что она небольшая, работает на CPU и существуют порты ONNX и MLX, Laya — это модель, которую можно поместить внутрь процесса, где нет GPU и сети. В стороннем бенчмарке для браузерных агентов Laya выполнила 0 из 50 задач и преждевременно объявила о завершении в 33 попытках — но авторы бенчмарка отмечают, что она обучалась для работы, связанной с вынесением суждений, такой как обработка обращений в поддержку, счетов и анализ трассировок агентов, а не для навигации. Воспринимайте этот результат как заявление об области применения, а не как вердикт, и он согласуется с позиционированием обоих проектов: это компоненты для конкретного класса решений, а не универсальные агенты.
Ни Laya, ни Nimble не являются размещёнными моделями на OrcaRouter. Обе — это веса, которые вы запускаете сами, и ничто в этом материале не должно восприниматься как утверждение, будто мы их обслуживаем. Причина, по которой продукт маршрутизации вообще упоминается, та же, по которой он возникает в любой архитектуре с моделью принятия решений: модель принятия решений отвечает на один вызов, а приложению вокруг неё всё ещё нужен текст. Пайплайну, который использует Nimble, чтобы оценить, соответствует ли черновик требованиям, и Laya, чтобы маршрутизировать исключение, всё равно понадобится генеративная модель, чтобы написать черновик. Сохранение этой генеративной половины на одном endpoint, совместимом с OpenAI — 200+ моделей, цена из прайс-листа провайдера передаётся с наценкой 0%, так что снижение цены поставщиком вступает в силу в тот же день, автоматическое переключение при сбое между провайдерами — означает, что слой принятия решений можно заменить, не трогая контракт генеративного слоя.
Вердикт — и эксперимент, который мог бы его изменить
Выбирайте Nimble, если ваша таксономия фиксирована и узка, входные данные — английские и короткие, у вас есть GPU, и вам нужен рецепт данных не меньше, чем сама модель. Выбирайте Laya, если вам нужен многоязычный ввод, бюджет менее 40 мс или процесс вообще без GPU — и с самого начала закладывайте дообучение в бюджет, потому что zero-shot чекпойнт находится ниже тривиального бейзлайна, и в карточке модели так и написано.
Эксперимент, который позволил бы это решить, — это парная оценка на реальном трафике: одни и те же входные данные, одни и те же наборы опций, одни и те же пороги уверенности, оценка по человеческим меткам, с диаграммой надёжности для каждого. Собственная документация Nimble предупреждает, что его вероятности — это не показатели корректности, а карточка Laya сообщает об ошибке калибровки 0.466 до повторной подгонки, так что именно эта диаграмма — тот артефакт, который действительно подскажет, какую модель ставить перед продакшеном. Ни один из проектов не опубликовал её, и ни один не опубликовал диаграмму другого. Постройте её на своих собственных данных, прежде чем устанавливать порог.

