Сгенерированная титульная карточка для RSI-Jev против Laya с надписью «Две открытые модели принятия решений. Противоположные ставки.», с левой карточкой с подписью «RSI-Jev v6.1-VL», содержащей иконку brain-cog и строку «4,69 млрд параметров, zero-shot», и правой карточкой с подписью «Laya», содержащей иконку пера и строку «421 млн параметров, дообучите её», с тонким вертикальным разделителем между двумя карточками и подписью «Обе под Apache-2.0. Ни одна из них не хостится для вас.» Логотип OrcaRouter скомпонован в правом нижнем углу.
Guides & Insights

RSI-Jev vs Laya: две открытые модели принятия решений, противоположные ставки

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

По состоянию на октябрь 2026 года есть две модели с открытыми весами, которые стоит рассмотреть, если вам нужны типизированные решения — да/нет, выбор одного из k, оценка по рубрике — без размещённого эндпоинта в цепочке. Это RSI-Jev v6.1-VL 4B, опубликованная 2026-10-07 сторонним исследовательским циклом Shanghua-Gao/RSI-Jev, и Laya, выпущенная 2026-09-18 компанией Convai Innovations. Обе дают ответ за один прямой проход без генерации текста; обе возвращают калиброванную вероятность для каждого варианта; обе поставляются с весами под лицензией Apache-2.0 и сервером, который поддерживает API решений TypeSafe, так что клиент, написанный для коммерческой модели, работает с любой из них при изменении базового URL. Они также построены на противоположных ставках, и два числа, которые их разделяют, — это от 3 до 4 токенов на метку и 421 миллион параметров.

Первая ставка — это масштаб. Английский чекпойнт Laya — это ModernBERT-large на 421 млн параметров с контекстом в 512 токенов, а её многоязычный чекпойнт — mmBERT-base на 322 млн с окном в 1 024 токена, которое достигает 8 192 при расширенной настройке энкодера. RSI-Jev v6.1-VL использует целую башню Qwen3.5-4B-Base — 4,69 млрд параметров, 3,57 млрд из них в 32 слоях декодера, плюс визуальную башню и три головы принятия решений на слоях 16, 20 и 32. Laya — это модель, три экземпляра которой можно предзагрузить, уложившись в несколько гигабайт; RSI-Jev — это чекпойнт bf16 на 9,7 ГБ. Вторая ставка следует из первой: Laya почти ничего не тратит на вызов и ожидает, что вы научите её вашей предметной области, тогда как RSI-Jev тратит четыре с половиной миллиарда параметров, пытаясь ответить на ваш вопрос вообще без обучения.

Для чего на самом деле нужен каждый из них

В собственной карточке модели Laya есть фраза, которая описывает это сравнение лучше, чем любой рецензент: «Laya — это быстрая база для специализации, а не zero-shot-движок принятия решений». В бенчмарке typed-decisions — 2 000 решений по четырём рабочим процессам — базовый английский чекпоинт набирает 0,362 против 0,318 при случайном угадывании и 0,461 при постоянном выборе класса большинства. На тех же решениях чекпоинт Convai, дообученный на собственной обучающей выборке этого бенчмарка, набирает 0,766, превышая потолок согласия с учителем в 0,735. Этот разрыв и есть продукт: Laya — это 421M-энкодер, который вы дообучаете на узкой таксономии, а Convai предоставляет ноутбук Kaggle, выполняющий весь цикл — собрать датасет, обучить, подобрать температуры калибровки, оценить — на двух бесплатных T4.

RSI-Jev — это другой трейд. Его релиз v6.1-VL набирает 50,98 балла в собственном публичном Decision Index 0.3 — прогоне конфигурации по умолчанию на 140 178 запросов, — что в таблице проекта от 2026-10-06 повторяет результат лучшей тамошней 4B-модели и занимает 27-е место из 113 в общем зачёте. Его набор из пятнадцати бенчмарков даёт 0,793, а отложенная выборка — 0,729. Это показатели zero-shot — хотя проект осторожно оговаривает, что десять из пятнадцати бенчмарков в той или иной форме поставляют обучающие данные, так что «zero-shot» относится к поиску, выполненному в этом релизе, а не к каждой цифре на странице. Что эти цифры действительно дают — так это модель, которая отвечает на вопрос о документе, которого вы ей никогда не показывали, и при этом не требует предварительного прогона обучения.

• Размер — Laya 421M для английского / 322M для многоязычного против RSI-Jev 4.69B, использующего всю башню Qwen3.5-4B-Base.

• Точность в режиме zero-shot — Laya 0,362 на typed-decisions, ниже базовой линии большинства 0,461, против RSI-Jev 50,98 по его собственному Decision Index 0.3, что повторяет лучший результат среди 4B-моделей там.

• Точность после дообучения — Laya 0.766 с чекпоинтом, обученным на собственном разбиении бенчмарка, против показателей RSI-Jev, которые относятся к уровню релиза, а не к отдельным доменам.

• Языки — Laya: 45 из 51 языка пригодны для использования, что более чем втрое превышает случайную серверную маршрутизацию по сравнению с англоцентричным текстом RSI-Jev.

• Модальность — только текст Laya против текста RSI-Jev плюс до четырёх изображений на запрос.

• Контекст — Laya: 512 токенов для английского, 1 024 для многоязычного и до 8 192 для длинных документов против RSI-Jev: 32 768 токенов, отказывается, а не усекает.

• Задержка — Laya 32.8 мс p50 на T4, 7.2 мс на вопрос при размере батча десять против RSI-Jev 22.5 мс при усилии low и около 40 мс на полной глубине, на H200.

Обрыв в количестве опций — самое резкое различие

Обе модели определяют пространство ответов во время запроса, поэтому новая схема не требует дообучения — это общий структурный выигрыш всего этого семейства. Но распределяют они пространство ответов по-разному, и разница проявляется именно на тех задачах, с которыми обычно имеет дело корпоративная маршрутизация. Laya оценивает каждый вариант по его собственному маскированному токену, а варианты делят между собой фиксированный бюджет головы: 192 токена на английском чекпоинте, 256 — на многоязычном. В Banking77 с 77 интентами это даёт примерно три-четыре токена на метку, и точность падает до 0,425. В собственной карточке Convai описан этот обрыв и предложено решение — увеличьте head_max_len до 512, а контекст — до 1 024 или больше, чтобы каждой метке хватило места, либо разбейте большой набор вариантов на двухэтапный выбор от грубого к точному.

Путь обслуживания RSI-Jev допускает до 5 120 вариантов на вопрос. Это не сопоставимый бенчмарк с 0,425 у Laya — эти два показателя измерялись на разных стендах, а потолок числа вариантов — это ограничение конфигурации, а не оценка. Это утверждение о том, какая модель не рухнет, когда в вашей таксономии будет сотня элементов. Если ваши вопросы с выбором — это «оплата / технические вопросы / продажи / другое», подойдёт любая. Если это около сотни меток интентов, одну из этих двух нужно настроить, прежде чем её можно будет использовать, а другую — нет.

Headless Chromium capture of the GitHub repository page for Shanghua-Gao/RSI-Jev: the repository header with the Public badge and the counters Fork 5 and Star 80, the repository description about typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents with the checkpoints, the code that produced them and every version that failed, a commit list headed by the merge commit 'Merge pull request #35 from Shanghua-Gao/copy-no-ranking', the file rows for the v6.1-VL weight-averaging work and the v5.0-VL 3B quickstart, the counters 202 commits, 8 tags and 8 releases, the MIT license line, and the topic tags decision-model, jev, lm, system-one and typed-decisions.

Задержка, языковой вопрос и изображения

Самое громкое заявление Laya касается задержки, и оно не голословно: 32,8 мс p50 для одного вопроса на Tesla T4, 72,3 мс для батча из десяти и 337 мс для пятидесяти — от 103 до 332 вопросов в секунду на одном скромном GPU. Собственные цифры RSI-Jev, замеренные на H200, — 22,5 мс при усилии низком, 26,8 мс при среднем, 39,9 мс по умолчанию и 40,4 мс на полной глубине. Это величины одного порядка, и оба — локальные прямые проходы, а не сетевые вызовы, и именно это сравнение действительно имеет значение, когда хостинговый эндпоинт больше не рассматривается. Обратите внимание, как оба распоряжаются временем: RSI-Jev может намеренно остановиться на слое 16, чтобы получить эти 22,5 мс, и пройти все 32, когда вопрос сложный, а у Laya нет такой настройки — она всегда прогоняет весь свой (небольшой) энкодер.

История с языками разворачивается в обратную сторону и имеет решающее значение для всех, кто не говорит по-английски. Laya поставляет роутер, который определяет письменность значительно менее чем за миллисекунду и направляет в многоязычный чекпоинт, а её опубликованная таблица показывает, что 45 из 51 языка пригодны для использования с результатом выше трёхкратного случайного, против 23 для одного только английского чекпоинта. В её карточке также честно объясняется, почему это важно: английский чекпоинт разваливается на нелатинских письменностях — кхмерский набирает точность 0.000 при уверенности 0.952 — поэтому фильтрация по уверенности не может спасти неверный маршрут. У RSI-Jev нет подобной языковой истории; это ориентированная на английский текстовая модель, которая, так уж вышло, умеет читать изображения.

С изображениями всё зеркально наоборот. RSI-Jev принимает от одного до четырёх за один запрос в виде data URL в кодировке base64 и набрал 0,834 на своём отложенном наборе изображений в этом релизе; поставляемые чекпоинты Laya — это текстовые классификаторы, и хотя порты сообщества, такие как laya-vision, есть на Hub, они не являются продуктом вендора. Если ваше решение принимается по фотографии, диаграмме или скриншоту, то это колонка одной модели, а не другой.

Ни один из них не проходил сравнительное тестирование с другим.

Вот что тихо скрывает сравнение по спецификациям: между этими двумя моделями нет прямого сравнения. Есть прямое сравнение каждой из них с одной и той же закрытой моделью — TypeSafe's Jev 1.13 — и ни одну из них нельзя поставить рядом с другой.

Convai опубликовала одну: на typed-decisions Jev 1.13.0 — 0.727 против 0.766 у Laya с маршрутизацией; на Banking77 Jev — 0.870 против 0.425 у Laya; на калибровке Jev — 0.246 против 0.081 у Laya после исправления температуры. Convai отмечает собственные ограничения в той же таблице — цифры Jev опубликованы третьей стороной, у них никогда не было API-доступа для его измерения, а размеры выборок и промпты различаются. Сравнением RSI-Jev служит Decision Index — это публичный совет RSI-Jev, в котором вообще нет записи о Jev. Таким образом, единственные внешние цифры, которые касаются обеих этих моделей, происходят из стендов, созданных сторонами, которые их продают, и разумное прочтение любой отдельной цифры выше — «это то, что измерил производитель, на задаче производителя».

Что оба проекта делают хорошо — и что случается редко — так это публикуют свои собственные слабые места. RSI-Jev называет пять некоммерческих источников изображений, лежащих в основе его vision-релизов, и прямо говорит, что вопрос о том, наследуют ли обученные на них веса эти условия, не решён; он сообщает о регрессии калибровки в своём новейшем релизе и называет свой порог выхода по умолчанию неподтверждённым. Laya документирует, что её базовые чекпоинты находятся ниже базовой линии большинства, что её порядковые score вопросы — её самый слабый примитив, что её noul может следовать собственным меткам вариантов, а не состоянию, и что одно из её полей ответа не несёт полезного сигнала. Эта честность — самое полезное, что можно унаследовать от любого из этих проектов: проверьте значения уверенности на своих собственных размеченных примерах, прежде чем строить на их основе автоматизацию.

Headless Chromium capture of OrcaRouter's own model page for typesafe/jev-1.13: the breadcrumb 'Home / Models / TypeSafe', the page title Jev 1.13 above the slug typesafe/jev-1.13, the line 'by TypeSafe - 2026-09-24', the description that it is TypeSafe's structured decision and evaluation model taking noul / choice / score questions and returning a structured answer for each, the note 'POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.', the endpoint panel reading /v1/systemone with the price $0.04, our p50 TTFT of 161 ms, 363 ms and 58.9M, and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

Где на самом деле находится контракт, который они копируют

Обе эти модели существуют потому, что один формат передачи данных стоило скопировать. Jev от TypeSafe определяет форму запроса — состояние, вопросы, три типизированных примитива — и форму ответа, и обе реализации, Laya и RSI-Jev, следуют ей, так что существующий клиент работает после смены базового URL. Эта эталонная модель, typesafe/jev-1.13, — единственная из трёх, которую обслуживаем мы: она есть в нашем каталоге на выделенном эндпоинте systemone, это POST на /v1/systemone, без потоковой передачи, с контекстом 65 536 токенов, по цене $0.042 за миллион входных токенов, а вывод тарифицируется по нулю. Ни Laya, ни RSI-Jev нет в нашем каталоге — обе доступны для скачивания, и в этом их суть.

Практическая сторона этого важнее сравнения. Слои принятия решений почти никогда не бывают одни в стеке; они стоят рядом с генеративной моделью, которая пишет ответ, резюме или код. Наличие эталонного контракта на том же ключе, что и у 200+ других моделей, по каталожной цене провайдера, передаваемой с наценкой 0%, означает, что изменение тарифов поставщика доходит до вас в тот же день, а автоматическое переключение при сбое означает, что генеративная половина этой пары не является единой точкой отказа, пока вы выясняете, достаточно ли хороша дешёвая половина для принятия решений. Если вы решите, что правильный выбор — самостоятельно размещённый энкодер 421M или чекпоинт 4.69B, вам всё равно нужно, чтобы контракт, которому он соответствует, был доступен из того же места — а если вы предпочитаете не запускать ни то, ни другое, модель, которую копируют обе, находится всего в одном запросе от вас.

Какой из них скачать?

Выбирайте Laya, если у вас есть размеченные данные, таксономия, которая не сильно меняется, и языковая смесь, которая не ограничивается только английским. Она достаточно мала, чтобы запускать множество экземпляров, достаточно быстра, чтобы ставить перед каждым запросом, и с самого начала разработана для тонкой настройки — результат 0.766 после тонкой настройки против 0.362 zero-shot — это и есть весь аргумент. Заложите в бюджет затраты на обучение, разметку и перенастройку температуры для каждого типа вопросов, которая снижает ошибку калибровки с 0.466 до 0.081, и держите наборы вариантов в пределах примерно двадцати меток или увеличьте бюджет головы, прежде чем доверять крупной классификации.

Выбирайте RSI-Jev v6.1-VL, если вы хотите, чтобы решение работало без предварительного обучения, если ваши вопросы иногда касаются изображения, если ваши наборы вариантов велики или если вы хотите обменять задержку на глубину при обработке каждого запроса. Ожидайте, что придётся запускать чекпойнт на 9,7 ГБ, а не на 400M, ожидайте проекта, который выпустил восемь релизов за тринадцать дней и может выпустить ещё один, пока вы оцениваете этот, и ожидайте, что придётся самостоятельно проверить его калибровку — в собственной карточке этого релиза сказано, что он стал хуже, а не лучше.

Что бы вы ни выбрали, справедливы две вещи. Ни одна из моделей не генерирует текст, поэтому ни одна не может дать сбой, выдав неправильно сформированное поле; обе возвращают вероятности, и именно вероятность — это то, что нужно проверять при каждом развёртывании, а не брать из карточки. И обе сместили интересный вопрос о слое принятия решений с «чей API» на «чьи веса» — а это вопрос, который задавать лучше, и на него эта пара отвечает совершенно по-разному.

A generated two-column scoreboard titled 'RSI-Jev v6.1-VL vs Laya - the scoreboard', six rows across both columns: size, '4.69B parameters' against '421M English / 322M multilingual'; zero-shot, '50.98 Decision Index' against '0.362 typed-decisions'; fine-tuned, 'Not per-domain' against '0.766 on its own split'; languages, 'English-centric' against '45 of 51 usable'; modality, 'Text + up to 4 images' against 'Text only'; and latency, '~23-40 ms on an H200' against '32.8 ms p50 on a T4'. A footer reads 'Both vendor-reported; neither has been benchmarked against the other.'