Сгенерированная титульная карточка для RSI-Jev против Jev 1.13 с надписью «Один скачиваешь. Один вызываешь.», с левой карточкой с надписью «RSI-Jev v6.1-VL 4B», несущей иконку загрузки и строку «веса Apache-2.0, 4.69B», с правой карточкой с надписью «Jev 1.13», несущей иконку облачного эндпоинта и строку «Хостируемый API, $0.042 / 1M вх.», соединительной линией между двумя карточками и подписью «Одинаковый формат передачи, разные контракты». Логотип OrcaRouter скомпонован в правом нижнем углу.
Guides & Insights

RSI-Jev vs Jev 1.13: один скачиваешь, другой вызываешь

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Поставьте RSI-Jev v6.1-VL 4B и Jev 1.13рядом — и первое, что заметит клиент, — это то, что перед ним один и тот же запрос. Передайте любому из них состояние и набор типизированных вопросов — да/нет, выбор одного из k, оценку по шкале — и оба вернут откалиброванную вероятность для каждого варианта за один прямой проход, без сгенерированного текста, который нужно разбирать. Это не совпадение: RSI-Jev намеренно создан так, чтобы говорить в формате передачи данных Jev, поэтому клиент, написанный под API TypeSafe, заработает с ним, стоит лишь изменить базовый URL. А вот всё, что вокруг вызова, — разное. Jev 1.13 — закрытая коммерческая модель TypeSafe, обслуживаемая с конечной точки, оплачиваемой по мере использования; RSI-Jev v6.1-VL — это чекпойнт на 4,69 млрд параметров с весами под лицензией Apache-2.0, который вы скачиваете и запускаете на собственном оборудовании. Ни одна из них не является ребрендингом другой, ни один поставщик не одобряет другого, и почти каждая цифра в этом сравнении исходит от стороны, которая её произвела.

Дата в этом вопросе имеет значение, потому что этот проект выпускает релиз примерно каждый день. RSI-Jev v6.1-VL 4B был опубликован 2026-10-07 сторонним Shanghua-Gao/RSI-Jev проектом — самоулучшающимся исследовательским циклом, который обучает модели принятия решений в стиле Jev и публикует каждый неудачный вариант вместе с теми, что победили. Это восьмой релиз за тринадцать дней в этой линейке, и он представляет собой усреднение весов предыдущего релиза со вторым дообучением той же Qwen3.5-4B-Base. Jev 1.13 — модель TypeSafe AI, выпущенная 2026-09-15 и включённая в наш собственный каталог с 2026-09-24. Обе эти даты важны для дальнейшего, потому что сравнение с проектом, который обновляется ежедневно, имеет срок годности, измеряемый днями.

Что оба они на самом деле собой представляют — по одной строке на каждого.

Jev 1.13 — это размещённая модель принятия решений, доступная через выделенный эндпоинт — POST /v1/systemone, без потоковой передачи, с бюджетом входных данных примерно в 64 000 токенов, которые суммарно охватывают состояние и все ваши вопросы, по цене $0,042 за миллион входных токенов, при этом вывод тарифицируется по нулю, поскольку выходных токенов нет. Её архитектура, количество параметров и вычислительные ресурсы, затраченные на обучение, не раскрываются; TypeSafe заявила, что подробности держат в секрете и что, возможно, за этим последует статья. Вы не запускаете её. Вы вызываете её, и каждый вызов — это тарифицируемый сетевой запрос.

RSI-Jev v6.1-VL — это другая полноценная конфигурация. Это башня Qwen3.5-4B-Base, дообученная end-to-end, с головами принятия решений на слоях 16, 20 и 32, обслуживаемая из самодостаточного чекпоинта размером 9,7 ГБ в bf16. Количество параметров — 4,69 млрд, и полезно знать, куда они уходят: 3,57 млрд в 32 слоях декодера, 0,64 млрд в эмбеддингах токенов, 0,33 млрд в визуальной башне, 0,05 млрд в основной голове принятия решений и 0,10 млрд в двух головах раннего выхода. Здесь нет ни смеси экспертов, ни второй модели. Вы устанавливаете его с помощью pip-команды из репозитория, запускаете его сервер, и с этого момента решение никогда не покидает вашу инфраструктуру.

• Кто этим управляет — тарифицируемый хостируемый эндпоинт, который вы не контролируете, против чекпойнта размером 9,7 ГБ на вашем собственном GPU, Apple Silicon или CPU.

• Структура цены — $0.042 за миллион входных токенов, вывод бесплатный, оплата за вызов против нуля на марже плюс стоимость машины и эксплуатационных расходов.

• Бюджет входных данных — около 64 000 токенов на запрос у размещённой модели против 32 768 текстовых токенов плюс бюджета изображений у контрольной точки; всё, что длиннее, отклоняется, а не усекается.

• Веса и лицензия — закрытые, нераскрытый размер против весов Apache-2.0, кода MIT, 4,69 млрд параметров.

• Модальность — текст для контракта Jev против текста плюс до четырёх изображений на запрос в релизах RSI-Jev с поддержкой зрения.

• Право собственности — коммерческая модель TypeSafe AI в сравнении со сторонним исследовательским проектом, который в строке собственной лицензии указывает: «Не связан с TypeSafe AI».

Счёт на собственном табло RSI-Jev, и почему это лишь половина сравнения

Число, с которого проект начинает, — это его оценка по Decision Index 0.3: 50.98 для v6.1-VL 4B против 46.23 у предыдущего релиза. Это полный прогон конфигурации по умолчанию — 140 178 запросов, покрытие 1.0, — и на собственной публичной доске проекта, датированной 2026-10-06, он идёт наравне с лучшей 4B-моделью на этой доске (50.98 против 50.82 у ezjev 4B s2, что набор считает ничьей при 0.25) и занимает 27-е место из 113 в общем зачёте. В более старой версии Decision Index 0.2.1 он показывает 50.74 против 46.24 у v6.0-VL. Его набор из пятнадцати бенчмарков, приводимый без open_jev_ood задачи, которая, как выяснилось, пересекается со строками обучающих данных, составляет 0.793, а его отложенный набор — 0.729.

Каждый из этих показателей получен самим RSI-Jev и измерен на его собственном тестовом стенде. Decision Index — публичная таблица бенчмарков, но показателя Jev 1.13 в ней нет, потому что набор тестов проекта создавался для оценки открытых чекпоинтов принятия решений, а Jev — закрытый эндпоинт. Поэтому соблазн сопоставить 50,98 с 0,727 Jev в бенчмарке typed-decisions и объявить победителя — это как раз та ошибка, которой следует избегать: эти два числа получены на разных тестовых стендах, при разных объёмах выборок и на разных данных, и никто не прогонял один и тот же тестовый стенд на обеих моделях.

Headless Chromium capture of the GitHub repository page for Shanghua-Gao/RSI-Jev: the repository header with the Public badge and the counters Fork 5 and Star 80, the repository description about typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents with the checkpoints, the code that produced them and every version that failed, a commit list headed by the merge commit 'Merge pull request #35 from Shanghua-Gao/copy-no-ranking', the file rows for the v6.1-VL weight-averaging work and the v5.0-VL 3B quickstart, the counters 202 commits, 8 tags and 8 releases, the MIT license line, and the topic tags decision-model, jev, lm, system-one and typed-decisions.

Единственное прямое сравнение, которое существует, — это сравнение Laya, а не RSI-Jev.

Есть одно опубликованное сравнение, которое действительно ставит показатель Jev рядом с открытым чекпойнтом, и его не проводила ни одна из сторон, о которых здесь идёт речь. Convai Innovations, создатели модели принятия решений Laya, свели в таблицу опубликованные показатели TypeSafe Jev 1.13.0 со своими и сами отметили ограничения: показатели Jev опубликованы третьей стороной и никогда не измерялись Convai, размеры выборок и промпты различаются, а вендор не приводит собственных бенчмарков для модели. Эту таблицу стоит читать для калибровки, а не для вердикта — и в ней вовсе нет RSI-Jev, потому что RSI-Jev не существовал на момент её публикации.

А вот что оно показывает, так это очертания вопроса «хостинговые модели против открытых», который читатель на самом деле взвешивает. Хостинговая модель лидирует там, где пространство вариантов велико и модели нужно удерживать широкий набор ответов стабильным; открытые модели выигрывают по чистой задержке на один вызов, потому что в пути нет сети. Ничто в этой закономерности не говорит, какая из этих двух конкретных моделей лучше справляется с вашей задачей, и честная позиция такова: публичного ответа на этот вопрос пока не существует.

Что даёт контрольная точка такого, чего не может дать конечная точка

Самый сильный аргумент в пользу RSI-Jev — не оценка. А то, что веса лежат на вашем диске. Для решения о маршрутизации, принимаемого на основе медицинской карты, юридического документа или истории клиентского счёта, «данные никогда не покидают здание» — это не предпочтение, которым вы торгуете против пункта бенчмарка, — это жёсткое требование, и ни одна хостируемая конечная точка ни за какую цену его не удовлетворяет. Это же свойство снимает ограничение скорости: документация самого вендора для хостируемой модели отмечает, что её лимиты настраиваются динамически и могут меняться без уведомления, а у самостоятельно размещённого чекпоинта нет такого потолка, кроме вашего оборудования.

Второе, что даёт чекпойнт, — это управление глубиной, и это необычно. Поскольку головы принятия решений находятся на трёх глубинах, параметр усилия определяет, сколько слоёв может использовать запрос: низкий останавливается на слое 16, медиана — около 23 мс, средний — на 20-м за 27 мс, высокий — на 32-м примерно за 40 мс, а авто отвечает на первом достаточно уверенном выходе, используя в среднем 19,5 из 32 слоёв в наборе тестов проекта. Эти задержки — собственные цифры проекта, замеренные на одном H200 в bf16, и их не следует смешивать ни с какими показателями хостинговых сервисов — локальный прямой проход и тарифицируемый вызов API — это не одно и то же измерение, и собственная документация RSI-Jev прямо указывает, что в её более раннем сравнении с опубликованной задержкой Jev локальная работа GPU противопоставлялась сетевому круговому обмену.

Третье — это изображения. Контракт Jev — на входе текст, на выходе структурированный JSON. Релизы RSI-Jev vision принимают от одного до четырёх изображений на запрос в виде data URL в кодировке base64, при этом состояние ссылается на каждое с помощью маркера, а v6.1-VL набирает 0,834 на отложенном наборе изображений проекта. Если ваше решение — «показывает ли фотография видимые повреждения», то это возможность, которую хостируемый контракт вообще не предлагает.

То, от чего вы отказываетесь, тоже реально, и проект это публикует. Калибровка в этом релизе стала хуже, а не лучше: итоговая ожидаемая ошибка калибровки составляет 0,048 на слое 32 и 0,055 при использовании авто, против 0,036 и 0,024 в предыдущем релизе. Единый порог по умолчанию 0,95 поставляется явно неподтверждённым — это резервный вариант правила отбора, собственный выбор которого, 0,85, не достиг проектного ограничения по глубине на половине его данных для разработки. Ранние выходы читают только текст, поэтому любой вопрос с изображением прогоняет все 32 слоя независимо от уровня усилий. И пять из источников обучающих данных для изображений являются некоммерческими или только для исследований, причём проект прямо заявляет, что вопрос о том, наследуют ли веса, обученные на некоммерческих данных, эти условия, не решён.

Где вызывать хостируемый вариант, а где — нет.

Это та часть сравнения, в которой мы заинтересованы, поэтому стоит быть точными. Мы предоставляем коммерческую модель TypeSafe как typesafe/jev-1.13 на выделенном эндпоинте systemone — POST на /v1/systemone, а не в формате chat-completions от OpenAI, без потоковой передачи, в рамках контекста на 65 536 токенов, указанного в нашем каталоге. Это та же форма запроса и ответа, которую реализует RSI-Jev, — от модели, чей контракт копирует проект. Сам RSI-Jev мы не размещаем; в нашем каталоге нет ни идентификатора rsi-jev, ни идентификатора shgao, и читатель, которому нужна эта модель, скачивает её.

Причина, по которой это различие здесь важно, узкая и конкретная. Слой принятия решений редко составляет весь рабочий процесс — обычно он соседствует с генеративной моделью, которая пишет ответ, резюме или код. Исторически это означало два контракта. Для размещённой части так быть уже не обязано: Jev 1.13 работает на том же ключе, что и 200+ других моделей, по прейскурантной цене провайдера, передаваемой без наценки, поэтому если TypeSafe меняет тариф, на нашей стороне изменение вступает в силу в тот же день, а не в следующем расчётном цикле. У самостоятельно размещённой части такой проблемы никогда не было, потому что провайдер — вы. Чистый способ выбрать между ними — сначала опробовать коммерческий контракт на нескольких ваших собственных размеченных случаях, посмотреть, достаточно ли хорошо поведение «из коробки», чтобы автоматизировать на его основе, и только затем решить, стоит ли запускать чекпойнт на 4,69 млрд параметров самостоятельно с учётом эксплуатационных затрат.

Headless Chromium capture of OrcaRouter's own model page for typesafe/jev-1.13: the breadcrumb 'Home / Models / TypeSafe', the page title Jev 1.13 above the slug typesafe/jev-1.13, the line 'by TypeSafe - 2026-09-24', the description that it is TypeSafe's structured decision and evaluation model taking noul / choice / score questions and returning a structured answer for each, the note 'POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.', the endpoint panel reading /v1/systemone with the price $0.04, our p50 TTFT of 161 ms, 363 ms and 58.9M, and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

Какой из них вам действительно стоит выбрать

Выбирайте RSI-Jev v6.1-VL 4B, если решение должно оставаться внутри вашего периметра, если вам нужно решение и по изображению, и по тексту, если ваши наборы вариантов исчисляются сотнями (этот чекпойнт допускает до 5 120 вариантов на вопрос) или если вы хотите настраивать глубину и задержку для каждого запроса. Приступайте, зная, что вы берёте проект, который переезжал восемь раз за тринадцать дней, что его последний релиз обменял калибровку на точность и что его собственная карточка называет те части политики выхода, которые он не смог подтвердить.

Выбирайте Jev 1.13, если хотите, чтобы решение работало без serving-стека, если вам важен эндпоинт, который поддерживает кто-то другой, и если цена $0,042 за миллион входных токенов — при отсутствии выходных токенов, которые нужно измерять, — невысока для вашего объёма вызовов. Приступайте, зная, что вы вызываете закрытую модель, размер которой не раскрыт, её лимиты скорости могут меняться без предупреждения, а опубликованные бенчмарки вы не можете перезапустить самостоятельно.

То, что у них общего, полезнее того, что их разделяет, и именно поэтому сравнение вроде этого вообще стоит писать. Ни одна из моделей не генерирует текст, поэтому ни одна не привносит класс сбоев, свойственный модели, которая забывает закрыть фигурную скобку или выдумывает поле. Обе возвращают вероятности, и в обоих случаях вероятность — это то, что нужно проверить на собственных размеченных данных, прежде чем автоматизировать на её основе: задержка уже стала обычным товаром, а значение уверенности — это то, что приходится заслуживать при каждом развёртывании. С какой бы стороны границы между скачиванием и вызовом вы ни оказались, сначала проверьте калибровку.

A generated two-column scoreboard titled 'RSI-Jev v6.1-VL 4B vs Jev 1.13 - the scoreboard', six rows across both columns: who runs it, 'You, on your own GPU' against "TypeSafe's hosted endpoint"; weights, 'Apache-2.0, 4.69B' against 'Closed, undisclosed'; input budget, '32,768 tokens' against 'About 64,000 tokens'; price, 'Free at the margin' against '$0.042 per 1M input'; modality, 'Text + up to 4 images' against 'Text only'; and latency, 'Local pass, ~23-40 ms' against 'Metered network call'. A footer reads 'RSI-Jev figures vendor-reported; Jev 1.13 pricing per our catalogue.'