
RSI-Jev vs Jev 1.13: один скачиваешь, другой вызываешь
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Поставьте RSI-Jev v6.1-VL 4B и Jev 1.13рядом — и первое, что заметит клиент, — это то, что перед ним один и тот же запрос. Передайте любому из них состояние и набор типизированных вопросов — да/нет, выбор одного из k, оценку по шкале — и оба вернут откалиброванную вероятность для каждого варианта за один прямой проход, без сгенерированного текста, который нужно разбирать. Это не совпадение: RSI-Jev намеренно создан так, чтобы говорить в формате передачи данных Jev, поэтому клиент, написанный под API TypeSafe, заработает с ним, стоит лишь изменить базовый URL. А вот всё, что вокруг вызова, — разное. Jev 1.13 — закрытая коммерческая модель TypeSafe, обслуживаемая с конечной точки, оплачиваемой по мере использования; RSI-Jev v6.1-VL — это чекпойнт на 4,69 млрд параметров с весами под лицензией Apache-2.0, который вы скачиваете и запускаете на собственном оборудовании. Ни одна из них не является ребрендингом другой, ни один поставщик не одобряет другого, и почти каждая цифра в этом сравнении исходит от стороны, которая её произвела.
Дата в этом вопросе имеет значение, потому что этот проект выпускает релиз примерно каждый день. RSI-Jev v6.1-VL 4B был опубликован 2026-10-07 сторонним Shanghua-Gao/RSI-Jev проектом — самоулучшающимся исследовательским циклом, который обучает модели принятия решений в стиле Jev и публикует каждый неудачный вариант вместе с теми, что победили. Это восьмой релиз за тринадцать дней в этой линейке, и он представляет собой усреднение весов предыдущего релиза со вторым дообучением той же Qwen3.5-4B-Base. Jev 1.13 — модель TypeSafe AI, выпущенная 2026-09-15 и включённая в наш собственный каталог с 2026-09-24. Обе эти даты важны для дальнейшего, потому что сравнение с проектом, который обновляется ежедневно, имеет срок годности, измеряемый днями.
Что оба они на самом деле собой представляют — по одной строке на каждого.
Jev 1.13 — это размещённая модель принятия решений, доступная через выделенный эндпоинт — POST /v1/systemone, без потоковой передачи, с бюджетом входных данных примерно в 64 000 токенов, которые суммарно охватывают состояние и все ваши вопросы, по цене $0,042 за миллион входных токенов, при этом вывод тарифицируется по нулю, поскольку выходных токенов нет. Её архитектура, количество параметров и вычислительные ресурсы, затраченные на обучение, не раскрываются; TypeSafe заявила, что подробности держат в секрете и что, возможно, за этим последует статья. Вы не запускаете её. Вы вызываете её, и каждый вызов — это тарифицируемый сетевой запрос.
RSI-Jev v6.1-VL — это другая полноценная конфигурация. Это башня Qwen3.5-4B-Base, дообученная end-to-end, с головами принятия решений на слоях 16, 20 и 32, обслуживаемая из самодостаточного чекпоинта размером 9,7 ГБ в bf16. Количество параметров — 4,69 млрд, и полезно знать, куда они уходят: 3,57 млрд в 32 слоях декодера, 0,64 млрд в эмбеддингах токенов, 0,33 млрд в визуальной башне, 0,05 млрд в основной голове принятия решений и 0,10 млрд в двух головах раннего выхода. Здесь нет ни смеси экспертов, ни второй модели. Вы устанавливаете его с помощью pip-команды из репозитория, запускаете его сервер, и с этого момента решение никогда не покидает вашу инфраструктуру.
• Кто этим управляет — тарифицируемый хостируемый эндпоинт, который вы не контролируете, против чекпойнта размером 9,7 ГБ на вашем собственном GPU, Apple Silicon или CPU.
• Структура цены — $0.042 за миллион входных токенов, вывод бесплатный, оплата за вызов против нуля на марже плюс стоимость машины и эксплуатационных расходов.
• Бюджет входных данных — около 64 000 токенов на запрос у размещённой модели против 32 768 текстовых токенов плюс бюджета изображений у контрольной точки; всё, что длиннее, отклоняется, а не усекается.
• Веса и лицензия — закрытые, нераскрытый размер против весов Apache-2.0, кода MIT, 4,69 млрд параметров.
• Модальность — текст для контракта Jev против текста плюс до четырёх изображений на запрос в релизах RSI-Jev с поддержкой зрения.
• Право собственности — коммерческая модель TypeSafe AI в сравнении со сторонним исследовательским проектом, который в строке собственной лицензии указывает: «Не связан с TypeSafe AI».
Счёт на собственном табло RSI-Jev, и почему это лишь половина сравнения
Число, с которого проект начинает, — это его оценка по Decision Index 0.3: 50.98 для v6.1-VL 4B против 46.23 у предыдущего релиза. Это полный прогон конфигурации по умолчанию — 140 178 запросов, покрытие 1.0, — и на собственной публичной доске проекта, датированной 2026-10-06, он идёт наравне с лучшей 4B-моделью на этой доске (50.98 против 50.82 у ezjev 4B s2, что набор считает ничьей при 0.25) и занимает 27-е место из 113 в общем зачёте. В более старой версии Decision Index 0.2.1 он показывает 50.74 против 46.24 у v6.0-VL. Его набор из пятнадцати бенчмарков, приводимый без open_jev_ood задачи, которая, как выяснилось, пересекается со строками обучающих данных, составляет 0.793, а его отложенный набор — 0.729.
Каждый из этих показателей получен самим RSI-Jev и измерен на его собственном тестовом стенде. Decision Index — публичная таблица бенчмарков, но показателя Jev 1.13 в ней нет, потому что набор тестов проекта создавался для оценки открытых чекпоинтов принятия решений, а Jev — закрытый эндпоинт. Поэтому соблазн сопоставить 50,98 с 0,727 Jev в бенчмарке typed-decisions и объявить победителя — это как раз та ошибка, которой следует избегать: эти два числа получены на разных тестовых стендах, при разных объёмах выборок и на разных данных, и никто не прогонял один и тот же тестовый стенд на обеих моделях.

Единственное прямое сравнение, которое существует, — это сравнение Laya, а не RSI-Jev.
Есть одно опубликованное сравнение, которое действительно ставит показатель Jev рядом с открытым чекпойнтом, и его не проводила ни одна из сторон, о которых здесь идёт речь. Convai Innovations, создатели модели принятия решений Laya, свели в таблицу опубликованные показатели TypeSafe Jev 1.13.0 со своими и сами отметили ограничения: показатели Jev опубликованы третьей стороной и никогда не измерялись Convai, размеры выборок и промпты различаются, а вендор не приводит собственных бенчмарков для модели. Эту таблицу стоит читать для калибровки, а не для вердикта — и в ней вовсе нет RSI-Jev, потому что RSI-Jev не существовал на момент её публикации.
А вот что оно показывает, так это очертания вопроса «хостинговые модели против открытых», который читатель на самом деле взвешивает. Хостинговая модель лидирует там, где пространство вариантов велико и модели нужно удерживать широкий набор ответов стабильным; открытые модели выигрывают по чистой задержке на один вызов, потому что в пути нет сети. Ничто в этой закономерности не говорит, какая из этих двух конкретных моделей лучше справляется с вашей задачей, и честная позиция такова: публичного ответа на этот вопрос пока не существует.
Что даёт контрольная точка такого, чего не может дать конечная точка
Самый сильный аргумент в пользу RSI-Jev — не оценка. А то, что веса лежат на вашем диске. Для решения о маршрутизации, принимаемого на основе медицинской карты, юридического документа или истории клиентского счёта, «данные никогда не покидают здание» — это не предпочтение, которым вы торгуете против пункта бенчмарка, — это жёсткое требование, и ни одна хостируемая конечная точка ни за какую цену его не удовлетворяет. Это же свойство снимает ограничение скорости: документация самого вендора для хостируемой модели отмечает, что её лимиты настраиваются динамически и могут меняться без уведомления, а у самостоятельно размещённого чекпоинта нет такого потолка, кроме вашего оборудования.
Второе, что даёт чекпойнт, — это управление глубиной, и это необычно. Поскольку головы принятия решений находятся на трёх глубинах, параметр усилия определяет, сколько слоёв может использовать запрос: низкий останавливается на слое 16, медиана — около 23 мс, средний — на 20-м за 27 мс, высокий — на 32-м примерно за 40 мс, а авто отвечает на первом достаточно уверенном выходе, используя в среднем 19,5 из 32 слоёв в наборе тестов проекта. Эти задержки — собственные цифры проекта, замеренные на одном H200 в bf16, и их не следует смешивать ни с какими показателями хостинговых сервисов — локальный прямой проход и тарифицируемый вызов API — это не одно и то же измерение, и собственная документация RSI-Jev прямо указывает, что в её более раннем сравнении с опубликованной задержкой Jev локальная работа GPU противопоставлялась сетевому круговому обмену.
Третье — это изображения. Контракт Jev — на входе текст, на выходе структурированный JSON. Релизы RSI-Jev vision принимают от одного до четырёх изображений на запрос в виде data URL в кодировке base64, при этом состояние ссылается на каждое с помощью маркера, а v6.1-VL набирает 0,834 на отложенном наборе изображений проекта. Если ваше решение — «показывает ли фотография видимые повреждения», то это возможность, которую хостируемый контракт вообще не предлагает.
То, от чего вы отказываетесь, тоже реально, и проект это публикует. Калибровка в этом релизе стала хуже, а не лучше: итоговая ожидаемая ошибка калибровки составляет 0,048 на слое 32 и 0,055 при использовании авто, против 0,036 и 0,024 в предыдущем релизе. Единый порог по умолчанию 0,95 поставляется явно неподтверждённым — это резервный вариант правила отбора, собственный выбор которого, 0,85, не достиг проектного ограничения по глубине на половине его данных для разработки. Ранние выходы читают только текст, поэтому любой вопрос с изображением прогоняет все 32 слоя независимо от уровня усилий. И пять из источников обучающих данных для изображений являются некоммерческими или только для исследований, причём проект прямо заявляет, что вопрос о том, наследуют ли веса, обученные на некоммерческих данных, эти условия, не решён.
Где вызывать хостируемый вариант, а где — нет.
Это та часть сравнения, в которой мы заинтересованы, поэтому стоит быть точными. Мы предоставляем коммерческую модель TypeSafe как typesafe/jev-1.13 на выделенном эндпоинте systemone — POST на /v1/systemone, а не в формате chat-completions от OpenAI, без потоковой передачи, в рамках контекста на 65 536 токенов, указанного в нашем каталоге. Это та же форма запроса и ответа, которую реализует RSI-Jev, — от модели, чей контракт копирует проект. Сам RSI-Jev мы не размещаем; в нашем каталоге нет ни идентификатора rsi-jev, ни идентификатора shgao, и читатель, которому нужна эта модель, скачивает её.
Причина, по которой это различие здесь важно, узкая и конкретная. Слой принятия решений редко составляет весь рабочий процесс — обычно он соседствует с генеративной моделью, которая пишет ответ, резюме или код. Исторически это означало два контракта. Для размещённой части так быть уже не обязано: Jev 1.13 работает на том же ключе, что и 200+ других моделей, по прейскурантной цене провайдера, передаваемой без наценки, поэтому если TypeSafe меняет тариф, на нашей стороне изменение вступает в силу в тот же день, а не в следующем расчётном цикле. У самостоятельно размещённой части такой проблемы никогда не было, потому что провайдер — вы. Чистый способ выбрать между ними — сначала опробовать коммерческий контракт на нескольких ваших собственных размеченных случаях, посмотреть, достаточно ли хорошо поведение «из коробки», чтобы автоматизировать на его основе, и только затем решить, стоит ли запускать чекпойнт на 4,69 млрд параметров самостоятельно с учётом эксплуатационных затрат.

Какой из них вам действительно стоит выбрать
Выбирайте RSI-Jev v6.1-VL 4B, если решение должно оставаться внутри вашего периметра, если вам нужно решение и по изображению, и по тексту, если ваши наборы вариантов исчисляются сотнями (этот чекпойнт допускает до 5 120 вариантов на вопрос) или если вы хотите настраивать глубину и задержку для каждого запроса. Приступайте, зная, что вы берёте проект, который переезжал восемь раз за тринадцать дней, что его последний релиз обменял калибровку на точность и что его собственная карточка называет те части политики выхода, которые он не смог подтвердить.
Выбирайте Jev 1.13, если хотите, чтобы решение работало без serving-стека, если вам важен эндпоинт, который поддерживает кто-то другой, и если цена $0,042 за миллион входных токенов — при отсутствии выходных токенов, которые нужно измерять, — невысока для вашего объёма вызовов. Приступайте, зная, что вы вызываете закрытую модель, размер которой не раскрыт, её лимиты скорости могут меняться без предупреждения, а опубликованные бенчмарки вы не можете перезапустить самостоятельно.
То, что у них общего, полезнее того, что их разделяет, и именно поэтому сравнение вроде этого вообще стоит писать. Ни одна из моделей не генерирует текст, поэтому ни одна не привносит класс сбоев, свойственный модели, которая забывает закрыть фигурную скобку или выдумывает поле. Обе возвращают вероятности, и в обоих случаях вероятность — это то, что нужно проверить на собственных размеченных данных, прежде чем автоматизировать на её основе: задержка уже стала обычным товаром, а значение уверенности — это то, что приходится заслуживать при каждом развёртывании. С какой бы стороны границы между скачиванием и вызовом вы ни оказались, сначала проверьте калибровку.

