
Что такое RSI-Jev? Самоулучшающийся цикл, который строит модели принятия решений в стиле Jev
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 145 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 296 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
RSI-Jev — это сторонний открытый исследовательский проект, который создаёт модели принятия решений System One в стиле Jev, а модель, которой посвящена эта страница, — это его 4B-релиз RSI-Jev v6.0-VL от 2026-10-06. Его написал Shanghua Gao (@gasvn), а Sufian (@SufianTA) указан в благодарностях репозитория; он не является Jev от TypeSafe и не аффилирован с TypeSafe AI — в собственной строке лицензии проекта сказано именно это. Идея, лежащая в его основе, достаточно узка, чтобы сформулировать её одним предложением: задайте типизированный вопрос о документе, чате или изображении — да/нет, выбор одного из k, оценка по рубрике — и один прямой проход возвращает калиброванную вероятность для каждого варианта. Ничего не генерируется, поэтому нет токенов рассуждений, которые нужно было бы тратить, и они не тратятся. v6.0-VL — не первый релиз проекта; это его седьмой за двенадцать дней, и это самое важное, что нужно о нём понять, потому что полезная информация здесь — в форме линии, а не в каком-либо отдельном чекпоинте.
Об одном нужно сказать раньше любых цифр, потому что это датирует их все. v6.0-VL возглавлял список ровно один день. 2026-10-07 в 07:56 UTC — сегодня утром — проект опубликовал RSI-Jev v6.1-VL — это усреднение v6.0-VL с весом 0,5 каждое со вторым файнтюном той же Qwen3.5-4B-Base, обученным на других данных; он набирает 50,98 в наборе Decision Index 0.3 проекта против 46,23 у v6.0-VL в том же наборе. После усреднения ничего не обучалось. Его калибровка хуже, чем у v6.0-VL, и в его собственной карточке так и сказано. Этот релиз реален и актуален; эта страница не о нём. Каждая цифра ниже взята из записи о релизе v6.0-VL, датированной 2026-10-06, и там, где какой-либо счётчик с тех пор изменился — счёт релизов, счёт экспериментов — эта страница приводит и значение, каким оно было для v6.0-VL, и значение, каким оно читается сегодня.
То, чем RSI-Jev не является, тоже стоит сказать в начале, потому что два из трёх очевидных предположений неверны. Это не хостируемый продукт, который можно сегодня вызвать через общий API, и его не обслуживает OrcaRouter — в нашем каталоге нет ни id rsi-jev, ни id shgao, ни карточки модели для него. Единственное, что у нас есть, — это модель, HTTP-контракт которой копирует этот проект: коммерческий Jev от TypeSafe, который мы обслуживаем как typesafe/jev-1.13 на эндпоинте systemone. Один из этих двух вы вызываете, а другой скачиваете и обслуживаете сами. Всё ниже взято из собственного репозитория проекта, релизных карточек и документации по обслуживанию, прочитанных 2026-10-07, и там, где число принадлежит самому проекту, а не внешнему измерению, на этой странице указано, чьё оно.

Что эта штука на самом деле делает
Проект описывает себя одной строкой как «рекурсивно самоулучшающуюся исследовательскую систему, которая строит модели System One в стиле Jev», а создаваемые им артефакты — это решатели, а не генераторы. Вы передаёте ему состояние — документ, расшифровку чата, транзакцию, а в vision-релизах — до четырёх изображений — и один или несколько типизированных вопросов с именованными критериями. Он возвращает для каждого вопроса вероятность для каждого варианта. Три типа вопросов покрывают это пространство, и именно их определяет API TypeSafe:
• новое — суждение «истина/ложь», возвращаемое в виде единственной вероятности, без распределения и без значения уверенности, точно совпадающее по форме с ответом эталона.
• выбор — выберите один из набора помеченных вариантов; возвращается вместе с полным распределением вероятностей и статистикой уверенности.
• оценка — оценка по упорядоченной рубрике, возвращается как взвешенный по вероятностям индекс уровней с отсчётом от нуля, а также легенда и распределение.
Поскольку шага генерации нет, нет и второго вызова модели и сэмплирования. Решение о документе, который модель уже прочитала, по своей конструкции является дешёвой операцией, а собственная формулировка проекта об этой стоимости — «около 10 мс» — относится к его эпохе 2B, а не к текущему релизу; измеренные показатели для v6.0-VL приведены ниже.
Два факта о принадлежности важнее всего остального на этой странице. RSI-Jev — не работа TypeSafe, и TypeSafe не давала на это одобрения. Строка лицензии, приведённая полностью: «Код: MIT. Веса: Apache-2.0, как у базовой модели; некоторые источники изображений для обучения некоммерческие, перечислены на карточке каждой модели. Не аффилирован с TypeSafe AI.» И связь односторонняя: проект намеренно копирует формат передачи данных Jev и говорит об этом, потому что совместимый сервер — в этом весь смысл. «В стиле Jev» — это собственная формулировка проекта для того типа модели, которую он создаёт. Jev от TypeSafe — это другая, закрытая, коммерческая модель, и эти две — не одно и то же под более коротким названием.
Внутри текущей модели: 4B-башня Qwen с тремя выходами
RSI-Jev v6.0-VL — это башня Qwen3.5-4B-Base с дообученной башней и обученной головой принятия решений поверх неё. Это вся архитектура — здесь нет смеси экспертов, нет маршрутизатора и нет второй модели. Она запускает всю базовую модель, поэтому число её параметров составляет 4,69 млрд, а не что-то меньшее: 3,57 млрд приходятся на 32 слоя декодера, 0,64 млрд — на эмбеддинги токенов, 0,33 млрд — на визуальную башню, 0,05 млрд — на основную голову принятия решений и 0,10 млрд — на две головы раннего выхода. Выпущенный чекпойнт является самодостаточным и занимает 9,7 ГБ в bf16.
Три решающие головы прикреплены на слоях 16, 20 и 32 базовой модели, и они — механизм, стоящий за всем, чем известен текущий релиз. Четвёртый выход на слое 12 был построен, измерен и отброшен — «Выход на слое 12 проигрывал каскаду из 16 при каждом сравнении и не входит в пакет» — так что три поставляются, а четыре нет. Выходы читают отсоединённую копию своего слоя — деталь, которую проект обнаружил на горьком опыте: перенастройка голов на стволе, выходы которого были прикреплены во время обучения, не восстановила точность глубоких слоёв, поэтому именно отсоединение выходов восстановило глубину.
Одно число здесь — самый простой способ неправильно понять проект. Всё вплоть до v3.0 включительно было моделью 2B на Qwen3.5-2B-Base, и это линия происхождения, а не текущая модель. v4.0-VL была 2B, v5.0-VL сократила модель до 3B, а v6.0-VL — 4B. Страница, которая называет текущую модель RSI-Jev моделью 2B, отстала на три релиза.
Цикл и есть настоящий проект
Модели — это результат; то, что создаётся, — это процесс. В проекте сказано, что «цикл, ведущий исследования, — это следующая версия AutoScientists», самоорганизующейся системы команд агентов, опубликованной лабораторией Зитник в Гарварде, и работает она именно так, как подразумевает эта фраза. ИИ-агенты предлагают гипотезы, регистрируют свои прогнозы до того, как потратить время GPU, проводят эксперименты и отправляют в отставку собственных чемпионов, когда данные говорят, что пора. Два числа делают это наглядным. На 2026-10-07 в шапке репозитория значится восемь релизов за тринадцать дней, с v1.0 до v6.1-VL; для собственного релиза v6.0-VL от 2026-10-06 там было семь релизов за двенадцать дней, и каждый из них обучен, оценён и задокументирован циклом. А счётчик экспериментов, который на момент выхода релиза этой страницы равнялся 471, сегодня показывает 496 — и каждый описан, включая неудачи. Оба числа принадлежат самому проекту, и оба меняются.
Дисциплина — это то, что наполняет эти числа смыслом, и проект прямо её перечисляет. Нулевые пороги измеряются, а не предполагаются — варианты, доказуемо идентичные контролю, подтверждённые по идентичности объектов до того, как потрачено хоть какое-то время GPU, так что разброс между ними — это уровень шума, и разница меньше этого разброса не является результатом. Прогнозы регистрируются до запуска, так что версия, не дотянувшая до собственной планки, выходит как неудача, а не тихо перекраивается. Артефакты проверяются: чекпойнт перезагружается с диска и переоценивается, и публикуется только если воспроизводит предсказания по каждому вопросу из своего обучающего прогона — что оба чекпойнта v1.0 делают с показателем 1.0000. Контаминация «проверяется, а не утверждается». И неудачи публикуются, включая те, что убили собственного чемпиона проекта.
Что такое вклад, словами самого проекта из его руководства по участию: «Вклад здесь — это обычно измерение, а не патч». Запись о релизах хранится как цепочка, а не как снимок — «versions/ хранит по одной карточке на каждый релиз, все они, в main навсегда… Эта цепочка И ЕСТЬ проект» — поэтому числа старого релиза можно сверить с тем, что проект говорит о них позже, и поэтому единственная поправка, обсуждаемая ниже, видна, а не замалчивается.
Что изменилось в v6.0-VL: он тратит глубину вместо токенов
Механизм текущего релиза — это настройка под названием effort, и она управляет кое-чем необычным: сколько слоёв модели разрешено использовать запросу. Поскольку головы расположены на трёх глубинах, лёгкий вопрос может получить ответ на слое 16, а сложный вопрос может задействовать все 32. low останавливается на слое 16, medium на 20, high на 32, а auto отвечает на первом выходе, калиброванная вероятность которого превышает порог этого выхода. Медианная задержка на запрос на выборке Decision Index, измеренная на одном H200 в bf16: 23 мс при low, 27 мс при medium, 40 мс при high, и 40 мс для значения по умолчанию, когда настройка не задана. Это собственные измерения проекта на его собственном оборудовании, и их не следует смешивать с числами GB10 из документации по обслуживанию, которые относятся к другой машине.
Измеренное поведение auto — это самое интересное: в наборе из пятнадцати бенчмарков проекта 20% вопросов останавливаются на слое 16, 46% — на слое 20, а 34% доходят до 32, что в среднем даёт 23,3 из 32 слоёв. Единый фиксированный порог в среднем даёт 20,9, а излишние остановки — это как раз то, что даёт единый порог. auto — это не компромисс по качеству, и об этом стоит сказать, потому что обычно адаптивная настройка — именно таковой и является: она показывает лучшую строку по набору среди всех настроек (0,771 против 0,770 у настройки по умолчанию), лучшую строку MMLU-Pro (0,444 против 0,440) и лучшую итоговую калибровку (ECE 0,024 против 0,036). Единственное место, где побеждает high, — это отложенный набор: 0,702 против 0,696 у auto. Некоторые задачи с ростом глубины измеримо ухудшаются — BANKING77 на 0,035, сопоставление подписей к New Yorker на 0,060 — поэтому уровень усилий — это выбор, который делает вызывающая сторона, а не правило, которое навязывает сервер.
Результат, благодаря которому это стало релизом, а не экспериментом, находится в публичном Decision Index 0.2.1 проекта, где оценка выросла с 38,38 для v5.0-VL до 46,24 для v6.0-VL за один релиз. В публичной таблице от 2026-09-28 это наивысший балл среди моделей 4B и всего, что меньше, и 14-е место из 71 в целом; следующая запись такого размера — JPT-4B с 43,04. Более ранние релизы в этой линейке — это предыстория, а не текущая модель: v5.0-VL (2026-10-02) урезал модель до первых 20 из 32 слоёв и заставил её говорить «unknown», когда у вопроса нет ответа; v4.0-VL (2026-10-01) был первым, который читает изображения; а v3.0 (2026-09-28) — это релиз, в котором обучение с подкреплением впервые помогло с помощью награды за списочное ранжирование — NDCG@5 по 16 кандидатам — которая подняла R@1 при реранжировании с 0,192 до 0,308 по сравнению с родительской моделью, обученной с учителем, ценой 0,0028 на наборе тестов. Именно здесь начинается история RL проекта, и сейчас это уже три релиза назад.

Цифры, вместе с сопутствующими им оговорками.
Основной показатель Decision Index 0.2.1 для v6.0-VL — 46,24, при полном прогоне, в котором на все 150 759 запросов набора были даны ответы: знания 28,8, язык 46,2, поиск 55,5, инструменты 65,8, искусство 37,1. Набор из пятнадцати бенчмарков показывает 0,770, отложенный набор — 0,698, MMLU-Pro — 0,440, а итоговый ECE — 0,024 с auto. Две оговорки должны быть упомянуты в том же дыхании, что и эти цифры, потому что без них числа вводят в заблуждение.
Первое — это сокращение набора. Внутренняя задача набора open_jev_ood пересекалась с 579 обучающими строками, поэтому её показатель был завышен на неизвестную величину; начиная с v6.0-VL проект публикует набор без неё — 0.770. У v5.0-VL показатель 0.764 был с ней, а карточка v6.0-VL пересчитывает этот выпуск как 0.763 без неё. Эти два числа несопоставимы, и если вы всё же их сравниваете, нужно использовать пересчитанное 0.763 и указать, что вы делаете именно это. В отложенном наборе, MMLU-Pro и BBH пересечений нет, и они не затронуты. Связанный аудит обнаружил около 1 000 элементов тестовых строк комплекта Decision Index в обучающих корпусах — ANLI 274, RouterBench-GSM8K 90, ARC 5, а также текст запросов BRIGHT/ToolRet без меток, примерно 0,3% строк комплекта — и повторное оценивание без них сдвигает индекс не более чем на 0.04 на выборке проекта. Это исправление к записи v5.0-VL, опубликованное в карточке v6.0-VL, и это собственное правило проекта о контаминации, которое лишило его одного числа.
Второй момент — чей это бенчмарк. Decision Index — это собственная публичная таблица RSI-Jev, а не вердикт третьей стороны, и 46.24 — это оценка в этой таблице. Её нельзя сравнивать с чем-либо, что опубликовала TypeSafe, потому что эти два числа получены не на одном и том же стенде, и никто не проводил независимого прямого сравнения RSI-Jev и Jev 1.13. Можно сказать лишь то, что различие структурное, а не числовое: одна — это хостируемая коммерческая модель на эндпоинте вендора, а другая — это чекпойнт, который вы скачиваете и обслуживаете сами.
К этому набору относятся ещё два фрагмента контекста. Проект прямо утверждает, что «десять из пятнадцати бенчмарков в той или иной форме предоставляют обучающие данные, так что ни одна из этих цифр не является zero-shot»; отложенный набор — это то сравнение, которое отложено, и даже он «исключён из обучения, но не изолирован от поиска». А v6.0-VL прогнал 97 экспериментальных ветвей по собственной линии — 93, если исключить четыре аудита данных, — и это тот масштаб поиска, который стоит за скачком на 7,86 пункта по этому индексу.
Он работает с проводным форматом Jev, с четырьмя отличиями, о которых должна знать вызывающая сторона.
Поверхность совместимости — это причина, по которой этот проект существует в таком виде. Та же форма запроса ({state, model, questions}), те же три типа вопросов с теми же формами критериев, те же формы ответов, те же от 1 до 64 вопросов на запрос, те же конверты ошибок и та же статистика уверенности — пик, (K · p_max − 1) / (K − 1), ограниченный диапазоном 0..1. Собственное утверждение проекта об этой поверхности состоит в том, что «всё, написанное под Jev, работает с этим без изменений», а сервер документирует, что скопировано, а что нет, и это полезнее самого утверждения.
• Промпт и считывание — её собственные. RSI-Jev — это базовая модель с обученной головой считывания, обслуживаемая с тем энкодером, с которым она обучалась, потому что использование промпта из эталона «вывело бы модель за пределы её обучающего распределения». Контракт передачи данных — это поверхность совместимости; промпт — нет.
• Ключи вариантов видны модели. В эталонной реализации они скрыты, поэтому переименование ключа доказуемо не может изменить ответ там. Здесь это возможно, и сервер честно сообщает об этом как option_keys_visible_to_model: true.
• Критерии должны быть строками или null. Структурированный критерий — объект — отклоняется с кодом 422, потому что ни один релиз не обучался на таком. Это единственное место, где запрос, который принимает эталонная реализация, не запустится здесь.
• Ничего не обрезается. Обслуживание принимает до 32 768 текстовых токенов плюс бюджет изображений, а более длинный запрос отклоняется с ошибкой 422, которая об этом сообщает, вместо тихого усечения. Цифра в 2 048 токенов, которая встречается в старых карточках, — это длина, на которой модели обучались, а не ограничение обслуживания, и описывать тихое усечение до 2 048 как текущее поведение неправильно.
Количества вариантов различаются с большим перевесом в пользу обслуживания: до 5 120 вариантов на вопрос (RSIJEV_MAX_ANSWERS), против 160 при обучении и 64, допускаемых эталоном. Не указывайте 160 как ограничение для обслуживания. Одно в ответах v6.0-VL является новым, а не унаследованным: каждый ответ сообщает, какой слой ответил, в usage.depth, вместе с калиброванной уверенностью, так что адаптивное решение можно проверить постфактум. Изображения — это расширение, которого нет у эталона, — от одного до четырёх на запрос, в виде base64 data URL, при этом состояние ссылается на каждое с помощью литерального маркера.
Где читатель действительно может это запустить, а где не может
RSI-Jev — это скачиваемый продукт. Проект поставляется с собственным сервером, который реализует тот самый Jev-совместимый API, а документированный способ установки — pip install из репозитория, после чего нужно выполнить его команду serve с псевдонимом чекпоинта и настройкой усилия. Веса размещены на Hugging Face в организации shgao и выпущены под Apache-2.0, как и базовая модель; при этом проект сам признаёт один открытый вопрос: пять из источников данных для обучения на изображениях являются некоммерческими или предназначены только для исследований, и «не решено, наследуют ли веса, обученные на некоммерческих данных, эти условия». Код распространяется под MIT.
Аппаратное обеспечение не является ограничением. Проект разрабатывается на HP ZGX Nano — машине NVIDIA GB10, за которую он благодарит HP и NVIDIA, а сервер работает на любом CUDA GPU, на Apple Silicon или на обычном CPU — последний из которых документация оценивает в 733 мс на один вопрос на собственном Arm CPU машины GB10, так что он скорее пригоден к использованию, чем быстр.
Чего он не делает — так это не появляется в общем каталоге моделей, и именно здесь нам нужно быть точными в отношении собственной позиции. RSI-Jev нет на OrcaRouter, и нет карточки модели, на которую его можно было бы маршрутизировать. Мы предоставляем коммерческий Jev от TypeSafe, typesafe/jev-1.13, на выделенном эндпоинте systemone, доступ к которому осуществляется через POST на /v1/systemone, а не в формате chat-completions от OpenAI — те же формы запроса и ответа, которые реализует этот проект, от модели, чей контракт он копирует. Вот и всё, что их связывает: они говорят на одном протоколе, мы обслуживаем одну из них, а другую вы запускаете сами. Если у вас уже есть ключ у нас, то вызов Jev 1.13 — это полноценный маршрут на один API для 200+ моделей с наценкой 0% (цена из прайс-листа провайдера передаётся как есть, так что снижение цен вендором действует здесь в тот же день) — что важно для сравнения в одном конкретном отношении. Такую страницу, как эта, дёшево применить на практике, если вы можете сначала попробовать коммерческий контракт и лишь затем решить, стоит ли запускать открытый 4B-чекпоинт самостоятельно с учётом операционной работы.

Как читать RSI-Jev на 2026-10-07
Слабые места, которые проект публикует, так же конкретны, как и его результаты, и даты имеют значение. Внешнее тестирование v2.1 показало, что модель склоняется к более серьёзному или дорогому варианту при упорядоченных выборах и оценках по рубрикам, редко выбирает «неизвестно», когда документ не может ответить, и непоследовательно отвечает на вопрос и его отрицание. В более поздних выпусках данные были нацелены на случай «неизвестно» — KoBBQ unknown-when-ambiguous составил 0,891 на v4.0-VL, 0,932 на v5.0-VL и 0,918 / 0,939 на v6.0-VL, — и карточка v6.0-VL откровенно признаёт, что улучшения дали данные, а не глубина, и что 10% вопросов, которые дошли бы до слоя 32 и остановились на 16 или 20, — это те, где политика глубины всё ещё гадает. В переранжировании ещё есть куда расти: собственный порядок извлечения hippo-memory имеет показатель 0,484 R@1 и по-прежнему опережает 0,308, которого модель достигла на v3.0, — показатель, о закрытии разрыва с которым проект с тех пор не заявлял. Доказательства RL основаны на одном seed, а v3.0 «сама не имеет сопоставимого SFT-контроля». Обучающие корпуса и наборы для разработки политики не опубликованы, поэтому этапы нельзя воспроизвести только из репозитория, а сборщик корпуса для переранжирования — около 96 ГБ памяти — не был повторно запущен от начала до конца.
Тракшн, замеренный в тот же день: 73 звезды, 5 форков, 0 открытых issue, 7 релизов на GitHub. Эти цифры меняются ежедневно, а репозиторий возрастом три недели — не устоявшийся проект, какова бы ни была частота его релизов. Честный вывод таков: RSI-Jev — одно из наиболее прозрачных исследовательских начинаний в этом уголке области: цепочка датированных, измеренных, иногда проигрышных релизов, где поиск публикуется вместе с оценками, — и в то же время одно из наименее независимо проверенных, поскольку почти каждая цифра на этой странице — его собственная, и ни одна сторонняя сторона не провела его бенчмарк в сравнении с коммерческой моделью, с которой он совместим.
Что важно отслеживать — это не следующий релиз, ведь при такой периодичности он выйдет в течение нескольких дней; а то, начнёт ли что-либо за пределами проекта проводить измерения. Две вещи, которые изменили бы картину, — это независимый прогон бенчмарка на опубликованных контрольных точках и сравнение моделей принятия решений, которое прогоняет как открытую 4B, так и хостируемую модель TypeSafe через один и тот же стенд. Ни того, ни другого сегодня не существует. Пока что-то из этого не появится, полезный способ воспринимать такую оценку, как 46.24, — это как хорошо документированное утверждение проекта, который регистрирует свои прогнозы заранее и выпускает неудачные ветви — что является более прочной цепочкой доказательств, чем у большинства, и всё же не результатом третьей стороны.
