제목이 'RSI-Jev란 무엇인가?'이고 부제가 'Jev 스타일 의사결정 모델을 구축하는 자기 개선형 연구 루프'인 생성된 타이틀 카드가, '4.69B 파라미터 - Qwen3.5-4B-Base 타워', '세 개의 출구 - 레이어 16 / 20 / 32', '토큰이 아니라 깊이를 소모한다'라고 적힌 세 개의 둥근 마일스톤 카드가 나란히 있는 행 위에 있으며, 바닥글에는 '페이지의 모든 수치는 프로젝트 자체 수치이며, 2026-10-07 기준으로 확인함.'이라고 적혀 있고, 미니멀한 플랫 라인 아이콘과 OrcaRouter 로고가 오른쪽 아래 모서리에 합성되어 있다.
Guides & Insights

RSI-Jev란 무엇인가? Jev 스타일 의사결정 모델을 구축하는 자기 개선 루프

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

RSI-Jev는 Jev 스타일의 System One 의사결정 모델을 구축하는 제3자 공개 연구 프로젝트이며, 이 페이지에서 다루는 모델은 2026-10-06 날짜의 4B 릴리스인 RSI-Jev v6.0-VL입니다. 이 프로젝트는 Shanghua Gao(@gasvn)가 작성했고, Sufian(@SufianTA)은 저장소의 감사의 글에 이름을 올렸으며, TypeSafe의 Jev가 아니고 TypeSafe AI와 제휴 관계도 아닙니다 — 프로젝트 자체의 라이선스 문구가 정확히 그렇게 말합니다. 그 바탕에 있는 아이디어는 한 문장으로 말할 수 있을 만큼 범위가 좁습니다: 문서, 채팅 또는 이미지에 대해 유형화된 질문을 던지면 — 예/아니요, k개 중 하나 고르기, 루브릭으로 평가하기 — 한 번의 포워드 패스가 모든 선택지에 대해 보정된 확률을 반환합니다. 아무것도 생성되지 않으므로 소비할 추론 토큰이 없고, 실제로 하나도 소비되지 않습니다. v6.0-VL은 이 프로젝트의 첫 릴리스가 아닙니다. 이는 12일 만에 일곱 번째 릴리스이며, 이것이 이 프로젝트를 이해하는 데 가장 중요한 단 하나의 사실입니다. 왜냐하면 여기서 유용한 정보는 개별 체크포인트가 아니라 그 선의 형태에 있기 때문입니다.

숫자보다 앞서 한 가지는 반드시 말해야 합니다. 그것이 모든 수치의 날짜를 정하기 때문입니다. v6.0-VL은 정확히 하루 동안만 선두였습니다. 2026-10-07 07:56 UTC — 오늘 아침 — 프로젝트가 공개한 것은 RSI-Jev v6.1-VL, 즉 v6.0-VL과, 다른 데이터로 훈련된 동일한 Qwen3.5-4B-Base의 두 번째 파인튜닝을 각각 가중치 0.5로 평균한 모델입니다. 이 모델은 프로젝트의 Decision Index 0.3 kit에서 50.98점을 기록하며, 같은 kit에서 v6.0-VL은 46.23점입니다. 평균 이후에는 아무것도 훈련되지 않았습니다. 이 모델의 캘리브레이션은 v6.0-VL보다 나쁘며, 자체 카드에도 그렇게 적혀 있습니다. 그 릴리스는 실제이며 현재의 것입니다. 이 페이지는 그것에 관한 것이 아닙니다. 아래의 모든 수치는 2026-10-06 날짜의 v6.0-VL 릴리스 기록에서 읽은 것이며, 이후 집계가 바뀐 경우 — 릴리스 집계, 실험 집계 — 이 페이지는 v6.0-VL 당시의 수치와 오늘 읽히는 수치를 모두 제시합니다.

RSI-Jev가 아닌 것 또한 먼저 짚고 넘어갈 가치가 있습니다. 왜냐하면 뻔한 세 가지 가정 중 두 가지가 틀렸기 때문입니다. 그것은 오늘날 일반 API를 통해 호출할 수 있는 호스팅 제품이 아니며, OrcaRouter가 제공하는 것도 아닙니다 — 우리 카탈로그에는 rsi-jev id도, shgao id도, 그에 대한 모델 카드도 없습니다. 우리가 가진 단 하나는 이 프로젝트가 HTTP 계약을 그대로 베낀 모델, 즉 TypeSafe의 상용 Jev이며, 우리는 이를 systemone 엔드포인트에서 typesafe/jev-1.13로 제공합니다. 이 둘 중 하나는 호출하는 것이고, 다른 하나는 직접 내려받아 서빙하는 것입니다. 아래 내용은 모두 프로젝트 자체 저장소, 릴리스 카드, 서빙 문서에서 2026-10-07에 읽은 것이며, 수치가 외부 측정치가 아니라 프로젝트 자체의 것일 경우 이 페이지는 그것이 누구의 것인지 밝힙니다.

A screenshot of the subject project's own GitHub repository page, Shanghua-Gao / RSI-Jev, showing the repository description 'Typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents - checkpoints, the code that produced them, and every version that failed', the sidebar counters 73 stars, 5 forks and 1 watching, 198 commits and 8 releases, the newest release headed 'RSI-Jev v6.1-VL 4B' dated 14 minutes before the capture, an MIT license line, the topic tags ai-agents, autonomous-research, decision-model, jev, recursive-self-improvement, system-one and typed-decisions, and the merge commit 'Merge pull request #33 from Shanghua-Gao/release-v6.1-vl' at the top of the commit list.

그게 실제로 하는 일

이 프로젝트는 스스로를 한 줄로 “Jev 스타일 System One 모델을 구축하는 재귀적으로 자기 개선하는 연구 시스템”이라고 설명하며, 이 프로젝트가 만들어 내는 산출물은 생성기가 아니라 결정기입니다. 여기에 상태 — 문서, 채팅 기록, 트랜잭션, 그리고 vision 릴리스에서는 최대 네 개의 이미지 — 와 명명된 기준이 있는 하나 이상의 타입 지정 질문을 넘기면, 각 질문마다 모든 선택지에 대한 확률을 반환합니다. 세 가지 질문 유형이 이 공간을 포괄하며, 이들은 TypeSafe의 API가 정의하는 유형들입니다:

• noul — 참/거짓 판정으로, 단일 확률로 반환되며 분포와 신뢰도 값이 없고, 참조의 답변 형태와 정확히 일치합니다.

• 선택 — 레이블이 지정된 옵션 집합 중에서 하나를 고르며, 전체 확률 분포와 신뢰도 통계와 함께 반환됩니다.

• 점수 — 순서형 루브릭으로 평가하며, 레벨을 가리키는 확률 가중치 기반의 0부터 시작하는 인덱스로 반환되고, 범례와 분포가 함께 제공됩니다.

생성 단계가 없기 때문에 두 번째 모델 호출도, 샘플링도 없습니다. 모델이 이미 읽은 문서에 대한 결정은 구조적으로 저렴한 연산이며, 그 비용에 대한 프로젝트 자체의 기준 — "약 10 ms" — 는 현재 릴리스가 아니라 2B 시대의 것입니다. v6.0-VL에 대해 측정된 수치는 아래에 제시되어 있습니다.

소유권에 관한 두 가지 사실이 이 페이지의 그 무엇보다 중요하다. RSI-Jev는 TypeSafe의 작업물이 아니며 TypeSafe가 이를 보증한 적도 없다. 라이선스 문구를 전문 그대로 인용하면 다음과 같다. "코드: MIT. 가중치: Apache-2.0, 기본 모델을 따름; 일부 이미지 학습 소스는 비상업용이며 각 모델 카드에 나열되어 있음. TypeSafe AI와 제휴 관계가 없음." 그리고 관계는 일방향으로 흐른다. 이 프로젝트는 Jev의 와이어 포맷을 의도적으로 복사하며, 호환 서버가 요점이기 때문에 그렇게 한다고 밝힌다. "Jev-style"은 이 프로젝트가 만드는 모델 유형을 가리키는 프로젝트 자체의 표현이다. TypeSafe의 Jev는 별개의 폐쇄형 상업 모델이며, 둘은 더 짧은 이름으로 불린다고 해서 같은 것이 아니다.

현재 모델 내부: 세 개의 출구를 가진 4B Qwen 타워

RSI-Jev v6.0-VL은 Qwen3.5-4B-Base 타워에 해당 타워를 파인튜닝하고 그 위에 훈련된 결정 헤드를 올린 모델입니다. 그것이 전체 아키텍처입니다 — 전문가 혼합도, 라우터도, 두 번째 모델도 없습니다. 이 모델은 전체 베이스 모델을 실행하며, 그래서 파라미터 수가 더 작은 값이 아니라 4.69B입니다: 3.57B는 32개 디코더 레이어에, 0.64B는 토큰 임베딩에, 0.33B는 비전 타워에, 0.05B는 메인 결정 헤드에, 0.10B는 두 개의 조기 종료 헤드에 있습니다. 공개된 체크포인트는 자체 완결형이며 bf16 기준 9.7 GB입니다.

세 개의 결정 헤드가 베이스의 16, 20, 32번째 층에 부착되어 있으며, 이들은 현재 릴리스가 알려진 모든 것의 이면에 있는 메커니즘이다. 12번째 층의 네 번째 출구는 구축되고 측정된 뒤 폐기되었다 — "12번째 층 출구는 모든 비교에서 16번째 층에서 비롯된 캐스케이드에 밀렸고 패키지에 포함되지 않는다" — 따라서 세 개는 출시되고 네 개는 그렇지 않다. 출구들은 자신이 속한 층의 분리된 사본을 읽는데, 이는 프로젝트가 힘겹게 알게 된 세부 사항이다: 학습 중에 출구가 부착된 트렁크에서 헤드를 재조정해도 깊은 층의 정확도를 회복하지 못했기에, 이들을 분리하는 것이 깊이를 회복시킨 것이다.

여기서 숫자 하나가 이 프로젝트를 가장 쉽게 오해하게 만드는 요인이다. v3.0까지 포함한 모든 버전은 Qwen3.5-2B-Base 기반의 2B 모델이었고, 그것은 계보일 뿐 현재 모델이 아니다. v4.0-VL은 2B였고, v5.0-VL은 모델을 3B로 줄였으며, v6.0-VL은 4B다. 현재 RSI-Jev 모델을 2B라고 부르는 페이지는 세 릴리스나 뒤처져 있다.

루프가 바로 실제 프로젝트다

모델은 산출물이고, 구축되는 것은 프로세스다. 이 프로젝트는 "연구를 수행하는 루프가 AutoScientists의 다음 버전"이라고 말한다. AutoScientists는 하버드의 Zitnik lab이 발표한 자기조직화 에이전트 팀 시스템이며, 이는 그 문장이 함축하는 방식대로 작동한다. AI 에이전트는 가설을 제안하고, 자신들의 예측을 등록하고,그 전에 GPU 시간을 쓰고, 실험을 실행하고, 증거가 그렇게 말할 때 자신들의 챔피언을 은퇴시킨다. 두 가지 수치가 이를 구체화한다. 2026-10-07에 읽어보면, 저장소의 헤드라인은 13일 동안 8개의 릴리스, v1.0에서 v6.1-VL까지이다; 2026-10-06에 있었던 v6.0-VL 자체의 릴리스에 대해서는 12일 동안 7개의 릴리스라고 적혀 있었으며, 각각은 루프에 의해 훈련되고 평가되고 문서화되었다. 그리고 이 페이지의 릴리스가 나왔을 때 471이었던 실험 수는 오늘 496이다 — 실패를 포함한 모든 것이 기록되었다. 두 수치 모두 프로젝트 자체의 것이며, 둘 다 움직인다.

그 규율이 바로 그 숫자들을 의미 있게 만드는 것이며, 프로젝트는 이를 명확히 나열한다. 널 플로어는 가정하지 않고 측정한다 — 대조군과 증명 가능하게 동일한 실험군을, GPU 시간을 쓰기 전에 객체 동일성으로 검증함으로써, 그들 사이의 편차는 곧 노이즈 플로어이고, 그 편차보다 작은 차이는 결과가 아니다. 예측은 실행 전에 등록되므로, 자기 기준을 놓친 버전은 조용히 다시 손질되는 대신 실패로 출시된다. 아티팩트는 검증된다: 체크포인트는 디스크에서 다시 불러와 재채점하고, 훈련 실행의 질문별 예측을 재현할 때에만 공개하는데, v1.0 체크포인트 두 개 모두 1.0000으로 이를 재현한다. 오염은 "주장하는 것이 아니라 확인한다." 그리고 실패도 출시된다, 프로젝트 자체의 챔피언을 죽인 실패까지도 포함해서.

기여란 무엇인지에 대해, 이 프로젝트의 기여 가이드에 나오는 프로젝트 자신의 말은 이렇다: "여기서 기여란 대개 패치가 아니라 측정값이다." 릴리스된 기록은 스냅샷이 아니라 사슬로 유지된다 — "versions/는 릴리스마다 카드 하나를, 그 전부를, main에 영원히 보관한다… 그 사슬이 바로 프로젝트다" — 그래서 오래된 릴리스의 숫자를 나중에 프로젝트가 그 숫자에 대해 말하는 내용과 대조해 확인할 수 있고, 아래에서 논의되는 한 번의 정정이 조용히 묻히지 않고 눈에 보이는 것이다.

v6.0-VL이 바꾼 것: 토큰 대신 깊이를 쓴다

현재 릴리스의 메커니즘은 effort라는 설정이며, 이 설정은 특이한 것을 제어합니다: 요청이 모델의 몇 개의 레이어까지 사용할 수 있는지입니다. 헤드가 세 개의 깊이에 위치하므로, 쉬운 질문은 레이어 16에서 답할 수 있고 어려운 질문은 32개 레이어를 모두 실행할 수 있습니다. low는 레이어 16에서 멈추고, medium은 20에서, high는 32에서 멈추며, auto는 보정된 확률이 해당 출구의 임계값을 넘는 첫 번째 출구에서 답합니다. Decision Index 샘플에서 요청당 중앙값 지연 시간은 H200 한 대에서 bf16으로 측정했을 때: 23ms는 low에서, 27ms는 medium에서, 40ms는 high에서, 설정하지 않은 기본값은 40ms입니다. 이는 프로젝트가 자체 하드웨어에서 직접 측정한 값이며, 다른 머신에서 나온 서빙 문서의 GB10 수치와 혼합해서는 안 됩니다.

측정된 auto의 동작이 흥미로운 부분이다. 이 프로젝트의 15개 벤치마크 스위트에서 질문의 20%는 레이어 16에서 멈추고, 46%는 레이어 20에서 멈추며, 34%는 32까지 실행되는데, 이는 32개 레이어 중 평균 23.3개에 해당한다. 단일 고정 임계값은 평균 20.9이며, 과잉 중단은 바로 단일 임계값이 안겨주는 결과다. auto는 품질을 타협한 선택이 아니다. 이 점은 짚고 넘어갈 가치가 있는데, 적응형 설정이란 보통 그런 것이기 때문이다. 즉 어떤 설정보다도 좋은 스위트 결과(기본값 0.770 대비 0.771), 가장 좋은 MMLU-Pro 결과(0.440 대비 0.444), 그리고 가장 좋은 최종 캘리브레이션(ECE 0.036 대비 0.024)을 기록한다. 단 한 곳, high가 이기는 지점은 홀드아웃 세트로, 0.702 대 auto의 0.696이다. 일부 과제는 깊이가 늘어날수록 측정 가능하게 나빠진다. BANKING77은 0.035, New Yorker 캡션 매칭은 0.060만큼 나빠지는데, 그래서 노력 수준은 서버가 강제하는 규칙이 아니라 호출자가 선택하는 사항이다.

이것을 실험이 아니라 릴리스로 만든 결과는 프로젝트의 공개 Decision Index 0.2.1에 있습니다. 여기서 점수는 한 릴리스 만에 v5.0-VL의 38.38에서 v6.0-VL의 46.24로 올랐습니다. 2026-09-28자 공개 보드에서 이는 4B 모델 및 그보다 작은 모든 모델 중 최고 점수이며, 전체 71개 중 14위입니다. 같은 규모의 다음 항목은 43.04의 JPT-4B입니다. 이 라인의 이전 릴리스들은 현재 모델이 아니라 계보에 해당합니다. v5.0-VL(2026-10-02)은 모델을 32개 레이어 중 처음 20개로 줄였고, 질문에 답이 없을 때 "unknown"이라고 말하게 했습니다. v4.0-VL(2026-10-01)은 이미지를 읽는 첫 버전이었습니다. 그리고 v3.0(2026-09-28)은 강화 학습이 처음으로 도움이 된 릴리스로, 16개 후보에 대한 NDCG@5인 리스트와이즈 랭킹 보상을 통해 감독 학습 부모 대비 리랭킹 R@1을 0.192에서 0.308로 끌어올렸으며, 그 대가는 스위트에서 0.0028이었습니다. 프로젝트의 RL 이야기는 바로 여기서 시작되며, 이제는 세 릴리스 전의 일입니다.

A generated single-column scoreboard headed 'RSI-Jev v6.0-VL - the scoreboard', with six rows reading 'Decision Index: 46.24 on its own public board', '15-benchmark suite: 0.770 without open_jev_ood', 'Held-out set: 0.698', 'MMLU-Pro: 0.440', 'Final ECE: 0.024 with effort auto' and 'Depth: layers 16 / 20 / 32 at 23 / 27 / 40 ms'; a footer reads 'All figures RSI-Jev's own release record, 2026-10-06; the Decision Index is its own public board, not a third-party result.'

그 수치들, 그리고 그 수치들과 함께 따라오는 단서들

v6.0-VL의 Decision Index 0.2.1 헤드라인은 46.24이며, 스위트의 150,759개 요청이 모두 응답된 전체 실행에서 지식 28.8, 언어 46.2, 검색 55.5, 도구 65.8, 예술 37.1입니다. 15개 벤치마크 스위트는 0.770, 홀드아웃 세트는 0.698, MMLU-Pro는 0.440, 그리고 최종 ECE 0.024: auto. 두 가지 주의사항은 그 수치들과 같은 호흡으로 제시되어야 합니다. 왜냐하면 그것들이 없으면 숫자는 오해를 불러일으키기 때문입니다.

첫 번째는 스위트에서의 제외다. 내부 스위트 작업 open_jev_ood는 579개의 훈련 행과 겹쳤으므로 그 수치는 알 수 없는 만큼 부풀려졌다; v6.0-VL부터 프로젝트는 그것을 제외한 스위트를 0.770으로 보고한다. v5.0-VL의 0.764는 그것을 포함한 수치였고, v6.0-VL의 카드는 해당 릴리스를 그것을 제외한 0.763으로 다시 명시한다. 두 수치는 비교할 수 없으며, 그래도 비교한다면 다시 명시된 0.763을 사용해야 하고 그것이 자신이 하는 일이라고 말해야 한다. 홀드아웃 세트, MMLU-Pro 및 BBH는 겹침이 없고 영향을 받지 않는다. 관련 감사에서는 Decision Index 키트의 테스트 행 약 1,000개 항목이 훈련 코퍼스에서 발견되었다 — ANLI 274, RouterBench-GSM8K 90, ARC 5, 그리고 레이블이 없는 BRIGHT/ToolRet 쿼리 텍스트, 대략 키트 행의 0.3% — 그리고 그것들을 제외하고 다시 채점하면 프로젝트 샘플에서 지수가 최대 0.04만큼 움직인다. 이는 v5.0-VL의 기록에 대한 정정으로, v6.0-VL의 카드에 게시되었으며, 프로젝트 자체의 오염 규칙이 프로젝트로 하여금 수치 하나를 잃게 만드는 것이다.

두 번째는 이 벤치마크가 누구의 것인지 하는 점입니다. Decision Index는 RSI-Jev 자체의 공개 보드이지 제3자의 판정이 아니며, 46.24는 그 보드에서의 점수입니다. 이는 TypeSafe가 공개한 그 어떤 것과도 비교할 수 없습니다. 두 숫자가 같은 하네스에서 나온 것이 아니고, RSI-Jev와 Jev 1.13 사이에 독립적인 직접 비교를 수행한 사람도 없기 때문입니다. 숫자적으로라기보다 구조적으로 말할 수 있는 것은 있습니다. 하나는 벤더 엔드포인트에서 호스팅되는 상용 모델이고, 다른 하나는 직접 다운로드해 서빙하는 체크포인트입니다.

이 세트에는 두 가지 추가 맥락이 더 있습니다. 프로젝트는 "15개 벤치마크 중 10개가 어떤 형태로든 훈련 데이터를 제공하므로, 이 수치들 중 어느 것도 제로샷이 아니다"라고 분명히 밝히고 있습니다; 홀드아웃 세트는 홀드아웃된 비교 대상이며, 심지어 그것도 "훈련에서 홀드아웃된 것이지 검색에서 봉인된 것은 아니다"라고 합니다. 그리고 v6.0-VL은 자체 라인에서 97개의 arm을 실행했습니다 — 네 가지 데이터 감사를 제외하면 93개 — 이것이 해당 지수에서 7.86포인트 상승을 만들어낸 검색 규모입니다.

Jev의 와이어 형식을 사용하며, 호출자가 알아야 할 네 가지 차이점이 있습니다.

호환성 표면은 이 프로젝트가 지금의 형태로 존재하는 이유입니다. 동일한 요청 형태({state, model, questions}), 동일한 기준 형태를 가진 동일한 세 가지 질문 유형, 동일한 답변 형태, 요청당 동일한 1~64개 질문, 동일한 오류 엔벨로프, 그리고 동일한 신뢰도 통계량 — 최고점, (K · p_max − 1) / (K − 1), 0..1로 클램프 — 입니다. 해당 표면에 대한 프로젝트 자체의 주장은 "Jev에 맞춰 작성된 것은 무엇이든 변경 없이 이 프로젝트에서 작동한다"이며, 서버는 무엇이 복사되었고 무엇이 아닌지를 문서화하는데, 이는 그 주장보다 더 유용합니다.

• 프롬프트와 리드아웃은 자체적이다. RSI-Jev는 훈련된 리드아웃 헤드를 갖춘 베이스 모델이며, 참조의 프롬프트를 사용하면 "모델이 훈련 분포를 벗어나게 될 것"이기 때문에 훈련될 때 사용한 프롬프트와 함께 서빙된다. 와이어는 호환성 표면이고, 프롬프트는 그렇지 않다.

• 옵션 키가 모델에 표시됩니다. 참조 구현에서는 이를 숨기므로, 거기서는 키 이름을 바꾸어도 답변이 바뀌지 않는다는 것이 입증됩니다. 여기서는 답변이 바뀔 수 있으며, 서버는 이를 솔직하게 option_keys_visible_to_model: true라고 보고합니다.

• 기준은 문자열 또는 null이어야 합니다. 구조화된 기준 — 객체 — 은 422로 거부됩니다. 어떤 릴리스도 그러한 기준으로 학습되지 않았기 때문입니다. 이는 레퍼런스가 허용하는 요청이 여기서는 실행되지 않는 유일한 지점입니다.

• 아무것도 잘리지 않습니다. 서빙은 최대 32,768개의 텍스트 토큰에 이미지 예산을 더한 만큼까지 처리하며, 더 긴 요청은 조용히 잘리는 대신 그렇다고 알려 주는 422와 함께 거부됩니다. 이전 카드에 나타나는 2,048 토큰이라는 수치는 모델들이 훈련된 길이이며, 서빙 한도가 아닙니다. 그리고 2,048로 조용히 잘리는 것을 현재 동작으로 설명하는 것은 잘못입니다.

옵션 수는 서빙에 훨씬 유리하게 차이가 납니다: 질문당 최대 5,120개 옵션(RSIJEV_MAX_ANSWERS), 훈련에서는 160개, 참조가 허용하는 64개와 대조됩니다. 160을 서빙 상한으로 인용하지 마십시오. v6.0-VL의 응답에서 상속된 것이 아니라 새로운 점이 하나 있습니다: 모든 답변은 어느 계층이 답했는지를 usage.depth에서 보정된 신뢰도와 함께 보고하므로, 적응형 결정을 사후에 감사할 수 있습니다. 이미지는 참조에 없는 확장 기능입니다 — 요청당 1~4개이며, base64 데이터 URL로서, 상태는 각 이미지를 리터럴 마커로 참조합니다.

독자가 실제로 그것을 실행할 수 있는 곳과 실행할 수 없는 곳

RSI-Jev는 다운로드입니다. 이 프로젝트는 자체 서버를 제공하는데, 이 서버는 해당 Jev 호환 API를 사용하며, 문서화된 경로는 저장소에서 pip install을 한 뒤 checkpoint 별칭과 effort 설정을 지정하는 serve 명령을 실행하는 것입니다. 가중치는 shgao 조직 산하 Hugging Face에 있으며, 기본 모델을 따라 Apache-2.0으로 공개되었습니다. 다만 프로젝트 스스로 밝힌 미해결 질문이 하나 있습니다: 이미지 학습 소스 중 다섯 개가 비상업적 또는 연구 전용이며, "비상업적 데이터로 학습된 가중치가 그 조건을 승계하는지는 확정되지 않았습니다." 코드는 MIT입니다.

하드웨어가 제약은 아니다. 이 프로젝트는 HP와 NVIDIA의 공로를 인정하는 NVIDIA GB10 머신인 HP ZGX Nano에서 개발되며, 서버는 모든 CUDA GPU, Apple Silicon, 또는 일반 CPU에서 실행된다 — 문서에서는 마지막 옵션이 GB10 자체의 Arm CPU에서 단일 질문에 733ms가 걸린다고 제시하므로, 빠르기보다는 쓸 만한 수준이다.

그것이 하지 않는 일은 일반 모델 카탈로그에 나타나는 것이며, 바로 이 지점에서 우리는 우리 자신의 입장을 정확히 밝혀야 합니다. RSI-Jev는 OrcaRouter에 없고, 라우팅할 모델 카드도 없습니다. 우리가 제공하는 것은 TypeSafe의 상용 Jev, typesafe/jev-1.13, 전용 systemone 엔드포인트에서 OpenAI chat-completions 형식이 아니라 /v1/systemone에 대한 POST로 접근합니다 — 이 프로젝트가 구현하는 것과 동일한 요청 및 응답 형식이며, 계약을 복사한 모델에서 나온 것입니다. 그것이 관계의 전부입니다: 둘은 같은 프로토콜을 사용하고, 우리는 그중 하나를 제공하며, 다른 하나는 직접 실행합니다. 이미 우리와 키를 보유하고 있다면, Jev 1.13 호출 형식은 200개 이상의 모델을 위한 0% 마크업의 단일 API에서 일급 경로입니다 (공급자 정가가 그대로 전달되므로, 공급업체 가격 인하가 같은 날 여기에서 적용됩니다) — 이는 비교에 한 가지 특정한 방식으로 중요합니다. 이 페이지와 같은 페이지는 상용 계약을 먼저 시도해 본 다음에야 오픈 4B 체크포인트를 직접 실행하는 것이 운영상의 수고에 비해 가치가 있는지 결정할 수 있다면 실행에 옮기기에 부담이 적습니다.

A screenshot of OrcaRouter's own model page for Jev 1.13 showing the breadcrumb 'Home / Models / TypeSafe', the title 'Jev 1.13', the slug typesafe/jev-1.13, 'by TypeSafe - 2026-09-24', the description that it is TypeSafe's structured decision and evaluation model taking noul / choice / score questions, the line 'POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.', the price $0.04, our p50 TTFT of 149 ms, and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

2026-10-07에 RSI-Jev를 읽는 방법

프로젝트가 공개하는 약점은 그 결과만큼이나 구체적이며, 날짜도 중요하다. v2.1의 외부 테스트에서는 모델이 순서형 선택지와 루브릭 점수에서 더 심각하거나 더 비용이 많이 드는 선택지 쪽으로 기울고, 문서가 답할 수 없을 때 "알 수 없음"을 거의 선택하지 않으며, 질문과 그 부정에 일관성 없이 답한다는 점이 발견되었다. 이후 릴리스들은 "알 수 없음" 사례에 데이터를 겨냥했다 — KoBBQ unknown-when-ambiguous는 v4.0-VL에서 0.891, v5.0-VL에서 0.932, v6.0-VL에서 0.918 / 0.939를 기록했으며 — v6.0-VL 카드는 이득이 깊이보다는 데이터에서 왔다는 점과, 레이어 32까지 가야 하지만 16이나 20에서 멈추는 질문의 10%가 깊이 정책이 여전히 추측 중인 지점이라는 점을 솔직히 밝힌다. 재랭킹은 더 나아가야 할 부분이 있다: hippo-memory 자체의 검색 순서는 R@1 0.484를 기록하며 v3.0에서 모델이 도달한 0.308보다 여전히 앞서는데, 이는 프로젝트가 그 이후로 좁혔다고 주장한 적 없는 수치다. RL 증거는 시드 하나뿐이며, v3.0은 "그 자체로 매칭된 SFT 대조군이 없다." 훈련 코퍼스와 정책 개발 세트는 공개되지 않았으므로 단계들은 저장소만으로 다시 실행할 수 없으며, 재랭킹 코퍼스 빌더 — 약 96GB의 메모리 — 는 처음부터 끝까지 다시 실행되지 않았다.

같은 날 확인한 관심도: 스타 73개, 포크 5개, 오픈 이슈 0개, GitHub 릴리스 7개. 이런 수치는 매일 변하며, 세 주 된 저장소는 릴리스 주기가 어떻든 확립된 프로젝트가 아니다. 솔직히 요약하자면, RSI-Jev는 이 분야의 이 구석에서 더 명료한 연구 노력 중 하나이다 — 날짜가 기록되고 측정된, 때로는 손해를 보는 릴리스의 연쇄이며, 검색 과정이 점수와 함께 공개된다 — 그리고 가장 독립적으로 검증되지 않은 것 중 하나이다. 이 페이지의 거의 모든 숫자가 자체적으로 나온 것이고, 외부 주체가 호환되는 상용 모델과 비교하여 벤치마킹한 적이 없기 때문이다.

주목할 것은 다음 릴리스가 아니다. 이런 주기라면 며칠 안에 하나 나올 테니까. 주목할 것은 프로젝트 외부의 무언가가 측정을 시작하는지 여부다. 상황을 바꿀 두 가지는 공개된 체크포인트에 대해 독립적으로 실행된 벤치마크와, 오픈 4B와 TypeSafe의 호스팅 모델을 모두 하나의 하네스에 통과시키는 의사결정 모델 비교다. 둘 다 현재는 존재하지 않는다. 그중 하나라도 생기기 전까지, 46.24 같은 점수를 읽는 유용한 방식은 예측을 사전에 등록하고 실패한 실험군까지 공개하는 프로젝트가 내놓은 잘 문서화된 주장으로 보는 것이다. 이는 대부분보다 강력한 증거 기록이며, 여전히 제3자 결과는 아니다.