
RSI-Jev vs Jev 1.13: 하나는 다운로드, 하나는 호출
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
을 나란히 놓고 보면, RSI-Jev v6.1-VL 4B와 Jev 1.13호출자가 가장 먼저 알아차리는 것은 두 모델이 동일한 요청이라는 점입니다. 어느 쪽에든 상태와 유형이 지정된 질문 세트 — 예/아니요, k개 중 하나 고르기, 루브릭에 따른 평가 — 를 주면, 둘 다 한 번의 순전파로 모든 옵션에 대해 보정된 확률을 반환하며, 파싱할 생성 텍스트가 없습니다. 이는 우연이 아닙니다: RSI-Jev는 의도적으로 Jev의 와이어 포맷을 구사하도록 만들어졌기 때문에, TypeSafe의 API를 기준으로 작성된 클라이언트는 base URL만 바꾸면 이 모델을 상대로 실행됩니다. 동일하지 않은 것은 호출을 둘러싼 모든 것입니다. Jev 1.13은 TypeSafe의 폐쇄형 상업 모델로, 사용량을 측정하는 엔드포인트에서 제공됩니다; RSI-Jev v6.1-VL은 Apache-2.0 라이선스가 적용된 가중치의 4.69B 파라미터 체크포인트로, 직접 다운로드해 자체 하드웨어에서 서빙할 수 있습니다. 어느 쪽도 다른 쪽의 리브랜드가 아니고, 어느 벤더도 다른 쪽을 보증하지 않으며, 이 비교의 거의 모든 수치는 그것을 만들어낸 당사자로부터 나온 것입니다.
주제의 날짜가 중요한데, 이 프로젝트는 거의 매일 릴리스를 출시하기 때문입니다. RSI-Jev v6.1-VL 4B는 2026-10-07에 제3자 Shanghua-Gao/RSI-Jev 프로젝트에 의해 공개되었습니다 — Jev 스타일 결정 모델을 훈련하고 실패한 모든 실험군과 성공한 실험군을 함께 공개하는 자기 개선 연구 루프입니다. 이는 해당 라인에서 13일 만에 여덟 번째 릴리스이며, 동일한 Qwen3.5-4B-Base를 두 번째로 미세 조정한 것과 이전 릴리스의 가중 평균입니다. Jev 1.13은 TypeSafe AI의 모델로, 2026-09-15에 출시되었으며 2026-09-24부터 자체 카탈로그에 포함되어 있습니다. 아래에서 두 날짜 모두 중요합니다. 매일 움직이는 프로젝트와의 비교는 수명이 며칠 단위로 측정되기 때문입니다.
두 가지가 실제로 무엇인지, 각각 한 줄로
Jev 1.13은 전용 엔드포인트 뒤에 있는 호스팅된 의사결정 모델입니다 — POST /v1/systemone, 비스트리밍, 상태와 모든 질문을 통틀어 대략 64,000토큰의 입력 예산, 백만 입력 토큰당 $0.042의 가격이 책정되어 있으며 출력 토큰이 없기 때문에 출력 비용은 0으로 청구됩니다. 아키텍처, 파라미터 수, 훈련 컴퓨트는 공개되지 않았습니다. TypeSafe는 세부 사항을 비공개로 유지하고 있으며 논문이 뒤따를 수 있다고 밝혔습니다. 당신은 그것을 실행하지 않습니다. 당신은 그것을 호출하며, 모든 호출은 계량되는 네트워크 요청입니다.
RSI-Jev v6.1-VL은 또 다른 구성의 전체 모습입니다. 이는 Qwen3.5-4B-Base 타워를 엔드 투 엔드로 파인튜닝한 모델로, 16, 20, 32번 레이어에 결정 헤드가 있으며, 자체 완결형이고 bf16에서 9.7 GB인 체크포인트에서 서빙됩니다. 파라미터 수는 4.69B이며, 그 분포를 알면 좋습니다. 32개 디코더 레이어에 3.57B, 토큰 임베딩에 0.64B, 비전 타워에 0.33B, 메인 결정 헤드에 0.05B, 두 개의 조기 종료 헤드에 0.10B입니다. 전문가 혼합은 없고 두 번째 모델도 없습니다. 저장소에서 pip 명령으로 설치하고 서버를 실행하면, 그 시점부터 의사결정은 여러분의 인프라를 절대 떠나지 않습니다.
• 누가 운영하는가 — 당신이 통제할 수 없는 사용량 제한 방식의 호스팅 엔드포인트 대 자신의 GPU, Apple Silicon 또는 CPU에 올린 9.7 GB 체크포인트.
• 가격 구조 — 입력 토큰 백만 개당 $0.042, 출력 무료, 호출당 지불 vs 한계비용 제로에 머신 및 운영 비용을 더한 것.
• 입력 예산 — 호스팅 모델에서는 요청당 약 64,000 토큰인 반면, 체크포인트에서는 32,768 텍스트 토큰에 이미지 예산을 더한 것이며, 그보다 긴 입력은 잘리는 대신 거부됩니다.
• 가중치와 라이선스 — 비공개, 크기 미공개 vs Apache-2.0 가중치, MIT 코드, 4.69B 파라미터.
• 모달리티 — Jev 계약에는 텍스트, RSI-Jev 비전 릴리스에서는 요청당 최대 4개의 이미지와 함께 제공되는 텍스트.
• 소유권 — TypeSafe AI의 상업적 모델 대 자체 라이선스 문구에 "TypeSafe AI와 제휴 관계가 없음"이라고 명시한 제3자 연구 프로젝트.
RSI-Jev 자체 보드의 점수, 그리고 그것이 비교의 절반에 불과한 이유
이 프로젝트가 내세우는 수치는 Decision Index 0.3 점수인 50.98로, 직전 릴리스의 46.23에서 상승한 v6.1-VL 4B의 점수다. 이는 기본 구성의 전체 실행 — 요청 140,178건, 커버리지 1.0 — 이며, 2026-10-06자 프로젝트 자체 공개 보드에서 해당 보드 최고의 4B 모델과 동률을 이룬다(50.98 대 ezjev 4B s2의 50.82로, 키트는 이를 0.25 이내 동률로 취급한다). 전체 113개 중 27위에 올라 있다. 더 오래된 Decision Index 0.2.1에서는 v6.0-VL의 46.24에 대비해 50.74를 기록한다. 15개 벤치마크 스위트는 open_jev_ood 훈련 행과 겹치는 것으로 밝혀진 태스크를 제외하고 보고하면 0.793이며, 홀드아웃 세트는 0.729다.
그 수치들은 모두 RSI-Jev 자체의 것으로, RSI-Jev의 하네스에서 측정된 것입니다. Decision Index는 공개 벤치마크 보드이지만, 그 안에 Jev 1.13에 대한 측정값은 없습니다. 왜냐하면 그 프로젝트의 스위트는 공개 결정 체크포인트를 채점하도록 만들어졌고, Jev는 비공개 엔드포인트이기 때문입니다. 따라서 typed-decisions 벤치마크에서 50.98을 Jev의 0.727과 맞세우고 승자를 선언하고 싶은 유혹은 바로 피해야 할 실수입니다. 그 두 수치는 서로 다른 하네스, 서로 다른 표본 크기, 서로 다른 데이터에서 나온 것이며, 어느 누구도 두 모델 모두에 하나의 하네스를 실행한 적이 없습니다.

존재하는 단 하나의 일대일 비교는 RSI-Jev의 것이 아니라 Laya의 것이다
공개된 비교 중 실제로 오픈 체크포인트 옆에 Jev 수치를 나란히 놓은 것이 하나 있는데, 그것은 이곳의 어느 당사자도 수행한 것이 아니다. Laya 결정 모델을 만든 Convai Innovations는 TypeSafe가 공개한 Jev 1.13.0 수치를 자사 수치와 함께 표로 정리하고, 그 한계도 스스로 지적했다: Jev 수치는 제3자가 공개한 것이며 Convai가 측정한 적이 없고, 표본 크기와 프롬프트가 다르며, 벤더는 해당 모델에 대한 자체 벤치마크를 기재하지 않는다. 그 표는 판정이 아니라 보정을 위해 읽을 가치가 있으며, RSI-Jev는 전혀 포함하지 않는다. 그 표가 공개될 당시 RSI-Jev는 존재하지 않았기 때문이다.
그것이 실제로 보여주는 것은 독자가 실제로 저울질하고 있는 호스팅 대 오픈이라는 질문의 윤곽이다. 호스팅 모델은 선택지 공간이 크고 모델이 넓은 답변 집합을 안정적으로 유지해야 할 때 앞선다. 오픈 모델은 경로에 네트워크가 없기 때문에 호출당 순수 지연 시간에서 이긴다. 그 패턴 안에는 이 두 특정 모델 중 어느 것이 당신의 과제에 더 나은지 알려주는 것이 없으며, 정직한 입장은 그 답이 아직 공개적으로 존재하지 않는다는 것이다.
체크포인트가 주는 것, 엔드포인트는 줄 수 없는 것
RSI-Jev에 대한 가장 강력한 논거는 점수가 아니다. 그것은 가중치가 당신의 디스크에 있다는 점이다. 의료 기록, 법률 문서 또는 고객의 계좌 이력에 대해 내려지는 라우팅 결정에서 "데이터는 건물 밖으로 나가지 않는다"는 것은 벤치마크 점수와 맞바꿀 선호가 아니라 — 엄격한 요구사항이며, 어떤 가격을 제시하더라도 호스팅 엔드포인트는 이에 답하지 못한다. 같은 속성은 속도 제한도 없앤다: 호스팅 모델에 대한 공급업체 자체 문서는 그 한도가 동적으로 조정되며 예고 없이 변경될 수 있다고 명시하고, 자체 호스팅 체크포인트에는 당신의 하드웨어 외에는 그러한 상한이 없다.
체크포인트가 제공하는 두 번째 이점은 깊이 제어이며, 이는 이례적입니다. 결정 헤드가 세 가지 깊이에 위치하기 때문에, effort 설정은 요청이 사용할 수 있는 레이어 수를 선택합니다: low는 약 23ms 중앙값으로 레이어 16에서 멈추고, medium은 27ms로 20에서, high는 약 40ms로 32에서, auto는 충분히 확신하는 첫 번째 출구에서 답하며, 프로젝트의 스위트에서 평균 32개 중 19.5개 레이어를 사용합니다. 이 지연 시간은 bf16으로 H200 한 대에서 측정한 프로젝트 자체의 수치이며, 어떤 호스팅 수치와도 혼합해서는 안 됩니다 — 로컬 포워드 패스와 과금되는 API 호출은 같은 측정이 아니며, RSI-Jev의 자체 문서는 Jev의 공개된 지연 시간과의 이전 비교가 로컬 GPU 작업과 네트워크 왕복을 맞붙인 것임을 분명히 밝히고 있습니다.
세 번째는 이미지입니다. Jev의 계약은 텍스트를 입력받아 구조화된 JSON을 출력합니다. RSI-Jev 비전 릴리스는 요청당 1~4개의 이미지를 base64 데이터 URL로 받아들이며, 상태는 각 이미지를 마커로 참조하고, v6.1-VL은 프로젝트의 홀드아웃 이미지 세트에서 0.834점을 기록합니다. 당신의 결정이 "사진에 눈에 띄는 손상이 보이는가"라면, 그것은 호스팅된 계약이 전혀 제공하지 않는 기능입니다.
포기하는 것 역시 실재하며, 프로젝트는 이를 공개합니다. 이번 릴리스에서 캘리브레이션은 나아진 것이 아니라 더 나빠졌습니다: 최종 기대 캘리브레이션 오차는 레이어 32에서 0.048, 자동 사용 시 0.055이며, 이전 릴리스의 0.036 및 0.024와 대비됩니다. 기본 단일 임계값 0.95는 명시적으로 확인되지 않은 상태로 제공됩니다 — 이는 선택 규칙의 폴백이며, 그 규칙이 자체적으로 선택한 0.85는 개발 데이터의 절반에서 프로젝트의 깊이 상한을 충족하지 못했습니다. 얼리 엑시트는 텍스트만 읽으므로, 이미지가 있는 질문은 노력 수준과 관계없이 32개 레이어를 모두 실행합니다. 그리고 이미지 훈련 소스 중 다섯 개는 비상업용이거나 연구 전용이며, 프로젝트는 비상업 데이터로 훈련된 가중치가 그러한 조건을 승계하는지 여부가 확정되지 않았다고 분명히 밝히고 있습니다.
호스팅된 버전을 어디에서 호출할지, 어디에서는 호출하지 말아야 할지
이것은 우리가 이해관계를 걸고 있는 비교의 일부이므로, 정확하게 짚을 가치가 있습니다. 우리는 TypeSafe의 모델을 typesafe/jev-1.13이라는 이름으로 전용 systemone 엔드포인트에서 제공합니다. 즉 OpenAI chat-completions 형태가 아니라 /v1/systemone으로 보내는 POST이고, 스트리밍이 아니며, 우리 카탈로그에 등재된 65,536토큰 컨텍스트를 대상으로 합니다. 이는 RSI-Jev가 구현하는 것과 동일한 요청 및 응답 형태이며, 해당 프로젝트가 그 계약을 그대로 모방한 모델에서 나온 것입니다. RSI-Jev 자체는 우리가 호스팅하지 않습니다. 우리 카탈로그에는 rsi-jev id도 shgao id도 없으며, 그 모델을 원하는 독자는 직접 내려받습니다.
여기서 그 구분이 중요한 이유는 좁고 구체적입니다. 의사 결정 계층은 워크플로 전체인 경우가 드물며, 보통 답변이나 요약 또는 코드를 작성하는 생성 모델 옆에 자리합니다. 이는 역사적으로 두 가지 계약을 의미했습니다. 호스팅되는 쪽에서는 더 이상 그럴 필요가 없습니다: Jev 1.13은 200개 이상의 다른 모델과 동일한 키에서 공급자 정가가 0% 마크업으로 그대로 전달되는 가격으로 제공되며, 따라서 TypeSafe가 요금을 변경하면, 그 변경은 다음 청구 주기가 아니라 같은 날 우리 쪽에 반영됩니다. 자체 호스팅되는 쪽은 그런 문제가 없었습니다. 공급자가 바로 여러분이기 때문입니다. 이 둘 사이에서 결정하는 깔끔한 방법은 먼저 자신만의 레이블이 지정된 사례 몇 개에 상용 계약을 적용해 보고, 기본 제공 동작이 자동화에 충분히 좋은지 확인한 다음, 그제서야 4.69B 체크포인트를 직접 실행하는 것이 운영 부담을 감수할 만한지 따져보는 것입니다.

실제로 어떤 것을 선택해야 할까요
결정이 귀하의 경계 안에 머물러야 한다면, 이미지와 텍스트 모두에 대한 결정이 필요하다면, 옵션 세트가 수백 개에 달한다면(체크포인트는 질문당 최대 5,120개 옵션을 허용합니다), 또는 요청별로 깊이와 지연 시간을 조정하고 싶다면 RSI-Jev v6.1-VL 4B를 선택하세요. 들어가면서 다음을 알고 시작하세요: 귀하가 도입하려는 프로젝트가 13일 동안 여덟 번 움직였다는 점, 최신 릴리스가 캘리브레이션을 희생하고 정확도를 택했다는 점, 자체 카드가 확인할 수 없었던 종료 정책의 부분들을 명시한다는 점.
서빙 스택 없이도 의사결정이 작동하기를 원한다면, 누군가가 계속 유지해 주는 엔드포인트를 중요하게 여긴다면, 그리고 계량할 출력 토큰 없이 백만 입력당 $0.042라는 가격이 귀하의 호출량 대비 저렴하다면 Jev 1.13을 선택하십시오. 크기가 공개되지 않았고, 속도 제한이 예고 없이 바뀔 수 있으며, 공개된 벤치마크를 다시 실행할 수 없는 폐쇄형 모델을 호출하고 있다는 점을 알고 시작하십시오.
두 모델이 공통으로 가진 점은 이들을 구분하는 점보다 더 유용하며, 이런 비교를 굳이 쓸 가치가 있는 이유이기도 하다. 어느 모델도 텍스트를 생성하지 않으므로, 중괄호를 닫는 것을 잊거나 필드를 만들어내는 모델에서 비롯되는 실패 유형을 끌어들이지 않는다. 둘 다 확률을 반환하며, 두 경우 모두 그 확률은 자동화에 활용하기 전에 자신의 레이블링된 데이터로 검증해야 하는 부분이다 — 지연 시간은 이미 상품화되어 있고, 배포마다 확보해야 하는 것은 신뢰도 값이다. 다운로드 대 호출이라는 구분선의 어느 쪽에 서든, 캘리브레이션을 먼저 테스트하세요.

