RSI-Jev vs Laya를 위한 생성된 타이틀 카드로, '두 개의 오픈 의사결정 모델. 상반된 베팅.'이라고 적혀 있고, 왼쪽 카드에는 'RSI-Jev v6.1-VL'이라는 라벨과 brain-cog 아이콘, '4.69B 파라미터, 제로샷'이라는 줄이 있으며, 오른쪽 카드에는 'Laya'라는 라벨과 feather 아이콘, '421M 파라미터, 파인튜닝하세요'라는 줄이 있고, 두 카드 사이에는 얇은 세로 구분선이 있으며, 캡션은 '둘 다 Apache-2.0. 어느 것도 당신을 위해 호스팅되지 않습니다.'입니다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

RSI-Jev vs Laya: 두 개의 오픈 의사결정 모델, 정반대의 승부수

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 10월 기준으로, 호스팅된 엔드포인트를 거치지 않고 타입이 지정된 결정 — 예/아니오, k개 중 하나 선택, 루브릭에 따른 평가 — 을 내리고 싶다면 고려해 볼 만한 오픈 웨이트 모델이 두 개 있습니다. 바로 RSI-Jev v6.1-VL 4B(2026-10-07, 서드파티 Shanghua-Gao/RSI-Jev 연구 루프 공개)와 Laya(2026-09-18, Convai Innovations 출시)입니다. 둘 다 생성 텍스트 없이 단일 순방향 패스로 답하고, 모든 옵션에 대해 보정된 확률을 반환하며, Apache-2.0 웨이트로 제공되고 TypeSafe의 결정 API를 사용하는 서버와 함께 제공되므로, 상용 모델용으로 작성된 클라이언트도 기본 URL만 바꾸면 둘 중 어느 쪽에서든 실행됩니다. 또한 이 둘은 상반된 베팅 위에 만들어졌으며, 이들을 구분 짓는 두 수치는 레이블당 3~4토큰과 4억 2,100만 개의 파라미터입니다.

첫 번째 베팅은 규모에 관한 것입니다. Laya의 영어 체크포인트는 421M 파라미터에 512 토큰 컨텍스트를 가진 ModernBERT-large이고, 다국어 체크포인트는 322M의 mmBERT-base로 1,024 토큰 윈도우를 가지며 인코더를 넓게 설정하면 8,192까지 도달합니다. RSI-Jev v6.1-VL은 Qwen3.5-4B-Base 타워 전체를 실행합니다 — 4.69B 파라미터, 그중 3.57B는 32개 디코더 레이어에 있고, 여기에 비전 타워와 레이어 16, 20, 32의 세 개 의사결정 헤드가 더해집니다. Laya는 몇 기가바이트 안에 세 개를 미리 로드할 수 있는 모델이고, RSI-Jev는 9.7GB bf16 체크포인트입니다. 두 번째 베팅은 첫 번째에서 이어집니다. Laya는 호출당 거의 아무것도 쓰지 않으며 당신이 자신에게 도메인을 가르쳐 주기를 기대하는 반면, RSI-Jev는 전혀 훈련 없이 당신의 질문에 답하려고 45억 개 파라미터를 씁니다.

각각이 실제로 무엇을 위한 것인지

Laya의 자체 모델 카드에는 어떤 리뷰어도 할 수 없을 만큼 이 비교를 잘 정리해 주는 문장이 들어 있다: “Laya는 특화하기 위한 빠른 기반이지, 제로샷 의사결정 엔진이 아니다.” typed-decisions 벤치마크에서 — 네 개의 워크플로에 걸친 2,000개 결정 — 베이스 영어 체크포인트는 0.362점을 기록하는데, 이는 무작위 추측의 0.318, 항상 다수 클래스를 고르는 경우의 0.461과 대비된다. 같은 결정들에서, 해당 벤치마크 자체의 학습 분할로 Convai가 파인튜닝한 체크포인트는 0.766점을 기록해 0.735의 교사 일치도 상한을 넘어선다. 그 격차가 바로 제품이다: Laya는 좁은 분류 체계에 파인튜닝하는 421M 인코더이고, Convai는 두 개의 무료 T4에서 전체 루프 — 데이터셋 구축, 학습, 캘리브레이션 온도 피팅, 평가 — 를 실행하는 Kaggle 노트북을 제공한다.

RSI-Jev는 또 다른 선택지다. 자체 공개 Decision Index 0.3에서 v6.1-VL 릴리스는 50.98점을 기록하는데, 이는 기본 구성으로 140,178회 요청을 실행한 결과이며, 2026-10-06자 프로젝트 보드에서 그곳 최고 4B 모델과 동률을 이루고 전체 113개 중 27위에 올라 있다. 15개 벤치마크 스위트는 0.793이고 홀드아웃 세트는 0.729다. 이는 제로샷 수치다. 다만 프로젝트는 15개 벤치마크 중 10개가 어떤 형태로든 훈련 데이터를 제공한다고 신중히 밝히고 있으므로, "제로샷"은 해당 릴리스의 탐색에 적용되는 것이지 페이지의 모든 숫자에 적용되는 것은 아니다. 이 수치들이 실제로 제공하는 것은, 모델에 한 번도 보여준 적 없는 문서에 관한 질문에 답할 수 있고 먼저 훈련 실행을 할 필요가 없는 모델이다.

• 크기 — Laya 421M 영어 / 322M 다국어 vs RSI-Jev 4.69B, 전체 Qwen3.5-4B-Base 타워를 실행

• 제로샷 정확도 — Laya는 typed-decisions에서 0.362로 0.461의 다수결 베이스라인을 밑돌았고, RSI-Jev는 자체 Decision Index 0.3에서 50.98로 그 부문 최고 4B 항목과 동률을 기록했다.

• 파인튜닝 정확도 — Laya 0.766은 벤치마크 자체 분할로 학습된 체크포인트를 사용한 수치인 반면, RSI-Jev의 수치는 도메인별이 아닌 릴리스 수준입니다.

• 언어 — Laya: 51개 언어 중 45개 언어 사용 가능, RSI-Jev 영어 중심 텍스트 대비 서버 측 무작위 라우팅보다 3배 이상.

• 모달리티 — Laya는 텍스트만 사용하는 반면, RSI-Jev는 텍스트와 요청당 최대 4개의 이미지를 사용합니다.

• 컨텍스트 — Laya는 영어 512 토큰, 다국어 1,024 토큰, 긴 문서의 경우 최대 8,192 토큰인 반면, RSI-Jev는 32,768 토큰이며, 잘라내는 대신 거부합니다.

• 지연 시간 — T4에서 Laya는 p50 32.8ms, 배치 10에서 질문당 7.2ms인 반면, RSI-Jev는 effort 낮음에서 22.5ms, H200에서 최대 깊이에서는 약 40ms입니다.

옵션 개수의 급락이 가장 뚜렷한 차이입니다

두 모델 모두 요청 시점에 답변 공간을 정의하므로 새 스키마에 재학습이 필요하지 않습니다. 이것이 이 제품군 전체가 공유하는 구조적 이점입니다. 하지만 두 모델은 답변 공간을 서로 다르게 할당하며, 그 차이는 기업용 라우팅이 주로 다루는 바로 그 작업에서 드러납니다. Laya는 각 옵션을 자체 마스킹 토큰에서 채점하고, 옵션들은 고정된 헤드 예산을 공유합니다. 영어 체크포인트에서는 192개 토큰, 다국어에서는 256개 토큰입니다. 인텐트가 77개인 Banking77에서는 레이블당 대략 서너 개의 토큰에 불과해 정확도가 0.425로 떨어집니다. Convai 자체 카드에서도 이 급락을 문서화하고 해결책을 제시합니다: head_max_len을 512로, 컨텍스트를 1,024 이상으로 높여 각 레이블에 여유를 주거나, 큰 옵션 집합을 coarse-to-fine 2단계 선택으로 나누는 것입니다.

RSI-Jev의 서빙 경로는 질문당 최대 5,120개의 선택지를 허용합니다. 이는 Laya의 0.425에 대한 동일 조건 벤치마크가 아닙니다. 이 둘은 서로 다른 하네스에서 측정되었고, 선택지 상한은 점수가 아니라 구성 한계입니다. 이는 여러분의 분류 체계에 항목이 100개 있을 때 어떤 모델이 무너지지 않는지에 관한 진술입니다. 선택형 질문이 "청구 / 기술 / 영업 / 기타"라면 둘 다 작동합니다. 100여 개의 인텐트 레이블이라면, 이 둘 중 하나는 사용 가능해지기 전에 튜닝이 필요하고 다른 하나는 그렇지 않습니다.

Headless Chromium capture of the GitHub repository page for Shanghua-Gao/RSI-Jev: the repository header with the Public badge and the counters Fork 5 and Star 80, the repository description about typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents with the checkpoints, the code that produced them and every version that failed, a commit list headed by the merge commit 'Merge pull request #35 from Shanghua-Gao/copy-no-ranking', the file rows for the v6.1-VL weight-averaging work and the v5.0-VL 3B quickstart, the counters 202 commits, 8 tags and 8 releases, the MIT license line, and the topic tags decision-model, jev, lm, system-one and typed-decisions.

지연 시간, 언어 문제, 그리고 이미지

Laya의 지연 시간 주장은 가장 크게 내세우는 것이며, 실제로 사실이다: Tesla T4에서 단일 질문에 p50 32.8ms, 10개 배치에 72.3ms, 50개에 337ms — 평범한 GPU 하나에서 초당 103~332개 질문이다. H200에서 측정한 RSI-Jev 자체 수치는 다음과 같다: 22.5ms는 추론 노력 낮음일 때, 26.8ms는 중간일 때, 39.9ms는 기본 설정일 때, 40.4ms는 최대 깊이일 때이다. 이들은 같은 자릿수이며, 둘 다 네트워크 호출이 아닌 로컬 포워드 패스인데, 이는 호스팅 엔드포인트가 고려 대상에서 빠지면 실제로 중요한 비교다. 이 둘이 시간을 어떻게 쓰는지 주목하라: RSI-Jev는 그 22.5ms를 얻기 위해 의도적으로 레이어 16에서 멈출 수 있고, 질문이 어려우면 32개 레이어를 전부 실행하며, Laya에는 그러한 다이얼이 없다 — 항상 전체 (작은) 인코더를 실행한다.

언어 관련 이야기는 정반대로 흘러가며, 영어권 밖의 사람에게는 결정적이다. Laya는 문자 체계를 1밀리초도 안 되는 시간에 감지해 다국어 체크포인트로 보내는 라우터를 제공하는데, 공개된 표를 보면 51개 언어 중 45개가 무작위 대비 3배 이상 수준으로 쓸 수 있는 반면, 영어 체크포인트 단독으로는 23개에 그친다. 이 카드는 그것이 왜 중요한지도 솔직히 밝힌다. 영어 체크포인트는 비라틴 문자에서 무너지는데 — 크메르어는 확신도 0.952에서 정확도 0.000을 기록한다 — 따라서 확신도 게이팅으로는 잘못된 라우팅을 구제할 수 없다. RSI-Jev에는 이런 종류의 언어 관련 이야기가 없다. 그것은 우연히 이미지를 읽을 수 있는, 영어 중심의 텍스트 모델일 뿐이다.

이미지의 경우는 정반대입니다. RSI-Jev는 요청당 1~4개의 이미지를 base64 데이터 URL로 받으며, 이번 릴리스에서 홀드아웃 이미지 세트를 대상으로 0.834점을 기록했습니다. Laya의 출시된 체크포인트는 텍스트 분류기이며, 커뮤니티 포트로는 laya-vision이 Hub에 존재하지만, 그것들은 공급업체의 제품이 아닙니다. 사진, 차트 또는 스크린샷에 대한 결정을 내려야 한다면, 그것은 한 모델의 영역이지 다른 모델의 영역이 아닙니다.

둘 중 어느 쪽도 다른 쪽과 비교해 벤치마크된 적이 없습니다

이것은 사양별 비교가 조용히 숨기는 부분이다: 이 두 모델 사이에는 직접적인 맞대결이 없다. 존재하는 것은 각 모델과 동일한 클로즈드 모델인 TypeSafe의 Jev 1.13 사이의 맞대결뿐이며, 어느 쪽도 다른 쪽과 나란히 놓일 수 없다.

Convai가 하나를 발표했습니다. typed-decisions에서는 Jev 1.13.0이 0.727로 Laya의 라우팅 방식 0.766을 상대했고, Banking77에서는 Jev가 0.870으로 Laya의 0.425를 상대했으며, 캘리브레이션에서는 Jev가 0.246으로 temperature 수정 후의 Laya 0.081을 상대했습니다. Convai는 같은 표에서 자체적인 한계도 지적합니다. Jev 수치는 제3자가 발표한 것이고, Convai는 그것을 측정할 API 접근 권한이 애초에 없었으며, 표본 크기와 프롬프트도 다릅니다. RSI-Jev의 비교 대상은 Decision Index인데, 이는 RSI-Jev 자체의 공개 보드이며 Jev 항목을 전혀 포함하지 않습니다. 따라서 이 두 모델 모두에 걸치는 유일한 외부 수치는 각 모델을 판매하는 당사자들이 만든 평가 도구에서 나온 것이고, 위의 어떤 단일 수치든 합당하게 해석하자면 "이것은 제작자가 제작자의 과제에서 측정한 값"이라는 뜻입니다.

두 프로젝트가 잘하면서도 드물게 하는 일은 자신들의 약점을 공개하는 것입니다. RSI-Jev는 자사의 비전 릴리스에 사용된 다섯 개의 비상업적 이미지 출처를 밝히고, 그들로 학습된 가중치가 해당 약관을 승계하는지는 확정되지 않았다고 분명히 말합니다. 자사의 최신 릴리스에서 보정 회귀를 보고하고 기본 종료 임계값을 미확인이라고 부릅니다. Laya는 자사의 기본 체크포인트가 다수결 기준선 아래에 있다는 점, 자사의 서수 점수 질문이 가장 약한 기본 요소라는 점, 자사의 noul이 상태가 아니라 자체 옵션 레이블을 따를 수 있다는 점, 그리고 응답 필드 중 하나가 쓸모 있는 신호를 담지 않는다는 점을 문서화합니다. 그 정직함은 두 프로젝트 중 어느 쪽에서든 물려받을 가장 유용한 것입니다: 그것들을 토대로 자동화하기 전에 자체 레이블이 지정된 사례에서 신뢰도 값을 확인하십시오.

Headless Chromium capture of OrcaRouter's own model page for typesafe/jev-1.13: the breadcrumb 'Home / Models / TypeSafe', the page title Jev 1.13 above the slug typesafe/jev-1.13, the line 'by TypeSafe - 2026-09-24', the description that it is TypeSafe's structured decision and evaluation model taking noul / choice / score questions and returning a structured answer for each, the note 'POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.', the endpoint panel reading /v1/systemone with the price $0.04, our p50 TTFT of 161 ms, 363 ms and 58.9M, and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

그들이 복사하는 계약서가 실제로 있는 곳

이 두 모델이 모두 존재하는 이유는 하나의 와이어 형식이 복사할 가치가 있었기 때문입니다. TypeSafe의 Jev는 요청 형태 — 상태, 질문, 세 가지 타입 지정 프리미티브 — 와 응답 형태를 정의하며, Laya와 RSI-Jev 모두 이를 구현하므로 기존 클라이언트는 기본 URL만 바꾸면 작동합니다. 그 참조 모델인 typesafe/jev-1.13은 우리가 서비스하는 세 가지 중 하나입니다: 우리 카탈로그의 전용 systemone 엔드포인트에 있으며, /v1/systemone으로의 POST이고, 비스트리밍이며, 65,536토큰 컨텍스트를 대상으로 입력 토큰 100만 개당 $0.042이고 출력은 0으로 청구됩니다. Laya도 RSI-Jev도 우리 카탈로그에는 없습니다 — 둘 다 다운로드이며, 바로 그것이 이들의 요점입니다.

그것의 실용적인 버전이 비교보다 더 중요합니다. 의사결정 레이어는 스택 안에서 거의 혼자 존재하지 않습니다. 답변이나 요약, 코드를 작성하는 생성 모델 바로 옆에 자리하죠. 참조 계약이 200개 이상의 다른 모델과 같은 키에 있고, 공급자 목록 가격이 0% 마크업으로 그대로 전달된다는 것은 공급업체 요율 변경이 같은 날 여러분에게 도달한다는 뜻이며, 자동 페일오버 덕분에 저렴한 의사결정 절반이 충분히 좋은지 판단하는 동안에도 생성 절반이 단일 장애점이 되지 않습니다. 자체 호스팅 421M 인코더나 4.69B 체크포인트가 올바른 선택이라고 결정하더라도, 그것이 사용하는 계약에 같은 곳에서 접근할 수 있기를 여전히 원할 것입니다 — 그리고 둘 중 어느 것도 운영하고 싶지 않다면, 둘 다 복사하는 모델이 한 번의 요청 거리에 있습니다.

어느 것을 다운로드해야 하나요?

레이블된 데이터가 있고, 크게 변하지 않는 분류 체계가 있으며, 영어만으로 구성되지 않은 언어 조합을 가지고 있다면 Laya를 선택하세요. Laya는 여러 개를 실행할 수 있을 만큼 작고, 모든 요청 앞에 배치할 수 있을 만큼 빠르며, 처음부터 파인튜닝되도록 설계되었습니다 — 제로샷의 0.362에 대비한 파인튜닝된 0.766 점수가 모든 것을 말해줍니다. 훈련 실행, 레이블링, 그리고 보정 오차를 0.466에서 0.081로 낮추는 질문 유형별 temperature 재조정에 대한 예산을 책정하고, 대규모 분류를 신뢰하기 전에 옵션 세트를 대략 20개 레이블 이하로 유지하거나 헤드 예산을 늘리세요.

훈련 없이 먼저 작동하는 의사결정을 원한다면, 질문이 때때로 이미지에 관한 것이라면, 옵션 세트가 크다면, 또는 요청당 깊이를 얻기 위해 지연 시간을 맞바꾸고 싶다면 RSI-Jev v6.1-VL을 선택하세요. 400M 체크포인트가 아니라 9.7 GB 체크포인트를 실행하게 될 것이며, 13일 동안 8개의 릴리스를 공개했고 이 버전을 평가하는 동안 또 하나를 공개할 수도 있는 프로젝트를 예상하세요. 그리고 그 캘리브레이션을 직접 확인해야 한다고 예상하세요 — 이 릴리스 자체의 카드에는 더 나아진 것이 아니라 더 나빠졌다고 적혀 있습니다.

어느 쪽을 고르든, 두 가지 사실은 같다. 두 모델 모두 텍스트를 생성하지 않으므로, 잘못된 형식의 필드를 내보내면서 실패할 수는 없다. 둘 다 확률을 반환하며, 그 확률은 카드에서 가져오는 것이 아니라 배포마다 검증해야 하는 부분이다. 그리고 둘 다 결정 계층에 관한 흥미로운 질문을 “누구의 API인가”에서 “누구의 가중치인가”로 옮겼다. 이는 물어볼 만한 더 나은 질문이며, 이 둘은 이 질문에 아주 다르게 답한다.

A generated two-column scoreboard titled 'RSI-Jev v6.1-VL vs Laya - the scoreboard', six rows across both columns: size, '4.69B parameters' against '421M English / 322M multilingual'; zero-shot, '50.98 Decision Index' against '0.362 typed-decisions'; fine-tuned, 'Not per-domain' against '0.766 on its own split'; languages, 'English-centric' against '45 of 51 usable'; modality, 'Text + up to 4 images' against 'Text only'; and latency, '~23-40 ms on an H200' against '32.8 ms p50 on a T4'. A footer reads 'Both vendor-reported; neither has been benchmarked against the other.'