'Intern-Decision-2B vs Laya'라고 적힌 생성된 타이틀 카드, 부제는 '2.21B 대 421M, 어느 쪽도 토큰을 쓰지 않음', '하나는 pip 패키지를 배포'와 '하나는 재현 키트를 배포'라는 배지가 붙어 있고, OrcaRouter 로고가 모서리에 합성되어 있다.
Guides & Insights

Intern-Decision-2B vs Laya: 22억 개 파라미터 대 4억 2,100만 개, 둘 다 답변 작성을 거부하다

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

internlm/Intern-Decision-2B과 convaiinnovations/laya는 소형 의사결정 모델 틈새에서 가장 유사한 두 모델이며, 이 비교에 관한 가장 유용한 사실은 이들이 정반대의 경로를 통해 그 지점에 도달한다는 것입니다. InternLM의 2,213,241,664개 파라미터 체크포인트는 플레이스홀더 앞의 고정된 위치에서 로짓을 읽고 generate()를 결코 호출하지 않습니다. Convai의 4억 2,100만 개 파라미터 체크포인트는 ModernBERT-large 백본 위에 있는 의사결정 헤드에 입력된 질문을 공급하고 단일 순방향 패스로 보정된 확률을 반환합니다. 둘 다 토큰을 생성하지 않으며, 둘 다 확률을 약속하고, 둘 다 입력 토큰 약 8천 개에서 한계에 도달하며, 더 작은 쪽은 5배 더 작고 대략 1000배 더 인기가 많습니다. 이들을 구분 짓는 것은 능력이라기보다는 패키징이며, 그 패키징 격차가 대부분의 독자에게 구매를 결정짓습니다.

Intern-Decision-2B는 2026년 9월 26일 05:36 UTC에 Hugging Face에 등장했는데, 이는 InternLM이 40초 만에 아무런 공지도 없이 업로드한 세 가지 크기 중 중간 크기였으며, Apache-2.0에 따라 Qwen/Qwen3.5-2B에서 파인튜닝된 모델이었다. Laya는 2026년 9월 18일에 처음 푸시된 이후 3,700여 개의 좋아요, pip 패키지, Jev 호환 HTTP 서버, ONNX 및 LangChain 통합, 파인튜닝 노트북을 축적해 왔다. 성숙도의 대비, 그것이 바로 이 글이다.

그들이 공유하는 전제, 그리고 서로 다른 메커니즘

두 카드 모두 당신의 문제가 알려진 답들 중에서 선택하는 것이라면, 산문을 생성하는 것은 잘못된 연산이라고 주장한다. Laya의 표현은 "그것은 결코 텍스트를 생성하지 않으므로, 파싱할 것도 없고 환각을 일으킬 것도 없다."이다. Intern-Decision-2B의 주장은 그 API가 "구조화된 후보 점수 산정을 수행한다. generate()를 호출하거나 자유 형식 텍스트를 샘플링하지 않는다."라는 것이다.

메커니즘은 그것들이 갈라지는 지점이다.

Laya는 분류기입니다. ModernBERT-large 인코더(395M, 양방향, 완전 파인튜닝)가 처음부터 학습된 결정 헤드 — 두 개의 트랜스포머 레이어, 옵션 마커 스코어러, act/escalate 헤드 — 에 입력을 공급하여 총 421M이 됩니다. 옵션들은 고정된 토큰 예산(head_max_len, 영어 체크포인트에서 192토큰, 다국어에서 256토큰)을 공유하며, 라우터는 패스 전에 0.5밀리초 이내에 문자 체계와 언어를 감지합니다.

Intern-Decision-2B는 생성기가 되는 것이 금지된 다음 토큰 모델입니다. 각 질문의 선택지를 단일 토큰 기호 A–Z, a–z, 0–9에 매핑하고, 각 필드마다 <decision> 플레이스홀더 하나가 있는 완전한 어시스턴트 JSON 스켈레톤을 렌더링하며, 한 번의 인과적 순방향 패스를 실행하고, 각 플레이스홀더 바로 앞에서 로짓을 읽고, 해당 필드의 허용 기호에 대해 소프트맥스를 적용하고, 피팅된 온도 2.100509348278을 적용합니다. 그 아래에는 표준 Qwen3_5ForConditionalGeneration이 있습니다 — 24개 레이어, 완전 어텐션 레이어 하나당 선형 어텐션 레이어 세 개, 유지된 다중 토큰 예측 레이어, 262,144 위치 임베딩 상한 — 그리고 비전 타워와 프로젝터도 있습니다.

차이의 실질적인 결과는 옵션 수용력이다. Laya의 고정된 옵션당 예산은 넓은 레이블 공간에서 무너진다. 자체 카드에는 같은 작업에서 TypeSafe Jev의 0.870에 대해 0.425를 기록한 77개 레이블 질문이 문서화되어 있는데, 77개 옵션이 각각 약 3~4개의 토큰을 받기 때문이다. Intern-Decision-2B는 질문당 최대 62개의 옵션과 최대 16개의 질문을 처리하며, 62는 선호도가 아니라 계약이 처리할 수 있는 단일 토큰 기호의 정확한 개수이다. 둘 다 수십 개 옵션을 넘어서면 편안하지 않으며, 실패 형태가 다르다.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

점수판

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Laya'. The left column reads: Parameters 2,213,241,664 plus vision tower; Input ceiling 8,192 tokens, refused above; Images up to eight; Speed 33.28 ms mean on one RTX 4090; Languages no multilingual claim made; Packaging a checkpoint and an inference script. The right column reads: Parameters 421M, one 842 MB safetensors file; Input ceiling 8,192 with max_len set, 1,024 default; Images none; Speed 103-332 questions/sec batched on one T4; Languages 100+ routed, 45 of 51 usable; Packaging pip install, HTTP server, ONNX, LangChain. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced and the Laya figures are Convai's own card, including its zero-shot typed-decisions result below the majority-class line.

• 매개변수 — BF16 기준 Intern-Decision-2B 2,213,241,664개에 비전 타워와 프로젝터 포함, 디스크에서 약 4.46GB; Laya 421M, 단일 842MB safetensors 파일, 별도의 644MB 다국어 체크포인트 포함.

• 입력 상한 — 둘 모두 8,192 토큰이며, 둘 다 잘라내지 않고 거부합니다. 참고로 Laya의 8,192는 laya-multilingual에 적용되고 max_len=8192를 요구합니다. 기본 제공되는 값이 1,024이기 때문입니다.

• 이미지 — Intern-Decision-2B의 경우 최대 8개이며, 동일한 토큰 예산에 포함됩니다. Laya에는 멀티모달 경로가 없습니다.

• 속도 — 하나의 RTX 4090에서 Intern-Decision-2B 기준 요청당 평균 33.28ms, P50 33.15ms, P95 33.55ms; Laya는 단일 T4에서 요청당 약 33ms, 배치 처리 시 초당 103–332개 질문을 보고합니다.

• 언어 — Laya는 다국어라는 주장을 전혀 하지 않는다; Laya는 100개 이상의 언어를 라우팅하며, 벤치마크된 언어 중 40개가 무작위 대비 3배 이상 사용 가능하다고 보고하고, 13개 비영어 언어 전반에서 MASSIVE 의도 과제에서 0.451을 기록해 영어 전용 체크포인트의 0.306과 대비된다.

• 제로샷 정확도 — Intern-Decision-2B는 7개 벤더 스위트에 걸쳐 평균 84.68을 기록했고 Brier 0.437과 ECE 0.100을 보였지만, 모두 재현되지 않았다. Laya의 기본 영어 체크포인트는 2,000개 결정으로 구성된 typed-decisions 벤치마크에서 0.362를 기록했는데, 자체 카드에서는 이를 0.461의 다수 클래스 기준선 아래로 표시한다.

• 패키징 — 체크포인트, inference.py, 그리고 학습 및 평가 코드가 포함된 새로 공개된 GitHub 리포지토리 대 pip install laya, Jev 호환 HTTP 서버, ONNX Runtime 및 TileLang 고속 경로, MCP 및 LangChain 통합, 무료 티어 GPU에서 실행되는 파인튜닝 노트북.

가장 공정한 비교는 스펙 시트가 만들어 놓은 비교가 아니다

84.68을 0.362 옆에 나란히 놓는 것은 거의 부정직한 짓이며, 그 숫자들을 그대로 방치하기보다는 왜 그런지 말할 가치가 있다.

Laya의 0.362는 튜닝 대상이 아니었던 벤치마크에서 제로샷으로 측정된 베이스 체크포인트입니다. 자체 카드는 결론을 명시적으로 내립니다: "Laya는 전문화하기 위한 빠른 베이스이지, 제로샷 의사결정 엔진이 아닙니다." 그 벤치마크 자체의 훈련 분할로 파인튜닝하면 0.766에 도달해, 0.735의 교사 상한을 넘어서고 같은 결정들에서 TypeSafe Jev의 공개된 0.727을 능가합니다. 한편 Intern-Decision-2B의 84.68은 7개 스위트 벤더 평균으로, 그 테스트 세트는 Laya가 인용하는 것과 같지 않고, 모델을 만든 연구소가 산출했으며, 제3자가 실행한 적이 없습니다 — 해당 체크포인트는 좋아요 하나와 다운로드 0을 보여줍니다. 파인튜닝 결과를 제로샷 결과와 비교하거나, 벤더 평균을 독립 리더보드와 비교하는 것은 비교가 아닙니다. 그것은 같은 서체를 공유하는 두 개의 서로 다른 측정입니다.

정말로 비교 가능한 점은 이것이다: 둘 다 작고, 둘 다 실행 비용이 저렴하며, 둘 다 당신의 도메인에 맞춰 파인튜닝할 수는 없다. 오늘 아침 InternLM이 공개한 저장소는 그 마지막 부분을 어제보다 실질적으로 더 쉽게 만든다. 훈련 런처, masked-next-token 목적 함수, 7개 스위트에 걸친 10,751개 테스트 행의 해시 검증된 번들, 그리고 temperature-fitting 및 replay 스크립트를 제공하기 때문이다. 결정론적 캘리브레이션 생성기를 제공하고 replay가 결정을 전혀 바꾸지 않는다고 단언하는 연구소는 바로 Laya의 카드가 권장하는 종류의 적응을 초대하고 있는 셈이다.

당신이 실제로 둘 중 하나를 어떻게 호출할지

두 모델 모두 OrcaRouter에 없습니다. OrcaRouter의 Intern-Decision-2B 모델 페이지는 404를 반환하며 Laya 라우트도 없습니다. 여기서 가용성을 주장하는 내용은 없습니다. Intern-Decision-2B는 체크포인트를 다운로드해 자체 GPU에서 번들 엔진을 실행하는 것을 의미합니다. Laya는 pip install laya를 의미하며, Jev 호환 인터페이스를 원한다면 POST /v1/systemone에서 laya-serve를 사용하는 것입니다.

그 밑에 깔린 오케스트레이터 형태의 질문은, 스코어러를 위한 두 번째 운영 표면을 원하는지 여부입니다. Laya는 임베딩되도록 설계되었습니다 — TypeSafe Jev와 동일한 요청 및 응답 형태이므로, 기존 클라이언트는 기본 URL만 바꾸면 되고 그 외에는 아무것도 바꿀 필요가 없습니다. Intern-Decision-2B는 재현되도록 설계되었으며, 현재로서는 첫 번째 결정이 돌아오기까지 대략 하루치 환경 작업이 필요합니다. 지금 내리는 폐쇄 집합 결정이 이 둘 중 하나와 형태가 비슷하다면, 두 카드가 모두 벤치마크하는 호스팅 대안은 TypeSafe Jev 1.13이며, 여기에는 경로가 있습니다: 백만 입력 토큰당 $0.042, 65K 컨텍스트, 그리고 178ms의 P50 첫 토큰 도달 시간이며, 200개 이상의 다른 모델과 동일한 키로 접근할 수 있고 제공업체 정가가 0% 마크업으로 그대로 전달됩니다.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing the TypeSafe breadcrumb, the model name Jev 1.13, text input, and the description that Jev is a structured decision and evaluation model taking a state and named questions (noul / choice / score) and returning a structured answer for each, served non-streaming via POST /v1/systemone with up to about 64K input tokens.

각각 우세한 부분

Laya는 운영상의 모든 측면에서 앞선다. pip 패키지 대 체크포인트 다운로드. 100개 이상의 언어를 아우르는 라우터 대 다국어 지원 주장이 없는 것. 초당 수백 개의 질문으로 측정되는 배치 처리량 대 배치 처리 관련 설명이 전혀 없는 요청당 수치. 2년간 축적된 생태계 역량 — ONNX, TileLang, LangChain, MCP — 대 공개된 지 두 시간밖에 안 된 저장소.

Intern-Decision-2B는 세 가지 좁은 측면에서 우위를 점합니다. 이 모델은 이미지를 입력받지만, Laya는 그렇지 않습니다. 이 모델에는 파인튜닝 부채가 없습니다. 84.68은 제로샷 벤더 측 주장인 반면, Laya의 대표 수치 0.766은 벤치마크 자체의 학습 분할에서 파인튜닝된 체크포인트에 속합니다. 그리고 재현 키트—검증 가능한 평가 번들과 공개 학습 스택—와 함께 문서화되어 있는데, 이는 모델을 다른 누군가에게 정당화해야 하는 사람에게 리더보드의 한 줄보다 더 가치가 있습니다.

동점은 전제입니다. 둘 다 생성을 거부하고, 둘 다 임계값을 적용할 수 있는 확률을 제공하며, 둘 다 대부분의 실제 문서가 존재하는 입력 길이에 미치지 못합니다. 당신의 상태가 티켓, 이메일 또는 양식이라면 어느 쪽이든 충분하며 Laya가 더 빠르게 도달하게 해 줄 것입니다. 당신의 상태에 스크린샷이 첨부되어 있거나 조직에서 재현 결과를 감사 가능하게 만들어야 한다면, InternLM의 중간 체크포인트가 바로 그 특정 이의에 답하는 쪽입니다. 그리고 InternLM 자체 수치로 보면 이는 세 형제 중 보정이 가장 잘 안 된 모델이며, ECE가 0.100으로 0.066 및 0.065와 대비됩니다. 그러니 이 모델이 보고하는 신뢰도를 믿기 전에 자체 temperature를 맞추십시오.