'Intern-Decision-4B vs Laya'라고 적힌 생성된 타이틀 카드가 있고, 부제는 '토큰을 생성하지 않고 답하는 두 모델'이며, 세 개의 칩에는 '4.54B vs 421M', '둘 다 한 번의 포워드 패스', '둘 다 Apache-2.0'이라고 적혀 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Engineering & Research

Intern-Decision-4B vs Laya: 답변 쓰기를 거부하는 두 모델, 크기 차이는 열 배

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Intern-Decision-4B 모델 카드에는 "Laya — 57.77"이라고 적힌 행이 있습니다. Laya 자체 문서를 읽어본 사람이라면 이 숫자의 의미를 알아볼 것입니다: convaiinnovations/laya는 4억 2,100만 개 파라미터의 비자기회귀(non-autoregressive) 결정 모델이며, 57.77은 다른 사람의 벤치마크에서 제로샷으로 사용될 때 얻는 평균값입니다. 자체 카드에는 같은 내용이 더 직설적으로 적혀 있습니다 — 기본 체크포인트는 낮습니다. typed-decisions 벤치마크의 다수 클래스 기준선보다 0.362 대 0.461로 internlm/Intern-Decision-4B는 한편, 정확히 같은 작업을 위해 만들어진 45억 4,000만 개 파라미터 모델입니다: 상태와 타입이 지정된 질문 세트를 받아, 한 번의 순전파를 실행하고, 보정된 확률을 반환하며, 토큰을 전혀 생성하지 않습니다. 같은 아키텍처적 선택, 같은 출력 형태, 같은 Apache-2.0 라이선스, 열 배의 파라미터 — 그리고 하나는 파인튜닝할 기반 모델이고 다른 하나는 완성된 제로샷 엔진이라고 주장합니다.

그들은 전제에 동의하는데, 바로 그게 드문 부분이다.

두 카드 모두 같은 주장을 펼치며, 업계 대부분이 반대를 주장하기 때문에 이 점은 말해 둘 가치가 있습니다. 문제가 알려진 답변 집합 중에서 선택하는 것이라면, 산문을 생성하는 것은 잘못된 작업입니다: 버려질 토큰에 비용을 지불하고, 파서가 필요하며, 임계값을 적용할 수 있는 확률 대신 요청하지도 않은 설명을 받게 됩니다. Laya의 카드는 이를 "텍스트를 전혀 생성하지 않으므로 파싱할 것도, 환각할 것도 없다"라고 표현합니다. Intern-Decision-4B의 카드는 자사의 API가 "구조화된 후보 점수 산정을 수행합니다. 그것은 generate()를 호출하거나 자유 형식 텍스트를 샘플링하지 않습니다."

이 메커니즘들은 교훈적인 방식으로 서로 다릅니다. Laya는 타입이 지정된 질문을 분류기 헤드에 입력하고, 단일 순방향 패스에서 보정된 확률과 함께 타입이 지정된 답변을 반환하며, 패스 전에 0.5밀리초 미만으로 문자 체계와 언어를 감지하는 라우팅 계층을 갖추고 있습니다. Intern-Decision-4B는 각 질문의 선택지를 단일 토큰 심볼에 매핑하고, 각 필드마다 플레이스홀더가 하나씩 있는 어시스턴트 JSON 골격을 렌더링하며, 각 플레이스홀더 바로 앞의 로짓을 읽고, 해당 필드에 허용된 심볼에 대해서만 소프트맥스를 적용합니다. Laya의 것은 분류 문제이고, InternLM의 것은 생성 문제가 되도록 내버려두지 않는 다음 토큰 문제입니다.

A screenshot of the convaiinnovations/laya model card on Hugging Face, showing the title 'Laya', the description of it as a multilingual non-autoregressive System 1 decision model returning typed answers with calibrated probabilities in a single forward pass across 100+ languages, the pip install laya line, and the long-documents note about laya-multilingual reading up to 8,192 tokens with max_len=8192.

크기 격차, 그리고 그것이 주는 것

421M과 4.54B 파라미터로 두 모델에게 같은 작업을 시키면 예상할 수 있는 결과가 나오고, 그다음엔 놀라움이 있다.

예측된 부분은 어려운 질문에서의 역량이다. Intern-Decision-4B는 일곱 개 평가 세트에서 평균 90.02를 기록하며, InternLM 자체 측정에서 Brier score 0.347과 expected calibration error 0.065를 보이고, 단일 RTX 4090에서 쿼리당 평균 44.16 ms로 실행된다. Laya의 기본 영어 체크포인트는 2,000개 결정 typed-decisions 벤치마크에서 정확도 0.362이며, 자체 카드에서는 이를 0.461 다수 클래스 기준선 아래이면서 0.318 무작위 기준선보다 겨우 높은 것으로 표시한다. 같은 체크포인트를 해당 벤치마크 자체의 학습 분할로 미세 조정하면 이 수치는 0.766으로 뛰어오른다. Laya의 카드는 스스로 결론을 내린다: "Laya는 전문화하기 위한 빠른 기반이지, 제로샷 결정 엔진이 아니다."

놀라운 점은 더 작은 모델이 두 가지 차원에서 완전히 앞선다는 것이다. 속도: Laya는 단일 T4에서 배치 처리로 초당 103~332개의 질문에 답하며, 자사 카드에서는 자체 인용한 독립 측정 p50 수치 236–276ms를 기준으로 TypeSafe Jev보다 대략 6~8배 빠르다고 내세운다. 매개변수가 10배라고 해서 반대 방향으로 처리량이 10배가 되는 것은 아니다 — Intern-Decision-4B의 44.16ms는 배치 처리 관련 내용이 전혀 공개되지 않은 4090에서 쿼리당 수치다. 그리고 언어: Laya는 벤치마크된 51개 언어 중 45개가 무작위 기준의 3배 이상으로 사용 가능하다고 보고하며, 13개 비영어 언어에서 MASSIVE intent 라우팅 점수 0.451을 기록해 영어 전용 체크포인트의 0.306과 대비된다. Intern-Decision-4B는 다국어 관련 주장을 전혀 하지 않는다.

점수판

• 파라미터 — Intern-Decision-4B용 BF16 4.54B, 텍스트 타워 + 비전 타워 + 프로젝터; Laya용 421M, 단일 소형 인코더급 스택.

• 입력 상한 — 두 모델 모두 8,192토큰이며, 둘 다 잘라내기보다 거부합니다. Laya의 8,192는 다국어 체크포인트에 적용되며, 해당 체크포인트의 출시 시 기본값은 1,024라는 점에 유의하세요.

• 다중성 — Intern-Decision-4B는 질문을 1개에서 16개까지, 각 질문당 최대 62개의 선택지를 입력받으며, 62는 임의의 숫자가 아니다. 그것은 정확히 이 모델의 추론 계약이 다룰 수 있는 단일 토큰 심볼의 수다. Laya도 여러 유형의 질문을 처리하지만, 해당 카드에는 약 50개 선택지를 넘어서면 급격한 붕괴가 기록되어 있다. 여기서 77개 레이블 질문은 레이블당 단 3~4개 토큰의 예산만 받고 정확도가 0.425로 떨어진다.

• 이미지 — Intern-Decision-4B의 경우 최대 8개이며, 8,192 토큰 예산에 포함됩니다. Laya에는 멀티모달 경로가 없습니다.

• 보정 — Intern-Decision-4B는 1,728개 사례에 대한 NLL 최소화로 선택된 1.99241824의 적합된 온도를 제공하며, 자체 스위트에서 ECE 0.065를 보고한다; Laya는 과신 상태로 제공되며, 그 카드에는 질문 유형 및 옵션 수별로 하나의 온도를 재적합하면 평균 ECE를 0.466에서 0.081로 이동시킨다고 나와 있다.

• 제로샷 태세 — 다수 클래스 기준선 아래의 점수를 기록하는 문서화된 베이스에 대비해 90.02 평균을 주장하는 완성된 체크포인트.

• 지연 시간 — 단일 RTX 4090에서 평균 44.16ms, 중앙값 44.03ms, 단일 T4에서 배치 처리 시 초당 103~332건.

• 언어 — 라우팅 시 사용 가능한 51개 언어 중 45개에 반하는 공개된 주장은 없습니다.

• 라이선스 — Apache-2.0, 업스트림 Qwen 라이선스는 보존되며 Apache-2.0은 상업적 사용으로 명시적으로 태그됨.

A two-column comparison scoreboard titled 'Intern-Decision-4B vs Laya'. The left column reads: Parameters: 4.54B BF16; Output: probabilities, no text; Options per question: up to 62; Latency: 44.16 ms mean on one RTX 4090; Zero-shot: 90.02 average reported; Images: up to eight; License: Apache-2.0. The right column reads: Parameters: 421M; Output: typed answers, no text; Options per question: degrades past ~50; Latency: 103-332 q/s batched on one T4; Zero-shot: below majority class, 0.362; Images: none; License: Apache-2.0, commercial use tagged. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.

두 장의 카드, 공개를 바라보는 매우 다른 두 가지 시각

여기서부터 비교는 스펙 시트를 넘어 판단의 문제가 됩니다. 두 공급업체가 각자의 모델을 정반대 스타일로 문서화하기 때문입니다.

Laya의 카드는 자체 실패를 상세히 공개합니다. 영어 체크포인트가 크메르어에서 0.952 신뢰도로 0.000 정확도를 기록한다고 보고합니다 — 틀렸는데도 확신한다는 뜻이며, 이로 인해 그곳에서는 신뢰도 게이팅이 무용지물이 됩니다. 또한 다음을 보고합니다: action.act_probability는 쓸 만한 신호를 담고 있지 않아, 396개의 라벨링된 결정에서 AUROC 0.30으로 거의 모든 입력에 대해 1.0을 기록하며, 대신 신뢰도로 게이팅하라고 알려줍니다. 같은 항목들에서 이는 0.77에 도달합니다. 순서형 점수 질문을 "가장 약한 기본 요소"라고 부르며 SST-5에서 0.372를 인용합니다. 자신의 출력 중 무엇을 무시해야 하는지 알려주는 카드는 대부분의 벤더가 시도하지 않는 일을 하고 있습니다.

Intern-Decision-4B의 카드는 깔끔한 표를 공개하며 실패 사례는 없다. 이 카드의 경고 문구들은 실재하며 중요한 역할을 한다 — 캘리브레이션 섹션은 파일럿의 "before" 열이 어떤 사용자도 보게 될 내용이 아니며, 테스트 스위트 레이블이 temperature를 선택하는 데 사용되지 않았다는 점을 이례적으로 분명히 밝힌다 — 하지만 평가 섹션은 일곱 번의 승리뿐이고 실패를 인정하는 대목은 없다. 또한 InternLM이 InternLM의 하네스에서 실행한 다섯 경쟁 시스템에 대한 행도 담고 있는데, 이 글을 여는 Laya 행도 그중 하나다. 그것들은 해당 프로젝트 자체의 수치가 아니며, 그렇게 읽는 것은 실수일 것이다.

그래서 이 맞대결의 근거 출처는 더 작은 모델에게 유리한 방식으로 비대칭적입니다: Laya의 근거에는 스스로 문서화한 결함이 포함되어 있고, Intern-Decision-4B의 근거는 저자들이 직접 고르지 않은 테스트 세트를 한 번도 만난 적이 없습니다.

각 항목이 어떤 형태의 문제에 적합한지

영어로 된 짧고 구조화된 상태가 주어지고, 답변 집합이 폐쇄되어 있으며, 신뢰할 수 있는 확률이 필요하다면, Intern-Decision-4B는 서류상으로는 더 유능한 객체이고 실제로는 더 비용이 많이 드는 객체입니다 — 4개의 safetensors 샤드, Python 3.12에서 PyTorch 2.9.1과 Transformers 5.14.1, 상주 엔진, 그리고 HTTP 엔드포인트를 원한다면 직접 작성해야 하는 래퍼. 처리량이 결정적 제약인 수십 개 언어에 걸친 대용량 라우팅 또는 가드레일 결정이 주어지면, Laya가 더 나은 형태입니다: pip install laya, 421M 모델, 그리고 확률을 신뢰하기 전에 미세 조정하라고 이미 알려준 카드.

두 카드가 모두 동의하는 단 하나는, 두 모델 중 어느 것도 자체 데이터로 캘리브레이션을 확인하지 않은 채 제로샷으로 신뢰해서는 안 된다는 점입니다 — Laya는 기본 체크포인트가 낯선 의사결정 유형에서는 거의 우연 수준이기 때문이고, Intern-Decision-4B는 0.065 ECE가 자체 저자들이 구성한 스위트에서 나온 것이기 때문입니다.

라우터가 여기서 바꾸는 것과 바꾸지 않는 것

이 두 모델은 모두 OrcaRouter 카탈로그에 없으며, 그렇지 않은 것처럼 암시하기보다 분명히 말하는 편이 좋습니다. 우리 모델 페이지는 Intern-Decision-4B와 Laya 모두에 대해 404를 반환하고, 둘 다 오늘날 호출할 수 있는 라우트가 아닙니다. 그것이 두 프로젝트에 의미하는 바는 같지 않습니다. Laya의 상업적 사용 태그가 있는 Apache-2.0 라이선스는 장애물이 순전히 패키징이라는 뜻입니다. 즉, 작은 설치 공간을 가진 로컬 Python 패키지이며, 이는 충분히 서비스할 수 있을 법한 유형입니다. Intern-Decision-4B의 장애물도 패키징이지만, 4.54B BF16 가중치와 8,192토큰 거부 한도 때문에 서비스라기보다 구성 요소에 가깝습니다.

OrcaRouter가 실제로 도움이 되는 곳은 결정의 저편, 즉 결정 이후 단계입니다. 구조화된 의사결정 문제에 결국 추론 단계가 필요하다면, 그 추론을 수행할 수 있는 범용 모델들은 200개 이상의 모델을 아우르는 단일 키로, 제공업체 정가가 0% 마크업으로 그대로 전달되고 제공업체 간 자동 장애 조치를 제공하는 환경에 있습니다 — 따라서 스코어러와 짝지을 모델은 두 번째 계약이 아니라 엔드포인트 하나 거리에 있습니다.

간략 버전

이 두 프로젝트는 결정이 어떻게 내려져야 하는지에 관해 같은 결론에 도달했고, 그다음에는 거의 모든 다른 점에서 갈렸다. Laya는 421M 파라미터, 엄격한 언어 라우팅, 자신의 결함에 대한 무자비한 솔직함이 당신이 특화할 수 있는 빠른 기반을 만든다고 본다. Intern-Decision-4B는 열 배의 파라미터와 세심하게 설계된 단일 토큰 채점 계약이 완성된 제로샷 엔진을 만든다고 본다. 결정적 실험은 둘 다 공개적으로는 해본 적 없는 것이다. 계산 가능한 답이 있는 결정들을 모아 두 모델을 모두 실행하고, 그 확률이 의미가 있는지 확인하는 것이다. Laya는 그 실험을 절반만 공개했고 그것이 어디서 실패하는지 보여주었다. Intern-Decision-4B는 그것을 전혀 공개하지 않았다.

A generated comparison card titled 'Same bet, ten times the parameters'. The left side, 'Intern-Decision-4B', lists: 4.54B BF16; a finished zero-shot checkpoint claiming a 90.02 average across seven sets; fitted temperature 1.99241824; 44.16 ms mean per query on one RTX 4090; Apache-2.0 with the upstream Qwen license preserved. The right side, 'Laya', lists: 421M; a documented base below the majority-class line at 0.362, rising to 0.766 once fine-tuned on the benchmark's own training split; refitting one temperature per question type moves mean ECE from 0.466 to 0.081; 103 to 332 questions per second batched on one T4; Apache-2.0 tagged for commercial use. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.