'Intern-Decision-0.8B'라고 적힌 히어로 타이틀 카드로, 부제는 '조용히 배포됨, 발표되지 않음'이고, '논문 없음, 저장소 없음, 출시 게시물 없음'과 '852,985,920개 파라미터, 디스크에 1.73 GB'라는 배지를 달고 있으며, 모서리에는 OrcaRouter 로고가 합성되어 있다.
Guides & Insights

아무런 예고 없이 등장한 Intern-Decision-0.8B: InternLM이 Hugging Face에 조용히 올린 것

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

모델 카드의 GitHub 링크는 404를 반환합니다. 데모 Space는 401을 반환합니다. "Intern-Decision"이라는 문자열에 대해 인턴십 구인 공고가 아닌 컬렉션도, 블로그 글도, 기술 보고서도, 검색 결과도 어디에도 없습니다 — 그런데도 Intern-Decision-0.8B는 지금 Hugging Face에 완전하고 다운로드 가능한 Apache-2.0 체크포인트로 올라와 있으며, Qwen3.5-0.8B에서 파인튜닝되었고, 2026년 9월 26일 새벽에 같은 3분 안에 나타난 두 개의 더 큰 형제 모델인 Intern-Decision-2B와 Intern-Decision-4B와 함께 업로드되었습니다. InternLM은 전에도 이런 방식으로 출시한 적이 있으며, 바로 그렇기 때문에 아래의 모든 내용은 출시 게시물이 아니라 저장소 자체에서 수집한 것입니다. 이 구분은 여기서 평소보다 더 중요합니다: 저장소는 무엇이 존재하는지 알려주고, 그것이 무엇을 위한 것인지는 오직 벤더만이 알려줄 수 있습니다.

리포지토리가 자세히 말하는 내용은 읽을 가치가 있을 만큼 이례적이다. 이것들은 채팅 모델도 아니고, 일반적인 의미의 소형 언어 모델도 아니다. Intern-Decision-0.8B는 하나의 상태, 미리 작성하는 이름 붙은 질문들의 스키마, 그리고 선택적으로 최대 8개의 이미지를 받아, 한 번의 순전파로 모든 질문에 대한 답변 분포를 반환한다. generate()를 호출하지 않는다. 샘플링하지도 않는다. 파싱할 텍스트 출력도, 수리할 JSON도, 끝내 닫히지 않은 중괄호를 둘러싼 재시도 루프도 없다. 그 좁음 자체가 아키텍처의 전부이며, 이 모델을 TypeSafe의 Jev 1.13, Convai의 Laya와 같은 작은 범주에 놓는다 — InternLM이 분명히 의도적으로 겨냥해 벤치마킹한 범주인데, Jevbench는 TypeSafe 자체 벤치마크이며 표의 첫 번째 열이기 때문이다.

다음은 체크포인트로부터 알 수 있는 것, 체크포인트가 주장할 뿐인 것, 그리고 현재 InternLM 외부의 누구도 전혀 말할 수 없는 것입니다.

저장소에 실제로 무엇이 들어 있나요?

모델 카드는 계보에 대해 짧고 솔직하다. Intern-Decision-0.8B는 "Qwen3.5-0.8B에서 미세 조정된 멀티모달 구조화 의사결정 모델"로 설명되며, 여기서 Qwen 베이스는 2026년 2월 28일에 공개되었다. 그리고 저장소에는 Apache-2.0 조건과 함께 두 번째 라이선스 파일인 LICENSE-QWEN이 포함되어 있는데, 이는 파생 모델이 마땅히 해야 할 일이며 그 자체로 작은 정직성 신호다. Hugging Face의 인덱스는 세 개의 샤드에 걸쳐 852,985,920개의 파라미터를 보고한다: 1.50 GB 언어 샤드, 176 MB 비전 샤드, 25 MB 프로젝터. 토크나이저 파일을 포함한 전체 저장소 용량은 약 1.73 GB로, 이는 전체를 소비자용 GPU 한 장이나 충분한 사양의 노트북에 무리 없이 올릴 수 있게 한다.

이 구성은 맞춤형 의사결정 네트워크라기보다 Qwen이 3.5 세대 전반에 걸쳐 제공해 온 아키텍처를 드러낸다. 이는 24개 레이어가 세 개의 선형 어텐션 레이어마다 하나의 전체 어텐션 레이어가 반복되는 패턴으로 배열되고, 은닉 크기 1,024, 2개의 키-값 헤드에 대한 8개의 어텐션 헤드, 헤드 차원 256, 최대 위치 임베딩 262,144 토큰을 갖는 Qwen3_5ForConditionalGeneration이다. 단일 다중 토큰 예측 레이어가 유지된다. 비전 경로는 실제로 존재한다: 모델 카드의 텍스트는 이미지 처리를 설명하고, 프로세서는 이미지를 입력받으며, 체크포인트는 이를 지원하기 위해 비전 타워와 프로젝터를 함께 제공한다 — 따라서 저장소의 멀티모달 태그는 단순한 태그가 아니라 가중치로 뒷받침된다.

패밀리 전체 그림은 주목할 만하다. 그것이 나머지 모든 것을 읽는 방식을 좌우하기 때문이다. InternLM은 40초 만에 세 가지 크기를 업로드했다: 0.8B, 그다음 2B, 그다음 4B. 파라미터 수는 852,985,920개, 2,213,241,664개, 4,539,265,536개다. 4B 모델의 카드에는 0.8B 카드에는 없는 추가 섹션이 실려 있다 — 전후 점수가 포함된 96개 사례의 알려진 분포 캘리브레이션 파일럿이다. 그 비대칭은 소형 모델의 결함을 보여주는 증거가 아니다; 그것은 소형 모델의 문서가 더 짧은 예산에 맞춰 작성되었다는 증거이며, 이는 조용한 릴리스가 보이는 전형적인 모습이다.

추론 경로가 실제로 작동하는 방식

번들로 제공되는 inference.py는 이 저장소에서 가장 정보가 많은 파일입니다. 왜냐하면 이는 프롬프트가 아니라 계약을 문서화하기 때문입니다. 순서는 다음과 같습니다:

• 귀하는 state(판단 대상), questions(스키마), 그리고 선택적으로 이미지가 포함된 요청을 제공합니다.

• 각 질문의 선택지는 단일 토큰 기호에 매핑됩니다 — A부터 Z까지, 그다음 소문자, 그다음 숫자, 질문당 최대 62개 선택지까지.

• 시스템 프롬프트, 상태, 스키마, 그리고 완전한 어시스턴트 JSON 스켈레톤은 필드마다 하나의 <decision> 플레이스홀더와 함께 렌더링됩니다.

• 하나의 인과적 순방향 패스가 실행됩니다. 로짓은 각 플레이스홀더 바로 앞 위치에서 읽힙니다.

• 소프트맥스는 해당 필드에서 허용된 후보 심볼에 대해서만 계산되고, 체크포인트의 캘리브레이션이 적용되며, 심볼은 원래 옵션 값으로 다시 매핑됩니다.

엔진은 세 가지 질문 유형을 제공합니다. choice는 옵션 값을 설명에 매핑하는 순서가 있는 객체를 받습니다. score는 리스트 — 이는 문자열 값 "0", "1", "2" 등이 됩니다 — 또는 유한한 숫자 문자열 키를 가진 순서가 있는 객체를 받으며, 이를 통해 모델이 범주만이 아니라 확률 가중 기댓값을 반환할 수 있습니다. noul은 no가 yes보다 앞서는 이진 결정입니다. 응답은 필드별로 보정된 확률 분포, 최대 후보 확률과 동일한 신뢰도, 사전식 동점 처리를 적용한 argmax 결정을 반환하며, score 질문의 경우 기댓값 숫자와 범례를 반환합니다. 제한은 명시적입니다: 요청당 1~16개 질문, 각 질문당 최대 62개 옵션, 잘리지 않고 거부되는 기본 입력 상한 8,192 토큰, 그리고 토큰이 해당 상한에 포함되는 최대 8개의 이미지입니다.

그 목록에는 두 가지 세부 사항이 주목할 만한데, 그것들이 출력을 신뢰할 수 있는지를 결정하기 때문이다. 첫째는 프롬프트에 정답이 삽입되지 않는다는 점이다 — 모델은 정답을 보여주지 않은 후보들의 점수를 매기고 있다. 둘째는 usage.output_tokens가 텍스트 토큰 수가 아니라는 점이다. 그것은 점수가 매겨진 필드를 센다. 이것을 기존 토큰 예산 계산에 연결하는 사람은 누구든 그 점에 놀랄 것이며, 카드는 그것을 발견에 맡기지 않고 그렇게 명시하고 있다.

A single-column scoreboard headed 'Intern-Decision-0.8B — the scoreboard' listing parameters of 852,985,920 across three shards, a repository of about 1.73 GB under Apache 2.0 plus LICENSE-QWEN, an inference path of one causal forward pass with no generate() and no sampling, RTX 4090 latency of 33.98 ms mean and 37.50 ms p95, calibration at Brier 0.530 and ECE 0.066 with a fitted temperature of 2.747760550703, a suite average of 79.38 across seven benchmarks, and WildJailBreak at 64.48 against Jev's 96.29, with a footer noting every figure is vendor-reported and unreproduced.

벤치마크 표, 그리고 그것을 얼마나 믿어야 하는가

이 섹션을 읽는 독자라면 주의하세요: 아래의 모든 수치는 벤더가 보고한 것이며 재현되지 않았습니다. InternLM이 벤치마크를 선택하고, 비교 모델을 선택하고, 평가를 실행하고, 표를 공개했습니다. 어떤 공개 리더보드에도 Intern-Decision-0.8B의 독립적인 실행 결과가 없으며, Artificial Analysis를 검색해도 이 모델에 대해서는 전혀 아무것도 나오지 않습니다. 그렇다고 해서 그 표가 거짓인 것은 아닙니다. 그것은 이 표가 감사되지 않았음을 의미하며, 해당 열들이 결과의 수준보다는 결과의 형태를 읽는 데 가장 유용하다는 뜻입니다.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

• Jevbench, 세 가지 분할 — Intern-Decision-0.8B는 Easy에서 97.92, Original에서 80.56, Hard에서 52.25를 기록합니다. TypeSafe의 Jev는 동일한 분할에서 100.00, 98.61, 72.07에 위치해 있습니다.

• Typed Decision — 0.8B는 Jev의 73.35를 상대로 77.35점을 기록합니다. 이는 해당 분야에서 가장 작은 모델이 벤치마크가 이름을 따온 모델을 능가하는 유일한 항목입니다.

• ToolACE — 0.8B의 94.52 대 Jev의 91.29. ToolACE는 함수 호출 벤치마크이며, 도구 선택에서 Jev를 능가하는 결정 헤드는 이 표에서 가장 실질적인 주장이다.

• AG News — Jev의 89.57에 맞선 88.61. 4개 주제 분류에서 이 범주의 최전선과 사실상 동일한 수준입니다.

• WildJailBreak — Jev의 96.29 대비 64.48. 이것이 바로 붕괴입니다. 아마도 신뢰할 수 없는 입력에 투입할 모델에서 가장 중요한 열이며, 0.8B가 레퍼런스에서 가장 멀리 떨어진 항목일 것입니다.

• 평균 — 0.8B는 79.38, 자체 2B 형제 모델은 84.68, 4B는 90.02. 이 모델군은 가파르게 상승하는데, 이는 정확히 예상할 수 있는 일이며 그 자체로 이 표가 플래그십을 돋보이게 하려고 역설계된 것이 아니라는 약한 근거가 된다.

• 보정 — 0.8B의 경우 Brier 0.530, 기대 보정 오차는 0.066. Jev는 0.358과 0.095를 보고한다. 두 수치를 함께 읽으면 어느 한 숫자만 볼 때보다 더 명확한 그림이 드러난다: 0.8B는 ECE 관점에서 Jev보다 보정이 더 잘 되어 있고 — 제시된 신뢰도가 정확도를 더 가깝게 따라가며 — 전체적으로는 상당히 덜 정확하다. 이는 의도적으로 온도를 피팅한 소형 모델에서 나올 법한 양상이며, 실수로 공개하기에는 그다지 좋게 보이는 조합이 아니다.

비교 세트에는 눈에 띄는 속성이 하나 있다. 바로 의사결정 모델이 주를 이룬다는 점이다. Jev, Laya, SemIf, Kev, JevK5가 모두 등장하며, 그 표의 자체 벤치마크는 TypeSafe의 것이다. InternLM은 경쟁자의 홈그라운드에서, 경쟁자의 하네스를 사용해 측정받기를 택했고, 그러고는 자사의 가장 작은 모델이 뒤지는 항목들까지 공개했다. 이는 팀이 출시를 둘러싼 마케팅 캠페인을 계획하고 있지 않을 때 내리는 종류의 결정이다 — 이 제품이 출시된 방식에 관한 다른 모든 점과도 일관된다.

교정 온도는 가장 흥미로운 숫자입니다.

Intern-Decision-0.8B는 기본 온도 2.747760550703을 맞춥니다. 이는 1,728개의 지정된 보정 사례와 1,693개의 별도 검증 사례에 대한 NLL 최소화를 통해 결정되었습니다. 카드에는 테스트 스위트 레이블이 이 값을 선택하는 데 사용되지 않았다고 명시되어 있습니다. 적용된 변환은 p = softmax(candidate_logits.float())에 이어 calibrated_p = softmax(log(p) / T)입니다.

그것은 후보 확률 보정이지 샘플링 온도가 아니며, 이 구분은 현학이 아니다. 그 변환은 소프트맥스 이후에 적용되고 순서를 보존하기 때문에 argmax 결정을 전혀 바꿀 수 없다. 그것은 신뢰도, 새로운 '예'일 확률, 그리고 점수 질문의 기대값을 이동시키면서 헤드라인 결정은 동일하게 남긴다. 워크플로가 레이블을 읽는다면, 그 온도는 아무 효과가 없다. 워크플로가 확률을 읽는다면 — 임계값을 적용하거나, 그 확률로 순위를 매기거나, 다운스트림 기대값 계산에 입력한다면 — 그 온도는 의미 있는 숫자와 그렇지 않은 숫자 사이의 차이다. temperature=1을 전달하면 보정되지 않은 분포가 반환되는데, 이는 자신만의 보정을 그 위에 적용하려는 사람에게 유용한 탈출구다.

temperature는 공유되지 않고 체크포인트별로 피팅됩니다. 4B 모델은 다른 값인 1.99241824를 사용하며, 카드에서는 기본 캘리브레이션이 일치하도록 다운로드한 크기와 함께 제공되는 추론 모듈을 사용하라고 안내합니다. 한 형제 모델에서 다른 형제 모델로 추론 래퍼를 복사하는 사람은 누구든 잘못된 temperature를 조용히 적용하게 됩니다.

34밀리초, 그리고 나올 수 없어야 할 결과

InternLM은 로컬 Hugging Face 경로를 사용해 단일 RTX 4090에서 쿼리당 엔드투엔드 지연 시간을 측정했습니다. 이는 실제 측정치이긴 하지만, 프로덕션 배포라면 컴파일된 런타임이나 배칭 런타임을 사용했을 것이므로 가능한 한 가장 느린 서빙 구성이기도 합니다. Jev는 평균 109.70ms, 중앙값 106.30ms, p95 146.70ms로 기재되어 있습니다. Intern-Decision-0.8B는 33.98 / 33.44 / 37.50ms입니다.

주목할 만한 숫자는 2B 형제 모델입니다: 평균 33.28 ms, 중앙값 33.15 ms. 2B는 더 빠릅니다 0.8B보다, 그 차이는 노이즈라고 할 만큼 작지만 매개변수 수가 예측하는 방향은 아닙니다. 이는 표의 오류가 아니며, 실제로 모델에 관한 것도 아닙니다. 의사 결정 모델은 상태, 스키마 및 옵션 설명에 의해 길이가 정해지는 프롬프트에 대해 정확히 한 번의 순방향 패스를 수행합니다 — 모델이 쓰는 내용에 의해 정해지는 것이 아닙니다. 모델은 아무것도 쓰지 않기 때문입니다. 그런 영역의 프롬프트에서는 프롬프트 처리가 지배적이고 매개변수 수는 2차 비용입니다. 실질적인 결과는 가장 작은 체크포인트를 택하려는 일반적인 이유 — 토큰당 비용을 지불한다는 — 가 여기에는 적용되지 않는다는 것입니다. 2B 대신 0.8B를 선택하는 진짜 이유는 메모리 사용량과 전체 저장소가 1.73 GB에 들어간다는 사실이지 처리량이 아닙니다.

아직 확립될 수 없는 것

이것은 출시 게시물이라면 답했을, 저장소는 답할 수 없는 부분입니다.

공개된 출시 날짜도, 발표도 없고, InternLM의 공개 채널에도 이 제품군을 설명하는 내용이 전혀 없다. 모델 카드에 인쇄된 GitHub URL은 접속되지 않는다. 카드에서 참조된 데모 Space는 공개적으로 열람할 수 없다. 세 체크포인트를 모아 둔 컬렉션도 없으므로, 2B나 4B를 찾는 유일한 방법은 해당 조직의 모델 목록을 살펴보는 것뿐이다. 논문도 없으므로 훈련 데이터, 튜닝 레시피, 훈련 스텝 수, 그리고 "decision tuning"이 가중치에서 무엇을 수정했는지는 모두 명시되지 않았다. 독립적인 평가도, 제3자 지연 시간 재현도 없고, InternLM 외부의 누군가가 이 체크포인트를 실행했다는 증거도 아직 없다.

또한 이 카드가 제기하지만 답하지 않는 두 가지 질문이 있다. 첫 번째는 WildJailBreak 격차가 실제로 무엇을 의미하는가이다. 그 정도 규모의 거부 견고성 결손은 파인튜닝의 속성이며, 그것이 베이스 모델 때문인지, 결정 튜닝 목표 때문인지, 아니면 적은 파라미터 수 때문인지는 리포지토리가 알려주지 않는다. 두 번째는 입력 상한에서 무슨 일이 일어나는가이다. 8,192 토큰을 초과하는 요청은 잘리는 대신 거부되는데, 이는 스코어링 모델에 맞는 동작이지만, 실질적 컨텍스트 창이 config가 내세우는 262,144가 아니라 상태, 스키마, 옵션, 이미지 패치의 8,192 토큰 안에 들어가는 만큼이라는 뜻이다. 스키마가 풍부한 긴 문서의 경우, 그 상한은 아키텍처 다이어그램이 시사하는 것보다 더 빨리 찾아온다.

이것이 어디에 위치하는지, 그리고 그것에 베팅하지 않고 시도하는 방법

솔직히 말하면, Intern-Decision-0.8B는 감사를 거치지 않은 주장과 이를 뒷받침할 문서가 없는 공개된 체크포인트입니다. 그 조합이 무시할 이유는 아닙니다 — 오후 한나절이면 다운로드해서 측정할 수 있는 Apache-2.0 가중치 공개는 대기자 명단에 오른 API보다 나은 상황입니다 — 하지만 검증의 부담은 당신에게 있다는 뜻입니다. 엔진은 로컬 디렉터리에서 로드되고, 4090급 GPU 또는 그보다 작은 GPU에서 실행되며, 카드에는 그대로 붙여넣을 수 있는 예시 요청이 제공됩니다. 자신의 레이블된 사례로 하루 동안 평가해 보면 WildJailBreak 열에 관해 공급업체 표가 알려줄 수 있는 것보다 더 많은 것을 알게 될 것입니다.

의사 결정 계층이 평가하려는 부분이라면, 유용한 비교 대상은 호스팅된 쪽입니다. TypeSafe의 Jev 1.13은 InternLM이 벤치마크한 모델이며, 현재 단일 OpenAI 호환 엔드포인트를 통해 호출할 수 있고 입력 토큰 100만 개당 $0.042, 출력은 0으로 청구됩니다 — 벤더가 공개한 가격과 동일합니다. 왜냐하면 OrcaRouter는 제공자 정가를 마크업 없이 그대로 전달하며 그 위에 마진을 붙이지 않기 때문입니다. 자체 호스팅 0.8B 의사 결정 헤드와 호스팅된 의사 결정 API를 같은 키에, 같은 오후에 올리는 것은 같은 질문에 답하기 위해 두 개의 별도 계약을 연결하는 것보다 훨씬 저렴한 실험입니다.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

이 상황을 바꿀 것은 벤치마크가 아니다. 그것은 GitHub 저장소가 등장하거나, InternLM이 튜닝 레시피를 공개하거나, 체크포인트에 대한 첫 독립 실행 결과가 리더보드에 오르는 것이다. 그중 하나가 일어나기 전까지, Intern-Decision-0.8B에 대한 정확한 설명은 범위가 좁고 듣기 좋지 않지만 전적으로 이 모델에 유리하다: 가중치는 진짜이고, 추론 계약은 대부분의 출시된 모델이 해내는 것보다 더 잘 문서화되어 있으며, 마케팅은 아직 시작되지 않았다.