
Intern-Decision-4B: InternLM, 토큰을 하나도 쓰지 않고 답하는 의사결정 모델 출시
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 592 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 187 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
2026년 9월 26일, 40초 만에 InternLM의 Hugging Face 페이지에 세 개의 모델 저장소가 등장했다: Intern-Decision-0.8B는 05:35:57 UTC에, Intern-Decision-2B는 05:36:19에, internlm/Intern-Decision-4B는 05:36:37에 나타났다. 4B가 흥미로운 쪽이다. 이는 Qwen3.5-4B를 파인튜닝한 모델로, 공유 상태, 이름이 붙은 질문들로 이루어진 스키마, 선택적 이미지를 입력받아 단일 순전파에서 모든 질문에 대한 보정된 답변 분포를 반환한다. 텍스트를 생성하는 일은 전혀 없다. 자체 릴리스 노트에서도 이를 분명히 밝히고 있다. "이 API는 구조화된 후보 점수 산정을 수행합니다. generate()를 호출하거나 자유 형식 텍스트를 샘플링하지 않습니다." 40초 동안의 업로드였고, 어디에도 공지 한 줄 없었다 — 블로그 글도, 트윗도, 체인지로그도, 출시 페이지도. 존재하는 것은 모델 카드 하나, inference.py, 그리고 네 개의 safetensors 샤드뿐이다.

출시된 것과 그렇지 않은 것
가장 먼저 제대로 파악해야 할 것은 패밀리다. 4B의 카드가 그것을 조용히 담고 있기 때문이다. 그 벤치마크 표에는 Intern-Decision-0.8B와 Intern-Decision-2B 행이 자체 행과 함께 실려 있고, 세 체크포인트는 모두 같은 분에 허브에 올라왔다. 2B 저장소는 4B의 카드에서 링크되지 않는다 — 조직의 업로드 피드를 통해 찾아야 한다.
출시되지 않은 것은 릴리스가 일반적으로 가져오는 거의 모든 것입니다:
• 발표 없음 — 웹 보도 전무, 우리가 찾아볼 수 있는 어떤 언어로도 벤더 측 성명이 없음.
• 데모 없음 — 카드가 다음 위치의 Space를 링크합니다: huggingface.co/spaces/internlm/intern-decision; 해당 엔드포인트는 HTTP 401을 응답하는데, 이는 공개되어 있지 않다는 뜻이지 고장 난 것이 아닙니다.
• 컬렉션 없음 — huggingface.co/collections/internlm/intern-decision에 광고된 모델 컬렉션도 401을 반환합니다.
• 코드 저장소 없음 — 카드의 GitHub 링크인 github.com/internlm/Intern-Decision는 404이며, InternLM 조직의 저장소 목록에는 그러한 프로젝트가 없습니다.
• 채택 없음 — 이 글을 작성하는 시점에 4B는 좋아요 1개와 다운로드 0회를 기록하고 있습니다.
그것이 알 수 있는 표면의 전부다. 아래의 모든 수치는 벤더가 직접 제시한 것으로 취급하라. 아직 다른 누구도 이것을 실행해 보지 않았기 때문이다.

추론 계약이 곧 제품이다
카드의 대부분은 5단계 절차에 할애되며, 이는 엔지니어링이 어디에 투입되었는지 알려줍니다. 질문과 선택지는 순서를 유지합니다. 각 질문의 선택지는 단일 토큰 기호에 매핑됩니다 — A부터 Z까지, 그다음 a부터 z까지, 그다음 0부터 9까지. 즉 62개의 기호이며, 이것이 바로 카드가 질문당 선택지를 62개로 제한하는 이유입니다. 프롬프트는 원본 시스템 프롬프트, 상태, 결정 스키마, 그리고 필드마다 하나의 <decision> 플레이스홀더가 포함된 완전한 어시스턴트 JSON 골격으로부터 렌더링되며, 체크포인트의 채팅 템플릿과 빈 사고 블록을 유지합니다. 그다음 인과적 순방향 패스가 한 번 수행됩니다. 로짓은 각 플레이스홀더 바로 앞 위치에서 읽히고, 소프트맥스는 해당 필드에서 허용된 후보 기호 로짓에만 적용되고, 캘리브레이션이 적용되며, 기호는 다시 여러분의 선택지 값으로 매핑됩니다.
그 결과는 고정된 형태입니다: 디코딩 루프도, 샘플링도, 파서도, 환각 표면도 없으며, 패스마다 질문당 하나의 결정이라는 엄격한 상한이 있습니다. 세 가지 질문 유형이 지원됩니다 — 선택은 순서가 있는 기준 맵을 사용하고, 점수는 목록 또는 숫자 키 맵을 사용하고, noul, 이진 아니요/예.
사양서에서 가장 중요한 세부 사항
모델 카드에는 입력이 다음을 초과하면 "잘림 없이 거부된다"고 명확히 밝히고 있습니다: DecisionEngine(max_length=8192). 이를 설정 파일과 나란히 읽어 보면 뭔가 이상한 점이 드러납니다. 기반 텍스트 타워는 max_position_embeddings가 262,144라고 선언합니다. 백본은 25만 토큰을 처리할 수 있지만, 공개된 래퍼는 8,192를 넘으면 무엇이든 거부합니다. 이것은 보수적인 기본값을 가진 장문맥 모델이 아니라, 자체 하네스가 당신이 넘겨줄 수 있는 증거의 양을 제한하는 결정 점수화 모델입니다. 라우팅 질문이 대략 8천 개가 넘는 토큰 분량의 상태에 달려 있다면, 배포된 그대로의 이 체크포인트는 그 질문에 답하지 못할 것이며, 입력을 줄이는 대신 거부할 것입니다.
최대 8개의 이미지가 허용되며, 이미지 토큰도 동일한 8,192 한도에 포함된다고 카드에 명시되어 있습니다.

가중치 내부
네 개의 샤드, 45억 4천만 개의 BF16 파라미터, 그리고 크기 이름을 설명해 주는 구성: 텍스트 타워, 16픽셀 패치 크기를 가진 대략 24개 층의 비전 타워, 그리고 그 사이의 프로젝터가 있습니다. 텍스트 쪽은 히든 크기 2,560의 32개 층으로, 16개의 어텐션 헤드 대 4개의 키/값 헤드, 248,320개 토큰 어휘, 그리고 묶인 임베딩을 사용합니다. 층 유형은 고정된 간격으로 교대합니다. 즉 선형 어텐션 층 세 개, 그다음 완전 어텐션 층 하나가 반복됩니다. 전역 어텐션을 갖는 것은 완전 어텐션 층뿐이며, 로터리 임베딩은 0.25의 계수로 부분적입니다. 이를 로딩하려면 Python 3.12 이상, PyTorch 2.9.1 및 Transformers 5.14.1이 필요하며, 파일 목록에는 여전히 허브 측 토크나이저에 의존하지 않고 토크나이저, 병합 및 어휘 파일이 포함되어 있습니다.
숫자들, 그리고 누가 그것을 산출했는지
이 섹션의 모든 내용은 InternLM이 측정하여 모델 카드에 공개한 것입니다. 그중 어느 것도 제3자에 의해 재현되지 않았으며, 이 모델에 대한 Artificial Analysis 항목도, 아레나 평점도, 리더보드 행도 어디에도 없습니다.
일곱 개의 평가 세트에 걸쳐 4B는 평균 90.02를 기록하며, 브라이어 점수는 0.347, 기대 캘리브레이션 오차는 0.065입니다. 같은 표에는 Intern-Decision-0.8B가 79.38, Intern-Decision-2B가 84.68로 나와 있으므로, 이 패밀리는 크기가 커질수록 위로 향합니다 — 0.8B에서 2B까지 4.7점, 그다음 4B까지 5.3점 더 올라갑니다. 이 표에는 벤더가 훈련하지 않은 다섯 개 행도 실려 있습니다: Jev 88.74, JevK5 85.16, SemIf 84.23, Kev 79.56, Laya 57.77. 그것들은 InternLM이 InternLM의 하네스에서 InternLM의 체크포인트를 대상으로 실행한 것입니다. 그것들은 해당 프로젝트 자체의 수치가 아니며, 그렇게 읽는 것이 여기서 저지를 수 있는 가장 쉬운 실수입니다.
지연 시간은 단일 RTX 4090에서 로컬 Hugging Face 경로를 통해 측정되었으며, 해당 카드는 이 값들이 워크로드와 하드웨어에 따라 달라질 수 있음을 명시한다. 4B는 평균 44.16ms, 중앙값 44.03ms, P95에서 44.60ms를 기록한다. 중앙값과 꼬리 값 사이의 차이는 1밀리초 훨씬 아래로, 이는 고정 형상 순전파가 보이는 전형적인 모습이다. 두 더 작은 체크포인트는 모두 약 33ms이며, 2B는 평균과 중앙값에서 0.8B를 아주 근소하게 앞선다. 이는 얼버무리기보다 주목할 가치가 있다. 이 둘은 서로 측정 노이즈 범위 안에 들 정도로 충분히 가깝다.
교정, 그리고 그 안의 솔직한 주의사항
체크포인트는 기본 온도 1.99241824를 제공합니다. 이 값은 이 모델에 대해 별도로, 1,728개의 지정된 캘리브레이션 사례에서 음의 로그 우도 최소화를 통해 적합되었으며, 1,693개는 검증용으로 남겨 두었습니다. 카드에는 테스트 스위트 레이블이 이 값을 고르는 데 사용되지 않았다고 나와 있습니다. 이 구현은 샘플링 온도가 아니라 후보 확률 캘리브레이션입니다: 신뢰도, 이진 확률, 기대 점수를 움직이지만 argmax 결정은 건드리지 않습니다.
별도의 96개 사례 진단이 그 효과를 보고한다. InternLM 자체의 전후 열에서, 4B의 전체 Brier와 ECE는 0.628 / 0.213에서 0.550 / 0.089로 이동하며, 이는 Jev의 0.595 / 0.130과 대비된다. 그 표에 대한 두 가지 솔직한 해석: 캘리브레이션은 분명히 작동하며, "이전" 열은 어떤 사용자도 결코 볼 수 없는 값인데, 이는 출시된 기본값이 피팅된 온도이기 때문이다. 또한 주목할 점은 — 여섯 가지 진단 범주 중 두 가지가 4B에서 Jev보다 더 나쁘며, 그중 가장 나쁜 일상적 증거와 관찰 편향은 0.575 / 0.210으로 개선되지만 여전히 Jev의 0.603 / 0.114에 미치지 못한다. 그 부분에서 캘리브레이션은 격차를 좁히지만 완전히 해소하지는 못한다.
라우터가 들어맞는 곳, 그리고 아직 들어맞지 않는 곳
이 모델을 사용하는 데 따르는 실질적인 걸림돌은 정확성이 아니라 패키징입니다. 이번 릴리스는 네 개의 샤드를 내려받은 뒤 임포트하는 파이썬 클래스를 제공할 뿐, 호출할 수 있는 HTTP 엔드포인트가 아닙니다. 바로 그 간극을 메우기 위해 라우팅 계층이 존재합니다 — 200개 이상의 모델을 아우르는 단일 키, 공급자 정가를 0% 마크업으로 그대로 전달하는 것, 그리고 공급자가 흔들릴 때 자동으로 이루어지는 장애 조치 — 하지만 분명히 말하자면 OrcaRouter는 현재 Intern-Decision-4B나 그와 유사한 모델을 취급하지 않습니다. 우리 카탈로그에는 그것이 등록되어 있지 않으며, 여기 어떤 내용도 공급 가능성에 대한 주장으로 읽혀서는 안 됩니다. 우리가 제안할 수 있는 것은 더 저렴한 결정입니다. 프로덕션 경로 앞단에 45억 파라미터 의사결정 스코어러를 시험해 보고 싶다면, 일반 모델로의 폴백을 둔 라우터에 그것을 내장할 수 있습니다. 그러면 캘리브레이션이 어긋난 날의 대가는 장애가 아니라 재시도 한 번으로 끝납니다.
무엇이 상황을 바꿀까요?
중요도 순으로 세 가지. InternLM 외부의 누군가가 90.02 평균과 0.065 기대 캘리브레이션 오류를 재현해야 합니다 — 외부 테스트 세트를 한 번도 접한 적 없는 캘리브레이션 주장은 머신러닝에서 가장 전이성이 낮은 숫자입니다. 카드 자체의 흔적이 나타나야 합니다: Space, 컬렉션, GitHub 리포지토리. 그리고 공급업체는 이것이 제품인지 논문 아티팩트인지 말해야 합니다. 왜냐하면 연구 전용 라이선스와 Apache-2.0 라이선스는 같은 약속이 아니며, 4B는 Qwen 라이선스를 함께 보존한 채 Apache-2.0을 선택했기 때문입니다. 그때까지 올바른 프레이밍은 업로드 자체가 시사하는 것입니다: 이것은 실제 추론 계약을 가진 실제 체크포인트이자 완전히 검증되지 않은 스코어카드이며, 아무에게도 알리지 않고 공개되었습니다.
당장은 솔직한 요약이 범위는 좁지만 유용합니다. 당신의 문제가 “다섯 개의 라우팅 레이블 중 하나를 고르고 얼마나 확신하는지 알려줘”라면, 62개의 로짓을 출력하고 산문은 내지 않는 4.5B 모델은 평가해 볼 만한 방어 가능한 형태입니다. 당신의 문제가 긴 문서, 여덟 개를 넘는 이미지, 또는 답을 말로 설명해야 하는 필요를 포함한다면, 출하된 그대로의 이 체크포인트는 잘못된 도구이며, 공급업체 벤치마크를 아무리 매끄럽게 다듬어도 그 사실은 달라지지 않습니다.
