비교 기사용 타이틀 카드로, 제목은 Intern-Decision-0.8B vs Qwen 3.8, 부제는 8억 5,300만 파라미터, 1.71 GB, 닫힌 답변 집합이며, 세 장의 플랫 라인 카드에는 각각 대상: Intern-Decision-0.8B가 2026년 9월 26일 아무런 발표 없이 공개됨, 상대: Qwen 3.8, Qwen3.8-Max가 $2.00와 $6.00인 2.4T 희소 코어, 핵심 발견: 2B 형제 모델이 더 빠르고 더 정확하며 0.8B에 유리한 것은 풋프린트뿐이다.
Engineering & Research

Intern-Decision-0.8B vs Qwen 3.8: 8억 5,300만 개의 파라미터와 폐쇄형 답변 집합

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Intern-Decision-0.8B는 InternLM이 2026년 9월 26일 아침에 Hugging Face에 공개한 세 가지 결정 모델 중 가장 작은 모델이며, 그중 가장 빠른 모델은 아니다. 이것이 가장 먼저 알아 둘 만한 점이다. 연구소 자체 측정치에서 2B 형제 모델은 아주 약간 더 빠르게 실행되고 — 33.28ms 대 33.98ms — 동일한 7개 스위트 평균에서 6점 더 높은 점수를 받는다. 따라서 10억 개 미만 체크포인트를 선택하는 통상적인 이유인 순수 속도는 여기에는 해당하지 않는다. 해당하는 것은 크기다: 852,985,920개 파라미터, 1.71GB의 bf16 가중치로, 다른 일을 해야 하는 기계의 여유 공간에 영구히 상주할 만큼 작다. 이를 Qwen3.8-Max와 비교해 보면 — 공급업체가 8월에 공개한 2.4조 개 파라미터 희소 전문가 혼합(mixture-of-experts) 핵심의 호스팅 제공 버전으로, 100만 토큰당 $2.00 및 $6.00에 책정됨 — 둘은 같은 작업을 두고 경쟁하는 것이 아니다. 하나는 미리 제공한 선택지들에 대한 확률 분포를 반환한다. 다른 하나는 쓴다.

간단히 말하자면: Intern-Decision-0.8B는 이미 보유한 하드웨어에서 채점되는 폐쇄 집합 결정이 필요하고, 4.43 GB 대신 1.71 GB가 출시와 미출시를 가르는 차이라면 가질 만한 가치가 있습니다. 이번 주에 InternLM이 출시한 가장 정확한 소형 스코어러를 원한다면 — 그것은 4B입니다 — 가질 가치가 없으며, 또는 답이 프롬프트에 이미 열거되어 있지 않다면, 이 경우 이 둘 중 어느 것도 올바른 도구가 아니고 Qwen 3.8만이 그 쌍 중에서 그 작업을 전혀 할 수 있는 유일한 것입니다.

저장소가 말하는 것, 그리고 다른 무엇도 말하지 않는 것

증거부터 시작하자. 증거가 거의 없기 때문이다. InternLM은 이 모델에 대해 아무런 발표도 하지 않았다. 출시 게시물도, 논문도, 저장소 설명도 없다. Hugging Face 카드는 데모 Space와 GitHub 저장소를 링크하고 있으며, 이 글을 쓰는 시점에 그 Space는 401을 반환하고 GitHub 링크는 404를 반환한다 — 카드가 더 많은 정보를 위해 안내하는 두 곳이 모두 닫혀 있다. 9월 26일 대략 05:36 UTC에 40초 이내의 간격으로 세 개의 체크포인트가 나타났다: Intern-Decision-0.8B, Intern-Decision-2B, Intern-Decision-4B. 모두 같은 태그를 달고 있었다 — 의사결정, 멀티모달, 구조화된 예측 — 그리고 모두 Qwen 체크포인트, 이 경우 Qwen3.5-0.8B의 파인튜닝이었다.

저장소에서 알 수 있는 것은 발표되지 않은 릴리스치고는 유난히 정확한데, 이는 연구소가 가중치와 함께 자체 추론 모듈을 배포했기 때문이다. 0.8B는 16KB의 inference.py를 모델 디렉터리에서 불러오며, Python 3.12 이상과 torch 2.9.1 및 transformers 5.14.1이 필요하고, DecisionEngine 클래스를 노출한다. 한 번 인스턴스화해서 재사용하면 된다. Python dict 하나를 넣으면 응답 dict 하나가 나온다. 알 수 없는 것은 이것이 완성된 릴리스인지 아니면 초기 푸시인지, 호스팅 엔드포인트가 나올 예정인지, 그리고 이 모델이 사이에 끼어 있는 두 체크포인트가 서로 다른 크기의 같은 제품을 의미하는지 아니면 이름만 공유하는 세 가지 다른 제품인지이다. InternLM 외부에서는 아무도 이들 중 어느 것도 실행해 본 적이 없다.

The Hugging Face model card for InternLM's Intern-Decision-0.8B, showing the internlm organisation, a 0.9B params label, tags for image-text-to-text, transformers, safetensors, qwen3_5, decision-making, multimodal, structured-prediction and conversational, an opening line stating the model is a multimodal structured decision model fine-tuned from Qwen3.5-0.8B, and a Checkpoint and docs section that also reports 0.9B params.

형제 문제: 2B가 더 빠르고 더 좋다

다음은 0.8B를 어디에 놓기 어렵게 만드는, InternLM이 자체 공개한 표의 일부입니다. 같은 일곱 개 스위트에서 세 가지 크기를 세로로 읽어 보면:

• 속도 — 0.8B: 평균 33.98ms, 중앙값 33.44ms, p95에서 37.50ms. 2B: 33.28ms, 33.15ms, 33.55ms. 4B: 44.16ms, 44.03ms, 44.60ms. 모두 단일 RTX 4090에서 로컬 Hugging Face 경로를 통해 쿼리당 측정했습니다.

• 7개 스위트 평균 — 0.8B: 79.38. 2B: 84.68. 4B: 90.02.

• 캘리브레이션 — 0.8B: Brier 0.530, ECE 0.066. 2B: Brier 0.437, ECE 0.100. 4B: Brier 0.347, ECE 0.065.

• bf16 기준 디스크 사용량 — 0.8B: 1.71 GB. 2B: 4.43 GB. 4B: 9.08 GB.

2B는 평균에서 더 빠르고, 꼬리에서는 극적으로 더 타이트하며, 동시에 더 정확하다. 그래서 "더 작을수록 더 빠르다"는 이 패밀리 전체에서 거짓이다 — 두 번이나 그러한데, 4B가 둘 다보다 느리기 때문이다. 0.8B가 확실히 이기는 유일한 축은 아무도 벤치마크하지 않는 축이다: 1.71 GB 대 2B의 4.43 GB, 4B의 9.08 GB. 고정 메모리 예산 — 항상 켜져 있는 작은 박스, 공동 테넌트 GPU, 이미 카드의 대부분을 언어 모델이 차지하고 있는 엣지 노드 — 안에 스코어러를 배치하는 상황이라면, 그것이 논거의 전부이며, 그 논거는 실질적이다.

표의 나머지 부분은 소형 모델이 어디서 불균등하게 무너지는지를 잘 보여주는 사례다. 0.8B의 Typed Decision 점수는 77.35로, 4B의 80.55와 3점 차이인데 매개변수 수는 5분의 1에 불과하다. 그러나 Jevbench-Original은 98.61에서 80.56으로 떨어지고 WildJailBreak는 89.86에서 64.48로 급락한다. 이 두 스위트가 무엇을 측정하는지는 — 카드에 나와 있지 않으며, 카드는 스위트 정의를 전혀 제공하지 않는다 — 작은 체크포인트를 가장 혹독하게 벌하는 항목들이다. 한 축에서는 버티지만 다른 두 축에서는 절벽에서 떨어지듯 성능이 급락하는 모델은 균일하게 더 약한 모델이 아니다. 그것은 특정한 역량 경계를 가진 모델이며, 플릿을 여기에 투입하기 전에 자신의 워크로드가 어디에 위치하는지 알고 싶어질 것이다.

캘리브레이션 행에 관해 한 가지 더 주의할 점이 있습니다. 0.8B의 ECE 0.066은 이 모델의 가장 좋은 수치입니다 — 같은 스위트에서 Jev의 0.095보다 낫습니다 — 반면 Brier 점수 0.530은 Jev의 0.358보다 나쁩니다. 캘리브레이션 오차와 평균 제곱 확률 오차는 같은 측정값이 아니며, 하나는 강해 보이고 다른 하나는 약해 보이는 표는 분포가 신뢰도 피크 근처에서는 잘 형성되어 있지만 그 사이에서는 마땅한 것보다 더 두툼하다는 것을 말해줍니다. 시스템이 신뢰도를 기준으로 임계값을 설정한다면, 그 구분은 평균보다 더 중요합니다.

1.71 GB로 실제로 얻을 수 있는 것

이 모델의 추론 경로는 생성기가 아니라 채점기이며, 비용 차이는 점진적이라기보다 구조적입니다. 여러분은 모델에 공유 상태, 이름이 지정된 질문들의 스키마, 그리고 선택적으로 최대 8개의 이미지를 넘겨줍니다. 각 질문은 세 가지 유형 중 하나입니다: 선택 (정렬된 옵션 집합 중 하나), 점수 (순서형 척도이며, 확률 가중 기대값으로 반환됨), 또는 noul (이진 아니오/예). 상태, 스키마, 그리고 완전한 어시스턴트 JSON 스켈레톤은 각 필드마다 하나의 자리 표시자와 함께 렌더링되고, 모델은 단일 인과적 순방향 패스를 실행하며, 로짓은 각 자리 표시자 바로 앞 위치에서 읽힙니다. 소프트맥스는 해당 필드에 허용된 후보 기호들에 대해서만 계산되고, 체크포인트의 피팅된 캘리브레이션이 적용되며, 기호는 여러분의 옵션 값으로 다시 매핑됩니다.

그로부터 세 가지 결과가 따라온다. 출력 토큰이 없고 따라서 출력 비용도 없다 — 백만 개의 결정도 토큰 비용이 들지 않는다. 디코딩 루프도 없고 잊어버릴 중괄호도 없으므로, 잘못된 형식의 JSON은 실패 모드가 아니다. 그리고 각 필드의 답변 공간은 요청마다 조립되므로, 오늘 오후에 만들어 낸 스키마도 재훈련이 필요 없다: 질문을 추가하면 그 선택지들이 해당 필드의 후보 심볼이 된다.

제한은 아주 명확하게 명시되어 있습니다. 질문 1~16개, 각 최대 62개의 선택지, 최대 8개의 이미지, 그리고 기본 8,192토큰 상한 — 이를 초과하는 입력은 잘리지 않고 거부됩니다. 이 마지막 조항은 곰곰이 생각해 볼 만한 설계 결정입니다. 조용한 잘림이야말로 분류기가 어느새 당신이 물은 것과 다른 질문에 답하기 시작하는 방식이기 때문입니다. InternLM은 그 대신 요란하게 실패하는데, 이는 올바른 동작이면서 동시에 운영상의 함정입니다: 긴 티켓 스레드에 스키마와 이미지까지 더해지면 생각보다 훨씬 빨리 8,192를 넘어서게 되고, 그렇게 되었을 때 우아하게 처리할 방법이 없습니다.

그리고 1.71GB는 곱해서 계산할 수 있는 런타임 경제성을 제공한다. 결정 하나당 33.98ms라면, 100만 번의 결정은 RTX 4090 한 장으로 9.44시간이다. 4B는 같은 100만 번에 12.3시간이 필요하고, 갖고 있지 않던 7.37GB를 얻는 대가로 정확도 10.5포인트를 포기한다. 어느 수치에도 장비 비용은 포함되지 않으며, 사람들이 잊는 부분도 포함되지 않는다: 당신은 서비스를 운영하고 있는데, 저장소에는 서버가 없다.

The OrcaRouter model page for Qwen3.8 Max, showing the model name, family and tier badges, a 1,000,000-token context window, pricing of $2.00 per million input tokens and $6.00 per million output tokens, an output speed of 63.71 tokens per second, an error rate of 0.69 percent, an Artificial Analysis index of 45.4 at rank 15 of 145, and a side panel listing Qwen 3.8 27B at an Artificial Analysis intelligence index of 33.65 with $0.33 and $2.40 per million tokens.

Qwen 3.8은 단일 모델이 아니며, 눈여겨볼 것은 저가형 쪽이다

Qwen 3.8은 단독 명칭으로 쓰일 때 Qwen3.8-2.4T-A95B입니다. 즉 Alibaba가 2026년 8월 12일 오픈 웨이트로 공개한 2.4조 매개변수 규모의 희소 전문가 혼합 코어로, 토큰당 약 950억 개 매개변수가 활성화되며 Apache 2.0이 아닌 사용자 지정 라이선스를 사용합니다. 동일한 코어의 호스팅 제공 형태는 Qwen3.8-Max로, 8월 3일부터 유료 API에서 일반 제공되었고 9월 2일자 스냅샷으로 갱신되었습니다. 이 둘은 하나의 두뇌를 두 가지 방식으로 판매한 것이며, 두 번째 제공 형태가 대부분의 사람들이 실제로 호출하게 될 것입니다.

독립적인 수치에서, Artificial Analysis는 Qwen3.8-Max의 9월 스냅샷을 Intelligence Index 45.4로 측정합니다 — 인덱싱된 145개 모델 중 15위 — AA Coding 점수는 138개 중 9위인 76.2, GPQA Diamond는 92.8, Humanity's Last Exam은 43.1, 장문맥 회상 점수는 80.3입니다. 오픈 체크포인트는 증류 원본인 API보다 39.9로 뒤처집니다. 자체 7일 플레이그라운드 기간에서 Qwen3.8-Max는 p50이 2,578ms, p95가 9,539ms이며, 초당 출력 토큰 55.5개, 오류율 1.57%입니다. Qwen3.8-Max는 OrcaRouter에서 호출 가능합니다: 공급자 정가에 0% 마크업이 추가된 가격으로, 따라서 Alibaba 가격 변경은 다음 청구 주기가 아니라 같은 날 저희 쪽에 반영됩니다.

다만, dense 형제 모델은 1.71 GB 로컬 체크포인트와 견줘 볼 만한 대상입니다. 이 제품군에서 역량을 확보하는 가장 깔끔한 방법이기 때문입니다. Qwen3.8-27B는 Apache 2.0이며, 네이티브 262,144토큰 컨텍스트를 갖추고 있고, Qwen3.8-27B는 당사 카탈로그에서 백만 토큰당 $0.33 및 $2.40에 책정되어 있습니다. Artificial Analysis Intelligence Index는 33.7입니다. 이것은 Intern-Decision-0.8B의 매개변수 수의 약 32배이며, 여전히 생성형이고, 대량으로 폐쇄 집합 결정을 내리는 데에는 여전히 잘못된 도구입니다. 하지만 이것은 정직한 중간 옵션이며, 이 비교에서 진정으로 저렴하면서 동시에 진정으로 범용적인 유일한 구성원입니다.

스코어러 대 생성기, 한마디로 말하면

• 컨텍스트 — Qwen3.8-Max는 1,000,000토큰 창을 갖습니다. Intern-Decision-0.8B는 8,192를 넘는 모든 것을 거부합니다. 122배 차이이며, 잘라내는 대신 강제 적용됩니다.

• 입력 — Qwen3.8-Max는 텍스트, 이미지, 동영상을 입력으로 받습니다. Intern-Decision-0.8B는 텍스트와 최대 8개의 이미지를 입력으로 받으며, 이미지 토큰은 동일한 8,192 예산에 산입됩니다.

• 출력 — Qwen3.8-Max는 글을 쓰고, 추론하고, 도구를 호출하며, 요청 시 JSON을 내보낸다. Intern-Decision-0.8은 문단도, 근거도, 계획도 만들어내지 못한다. 이미 나열하기로 생각한 선택지에 점수를 매길 수 있을 뿐이다.

• 호출당 비용 — 입력 토큰 800개와 출력 토큰 150개로 구성된 현실적인 트리아지 호출은 Qwen3.8-Max에서 추론 토큰을 제외하면 약 $0.0025이며, 추론 모델이기 때문에 출력 측은 낙관적으로 적게 잡은 것입니다. 그런 호출 100만 건은 대략 $2,500입니다. Intern-Decision-0.8B는 토큰 가격이 전혀 없습니다: 100만 건의 결정은 보유하거나 임대한 4090 한 대로 9.44시간입니다.

• 지연 시간 — 지난 7일간 Qwen3.8-Max에서 중앙값 2,578ms였으며, 네트워크와 큐잉을 포함한 수치입니다. Intern-Decision-0.8B의 33.98ms는 로컬 카드에서의 순수 포워드 패스일 뿐 같은 측정이 아닙니다. 정직하게 비교하면 80배가 아니라 한 자릿수(10배) 차이입니다.

• 근거 — 여기 있는 모든 Intern-Decision-0.8B 수치는 InternLM 자체 하네스에서 벤더가 보고한 것이며, 지연 시간을 포함해 누구도 재현하지 못했습니다. Qwen 3.8의 모든 수치는 Alibaba 자체 측정치이거나 Artificial Analysis 측정치이며, 위에 별도로 표시되어 있습니다.

• 독립적 점수 — Qwen3.8-Max에는 있습니다. Intern-Decision-0.8B에는 어떤 종류의 점수도 없으며, 이를 배포하는 추론 제공업체도 없습니다.

A two-column scoreboard comparing Intern-Decision-0.8B and Qwen 3.8. The Intern-Decision-0.8B column reads Parameters 853M, Seven-suite average 79.38, Context 8,192 tokens, Output scores only no text, Cost no token price 1.71 GB local, Latency 33.98 ms local pass. The Qwen 3.8 Max column reads Parameters 2.4T sparse, AA Intelligence Index 45.4, Context 1,000,000 tokens, Output text image video tools, Cost $2.00 and $6.00 per million, Latency 2,578 ms p50 hosted. A footer reads Intern-Decision-0.8B figures are vendor-reported and unreproduced; Qwen3.8-Max figures per Artificial Analysis and our own seven-day window.

이 파이프라인을 실행하는 두 가지 방법

운영상의 분기점은 벤치마크 분기점보다 더 첨예하다. Intern-Decoder-0.8B는 모듈이지 벤치마크가 아니다. 배칭 서버도 없고, 헬스 체크도 없고, 재시도도 없으며, 직접 만들지 않는 한 두 번째 레플리카도 없다. 이는 단일 프로세스에 로드되어 한 번에 하나의 dict에 응답하며, 페일오버가 필요하면 당신이 곧 페일오버다. 이는 출시 노트 없이 공개된 8억 5,300만 파라미터 연구 체크포인트에 대한 타당한 설명이며, 그에 따라 의사결정에 반영해야 한다.

동일한 파이프라인의 생성 절반은 네트워크 호출이며, 네트워크 호출은 라우터가 필요한 바로 그 대상이다. Qwen3.8-Max와 Qwen3.8-27B 모두 하나의 OpenAI 호환 키 뒤에서 접근할 수 있고, 자동 장애 조치가 있으므로 성능이 저하된 업스트림이 곧 당신의 인시던트가 되지는 않는다 — 여기서 언급할 가치가 있는 이유는 우리 쪽에서 측정한 Qwen3.8-Max의 실시간 7일 오류율이 1.57%이기 때문인데, 이는 당신의 요청이 되기 전까지는 낮은 수치다. 합리적인 패턴은 이 조합이 조용히 설명해 온 바로 그것이다: 저렴한 폐쇄 집합 스코어러는 빠르고 호출당 비용이 들지 않으므로 로컬에서 실행하고, 추론 단계는 라우팅하라 — 가격 인하, 모델 교체, 장애가 실제로 일어나는 곳이 바로 거기이기 때문이다.

우리가 주장하지 않을 두 가지가 있습니다. Intern-Decision-0.8B는 우리의 경로 중 하나가 아니며, InternLM이 어딘가에서 그것을 호스팅하기 전까지는 그렇지 않을 것입니다 — 우리는 그렇지 않다고 암시하지 않겠습니다. 그리고 우리는 오늘날 InternLM 모델을 전혀 호스팅하지 않으므로, 이 글의 어떤 내용도 해당 주제를 우리를 통해 실행하자는 제안이 아닙니다.

답을 바꾸는 것은 무엇인가?

세 가지 열린 질문이 있고, 모두 며칠 안에 답할 수 있다. InternLM은 자체 카드가 링크하는 GitHub 리포지토리를 공개하는가, 그리고 그와 함께 이 가중치들이 어떻게 튜닝되었는지에 대한 설명도 공개하는가? 체크포인트에 이어 출시 게시물이 나와, 조용한 푸시를 배포 스토리가 명시된 문서화된 릴리스로 바꾸는가? 그리고 InternLM의 것이 아닌 하드웨어에서 독립적으로 79.38 평균이나 0.066 캘리브레이션 오류를 재현하는 사람이 있는가?

그중 하나가 나오기 전까지, Intern-Decision-0.8B를 정직하게 읽으면 그 의미는 좁고 구체적이다: 그것은 세 모델로 이루어진 패밀리에서 가장 저렴한 closed-set 스코어러이며, 자신의 더 빠르고 더 정확한 형제 모델은 들어가지 못하는 곳에 맞는 풋프린트를 갖추고 있고, 발표도 없이, 그리고 무엇을 위해 튜닝되었는지 알려줄 단 하나의 아티팩트도 없이 공개되었다. 당신의 결정이 closed-set이고, 답을 프롬프트에 열거할 수 있으며, 1.71 GB가 당신의 배포에서 실제로 판가름하는 숫자라면, 그것이 올바른 선택이며 그 크기에서는 그와 같은 것이 달리 없다. 답을 미리 열거할 수 없거나, 상태가 8,192 토큰을 넘어가거나, 사람에게 보여줄 수 있는 근거가 필요하다면, 그 비교는 애초에 막상막하가 아니었다 — 그리고 당신이 원하는 모델은 결코 8억 5,300만 파라미터짜리 모델이 아니었다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트