제목이 Intern-Decision-4B vs Qwen 3.8인 비교 기사용 타이틀 카드로, 부제는 '2.4조 개 매개변수에 맞선 44밀리초 포워드 패스'이며, 작고 빠른 스코어러, 대형 추론 모델, 비용 비교를 암시하는 세 개의 플랫 라인 아이콘으로 이루어져 있습니다.
Engineering & Research

Intern-Decision-4B vs Qwen 3.8: 2.4조 매개변수에 맞선 44밀리초 순전파

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

InternLM은 2026년 9월 26일 오전 Hugging Face에 Intern-Decision-4B를 공개했다 — 출시 게시물도, 블로그 글도 없고, 자체 모델 카드에 있는 GitHub 링크는 404를 반환하며 데모 Space는 401을 반환한다. 가중치는 실제이며 다운로드할 수 있다. 공지는 거기에 없다. 그리고 그 바탕에 있는 모델은 Qwen3.5-4B의 파인튜닝이며, 바로 이 점이 호스팅된 플래그십과의 비교를 스펙 시트 이상의 가치로 만든다. 이 둘은 경쟁자가 아니다. 이들은 하나의 파이프라인의 양 끝이고, 관건은 둘 사이의 경계가 어디에 그어지는가이다. 바탕이 되는 핵심은 공급업체가 8월에 공개했고 현재 Qwen3.8-Max로 제공되는 2.4조 매개변수 모델로, 백만 토큰당 $2.00 및 $6.00로 청구된다. Intern-Decision-4B는 7개월 된 그 기본 모델을 45억 4천만 개 매개변수로 재구축한 것으로, 토큰을 전혀 내보내지 않으며, 한 번의 순방향 패스에서 최대 16개의 유형이 지정된 질문에 답하고, 청구할 출력이 없기 때문에 호출당 비용이 들지 않는다.

한 줄 답변: 당신의 작업이 정해진 답변 집합을 가진 결정이라면, Intern-Decision-4B는 결정당 대략 50배 더 빠르고 구조적으로 더 저렴하며, 어떤 프런티어 모델도 그 좁은 축에서는 그것을 이기지 못할 것입니다. 당신의 작업이 그 외의 무엇이라면 — 추론, 긴 문맥, 도구 사용, 프롬프트에 이미 열거되어 있지 않은 답을 요구하는 모든 것 — Qwen 3.8은 단지 더 나은 정도가 아니라, 둘 중 그 작업을 아예 해낼 수 있는 유일한 모델입니다. 아래의 모든 내용은 그 경계선을 정확히 찾는 것에 관한 것입니다.

무엇이 실제로 확인되었고, 무엇이 확인되지 않았는가

증거부터 시작하자. 프레이밍이 중요하니까. Intern-Decision-4B에 대한 벤더 발표는 없다. 보도자료도, 논문도, 읽어볼 만한 저장소 설명도 없다. 오늘 현재 존재하는 것은 오늘 아침 internlm 조직 — 상하이 AI 연구소(Shanghai AI Laboratory)의 Intern Large Models — 산하에 공개된 Hugging Face 저장소 하나로, Apache 2.0 라이선스를 적용하고 있으며 업스트림 Qwen 라이선스가 LICENSE-QWEN이라는 이름으로 그 옆에 그대로 보존되어 있다. 40초 간격으로 두 개의 형제 체크포인트가 등장했다: 8억 5,300만 파라미터의 Intern-Decision-0.8B와 22억 1,000만 파라미터의 Intern-Decision-2B. 세 모델 모두 동일한 태그를 달고 있다 — decision-making, multimodal, structured-prediction — 그리고 셋 모두 아직 공개적으로 열리지 않는 하나의 모델 컬렉션 아래에 있다.

확인되지 않은 점: 이것이 최종 릴리스인지 아니면 이른 푸시인지 여부다. 리포지토리는 05:36 UTC에 생성되었고 같은 날 08:00 UTC 이전에 다시 수정되었으며, 형제 체크포인트에 대한 추가 공개 활동은 09:00 이후에도 계속되었다. InternLM은 의도된 배포 계획이 무엇인지 말하지 않았고, 링크한 리포지토리를 공개하지 않았으며, 호스팅 엔드포인트가 나올지도 밝히지 않았다. 이 기사의 모든 벤치마크 수치는 벤더가 보고한 것이며 재현되지 않은 것으로 취급하라 — 이 글을 쓰는 시점에 이 모델에 관해 다른 어떤 내용도 어디에도 전혀 작성된 바 없기 때문이다. 세 가지 별도의 검색 경로에서 이 이름에 대한 결과가 아무것도 나오지 않는다.

Screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the internlm organization, the image-text-to-text and transformers tags, 5B params, and the model card opening line describing a multimodal structured decision model fine-tuned from Qwen3.5-4B.

아키텍처적 선택: 생성기가 아닌 스코어러

Intern-Decision-4B 자체 문서에서 가장 중요한 문장은 부정문입니다: 추론 경로는 "generate()를 호출하거나 자유 형식 텍스트를 샘플링하지 않습니다." 그것은 구현 세부 사항이 아니라 전체 설계이며, 이것이 Qwen3.8-Max를 JSON 스키마와 함께 호출하고 중괄호가 닫히기를 바라는 것과 이 설계를 구분하는 점입니다.

카드에서 설명하는 메커니즘은 다음과 같습니다. 모델에 공유 상태, 이름이 지정된 질문들의 스키마, 그리고 선택적으로 최대 8개의 이미지를 넘깁니다. 각 질문은 세 가지 유형 중 하나입니다: choice (정렬된 옵션 집합 중 하나를 고름), score (서열 척도로 평가하며, 확률 가중 기대값으로 반환됨), 또는 noul (이진 아니오/예). 시스템 프롬프트, 상태, 스키마 및 완전한 어시스턴트 JSON 뼈대는 필드마다 하나의 자리 표시자와 함께 렌더링됩니다. 그런 다음 — 이것이 핵심인데 — 모델은 한 번의 인과적 순전파를 실행하고, 로짓은 각 자리 표시자 바로 앞 위치에서 읽힙니다. 해당 필드에 허용된 후보 기호들만을 대상으로 소프트맥스가 수행되고, 체크포인트의 캘리브레이션이 적용되며, 기호들은 원래 옵션 값으로 다시 매핑됩니다.

결과는 구체적이다. 각 필드의 답변 공간은 어휘 헤드에 미리 박혀 있는 것이 아니라 요청마다 조립되므로, 오늘 오후에 고안한 스키마도 재학습이 필요 없다 — 질문을 하나 추가하면 선택지가 그 필드의 후보 심볼이 된다. 디코딩 루프가 없으므로 출력 토큰도, 잊어버릴 중괄호도, 잘못된 JSON을 둘러싼 재시도 로직도 없다. 그리고 모든 질문이 동일한 상태 읽기를 바탕으로 채점되므로, 열여섯 개 질문의 비용은 열여섯 번이 아니라 한 번의 순전파다.

한계는 똑같이 구체적이며, 카드는 이를 얼버무리지 않고 명시한다. 질문 1~16개, 질문당 최대 62개 옵션, 최대 8개 이미지. 기본 최댓값 8,192토큰 — 그리고 이를 초과하는 입력은 잘림 없이 거부된다. 그 마지막 조항은 곱씹어 볼 만한 설계 결정이다. 조용한 잘림은 분류기가 당신이 물은 것과 다른 질문에 조용히 답하기 시작하는 방식이며, InternLM은 대신 요란하게 실패하기로 선택했다. 이는 옳은 판단이자 동시에 운영상의 함정이기도 하다. 긴 티켓 스레드에 스키마와 이미지까지 더하면 예상보다 빨리 8,192를 넘어서게 되고, 우아한 경로는 없다 — 오류가 발생한다.

Intern-Decision-4B가 이기는 곳, 그리고 그 차이는 크다

두 개의 축이며, 둘 다 점진적인 것이 아니라 구조적인 것이다.

• 결정당 지연 시간 — 평균 44.16ms, 중앙값 44.03ms, p95에서 44.60ms이며, 로컬 Hugging Face 경로를 통해 단일 RTX 4090에서 측정했습니다. 자체 플레이그라운드에서 실시간 7일 창이 초당 출력 토큰 55.4개 기준으로 p50 2,474ms, p95 9,789ms를 보여주는 Qwen3.8-Max와 비교하면, 중앙값 기준 약 56배입니다. 그리고 이 비교는 불공정하다기보다 서로 다른 두 작업 사이의 비교에 가깝습니다. 한 모델은 분류하고, 다른 모델은 추론한 다음 작성합니다. 격차는 실재하며 그 이유도 실재합니다.

• 결정당 비용 — 그리고 이건 의견이 아니라 산수다. 현실적인 지원 트리아지 호출을 가정해 보자: 상태와 스키마에 대한 입력 토큰 800개, 구조화된 JSON 출력 토큰 150개. Qwen3.8-Max에서는 800 × $2.00/M 더하기 150 × $6.00/M, 즉 추론 토큰 하나도 쓰기 전에 결정당 약 $0.0025다 — 그리고 Qwen3.8-Max는 추론 모델이므로 출력 쪽은 낙관적으로 작게 잡은 값이다. 결정 100만 건이면 대략 $2,500이 든다. 같은 결정 100만 건을 Intern-Decision-4B에서 처리하면 토큰 비용은 0이고, RTX 4090 시간으로 약 12.3시간이 든다. Intern-Decision-4B는 출력이 없으므로 출력 가격도 없다.

그 거래는 정직하고 명백하다: 4B에는 당신이 소유하거나 임대한 GPU가 필요하고, 그 GPU를 점유하며, 오직 한 가지 일만 할 수 있다. 하지만 그 한 가지 일이 당신의 제품이 하루에 수백만 번 수행하는 일이라면, 위의 계산이 곧 전체 비즈니스 사례가 되며, 어떤 프런티어 모델 능력도 그것을 바꾸지 못한다.

Qwen 3.8이 공개하지 않는 숫자: 캘리브레이션

이것이 조용한 차별점이며, 벤치마크처럼 보이지 않기 때문에 대부분의 비교에서 놓치게 되는 부분이다.

Intern-Decision-4B는 분포를 반환합니다 — 단순한 레이블이 아니라 옵션 값에 대한 분포이며, 신뢰도까지 함께 제공하고, noul 질문에 대해서는 보정된 확률을 제공합니다. InternLM은 자체 스위트에서 브라이어 점수 0.347과 기대 보정 오차 0.065를 보고하며, 피팅된 온도를 체크포인트에 담아 제공합니다: 1.99241824, 이 크기에 맞춰 1,728개의 지정된 보정 사례와 1,693개의 홀드아웃 검증 사례에서 음의 로그 우도 최소화를 통해 별도로 피팅된 값입니다. 테스트 스위트 레이블은 이를 선택하는 데 사용되지 않았습니다. 카드에는 샘플링된 레이블이 아니라 정확한 참조 분포를 사용하는 별도의 독립적인 96개 사례 진단이 있으며, 이는 보정 전 0.628 / 0.213에서 보정 후 0.550 / 0.089로 전체 브라이어/ECE가 달라지는 것을 보여줍니다 — 보정 단계가 기대 오차를 절반 이상 줄였습니다.

이제 Qwen 3.8 쪽에서도 같은 수치를 찾아보십시오. 그것은 없습니다. 알리바바는 Artificial Analysis Index 점수, GPQA Diamond, terminal-bench, SciCode, tau-banking, 장문맥 회상을 공개합니다 — 모두 역량 측정치입니다. Qwen 3.8 패밀리 구성원 누구에 대해서도 보정 지표는 공개하지 않습니다. 생성 모델의 신뢰도는 공급업체가 제공하는 수치가 아니기 때문입니다. 시스템이 신뢰해야 하는 답변 대신 임계값을 설정하거나 라우팅에 사용할 수 있는 확률을 필요로 한다면, 그 차이는 정도의 문제가 아닙니다. 한 모델은 문서화된 오류율이 있는 숫자를 주고, 다른 모델은 텍스트를 주며, 그 주위로 여러분이 직접 신뢰도 추정치를 세워야 합니다.

Qwen 3.8이 이기는 부분에서는, 그것도 근소한 차이가 아니다

두 대상이 각각 무엇을 하도록 요구받을 수 있는지를 기준으로 나란히 놓고 보면, 경계는 더 이상 미묘하지 않게 된다.

• 배경 — Qwen3.8-Max는 1,000,000토큰 창을 갖습니다. Intern-Decision-4B는 8,192를 넘는 모든 입력을 거부합니다. 이는 122배이며, 우회 방법이 없습니다. 입력 상한이 초과분을 잘라내는 방식이 아니라 강제 적용되기 때문입니다.

• 입력 모달리티 — Qwen3.8-Max는 텍스트, 이미지, 동영상을 입력받습니다. Intern-Decision-4B는 텍스트와 이미지를 입력받으며, 이미지는 최대 8장까지 가능하고 이미지 토큰은 동일한 8,192 예산에 포함됩니다.

• 추론과 도구 — Qwen3.8-Max는 공개된 기능에 도구 사용, JSON 모드, 추론을 포함하고 있으며, Artificial Analysis Intelligence Index 45.4를 기록해 색인된 145개 모델 중 15위이고, AA Coding 점수는 76.2로 138개 중 9위입니다. 이는 벤더의 주장이 아니라 Artificial Analysis가 발표한 독립적인 수치입니다. Intern-Decision-4B는 Artificial Analysis 등재 항목도, 어떤 종류의 독립적인 점수도 없으며, 추론하거나 계획을 세우거나 무엇이든 호출할 수 있는 능력도 없습니다.

• 개방형 출력 — Qwen3.8-Max는 글을 씁니다. Intern-Decision-4B는 문단도, 근거도, 계획도 만들어내지 못합니다. 그것은 당신이 이미 나열하기로 생각해 둔 선택지에 점수만 매길 수 있을 뿐입니다.

오픈 웨이트 쪽에서도 짚고 넘어갈 만합니다: Qwen 3.8 코어 자체를 원하고 호스팅 경로는 원하지 않는다면, Qwen3.8-27B가 덴스(dense) 형제 모델입니다 — 278억 개 매개변수, Apache 2.0, 262,144토큰 컨텍스트, 그리고 서빙되는 곳 기준 백만 토큰당 대략 $0.33 / $2.40입니다. AA Intelligence Index에서 33.7점을 기록합니다. 여전히 Intern-Decision-4B보다 10배 더 크고, 여전히 생성형이며, 대량으로 처리하는 폐쇄 집합 결정에는 여전히 잘못된 도구입니다 — 하지만 이는 정직한 중간 옵션이며, 셋 중 정말로 저렴하면서 동시에 정말로 유능한 유일한 옵션입니다.

Screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the on-page navigation for code samples, pricing, performance, public benchmarks, community buzz, how it compares and FAQ, with the model name and vendor breadcrumb at the top.

InternLM 자체 벤치마크 표를 솔직하게 읽기

Intern-Decision-4B의 카드에는 비교 표가 실려 있는데, 빠져 있는 것이 표 안에 담긴 것보다 더 많은 것을 알려준다. 행은 Jev, Laya, SemIf, Kev, JevK5, 그리고 InternLM 자체의 0.8B와 2B다. 그 하나하나가 모두 또 다른 System One 또는 의사결정 모델 항목이다 — TypeSafe AI의 Jev, Convai Innovations의 Laya, 그리고 나머지 셋. 모든 수치는 InternLM 자체 하네스에서 벤더가 보고한 것이다. 표에는 프런티어 모델이 전혀 없다.

그것은 간과가 아니다. 그것이 그 주장의 정직한 범위다. 일곱 개 스위트에 걸친 Intern-Decision-4B의 대표 평균 90.02 — Jevbench-Easy 100.00, Jevbench-Original 98.61, Jevbench-Hard 73.87, Typed Decision 80.55, ToolACE 96.45, AG News 90.82, WildJailBreak 89.86 — 는 의사결정 모델 범주를 선도한다는 주장이며, 이 표에서는 실제로 그렇다. Jev의 88.74와 Laya의 57.77을 앞선다. 그것은 Qwen 3.8과 경쟁하겠다는 주장이 아니며, InternLM은 어디에서도 그런 주장을 하지 않는다. 모델 카드는 그 자체의 범주로 범위가 한정되어 있으며, 범주에서의 승리를 역량의 승리로 읽는 것이 바로 이 섹션이 방지하고자 하는 실수다.

주의사항이 두 가지 더 있습니다. 지연 시간 수치 — 4090에서 평균 44ms — 는 벤더가 측정한 값이며 워크로드와 하드웨어에 따라 달라지고, 단일 GPU 포워드 패스는 네트워크 왕복과 큐잉을 포함하는 호스팅 API 호출과 동일한 측정치가 아닙니다. 그리고 캘리브레이션 파일럿은 96개 사례로, 벤치마크가 아니라 진단이며, 카드에도 그렇게 적혀 있습니다.

진짜 갈림길인 배포 문제

잠시 벤치마크는 잊고, 각각이 운영 측면에서 여러분에게 무엇을 요구하는지 물어보세요.

Intern-Decision-4B는 bf16 기준으로 디스크에서 약 9.1 GB입니다. 4.26 GB와 4.15 GB짜리 언어 샤드 두 개, 612 MB의 비전 타워, 그리고 54 MB의 프로젝터로 이루어져 있죠. 이는 저장소 자체에 포함된 16 KB짜리 inference.py를 통해 로드되며, 한 번 인스턴스화한 뒤 재사용하는 DecisionEngine 클래스가 함께 제공됩니다. 입력은 Python dict 하나, 출력은 응답 dict 하나이고, Python 3.12 이상이 필요합니다. 4090에서 44 ms로 실행되며, 0.8B 형제 모델은 훨씬 적은 자원으로도 충분히 따져볼 수 있을 만큼 작습니다. 하지만 모듈 자체가 인터페이스입니다 — 서버도, OpenAI 호환 엔드포인트도, 호스팅 API도 없습니다. 그 주위에 여러분이 서비스를 구축해야 하고, 페일오버를 위해 두 개가 필요하다면 그것 역시 여러분이 만들어야 합니다.

같은 파이프라인의 생성 측면은 완전히 다른 결정이며, 라우터가 실제로 존재하는 이유가 바로 그것입니다. Qwen3.8-Max와 Qwen3.8-27B는 모두 동일한 OpenAI 호환 키 뒤에서 OrcaRouter에서 호출할 수 있으며, 공급자 정가에 0% 마크업이 그대로 전달되는 가격으로 — 그래서 알리바바가 Qwen 가격을 조정하면 다음 청구 주기가 아니라 같은 날 우리 쪽에도 반영됩니다. Intern-Decision-4B는 우리의 라우트 중 하나가 아니며, InternLM이 어딘가에 호스팅하기 전까지는 그럴 예정도 없습니다. 그렇지 않은 척할 생각도 없습니다. 우리가 담당하는 것은 이 파이프라인에서 네트워크 호출에 해당하는 절반입니다: 200개 이상의 모델을 위한 단일 키, Qwen3.8-Max 성능이 저하될 경우 자동 장애 조치 — 실시간 7일 오류율은 1.78%입니다 — 그리고 두 Qwen 3.8 등급 중 어느 쪽을 선택하기 전에 동일한 요청 경로에서 서로 A/B 테스트할 수 있는 기능입니다.

가져갈 만한 패턴은 바로 이것입니다. 스코어러는 로컬에서 실행하세요. 저렴하고 빠르며 한 가지 좁은 일을 잘하기 때문입니다. 추론 단계는 라우팅하세요. 벤더 교체와 가격 인하와 장애가 실제로 일어나는 곳이 바로 거기이기 때문입니다.

A two-column comparison scoreboard titled Intern-Decision-4B vs Qwen 3.8 — the scoreboard, contrasting 44 ms per decision, about $0 in tokens per million decisions, an 8,192-token context, text plus 8 images, a published Brier of 0.347 and no open-ended output on the left against 2,474 ms p50 hosted, about $2,500 per million, a 1,000,000-token context, text, image and video, no published calibration and open-ended reasoning on the right.

실제로 어떤 것을 선택해야 할까요

결정이 폐쇄집합이고, 답변이 프롬프트에 열거 가능하며, 동일한 결정을 대량으로 실행하고, 레이블만큼 확률에도 관심이 있다면 Intern-Decision-4B를 선택하세요. 티켓 라우팅, 고정된 분류체계에 대한 콘텐츠 모더레이션, 당신이 통제하는 스키마로의 구조화된 추출, 평가 루브릭, 이진 게이트 — 사람이 옵션 목록을 미리 작성할 수 있었던 모든 경우입니다. 45억 4천만 개의 파라미터는 한계에 대해 솔직합니다: 카드 자체가 Jevbench-Hard에서 4B가 73.87인 반면 Easy에서는 100.00임을 보여주므로, 결정 형태가 어려울수록 작은 모델은 더 많은 것을 포기합니다.

Qwen 3.8을 고르세요 — 호스팅된 코어를 원한다면 Qwen3.8-Max를, 직접 보유할 수 있는 가중치를 원한다면 Qwen3.8-27B를 의미합니다 — 답을 미리 열거할 수 없거나, 입력이 8,192 토큰보다 길거나, 사람에게 보여줄 수 있는 근거가 필요하거나, 도구 호출이 필요하거나, 비디오가 필요할 때. 또한 단순히 GPU를 운용하고 싶지 않을 때도 그것을 고르세요: 결정 100만 건당 4090 시간 12.3시간은 이미 4090이 있고 나머지 363일 동안 그것으로 할 다른 일이 있을 때에만 저렴합니다.

당신의 파이프라인이 대부분의 파이프라인이 실제로 취하는 형태라면 — 앞단에는 저렴한 폐쇄 집합 분류기를, 뒤에는 분류기가 확신하지 못하는 경우를 위한 프런티어 모델을 두는 — 둘 다 선택하세요. 그것이 바로 Intern-Decision-4B의 보정된 신뢰도가 만들어진 구성이며, 위의 ECE 수치가 헤드라인 평균보다 더 중요한 이유입니다.

볼 만한 것

세 가지 열린 질문이 있으며, 모두 며칠 안에 답할 수 있다. InternLM은 자사 카드가 링크하는 GitHub 저장소(현재 404)를 공개하고, 그와 함께 학습 설명도 공개하는가? 가중치에 이어 발표가 나와, 조용한 푸시를 문서화된 릴리스로 전환하는가? 그리고 InternLM의 하드웨어가 아닌 환경에서 90.02 평균이나 0.347 Brier를 독립적으로 재현하는 사례가 있는가?

기다리는 동안 작은 불일치 하나를 짚고 넘어가겠습니다. 배포 규모를 산정할 때 중요한 종류의 일이기 때문입니다. 모델 이름은 4B입니다. 파라미터 수는 4,539,265,536개, 즉 45억 4천만 개입니다. 0.8B 형제 모델은 8억 5,300만 개이고 2B 형제 모델은 22억 1천만 개로, 둘 다 아주 근소하게 올림 또는 내림한 값입니다. 오직 4B만 5억 개 넘게 내림한 값입니다. 이것은 문제가 아닙니다. 이는 공개 예고 없이 나온 릴리스에서는 문서가 당신이 가진 유일한 사양이며, 그 문서조차 아직 편집되고 있다는 점을 일깨워 줍니다.