
Intern-Decision-2B vs Qwen 3.8: 하나의 백본, 매우 다른 두 가지 작업
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 584 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 187 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
config를 열어서internlm/Intern-Decision-2B의 config와Qwen/Qwen3.5-2B의 config를 나란히 비교해 보면 거의 차이가 없다. 24개 레이어, 2,048 히든 크기, 쿼리 헤드 8개 대 키-값 헤드 2개, 256의 헤드 차원, 262,144 위치 임베딩 상한, 248,320 토큰 어휘, 선형 어텐션 레이어 3개 대 전체 어텐션 레이어 1개의 반복 패턴까지 모두 똑같다. Intern-Decision-2B는 새로운 아키텍처가 아니다. 그것은 텍스트 생성 능력을 제거하고 신뢰도를 보정한 그 백본이다 — 그리고 바로 그 단 하나의 감산이 Qwen3.8-Max, 'Qwen 3.8'이라는 제품군 이름이 최상위에서 가리키는 2.4조 파라미터 플래그십과의 비교를 파라미터 개수 세기보다 더 가치 있게 만든다.
둘은 경쟁자가 아니며, 이 맞대결은 승부가 아니다. Intern-Decision-2B는 Qwen3.5-2B를 2,213,241,664개 파라미터로 미세 조정한 모델로, 2026년 9월 26일 05:36 UTC에 공개되지 않은 세 형제 모델과 함께 Hugging Face에 업로드되었으며, 토큰을 출력하지 않는다: 상태와 타입이 지정된 질문들을 받아 하나의 인과적 전방 패스를 실행하고, 고정된 자리 표시자 위치에서 로짓을 읽고, 필드별로 보정된 분포를 반환한다. Qwen3.8-Max는 Alibaba의 호스팅 플래그십으로, 토큰당 약 950억 개의 파라미터가 활성화되는 희소 전문가 혼합 모델이며, 100만 토큰 멀티모달 컨텍스트 윈도와 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $6.00의 정가를 갖는다. 하나는 구성 요소다. 다른 하나는 서비스다. 유용한 질문은 이미 비용을 지불하고 있는 파이프라인에서 둘 사이의 경계가 어디에 놓여야 하는가이다.
정확히, 그 뺄셈
결정 튜닝이 바꾼 것이 무엇인지는 정확히 밝힐 가치가 있다. 그것은 베이스 모델이 이미 담고 있던 것이 무엇인지를 분명히 해 주기 때문이다.
이 작업은 저장소에서 자기회귀 마스킹 언어 모델링으로 명명되어 있습니다. 어시스턴트 입력에는 각 필드마다 하나의 <decision> 토큰이 있는 완전한 JSON 골격이 포함되어 있습니다. 정답 답안 기호는 레이블에만 나타나며 입력에는 결코 나타나지 않습니다. 훈련은 일반적인 인과적 다음 토큰 정렬을 사용합니다. 여기서 마커 바로 앞의 로짓이 해당 필드의 답을 예측하며, 모든 필드는 하나의 순전파를 공유합니다. 추론 시 로짓은 허용되는 단일 토큰 답안 기호 — A–Z, a–z, 0–9 — 로 제한되며, 62개 선택지 상한은 여기서 비롯됩니다. 그런 다음 소프트맥스 처리되어 당신의 레이블로 다시 매핑됩니다.
그래서 베이스 모델의 다음 토큰 메커니즘은 손상되지 않았고 수정되지도 않았습니다. 학습된 것은 문장을 계속 이어 가는 대신 몇 안 되는 답변 위치 중 하나를 차지하려는 선호, 그리고 체크포인트별 온도 2.100509348278입니다. 이 온도는 1,693개를 홀드아웃한 상태에서 1,728개의 지정된 캘리브레이션 사례에 대해 음의 로그 우도로 피팅되었습니다. 카드는 생성이 배제되어 있다는 점을 분명히 합니다: API는 "구조화된 후보 점수 산정을 수행합니다. generate()를 호출하거나 자유 형식 텍스트를 샘플링하지 않습니다."
저장소는 또한 튜닝이 건드리지 않은 부분도 기록한다: 그것은 "비전 타워와 프로젝터를 고정한 채 Qwen3.5의 언어 백본을 미세 조정한다"는 것이다. 2B의 612,517,440바이트 비전 샤드는 4B 결정 체크포인트와 동일한 바이트 수를 가지며, 이는 훈련된 구성 요소보다는 상속된 구성 요소에 부합한다. 이미지 경로는 작동한다; 단지 그것이 결정 단계가 예산을 쓴 대상은 아니었을 뿐이다.

22억 파라미터가 할 수 없는 것, 그리고 2조 4천억이 대신 하는 것
모든 것은 하나의 축으로 갈린다: 당신의 답이 이미 목록으로 존재하는지의 여부다.
Intern-Decision-2B는 닫힌 집합에 답한다. 질문은 1개에서 16개까지, 각각 최대 62개의 선택지, 최대 8개의 이미지까지이며, 이 모두는 엔진이 잘라내기보다 거부하는 8,192토큰 예산 안에 들어간다. 확률로 반환된다. 단일 RTX 4090에서 요청당 평균 33.28ms, P95 33.55ms이고, 청구할 출력이 없기 때문에 호출당 청구되는 금액은 없다.
Qwen3.8-Max가 씁니다. 100만 토큰 컨텍스트, 텍스트·이미지·비디오 입력, 사고 모드를 통한 추론, 네이티브 도구 호출, 구조화된 출력, 0902 빌드 기준 최대 131,000개의 출력 토큰. 원칙적으로는 Intern-Decision-2B가 내리는 것과 동일한 라우팅 결정을 내릴 수도 있습니다. 옵션 중에서 선택하고 JSON을 반환하도록 프롬프트할 수 있습니다. 그렇게 하면 세 가지 문제가 발생합니다. 결정하는 데 소비한 토큰 비용을 지불하게 됩니다. 파싱이 성공할 수도, 실패할 수도 있는 문자열을 얻게 됩니다. 그리고 그 문자열 안의 숫자는 0.8을 임계값으로 삼아 행동에 옮길 수 있는 소프트맥스가 아니라, 샘플러가 만들어낸 임의의 값입니다.
두 설명 모두 사실이며 어느 쪽도 다른 쪽을 상쇄하지 않는다. 2.4조 매개변수 플래그십이 존재하는 이유는 대부분의 문제가 닫힌 집합이 아니기 때문이다. 22억 매개변수 스코어러가 존재하는 이유는 닫힌 집합인 부분집합은 더 저렴한 도구를 받을 만하기 때문이다.
점수판

• 파라미터 — Intern-Decision-2B는 BF16 기준 2,213,241,664개에 비전 타워와 프로젝터를 더한 것으로, 디스크상 약 4.46GB; Qwen3.8-Max는 총 약 2.4조 개이며 토큰당 약 950억 개가 활성화되고, 다운로드되지 않고 서빙됩니다.
• 컨텍스트 — 8,192 토큰, 그 이상은 거부됨; 0902 빌드에서 최대 출력 131,000개인 1,000,000 토큰.
• 출력 — 보정된 확률 및 argmax, 생성된 텍스트 없음; 추론 트레이스를 포함한 생성된 텍스트.
• 입력 모달리티 — 텍스트와 최대 8개의 이미지, 텍스트, 이미지 및 동영상.
• 비용 — 호출당 요금이 없고 GPU를 직접 소유합니다; 입력 토큰 백만 개당 $2.00, 출력 백만 개당 $6.00이며, 캐시 읽기는 $0.25, 캐시 쓰기는 $2.50입니다.
• 공개된 증거 — 10,751개 테스트 행에 걸쳐 평균 84.68, Brier 0.437, ECE 0.100을 기록했지만 InternLM 외부에서는 아무도 재현하지 못한 7개 스위트 벤더 표이며, 좋아요 1개와 다운로드 0회인 체크포인트에 대한 것; Artificial Analysis Intelligence Index는 45.4로 145개 중 15위, AA Coding index는 76.2로 138개 중 9위이며, 둘 다 독립적으로 측정됨.
• 지연 시간 — RTX 4090 한 장에서 요청당 평균 33.28ms이며, 배칭이 추가될수록 감소합니다; 카탈로그에 보고된 대로 첫 토큰까지의 P50은 2.655초이며, 부하가 커질수록 증가합니다.
증거 행들은 동등하지 않으며, 마치 동등한 것처럼 인쇄되어서는 안 된다. 알리바바의 플래그십에는 이를 뒷받침하는 독립적인 지수 점수가 있다. InternLM의 체크포인트에는 자체 저자들이 만든 표가 있으며, 특히 캘리브레이션 수치는 다른 누군가의 데이터와 만나기 전까지는 잘 문서화된 의도로 읽어야 한다 — 여기서는 더욱 그렇다. 왜냐하면 이 특정 크기는 InternLM이 공개한 세 모델 중 가장 나쁜 기대 캘리브레이션 오차를 기록하기 때문이다. 0.100인 반면, 절반 크기 모델은 0.066이고 거의 두 배 크기인 모델은 0.065이다.
이음새와 이를 실행하는 방법
합리적인 파이프라인은 이 둘 중 하나를 선택하는 것이 아니라 분할하는 것입니다: 스코어러는 열거된 결정을 처리하고, 프런티어 모델은 답이 목록이 아닌 모든 것을 처리합니다. 여섯 팀 중 하나로 라우팅하고 긴급도를 3점 척도로 평가하는 지원 트리아지는 950억 개의 활성 파라미터가 필요하지 않습니다. 필요한 것은 확률과 임계값입니다. 결국 고객에게 답변을 작성하는 에스컬레이션 경로는 950억 개의 활성 파라미터가 필요합니다.
그 분할에는 운영상의 형태가 있습니다. Intern-Decision-2B는 OrcaRouter에 없습니다 — 해당 모델 페이지는 404를 반환하고, 우리가 찾을 수 있는 어디에도 호스팅된 경로가 없습니다 — 따라서 자체 하드웨어에서 실행되며, 이는 곧 여러분이 운영하고 모니터링하는 구성 요소라는 뜻입니다. Qwen3.8-Max는 경로입니다: 200개 이상의 모델에 걸친 하나의 키, 공급업체 목록 가격이 마크업 없이 그대로 전달되므로 플래그십 모델의 벤더 가격 변경이 발생하는 당일 바로 청구서에 반영됩니다. 파이프라인의 호스팅 구간을 그 단일 표면 뒤에 두는 것이 더 저렴한 구간을 저렴하게 유지하는 방법입니다. 스코어러가 호출량을 낮게 유지하고, 프런티어 모델은 실제로 필요한 경우에만 호출됩니다.

아직 그 자리에 어떤 스코어러가 들어가야 할지 평가 중이라면 — 이것은 독립적인 평가가 없고, 자체 제품군 안에서 캘리브레이션이 가장 취약합니다 — 자동 장애 조치를 공급자 전반에 걸쳐 사용하는 것이, 이미 뒤에 작동하는 대안이 있는 경로에서 이것을 시험해 보는 방법입니다. 그 대안을 통째로 대체하기보다는 말이죠.
정직한 평결
당신의 문제가 열거할 수 있는 답변 집합에 대한 결정이고, 상태가 8,000 토큰 안에 들어간다면, Intern-Decision-2B는 호출당 비용 없이 33밀리초 만에 처리할 것입니다. 그리고 아무리 많은 매개변수를 빌려도 그 축에서는 어떤 프런티어 모델도 그것을 이기지 못할 것입니다. 그것이 보고하는 신뢰도에 의존하기 전에, 그 모델에 당신 자체의 보정을 적용하세요.
당신의 문제가 그 밖의 다른 무엇이든 — 추론, 긴 컨텍스트, 도구 사용, 비디오, 백만 토큰짜리 문서, 혹은 아직 쓰이지도 않은 답변까지 — Qwen3.8-Max는 단순히 더 나은 정도가 아닙니다. 이 일을 해낼 수 있는, 둘 중 유일한 모델입니다.
그리고 그 두 가지 중 어느 것을 가지고 있는지 아직 말할 수 없다면, 답은 아마도 당신이 같은 파이프라인 안에 둘 다를 가지고 있다는 것이며, 그것이 바로 파라미터 수가 줄곧 조용히 당신에게 말해 주고 있던 아키텍처입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
