
Intern-Decision-2B vs Gemma 4 12B: 8,192토큰 상한과 256K 윈도우의 맞대결
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 584 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 187 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
판단해야 할 대상이 마흔 페이지짜리 보험 청구 파일이라고 가정해 보자. internlm/Intern-Decision-2B는 그것을 거부할 것이다. 잘라내지도, 요약하지도 않고 — 거부한다. 함께 제공되는 추론 엔진이 DecisionEngine(max_length=8192)을 선언하고 있고, 모델 카드에도 크기를 초과한 입력은 "잘림 없이 거부된다"고 분명히 적혀 있기 때문이다. google/gemma-4-12B-it— Gemma 4 12B Unified —는 같은 문서에다 거기에 철해 둔 스캔 사진, 녹음된 통화까지 받아서 답을 써줄 것이다. 그 대비가 바로 이 비교의 전부이며, 사양표를 훑어볼 때 가장 먼저 눈에 들어올 매개변수 수 — 2,213,241,664 대 11,959,730,224 — 와는 거의 아무 관련이 없다.
Intern-Decision-2B는 InternLM이 2026년 9월 26일 별다른 공지 없이 Hugging Face에 업로드한 세 개의 결정 체크포인트 중 가운데에 해당하며, Qwen/Qwen3.5-2B에서 파인튜닝되었고 Apache-2.0 라이선스가 적용되었으며 Qwen 약관도 함께 보존되었습니다. Gemma 4 12B Unified는 Google DeepMind가 2026년 5월에 공개한 인코더 없는 멀티모달 모델로, 텍스트, 이미지, 오디오, 비디오를 입력받아 256,000토큰 창에서 140개 이상의 언어로 텍스트를 생성하는 any-to-any 시스템입니다. 이들 중 하나는 스코어러입니다. 다른 하나는 신중하게 프롬프트하면 형편없이 점수를 낼 수도 있는 범용 모델입니다. 둘 중 무엇을 선택할지는 벤치마크 질문이라기보다 당신의 답이 이미 어떤 형태인지에 관한 질문에 가깝습니다.
두 가지가 실제로 비교할 수 없는 경우
숫자를 내놓기 전에 이 점은 분명히 짚고 넘어갈 필요가 있다. 이 맞대결은 잘못된 대칭을 불러일으키기 때문이다.
Intern-Decision-2B는 토큰을 생성하지 않는다. 상태, 각각 최대 62개의 선택지를 가진 1~16개의 명명된 질문, 선택적으로 최대 8개의 이미지를 입력받는다. 각 필드마다 하나의 <decision> 자리표시자가 있는 어시스턴트 JSON 골격을 렌더링하고, 단일 인과적 순방향 패스를 실행하며, 각 자리표시자 바로 앞 위치에서 로짓을 읽고, 해당 필드의 허용 기호에 대해서만 소프트맥스를 적용하며, 피팅된 온도 2.100509348278을 적용한다. 출력은 보정된 분포와 필드별 argmax이다. 카드에는 다음과 같은 부정문이 명확히 명시되어 있다: "이 API는 구조화된 후보 점수 산정을 수행한다. generate()를 호출하거나 자유 형식 텍스트를 샘플링하지 않는다."
Gemma 4 12B는 생성합니다. 그것이 수행하는 모든 작업 — 구성 가능한 사고를 통한 추론, 함수 호출, OCR, 차트 이해, 음성 인식, 140개 언어 지원 — 은 262,144개 항목으로 구성된 어휘에 대한 디코딩 루프를 통해 실행됩니다. 확률이 포함된 라우팅 결정을 요청하면 숫자가 포함된 산문을 얻게 되며, 그 숫자는 샘플러가 생성한 값일 뿐, 당신의 옵션 집합에 대한 소프트맥스가 아닙니다.
따라서 실질적인 질문은 "어느 쪽이 더 정확한가"가 아니다. "내 답이 이미 닫힌 집합인가?"이다. 그렇다면 12B는 목록에서 고르는 데 낭비적인 방법이다. 그렇지 않다면 Intern-Decision-2B는 어떤 정확도로도 당신에게 도움이 될 수 없다.
입력 상한선은 그들 사이에서 가장 뚜렷한 경계선이다
여기, 다른 모든 것보다 우선해 저울질해야 할 차원이 있습니다. 왜냐하면 이는 성능 저하가 아니라 치명적 실패를 초래하기 때문입니다.
• 입력 길이 — Intern-Decision-2B는 8,192개 토큰을 허용하고 그보다 긴 입력은 요란하게 거부한다. Gemma 4 12B는 256,000개 토큰을 허용하며, Google 자체 카드에서 128k에서의 MRCR v2 eight-needle 기준 43.4%를 기록한다.
• 이미지 — Intern-Decision-2B의 경우 최대 8개까지 가능하며, 동일한 8,192토큰 예산에 포함됩니다. Gemma 4 12B는 가변 화면 비율과 해상도를 지원하며, 임의 순서로 텍스트와 이미지가 인터리브된 입력이 가능합니다.
• 입력 모달리티 — 한쪽은 텍스트와 이미지, 다른 쪽은 텍스트, 이미지, 오디오 및 비디오.
• 언어 — Intern-Decision 문서 어디에도 다국어 지원에 대한 주장은 없습니다. Gemma 4는 140개 이상의 사전 학습 언어를 지원하며, 12B 모델의 MMMLU 다국어 평가 점수는 83.4입니다.
• 출력 — 하나는 타입이 지정된 JSON 답변 분포, 다른 하나는 생성된 텍스트.
8,192 제한은 임의적이지 않으며, 바로 그 점 때문에 우회하기가 어렵습니다. 결정 목표는 각 필드에 대해 고정된 위치에서 로짓을 읽으므로, 프롬프트는 상태, 스키마, 전체 뼈대를 한 번에 포함해야 합니다. 계약을 유지하는 청킹 전략은 없습니다. 티켓 하나, 이메일 하나, 짧은 JSON 상태, 스크린샷 한두 장 — 그것이 설계 중심입니다. 검색이 필요한 문서는 이 모델이 대상으로 하지 않는 문서입니다.
각각이 당신에게 얼마나 드는지, 솔직하게 계산하면
Intern-Decision-2B는 호스팅된 엔드포인트도, 제공자도 없습니다. OrcaRouter의 해당 모델 페이지는 404를 반환하며, 이 글의 어떤 내용도 가용성 주장이 아닙니다. 이를 호출한다는 것은 약 4.46 GB의 리포지토리 — 3.76 GB 언어 샤드, 612.5 MB 비전 타워, 50.3 MB 프로젝터 — 를 다운로드하고, 가중치 옆에서 inference.py를 Python 3.12 환경, torch 2.9.1 및 transformers 5.14.1과 함께 실행하는 것을 의미하며, 결정을 채점하든 아니든 비용을 지불하고 있는 GPU에서 실행됩니다.
그것이 모든 경우에 단점인 것은 아니며, 가정하기보다는 계산을 해볼 가치가 있다. InternLM 자체 측정에서 단일 RTX 4090으로 요청당 평균 33.28ms라면, 로컬에서 호스팅한 Intern-Decision-2B는 결정당 아무 비용도 청구하지 않는다. 호스팅된 범용 모델은 답변하기 전에 생각하는 데 쓰는 토큰을 포함해 토큰당 비용을 청구한다. 대량 처리에서는 이미 보유한 스코어러가 더 저렴한 도구다 — 비용은 호출이 아니라 GPU와 엔지니어링이다.
Gemma 4 12B Unified 역시 우리 카탈로그에는 없습니다. 원한다면 BF16 파라미터 119억 6천만 개를 내려받아 직접 서빙해야 합니다. 우리 카탈로그에 실제 Gemma 4 경로가 있는 것은 나머지 두 크기이며, 가격도 저렴합니다. Gemma 4 26B A4B는 입력 토큰 100만 개당 $0.06, 출력 100만 개당 $0.33이고, Gemma 4 31B는 $0.13, $0.38이며, 둘 다 262,144토큰 컨텍스트와 카탈로그에 표시된 P50 첫 토큰 도달 시간 1.73초로 등록되어 있습니다. 문제가 폐쇄형 결정이 아니라 일반 추론이라면, 바로 그것을 로컬에서 운영하는 스코어러와 비교해야 합니다. 하나의 키로 모델 두 개를 더, 마크업 없이 그대로 전달되는 제공업체 정가, 그리고 자동 장애 조치를 제공하므로 아직 평가 중인 모델이 프로덕션 경로에서 단일 장애점이 되는 일은 없습니다.

스코어보드, 단서 조항이 붙은
• 파라미터 — Intern-Decision-2B는 BF16 기준 2,213,241,664개에 비전 타워와 프로젝터를 더한 구성이고, Gemma 4 12B Unified는 BF16 기준 11,959,730,224개입니다.
• 컨텍스트 — 8,192 토큰, 위에서 거부됨, 대 256,000 토큰.
• 출력 — 보정된 확률과 argmax, 텍스트 없음; 생성된 텍스트, 한 번에 하나의 토큰.
• 모달리티 — 텍스트 + 최대 8개 이미지 대 텍스트, 이미지, 오디오, 비디오 입력, 텍스트 출력.
• 공개된 증거 — 연구소 외부에서는 아무도 재현하지 못한, 평균 84.68, Brier 점수 0.437, ECE 0.100을 기록한 7개 스위트 벤더 표; MMLU Pro 77.2%, GPQA Diamond 78.8%, 도구 없이 AIME 2026 77.5%, LiveCodeBench v6 72.0을 기록한 Google 평가 카드, 또한 Artificial Analysis Intelligence Index 14.2에 독립적으로 등재된 항목.
• 채택 — 5월부터 양자화, 파인튜닝, 파생 모델이 수백 개에 이르는 패밀리가 유통되고 있는 것에 비해, 2B 체크포인트에서는 좋아요 1개와 다운로드 0회에 그쳤다.
증거 행들은 비대칭적으로 읽어라. 그것이 바로 그 행들의 성격이기 때문이다. Google의 수치들은 제3자에 의해 독립적으로 색인되고 재현되었다. InternLM의 수치들은 연구소 외부의 누구도 실행한 적이 없으며, 특히 보정 수치는 외부 테스트 세트를 만나기 전까지는 잘 문서화된 의도로 취급해야 한다. 정직한 요약은 벤더 표가 틀렸다는 것이 아니다. 두 열이 동일한 증거적 무게를 지니지 않는다는 점이며, 그 사실을 밝히지 않은 채 84.68 옆에 77.2를 표기하는 비교는 독자를 오도하고 있다.

이걸 어떻게 해야 할까요?
결정이 정말로 확정되어 있고, 상태가 8천 토큰 안에 여유롭게 들어가며, 해석해야 하는 문단이 아니라 임계값을 적용할 수 있는 확률을 원하고, 아직 아무도 지원하지 않는 체크포인트를 운영할 하드웨어와 의욕이 있을 때 Intern-Decision-2B를 선택하세요. 중간 크기는 특히 InternLM이 출시한 세 가지 중 공개된 보정이 가장 약합니다. ECE 0.100으로, 크기가 절반인 모델의 0.066, 거의 두 배인 모델의 0.065와 대비됩니다. 따라서 이 제품군 안에서 고른다면, 2B는 자체 temperature를 맞춰야 하는 모델이지, 그대로 믿어도 되는 모델이 아닙니다.
입력이 한 페이지보다 길 때, 오디오나 비디오 또는 영어가 아닌 언어가 관련될 때, 답을 단순히 선택하는 것이 아니라 설명해야 할 때, 또는 추론 스택을 직접 소유하고 싶지 않을 때에는 Gemma 4 12B를 선택하세요 — 또는 더 실용적으로는, 우리가 실제로 라우팅하는 두 가지 Gemma 4 크기 중 하나를 선택하세요. 12B는 네이티브 오디오를 지원하는 Gemma 4 모델 중 가장 작은 모델입니다. 26B A4B는 토큰당 약 40억 개의 매개변수를 활성화하며, 이 패밀리에 들어가는 가장 저렴한 방법입니다.
그리고 실제로 당신에게 있는 것이 긴 문서가 딸린 채점 문제라면, 이 둘 중 어느 것도 올바른 도구가 아니다. 그것은 비교 기사의 옷을 입은 검색 문제다.

