'Intern-Decision-0.8B vs Gemma 4 12B'라고 적힌 히어로 타이틀 카드, 부제는 '하나는 답을 쓰고, 다른 하나는 점수를 매긴다', 배지로는 '0.8B 스코어링 헤드, 출력 토큰 없음'과 '11.95B 멀티모달 제너럴리스트'를 달고 있으며, 모서리에는 OrcaRouter 로고가 합성되어 있다.
Guides & Insights

Intern-Decision-0.8B vs Gemma 4 12B: 멀티모달 제너럴리스트에 맞선 스코어링 헤드

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Intern-Decision-0.8B가 무엇인지 — 그리고 무엇이 아닌지 — 를 가장 저렴하게 확인하는 방법은 Gemma 4 12B 옆에 놓아 보고, 그 비교가 거의 전적으로 각 모델이 출력 계층에서 무엇을 하는지에 관한 것임을 알아차리는 것이다. Gemma 4 12B는 2026년 6월 3일 Apache 2.0으로 공개된 DeepMind의 119억 5천만 파라미터 인코더 없는 멀티모달 모델로, 생성형 제너럴리스트다: 텍스트, 이미지, 오디오 또는 비디오를 주면 답을 쓴다. Intern-Decision-0.8B는 2026년 9월 26일 InternLM이 별도 발표 없이 Hugging Face에 조용히 업로드한 것으로, 훨씬 더 작은 Qwen3.5-0.8B를 파인튜닝한 모델이며 텍스트를 전혀 생성하지 않는다 — 상태, 이름 붙은 질문들의 스키마, 최대 8개의 이미지를 입력받아 단일 순전파 후 각 질문에 대해 보정된 확률 분포를 반환한다. 하나는 쓴다. 다른 하나는 점수를 매긴다. 아래의 모든 내용은 여기에서 따라 나온다.

그래서 이것을 경쟁으로 규정하는 것은 이상한 맞대결이 되며, 스펙 항목들 앞에서 분명히 말해 둘 가치가 있습니다: 이 둘은 대체재가 아니며, 이 둘 사이에서 선택하는 사람은 이미 문제를 잘못 제기한 것입니다. Gemma 4 12B는 "응답이 무엇이어야 하는가"라는 질문에 답합니다. Intern-Decision-0.8B는 "이 열여섯 가지 선택지 중 어느 것인가, 그리고 얼마나 확신하는가"라는 질문에 답합니다 — 그리고 디코더 루프 없이 답하는데, 지연 시간과 비용 차이는 바로 여기서 비롯됩니다. 따라서 유용한 비교는 어느 쪽이 이기는가가 아니라, 각각을 하나의 워크플로에 어떻게 연결할 것인가에 관한 것입니다.

가장 큰 단일 차이는 청구서의 출력 측면입니다

Gemma 4 12B는 여느 생성 모델과 마찬가지로 입력 토큰과 출력 토큰 모두에 대해 과금됩니다. 구조화된 JSON을 요청하면, 그 토큰 하나하나가 생성되고 샘플링되며 과금됩니다. 스키마가 길고 중첩될수록 토큰은 더 많아집니다. 이것은 모델에 대한 비판이 아닙니다 — 디코더가 하는 일이 그렇다는 것뿐입니다 — 하지만 결정 헤드가 제거하기 위해 존재하는 바로 그 항목입니다. Intern-Decision-0.8B에는 출력 토큰이 없습니다. 그 카드는 이유를 명확히 밝힙니다. 추론 경로는 결코 호출하지 않습니다: generate(), 미리 렌더링된 스켈레톤에서 각 <decision> 플레이스홀더 바로 앞 위치의 로짓을 읽고, 해당 필드에 허용된 후보 심볼에 대해서만 소프트맥스를 취합니다. 사용량 카운터인 output_tokens는 텍스트가 아니라 채점된 필드를 셉니다.

그 결과는 규모가 커질수록 증폭됩니다. Gemma 4 12B로 만 개의 레코드에 레이블을 지정하는 파이프라인은 만 개의 JSON 문서 비용을 지불합니다. 동일한 파이프라인을 Intern-Decision-0.8B에서 사용하면 프롬프트 비용만 지불하고 그 외에는 아무것도 지불하지 않습니다. 절대적인 숫자가 큰지는 전적으로 여러분의 볼륨과 스키마에 달려 있으며, 토큰당 예산을 가진 사람이라면 누구나 스프레드시트에서 10분 만에 계산해 낼 수 있습니다. 하지만 방향성은 이견의 여지가 없으며, 이것이 바로 소형 결정 모델이라는 범주가 아예 등장한 이유입니다.

레이턴시, 그리고 파라미터 격차가 왜 오해의 소지가 있는지

• 처리량 모델 — Intern-Decision-0.8B: 단일 순전파, 디코딩 루프 없음. Gemma 4 12B: 자기회귀 생성, 한 번에 토큰 하나씩.

• 측정된 지연 시간 — Intern-Decision-0.8B: 단일 RTX 4090에서 로컬 Hugging Face 경로를 통해 평균 33.98ms / p95 37.50ms, InternLM 자체 측정 기준. Gemma 4 12B: 측정할 단일 패스 자체가 없으므로 비교 가능한 단일 패스 수치는 존재하지 않습니다.

• 풋프린트 — Intern-Decision-0.8B: 약 1.73GB의 리포지토리 저장 공간, 1.50GB 언어 샤드, 176MB 비전 샤드, 25MB 프로젝터 전반에 걸쳐 852,985,920개 파라미터. Gemma 4 12B: Google의 출시 자료에서는 이를 16GB의 VRAM 또는 통합 메모리로 제시합니다.

• 출력 결정성 — Intern-Decision-0.8B: 후보 로짓에 대한 argmax이므로 동일한 입력은 매번 동일한 레이블을 산출합니다. Gemma 4 12B: 온도를 0으로 고정하지 않는 한 샘플링을 수행하며, 그렇게 하더라도 레이블은 파싱해야 하는 텍스트로 도착합니다.

이 두 모델 사이의 14배 파라미터 격차는 의사 결정 작업에서 14배 런타임 격차로 이어지지 않습니다. 작업의 성격이 다르기 때문입니다. Intern-Decision-0.8B는 한 번의 패스를 프롬프트 — 상태, 스키마, 옵션 설명 — 를 읽는 데 쓰고, 그다음 멈춥니다. Gemma 4 12B는 동일한 프롬프트 읽기를 수행한 다음, 그 위에 답변의 모든 토큰을 추가합니다. 설명형 옵션 라벨이 있는 16개 필드 스키마의 경우, 생성 단계는 반올림 오차가 아니라 전체 실제 시간의 대부분입니다. InternLM 자체 표는 이 점을 우연히 보여줍니다. 2B 형제 모델은 평균 33.28ms를 기록해 0.8B의 33.98ms보다 약간 더 빠릅니다. 프롬프트 처리가 지배적일 때, 파라미터 수는 더 이상 지렛대가 되지 않습니다. img src="2.png">

A two-column scoreboard comparing Intern-Decision-0.8B with Gemma 4 12B on six shared rows: parameters 852,985,920 against 11.95B, output tokens none because logits are read rather than generated against every token generated and billed, latency 33.98 ms mean and 37.50 ms p95 against no comparable single-pass figure, input surface text plus up to eight images under an 8,192-token ceiling against text, image, audio and video with a 256K context, published evidence a vendor table unreproduced against Google's own evaluation card, and licence Apache 2.0 plus LICENSE-QWEN against Apache 2.0 under Gemma 4 terms.

Gemma 4 12B가 그저 차원이 다른 경우

스펙 시트를 결정 과제 프레이밍에만 머물게 하는 것은 정직하지 않다. 왜냐하면 그 프레이밍 밖에서 Gemma 4 12B는 단지 앞서 있는 것이 아니라 — 다른 종목을 하고 있기 때문이다.

Intern-Decision-0.8B는 텍스트와 최대 8개의 이미지를 입력으로 받으며, 이것이 입력 표면의 전부입니다. 기본 입력 상한은 8,192 토큰이며, 잘리는 대신 거부되고, 이는 구성에서 광고하는 262,144 최대 위치 임베딩보다 훨씬 낮습니다 — 아키텍처가 아니라 상한이 실제 창입니다. Gemma 4 12B는 원시 패치와 파형을 임베딩 공간에 직접 투영하는 인코더 없는 설계를 통해 텍스트, 이미지, 오디오 및 비디오를 기본적으로 받아들이고, 256K 컨텍스트 창을 유지하며, 텍스트를 반환합니다. Google이 공개한 카드에 따르면 MMLU Pro에서 77.2%, 도구 없이 AIME 2026에서 77.5%, LiveCodeBench v6에서 72.0%, GPQA Diamond에서 78.8%, MMMU Pro에서 69.1%, MATH-Vision에서 79.7%를 기록했습니다. 이는 Google 자체 평가 카드의 벤더 수치이며, Intern-Decision-0.8B의 표와 달리 1년간의 타사 사용이 뒷받침되어 있습니다. 왜냐하면 Gemma 4는 첫날부터 생태계 — LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth — 에 출시되었기 때문입니다.

이 릴리스들도 서로 전혀 닮지 않았으며, 그 대비는 시사하는 바가 크다. Gemma 4 12B는 등장한 날 출시 블로그, arXiv 기술 보고서, 5개 모델 패밀리 페이지, 평가 카드, 다운로드 링크를 갖추고 있었다. Intern-Decision-0.8B는 404를 반환하는 GitHub URL과 401을 반환하는 데모 Space가 있는 모델 카드가 있었고, 똑같이 문서화되지 않은 두 개의 더 큰 형제 모델이 등장한 지 40초 이내에 나타났다. 이들 중 하나는 제품이다. 다른 하나는 누군가 인터넷에 올리기로 결정한 체크포인트다.

둘 다 Apache 2.0이며, 그것은 사소한 공유 행이 아닙니다.

이 둘이 진정으로 맞닿는 단 하나의 지점은 라이선스이며, 상업적 사용자에게는 바로 이 지점에서 결정이 달라지기 때문에 한 문단을 할애할 가치가 있습니다. 둘 다 Apache 2.0입니다. Gemma 4 12B는 Google에서 호스팅하는 Gemma 4 라이선스 조건에 따라 배포되며, 모델 카드에서는 이를 Apache 2.0으로 명시하고 있습니다. Intern-Decision-0.8B는 Apache-2.0과 함께 두 번째 LICENSE-QWEN/ 파일을 포함하는데, 이는 Qwen 가중치에서 파생된 모델에 대한 올바른 처리 방식이며, InternLM이 공식 발표하지 않은 릴리스에 대해서까지 서류 작업을 제대로 해냈다는 신호입니다.

이는 리퀴드 AI의 LFM2.5 제품군과 두 모델 모두를 구별해 줍니다. LFM2.5 제품군의 LFM Open License v1.0은 귀하의 법인이 연간 매출 1,000만 달러 기준 아래에 머무를 것을 상업적 권리의 조건으로 삼습니다. 이는 옵션을 비교하는 의사결정 모델 구매자가 "오픈 웨이트"가 어디서나 같은 의미라고 가정하기 전에 반드시 읽어야 할 실제 제약입니다. 귀하의 사용 사례가 상업적이고 매출이 그 기준을 넘는다면, Apache 2.0과 LFM 라이선스는 서로 바꿔 쓸 수 없으며, Gemma 4 12B와 Intern-Decision-0.8B 중 어느 것도 그 제한을 적용받지 않습니다.

Intern-Decision-0.8B의 수치에 관한 솔직한 기록

Intern-Decision-0.8B의 모든 성능 수치는 벤더가 보고한 것이며 재현된 바 없습니다. 이는 형식적인 문제가 아닙니다 — 그것이 현재 증거의 상태이며, 이 표가 어느 정도의 비중을 가져야 하는지를 좌우해야 합니다. InternLM은 벤치마크를 선정하고, 경쟁 모델을 선정하고, 평가를 수행하고, 결과를 발표했으며, 어떤 공개 리더보드에도 독립적인 실행 결과가 존재하지 않습니다. 이 모델에 대한 Artificial Analysis 조회는 아무것도 반환하지 않습니다. img src="3.png">

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

그 라벨이 붙어 있어도 결과의 형태는 여전히 시사하는 바가 있다. 0.8B는 TypeSafe의 Typed Decision 벤치마크에서 77.35를 기록해, 벤치마크가 이름을 딴 모델인 Jev 1.13의 73.35를 앞서고, ToolACE에서는 94.52로 91.29를 앞선다. 전체 스위트 평균은 79.38이며, 자체 2B와 4B 형제 모델은 각각 84.68과 90.02를 기록한다. 구매자를 주저하게 만들 만한 항목은 WildJailBreak로, 여기서는 64.48을 기록해 Jev의 96.29에 맞선다. 그 정도 크기의 거부 견고성 격차는 파인튜닝의 속성이며, 그것이 Qwen3.5-0.8B 베이스에서 비롯된 것인지, 결정 튜닝 목표에서 비롯된 것인지, 아니면 파라미터 수에서 비롯된 것인지는 어디에도 문서화되어 있지 않다. 더 흥미롭게 읽히는 것은 캘리브레이션 프로필이다. Brier는 0.530, 기대 캘리브레이션 오차는 0.066인데, Jev는 각각 0.358과 0.095다. 즉 전반적으로 정확도는 더 낮지만, 제시하는 신뢰도가 정확도를 더 밀접하게 따라간다는 뜻이다. 임계값 기반 워크플로에서는 그러한 구분이 원시 정확도보다 더 중요하며, 이는 InternLM이 공개할 유인이 없었던 종류의 정보다.

그에 반해 Gemma 4 12B의 결과 역시 벤더 보고입니다 — Google도 그 벤치마크를 실행했으니까요 — 하지만 그것은 6월부터 세상에 나와 있었고, 모든 주요 로컬 런타임을 통해 배포되었으며, 어떤 불일치가 있었더라도 드러났을 것입니다. "일주일 동안 재현되지 않음"과 "네 달 동안 재현되지 않았는데 아무도 반박하지 않음" 사이의 재현성 격차가 바로 이 두 열의 진짜 차이입니다.

실제로 그것들을 어떻게 결합하게 되는지

합리적인 패턴은 선택의 문제가 아니다. 결정 헤드는 구조화된 호출 — 라우팅, 트리아지, 분류, 루브릭 기준 채점 — 을 처리하며, 여기서는 답변 집합이 닫혀 있고 지연 시간이 중요하며 출력 토큰은 순전한 오버헤드다. 범용 모델은 산문, 코드, 종합 또는 긴 컨텍스트가 필요한 모든 것 — 에스컬레이션 요약, 티켓이 청구로 간 이유에 대한 설명, 사람이 편집하는 초안 — 을 처리한다.

경계가 어디에 있는지 파악하고 있다면, 가장 저렴한 실험은 두 절반을 하나의 엔드포인트 뒤에 두는 것입니다. OrcaRouter는 자동 페일오버와 제공업체 정가의 무마진 그대로 전달을 갖춘 단일 OpenAI 호환 API를 통해 200개 이상의 모델을 라우팅합니다, 즉 호스팅된 의사결정 모델과 호스팅된 범용 모델을 같은 스크립트에서 테스트하는 데 키 하나와 오후 한 나절이면 충분하다는 뜻입니다. 여기서 한 가지 경계는 정확히 짚고 넘어갈 가치가 있습니다. Intern-Decision-0.8B는 저희 모델이 아닙니다. 그것은 직접 다운로드해서 실행하는 Apache-2.0 체크포인트이며, 1.73 GB 모델을 선택하는 이유는 바로 그것이 여러분의 데이터가 이미 있는 곳에 자리하기 때문입니다. 이 패턴의 생성 절반은 한 줄만 더 쓰면 되는 부분입니다. 특히 Gemma 4 12B의 경우, 그것도 저희 카탈로그에 없습니다. 저희가 라우팅하는 Gemma 4 크기는 31B와 26B A4B이며, 12B는 로컬 다운로드입니다. img src="4.png">

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

그렇다면 평결은 승자가 아니다. Intern-Decision-0.8B는 아직 자신을 설명하지 않은 연구소에서 나온 저렴하고 빠르며 결정론적인 스코어링 헤드로, 아무도 재현하지 않은 벤치마크 표와, 신뢰할 수 없는 입력 근처에 가기 전에 테스트해야 하는 거부 견고성 열을 갖고 있다. Gemma 4 12B는 공개된 카드, 기술 보고서, 그리고 14배 많은 파라미터를 갖춘 성숙한 오픈 웨이트 멀티모달 제너럴리스트이며, 16개 필드 분류 호출에는 잘못된 도구다 — 더 나빠서가 아니라, 이미 답변 집합을 적어 둔 질문에 대한 답을 생성하는 것이 레이블을 얻는 값비싼 방법이기 때문이다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트