'Kolibri vs Intern-Decision 4B'라고 적힌 커다란 굵은 글씨의 히어로 타이틀 카드가 있고, 그 아래에 '보정된 확률 분포에 대조한 생성 텍스트'라고 적힌 더 작은 한 줄이 있으며, 왼쪽에는 벌새, 오른쪽에는 작은 종형 곡선 차트인 두 개의 작은 평면 선 아이콘이 나란히 있고, 그 사이는 얇은 세로 구분선으로 나뉘어 있으며, 흰색 배경에 부드러운 파란색-청록색 그라데이션 악센트가 있고 오른쪽 아래 모서리에 OrcaRouter 로고가 있습니다.
Guides & Insights

Kolibri vs Intern-Decision 4B: 하나는 문서를 작성하고, 다른 하나는 그 어떤 것도 작성하기를 거부한다

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

에 관해 가장 유용하게 눈여겨볼 점은 Kolibri와 Intern-Decision-4B이들이 같은 종류의 객체가 아니라는 것입니다. 이를 모델 대 모델 비교로 다루는 것은 범주 오류가 됩니다. Kolibri는 Aleph Alpha의 781억 파라미터 전문가 혼합 언어 모델로, 2026년 10월 3일에 공개되었으며 토큰당 34억 6천만 개의 파라미터를 활성화하고 독일어와 영어 텍스트를 씁니다. Intern-Decision-4B는 InternLM 팀의 45억 4천만 파라미터 멀티모달 구조화 의사결정 모델로, 2026년 9월 26일 Hugging Face에 업로드되었으며, 해당 카드에는 "generate()를 호출하거나 자유 형식 텍스트를 샘플링하지 않는다"고 아예 명시되어 있습니다. 하나는 산문을 만들어냅니다. 다른 하나는 사용자가 제공한 선택지들에 대한 확률 분포를 단일 순전파로 만들어내며, 문장을 작성할 능력이 전혀 없습니다. 이들은 단 하나의 좁은 상황에서만 경쟁자가 되는데, 그 상황이 정확히 무엇인지 아는 것이 두 릴리스 모두에서 가장 유용한 점입니다.

두 개의 릴리스, 완전히 다른 두 개의 간결한 주장

콜리브리의 카드는 대규모 희소 언어 모델의 사양입니다: 50개 레이어, 모든 레이어가 전문가 혼합(mixture-of-experts), 레이어당 384개의 전문가로 하나는 공유되고 여섯은 라우팅되며, 262,144 토큰의 네이티브 컨텍스트가 1,048,576까지 검증되었고, 네 가지 추론 노력 수준, vLLM 파서가 함께 제공되는 Hermes 스타일 도구 호출, 128×128 블록의 FP8 가중치, 그리고 Apache 2.0 조건. 그 훈련은 21일 동안 768대의 NVIDIA B200에서 20조 토큰을 실행했습니다 — 보고된 6.4×10²³ FLOPs로 392,000 GPU-시간, 데이터센터 오버헤드를 포함한 추정 9.5×10² MWh, 감독 미세 조정과 강화 학습은 제외. 카드의 최소 서빙 구성은 A100 80 GB 카드 2장, H100 SXM5 2장, H200 1장, B200 1장 또는 B300 1장이며, FP8 풋프린트는 약 78 GB입니다. 이는 진지한 인프라이며, 텍스트를 생성하여 질문에 답합니다.

Intern-Decision-4B는 반대 종류의 객체이며, 카드는 이에 대해 상쾌할 정도로 직설적이다. 이는 Qwen3.5-4B의 파인튜닝으로, 비전 타워와 프로젝터는 고정되고 언어 백본만 훈련된다. 상태, 명명된 질문들의 스키마, 그리고 선택적으로 최대 8개의 이미지를 입력하면, 모든 질문에 대한 후보 답변들의 분포를 한 번에 반환한다. 메커니즘은 독특하며 정확히 설명할 가치가 있다: 옵션들은 A부터 Z, a부터 z, 0부터 9까지 아우르는 단일 토큰 기호에 매핑된다 — 62개의 후보, 따라서 질문당 최대 62개의 옵션 — 프롬프트는 각 필드마다 하나의 자리 표시자로 렌더링되고, 모델은 각 자리 표시자 바로 앞 위치에서 로짓을 읽는다. Softmax는 해당 필드의 허용된 기호 로짓에만 실행되고, 체크포인트별 온도가 결과를 보정하며, 기호들은 원래 옵션 값으로 타입이 지정된 JSON으로 매핑된다. 디코딩 루프, 샘플링, 산문은 없다.

• 출력 — Kolibri: 자유롭게 생성된 독일어 또는 영어 텍스트, 도구 호출, 추론 추적. Intern-Decision-4B: 각 옵션에 대한 확률이 포함된 타입 지정 JSON 답변.

• 파라미터 — Kolibri: 총 78,103,074,560, 활성 3,457,573,120. Intern-Decision-4B: bfloat16의 네 개의 safetensors 샤드에 걸쳐 45.4억, 동결된 비전 타워 포함.

• 입력 — Kolibri: 텍스트만. Intern-Decision-4B: 텍스트와 최대 8개의 이미지.

• 질문 용량 — Intern-Decision-4B: 필드당 최대 62개 옵션, 단일 순전파에서 'choice', 'score' 및 'noul'(예/아니오) 질문 유형 지원. Kolibri: 원칙적으로 무제한, 실제로는 한 번에 토큰 하나씩.

• 언어 — Kolibri: 구조상 독일어와 영어. Intern-Decision-4B: Qwen3.5-4B가 지닌 그대로이며, 공개된 모든 평가 스위트는 영어로 되어 있습니다.

• 지연 시간 — Intern-Decision-4B: 자체 측정 기준 단일 RTX 4090에서 쿼리당 평균 44.16ms, 중앙값 44.03ms, P95 44.60ms. Kolibri: 공개된 쿼리당 수치가 전혀 없음.

• 라이선스 — 둘 다 Apache 2.0, Intern-Decision-4B는 Qwen 라이선스 파일이 함께 보존된 상태로 배포됩니다.

A two-column comparison scoreboard titled 'Kolibri vs Intern-Decision 4B'. Left column Kolibri: Output freely generated text, Parameters 78.1B MoE / 3.46B active, Input text only, Context 262,144 native / 1M validated, Latency none published, Licence Apache 2.0. Right column Intern-Decision 4B: Output typed JSON with a probability per option, Parameters 4.54B bfloat16 with a frozen vision tower, Input text plus up to eight images, Options up to 62 per field in one forward pass, Latency 44.16 ms mean on one RTX 4090, Licence Apache 2.0. A footer line reads 'Kolibri figures vendor-reported; Intern-Decision 4B figures per its model card.' with the OrcaRouter logo in the bottom-right corner.

4B 스코어러가 왜 존재하는가

Intern-Decision-4B를 지지하는 이유는 그것이 작다는 데 있지 않다. 큰 생성 모델에 확률을 물어보는 것은 그 확률을 측정하는 것과 같지 않으며, 그 차이는 측정 가능하다는 데 있다.

카드 자체의 벤치마크 표는 이례적으로 많은 자기 공개를 통해 그 주장을 펼친다. 일곱 개의 정확도 스위트에서 Intern-Decision-4B는 평균 90.02를 기록한다 — 자신이 비교 대상으로 삼은 가장 강력한 기준선인 Jev의 88.74와 대비된다. 그러나 정확도는 흥미롭지 않은 절반에 불과하다. 이 표는 브라이어 점수와 기대 캘리브레이션 오차도 보고하는데, 그 지점에서 그림은 더 엄격해진다. 4B는 브라이어 0.347과 ECE 0.065를 기록한 반면, Jev는 0.358과 0.095다. 캘리브레이션 이야기가 진정으로 유익해지는 곳은 더 작은 형제 모델들이다. Intern-Decision-2B는 평균 84.68점으로 79.38점의 0.8B를 크게 앞선다 — 그런데도 ECE 0.100은 0.8B의 0.066보다 나쁘고 4B의 0.065보다도 나쁘며, 브라이어는 0.437로 0.8B의 0.530과 대비된다. 두 소형 모델 중 더 정확한 쪽이 자신의 확신에 관해서는 가장 정직하지 않다. 캘리브레이션이 정확도와 함께, 또는 파라미터 수와 함께 개선된다고 가정했다면, 그 표는 두 측면 모두에서 반례다.

두 번째, 별도의 진단은 샘플링된 하드 레이블이 아닌 정확한 참조 분포로 구축된 96개 사례를 다룹니다 — 무작위 추출, 구성된 사건, 조건부 이력, 확률 퍼즐. 해당 파일럿에서 4B 모델의 오류는 보고된 지표에서 0.628에서 0.550으로 감소한 반면, 비교 모델은 0.595에 머물렀습니다. 카드에는 이 파일럿이 공개된 온도를 맞추거나 선택하는 데 사용되지 않았다고 명시되어 있습니다. 4B의 온도 1.992418은 보정 세트에서 별도로 맞춰졌습니다. InternLM 팀은 또한 벤치마크 자체를 GitHub 저장소에 공개했습니다 — 결정적 생성기, 레퍼런스 및 오프라인 스코어러 — 이는 보정 주장이 제3자가 믿음으로 받아들이기보다 실제로 다시 실행할 수 있는 드문 종류임을 의미합니다.

Kolibri의 릴리스에는 이에 상응하는 것이 전혀 없습니다. 그 비교 표는 단일 벤더 하네스에서 14개 모델의 작업 정확도를 보고하며, 정확도야말로 생성 모델을 측정할 수 있는 기준입니다. 자료 어디에도 캘리브레이션 수치도, Brier나 ECE도 없으며, 문장을 샘플링해 읽는 과정을 거치지 않고서는 "이 계약 조항이 집행 가능할 확률"을 묻는 방법도 없습니다.

그들이 실제로 만나는 단 하나의 이음새

두 가지를 실제 파이프라인에 나란히 놓으면 윤곽이 분명해진다. 독일어 문서 워크플로에는 두 절반이 모두 필요하며, 어느 도구도 다른 쪽의 절반을 담당하지 않는다.

Kolibri는 읽고 쓰는 쪽입니다. 독일어 계약서나 기술 문서를 다루는 팀은 262,144토큰 네이티브 윈도우, FP8 KV 캐시, Aleph Alpha가 독일어 웹 텍스트에서 토큰당 평균 4.90바이트라고 보고한 이중 언어 토크나이저, 그리고 Hermes 도구 호출을 얻습니다. 즉, 서류를 요약하고, 답변 초안을 작성하고, 도구 루프를 구동할 수 있는 모델입니다. 이것이 할 수 없는 것은 감사할 수 있는 방식으로 자신의 신뢰도를 알려주는 것입니다. 왜냐하면 이것이 내보내는 모든 것은 샘플링된 문자열이기 때문입니다.

Intern-Decision-4B는 결정을 내리는 절반이다. 독일어 텍스트 한 페이지와 고정된 선택지 집합이 주어지면, 이 모델은 소비자용 GPU 한 대에서 44밀리초 만에 보정된 분포를 반환하며, 생성 단계가 없으므로 샘플링 분산이 전혀 없다. 이 모델이 할 수 없는 것은 독일어 텍스트를 애초에 생성하는 일이며, 공개된 평가 스위트는 영어로 되어 있다. 그 독일어 동작은 훈련된 것이 아니라 Qwen3.5-4B 베이스에서 물려받은 것으로, 이는 독일어 배포에 있어 실질적인 한계이자 아무도 평가하지 않은 한계다.

그래서 규제를 받는 독일어 워크플로에 대한 정직한 엔지니어링 답은, 이것들이 하나의 슬롯을 두고 겨루는 두 후보가 아니라 하나의 파이프라인의 두 단계라는 것입니다. 실질적인 질문은 각각이 어디에서 실행되느냐입니다. Kolibri는 H100 두 장 또는 B200 한 장과 약 78GB가 필요합니다. Intern-Decision-4B는 RTX 4090 한 장이면 되고 쿼리를 45밀리초 이내에 처리합니다. 하드웨어에서의 비용 비대칭성은 대략 100배 수준이며, 이는 작은 스코어러가 모든 케이스에서 지속적으로 실행되고 대형 생성기는 케이스가 실제로 산문을 필요로 할 때만 호출되는 설계를 가리킵니다. 이는 모든 케이스를 78B 모델로 라우팅해서 그다음 해석해야 하는 답을 얻는 것보다 더 저렴하고 감사에 더 친화적인 형태입니다.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the card header, the description of it as a multimodal structured decision model fine-tuned from Qwen3.5-4B that returns an answer distribution in one forward pass, and the numbered 'How inference works' steps mapping each question's options to single-token symbols.

둘 모두의 실제 호스팅 환경, 그리고 레이어의 목적

두 모델 모두 호스팅 API로는 사용할 수 없으며, 우리는 추정하지 않고 직접 확인했다. Intern-Decision-4B에는 벤더 엔드포인트가 없다. 이번 릴리스는 가중치, GitHub 저장소, Hugging Face Space뿐이다. 다운로드 수와 좋아요 수는 주중 이후 변동이 있었는데, 이는 사람들이 이를 채택하고 있다는 뜻이지만, 우리가 이름을 댈 만한 유료 호출 경로는 여전히 어디에도 없다.

Kolibri 역시 Aleph Alpha API SKU가 없습니다 — 이번 릴리스는 가중치, 기술 보고서, 그리고 ghcr.io/aleph-alpha/aleph-alpha-inference에 있는 컨테이너 이미지입니다. 또한 OrcaRouter에는 없습니다: 우리는 벤더 접두사와 모델 이름의 모든 철자로 카탈로그를 조회했고 찾을 수 없음이 반환되는데, 이는 그렇지 않은 듯 암시하기보다 차라리 있는 그대로 말하고자 하는 것입니다.

여기서 라우팅 계층이 바꾸는 것은 이 두 모델에 대한 접근이 아니라, 둘 중 어느 쪽을 위해 하드웨어를 살지 결정하는 경제성이다. 생성 쪽 절반에 대한 정직한 구매 전 테스트는, 이미 라우팅된 소규모 전문가 혼합(MoE) 티어 — 입력 토큰 100만 개당 $0.06, 출력 토큰 100만 개당 $0.33, 262,144토큰 창과 텍스트, 이미지, 비디오 입력을 갖춘 Gemma 4 26B-A4B 변형 — 에 대해 OpenAI 호환 키 하나로 제공자의 정가로 아무것도 추가하지 않고 워크로드를 실행해 보고, GPU를 주문하기 전에 독일어 문서 워크로드가 정말로 780억 개 매개변수를 필요로 하는지 확인해 보는 것이다. 결정 쪽 절반에는 그런 지름길이 없다. 왜냐하면 보정된 분포 동작이 바로 이 모델의 핵심이고, 어떤 라우팅된 티어도 그것을 해내지 못하기 때문이다. 하지만 그것 자체가 발견이다. 즉, 4B 스코어러는 진정으로 셀프 호스팅하게 될 부분이고, 생성기는 오늘 오후에 빌릴 수 있는 무언가를 상대로 다시 테스트해 볼 가치가 있는 부분이라는 것을 알려준다.

무엇이 그것을 해결할까요?

두 가지 측정, 그리고 둘 다 아직 존재하지 않는다.

첫 번째는 독일어 입력에 대한 Intern-Decision-4B입니다. 공개된 모든 평가 스위트는 영어이고 이 모델은 다국어 베이스를 파인튜닝한 것이므로, 독일어 캘리브레이션은 알 수 없습니다 — 그리고 캘리브레이션은 바로 언어 간에 공짜로 전이되지 않는 속성입니다. 96개 사례 분포 파일럿의 독일어 버전은 이 모델에 관해 누구든 공개할 수 있는 가장 정보가 풍부한 단일 산출물이 될 것입니다.

두 번째는 결정당 Kolibri 비용이다. 그 서빙 경제성 주장은 GPU당 초당 디코딩 토큰 수에 대비한 품질의 파레토 프런티어이며, Kolibri에 대한 Artificial Analysis 페이지도 없고 하네스에 대한 제3자 재현도 없다. 누군가 그것을 실행하기 전까지 "780억 개 매개변수"는 비용이라기보다 사양이고, 그 앞에 44밀리초 스코어러를 유지해야 한다는 근거는 측정된 논거라기보다 설계 논거로 남는다.

그때까지, 이 조합을 읽는 올바른 방식은 대결 구도로 보는 것이 아니다. Intern-Decision-4B는 둘 중 기술적으로 더 흥미로운 릴리스다. 캘리브레이션을 인식하는 구조화 출력은 거의 어떤 생성 모델도 제공하지 않는 기능이며, 그 모델 카드를 통해 해당 주장을 확인할 수 있기 때문이다. Kolibri는 더 파급력 있는 릴리스다. 유럽의 한 연구소가 데이터 파이프라인까지 함께 공개하면서 780억 개 파라미터의 Apache 2.0 모델을 내놓는 것은 모델 이벤트라기보다 공급망 이벤트이기 때문이다. 어느 쪽도 다른 쪽을 대체하지 않는다. 둘 다 필요한 팀은 두 가지 모두를 계획에 넣고 그에 맞게 하드웨어 규모를 산정해야 하며, 실제 엔지니어링 노력이 들어가는 곳은 이들을 둘러싼 하네스다.

A screenshot of the InternLM 'Intern Large Models' organisation page on Hugging Face, showing the organisation header, its stated affiliation with Shanghai AI Laboratory, and a recent-activity feed listing models published within the last hour.