
콜리브리 vs Gemma 4 12B: 780억 개의 매개변수 대 12개, 그리고 그중 단 하나만 점수를 가지고 있다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 218 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Kolibri와 Gemma 4 12B는 오픈 웨이트 공개 모델이라면 보통 동등한 조건에서 비교할 수 없는 스펙트럼의 양 극단에 있습니다. Aleph Alpha의 Kolibri는 2026년 10월 3일에 공개되었습니다. 총 781억 개의 파라미터, 토큰당 34억 6천만 개의 활성 파라미터, 검증된 1,048,576토큰 컨텍스트 윈도우, 독일어와 영어만 지원, Apache 2.0. Gemma 4 12B는 2026년 6월 3일에 공개되었습니다. 119억 5천만 개의 덴스 파라미터, 262,144토큰 컨텍스트 윈도우, 텍스트·이미지·오디오·비디오 입력, Apache 2.0. 둘 중 하나는 독립적이고 공개적으로 재현 가능한 점수를 가지고 있습니다. 다른 하나는 벤더 벤치마크 표를 가지고 있습니다. 이 비대칭성은 이 비교에서 각주가 아닙니다. 바로 이 비교 그 자체입니다. 왜냐하면 구매자가 신경 쓰는 나머지 모든 것, 즉 작업당 비용, 와트당 품질, 그리고 여러분의 문서에서 작동할지 여부가 모두 이 비대칭성을 통과하기 때문입니다.
우리는 이 맞대결의 구도에 대해서도 똑같이 직설적으로 말해야 합니다. 78B 모델과 12B 모델을 맞붙여 놓은 헤드라인은 잘못된 결론을 불러오기 때문입니다. 이들은 경쟁자가 아닙니다. 하나는 고객이 소유한 랙에서 독일 공공 부문 및 산업 문서 작업을 겨냥한 78 GB 배포이고, 다른 하나는 노트북에서 실행되며 14의 독립 지수를 갖춘 120억 매개변수 통합 멀티모달 모델입니다. 다음은 각각이 실제로 무엇을 위한 것인지, 발표된 숫자로 이들을 어디까지 순위 매길 수 있고 어디서는 매길 수 없는지, 그리고 독립 점수가 없을 때 어떤 비용을 치르는지에 대한 설명입니다.
여기서 믿을 수 있는 단 하나의 숫자, 그리고 믿을 수 없는 단 하나의 숫자
Artificial Analysis가 Gemma 4 12B를 추론 구성에서 측정했습니다. 그들의 모델 페이지에 게시된 결과를 토대로 삼아야 합니다:
• 지능 — Artificial Analysis Intelligence Index 14로, 해당 비교에 포함된 142개 모델 중 #21위에 해당하는 최상위 클래스 구간에 위치하며, 동급 모델의 중앙값은 8입니다.
• 속도 — 초당 112.5 출력 토큰, 속도 뷰에서 142개 중 21위이며, 동급 모델의 중앙값인 91토큰을 상회합니다.
• 가격 — 백만 입력 토큰당 $0.10, 백만 출력 토큰당 $0.30이며, 비슷한 규모와 등급의 모델에서 중간값이 $0.03과 $0.15인 것과 비교할 때 그들의 페이지에서는 다소 비싸다고 표시하고 있습니다.
• 사양 — 262,144토큰 컨텍스트, 총 120억 개 파라미터, Apache 2.0, 텍스트·이미지·음성·영상 입력, 텍스트 출력.
Artificial Analysis의 자체 요약 평결은 리더보드 페이지치고는 이례적으로 직설적이며, 다시 언급할 가치가 있다: Gemma 4 12B는 지능 면에서 선도적인 모델 중 하나이지만, 비슷한 크기의 다른 오픈웨이트 모델과 비교하면 다소 비싸다. 이는 어느 벤더와도 이해관계가 없는 제3자가 내린, 실제적이고 독립적이며 재현 가능한 평가다.
Kolibri에는 그에 상응하는 것이 없다. 이를 위한 Artificial Analysis 모델 페이지가 없고, 이 글을 쓰는 시점까지 제3자가 평가 스위트를 재현한 사례도 없다. 존재하는 것은 Aleph Alpha 자체 비교표뿐이며, 그 표에서 Kolibri는 태스크 스위트 전반에서 영어 평균 75.5, 독일어 평균 70.8을 기록한다. 이는 벤더가 고른 벤치마크 조합에 대해, 벤더가 작성한 하네스에서, reasoning effort high로 산출한 비가중 백분율 평균이다. 이것들은 Intelligence Index가 아니며, 두 숫자는 서로 변환되거나 나란히 놓일 수 없다. “Kolibri 75.5 대 Gemma 14”를 순위로 제시하는 사람은 한 척도의 백분율과 다른 척도의 점수를 비교하고 있는 것이다. 정직한 입장은 Gemma 4 12B의 품질은 측정된 것이고 Kolibri의 품질은 주장된 것이라는 점이다.
벤더 표가 실제로 가능하게 하는 것은 행을 가로질러 읽는 것이다. 12B의 형제 격인 구글 자체 전문가 혼합(MoE) 모델인 Gemma 4 26B-A4B IT는 Aleph Alpha의 표에서 영어 71.9, 독일어 66.3으로 나타나며, 둘 모두에서 Kolibri보다 낮다. 그것이 이용 가능한 교차 검증에 가장 가까운 것이며, 동일한 주의사항이 따른다: 벤더 하네스, 벤더 수치. 그것은 약한 신호일 뿐, 증거는 아니다.

Dense 12B와 sparse 78B의 맞대결은 겉보기처럼 미스매치는 아니다
실제로 토큰당 무엇이 계산되는지를 따져 보면, 아키텍처 격차는 파라미터 격차보다 더 큽니다.
• 토큰당 연산량 — Gemma 4 12B는 토큰마다 119억 5천만 개의 파라미터를 모두 활성화합니다. Kolibri는 자체 78,103,074,560개 중 3,457,573,120개를 활성화합니다. 이는 모델의 약 22분의 1에 해당하며, 384개 중 레이어당 공유 전문가 1개와 라우팅된 전문가 6개를 사용합니다.
• 메모리 — 트레이드오프는 반대 방향으로 작동하며, 그것은 혹독하다. bfloat16의 Gemma 4 12B는 가중치가 약 24GB 규모다. Kolibri의 카드에서는 FP8 가중치를 대략 78GB로 제시하며, 최소 두 장의 A100 80GB 카드, 두 대의 H100 SXM5, 한 대의 H200, 한 대의 B200 또는 한 대의 B300이 필요하다.
• 주의 — Gemma 4는 로컬 슬라이딩 윈도우 어텐션과 완전 전역 어텐션의 하이브리드를 사용하며, 마지막 레이어는 항상 전역입니다. Kolibri는 50개의 올-MoE 레이어에 걸쳐 4:1 슬라이딩 윈도우 대 그룹화된 쿼리 분할을 사용합니다.
• 컨텍스트 — Gemma 4 12B의 경우 262,144 토큰; Kolibri는 네이티브 262,144이며, 위치 스케일링 없이 1,048,576까지 검증되었습니다.
그래서 "78B 대 12B"를 솔직하게 정리하면, Kolibri는 활성화 비용에서는 이기고 가중치 메모리 점유량에서는 지며, 어느 쪽 이점도 공짜가 아니다. 토큰당 34억 6천만 개의 매개변수를 활성화하는 희소 모델도 780억 개 전부를 메모리에 올려야 하므로, 배포 최소 사양은 소비자용 카드 한 장이 아니라 80 GB 가속기 두 장이다. Gemma 4 12B는 반대의 트레이드오프를 택한다. 모델의 더 큰 비중이 매 토큰마다 활성화되지만, 개인이 구매할 수 있는 하드웨어에 들어간다.
Kolibri 쪽에는 독일어 특유의 변수가 하나 있는데, 이는 순위가 아니라 계산 자체를 바꿉니다. Kolibri의 토크나이저는 독일어 웹 텍스트에서 토큰당 평균 4.90바이트를 기록하는데, Aleph Alpha 자체 측정에 따르면 Gemini는 4.13, Qwen3.5–3.8 계열은 4.17, GPT-5는 4.35입니다. 독일어 문서당 토큰 수가 더 적다는 것은 추론 비용의 직접적인 절감이며, 수백만 건 규모의 독일어 행정 텍스트를 처리하는 워크로드에서는 그 효과가 몇 포인트의 지표 점수보다 더 가치 있을 수 있습니다. 또한 이는 전적으로 벤더가 보고한 수치입니다.

각각이 실제로 볼 수 있는 것
여기서부터 이 대결은 더 이상 접전이 아니게 되는데, 이는 품질 주장이 아니라 명세상의 사실이다. Gemma 4 12B는 통합 멀티모달 모델이다. 모델 카드에는 인코더 없는 아키텍처가 설명되어 있는데, 이 아키텍처는 원시 이미지 패치와 오디오 파형을 언어 모델의 임베딩 공간에 직접 투영하며, 텍스트, 이미지, 음성, 비디오를 입력으로 받고 텍스트를 출력한다. 별도의 인코더를 프로비저닝할 필요 없이 소비자 기기에서 실행되도록 만들어졌다.
Kolibri는 두 언어의 텍스트를 읽으며, 그 외에는 아무것도 하지 않습니다. Aleph Alpha는 이를 의도적으로 넓이보다 깊이로 규정합니다: 광범위한 다국어 혼합보다는, 철저히 선별된 두 언어입니다. 비전 타워도, 오디오 경로도, 비디오도 없습니다. 워크로드에 스캔된 양식, 녹음된 통화 또는 장비 사진이 포함된다면, 벤치마크 결과가 무엇을 말하든 Gemma 4 12B가 후보이고 Kolibri는 아닙니다. 만약 귀하의 워크로드가 건물을 절대 떠나서는 안 되는 독일어 및 영어 문서의 코퍼스라면, 그 반대가 더 사실에 가깝습니다 — 하지만 "건물을 떠나지 않는다"는 요구 사항은 Gemma 4 12B도 충족한다는 점에 유의하세요. 가중치가 Apache 2.0이고 다운로드 가능하기 때문입니다.
어느 것이 더 저렴한지는 무엇을 사는지에 달려 있다
두 모델은 서로 환산되지 않는 통화로 가격이 책정되어 있다. Gemma 4 12B에는 시장 가격이 있다: Artificial Analysis가 여러 제공업체를 가로질러 측정한 기준으로 백만 토큰당 $0.10 및 $0.30이며, 라우팅된 엔드포인트의 MoE 티어에서는 더 저렴하다. Kolibri에는 가격 자체가 없다. Aleph Alpha가 이에 대한 추론을 판매하지 않기 때문이다 — 이번 공개는 가중치, 기술 보고서, 모델 카드로 구성된다.
• 호스팅 라우트의 Gemma 4 12B — Artificial Analysis 수치 기준 백만 입력당 $0.10, 백만 출력당 $0.30입니다. 자체 카탈로그에서는 MoE 형제 모델인 Gemma 4 26B-A4B IT가 262,144토큰 윈도우에 입력 $0.06, 출력 $0.33으로 등록되어 있고, 더 큰 dense 모델인 Gemma 4 31B IT는 $0.13과 $0.38입니다. 이는 공급자 정가를 그대로 전달한 것이며, 우리가 아무것도 더하지 않는 유일한 숫자입니다.
• 자체 하드웨어에서 Kolibri를 실행하려면 — 78GB의 가중치, 벤더의 aleph-alpha-inference 패키지에서 제공되는 vLLM 플러그인, 그리고 최소 H200 또는 B200 한 대나 H100 SXM5 두 대가 필요합니다. 비용은 자본 구매, 랙 슬롯, 그리고 vLLM 배포를 운영할 수 있는 인력이며, 생성하는 토큰 수에 걸쳐 상각됩니다.
그것들은 같은 구매가 아니며, 비교는 "어느 쪽이 더 저렴한가"가 아니다. 그것은 워크로드가 하드웨어를 소유하는 것을 정당화할 만한 형태를 갖추고 있는지의 문제다. 고정적이고 민감한 문서 코퍼스를 대량으로 처리하는 팀은 자체 호스팅 쪽에서 훨씬 앞설 수 있다. 하루에 몇백만 토큰 정도로 모델을 호출하는 제품 기능을 만드는 팀은 거의 그렇지 않다.
실용적인 중간 경로 하나: Gemma 티어는 오늘 OrcaRouter에 있으며, 다른 모든 것과 동일한 OpenAI 호환 엔드포인트에서, 공급자 간 페일오버가 지원되고 공급자의 정가가 토큰당 아무것도 추가되지 않은 채 그대로 전달됩니다. 이는 78GB 소버린 배포가 정당한지 결정하기 전에 호스팅 경로에서 실제 토큰 볼륨을 측정할 수 있는 저렴한 방법이 됩니다. 이것이 무엇이 아닌지는 분명히 말할 가치가 있습니다. 우리는 Kolibri를 라우팅하지 않습니다. 공급업체와 모델 이름의 모든 표기를 사용해 카탈로그를 조사했지만, 거기에는 없습니다. 현재로서는 셀프 호스팅이 그것을 호출하는 유일한 방법입니다.

누가 무엇을 골라야 할까
결정 규칙은 세 줄로 설명할 수 있을 만큼 짧습니다.
독일어와 영어 텍스트 외의 다른 것이 필요하다면, 도입을 확정하기 전에 측정된 품질 수치가 필요하다면, 이미 보유한 하드웨어에서 모델을 실행해야 한다면, 또는 서버 랙을 직접 소유하기보다 토큰을 임대하고 싶다면 Gemma 4 12B를 선택하세요. 이 모델은 둘 중 유일하게 독립적인 점수와 공개된 속도, 그리고 시장 가격을 갖춘 모델입니다.
요구사항이 780억 개 매개변수의 추론 모델 — 가중치, 훈련 데이터 출처, 에너지 소비량, 라이선스가 모두 문서화되어 있고, 자체 보안 경계 내에 배포되며, 독일어 행정 문체를 위해 만들어진 토크나이저와 규제된 워크플로가 의존할 수 있는 유보 행동을 갖춘 모델 — 이라면 Kolibri를 선택하세요. 그것은 좁은 목표이며 Aleph Alpha는 의도적으로 그것을 겨냥했습니다.
출시 게시물에서 본 벤치마크 항목 하나만 믿고 둘 중 하나를 고르지 마세요. Gemma 4 12B의 14는 다른 누군가가 측정한 값이며 당신이 확인할 수 있습니다. Kolibri의 75.5는 그 작성자가 한 주장이며, 현재 이를 반증할 수 있는 유일한 사람은 H100 두 장과 문서 코퍼스를 가진 고객뿐입니다.
