크고 굵은 글씨로 'Kolibri: 독일에서 나온 78B 오픈 웨이트 모델'이라고 적힌 히어로 타이틀 카드, 그 아래에 더 작은 한 줄로 '총 78B / 활성 3.46B / 1M 토큰 컨텍스트 / Apache 2.0'이라고 적혀 있고, 한 줄로 배치된 세 개의 작은 플랫 라인 아이콘, 흰색 배경에 부드러운 파란색-시안색 그라데이션 포인트와 오른쪽 아래 모서리의 OrcaRouter 로고가 있는 구성.
Guides & Insights

Kolibri의 첫날: Aleph Alpha가 78B 독일어-영어 가중치를 공개했고, 반응은 증거보다 앞서 달리고 있다

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Aleph Alpha가 Kolibri를 공개한 지 24시간이 지난 뒤, 반응은 하나의 문장으로 굳어졌고, 그 문장을 뜯어볼 가치가 있다. 하이델베르크의 연구소는 2026년 3월 3일, 781억 개 파라미터의 전문가 혼합(mixture-of-experts) 모델을 Apache 2.0 라이선스로 Hugging Face에 올렸고, 같은 날 아침 자사 뉴스룸과 자사 계정을 통해 발표했으며, 다음 날까지 AI 피드에 퍼진 요약은 이러했다: 총 파라미터 78B, 토큰당 활성 파라미터 3.46B, Apache 2.0에 따른 개방형 가중치, 독일어와 영어를 위해 구축됨. 그 문장의 모든 절은 저장소에서 확인할 수 있다. 거의 언급되지 않은 것은, 이번 릴리스에서 어느 부분이 측정된 사실이고 어느 부분이 저자들이 자기 모델에 대해 한 주장으로서 하이델베르크 밖에서는 아무도 실행해 보지 않은 것인가이다. 그 간극이 첫날의 이야기이며, 이는 헤드라인 숫자보다 더 중요하다.

타임라인부터 시작하자. 반응 중 놀랄 만큼 많은 부분이 이 일을 정체불명의 조용한 출시로 취급했지만, 사실 그렇지 않았기 때문이다. Hugging Face 저장소 Aleph-Alpha/Kolibri-1는 2026년 10월 2일 05:54:02 UTC에 생성되었고, 모델 카드에는 공개일이 10월 3일로 명시되어 있으며, 벤더의 뉴스룸 게시물은 같은 날 아침 08:43:53 GMT에 올라갔다 — 독일 통일의 날, 연구소가 분명히 선택한 날짜다. Aleph Alpha 자체 계정도 몇 분 만에 관련 게시물을 올렸다. 언론 엠바고도, 출시 행사도 없었다. 아마 여기서 '조용한 출시'라는 프레이밍이 나왔을 것이다. 그러나 벤더의 뉴스룸 게시물, 기술 보고서, 공식 발표는 조용한 출시가 아니다. 그것들은 일반 AI 언론이 그날 단순히 다루지 않았을 뿐인 평범한 출시다.

반응이 반복하고 있는 숫자

3.46B 활성 파라미터를 모두가 인용하는 이유는, 이것이 이번 발표에서 구매자가 보유해야 하는 것을 바꾸는 유일한 숫자이기 때문입니다. Kolibri는 50개 층 트랜스포머로, 모든 층이 mixture-of-experts이고, 층당 384개의 전문가를 두고, 1개의 공유 전문가와 6개의 라우팅 전문가를 사용하며, 총 78,103,074,560개의 파라미터에 걸쳐 있습니다. 토큰당 이 중 3,457,573,120개를 활성화합니다 — 약 22.6 대 1의 희소성 비율입니다. 바로 이것이 780억 파라미터 모델을 랙이 아니라 H100 두 장에서 서빙할 수 있게 하며, 이번 발표에서 단연 가장 중대한 주장입니다.

그 주위에는 다른 핵심 수치들이 자리하고 있는데, 이들은 모두 독립적인 실행이 아니라 모델 카드에서 가져온 것이다:

• 컨텍스트 — 16,384 토큰에서 학습하고, 65,536에서 중간 학습했으며, 262,144에서 네이티브이고, 최대 1,048,576까지 검증되었습니다. 카드에서는 지연 시간에 민감한 작업에는 262,144 이하로 유지할 것을 권장합니다. 요약에서 보게 될 획일적인 "1M 컨텍스트"는 네이티브 창이 아니라 검증된 상한이라는 점에 유의하세요.

• 정밀도 — 128x128 블록의 FP8 가중치와 동적으로 양자화된 활성화를 사용하며, FP8 KV 캐시로 평가됩니다; 임베딩, LM 헤드, 정규화 계층 및 MoE 라우터는 bfloat16으로 유지됩니다.

• 추론 — 네 가지 노력 수준 — 없음, 낮음, 중간, 높음 — 채팅 템플릿을 통해 설정되며, Hermes 스타일 도구 호출과 vLLM 파서가 가중치와 동일한 저장소에 함께 제공됩니다.

• 언어 — 독일어와 영어, 그 외에는 없음.

• 학습 — 대략 영어 62.5퍼센트, 독일어 23.9퍼센트, 코드 13.6퍼센트로 구성된 필터링된 이중언어 코퍼스에 대한 20조 개의 사전 학습 토큰, 더불어 3.44조 개의 중간 학습 토큰과 장문맥 확장을 위한 2,010억 개.

• 컴퓨팅 및 에너지 — 96개 HGX 노드에 걸친 NVIDIA B200 768개, 511시간 동안의 21일 사전 학습 및 392,000 GPU-시간, 보고된 6.4x10^23 FLOPs, 데이터센터 오버헤드를 포함한 추정 9.5x10^2 MWh, 지도 미세 조정 및 강화 학습은 제외.

• 라이선스 — Apache 2.0. 허용 사용 부속 조항 없음, 월간 활성 사용자 임계값 없음, 별도의 상업적 조건 없음.

아무도 확인하지 않은 두 가지 주장

이것은 반응이 건너뛴 첫날의 일부이며, 콜리브리가 중요한지 아니면 단지 흥미로운지 결정하는 부분이다.

첫 번째는 서빙 경제성 주장입니다. Aleph Alpha의 주장은 Kolibri가 사용 가능한 가장 강력한 모델이라는 것이 아닙니다. 연구소 자체의 비교표에서도 그렇지 않으며, 연구소도 그렇게 말합니다. 그 주장은 GPU당 초당 디코딩 토큰 수 대비 품질의 파레토 프런티어를 따라, 비교된 어떤 모델도 동일한 서빙 비용으로 더 높은 품질을, 또는 더 낮은 비용으로 동일한 품질을 제공하지 않는다는 것입니다. 이는 특정 하드웨어에서의 처리량에 관한 주장이며, 스톱워치와 H100 두 대를 가진 제3자만이 판가름할 수 있는 바로 그런 종류의 주장입니다. 아무도 그렇게 하지 않았습니다. 2026년 10월 4일 기준으로 Kolibri에 대한 Artificial Analysis 항목은 없고, 평가 하네스에 대한 제3자 재현도 없습니다.

두 번째는 토크나이저 주장입니다. Aleph Alpha는 UniBPE라고 부르는 방법으로 128,000개 토큰 어휘를 가진 독일어-영어 이중언어 토크나이저를 학습시켰고, 독일어 웹 텍스트에서 토큰당 평균 4.90바이트를 보고했습니다. 이는 GPT-5의 4.35, Gemini의 4.13, Qwen 3.5-3.8의 4.17, GLM 5.3의 3.93, DeepSeek V4의 3.72, Kimi K3의 3.28과 대비됩니다. 이 수치들은 하나같이 해당 업체 자체의 것이며, 자사 코퍼스에서 측정한 것이고, 업체가 직접 고른 경쟁 모델들을 상대로 한 것입니다. 토큰당 더 많은 텍스트는 품질 주장이라기보다 실제 추론 비용 효과이며, 그것이 사실이라면 모든 문서 처리 작업 부하에 걸쳐 누적됩니다. 하지만 이는 한 연구소의 측정치일 뿐, 벤치마크 결과가 아닙니다.

독일어가 핵심이며, 그것이 이번 릴리스에서 가장 흥미로운 엔지니어링이다

대부분의 "다국어" 모델 카드는 학습 데이터 구성에 독일어가 우연히 포함된 경우를 설명한다. 이것은 그 반대 방식으로 만들어졌으며, 이 카드는 그 작동 방식에 대해 유난히 구체적으로 밝히고 있다.

소규모 프록시 모델 실험을 통해 Aleph Alpha는 혼합 데이터에서 독일어 데이터를 약 20퍼센트로 목표하게 되었고, 이는 20조 토큰 규모의 실행에서 4조 개의 독일어 토큰을 확보해야 한다는 뜻이었다. 중복 제거 및 필터링을 거친 공개 독일어 데이터셋은 3,900억 개를 제공했지만, 10배가량 부족했다. 연구소는 세 가지 방식으로 격차를 메웠다. Common Crawl 필터를 독일어에 맞게 재조정해 1.3조 개의 고유한 자연 발생 토큰을 생산했고, 기존 독일어 문서를 백과사전 항목, 문답 대화, 텍스트 구절로 재구성해 약 1조 개를 추가로 생산하며 단일 최대 독일어 공급원이 되었으며, 번역은 전작 모델에 사용되었지만 Kolibri에서는 의도적으로 제외되었다. 독일어는 결국 2.4조 토큰의 고유 풀이 되었고, 그중 80퍼센트는 내부에서 선별하거나 생성했으며, 업샘플링 후 사전 학습 토큰의 21.3퍼센트로 나타났다.

필터의 세부 사항은 실제로 독일어로 훈련한 연구실에서만 드러나는 종류의 것이다. 표준 언어 데이터 파이프라인은 긴 단어가 너무 많은 문서를 버리는데, 독일어 행정 문체는 평균 단어 길이에 관한 영어 기준을 일상적으로 초과하므로 기본 설정은 공공 행정이 사용하는 문체를 조용히 삭제한다. 기성 영어 필터로 훈련된 모델은 독일어 법률·행정 어휘를 거의 갖추지 못하며, 어떤 벤치마크도 그 사실을 알려주지 않는다.

비교 표가 실제로 보여주는 것

알레프 알파(Aleph Alpha)는 14개 모델을 다루는 포스트 트레이닝 비교를 공개했는데, 이는 대상 모델을 미화하지 않기 때문에 대부분의 출시 표보다 더 유용하다. Kolibri를 추론 노력 수준 high로 설정한 동일한 하네스에서, Qwen3.8 27B는 영어 평균에서 80.2점으로 Kolibri의 75.5점을 앞서고, 독일어 평균에서 79.9점으로 70.8점을 앞서며, GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified 및 두 장문맥 벤치마크 모두에서 앞선다. Nemotron 3 Super 120B-A12B는 Kolibri의 75.5점에 대비해 영어에서 73.0점을 기록한다. Gemma 4 26B-A4B IT는 두 평균에서 71.9점과 66.3점을 기록한다.

그래서 이번 릴리스에 대한 솔직한 요약은 '최첨단'이 아니다. 그것은 Kolibri가 토큰당 30억에서 120억 개의 파라미터를 활성화하는 모델군의 중간에 자리하고, 훨씬 더 작은 모델들을 확실히 이기며, 자체 표의 대부분 행에서 파라미터의 약 8분의 1을 활성화하면서도 Alibaba의 270억 파라미터 dense 모델에 뒤진다는 점이다. 경제성이 그 격차를 메워 주는지가 Pareto 주장이며, 그 Pareto 주장은 검증되지 않았다.

A single-column specification scoreboard titled 'Kolibri — the scoreboard', with six rows reading 'Total parameters: 78.1B', 'Active per token: 3.46B', 'Context: 262,144 native, 1M validated', 'Licence: Apache 2.0', 'Independent score: none published' and 'Deployment floor: 2x H100 80GB', and a footer line reading 'All figures vendor-reported from the model card; no independent evaluation yet.' OrcaRouter logo in the bottom-right corner.

오늘날 실제로 당신이 그것을 어떻게 부를지

공급업체에서 제공하는 호스팅 엔드포인트는 없습니다 — 이 릴리스는 가중치와 기술 보고서로 이루어져 있으며, 공개된 자료에는 Kolibri용 Aleph Alpha API SKU가 없습니다. OrcaRouter에도 이에 대한 경로가 없습니다: 벤더 접두사와 모델 이름의 모든 철자로 카탈로그를 뒤져 보았지만 Kolibri는 없으므로, 오늘 이를 호출하려면 약 78GB의 FP8 가중치를 다운로드하고 직접 vLLM 엔드포인트를 실행해야 합니다: 다음에서 aleph-alpha-inference 패키지 또는 공개된 컨테이너 이미지.

그것은 조달 결정이지 각주가 아니며, 바로 그 지점에서 라우팅 레이어는 자기가 직접 보유하지도 않은 모델에 대해서도 제 역할을 합니다. 자체 호스팅 78B 소버린 배포를 저울질하는 사람에게 정직한 비교 대상은 벤치마크가 아니라 78GB의 VRAM이고, 남의 하드웨어에서 발생하는 토큰당 청구 항목과 맞붙는 조달 논의입니다. 이번 달에 실제로 필요한 것이 GPU 두 장을 사지 않고도 호출할 수 있는 작은 전문가 혼합 모델이라면, Gemma 4 26B-A4B 등급이 이미 라우팅된 엔드포인트에 있는 가장 가까운 대안이며, 입력 토큰 백만 개당 $0.06, 출력 토큰 백만 개당 $0.33에 262,144토큰 창을 제공합니다. 그리고 OrcaRouter는 그 등급을 OpenAI 호환 키 하나 제공업체의 정가로 아무것도 더 얹지 않고 라우팅합니다. 이것이 하드웨어가 도착하기 전에 그 워크로드가 하드웨어를 소유할 만한 가치가 있는지 값싸게 알아보는 방법입니다.

A screenshot of Aleph Alpha's newsroom post for Kolibri, showing the vendor headline about a sovereign open-weight model, the 78B parameter figure and the one-million-token context line, and the architecture comparison between Kolibri and Kolibri Origin.

무엇을 지켜봐야 하는지, 그리고 무엇이 판단을 바꿀 수 있는지

세 가지, 그것들이 판도를 얼마나 바꿀 수 있는지 순서대로.

카드가 권장하는 2-H100 구성에서의 독립적인 처리량 측정은 파레토를 입증하거나 논파할 것이다. 이는 이 글에서 스펙 시트를 재진술한 것이 아니라 진정으로 참신한 유일한 주장이다. 독일어 및 영어 태스크 스위트 평균의 독립적인 재현은 Qwen3.8 27B와의 격차가 벤더 자체 표에서 시사하는 만큼 좁은지, 아니면 더 좁은지 알려줄 것이다. 그리고 실제 행정 텍스트에 대한 독일어 평가 — 번역된 일반 벤치마크가 아니라 — 는 그 릴리스가 실제로 무엇을 위해 만들어졌는지 시험할 것이며, 이는 현재 어떤 리더보드도 측정하지 않는다.

그중 하나가 실제로 나오기 전까지는, 올바른 프레이밍은 저장소 자체가 뒷받침하는 것이다. Kolibri는 유럽 연구소가 내놓은 진정한 오픈 웨이트 릴리스로, 유럽 연구소들이 이전에 출시한 적 없는 규모이며, 기존 강자 누구도 맞먹지 못한 Apache 2.0 조건, 가중치와 함께 공개된 데이터 파이프라인, 그리고 헤드라인 숫자보다 더 흥미로운 두 모델 이터레이션 스토리를 갖췄다. 또한 현재로선, 가장 많이 인용되는 수치가 자체 저자들에게서 나오는 모델이기도 하다. 이 두 문장은 모두 첫날부터 사실이며, 반응에서 빠진 것은 두 번째 문장이다.

A screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the repository header, the Apache 2.0 licence tag, the stated release date of 3 October 2026, and the parameter, context and FP8 precision lines in the card body.