Kolibri 설명 자료용으로 생성된 히어로 카드로, 제목은 'Kolibri: 독일의 78B 오픈 웨이트 모델'이고 부제는 '총 78B / 활성 3.46B / 1M 토큰 컨텍스트 / Apache 2.0'이며, 세 개의 플랫 라인 아이콘: 벌새, 레이어 스택, 문서 위의 자물쇠가 있습니다. OrcaRouter 로고는 아트워크 아래의 띠에 있습니다.
Guides & Insights

Kolibri, 해설: Aleph Alpha가 Apache 2.0 라이선스로 78B 독일어-영어 모델을 출시

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Aleph Alpha는 Kolibri를 2026년 10월 3일에 공개했다. 토큰당 34억 6천만 개의 파라미터를 활성화하고, 1,048,576 토큰의 검증된 컨텍스트 윈도우를 갖추고 있으며, Apache 2.0 라이선스에 따라 Hugging Face에 전체 가중치를 제공하는 781억 개 파라미터 규모의 전문가 혼합(MoE) 모델이다. 하이델베르크의 연구소는 독일 통일의 날에 이 모델을 공개했으며, 기술 보고서와 독일어·영어 모델 카드, 그리고 이 모델이 어떻게 훈련되었는지에 관한 유난히 상세한 설명을 함께 내놓았다. Aleph Alpha 자체 문서 전반에서 이 모델의 비교 대상으로 삼는 것은 Kolibri Origin — 2026년 6월 11일에 사전 학습을 마쳤고 결코 공개적으로 출시되지 않았던, 306억 개 파라미터에 활성 파라미터 32억 7천만 개의 전작이다. 세 달 간격을 두고 나온 두 모델, 그리고 그 둘 사이의 간극이 이번 공개에서 가장 흥미로운 지점이다.

Kolibri를 주의 깊게 읽을 가치가 있는 이유는 그것이 사용 가능한 가장 강력한 모델이라서가 아니다. Aleph Alpha 자체의 비교 표에서도 그렇지 않으며, 그 점은 곧 다룰 것이다. 주목할 만한 것은 유럽의 한 연구소가 이 규모의 오픈 웨이트 모델을 아예 출시했다는 사실, 그와 함께 학습 파이프라인, 데이터 출처, 에너지 수치를 공개했다는 점, 그리고 라이선스를 맞춤형 연구 라이선스가 아닌 Apache 2.0으로 설정했다는 점이다. 조달 규칙이 "데이터가 어디로 가는가"에서 시작하는 팀들에게 그 조합 자체가 제품이다.

스펙 시트, 그리고 중요한 두 숫자

아래 내용은 모두 Aleph Alpha가 가중치와 함께 공개한 모델 카드에서 가져온 것이며, 아직 독립적으로 재현된 것은 아무것도 없고, 이 글을 쓰는 시점에 Kolibri에 대한 Artificial Analysis 항목도 없습니다.

• 총 파라미터 — 78,103,074,560개, 토큰당 활성 3,457,573,120개, 비율은 약 22.6 대 1.

• 아키텍처 — 50계층 트랜스포머, 모든 계층이 전문가 혼합(MoE)이며, 계층당 384개의 전문가(1개 공유, 6개 라우팅), 스택 전반에 걸쳐 슬라이딩 윈도우 어텐션 대 그룹화된 쿼리 어텐션의 4:1 혼합입니다.

• 컨텍스트 — 16,384개 토큰에서 학습되고, 65,536개에서 중간 학습되었으며, 네이티브 262,144개로 확장되었습니다. 위치 인코딩이 슬라이딩 윈도 레이어에만 적용되기 때문에, Aleph Alpha는 위치 스케일링 없이 윈도우를 확장할 수 있다고 밝히며, 최대 1,048,576개 토큰까지 품질과 서빙 효율성을 검증했습니다. 이 카드는 지연 시간에 민감한 작업과 복잡한 작업에서는 262,144개 이하를 유지할 것을 권장합니다.

• 정밀도 — 128×128 블록의 FP8 가중치와 동적으로 양자화된 활성화를 사용하고, FP8 KV 캐시로 평가됩니다. 임베딩, LM 헤드, 정규화 계층, MoE 라우터는 bfloat16으로 유지됩니다.

• 추론 — 채팅 템플릿을 통해 설정되는 네 가지 노력 수준: 없음, 낮음, 중간, 높음.

• 도구 호출 — 예, Hermes 스타일이며, vLLM 파서가 가중치와 같은 저장소에 포함되어 있습니다.

• 언어 — 독일어와 영어, 그 외에는 없다. 이는 누락이 아니라 설계상의 선택이라고 명시되어 있다.

• 학습 — 필터링된 이중 언어 말뭉치에 대한 사전 학습 토큰 20조 개(영어 약 62.5퍼센트, 독일어 23.9퍼센트, 코드 13.6퍼센트), 그리고 중간 학습 토큰 3.44조 개와 장문맥 확장을 위한 2010억 개.

• 컴퓨팅 — 96개의 HGX 노드에 걸쳐 768개의 NVIDIA B200, 511시간 및 392,000 GPU-시간에 걸친 21일간의 사전 학습, 보고된 6.4×10²³ FLOPs. 중간 학습은 5일과 90,000 GPU-시간을 추가했고, 롱컨텍스트 확장은 13시간과 10,000 GPU-시간을 추가했다.

• 에너지 — 데이터센터 오버헤드를 포함해 9.5×10² MWh로 추산되며, 사전 학습, 중간 학습, 장문맥 학습을 포괄하지만 지도 미세 조정과 강화 학습은 제외.

• 라이선스 — Apache 2.0. 허용 사용 부속 조항 없음, 월간 활성 사용자 임계값 없음, 별도의 상업적 조건 없음.

그중 두 줄은 구매자가 두 번 읽어봐야 할 항목입니다. 활성 파라미터 수는 추론 시 실제로 비용을 지불하는 부분이며, 전체 780억 개 중 34억 6천만 개가 활성화된다는 것은 매우 공격적인 희소성 비율입니다. 이 정도 규모의 모델을 두 개의 GPU에서 서빙할 수 있는 이유는 전적으로 여기에 있습니다. 그리고 컨텍스트 수치는 네이티브 262,144개, 검증된 1,048,576개로 제시되는데, 이는 이번 릴리스에 관한 대부분의 보도에서 보게 될 단순한 '1M 컨텍스트'보다 더 신중한 주장입니다.

Generated single-column scoreboard for Kolibri with six rows: total parameters 78.1B, active per token 3.46B, context 262,144 native and 1M validated, licence Apache 2.0, independent score 'none published', and deployment floor 2x H100 80GB. The footer reads 'All figures vendor-reported from the model card; no independent evaluation yet.'

두 모델, 세 달 차이

Kolibri는 Aleph Alpha가 자사의 Model Factory라고 부르는 것에서 나온 두 번째 모델이며, Aleph Alpha가 공개한 타임라인은 대부분의 보도가 건너뛰는 릴리스의 한 부분이다.

훈련 파이프라인 작업은 2026년 1월에 시작되었다. Kolibri Origin은 2026년 6월 11일에 목표 규모로 사전 훈련을 마쳤다 — 총 306억 개 파라미터, 활성 32억 7천만 개, 65,536토큰 컨텍스트 윈도, 7조 5,100억 훈련 토큰, 50개 레이어 중 2개는 dense, 48개는 MoE, 그리고 단일 추론 모드였다. 이는 내부적으로 검증되었고 공개적으로 출시된 적이 없다. Kolibri는 2026년 9월 11일에 사전 훈련을 마쳤다.

• 파라미터 — 총 30.6B, 활성 3.27B로, 총 78.1B, 활성 3.46B와 대비된다.

• 컨텍스트 — Origin에서는 8,192 토큰의 사전 학습 컨텍스트, Kolibri에서는 16,384 토큰, 최종적으로 네이티브 262,144.

• 데이터 — Origin에서 7.51조 개의 사전 학습 토큰, 파이프라인이 필터링하고 중복 제거하고 큐레이션한 200조 개가 넘는 원시 풀에서 추출한 20조 개와 대비된다.

• 아키텍처 — Origin에서는 2개의 밀집 층과 48개의 MoE 층인 반면, 50개의 MoE 층, 변경된 어텐션 설계, 3배의 전문가 수, 더 높은 희소성, 교체된 라우팅 알고리즘을 갖추고 있습니다.

• 추론 — Origin에서는 한 가지 모드, Kolibri에서는 없음, 낮음, 중간, 높음과 대비됩니다.

• 출시 — Origin은 공개 출시 없음, Kolibri는 2026년 10월 3일.

가장 많이 움직인 수치는 태스크 스위트(task-suite) 항목으로, 동일한 평가 하네스가 두 모델을 모두 채점한 경우입니다. 포스트트레이닝 스위트의 독일어 평균에서 Origin은 46.4점, Kolibri는 70.8점을 기록했고, 영어 평균에서는 54.1 대 75.5였습니다. 독일어 AIME 2025에서는 73.5 대 87.5였습니다. 벤더가 버티컬 세트로 공개하는 내부 고객 대리(customer-proxy) 벤치마크에서는 자동차 부품 공급업체 스위트가 0.72에서 0.99로, 반도체가 0.35에서 0.80으로, 독일 공공 부문이 0.54에서 0.75로, 산업용 드라이브 기술이 0.31에서 0.60으로, 항공우주가 0.14에서 0.59로 상승했습니다.

그 내부 버티컬 수치는 벤더 고객을 염두에 두고 벤더가 구축한 평가 스위트에서 벤더가 운영하는 것이므로, 점수라기보다 의도에 대한 설명으로 받아들이는 게 좋습니다. 이를 공개하는 요점은 그 수치가 모델이 무엇에 최적화되었는지를 설명해 준다는 데 있습니다: 리더보드가 아니라, 규제 산업 문서 집합입니다.

Screenshot of Aleph Alpha's newsroom post 'Kolibri Has Landed: A Sovereign Open-Weight Model', showing the opening lines dating the release to the Day of German Reunification, describing Kolibri as an English-German mixture-of-experts transformer with 78B total and 3B active parameters, context lengths up to 1M tokens, full weights on Hugging Face under Apache 2.0, and the paragraph on Kolibri Origin as the 30B total, 3B active predecessor with a 65k context window.

여기서 독일어는 언어 태그가 아니라 디자인 결정입니다

대부분의 "다국어" 모델 카드는 학습 데이터 혼합에 독일어가 우연히 포함된 정도를 뜻한다. 이 모델 카드는 그 반대 방식으로 만들어졌으며, 그 메커니즘을 구체적으로 밝히고 있다.

Aleph Alpha는 소규모 프록시 모델 실험을 통해 혼합물에 약 20퍼센트의 독일어 데이터가 들어갈 때 최상의 결과가 나온다는 것을 발견했는데, 20조 토큰 실행의 경우 4조 개의 독일어 토큰을 찾아야 함을 의미했다. 중복 제거 및 필터링된 공개 독일어 데이터셋은 3900억 개를 제공했는데, 이는 목표에 10배나 모자랐다. 이 격차는 세 가지 방식으로 좁혔다: Common Crawl 필터를 독일어에 특화되도록 재조정하여 1.3조 개의 고유 유기적 토큰을 생성했고; 기존 독일어 문서를 백과사전 스타일 항목, 질의응답 대화 및 텍스트 구절로 재구성하여 약 1조 개를 추가로 생성했으며 이는 단일 최대 독일어 소스가 되었다; 그리고 번역은 Kolibri Origin에서만 사용되었고 Kolibri에서는 제외되었다. 독일어는 최종적으로 2.4조 토큰의 고유 풀이 되었고, 그 중 80퍼센트는 내부에서 큐레이션되거나 생성되었으며, 업샘플링 후 사전 학습 토큰의 21.3퍼센트를 차지하는 것으로 나타났다.

이 필터 세부 사항은 인용할 가치가 있다. 실제로 독일어로 학습한 연구소에서만 드러나는 종류의 것이기 때문이다. 표준 언어 데이터 파이프라인은 너무 긴 단어가 많은 문서를 버린다. 하지만 독일어 행정 문어는 평균 단어 길이에 대한 영어 기준을 일상적으로 초과하므로, 기본 설정은 공공 행정이 사용하는 언어 사용역을 조용히 삭제한다. 명백한 상업적 결과는 기성 영어 필터로 학습된 모델이 독일어 법률·행정 어휘를 거의 갖추지 못한다는 것이며, 어떤 벤치마크도 그 사실을 알려주지 않는다.

토크나이저도 같은 대우를 받는다. Aleph Alpha는 UniBPE라고 부르는 새로운 방법으로 128,000개 토큰 어휘를 갖춘 독일어-영어 이중 언어 토크나이저를 훈련시켰는데, 이는 바이트 페어 인코딩의 상향식 병합을 유지하되 유니그램 목표로 병합을 선택한다. 독일어 웹 텍스트에서 토큰당 평균 4.90바이트를 보고했으며, 이는 GPT-5의 4.35, Gemini의 4.13, Qwen3.5–3.8의 4.17, GLM 5.3의 3.93, DeepSeek V4의 3.72, Kimi K3의 3.28보다 앞선다 — 모두 벤더가 자체 비교에서 보고한 수치다. 토큰당 텍스트가 더 많다는 것은 작업당 토큰이 더 적다는 뜻이며, 이는 품질 주장이라기보다 직접적인 추론 비용 효과이고, 문서 처리 워크로드 전반에 걸쳐 누적되는 종류의 효율성 이점이다.

벤더의 표가 해결하지 못하는 것

Aleph Alpha는 14개 모델을 아우르는 포스트트레이닝 비교를 발표했는데, 이는 대상을 미화하지 않기에 대부분의 출시 비교표보다 더 유용하다.

동일한 하네스에서 Kolibri의 추론 강도를 high로 설정했을 때, Qwen3.8 27B는 영어 평균에서 80.2점으로 Kolibri의 75.5점을 앞서고, 독일어 평균에서는 79.9점으로 70.8점을 앞선다. 또한 GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified 및 두 가지 긴 컨텍스트 벤치마크에서도 우위를 보인다. Nemotron 3 Super 120B-A12B는 영어에서 Kolibri의 75.5점에 맞서 73.0점을 기록해 더 근접했으며, AIME 2025에서는 앞선다. Gemma 4 26B-A4B IT는 두 평균에서 각각 71.9점과 66.3점을 기록한다.

이번 릴리스에 대한 솔직한 요약은 “최첨단”이 아니다. 요약은 이렇다. Kolibri는 토큰당 30억에서 120억 개의 파라미터를 활성화하는 모델군의 중간에 자리하며, 훨씬 작은 모델들은 분명히 이기고, 자체 표의 대부분 행에서 약 8분의 1의 파라미터만 활성화하면서도 알리바바의 dense 270억 파라미터 모델에게 진다. 이에 대한 Aleph Alpha의 프레이밍은 GPU당 초당 디코딩 토큰 수에 대비한 품질의 파레토 프런티어다. 비교된 모델 중 어느 것도 같은 서빙 비용에서 더 높은 품질을 제공하지 못하고, 더 낮은 비용에서 같은 품질을 제공하지도 못한다. 이것이 따져봐야 할 주장이며, 이는 역량 주장이 아니라 서빙 경제성 주장이다.

이 수치 중 어느 것도 독립적으로 검증되지 않았습니다. Kolibri에 대한 Artificial Analysis 항목은 없고, 평가 프레임워크에 대한 제3자 재현도 없으며, 버티컬 벤치마크는 공급업체가 직접 구축한 것입니다. 이 비교는 또한 구조적으로 한 방향에서는 Kolibri에 관대하고 다른 방향에서는 박한데, 열네 개 모델 모두가 동일한 프롬프트와 퓨샷 설정으로 Aleph Alpha 자체 하네스를 통해 실행되었습니다. 이는 올바른 방식이지만, 여전히 한 연구소의 하네스입니다. 다른 누군가가 실행하기 전까지 이 섹션의 모든 숫자는 공급업체가 보고한 것으로 간주하십시오.

Screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the licence badge apache-2.0 and the Model overview block: architecture Mixture-of-Experts, 78B total parameters given as 78,103,074,560, active parameters per token 3,457,573,120, languages German and English, context length 1,048,576 tokens with a recommendation to stay at or below 262,144 for serving efficiency and complex tasks, float8_e4m3 weights in 128x128 blocks with an FP8 KV cache and embeddings, LM head, norms and MoE router in bfloat16, reasoning mode yes, tool calling yes, and the June 18 2026 knowledge cutoff.

실행하는 데 필요한 것

Kolibri는 노트북에서 시험해 볼 모델이 아닙니다. FP8 가중치는 약 78GB의 모델 메모리 사용량을 차지하며, 카드 최소 요구 사항은 A100 80GB 두 장, H100 SXM5 두 장, H200 한 장, B200 한 장 또는 B300 한 장이고, 권장 구성은 H100 SXM5 두 장, H200 두 장, B200 한 장 또는 B300 한 장입니다.

이를 서빙하려면 aleph-alpha-inference 패키지를 설치해야 합니다. 이 패키지는 Kolibri vLLM 플러그인을 제공하고 지원하는 vLLM 버전을 고정합니다. 또는 컨테이너 이미지 ghcr.io/aleph-alpha/aleph-alpha-inference를 풀(pull)해도 됩니다. 그다음부터는 FP8 KV 캐시, Kolibri 추론 파서, Kolibri 도구 호출 파서를 사용하는 표준 vLLM 호출입니다. 262,144 토큰을 초과하는 컨텍스트에는 명시적인 maximum-model-length 플래그와 위치 임베딩 재정의가 필요합니다. 권장 샘플링 파라미터는 temperature 1.0, top-p 0.97, top-k 128입니다.

API 표면은 OpenAI 호환이며, 이는 들리는 것보다 더 중요합니다: 추론 노력은 reasoning_effort 값으로 채팅 템플릿을 통해 전달되고, 도구 호출은 표준 tools 필드에 내보내집니다. 이미 chat-completions 형식을 구사하는 팀은 래퍼 계층 없이 자체 건물 안의 머신에 있는 Kolibri 엔드포인트로 기존 코드를 향하게 할 수 있습니다.

Kolibri에 아직 없는 것

네 가지 부재는 분명히 짚고 넘어갈 가치가 있다. 출시 관련 보도가 이를 건너뛰는 경향이 있기 때문이다.

• 독립적인 평가 없음. Artificial Analysis에는 Kolibri에 대한 모델 페이지가 없으며, 어떤 제3자도 해당 벤더의 벤치마크 표를 재현한 결과를 공개하지 않았습니다.

• 벤더가 제공하는 호스팅 엔드포인트는 없습니다. 이 릴리스는 가중치와 기술 보고서로 구성되며, 모델과 함께 공개된 자료에는 Kolibri용 Aleph Alpha API SKU가 없습니다.

• OrcaRouter에는 경로가 없고, 우리가 이름을 밝힐 만한 어떤 애그리게이터에도 없습니다. 우리는 공급업체 접두사와 모델 이름의 모든 표기로 카탈로그를 샅샅이 뒤져 봤지만 Kolibri는 없습니다 — 그러니 이걸 호출하려면 78GB를 다운로드하고 vLLM 엔드포인트를 직접 실행해야 합니다. 우리는 그것을 제공한다고 암시하느니 차라리 그렇게 말하겠습니다.

• 멀티모달 입력은 없습니다. 텍스트 입력, 텍스트 출력, 두 언어. 그것은 그 연구소가 폭넓음보다 깊이를 위해 선택한 트레이드오프이며, 문서 처리 배포 환경에서는 아마 옳은 선택일 것이지만, 이는 실제 경계입니다.

오늘 실제로 필요한 것이 GPU 두 장을 사지 않고도 호출할 수 있는 작은 전문가 혼합(MoE) 모델이라면, Gemma 4 MoE 티어가 이미 라우팅된 엔드포인트에서 쓸 수 있는 가장 가까운 것입니다. 26B-A4B 변형 기준으로 입력 토큰 100만 개당 $0.06, 출력 토큰 100만 개당 $0.33이며, 262,144토큰 창을 갖추고 있습니다. 자체 호스팅하는 78B 소버린 배포를 그것과 저울질하는 사람에게 유용한 비교는 벤치마크 행이 아니라, 78 GB의 VRAM과 조달 논의를 토큰당 청구 항목과 맞세우는 것입니다. OrcaRouter는 공급자의 정가를 그대로 전달하고 아무것도 더하지 않은 채 하나의 OpenAI 호환 키로 그 티어를 라우팅합니다, 즉 해당 워크로드가 하드웨어를 소유할 가치가 있는지 알아보는 저렴한 방법입니다.

Kolibri 자체가 더 흥미로운 결과물이다. Apache 2.0 라이선스의 780억 파라미터 독일어-영어 모델이 데이터 파이프라인, 토크나이저 방식, 에너지 수치, 그리고 3개월간의 반복 작업 스토리를 가중치와 함께 공개한 것은, 일반적인 가중치 공개와는 다른 종류의 릴리스다 — 공개 자체가 제품의 일부이지, 제품에 관한 블로그 포스트가 아니다. 파레토 주장이 성립하는지는 이제 H100 두 대와 스톱워치를 가진 사람들의 질문이며, 그 답은 모델 카드를 작성한 사람에게서 나오지 않을 것이다.