
Kolibri vs Qwen 3.8: 독일 모델이 자기 테이블에서 패배하다, 그리고 바로 그 점이 핵심이다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 218 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
대부분의 출시 보도가 Kolibri에 관해 빠뜨린 문장부터 시작하자. 2026년 10월 3일 Aleph Alpha가 자사 모델과 함께 공개한 벤치마크 표에서, 가장 자주 비교 대상으로 등장하는 모델은 유럽의 경쟁 모델도, 미국의 경쟁 모델도 아니다. 그것은 바로 Qwen3.8 27B, 즉 그 세대에서 이 벤더가 내놓은 오픈 웨이트 등급으로 2026년 8월 13일에 공개된 모델이며, Aleph Alpha 자체 수치에서도 이 모델이 이긴다. Qwen3.8 27B는 Kolibri에게 75.5와 70.8을 주는 동일한 평가 스위트에서 영어 평균 80.2, 독일어 평균 79.9를 기록한다. GPQA Diamond에서는 89.2 대 84.3으로 앞선다. LiveCodeBench v6에서는 93.8 대 85.9로 앞선다. SWE-Bench Verified에서는 72.6 대 66.4로 앞서고, 두 장문 맥락 벤치마크에서도 LongBench Pro 76.9 대 64.5, AA-LCR 81.3 대 68.3으로 앞선다. 독일 연구소가 평가한 270억 매개변수 덴스 중국 모델이, 그 연구소의 780억 매개변수 대표 모델을 자체 표의 대부분 항목에서 이긴다. 이것은 스캔들이 아니다. 이번 출시에서 가장 유용한 사실이다. Kolibri가 실제로 무엇을 위한 것인지라는 질문을 불가피하게 만들기 때문이다.
비교를 더 진행하기 전에 한 가지 짚고 넘어갈 점이 있습니다. "Qwen 3.8"은 모델이 아니라 패밀리를 가리키는 이름이고, 여기서는 그 구분이 중요하기 때문입니다. Qwen3.8-Max는 알리바바의 호스팅 플래그십으로, 2026년 8월 3일부터 서비스 중이며 1M 토큰 컨텍스트 윈도우를 제공하고 입력 토큰 100만 개당 $2.00, 출력은 $6.00입니다. Qwen3.8-27B는 오픈 웨이트 등급으로, 2026년 8월 13일 출시되었으며 262,144토큰 윈도우를 지원합니다. Qwen3.8-Flash는 대량 처리 등급으로, 2026년 8월 26일 출시되었고 1M 토큰 윈도우와 훨씬 낮은 가격을 제공합니다. 그리고 일반 Qwen3.8은 — 2026년 7월 19일에 2.4조 매개변수 오픈 웨이트 플래그십으로 발표되었지만 — 아직 출시되지 않았습니다. 이는 카탈로그 추적 페이지와 발표문으로만 존재합니다. 아래 내용은 모두 다운로드해서 실행할 수 있는 가중치가 있는 모델, 즉 27B에 관한 것입니다.
Kolibri가 실제로 앞서는 지점, 같은 표에서 그대로 읽어낸
Kolibri가 Qwen3.8 27B를 앞서는 행들은 무작위로 흩어져 있지 않다. 그것들은 군집을 이루며, 그 군집이 곧 제품이다.
• 답변 유보 — RGB Negative에서 Kolibri는 70.6점 대비 85.6점을 기록합니다. 문맥에 답이 없을 때 Kolibri는 답이 없다고 훨씬 더 자주 밝힙니다.
• 제약 조건 하의 도구 호출 — τ²-bench telecom에서 94.7 대 82.5, 자동차 부품 공급업체 버티컬 스위트에서 99.0 대 97.3.
• 매우 긴 컨텍스트 — 24k 토큰 초과의 방해 요소가 없는 SealQA에서 100.0 대 94.4.
• 독일어 서빙 경제성 — 독일어 웹 텍스트에서 토큰당 평균 4.90바이트를 기록하는 이중언어 토크나이저로, Aleph Alpha 자체 측정에서 Qwen3.5–3.8 제품군의 4.17바이트와 대비됩니다. 독일어 문서당 토큰 수가 적다는 것은 청구서에는 나타나지만 어떤 벤치마크 행에도 나타나지 않는 직접적인 추론 비용 절감입니다.
그 네 가지 중 세 가지는 역량이 아니라 행동에 관한 것입니다. 귀하 조직 자체의 자료를 읽고, 그 자료가 질문에 답하지 못할 때 이를 인정할 것으로 기대되는 모델에게 필요한 것은 바로 답변 보류, 제한된 도구 호출, 근거 기반 장문맥 검색입니다. Aleph Alpha는 그 승부수를 중심으로 이번 릴리스 전체를 구축했으며, 표는 그 승부수가 적중하고 있음을 보여줍니다.

Qwen3.8 27B이 승리하는 행들은 범위에 관한 것입니다: 두 언어의 지식, 대학원 수준의 과학 질문, 경쟁 프로그래밍, 저장소 수준의 소프트웨어 엔지니어링, 장문 문서 이해. 토큰당 낮은 가격에 오픈 가중치를 갖춘 강력한 범용 모델이 필요하다면, Qwen3.8 27B가 더 나은 모델이며, 표는 벤더 자신의 글에서도 그렇게 말하고 있습니다.
그 해석은 콜리브리의 해석과 달리 뒷받침된다. Artificial Analysis는 Qwen3.8 27B를 자사의 Xhigh 추론 구성으로 독립적으로 측정했으며, 해당 비교의 142개 모델 중 1위로 Intelligence Index 34, 초당 출력 토큰 45.4개, 256,000토큰 컨텍스트, Apache 2.0 라이선스를 보고한다. 그들의 평가는 익숙한 방식으로 호의적이지 않다 — 지수 평가 중 생성된 토큰이 중앙값 8,200만 개에 비해 2억 개로 매우 장황하고, 느리다 — 하지만 점수 자체는 상대 모델에 대한 제3자 측정이다. Kolibri는 Artificial Analysis 페이지가 전혀 없다. 따라서 이 비교에서 가장 강력한 모델은 독립적으로 검증되었고, 더 약한 모델은 벤더의 말뿐이며, 이는 1세대 유럽 플래그십이 일반적으로 그려지는 방식과 반대다.
서로 반대 방향을 가리키는 두 종류의 공급망 주장
이 두 릴리스는 모두 모델이 어디에서 비롯되었는지에 대한 논쟁이며, 그 논쟁은 서로 거울상이다.
Aleph Alpha의 사례는 출처 증명(프로비넌스)을 하나의 기능으로 내세운 것이다. Kolibri는 독일과 핀란드에 위치한 인프라에서 독일 팀들이 EU 및 독일 법률에 따라 훈련했다. 모델 카드는 사전 훈련 구성을 공개한다 — 약 62.5% 영어, 23.9% 독일어, 13.6% 코드로 이루어진 20조 토큰 — 또한 중간 훈련 및 장문맥 예산, 정확한 컴퓨팅 규모(96개 HGX 노드 전반에서 768개 NVIDIA B200을 21일간 사용), 데이터센터 오버헤드를 포함해 추정 9.5×10² MWh의 에너지를 밝힌다. 이 카드는 훈련 방법을 계층 단위까지 명시한다: 4:1로 분할된 슬라이딩 윈도 대 그룹화 쿼리 어텐션을 갖춘 50계층 전문가 혼합(mixture-of-experts) 트랜스포머, 384개 전문가에 걸친 Muon 및 Exact Quantile Balancing(공유 1개, 라우팅 6개). 78GB 다운로드에 첨부된 1만 2천 단어의 공개 자료, 그리고 EU의 범용 AI 행동 규범(General-Purpose AI Code of Practice)에 대한 명시된 서명자 입장.
알리바바의 사례는 성격이 다릅니다. "우리가 모든 결정을 설명할 수 있다"가 아니라 "여기 가중치가 있으니 가져가라"입니다. Qwen을 전 세계의 사실상 기본값으로 만든 규모와 품질의 Apache 라이선스 공개 가중치, 100개가 훨씬 넘는 언어를 아우르는 248,077개 토큰 어휘, 그리고 거의 모든 추론 스택이 별도 설정 없이 이를 지원할 정도로 오랫동안 해당 체크포인트를 중심으로 조정되어 온 서빙 생태계가 있습니다. 여기서 주권 논리는 가용성에 관한 것입니다. 이미 파일을 가지고 있으므로 어떤 벤더도 모델을 회수할 수 없습니다.
두 주장 모두 정직하며 서로 다른 우려에 답한다. 바덴뷔르템베르크의 공공 부문 구매자는 관할권과 감사 가능성을 걱정하는데, Kolibri는 바로 그 걱정을 겨냥한다. 나이로비나 상파울루의 연구 그룹은 모델이 자신들이 결제할 수 없는 통화의 신용카드 장벽 뒤에 가로막혀 있는 것을 걱정하는데, 공개된 Qwen 가중치는 그 우려를 겨냥한다. 정직하지 않은 것은 둘 중 어느 하나를 역량 비교인 척하는 것이다. 왜냐하면 역량 표가 이미 답을 내놓았기 때문이다.

라이선스 격차는 실재하지만 들리는 것보다 좁다
Kolibri는 Apache 2.0입니다. Qwen3.8 27B는 Apache 라이선스가 적용된 오픈 웨이트입니다. 둘 다 허용적 사용 부속 조항도, 월간 활성 사용자 기준도, 별도의 상업적 조건도 없습니다. 이는 이들을 소수의 그룹에 속하게 하며, 어느 쪽도 상업적 사용 전에 법률 검토가 필요하지 않다는 뜻입니다.
이 둘을 구분하는 것은 라이선스 뒤에 따라오는 모든 것입니다. Kolibri는 벤더에서 제공하는 vLLM 플러그인과 파서 패키지, 컨테이너 이미지, 채팅 템플릿을 통해 구성할 수 있는 네 가지 추론 노력 수준, 명시적인 답변 유보 동작, 그리고 권장 샘플링 구성을 함께 제공합니다. Qwen3.8 27B는 Transformers, vLLM, SGLang이 이미 서빙할 줄 아는 가중치로 제공되며, 더 넓은 생태계가 몇 달 동안 받아들일 수 있었던 도구 호출 형식을 갖추고 있습니다.
배포 하드웨어도 같은 양상으로 차이가 난다. Kolibri의 FP8 가중치는 약 78GB의 풋프린트를 가지며, 최소 요건은 A100 80GB 카드 두 장, H100 SXM5 두 장, H200 한 장, B200 한 장 또는 B300 한 장이다. bfloat16의 Qwen3.8 27B는 가중치가 대략 54GB인데, 이는 전체 정밀도에서는 단일 80GB 가속기로, 양자화 빌드에서는 훨씬 적은 사양으로 가능하다. 독일 모델은 더 많은 하드웨어를 요구하면서 그 대가로 더 낮은 벤치마크를 돌려준다. 그것은 당신이 벤치마크를 사려는 경우에만 나쁜 거래다.
가격표가 알려주는 것과 알려주지 않는 것
Kolibri에는 가격이 없습니다. Aleph Alpha가 Kolibri에 대한 추론을 판매하고 있지 않기 때문입니다. 이번 릴리스는 가중치, 기술 보고서, 카드로 구성되며, 호스팅되는 SKU는 없습니다. Kolibri에 관한 어떤 비용 수치든, 그것은 직접 계산하는 하드웨어 감가상각 산출일 뿐입니다.
Qwen3.8은 공개적으로 세 가지 등급으로 가격이 책정되어 있으며, 자체 호스팅과 임대를 비교하는 팀에게 중요한 것은 중간 등급입니다.
• Qwen3.8-Max — 입력 토큰 100만 개당 $2.00, 출력 $6.00, 1M 토큰 컨텍스트, 캐시 읽기 $0.25, 2026년 8월 3일 출시.
• Qwen3.8-27B — 입력 $0.33, 출력 $2.40, 262,144토큰 컨텍스트, 2026년 8월 13일 출시. 오픈 웨이트이므로, 직접 실행하고 싶지 않다면 이 가격을 지불하면 됩니다.
• Qwen3.8-Flash — 1M 토큰 윈도우 기준 입력 $0.15, 출력 $0.47, 2026년 8월 26일 출시.
의 제공업체 정가입니다토큰당 아무것도 더하지 않고 그대로 전달되는 OrcaRouter, 이는 자체 호스팅 배포가 비용을 회수하는지가 관건일 때 유용한 특성입니다. 하드웨어에 투자하기 전에 호스팅 티어에서 실제 토큰 볼륨을 측정할 수 있으니까요. 우리는 마진을 붙이지 않으므로 공급업체의 가격 인하는 같은 날 우리 쪽에도 반영됩니다. Qwen3.8의 세 가지 티어 모두 오늘 제공업체 전반에 걸친 자동 장애 조치 기능을 갖춘 하나의 OpenAI 호환 키로 라우팅할 수 있으며, 곧 출시될 2.4조 매개변수 Qwen3.8에는 가중치를 기다리는 카탈로그 페이지가 마련되어 있으며, 그것을 제공하는 척하는 플레이스홀더가 아닙니다.
Kolibri는 라우팅할 수 없습니다. 모든 벤더 및 모델 표기법으로 카탈로그를 조사했지만 존재하지 않습니다 — 따라서 이를 호출하는 유일한 방법은 78GB 다운로드뿐입니다. 독일 모델이 귀하의 워크로드에 얼마의 비용이 들지 알고 싶다면, 답은 랙 한 대와 vLLM을 실행할 수 있는 사람이며, 현재 제3자는 그 외의 다른 견적을 제시할 수 없습니다.

누가 어떤 것을 사야 할까
이 결정을 좌우하는 것은 품질이 아니다. 그 문제는 이미 벤더가 직접 내놓은 표에서 알리바바에 유리하게 결론이 났기 때문이다. 결정을 좌우하는 것은 당신이 어떤 위험에 대비해 보험을 사는가이다.
• 구속력 있는 제약이 관할권, 출처 문서화 또는 감사 가능성이라면 — 즉, 학습 데이터가 어디에서 왔는지, 컴퓨팅이 어디에서 실행되었고 어느 법에 따라 수행되었는지 답할 수 있어야 하고, 워크로드가 자체 경계 내에서 처리되는 독일어 및 영어 문서라면 — Kolibri를 선택하십시오. 그에 대한 대가로 기능 프리미엄을 지불하게 되며, 그 프리미엄은 위 표에서 확인할 수 있습니다.
• 바인딩 제약이 달러당 성능, 언어의 폭, 또는 생태계 지원이라면 Qwen3.8 27B를 선택하세요. 이 모델은 Aleph Alpha 자체 평가에서 더 강력한 모델이며, Apache 라이선스이고, 가속기 하나에서 실행되며, 직접 실행하고 싶지 않다면 호스팅 티어가 백만 입력 토큰당 $0.33부터 시작합니다.
• 워크로드에 규제 대상 핵심과 일반 주변부가 함께 있다면 둘 다 같은 아키텍처에서 고려하십시오. 건물 밖으로 나갈 수 없는 문서는 자체 호스팅 Kolibri 엔드포인트로 보내고, 요약·번역·코드 작업은 1,000토큰당 1센트의 3분의 1 비용으로 라우팅된 Qwen3.8 티어로 보냅니다. API 키 하나, 라우팅 규칙 하나, 공급자 정가 그대로 전달, 장애 조치까지 알아서 처리 — 이는 이 둘 중 하나를 골라 다른 하나는 존재하지 않는 척하는 것보다 훨씬 유용한 구성입니다.
