
콜리브리 vs 솔라 미니 4: 동일한 3B 활성 예산, 두 가지 매우 다른 승부수
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 217 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
두 모델은 17일 간격으로 출시되었고, 둘 다 토큰당 약 30억 개의 활성 파라미터를 사용하도록 튜닝되었지만, 실제로 도입하는 관점에서는 이보다 더 다를 수 없을 정도로 서로 다릅니다. Aleph Alpha의 Kolibri는 직접 다운로드해 서빙하는 Apache-2.0 가중치 781억 개 파라미터 모델입니다. 호스팅 엔드포인트가 존재하지 않으며, 오늘 현재까지 어디에도 이에 대한 독립적인 점수가 단 하나도 없습니다. Upstage의 Solar Mini 4는 전혀 다운로드할 수 없는 350억 개 파라미터 모델입니다. 오직 사용량 기반 과금 엔드포인트로만 존재하며, 이미 Artificial Analysis Intelligence Index 24.05를 기록하고 있습니다. 활성 파라미터 수는 각 모델을 실행하는 데 드는 비용을 알려줍니다. 그 숫자에 관한 다른 어떤 것도 시작하는 데 드는 비용을 알려주지 않습니다.
총합이 이렇게까지 벌어지는 이유 — 거의 같은 활성 슬라이스로 78.1B 대 35B — 는 둘 다 희소 전문가 혼합(mixture-of-experts) 설계이고, 두 연구소가 전문가 용량을 얼마나 예비로 남길지에 대해 반대되는 판단을 했기 때문이다. Kolibri는 전문가 384개를 보유하고 토큰당 1개의 공유 전문가와 그중 6개로 라우팅한다. Solar Mini 4는 35B/3B 분할을 공개했을 뿐 전문가 수에 대해서는 아무것도 밝히지 않는다. 두 모델이 같은 활성 수치를 내세워 광고될 때, 하드웨어 비용을 결정하는 것은 활성 수치가 아니라 전체 파라미터 수다 — 그리고 여기서는 동일한 명시적 컴퓨트 예산에서 2.2배 차이다.
각각이 실제로 무엇인지
• 총 파라미터 — Kolibri 78.10B vs Solar Mini 4 35B
• 토큰당 활성 파라미터 — Kolibri 3.46B vs Solar Mini 4 3B
• 가중치 — Kolibri Apache 2.0, Hugging Face에 전체 가중치 공개 vs Solar Mini 4는 비공개; API만 제공
• 컨텍스트 — Kolibri 1,048,576 토큰 검증됨 vs Solar Mini 4: Upstage 문서 기준 512K, Artificial Analysis 모델 카드 기준 1,048,576
• 최대 출력 — Kolibri는 벤더에 의해 제한되지 않음 vs Solar Mini 4 128,000 토큰
• 언어 — Kolibri 독일어 및 영어 vs Solar Mini 4 영어, 한국어 및 일본어
• 지식 컷오프 — Kolibri 2026년 6월 18일 vs Solar Mini 2026년 2월 4일
• 제공 방식 — Kolibri 자체 호스팅(vLLM) vs Upstage의 Console, Playground 및 온프레미스에서 호스팅되는 Solar Mini 4
• 독립 평가 — Kolibri는 공개된 결과 없음 vs Solar Mini 4 AA 인텔리전스 지수 24.05
Kolibri: 780억 개의 매개변수, 그리고 연구소 밖에서는 아무도 이 모델을 평가하지 않았다
Aleph Alpha는 2026년 10월 3일, 독일 통일의 날에 맞춰 의도적으로, 새로운 패밀리의 첫 모델이자 Kolibri Origin의 후속 모델로 Kolibri를 공개했다. 모델 카드에는 무엇이 투입됐는지가 이례적으로 상세히 밝혀져 있다: 사전 학습에 20조 토큰, 중간 학습에 3.44조 토큰, 장문맥 학습에 2,010억 토큰이 사용됐으며, 768대의 B200 GPU에서 21일 동안 실행되어 약 6.4×10²³ FLOPs를 수행했고 약 950 MWh를 소비했다. 벤더는 실패 횟수까지 자발적으로 공개한다 — 계획되지 않은 중단 38건, 약 10,000 GPU-시간당 1건 — 이는 연구소들이 보통 빼놓는 종류의 수치다.

아키텍처는 깔끔한 희소 MoE 설계입니다. 50개 레이어에 슬라이딩 윈도우 어텐션(512토큰 윈도우) 대 전역 어텐션 비율이 4:1이며, 전역 어텐션은 다섯 번째 레이어마다만 작동합니다. 128×128 블록 스케일링을 적용한 FP8 가중치와 FP8 KV 캐시를 사용합니다. 비교하자면 Kolibri Origin은 8개씩 라우팅되는 128개 전문가, 768차원의 전문가 은닉 차원, 모든 레이어의 전체 어텐션을 사용했으며, 2024년 9월에 끊긴 영어 데이터를 사용했습니다. Kolibri는 512차원 은닉 차원을 가진, 6개씩 라우팅되는 384개 전문가로 전환하고, 두 언어의 컷오프를 모두 2026년 6월 18일로 연장합니다.
독일어 파이프라인은 다른 곳에서 사들이기가 정말 어려운 부분이다. Aleph Alpha는 자체 UniBPE 토크나이저를 학습시켰고, 독일어 텍스트를 토큰당 4.90바이트로 보고하는데, 이는 GPT-5의 4.35, Qwen3.5의 4.17, Gemini의 4.13과 대비된다. 이는 어떤 최전선 다국어 모델보다 더 나은 독일어 압축을 주장하는 토크나이저이며, 주권적 배포 제안의 구체적인 메커니즘이기도 하다: 독일어 문서당 더 적은 토큰은 더 적은 과금 토큰과 동일 하드웨어에서 더 긴 실효 윈도우를 의미한다.
Kolibri에 대해 존재하는 모든 성능 수치는 Aleph Alpha 자체 모델 카드에서 나온 것이며, 그렇게 읽어야 합니다. 벤더가 보고한 표에서 Kolibri는 영어 평가에서 종합 75.5, 독일어에서 70.8, GPQA Diamond는 영어 84.3 대 독일어 81.3, Humanity's Last Exam은 영어 21.5 대 독일어 15.9, SWE-Bench Verified 66.4, LiveCodeBench v6 85.9, AA-LCR 68.3을 기록했습니다. 이는 감사되지 않은 수치입니다. Kolibri에 대한 Artificial Analysis 페이지는 없습니다 — 해당 트래커의 모델 URL은 404를 반환합니다 — 따라서 그 표의 어떤 것도 독립적으로 재현된 바 없으며, 지금 읽고 계신 이 기사가 그것을 실제보다 더 견고하게 만들 수는 없습니다.
이 카드가 확실하게 만들어 주는 것은 서빙 스토리입니다. 하드웨어 최소 사양은 A100 80GB 2장, 또는 H100 SXM5 2장, 또는 H200, B200, B300 1장입니다. 공개된 vLLM 레시피는 --kv-cache-dtype fp8 및 전용 추론 및 도구 호출 파서와 함께, temperature 1.0, top-p 0.97, top-k 128로, reasoning_effort 다이얼을 none, low, medium, high까지 아우르며 실행합니다. 78B 모델을 1M 토큰 검증 컨텍스트에서 서빙하는 단일 B300이 이 제안의 구체적인 형태입니다: 박스를 구매하면, 이후에는 모든 토큰의 한계 비용을 부담하게 됩니다.
Solar Mini 4: 3B 활성 슬라이스를 구매하는 대신 임대합니다
Solar Mini 4는 2026년 9월 22일에 출시되었습니다 — 스냅샷 solar-mini4-260922, 별칭 solar-mini4 — Upstage의 에이전트 지향 소형 모델로: 총 35B, 활성 3B, 2026년 2월 컷오프, 영어, 한국어, 일본어를 지원하며, 채팅, 추론, 구조화 출력, 도구 호출 모드를 갖추고 있습니다. Upstage의 Console 및 Playground와 온프레미스 배포를 통해 이용할 수 있지만, 가중치 다운로드도, 검토할 라이선스도 없습니다. Upstage의 문서에는 이 모델에 대해 "데이터 미수집"이라고 기록되어 있는데, 이는 실제 트래픽에 노출할 경우 중요한 규정 준수 항목입니다.

콜리브리와 달리, Solar Mini 4는 독립적인 하네스를 거쳤다. Artificial Analysis는 이를 Intelligence Index 24.05로 평가했으며, Terminal-Bench 4.0에서 1.01%, SciCode에서 47.6%, AA-LCR에서 83.3%, Humanity's Last Exam에서 25.8%를 측정했다. Upstage의 출시 게시물은 24.1을 3B 활성 파라미터를 가진 모델 중 가장 높은 지수라고 표현하며, Qwen3.6 35B A3B의 18과 Nemotron 3.5 Lightning의 13을 앞선다고 한다. 이 표현은 가능한 범위에서는 공정하며, 들리는 그대로 정확히 좁은 주장이라는 점을 짚을 만한데, 이는 일반적인 소형 모델에 대한 주장이라기보다 3B 활성 모델군에 대한 주장이기 때문이다.
예산을 책정하는 방식을 결정해야 하는 측정 기준은 Index가 아닙니다. Artificial Analysis의 작업당 비용 분석에 따르면 Solar Mini 4를 Intelligence-Index 작업당 약 $0.36으로 평가하며, 그중 약 $0.30 — 약 82% — 는 프롬프트 캐시 쓰기. 캐시 읽기는 $0.03이고 생성된 출력은 $0.035에 불과합니다. 이 모델은 작업당 약 88,300개의 출력 토큰을 생성하며, 그중 약 71,600개는 추론 토큰입니다. 즉, 이는 다시 작성하는 토큰이 아니라 긴 컨텍스트를 다시 작성하는 것이 비용을 주도하는 저렴한 모델입니다. 평가당 비용은 Terminal-Bench 4.0의 경우 $1.63에서 AA-Briefcase의 경우 $0.95까지입니다. 중간 출력 속도는 초당 198토큰이며, 첫 청크까지 걸리는 시간은 1.58초입니다.
각 경로의 가격
Solar Mini 4는 오늘 정가로 책정되어 있지 않습니다. Upstage의 가격 정책은 이 모델에 대해 날짜가 붙은 사다리를 운영합니다: 입력 $0.03, 캐시 $0.003, 출력 $0.12 — 70% 출시 할인 — 2026년 10월 10일 UTC까지, 그다음 10월 11일부터 $0.05 / $0.005 / $0.20, 마지막으로 10월 23일부터 정가 $0.10 / $0.01 / $0.40입니다. Upstage의 출시 게시물은 가격 페이지의 일정보다 할인을 더 느슨하게 설명합니다; 위 사다리는 날짜가 붙은 버전이며, 계획의 기준으로 삼을 만한 쪽입니다. 가장 가파른 할인이 어디에 있는지 주목하세요: 캐시 입력은 입력 요율의 10분의 1로 떨어지며, 이는 위의 캐시 쓰기 비용 프로필이 과금하는 바로 그 장기 안정 컨텍스트 워크로드에 정확히 보상을 줍니다.
Kolibri의 가격은 구매 주문서다. 비교할 백만 토큰당 요금은 없다. 호스팅된 계량기가 없기 때문이다. 당신은 GPU와 전력에 비용을 지불하며, 공급업체가 공개한 유일한 비용 신호는 학습 실행 자체다: 모델을 생산하는 데 약 950MWh. 이미 추론 용량을 보유하고 있다면 Kolibri의 토큰당 한계 비용은 전력 비용에 가까워진다. 그렇지 않다면 입장권은 A100 두 장이 들어간 박스 또는 그보다 나은 구성이다. 그것은 백만 토큰 단위로 호출하고 내일이면 호출을 중단할 수 있는 모델과는 근본적으로 다른 형태의 약정이며, 이것이 두 선택지가 제시하는 실제 결정이다.
그들이 겹치는 곳, 그리고 비교가 깨지는 곳
• 활성 연산 — 거의 동일: 토큰당 3.46B 대 3B
• 그것에서 비롯되는 모든 것은 — 비교할 수 없다. 둘 중 하나만이 검증된 증거를 조금이라도 가지고 있기 때문
• 측정된 최고 점수 — Solar Mini 4는 감사를 거친 Index가 24.05입니다. Kolibri는 벤더 표가 있고 감사된 점수는 전혀 없습니다.
• 독일어 — Kolibri는 둘 중 이 언어를 위해 훈련된 유일한 모델로, 토큰당 4.90바이트입니다; Solar Mini 4는 이를 명시하지 않습니다.
• 한국어와 일본어 — Solar Mini 4는 둘 다 표시하지만 Kolibri는 둘 다 표시하지 않습니다
• 긴 컨텍스트 — Kolibri는 전체 1,048,576 토큰을 검증합니다. Solar Mini 4의 자체 문서에는 512K라고 나와 있지만 Artificial Analysis 카드에는 1M이라고 표시되어 있으므로, 상한은 벤더에 따라 달라지는 것으로 취급하세요.
{{1}}Mini 4{{/1}}까지 걸리는 시간은 몇 분입니다. 서명만 하면 되니까요; Kolibri는 며칠입니다. 랙에 장착해야 하니까요
• 비용 모델 — 토큰당, 할인 단계에 따라 하락하며, 자본 및 전력 대비
솔직히 요약하자면, 이것은 리더보드에서 결판낼 수 있는 맞대결이 아니다. Kolibri의 벤더 표에는 자체 비교 세트까지 포함되어 있다 — GLM-4.7 Flash 30B-A3B는 영어 종합 64.7, Nemotron 3 Nano 30B-A3B는 65.6, Qwen3.5 35B-A3B는 74.7, Qwen3.6 35B-A3B는 71.4, Gemma 4 26B-A4B IT는 71.9이며, 모두 Kolibri 자체의 75.5와 비교한 수치다 — 그리고 그 행들 각각은 Aleph Alpha 자체 수치이며, 같은 연구소가 자체 하네스에서 실행한 것이다. 이는 3B 활성 영역의 유용한 지도다. 독립적인 순위는 아니다.
오늘 원하는 것이 키에 있는 3B-active MoE라면
이 비교에 나오는 두 모델 중 어느 것도 OrcaRouter에 없으며, 그 이유를 분명히 짚고 넘어갈 가치가 있습니다. Kolibri는 아직 어떤 형태의 호스팅 추론도 제공하지 않습니다. 즉, 가중치와 vLLM 레시피일 뿐이라 라우터가 가리킬 대상이 없습니다. Solar Mini 4는 Upstage와 Upstage 자체 온프레미스 채널을 통해 제공됩니다. 저희는 이를 라우팅하지 않으며, 어떤 Upstage 모델도 라우팅하지 않습니다. 둘 중 하나를 원하시면 각 공급업체에서 직접 받으시면 됩니다.
우리가 라우팅하는 범위는 주변 클래스, 즉 이 두 모델이 함께 경쟁하고 있는 희소 소형 MoE 대역입니다. Gemma 4 26B-A4B IT는 백만 토큰당 입력 $0.06, 출력 $0.33에 262,144토큰 윈도로 카탈로그에 올라 있습니다. Qwen3.5 35B-A3B는 $0.057 / $0.459, Qwen3.6 35B-A3B는 $0.248 / $1.485이며 262,144토큰 윈도와 최대 출력 65,536토큰을 제공합니다. 이는 위 두 모델이 하고 있는 것과 같은 거래입니다 — 소형 모델 가격으로 사는 3B~4B 활성 슬라이스 — 하나의 API 키로 이용할 수 있으며, 제공업체의 정가가 0% 마크업으로 그대로 전달되므로 공급업체의 가격 변경이 다음 계약 갱신 때가 아니라 발표되는 당일 청구서에 반영됩니다. 자동 페일오버는 여기서 평소보다 더 중요합니다. 검증되지 않은 희소 모델을 평가할 때, 같은 키 뒤에 있는 두 번째 경로가 나쁜 오후가 장애로 이어지는 것을 막아주기 때문입니다.

해야 할 일과 주의할 점
독일어나 영어가 워크로드라면, 데이터가 자체 랙을 떠날 수 없다면, 그리고 78B를 FP8로 서빙할 GPU를 이미 보유했거나 기꺼이 구매할 의향이 있다면 Kolibri를 선택하세요. 그 구성에서는 이 두 모델 중 유일하게 선택지가 되는 모델이며, 4.90바이트/토큰 독일어 토크나이저를 사용하는 1M 토큰 검증 컨텍스트는 벤더 측정치이긴 해도 실질적인 장점입니다. 이번 주에 프로덕션에 들어가고 싶다면, 한국어나 일본어가 로드맵에 있다면, 그리고 캐시 할인이 보상하는 길고 안정적인 컨텍스트가 워크로드라면 Solar Mini 4를 선택하세요. 출력 토큰이 아니라 캐시 쓰기에 예산을 배정하세요.
두 경우 모두 미해결 질문은 같으며, 그것은 역량의 문제라기보다 증거의 문제다. Kolibri의 75.5와 84.3은 Aleph Alpha 자체 하네스에서 나온 Aleph Alpha 자체 수치이고, 독립적인 트래커가 이를 실행하기 전까지 그 수치를 인용하는 사람은 연구소를 인용하는 셈이다. Solar Mini 4의 24.05는 실제이며 재현되었지만, Index는 아직 할인 사다리 중간에 있는 모델의 스냅샷이며, 정가는 10월 23일에야 나온다. Kolibri의 첫 독립 평가를 주시하고, 할인 사다리가 끝난 뒤 Solar Mini 4의 실제 비용이 얼마인지 지켜보라 — 왜냐하면 $0.10 / $0.40에서는 3B 슬라이스를 임대하는 경제성이 오늘 제시받고 있는 $0.03 / $0.12와 달라 보이기 때문이다.
