'Qwen 4 Max vs Kimi K3'라는 제목의 생성된 히어로 카드로, 부제는 '오픈 웨이트의 약속과 오픈 웨이트의 이행이 만나다'이며, '웨이트는 약속했지만, 배포되지 않음', 'K3 웨이트, 2026년 7월 27일 공개', '수정된 MIT 라이선스'라고 적힌 세 개의 알약형 배지가 있습니다. 푸터 줄에는 'Alibaba Yunqi Conference, Hangzhou'라고 적혀 있습니다. 흰색 배경에 파란색에서 청록색으로 이어지는 그라데이션 워시를 사용한 플랫 벡터 에디토리얼 스타일링과 오른쪽 아래에 합성된 OrcaRouter 로고.
Engineering & Research

Qwen 4 Max vs Kimi K3: 오픈 웨이트 약속이 오픈 웨이트 이행과 만나다

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Moonshot AI는 2026년 7월 16일 Kimi K3를 출시한 뒤, 대부분의 연구소가 말만 하는 일을 실제로 해냈습니다: 가중치를 공개한 것입니다. 2.8조 매개변수 체크포인트는 출시 11일 후인 2026년 7월 27일 Modified MIT 라이선스로 공개되었습니다. 한편, 2026년 9월 22일 Yunqi 컨퍼런스에서는 Qwen 4 Max를 4계층 Qwen 4 제품군의 플래그십으로 발표했는데, 여기에는 오픈 웨이트 Qwen 4 27B도 포함됩니다 — 약속된 계층이지 출시된 계층은 아닙니다. 이 두 사실이 비교의 핵심입니다. Qwen 4 Max에 관한 나머지 정보는 현재 알려지지 않았으며, 약속된 오픈 계층과 실제 제공된 계층 사이의 간극이야말로 이 맞대결이 실제로 할 말이 있는 지점입니다.

7월에 Kimi K3가 테이블 위에 올려놓은 것

Kimi K3는 2.8조 개 매개변수의 전문가 혼합(MoE) 모델로, 토큰당 896개 전문가 중 16개를 활성화하여 각 단계마다 약 1,040억 개 매개변수를 활용합니다. 입력과 출력 양쪽 모두에서 1,048,576토큰 컨텍스트 창을 지원하며, 텍스트, 이미지, 비디오 입력을 받아 텍스트를 출력합니다. 자사 API 가격은 백만 입력 토큰당 $3.00, 백만 출력 토큰당 $15.00, 백만 캐시 입력 토큰당 $0.30이며, 서드파티 요금은 그보다 낮습니다.

알리바바 자체 프리뷰가 되풀이하는 부분이 바로 아키텍처다. Kimi K3는 Kimi Delta Attention과 Attention Residuals를 기반으로 구축되었으며, Moonshot은 이것이 Kimi K2보다 약 2.5배 더 나은 스케일링 효율을, 백만 토큰 컨텍스트에서는 최대 6.3배 더 빠른 디코딩을 제공한다고 주장한다. 이는 Qwen의 QSA가 겨냥하는 것과 같은 문제, 즉 극단적인 길이에서 어텐션을 감당 가능하게 만드는 문제이며, 이는 두 패밀리가 규모에서 경쟁하는 것이 아니라 누구의 희소 어텐션 설계가 더 오래 살아남는지를 두고 경쟁하고 있음을 의미한다.

Moonshot이 출시 당시 공개한 점수, 벤더가 보고했으며 당시에는 재현되지 않은:

• Artificial Analysis Intelligence Index — 57, 당시 Claude Fable 5GPT-5.6 Sol에 이어 3위. 이 수치는 이전 지수 개정판 기준으로 기록된 것이며, 이후 지수가 두 차례 재구성되었으므로 현재 수치가 아닌 과거 기록이다.

• Frontend Code Arena — 1,679 Elo로 1위, 일반 지수에서 자신보다 높은 점수를 받은 두 모델을 모두 앞서

• Terminal-Bench 2.1 — 88.3

• SWE-Marathon — 42, Opus 4.8과 GPT-5.6 Sol보다 앞서

• DeepSearchQA — 0.95, 1위, 그리고 MATH-Vision 0.98, 역시 1위

• GPQA-Diamond — 0.94

Moonshot 자체의 출시 자료는 K3가 전반적인 역량에서 여전히 Claude Fable 5와 GPT-5.6 Sol에 뒤처진다는 점을 인정한다. 이는 위에 나온 그 어떤 1위 주장보다도 더 유용한 문장이다. 숫자에서 흥미로운 구도는 일반 지수에서 3위인 모델이 프런트엔드 코드에서 1위, 장기 지평 검색에서 1위를 차지했다는 점이다 — 이 프로필은 종합 지수가 범용 도구를 설명하기보다는 특화된 도구를 숨기고 있음을 시사한다.

A generated scoreboard titled 'Qwen 4 Max vs Kimi K3 - the scoreboard'. Left column 'Qwen 4 Max' reads announced not released, Qwen 4 27B promised, not published, not published, not published, not published. Right column 'Kimi K3' reads GA since July 16 2026, published July 27 2026, Modified MIT, $3.00 per 1M tokens, $15.00 per 1M tokens, 1,048,576 tokens. Footer reads 'Kimi K3 figures from Moonshot's launch material; Qwen 4 Max status per Alibaba's September 22 2026 Yunqi conference.'

알리바바가 약속한 것, 그리고 약속의 가치

Qwen 4 발표에서는 네 가지 등급을 명명했다. Qwen 4 Max는 플래그십, Qwen 4 Flash는 처리량용, Qwen 4 Plus는 균형 잡힌 중간 등급, Qwen 4 27B는 오픈 웨이트 로컬 등급이다. Qwen LLM 책임자 Liu Da Yiheng은 이 제품군이 차세대 아키텍처로 학습 중이라고 설명하며 곧 출시될 것이라고 말했다. 네 가지 중 어느 것에도 날짜, 모델 카드, API 식별자, 클라우드 등록 정보, 가격, 공개된 점수는 없다.

그 발표와 관련해 두 가지 특정한 사항이 잘못 보도되고 있으며, 둘 다 그 발표를 염두에 두고 계획하려는 사람에게 중요합니다:

• Qwen 4 보도에 붙은 5조~10조 매개변수 수치는 Qwen 4의 사양이 아닙니다. 그것은 Qwen 4.5 및 Qwen 5 로드맵에 속합니다. Qwen 4 Max에 대해서는 어떤 종류의 매개변수 수치도 공개된 바 없습니다.

• 티어 이름이 계속 이어진다고 해서 사양까지 승계되는 것은 아니다. Qwen 4 Max의 컨텍스트 윈도, 가격 및 라이선스는 알려지지 않았다; 출시된 Qwen3.8-Max의 수치 — 백만 개당 $2.00와 $6.00로 1,000,000 토큰 — 는 다른 모델을 설명한다

27B 등급이 흥미로운 이유는 벤치마크와는 아무 관련이 없습니다. 이 등급은 Qwen 4 라인에서 역사적으로 오픈 웨이트로 출시된 유일한 등급이며, Qwen 3.8 세대는 그것이 무엇을 가능하게 하는지 보여주었습니다. 27B 웨이트가 공개된 지 며칠 만에 커뮤니티는 MLX 변환, NVFP4 양자화, 그리고 온갖 종류의 파인튜닝을 만들어냈습니다. 27B 발표는 다운스트림 생태계에 대한 약속이며, 로드맵에서 가장 예측 가능한 제공물입니다.

하지만 예측 가능성은 제공되지 않습니다. Kimi K3의 가중치는 오늘 다운로드할 수 있는 파일입니다. Qwen 4 27B의 가중치는 컨퍼런스 발표에서 언급된 한 줄에 불과합니다.

오픈 웨이트와 실행 가능한 웨이트는 서로 다른 주장입니다.

Kimi K3를 오픈 웨이트의 해답으로 취급하는 데는 함정이 있으며, 이는 중국 프런티어 모델 보도에서 가장 흔한 과장 주장이므로 분명히 짚을 가치가 있다. 2.8조 파라미터의 전문가 혼합(mixture-of-experts)은 데이터센터 규모의 산출물이다. 공개된 웨이트는 이를 실행하도록 허가받았고, 살펴볼 수 있으며, 미세 조정할 수 있고, 양자화할 수 있다는 뜻이다. 워크스테이션에서 실행할 수 있다는 뜻은 아니다. 그 규모의 체크포인트를 효율적으로 서빙하려면 수십 대의 가속기가 필요하며, 오픈 릴리스에 뒤따르는 양자화 작업—몇 주 안에 유통되는 NVFP4 및 REAP 스타일 변형—은 모델을 더 작게 만드는 것만큼이나 모델을 서빙 가능하게 만드는 일에 관한 것이다.

그래서 Kimi K3의 라이선스를 정직하게 읽어보면, 그 범위는 더 좁지만 여전히 중요합니다. 이는 수정된 MIT 라이선스 아래에서 감사 가능하고, 수정 가능하며, 자체 호스팅 가능한 프런티어 모델로서, 이를 서빙할 하드웨어를 갖춘 조직을 위한 것입니다. 이는 진정한 전략적 자산이며, "오픈 웨이트"를 "내 노트북에서 돌아간다"는 뜻으로 읽은 사람에게는 잘 맞지 않습니다.

동일한 단서 조항은 Qwen 4 27B가 출시된다면, 그리고 실제 출시될 때에도 적용될 것입니다 — 다만 그 정도는 덜할 것입니다. 왜냐하면 27B 오픈 웨이트 계층은 2.8T 플래그십과는 달리 진정으로 로컬 규모이기 때문입니다. 바로 그렇기 때문에 이 비교에서 Qwen 4 27B 계층은 Max 계층보다 더 많은 주목을 받을 가치가 있습니다. 비록 발표가 앞세운 것은 Max 계층이었지만요.

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3), captured September 22 2026, showing the model name, the 1M token context, text and image input with text output, vision, tool and reasoning badges, and a p50 time-to-first-token figure.

라이선스 문제 아래에 깔린 상업적 문제

Kimi K3의 퍼스트파티 요금은 입력 백만 토큰당 $3.00, 출력 백만 토큰당 $15.00으로 프리미엄 포지션에 있으며, Moonshot은 중국 시장의 저가 구간보다 의도적으로 높게 책정했다고 분명히 밝혀 왔다. 입력 $2.00, 출력 $6.00인 Qwen3.8-Max와 비교하면 입력 요율은 1.5배, 출력 요율은 2.5배다. 이는 워크로드가 Kimi K3의 특정 강점, 그중에서도 프런트엔드 코드와 장기 호라이즌 검색에 신경 써야만 프리미엄을 지불할 가치가 있을 만큼 큰 격차다.

OrcaRouter는 kimi/kimi-k3를 Qwen 3.8 패밀리와 나란히 0% 마크업의 단일 OpenAI 호환 엔드포인트에서 라우팅합니다. 즉, 청구되는 금액은 마크업된 동급 요율이 아니라 벤더의 정가 요율입니다. 출력 가격 차이가 2.5배에 달하는 비교에서 플랫폼 마진의 부재는 반올림 수준의 세부 사항이 아닙니다. $15.00 출력 요율에 10퍼센트가 더해지면 백만 토큰당 $1.50인데, 이는 이 맞대결에서 더 저렴한 모델의 전체 입력 비용보다 큽니다. 동일한 엔드포인트는 자동 페일오버와 정책을 명시적으로 표현하기 위한 라우팅 DSL을 제공하며, 이는 이전에 실행해 본 적 없는 벤더에 전체 경로를 걸지 않고도 프로덕션 트래픽의 일부에서 Kimi K3의 프로필을 가진 모델을 시험해 볼 수 있는 방법입니다.

OrcaRouter가 취급하지 않는 것은 Qwen 4 Max나 어떤 Qwen 4 등급도 아닙니다. 왜냐하면 그것들 중 어느 것도 아직 제품으로 존재하지 않기 때문입니다.

A screenshot of the OrcaRouter models catalogue, captured September 22 2026, showing the filter sidebar (input modalities, context length, input price, status, series), the model card grid and a code sample posting to the OpenAI-compatible endpoint at api.orcarouter.ai.

무엇을 주시하고, 무엇을 무시할 것인가

세 가지 신호가 이 비교를 바꿀 수 있으며, 주목할 만큼 충분히 구체적입니다:

• Qwen 4 27B 가중치. Max 등급의 벤치마크 표가 아니라 — 27B 체크포인트, 그 라이선스와 크기. 바로 그 릴리스가 알리바바의 이 세대 오픈 가중치 약속이 지난 세대만큼 진짜인지 알려줄 것이다.

• Qwen 4 Max의 라이선스(있다면). Alibaba가 Qwen3.8-Max에 대해 그랬던 것처럼 자사 플래그십의 가중치를 공개한다면, 이번 맞대결에서 오픈 웨이트 논거는 Kimi의 우위가 아니라 동률이 된다

• Kimi K3에 대한 새로운 독립적 평가. Moonshot의 출시 점수는 자체 보고였고, Artificial Analysis 지수는 그 이후 두 번 재구축되었으므로, 57과 Frontend Code Arena Elo는 둘 다 현재의 어떤 것과 비교되기 전에 기준을 다시 설정해야 한다

무시해야 할 것은 Alibaba가 모델 카드를 공개하기 전에 등장하는 어떤 Qwen 4 Max 사양표와, Kimi K3의 오픈 웨이트가 이를 로컬에서 실행 가능하게 한다는 어떤 주장입니다. 두 오류는 이미 돌고 있습니다. 그동안 실제로 행동에 옮길 수 있는 비교는 존재하는 두 모델 사이의 비교입니다: 프리미엄 요금에 웨이트가 제공되고 진정으로 차별화된 코딩 프로필을 갖춘 Kimi K3, 그리고 출력 요금이 절반 이하이면서 고정된 100만 토큰 윈도우와 자체 웨이트를 갖춘 Qwen3.8-Max입니다. 이는 양쪽 모두 가격이 매겨진 실제 선택이며, 컨퍼런스 슬라이드가 제품이 되기를 기다릴 필요가 없습니다.

이 글에서 비교한 모델3

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트