Qwen 3.8 vs Kimi K3: 중국의 양대 거인, 이제 하나는 더 저렴해졌다
Guides & Insights

Qwen 3.8 vs Kimi K3: 중국의 양대 거인, 이제 하나는 더 저렴해졌다

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 둘은 2026년 가장 영향력 있는 중국 프론티어 모델 두 가지로, 가까운 사촌 관계입니다. 둘 다 거대한 희소 전문가 혼합(Mixture-of-Experts) 시스템이며, 100만 토큰 컨텍스트를 지원하고, 멀티모달이며, 오픈 가중치를 약속합니다.Kimi K3는 Moonshot의 모델로, 실제로 두 모델 중 더 크며, Qwen의 2.4T와 비교해 총 2.8T 파라미터를 보유합니다 — 파라미터 수가 순위를 결정하지 않는다는 유용한 상기점입니다.

2026년 8월 3일까지 이 비교는 특정한 방식으로 한쪽으로 치우쳐 있었습니다: Kimi K3는 검증된 Artificial Analysis Intelligence Index 57.1, LMArena 프론트엔드 코드 부문 1위, 공개된 가격, 그리고 배포된 가중치를 보유한 반면, Qwen3.8-Max는 2.4T라는 헤드라인 수치 외에는 아무것도 없었습니다. GA는 경제성을 결정적으로 바꾸었습니다. Qwen은 이제 토큰 100만 개당 $2/$6를 공개하는 반면, Kimi는 $3/$15입니다. 이는 더 크고 더 검증된 모델이 훨씬 더 비싼 쪽이 되게 합니다.

빌더를 위한 참고 사항 — 이 문제를 해결하는 가장 빠른 방법은 두 가지를 직접 프롬프트에서 실행해 보는 것입니다. OrcaRouter는 하나의 OpenAI 호환 엔드포인트 뒤에 200개 이상의 모델을 연결하므로, 두 개의 SDK를 연결하지 않고도 동일한 작업에서 Qwen 3.8 Max와 Kimi K3를 비교할 수 있습니다.

TL;DR 결론.Kimi K3는 여전히 증거에서 승리합니다: 감사받은 AA Intelligence Index 57.1 (#3), LMArena frontend-code #1 자리(1679), 그리고 실제로 준비된 오픈 가중치. Qwen3.8-Max는 독립 평가 기관에서 전혀 점수를 받지 못했습니다. 그러나 GA는 Qwen에게 두 가지 실질적인 이점을 안겼습니다. 가격 측면에서 이제는 상당히 저렴합니다 — $2 / $6 대비 $3 / $15, 즉 출력 비용이 2.5배 더 낮습니다. 그리고 존재하는 유일한 1:1 제3자 테스트에서, Qwen은 헤드라인 80 대 83으로 패배했지만, 눈에 띄게 더 나은 행동을 보인 에이전트였습니다: 저장소 인용 354 대 274, 게이트웨이 요청 22 대 53, 실패한 도구 호출 0 대 2. Kimi는 검증된 품질, Qwen은 더 저렴하고 깔끔한 에이전트 실행.

주요 시사점

Kimi K3는 더 큰 모델입니다 — Qwen의 2.4T에 비해 2.8T MoE로 약 400B가 더 많으며 — 이는 파라미터 수를 성능의 대리 지표로 취급하는 것에 반대하는 좋은 논거입니다.

Qwen3.8-Max는 2026년 8월 3일부터 GA(일반 공급)이며, 가격은$2 / $6 플랫 1M당, Kimi K3의 $3 / $15(AA 블렌드 약 $2.31)와 비교 시. Qwen은 이제 출력에서 2.5배 저렴.

Kimi K3는 검증된 순위를 보유하고 있습니다: AA Intelligence Index 57.1 (#3) — Fable 5와 GPT-5.6 Sol만이 앞섬 — 그리고 LMArena frontend-code #1 (1679). Qwen3.8-Max는 아직 평가되지 않았습니다.

유일한 직접 테스트(Trilogy AI)에서 Kimi는 Qwen을 83 대 80으로 간신히 이겼지만, 전반적으로 Qwen은 더 많은 레포 인용(354 대 274), 더 적은 게이트웨이 요청(22 대 53), 그리고 실패한 도구 호출 0건(2건 대비)을 보였으며, 도구 사용 평가에서 9/10으로 Kimi의 8/10보다 높았다.

Qwen은 이제 에이전트 및 코딩 수치를 보고합니다: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (전작의 40.7에서) — 모두 Alibaba가 보고한 수치입니다.

공개 시점은 여전히 Kimi에게 유리합니다: 그 가중치는 사실상 준비가 끝났고, Qwen의 것은 이번 주 내로 약속되어 있지만 아직 라이선스나 저장소는 없습니다.

정확성 참고: 모든 Qwen3.8-Max 품질 수치는 Alibaba가 보고한 수치로, 제3자 검증을 거치지 않았습니다. Kimi K3 수치는 Artificial Analysis와 LMArena에서 제공되었습니다. 맞대결 비교는 Trilogy AI의 단일 테스트로, 일반적인 순위가 아닌 하나의 데이터 포인트로 간주해야 합니다. Qwen 가격은 GA 요금표를 기준으로 하며 7월 미리보기 할인을 대체합니다.

사양과 가격, 나란히

여기 확실한 데이터가 있습니다. 각 수치에는 출처가 표기되어 있습니다.

• 제조사 / 상태 — Qwen3.8-Max: Alibaba; GA (2026년 8월 3일); Kimi K3: Moonshot; 오픈 웨이트 릴리스

• 아키텍처 — Qwen3.8-Max: 총 약 2.4T, 희소 MoE (활성 파라미터는 아직 공개되지 않음); Kimi K3: 2.8T MoE, 네이티브 비전 (Artificial Analysis)

• 컨텍스트 창 — Qwen3.8-Max: 1M 토큰 (추론 포함 983,616; 최대 출력 131,072); Kimi K3: 1M 토큰 (Artificial Analysis)

• AA Intelligence Index — Qwen3.8-Max: 아직 점수 없음; Kimi K3: 57.1 — 3위 (Artificial Analysis)

• 아레나 / 리더보드 — Qwen3.8-Max: 공개 점수가 없음; Kimi K3: 프론트엔드 코드 #1, 1679 (LMArena)

• 벤더 보고 점수 — Qwen3.8-Max: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1 (Alibaba 보고 기준); Kimi K3: 순위는 제3자 측정 기준

• 가격(입력/출력) — Qwen3.8-Max: $2.00 / $6.00 1M당 고정 요금, 캐시 입력 $0.25; Kimi K3: $3 / $15 1M당 (AA 혼합 ~$2.31), 캐시 적중 $0.30

• 오픈 가중치 — Qwen3.8-Max: 이번 주 내 출시 예정 (아직 라이선스 없음); Kimi K3: 오픈 가중치; 가중치 준비 완료

• 속도 — Qwen3.8-Max: p50 TTFT 1.64s (OrcaRouter 7일 텔레메트리); Kimi K3: 장황하고 느림 (~34s TTFT, AA 기준)

이 비교를 규정하는 두 가지가 있는데, 그중 하나는 8월 3일에 완전히 반전됐다.

첫째, 가격 관계가 역전되었습니다. 7월까지 Kimi K3는 실제 가격이 있는 모델이었고 Qwen은 할인 쿠폰이 있는 모델이었습니다. 이제 양쪽 모두 요금을 공개하며, 더 검증된 더 큰 모델이 더 비쌉니다: $3 / $15 대 $2 / $6. 출력에서는 — 추론과 코드 생성이 비용을 소비하는 부분 — Kimi는 2.5배 더 비쌉니다. Qwen은 또한 전체 1M 토큰 컨텍스트에 걸쳐 균일 요율을 부과하며, 캐시된 입력은 $0.25로 Kimi의 $0.30 캐시 적중률보다 약간 낮습니다. 대용량 워크로드의 경우 Qwen의 경제성이 이제 확실히 더 나아졌습니다.

둘째, 증명 격차는 변함이 없으며, 그것이 Kimi가 여전히 이기는 이유입니다. Kimi K3의 57.1 Intelligence Index는 Fable 5와 GPT-5.6 Sol에 이어 전체 3위를 차지합니다 — 이는 중립적 평가자의 판정입니다. LMArena 프론트엔드 코드 부문 1679점으로 1위를 기록한 것은 수많은 맹검 비교에서 얻은 크라우드소싱 결과입니다. Qwen의 Terminal-Bench 86.6과 GPQA Diamond 92.6은 실제 수치이지만, 다른 누구도 실행하지 않은 하네스에서 나온 Alibaba 자체의 결과입니다. 유용한 기준점 하나: 이전 모델 Qwen3.7-Max가 기록한 수치는 46이며, AA 지수에서 Kimi의 57.1과 비교했을 때 Qwen이 고작 동등해지는 데에도 큰 세대 도약이 필요합니다.

주목할 만한 지연 시간 이슈도 있습니다. 이는 일반적인 예상과 배치되기 때문입니다. Artificial Analysis의 측정에 따르면 Kimi K3는 대략 첫 토큰까지 34초가 걸립니다 — 확실히 느립니다. OrcaRouter의 GA 텔레메트리에 따르면 Qwen3.8-Max의 p50 TTFT는 1.64초. 이 측정값들은 서로 다른 출처에서 나온 것이며 통제된 비교는 아니지만, 프리뷰 시절의 가정, 즉 Qwen이 둘 중 더 느리다는 가정을 복잡하게 만듭니다.

유일한 맞대결 테스트, 주의 깊게 읽으세요

이 시리즈에서 제3자가 두 모델을 동일한 작업에 대해 서로 맞붙게 한 유일한 매치업이므로, 승자를 요약하기보다는 자세히 읽어볼 가치가 있다.

Trilogy AI는 아키텍처 이해 과제 — 실제 저장소를 이해하고 올바른 아키텍처 결론에 도달하는 과제 — 를 수행하고 결과를 채점했습니다:

• 종합 점수 — Qwen3.8-Max: 80 / 100; Kimi K3: 83 / 100

• 저장소 인용 — Qwen3.8-Max: 354; Kimi K3: 274

• 게이트웨이 요청 — Qwen3.8-Max: 22; Kimi K3: 53

• 실패한 도구 호출 — Qwen3.8-Max: 0; Kimi K3: 2

• 도구 사용 평가 — Qwen3.8-Max: 9 / 10; Kimi K3: 8 / 10

• 캐시 적중률 — Qwen3.8-Max: >90%; Kimi K3: >90%

Kimi는 헤드라인에서 3점 차로 승리했습니다. 하지만 프로세스 열을 보십시오. 에이전틱 엔지니어링에서는 점수보다 그 열들이 더 중요하기 때문입니다. Qwen은 동일한 핵심 아키텍처 결론에 도달했습니다. 사용한 것은게이트웨이 요청의 절반 미만이었고, 그러면서 생성한 것은29% 더 많은 근거 인용이었으며, — 에이전트를 구축하는 모든 이가 관심을 가질 만한 세부 사항 —도구 호출 실패는 Kimi의 두 번과 대조적으로 0회였습니다.

실패한 도구 호출이 실제로 프로덕션 에이전트를 망가뜨리는 요소입니다. 그것들은 연쇄적으로 작용합니다. 잘못된 형식의 호출은 모델이 해석해야 하는 오류를 생성하고, 이는 턴을 소비하며, 더 많은 오류를 유발할 위험이 있습니다. 한 모델이 22번의 깨끗한 요청을 수행하는 반면 다른 모델이 두 번의 실패와 함께 53번을 수행한다면, 전자가 답변에서 3점 낮더라도 운영 비용이 더 저렴하고 예측 가능합니다. Qwen의 2.5배 저렴한 출력 요금과 결합하면, 그 실행의 운영 경제성은 Qwen을 크게 선호합니다.

주의할 점은 이것이 하나의 작업, 하나의 평가자, 한 번의 실행입니다. 그것은 벤치마크 스위트가 아니며 일반화되지 않습니다. Kimi의 57.1 인덱스와 #1 프론트엔드 순위는 이 단일 테스트보다 훨씬 많은 증거에 기반합니다. 올바른 결론은 좁습니다: 적어도 하나의 현실적인 에이전트 작업에서 Qwen은 출력 품질에서 약간 떨어지면서도 더 규율 있는 도구 사용자였습니다.

실제 비용: 에이전틱 실행은 대규모로 이루어진다

리포지토리 분석 에이전트를 예로 들어보겠습니다: 실행당 코드 컨텍스트 토큰 250,000개, 출력 토큰 12,000개입니다.

Qwen3.8-Max: 0.25M × $2 = $0.50, 더하기 0.012M × $6 = $0.072. ≈ 실행당 $0.57.

Kimi K3: 0.25M × $3 = $0.75, 더하기 0.012M × $15 = $0.18. ≈ 회당 $0.93.

• 하루 1,500회 실행 시: Qwen ≈ $858/day; Kimi ≈ $1,395/day — 월 약 $16,000 차이입니다.

• 안정적인 저장소에서 캐싱을 사용할 때: Qwen의 캐시 입력 $0.25/1M은 실행 비용을 ≈ $0.14; Kimi의 $0.30 캐시 적중률은 그것을 ≈ $0.26.

격차는 양쪽 모두에서 실제로 존재하며, Trilogy 결과가 이를 더욱 가중시킨다. Qwen이 실제로 비교 가능한 작업을 완료하는 데 게이트웨이 요청의 절반 미만을 사용한다면, 에이전트 작업에서의 실질 비용 차이는 요금표만으로 암시되는 것보다 더 크다.

두 모델 모두 사고 토큰을 출력으로 청구하므로, 추론이 많은 구성은 어느 쪽이든 단순 추정보다 비용이 더 많이 듭니다. 하지만 Qwen의 $6 요금은 그 패널티를 2.5배 더 작게 만듭니다.

개방성: 거의 대등, 시기 상이

이것은 두 모델이 가장 유사한 축이며, 차이는 순전히 준비 상태에 관한 것입니다. Kimi K3의 가중치는 공개되어 있고 사실상 준비가 끝났습니다. Qwen3.8-Max의 가중치는 이번 주 안에 제공될 예정이지만, 아직 라이선스 텍스트, 모델 카드, 저장소가 없습니다. — 그리고 라이선스는 모델을 상업적으로 사용할 수 있는지 여부를 결정하는 요소입니다.

현실적으로, 두 플래그십 모두 일반 팀이 자체 호스팅할 수 없습니다. 2.4T의 Qwen은 4비트에서 약 1.2TB로, H200당 약 141GB에 해당합니다. 2.8T의 Kimi는 더욱 큽니다. 둘 다 8개 이상의 최상급 가속기가 필요하며, Alibaba가 공개하지 않은 활성 파라미터 수 때문에 Qwen의 처리량조차 모델링할 수 없습니다.

그래서 동시에 발표된 Qwen3.8-27B가 여기서 중요합니다. 또한 오픈 가중치를 채택하고 보고에 따르면 약 17GB의 VRAM에서 실행되므로, Qwen 제품군에 2.4T 플래그십도 2.8T 플래그십도 제공하지 못하는 진정한 온프레미스 스토리를 제공합니다. 오픈 가중치가 이 두 플래그십 중에서 선택하는 실제 이유라면, 27B는 두 대형 모델 중 어느 것보다도 판도를 바꿉니다.

자주 묻는 질문

Qwen 3.8이 Kimi K3보다 더 좋나요?

감사된 증거에 기반한 것은 아니다. Kimi K3는 독립적 AA Intelligence Index 57.1(#3)을 보유하고 있으며, LMArena의 프론트엔드 코드 부문 1위 자리를 차지하고 있다. 반면 Qwen3.8-Max는 모든 제3자 평가 기관에서 점수를 받지 못했다. 이용 가능한 유일한 직접 테스트에서 Kimi가 83 대 80으로 승리했다. Qwen의 장점은 가격(출력 비용이 2.5배 저렴)과, 같은 테스트에서 더 깔끔한 도구 사용이다.

어느 모델이 더 큰가요?

Kimi K3는 총 파라미터 2.8T로 Qwen3.8-Max의 2.4T보다 약 400B 더 많습니다. 하지만 어느 쪽도 그 차이가 의미를 갖기에는 충분한 정보를 공개하지 않습니다. 알리바바는 Qwen의 활성 파라미터 수를 공개한 적이 없는데, Mixture-of-Experts(MoE) 모델에서 서빙 비용을 실제로 결정하는 것은 바로 이 수치입니다.

어느 게 더 싸요?

Qwen3.8-Max, 분명히, GA 이후로. 1M당 $2 / $6으로 Kimi K3의 $3 / $15와 비교됩니다 — 입력은 33% 저렴하고 출력은 2.5배 저렴합니다. Qwen의 요금은 전체 1M 컨텍스트에 걸쳐 일정하며, 캐시된 입력 가격($0.25)은 Kimi의 캐시 적중 요금($0.30)보다 약간 낮습니다.

직접 대결 테스트가 실제로 무엇을 보여줬나요?

Trilogy AI의 아키텍처 이해 과제에서 Kimi는 83점, Qwen은 80점을 기록했습니다. 하지만 Qwen은 Kimi의 274개 대비 354개의 저장소 인용을 생성했고, 53개의 게이트웨이 요청 대비 22개만 사용했으며, 두 건의 실패한 도구 호출에 맞서 실패한 도구 호출이 0건으로 기록되었고, 도구 사용 부문에서 Kimi의 8/10 대비 9/10을 획득했습니다. Kimi가 더 나은 답변을 제공했고, Qwen은 더 규율 있는 에이전트였습니다. 이는 하나의 과제이므로 순위가 아닌 하나의 데이터 포인트로 간주해야 합니다.

Qwen 3.8 Max가 프리뷰를 벗어났나요?

네, 2026년 8월 3일부터 공개된 요금표와 OpenAI 및 DashScope 호환 엔드포인트를 제공합니다. 7월의 Qoder 크레딧 캠페인은 더 이상 판매 방식을 설명하지 않습니다.

어느 것이 더 빠릅니까?

지금은 아마도 Qwen일 것이며, 이는 프리뷰 시대의 가정을 뒤집는 결과입니다. Artificial Analysis는 Kimi K3의 첫 토큰 생성까지의 시간(TTFT)을 약 34초로 측정합니다. OrcaRouter의 7일 GA 텔레메트리는 Qwen3.8-Max의 p50 TTFT가 1.64초임을 보여줍니다. 서로 다른 출처에서 나온 데이터이고 통제된 비교는 아니지만, 두 모델 모두 장황함으로 평판이 나 있으며, Kimi의 측정된 TTFT는 확실히 느립니다.

둘 중 하나를 자체 호스팅할 수 있나요?

플래그십 규모로는 현실적으로 어렵습니다. 2.4T 및 2.8T 모델은 H200급 GPU가 8개 이상 필요합니다. Kimi의 가중치는 오늘 바로 사용할 수 있지만, Qwen의 가중치는 아직 라이선스 없이 이번 주 안에 제공될 예정입니다. 진정한 온프레미스 옵션을 원한다면, 동시에 발표된 Qwen3.8-27B(약 17GB VRAM)가 Qwen 제품군에서 실용적인 선택입니다.

결론

Qwen 3.8 vs Kimi K3는 이번 시리즈에서 가장 근접한 맞대결이며, 일반 공개는 이를 두 축으로 깔끔하게 갈라놓았다. Kimi K3는 심판이 측정한 지표 덕분에 품질의 왕좌를 유지한다: Intelligence Index 57.1점으로 전체 3위, 그리고 LMArena 프런트엔드 코드 부문 1위. 이는 주장이 아니라 결과이며, Qwen에는 이에 필적할 만한 것이 없다.

8월 3일 Qwen이 이긴 것은 경제성이었고, 압도적이었습니다: $2/$6 대 $3/$15, 백만 토큰 기준 동일한 가격, 약간 더 저렴한 캐싱. 여기에 Trilogy의 연구 결과 — Qwen이 유사한 에이전트 작업을 절반의 게이트웨이 요청과 실패한 도구 호출 0건으로 완료했다는 사실 — 을 더하면, Qwen은 정확도가 떨어지는 영역에서도 운영 효율성이 더 높은 모델로 보입니다. 두 가지 이벤트를 주목하세요: Qwen3.8-Max에 대한 첫 번째 독립 Intelligence Index 점수와 라이선스와 함께 공개되는 가중치입니다. Qwen이 Kimi의 57.1에 근접한 점수를 받는다면, 가격 격차 때문에 대규모 작업에 Kimi를 선택하기가 매우 어려워집니다. 그때까지는 Kimi가 신뢰하는 모델이고 Qwen은 돌릴 여유가 있는 모델입니다 — 그리고 정직하게 선택하는 방법은 자신의 리포지토리에서 테스트하는 것입니다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트