생성된 히어로 타이틀 카드는 'GPT-6 Luna vs Kimi K3'라는 헤드라인과 '처리량은 네 배, 가격은 30분의 1'이라는 부제목, '가격은 OpenAI 및 Moonshot AI 기준; 지수 수치는 Artificial Analysis 기준.'이라는 바닥글을 가지며, OrcaRouter 로고가 오른쪽 아래에 합성되어 있습니다.
Guides & Insights

GPT-6 Luna vs Kimi K3: 처리량은 네 배, 가격은 30분의 1, 단 하나의 진짜 예외

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

지난 3개월 이내에 출시된 두 모델, 둘 다 프런티어 패밀리의 저가 티어로 포지셔닝되었고, 둘 다 "저가 티어"가 무엇을 의미하는지에 대해 똑같은 방식으로 틀렸다 — 전혀 틀리지 않았다는 점에서. Kimi K3는 Moonshot AI의 오픈 웨이트 플래그십으로, 2026년 7월 27일부터 Modified MIT 라이선스로 공개되었으며, 가격은 백만 입력 토큰당 $3.00, 백만 출력 토큰당 $15.00, 캐시 읽기는 $0.30이다. GPT-6 Luna는 해당 벤더의 볼륨 티어로, 2026년 9월 22일부터 정식 제공되며 가격은 $0.10와 $0.50, 캐시 읽기는 1센트다. 입력에서는 30배, 출력에서는 30배이며, 한쪽에는 다른 쪽이 어떤 가격으로도 제공할 수 없는 라이선스가 있다.

요금표가 이 페어링을 결정하는 것은 아니다. 결정할 필요가 있을 만큼 근접해 있지 않기 때문이다. 이를 결정하는 것은 어느 벤더도 헤드라인에 내세우지 않는 숫자, 즉 측정된 출력 속도다. Kimi K3는 초당 38.7토큰을 생성한다. GPT-6 Luna는 153.9를 생성한다. 이는 네 배 차이이며, 모델이 사람이 대화하는 엔드포인트가 아니라 루프 내부의 구성 요소인 모든 워크로드에서 네 배의 처리량 차이는 요금이 아니라 아키텍처를 바꾼다.

이 둘이 실제로 무엇인지

Kimi K3는 2.8조 파라미터의 전문가 혼합(MoE) 모델로, 토큰당 1040억 개의 파라미터가 활성화되며, 1,048,576 토큰 컨텍스트 윈도우, 1,048,576 토큰 출력 상한을 가지고, 가중치는 Hugging Face에 수정된 MIT 라이선스로 공개되었습니다. 이 모델은 독립 리더보드에서 최고 점수를 받은 오픈 웨이트 모델이며, 112개 오픈 웨이트 모델 중 1위이고, Code Arena의 WebDev 리더보드에서 1,679 Elo로 1위를 차지하고 있습니다. Moonshot은 Terminal-Bench 2.0에서 88.3%를 보고했지만, 이는 벤더 측 수치이며 독립적으로 재현되지 않았습니다.

GPT-6 Luna는 OpenAI의 GPT-6 세대 중 소형 등급으로, $2.00/$10.00의 GPT-6 Sol 아래에 있고, $10.00/$50.00의 플래그십 GPT-6 Astra보다 훨씬 아래에 있습니다. 텍스트와 이미지를 입력으로 받고 텍스트를 출력하며, 1,050,000토큰 창에 최대 입력 922,000, 출력 상한 128,000토큰을 제공합니다. 추론 강도는 none부터 low, medium, high, xhigh, max까지 선택할 수 있으며 기본값은 medium입니다. 폐쇄형, 단일 식별자이며, API 키가 있는 누구나 사용할 수 있습니다.

하나는 다운로드입니다. 하나는 엔드포인트입니다. 둘 다 볼륨을 기준으로 가격이 책정됩니다. 그것이 이 비교의 구도입니다.

카드, 줄별로

각 차원당 한 줄, 각 줄에 양쪽 모두:

• 1M당 입력 — GPT-6 Luna $0.10 vs Kimi K3 $3.00

• 1M당 출력 — GPT-6 Luna $0.50 vs Kimi K3 $15.00

• 1M당 캐시 입력 — GPT-6 Luna $0.01 vs Kimi K3 $0.30, 두 카드 모두 자체 입력 요율의 10분의 1

• 장문맥 조항 — GPT-6 Luna는 272,000 입력 토큰 초과 시 입력과 캐시를 두 배로 늘리고 출력을 1.5배로 높이며, 전체 요청에 적용됨 vs Kimi K3는 자체 카드에 동등한 조항이 공개되어 있지 않음

• 컨텍스트 창 — GPT-6 Luna 1,050,000 토큰, 최대 입력 922,000 vs Kimi K3 1,048,576 토큰

• 최대 출력 — GPT-6 Luna 128,000 토큰 vs Kimi K3 1,048,576 토큰, 상한의 8배

• Intelligence Index, 독립 — 최대 노력에서 GPT-6 Luna 37 vs 최대 노력에서 Kimi K3 44, 동일 인덱스 리비전

• 기본 노력 점수 — 기본 medium 설정의 GPT-6 Luna 29 대 최대 설정에서 측정한 Kimi K3

• Index 작업당 비용, 독립 기준 — GPT-6 Luna 약 $0.07 vs Kimi K3 $2.00

• 인덱스 실행 시 출력 토큰 — GPT-6 Luna 150M 대 Kimi K3 160M, 보드 중앙값 88M과 비교; 둘 다 보드의 중앙값 모델보다 훨씬 더 장황함

• 출력 속도, 독립 측정 — GPT-6 Luna 초당 153.9토큰 vs Kimi K3 초당 38.7토큰

• 가중치 — GPT-6 Luna는 비공개, API 전용 vs Kimi K3는 2026년 7월 27일부터 Hugging Face에서 공개

• 라이선스 — GPT-6 Luna는 해당 없음 vs Kimi K3 Modified MIT는 MIT와 동일한 법적 문서가 아님

• 총 매개변수 — GPT-6 Luna 비공개 vs Kimi K3 2조 8,000억, 그 중 1,040억 개가 토큰당 활성

• 눈에 띄는 증거 — GPT-6 Luna의 도구 호출 및 에이전트 루프는 캐시된 입력 토큰 1,000개당 0.1센트인 반면, Kimi K3는 Code Arena WebDev #1, Elo 1,679, Terminal-Bench 2.0 88.3%(공급업체 보고), 독립 보드에서 최고 오픈웨이트 점수

• OrcaRouter에서 — GPT-6 Luna는 당사 카탈로그에 없음 vs Kimi K3는 Moonshot의 정가로 라우팅 가능

Generated two-column scoreboard titled 'GPT-6 Luna vs Kimi K3 - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index at max effort 37, Output speed 153.9 tok/s, Context 1,050,000, Weights closed. Right column Kimi K3 rows: Price in/out $3.00 / $15.00, Cached input $0.30, AA Index at max effort 44, Output speed 38.7 tok/s, Context 1,048,576, Weights Modified MIT. Footer: 'Prices per OpenAI and Moonshot AI; index and speed per Artificial Analysis.'

처리량은 아무도 헤드라인에 내세우지 않는 스펙이다.

초당 38.7토큰 모델과 초당 153.9토큰 모델은 가격표만 다른 같은 제품이 아닙니다. 서로 다른 제품입니다.

모델이 1,500토큰 분량의 답변을 생성해야 하는 작업을 가정해 보자 — 요약, 구조화된 추출, 설명이 포함된 코드 패치 등. 초당 153.9토큰에서는 그 답변이 약 10초 걸린다. 초당 38.7토큰에서는 약 39초 걸린다. 어느 수치도 추론 시간이나 네트워크 지연을 포함하지 않으므로, 실제 격차는 비례상 4배보다 더 넓지, 좁지 않다.

이제 이것을 루프에 넣어 보자. 하나의 작업을 완료하기 위해 모델을 서른 번 호출하는 에이전트 — 계획하고, 도구를 선택하고, 결과를 읽고, 다음 단계를 결정하고, 반복 — 는 그 호출 전반에 걸쳐 아마 15,000개의 출력 토큰을 생성한다. GPT-6 Luna는 생성하는 데 약 97초를 쓴다. Kimi K3는 약 388초를 쓴다. 그것이 사용자가 기다리는 작업과 사용자가 스케줄링하는 작업의 차이이며, 라이선스가 아무리 허용적이어도 그것을 바꾸지 못한다.

장황함은 속도 문제를 상쇄하기는커녕 더욱 악화시킨다. Kimi K3는 독립 지수를 완료하면서 1억 6천만 개의 출력 토큰을 생성했고, GPT-6 Luna는 1억 5천만 개를 생성했다. 따라서 그 평가에서 더 느린 모델은 토큰을 더 적게 생성한 것이 아니라 오히려 약간 더 많이 생성한 셈이다. 두 모델은 장황함이 비슷하다. 단지 속도가 비슷하지 않을 뿐이며, 출력 기준으로 과금되는 카드에서는 장황함이 두 번 비싸게 작용한다.

Kimi K3의 결함이 아니라는 점은 분명히 말할 가치가 있습니다. 활성 매개변수 1040억 개를 가진 2.8조 매개변수 모델은 소형 티어 모델보다 토큰당 더 많은 작업을 수행하며, 처리량 수치는 바로 그 작업량을 측정한 값입니다. 관련 질문은 당신의 워크로드가 그 작업량을 필요로 하는지입니다. 필요로 한다면 초당 38.7토큰은 그 능력의 대가입니다. 필요로 하지 않는다면, 당신은 요청하지도 않은 숙고에 대해 서른 배의 값을 치르고 있는 것입니다.

K3의 일곱 개 포인트가 자리한 곳

Kimi K3는 최대 노력 설정에서 독립적인 Intelligence Index 44점을 기록합니다. GPT-6 Luna는 같은 설정에서 37점을 기록합니다. 재실행 노이즈 범위 안에 들어가는 1점이 존재하는 종합 지표에서 7점 차이이며, 두 모델은 완료된 작업당 비용에서 약 28배, 즉 2.00달러 대 약 0.07달러로 벌어져 있습니다.

그 일곱 점은 고르게 분포되어 있지 않습니다. Kimi K3의 평판은 코딩과 에이전트형 소프트웨어 작업에 집중되어 있으며, 이는 이 모델이 존재하는 이유이기도 합니다: Code Arena의 WebDev 리더보드에서는 1,679 Elo로 1위이고, 공급업체의 Terminal-Bench 2.0 수치인 88.3%는 코딩 에이전트 측정치입니다. GPT-6 Luna의 코딩상 위치 자체는 앞으로 나아간 것이 아니라 한 걸음 뒤로 물러난 것입니다 — Coding Agent Index가 41로, 자신이 대체한 GPT-5.6 Luna보다 2점 낮으며, 하락은 SWE-Atlas-QnA와 DeepSWE v1.1에 집중되어 있습니다. 당신의 작업이 실제 저장소를 대상으로 소프트웨어를 작성하는 에이전트라면, 이는 같은 방향을 가리키는 7점의 지수 격차와 2점의 세대 회귀이며, 저렴한 티어를 선택할 명분은 상당히 약해집니다.

일곱 점이 해당하지 않는 영역이 바로 GPT-6 Luna가 가격을 책정한 작업 부류다. 분류, 추출, 라우팅, 대량 요약, 빠른 예/아니오 판단이 필요한 에이전트의 내부 루프 — 이런 작업에서 두 모델은 압도적 다수의 경우 동일하게 쓸 수 있는 출력을 내며, 그 차이는 당신의 자체 평가 세트와 맞닥뜨려도 살아남지 못할 것이다. 이 지수는 장기 지평 추론과 코딩에 큰 비중을 둔 복합 지표를 측정하는데, 둘 중 어느 것도 라우팅 결정에 필요한 것은 아니다.

양쪽 지수 수치에 붙여 둘 만한 단서가 하나 있습니다. 이 보드는 롤링 평가이며, 그 개정 이력이 중요합니다. 같은 리더보드의 이전 스냅샷에서는 Kimi K3가 오늘 우리 캡처가 보여 주는 44보다 상당히 높게 배치되었는데, 이는 종합 점수, 하네스, 모델 세트가 모두 변하기 때문입니다. 롤링 지수에서 두 모델 사이의 정확한 격차에 기대는 모든 비교는 고정되어 있지 않을 무언가에 기대는 것입니다. 정직하게 읽자면, 이 둘은 각자의 상한에서 인접한 역량 대역에 있으며, 그 지수만으로는 당신의 과제에 어느 쪽이 더 나은지 알 수 없습니다.

예외: Modified MIT가 실제로 제공하는 것

Kimi K3의 라이선스는 GPT-6 Luna가 어떤 가격으로도 답을 내놓을 수 없는 유일한 차원이며, '오픈 웨이트'라는 표현이 보통 받는 것보다 더 정밀한 설명을 받을 만하다.

가중치는 Hugging Face에 공개되어 있고 라이선스는 MIT가 아니라 Modified MIT입니다. 이 구분은 중요합니다. Modified MIT 라이선스는 보통 조건을 붙이는데, 흔히 모델이 일정 규모 이상의 제품에서 사용될 때 출처 표시를 요구하는 조건이며, 이 가중치를 기반으로 상용 제품을 만들 계획이 있는 사람이라면 그것이 닮아 있는 라이선스 계열의 이름이 아니라 실제 문서를 읽어야 합니다. 이것이 사용을 피해야 할 이유는 아닙니다. 조달 문서에서 이를 MIT라고 기술해서는 안 되는 이유입니다.

다운로드가 주는 것은 실재하지만 한계가 있습니다. 그것은 비용의 하한선을 확보해 줍니다. 충분한 규모에서는 고정된 GPU 풋프린트가 종량제 청구서를 앞지를 수 있다는 의미에서입니다. 그것은 공급업체의 로드맵으로부터의 독립을 확보해 줍니다. 직접 호스팅하는 모델은 당신 모르게 지원 종료될 수 없기 때문입니다. 그것은 자체 데이터 분포로 미세 조정할 수 있는 능력을 확보해 줍니다. 그리고 그것은 프롬프트를 자체 경계 안에 유지할 수 있는 선택지를 확보해 줍니다. 일부 팀에게 이는 가격이 언급되기도 전에 비교 자체를 끝내게 합니다.

비용의 핵심은 하드웨어입니다. 1,040억 개의 활성 매개변수를 가진 2.8조 매개변수 전문가 혼합 모델은 워크스테이션에서 실행되는 모델이 아닙니다. 이를 프로덕션 처리량으로 서비스하는 것은 자본 비용, 운영 비용, 그리고 임대가 아닌 직접 소유하는 지연 시간 프로필을 수반하는 클러스터 규모의 약정입니다. 이는 Kimi K3를 자체 호스팅하는 것에 반대하는 논거가 아닙니다 — 올바른 비교는 백만 출력 토큰당 $15.00 대 $0.00이 아니라, 백만 출력 토큰당 $15.00 대 실리콘과 인력을 포함한 토큰당 총부담 비용이라는 논거입니다. 소수의 조직에게는 그 숫자가 더 낮습니다. 대부분에게는 그렇지 않으며, 손익분기점은 라이선스가 느끼게 하는 것보다 더 멀리 있습니다.

그중 하나 또는 둘 다 실행하기

Kimi K3는 Moonshot의 정가로 OrcaRouter에서 이용할 수 있습니다. 패스스루 가격 정책 아래에서 이는 벤더 요율 변경이 같은 날 우리 쪽에도 그대로 적용된다는 뜻입니다. 자동 페일오버는 특히 이 모델에서 그 진가를 발휘하는 부분입니다. 셀프 호스팅 또는 서드파티 Kimi K3 엔드포인트의 성능이 저하되는 상황은 바로 배포 없이 라우트를 전환하고 싶은 대표적인 시나리오이며, 초당 38.7토큰을 처리하는 모델은 빠른 모델보다 느린 업스트림을 흡수할 여유가 적습니다.

GPT-6 Luna는 이 글을 쓰는 시점에 우리 카탈로그에 없으며 OpenAI 자체 API를 통해 접근하므로, 둘 다 원하는 팀은 Kimi K3용 키 하나와 OpenAI에 이미 사용 중인 키를 함께 운영하게 됩니다. 이 조합은 또한 라우팅 DSL이 하드코딩된 분할로는 할 수 없는 일을 수행하는 사례이기도 합니다. 즉, 코딩과 장기적 작업은 Kimi K3로, 프로그램이 소비하는 짧은 작업은 모두 GPT-6 Luna로 보내는 규칙은 두 벤더 중 어느 쪽이든 출시할 때마다 이동하는 경계를 표현하며, 이는 코드 경로가 아니라 구성으로서 이동합니다. 모델 퓨전은 여기서 언급할 가치가 있는 또 다른 구성입니다 — 느리고 신중한 모델 하나와 빠르고 저렴한 모델 하나가 함께 답하는 패널로서, 저렴한 구성원이 물량을 처리하고 비싼 구성원이 중요한 사례를 판정하는 방식은 이 두 모델이 유난히 잘 맞는 형태입니다. 두 모델 사이의 비용 비대칭이 충분히 커서 트래픽의 작은 일부에 Kimi K3 호출을 쓰는 것이 감당 가능하기 때문입니다.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

어느 것, 그리고 언제

워크로드가 대용량이고 프로그램이 소비하며 지연 시간에 민감하다면 GPT-6 Luna를 선택하세요. 분류, 추출, 라우팅, 대량 요약, 에이전트의 내부 루프에 적합합니다. $0.10/$0.50에 1센트 캐시 읽기, Kimi K3 처리량의 4배라면 계산은 비교가 되지 않고 지연 차이도 미미하지 않습니다. effort 매개변수를 명시적으로 설정하세요. 기본값은 medium이고 대표 수치 37은 최대 effort 수치이기 때문입니다. 그리고 긴 호출은 272,000토큰 선의 올바른 쪽에 유지하세요.

가중치가 필요하다면, 당신의 작업이 실제 저장소를 대상으로 하는 에이전트형 코딩이고 그 작업에서 중요한 증거가 WebDev 순위와 공급업체가 보고한 Terminal-Bench 2.0의 88.3%라면, 128,000토큰을 초과하는 출력 상한이 필요하다면, 또는 조직에서 폐쇄형 엔드포인트로 프롬프트를 보낼 수 없다면 Kimi K3를 선택하세요. 초당 38.7토큰을 이 거래의 일부로 받아들이고, Modified MIT 약관을 당연시하지 말고 읽어 보세요.

이 비교가 불러오는 실수는 30배라는 비율을 능력에 관한 질문의 답으로 취급하는 것이다. 그것은 토큰에 관한 질문의 답이다. 능력에 관한 질문은 가중치가 필요한지 속도가 필요한지에 따라 결정되며, 그 두 답은 서로 반대 방향을 가리킨다.

Screenshot of the OrcaRouter model page for Kimi K3 showing the breadcrumb Home > Models > MoonshotAI > Kimi K3, a FEATURED badge, the model id kimi/kimi-k3, Vision, Tools, JSON and Reasoning chips, a MoonshotAI attribution dated 2026-07-15, the description of a 2.8-trillion-parameter mixture-of-experts model with a 1M-token context window, input pricing of $3.00 and output of $15.00 per 1M tokens, a p50 time to first token of 8.11s, a p95 of 10.00s, and traffic of 1163.7M tokens over seven days.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트