제목이 'Grok 4.7 vs Kimi K3 — 가격 대 컨텍스트'인 기사를 위한 생성된 히어로 타이틀 카드로, 부제는 '두 개의 프론티어 모델, 두 가지 다른 베팅'이며, 스탯 칩은 가격 $2/$6 vs $3/$15, 컨텍스트 500K vs 1M, 오픈 웨이트 아니오 vs 예를 표시합니다.
Guides & Insights

Grok 4.7 vs Kimi K3: 절반의 가격, 절반의 컨텍스트, 가중치는 전혀 없음

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

에이전트 코딩 작업으로 한 달에 3억 토큰을 써 보면서 두 모델을 모두 정가로 돌려 보면, 선택은 더 이상 벤치마크 논쟁처럼 보이지 않습니다. Grok 4.7은 2026년 9월 21일 SpaceXAI가 출시했으며, 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러를 청구합니다. Kimi K3는 2026년 7월 16일 Moonshot AI가 출시했으며, 3달러와 15달러를 청구합니다. 그 가상의 한 달, 이를테면 입력 2억 개와 출력 1억 개라면 Grok 4.7은 약 1,000달러, Kimi K3는 약 2,100달러가 됩니다. 이 격차는 반올림 차이가 아니라 모델 하나를 더 쓸 수 있는 예산에 해당합니다. 그에 반해 Kimi K3는 500,000 대신 1,000,000 토큰의 컨텍스트 창, 이미지는 물론 네이티브 비디오 입력, 다운로드 가능한 가중치를 제공합니다. Grok 4.7은 Kimi K3도 겨냥하는 장기 지평의 터미널 작업을 위해 명시적으로 훈련된 더 빠르고 저렴한 폐쇄형 모델을 제공합니다. 둘 다 최전선급입니다. 같은 구매가 아닙니다.

두 모델, 간략히

Grok 4.7은 SpaceXAI의 프런티어 코딩 및 지식 노동 모델로, Grok 4.6보다 더 큰 기본 모델을 기반으로 하며 몇 시간이 걸릴 수 있는 작업을 겨냥한 더 긴 강화 학습 과정을 거쳤습니다. 독점 모델로, 가중치도 다운로드도 제공되지 않으며, 500,000토큰 컨텍스트 창을 제공하고, 텍스트와 이미지를 입력으로 받아 텍스트를 반환하며, low부터 xhigh까지의 추론 노력 수준을 지원합니다. 대표적인 주장은 속도와 가격입니다. SpaceXAI는 이를 비슷한 모델보다 대략 두 배 빠르고 가격은 대략 절반이라고 포지셔닝합니다.

Kimi K3는 Moonshot AI의 플래그십 오픈 전문가 혼합(MoE) 모델이자, 3조 파라미터급 최초의 오픈 모델입니다. 총 2.8조 개의 파라미터에 토큰당 1,040억 개가 활성화되며, Kimi Delta Attention과 양자화 인식 MXFP4 가중치를 기반으로 구축되었습니다. 텍스트, 이미지, 동영상을 입력받고 1,000,000토큰 컨텍스트를 제공하며, 조정 가능한 강도로 추론을 상시 실행하고, 가중치는 Kimi K3 라이선스에 따라 다운로드할 수 있습니다 — 상업적 사용이 허용되지만 제한이 있습니다. 이 모델은 설계상 집으로 가져갈 수 있는 모델입니다.

둘 사이의 구조적 차이는 그것이 전부다. 하나는 저렴하고 빠른 폐쇄형 엔드포인트다. 다른 하나는 두 배의 컨텍스트를 가진, 더 비싸고 느린 개방형 아티팩트다. 아래의 모든 내용은 그로부터 비롯된 결과다.

벤치마크가 실제로 비교하는 것

바로 이 지점에서 대부분의 Grok 4.7 대 Kimi K3 비교 글이 잘못된다. 그래서 솔직하게 말할 가치가 있다: 두 모델이 공개한 수치는 대체로 같은 것을 측정하지 않으며, 적어도 비교 가능해 보이는 한 쌍은 그렇지 않다.

정말로 오해를 부르는 그 조합부터 시작하겠습니다. Kimi K3의 출시 자료는 Terminal-Bench 2.1 점수 88.3을 인용합니다. Grok 4.7의 출시 자료는 Terminal-Bench 4.0에서 38.0%를 인용합니다. 이들은 서로 다른 벤치마크 버전이고 과제 세트와 채점 방식도 다르며, 이 둘을 나란히 놓으면 Kimi K3가 에이전트형 모델로서 두 배 이상 뛰어나다는 인상을 줄 것입니다. 그것은 방어할 수 있는 해석이 아니며, 누구도 그것을 반복해서는 안 됩니다. 두 수치 모두 벤더가 보고한 것이며 — 어느 쪽도 독립적으로 재현된 적이 없습니다.

비교할 수 있는 것은 독립적 종합 지표이며, 거기서 두 모델은 거의 비슷하다. 현재 Artificial Analysis Intelligence Index, 버전 v4.3.2에서 Kimi K3는 44점으로 113개 모델 중 2위이며, 이 순위표에서 모든 오픈 웨이트 모델 가운데 최고 순위다. Grok 4.7은 46점으로 655개 중 16위다. 2점 차이며, Kimi K3의 순위는 최대 추론 강도에서 얻은 것이다. 혼합 종합 지표에서는 이 모델들이 동급이다.

• 독립 종합 — AA Intelligence Index v4.3.2에서 Grok 4.7은 46, 같은 버전에서 Kimi K3는 44. 사실상 동점.

• 컨텍스트 윈도우 — Grok 4.7 500,000 토큰 vs Kimi K3 1,000,000 토큰. Kimi K3에게는 실질적이고 조건 없는 우위이며, 아무런 단서도 붙지 않은 유일한 사양 차이.

• 입력 모달리티 — Grok 4.7: 텍스트 및 이미지 vs Kimi K3: 텍스트, 이미지 및 비디오. 워크로드에 비디오가 포함되어 있다면 Kimi K3가 더 폭넓습니다.

• 가중치 — Grok 4.7은 독점, 다운로드 불가 vs Kimi K3는 Kimi K3 라이선스에 따른 오픈 웨이트. 온프레미스 또는 에어갭 요구사항에서는 이 한 줄만이 중요하다.

• 백만 토큰당 가격 — Grok 4.7은 입력 $2 / 출력 $6, Kimi K3는 입력 $3 / 출력 $15이며, Kimi의 캐시 입력 요금은 백만 토큰당 $0.30입니다. Grok 4.7이 모든 측면에서 더 저렴하고, 출력에서는 훨씬 더 저렴합니다.

• 추론 강도 제어 — Grok 4.7은 low부터 xhigh까지인 반면, Kimi K3는 구성 가능한 강도로 항상 켜져 있습니다. 기능적으로는 유사하지만, 차이점은 Grok 4.7에서는 추론 강도를 낮출 수 있다는 것입니다.

• 공급업체가 보고한 에이전트 관련 근거 — Grok 4.7 Terminal-Bench 4.0 38.0%, CursorBench 4.0 46.3%, DeepSWE v1.1 71.0%(모두 공급업체 보고) vs Kimi K3 Terminal-Bench 2.1 88.3%, Frontend Code Arena 1,679 Elo로 1위(출시 당시 공급업체 보고). 비교 불가 — 위 참조.

A generated two-column comparison scoreboard for Grok 4.7 and Kimi K3 with six rows: price $2/$6 vs $3/$15 per million tokens, context 500K vs 1M tokens, AA Intelligence Index 46 vs 44, weights proprietary vs open, modalities text and image vs text, image and video, and speed twice as fast vs slower output, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

돈이 실제로 어디로 가는가

요금표는 격차를 실제보다 작게 보이게 한다. 두 모델이 토큰을 서로 다르게 소비하기 때문이다. Grok 4.7은 장황한 추론 모델이다 — Artificial Analysis가 Intelligence Index를 실행하는 동안 생성된 출력 토큰이 2억 4천만 개라고 측정했으며, 이는 모델 전반의 중앙값 9,200만 개와 비교된다. Kimi K3는 정반대 방식으로 비싸다. 크고 상시 작동하는 추론 모델이며, 출력 토큰 100만 개당 15달러라면, 당신이 사는 것은 장황함이다.

그러니까 정직한 비용 모델은 "$2/$6 대 $3/$15"가 아니다. 그것은 완료된 작업당 출력 토큰에 출력 단가를 곱한 값에, 모든 재시도를 포함한 입력 토큰에 입력 단가를 곱한 값을 더한 것이다. 백만 토큰당 $6로 한 번의 긴 패스에서 작업을 해결하는 모델이 백만 토큰당 $15로 세 번의 시도가 필요한 모델을 이길 수 있고, 저렴한 모델의 패스가 충분히 길면 그 모델에게 질 수도 있다. 그것은 당신이 자신의 저장소에서 실행하는 측정이지, 누군가 당신을 위해 공개해 주는 측정이 아니다.

실행하기 전에 알아 둘 만한 비대칭성이 하나 있습니다: Grok 4.7의 전신인 Grok 4.6은 입력 토큰 200,000개에서 가격 절벽을 적용하는데, 이 선을 넘는 요청은 요청 전체가 두 배 요율로 다시 책정됩니다. Grok 쪽의 장문맥 작업은 배포하는 모델의 현재 요금표와 대조해 확인해야 합니다. 왜냐하면 500,000토큰 창과 200,000토큰 절벽이 나쁘게 상호작용하기 때문입니다. Kimi K3의 요금은 균일한데, 이것이 둘 중 더 은근한 장점입니다.

각각 어디서 망가지는가

두 모델 모두 출시 자료가 앞세우지 않은 실패 모드를 가지고 있으며, 그 실패 모드들은 서로 다릅니다.

Kimi K3의 문제는 지속 부하에서의 신뢰성이다. 출시 당시 커뮤니티와 독립 테스트는 실행이 길어질수록 에이전트 성능이 저하된다고 보고했다 — 단일 실행 결과는 강하지만 지속 통과율은 약하며, 출력 속도는 초당 약 37~38토큰으로 대화형 코딩에는 느린 편이다. Moonshot은 또한 출시 직후 수요가 용량을 앞질러 신규 소비자 구독을 일시 중단해야 했는데, 이는 호스팅 측의 서빙 여유에 대해 시사하는 바가 있다.

Grok 4.7의 것은 정반대 형태입니다. 빠르고 저렴하며 폐쇄적이어서, 들여다볼 수도, 직접 실행할 수도, 지원 중단에 대비할 수도 없습니다. SpaceXAI는 이미 이번 릴리스 뒤에 Grok 4.8, Grok 4.9, Grok 5를 공개적으로 예고해 두었고, Grok 4.6은 대체되기까지 약 5주밖에 버티지 못했습니다. Grok 4.7 위에 무언가를 만든다면, 모델 ID가 가정이 아니라 구성 값이 되도록 만들어야 합니다.

어느 모델의 실패도 아닌 세 번째 고려 사항이 있습니다: 어느 쪽도 2주간의 자율 실행에 대한 정답이 아니며, 두 공급업체 모두 바로 그런 점을 시연했습니다. 공개된 16일 및 48시간 자율 코딩 데모는 독립적 재현 없이 공급업체가 주도하고 공급업체가 선택한 작업에서 진행되었습니다. 이는 알아둘 가치는 있지만, 그것을 전제로 계획을 세울 가치는 없습니다.

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing Moonshot AI's list pricing of $3.00 per million input tokens and $15.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

둘 다 실행하기, 그리고 그것이 진짜 답인 이유

비용 격차와 컨텍스트 격차는 서로 반대 방향을 가리키며, 이것이 하나를 고르지 말아야 하는 이유다. Kimi K3는 1M 창 덕분에 입력을 쪼갤 필요가 없는 리포지토리 규모 작업에서, 그리고 자체 호스팅이 필요한 모든 경우에 그 가격값을 한다. Grok 4.7은 볼륨, 즉 턴 수가 많은 에이전트 루프, 도구 호출이 많은 파이프라인, 속도와 출력 비용이 좌우하는 긴 터미널 세션에서 그 가격값을 한다.

Kimi K3는 OrcaRouter에 있습니다, 따라서 이러한 분할은 조달 결정이 아니라 라우팅 결정입니다. 이는 Moonshot의 정가로 카탈로그에 올라 있으며, OrcaRouter가 제공업체의 정가를 0% 마크업으로 그대로 전달하기 때문에 벤더의 가격 인하는 다음 계약 갱신 시점이 아니라 발표되는 당일 바로 여기에서 적용됩니다. 긴 컨텍스트 처리와 실행 처리가 경쟁이 아니라 협력해야 하는 워크로드 — 한 모델은 전체 저장소를 시야에 담고, 다른 모델은 그것을 바탕으로 실행하는 — 를 위해 라우팅 DSL은 여러 모델을 단일 호출로 구성하며, 모델 퓨전은 추가 비용을 지출할 가치가 있는 작업이라면 모델 패널이 함께 답변하도록 합니다. 하나의 API 키로 Kimi K3와 200개 이상의 다른 모델을 사용할 수 있으므로, 그 분할의 실행 절반은 컨텍스트를 보유한 모델이 아니라 해당 작업에 가장 저렴하고 빠른 모델에서 나올 수 있습니다.

한 가지 분명히 해야 할 점이 있습니다: Kimi K3의 오픈 웨이트는 다운로드할 수 있지만, OrcaRouter가 라우팅하는 대상은 호스팅 엔드포인트입니다. 요구 사항이 진정으로 온프레미스 추론이라면, 그것은 라우팅 결정이 아니라 자체 하드웨어에서의 셀프 호스팅 프로젝트이며, 이 비교에 단 하나의 정답이 있는 유일한 시나리오입니다.

판결, 그리고 기억해야 할 단 하나의 숫자

비용과 속도를 기준으로 선택한다면 Grok 4.7이 이기며, 그 격차는 좁지 않습니다: 입력 가격은 절반, 출력 가격은 절반 이하, 더 빠른 서빙, 그리고 낮출 수 있는 추론 다이얼까지 갖추고 있습니다. 컨텍스트, 모달리티 폭, 또는 모델을 직접 소유할 수 있는 능력을 기준으로 선택한다면 Kimi K3가 같은 조건에서 이깁니다. 능력만을 기준으로 선택한다면, 독립적인 종합 평가는 두 모델이 두 점 차이라고 말하며, 어느 벤더의 출시 차트가 아니라 자신만의 평가를 바탕으로 결정해야 합니다.

고수해야 할 숫자는 맨 위에 있는 것입니다: $2/$6 대 $3/$15. 이 비교에서 나머지 모든 것은 협상할 수 있지만, 그 비율은 아닙니다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트