GPT-6와 Kimi K3의 비교를 위한 히어로 타이틀 카드. 헤드라인은 'GPT-6 vs Kimi K3'입니다. 칩에는 'Kimi K3: 1,048,576 컨텍스트, $3.00 / $15.00, 2026-07-15 출시'라고 표시됩니다. 칩에는 'GPT-6 Sol: 1,050,000 컨텍스트, $2.00 / $10.00, GA 2026-09-22'라고 표시됩니다. 푸터에는 '둘 다 텍스트와 이미지 입력을 지원하지만, 가격 책정과 점수 산정 방식은 다릅니다.'라고 표시됩니다.
Guides & Insights

GPT-6 vs Kimi K3: 서로 다르게 특화된 200만 토큰 모델

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

GPT-6 Sol과 Kimi K3는 같은 작업을 두고 최종 후보에 오를 가능성이 가장 큰 두 모델입니다: 100만 토큰 컨텍스트 창, 이미지 입력, 그리고 긴 문서를 경제적으로 다룰 수 있게 하는 가격. 두 모델은 서로 반대 방향에서 그 지점에 도달했습니다. Kimi K3는 2026년 7월 15일 출시된 MoonshotAI의 장문 컨텍스트 전문가이며, 그 카드는 리콜을 중심으로 구성되어 있습니다 — Artificial Analysis의 장문 컨텍스트 리콜 테스트에서 88.7%를 기록해, 우리가 비교할 수 있는 해당 벤더의 모든 모델을 앞섰습니다. GPT-6 Sol는 해당 벤더의 중간급 범용 모델로, 2026년 9월 22일 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $10.00에 출시되었으며, 그 강점은 폭입니다: 약간 더 큰 창, 더 높은 일반 추론 종합 점수, 그리고 더 저렴한 출력 토큰.

그래서 솔직한 구도는 더 나음 대 더 나쁨이 아니다. 그것은 회상 대 추론이며, 100만 토큰을 한 번 로드한 뒤 그 토큰들로 무엇을 하느냐에 따라 결정된다.

서류상으로는 창문들이 같은 크기입니다

두 카드 모두 대략 100만 토큰이라고 적혀 있고, 차이는 겉치레에 불과합니다. Kimi K3의 윈도는 1,048,576토큰 — 정확히 2^20으로, 모든 장문맥 모델이 언급하는 이진수 기준의 백만입니다. GPT-6 Sol의 윈도는 1,050,000으로, 약 1,400토큰 더 큰 딱 떨어지는 십진수입니다. 실제로 담을 수 있는 어떤 워크로드든 두 윈도는 같습니다. 이것 때문에 선택하지 마세요.

차이가 나는 것은 엔벨로프의 나머지 부분이며, 그것은 짧은 목록이다.

• 컨텍스트: Kimi K3 1,048,576 토큰, GPT-6 Sol 1,050,000 — 사실상 동일
• 입력 모달리티: Kimi K3는 텍스트와 이미지를 지원하고, GPT-6 Sol은 텍스트, 이미지, 파일을 지원합니다
• 출력 한도: GPT-6 Sol은 한 응답에 128,000 토큰; Kimi K3의 카드에는 최대 출력 수치가 공개되어 있지 않습니다
• 표준 가격: Kimi K3 백만 토큰당 입력 $3.00 / 출력 $15.00, GPT-6 Sol 입력 $2.00 / 출력 $10.00
• 캐시된 입력: Kimi K3 백만 토큰당 $0.30, GPT-6 Sol 백만 토큰당 $0.20
• 장문 컨텍스트 가격: Kimi K3는 문서화된 구간 없이 단일 요율을 제시합니다; GPT-6 Sol은 입력 토큰 272,000개를 초과하면 전체 요청 가격을 입력 $4.00 / 출력 $15.00으로 재산정합니다
• 추론 제어: GPT-6 Sol은 구성 가능한 reasoning.effort를 노출합니다; Kimi K3는 동일한 OpenAI 호환 인터페이스를 통해 reasoning 및 reasoning-effort 매개변수를 노출합니다

Kimi K3의 누락된 출력 상한은 매끄럽게 넘기기보다 문제로 짚고 넘어갈 가치가 있습니다. MoonshotAI는 컨텍스트 수치는 공개하지만 최대 출력 수치는 공개하지 않으므로, 예산 책정을 위해 하드 출력 상한에 의존하는 시스템은 스펙 카드에서 그 값을 읽어낼 수 없습니다. 장문 컨텍스트 등급은 또 다른 비대칭이며, 이는 직관에 반하는 방향으로 작용합니다 — GPT-6 Sol의 대표 요금은 더 낮지만, 272K 초과 시 전체 요청에 대한 재가격 책정 방식 때문에 300,000토큰 호출은 첫 토큰부터 $4.00 / $15.00로 청구됩니다. 반면 Kimi K3의 단일 $3.00 / $15.00 요금은 구간이 바뀐다는 내용이 전혀 문서화되어 있지 않습니다. 아주 긴 문서의 경우, Kimi K3는 더 높은 대표 요금에도 불구하고 입력 비용에서 둘 중 더 저렴해질 수 있습니다.

Recall은 Kimi K3의 실제 제품입니다.

Kimi K3를 선택하는 이유는 그것이 큰 창을 가지고 있기 때문이 아니다 — 여러 모델이 그렇다. 이유는 그 창 안에 있는 것을 유지한다는 점이다. 모델 카탈로그에 실려 있는 Artificial Analysis의 장문 컨텍스트 회상 평가에서 Kimi K3는 88.7%를 기록해 GPT-6 Sol의 83.7%를 앞선다. 이는 긴 입력 속에 묻힌 세부 정보를 모델이 찾아내고 활용할 수 있는지를 측정하는 바로 그 테스트에서의 5포인트 차이이며, 프로덕션에서 실제 실패로 나타나는 종류의 차이다 — 400페이지의 조항을 빠뜨리는 요약기, 배상 조항을 놓치는 계약 검토자.

Kimi K3는 코딩에서도 선두를 달리고 있으며, 그 격차는 종합 지수가 시사하는 것보다 더 큽니다. 코딩 지수에서는 76.2로 평가된 모델 중 상위 10위 안에 들고, terminal-bench v2.1에서 85.0%를 기록합니다. 이는 코딩 에이전트의 유용성이 달려 있는 에이전트형 명령줄 벤치마크입니다. GPQA Diamond 점수인 93.5%는 리더보드 최상위 구간에 속합니다.

GPT-6 Sol이 우위를 보이는 분야는 종합 지표와 과학 코드다. 일반 지능 지수 47은 Kimi K3의 43.6보다 4포인트 앞서며 최상위 10%에 근접한다. 두 모델은 SciCode에서 각각 57.6%와 59.5%로 대등하며, 이는 단일 실행의 노이즈 범위 안에 있다. 그리고 Humanity's Last Exam에서 GPT-6 Sol의 47.9%가 Kimi K3의 46.9%를 근소하게 앞선다. 이러한 단일 벤치마크 차이는 어느 것도 그 자체만으로 선택을 내리기에 충분히 크지 않다.

Screenshot of the OrcaRouter model page for Kimi K3, showing the MoonshotAI Kimi K3 card with a 1,048,576-token context window, text and image input, and a flat rate of $3.00 per million input tokens and $15.00 per million output tokens with a $0.30 cached-input rate.

요율표가 아닌 워크로드 기준으로 비용을 산정하세요.

요금표는 오해를 불러일으킵니다. 입력 대 출력 토큰의 비율이 작업마다 다르고, 이 두 모델은 어느 쪽이 더 저렴한지에 대해 의견이 다르기 때문입니다. Kimi K3는 작업이 대부분 입력이라고 가정할 때 더 저렴합니다 — 긴 문서를 입력하고 짧은 답변을 출력하는 경우입니다. GPT-6 Sol은 작업이 균형 잡혀 있거나 출력이 많은 경우 더 저렴합니다. 출력 요금이 3분의 1 더 낮기 때문입니다.

• 책 한 권 읽고 요약하기 형태(입력 900K, 출력 4K): Kimi K3 ≈ $2.76, GPT-6 Sol ≈ $3.64 (272K 재가격 적용 전); 재가격 적용 시 GPT-6 Sol의 호출 전체가 더 높은 등급으로 이동해 격차가 더 벌어짐
• 균형형 에이전트 형태(입력 60K, 출력 20K): Kimi K3 ≈ $0.48, GPT-6 Sol ≈ $0.32
• 코드 생성 형태(입력 30K, 출력 60K): Kimi K3 ≈ $0.99, GPT-6 Sol ≈ $0.66

이것은 각 공급업체가 공개한 요율에 기반한 순수 토큰 계산이며, 캐시된 입력은 제외합니다. 캐시된 입력은 가장 많이 캐시하는 모델에 도움이 됩니다. 중요한 것은 답의 형태입니다. 순수한 장문 입력 회상 작업에서는 Kimi K3의 균일 요율이 우세하고, 많은 양을 다시 출력하는 작업에서는 GPT-6 Sol의 더 낮은 출력 요율이 우세합니다. 어느 쪽도 보편적으로 더 저렴하지 않으며, 토큰 비율을 밝히지 않고 가격에서 한쪽 승자를 지목하는 비교는 아무것도 측정하지 않는 것입니다.

출처는 결정의 일부입니다

Kimi K3는 중국 연구소 MoonshotAI가 만들고, GPT-6 Sol은 OpenAI가 만든다. 그 차이는 벤치마크가 아니며 요금표에도 나타나지 않지만, 규제 대상 워크로드에서는 가격을 논의하기 전에 최종 후보 명단을 결정한다. 카탈로그에 실린 MoonshotAI의 카드는 라이선스 필드를 게시하지 않으므로, 여기 어떤 내용도 가중치 제공 여부에 대해 어느 쪽으로도 주장하는 것으로 읽혀서는 안 된다 — 오픈 가중치가 배포에 중요하다면, 패밀리 이름만 보고 가정하지 말고 원출처에서 확인하라.

파이프라인의 한 부분에는 중국 연구소 모델을, 다른 부분에는 OpenAI 모델을 쓰면서 라우팅, 빌링, 레지던시 문제는 한 곳에서 처리해야 하는 팀 — 바로 이런 팀에게 두 벌의 자격 증명 대신 단일 게이트웨이를 두는 것이 가치 있는 이유입니다. OrcaRouter에서는 kimi/kimi-k3와 GPT-6 Sol이 모두 같은 카탈로그에 라이브 라우트로 있으며, 공급사 정가에 0% 마크업으로 제공되므로 MoonshotAI나 OpenAI의 요금 변경이 같은 날 바로 반영됩니다. 자동 페일오버 덕분에 어느 공급사에서든 저하된 라우트가 파이프라인을 중단시키지 않으며, 라우팅 DSL을 사용하면 추측이 아니라 규칙에 따라 리콜 중심 작업은 Kimi K3로, 생성 중심 작업은 GPT-6 Sol로 보낼 수 있습니다.

A six-row comparison card titled 'GPT-6 Sol vs Kimi K3'. Rows read 'Context: 1,050,000 vs 1,048,576'; 'Input: $2.00 vs $3.00'; 'Output: $10.00 vs $15.00'; 'AA Intelligence: 47.6 vs 43.6'; 'Long-context recall: 83.7% vs 88.7%'; 'Coding index: top-decile on both'. A footer reads 'Figures per each vendor's published card and Artificial Analysis; GPT-6 Sol output ceiling is 128K, Kimi K3 publishes no maximum output.'

파이프라인에 어느 것을 넣을까

매우 긴 입력에 대한 검색과 보존이 작업의 핵심일 때 Kim K3를 선택하세요 — 법률 및 의료 문서 검토, 전체 저장소 코드 이해, 수백 개 문서에 걸친 대화 기록 분석 등 — 그리고 입력 비중이 높은 프롬프트를 사용해 정액 $3 요금이 GPT-6 Sol의 가격 재조정보다 유리할 때 적합합니다. K3의 재현율 우위와 코딩 부문 톱10 순위는 그 선택을 뒷받침하는 두 가지 수치입니다.

작업이 백만 토큰 창을 기반으로 하는 범용 어시스턴트라면 GPT-6 Sol을 선택하세요: 복합 추론, JSON 직렬화, 많은 양을 다시 작성하는 에이전트 루프, 그리고 128,000토큰 출력 상한이 제약이 아니라 기능인 모든 워크플로에 적합합니다. 출력 비용이 더 저렴하고, 명시적인 추론 노력 제어를 제공하며, 종합 지수가 더 강력한 범용 신호입니다. 파이프라인이 실제로 두 가지를 모두 수행한다면, 정직한 답은 하나를 고르는 것이 아니라 라우팅하는 것입니다. 이는 어느 모델에 대한 진술이 아니라 여러분의 트래픽 형태에 대한 진술입니다.

Screenshot of the OrcaRouter model page for GPT-6 Sol, showing the OpenAI GPT-6 Sol card with a 1,050,000-token context window, 128,000 maximum output, text/image/file input, and the tiered rate of $2.00 per million input and $10.00 per million output up to 272,000 tokens, stepping to $4.00 and $15.00 above that.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트