
GPT-6.1 Sol vs Kimi K3: 다운로드는 존재하며, 여전히 저렴한 선택지는 아니다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Kimi K3는 이런 종류의 논쟁을 보통 정리해 주는 반례다. Moonshoot AI는 2026년 7월에 2조 8천억 개 매개변수 모델을 출시하고 가중치를 공개했다 — moonshotai/Kimi-K3는 Hugging Face에 게이트 없이 공개되어 있으며, 다운로드 수는 100만을 넘고 마지막 리비전은 9월에 있었다. 그래서 여기에는 "원칙적으로는 오픈이지만 안전 강화를 위해 보류했다"는 별표가 없고, 기다려야 할 2주 지연도 없다. GPT-6.1 Sol은 OpenAI가 2026년 9월 29일에 출시했으며, 폐쇄형이고 API 전용이며 앞으로도 항상 그럴 것이다. 그리고 독립 리더보드에서 다운로드 가능한 모델은 43.6점을 기록한 반면 폐쇄형 모델은 51.8점을 기록하며, 완료된 인덱스 작업당 비용은 $2.00 대 $0.72다. 오픈 가중치는 값싼 탈출구로 여겨지는데; 이 짝에서는 오픈 가중치가 거래에서 비싼 쪽이며, 그 이유는 라이선스가 아니다.
각 모델이 무엇인지
Kimi K3는 총 2조 8,000억 개의 파라미터를 갖춘 희소 전문가 혼합 모델로, 토큰당 약 1,040억 개—약 3.7%—가 활성화됩니다. 1,048,576토큰 컨텍스트 윈도우를 가지며, 텍스트와 이미지를 입력으로 받고 텍스트를 반환합니다. 공개된 체크포인트는 FP8 아티팩트이며 정말로 큰 용량의 다운로드입니다. 자체 하드웨어에서의 프로덕션 배포는 워크스테이션에서 내릴 결정이 아니라 클러스터에서 내릴 결정입니다. Moonshoot이 내세우는 아키텍처적 주장은 장문맥 디코딩에서 상당히 더 빠르다고 하는 하이브리드 선형 어텐션 방식에, 2.8조 파라미터 모델을 애초에 서빙 가능하게 만든 잔차 및 라우팅 작업을 더한 것입니다.
GPT-6.1 Sol은 OpenAI의 중간 계층 리프레시 모델로, GPT-6 Astra 아래이자 GPT-6 Luna 위에 있으며, 1,050,000 토큰 컨텍스트 창, 128,000 토큰 출력 상한, 텍스트·이미지·파일 입력, 그리고 2026년 4월 30일 지식 컷오프를 갖추고 있습니다. 추론은 low부터 max까지이며 medium이 기본값입니다. none 단계는 이전 GPT-6 Sol이 허용했던 것이지만 즉시 거부되며, OpenAI 자체 마이그레이션 노트는 개발자들에게 대신 low를 사용하도록 안내합니다. 가격은 백만 토큰당 $2.00 및 $10.00이며, 캐시된 입력은 $0.10입니다.
각 차원당 한 줄, 각 줄에 양쪽 모두:
• 입력 — GPT-6.1 Sol 1M당 $2.00 vs Kimi K3 1M당 $3.00
• 출력 — GPT-6.1 Sol 1M당 $10.00 vs Kimi K3 1M당 $15.00
• 캐시된 입력 — GPT-6.1 Sol 1M당 $0.10 vs Kimi K3 1M당 $0.30
• 컨텍스트 — 1,050,000 토큰 vs 1,048,576 토큰, 0.1% 차이로 미미함
• 최대 출력 — 양측 모두 128,000 토큰
• 전체 및 활성 파라미터 — 비공개 2조 8,000억, 토큰당 활성 1,040억
• 모달리티 — 텍스트 입력 및 파일 입력, 텍스트 출력 vs 텍스트 및 이미지 입력, 텍스트 출력
• 가중치 — 비공개, API 전용 vs 공개, 게이트 없음, 100만+ 다운로드
• 롱 컨텍스트 조항 — 272,000 입력 토큰 초과 시 전체 요청에 입력 및 캐시 2배, 출력 1.5배를 적용해 재가격 책정 vs 공개된 카드에 이에 상응하는 조항 없음
• 인텔리전스 지수, 독립, 최대 노력 — 51.8 vs 43.6
• 지수 과제당 비용, 독립 — $0.72 vs $2.00
• 지수 실행 시 출력 토큰 — 6,700만 vs 1억 6,000만, 해당 비교 클래스의 보드 중앙값 1억 4,000만 대비
K3가 이기는 단 하나의 평가, 그리고 그것이 중요한 이유
산술에 앞서, 예외가 있다. 그것이 실제이기 때문이다. Artificial Analysis v4.3.2에서 최대 노력으로 평가별로 채점한 결과, GPT-6.1 Sol은 10개 중 7개에서 앞서고 동점은 없지만, 장문맥 추론 평가에서 승리하는 모델은 K3이다:
• AA-LCR v1.1 — Kimi K3 0.887 vs GPT-6.1 Sol 0.830. 장기 입력에 대한 추론을 위해 특별히 만들어진 평가에서 6점 앞선다.
• SciCode — Kimi K3 0.595 vs GPT-6.1 Sol 0.542. K3는 과학적 코딩에서도 앞선다.
• Terminal-Bench 4.0 — Kimi K3 0.126 vs GPT-6.1 Sol 0.561. 반대 방향으로 43점 격차이며, 이 조합에서 단연 가장 큰 차이다.
• Humanity's Last Exam — Kimi K3 0.469 vs GPT-6.1 Sol 0.529.
• AA-Omniscience — Kimi K3 19.7 vs GPT-6.1 Sol 41.5; 사실적 신뢰성에서는 두 모델이 같은 부류가 아니다.
• GDPval-AA v2.1 — Kimi K3 Elo 1536.5 vs GPT-6.1 Sol Elo 1575.1.
• MMMU-Pro — Kimi K3 0.805 vs GPT-6.1 Sol 0.860.
• AutomationBench-AA, GDP.pdf, CritPt — K3 0.583, 0.22 및 0.234; Sol 0.649, 0.310 및 0.317.
AA-LCR 결과는 진지하게 받아들일 가치가 있는데, 그것이 작업당 비용 이야기와 모순되는 유일한 수치이며, 싸 보이는 답이 양방향으로 모두 틀리는 워크로드를 가리키기 때문이다. 당신의 트래픽이 아주 긴 입력, 크지 않은 생성 답변, 안정적인 프리픽스의 대량 재사용 — 장황함이 전혀 발목을 잡지 못하는 형태 — 이라면, 최상위권 장문맥 점수, 이미지 입력, 다운로드 가능한 체크포인트라는 K3의 조합은 Sol의 조합보다 더 잘 맞으며, 인덱스 실행의 작업당 비용 수치는 당신에게 적용되지 않는다. 그것이 "오픈 가중치는 프리미엄을 지불할 가치가 있다"의 정직한 버전이다: 때로는 오픈 모델이 그 작업에 단순히 더 나은 모델이며, 여기서는 한 축에서 그렇다.
그 두 승리의 공통점을 짚어 볼 가치도 있다. K3는 하나의 긴 읽기나 추론 행위로 과제에 답할 수 있을 때 강하지만, 여러 작은 단계로 실행하고 점검해야 할 때는 약하다. 43점의 Terminal-Bench 격차와 22점의 omniscience 격차는 같은 발견을 두 각도에서 본 것이다. 지속적인 에이전트 실행은 이 체크포인트가 최적화된 대상이 아니다.
실제로 그것을 결정하는 것은 바로 그 계산이다
K3의 요금표는 모든 항목에서 Sol의 1.5배이고, 완료된 인덱스 작업당 측정 비용은 2.8배이며, 1.5와 2.8의 차이는 전적으로 토큰 볼륨으로 설명됩니다. 이사회 자체 측정치는 동일한 10개 평가 스위트에서 K3가 1억 6천만 개의 출력 토큰, Sol이 6천 7백만 개입니다. K3는 1.5배 가격에 2.4배의 출력을 생성하며, 2.4 × 1.5는 3.6입니다. 이사회의 $2.00 대 $0.72 수치는 입력 및 캐시 기여가 이를 약간 상쇄하기 때문에 순수 비율보다 조금 더 관대하지만, 방향성은 논란의 여지가 없습니다.
Moonshoot의 자체 마케팅은 이 점과 상충하는데, 이는 주의 깊게 읽어볼 가치가 있다. 이 회사는 K3가 이전 모델보다 출력 토큰을 더 적게 생성한다고 주장하며, 아키텍처 작업—어텐션 구조, 잔차 설계—은 장문맥 디코딩 비용을 정면으로 겨냥한다. 모델이 일반 스위트에서 벤치마크 중앙값보다 여전히 두 배나 장황하더라도 이 두 가지는 모두 사실일 수 있다. 두 주장은 서로 다른 것을 다룬다: 이전 Kimi 대비 효율성, 그리고 해당 분야 대비 효율성. 당신이 청구받는 기준은 오직 두 번째뿐이며, 독립 위원회가 측정하는 것도 바로 그것이다.
캐싱은 이를 완화합니다. 두 캐시 입력 요금은 각 모델의 비캐시 입력 요금의 10분의 1입니다 — K3는 $0.30, Sol은 $0.10 — 따라서 캐시 항목이 순위를 바꾸지는 않지만, 요청이 많고 답변이 적은 워크로드에서는 격차가 측정된 작업 비율이 아니라 대략 요금표 비율로 좁혀진다는 뜻입니다. 그리고 Sol의 장문맥 조항은 반대 방향으로 작용합니다. 입력 토큰이 272,000개를 초과하면 전체 요청을 $4.00 및 $15.00로 재책정하고 캐시는 $0.20이 되는데, 이는 K3의 단일 요금표가 완전히 우세한 유일한 구간입니다. 이는 두 가지 이유로 알아둘 가치가 있습니다. 이 구간이 바로 K3의 장문맥 점수가 이 비교에서 가장 좋은 수치인 구간이기도 하기 때문입니다.

여기서 오픈 웨이트가 실제로 어떤 가치가 있는가
세 가지다. 그리고 이것들은 분리해서 볼 가치가 있는데, 'open weights'는 그것이 세 가지인데도 보통 하나의 논거로 쓰이기 때문이다.
첫 번째는 떠날 수 있다는 점입니다. Moonshoot이 인수되거나, 향후 버전의 라이선스를 변경하거나, K3를 지원 중단하거나, API 가격을 인상하더라도 이미 다운로드한 체크포인트는 계속 실행됩니다. 이는 이 연구실에게 가상의 시나리오가 아닙니다. Moonshoot은 기존 유료 고객의 서비스 품질을 보호하기 위해 이전 릴리스 후 약 48시간 이내에 신규 구독을 중단했는데, 이는 API 접근이 고유한 속성이 아니라 정책적 결정임을 생생하게 보여주는 사례입니다. 이 중 어느 것도 작업당 비용 표에는 나타나지 않지만, 그 모두는 현실입니다.
두 번째는 고정할 수 있다는 점입니다. 미세 조정되어 당신이 통제하는 경계 안에서 실행되는 고정 리비전은 감사자에게 보여줄 수는 있지만 API는 제공할 수 없는 것입니다. 규제 대상 트래픽의 경우 이는 요금표보다 더 가치가 있습니다.
세 번째, 흔히 가정되는 것은 그것이 더 저렴할 것이라는 점이다. 그렇지 않다. 이 체크포인트는 2.8조 매개변수 FP8 아티팩트이며, 공개된 배포 지침은 단일 노드보다는 다중 가속기 구성에 초점을 맞추고 있다. 그런 급의 클러스터를 이미 운영하는 팀이라면 여기서 진짜 선택지가 생기고 계산이 완전히 달라진다. 토큰의 한계 비용이 전기가 되기 때문이다. 그렇지 않은 팀은 API 청구서와 자본 구매를 비교하는 셈이고, API 청구서가 큰 차이로 이긴다. 솔직히 요약하자면, 여기서 오픈 웨이트는 떠날 수 있는 능력을 줄 뿐, 저렴하게 운영할 수 있는 능력을 주는 것은 아니다.
둘 다 하나의 키에 있는데, 바로 그 점이 거래를 유용하게 만드는 부분입니다.
Kimi K3는 Moonshot 자체 정가로 OrcaRouter에 있습니다 — 백만 토큰당 $3.00 및 $15.00, 캐시 읽기 $0.30, 벤더의 가격표에서 변경 없음 — 그리고 GPT-6.1 Sol은 출시 당일 OpenAI 가격으로 저희 라우트에 들어왔습니다, $2.00 및 $10.00, 캐시된 입력 $0.10, 272,000토큰 단계는 목록 그대로 통과되었습니다. 어느 쪽에도 아무것도 추가되지 않습니다. 플랫폼은 제공자 정가를 마크업하지 않고 그대로 전달하므로, Moonshot 요금 변경과 OpenAI 요금 변경 모두 벤더에 나타나는 같은 날 저희 쪽에도 나타나며, 별도 계약이나 중간 리셀러 없이 이루어집니다.

이 조합에서 이 이유가 대부분의 경우보다 더 중요한 이유는 두 모델이 서로 다른 실패 모드에 속하기 때문입니다. GPT-6.1 Sol은 지속적인 실행, 도구 루프, 사실적 신뢰성을 위해 돌리는 모델이고, Kimi K3는 최고의 롱컨텍스트 점수가 필요하고 다른 누군가의 비즈니스 결정에 대비한 헤지로서 체크포인트를 원하는 매우 긴 입력을 위해 돌리는 모델입니다. 이 둘은 경쟁하는 선택지가 아니라 같은 트래픽 위의 두 경로입니다. 둘 다 하나의 엔드포인트 뒤에 두고, 그들 사이의 자동 장애 조치와 긴 입력 작업은 K3로, 실행 작업은 Sol로 보내는 규칙을 두는 것이, "우리에게는 오픈 웨이트 폴백이 있다"를 설계 문서의 한 줄에서 새벽 3시, 실패 중인 호출에서도 작동하는 무언가로 바꿔줍니다.

각자가 속한 곳
• 터미널 에이전트, 리포지토리 규모 코딩, 다단계 실행 — GPT-6.1 Sol, Terminal-Bench 4.0에서 43점 차이. 이건 접전이 아니다.
• 환각이 비싸게 치러지는 답변 — GPT-6.1 Sol, AA-Omniscience 22점 차이.
• 매우 긴 입력에 짧은 생성 답변 — Kimi K3. 이 비교에서 최고의 장문맥 추론 점수, 이미지 입력, 그리고 적용될 기회조차 없는 장황함.
• 셀프 호스팅 또는 반드시 동결할 수 있어야 하는 추론 스택 — Kimi K3, 그리고 이미 하드웨어를 운영 중인 경우에만. 체크포인트가 결과물이며, 이를 운영하는 경제성은 별개의 문제다.
• 공급업체가 약관을 바꾸는 것에 대한 헤지 — Kimi K3, 그리고 이것은 GPT-6.1 Sol이 어떤 가격으로도 답할 수 없는 유일한 논거다.
• 요금표를 기준으로 선택하기 — 이 비교에서 K3도 Sol도 저렴한 선택지가 아니며, GPT-6 라인에서도 둘 다 저렴한 선택지가 아니다. 청구서가 결정적 입력이라면, 원하는 모델은 이 표 건너편이 아니라 가격표 더 아래에 있다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
