
GPT-6 Sol Pro vs Grok 4.7: 두 배의 장황함, 3분의 1의 가격
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 986 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 196 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
2026년 9월, 프런티어에 가장 근접한 두 모델 가운데 가장 저렴한 두 모델이 하루 차이로 등장했는데, 이들과 관련해 흥미로운 점은 어느 쪽이 더 똑똑한지가 아니다. GPT-6 Sol — 사람들이 GPT-6 Sol Pro를 검색할 때 찾게 되는 모델, 즉 그 모델에서 reasoning.mode를 pro로 설정한 것이지 별도의 제품이 아님 — 은 2026년 9월 22일에 출시되었으며, 입력 토큰 100만 개당 2.00달러, 출력 토큰 100만 개당 10.00달러다. Grok 4.7은 해당 업체에서 9월 21일에 출시되었고, 입력은 같은 2.00달러, 출력은 6.00달러다. Artificial Analysis의 중립적 하네스에서 두 모델은 지수 2점 차이, 완료된 작업당 약 2달러 차이를 보이는데, 그 격차의 이유는 성능이 아니다. 바로 각 모델이 거기까지 도달하는 데 태우는 토큰 수다.
Sol은 Intelligence Index를 실행하면서 7,700만 개의 출력 토큰을 생성했습니다. Grok 4.7은 2억 4,000만 개를 생성했습니다. 3대 1을 조금 넘는 그 비율이 이 비교의 전부이며, 이는 토큰당 가격표가 제시하는 결론을 뒤집습니다.
두 요금표, 그리고 저렴한 쪽이 저렴하지 않은 지점
두 공급업체 모두 이 수치를 스스로 공개하며, 어느 쪽도 독립적으로 재가격이 책정된 적이 없습니다.
입력 — {{1}}GPT-6 Sol{{/1}} 백만 토큰당 $2.00 vs {{2}}Grok 4.7{{/2}} 백만 토큰당 $2.00
• 출력 — GPT-6 Sol 백만 토큰당 $10.00 vs Grok 4.7 백만 토큰당 $6.00
• 캐시된 입력 — GPT-6 Sol 백만 토큰당 $0.20 대 Grok 4.7 백만 토큰당 $0.50; Sol의 캐시 읽기가 2.5배 더 저렴한데, 이는 대표 출력 요율이 시사하는 것과 정반대다
• 컨텍스트 창 — GPT-6 Sol 1,050,000 토큰 대 Grok 4.7 500,000 토큰
• 장문 컨텍스트 할증 — GPT-6 Sol은 입력 토큰 272,000개를 초과하는 요청에 대해 전체 요청 기준으로 입력 및 캐시 요율을 2배, 출력을 1.5배로 재산정하는 반면, Grok 4.7은 입력 토큰 200,000개에서 모든 요율을 2배로 올리며, 이 역시 전체 요청에 적용된다
• 지식 컷오프 — GPT-6 Sol 2026년 4월 20일 vs Grok 4.7: 2026년 6월로 보고된 사전 학습 컷오프, 8월까지 보충 학습
• 추론 강도 — GPT-6 Sol 없음, 낮음, 중간(기본값), 높음, 매우 높음, 최대 vs Grok 4.7 낮음, 중간(기본값), 높음, 매우 높음
• 모달리티 — 둘 다 텍스트와 이미지 입력을 받아들이고 텍스트를 반환합니다
캐시 읽기 항목은 구매자가 곱씹어 봐야 할 부분입니다. Grok 4.7의 출력 요율은 40% 낮지만, 캐시 입력은 150% 더 높으며, 캐시 입력은 긴 에이전트 이력과 반복되는 시스템 프롬프트가 머무는 곳입니다. 대규모의 안정적인 컨텍스트를 주로 다시 읽는 워크로드라면 두 모델이 $6 대 $10이라는 가격이 암시하는 것보다 훨씬 가깝게 느껴질 것입니다.

독립적인 기록, 그리고 그것을 결정하는 단 하나의 숫자
Artificial Analysis는 두 모델을 모두 측정한 유일한 하네스이며, 그 수치들은 나란히 놓고 볼 가치가 있습니다. 그 괴리가 시사하는 바가 크기 때문입니다.
• Intelligence Index — 최대 노력에서 GPT-6 Sol 48 대 xhigh에서 Grok 4.7 46; 둘 다 동급 모델 중앙값인 25를 훨씬 웃돎
• 인덱스 작업당 비용 — GPT-6 Sol $1.06 vs Grok 4.7 $3.74
• 인덱스 실행에 대한 출력 토큰 — GPT-6 Sol 77M 대 Grok 4.7 240M, 중앙값 88M 대비
• 출력 속도 — Grok 4.7은 초당 39토큰으로 측정되었으며, 이는 하네스 자체가 눈에 띄게 느리다고 표시하는 수치입니다. 같은 보드에서 Sol의 수치는 동일한 요약 줄에 공개되지 않았습니다.
• 코딩 에이전트 인덱스 — 작업당 $2.99의 GPT-6 Sol 57 대 자사 Grok Build 하네스를 갖춘 Grok 4.7 56, Grok 4.6보다 9점 상승
지수 차이는 2포인트, 작업당 비용은 3.5배. 그것은 가격 이상 현상이 아니다 — 장황함의 산술이다. Grok 4.7은 장황하게 소리 내어 생각하는 모델이다. 하네스는 중앙값 88M 토큰과 비교해 이를 "매우 장황함"으로 표시하며, 비용은 요금표가 아니라 토큰을 따른다.
코딩 에이전트 비교에는 스코어보드가 감추고 있는 단서가 있다. Grok 4.7의 56은 xAI 자체 Grok Build 하네스 내부에서 측정된 값으로, 이는 xAI가 제공하고 벤치마크 기준으로 삼는 구성이다. Sol의 57은 중립적인 하네스에서 측정되었다. 1~2점 정도의 자사 하네스 이점은 하네스 선택으로 설명되는 범위에 충분히 들어가며, 이는 정직하게 읽자면 이 둘이 에이전트 코딩에서 동급이라는 뜻이지 Sol이 1점 앞선다는 뜻이 아니다.

각 업체가 주장하는 것, 그리고 어느 쪽도 입증하지 못한 것
xAI의 출시 자료는 구체적이며, 이는 장기적 지평에 관한 이야기입니다. Grok 4.7은 Grok 4.6보다 더 큰 기본 모델을 기반으로 구축되었고, "완료하는 데 몇 시간이 걸릴 수 있는" 작업을 겨냥한 더 긴 강화학습 실행을 거쳤으며, 자기 검증, 장문맥 처리, Grok Bot 환경 내에서의 행동을 더 예리하게 다듬었습니다. 벤더가 보고한 수치로는 Terminal-Bench 4.0이 Grok 4.6의 20.3% 대비 38.0%, CursorBench 4.0이 46.3%, DeepSWE v1.1이 71.0%입니다. 이들 수치는 모두 xAI 자체 측정치이며, 어느 것도 독립적으로 재현되지 않았습니다. 회자되는 독립적인 Terminal-Bench 4.0 수치는 벤더의 수치보다 상당히 낮은데, 이는 그러한 격차의 전형적인 양상입니다.
OpenAI의 GPT-6 Sol에 대한 주장은 위에서 이미 다룬 것들이며, 같은 레이블을 달고 있습니다. 벤더가 보고한 수치는 xhigh effort에서 AutomationBench 33.2%로, max에서의 Claude Opus 5의 26.9%에 맞서며, 작업당 비용은 약 9% 수준이고, max effort에서 DeepSWE v1.1 68.8%로, xhigh에서의 Claude Fable 5와 1.1포인트 이내이며, 작업당 비용은 약 80% 더 낮습니다. 비교 대상에 주목하십시오: OpenAI 자체 차트는 Sol을 Anthropic의 모델들과 맞붙이며, Grok 4.7과 맞붙이는 것이 아닙니다. 어느 벤더도 상대방과의 직접 맞대결 결과를 발표하지 않았습니다.

라우팅 계층이 존재 가치를 입증하는 곳
OrcaRouter는 이 맞대결에 등장하는 어느 모델도 취급하지 않습니다 — Grok 4.7과 GPT-6 Sol은 둘 다 우리 카탈로그에 없으므로, 여기에서 우리를 통한 두 모델의 가격에 대해 주장하는 바는 없습니다. 이 특정 조합에서 라우팅 계층의 가치는 요금표가 아니라 실패 모드에 있습니다. Grok 4.7을 선택하려는 이유는 장기 지평의 에이전트 동작이며, 선택하지 않으려는 이유는 초당 39토큰의 출력 속도 때문에 긴 에이전트 실행이 문제가 될 만큼 느려지고, 느린 실행은 타임아웃될 수 있는 실행이기 때문입니다. 제공자 간 자동 페일오버는 긴 작업이 실제로 사용 가능한 모델로 라우팅될 수 있게 하여 그 속도가 단일 장애점이 되지 않게 하며, 라우팅 DSL은 모델 선택을 호출 내부의 규칙으로 표현하는 것이지 마이그레이션으로 표현하는 것이 아니라 — 이는 여기서 중요합니다. 왜냐하면 이 조합에 대한 올바른 답은 작업이 토큰을 많이 소모하는지 지연에 민감한지에 달려 있고, 그것은 분기가 아니라 요청의 속성이기 때문입니다.
의사결정 규칙
• 고정 예산에서의 에이전트형 코딩 — GPT-6 Sol. 중립 코딩 지수에서 Level 수준의 역량을, 작업당 비용은 약 3분의 1로 달성합니다. 토큰을 3분의 1만 써서 거기에 도달하기 때문입니다.
• 실행 길이 자체가 핵심인 장기 지평 작업 — Grok 4.7. 이번 릴리스는 여러 시간에 걸친 작업을 위해 특별히 훈련되었으며, SWE-Marathon과 CursorBench에 대한 벤더 수치도 바로 그 방향으로 움직인다.
• 지연에 민감한 볼륨 — 현재 기록상으로는 둘 다 아닙니다. 작업당 비용은 Sol이 더 나은 수치이지만, Grok 4.7의 측정된 초당 39토큰은 인터랙티브한 모든 것에 실질적인 제약입니다.
• 대부분 캐시되는 장문 컨텍스트 워크로드 — GPT-6 Sol, 출력 라인이 아니라 캐시 읽기 라인 기준. 캐시된 토큰 백만 개당 $0.50 대비 $0.20이고, 윈도우 크기도 두 배이므로, 프롬프트에서 안정적인 부분이 많을수록 그 명분은 더 강해진다.
• 비교가 토큰당 요율표를 기준으로 만들어졌다면, 작업당 비용을 기준으로 다시 만드세요. $6.00 대 $10.00 출력은 이 글에서 가장 정보가 적은 두 숫자이며, 모든 기존 페이지가 가장 먼저 내세우는 바로 그 두 숫자입니다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
