
GPT-6 Sol vs Grok 4.7: 더 저렴하지만 세 배의 비용이 드는 토큰
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026년 9월, 하루 간격으로 두 모델이 출시되었는데, 가격표만 놓고 보면 둘은 그리 가깝지 않다. Grok 4.7은 9월 21일, 입력 토큰 100만 개당 2.00달러, 출력 토큰 100만 개당 6.00달러에 출시되었다. GPT-6 Sol은 9월 22일, 동일한 입력 2.00달러, 출력 10.00달러에 출시되었다. Grok의 출력이 40% 더 저렴하다. 대부분의 비교가 바로 이 점만 근거로 Grok을 선택하겠지만, 그것은 잘못된 숫자를 보고 있는 것이다.
이 짝을 결정하는 숫자는 어느 요금표에도 없습니다. 그것은 2억 4천만 대 7천 7백만 — Artificial Analysis가 Intelligence Index를 실행하는 동안 각 모델이 생성한 출력 토큰입니다. Grok 4.7은 같은 질문 세트에 답하기 위해 3배가 조금 넘는 토큰을 태웠습니다. 이를 토큰당 요금에 곱하면, 출력 단가가 더 저렴한 모델이 완료된 작업당 $3.74, 상대는 $1.06의 비용이 들게 됩니다. 토큰당으로는 더 저렴하지만 청구서는 3배가 넘습니다.
각 모델이 실제로 무엇인지
Grok 4.7은 Grok 4.6의 후속 모델로, xAI의 가장 강력한 코딩 및 지식 작업 모델로 자리매김하며, 500,000토큰 컨텍스트 창, 텍스트 및 이미지 입력, 텍스트 출력, 그리고 낮음, 중간, 높음, xhigh로 설정 가능한 추론 강도를 갖추고 있습니다. xAI는 파라미터 수를 공개하지 않았습니다. 이 모델은 2026년 6월로 보고된 사전 학습 컷오프를 받아들이며, 8월까지 보충 학습이 이루어졌습니다.
GPT-6 Sol은 OpenAI의 중급 GPT-6 모델로, 플래그십 GPT-6 Astra 아래, 보급형 GPT-6 Luna 위에 있으며, 1,050,000토큰 컨텍스트 윈도우, 922,000토큰 최대 입력, 128,000토큰 출력 상한, 그리고 2026년 4월 20일 지식 컷오프를 갖추고 있습니다. 텍스트와 이미지를 입력받아 텍스트를 출력하며, 추론 노력은 없음부터 최대까지 설정할 수 있고, OpenAI는 이 모델의 가격이 프로모션이 아닌 영구적이라고 설명했습니다.
컨텍스트 윈도는 비슷하지 않습니다. Sol의 것은 대략 두 배입니다. 이는 정확히 한 가지 워크로드 유형에 중요하며, 대부분의 사람들이 실행하는 유형은 아닙니다.
요율표, 그리고 그것을 뒤집는 선
• 입력 — GPT-6 Sol 백만 토큰당 $2.00 대 Grok 4.7 백만 토큰당 $2.00; 동일
• 출력 — GPT-6 Sol 백만 토큰당 $10.00 vs Grok 4.7 백만 토큰당 $6.00; Grok이 40% 더 저렴합니다
• 캐시된 입력 — GPT-6 Sol은 백만 토큰당 $0.20, Grok 4.7은 백만 토큰당 $0.50; Sol의 캐시 읽기는 2.5배 더 저렴한데, 이는 출력 요금이 시사하는 바와 반대입니다.
• 캐시 쓰기 — GPT-6 Sol은 백만 토큰당 $2.50인 반면, Grok 4.7은 같은 시트에 공개되지 않은 요율
• 컨텍스트 창 — GPT-6 Sol 1,050,000 토큰 대 Grok 4.7 500,000 토큰
• 장문 컨텍스트 할증 — GPT-6 Sol은 입력 토큰 272,000개를 초과하는 요청에 대해 전체 요청 기준으로 입력 및 캐시 요율을 2배, 출력을 1.5배로 재산정하는 반면, Grok 4.7은 입력 토큰 200,000개에서 모든 요율을 2배로 올리며, 이 역시 전체 요청에 적용된다
• 지식 컷오프 — GPT-6 Sol 2026년 4월 20일 vs Grok 4.7: 2026년 6월로 보고된 사전 학습 컷오프, 8월까지 보충 학습
• 추론 강도 — GPT-6 Sol 없음, 낮음, 중간(기본값), 높음, 매우 높음, 최대 vs Grok 4.7 낮음, 중간(기본값), 높음, 매우 높음
• 모달리티 — 텍스트와 이미지 입력, 텍스트 출력, 둘 모두 해당
캐시 요금 항목은 구매자가 곰곰이 따져봐야 할 부분이다. Grok의 출력 요금은 더 낮지만, 캐시된 입력 요금은 Sol의 2.5배이며, 캐시된 입력은 긴 에이전트 이력과 반복되는 시스템 프롬프트가 있는 곳이다. 대규모의 안정적인 컨텍스트를 주로 다시 읽는 워크로드라면 두 요금이 $6 대 $10이라는 숫자가 시사하는 것보다 훨씬 가깝게 느껴질 것이며, 여기에 토큰 볼륨 비율까지 적용하면 순위가 뒤바뀐다.

왜 2억 4천만 토큰이 모든 것을 말해주는가
Artificial Analysis는 Grok 4.7이 xhigh에서 인덱스 실행 동안 약 2억 4천만 개의 출력 토큰을 생성한 것으로 측정했으며, 이는 같은 보드에 있는 모델들의 중앙값 약 8,800만 개와 대비된다. 자체 요약에서는 이 모델을 "눈에 띄게 느리고 매우 장황하다"라고 표현한다. 같은 하네스에서 측정된 GPT-6 Sol은 7,700만 개를 생성했으며, 보드에서는 "상당히 간결하다"라고 설명된다.
이 보드는 또한 그 결과를 직접 보고한다. Grok 4.7은 작업당 $3.74로 Intelligence Index에서 46점을 기록한다. 높은 설정에서는 점수도 46점이며 비용은 작업당 $2.73이다. GPT-6 Sol은 작업당 $1.06으로 48점을 기록한다. 동일한 인덱스, 동일한 하네스, 그리고 어떤 요금표에도 나오지 않는 2배에서 3.5배의 비용 차이다.
이 수치들을 깔끔한 일대일 비교로 받아들이기 전에 두 가지 주의할 점이 있습니다. 두 페이지는 같은 날 캡처되었지만 보드마다 총계가 다릅니다 — Grok 페이지는 212개 모델 클래스를 보여 주고, 별도의 Grok 목록은 655개 중 순위를 보고합니다 — 따라서 두 점수가 동일한 인덱스 빌드에 있다고 보장할 수 없습니다. 또한 두 수치 중 어느 것도 공급업체 수치가 아닙니다. Artificial Analysis는 자체 하네스를 실행하며, 바로 그 점이 핵심이지만, 두 목록 간 추론 설정이 다르므로(Grok은 xhigh, Sol은 max) 500퍼센트 비용 격차는 발견 사항으로, 2포인트 인덱스 격차는 대략적인 값으로 취급하십시오.

xAI가 공개한 것, 그리고 아무도 확인하지 않은 것
xAI 자체 발표 수치는 강력하며, 모든 벤더 출시 수치가 그렇듯 재현되지 않았다. CursorBench 4.0은 xhigh에서 46.3%로 Grok 4.6의 40.4%와 대비된다. Terminal-Bench 4.0은 38.0%로 20.3%와 대비된다 — 이번 릴리스에서 단일 최대 상승폭이다. DeepSWE v1.1은 high에서 71.0%로 65.2%와 대비된다. EEBench는 64.0%로 53.0%와 대비된다. 이는 xAI의 하네스, xAI의 설정, xAI의 보고다.
OpenAI가 GPT-6 Sol에 대해 내놓은 수치들은 같은 패턴을 따르며, 마찬가지로 할인해서 봐야 한다. 차이는 Sol이 Grok보다 독립적인 증거를 하나 더 갖고 있다는 점이다. 바로 Artificial Analysis의 작업당 비용 수치인데, 이는 벤더의 점수표가 아니라 측정된 토큰 소비량으로부터 계산된다. 이 비교에서 살아남는 숫자는 바로 그것이다.
두 모델 중 어느 쪽에 대해서도 아무도 발표하지 않은 것은, 동일한 과제에서 동일한 하네스와 동일한 노력 설정으로 맞붙인 직접 비교다. 그런 걸 보게 된다면, 그 세 변수 중 무엇이 달라졌는지 확인하세요.
한 달치 캐시된 에이전트 트래픽 가격 책정
대부분 안정적인 컨텍스트로 구성된 워크로드를 생각해 보겠습니다: 60,000토큰의 시스템 프롬프트와 리포지토리 요약을 가진 코딩 에이전트가 한 달에 5,000회 호출에서 이를 다시 읽고, 각 호출이 4,000개의 출력 토큰을 반환합니다. 캐싱이 작동하며 안정적인 프리픽스는 캐시된 요율로 청구된다고 가정합니다.
GPT-6 Sol 기준: 캐시된 입력 토큰 3억 개는 백만 개당 $0.20로 $60.00입니다. 출력 토큰 2천만 개는 백만 개당 $10.00로 $200.00입니다. 총합은 $260.00입니다.
Grok 4.7 기준: 동일한 3억 개의 캐시된 입력 토큰은 백만 개당 $0.50로 $150.00입니다. 2천만 개의 출력 토큰은 백만 개당 $6.00로 $120.00입니다. 합계는 $270.00입니다.
거의 동일합니다 — 그리고 이는 토큰량을 일정하게 유지한 경우이며, 이는 관대한 가정입니다. 인덱스 실행에서 측정된 Grok 4.7의 장황함은 Sol의 세 배였습니다. 출력량에 1.5배를 곱하기만 해도 Grok의 청구액은 Sol의 $320.00 대비 $330.00이 되고, 거기서부터 격차는 더 벌어집니다. 더 저렴한 출력 단가는 캐싱과 장황함이 더해지면 살아남지 못하며, 캐싱만으로도 간신히 살아남습니다.
여기서 OrcaRouter를 통한 두 모델의 가격에 관한 주장은 아닙니다 — 어느 모델도 우리 카탈로그에 없습니다. GPT-6 Sol은 OpenAI 자체 API를 통해, Grok 4.7은 xAI를 통해 접근할 수 있으며, Grok 4.6을 포함한 나머지 Grok 라인업은 우리를 통해 패스스루 모델에 따라 xAI의 정가로. 이 계산의 핵심은, 여러분이 작성하는 에스컬레이션 규칙이 요율표가 아니라 자체 트래픽에서의 완료된 작업당 비용을 기준으로 삼아야 한다는 것입니다 — 그리고 라우팅 레이어가 있기에 두 번째 계약 없이 그 규칙을 시험해 볼 수 있습니다.

각자가 속한 곳
• 대용량·캐시된 컨텍스트 에이전트 작업 — GPT-6 Sol. 캐시 입력 라인은 Sol에 2.5배 유리하고 출력량 라인은 Grok에 그보다 더 큰 폭으로 유리하며, 이 둘은 겹쳐서 증폭된다.
• 이번 릴리스에서 공개된 Terminal-Bench 개선 중 가장 강력한 것을 원하는 코딩 작업 — 숫자를 가진 모델은 Grok 4.7이고, 그 숫자는 아주 큽니다. 토큰만 예산에 잡고, 요율은 신경 쓰지 마세요.
• 500,000 토큰이 넘는 긴 문서 — GPT-6 Sol, 그리고 이건 근소한 차이가 아니다. Grok의 윈도는 Sol의 윈도가 절반 지점에 이르는 곳에서 끝난다.
• 지연 시간에 민감한 경로 — 둘 다 아닙니다. Artificial Analysis는 Grok 4.7을 초당 출력 토큰 39.2개로 기재하며, 이를 눈에 띄게 느리다고 설명합니다. 더 낫다고 가정하기 전에 현재 순위표에서 Sol 자체의 속도 수치를 확인하세요.
• "그래서 Grok이 더 저렴하다"로 끝나는 토큰당 비교를 보여받았다면 — 그것은 한 단계 너무 일찍 끝난 것입니다. 다음 단계는 토큰 수입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
