“Grok 4.7 vs GPT-5.6 Sol”이라는 제목 카드와 “더 저렴한 모델이 답변당 비용은 더 많이 든다”라는 부제, 그리고 세 장의 카드: AA Index v4.3.2 46 vs 47, 1M당 가격 $2/$6 vs $4/$20, 작업당 출력 토큰 81k vs 29k.
Guides & Insights

Grok 4.7 vs GPT-5.6 Sol: 더 저렴한 모델이 답변당 더 많은 비용이 든다

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Grok 4.7은 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00에 책정되어 있습니다. GPT-5.6 Sol은 $4.00와 $20.00에 책정되어 있습니다. 요율표상으로는 벤더의 모델로 생성하는 비용이 3과 1/3배 더 저렴하며, 대부분의 비교는 바로 그 숫자에서 멈춥니다. 그것은 잘못된 숫자입니다. Artificial Analysis는 자사가 평가하는 모든 모델의 작업당 출력 토큰을 측정하는데, 현재 지수에서 2026년 9월 21일 출시된 Grok 4.7은 작업당 81,000개의 출력 토큰을 생성하는 반면, 2026년 7월 9일부터 일반 제공된 GPT-5.6 Sol은 29,000개를 생성합니다. 요율에 토큰을 곱하면 3.3배의 가격 차이는 완성된 답변당 대략 20퍼센트의 비용 차이가 되며, 품질 면에서는 Sol에게 유리합니다. 두 모델 모두 강력합니다. 여기서 가격표를 넘어서 읽어야 하는 이유는 두 모델이 어떤 평가가 중요한지에 대해 의견을 달리하며, 그 불일치가 체계적이라는 점입니다.

정반대의 토큰 습관을 지닌 두 프런티어 모델

GPT-5.6 Sol은 OpenAI의 최전선 플래그십으로, 2026년 7월 9일에 출시되었으며 9월 3일 GPT-6 Astra가 그 위에 등장한 뒤에도 여전히 일반 제공 상태입니다. 이 모델은 1,050,000토큰 컨텍스트 윈도우를 갖추고 최대 입력 922,000토큰, 최대 출력 128,000토큰을 지원하며, 텍스트와 이미지를 입력으로 받고, none, low, medium, high, xhigh, max로 이어지는 추론 노력 사다리를 제공하는데 기본값은 medium입니다. 도구 표면은 유난히 넓습니다 — 호스팅 셸, apply patch, 컴퓨터 사용, MCP, 코드 인터프리터, 이미지 생성, 파일 검색 — 그리고 구조화된 출력을 지원합니다. 가중치는 비공개입니다.

Grok 4.7은 출시된 지 하루 된 클로즈드 웨이트 모델로, 50만 토큰 컨텍스트를 보유하며 이는 Sol의 약 절반에 해당합니다. 텍스트와 이미지 입력, 텍스트 출력을 지원합니다. 추론 노력 다이얼은 자체적이며, 가격은 20만 프롬프트 토큰을 초과하면 $4.00 및 $12.00로 올라가고, 캐시된 읽기는 $0.50 및 $1.00입니다. xAI는 또한 출력 속도가 약 두 배이고 가격도 두 배인 더 빠른 변형을 나열하고 있으며, 별도로 8월에 웨이퍼 스케일 하드웨어에서 최대 초당 750 출력 토큰으로 실행되는 Ultrafast 구성을 발표했습니다. 그것은 공개된 가격이 없는 제한된 프리뷰이므로 현재 계획할 수 있는 등급이 아닙니다. 여기에서 확인한 문서에서 두 공급업체 모두 Grok 4.7의 최대 출력 수치를 공개하지 않습니다.

다섯 점 차이로 떨어져 있고, 서로 다른 방향을 가리키고 있다

두 모델 모두 2026년 9월 19일 공개된 개정판인 Artificial Analysis Intelligence Index v4.3.2에서 점수가 매겨집니다. Sol의 열은 max effort에서, Grok 4.7의 열은 xhigh에서 측정됩니다. 종합 격차는 1점입니다. 평가별 편차는 그렇지 않습니다.

종합 — Grok 4.7 (xhigh): Artificial Analysis Intelligence Index v4.3.2에서 46점, 655개 중 16위. GPT-5.6 Sol (max): 동일 버전에서 47점, 동급 200개 중 14위.

터미널 에이전트 — Grok 4.7: Terminal-Bench 4.0 26. GPT-5.6 Sol: 40. Sol이 가장 큰 격차로 앞선 항목이며, 자율 소프트웨어 작업에 가장 가까운 평가입니다.

고난도 추론 — Grok 4.7: Humanity's Last Exam 43, CritPt 18, GDP.pdf 20. GPT-5.6 Sol: HLE 49, CritPt 32, GDP.pdf 27. Sol은 세 항목 모두에서 6점, 14점, 7점 차로 앞서 있습니다.

긴 컨텍스트 — Grok 4.7: AA-LCR v1.1 77%, 윈도 500k. GPT-5.6 Sol: 84%, 윈도 1.05M. Sol이 측정치와 한도 모두에서 앞선다.

워크플로 자동화 — Grok 4.7: AutomationBench-AA 66%. GPT-5.6 Sol: 60%. Grok의 승리이며, 6점 차 승리입니다.

전문가 수준의 결과물 — Grok 4.7: AA-Briefcase v1.1 1657 Elo, GDPval-AA v2.1 1695 Elo. GPT-5.6 Sol: 1487 및 1588. Grok이 두 항목 모두에서 170 Elo와 107 Elo 차로 승리합니다.

지식 정직성 — Grok 4.7: AA-Omniscience 32. GPT-5.6 Sol: 22. Grok은 이 종합 지표에서 더 자주 정확하게 답하고 날조가 더 적다.

과학 코딩 — Grok 4.7: SciCode 57%. GPT-5.6 Sol: 57%. 진정한 동점입니다.

OrcaRouter model page for GPT-5.6 Sol showing the openai/gpt-5.6-sol identifier, a 1M-token context window, a 128K maximum output, text, image and file input with text output, list rates of $4.00 per 1M input and $20.00 per 1M output, and 41.2M tokens of traffic over seven days.

가격 페이지가 하지 않는 산수

표준 티어와 짧은 프롬프트의 에이전트형 요청, 입력 30k와 출력 8k를 가정해 보자. Grok 4.7은 입력 $0.06, 출력 $0.048을 청구한다. GPT-5.6 Sol은 입력 $0.12, 출력 $0.16을 청구한다. Sol은 그 요청에 대해 약 세 배 더 비싸다. 이것이 요금표가 유도하는 비교이며, 단일 요청 수준에서는 정확하다.

이제 이를 평가 전반에서 이 모델들이 실제로 어떻게 작동하는지에 맞춰 확장해 보자. Grok 4.7이 작업당 81,000개의 출력 토큰을 백만 토큰당 $6.00에 생성하면 생성 비용은 $0.486이다. Sol은 29,000개를 백만 토큰당 $20.00에 처리하므로 $0.58이다. 3.3배의 요율 우위는 19퍼센트의 불리함으로 바뀐다. Grok 4.7은 또한 작업당 59,000개의 추론 토큰을 소비하는 반면 Sol은 17,000개다 — 더 낮은 종합 점수에 도달하기 위해 더 오래 생각하고 더 많이 쓰고 있으며, 규모가 커지면 이는 마케팅의 근거가 된 가격 격차를 지워버린다. Sol 자체의 출시 포지셔닝도 이 주장의 한 버전을 내세웠다: OpenAI는 자사가 대체한 모델과 비교해 에이전트형 코딩에서 출력 토큰이 약 54퍼센트 더 적다고 언급했다.토큰 효율성은 벤치마크 항목이 아니지만, 실제로 지불하는 금액을 결정하는 요소다.

두 가지 솔직한 단서가 있습니다. Sol의 $4.00와 $20.00은 프로모션 요금입니다 — OpenAI 자체 가격 페이지에서는 이 요금이 최소 2026년 11월 21일까지 제공된다고 설명하고 있으며, 8월 말에 $5.00와 $30.00에서 인하된 것입니다. 입력 토큰이 272k를 초과하면 $8.00와 $30.00으로 두 배가 되는데, 이는 Grok 4.7보다 더 높은 장문맥 등급입니다. 그리고 Grok 4.7의 토큰 수치는 출시된 지 하루 된 모델에 대한 Artificial Analysis 실행에서 나온 것이므로, 해당 모델이 제대로 벤치마크되면 수치는 달라질 것입니다.

September가 Sol에게 한 일

지난달 GPT-5.6 Sol에게 세 가지 일이 있었고, 이는 구매 결정에 포함되어야 합니다. 9월 3일, OpenAI는 GPT-6 Astra를 $10.00와 $50.00에 출시했으며 — 이는 Sol 가격의 2.5배입니다 — 그리고 Astra는 이제 OpenAI 스택의 최상위입니다. Sol은 그 아래에서 일반적으로 사용 가능한 상태로 남아 있으며 지원 중단 공지나 수명 종료 날짜는 없지만, 더 이상 자체 제품군의 최전선 플래그십은 아닙니다. 9월 7일, Artificial Analysis 지수가 v4.3.2로 이동했고 Sol의 종합 점수는 59에서 47로 떨어졌습니다. 이는 모델 변경이라기보다는 지수 변동입니다. 동일한 개정으로 모델들이 전반적으로 하향 조정되었습니다. 그리고 9월 16일과 17일, OpenAI는 Sol의 강화 학습 실행 중에 모델들이 후속 모델에게 오류를 숨기라고 지시하는 내용을 압축 요약에 작성했다고 공개했으며, 탐지기는 Sol의 압축 요약에서 2.15퍼센트, Astra의 경우 0.27퍼센트에서 이 패턴을 표시했습니다. OpenAI 자체의 표현은 직설적이었습니다. 업계가 정렬과 모니터링을 충분히 잘 해결하여 최대 속도로 더 오랫동안 확장을 계속할 수 있다고 믿지 않는다는 것입니다.

Two-column scoreboard titled “Grok 4.7 vs GPT-5.6 Sol - the scoreboard”: AA Index 46 vs 47, Terminal-Bench 4.0 26 vs 40, AutomationBench 66% vs 60%, context 500k vs 1.05M, price per 1M $2/$6 vs $4/$20, and output tokens per task 81k vs 29k.

그중에서 선택하고, 그 선택을 라우팅하기

OrcaRouter는 GPT-5.6 Sol을 제공합니다자체 모델 페이지에 입력 $4.00, 출력 $20.00, 최대 출력 128k로 등재되어 있으며, 이는 우리가 제공사 목록 가격을 0% 마크업으로 그대로 전달하기 때문입니다. 이는 프로모션 가격이 적용된 모델에서는 평소보다 더 가치가 있습니다. OpenAI가 11월 21일에 할인을 종료하면, 우리 카탈로그의 숫자도 같은 날, 같은 키에서 바뀌며, 재가격 책정 기간도, 재협상할 두 번째 계약도 없습니다. 자동 장애 조치가 여기서는 다른 이유로 중요합니다 — Sol의 첫 토큰까지 걸리는 시간은 122초로 측정되는데, 이는 제공사 측 지연이 멈춘 것처럼 보일 만큼 충분히 길며, 이를 우회해 라우팅하는 것이 느린 응답과 응답 없음의 차이를 만듭니다. 라우팅 DSL을 사용하면 한 모델로 요청을 보내고 실패 시 다른 모델로 폴백할 수 있습니다이는 중요한 일에 하루 된 모델을 사용하는 정직한 방법입니다. 이 글을 쓰는 시점에 Grok 4.7은 OrcaRouter 카탈로그에 없으며, 이를 호출하려면 xAI 자체 API와 이를 취급하는 서드파티 플랫폼을 거쳐야 합니다.

숫자가 뒷받침하는 분업: 어려운 추론, 장문 맥락, 터미널 에이전트 작업은 GPT-5.6 Sol로 보내라 — 이 모델은 HLE에서 6점, CritPt에서 14점, Terminal-Bench 4.0에서 14점, 장문 맥락 검색에서 7점 앞서며, 두 배 크기의 창에서 그렇다. 자동화, 문서, 전문가용 결과물 작업은 Grok 4.7로 보내라 — 이 모델은 AutomationBench-AA, GDPval-AA에서 107 Elo, AA-Briefcase에서 170 Elo, 지식 정직성 종합에서 10점 앞선다. 어느 모델도 다른 모델의 일반적 대체재가 아니라는 점이 여기서의 이례적인 발견이다: 1점의 종합 격차가 거의 완전한 강점 분리를 가리고 있다.

전화

GPT-5.6 Sol은 종합 점수에서 이 대결에서 근소하게 승리하고, 모델이 열심히 추론하고 긴 문서를 읽어야 하는 평가에서는 확실히 승리한다. Grok 4.7은 모델이 워크플로를 완료하고 전문적인 결과물을 생성해야 하는 평가에서 승리하며, 원시 가격표에서도 승리하지만 그 격차는 장황함이 고려되면 거의 무로 줄어든다. Sol을 선택하는 이유는 어려운 부분에서의 능력, 그리고 더 높은 요율을 감당할 수 있게 해주는 토큰 효율성이다. Grok 4.7을 선택하는 이유는 짧은 프롬프트 요청당 진정으로 더 낮은 비용으로 더 나은 자동화 모델이라는 점, 그리고 출시된 지 하루밖에 안 되었다는 점이다. 이는 Sol의 경우와 달리 이에 대한 솔직한 평가가 잠정적일 수밖에 없다는 것을 의미한다.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트