"GPT-5.6 vs Grok 4.6"에 대한 히어로 타이틀 카드, 오버라인 "61로 동점 — 가격과 컨텍스트는 상이": 왼쪽 둥근 카드 "GPT-5.6 Sol" (OpenAI — 2026년 7월 9일 출시; $4.00 / $20.00 per 1M; ~1.05M 컨텍스트 · 128K 출력; 최대 노력 = 서브에이전트 4개) 및 오른쪽 둥근 카드 "Grok 4.6" (SpaceXAI — 2026년 8월 12일 출시; $2.00 / $6.00 per 1M; 500K 컨텍스트 · 출력 상한 없음; 노력 다이얼 낮음~매우 높음), 푸터 "독립 AA 지수: 61 = 61.", OrcaRouter 로고는 오른쪽 하단.
Guides & Insights

GPT-5.6 vs Grok 4.6: 인덱스에서는 동급, 컨텍스트와 가격에서는 갈림

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

두 모델 모두 2026년 9월 초까지 측정 기준이었던 Artificial Analysis Intelligence Index 척도에서 OpenAIGPT-5.6(플래그십 티어인 GPT-5.6 Sol, 즉 gpt-5.6 API 이름이 라우팅되는 모델)과 SpaceXAI의 Grok 4.6은 같은 61점을 기록했습니다. 독립 지수에서 라이벌 플래그십 두 모델이 동점을 기록한 것은 프런티어 비교에서 가장 보기 드문 결과이며, 이 대결은 여기서 끝나는 것이 아니라 여기서부터 흥미로워집니다. 동점을 기록한 두 모델은 매우 다른 방식으로 판매됩니다. OpenAI가 7월 9일에 출시한 플래그십 모델 GPT-5.6 Sol은 9월 3일 GPT-6 Astra가 출시되면서 밸류 티어로 재편되었으며, 8월 24일 가격 인하 이후 입력 토큰 100만 개당 $4.00, 출력 토큰 100만 개당 $20.00에 책정되어 있고 최대 약 105만 토큰의 컨텍스트를 읽을 수 있습니다. xAI가 8월 12일에 출시한 Grok 4.6은 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00에 책정되어 있으며 최대 500,000토큰을 지원합니다. 독립 평가에서는 같은 점수를 받았지만, 두 모델은 단일 요청을 얼마나 확장할 수 있는지, 그리고 그 확장에 드는 비용에서 갈라집니다.

이 페이지는 지금 분명한 이유로 존재합니다. 두 요율표와 두 상한선이 서로 몇 주 간격으로 변경되었기 때문입니다. Grok 4.6은 8월 12일에 출시되었고, 처음 2주 동안 Grok Build와 API로만 제한되었다가 8월 28일부터 웹과 모바일의 일반 Grok 채팅에서 사용할 수 있게 되었습니다. GPT-5.6 Sol의 프로모션 할인은 8월 24일에 적용되었고, 10일 후 출시된 GPT-6 Astra로 인해 Sol은 플래그십에서 밸류 플래그십으로 조용히 강등되었습니다. 아래 두 모델 모두 이제 Astra급 가격을 지불하지 않고 프론티어에 준하는 추론을 원할 때 손이 가는 모델입니다. 이것이 바로 61 대 61 동률이 단순한 지엽적 질문이 아닌 실제 결정의 분기점이 된 이유입니다.

"tied at 61"이 의미하는 것과 의미하지 않는 것

점수에는 날짜와 척도가 필요하다. Artificial Analysis는 9월 초까지 사용된 지수 척도에서 GPT-5.6 Sol을 약 61, Grok 4.6을 61로 측정했다. 이 블로그의 다른 GPT-5.6 대결에서 인용하는 척도가 바로 이것이다. 그 척도에서 Grok은 AA가 추적하는 202개 모델 중 11위였고, Sol은 같은 점수에서 Grok과 두어 단계 차이였다. 이후 AA는 9월 7일(v4.3)에 지수를 재보정했는데, 이 버전은 점수를 압축한다. GPT-5.6 Sol은 그 버전에서 47로 측정되고, GPT-6 Astra와 Claude Fable 5.1은 53으로 측정되며, Grok 4.6의 전체 점수는 아직 새 척도로 발표되지 않았다. 따라서 아래의 동률은 재보정 전 9월 척도에 관한 진술이며, 상대적 위치로 읽는 것이 가장 좋다. 둘 다를 평가한 가장 최근 지수에서 이 둘은 동률이었고, 둘 다 Claude Opus 5 등급 바로 뒤에 있었다.

동점 결과에 대해 한 가지 더 주의할 점이 있습니다. 이는 이 결과를 어떻게 활용하느냐와 관련해 중요합니다. 두 점수는 서로 다른 노력 설정에서 나왔습니다. GPT-5.6 Sol은 max reasoning, 즉 OpenAI의 최고 다이얼 설정(어려운 요청에 대해 네 개의 병렬 하위 에이전트를 실행)에서, Grok 4.6은 high, 즉 xAI의 low-to-xhigh 다이얼 기본 설정에서 나온 결과입니다. 둘 다 '모든 것을 쏟아붓는' 구성이지만 동일한 구성은 아니며, 동점은 이 모델들이 제공하는 모든 설정 사이의 동점이 아니라 바로 그 두 특정 설정 사이의 동점입니다. 동일한 점수가 확실히 보여주는 것은, 어느 진영도 독립적인 종합 지표에서 상대 진영이 가리킬 수 있는 일반 지능 우위를 지니지 못한다는 점입니다. 그렇기에 둘 중 하나를 선택하는 구매자는 지표 너머를 살펴봐야 합니다. 즉 맥락, 가격, 그리고 각 측이 실제로 제시할 수 있는 증거를 봐야 합니다.

요금 카드 2개, 절벽 2개

두 공급업체 모두 긴 프롬프트를 프리미엄 이벤트로 청구하며, 임계값을 초과하면 전체 요청을 더 높은 등급으로 청구합니다. 이것이 이 가격 비교를 명확하게 만드는 공통 메커니즘입니다. OpenAI의 GPT-5.6 Sol 요금은 캐시된 읽기 $0.40과 함께 백만 개당 $4.00 / $20.00이며, 요청이 약 272K 입력 토큰을 초과하면 전체 요청이 $8.00 / $30.00으로 재책정됩니다. 이는 Epoch AI가 9월 8일에 문서화한 긴 컨텍스트 구조입니다. xAI의 Grok 4.6 요금은 캐시된 읽기 $0.50과 함께 $2.00 / $6.00이며, 프롬프트가 200K 토큰을 초과하면 전체 요청이 $4.00 / $12.00으로 이동합니다.

출시 — GPT-5.6: 2026년 7월 9일 (공개 API; gpt-5.6 별칭은 Sol 티어에 도달). Grok 4.6: 2026년 8월 12일.

1M당 정가 (입력 / 출력) — GPT-5.6 Sol: $4.00 / $20.00, 캐시 읽기 $0.40 (2026년 11월 21일까지 유효한 프로모션). Grok 4.6: $2.00 / $6.00, 캐시 읽기 $0.50.

긴 프롬프트 등급 — GPT-5.6 Sol: 전체 요청 기준, 약 272K 입력 초과 시 $8.00 / $30.00. Grok 4.6: 전체 요청 기준, 200K 입력에서 $4.00 / $12.00.

컨텍스트 / 출력 상한 — GPT-5.6 Sol: 입력 약 1.05M, 출력 128K. Grok 4.6: 입력 500K, 공개된 출력 상한 없음.

Index (독립적) — GPT-5.6 Sol (max) ~61 vs Grok 4.6 (high) 61, 재보정 전 9월 척도 기준.

모달리티 — 둘 다 텍스트와 이미지 입력을 받고 텍스트를 생성합니다.

계산된 수치를 살펴보면 패턴이 명확합니다: Grok 4.6이 서비스할 수 있는 모든 프롬프트 길이에서, 재조정된 상한선이 여전히 GPT-5.6 Sol의 표준 요금과 같거나 그 이하에 위치하기 때문에, Grok 4.6이 더 저렴한 선택입니다.

입력 100K / 출력 8K — GPT-5.6 Sol: 0.10 × $4 + 0.008 × $20 = $0.56. Grok 4.6: 0.10 × $2 + 0.008 × $6 = $0.25. Grok은 이 요청에서 약 55% 더 저렴합니다.

400K 입력 / 30K 출력 (둘 다 가격 재조정됨) — GPT-5.6 Sol: 0.40 × $8 + 0.03 × $30 = $4.10. Grok 4.6: 0.40 × $4 + 0.03 × $12 = $1.96. Grok은 자체 클리프(cliff)가 적용된 이후에도 여전히 약 절반 가격이다.

600K 입력 / 30K 출력 — GPT-5.6 Sol: 0.60 × $8 + 0.03 × $30 = $5.70. Grok 4.6: 불가 — 600K는 500K 컨텍스트 창을 초과합니다. 이 대역은 Sol이 유일한 옵션이 되는 구간이며, 가격이 더 이상 프리미엄처럼 보이지 않는 지점입니다.

A two-column scoreboard titled 'GPT-5.6 vs Grok 4.6 — the scoreboard'. Left column 'GPT-5.6 Sol': Released Jul 9 2026; Price $4.00 / $20.00 per 1M, cache $0.40; Over 272K input whole request $8.00 / $30.00; Context / output ~1.05M / 128K; AA Intelligence Index ~61 (max); SWE-bench Verified ~96% (reported). Right column 'Grok 4.6': Released Aug 12 2026; Price $2.00 / $6.00 per 1M, cache $0.50; At 200K input whole request $4.00 / $12.00; Context / output 500K / no published cap; AA Intelligence Index 61 (high); GPQA Diamond 94.9% (reported). Footer: 'Independent index: tied at 61 — AA scale, pre-Sept-7 2026 recalibration.'; OrcaRouter logo bottom-right.

절벽 형태가 한 가지 점에서 GPT-5.6 Sol에 유리한 차이를 보인다. Sol의 임계값(272K)이 Grok의 임계값(200K)보다 높아서, 입력이 대략 200K~272K인 구간에서는 Grok은 이미 재가격화됐지만 Sol은 아니다. 그 구간에서도 Grok이 달러 기준으로 승산이 있다. Grok의 재가격화된 출력 요율 $12는 여전히 Sol의 기본 $20보다 40% 낮기 때문이다. 경제적 우위는 토큰 500K를 넘어서야 Sol 쪽으로 뒤집히는데, 이는 정확히 Grok의 컨텍스트 윈도가 진입할 수 없는 영역이다. 프롬프트 길이가 200K 미만이라면(대부분의 채팅·RAG·코드 지원 트래픽이 여기에 해당) Grok 4.6이 혼합 비용 기준으로 거의 2배 가까이 저렴하며, 전체 요청에 걸리는 절벽 특성상 200K를 부드러운 제안이 아니라 계획 경계로 삼아야 한다.

Sol의 추가 50만 토큰이 실제로 무엇을 위한 것인지

Grok 4.6의 500K 윈도우는 사양표가 시사하는 것보다 더 많은 실제 작업 부하에 맞습니다. — 전체 코드베이스 읽기, 긴 에이전트 기록, 대규모 검색 컨텍스트 — 그리고 공개된 출력 상한이 없다는 점이 생성 측면에서도 도움이 됩니다. 매우 긴 산출물을 내보내야 하는 단일 호출의 경우, Grok은 문서화된 상한이 없는 반면 GPT-5.6 Sol은 출력 토큰 128K에서 멈춥니다. GPT-5.6 Sol의 장점은 500K~1.05M 구간에 있으며, 실제로 그 구간이 필요한 작업 부하는 마케팅이 암시하는 것보다 더 한정적입니다. 전체 저장소와 긴 작업 기록을 컨텍스트에 담아 두는 에이전트, 매우 긴 회의나 연구 기록을 한 번에 분석하는 경우, Grok 크기 윈도우로 분할하기에는 너무 큰 말뭉치에 대한 검색 작업 등이 그것입니다. 파이프라인 중 어느 것도 그 구간에 닿지 않는다면, Sol의 추가 컨텍스트는 사용하지 않기 위해 $4.00 입력 요율을 지불하는 여유 공간일 뿐입니다.

두 모델은 추론을 이끄는 방식도 다릅니다. GPT-5.6 Sol은 low/medium/high/max 노력 다이얼을 제공하며, max에서는 어려운 작업을 조율하는 네 개의 병렬 하위 에이전트가 실행됩니다. 즉, 요청 하나마다 사실상 소규모 에이전트 스웜이 가동되는 셈으로, 강력하지만 출력 토큰을 많이 소모하고 ~61 지수 점수를 만든 설정이기도 합니다. Grok 4.6은 단일 모델로 실행되며 low-to-xhigh 다이얼(기본값 high)과 검색·코드 실행용 서버 측 도구를 갖추고 있어 지출을 더 예측 가능하게 만듭니다. 요청 하나, 모델 하나, 요금표에서 산정할 수 있는 비용 덕분입니다. 비용을 확정적으로 예측하려는 개발자에게는 Grok의 단일 모델 설계가 운영상 더 단순합니다. 가장 어려운 장기(long-horizon) 작업에서는 Sol의 max-effort 스웜이 더 유능한 구성이며, 최고 점수와 최악의 청구서가 같은 설정에서 나오는 이유가 바로 그것입니다.

각 측이 실제로 제시할 수 있는 증거

두 모델 모두 독립적인 코딩 점수보드에서 우위를 점하지 못했으므로, 인용 가능한 증거는 공급업체별로 나뉜다. OpenAI는 GPT-5.6 Sol이 SWE-bench Verified에서 약 96%를 기록했다고 발표했는데, 이는 두 모델이 제시할 수 있는 가장 강력한 코딩 인용이지만 아직 독립적인 감사가 공개되지 않은 보고된 평가 수치이며, Sol의 실제 사용 환경에서의 강점은 Codex 및 ChatGPT 도구 내에 통합되어 있다는 점을 포함한다. xAI는 Grok 4.6이 GPQA Diamond에서 94.9%를 기록했으며, 이는 해당 벤치마크에서 테스트된 최고 점수라고 주장하고, 종합 작업당 평균 약 0.84달러의 API 비용이 드는 에이전트 평가 수치를 인용한다. 둘 다 공급업체 수치다. 속도 측면에서는 두 모델이 가격 격차가 시사하는 것보다 더 가깝다. AA는 표준 서빙 환경에서 Grok 4.6을 초당 64.9 출력 토큰으로, GPT-5.6 Sol을 동일한 중반 60초 범위로 측정했으며, OpenAI의 별도 Cerebras 기반 "Ultrafast" 프리뷰(최대 약 초당 750토큰)는 여전히 제한적이고 가격이 책정되지 않았다. 전체 증거 표는 이렇게 읽어야 한다: 지수는 동률, 코딩 실적은 양측 모두 존재하지만 어느 쪽에도 독립적인 감사가 없으며, 결정을 바꿀 만한 속도 격차도 없다.

2026년 9월에 어떤 기본값이 합리적인가

트래픽이 입력 200K 토큰 미만에 해당한다면 Grok 4.6을 선택하세요. 지원하는 모든 길이에서 가격이 거의 절반 수준이고, 독립 지수는 두 모델이 동급이라고 평가하며, 서버 측 도구와 함께 단일 모델만 다이얼하면 청구 비용을 예측 가능하게 유지할 수 있습니다. 500K~1.05M 컨텍스트 대역이 진정으로 필요하거나, 이미 Codex 또는 ChatGPT 네이티브 스택을 갖추고 있고 보고된 약 96% SWE-bench 수치가 조달팀에 코딩 성과 증빙을 제공하거나, 가장 어려운 장기 실행 과제를 위해 4개 하위 에이전트 최대 노력 구성 옵션을 원한다면 GPT-5.6 Sol을 선택하세요. 그리고 두 가지 날짜를 주목하세요. GPT-5.6 Sol의 $4/$20 프로모션은 적어도 2026년 11월 21일까지만 보장되며, 그 이후에는 이 비교가 달라집니다. 또한 xAI는 이미 Grok 4.7을 예고했습니다. 두 이벤트 중 하나라도 지금 표준화하려는 이 매치업의 가격을 다시 책정할 수 있습니다.

아키텍처를 재설계하지 않고 둘 다 실행하기

인덱스에서의 동률은 이 결정이 품질에 관한 것이 아니라 상한선 및 가격에 관한 것임을 의미하므로, 대부분의 팀이 실제로 쓰는 패턴은 고르기(pick)보다 라우팅(route)입니다. GPT-5.6 Sol과 Grok 4.6은 둘 다 공급업체 표시 가격 그대로 OrcaRouter에 있으며, 마크업 없이 통과됩니다. OpenAI의 $4/$20과 xAI의 $2/$6이 목록에 적힌 수치이며 어느 공급업체가 요금을 변경하든 새 가격은 같은 키(key)로 당일 바로 적용됩니다. 하나의 OpenAI 호환 엔드포인트를 사용하면 다음을 할 수 있습니다: sub-200K 트래픽을 Grok 4.6으로 보내기, Sol의 더 긴 컨텍스트 또는 max-effort 구성이 필요한 프롬프트를 에스컬레이션하기, 그리고 한 공급자 경로의 속도 제한이 중단이 아닌 라우팅 이벤트가 되도록 자동 장애 조치를 사용하기.

A screenshot of the OrcaRouter model page for GPT-5.6 Sol (model id openai/gpt-5.6-sol), showing the header price of $4.00 in / $20.00 out per 1M tokens, tags including Vision, Tools, JSON and Reasoning, 'by OpenAI — 2026-07-09', a description of GPT-5.6 Sol as the flagship model in OpenAI's GPT-5.6 series covering deep multi-step reasoning, large-scale software engineering and long-horizon agentic work over a 1.05M-token context window with up to 128K output tokens, and the site's latest-model navigation.

이 비교에서 가격에 해당하는 절반은 움직이는 부분입니다 — OpenAI의 Sol 프로모션은 11월 21일까지만 보장되며, xAI는 로드맵에 4.7을 올려두고 있습니다 — 따라서 이 블로그가 계속 업데이트하는 참고 자료는 GPT-5.6 Sol 가격 페이지이며, 요금표가 변경될 때마다 날짜가 표시되고 재검증됩니다.

A screenshot of OrcaRouter's '$4 / $20 per 1M Tokens — After the Price Cut' pricing article on the GPT-5.6 Sol promotional rate, bylined Gideon Frost, shown alongside the site's LATEST MODELS rail.

두 줄짜리 답변

프롬프트가 50만 토큰 미만이라면 — 대부분의 경우 그렇습니다 — Grok 4.6은 제공할 수 있는 모든 길이에서 GPT-5.6 Sol과 동일한 독립 지수 점수를 거의 절반 가격에 제공하며, 공개된 출력 상한이 없고 예측 가능한 단일 모델 다이얼을 갖추고 있습니다. GPT-5.6 Sol의 프리미엄은 Grok이 도달할 수 없는 구간, 즉 50만 토큰을 초과하는 컨텍스트와 OpenAI 도구 환경 안에서 값어치를 합니다. 그 환경에서는 보고된 약 96%의 SWE-bench Verified 점수와 그 아래의 Terra 및 Luna 등급 덕분에 단일 모델이 아니라 하나의 제품군을 얻게 됩니다. 지수에서의 동률은 이 결정이 성능이 아니라 상한선과 비용에 관한 것임을 의미합니다. 그러니 확정하기 전에 실제로 사용하는 가장 긴 프롬프트를 측정하세요. 그 한 가지 숫자가 승자를 결정하니까요.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트