
Grok 4.7 vs Claude Opus 5: 가격 격차는 실재하지만, 동등성은 아니다
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok 4.7은 백만 입력 토큰당 2.00달러, 백만 출력 토큰당 6.00달러에 호출할 수 있습니다. Claude Opus 5는 5.00달러와 25.00달러에 호출할 수 있습니다. 이는 출력에서 4.2배 차이입니다 — 벤치마크를 열기도 전에 비교를 끝내버리는 종류의 격차죠. 그러나 이 비교는 그렇게 끝나지 않습니다. 두 모델이 현재 점수를 매기는 Artificial Analysis Intelligence Index의 버전인 v4.3.2(2026년 9월 19일 발표된 개정판)에서 Claude Opus 5는 51점, 2026년 9월 21일 공급업체가 출시한 Grok 4.7은 46점입니다. 5점 차이는 압승은 아니지만, 그 5점의 형태는 이렇습니다: Opus 5는 해당 지수의 10개 평가 중 8개에서 승리합니다. 더 저렴한 모델의 명분은 가격이고, 컨텍스트는 무승부이며, Grok 4.7의 가격 이점이 가장 중요할 것으로 예상되었던 바로 그 지점에서 이점은 사라집니다.
두 플래그십, 매우 다른 두 개의 가격표
Claude Opus 5는 2026년 7월 24일부터 시장에 나와 있으며, Anthropic의 Opus 등급 플래그십으로, 회사 자체 라인업에서 Claude Fable 5.1 바로 아래에 위치합니다. 1M 토큰 컨텍스트 윈도우를 정액 요금으로 제공합니다 — Anthropic은 900k 토큰 요청이 9k 토큰 요청과 동일한 토큰당 요금으로 청구되며 장문 컨텍스트 프리미엄이 전혀 없다고 명확히 밝힙니다 — 그리고 최대 출력은 128K이며, Message Batches API에서는 300K까지 확장할 수 있습니다. 사고는 적응형이고 기본적으로 켜져 있으며, 노력 단계는 low, medium, high, xhigh, max로 이어지고 기본값은 high입니다. 가중치는 비공개입니다.
Grok 4.7은 출시된 지 하루 되었다. 50만 토큰 컨텍스트를 보유하고, 텍스트와 이미지를 입력받아 텍스트를 반환하며, 자체적인 추론 강도(reasoning-effort) 다이얼을 작동시킨다. 정가는 프롬프트 토큰 20만 개 미만일 때 백만 토큰당 입력 $2.00, 출력 $6.00이고, 그 임계값 이상에서는 $4.00와 $12.00로 올라가며, 캐시된 읽기는 같은 두 구간에서 각각 $0.50와 $1.00이다. xAI는 또한 약 두 배의 출력 속도로 실행되고 가격도 약 두 배인 더 빠른 변형도 나열하고 있지만, 그 구성은 공개된 속도 측정치가 첨부되지 않은 채 출시되었다. 여기서도 가중치는 비공개이므로, 이 비교의 양쪽 모두에서 '직접 실행하기'라는 탈출구가 사라진다.
독립적인 이사회는 가깝지도 않고, 아첨하지도 않는다
이 두 모델은 모두 Artificial Analysis의 v4.3.2 지수에서 평가되며, 이 지수는 에이전트, 코딩, 일반 지식, 과학적 추론을 아우르는 열 가지 평가를 포함합니다. 두 열을 나란히 놓고 보면 5점 차이라는 대표 수치가 더 저렴한 모델에 후하게 보이게 만듭니다 — 종합 지표에서 단일 5점 격차는 많은 것을 감출 수 있는데, 여기서는 거의 전면 석권에 가까운 결과를 감추고 있습니다.
• 종합 지능 — Grok 4.7(xhigh): Artificial Analysis Intelligence Index v4.3.2에서 46점. Claude Opus 5(적응형 추론, 최대 노력): 동일 리비전에서 51점.
• 고난도 추론 — Grok 4.7: Humanity's Last Exam 43점, CritPt 18점. Claude Opus 5: HLE 55점, CritPt 29점. 각각 12점과 11점 차이로, 둘 다 Opus 5에 유리하다.
• 에이전트 터미널 — Grok 4.7: Terminal-Bench 4.0 26. Claude Opus 5: 49. 이것은 이 보드 전체에서 가장 큰 단일 격차이며, 실제 자율 작업에 가장 가까운 벤치마크에서 나타난 격차입니다.
• 직장 자동화 — Grok 4.7: AutomationBench-AA 66%. Claude Opus 5: 57%. Grok 4.7의 유일하게 확실한 승리이자 실질적인 성과 — 에이전트가 가드레일에 걸리지 않고 워크플로를 끝내는지를 평가하는 벤치마크에서 9점 차.
• 지식과 정직성 — Grok 4.7: AA-Omniscience 32. Claude Opus 5: 37. 두 모델 모두 환각을 일으키지만, 이 지표에서는 Opus 5가 덜 그렇습니다.
• 긴 컨텍스트 — Grok 4.7: AA-LCR v1.1 77%, 윈도우 500k 토큰. Claude Opus 5: 79%, 윈도우 1M 토큰.
• 인덱스 실행 비용 — Grok 4.7: 평가 전반에 걸쳐 2억 4천만 개의 출력 토큰을 사용했으며, Artificial Analysis로부터 유난히 장황하다는 지적을 받았습니다. Claude Opus 5: 1억 4천만 개. Grok 4.7은 더 낮은 점수에 도달하는 데 1.7배의 토큰을 소비합니다.

Grok 4.7의 가격 우위가 무너지는 곳
다음은 요금표가 숨기고 있는 산술이다. 현실적인 에이전트 요청을 하나 들어 보자: 입력 3만 토큰, 출력 8천 토큰. Grok 4.7은 입력에 $0.06, 출력에 $0.048을 청구한다 — 약 11센트다. Claude Opus 5는 입력에 $0.15, 출력에 $0.20을 청구한다 — 약 35센트다. 이는 실제로 3배이며, 이 규모에서는 비용만 따져도 Grok 4.7이 확실한 선택이다.
이제 Grok 4.7 자체 마케팅이 중심에 둔 요청을 보자: 장문 컨텍스트 에이전트 세션이다. 프롬프트를 200k 토큰 넘게 밀어붙이면 Grok 4.7의 요금은 입력 $4.00, 출력 $12.00으로 두 배가 된다. Claude Opus 5는 움직이지 않는다 — 1M 윈도는 입력 $5.00, 출력 $25.00의 정액으로 청구된다. 입력 250k, 출력 8k에서 Grok 4.7은 입력 $1.00, 출력 $0.096으로 약 $1.10이 든다. Opus 5는 입력 $1.25, 출력 $0.20으로 약 $1.45가 든다. 격차는 3배에서 약 1.3배로 줄었다. 더 밀어붙여 400k, 500k, Grok 4.7 윈도의 최상단까지 가면, Opus 5의 정액 요금은 계속 격차를 좁히는 반면 그 윈도는 계속 100만 토큰까지 이어진다.Grok 4.7은 짧은 프롬프트에서는 저렴한 모델이고, 긴 프롬프트에서는 가격 면에서 거의 대등한 모델이다, 이는 가격 페이지가 만들어내도록 설계된 직관을 뒤집는다.
두 가지 단서가 이 이야기를 정직하게 유지합니다. 첫째, 롱컨텍스트 티어는 xAI 자체 모델 문서에 나온 공식 정가 구조이지 측정값이 아닙니다 — 실제 청구액은 캐싱에 따라 달라지며, Grok 4.7의 $0.50 캐시 읽기 요금은 정말로 저렴합니다. 둘째, Artificial Analysis는 아직 Grok 4.7에 대한 속도 측정치를 발표하지 않았으므로, 저렴함과 빠름 논거에서 "더 빠르다"는 절반은 현재 검증되지 않은 상태입니다. 측정된 것은 Opus 5로, 초당 59토큰에 첫 토큰까지 49초가 걸립니다 — 느리고 비싸지만 거의 모든 품질 축에서 앞서 있습니다.
실제로 라우팅하게 될 대상
이것은 정직한 답이 워크로드에 따라 달라지는 비교이며, 그것에 대해 행동으로 옮기는 가장 저렴한 방법은 라우터입니다. Claude Opus 5는 OrcaRouter에서 이용할 수 있으며, 자체 모델 페이지에 등록되어 있고 제공업체의 가격이 0% 마크업으로 그대로 전달됩니다 — 따라서 저희 카탈로그에 표시된 Opus 5의 $5.00과 $25.00은 Anthropic의 정가이며, 마크업이 붙은 사본이 아닙니다. 그리고 Anthropic이 가격을 변경하면 같은 키에서 같은 날 숫자가 바뀝니다. 이 글을 쓰는 시점에 Grok 4.7은 OrcaRouter 카탈로그에 없습니다. 오늘 그것을 호출하려면 xAI 자체 API와 이를 제공하는 제3자 플랫폼을 거쳐야 합니다. 이러한 비대칭성은 그 위에 아키텍처를 설계하기 전에 알아둘 가치가 있습니다.

숫자에서 도출되는 라우팅 패턴은 단순하다. 장문 컨텍스트, 추론 집약적, 터미널 에이전트 작업은 Opus 5로 보내라 — Opus 5는 Terminal-Bench 4.0에서 23점 차이로 앞서고 정액 가격에 두 배의 윈도우를 제공하므로, 이는 어렵고 긴 작업의 프로필과 정확히 일치한다. 대량 자동화 및 워크플로 작업은 Grok 4.7로 보내라: Grok 4.7은 AutomationBench-AA에서 9점 차이로 앞서고 짧은 프롬프트에서는 비용이 3분의 1에 불과하다. 둘 다 카탈로그에 있을 때 하나의 엔드포인트를 통해 접근되므로, 그 분할은 두 번째 공급업체 계약이 아니라 라우팅 규칙이며, 자동 장애 조치는 한 경로의 속도 제한이 중단이 아니라 라우팅 이벤트가 되도록 한다. 워크로드가 실제로 둘 다 필요할 때 — 저렴한 1차 패스와 비용이 많이 드는 검증 패스 — 라우팅 DSL은 이를 두 개의 통합이 아니라 단일 호출로 구성한다.
평결
증거를 기준으로 선택한다면 Claude Opus 5가 이 맞대결에서 승리하며, 그 격차는 결코 작지 않습니다: 10개 평가 중 8개, 가장 큰 두 개의 격차, 동일 가격에 두 배의 컨텍스트, 그리고 더 높은 점수를 내면서도 3분의 2에도 훨씬 못 미치는 토큰 예산입니다. 5점 종합 점수는 이것이 얼마나 철저하게 앞서는지를 제대로 전달하지 못합니다. Grok 4.7의 명분은 가격표가 시사하는 것보다 좁지만 결코 빈약하지는 않습니다. 대부분의 애플리케이션이 실제로 사용하는 프롬프트 크기에서는 정말로 더 저렴하고, 더 나은 자동화 모델이며, 출시된 지 하루밖에 되지 않아 벤더 벤치마크 제품군이 아직 독립적으로 재현되고 있습니다. 비용에 민감한 자동화를 위해 구매하고, Artificial Analysis가 속도 수치를 공개하면 이를 주시하며, 장문 컨텍스트 가격 등급을 저렴한 모델이 계속 저렴하게 남을지를 결정하는 요소로 취급하십시오.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
