
Grok 4.6 대 Claude Opus 5: 같은 61, 서로 다른 두 경제
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
Artificial Analysis는 모든 최첨단 모델을 동일한 아홉 가지 평가에 통과시키고 비용 명세서를 공개합니다. Intelligence Index에서, Grok 4.6과Claude Opus 5는 같은 수치인 61에 도달합니다. 이로 인해 합성 지표가 어떤 것을 사용해야 할지 알려줄 수 없는 드문 맞대결이 됩니다. 그것을 알려줄 수 있는 것은 같은 출처의 덜 알려진 수치입니다: AA-Briefcase 지식 작업 스위트에서 Grok 4.6은 대략 53턴과 약 5억 개의 입력 토큰으로 작업을 완료한 반면, Claude Opus 5는 최대 노력으로 동일한 작업에 약 103턴과 20억 개의 토큰이 필요했습니다. 이는 대표 점수가 동일한 두 모델 간 토큰 소비의 4대 1 격차이며, 모델 카드를 비교하는 것을 멈추고 비용을 비교하기 시작할 때만 드러납니다.
두 모델 모두 현재 플래그십 출시작이므로, 세대 간 불일치가 아닌 깔끔한 비교가 가능합니다. Grok 4.6은 2026년 8월 12일 SpaceXAI에서 Grok 4.5 기반의 개선판으로 출시되었습니다. 동일한 1.5조 파라미터 혼합 전문가(MoE) 기반 위에서, 장기 실행 에이전트를 겨냥한 더 긴 지도 학습 및 강화 학습 실행으로 재훈련된 모델입니다. Claude Opus 5는 2026년 7월 24일 Anthropic에서 적응형 사고, 100만 토큰 컨텍스트 창, 이미지 및 파일 입력을 갖춘 고정 날짜 스탬프 플래그십으로 출시되었습니다. 두 모델은 독립적인 스코어보드에서는 같은 위치에, 가격표에서는 정반대 위치에 있습니다: Grok 4.6은 토큰 100만 개당 $2 / $6인 반면, Claude Opus 5는 $5 / $25입니다. 흥미로운 과제는 이 문장의 어느 절반이 프로덕션 선택을 결정하는지 파악하는 것입니다.
4:1 효율 격차를 숨기는 61
Intelligence Index는 9가지 평가의 복합 지표로서, 그것이 강점이자 맹점이다. 추론, 수학, 코딩, 지식 작업 점수를 평균한 단일 숫자는 모델이 그 결과에 도달하는 방식을 숨기며, 이 두 모델은 정반대 방식으로 도달한다. Artificial Analysis 자체의 브리프케이스 스타일 전문 지식 작업 스위트가 이를 가장 선명하게 보여준다. 실제 장기 지평 작업을 측정하며, Grok 4.6은 작업당 약 53턴과 0.5B 입력 토큰을 기록한 반면, Claude Opus 5 Max는 대략 103턴과 2B 입력 토큰을 기록했다. 작업당 경제성 측면에서 이는 연구·생산 작업을 4분의 1 토큰으로 끝내는 모델과 토큰을 소진하는 모델의 차이다.
원인은 버그가 아니라 설계 선택입니다. Grok 4.6은 작업을 진행하면서 자신의 작업을 검증하고 하위 작업이 실제로 완료되면 중단하도록 특별히 훈련되었습니다. xAI는 자기 검증을 포함한 긴 작업 궤적을 훈련 목표로 설명합니다. Claude Opus 5는 추론의 깊이와 지식의 폭을 위해 훈련되었으며, 기본적으로 엄격히 필요한 것보다 더 깊이 생각하고 더 많이 참조하는 방식으로 작동합니다. 둘 다 '추론 모델'이지만, 노력을 다르게 배분하며 에이전트 워크로드에서 중요한 사양은 바로 그 배분입니다.

이 격차는 모델을 루프로 호출하는 에이전트에게 가장 중요합니다 — 연구 에이전트, 수십 턴을 실행하는 코드 에이전트, 밤새 배치를 처리하는 문서 파이프라인 등입니다. 매 턴이 과금되며, 모든 입력 토큰은 다음 호출 시 다시 전송해야 하는 컨텍스트입니다. 0.5B 토큰으로 53턴 만에 완료하는 모델은 단순히 토큰당 비용이 더 저렴한 것이 아니라, 작업당 비용이 2B 토큰으로 103턴이 걸리는 모델보다 대략 한 자릿수 더 저렴합니다. 이는 정가를 곱하기도 전의 이야기입니다.
사양서, 양면
서류상 차이점을 각각 한 줄씩 나열하면:
• Intelligence Index — Grok 4.6은 61점으로 184개 중 6위, Claude Opus 5는 61점으로 최상위권에 나란히 올랐습니다. Artificial Analysis에 따르면 동률입니다.
• 1M 토큰당 정가 — Grok 4.6: 입력 $2 / 출력 $6 (200K 이상 입력 토큰 프롬프트는 $4 / $12로 두 배); Claude Opus 5: 입력 $5 / 출력 $25, 50% 배치 할인 시 $2.50 / $12.50.
• 컨텍스트 창 — Grok 4.6은 500K 토큰, Claude Opus 5는 1,000,000 토큰으로, 두 모델 중 하나가 갖는 가장 명확한 사양상의 이점이다.
• 최대 출력 — Claude Opus 5는 최대 128K 출력 토큰(배치 API를 통하면 300K)을 허용합니다. Grok 4.6의 출력 상한은 더 낮아 일반적인 긴 답변 수준입니다.
• 입력 — 둘 다 텍스트와 이미지를 지원하며, Claude Opus 5는 파일도 지원합니다. 또한 Anthropic의 멀티모달 입력은 문서에 더 직접적으로 접근합니다.
• GDPVal-AA v2 (지식 작업) — Grok 4.6이 1,753 Elo, Claude Opus 5가 1,852 Elo입니다. Opus 5는 브리프케이스 효율성에서 Grok이 앞섰던 지표에서 지식 작업 품질 부문의 왕관을 차지했습니다. [Artificial Analysis]
• CursorBench v3.2 — Grok 4.6은 69.9%, Claude Opus 5는 70.0%로, 두 모델이 모두 평가된 코딩 에이전트 벤치마크에서 사실상 동률입니다. [Artificial Analysis]
• 추론 제어 — Claude Opus 5는 낮음에서 최대까지의 노력 다이얼을 제공하며 적응형 사고가 기본적으로 켜져 있습니다. Grok 4.6은 추론 노력을 제공하지만 긴 에이전트 궤적을 선호하는 기본값으로 조정되어 있습니다.
이 둘을 나란히 놓고 비교하는 요점은 어느 모델도 완전히 우위에 있지 않다는 것이다. Claude Opus 5는 서류상으로는 더 나은 범용 모델이다. 더 많은 컨텍스트, 더 높은 출력 상한, 파일 입력, 더 높은 지식 작업 품질을 제공한다. Grok 4.6은 더 나은 가성비와 더 효율적인 에이전트이다. 남은 유일한 질문은 그중 어느 것이 실제로 당신이 수행하는 작업에 해당하는지이다.

Claude Opus 5가 프리미엄을 정당화하는 순간
Anthropic의 출시 수치(벤더가 보고했으며 독립적으로 재현되지 않은 수치)는 SWE-bench Verified에서 Claude Opus 5를 96.0%, SWE-bench Pro에서 79.2%로 평가하며, 컴퓨터 사용에 대한 OSWorld 점수는 70.6%입니다. 광범위한 종합 지표에서는 61점으로 Grok 4.6과 일치하며, GDPVal-AA에서는 측정 가능할 정도로 앞섭니다. 이것이 실제로 의미하는 바는 지식 근로자의 하루 전체에 걸쳐 제 몫을 해내는 모델이라는 점입니다. 초안 작성, 분석, 장문 추론, 이미지+텍스트 작업, 코딩을 모두 한 곳에서 처리할 수 있으며 백만 토큰의 처리 여유를 갖추고 있습니다.
컨텍스트 창은 그것을 선택하게 하는 솔직한 이유다. 50만 토큰 한도는 크지만, 전체 코드베이스에 연구 코퍼스, 긴 에이전트 세션의 중간 결과물까지 담기에는 부족하다. 전체 저장소, 1년치 금융 서류, 긴 PDF 더미처럼 매우 방대한 코퍼스에 대해 단일 패스 심층 분석을 수행하는 팀은 Grok 4.6의 한계에 부딪히고 Claude Opus 5의 한계에는 결코 도달하지 못할 것이다. 그러한 작업 부하에서 추가 컨텍스트는 사치가 아니다. 그것은 작업을 수용하는 것과 한계를 우회하여 조율하는 것 사이의 차이다.
Grok 4.6이 더 나은 구매 선택인 경우
동일한 사실을 뒤집어 보면, Grok 4.6이 에이전트 파이프라인에 있어 더 나은 구매이며, 그 격차가 결코 작지 않다. Opus 5의 정가 대비 입력은 2.5배, 출력은 4.2배 저렴하며, 작업별 토큰 효율성이 그 효과를 증폭한다. AA-Briefcase 수치에 따르면 동일한 지식 작업 결과에 대해 대략 토큰은 4배 적게, 턴 수는 2배 적게 사용한다. 4배와 2.5배를 곱하면, Opus 5의 경제성으로 $1.00이 드는 작업이 Grok 4.6에서는 대략 $0.10 수준으로 든다. 물론 Opus 쪽의 배치 할인이 그 격차를 일부 줄이기 전의 이야기다.
구체적으로 에이전틱 코딩에서 Grok 4.6의 DeepSWE 1.1 결과는 4.5에서 4.6 사이에 54%에서 65.9%로 개선되었으며, CursorBench 점수는 자체 검증을 수행하면서도 Opus 5와 0.5포인트 이내의 차이를 보입니다. 하루에 수천 건의 에이전틱 호출을 실행하고 각 호출이 다중 턴 루프인 팀에게 작업별 경제성과 더 짧은 궤적은 실행 가능한 제품과 소진율의 차이를 결정합니다. 이것이 xAI가 제시하는 논거이며, 독립적인 효율성 데이터가 그 방향을 뒷받침합니다.
라우팅 결정
이것은 라우터가 제 역할을 입증하는 매치업입니다. 정답이 '둘 다, 단 워크로드 형태에 따라 분할'이기 때문입니다. Grok 4.6과 Claude Opus 5는 모두 OrcaRouter에서 각 공급업체의 공식 리스트 가격 — grok/grok-4.6은 $2/$6, anthropic/claude-opus-5는 $5/$25 — 으로 제공되며, 마크업은 0%입니다. 따라서 비용 모델에 기재된 숫자가 그대로 청구됩니다. 이 분할을 실용적으로 만드는 인프라는 다음과 같습니다: 두 모델 모두에 사용하는 하나의 API 키, 긴 에이전트 실행 중 한 공급업체의 엔드포인트가 성능이 저하되면 자동으로 장애 조치되는 기능, 그리고 단일 호출 내에서 짧고 대량의 턴은 Grok 4.6으로 보내고 장기적이고 컨텍스트를 많이 요구하는 작업은 Claude Opus 5로 에스컬레이션할 수 있는 라우팅 DSL입니다. 2계층 아키텍처를 운영하기 위해 별도의 계약이 필요하지 않으며, 모델 카드로 추측하는 대신 실제 트래픽 데이터가 들어오면 분할을 다시 조정할 수 있습니다.

솔직한 해석
종합 지수의 동률은 실제이며 그것은 함정이다. 동일한 점수의 모델은 서로 대체 가능하지 않다. 점수가 보지 못하는 바로 그 지점에서 그들은 구별된다. Claude Opus 5는 비용보다 100만 토큰 창과 깊은 추론이 더 중요한, 광범위하고 맥락이 많으며 문서·이미지 기반의 지식 작업에 더 안전한 기본 선택이다. Grok 4.6은 작업당 토큰 효율성과 2.5배의 가격 우위가 복리처럼 쌓여 청구 금액에서 10배 차이를 만들어내는 대용량 에이전트 루프에 더 나은 기본 선택이다. 업무 부하가 전자라면 Opus 5에 비용을 지불하고 가격 걱정은 그만두어라. 후자라면, 서류상 61점의 동등함은 Grok 4.6을 먼저 테스트해야 할 가장 좋은 이유다 — 벤치마크는 둘이 동일하다고 말하지만 청구서는 그렇지 않다고 말한다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
