
Claude Opus 5.5 vs Grok 4.6: 한 모델은 읽고, 다른 모델은 행동한다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 221 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Claude Opus 5.5와 Grok 4.6은 프런티어급 모델을 구매하는 가장 저렴한 두 가지 방법이며, 그 모델은 50만 토큰의 컨텍스트를 유지할 수 있습니다 — 그리고 이 둘은 같은 제품이 아닙니다. 한 측정에서 Grok 4.6은 절대 상한선에서 3점밖에 떨어져 있지 않습니다. Anthropic의 플래그십이 같은 대역에 위치한 대학원 수준 과학 문제 세트인 GPQA Diamond에서 94.9점입니다. 다음 측정에서는 38점 뒤처집니다. 셸에서 실제 작업을 완료하도록 모델에 요구하는 에이전트형 터미널 벤치마크인 Terminal-Bench 4.0에서, Artificial Analysis는 Grok 4.6을 21.21%, Claude Opus 5.5를 59.60%로 평가했습니다. 이는 어느 방향으로도 오식이 아니며, 이 조합의 전체 윤곽은 두 수치가 동시에 참인 이유를 설명하는 데 있습니다.
두 번의 출시, 하나의 가격대, 네 달 차이
SpaceXAI는 2026년 8월 12일 Grok 라인의 현행 플래그십으로 Grok 4.6을 출시했으며, 입력 토큰 100만 개당 $2.00, 출력 $6.00, 500,000토큰 컨텍스트 창과 텍스트, 이미지, 파일 입력 인터페이스를 제공합니다. Anthropic은 약 6주 후인 2026년 9월 22일 Claude Opus 5.5를 출시했으며, $4.00/$20.00, 1,000,000토큰 컨텍스트 창과 128,000 출력 토큰을 제공합니다. 두 모델 모두 구성 가능한 추론 강도, 도구 호출, 구조화된 출력을 지원하며, OpenAI 호환 채팅 인터페이스와 각 공급업체 고유의 형식을 모두 지원합니다.
그래서 순진하게 읽으면 깔끔한 맞교환이다: Grok 4.6은 입력 가격이 절반이고 출력은 대략 3분의 1이며, Claude Opus 5.5는 두 배의 컨텍스트 윈도로 응답한다. 그 맞교환은 실재하며, 장문 문서 작업에서는 그것이 유일하게 중요한 것일 수도 있다. 그것은 또한 흥미로운 차이가 나타나는 지점이 아니다. 왜냐하면 두 모델은 동일한 독립 하네스에서 측정되었고, 에이전트 작업에 중요한 축에서 같은 위치에 자리하지 않았기 때문이다.
카탈로그가 둘 다 측정된 축에 관해 말하는 것
OrcaRouter의 카탈로그는 행마다 벤치마크 출처를 담고 있습니다 — 각 수치는 그 수치가 나온 평가 주체를 밝힙니다 — 따라서 아래의 쌍들은 두 모델 모두에서 단일 출처, 즉 Artificial Analysis에서 나온 것이며, 한쪽은 벤더 수치이고 다른 쪽은 제3자 수치인 것이 아닙니다:
• GPQA Diamond — Claude Opus 5.5는 저희 카탈로그의 이 축에 등록되어 있지 않습니다; Grok 4.6은 94.9%를 기록합니다
• Humanity's Last Exam — Claude Opus 5.5는 61.4%, Grok 4.6은 42.9%
• SciCode — 66.9% 대 56.5%
• 장문맥 재현율 — 80.3% 대비 84.7%
• Terminal-Bench 4.0 — 21.21% 대비 59.60%
• AA Intelligence Index — 44.3 대비 57.6
GPQA 행은 벤더 자료로 채우는 대신 Anthropic 측에서 의도적으로 비워 두었습니다. 그곳에서 Grok 4.6의 94.9는 이 모델의 카드에서 가장 강력한 수치이며, 이는 진짜입니다 — SpaceXAI의 주장이 아니라 독립적인 측정 — 그리고 이 모델에 대해 실질적인 무언가를 말해줍니다: 과제가 방어 가능한 답이 하나인 잘 정형화된 질문일 때, Grok 4.6은 최전선 수준의 성능을 냅니다. 이를 Terminal-Bench 4.0의 21.21%와 나란히 놓고 읽어보면 그 윤곽이 또렷해집니다. 과학에 관한 정답을 만들어내는 것과 실제 파일 시스템을 상대로 셸에서 5단계 과제를 수행하는 것은 서로 다른 역량이며, Grok 4.6은 두 번째보다 첫 번째에서 훨씬 더 앞서 있습니다.
그 조합을 판정으로 사용하기 전에 한 가지 단서를 달자면, 두 모델의 Artificial Analysis 수치는 서로 다른 평가 날짜에 기록되었고, Grok 4.6의 수치가 더 오래된 세트입니다. 이 비교는 8월에 평가된 모델과 9월에 평가된 모델 사이의 비교이며, 그 기간 동안 평가 하네스 자체도 개정되었습니다. 격차의 방향은 다섯 개의 별도 축에서 일관되며, 그래서 우리는 이를 신호로 취급합니다. 다만 정확한 점수 값은 같은 날 비교가 아니라 8월 대 9월 비교로 읽어야 합니다.
어느 쪽도 팔지 않는 사람이 만든 지수
두 번째 독립 지표가 있으며, 방향성은 일치하지만 미세한 구분을 내리려는 의지는 훨씬 덜하다. 50개가 넘는 벤치마크를 합성해 Epoch AI가 만들고, Claude 3.5 Sonnet이 130, GPT-5가 150에 오도록 재조정한 Epoch Capabilities Index는 2026년 10월 2일에 우리가 읽은 파일에서 Claude Opus 5.5를 167.35에 둔다. Grok 4.6은 8월 12일 평가에서 156.61이다. 이는, 지수 출시 당시 약 5점이 METR의 시간 지평 측정치가 두 배가 되는 것에 대응하는 것으로 관찰된 척도에서 10.74점 차이다 — 넓으며, 두 모델의 공표된 구간인 164.0~172.0과 154.66~158.93을 넉넉히 벗어나는데, 이 두 구간은 전혀 겹치지 않는다.
이 지수가 해결하지 못하는 점을 짚어둘 만하다. 이 지수는 Claude Sonnet 5.5를 165.2, Claude Fable 5.1을 164.82로 두는데, 둘 다 Grok 4.6보다 위이며, 둘 다 백만 출력 토큰당 비용이 Grok 4.6의 2티어 요율보다 저렴하다. 오로지 달러당 역량만으로 선택하는 사람이라면 같은 벤더군 안에 세 번째와 네 번째 선택지가 있고, 이 글에서 다루는 조합은 다른 것, 즉 두 모델이 각각 무엇을 잘하는지에 관한 것이다.
요금표들, 그리고 그중 하나에만 나타나는 행

Grok 4.6의 요금표에는 Claude Opus 5.5에는 없는 구간이 하나 있습니다: 200,000 프롬프트 토큰을 초과하는 요청은 기본 요율의 두 배로 청구되므로, 입력은 $2.00에서 $4.00로, 출력은 $6.00에서 $12.00로 오르고, 캐시 읽기는 $0.50에서 $1.00로 오릅니다. Claude Opus 5.5는 1,000,000토큰 창 전체에서 캐시 읽기를 $0.20로 균일하게 적용하며 $4.00/$20.00을 청구합니다. 그 역전은 두 모델 중 어느 쪽에서든 긴 컨텍스트를 구매할 때 생기는 실질적 결과이며, 워크로드가 실제로 커지면 스티커 가격 비교를 뒤집습니다:
• 입력 토큰 30,000개 기준 가격 — Claude Opus 5.5가 비싼 쪽으로, 입력 30,000개와 출력 8,000개에 약 28센트인 반면, Grok 4.6은 약 11센트다.
• 250,000 입력 토큰에서의 가격 — 순서가 역전된다. Grok 4.6은 두 배가 된 티어로 올라섰지만 Claude Opus 5.5는 그렇지 않기 때문이다.
• 캐시 읽기 — Claude Opus 5.5는 백만 개당 $0.20인 반면, Grok 4.6은 $0.50이며, 단계를 초과하면 $1.00로 상승합니다.
• 최대 출력 — Claude Opus 5.5의 경우 128,000 토큰; Grok 4.6의 출력 상한은 카탈로그 기록에 공개되어 있지 않음
Grok 4.6에는 나중에 발견하도록 남겨 두기보다 분명히 짚고 넘어갈 만한 한 가지 공백도 있습니다. 그 기록에는 최대 출력 수치가 전혀 기재되어 있지 않습니다. 이 항목은 0이 아니라 측정되지 않은 것이므로, 매우 긴 단일 응답에 의존하는 워크로드는 비교의 그쪽 측면에서 계획을 세울 근거가 될 공개된 수치가 없습니다.
읽어서는 안 되는 성능 칼럼
우리 카탈로그에는 모델별 서빙 성능 패널도 포함되어 있는데, Grok 4.6에서는 이것이 페이지에서 가장 오해를 부르는 요소입니다. 이 카드에는 7일 기간 동안 p50 지연 시간이 10,000밀리초, 오류율이 97.58%로 표시되어 있으며, 해당 기간에 제공된 토큰은 26,184개입니다. 그 필드들은 느린 모델을 설명하는 것이 아닙니다. 거의 호출되지 않은 모델을 설명합니다. 그 트래픽 수준에서는 지연 시간 분포가 무슨 의미를 갖기에는 표본이 너무 빈약하고, 오류율은 서비스 품질이 아니라 소수의 시도 결과를 반영합니다. 그 블록을 Grok 4.6이 느리다는 증거로 취급하는 것은 측정 아티팩트를 측정값으로 읽는 셈입니다.
반면 Claude Opus 5.5의 패널은 그 뒤에 모집단이 있습니다 — 일별 샘플이 포함된 7일 구간에서 p50이 4.4초대이고, 같은 기간에 1억 5,600만 토큰이 제공되었습니다. 그마저도 있는 그대로 읽어야 합니다. 즉 이것은 모델의 속성이 아니라 우리 사용자들의 표본인, 우리 자체 플레이그라운드 트래픽입니다.
어느 것을 라우팅해야 하는지, 그리고 자신의 작업에서 그것을 알아내는 방법
숫자가 말해 주는 이 구분은 행동에 옮길 만큼 안정적이다. Claude Opus 5.5는 에이전트형 및 장기 지평(long-horizon) 작업을 위한 선택이다 — Terminal-Bench 4.0에서 59.60% 대 21.21%의 격차는 두 모델이 함께 측정된 모든 축 가운데 가장 큰 차이이며, 이는 모델에 질문이 아니라 과업을 맡길 수 있는지를 예측해 주는 축이다. 또한 프롬프트가 정말로 길 때도 선택지인데, 요금표가 단계적으로 오르지 않고 컨텍스트 창이 두 배 크기 때문이다. Grok 4.6은 대량의 질문형 작업을 위한 선택이다: 처음 200,000 토큰 구간에서 $2.00/$6.00에 94.9%의 GPQA Diamond 점수는 두 배 구간으로 커지지 않는 검색-응답 워크로드에 매우 좋은 거래다.
둘 다 OrcaRouter에서 제공업체 정가에 0% 마크업으로 제공됩니다 — Claude Opus 5.5는 $4.00/$20.00에 캐시 읽기 $0.20, Grok 4.6은 $2.00/$6.00에 200K 초과 구간이 SpaceXAI가 정한 그대로 적용됩니다 — 하나의 키 뒤에 있으니, 위의 분할은 논쟁하는 대신 여러분의 프롬프트 세트에서 직접 테스트할 수 있습니다. 둘 다 라우팅되는 경우 자동 장애 조치가 그 아래에서 작동하는데, 이는 더 저렴한 모델이 에이전트 경로를 맡고 있을 때 있으면 좋은 기능입니다.
이 조합이 받는 평결: Grok 4.6은 더 나은 독자이고 Claude Opus 5.5는 더 나은 일꾼이다. GPQA Diamond의 94.9와 Terminal-Bench의 21.21은 같은 모델을 두 번 측정한 것이며, 당신의 워크로드가 그 두 숫자 중 어느 쪽처럼 보이는지 아는 것이 결정의 전부다.


이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
