히어로 타이틀 카드: "Gemini 4 Argon 대 Claude Opus 5.5 — 벤치마크 격차", 날짜 띠: "Argon 발표 2026-09-30", "Opus 5.5 출시 2026-09-22", 배지: "Argon: 한정 파일럿, 일반 제공 아님", 하단 문구: "Argon 수치는 벤더 보고 기준, 두 모델의 지수 수치는 Artificial Analysis 기준."
Guides & Insights

Gemini 4 Argon vs Claude Opus 5.5: 아무도 예상하지 못한 벤치마크 격차

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Gemini 4 Argon과 Claude Opus 5.5 중 누가 더 나은지를 두고 평가가 갈리며, 그 불일치는 잡음이 아니다. Artificial Analysis의 Intelligence Index에서는 두 모델이 Opus 5.5에 유리하게 5점 차이로 벌어져 있다. GDP 가중 경제 영향력 순위표인 Vals Index에서는 Gemini 4 Argon이 1위, Claude Opus 5.5가 3위로, Argon과 Claude Sonnet 5.5 둘 모두에 뒤처진다. 두 순위표는 같은 주에 동일한 두 모델을 측정했다. 그것이 이 글의 전부다: 어느 것을 골라야 할지는 당신의 업무가 시험 문제에 더 가까운지, 법무법인의 화요일에 더 가까운지, 그리고 오늘 기준으로 거의 아무도 갖고 있지 않은 Argon에 대한 API 접근 권한을 당신이 아예 갖고 있는지에 따라 달라진다.

Google은 2026-09-30, DeepMind 게시물에서 Gemini 4 Argon을 발표했습니다. 이 게시물은 Google DeepMind의 SVP이자 Chief AI Architect인 Koray Kavukcuoglu의 이름으로 올라왔습니다. Anthropic은 8일 전인 2026-09-22에 Claude Opus 5.5를 출시했습니다. 그중 하나는 오늘 오후에 바로 호출할 수 있는 GA 릴리스입니다. 다른 하나는 특정 명단의 사이버 방어자 집단과 Google 자체 엔지니어들을 대상으로 한 단계적 롤아웃이며, 가드레일이 준비되는 대로 '유료 API 고객과 Google AI Ultra 구독자'에게 도달하겠다는 의도가 명시되어 있지만 그 시점에는 날짜가 붙어 있지 않습니다.

한 줄 답변, 세부 내용보다 먼저

오늘날 측정 가능한 최고의 일반 추론이 필요하고 그것을 프로덕션 키에서 써야 한다면, Claude Opus 5.5는 지금 OrcaRouter에서 사용할 수 있으며 Gemini 4 Argon은 어떤 공개 API에도 없습니다. 달러당 경제적 산출량으로 평가되는 금융, 법률, 세무 또는 코딩 에이전트를 만들고 있다면, Argon의 수치가 더 좋고 바로 그것을 정확히 측정하는 단 하나의 보드에서 작업당 가격이 Opus 5.5의 5분의 1입니다. 핵심 인프라를 위한 사이버보안 방어 분야에 있다면, Argon에는 신청할 수 있는 프로그램이 있고 답은 '예'일 수도 있습니다.

각 숫자가 실제로 어디에서 오는지

두 개의 지수 위원회, 두 가지 방법론, 그리고 어느 쪽이 어느 쪽인지 정확히 짚고 넘어갈 가치가 있다. 앞으로 몇 달 동안 두 진영은 서로의 과거 발언을 인용하며 맞붙을 테니까.

• Artificial Analysis Intelligence Index v4.3 — Claude Opus 5.5는 57.6, Gemini 4 Argon은 52.6이며, 두 수치 모두 2026-09-30에 Artificial Analysis에서 확인한 것입니다. 이는 10개 평가를 종합한 합성 지표로, 의도적으로 과제 전반에 걸쳐 범용적이며, 대부분의 사람들이 "그" 순위로 인용하는 바로 그 순위표입니다.

• Vals Index, 2026-09-29 업데이트 — Gemini 4 Argon이 68.90%(±0.97)로 1위, Claude Sonnet 5.5가 67.04%(±0.92)로 2위, Claude Opus 5.5가 66.97%(±0.89)로 3위입니다. Vals는 금융, 코딩, 법률, 세무 작업에 각 부문이 미국 GDP에서 차지하는 비중만큼 가중치를 두기 때문에, 퍼즐에는 평범하지만 계약 검토와 스프레드시트 작업에는 뛰어난 모델이 여기서 좋은 점수를 받습니다.

5점 AA 격차는 실재하며 작지 않다. 2점 Vals 격차도 실재한다. 리더보드에 표시된 신뢰구간을 보면 Argon의 68.90 ±0.97 대 Opus 5.5의 66.97 ±0.89는 약 1.5 표준오차의 차이 — 동전 던지기보다는 낫지만 압도적이지는 않다. 어느 보드도 틀리지 않았다. 두 보드는 서로 다른 일을 측정하고 있다.

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, Vals Index 68.90% (rank 1), price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, throughput 48.9 tok/s. Claude Opus 5.5 reads: AA Intelligence Index 57.6, Vals Index 66.97% (rank 3), price $4 / $20, cost per index task $5.98, output ceiling 128K tokens, throughput 92.2 tok/s. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis on 2026-09-30.

한 가지 구성 관련 유의점이 있는데, 이는 AA 격차를 순수한 모델 비교로 해석하는 데 반하는 것입니다. Artificial Analysis는 Gemini 4 Argon을 해당 모델의 높은 노력 설정으로, Claude Opus 5.5를 "Adaptive Reasoning, Max Effort, Default Fallback"으로 차트에 표시합니다. 이는 두 노력 단계에서 같은 지점이 아니므로, 57.6 대 52.6이라는 헤드라인은 동일한 추론 예산에서의 동등한 비교가 아닙니다. 두 페이지 모두 게시하는 숫자이며, Anthropic에 공정하려면 인용해야 할 숫자이지만, 통제된 실험이 아닙니다.

작업당 비용은 격차가 불편해지는 지점입니다

Artificial Analysis는 자사 지수 제품군을 운영하는 데 든 비용에 대한 산정 내역도 공개하는데, 여기서 두 모델은 큰 차이를 보인다.

• 인덱스 작업당 비용 — Gemini 4 Argon $1.99 대 Claude Opus 5.5 $5.98.

• 전체 인덱스 스위트를 실행하는 비용 — Gemini 4 Argon $2,407 대 Claude Opus 5.5 $8,708.

• 백만 토큰당 정가 — Gemini 4 Argon은 입력 $2 / 출력 $10(Google이 제시한 도입 요금으로, 캐시 입력은 95% 할인되어 $0.10)인 반면, Claude Opus 5.5는 입력 $4 / 출력 $20이다.

• 처리량 — Gemini 4 Argon은 초당 48.9 출력 토큰, 첫 토큰은 2.79초 후; Claude Opus 5.5는 초당 92.2 출력 토큰이지만 동일한 하네스에서 첫 토큰 지연 시간이 702초로, 확장 사고 비용이 고스란히 드러난 셈이다.

• Vals 실행당 비용 — 동일한 GDP 가중 작업 세트 기준 Gemini 4 Argon $15.68 대 Claude Opus 5.5 $32.14.

매끄럽게 넘기기보다 짚고 넘어가야 할 문제가 하나 있습니다: Vals의 리더보드에는 Argon의 요금이 입력 $4 / 출력 $20으로 기재되어 있는 반면, Google의 발표에서는 도입 기간 동안 입력 $2 / 출력 $10이라고 밝힙니다. 가장 유력한 해석은 Vals가 표준 정가 요율을 보여주고 Google이 프로모션 요율을 보여주고 있다는 것이지만, 이는 추론일 뿐 어느 쪽에서도 공식적으로 발표한 내용은 아닙니다. 예산이 그 숫자에 달려 있다면 Google에 문의하세요.

Argon이 주장하는 것과 확인된 것

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst reading that Gemini 4 Argon delivers frontier performance in complex workflows across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

구글의 게시물은 수치로 빽빽한데, 그 하나하나가 모두 벤더가 보고한 것입니다. 제가 찾아본 바로는 독립적으로 재현된 것은 하나도 없으며, 위의 독립 기관들은 구글이 헤드라인으로 내세우기로 선택한 것들과는 다른 것들을 측정합니다. 구글 자신의 주장으로 말하자면:

• DeepSWE v1.1 — 77.9%, 실제 환경의 장기 지평(long-horizon) 소프트웨어 엔지니어링에서 새로운 최고 수준(state of the art)으로 평가받음.

• LVBench 장시간 비디오 이해 — 91.7%, 최첨단으로 평가됨.

• AutomationBench(Zapier의 엔드투엔드 비즈니스 작업 벤치마크) — 51.3%로 1위.

• CWE-bench v1 취약점 해결 — 68%로 공동 1위, v0 보드에서의 Gemini 3.8 Flash Cyber 결과를 기반으로 함.

• Gray Swan Indirect Prompt Injection — 게시물에 수치가 공개되지 않은 채 선두로 묘사됨.

• Vals Finance Agent v2와 Harvey's Legal Agent Benchmark — 선도적이라고 설명되며, 마찬가지로 발표문에 명시된 숫자는 없습니다.

독립적인 뒷받침이 실제로 있는 두 주장 계열이 가장 신뢰할 만한 것들이다: Vals는 수치와 구간으로 지수 위치를 확인하고, Artificial Analysis는 52.6 지수와 가격을 확인한다. 내부 생산성 일화 — 양자 서브루틴에서 공개된 기준선 대비 40% 개선, Argon 에이전트가 Google의 플릿 전반에서 해제한 300 TiB 이상의 메모리 — 는 외부 테스트가 없는 회사 내부 결과이므로, 그렇게 읽어야 한다.

당신이 바위 밑에서 살아왔다면, Opus 5.5란 무엇인가

Claude Opus 5.5는 Anthropic의 플래그십입니다: 1M 토큰 컨텍스트, 128K 최대 출력, 텍스트, 이미지 및 파일에 걸친 멀티모달 입력, 확장 사고, 도구 사용 및 구조화된 출력을 제공합니다. 2026-09-22에 Claude Opus 5를 계승했으며, 출시의 헤드라인은 틀림없이 가격 인하였습니다 — 등급은 올라간 것이 아니라 내려왔고, $4/$20에 캐시된 읽기는 $0.20입니다. 오늘 OrcaRouter에서 정확히 해당 요율로 라우팅할 수 있으며, 제공업체 정가가 마크업 없이 전달되고, 공급업체의 가격 변경은 그들 측에 적용되는 같은 날 우리 측에도 적용됩니다.

두 모델 모두가 가진 작업 수준 점수에서는 양상이 일방적인 휩쓸기가 아니라 진짜 엎치락뒤치락이다:

• Terminal-Bench 4.0 — Claude Opus 5.5 59.6% 대 Gemini 4 Argon 57.1%.

• SciCode — Claude Opus 5.5 66.9% 대 Gemini 4 Argon 61.8%.

• Humanity's Last Exam — Claude Opus 5.5 61.4% 대 Gemini 4 Argon 57.1%.

• 장문맥 추론 — Claude Opus 5.5 84.7% 대 Gemini 4 Argon 79.7%.

• CritPt — Claude Opus 5.5 31.7% 대 Gemini 4 Argon 27.1%.

• 전지성 — Claude Opus 5.5 46.4 대 Gemini 4 Argon 42.4.

• GDPval — Claude Opus 5.5 1,846 대 Gemini 4 Argon 1,611.

• AutomationBench-AA — Gemini 4 Argon 77.5% 대 Claude Opus 5.5 69.5%. 이는 Argon이 확실히 앞서는 유일한 일대일 과제 점수이며, Vals Index가 보상하는 대상에 가장 가까운 과제군이기도 합니다.

그러니까 패턴은 일관된다: Opus 5.5는 학술적인 색채를 띤 추론 사다리에서 앞서고, Argon은 엔드투엔드 작업 실행에서 앞선다. 이제 그것은 두 리더보드 사이의 모순이 아니다. 같은 발견이 두 번 표현된 것이다.

아무도 비교하지 않는 역량

Gemini 4 Argon의 출력 상한은 단일 트래젝터리에서 1,000,000 토큰으로, 이전 세대의 64K에서 상향된 수치다. Claude Opus 5.5는 출력을 128K로 제한한다. 둘 다 1M 토큰 컨텍스트 윈도를 보유하지만, 컨텍스트와 출력은 서로 다른 예산이며, 이는 이번 발표에서 단일 사양으로는 가장 큰 폭의 상승이다.

그게 중요한지는 전적으로 무엇을 실행하느냐에 달려 있다. 128K 출력 상한은 채팅, 코드 리뷰, 구조화된 추출, 에이전트 단계에는 넉넉한 수준이다. 하지만 전체 마이그레이션 패치 세트, 전체 감사 보고서, 또는 장문 문서를 한 번에 생성하는 데에는 단단한 벽이다 — Google이 이번 출시를 설명하기 위해 선택한 워크플로들이 바로 그렇다. 파이프라인이 상한 아래로 유지하려고 호출을 스무 번 연쇄한다면, Argon의 상한은 지연 시간과 오케스트레이션 코드를 절약해 줄 것이다. 그렇지 않다면, 당신은 쓰지도 않을 여유분에 비용을 지불하는 셈이다.

결정적인 변수는 품질이 아니라 가용성이다

이것은 비교에서 어떤 벤치마크도 붙어 있지 않으면서 그 모든 것보다 더 중요한 부분입니다.

Gemini 4 Argon은 일반적으로 제공되지 않습니다. Google의 게시물에 따르면 이 모델은 Fairwind Program을 통해 신뢰할 수 있는 사이버 방어자들에게 순차적으로 제공되고 있으며, 회사는 미국 정부의 자발적 출시 전 모델 접근 프로세스에 참여하고 있고, 개발자, 기업 및 소비자에 대한 더 넓은 접근은 "가능한 한 빨리" 제공될 예정이며, 유료 API 고객과 Google AI Ultra 구독자부터 시작합니다. 모델 식별자도, 엔드포인트도, 공개된 할당량도, 날짜도 없습니다. 이 모델은 우리 카탈로그에도 없고 다른 누구의 공개 API에도 없으므로, Argon에 대한 가격 페이지는 아직 존재하지 않습니다.

Claude Opus 5.5가 오늘 출시됩니다. OrcaRouter에서는 anthropic/claude-opus-5.5를 카탈로그에 있는 200개 이상의 다른 모델과 동일한 OpenAI 호환 엔드포인트를 통해 사용할 수 있으며, 제공자 간 자동 장애 조치가 한 경로가 성능 저하될 때 작동하고, 동일한 키로 일부 트래픽은 Opus 5.5로, 나머지는 다른 곳으로 보내고 싶을 때를 위한 라우팅 DSL도 제공합니다. 두 번째 계약도, 두 번째 SDK도 필요 없습니다.

A capture of the OrcaRouter model page for Anthropic: Claude Opus 5.5, showing the Anthropic provider, a release date of 2026-09-22, a 1,000,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $4.00 input / $20.00 output per million tokens with cache reads at $0.20 and cache writes at $5.00.

다음 달을 위한 실용적인 권고는 화려하지 않다: Opus 5.5 위에 구축하고, 모델 이름을 문자열 리터럴이 아니라 구성 값에 두고, 재시도 경로 뒤에 저렴한 모델을 배치하여 702초짜리 첫 토큰 실행에서의 지연 급증이 제품까지 함께 중단시키지 않도록 하라. 마지막 지점은 이론적이지 않다 — AA 하네스에서 Opus 5.5의 첫 토큰 지연은 11분이며, 그것이 하네스 아티팩트인지 아니면 모델이 이전의 그 무엇보다 더 오래 생각하는 것인지와 상관없이, 타임아웃 예산은 마케팅이 아니라 그 숫자로 설정해야 한다.

이 평결을 바꿀 수 있는 것은 무엇인가요

가능성 순서대로 세 가지다. 가격이 공개된 상태의 Argon 정식 출시(GA) — 이는 비용 논리를 즉시 실행 가능하게 만들고, $2/$10이 실제 트래픽과 맞닥뜨렸을 때 살아남는지를 시험하게 해줄 것이다. 구글 외부에서 이루어진 DeepSWE v1.1과 CWE-bench v1의 독립적이고 재현 가능한 실행 — 이는 벤더의 주장을 확인해 주거나 아니면 반박할 것이다. 또는 Argon을 최고 노력 설정으로 구성한 Artificial Analysis의 측정 — 이는 5점 지수 격차가 능력 차이인지 아니면 노력 설정의 부산물인지를 판가름할 것이다.

둘 중 하나가 실제로 실현되기 전까지는, 솔직한 요약은 Opus 5.5가 더 잘 검증된 모델이고 Argon이 가격 면에서 더 나은 주장이라는 것입니다. 둘 중 오늘 실제로 사용할 수 있는 것이 어느 쪽인지는 두말할 필요도 없습니다.

Claude Opus 5.5가 OrcaRouter에서 벤더 정가 그대로, 마크업 없이 라이브되었습니다. 카탈로그의 나머지 모델들과 함께요 — 리더보드가 아니라 여러분의 실제 워크로드를 기준으로 벤치마크하고 싶다면, anthropic/claude-opus-5.5가 호출할 id이며, 나중에 다른 모델로 바꾸는 것도 같은 키에서 한 줄만 수정하면 됩니다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트