
Gemini 4 라인업에서 Argon의 위치 — 그리고 G4 Ultra가 없는 이유
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 221 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
이 글을 시작하게 한 질문에 대한 짧은 답은 Gemini 4 Argon이 Google의 최상위 모델이지 최상위 등급은 아니라는 것입니다. 왜냐하면 그 위의 등급은 아직 존재하지 않기 때문입니다 — 그리고 어쩌면 누구나 예상하는 형태로 존재하지 않을 수도 있습니다. Google은 Gemini 4 모델을 정확히 하나, Argon을 공개했으며, 자체 도메인의 경로 /models/gemini/ultra/ 아래에 있는 유일한 자사 페이지는 모델 페이지가 전혀 아닙니다: Google AI 구독 요금제로 리디렉션됩니다. 그 리디렉션은 이 글에서 가장 유용한 단일 사실이며, 터미널에서 한 줄로 확인할 수 있습니다. 여기서 나머지 내용은 Argon의 가격을 등급 라벨로 읽는 것을 멈추고 숫자로 읽기 시작하면 Argon이 실제로 어디에 위치하는지에 관한 것입니다.
두 가지 사실이 동시에 참이며, 이 둘은 혼동하기 쉽다. Argon은 존재하는 Gemini 중 가장 뛰어나지만, Argon은 프런티어급 모델은 아니다. 그것은 지금까지 출시된 모든 Google 모델을, 비교가 사실상 비교가 아니게 될 만큼 큰 격차로 앞서며, Artificial Analysis의 Intelligence Index에서 현재 선두보다 꼬박 5점 뒤처진 두 경쟁 플래그십과 1점의 일부 차이 안에 든다. Google은 그것이 프런티어보다 한 단계 아래에 있는 것처럼 가격을 매겼고, 독립적인 측정도 이에 동의한다. 따라서 그 가격은 이 모델을 저평가하는 마케팅 결정이 아니다. 그것은 이 모델에 관한 정확한 진술이다.
이 글은 지금까지 알려진 내용을 정리한 글입니다. Gemini 4 Argon은 2026-09-30에 Koray Kavukcuoglu의 이름으로 올라온 Google DeepMind 게시물에서 발표되었으며, Google의 Fairwind Program을 통해 이름이 명시된 사이버 방어자 코호트에 먼저 순차 제공되고 있습니다 — 개발자에게도, 기업에게도, 소비자에게도, 신용카드를 가진 누구에게도 제공되지 않습니다. Gemini API에 모델 ID가 없고, 엔드포인트도 없으며, 청구 기준으로 삼을 수 있는 공개된 토큰당 가격도 없습니다. 이 모델에 대한 모델 식별자, 실제 트래픽에서 측정된 처리량 및 안정성은 존재하지 않습니다. 즉, 아래 측정치는 한 연구소의 벤치마크 실행일 뿐, 그 이상은 아닙니다. 숫자가 Google에서 나온 경우에는 Google의 것으로 표시하고, Artificial Analysis에서 나온 경우에는 Artificial Analysis의 것으로 표시합니다. 여기 어떤 내용도 Argon이 구매 가능한 제품이라는 주장으로 해석되어서는 안 됩니다.
구글이 실제로 출시한 사다리, 자사 페이지에서 읽어낸
“Argon이 Gemini 4 라인업에서 어디에 위치하는가”에 답하는 가장 빠른 방법은 라인업에 대해 묻는 것을 멈추고 Google이 페이지를 게시하는 모델들을 나열하기 시작하는 것이다. 라인업은 마케팅 개념이고, 페이지는 사실이다. 다음은 2026년 10월 1일 기준으로 퍼스트파티 경로가 가리키는 대상이다.
• deepmind.google/models/gemini/pro/는 200을 반환하며 제목은 “Gemini 3.1 Pro — Google DeepMind”입니다. Google 자사 사이트의 Pro 슬롯은 여전히 3.1 세대 모델입니다.
• deepmind.google/models/gemini/flash/200을 반환하고 제목은 “Gemini 3.8 Flash — Google DeepMind”입니다. Flash 슬롯은 3.5, 3.6, 3.7, 3.8로 세 번 이동했지만, Pro 슬롯은 전혀 이동하지 않았습니다.
• deepmind.google/models/gemini/argon/은 404를 반환합니다. Argon에는 모델별 경로가 없습니다. Argon의 홈은 패밀리 페이지인 deepmind.google/models/gemini/이며, 바로 이곳이 Google이 현재 주력으로 내세우는 모델을 배치하는 곳입니다.
• deepmind.google/models/gemini/ultra/는 302를 반환하고 다음으로 연결됩니다: one.google.com/about/google-ai-plans/, 소비자 구독 페이지. 더 오래된 경로도 마찬가지입니다: deepmind.google/technologies/gemini/ultra/. Google의 모델 경로에서 “Ultra”는 청구 등급이지 체크포인트가 아닙니다.
• deepmind.google/models/gemini/nano/은 Gemini 패밀리 페이지로 301을 반환합니다. Nano 슬롯도 독립형 모델 페이지로 존재하지 않습니다.
• deepmind.google/models/gemini/model-cards/ — Google이 자사가 공개한 모든 모델 카드를 정리해 유지하는 색인 — 에는 Argon에 대한 항목도, 이름에 “Gemini 4”가 들어간 항목도 없습니다. 가장 최신 Gemini 행은 3.8 Flash, 3.8 Audio, 3.7 Flash, 3.6 Flash, 3.5 Flash, 3.5 Flash-Lite, 3.1 Pro입니다. 이 카드 색인은 이 세트에서 가장 더디게 변하는 문서이므로, 그 침묵은 Argon이 결코 카드를 갖지 못할 것이라는 증거가 아닙니다; 그것은 서류 작업이 발표를 따라잡지 못했다는 증거입니다.
• deepmind.google/models/라는 모델 인덱스에는 “Gemini 4 Argon”이 “우리의 차세대 프런티어 지능”이라는 태그라인이 달린 플래그십 카드로, “Gemini 3.8 Flash — 복잡한 에이전트 작업을 대규모로 처리하는 데 최적” 바로 위에 나열되어 있습니다. 두 개의 Gemini 카드가 한 세대 차이로, 그 순서대로.
이것들을 종합하면 그 사다리의 모양은 모호하지 않다. 구글의 공개 모델 표면에는 현재 Gemini 4 단계에 항목이 하나, Gemini 3.8 단계에 항목이 하나, 3.5세대나 뒤처진 낡은 Pro 단계가 하나 있으며, 그 어느 것 위에도 아무것도 없다. 구글 도메인에서 “Ultra”라는 단어는 구독을 가리킨다. Gemini 4 Pro 페이지도, Gemini 4 Flash 페이지도, Gemini 4 Ultra 페이지도, Gemini 4 모델 카드도 없다. 구글은 패밀리가 아니라 하나의 모델을 발표했다.
Gemini 4 Ultra가 있나요? 그 증거, 그리고 무엇이 그것을 반증할까요
이것은 일주일만 지나면 가장 다르게 답해질 가능성이 큰 질문의 일부이고, 솔직한 답에는 유통기한이 있기 때문에, 별도의 섹션을 둘 만하다.
부정적 증거는 모호하기보다 구체적이다. Ultra 경로에서 구독 요금제 페이지로 향하는 302는 약한 신호가 아니다. 그것은 Google 자체 웹팀이 구성한 리디렉션이다. 여러 blog.google URL 패턴은 Gemini 4 Ultra 게시물에 대해 404를 반환한다 — 제품 경로, innovation-and-ai models-and-research 경로, 그리고 일반 발표 경로. 여기서 Ultra라는 이름에는 관례가 있고, 그 관례는 Gemini 4 Ultra에 불리하게 작용한다. Google의 최초 Gemini 발표는 Gemini 1.0을 “세 가지 서로 다른 크기, 즉 Ultra, Pro, Nano에 최적화됨”으로 소개했으며, Gemini Ultra는 “우리의 가장 크고 가장 강력한 모델”로 설명했다. 세 가지 크기를 언급하는 출시 게시물은 패밀리 발표의 모습이다. Argon의 게시물은 모델 하나만 언급하고 형제 모델은 전혀 언급하지 않는다. Google은 나중에 Ultra 모델 이름을 숫자 등급으로 대체하고 그 단어를 사업의 구독 쪽으로 옮겼으며, 이제 그 단어는 최상위 소비자 요금제를 가리킨다. 모델 페이지가 요금제 페이지로 리디렉션되는 것은 마케팅 사이트가 그 주변을 정리한 뒤 은퇴한 모델 이름이 보이는 모습이다.
또한 그 발표에는 더 큰 형제 모델을 약속하는 내용이 전혀 없다. Argon 출시 게시물은 Argon을 “우리의 새로운 프런티어 모델”이라고 설명하고, 단계적 출시, 안전장치 작업, 내부 배포를 설명한 뒤 멈춘다. “Gemini 4 패밀리의 첫 번째”라고 말하지도 않고, Pro나 Ultra를 예고하지도 않으며, 후속 모델의 이름을 밝히지도 않는다. Google 자신의 프레이밍은 Argon을 작은 모델이 아니라 핵심으로 취급한다.
결론을 반증할 수 있는 요인은 말하기도 쉽고 주시할 가치도 있다. 왜냐하면 이들 중 어느 하나만으로도 하루 안에 결론이 뒤집힐 수 있기 때문이다.
• 200 응답이 나오는 deepmind.google/models/gemini/ultra/에서 플랜 페이지가 아니라 모델 페이지를 렌더링하는 경우, 또는 새로운 models/gemini/ 하위 경로가 pro 및 flash와 함께 나타나는 경우.
• 모델 카드 색인에 Gemini 4 Ultra 행이 등장하는 것 — 이는 구글이 역사적으로 어떤 모델이 문서화된 산출물로 존재함을 확인해 온 방식이다.
• gemini-4-* 네임스페이스에 있는 Gemini API의 두 번째 모델 ID입니다. 현재 Argon에는 아무것도 없으므로, Pro 또는 Ultra ID는 해당 제품군이 실제임을 보여주는 첫 번째 증거가 될 것입니다.
• Artificial Analysis의 모델 목록에 있는 항목, 또는 패밀리 페이지에서 네 번째 열이 있는 벤치마크 표. 이 두 가지 모두 Google의 출시를 앞서 파악할 만큼 면밀하게 추적합니다.
• Gemini 4에 대해 "family"라는 단어를 사용한 Google I/O, Cloud Next 또는 DeepMind 발표 게시물. Argon의 게시물은 그렇지 않다.
그중 적어도 하나가 실제로 일어나기 전까지는, Gemini 4 Ultra가 출시될 것이라고 주장하는 글은 보도라는 옷을 걸친 예측일 뿐입니다. 우리가 쓴 글도 포함해서, 그렇게 대하세요.

가격 사다리를 티어 선언으로 읽기
가격은 Google이 의도적으로 공개한 이번 사안의 한 부분이며, 각주까지 달려 있고, 이는 전체 출시에서 티어 의도를 가장 명확하게 보여주는 진술입니다. Argon의 도입 가격은 입력 토큰 100만 개당 $2, 출력 토큰 100만 개당 $10이며, 캐시된 입력은 95% 할인됩니다. 그리고 Google 자체의 각주 1에는, 정의할 수 없다고 한 도입 기간이 지나면 “입력 토큰 1M당 $4, 출력 토큰 1M당 $20의 가격이 적용됩니다”라고 나와 있습니다.
그 두 쌍을 필드와 대조해 보면 티어 주장은 저절로 성립한다.
• $4 / $20은 Claude Opus 5.5의 정가입니다. Argon에 대한 Google의 도입가 종료 후 요금은, 그보다 5점 뒤처지는 모델임에도, 현재 최전선 선두 주자의 요금표에 정확히 들어맞습니다.
• $2 / $10은 GPT-6 Sol과 Claude Sonnet 5.5가 모두 차지하는 프로모션 가격대입니다. Argon의 도입 요금도 동일한 $2 / $10으로, 이는 Argon의 출시 가격을 프런티어 가격대가 아니라 중간 계층 Sol과 같은 가격대에 놓이게 합니다.
• $10 / $50은 Claude Fable 5.1과 GPT-6 Astra가 모두 자리한 가격입니다. Argon은 Fable 5.1의 입력 가격의 5분의 1, 출력 가격의 5분의 1이며, 점수는 Fable 5.1과 0.8 이내입니다.
• $0.75 / $3.75는 Gemini 3.8 Flash입니다. Argon은 입력에서 그 2.7배, 출력에서 2.7배로, 절벽이 아닌 매끄러운 한 단계 상승입니다.
그래서 Google은 Argon을 $10/$50 미만이면서 $0.75/$3.75 초과에 속하고, 궁극적으로는 $4/$20에 안착할 모델로 가격을 책정했다. 그 사다리 어디에도 “프런티어”라고 말하는 부분은 없다. 그것은 “더 낮은 성능으로, 선두 주자가 오늘 청구하는 것과 같은 요율에 안착할 대표 숫자를 가진 중간대의 최상단”이라고 말한다. 그것은 방어 가능한 상업적 선택이다. 그것은 그 어떤 것보다 두 등급 앞선 위치에 놓인 모델의 가격 책정이 아니다.
기억해 둘 만한 구조적 요점이 하나 있습니다: Argon의 가격 단계는 각주에 정의된 진짜 단계이며, 날짜가 명시되어 있지 않습니다. Sonnet 5.5와 GPT-6 제품군도 긴 컨텍스트 계층에서 비슷한 방식을 쓰며, Sol은 272K를 넘으면 $4/$15로 올라갑니다. Argon의 단계는 컨텍스트 길이가 아니라 시간을 기준으로 합니다. 즉, 1M 창 전체에 동일한 $2/$10이 적용되고 요율을 바꾸는 것은 오직 달력뿐입니다. 이는 이례적인 형태이며, Argon과의 모든 비용 비교를 두 개의 열로 수행해야 하는 작업으로 만듭니다: 어느 기간인지, 그리고 어느 사용량인지.
존재하는 수치로 본, 경쟁자들 사이에서 Argon의 위치
Artificial Analysis는 Gemini 4 Argon에 대한 측정 결과를 충분히 빠르게 올려서, 그것이 이용 가능한 유일한 독립적 측정치가 되었습니다. 10월 1일 기준 최신 리비전인 v4.3.2에서, Argon은 high reasoning effort로 구성했을 때 Intelligence Index에서 52.56점을 기록합니다. 그 주변의 모델들은 해당 분야의 무작위 표본이 아닙니다.
• Claude Opus 5.5는 최대 노력(max effort)과 폴백 조건에서 측정했을 때 57.62를 기록합니다. 이는 Argon보다 5점 남짓 높은 수치이며, 현재 순위표의 최상단입니다.
Claude Fable 5.1은 폴백을 사용한 최대 노력(max effort)으로 측정했을 때 53.35를 기록했습니다. Argon은 그보다 0.79 뒤처집니다.
• GPT-6 Astra는 최대 측정 기준 52.67을 기록했습니다. Argon은 그보다 0.11 뒤처져 있습니다.
• Claude Sonnet 5.5는 55.98점에 위치하며, 폴백을 포함해도 최대치입니다. 이는 중급 모델이 Argon보다 3.4점 더 높은 점수를 받는다는 뜻이고, “Gemini 4 Argon이 세계에서 두 번째로 좋은 모델이다”라는 주장을 꺼내려는 사람이라면 누구나 걱정해야 할 수치입니다.
• GPT-6 Sol은 872K 컨텍스트 윈도우에서 최대치로 측정했을 때 47.63을 기록합니다. Argon이 4.9 앞서 있습니다.
• Gemini 3.8 Flash는 높은 노력 설정에서 40.93을 기록합니다. Argon은 그것보다 11.6 앞서 있습니다.
• Gemini 3.1 Pro Preview는 29.72에 머문다. Argon은 그보다 22.8 앞서 있는데, 이는 구글이 실제로 출시하는 Pro 등급이 자체 연구에 얼마나 뒤처졌는지를 보여주는 가장 명확한 단일 진술이다.
그 목록에서 세 가지가 도출된다. 첫째, Argon은 두 경쟁자 Fable 5.1과 Astra와 같은 수준이고, 두 Anthropic 모델 — Opus 5.5, 그리고 더 곤란하게도 Sonnet 5.5 — 에는 확실히 뒤처진다. 둘째, Argon과 Google 자체의 최고 출시 모델 사이의 격차는 현재 라인업에서 단연 가장 큰 세대 간 도약이다. 셋째, “프런티어가 최소 두 계층 앞서 있다”는 시그널의 프레이밍은 실질적으로는 맞지만 기하학적으로는 약간 어긋난다. Argon보다 확실히 앞선 모델 계층이 하나 있고(57.6을 기록한 Opus 5.5), 더 저렴한 계층에 있는 두 번째 모델도 Argon보다 앞서 있다(56.0을 기록한 Sonnet 5.5). 이는 Argon이 실제로 올라 있는 사다리에서 두 칸 아래에 있는 것보다 더 심각한 문제다.
원래 질문의 가격 비교 프레이밍 — “가격을 보면 이것이 그들의 Sol/Sonnet 상응 모델임을 시사한다” — 은 출시 가격에 대해서는 대체로 맞고 최종 가격에 대해서는 틀린 것으로 드러난다. Argon은 Sol과 Sonnet 5.5의 요금으로 시작해 Opus 5.5의 요금으로 정착한다. 이는 중간급 모델로 가격이 책정되었지만 프런티어급 가격이 되려는 모델이며, 측정 성능은 어느 쪽에도 해당하지 않는다.
작업당 비용을 살펴보면 Argon이 가장 강력한 지점이 드러나고, 여기서 티어 이야기에 두 번째 차원이 더해집니다. Index 작업에서 Argon은 $1.99의 비용으로 142,374개의 출력 토큰을 생성합니다. Opus 5.5는 $5.98의 비용으로 338,099개를 생성합니다. Sonnet 5.5는 $7.62의 비용으로 599,849개를 생성합니다. Fable 5.1은 $7.63의 비용으로 187,455개를 생성합니다. Astra는 $3.26의 비용으로 68,691개를 생성합니다. Gemini 3.8 Flash는 $1.24의 비용으로 154,230개를 생성합니다. Argon은 최전선에 근접한 점수를 사는 가장 저렴한 방법이며, 점수에서 자신보다 위에 있는 Flash 모델보다 작업당 1달러 미만으로 더 저렴합니다.
에포트 설정은 위의 모든 내용에 대한 단서이며, 해당 분야에서는 이를 일관되게 보고하지 않는다. Argon은 높음에서 측정된다. Opus 5.5와 Fable 5.1, Sonnet 5.5는 폴백을 포함한 최대에서 측정된다. Astra와 Sol은 최대에서 측정된다. 높은 에포트 실행과 최대 에포트 실행은 같은 측정이 아니며, Anthropic 자체의 에포트 단계는 설정 간에 모델을 몇 점씩 이동시킨다. Argon이 최대 에포트로 측정되었을 때 52.6을 의미 있게 상회하는 점수를 받는다면, 티어 논거는 달라진다. 아직 아무도 그 실행을 공개하지 않았다.
Google 자체 표가 주장하는 내용, 그리고 독립적인 표와 어떻게 다른지
Gemini 제품군 페이지에는 Google이 작성한 네 개의 열 — Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5 — 과 열아홉 개의 벤치마크 행으로 구성된 성능 표가 실려 있다. 이는 Google이 이 모델에 관해 공개한 가장 상세한 주장 모음이며, 전반적으로 벤더가 보고한 내용이다. 이를 독립적인 Index와 대조해 읽는 것은 바로 두 자료가 이 분야의 구도에 대해 서로 일치하지 않기 때문에 시사하는 바가 크다.
Google의 표에서 Argon은 19개 행 중 13개에서 단독으로 1위를 차지하거나 공동 1위에 오릅니다. 여기에는 Vals Index Knowledge work 68.9, AutomationBench 51.3, Harvey’s Legal Agent Benchmark 19.6, DeepSWE v1.1 77.9, LABBench 2 88.8, GraphWalks의 ≤128K 구간 99.7 및 256K–1M 구간 84.2, Agent’s Last Exam 39.5, LVBench 91.7, Chartography 71.6이 포함됩니다.
• Claude Opus 5.5는 지속적인 엔지니어링처럼 읽히는 항목에서 승리합니다: FrontierSWE v2는 62.3 대 Argon의 55.0, Terminal-bench 4.0은 66.4 대 57.4, Terminal-Bench Science 0.1은 63.3 대 57.6, PostTrainBench는 49.3 대 45.3입니다.
• GPT-6 Astra는 Terminal-Bench Science 0.1에서 68.1, OSWorld-2.0 오프라인 하위 집합에서 72.6을 기록하며, CWE-bench v1에서는 68.0으로 Argon과 동점을 이룹니다. Claude Fable 5.1은 Vibe Code Bench에서의 공동 동점을 제외하면 모든 행에서 패합니다.
• 독립 Index에서는 순서가 Opus 5.5가 먼저, 그다음 Sonnet 5.5, 그다음 Fable 5.1, 그다음 Argon과 Astra가 사실상 동급입니다. Google의 표에는 Sonnet 5.5 열이 아예 없는데, 이는 그 표에서 가장 중대한 누락입니다: 표의 네 개 열은 선별된 것이며, Index에서 Argon보다 더 높은 순위를 차지하면서 더 낮은 가격인 모델은 그 안에 없습니다.
그렇다고 해서 Google의 표가 부정직해지는 것은 아니다. 벤더 벤치마크 표는 샘플링된 것이 아니라 선별된 것이며, 모든 실험실의 표도 마찬가지다. 그것은 표를 측정치가 아니라 주장으로 만들고, 티어 문제를 그 표만으로 판가름할 수 없다는 뜻이다. 이 글에서 이 표가 진정으로 중요한 역할을 하는 곳은 부정적인 부분 하나뿐이다: 열아홉 개 행, 네 개 열, 그리고 Ultra를 위한 다섯 번째 열은 없다.

Argon에 관한, 전혀 티어 문제가 아닌 단 하나의 것
위의 모든 티어 논거는 Argon이 결국 호출할 수 있는 모델이라고 가정한다. 그것은 포지셔닝 질문과 분리해서 볼 가치가 있다. 둘은 서로 다른 답을 가지며, 그중 하나만이 역량에 관한 것이기 때문이다.
Argon의 출력 토큰 한도는 64K에서 100만 토큰으로 늘어났으며, Google은 이를 직접 밝혔다. 이는 출력 상한이지 컨텍스트 윈도우가 아니다. 이 구분이 중요한 이유는 이번 출시를 다룬 보도에서 이 둘이 끊임없이 혼동되기 때문이며, 100만 출력 한도는 100만 컨텍스트 윈도우와는 다른 엔지니어링 주장이기 때문이다. 전자는 단일 트래젝터리가 얼마나 오래 실행될 수 있는지에 관한 것이고, 후자는 모델에 한 번에 얼마나 많이 넘겨줄 수 있는지에 관한 것이다. Google은 출력 한도에 대해서는 명확히 밝혔지만 컨텍스트 윈도우에 대해서는 침묵했다. Artificial Analysis는 Argon의 컨텍스트 역시 1,000,000 토큰으로 기록하지만, 이는 해당 트래커의 항목일 뿐 Google의 진술이 아니다. 따라서 두 수치가 같아 보이더라도 서로 다른 출처에서 나온 것으로 취급해야 한다.
명백히 이용할 수 없는 것은 접근 권한이다. Argon은 일반적으로 제공되지 않으며, 어떤 식별자로도 Gemini API에 없고, 어떤 제3자 카탈로그에도 없다. 이는 Fairwind 프로그램을 통해 검증된 사이버 방어자들과 Google 자체 엔지니어들에게 제공되며, Google이 언급한 다음 단계 — “유료 API 고객과 Google AI Ultra 구독자부터 시작” — 에는 날짜가 붙어 있지 않다. 자신의 워크로드에서 이를 벤치마킹할 수 없다. 따라서 이 기사의 모든 수치는 사용할 수 없는 모델에 대한 다른 누군가의 측정값이다.
Argon을 한 단계 끌어올리려면 무엇이 필요할까
티어 판정은 스냅샷이며, 이를 바꿀 수 있는 약 다섯 가지 요소가 있는데, 대략적인 중요도 순으로 정렬된다.
• 독립적으로 측정된 최대 노력(max-effort) 실행. Argon은 현재 52.56의 고노력(high-effort) 측정치입니다. Anthropic 자체의 노력 사다리는 설정에 따라 모델을 몇 점씩 움직이며, Google의 모델이 최대 설정에서 비슷하게 작동한다면, Fable 5.1과 Astra에 대항하는 Argon의 실제 위치는 이 기사에서 말하는 것보다 더 좋습니다. 이것이 가장 유력한 단일 변경 사항입니다.
• 두 번째 측정 출처. 추적기 하나는 하나의 측정이다. 두 번째 독립 연구소가 자체 하네스에서 Argon을 평가하는 것이 Google의 어떤 추가 벤치마크 행보다 티어 주장에 더 도움이 될 것이다.
• Gemini 4 Pro. 구글이 4세대의 Pro 등급을 Argon 아래에 추가한다면, 라인업은 형태를 갖춘 하나의 제품군이 되고, Argon의 위치는 “유일한 제품”에서 “셋 중 최상위”가 되며, 이 글에서 빠져 있는 제품군에 관한 모든 논거는 다시 써야 한다. 주목할 만하며, Ultra 문제보다 더 임박해 있다.
• 계단식으로 오르지 않는 가격. 도입 가격이 그냥 만료되지 않는다면 — Argon은 그것이 언제 끝나는지 정의하지 않았다 — Argon의 실질 상시 가격은 $4/$20이 아니라 $2/$10이 되고, Opus 5.5 대비 작업당 비용은 3배에서 약 6배로 벌어진다. 이는 역량의 사건이 아니라 상업적 사건이지만, 가격 결정의 양상을 바꾼다.
• Argon 모델 카드, 시스템 카드 또는 평가 방법론 페이지. 성능 표는 Google 도메인의 방법론 페이지로 연결된다. 완전한 모델 카드는 컨텍스트 윈도우, 배포 구성, 안전 보장 범위를 공식 기록으로 남기고, Fairwind 코호트 외부의 사람이 Google의 수치를 단순히 읽는 것이 아니라 확인할 수 있게 해 주는 첫 번째 산출물이 될 것이다.
반대로, Argon을 가장 유력하게 아래로 끌어내릴 요소는 벤치마크가 전혀 아니다. 그것은 9월 30일 Bloomberg 보도로, 이 보도는 해당 모델에 접근 권한이 있는 Google 직원들이 실제 업무에서 이 모델이 점수가 시사하는 것보다 더 못한다고 말한 내용을 인용했다. 그 주장은 Google 외부의 누구에 의해서도 검증되지 않았고 측정값도 아니지만, 제2의 독립 벤치마크가 확인해 주거나 무효화할 수 있는 종류의 주장이다. 그때까지 그것은 이름이 밝혀진 매체와 익명의 소식통을 동반한 의혹으로 기록에 남아 있으며, 벤치마크와 실제 현장 간 격차가 논란 중인 모델은 벤치마크만으로 승격될 수 없기 때문에 이는 등급 논의에 포함되어야 한다.
이번 달에 모델을 고르고 있다면 이것이 의미하는 바
포지셔닝 논쟁을 걷어내면, 실용적인 그림은 단락 하나로 충분히 설명될 만큼 명확하다. Gemini 4 Argon은 Google이 만든 최고의 Gemini이며 당신은 그것을 사용할 수 없으므로, 오늘 실제로 선택할 수 있는 Google 모델은 이미 출시된 것들뿐이다: Index에서 40.93을 기록하며 $0.75/$3.75인 Gemini 3.8 Flash, 그리고 29.72를 기록하며 $2/$12인 Gemini 3.1 Pro Preview. 지금 당장 Gemini가 필요하다면, 그것이 실제 선택지이며, Argon은 거기에 없다.
Google 내부가 아니라 여러 공급업체를 두고 선택하는 경우라면, Argon의 발표는 오늘의 결정을 바꾸지 않습니다. Index 최상위는 57.62의 Claude Opus 5.5이며, 55.98의 Claude Sonnet 5.5가 입력 요금은 5분의 1, 출력은 절반으로 그 바짝 뒤를 잇습니다. 52.56의 Gemini 4 Argon은 귀하의 애플리케이션으로 이어지는 경로가 없으므로, 최종 점수가 아무리 좋게 나오더라도 후보가 아닙니다.

OrcaRouter는 앞에 있는 단일 API로, 200개 이상의 모델 제공업체 목록 가격을 마크업 없이 그대로 전달하고 제공업체 간 자동 장애 조치, 이는 모델 전환 결정에 아무것도 다시 배선할 필요가 없다는 것을 의미합니다: 요청 본문의 ID가 전부입니다. 현재 우리 카탈로그에 있는 Google 모델은 Google이 실제로 출시한 모델입니다 — google/gemini-3.8-flash, google/gemini-3.6-flash, google/gemini-3.5-flash 및 google/gemini-3.1-pro-preview. Gemini 4 Argon은 그중 하나가 아니며, 공개 모델 식별자와 공개 요금표가 없는 동안에는 그럴 것입니다. 따라서 위의 어떤 내용에도 라우팅 주장을 읽어서는 안 됩니다. Google이 Argon을 ID가 있는 API에 올리면, 그것은 라우팅 질문이 됩니다. 그때까지 OrcaRouter 답변의 정직한 버전은 아직 적용되지 않는다는 것이며, 이 특정 결정을 위해 카탈로그가 하는 유용한 일은 실제로 호출 가능한 모델의 가격을 실제로 호출 가능한 모델 나란히 비교할 수 있게 하여 네 개의 계정을 열지 않고도 알아볼 수 있게 하는 것입니다.
요점
Gemini 4 Argon은 구글의 플래그십이지만 구글의 최전선은 아니다. 고강도 모드에서 Artificial Analysis의 v4.3.2 지수 52.56을 기록해 Claude Fable 5.1, GPT-6 Astra와 동일한 수준이며, Claude Opus 5.5보다 5점 뒤처지고, 경쟁 연구소의 더 저렴한 모델인 Claude Sonnet 5.5보다도 뒤처진다. 구글은 이를 $2/$10의 도입 가격으로 책정했고 이후 $4/$20으로 인상하는데, 이는 측정 가능하게 더 낮은 성능으로 결국 Claude Opus 5.5와 정확히 같은 요율이 된다. Gemini 3.8 Flash에 대한 11.6점 우위는 구글 자체 라인업에서 가장 넓은 세대 간 격차이며, Gemini 4 세대가 단순한 리배지가 아니라 실제 도약이라는 가장 강력한 증거다.
이 모든 것을 촉발한 질문에 관해 말하자면: Gemini 4 Ultra는 존재하지 않는다. Google 자체 도메인의 Ultra 경로는 구독 요금제 페이지로 리디렉션되고, 모델 카드 인덱스에는 Gemini 4 항목이 전혀 없으며, Gemini 4 Ultra 게시물에 대한 모든 발표 URL 패턴은 404를 반환하고, 출시 게시물은 하나의 모델만 발표할 뿐 제품군을 약속하지 않는다. 이는 실제 발견이며 추론이 아니라 1차 출처 증거다. 그러나 반감기가 짧은 사실이기도 하다 — 한 경로에서 단 하나의 200 응답만으로도 뒤집히고, Gemini 4 세대에서 먼저 등장할 가능성이 더 큰 쪽은 Pro 단계다.
이 글에서 가져가야 할 두 가지 유의점이 있다. 여기 나오는 모든 Argon 수치는 검증된 사이버 방어자 집단 밖의 누구도 호출할 수 없는 모델에 대한 다른 누군가의 측정값이며, Google 자체의 19행 표는 측정값이 아니라 하나의 주장이다 — 있는 그대로는 유용하지만 독립적인 Index를 대신할 수는 없다. 그리고 티어 문제에 대한 공정한 판단은 잠정적이다: Argon은 max가 아니라 high effort에서 측정되었으며, max-effort 실행은 이 기사가 틀릴 수 있는 가장 비용이 적게 드는 방식이다.
이 글에서 비교한 모델4
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
