
Gemini 4 Argon vs GPT-6 Astra: 지수에서 막상막하, 가격은 3분의 2나 내려간 단계
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 144 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
두 프런티어 모델이 Artificial Analysis의 Intelligence Index에서 0.11점 차이다. Gemini 4 Argon은 52.56점을 기록한다. GPT-6 Astra는 52.67점을 기록한다. 측정된 일반 역량을 기준으로 둘 중 하나를 골라야 한다면 동전을 던져도 될 정도이고, 두 점수 사이의 차이는 어느 쪽의 신뢰구간보다도 작다. 이는 상위 10개 모델이 총 약 15점 폭에 걸쳐 있는 시장에서 진정으로 드문 상황이며, 이 때문에 Gemini 4 Argon의 맞대결 중 추론하기 가장 쉬운 사례가 된다. 능력 논쟁은 시작하기도 전에 끝나고, 남은 것은 경제성과 접근성뿐이기 때문이다.
하지만 이 둘은 쌍둥이가 아니다. Argon은 2026-09-30에 Google DeepMind가 발표했고, Fairwind Program의 신뢰받는 사이버 방어자들을 시작으로 단계적으로 출시되고 있다. GPT-6 Astra는 9월 초에 출시되었으며 — 우리 카탈로그 카드는 2026-09-04로 기록하고, Artificial Analysis는 2026-09-03으로 기재한다 — 오늘 오후에 호출할 수 있는 라이브 경로이고, 백만 토큰당 입력 $10, 출력 $50이며, 1,050,000-토큰 컨텍스트 창과 128,000-토큰 출력 상한을 갖추고 있다. 이 모델들 중 하나는 오늘 실제로 청구될 수 있는 가격을 갖고 있다.
0.11점 차이가 실제인 곳과 노이즈인 곳
지수는 종합 지표이므로, 종합 점수에서 동점인 두 모델도 그 구성 요소에서는 의미 있게 다를 수 있다. 여기서는 구성 요소들이 대체로 일치하지만, 언급할 만한 세 가지 예외가 있다.
• Terminal-Bench 4.0 — GPT-6 Astra 59.1% 대 Gemini 4 Argon 57.1%. Astra가 근소하게 앞선다.
• 장문맥 추론 — GPT-6 Astra 80.7% 대 Gemini 4 Argon 79.7%.
• GPQA Diamond — GPT-6 Astra 96.1%. Argon은 이 보드에서 어떤 수치도 공개하지 않습니다.
• CritPt — GPT-6 Astra 31.7% 대 Gemini 4 Argon 27.1%.
• SciCode — Gemini 4 Argon 61.8% 대 GPT-6 Astra 56.5%.
• 인류 최후의 시험 — Gemini 4 Argon 57.1% 대 GPT-6 Astra 54.7%.
• AutomationBench-AA — Gemini 4 Argon 77.5% 대비 GPT-6 Astra 68.5%.
• GDPval — Gemini 4 Argon 1,611 대 GPT-6 Astra 1,542.
• 전지성 — GPT-6 Astra 43.4 대 Gemini 4 Argon 42.4.
• ITBench-SRE — GPT-6 Astra 48.6%, 공개된 Argon 수치가 없음과 비교
• 출력 속도 — GPT-6 Astra 초당 51.2토큰, Gemini 4 Argon 48.9토큰. 사실상 동일한 수준.
• 인덱스 하네스에서의 첫 토큰 지연 시간 — Gemini 4 Argon 2.8초 대 GPT-6 Astra 320.2초.
Astra는 과학적 객관식 추론, 임계점 물리 문제, SRE 벤치마크에서 우위를 점한다. Argon은 과학적 코딩, 더 어려운 종단 간 작업 세트, GDP 가치가 있는 작업에서 우위를 점한다. 어느 쪽 우위도 그 자체만으로 마이그레이션의 근거가 될 만큼 크지 않다.

지연 시간 항목은 다른 문제다. 첫 토큰까지 320초는 무엇이든 출력되기 전 5분 30초의 침묵인 반면, Argon은 3초 미만이다. 둘 다 같은 것, 즉 Artificial Analysis의 인덱스 실행에서 첫 번째 청크까지 걸리는 시간을 측정하므로 비교 가능하다. Astra의 추론은 항상 켜져 있으며 낮은 노력부터 최대 노력까지 구성할 수 있다. 어려운 작업에서 최대 노력 실행은 말하기 전에 실제로 몇 분 동안 생각한다. 그것이 결함인지는 전적으로 인터페이스에 달려 있다. 배치 작업에는 아무런 비용도 들지 않는다. 사용자가 스피너를 지켜보는 모든 상황에서는 이것이 두 모델 사이에서 사용자에게 가장 눈에 띄는 차이이며, 페이지에 있는 어떤 벤치마크 격차보다도 크다.
진짜 주제인 가격 단계
동점이 갈리는 지점이 바로 여기인데, Astra의 요율표에 서로 비슷하게 생긴 세 개의 등급이 있기 때문에 잘못 모델링하기 쉬운 방식으로 갈린다.
• 표준, 최대 272,000 입력 토큰 — GPT-6 Astra $10.00 입력 / $50.00 출력, 캐시 읽기 $1.00, 캐시 쓰기 $12.50.
• 긴 컨텍스트, 272,000 입력 토큰 초과 — GPT-6 Astra $20.00 입력 / $75.00 출력, 캐시 읽기 $2.00. 전체 요청이 초과분만이 아니라 더 높은 등급으로 재가격 책정됩니다: 입력 2×, 출력 1.5×.
• 고속 모드 — 적용되는 표준 요율의 2배이므로 입력 $20.00 / 출력 $100.00입니다. 이것이 마치 장문맥 요율인 것처럼 인용되는 $100 수치인데, 실제로는 그렇지 않습니다.
• Gemini 4 Argon — $2.00 입력 / $10.00 출력, 도입 기준 정액이며, 캐시된 입력 $0.10, 공개된 단계 요금도 공개된 패스트 티어도 없음.
그래서 Argon은 Astra의 표준 등급보다 입력에서 5배, 출력에서 5배 더 저렴하며, 272K 초과 입력에서는 10배 더 저렴합니다. 두 가지 독립적인 비용 측정은 다른 방향에서 같은 점을 보여줍니다: Artificial Analysis는 Argon을 인덱스 작업당 $1.99, Astra를 $3.26로 산정하고, 전체 인덱스를 실행하는 비용은 Argon이 $2,407, Astra가 $5,324라고 봅니다. 작업당 비율은 DeepSeek과 비교했을 때와 같은 이유로 토큰당 비율보다 작습니다 — Argon은 작업을 끝내는 데 더 적은 토큰을 사용합니다 — 하지만 여전히 1.6배입니다.
Vals의 GDP 가중 리더보드는 같은 이야기의 세 번째 버전을 들려준다: Argon이 68.90%와 실행당 $15.68로 1위, Astra가 63.13%와 $18.46로 6위다. Astra는 더 비싸고 그곳에서는 더 낮은 점수를 받는다. Google의 자료는 가격이 도입 요금(introductory rate)이라고 분명히 밝히고 있는데, 이는 변할 수 있다는 뜻을 지닌 표현이며, 솔직히 해석하자면 Argon의 가격 우위는 실재하지만 그 영속성은 보장되지 않는다.
벤치마크보다 더 많은 것을 좌우하는 두 가지 아키텍처 사실

출력 상한부터 살펴보겠습니다. Gemini 4 Argon은 단일 트라젝터리에서 최대 1,000,000 토큰을 생성합니다 — Google의 발표에서는 이를 이전 세대의 64K에서 확장된 것으로 강조합니다. GPT-6 Astra는 128,000이 상한입니다. 두 모델 모두 컨텍스트 윈도는 약 100만 토큰을 유지하므로, 이는 순전히 모델이 한 번에 얼마나 많이 쓸 수 있는지에 관한 문제입니다. 장문 생성, 전체 패치 코드 변경 또는 단일 패스 문서 초안 작성의 경우, 단일 호출로 생성할 수 있는 양에서 8배 차이입니다. 채팅, 추출 및 짧은 에이전트 단계에서는 두 상한 모두 사실상 무한하며, 그 차이로 인해 손해 볼 것은 없습니다.
모달리티는 두 번째 항목인데, 여기서는 한 가지 측면에서 이점이 반대 방향으로 흐릅니다. GPT-6 Astra는 텍스트, 이미지, 파일을 입력으로 받습니다. Gemini 4 Argon은 텍스트, 이미지, 동영상, 파일을 입력으로 받으며, Google의 출시 자료는 특히 장시간 동영상 이해를 강조합니다. 벤더가 보고한 LVBench 수치 91.7%입니다. 여러분의 파이프라인이 동영상을 입력으로 처리한다면 Astra는 대체재가 아닙니다. Argon의 공개된 모달리티 목록에도 오디오는 명시되어 있지 않으므로, 이번 업그레이드가 오디오를 지원한다고 가정하지 마십시오.
실제로 해야 할 일
Astra는 사용 가능하고 Argon은 사용할 수 없으며, 이는 다음 달 대부분의 결정을 사실상 정리해 준다. 헛수고를 없애는 구체적인 경로는 이것이다: 워크로드에 뛰어난 과학적 정확성과 입증된 에이전트 수행 실적을 갖춘 상시 작동 추론 모델이 필요하다면 GPT-6 Astra를 기반으로 구축하고, 구성에는 모델 이름을 유지하며, 낙관이 아니라 Astra의 측정된 동작을 기준으로 클라이언트 타임아웃을 설정하라 — 5분짜리 첫 토큰 실행은 기본 60초 타임아웃에 걸리고, 300초에 끊기는 스트림은 장애처럼 보인다. 272K 입력 토큰을 초과하는 구간에서 비용에 민감하다면, 커밋하기 전에 가격 재조정을 명시적으로 모델링하라. 왜냐하면 그 단계는 하나의 경계에서 입력을 두 배로 만들고 출력을 50% 인상하기 때문이다.

흥미로운 중간 경로는 기본값을 하나만 골라야 하는 것은 아니라는 점입니다. Astra와 Argon은 — Argon이 출시되면 — 같은 부류의 작업을 겨냥한 같은 형태의 모델이므로, 같은 자리를 두고 경쟁하는 관계라기보다 자연스러운 페일오버 파트너가 됩니다. OrcaRouter에서, openai/gpt-6-astra는 제공업체 정가에 마크업 없이 라이브 상태이며, 200개 이상의 다른 모델과 동일한 OpenAI 호환 엔드포인트를 통해, 제공업체 간 자동 페일오버와 하나의 키로 프라이머리-백업 구성을 표현할 수 있는 라우팅 DSL을 제공합니다. Argon이 Google이 공개하는 어떤 ID로든 카탈로그에 합류하면, 전환은 문자열 하나입니다 — 두 번째 계약도, 통합 작업도, 그동안 Astra를 기반으로 구축한 무엇을 재구축할 필요도 없습니다.
무엇이 그 동점을 영구적으로 깨뜨릴까?
초기 도입 기간 이후 공개된 Argon 가격, 그리고 Google의 에이전트 관련 주장에 대한 독립적 재현 — 77.9%라는 DeepSWE v1.1 수치와 68%라는 CWE-bench v1 결과는 둘 다 공급업체가 보고한 것이며, 어느 쪽도 외부 실행이 뒷받침하지 않는다. 둘 중 어느 것이든 Argon을 상당 폭 올리거나 내릴 수 있는데, 0.11포인트의 지수 우위는 비용 우위가 일시적인 것으로 드러날 경우 1.6배의 비용 열위를 상쇄할 완충이 아니며, Google이 초기 요금을 유지하고 Astra의 롱컨텍스트 티어가 프로덕션에서 예상보다 더 강하게 작용한다면 그것은 부족도 아니기 때문이다.
당장은: 측정된 일반 역량에서 이 둘은 두 개의 래퍼에 담긴 같은 모델이다. Astra는 라이브 경로가 있고, 가격 단계가 알려져 있으며, 5분간 사고를 멈추는 쪽이다. Argon은 더 저렴한 카드를 쓰고 엔드포인트가 없는 쪽이다. 이 동점은 실재하며, 그 한쪽은 구매할 수 있다.
