히어로 타이틀 카드에 "Gemini 4 Argon vs GPT-6 Astra", 칩에 "Index 52.6 vs 52.7", 또 다른 칩에 "Cost per index task $1.99 vs $3.26", 하단 줄에 "Argon figures vendor-reported; index and cost figures per Artificial Analysis, 2026-09-30."라고 표시됩니다.
Guides & Insights

Gemini 4 Argon vs GPT-6 Astra: 지수에서 막상막하, 가격은 3분의 2나 내려간 단계

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

두 프런티어 모델이 Artificial Analysis의 Intelligence Index에서 0.11점 차이다. Gemini 4 Argon은 52.56점을 기록한다. GPT-6 Astra는 52.67점을 기록한다. 측정된 일반 역량을 기준으로 둘 중 하나를 골라야 한다면 동전을 던져도 될 정도이고, 두 점수 사이의 차이는 어느 쪽의 신뢰구간보다도 작다. 이는 상위 10개 모델이 총 약 15점 폭에 걸쳐 있는 시장에서 진정으로 드문 상황이며, 이 때문에 Gemini 4 Argon의 맞대결 중 추론하기 가장 쉬운 사례가 된다. 능력 논쟁은 시작하기도 전에 끝나고, 남은 것은 경제성과 접근성뿐이기 때문이다.

하지만 이 둘은 쌍둥이가 아니다. Argon은 2026-09-30에 Google DeepMind가 발표했고, Fairwind Program의 신뢰받는 사이버 방어자들을 시작으로 단계적으로 출시되고 있다. GPT-6 Astra는 9월 초에 출시되었으며 — 우리 카탈로그 카드는 2026-09-04로 기록하고, Artificial Analysis는 2026-09-03으로 기재한다 — 오늘 오후에 호출할 수 있는 라이브 경로이고, 백만 토큰당 입력 $10, 출력 $50이며, 1,050,000-토큰 컨텍스트 창과 128,000-토큰 출력 상한을 갖추고 있다. 이 모델들 중 하나는 오늘 실제로 청구될 수 있는 가격을 갖고 있다.

0.11점 차이가 실제인 곳과 노이즈인 곳

지수는 종합 지표이므로, 종합 점수에서 동점인 두 모델도 그 구성 요소에서는 의미 있게 다를 수 있다. 여기서는 구성 요소들이 대체로 일치하지만, 언급할 만한 세 가지 예외가 있다.

• Terminal-Bench 4.0 — GPT-6 Astra 59.1% 대 Gemini 4 Argon 57.1%. Astra가 근소하게 앞선다.

• 장문맥 추론 — GPT-6 Astra 80.7% 대 Gemini 4 Argon 79.7%.

• GPQA Diamond — GPT-6 Astra 96.1%. Argon은 이 보드에서 어떤 수치도 공개하지 않습니다.

• CritPt — GPT-6 Astra 31.7% 대 Gemini 4 Argon 27.1%.

• SciCode — Gemini 4 Argon 61.8% 대 GPT-6 Astra 56.5%.

• 인류 최후의 시험 — Gemini 4 Argon 57.1% 대 GPT-6 Astra 54.7%.

• AutomationBench-AA — Gemini 4 Argon 77.5% 대비 GPT-6 Astra 68.5%.

• GDPval — Gemini 4 Argon 1,611 대 GPT-6 Astra 1,542.

• 전지성 — GPT-6 Astra 43.4 대 Gemini 4 Argon 42.4.

• ITBench-SRE — GPT-6 Astra 48.6%, 공개된 Argon 수치가 없음과 비교

• 출력 속도 — GPT-6 Astra 초당 51.2토큰, Gemini 4 Argon 48.9토큰. 사실상 동일한 수준.

• 인덱스 하네스에서의 첫 토큰 지연 시간 — Gemini 4 Argon 2.8초 대 GPT-6 Astra 320.2초.

Astra는 과학적 객관식 추론, 임계점 물리 문제, SRE 벤치마크에서 우위를 점한다. Argon은 과학적 코딩, 더 어려운 종단 간 작업 세트, GDP 가치가 있는 작업에서 우위를 점한다. 어느 쪽 우위도 그 자체만으로 마이그레이션의 근거가 될 만큼 크지 않다.

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Astra on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, first token 2.8 s, input modalities text, image, video and files. GPT-6 Astra reads: AA Intelligence Index 52.7, price $10 / $50, cost per index task $3.26, output ceiling 128K tokens, first token 320.2 s, input modalities text, image and files, with a note that its standard rate steps to $20 input and $75 output above 272K input tokens. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis.

지연 시간 항목은 다른 문제다. 첫 토큰까지 320초는 무엇이든 출력되기 전 5분 30초의 침묵인 반면, Argon은 3초 미만이다. 둘 다 같은 것, 즉 Artificial Analysis의 인덱스 실행에서 첫 번째 청크까지 걸리는 시간을 측정하므로 비교 가능하다. Astra의 추론은 항상 켜져 있으며 낮은 노력부터 최대 노력까지 구성할 수 있다. 어려운 작업에서 최대 노력 실행은 말하기 전에 실제로 몇 분 동안 생각한다. 그것이 결함인지는 전적으로 인터페이스에 달려 있다. 배치 작업에는 아무런 비용도 들지 않는다. 사용자가 스피너를 지켜보는 모든 상황에서는 이것이 두 모델 사이에서 사용자에게 가장 눈에 띄는 차이이며, 페이지에 있는 어떤 벤치마크 격차보다도 크다.

진짜 주제인 가격 단계

동점이 갈리는 지점이 바로 여기인데, Astra의 요율표에 서로 비슷하게 생긴 세 개의 등급이 있기 때문에 잘못 모델링하기 쉬운 방식으로 갈린다.

• 표준, 최대 272,000 입력 토큰 — GPT-6 Astra $10.00 입력 / $50.00 출력, 캐시 읽기 $1.00, 캐시 쓰기 $12.50.

• 긴 컨텍스트, 272,000 입력 토큰 초과 — GPT-6 Astra $20.00 입력 / $75.00 출력, 캐시 읽기 $2.00. 전체 요청이 초과분만이 아니라 더 높은 등급으로 재가격 책정됩니다: 입력 2×, 출력 1.5×.

• 고속 모드 — 적용되는 표준 요율의 2배이므로 입력 $20.00 / 출력 $100.00입니다. 이것이 마치 장문맥 요율인 것처럼 인용되는 $100 수치인데, 실제로는 그렇지 않습니다.

• Gemini 4 Argon — $2.00 입력 / $10.00 출력, 도입 기준 정액이며, 캐시된 입력 $0.10, 공개된 단계 요금도 공개된 패스트 티어도 없음.

그래서 Argon은 Astra의 표준 등급보다 입력에서 5배, 출력에서 5배 더 저렴하며, 272K 초과 입력에서는 10배 더 저렴합니다. 두 가지 독립적인 비용 측정은 다른 방향에서 같은 점을 보여줍니다: Artificial Analysis는 Argon을 인덱스 작업당 $1.99, Astra를 $3.26로 산정하고, 전체 인덱스를 실행하는 비용은 Argon이 $2,407, Astra가 $5,324라고 봅니다. 작업당 비율은 DeepSeek과 비교했을 때와 같은 이유로 토큰당 비율보다 작습니다 — Argon은 작업을 끝내는 데 더 적은 토큰을 사용합니다 — 하지만 여전히 1.6배입니다.

Vals의 GDP 가중 리더보드는 같은 이야기의 세 번째 버전을 들려준다: Argon이 68.90%와 실행당 $15.68로 1위, Astra가 63.13%와 $18.46로 6위다. Astra는 더 비싸고 그곳에서는 더 낮은 점수를 받는다. Google의 자료는 가격이 도입 요금(introductory rate)이라고 분명히 밝히고 있는데, 이는 변할 수 있다는 뜻을 지닌 표현이며, 솔직히 해석하자면 Argon의 가격 우위는 실재하지만 그 영속성은 보장되지 않는다.

벤치마크보다 더 많은 것을 좌우하는 두 가지 아키텍처 사실

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst describing frontier performance across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

출력 상한부터 살펴보겠습니다. Gemini 4 Argon은 단일 트라젝터리에서 최대 1,000,000 토큰을 생성합니다 — Google의 발표에서는 이를 이전 세대의 64K에서 확장된 것으로 강조합니다. GPT-6 Astra는 128,000이 상한입니다. 두 모델 모두 컨텍스트 윈도는 약 100만 토큰을 유지하므로, 이는 순전히 모델이 한 번에 얼마나 많이 쓸 수 있는지에 관한 문제입니다. 장문 생성, 전체 패치 코드 변경 또는 단일 패스 문서 초안 작성의 경우, 단일 호출로 생성할 수 있는 양에서 8배 차이입니다. 채팅, 추출 및 짧은 에이전트 단계에서는 두 상한 모두 사실상 무한하며, 그 차이로 인해 손해 볼 것은 없습니다.

모달리티는 두 번째 항목인데, 여기서는 한 가지 측면에서 이점이 반대 방향으로 흐릅니다. GPT-6 Astra는 텍스트, 이미지, 파일을 입력으로 받습니다. Gemini 4 Argon은 텍스트, 이미지, 동영상, 파일을 입력으로 받으며, Google의 출시 자료는 특히 장시간 동영상 이해를 강조합니다. 벤더가 보고한 LVBench 수치 91.7%입니다. 여러분의 파이프라인이 동영상을 입력으로 처리한다면 Astra는 대체재가 아닙니다. Argon의 공개된 모달리티 목록에도 오디오는 명시되어 있지 않으므로, 이번 업그레이드가 오디오를 지원한다고 가정하지 마십시오.

실제로 해야 할 일

Astra는 사용 가능하고 Argon은 사용할 수 없으며, 이는 다음 달 대부분의 결정을 사실상 정리해 준다. 헛수고를 없애는 구체적인 경로는 이것이다: 워크로드에 뛰어난 과학적 정확성과 입증된 에이전트 수행 실적을 갖춘 상시 작동 추론 모델이 필요하다면 GPT-6 Astra를 기반으로 구축하고, 구성에는 모델 이름을 유지하며, 낙관이 아니라 Astra의 측정된 동작을 기준으로 클라이언트 타임아웃을 설정하라 — 5분짜리 첫 토큰 실행은 기본 60초 타임아웃에 걸리고, 300초에 끊기는 스트림은 장애처럼 보인다. 272K 입력 토큰을 초과하는 구간에서 비용에 민감하다면, 커밋하기 전에 가격 재조정을 명시적으로 모델링하라. 왜냐하면 그 단계는 하나의 경계에서 입력을 두 배로 만들고 출력을 50% 인상하기 때문이다.

A capture of the OrcaRouter model page for OpenAI: GPT-6 Astra, showing the OpenAI provider, a release date of 2026-09-04, a 1,050,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $10.00 input / $50.00 output per million tokens.

흥미로운 중간 경로는 기본값을 하나만 골라야 하는 것은 아니라는 점입니다. Astra와 Argon은 — Argon이 출시되면 — 같은 부류의 작업을 겨냥한 같은 형태의 모델이므로, 같은 자리를 두고 경쟁하는 관계라기보다 자연스러운 페일오버 파트너가 됩니다. OrcaRouter에서, openai/gpt-6-astra는 제공업체 정가에 마크업 없이 라이브 상태이며, 200개 이상의 다른 모델과 동일한 OpenAI 호환 엔드포인트를 통해, 제공업체 간 자동 페일오버와 하나의 키로 프라이머리-백업 구성을 표현할 수 있는 라우팅 DSL을 제공합니다. Argon이 Google이 공개하는 어떤 ID로든 카탈로그에 합류하면, 전환은 문자열 하나입니다 — 두 번째 계약도, 통합 작업도, 그동안 Astra를 기반으로 구축한 무엇을 재구축할 필요도 없습니다.

무엇이 그 동점을 영구적으로 깨뜨릴까?

초기 도입 기간 이후 공개된 Argon 가격, 그리고 Google의 에이전트 관련 주장에 대한 독립적 재현 — 77.9%라는 DeepSWE v1.1 수치와 68%라는 CWE-bench v1 결과는 둘 다 공급업체가 보고한 것이며, 어느 쪽도 외부 실행이 뒷받침하지 않는다. 둘 중 어느 것이든 Argon을 상당 폭 올리거나 내릴 수 있는데, 0.11포인트의 지수 우위는 비용 우위가 일시적인 것으로 드러날 경우 1.6배의 비용 열위를 상쇄할 완충이 아니며, Google이 초기 요금을 유지하고 Astra의 롱컨텍스트 티어가 프로덕션에서 예상보다 더 강하게 작용한다면 그것은 부족도 아니기 때문이다.

당장은: 측정된 일반 역량에서 이 둘은 두 개의 래퍼에 담긴 같은 모델이다. Astra는 라이브 경로가 있고, 가격 단계가 알려져 있으며, 5분간 사고를 멈추는 쪽이다. Argon은 더 저렴한 카드를 쓰고 엔드포인트가 없는 쪽이다. 이 동점은 실재하며, 그 한쪽은 구매할 수 있다.