히어로 타이틀 카드에는 "Gemini 4 Argon vs GPT-6 Sol — 가격은 5분의 1, 청구서는 4배"라고 적혀 있고, 칩에는 "Argon $2 / $10", "Sol $2 / $10", "인덱스 작업당 비용 $1.99 vs $1.05"라고 표시되어 있으며, 하단 줄에는 "Argon 수치는 벤더 보고 기준; 인덱스 수치는 Artificial Analysis 기준, 2026-10-01 확인."이라고 적혀 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

Gemini 4 Argon vs GPT-6 Sol: 가격은 5분의 1, 청구서는 4배

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Gemini 4 Argon에서 Artificial Analysis 인덱스 스위트를 실행하면 $2,407이 청구된다. 동일한 스위트를 GPT-6 Sol에서 실행하면 $1,546이 청구된다. 같은 인덱스, 같은 작업, 같은 주다. 두 모델의 정가는 동일하다 — 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $10.00이며, Argon은 Go​ogle이 제시한 도입 요금이고 Sol은 Open​AI의 상시 요금이다 — 그런데도 동일한 작업을 수행하는 최종 비용은 5점 더 낮은 점수를 받은 모델에 유리하게 56%나 차이가 난다. 그 격차야말로 이 비교를 쓸 가치가 있는 이유의 전부이며, 이는 요금표와는 아무 관련이 없다.

구글은 2026년 9월 30일에 Gemini 4 Argon을 발표하며 최전선 지능의 다음 시대라고 불렀고, 입력 $2, 출력 $10, 캐시된 입력 95% 할인으로 책정했으며, Fairwind Program을 통해 신뢰할 수 있는 사이버 방어자들에게 순차 제공하고 있다. GPT-6 Sol은 2026년 9월 22일부터 일반 제공되었는데, 당시 OpenAI가 GPT-6 라인의 중간 계층을 입력 $2, 출력 $10, 90% 캐시 할인으로 출시했다. 하나는 오늘 OpenAI 호환 엔드포인트에서 구매할 수 있고, 다른 하나는 특정 지정 집단 외에는 누구도 구매할 수 없으며, 이것이 이 글에서 실질적인 갈림길이다. 그러나 위의 비용 역전은 가용성을 완전히 제쳐두어도 여전히 유효하며, 그 이유를 이해하는 것이 유용한 부분이다.

쉽게 말한 반전

Artificial Analysis는 Intelligence Index와 해당 지수를 운영하는 데 든 비용에 대한 회계를 모두 공개합니다. 함께 읽으면 이렇게 말합니다:

• Intelligence Index — Gemini 4 Argon 52.6 대 GPT-6 Sol 47.5. 5점 격차이며, Argon은 high 노력 설정으로, Sol은 max 설정에서 측정했기 때문에 이 비교는 Argon보다 Sol에 관대합니다.

• 백만 토큰당 정가 — 동일합니다. 두 제품 모두 입력 $2.00 / 출력 $10.00입니다. 캐시 읽기가 유일한 차이점입니다: Argon은 $0.10, Krypton은 $0.20입니다.

• 인덱스 작업당 비용 — Gemini 4 Argon $1.99, GPT-6 Sol $1.05. Argon은 토큰당 비용은 같지만 작업당 비용은 약 두 배다.

• 전체 스위트를 실행하는 비용 — Gemini 4 Argon $2,407 대 GPT-6 Sol $1,546.

• 측정된 출력 속도 — GPT-6 Sol은 초당 77.0토큰, Gemini 4 Argon은 48.9토큰으로, 1.6배 차이가 지연 시간과 비용 모두에서 나타난다.

그 목록에는 다른 모든 항목을 설명해 주는 한 줄이 있는데, 그것은 가격이 아니다. 그것은 토큰 수다. 인덱스 자체의 작업에서 Gemini 4 Argon은 작업당 약 561,000개의 출력 토큰을 생성했고, GPT-6 Sol은 약 282,000개를 생성했다. Argon은 같은 질문에 답하기 위해 두 배로 오래 생각하며, 토큰당 요율이 동일하다면 청구서도 정확히 두 배가 된다.

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Sol. The Gemini 4 Argon column reads: AA Intelligence Index 52.6, price $2 in / $10 out per million tokens, cost per index task $1.99, output tokens per task 561K, output speed 48.9 tok/s, max output 1M tokens. The GPT-6 Sol column reads: AA Intelligence Index 47.5, price $2 in / $10 out, cost per index task $1.05, output tokens per task 282K, output speed 77.0 tok/s, max output 128K tokens. A footer line reads that the prices are vendor list prices and the index figures are per Artificial Analysis, read 2026-10-01.

왜 토큰이 가격인가

이것은 누군가 마이그레이션 예산을 편성하기 전에 내면화할 가치가 있는 교정이다. 왜냐하면 직관은 잘못된 방향으로 작동하기 때문이다. 어떤 모델이 경쟁 모델과 같은 가격으로 책정되어 있고 작업을 끝내는 데 두 배의 출력 토큰을 소비한다면, 토큰당 가격이 실제 가격은 아니다. 실제 가격은 토큰당 가격에 그 모델이 사용하기로 결정한 토큰 수를 곱한 값이며, 그 두 번째 요인은 요금표가 아니라 모델의 속성이다.

작업별 마진은 엄청나게 다르게 나타나는데, 이는 상황을 더 나쁘게 만듭니다 — 일률적인 배수를 적용하고 넘어갈 수는 없습니다:

• Terminal-Bench 4.0 — Argon은 작업당 출력 토큰이 165,330개인 반면 Sol은 97,372개입니다. 여기서 Argon은 작업당 $6.78로 Sol의 $4.00보다 비용이 더 많이 듭니다. Argon이 57.1%를 기록해 Sol의 43.9%를 앞서는데도 말이죠.

• CritPt — Argon 109,533 토큰 대 Sol의 31,848. Sol이 실제로 더 높은 점수를 기록하는 작업에서 3.4배의 토큰 비율, 30.9% 대 27.1%.

• GDPval — Argon 74,571 토큰 대 Sol의 41,567, 작업당 $1.82 대 $1.32.

• Omniscience — 938 대 2,662 토큰 비율에서 Argon의 우위, Sol의 $0.027에 비해 작업당 $0.010. 방향이 뒤집히는 유일한 작업군.

• 장문맥 추론 — Argon 2,197 토큰 대 Sol의 954 토큰이며, 이 제품군에서 Sol이 점수로 확실히 앞서는 유일한 과제로 83.7% 대 79.7%다.

CritPt가 더 시사하는 바가 크다. 같은 질문에서 약간 더 나쁜 답을 내놓기 위해 토큰을 3.5배나 태우는 모델은 역량에 관한 이야기가 아니라 지출 습관에 관한 이야기다. Argon의 추론은 길게 이어지는데, 어떤 과제 형태에서는 그 길이가 점수로 전환되고 다른 과제에서는 그저 달러로 전환된다. 이 지수의 52.6과 Sol의 47.5는 총합이며, 총합은 바로 이 점을 가린다.

다섯 가지 점은 실제로 어디에서 비롯되는가

인덱스 격차와 비용 격차가 서로 반대 방향을 가리키므로, 각각을 주도하는 작업이 무엇인지 알아 둘 가치가 있습니다.

• Terminal-Bench 4.0 — Gemini 4 Argon 57.1% 대 GPT-6 Sol 43.9%. Argon의 가장 큰 단일 승리이자, 장기 지평(long-horizon) 에이전트 코딩에 가장 가까운 작업군입니다.

• 전지성 — Gemini 4 Argon 42.4 대 GPT-6 Sol 27.1. 사실 커버리지에서 15포인트 차이로, 이 스위트에서 가장 큰 상대적 격차입니다.

• AutomationBench-AA — Gemini 4 Argon 77.5% 대 GPT-6 Sol 61.6%.

• SciCode — Gemini 4 Argon 61.8% 대 GPT-6 Sol 57.6%.

• Humanity's Last Exam — Gemini 4 Argon 57.1% 대 GPT-6 Sol 47.9%.

• GDPval — Gemini 4 Argon 1,611 대 GPT-6 Sol 1,487.

• ApexAgents / AA-Briefcase — GPT-6 Sol의 1,482.78 Elo 대 Argon의 1,493.84, 11점 차이는 공개된 신뢰 구간 안에 들어가므로 무승부로 판정해야 한다.

• 장문맥 추론 — GPT-6 Sol 83.7% 대 Gemini 4 Argon 79.7%. Sol이 거둔 확실한 단 한 번의 승리.

• CritPt — GPT-6 Sol 30.9% 대 Gemini 4 Argon 27.1%. Sol이 또다시 근소하게 승리했습니다.

그러니까 구도는 'Argon이 더 낫다'가 아니다. Argon은 출시 자료에서 앞세운 두 가지, 즉 엔드투엔드 비즈니스 작업 실행과 장기적 소프트웨어 엔지니어링에서 더 뛰어나고, Sol은 학술적 색채가 강한 추론 사다리와 긴 컨텍스트 전반에서 일관성을 유지하는 면에서 동등하거나 앞선다는 것이다. 워크로드가 400K 토큰 프롬프트를 사용하는 검색 파이프라인인 독자에게 Sol은 동시에 더 나은 모델이자 더 저렴한 모델이며, 이는 흔치 않게 편안한 위치다.

벤치마크 논의보다 오래 지속되는 명세 차이

• 최대 출력 — Gemini 4 Argon: 단일 트래젝터리에서 1,000,000 토큰. Google은 이를 업계 최대 규모이자 이전 세대의 64K 한도에서 증가한 수치라고 설명합니다. GPT-6 Sol: 128,000 토큰.

• 컨텍스트 윈도우 — GPT-6 Sol의 벤더 카드에는 약 1,050,000 토큰으로 기재되어 있고, Argon은 1,000,000입니다. Artificial Analysis는 자사 하네스를 통해 Sol을 872,000 토큰으로 측정했는데, 이는 하네스 측정치이지 카드 기재 수치가 아닙니다. 카드는 사양으로, 하네스 수치는 평가자가 실제로 실행한 값으로 취급하십시오.

• 입력 모달리티 — 둘 다 텍스트, 이미지, 파일을 입력으로 받는다. Argon의 출시 자료는 또한 장시간 비디오 이해에 기대고 있으며, 여기서 Google은 LVBench에서 91.7%를 기록했다고 주장하고 이를 최첨단이라고 설명한다. 이는 벤더가 보고한 수치이며, 아직 이를 재현한 독립적인 평가 기관은 없다.

• 비디오 입력 — 약함. Artificial Analysis는 Argon을 비디오 입력이 비활성화된 상태로 차트에 올리고 출시 시 비디오를 명시적으로 언급하지만, Sol의 카드에는 비디오가 전혀 나열되어 있지 않습니다. 비디오가 파이프라인에서 핵심적인 역할을 한다면, 어느 카드도 이를 확정해 주지 않으므로 아키텍처를 설계하기 전에 테스트해야 합니다.

• 추론 노력 — Sol은 API에서 구성 가능한 추론 노력(없음부터 최대까지, 기본값은 중간)을 노출하며 최대 설정으로 차트에 올랐습니다. Argon은 높음 설정으로 차트에 올랐습니다; 아무도 동일한 스위트를 최고 설정에서 공개하지 않았습니다.

100만 토큰 출력 상한은 예산이 아니라 아키텍처를 실제로 바꿀 수 있는 요소입니다. 현재 128K 상한 아래에 머무르기 위해 십여 개의 연쇄 호출로 쪼개는 모든 작업 — 여러 파일 패치 세트, 전체 감사 보고서, 긴 문서를 한 번에 처리 — 은 하나의 호출이 되고, 에이전트 루프가 상태를 잃을 지점도 줄어듭니다. 그게 작업당 두 배 비용의 가치가 있는지는 전적으로 그런 워크로드가 있느냐에 달려 있습니다. 있다면 아마 가치가 있을 겁니다. 호출이 분류하고 반환하는 게 전부라면, 아무도 차지하지 않을 여유 공간에 돈을 쓰는 셈입니다.

아무도 따라잡지 못한 노력 설정, 그리고 그것이 중요한 이유

한 가지 유의점은 별도 문단으로 다룰 가치가 있습니다. 왜냐하면 이는 5점 지수 격차를 순수한 역량 차이로 해석하는 것에 반하기 때문입니다. Artificial Analysis는 Gemini 4 Argon을 high 추론 노력 설정에서, GPT-6 Sol을 max에서 측정합니다. 이 둘은 두 사다리에서 같은 단계가 아니며, 이 불일치의 방향은 흥미롭습니다: Sol은 가장 비용이 많이 드는 설정에서, Argon은 중간 정도의 설정에서 실행되었습니다.

두 가지 해석이 이어지는데, 데이터로는 둘을 구분할 수 없다. Argon이 최대일 때 52.6보다 높은 점수를 받을 수도 있지만 — 작업당 561,000개가 넘는 토큰을 소모하고 $1.99보다 더 많은 비용이 들 수도 있다 — 아니면 점수가 거의 비슷할 수도 있는데, 그렇다면 이 스위트에서는 노력 다이얼이 별로 하는 일이 없다는 뜻이다. 이를 판가름하는 공개된 실행은 없다. 52.6을 Argon의 상한이라고 인용하는 사람은 모델이 아니라 구성을 인용하는 것이며, 그 구성은 벤더가 가장 먼저 공개하기로 선택한 구성이다.

같은 논리가 Sol의 47.5에도 적용되지만, 방향은 반대입니다: max는 해당 라인업의 최상단이므로, 이 수치는 바닥이라기보다 천장에 가깝습니다. 같은 노력으로 하는 공정한 대결은 격차를 좁힐 수 있고, 비용 비교를 뒤집을 수도 있습니다. 왜냐하면 max가 소비하는 토큰이 바로 백만 개당 $10의 비용이 드는 토큰이기 때문입니다.

실제 답을 결정하는 가용성 분기

Gemini 4 Argon은 일반 공급되지 않습니다. Google의 발표에 따르면 이 모델은 Fairwind Program을 통해 한 무리의 신뢰할 수 있는 사이버 방어자들에게 순차 제공되고 있으며, 회사는 미국 정부의 자발적 사전 출시 모델 접근 프로세스에 참여하고 있고, 개발자, 기업 및 소비자에 대한 일반 접근은 유료 API 고객과 Google AI Ultra 구독자부터 시작해 "가능한 한 빨리" 제공될 것이라고 합니다. 모델 식별자도, 엔드포인트도, 할당량도, 날짜도 없습니다. 우리 것을 포함해 어떤 공개 API에도 없습니다 — 카탈로그를 확인하면 404가 뜹니다. 아직 거기에 존재하지 않기 때문입니다.

GPT-6 Sol은 호출 가능한 제품입니다. OrcaRouter에서는 openai/gpt-6-sol로, 카탈로그에 있는 다른 200개 이상의 모델과 동일한 OpenAI 호환 엔드포인트에서 마크업 없이 OpenAI 정가 그대로 제공되므로, 위의 $2/$10과 272,000토큰 롱컨텍스트 구간의 $4/$15는 요율표가 주장하는 값이 아니라 실제로 지불하는 금액입니다. 제공자 간 자동 페일오버는 실행 중 경로가 저하되는 경우를 처리하며, 라우팅 DSL을 사용하면 하나의 애플리케이션이 두 번째 SDK 없이 값싼 분류 트래픽은 더 작은 모델로, 어려운 추론 트래픽은 Sol로 보낼 수 있습니다.

A capture of the OrcaRouter model page for openai/gpt-6-sol, listed by OpenAI with a 2026-09-22 date, a 1M-token context window, a 128K-token maximum output, text, image and file input, and pricing of $2.00 per million input tokens and $10.00 per million output tokens.

그 마지막 구성이 대부분의 팀에게 이 비교에 대한 정직한 답이다. Argon에 유리한 비용 논거는 실재하지만, 장기 호라이즌 에이전트 작업이 지배하는 워크로드에 한해 조건부로 성립한다. Argon에 반대하는 비용 논거는 다른 모든 워크로드에서 실재한다. 그리고 어쨌든 이번 달에는 Argon을 살 수 없다. 비용이 적게 드는 선택은 지금 평가 하네스를 구축하는 것이다 — 여러분의 자체 프롬프트, 자체 채점, 몇 가지 에포트 설정에서 Sol을 상대로 실행 — 그래야 Argon이 유료 API 고객에게 도달했을 때, 다른 모든 이가 리더보드로 답하게 될 질문에 대해 여러분은 측정된 답을 갖게 된다.

무엇이 그것을 해결할까요?

판정을 바꿀 수 있는 정도 순으로 세 가지다. Argon이 실제의, 도입용이 아닌 가격으로 정식 출시되는 것 — '도입용'이라는 말은 $2/$10이 움직일 수 있다는 뜻이고, Google 자체의 순서는 유료 API 고객을 먼저 두므로 출시 후 처음 공개되는 요금이 지켜볼 대상이다. Argon을 최고 effort 설정에서 실행한 Artificial Analysis 결과의 공개 — 이는 52.6이 천장인지, 아니면 천장에서 털끝만큼 모자란 것인지 알려줄 것이다. 그리고 DeepSWE v1.1 수치의 독립적 재현 한 건 — Google은 77.9%를 주장하며 이를 새로운 최첨단이라고 부른다. 오늘 현재 이는 공급업체가 보고한 수치이며 Google 외부에서는 재현되지 않았다.

그때까지 이 구분은 깔끔하고 약간 역설적이다. GPT-6 Sol은 검증이 더 잘 된 모델이고, 더 빠르며, 완료된 작업당 비용이 더 저렴하고, 오늘 오후에 바로 호출할 수 있는 모델이다. Gemini 4 Argon은 해당 공급업체가 공개하기로 선택한 리더보드에서 더 높은 점수를 받은 모델이고, 실제로 사용하기에는 비용이 대략 두 배 더 들며, 아직 판매되지 않는다. 둘 중 하나를 선택하는 것은 역량에 대한 판단이 아니다. 그것은 그 두 문장 중 어느 것이 당신의 이번 달을 설명하는지에 대한 판단이다.

A capture of the Artificial Analysis model page for Gemini 4 Argon (High), dated September 2026 and credited to Google, marked a proprietary model. It reports an Artificial Analysis Intelligence Index score of 53, pricing of $2.00 per million input tokens and $10.00 per million output tokens with a 95% cache discount, an average cost of $1.99 per task on the Intelligence Index, a 1M-token context window, and text and image input.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트