
FrontierSWE에서의 Gemini 4 Argon: “유레카!”를 외치고는 자기 숙제를 스스로 채점한다
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 261 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 216 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- xAISpaceXAI: Grok 4.62026-08-1244지능77코딩
Gemini 4 Argon에는 성격 문제가 있고, 이는 Google이 2026-09-30에 이 모델을 발표한 이후 누군가 이 모델에 대해 한 말 중 가장 흥미로운 것이다. 초장기(long-horizon) FrontierSWE 벤치마크에서 GPT-6 Astra와 Claude Opus 5.5에 이어 3위를 차지한 이 모델은 평가자들에게 기억에 남는 인상을 남겼다: 가장 좋아하는 단어는 “유레카!”이고, 20시간의 작업 예산 중 상당 부분을 스스로에게 극도로 엄격하게 굴며 보낸다. 이는 벤치마크 운영자가 전한, 유출에 가까운 단일 출처 관찰이며, 공급업체의 주장도 릴리스 노트도 아니다. 그리고 이것이 무엇을 말해주고 무엇을 말해주지 않는지 정확히 짚을 가치가 있다. 위 세 모델 중 어느 것에도 Argon의 GA 날짜는 붙어 있지 않다. 이 관찰은 하네스 내부의 행동에 관한 것이며, 여기에 딸린 수치들은 Google이 스스로 운영하지 않는 벤치마크에서 Argon을 측정한 첫 독립적 결과다.
「유레카!」라는 말이 실제로 무엇인지
출처는 모델 평가를 담당하는 엔지니어 @nrehiew_가 2026년 9월 30일에 게시한 글로, 순다르 피차이의 Gemini 4 Argon 발표를 인용한 것입니다. 핵심 내용은 세 가지 주장입니다. Argon은 그들이 FrontierSWE에서 평가한 모델 중 가장 재미있는 모델이고, 가장 좋아하는 단어는 "Eureka!"이며, 극도로 자기비판적이라는 것입니다. 게시자는 Argon을 이전 Gemini들에 비해 크게 개선되었으면서도 그 개성은 그대로 유지하고 있다고 설명하며, 인상적이라고 평합니다.
그것을 주의 깊게 읽으세요. 지나치게 확대 해석하기 쉽기 때문입니다. 그것은 한 평가자가 에이전트 트레이스를 지켜보고 얻은 인상일 뿐이며, 점수화된 결과도, 공개된 지표도, FrontierSWE를 만들고 운영하는 Proximal Labs가 하나의 발견으로 이름을 걸고 내놓은 것도 아닙니다. 리더보드에는 "자기비판" 칸 같은 것은 없습니다. 그 발언이 글을 쓸 가치가 있는 이유는 그것이 권위 있기 때문이 아니라, 구글 외부의 누군가가 Argon에 대해 내놓은 유일한 정성적 해석이기 때문이며, 그 모델이 일반적으로 이용 가능하지 않기 때문에 이런 트레이스들이 현재 그 모델이 작동하는 모습을 볼 수 있는 유일한 방법이기 때문입니다.
이것은 또한 Argon을 에이전트로 실행하려는 사람이라면 누구나 직면하는 실제 질문을 건드린다. 장기 호라이즌 코딩 실행은 대부분 예산 관리 문제다. 재고하기 위해 스스로를 중단하고, 자신의 중간 작업을 평가하며, 돌파구를 알리는 모델은 프로세스에 토큰을 쓰는 모델이다. 그것이 강점인지 비용인지는 전적으로 자기 비판이 수렴하는지 루프에 빠지는지에 달려 있다. 단일 평가자가 "인상적"이라고 말하는 것은 답이 아니라 하나의 데이터 포인트다.
FrontierSWE v2, 그리고 3위 성적이 진짜 이야기인 이유
FrontierSWE는 헤드라인 숫자 하나만 보고 판단할 수 있는 종류의 벤치마크가 아니다. Proximal Labs가 만들었고, 해당 저장소에서 구현, 성능 엔지니어링, ML 연구를 테스트하는 초장기 지평(ultra long-horizon) 코딩 에이전트 벤치마크라고 설명하고 있다. 버전 2는 2026년 9월에 기존 세트에 21개의 새 태스크를 더해 총 34개로 출시되었으며, 에이전트가 최대 20시간 동안 계속 작업할 것을 기대한다. 모든 것은 Proximal 자체 하네스인 proximus를 통해 실행되는데, 이는 mini-swe-agent를 기반으로 구축되어 컨텍스트 압축, 비전, 명시적 제출 도구를 추가한 것이다. 채점은 mean@5 — 태스크당 다섯 번 시도의 평균 — 이며, 보고되는 불확실성 구간은 각 태스크의 최악 실행 평균부터 최선 실행 평균까지에 걸쳐 있다.
그 방법론은 Argon의 행을 정직하게 읽는 데 중요합니다:
• 점수 — Gemini 4 Argon 55.0% mean@5, ±9.9, GPT-6 Astra 65.5% 및 Claude Opus 5.5 62.3% 대비
• 분포 — Argon의 실행 범위는 44.5%(worst@5)에서 64.3%(best@5)까지로, 이 범위는 상단에서 Opus 5.5의 52.0%–71.5%와 겹치고 Astra의 55.1%–73.0%와는 전혀 겹치지 않습니다.
• 시험당 비용 — Argon $129.36, Opus 5.5 $98.87, Astra $1,029.65
• 시험당 실제 경과 시간 — Argon 10.6시간, Opus 5.5 14.2시간, Astra 12.1시간
가장 먼저 눈에 띄는 것은 Argon이 3위이고 점수에서 2위와 가깝지 않다는 점이다. 두 번째로 — 당신이 신경 써야 할지를 결정해야 하는 것 — 은 이 벤치마크에서 Argon이 Claude Opus 5.5에게 완전히 압도된다는 점이다. Opus 5.5는 더 높은 점수(62.3% 대 55.0%)를 받았고 시도당 비용은 더 적었다($98.87 대 $129.36). 여기서 Argon이 이기는 축은 없다. 그것의 유일한 장점은 시간이다: Opus 5.5의 14.2시간에 비해 10.6시간이며, 이는 토큰이 아니라 실제 경과 시간에 비용을 지불하는 경우라면 실질적인 이점이고, 시도당 예산에 비용을 지불하는 경우라면 무관하다.
Proximal 자체 리더보드에는 Argon 행에 대해 이 수치를 인용하는 모든 사람이 되풀이해야 할 각주가 달려 있습니다: "Gemini 4 Argon: 캐시 적중률은 비프로덕션 설정 때문에 훨씬 낮습니다." 이는 평가자들이 Argon을 프로덕션 배포에서 사용할 구성이 아닌 환경에서 실행했음을 표시한 것으로, 이는 비용을 부풀리고 지연 시간도 부풀렸을 가능성이 있습니다. 특히 이는 비용 수치에 대한 유의 사항이며, $129.36을 요금표가 아니라 상한으로 읽어야 하는 이유입니다.
구글 자체 차트가 보여주지 않는 숫자
여기서부터 출처 확인이 진짜 흥미로워지며, 이 결과에 관한 대부분의 기사가 틀리는 지점이기도 하다. 구글의 발표 글에는 FrontierSWE v2 행이 포함된 벤치마크 차트가 있다. 그 행에는 GPT-6 Astra 65.5%, Claude Fable 5.1 56.3%, Claude Opus 5.5 62.3%라고 적혀 있다. Gemini 4 Argon은 거기에 없다. Proximal의 실시간 리더보드에는 Astra가 65.5%, Opus 5.5가 62.3%로 — 같은 수치다 — 하지만 Claude Fable 5.1은 56.3%가 아니라 56.5%로 적혀 있고, Gemini 4 Argon은 55.0%로 올라와 있다.
누락된 이유는 신비롭지 않으며, Google도 스스로 그렇게 말한다: 그들의 평가 스위트에 딸린 방법론 노트에는 FrontierSWE 결과가 Proximal의 공식 공개 리더보드에서 보고된다고 명시되어 있다. Google은 이 벤치마크를 자체 계산하지 않았다. 그들은 우리와 동일한 제3자를 인용하고 있으며, 그 제3자가 공개하는 유일한 Argon 수치는 55.0%이다. 따라서 정직한 해석은 Argon의 FrontierSWE 점수가 진정으로 독립적인 측정치라는 것 — Proximal이 그들의 하네스에서, 그들의 과제로 그것을 실행했다 — 이며, 그것이 Argon을 두 경쟁자 뒤에 위치시킨다는 것이다.
Google 차트의 나머지 모든 항목은 벤더가 보고한 것이므로 머릿속에서는 그렇게 표시해야 한다: Vals Index에서 Argon 63.1% 대 Opus 5.5의 67.0%, AutomationBench에서 41.4% 대 Opus 5.5의 42.5%, Vibe Code Bench에서 89.6% 대 Astra와 Opus 5.5 둘 모두의 90.3%, LVBench에서 87.5% 대 83.7%, CWE-bench v1에서 68.0% 대 Opus 5.5의 67.0%. 이는 Google이 선택한 평가를 Google이 실행한 결과다. 그 그림에서 독자가 독립적으로 확인할 수 있는 유일한 항목은 FrontierSWE 행이며, 바로 그렇기 때문에 3위라는 결과가 그 주변의 동점 또는 근소한 승리 패턴보다 더 큰 무게를 지닌다.
Artificial Analysis가 독립적으로 말하는 것
FrontierSWE는 하나의 렌즈입니다. Artificial Analysis는 또 다른 렌즈이며, 이야기의 윤곽과 일치합니다. 그들의 Intelligence Index v4.3.2에서 Gemini 4 Argon은 높은 추론 구성에서 52.56점을 기록합니다 — 자체 하드웨어에서 독립적으로 측정된 것이며 Google이 보고한 것이 아닙니다 — 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $10.00의 정가에, 캐시된 입력 95% 할인이 적용됩니다. 그들의 계측에 따르면 단일 지수 작업 비용은 $1.99입니다.
중요한 비교는 FrontierSWE가 제시한 것과 동일하다. Claude Opus 5.5는 high 구성에서 지수 53.58로 더 높은 점수를 기록했고, 작업당 비용은 $1.82로 더 낮았다. 서로 다른 작업과 서로 다른 하네스를 사용한 두 독립 평가자는 품질과 비용 모두에서 Argon을 Opus 5.5보다 뒤에 두었다. 이는 단일 벤치마킹 인공물이 아니라 일관된 신호이며, 현재 Gemini 4 Argon의 경제성에 대해 할 수 있는 가장 강력한 진술이다.

발표된 것이지, 출시된 것은 아니다 — 그리고 그런 표현 방식이 왜 현학적인 잔소리가 아닌지
Gemini 4 Argon 모델 ID는 존재하지 않습니다. 접근 권한은 Fairwind Program을 통해 검증된 사이버 방어자들에게 단계적으로 제공되고 있으며, 유료 API 고객과 Google AI Ultra 구독자에게도 단계적으로 개방되고 있습니다. 일반 제공일은 공개되지 않았습니다. Google의 게시물은 모델과 일련의 평가에 대한 발표이지, 호출할 수 있는 엔드포인트의 출시가 아닙니다. 이를 릴리스라고 설명한 보도를 읽었다면, 그 보도는 사실보다 앞서 나간 것입니다.
그 구분은 FrontierSWE 수치를 읽는 누구에게나 실질적인 함의를 지닙니다. 이 평가는 Proximal이 어떤 약정 아래 접근할 수 있었던 모델을 대상으로 실행되었습니다. 즉, 이는 여러분이 사용할 수 있는 것이 아니라 그 모델이 무엇을 할 수 있는지를 알려줍니다. 또한 성능 수치의 반감기가 평소보다 짧다는 뜻이기도 합니다. 아직 GA가 아닌 모델은 여전히 바뀔 수 있습니다. 디코딩 설정, 시스템 프롬프트, 도구 사용 기본값, 안전 스캐폴딩은 모두 아직 조정 중이며, Argon의 캐시 적중률이 낮았던 이유로 제시된 것은 바로 평가자들이 프로덕션 구성을 실행하지 않았기 때문입니다. 55.0%와 $129.36은 바뀔 것으로 예상하십시오.
이 그림을 바꿀 요소는 다음과 같다: 요금표가 함께 공개된 모델 ID, GA 날짜, 프로덕션 설정에서의 FrontierSWE 재실행, 그리고 3위 결과를 재현하는 두 번째 독립 평가자. 적어도 그중 처음 두 가지가 존재할 때까지는, Google 자체 차트에 있는 좋은 수치들을 포함해 모든 Argon 숫자를 잠정적인 것으로 취급하라.

성격 분석은 시간이 지나도 가장 잘 살아남을 부분이다
pre-GA 모델의 벤치마크 점수는 유효기간이 몇 주 단위로 측정된다. 하지만 행동 관찰은 그렇지 않다. 장기 지평(long-horizon) 에이전트 작업은 모델의 성격이 실제로 드러나는 지점이다. 34개 과제에 20시간이라는 예산은 모델의 성향이 누적되기에 충분한 밧줄이 되기 때문이다. 실패한 접근에서 어떻게 회복하는지, 재계획을 위해 멈추는지, 어려운 문제와 잘못된 방향 전환을 구분할 수 있는지 말이다. 이런 트레이스를 많이 지켜보는 평가자가 어떤 모델을 두고 스스로를 비판적으로 대하며 뭔가 잘 풀릴 때 감탄사를 내뱉는 경향이 있다고 묘사한다면, 그가 묘사하는 것은 자신의 진행 상황에 대한 추론을 외부로 드러내는 모델이다. 이것이 Argon의 실행 결과가 44.5%에서 64.3%까지 퍼진 이유에 대한 하나의 가설이다 — Opus 5.5보다 더 넓은 폭이다 — 그리고 모델을 호출할 수 있게 되면 검증할 수 있다.
그 발언의 나머지 절반은 바로 회의적으로 봐야 할 부분이다. "이전 Geminis보다 큰 개선"이라는 말은 이 벤치마크에서 이 하네스로 점수가 매겨진 적이 없는 모델들과의 비교이므로, 리더보드와 대조해 확인하는 것은 전혀 불가능하다. 그것은 인상일 뿐이며, 그것을 제시하는 사람이 아무리 믿을 만하더라도 인상으로 취급해야 한다.

오늘 실제로 장기 지평 에이전트가 필요하다면, 이 상황이 당신을 어디에 남기는가
Gemini 4 Argon이라고 부를 수는 없으므로, 실질적인 질문은 Argon 대 무엇이 아니라 Argon이 벤치마크된 작업에 어떤 모델을 실행해야 하는가입니다. FrontierSWE 자체의 순위가 그 답을 줍니다: GPT-6 Astra가 65.5%로 선두지만 시험당 $1,029.65로, 바로 아래 두 모델 비용의 약 10배이며, Claude Opus 5.5는 $98.87로 62.3%를 달성합니다. 이 벤치마크에서 가성비 선택은 Opus 5.5이며, 또한 작업당 더 낮은 비용으로 Artificial Analysis에서 Argon을 앞선 모델입니다.
두 모델 모두, 그리고 보드 상위 10위 대부분 — GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp, Muse Spark 1.2 등 — 은 OrcaRouter의 단일 API를 통해 라우팅할 수 있습니다 200개 이상의 다른 모델과 함께 말이죠 — 키 하나, 0% 마크업이므로 공급자의 정가가 곧 지불 가격이고, 벤더의 가격 인하는 같은 날 우리 쪽에도 반영됩니다. 이 마지막 특성은 GA 이전 모델에서 평소보다 더 가치가 있습니다. 지금부터 GA 사이에 Argon의 가격이 바뀐다면 — 비프로덕션 캐시 각주가 그럴 가능성을 시사합니다 — 그렇게 되어도 여러분의 통합에는 아무런 변화가 없기 때문입니다. 자동 페일오버는 이 특정 사례에 딱 맞는 또 하나의 요소입니다 — 아직 아무도 실패 모드를 파악하지 못한 낯선 모델이야말로 단일 하드코딩된 프로덕션 경로에 절대 두고 싶지 않은 바로 그것입니다.
한 가지를 분명히 하자면: Gemini 4 Argon은 우리 카탈로그에 없습니다. 공개 모델 API에서 google/gemini-4-argon을 조회하면 "model not found,"를 반환하며, 다른 누구도 이를 호스팅하지 않습니다 — 이는 모델 ID가 공개되지 않은 채 Google의 Fairwind Program에 의해 제한되어 있습니다. 호출 가능해지면 우리가 이를 라우팅할 것이며, 위의 FrontierSWE 수치는 그 모델을 기다리기보다 그날을 주시해야 하는 이유입니다. 그것이 밀린 모델들은 이미 그곳에 있습니다.
볼 만한 것
이것을 ‘지금까지 알아낸 바’에서 의사결정으로 바꿔 줄 신호들은 구체적이다. 공개된 모델 ID와 그 요금표. GA(일반 제공) 날짜. 프로덕션 설정에서의 FrontierSWE 재실행—이는 트라이얼당 $129.36 비용이 실제 요율인지, 아니면 Proximal이 지적한 캐시 구성의 아티팩트인지를 밝혀 줄 것이다. 그리고 이상적으로는 두 번째 평가자가 Argon 트레이스를 공개하여 ‘Eureka!’ 관찰이 더 이상 단일 표본에 그치지 않게 하는 것이다.
그때까지는, 정직한 요약은 좁지만 간직할 가치가 있다: Gemini 4 Argon이 발표되었고, 한 평가자에 따르면 장기 호라이즌 에이전트 트레이스에서 유난히 표현력이 뛰어나며, 우리가 확인할 수 있는 유일한 독립 벤치마크에서는 두 모델에 이어 3위를 기록했는데 — 그중 하나는 점수와 비용 모두에서 동시에 그보다 앞섰다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
