
GPT-6 Astra 대 Qwen3.8-Max: 두 에이전트 플래그십과 각각의 세부 조건
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
2026년 9월에는 두 가지 ‘에이전틱 플래그십’ 이야기가 있으며, GPT-6 Astra와 Qwen3.8-Max가 그 두 이야기의 주인공이다. OpenAI는 9월 3일 GPT-6 Astra를 컴퓨터 사용, 소프트웨어 엔지니어링, 과학, 사이버보안 분야에서 세계 최고라고 자사가 주장하는 모델로 출시했다. 알리바바의 Qwen3.8-Max는 8월 3일부터 출시된, 가장 강력한 중국 연구소의 에이전틱 플래그십이다. Artificial Analysis는 이 모델을 자체 에이전틱 지수에서 업계 최상위권으로 평가하며, 오픈 생태계에서 최첨단 자율 작업 주장에 가장 근접한 경쟁자로 꼽는다. 두 모델 모두 확실히 강력하며, 둘 다 면밀히 들여다보면 줄어드는 헤드라인 수치와 함께 판매된다. OpenAI의 99.9% ARC-AGI-3 결과는 ARC Prize가 자체 중립 하니스로 실행하면 62.7%로 떨어지고, Qwen3.8-Max의 에이전틱 탁월함에는 독립적으로 측정된 환각 성능 저하와 전임 모델이 14턴에 끝낸 작업에 64턴과 1달러 이상을 쓰는 습관이 따른다. 이것은 두 모델의 비교이자, 벤치마크를 읽는 두 가지 방식의 비교다.
그 두 헤드라인
OpenAI가 GPT-6 Astra의 강점으로 내세우는 것은 폭과 자율성입니다. 브라우저를 조작하고, 코드를 작성·수정하고, 과학적 분석을 실행하며, 독특하게도 새로운 보안 취약점을 발견할 수 있는 단일 모델로서, OpenAI는 자체 Preparedness Framework에 따라 전체 모델을 'critical'(치명적)로 평가하고 가장 강력한 설정은 검증된 파트너에게만 제한했습니다. 출시 자료는 ExploitBench에서 완벽한 100%, FrontierMath Tier 4에서 97.6%, GPQA Diamond에서 96.0%, ARC-AGI-3 포화 점수를 기록했다고 주장합니다. 반면 Alibaba가 Qwen3.8-Max를 내세우는 요점은 더 좁지만 분명합니다. $2/$6이라는 가격에 에이전트형 작업 중심 모델로서 독립적인 에이전트 평가에서 최상위권 또는 그에 준하는 점수를 기록하며, 기본 가중치를 블랙박스에 가두지 않고 (커스텀 라이선스 하에) 공개합니다.
독립 스코어보드가 말하는 바
Artificial Analysis는 현재 GPT-6 Astra(max)의 Intelligence를 61로 평가하며, 추적 중인 202개 모델 중 8위, Qwen3.8-Max는 Intelligence 58로 24위를 기록했다. 이 3점 차이는 가격 차이보다 작고, 두 업체의 마케팅보다도 작다. AA의 별도 agentic index에서 Qwen3.8-Max는 58을 기록하며 독점 프론티어 최고 수준과 어깨를 나란히 했지만, AA는 아직 GPT-6 Astra에 대한 agentic index를 발표하지 않았다. 솔직한 해석: 순수하게 측정된 지능에서 이 둘은 가까운 이웃이며, OpenAI 출시 자료에서의 "세계에서 가장 지능적인 모델"이라는 프레이밍은 AA의 독립 평가가 보여주는 것과 다르다.
• 지능 — GPT-6 Astra (최대): AA 지능 61, 순위 8/202. Qwen3.8-Max: AA 지능 58, 순위 24/202; AA 에이전트 58.
• 정가 — GPT-6 Astra: 1M당 $10.00 / $50.00, 캐시 읽기 $1.00, 272K 토큰 초과 시 입력 요금 2×. Qwen3.8-Max: 1M당 $2.00 / $6.00, 캐시 읽기 $0.25.
• 컨텍스트 / 출력 — GPT-6 Astra: 입력 1.05M / 출력 128K. Qwen3.8-Max: 입력 1M / 출력 ~128K.
• 에이전틱 증거 — GPT-6 Astra: ARC-AGI-3 99.9%(OpenAI 하네스) 대 62.7%(ARC Prize 표준 하네스); WANDR 0.682(태스크당 $11.98, Perplexity 보고). Qwen3.8-Max: AA GDPval 태스크당 64턴에서 Elo 1,739(태스크당 ~$1.14); Code Arena WebDev에서 1,691 Elo로 #1.
• 독립적 위험 신호 — GPT-6 Astra: 아직 ChatGPT 선택기에 없음, 단계적 API, 모니터링 가능성 인정. Qwen3.8-Max: 이전 세대 대비 AA-Omniscience 환각 회귀가 23%에서 40%로 증가.
• 가중치 — GPT-6 Astra: 비공개. Qwen3.8-Max: Max급 체크포인트(Qwen3.8-2.4T-A95B)로 8월 12일부터 커스텀 라이선스로 공개되었으며, AA는 여전히 호스팅 플래그십을 비공개로 표시합니다.

주석이 달린 세부 조항
ARC-AGI-3 수치부터 살펴보자. 숫자가 어떻게 동시에 사실이면서도 오해를 불러일으킬 수 있는지 보여주는 가장 깔끔한 예이기 때문이다. OpenAI는 자체 공급업체 어댑터 하네스 — 모델에 맞춰 조정된 설정 — 에서 GPT-6 Astra에 대해 99.9%를 보고했다. 벤치마크를 유지 관리하는 기관인 ARC Prize는 공급업체 중립 표준 하네스에서 GPT-6 Astra를 실행해 62.7%를 측정했다. 둘 다 최첨단 결과이지만, 어느 것도 모델 제작자가 통제하지 않는 하네스에서의 99.9%는 아니다. 같은 주의가 Perplexity의 WANDR 점수 0.682에도 적용된다. Perplexity가 기록한 최고 점수이지만, 동시에 GPT-6 Astra를 자사 제품에 통합하고 있는 회사가 측정했기에 상업적 이해관계가 얽혀 있다. 이 패턴은 이름 붙일 만하다. OpenAI의 가장 화려한 수치들은 모두 OpenAI 또는 파트너가 통제하는 하네스에서 나왔고, 완전히 독립적인 단 하나의 수치 — AA의 Intelligence 61 — 는 그저 우수할 뿐이다.
Qwen3.8-Max의 세부 사항은 반대를 말한다. 즉, 강점도 독립적으로 측정되었고 약점 역시 독립적으로 측정되었다. 1,739 Elo라는 GDPval 점수는 진짜다. 그러나 Artificial Analysis의 실행 결과, Qwen3.8-Max는 작업당 약 64턴과 약 1.14달러를 소비해 그 점수에 도달한 반면, 이전 세대는 14턴과 0.53달러를 사용했다. 이것은 노력 비용이다. 모델이 에이전트로서의 상한선을 추론 토큰으로 사들이는 셈이며, 토큰당 비용을 지불하는 모든 사람에게 중요한 문제다. 또한 AA의 Omniscience 평가에서는 이전 Qwen 세대 대비 할루시네이션 비율이 23%에서 40%로 후퇴한 것으로 측정되었다. 이는 확신에 찬 오답이 가장 큰 비용을 초래하는 자율적·다단계 워크로드에서 정확히 유효한 독립적 경고 신호다. 64턴에 걸쳐 스스로를 오류로 몰아가는 모델이, 제작사가 모니터링 가능성의 저하를 인정한 모델보다 더 안전하게 내놓을 수 있다고 보기는 어렵다.

가격, 배포, 그리고 정직하게 선택하는 방법
가격은 비교가 되지 않습니다. Qwen3.8-Max는 백만 토큰당 $2.00/$6.00으로 GPT-6 Astra 입력 가격의 5분의 1, 출력 가격의 8분의 1에 불과하며, Astra의 긴 프롬프트 추가 요금이 없는 100만 토큰 컨텍스트를 제공합니다. 배포 용이성에서도 Qwen3.8-Max는 이번 주 한층 더 유리합니다. 오늘 바로 호출할 수 있고, OrcaRouter에서 알리바바 정가로 라이브로 제공되며, 0% 마크업과 자동 장애 조치가 적용됩니다. GPT-6 Astra는 아직 출시가 진행 중이고 9월 4일 기준 대부분의 사용자가 ChatGPT에서 선택할 수 없지만, OpenAI 자체 API와 주요 클라우드 마켓플레이스를 통해 이미 이용할 수 있으며 접근 범위도 넓어지고 있습니다. 에이전틱 파이프라인을 구축하는 팀이 취할 실용적인 패턴은 오늘 호출할 수 있는 모델에 워크로드를 맡기고, 다른 모델은 지켜볼 벤치마크로 취급하는 것입니다. "에이전틱" 주장을 믿기보다 직접 평가하려면 라우팅 계층이 적합한 도구입니다. Qwen3.8-Max, Kimi K3, Grok 4.6 등 200개 이상의 모델이 OrcaRouter에서 하나의 키로 제공되고, 라우팅 DSL은 그중 여러 모델을 단일 호출로 조합할 수 있게 해줍니다. 따라서 두 공급업체의 세부 약관 중에서 고르는 대신, 경쟁 모델들을 대상으로 자체 작업 스위트를 실행하고 결과를 직접 읽을 수 있습니다.
이 매치업이 계속해서 제기하는 두 가지 질문
OpenAI가 ARC-AGI-3에서 99.9%를 보고하는데 ARC Prize는 62.7%로 측정하는 이유는 무엇일까? 둘은 동일한 테스트가 아니기 때문이다. OpenAI의 프로바이더 어댑터 하니스는 GPT-6 Astra가 프로덕션 환경에서 호출되는 방식에 맞게 구성된 벤치마크 버전이고, ARC Prize의 표준 하니스는 모든 모델을 공정하게 비교하도록 설계된 중립적 구성이다. 62.7%라는 결과는 "내가 이 모델을 직접 호출하면 어떤 일이 벌어지는가"에 일반화되는 수치이며, 여전히 ARC Prize가 해당 하니스에서 기록한 최고 점수다.
Qwen3.8-Max는 오픈 가중치(open weights) 모델인가요? 부분적으로 그렇습니다. 단, 라이선스 조건이 있습니다. 알리바바는 8월 12일 Max급 체크포인트인 Qwen3.8-2.4T-A95B를 커스텀 라이선스로 공개했습니다. 가중치는 다운로드할 수 있지만, 더 작은 Qwen3.8-27B의 Apache-2.0 방식 개방성과는 다릅니다. 또한 Artificial Analysis는 호스팅된 플래그십 모델을 여전히 독점(proprietary)으로 분류하고 있습니다. 요구사항이 "내가 비용을 지불한 바로 그 모델을 실행할 수 있어야 한다"라면 이 차이는 중요합니다. 요구사항이 "아키텍처를 검사하고 유사한 변형 모델을 자체 호스팅할 수 있어야 한다"라면 Qwen3.8-Max는 조건을 충족하고 GPT-6 Astra는 그렇지 않습니다.
핵심 요점
GPT-6 Astra를 선택하세요. 현재 그것만이 유일하게 수행하는 특정 작업({{1}}공격 보안 작업{{/1}}, {{2}}최첨단 과학적 추론{{/2}}, {{3}}가장 어려운 자율 컴퓨터 사용 작업{{4}}—그중에서도 특히 까다로운 작업{{/4}}{{/3}})이 필요하고, 조직이 게이팅을 통과하고 가격을 감당할 수 있다면 말이죠. Qwen3.8-Max를 선택하세요. 이번 주에 실제로 배포할 수 있는 최상위 에이전트 모델을 원한다면, $2/$6이라는 가격, 탈출구 역할을 하는 가중치, 그리고 이제 테스트해야 한다는 것을 알게 된 환각 회귀 문제와 함께 말이죠. 더 넓은 교훈은 바로 세부 조항 자체에 있습니다. {{6}}2026년 9월{{/6}}, 두 주요 "에이전트" 플래그십 모델은 어느 제조사도 완전히 통제하지 못하는 주요 수치를 내세워 판매되며, 합리적인 구매자는 하네스를 읽고, 턴 수를 계산하고, 선택하기 전에 자신의 작업을 직접 실행해 봅니다.

이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
