
Qwen 4 Max vs Claude Opus 5: 둘 모두의 발밑에서 움직인 벤치마크
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen 4 Max는 2026년 9월 22일 항저우의 윈치 컨퍼런스에서 미리 공개되었다 — 발표되었지만 아직 출시되지 않은 4개 모델 Qwen 4 라인의 플래그십 등급으로, 가격도, 컨텍스트 윈도우도, 공개된 점수도 없다. Claude Opus 5는 2026년 7월 24일부터 백만 입력 토큰당 $5.00, 백만 출력 토큰당 $25.00에 일반 제공되어 왔으며, Qwen3.8-Max 출시 이후 모든 플래그십이 겨냥해 온 목표였다. 이 비교를 작성하는 뻔한 방식은 한 열이 비어 있는 스펙 시트다. 유용한 방식은 2026년 9월 19일, 발표 사흘 전에 Artificial Analysis가 자사의 Intelligence Index를 다시 채점했고 Claude Opus 5가 더 이상 그 1위 모델이 아니게 되었다는 점을 알아차리는 것이다. 그 단 하나의 변화가 Qwen 4 Max가 넘어서야 할 대상의 틀을 재구성한다.
9월 19일에 무엇이 바뀌었나요?
Artificial Analysis는 2026년 9월 19일에 인덱스 개정 v4.3.2를 발표했습니다. 현재 개정판에서 Claude Opus 5는 최대 추론 노력에서 Intelligence Index 51점을 기록하며 — xhigh에서 50, high에서 48, medium에서 45, low에서 39 — 둘 다 53점인 Claude Fable 5.1과 GPT-6 Astra보다 뒤에 있습니다. 해당 인덱스의 작업당 비용은 $5.86입니다.
그게 하향 조정처럼 읽힌다 해도, 실제로는 하향 조정이 아니다. 모델은 바뀌지 않았다. 지수가 바뀌었다. 7월과 8월에 걸친 우리 자체 보도에서는 Claude Opus 5를 61~63, 표 최상단으로 인용했으며, 그 수치들은 당시 시행 중이던 개정 기준 아래에서는 정확했다. 개정 날짜도 없이 여전히 그 수치를 인용하는 사람은 더 이상 사용되지 않는 수치를 인용하는 것이며, 이는 이번 달에 작성된 비교 글에서 가장 흔한 단일 오류다. 실질적인 결과는 “Claude Opus 5가 이용 가능한 모델 중 최고 점수 모델이다” 같은 주장이 더 이상 사실이 아니며, 그에 기반해 세운 비교는 무너진다는 것이다.
Qwen 쪽의 결과는 훨씬 더 심각하다. 2026년 9월에 발표된 플래그십 등급은 2026년 9월에 재정의된 목표를 겨냥하고 있다. 알리바바가 Qwen 4 Max를 위해 결국 무엇을 공개하든, 그것은 63이 아니라 53이 넘어야 할 숫자인 리더보드를 기준으로 읽히게 될 것이다.

비교를 솔직히 말하자면
이 표의 한쪽은 완성되어 있고 다른 쪽은 비어 있으며, 그렇지 않은 척하는 것이 바로 이 글의 실패 모드 전체일 것이다. 실제로 알려진 것은 다음과 같다:
• 상태 — Claude Opus 5는 2026년 7월 24일부터 일반 제공 중인 반면, Qwen 4 Max는 2026년 9월 22일 발표되었으나 출시일 미정
• 입력 가격 — Claude Opus 5는 100만 토큰당 $5.00, Qwen 4 Max는 미공개
출력 가격 — Claude Opus 5는 100만 토큰당 $25.00, Qwen 4 Max는 미공개
• 캐시된 입력 — 캐시 읽기 기준 Claude Opus 5는 100만 토큰당 $0.50, Qwen 4 Max는 미공개
• 컨텍스트 — Claude Opus 5는 1M 토큰이 기본값이자 최대치인 반면, Qwen 4 Max는 미공개
• 출력 상한 — Claude Opus 5는 동기 방식으로 128K 토큰, 베타 헤더를 사용하면 Batches API에서 300K인 반면, Qwen 4 Max는 공개되지 않음
• 모달리티 — Claude Opus 5는 텍스트, 이미지 및 파일 입력에 텍스트 출력을 지원하는 반면, Qwen 4 Max는 미공개
• 장문 컨텍스트 가격 — Claude Opus 5는 추가 요금이 없으므로 900,000토큰 요청이 9,000토큰 요청과 동일한 토큰당 요율로 청구됩니다. 반면 Qwen 4 Max는 공개되지 않았습니다.
• 독립적 점수 — 최대 노력 설정에서 Artificial Analysis Intelligence Index v4.3.2 기준 Claude Opus 5 51점, 반면 Qwen 4 Max는 독립적 평가가 존재하지 않음
• 벤더 보고 점수 — Claude Opus 5 SWE-bench Verified 96.0%, SWE-bench Pro 79.2%, OSWorld 2.0 70.6%, Terminal-Bench 2.1은 하네스에 따라 80% 중반대, 반면 Qwen 4 Max는 보고된 바 없음
• 추론 제어 — Claude Opus 5는 5단계 노력 레벨을 갖춘 적응형 사고가 기본으로 활성화되는 반면, Qwen 4 Max는 공개되지 않음
‘미공개’ 열 줄은 수사적 장치가 아니다. 그것은 증거의 현황이며, 여기서 나오는 정직한 결론은 이 두 모델 간의 능력 비교는 아직 누구도 할 수 없다는 것이다.
메워지지 않을 간극의 부분
가격과 맥락은 결국 공개될 것입니다. 출시 후에도 한 가지 차이는 남을 것이며, 이는 Qwen 4 Max가 출시되는 주에 결정하기보다 지금 결정하는 것이 좋습니다: 두 모델은 서로 다른 방식으로 구매되도록 만들어졌습니다.
Claude Opus 5는 단일 공급업체가 단일 가격에 제공하는 단일 폐쇄형 모델이며, 2027년 7월 24일 이전에는 서비스를 종료하지 않겠다는 약속을 공개했습니다. 이는 용량 계획을 위한 안정적인 목표입니다. Qwen 4 Max는 Alibaba가 훨씬 더 넓은 가격대에 걸쳐 반복적으로 출시해 온 제품군의 플래그십입니다 — Qwen 3.8 세대는 입력 요금이 $2.00인 프런티어 플래그십과 그보다 훨씬 낮은 Flash 티어를 아우릅니다 — 그리고 Qwen 라인의 플래그십 티어는 역사적으로 더 저렴한 티어가 그 격차를 좁히기 전까지 유효 수명이 가장 짧은 티어였습니다.
또 다른 차이점은 오픈 가중치이며, 이는 반대 방향을 가리킨다. Qwen 3.8 세대는 자사의 가장 큰 모델에 대한 가중치를 커스텀 Qwen 라이선스 하에 공개했는데, 이것이 있어야만 파인튜닝, 양자화, 셀프 호스팅이 가능해진다. Claude Opus 5는 가중치를 공개하지 않았으며, 앞으로도 공개하지 않을 것이다. 만약 워크로드가 자체 경계 내에서 실행하거나 수정할 수 있는 모델을 필요로 한다면, 이는 어떤 벤치마크 개정도 알리바바로부터 빼앗을 수 없는 구조적 이점이며, 이 특정 비교를 하나의 플래그십 대 다른 플래그십으로 취급하기보다 주목해야 할 가장 강력한 이유이다.

오늘 이 비교를 실행하는 방법
Claude Opus 5가 이제 출시되었으며, OrcaRouter는 이를 anthropic/claude-opus-5로 라우팅합니다, Anthropic의 정가에 0% 마크업으로 — 제공업체의 요율이 그대로 전달되므로, 위의 $5.00과 $25.00 수치는 마크업된 환산가가 아니라 실제로 청구되는 금액입니다. 이는 이 가격대의 모델에서는 평소보다 더 중요합니다. $25.00의 출력 요율에 10퍼센트의 플랫폼 마진이 붙으면 백만 토큰당 $2.50이며, 이는 대부분의 오픈 웨이트 대안 모델의 전체 입력 비용보다 더 큰 금액입니다. 이와 함께 카탈로그는 하나의 OpenAI 호환 엔드포인트에서 약 200개의 모델을 제공하며, 제공업체 경로가 저하될 때의 자동 장애 조치와 애플리케이션에 모델 이름을 하드코딩하는 대신 정책을 명시적으로 표현하기 위한 라우팅 DSL을 갖추고 있습니다.
OrcaRouter가 제공하지 않는 것은 Qwen 4 Max, 또는 어떤 Qwen 4 등급도 마찬가지입니다. 카탈로그에는 해당 제품군에 대한 항목이 전혀 없는데, 이는 발표만 되고 출시되지 않은 모델에 대해 예상할 수 있는 그대로입니다. 등급들이 실제로 출시되면 같은 위치에 나타날 것이며, 그때까지는 Claude Opus 5와 비교할 가치가 있는 Qwen 모델은 실제로 호출할 수 있는 모델, 즉 2026년 8월 3일부터 일반 제공된 Qwen3.8-Max로, 백만 토큰당 입력 $2.00, 출력 $6.00이며, 가중치가 공개되어 있고 작업당 $1.14에 기록된 독립 지능 점수 56을 보유합니다. 이 수치는 이전 인덱스 개정에서 확보된 것이므로, Claude Opus 5의 51과 비교할 때는 이러한 단서를 반드시 붙여야 합니다.
모델 카드가 존재하기 전에는 이것으로 무엇을 해야 할까요?
여기서 내릴 결론은 없습니다. 두 모델 중 하나는 제품으로 존재하지 않기 때문입니다. 말할 수 있는 것은 2026년 9월 19일에 어느 벤더도 아무것도 하지 않았는데도 비교의 구도가 바뀌었다는 점입니다. Claude Opus 5는 대부분의 비교가 기대는 독립 지표에서 더 이상 최고 점수 모델이 아니며, 이제 다른 두 모델에 2점 뒤처져 있습니다. Qwen 4 Max의 출시는 7월의 표가 아니라 그 표에 들어가게 될 것입니다.
앞으로 몇 달 동안의 결정은 Qwen 4 Max 대 Claude Opus 5가 아닙니다. 그것은 Claude Opus 5 대 이미 출시된 Qwen 모델 — 입력 가격의 5분의 1이면서 가중치가 공개된 플래그십 — 이며, 그 비교는 양쪽의 실제 수치와 함께 지금 이용 가능합니다. 알리바바가 모델 카드를 공개하면 다시 살펴보고, 그전에 보게 되는 Qwen 4 Max 벤치마크 표는 모두 미검증으로 취급하세요.

이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
