
Qwen 4 Max vs Gemini 3.1 Pro: 발표되지 않은 플래그십 대 끝나지 않은 프리뷰
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
대부분의 비교는 출시된 제품과 출시된 제품을 맞붙인다. 이번 비교는 이례적이다. Qwen 4 Max는 2026년 9월 22일 항저우에서 열린 윈치(Yunqi) 콘퍼런스에서 프리뷰로 공개되었으며, 출시일도, 가격도, 가중치도 없었다. 그리고 Gemini 3.1 Pro는 2026년 2월 19일부터 프리뷰 상태였고, 칠 개월이 지난 지금도 여전히 프리뷰다. 일반 제공(GA) 일정은 발표되지 않았고, 지원 중단(deprecation) 표에도 종료 날짜가 없다. 이 대결에 등장하는 어느 모델도 확정된 제품이 아니다. 그렇다고 해서 이 비교를 건너뛸 이유가 되는 것은 아니다. 그것이 바로 이 비교이며, 이 비교에서 진정으로 유익한 단 하나의 지점이다.
7개월간의 미리보기
프리뷰 라벨은 원래 짧게 유지되는 상태여야 한다. Gemini 3.1 Pro는 이제 같은 연구소의 세 번의 Flash 출시를 거치는 동안에도 그 라벨을 유지하고 있다. 여기에는 2026년 9월 2일의 Gemini 3.8 Flash가 포함되며, Google은 이를 가장 지능적인 Flash 모델이라고 설명한다. 독립적인 종합 평가에서 그 모델은 이제 3.1 Pro보다 높은 점수를 받는다. Google의 Pro 라인에는 더 새로운 구성원이 없다. Gemini 3.8 Pro는 없으며, 3.5 Pro 세대는 연기되었고 보류된 것으로 알려졌다. 실질적인 결과는 Pro라는 이름을 달고 있는 모델이 더 이상 자사 최고 점수 모델이 아니라는 점이다.
Google이 카탈로그 항목에 명시한 자체 제한 문구는 프리뷰 지원 중단을 대비해 계획하라고 권고하며, 이는 해당 상태를 해석하는 정직한 방식이다. GA 날짜도 종료 날짜도 없는 프리뷰는 그 위에 구축할 수는 있지만 일정을 그에 맞춰 세울 수는 없는 모델이다.
Qwen 쪽은 부호를 뒤집은 거울상이다. Qwen 4 Max는 긴 프리뷰 단계가 아니라, 아무것도 공개되지 않은 프리뷰 이전 단계다. 두 가지 실패 양상은 서로 정반대다. Gemini 3.1 Pro는 장기적 존속 여부가 명시되지 않은 실제 엔드포인트이고, Qwen 4 Max는 엔드포인트가 없는, 로드맵에 명시된 항목이다.

비교, 그리고 그것을 결정하는 장문맥 수치
Gemini 3.1 Pro의 사양은 공개되어 있고 구체적입니다. Qwen 4 Max의 사양은 비어 있습니다. 곱씹어 볼 만한 것은 Gemini 열의 한 행입니다. 왜냐하면 그것은 인용되곤 하지만 그래서는 안 되는 종류의 숫자이기 때문입니다:
• 상태 — Gemini 3.1 Pro는 2026년 2월 19일부터 프리뷰 중인 반면, Qwen 4 Max는 2026년 9월 22일에 발표되었으나 날짜는 미정
• 입력 가격 — Gemini 3.1 Pro는 최대 200K 프롬프트까지 100만 토큰당 $2.00, 그 이상은 $4.00인 반면, Qwen 4 Max는 미공개
• 출력 가격 — Gemini 3.1 Pro는 최대 200K까지 1M당 $12.00, 그 이상은 $18.00인 반면, Qwen 4 Max는 공개되지 않음
• 캐시된 입력 — 캐시 읽기 시 1M당 Gemini 3.1 Pro $0.20, Qwen 4 Max는 미공개
• 컨텍스트 — Gemini 3.1 Pro 1,048,576 토큰, 반면 Qwen 4 Max는 미공개
• 출력 상한 — Gemini 3.1 Pro 65,536 토큰, Qwen 4 Max는 미공개
• 모달리티 — Gemini 3.1 Pro는 텍스트, 이미지, 동영상, 오디오 및 PDF 입력에 텍스트 출력을 지원하는 반면, Qwen 4 Max는 공개되지 않음
• 추론 제어 — Gemini 3.1 Pro 낮음, 중간, 높음 사고 수준, 대비 Qwen 4 Max는 미공개
• 장문맥 검색 — Gemini 3.1 Pro의 벤더 보고 MRCR v2는 128K에서 8개 니들 평균 84.9퍼센트였으나, 100만 토큰 포인트와이즈 설정에서는 26.3퍼센트였으며, 반면 Qwen 4 Max는 보고된 바 없음
• 공급업체가 보고한 점수 — Gemini 3.1 Pro SWE-bench Verified 80.6퍼센트, GPQA Diamond 94.3퍼센트, ARC-AGI-2 77.1퍼센트, Humanity's Last Exam은 도구 없이 44.4퍼센트, 반면 Qwen 4 Max는 보고된 바 없음
• 독립적 점수 — Artificial Analysis Intelligence Index v4.3.2에서 Gemini 3.1 Pro는 30점, 반면 Qwen 4 Max는 독립적 평가가 존재하지 않음
그 긴 컨텍스트 행이야말로 가져가야 할 항목이다. 1,048,576토큰 컨텍스트 창은 마케팅 숫자에 불과하다; 100만 토큰 설정에서의 26.3퍼센트 검색률은 같은 벤더가 그 창의 맨 끝을 측정할 때 보고하는 수치다. 두 수치 모두 Google에서 나온 것이므로, 이 격차는 평가자에 관한 것이 아니라 모델에 관한 진술이 된다. 당신의 워크로드가 100만 토큰 프롬프트의 끝 근처에 묻힌 사실을 찾는 데 달려 있다면, 헤드라인 컨텍스트 수치는 유용한 것을 전혀 알려주지 않고 이 행은 거의 모든 것을 알려준다.
지수는 움직였지만, 모델은 움직이지 않았다
Gemini 3.1 Pro는 2026년 2월 19일 Artificial Analysis Intelligence Index에서 57점으로 출시되어 해당 분야 1위였습니다. 2026년 9월 19일 공개된 지수 개정 v4.3.2에 따르면, 이 수치는 30으로 표시됩니다. 그 두 날짜 사이에 모델 자체에서 바뀐 것은 아무것도 없습니다. 척도가 재구축되었고, 그것도 Alibaba의 Qwen 4 발표 나흘 전에 재구축되었습니다.
그 우연은 숫자 자체보다 더 큰 의미가 있다. 이번 비교 묶음에 포함된 네 모델 중 세 개 — Gemini 3.1 Pro, Claude Opus 5, Qwen 3.8 플래그십 — 는 동일한 리비전 아래에서 독립적인 점수가 움직였고, 각각의 경우 그 움직임은 순위를 뒤집을 만큼 컸다. 이번 달에 작성된 비교에서 리비전을 명시하지 않은 채 단일 지수 값을 인용한다면, 그것은 서로 다른 자로 측정한 점수를 비교하는 것이며, 그 오류는 독자에게 보이지 않을 것이다.
Qwen 4 Max의 경우, 그 결과는 목표가 계속 움직인다는 점입니다. 알리바바가 결국 공개하면, 이 지수에서 넘어야 할 점수는 그날의 현재 개정판이 제시하는 값이 될 것이며, 그 개정판은 지난주에 적어도 한 번 변경되었습니다.

운영 수치가 말해 주는 것, 불편한 수치까지 포함해서
Gemini 3.1 Pro는 google/gemini-3.1-pro-preview로 OrcaRouter에서 라우팅할 수 있으며, 사전 출시 배너 없이 플래그십 및 피처드 배지를 달고 있고, 가격은 Google 정가인 백만 토큰당 $2.00 및 $12.00에 0% 마크업이 적용됩니다. 라우팅 자체는 정직합니다. 페이지에 표시된 요금이 곧 Google이 공표한 요금입니다. 9월 22일까지의 7일간 운영 수치도 건너뛰지 않고 그대로 적어 둘 가치가 있습니다. p50 첫 토큰 도달 시간은 10.00초, 출력 속도는 초당 약 632토큰, 해당 기간의 오류율은 77.5퍼센트입니다. 이 오류율은 각주가 아닙니다. GA 일정조차 없는 프리뷰 등급 모델의 경우, 이는 페이지에서 의사 결정에 가장 관련성이 높은 단일 수치이며, 이를 빼놓고 가격만 인용하는 비교는 정보를 제공하는 것이 아니라 판매하는 것입니다.
같은 카탈로그는 자동 페일오버와 라우팅 DSL을 갖춘 하나의 OpenAI 호환 엔드포인트에서 200개에 가까운 모델을 제공합니다. 이는 그런 오류율을 치명적인 것이 아니라 감내 가능한 것으로 만들어 주는 메커니즘으로, 성능이 저하된 제공자 경로를 중단시키는 대신 페일오버할 수 있게 해줍니다. Qwen 3.8 제품군, 즉 Qwen3.8-Max, Qwen3.8-Flash, Qwen3.8-27B는 Gemini 3.1 Pro Preview와 동일한 엔드포인트에 있으므로, 이 글에서 정말로 다루는 대체, 즉 오늘 바로 실행할 수 있는 대체는 마이그레이션 프로젝트가 아니라 라우팅 정책 변경입니다. Qwen 4 Max는 카탈로그에 없으며, 어떤 Qwen 4 등급도 없습니다. 그것이 출시되면 바로 그곳에 나타날 것입니다.
그 결정이라는 것도, 뭐 그렇긴 하지만
여기 있는 어느 모델도 여러분이 확정해 채택할 수 있는 제품이 아니며, 솔직한 조언은 둘 모두 그에 맞게 대하라는 것입니다. Gemini 3.1 Pro는 오늘날 공개된 가격과 공개된 컨텍스트 윈도, 그리고 그 윈도의 맨 끝에서 나타나는 검색 약점을 포함한 공개 평가 기록을 바탕으로 호출할 수 있습니다. 또한 벤더가 지원 중단을 계획하라고 권고하는 프리뷰이며, 프로덕션 의존성으로는 용납될 수 없는 오류율로 작동합니다. Qwen 4 Max는 그러한 속성을 전혀 갖추지 않았기 때문에 그러한 문제도 전혀 없습니다.
지금 모델이 필요하다면, 선택은 이 둘 사이가 아니다. 그것은 Gemini 3.1 Pro와 출시된 Qwen 플래그십 사이이며, 이용 가능한 증거로 볼 때 이는 장문 컨텍스트 검색 품질 대 $2.00 입력 요금 및 공개된 가중치에 관한 결정이다. 기다릴 수 있다면, 하나가 아니라 두 가지를 지켜보라: Qwen 4 Max 모델 카드, 그리고 Gemini 3.1 Pro의 일반 제공 날짜. 어느 쪽이 먼저 도착하든, 그것은 알리바바와 구글이 이 두 로드맵 중 실제로 어느 쪽을 우선시하는지 알려줄 것이다.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
