
Apsara 2026에서 발표된 Qwen 4 Max: Alibaba가 확인한 것과 확인하지 않은 것
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
항저우의 윈치 컨퍼런스, 즉 압사라 컨퍼런스는 2026년 9월 22일, 아직 출시되지 않은 네 가지 모델을 선보이는 데 활용됐다. 해당 연구소의 LLM 책임자 리우 다이헝은 무대에서 Qwen 4 Max, Qwen 4 Flash, Qwen 4 Plus, Qwen 4 27B를 미리 공개하고, 이 제품군이 차세대 아키텍처로 훈련되고 있다고 설명했으며, 곧 출시될 것이라고만 말했다. 이 글을 쓰는 시점에 이 네 모델 중 어느 것에도 모델 카드가 없고, 공개 가중치도, API 식별자도, 컨텍스트 윈도도, 가격도, 벤치마크 점수도 없다. 오늘 실제로 호출할 수 있는 최신 플래그십은 2026년 8월 3일부터 일반 제공된 Qwen3.8-Max이며, 무대 발표와 호출 가능한 엔드포인트 사이의 그 간극이야말로 이 이야기에서 주의 깊게 읽을 가치가 있는 부분이다.
네 가지 계층, 그리고 각 계층이 무엇을 의미하도록 되어 있는지
알리바바의 Qwen 제품군은 Qwen 3 세대 이후 역량 등급으로 구성되어 왔으며, Qwen 4 발표에서도 이를 대체하기보다 그 구조를 그대로 유지했습니다. 무대에서 공개된 것은 사양서가 아니라 명단이었습니다:
• Qwen 4 Max — 플래그십 등급이며, 알리바바가 다른 모든 프런티어 연구소의 최상위 모델에 맞서 내세우는 모델
• Qwen 4 Flash — 높은 처리량 등급으로, 최고 수준의 추론보다는 지연 시간에 민감하고 대량의 작업을 위해 설계되었습니다
• Qwen 4 Plus — 균형 잡힌 중간 등급으로, 역사적으로 멀티모달 지원 범위가 가장 넓었던 모델
• Qwen 4 27B — 오픈 웨이트 로컬 계층, 호스팅된 API를 전혀 건드리지 않는 사람들이 다운로드하고 파인튜닝하고 양자화하는 바로 그 모델
• 아키텍처 — 새로운 세대라고 설명되며, 훈련 중이라고 설명되는데, 이는 완성된 것과는 다르다
• 주요 워크로드 — 컨퍼런스에서 규정한 바에 따르면, 채팅이 아닌 에이전틱 및 도구 활용 작업
• 가용성 — 없음. 어떤 티어도 출시일, 가격, 컨텍스트 윈도, 모달리티 목록 또는 공개된 점수를 갖고 있지 않습니다.
27B 등급은 벤치마크와는 전혀 무관한 이유로 주목해야 할 등급입니다. 이는 이 제품군에서 역사적으로 오픈 가중치로 출시된 유일한 등급이며, Qwen 3.8 세대는 그것이 얼마나 많은 독립적 작업을 가능하게 하는지 보여주었습니다. 27B 가중치가 공개된 지 며칠 만에 커뮤니티는 MLX 변환, NVFP4 양자화, 검열 없는 파인튜닝을 만들어냈습니다. 발표된 27B는 전체 다운스트림 생태계에 대한 약속이며, 이 로드맵에서 가장 예측 가능한 제공 일정을 가진 부분입니다.
5조에서 10조 개의 매개변수라는 숫자는 Qwen 4의 것이 아니다
컨퍼런스 보도는 한 수치에 대해 엄밀하지 못했다. Qwen 4 뉴스와 함께 돌았던 "5조~10조 파라미터" 목표는 Qwen 4의 사양이 아니다 — 그것은 그 이후 세대, 즉 Qwen 4.5와 Qwen 5 시기를 겨냥한 전망성 발언이다. 알리바바는 Qwen 4 Max에 어떤 파라미터 수도 붙이지 않았으며, 이용 가능한 증거로 볼 때 그런 수치를 기재하는 것은 실수일 것이다.
이것이 중요한 이유는 매개변수 수가 독자들이 기준으로 삼는 숫자이자 널리 퍼지는 숫자이기 때문입니다. 공개된 아키텍처가 없는 모델에 붙은 5T 매개변수 주장은 양방향으로 반증할 수 없습니다. 누구도 이를 확인할 수 없고, 한 번 반복되면 누구도 이를 바로잡을 수 없습니다. 이번 주에 Qwen 4 Max가 수조 개 매개변수 모델로 묘사되는 것을 본다면, 그 숫자는 다른 슬라이드에서 빌려온 것입니다.
솔직히 말할 수 있는 것은, 전임 플래그십이 토큰당 950억 개의 매개변수가 활성화되는 2.4조 매개변수 규모의 전문가 혼합(MoE) 모델이며, 이는 Qwen3.8-Max의 공식 모델 카드와 그 뒤를 이은 오픈 웨이트 릴리스에서 확인된다는 점이다. Qwen 4 Max가 결국 무엇이 되든, 그것이 넘어서야 할 기준선은 바로 이 수치이며, 이는 로드맵상의 염원이 아니라 공개되어 검증 가능한 숫자다.

아키텍처는 소문이 아니다: 그 미리보기는 이미 출시되었다
Qwen 4 발표에서 가장 유용한 점은 아키텍처의 일부가 이미 다른 이름으로 공개되었다는 것입니다. Qwen3.8-Flash-Next는 2026년 8월 말에 오픈소스로 공개되었고, 해당 모델 카드에는 그것이 Qwen 4 아키텍처의 프리뷰라고 분명히 적혀 있습니다. 덕분에 이것은 알리바바 외부의 누구든 Qwen 4 제품군이 어떻게 만들어지는지에 대해 가진 유일한 구체적 증거가 됩니다.
이는 1,250억 개의 주 파라미터에 510억 개의 N-그램 임베딩 파라미터를 더한 희소 모델로, 추론 단계마다 약 60억 개를 활성화합니다. 262,000토큰의 네이티브 컨텍스트를 갖추고 있으며, 카드에 따르면 이는 100만 개를 향해 확장되고, Alibaba는 Qwen3.7-Plus보다 약 90% 더 낮은 비용으로 학습했다고 보고합니다. 카드에는 세 가지 기법이 명시되어 있습니다:
• Qwen 특화 희소 어텐션 기법인 QSA는 저렴한 장문맥 학습 주장의 배후에 있는 메커니즘이다
• 게이티드 잔차 연결, 심층 희소 네트워크를 위한 안정성 척도
• N-gram 임베딩, 밀집하게 계산되지 않고 조회되는 별도의 510억 매개변수 저장소
Qwen 4의 여러 티어가 그 설계를 계승한다면, 흥미로운 귀결은 아키텍처적이라기보다 경제적이다. 대략 학습 비용의 10분의 1로 최전선에 근접한 품질에 도달하도록 설계된 제품군은 공격적으로 가격을 책정할 수 있는 제품군이며, 알리바바의 공격적인 가격 책정은 지난 2년간 오픈 웨이트 모델 경제학에서 가장 신뢰할 수 있는 단일 동력이었다. 이는 사실이 아니라 예측이며, 예측이라고 표시해야 한다. 하지만 이것이 이 로드맵을 외면하기보다 주시해야 하는 이유다.
기다리는 동안 실행할 것
Qwen 4 발표 내용 중 이번 주에 이용 가능한 것을 바꾸는 것은 없으며, 오늘 무언가를 구축하는 사람에게 정직한 답은 Qwen 3.8 세대입니다. Qwen3.8-Max는 2026년 8월 3일부터 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $6.00에 일반 제공되었고, 전체 100만 토큰 컨텍스트에 걸쳐 동일 요금이며 긴 프롬프트 할증이 없습니다. 또한 그 가중치는 2026년 8월 12일 Qwen3.8-2.4T-A95B로 BF16 및 FP8 버전 모두 사용자 정의 Qwen 라이선스 하에 공개되었습니다. 이 모델은 Qwen 4 계층이 비교 기준으로 삼게 될 모델이며, 오늘 프로덕션 트래픽을 처리하고 있습니다.
별도의 계정과 키, 각 연구소별 청구를 관리하지 않고도 출시된 Qwen 세대를 다른 프런티어 모델들과 비교하고 싶다면, OrcaRouter는 Qwen 3.8 패밀리를 제공합니다 — Qwen3.8-Max, Qwen3.8-Flash, Qwen3.8-27B — 를 Claude Opus 5, DeepSeek V4 Pro, Gemini 3.1 Pro Preview, GLM 5.3과 함께 하나의 OpenAI 호환 엔드포인트에서. 즉 0% 마크업으로 약 200개 모델을 위한 하나의 API라는 뜻이며, 이는 제공업체의 정가가 그대로 전달된다는 의미이므로, 벤더의 가격 인하가 다음 청구 주기가 아니라 같은 날 바로 여러분의 키에 적용됩니다. Qwen 4 등급이 실제로 출시된다면 같은 카탈로그에 나타날 것이며, 현재로서는 그중 어느 것도 없습니다.

요점
Qwen 4 Max는 실제 발표이긴 하지만 실제 제품은 아닙니다. 그리고 그 문장의 양쪽 모두가 중요합니다. 라인업은 확정되었습니다: 네 개의 티어, 차세대 아키텍처, 에이전트 중심성, 그리고 플래그십보다 더 많은 사람에게 더 중요할 오픈 웨이트 27B 티어입니다. 구매 결정에 필요한 모든 것 — 가격, 컨텍스트, 모달리티, 가중치, 점수, 날짜 — 이 빠져 있습니다.
이것은 유난히 좋은 기록이 남아 있는 로드맵 신호로 취급하십시오. Qwen3.8-Flash-Next 릴리스가 아키텍처 미리보기를 무료로 제공하고, Qwen3.8-Max가 공개된 가중치와 공개된 가격을 갖춘 현행 기준선을 제공하기 때문입니다. 27B 등급은 그것이 만들어낼 생태계 때문에, Flash 등급은 처리량 경제성 때문에 추적하십시오. 5조~10조 매개변수 수치를 Qwen 4의 사실로 재배포하지 말고, 출시일이 없는 모델을 중심으로 마이그레이션을 계획하지 마십시오 — Qwen3.8-Max를 중심으로 계획하고, 이동할 엔드포인트가 생기면 이동하십시오.

이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
