
Qwen3.8-Max 대 Qwen 3.8: 단일 2.4T 코어, 임대 또는 자체 실행 — 0902 리프레시 이후
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026년 9월 2일, Alibaba는 Qwen3.8-Max의 날짜가 붙은 새 빌드를 출시했습니다 — 그 빌드를 Qwen3.8-Max-0902로 지정했습니다 — 그리고 같은 주에 독립 코딩 리더보드가 새 스냅샷을 1위에 올렸습니다. 접미사 없이 "Qwen 3.8"이라고 쓸 때 대부분의 사람들이 의미하는 바로 그 2.4조 매개변수 코어의 다운로드 가능한 버전은 여전히 8월 12일 체크포인트에 머물러 있습니다: 텍스트 전용이고, 추론이 항상 켜져 있으며, GPU 랙보다 작은 어떤 하드웨어에서도 실행 가능하려면 수백 기가바이트가 부족합니다. 호스팅된 플래그십과 공개 가중치 사이의 그 격차는 8월에는 존재하지 않았습니다. 그것이 지금 비교의 전부이며, 같은 모델이 두 개의 이름으로 여러분에게 계속 판매되는 이유입니다.
Qwen3.8-Max는 알리바바가 호스팅하는 플래그십 모델입니다: 토큰당 약 950억 개의 파라미터가 활성화되는 2.4조 파라미터 규모의 희소 혼합 전문가(sparse mixture-of-experts) 모델로, 8월 3일부터 유료 API로 서비스되며 100만 토큰 멀티모달 컨텍스트 창을 갖추고 있습니다. 독립적인 이름으로서의 Qwen 3.8은 같은 세대의 오픈 릴리스입니다 — 가장 중요하게는 알리바바가 8월 12일 맞춤형 라이선스로 공개한 가중치인 Qwen3.8-2.4T-A95B입니다. 이 둘은 저렴한 형제 모델과 프리미엄 형제 모델이 아닙니다. 같은 뇌를 두 가지 방식으로 판매하는 것이며, 9월의 사후 학습(posting-training) 패스가 두 전달 방식을 갈라놓기 시작했습니다. 이 글은 여러분이 실제로 보고 있는 "Qwen 3.8"이 어떤 것인지, 0902 업데이트가 무엇을 바꿨는지, 그리고 오늘 어떤 경로 — API를 빌리는 것과 가중치를 실행하는 것 — 를 선택해야 하는지를 정리합니다.
라이벌이 아닌 페어링
날짜와 요율표를 다루기 전에, 아키텍처부터 보자. Qwen3.8-Max와 Qwen3.8-2.4T-A95B는 세분화된 MoE 설계를 공유한다. 레이어당 512개의 전문가(레이어마다 라우팅되는 10개와 공유 1개), 92개의 레이어, 그리고 92개 중 69개의 레이어가 선형 어텐션(Gated DeltaNet과 게이티드 어텐션의 결합)을 사용하는 하이브리드 스택이며, 긴 컨텍스트 작업을 위해 전체 어텐션이 사이사이에 배치된다. 그 덕분에 모델 카드는 API에서 백만 토큰 컨텍스트를 내세울 수 있고, 오픈 빌드는 기본적으로 262K에 도달하며 적절한 서빙 구성에서는 백만으로 확장된다. 두 이름 사이의 차이는 가중치 아키텍처가 아니라 가장자리에 있고, 그 가장자리는 9월 2일 이후로 움직였다.
• 파라미터 — Qwen3.8-Max: 총 2.4T / 활성 약 95B, MoE. Qwen3.8-2.4T-A95B: 동일한 코어, 동일한 활성 수.
• 제공 — Qwen3.8-Max: 호스팅 API, 8월 3일부터 운영 중, 9월 2일 Qwen3.8-Max-0902로 갱신됨. Qwen3.8-2.4T-A95B: 다운로드 가능한 가중치, 8월 12일 최초 공개, 이후 새로운 체크포인트 없음.
• 모달리티 — Qwen3.8-Max: 텍스트, 이미지 및 비디오 입력. Qwen3.8-2.4T-A95B: 텍스트 전용.
• 추론 제어 — Qwen3.8-Max: thinking 토글 제공(비추론 모드 포함). Qwen3.8-2.4T-A95B: thinking 항상 켜짐, 추론 노력 다이얼만 제공(낮음 / 높음 / 매우 높음).
• 도구 — Qwen3.8-Max: 기본 함수 호출, 내장 도구 5개, 구조화된 출력. Qwen3.8-2.4T-A95B: 기본 도구 계층이 없으며, 제공되는 기능은 이를 서빙하는 추론 프레임워크에 따라 달라집니다.
9월 2일 업데이트에서 변경된 사항
0902 빌드는 새로운 아키텍처가 아니라 사후 훈련(posting-training) 패스입니다. 알리바바는 Qwen3.8-Max가 이미 알려진 두 가지, 즉 코딩과 '코워크(cowork)' — 장기적 에이전트 및 오피스 작업에 대한 자체 명칭 — 에 초점을 맞췄으며, 그 주변에 자리 잡은 수치들이 이번 리프레시가 중요한 이유입니다. 독립적인 Code Arena: WebDev 리더보드에서 Qwen3.8-Max-0902는 1,691 Elo로 데뷔했는데, 이는 이전 빌드 대비 22포인트 상승한 수치이며 출시와 동시에 1위를 차지하기에 충분했습니다. 알리바이는 또한 이 빌드를 해당 보드의 비용-성능 파레토 프런티어에서 최고 점수를 기록한 모델로 제시하며, 토큰 100만 개당 약 $5의 혼합 요율을 언급했습니다 — $2와 $6의 정가를 출력이 많은 에이전트 트래픽에 따라 가중한 것으로, 다른 곳에서 비슷한 프런티어 모델을 호출하는 비용의 약 4분의 1 수준입니다. 독자는 이러한 수치를 구분해서 이해해야 합니다: 1,691 Elo는 독립 아레나 결과이고, 파레토 프런티어 프레임은 알리바바가 해당 독립 보드에 대해 자체적으로 내린 평가입니다.
0902 패스에 대한 알리바바의 내부 평가는 벤더 보고 기반이며 재현되지 않은 결과지만, 같은 방향을 가리킨다: Terminal-Bench 3.0은 11.3에서 29.0으로, ProgramBench는 10.5에서 28.0으로, JobBench는 53.4에서 64.0으로, WorkArena Elo는 1,348에서 1,468로 상승했다. 이 수치는 "이번 리프레시가 에이전틱 및 코딩 축을 움직였다"는 신호로 읽어야지, 검증된 점수로 받아들여서는 안 된다. 일반 지능 측면에서 Artificial Analysis의 Intelligence Index는 Qwen3.8-Max를 56점으로 평가하는데, 이는 경쟁력이 있지만 이 모델을 선택할 이유는 되지 못한다. 선택의 이유는 코딩 및 에이전틱 결과다.
대부분의 보도가 놓친 부분은 0902 사후 학습(post-training)이 이 글을 쓰는 시점 기준으로 API 전용이라는 점입니다. Alibaba는 업데이트된 모델의 오픈 체크포인트를 공개하지 않았습니다. Hugging Face의 Qwen3.8-2.4T-A95B 가중치는 여전히 8월 12일 릴리스를 기준으로 합니다. 즉, 호스팅된 Qwen3.8-Max와 다운로드 가능한 코어는 더 이상 8월 중순과 같은 방식으로 동일한 모델이 아닙니다. API에는 9월 사후 학습이 포함되어 있지만 가중치에는 포함되어 있지 않습니다. 오픈 릴리스를 실행한 이유가 플래그십 모델이 수행하는 작업을 정확히 재현하기 위해서였다면, 그 가정은 9월 2일부로 조용히 더 이상 사실이 아니게 되었습니다.

그들이 진정으로 갈라지는 다섯 곳
공유 아키텍처는 차치하고 보면, 실질적인 차이는 명확히 드러납니다. 첫 번째 기준은 입력 형식(모달리티)입니다. 워크로드에 이미지나 영상(스크린샷, 차트, 그림이 포함된 문서, 비디오 프레임)이 포함되어 있다면 이를 처리할 수 있는 것은 Qwen3.8-Max뿐이며, 이 모델의 1M 토큰 컨텍스트 창은 확장(extension)이 아니라 네이티브(native)로 지원됩니다. 오픈 웨이트(open weights) 모델은 텍스트 전용입니다. 두 번째 기준은 추론 제어입니다. 호스팅 API는 추론(thinking) 모드를 끈 채 실행할 수 있는데, 이는 지연 시간에 민감하고 처리량이 많은 추출 작업, 즉 사고 과정(chain of thought)이 전적으로 오버헤드인 작업에서 중요합니다. 공개 빌드는 이 기능을 끌 수 없습니다. 세 번째 기준은 도구 지원입니다. 함수 호출(function calling), 다섯 가지 내장 도구, JSON 모드는 호스팅 제품에 포함되어 있지만, 공개 빌드는 서빙 계층(serving layer)이 제공하는 기능에 의존합니다.
컨텍스트는 사양서가 시사하는 것보다 더 미묘합니다. 양쪽 모두 대략 백만 개의 토큰에 도달할 수 있지만, 호스팅 모델은 멀티모달 입력으로 이를 기본 지원하는 반면, 오픈 빌드의 262K 기본 컨텍스트는 설정에서 확장해야 하며, 확장된 창의 모든 토큰은 텍스트입니다. 출력 상한도 다릅니다. API는 약 131K 출력 토큰까지 허용하며, 오픈 빌드는 일반적으로 유사한 상한으로 구성되지만, 오픈 측의 실질적 상한은 모델이 아니라 서빙 스택에 의해 결정됩니다.
각 경로의 실제 비용
바로 이 지점에서 두 제공 방식은 더 이상 전혀 비교할 수 없게 됩니다. Qwen3.8-Max의 공시 가격은 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00, 캐시된 입력 토큰 100만 개당 $0.25입니다. OrcaRouter는 공급업체의 공시 가격을 0% 마크업으로 통과시키므로, 여기서 적용되는 요율도 동일합니다. 알리바바가 가격을 변경하면 새 요금은 당일 바로 반영됩니다. 0902 스냅샷은 재현 가능한 동작을 원하는 팀을 위해 qwen/qwen3.8-max-0902로 별도 고정되어 있습니다. 가격과 기능은 동일하지만, 롤링 모델 대신 고정된 체크포인트를 사용한다는 점이 다릅니다. OrcaRouter 트래픽 기준 Qwen3.8-Max의 7일 중앙값 첫 토큰 도달 시간(time-to-first-token)은 약 2~4초이며, Artificial Analysis 측정 결과 초당 약 45~50개의 출력 토큰을 생성합니다. 느린 편은 아니지만 장황한 편이라, 이 모델로 에이전트 작업을 수행하다 보면 저렴한 요금에도 불구하고 예상외로 많은 토큰을 소모할 수 있습니다.

Qwen3.8-2.4T-A95B에는 공식 가격이 없습니다. 그 가격이란 곧 여러분의 인프라이기 때문입니다. BF16 가중치만 약 4.9TB에 달하고, 공식 FP8 빌드도 약 2.4TB이므로 이는 랙 규모 하드웨어입니다. 문서화된 가장 작은 서빙 구성은 B300 또는 GB300 GPU 약 8개부터 시작하며, GB300 NVL72 풀 랙이 레퍼런스 배포입니다. 과감한 양자화는 최소 요구치를 바꿔 놓습니다. NVFP4 빌드는 약 1.3TB에 들어가고, Unsloth의 1비트 계층 양자화는 모델을 약 397GB로 압축해 비로소 충분히 프로비저닝된 단일 노드로도 실행할 수 있게 해주지만, 이 모든 경로는 데이터센터 규모로 GPU를 운영한다는 전제가 깔려 있습니다. 오픈 체크포인트를 서빙하는 타사 호스트들은 Max의 토큰당 가격보다 싼값에 토큰을 판매하겠지만, 그 대신 멀티모달 입력, 비추론 모드, 네이티브 도구, 0902 사후 학습을 포기해야 하며, 그 다운로드 가능한 체크포인트 자체에 대한 독립 벤치마크도 아직 발표되지 않았습니다. Alibaba의 자체 모델 카드도 이 관계를 솔직히 설명합니다. Qwen3.8-Max는 Qwen3.8-2.4T-A95B를 기반으로 구축된 공식 버전으로, 오픈 코어 위에 비전 입력, 비추론 지원, 기본 1M 컨텍스트, 내장 도구를 추가한 것이라고 명시합니다.

독립 수치 대 벤더 주장
소싱의 신뢰성은 대부분의 비교에서보다 여기서 더 중요합니다. 두 측의 증거 연대가 매우 다르기 때문입니다. Qwen3.8-Max는 독립적으로 평가된 바 있습니다. 0902 빌드에 대한 Code Arena: WebDev 1,691 결과와 Artificial Analysis의 Intelligence Index 56은 제3자 측정값이며, Pareto 프런티어 주장을 흥미롭게 만드는 가격은 공개된 요금표입니다. Qwen3.8-2.4T-A95B는 아직 그러한 평가가 없습니다. Alibaba가 게시한 벤치마크 표는 Max급 코어를 설명한 것이지, 다운로드 가능한 체크포인트에 대한 독립적 실행 결과가 아닙니다. 따라서 이 비교의 오픈 측면은 여전히 대체로 "공급업체가 코어가 이렇게 점수를 낸다고 말한다"는 수준입니다. 능력 기준으로 둘 사이에서 결정해야 한다면, 제3자가 실행할 때까지 오픈 가중치의 주요 수치를 주장으로 취급하십시오.
누가 어떤 것을 골라야 하나요
위 목록에서 그 결정이 도출됩니다. 9월 포스트 트레이닝, 이미지 또는 비디오 입력, 비추론 모드, 네이티브 도구와 구조화된 출력, 또는 인프라를 구축하지 않고도 백만 토큰 컨텍스트 윈도우가 필요하다면, 호스팅된 Qwen3.8-Max — 특히 오늘 기준으로는 0902 빌드 — 를 사용하세요. 그것이 코딩 및 에이전틱 최전선의 위치이며, $2/$6, 캐시된 입력 $0.25라는 가격은 그 성능에 비해 매우 공격적으로 책정된 것입니다.
제어가 편의보다 우선시되는 경우 Qwen3.8-2.4T-A95B를 선택하세요. 즉, 가중치를 자체 하드웨어나 직접 운영하는 제공업체에 두어야 하거나, 감사 및 재현이 가능한 고정 체크포인트를 원하거나, 지속적인 사용량으로 인해 토큰당 비용이 지배적 요인이 되어 2.4T MoE를 운영할 준비가 된 경우입니다. 텍스트 전용, 항상 켜진 추론, 네이티브 도구 없음, 아직 0902 사후 학습 없음이라는 트레이드오프 목록을 수용하고, 수익 구간에 대한 라이선스 조건을 확인하세요. 맞춤형 Qwen3.8-Max 라이선스는 Apache 2.0이 아니며 대규모 상업 운영자에게 조건을 추가하기 때문입니다.
워크로드가 대용량이거나 단일 GPU 기반이거나 지연 시간에 민감한 경우라면 이 두 모델 모두 적합한 선택이 아닐 수 있습니다. 그런 상황에 맞는 크기의 모델은 이번 세대의 270억 파라미터 형제 모델인 Qwen3.8-27B이며, 이는 별도의 Qwen3.8-27B vs Qwen3.8-Max 비교에서 다룹니다.
스택을 걸지 않고 둘 다 시도하는 방법
이 호출을 제대로 수행하는 방법은 양쪽 모두를 자체 프롬프트에서 실행하는 것이며, 바로 여기서 라우팅 계층은 단순히 얹어놓는 부가 기능이 아니라 진가를 발휘합니다. Qwen3.8-Max와 고정된 Qwen3.8-Max-0902 스냅샷은 둘 다 OrcaRouter의 단일 OpenAI 호환 엔드포인트 뒤에 있으므로, 계속 갱신되는 플래그십과 재현 가능한 체크포인트 사이를 전환하는 것은 재배포가 아니라 모델 ID 변경일 뿐입니다. 팀이 오픈 가중치를 자체 인프라로 도입하기로 결정하면, 라우팅 DSL은 Qwen3.8-2.4T-A95B를 서빙하는 자체 호스팅 vLLM 또는 SGLang 엔드포인트 앞단에 배치되어 이를 동일한 호출 그래프 안에 넣습니다. 즉, 대량 트래픽은 자체 배포 환경으로 보내고, 어려운 프롬프트와 멀티모달 요청은 호스팅된 Qwen3.8-Max로 넘기며, 둘 사이에 자동 장애 조치가 적용됩니다. 그런 식으로 새 체크포인트를 시도하는 것은 마이그레이션이 아니라 설정 변경 하나로 끝나며, 이는 비교 대상의 양측이 여전히 서로 다른 속도로 움직이고 있을 때 정확히 원하는 방식입니다.
요점
Qwen3.8-Max와 Qwen 3.8은 동일한 작업을 두고 경쟁하는 두 모델이 아닙니다. 이 둘은 임대형 API와 다운로드 가능한 가중치로 제공되는 단일 2.4조 파라미터 코어이며, 9월 2일 갱신을 통해 두 제공 방식의 의미가 서로 달라졌습니다. API를 임대하면 Code Arena: WebDev에서 선두를 차지한 0902 후속 학습 결과물을 받게 되며, 여기에는 비전, 비추론 모드, 네이티브 도구, 기본 100만 토큰 창이 포함됩니다. 가격은 $2/$6이며 캐시 입력은 $0.25입니다. 오픈 가중치를 실행하면 8월 12일 상태에서 동결된 동일한 아키텍처, 즉 텍스트 전용에 추론이 항상 켜진 형태를 얻게 되며, 아직 독립적인 평가 점수는 없고 데이터센터 하드웨어 비용이 따릅니다. 9월의 코딩 및 에이전트 개선이 중요하다면, 현재 그 기능을 보유한 이름은 둘 중 하나뿐입니다. 재현 가능한 제어가 더 중요하다면, 온전히 소유할 수 있는 이름 역시 둘 중 하나뿐입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
