Qwen3.8-Max 리뷰: $2/$6에 공개된 알리바바의 2.4T 플래그십 — 0902 빌드, Code Arena WebDev 1위
Guides & Insights

Qwen3.8-Max 리뷰: $2/$6에 공개된 알리바바의 2.4T 플래그십 — 0902 빌드, Code Arena WebDev 1위

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Alibaba Qwen이 프리뷰한 Qwen3.8-Max는 2026년 7월 19일 상하이 세계 AI 콘퍼런스에서 공개된 이후 2주 동안, 아무도 실제로 가격을 매길 수 없는 가장 화제가 된 모델이었다. 요금표도, 벤치마크 표도, 모델 카드도, 라이선스도, 활성 파라미터 수치도 없었다. — 그저 2.4조 파라미터라는 헤드라인과 그 모델이 "Claude Fable 5에 이어 두 번째"라는 주장뿐이었다.

2026년 8월 3일, 그 상황은 바뀌었다. Qwen3.8-Max가 일반 공개되었다: 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러로 책정된 공개 요금표, OpenAI 및 DashScope 호환 엔드포인트, 전체 벤치마크 표, 그리고 8월 12일에 공개된 오픈 가중치까지 갖췄다. 일주일 뒤인 8월 14일, 알리바바의 "Day 0 출시 파트너"로서 DigitalOcean Serverless Inference에서 서비스가 시작되었다 — 해당 모델을 서비스한 최초의 주요 서방 클라우드였다. 9월 2일, 알리바바는 명명된 업데이트 버전인 Qwen3.8-Max-0902를 출시했으며, Coding과 Cowork에 대해 추가 후학습을 진행해 복잡한 기업 및 과학 작업에서의 성능을 강화한다고 Qwen은 밝혔다. 이 리뷰는 GA 시점의 사실을 기준으로 작성되었으며, 그 데이-제로 출시와 0902 빌드를 포함해, 이제 모델을 구매할 수 있게 된 팀들이 실제로 갖는 질문에 답한다: Qwen3.8-Max는 프로덕션 트래픽을 처리할 준비가 되었는가, 아니면 여전히 지켜봐야 할 모델인가?

간단히 말하면, 대부분의 예상보다 더 멀리 나아갔다는 것이다. 특히 가격 책정은 최첨단 모델의 가격 체계를 다시 쓰게 할 만큼 공격적이며, 9월 2일 업데이트는 이 모델이 원래 잘하던 두 가지, 즉 코딩과 협업 작업을 더욱 강화한다. 이후 공개된 독립 평가 결과는 확실히 훌륭하지만, 트래픽을 투입하기 전에 읽어볼 만한 주의사항이 따른다.

TL;DR(요약). Qwen3.8-Max가 이제 정식 출시(GA)됐으며, 100만 토큰당 $2/$6 요금이 전체 100만 토큰 컨텍스트에 걸쳐 동일하게 적용되고 장문 프롬프트 추가 요금이 없습니다. 이는 추론 작업의 비용을 좌우하는 출력 측면에서 Kimi K3($3/$15)와 Claude Opus 5($5/$25)보다 저렴한 가격입니다. 알리바바는 인상적인 벤치마크 표(Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1)를 공개했고, 코딩 성능은 이전 모델 대비 극적인 도약을 보여줍니다: FrontierSWE 73.5 대 40.7. 하지만 이 품질 표는 알리바바 자체 자료이며, 첫 독립 평가 기관인 Artificial Analysis Intelligence Index가 이미 평가를 내놓았습니다: Qwen3.8-Max는 과제당 $1.14에 56점을 기록해 Claude Opus 4.8(56)과 동률을 이루고, 오픈 가중치 선두 모델인 Kimi K3(57)에는 과제당 비용이 25% 더 높은 상태에서 1점 뒤처집니다. 활성 파라미터 수는 더 이상 미궁 속에 있지 않습니다. 총 2.4T 중 95B가 활성화된다는 사실이 공식 모델 카드에서 확인되었고, 이를 통해 외부에서도 마침내 서빙 경제성을 가늠할 수 있게 됐습니다. 이 리뷰가 처음 게시된 이후 두 번째 관리형 경로도 열렸습니다. Qwen3.8-Max는 8월 14일 알리바바의 Day 0 파트너인 DigitalOcean Serverless Inference에서 서비스를 시작했으며, DigitalOcean이 발표한 서빙 수치(프리필이 초당 약 16,000토큰까지 확장, 256개 동시 요청에서 초당 약 1,937개 출력 토큰, 오류 0건)는 알리바바가 아닌 제공업체에서 나온 첫 번째 실측 지연 시간 데이터입니다. 9월 2일 알리바바는 플래그십 모델을 Qwen3.8-Max-0902로 업데이트하고 Coding 및 Cowork에 대해 추가 사후 훈련을 진행했습니다. Qwen은 새 스냅샷이 복잡한 엔터프라이즈 및 과학 워크로드에서 더 강력하다고 밝히지만, 이는 공급업체 주장일 뿐 엔터프라이즈나 과학 작업에 대한 독립적인 수치는 아직 없습니다. 0902 빌드의 코딩 측면은 이제 자체 독립 아레나 결과를 확보했습니다. Qwen3.8-Max-0902는 Code Arena: WebDev 리더보드에서 1,691점으로 1위에 데뷔했습니다. 알리바바에 따르면 이는 이전 빌드보다 22점 높은 점수이며 Claude Opus 5와 Kimi K3를 앞선 것입니다. 에이전트 기반 커머스 관련 성과도 같은 주에 스코어보드를 얻었습니다. 알리바바 Accio 팀이 실제 커머스 소프트웨어의 상태 저장(stateful) 복제본으로 구축한 새 벤치마크인 CommerceAgentBench에서 Qwen3.8-Max는 오픈 가중치 모델 중 가장 강력한 결과를 기록했습니다. 세 하네스에서 총 156개 통과로 DeepSeek V4 Pro보다 2개 많은 수치이며, 이는 공급업체가 운영한 표이지 독립 평가 기관의 결과가 아닙니다. 결론: 이 모델은 이제 실제로 도입할 만하며, 실제 평가를 진행할 가치가 있을 만큼 저렴합니다. 다만 전면 도입이 아니라 의도적으로 경로를 설계해 사용하십시오.

주요 시사점

2026년 8월 3일부터 GA입니다. 미리보기 및 크레딧 캠페인 시대는 끝났습니다. 이제 실제 요금표와 실제 엔드포인트가 있습니다.

1M 토큰당 $2 / $6, 1M 컨텍스트에 걸친 단일 플랫 티어. 대부분의 경쟁사는 긴 프롬프트에 추가 요금을 부과한다. Alibaba는 그렇지 않으며, 이는 긴 문서 및 대규모 리포지토리 작업에 매우 중요한 의미를 갖는다.

Alibaba의 벤치마크 결과는 뛰어나지만 검증되지 않았습니다: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, PaperBench 93.0, IFBench 82.8, OSWorld-Verified 86.1, OmniDocBench 1.5 92.1.

코딩의 세대적 도약이 진짜 핵심입니다:FrontierSWE 73.5(기존 40.7) 및 DeepSWE 1.1 56.6(기존 21.6) — 둘 다 거의 두 배에 가까운 증가입니다.

첫 번째 독립 점수가 나왔습니다: Qwen3.8-Max의 점수는 AA Intelligence Index에서 $1.14/태스크당 56점입니다 — 이는 Qwen3.7-Max(46)보다 10점 높고, Claude Opus 4.8(56)과 동급이며, Kimi K3(57)보다 1점 낮습니다. LMArena의 일반 리더보드에는 아직 공개 점수가 없습니다.

활성 파라미터가 95B로 확정되었습니다. 공식 모델 카드에 총 2.4T, 활성화 95B로 명시되어 있어 서빙 비용 산정에서 가장 큰 미해결 과제가 해결되었습니다.

오픈 가중치가 공개되었습니다 — Qwen3.8-2.4T-A95B(BF16)와 Qwen3.8-2.4T-A95B-FP8이 8월 12일 Apache 2.0이 아닌 맞춤형 Qwen3.8-Max 라이선스로 Hugging Face에 등재되었습니다. Qwen3.8-27B 온프레미스 버전은 8월 14일 Apache 2.0 라이선스로 출시되었습니다.

두 번째 관리 경로가 8월 14일에 열렸습니다.Qwen3.8-Max는 알리바바의 "Day 0 출시 파트너"로서 DigitalOcean Serverless Inference에서 제공됩니다. NVIDIA HGX B300의 NVFP4, $2/$6 및 캐시 입력 시 $0.20, 공개 체크포인트의 기본 262K 컨텍스트로 서비스됩니다. DigitalOcean의 측정 수치(프리필 약 16K 토큰/초, 256 동시성에서 오류 0)는 알리바바 외부 관리 플랫폼에서의 첫 번째 서빙 성능 데이터입니다.

9월 2일 업데이트: Qwen3.8-Max-0902.알리바바는 플래그십 모델을 Coding 및 Cowork로 추가 사후 학습시켜 동일한 $2/$6 가격과 1M 컨텍스트로 QwenCloud에서 서비스하고 있습니다. Qwen은 엔터프라이즈 및 과학 성능이 더욱 강력해졌다고 밝혔지만, 이는 여전히 공급업체의 주장에 불과합니다. 한편 코딩 성능 부문은 같은 날 독립적인 아레나 결과를 얻었는데, 해당 빌드는 Code Arena: WebDev에서 1,691점으로 1위에 데뷔했습니다(아래 Code Arena 항목 참조).

CommerceAgentBench: 오픈 웨이트 선두, 벤더 주관. 알리바바의 Accio 팀은 이번 주 CommerceAgentBench를 공개했다. 실제 상거래 및 비즈니스 소프트웨어의 상태 저장 복제본 안에서 실행되는 107개의 장기 실행 작업으로, Accio, OpenClaw, Pi 하네스에서 상태 기반으로 평가된다. Qwen3.8-Max는 총 156회 통과로 오픈 웨이트 모델 중 선두를 차지했으며, DeepSeek V4 Pro보다 2회 앞선다. 클로즈드 모델인 Claude Opus 5는 191회로 전체 1위를 기록했다. 다만 이 순위표는 알리바바가 자체적으로 작성한 것으로, 독립적인 평가 기관의 결과가 아니다.

Code Arena: WebDev #1 — 0902 빌드의 독립 아레나 결과. Qwen3.8-Max-0902는 Code Arena: WebDev 리더보드에서 1,691점을 기록하며 1위로 데뷔했습니다. 이는 이전 빌드보다 22점 오른 수치이며, Claude Opus 5와 Kimi K3를 앞선 결과입니다. 또한 이 모델은 해당 보드의 비용-성능 파레토 프런티어에서 선두를 차지하는데, 혼합 기준 약 $5/MToken으로 Claude Opus 5의 혼합 가격의 약 4분의 1 수준입니다. Qwen의 공식 QwenCloud 계정이 이 순위를 확인했습니다. CommerceAgentBench와 달리 이 보드는 제3자 운영이며, 알리바바의 벤치마크 표가 아닌 블라인드 인간 투표 아레나입니다. 다만 '1위 데뷔'는 알리바바가 특정 시점의 순위표에 대해 발표한 것일 뿐입니다.

정확성 참고: 이 리뷰의 {{1}}Qwen3.8-Max 벤치마크 표{{/1}}는 {{2}}Alibaba가 보고한 수치{{/2}}이며 {{3}}독립적으로 재현된 바 없습니다{{/3}}. {{4}}Artificial Analysis Intelligence Index 점수(작업당 $1.14, 56점){{/4}}는 Alibaba의 공식 API를 대상으로 AA가 독립 측정한 값으로, 이 모델에 대한 첫 번째 독립 평가 기관입니다. {{5}}가격은 Alibaba Model Studio의 GA 요금표에서 가져온 것입니다{{/5}}. {{6}}오픈 가중치 저장소(Qwen3.8-2.4T-A95B 및 Qwen3.8-2.4T-A95B-FP8){{/6}}, {{7}}95B 활성 수치{{/7}}, {{8}}라이선스 텍스트{{/8}}는 모두 1차 자료입니다. 즉, Qwen 자체 Hugging Face 조직에서 제공된 것이며 2026년 8월 13일에 검증했습니다. {{9}}DigitalOcean 가용성, 요금표, 서빙 성능 측정값, 그리고 양자화 빌드에서의 GPQA 스팟 점검 결과 88점{{/9}}은 DigitalOcean 자체 문서와 커뮤니티 튜토리얼에서 나온 것으로, 8월 14일 발표와 함께 게재되었습니다. {{10}}"Day 0 출시 파트너"라는 표현{{/10}}은 Alibaba의 발표 문구입니다. 경쟁사 수치를 인용한 경우 해당 수치는 Artificial Analysis 또는 본문에 명시된 공급업체에서 가져온 것입니다. {{11}}9월 2일에 발표된 Qwen3.8-Max-0902 업데이트{{/11}}는 전체가 공급업체 명시 사항입니다. {{12}}사양, Coding-and-Cowork 사후 학습 설명, 그리고 주장된 엔터프라이즈 및 과학 분야 성과{{/12}}는 모두 Qwen 자체 발표와 QwenCloud 모델 페이지에서 가져온 것이며, 그 수치 중 어느 것도 독립적으로 재현되지 않았습니다. 벤치마크 섹션에서 다루는 {{13}}Code Arena: WebDev 순위{{/13}}는 유일한 예외입니다. 해당 보드는 Alibaba 표가 아닌 {{14}}제3자 블라인드 투표 아레나{{/14}}입니다. 다만 {{15}}'1,691점으로 1위 데뷔'{{/15}}는 특정 시점의 순위표에 대한 Alibaba의 발표이며, 아레나 점수는 투표가 누적됨에 따라 계속 변동합니다. 아래에서 다루는 {{16}}CommerceAgentBench 결과{{/16}}도 같은 범주에 속합니다. 해당 벤치마크는 {{17}}Alibaba International의 팀인 Accio{{/17}}가 구축·게시했으므로 그 표는 Alibaba가 보고한 것입니다. 오픈소스 벤치마크이긴 하나, Artificial Analysis와 같은 의미의 독립 평가 기관은 아닙니다. 공급업체 벤치마크 표는 일반적으로 낙관적으로 작성됩니다. 따라서 이를 확정된 순위가 아니라 자체 워크로드에서 테스트할 가설로 취급하십시오.

Qwen3.8-Max는 무엇인가요?

Qwen3.8-Max는 알리바바 Qw​en 제품군의 플래그십 모델로, 총 2.4조 개의 파라미터를 가진 희소 혼합 전문가(sparse Mixture-of-Experts) 모델이며, 100만(1M) 토큰 컨텍스트 창과 네이티브 멀티모달 입력을 지원합니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 출력합니다. thinking 모드, 함수 호출(function calling), 내장 도구, 구조화된 출력을 지원하며, OpenAI 호환 /v1/chat/completions 엔드포인트로 제공되므로 대부분의 기존 통합은 재작성 대신 base-URL 변경만으로 충분합니다. 9월 2일에 출시된 현재 프로덕션 스냅샷은 Qwen3.8-Max-0902로, Coding 및 Cowork에 대해 추가 사후 학습이 적용되었습니다.

실제 컨텍스트 수치는 마케팅에서 말하는 "1M"보다 약간 더 구체적입니다. 알리바바의 클라우드 메타데이터는 983,616-토큰 윈도우 (thinking이 활성화된 상태), 최대 입력 약 991K 토큰, 그리고 최대 출력 131,072 토큰을 나열합니다. 이 출력 상한은 이례적으로 넉넉하며, 파일 전체 코드 생성이나 긴 보고서 작성 같은 작업에서 중요합니다. 상한이 낮으면 청크로 나누고 이어 붙여야 하기 때문입니다. DigitalOcean이 현재 제공하는 오픈 체크포인트는 구성이 다릅니다. 해당 모델 카드에는 기본적으로 262,144 토큰이 나열되며, 약 1,010,000까지 확장할 수 있습니다. 따라서 오픈 베이스를 실행하는 타사 서비스는 일반적으로 더 작은 기본 토큰 수에 도달하게 됩니다.

활성 파라미터 수는 이제 공개되었으며, 저장소 이름에 그 값이 포함되어 있습니다: A95B는 950억 개의 활성 파라미터를 의미합니다. Qwen3.8-2.4T-A95B의 공식 모델 카드에는 "총 2.4T, 활성 95B"라고 명시되어 있으며, 이는 512개의 전문가를 가진 세분화된 Mixture-of-Experts로, 토큰당 10개의 라우팅 전문가와 1개의 공유 전문가가 활성화됩니다. 이 숫자는 2.4T라는 헤드라인보다 더 중요합니다. 덴스(dense) 모델의 경우 총 파라미터 수는 대략적인 추론 비용을 알려주지만, MoE 모델의 경우 총 파라미터 수는 거의 아무것도 알려주지 않습니다. 오직 활성 파라미터 수만이 중요합니다. 실제로 토큰당 실행되는 것이 바로 그 활성 수이기 때문입니다. 30B를 활성화하는 2.4T 모델은 200B를 활성화하는 모델과 지연 시간 및 서빙 비용 측면에서 완전히 다른 방식으로 동작합니다. 활성 95B에서 토큰당 계산량은 대략 90B 규모의 덴스 모델과 같은 수준에 해당하며, 이는 덴스 2.4T가 요구하는 것의 극히 일부입니다. 바로 이 숫자가 아래의 셀프 호스팅 질문에 마침내 답할 수 있게 해주는 수치입니다.

9월 2일 업데이트: Qwen3.8-Max-0902

2026년 9월 2일, Qwen은 첫 번째 이름이 붙은 프로덕션 리프레시(production refresh)를 출시했습니다. Qwen3.8-Max-0902는 동일한 2.4T 파라미터 스파스 MoE 아키텍처, 동일한 95B 활성 파라미터, 동일한 1M 토큰 컨텍스트 윈도를 유지하지만, Coding 및 Cowork라는 두 가지 역량에 대해 추가로 후속 훈련(post-training)되었으며, QwenCloud API에서 qwen3.8-max-0902(qwen3.8-max-2026-09-02로도 등재됨)로 제공됩니다. 이는 사이드 브랜치가 아닌 현재 권장 빌드입니다. Alibaba의 날짜 미지정 qwen3.8-max 엔드포인트는 이제 0902 스냅샷을 서비스하므로, 표준 모델 이름으로 호출하면 리프레시 버전으로 연결되고, 날짜가 포함된 ID는 정확한 빌드를 고정하려는 팀을 위한 것입니다. 9월 3일부터 이 스냅샷은 제3자 관리형 API에서도 자체 라우팅 가능한 모델 ID로 등재되었습니다. 요금표는 변동이 없습니다: 입력 1M당 $2, 출력 1M당 $6, 캐시 요금도 동일합니다.

성능 주장은 Qwen의 자체 주장입니다. 발표 자료와 QwenCloud 모델 페이지에는 엔지니어링 규모의 프로젝트와 장기 자율 개발에서 "새 지평을 여는" 코딩 역량, 다중 도구 오케스트레이션과 엔드투엔드 작업 전달에 걸친 "대폭 강화된" 협업 에이전트 경험, 그리고 회사의 표현대로 복잡한 엔터프라이즈 작업, 과학 연구, 장주기 워크플로우에서의 더 강력한 성능이 설명되어 있습니다. 첫 번째 독립 검증은 같은 날 이뤄졌습니다. Qwen3.8-Max-0902는 에이전트 웹 개발을 위한 제3자 블라인드 투표 아레나(구 WebDev Arena)인 Code Arena: WebDev 리더보드에서 1위로 데뷔했습니다. 알리바바가 실시간 리더보드를 인용해 밝힌 바에 따르면, 1,691포인트로 이전 빌드보다 22포인트 높았고 Claude Opus 5와 Kimi K3를 앞질렀습니다. Qwen 공식 계정도 같은 날 QwenCloud API를 지목하며 이 순위를 확인했습니다. 이것이 무엇을 증명하고 무엇을 증명하지 못하는지는 아래 벤치마크 섹션에서 자세히 다룹니다. 이번 업데이트의 나머지 주장(엔터프라이즈 추론, 과학 업무, 일반적인 장기 자율성)은 여전히 공급업체의 자체 주장이므로, 8월 표에 적용했던 규율을 유지하십시오. Artificial Analysis의 평가나 실제 워크로드가 확인할 때까지 해당 주장을 가설로 취급하십시오.

"Cowork"가 실제로 의미하는 바는 바로 이번 리프레시가 흥미로워지는 지점입니다. GA 시대의 Qwen3.8-Max는 이미 장기 자율성, 즉 16일간의 oh-my-cli 빌드와 2,000라운드가 넘는 가상 비즈니스에 기대고 있었습니다. 그리고 0902 빌드는 알리바바가 그 축에 한층 더 무게를 실은 것입니다. 즉, 단발성 답변이 아니라 여러 도구를 조율하여 작업을 처음부터 끝까지 완수하는 에이전트를 지향합니다. 같은 주에 알리바바의 Accio 팀은 그 축을 직접 측정하기 위한 벤치마크인 CommerceAgentBench를 발표했습니다. 실제 상거래 및 비즈니스 소프트웨어의 상태 저장 복제본 안에서 수행되는 107개의 장기 자율 작업으로 구성된 이 벤치마크에서 Qwen3.8-Max는 오픈웨이트 모델 중 선두를 달리고 있습니다. 자세한 내용은 아래 벤치마크 섹션에서 확인할 수 있습니다. 기업 업무용으로 이 모델을 평가하는 팀에게 이 주장은 가장 먼저 테스트해봐야 할 부분입니다. 벤치마크 표만으로는 검증하기 가장 어려운 주장이기 때문입니다.

가격 책정: 이번 출시에서 가장 공격적인 부분

Alibaba Model Studio에는 Qwen3.8-Max가 다음 가격으로 등재되어 있습니다: 입력 토큰 1M개당 $2.00, 출력 토큰 1M개당 $6.00. 출력에는 생각 토큰이 포함되며, 추론 중심 구성은 내부 추론을 출력 요율로 청구하므로 이는 중요한 고려 사항입니다. 캐시 경제성: 캐시된 입력 히트의 비용은 $0.25 1M당, 명시적 캐시 생성은 $2.50, 그리고 명시적 캐시 읽기는 $0.17입니다.

구조적으로 흥미로운 부분은 헤드라인 숫자가 아니라 플랫 티어다. 알리바바는 프롬프트가 5,000 토큰이든 900,000 토큰이든 동일하게 $2/$6를 청구한다. 대부분의 경쟁사는 거의 백만 토큰에 달하는 프롬프트를 서비스하는 것이 비싸기 때문에 정확히 긴 컨텍스트 할증료를 적용한다. 알리바바가 그 비용을 흡수하는 것은 의도적인 영토 확보로, 긴 컨텍스트가 핵심인 작업, 즉 전체 저장소 코드 리뷰, 계약 및 문서 분석, 다중 문서 연구 종합을 정확히 겨냥한 것이다.

풀이 예시. 가령 레포 분석 에이전트를 실행한다고 해 보자: 호출당 코드 컨텍스트 입력 토큰 200,000개와 출력 토큰 8,000개.

호출당: 0.2M × $2 = $0.40 입력, 더하기 0.008M × $6 = $0.048 출력. ≈ 호출당 $0.45.

하루 1,000콜 기준: ≈ $448/일, 또는 월 약 $13,400입니다.

Claude Opus 5에 대한 동일한 호출, $5/$25 기준: $1.00 + $0.20 = $1.20 — 약 2.7배 더.

안정적인 코드 컨텍스트에서 프롬프트 캐싱을 사용하면, $0.25의 캐시된 입력은 입력 측 비용을 $0.40에서 $0.05로 낮추어, 호출 비용은 ≈ $0.10이 됩니다 — 반복 트래픽에서 거의 4.5배의 절감 효과입니다.

실제 예산의 핵심은 바로 그 캐시 차등(cache differential)에 있습니다. 에이전트가 매 턴마다 거의 변경되지 않은 컨텍스트를 다시 읽는다면 — 대부분의 코딩 및 지원 에이전트가 여기에 해당합니다 — 실효 가격은 $2/$6보다 $0.25/$6에 훨씬 가깝습니다. 캐시 구성을 건너뛰는 팀은 이 모델에서 통상적으로 3~4배를 초과 지불하게 됩니다.

비교를 위해 정가 기준으로 살펴보면: Qwen3.8-Max는 $2/$6, 전작인 Qwen3.7-Max는 $2.50/$7.50, Kimi K3는 $3/$15, GPT-5.6 Terra는 $2/$12, Claude Opus 5는 $5/$25입니다. 입력 측면에서 Qwen은 그저 경쟁력이 있을 뿐입니다.출력의 경우 — 추론·에이전트 작업에서 지출을 좌우하는 측면 — 그 목록에서 가장 저렴한 프런티어를 표방하는 모델입니다.

Artificial Analysis의 독립적인 측정은 그 값싼 토큰들의 이면을 드러낸다. Intelligence Index에서 Qwen3.8-Max의 비용은 태스크당 $1.14 — 전작의 $0.53보다 두 배 이상이며, Kimi K3의 $0.86보다 25% 더 높다 Kimi K3는 토큰당 $3/$15로 공시되어 있음에도 불구하고 말이다. 그 격차는 가격 인상이 아니라 행동 방식에서 비롯된다: 이 모델은 평균 GDPval-AA 태스크당 64단계를 수행한 반면 Qwen3.7-Max는 14단계였다, 그리고 하네스가 각 단계에서 전체 대화를 다시 전송하기 때문에 입력 토큰은 약 15배, 출력 토큰은 약 45% 증가했다. 값싼 토큰이 값싼 에이전트를 의미하지는 않는다 — 미리보기 테스터들이 지적한 장황함은 이제 측정 가능한 비용으로 드러났다. OrcaRouter가 하나의 OpenAI 호환 엔드포인트 뒤에서 0% 마크업으로 공시 가격을 그대로 통과시키기 때문에, $1.14 대 $0.86의 문제는 추가 계약 없이 동일한 프롬프트에서 측정할 수 있다.

벤치마크 표, 그리고 각 숫자가 실제로 측정하는 내용

GA에서 Alibaba는 프리뷰에서 공개하지 않았던 표를 게재했습니다. 보고된 점수:

Terminal-Bench 2.1 — 86.6.모델이 실제 셸을 끝까지 작동할 수 있는지 측정합니다: 명령 실행, 출력 읽기, 오류 복구. 이것은 '코드 제안자가 아닌 코딩 에이전트로 기능할 수 있는지'에 대한 가장 근접한 대리 지표입니다.

GPQA Diamond — 92.6.대학원 수준의 물리학, 화학, 생물학 문제로, 단순 검색으로 답을 찾기 어렵게 설계되었습니다. 높은 점수는 회상이 아닌 진정한 과학적 추론을 나타냅니다. 92.6은 현재 해당 분야 최고 수준입니다.

PaperBench — 93.0. 연구 논문의 결과 재현 — 방법론을 읽고 이를 다시 구현하는 작업입니다. 지속적인 다단계 이해를 보상합니다.

IFBench — 82.8. 제약 조건 하에서의 지시 수행: 형식, 길이, 부정 지시. 특히 알리바바 자체 표에서 가장 낮은 점수로, 이는 모델이 범위 제한을 무시할 정도로 철저하다는 프리뷰 시절의 불만과 일치한다.

OSWorld-Verified — 86.1. 컴퓨터 사용: 실제 데스크톱 GUI를 조작하여 작업을 완료합니다. 이 분야에서의 강점이 에이전트 포지셔닝을 뒷받침합니다.

OmniDocBench 1.5 — 92.1. 문서 파싱 — 표, 레이아웃, 혼합 텍스트 및 그림. 1M 플랫레이트 컨텍스트와 페어링되어 문서 파이프라인에 대한 실질적인 사례를 만들어냅니다.

FrontierSWE — 73.5, 이전 버전의 40.7에서 상승. DeepSWE 1.1 — 56.6, 21.6에서 상승.

마지막 두 가지는 강조할 가치가 있다. 한 세대 만에 어려운 소프트웨어 엔지니어링 벤치마크에서 거의 두 배에 달하는 향상을 보인 것은 정상적인 점진적 개선이 아니며, 이는 알리바바가 이 모델을 채팅 사용자가 아닌 개발자에게 마케팅하기로 한 결정과 일치한다. FrontierSWE 수치가 독립적인 재현 검증을 통과한다면, Qwen3.8-Max는 단순히 큰 모델이 아니라 진지한 코딩 모델이다.

프리뷰에서 제기된 주의사항은 줄어들었지만 사라지지는 않았다. 위 표는 알리바바가 자체 하네스에서, 다른 누구도 검증할 수 없는 조건으로 만들어 낸 결과다. 벤더의 표는 표본 추출이 아니라 선별된 것이다. 연구소들은 자기들에게 유리한 벤치마크만 공개한다. 하지만 8월 6일 기준으로 이제 진정한 독립 심판이 등장했다. Artificial Analysis는 Qwen3.8-Max를 Intelligence Index에서 태스크당 $1.14로 56점이라고 평가했다. 이 점수는 알리바바 공식 API에서 측정된 결과로, 전작의 46점보다 10점 높으며 Claude Opus 4.8(56)과 동률이고 Kimi K3(57)보다 1점 낮다. AA의 에이전틱 GDPval-AA 리더보드에서 이 모델은 1,739 Elo를 기록해 Kimi K3(1,685)와 GPT-5.6 Sol(1,730)을 제쳤으며, 앞에는 Claude Opus 5(1,852)만 남았다. AA 자체의 주의사항도 동등한 비중으로 고려해야 한다. 앞선 실행에서는 엔드포인트 문제가 해결되기 전에 53점을 기록했고, 공식 API 재테스트에서는 56점이 나왔다. AA-Omniscience는 환각률이 23%에서 40%로 치솟으며 10점 하락했다. 태스크당 비용이 높은 것도 정확히 이 모델이 훨씬 더 많은 단계를 거치며 연산하기 때문이다. LMArena의 종합 리더보드에는 여전히 공개된 점수가 없다.

DigitalOcean 출시로 세 번째 데이터 포인트가 추가됐습니다. 이번에는 플래그십이 아니라 양자화된 빌드에 대한 것이었습니다. DigitalOcean이 서빙하는 NVFP4 가중치에 대한 자체 내부 점검에서 기록한 값은 GPQA Diamond 88점이었습니다. 이는 알리바바가 발표한 비양자화 플래그십의 92.6점과 대비됩니다. DigitalOcean은 이 비교를 "통제된 비교라기보다는 참고용 데이터 포인트"라고 지적합니다. 차이는 세 가지 축에서 발생합니다(호스팅된 플래그십이 아닌 오픈 가중치 기반, BF16이 아닌 NVFP4, 그리고 서로 다른 평가 스택). 그럼에도 이는 해당 가중치의 실제 서빙 배포에 대한 최초의 독립적 검증이며, 오픈 체크포인트가 알리바바 표의 숫자와 바이트 단위로 일치하지 않는다는 점을 상기시킵니다.

CommerceAgentBench: 에이전틱 커머스 스코어보드

이번 리프레시와 함께, Alibaba International의 Accio 팀은 Qwen이 계속해서 홍보해 온 장기 작업을 정확히 평가하도록 설계된 벤치마크인 CommerceAgentBench를 출시했다. 에이전트는 실제 커머스 및 비즈니스 소프트웨어의 오프라인 복제본 14개 중 하나의 새 컨테이너 안에서 각 작업을 시작한다 — 제품 게시, 화물 예약, 스토어프론트 관리, 결제 운영, 공급업체 분석 — 그리고 평가는 상태 기반이다. 기본 목(mock) 서비스와 생성된 파일이 실제로 변경되어야만 작업이 통과하므로, 상태를 바꾸지 않고 그럴듯한 워크플로를 서술만 하는 에이전트는 점수를 얻지 못한다. 이 스위트는 CLI, 브라우저, 파일/문서, API/MCP 인터페이스에 걸쳐 107개 작업을 실행하며, Accio, OpenClaw, Pi라는 세 가지 하네스를 통해 수행된다. 하네스 코드(Apache 2.0)와 작업 데이터(CC BY 4.0)는 검토나 재실행을 위해 공개되어 있다.

공개된 결과표에서 Qwen3.8-Max는 {{1}}가장 뛰어난 오픈웨이트 성적을 기록했다: Accio 하네스에서 107개 태스크 중 56개, OpenClaw에서 47개, Pi에서 53개 — {{/1}}{{2}}통과 합계 156건으로 DeepSeek V4 Pro의 154건보다 2건 앞선다.{{/2}} 오픈웨이트 우위는 전적으로 Accio 하네스에서 나왔으며, {{3}}두 모델은 OpenClaw와 Pi에서 동률이다.{{/3}} 오픈웨이트 1위가 곧 전체 1위는 아니다: {{4}}클로즈드 모델인 Claude Opus 5가 통과 합계 191건으로 35건 차이를 두고 전체를 압도한다.{{/4}} 그리고 이 표는 알리바바 자체 산출물이다 — Accio는 알리바바 팀이며, 저장소 자체도 감사 한계를 명시한다: {{5}}Accio 하네스는 참조 전용이며 체크아웃만으로는 재현할 수 없다(재실행 가능한 경로는 OpenClaw다).{{/5}} {{6}}태스크 수준 결과에는 불변의 공개 체크섬이 없고,{{/6}} {{7}}Qwen의 행은 비교 가능성을 유지하기 위해 추론 내용 재생 프로토콜에 의존했다.{{/7}} 이는 OSWorld-Verified와 AA의 GDPval-AA가 서로 다른 각도에서 접근하는 동일한 에이전틱 축에 대한 벤더 명시 데이터 포인트로 취급하라 — {{8}}자체 워크플로우에서 시험해볼 가치가 있는 것이지, 확정된 순위가 아니다.{{/8}}

Code Arena WebDev: 0902 빌드의 독립 심판

Code Arena는 이번 리프레시에 빠져 있었던 독립적 증거다. Code Arena는 에이전트형 웹 개발을 위한 제3자 리더보드로, 이전에 WebDev Arena로 알려진 프로젝트다. 이곳에서는 사용자가 어떤 모델의 결과물을 실제로 출시하고 싶어 하는지를 두고 진행되는 블라인드 방식의 쌍별 인간 투표가 Elo 방식 레이팅으로 전환된다. WebDev 보드에서 Qwen3.8-Max-0902는 1,691점으로 1위에 데뷔했다. 이는 이전 빌드보다 22점 높은 점수이며, Claude Opus 5와 Kimi K3를 앞선 수치다. 이 순위에는 비용 효율성 우위도 따른다. 웹앱 생성이 실제로 만들어 내는 출력 중심 구성에 가중치를 둔 $2/$6 정가 요금 기준의 블렌디드 약 $5/백만 토큰 가격에서, 0902 빌드는 이 보드의 파레토 프론티어에서 가장 높은 점수를 받은 모델이다. 비용은 Claude Opus 5의 블렌디드 가격(약 $20/M)의 약 4분의 1이며 Kimi K3의 약 $12/M보다 훨씬 낮다. 그래서 점수 2위와 3위를 차지한 두 모델은 프론티어에서 벗어나 있다. 알리바바는 9월 2일에 이 순위를 발표했고, Qwen 공식 계정도 이를 확인하며 사용자들을 QwenCloud로 안내했다. 이 측정 결과는 알리바바가 산출한 것이 아니다. 위의 벤치마크 표나 바로 위의 CommerceAgentBench 실행과 달리, 이 점수는 인간 선호 투표를 바탕으로 제3자 아레나가 산출한 것이다.

이를 신뢰할 수 있게 만드는 두 가지 주의사항이 있습니다. 첫째, 아레나 등급은 특정 시점의 값입니다. 1,691은 알리바바가 데뷔를 발표했을 당시 리더보드에 표시된 점수이며, 표가 쌓이면서 계속 변동될 것입니다. 따라서 웹 개발 코딩에 대한 강력한 신호로 읽되, 영구적인 왕관으로는 보지 마십시오. 둘째, 이 등급은 하나의 축만 다룹니다. 이번 리프레시의 엔터프라이즈, 과학, 일반적 장기 전망에 대한 주장에는 여전히 독립적인 심판이 없으며, 그렇기에 에이전틱 프런트엔드 작업 밖의 모든 것에 대해서는 벤더 표와 기본 모델의 AA Index 56이 기준점으로 남아 있습니다. 셋째, 최첨단 가격은 모델링 선택이지 새로운 요금표가 아닙니다. 약 5달러/MToken 수치는 변함없는 2달러/6달러 목록을 출력 중심 사용 가정으로 혼합한 값이므로, 알리바바의 재가격 책정이 아니라 아레나의 기준에 따른 비용 효율성 순위로 보아야 합니다.

오픈 가중치, Qwen3.8-27B, 그리고 온프레미스 문제

알리바바의 오픈웨이트 약속이 이제 지켜졌다. 2026년 8월 12일, Qwen은 Hugging Face에 두 개의 저장소를 게시했다 — BF16 형식의 Qwen3.8-2.4T-A95B와 Qwen3.8-2.4T-A95B-FP8 — 각각 213개의 가중치 파일이 포함되어 있다. 라이선스는 Apache 2.0이 아닌 맞춤형 Qwen3.8-Max 라이선스이며, Hugging Face의 라이선스 필드에는 "other"로 표시된다. 조건은 출처 표시와 함께 사용, 수정, 배포, 파인튜닝 및 상업적 사용을 허용하며, 두 가지 규모 기반 게이트가 추가된다: 월간 활성 사용자 1억 명 이상 또는 월 매출 2천만 달러 이상의 제품은 모델 이름을 눈에 띄게 표시해야 하며, Model-as-a-Service 또는 AI-Work-Assistant 비즈니스의 경우 지난 12개월 누적 매출이 5천만 달러를 초과하면 Qwen과의 별도 라이선스가 필요하다. 대부분의 팀은 이러한 게이트 내에 있으며, 비즈니스가 이를 초과한다면 그 위에 구축하기 전에 라이선스 텍스트를 읽어야 한다. 다운로드 카운터도 최근 공개를 뒷받침한다 — 이 글을 쓰는 시점에 BF16 저장소 978회, FP8 저장소 3,851회로, 프런티어 릴리스치고는 낮은 수치이며, 8월 8일에 생성되어 8월 12일에만 공개로 전환된 저장소와 일치하고, 일주일 동안 공개된 상태로 있었던 저장소와는 맞지 않는다. 한 가지 더 솔직한 참고 사항: 오픈 체크포인트는 텍스트 전용이며 사고(thinking) 모드가 항상 켜져 있는 기본 모델인 반면, 호스팅된 Qwen3.8-Max API는 비전 입력, 선택적 비사고 모드, 전체 1M 컨텍스트를 추가한다 — 가중치를 다운로드하면 모델을 얻을 수 있지만 모든 API 기능을 얻는 것은 아니다.

플래그십 모델의 자체 호스팅은 여전히 대부분의 팀에게는 불가능하지만, 이제는 그 불가능함이 정확한 수치로 계산됩니다. 전체 2.4T 파라미터 가중치 세트는 BF16 기준 약 4.9TB, FP8 기준 약 2.4TB입니다. 토큰당 95B만 활성화되더라도 모든 전문가(expert)가 메모리에 상주해야 하기 때문입니다. 4비트 양자화 기준으로는 약 1.2TB이며, H200 한 대당 약 141GB를 감안하면 단일 토큰을 서빙하기도 전에 최상위 가속기 8대 이상이 필요합니다. 이제 공개된 활성 파라미터 수가 보여주는 것은 처리량 측면입니다. 토큰당 95B가 활성화되므로 토큰당 연산량은 약 90B급 밀집(dense) 모델과 비슷한 수준이며, 밀집 2.4T 모델이 부과할 비용의 극히 일부에 불과합니다. 따라서 가중치가 메모리에 상주하기만 하면 토큰당 비용은 전체 파라미터 수가 암시하는 것만큼 부담스럽지 않습니다. 큰 메모리 풋프린트와 온건한 토큰당 연산량의 조합은 바로 알리바바가 출력 가격을 1M 토큰당 $6로 책정할 수 있는 이유이며, 자체 호스팅 팀에게는 단일 GPU가 아닌 FP8 체크포인트를 실행하는 멀티 GPU 노드를 가리키는 셈입니다.

DigitalOcean의 서빙 선택은 그 수학이 프로덕션에서 작동하는 실제 사례입니다. 2.4T 가중치가 단일 노드에 들어맞도록 특별히 NVIDIA HGX B300 GPU에서 NVFP4로 양자화된 모델을 실행하여 노드 간 전문가 라우팅을 피합니다 — 이는 이 섹션이 종이 위에서 해온 4비트 경제학의 실제 배포입니다. 트레이드오프는 위의 GPQA 스팟 체크가 정량화하는 바로 그 것입니다: 더 작은 풋프린트, 그러나 양자화되지 않은 플래그십에 비해 품질에서 측정 가능한 비용이 듭니다.

이 때문에 Qwen3.8-27B는 대부분의 독자에게 더 의미 있는 릴리스이며, 플래그십과 달리 가중치가 예정대로 공개됐다. 2026년 8월 14일, Qwen은 Qwen/Qwen3.8-27B를 Apache 2.0 라이선스로 Hugging Face와 ModelScope에 게시했다. 이 모델은 네이티브 멀티모달을 지원하는 덴스(dense) 27B 모델로, 기본 컨텍스트가 262K 토큰이며 1M까지 확장할 수 있고, 설정 가능한 reasoning_effort 모드를 갖췄다. Unsloth의 Daniel Han은 이 모델이 약 17GB의 VRAM, 즉 프로슈머용 그래픽카드 한 장으로 실행될 것이라고 추산했는데, 이제 실제로 테스트할 수 있다. 공식 저장소에는 BF16 safetensors(18개 샤드, 약 55.6GB)가 포함돼 있으며, GGUF 양자화 버전은 커뮤니티 저장소에서 잇따라 제공된다. 이로써 이번 세대의 출시 패턴이 완성됐다. 2.4T 플래그십의 가중치가 8월 12일에 먼저 공개됐고, 소규모 온프레미스 경로용 모델이 이틀 뒤 출시된 것이다. 우리는 Qwen3.8-27B 출시일 게시물에서 이번 출시를 추적했다.

Qwen3.8-Max가 적합한 곳: 네 가지 시나리오

1. 장문 문서 및 계약 분석. 이것이 가장 적합합니다. 1M 토큰 전체에 대한 정액 요금과 OmniDocBench 92.1은 추가 요금이나 청크 분할 없이 한 번의 호출로 400페이지 분량의 서류를 처리할 수 있음을 의미합니다. 장기 컨텍스트 프리미엄을 부과하는 경쟁사들은 동일한 작업을 훨씬 더 비싸게 만듭니다. DigitalOcean 경로에서는 해당 경로가 262K 컨텍스트에서 오픈 베이스를 제공한다는 점을 기억하세요. 여전히 큰 분량이지만 전체 100만 개는 아닙니다.

2. 레포 규모 코딩 에이전트.Terminal-Bench 86.6과 FrontierSWE 73.5가 이를 뒷받침하며, 캐시 가격 정책 덕분에 안정적인 코드베이스에서의 반복 작업 비용이 낮아졌습니다. 가장 먼저 테스트할 것은 자체 동시성 환경에서의 지연 시간입니다. 프리뷰 기간의 리뷰어들은 모델이 철저하지만 긴 에이전트 실행에서는 느리다고 평가했고, GA 서빙은 프리뷰 서빙과는 다른 양상을 보이기 때문입니다. AA의 GDPval-AA 결과(작업당 64단계를 사용해 선두권인 1,739 Elo 달성)는 이 트레이드오프의 양면을 독립적으로 확인해 줍니다. DigitalOcean의 8월 12일 측정 결과(256개 동시 요청에서 오류 없이 포화 상태도 발견되지 않으며 총 처리량이 ~1,937 출력 토큰/초까지 거의 선형적으로 확장)는 이 문제에 대한 최초의 관리형 플랫폼 데이터 포인트입니다. 다만 이는 DigitalOcean 자체 서빙에 대한 자체 수치일 뿐, Alibaba와의 직접 비교는 아닙니다.

3. 문서 및 스크린샷 파이프라인. 비디오·이미지 입력과 OSWorld-Verified 86.1은 화면을 읽는 워크플로우(QA 자동화, 스크린샷 기반 지원 분류, RPA 관련 작업)에서 신뢰성을 갖춥니다. 다시 말해, 멀티모달 입력은 호스팅 API 기능이며, DigitalOcean 오픈 베이스 경로는 텍스트 전용입니다.

4. 아직 적용하지 않을 곳. 지연 시간에 민감한 대화형 UX와 재현 가능한 평가가 필요한 규제 대상 워크로드입니다. 첫 번째의 경우, 통제된 측정 처리량이 필요합니다. 두 번째의 경우, 재현성에는 이제 모델 카드와 인용 라이선스가 있지만, 알리바바의 벤치마크 표는 아직 복제되지 않았습니다. 그리고 AA의 Omniscience 회귀(환각 발생률 최대 40%)는 독립 점수가 양방향으로 작용한다는 점을 상기시켜 줍니다.

Qwen3.8-Max에 액세스하는 방법

실용적인 방법은 여러 가지가 있습니다. Alibaba Model Studio / DashScope를 통한 직접 연결 또는 Qwen 자체의 QwenCloud API를 사용하면 위의 요금표와 날짜가 표시된 새로운 스냅샷에 대한 가장 빠른 액세스 권한을 얻을 수 있습니다. — 9월 2일자 Qwen3.8-Max-0902 빌드는 다른 엔드포인트로 출시되기 전에 그곳에 먼저 나타났습니다. — 단, 새 공급업체를 도입하고 또 다른 키를 관리해야 하는 비용이 따릅니다. Qwen Chat과 Qwen App은 코드를 작성하기 전에 동작을 빠르게 살펴볼 수 있는 가장 빠른 방법입니다. Hugging Face에서 오픈 가중치를 다운로드하는 것은 자체 인프라를 실행하려는 팀을 위한 네 번째 경로입니다. 위에서 언급한 크기와 라이선스 주의사항이 따릅니다. 라우터를 통하는 방법은 대부분의 프로덕션 팀이 고려해야 할 옵션입니다. 평가 결정에서 마이그레이션 결정을 분리해 주기 때문입니다.

2026년 8월 14일부터 진정한 의미의 새로운 옵션이 생겼습니다: Qwen3.8-Max가 DigitalOcean Serverless Inference에서 라이브로 제공됩니다. Alibaba는 이를 자사의 "Day 0 출시 파트너"로 발표했습니다 — 이는 Alibaba 자체의 표현이지만, 리스팅은 DigitalOcean의 것이며 그 자체로 충분히 성립합니다. DigitalOcean은 오픈 가중치 체크포인트(플랫폼 모델 ID qwen3.8-max)를 Inferact와의 기술 협력을 통해 NVIDIA HGX B300 GPU에서 NVFP4 양자화하여 완전 관리형 서버리스 API로 제공합니다: 단일 엔드포인트, 사용량 기반 요금, 관리할 인프라가 없습니다. 요금표는 Alibaba의 목록과 일치합니다 — $2.00 입력 / $6.00 출력 (1M당), 캐시된 입력은 $0.20 — 호스팅된 플래그십의 약 100만 토큰 멀티모달 모드 대신, 오픈 베이스의 기본 262K 컨텍스트를 thinking이 항상 켜진 상태로 제공합니다. 이 컨텍스트 상한은 워크로드가 긴 입력을 사용하는 경우 중요합니다: 전체 100만 토큰 모드는 Alibaba API에서만 사용할 수 있습니다.

DigitalOcean 경로가 지리적 측면 외에 추가로 제공하는 것은 알리바바가 아닌 다른 제공업체로부터의 최초의 실측 서빙 데이터입니다. DigitalOcean이 8월 12일에 자체 프로덕션 엔드포인트를 대상으로 실시한 측정에 따르면 프리필이 약 16,000개 토큰/초로 선형적으로 확장됩니다 — 경험칙상 TTFT ≈ (입력 ÷ 16,000) + 0.7초이므로 약 1,080개 토큰에서 약 1.1초, 약 254K에서 약 15.8초가 됩니다 — 그리고 총 처리량은 256개 동시 요청 시 약 1,937개 출력 토큰/초에 도달했으며, 이때 오류는 0건이었고 포화 지점도 발견되지 않았습니다. 이는 DigitalOcean이 자체 배포에서 얻은 수치로, 통제된 비교 테스트(bake-off)는 아니지만 알리바바 클라우드 외부에서 얻은 이 모델의 최초 지연 시간 및 동시성 데이터이며, 프리뷰 시대의 '철저하지만 느리다'는 우려를 직접적으로 해결합니다.

Qwen3.8-Max가 OrcaRouter에서 qwen/qwen3.8-max로 제공되며, 9월 2일 리프레시 버전은 고유한 날짜 ID인 qwen/qwen3.8-max-0902로 라우팅할 수 있습니다. 둘 다 동일한 $2.00/$6.00 목록 요금입니다. OrcaRouter는 0% 마크업을 적용하고 공급업체 가격을 그대로 전달하므로 어느 경로를 사용하든 직접 이용하는 것과 비용이 동일합니다. 자체 서빙 텔레메트리에 따르면 현재 7일 창에서 p50 첫 토큰까지의 시간(time-to-first-token)은 1.64초입니다. 이는 공급업체의 주장이 아닌 자체 측정 지연 시간이며, 프리뷰 시절의 "내가 사용해본 가장 느린 모델"이라는 평가와 비교해 볼 가치가 있습니다. 해당 평가는 프리뷰 인프라에서 한 시간짜리 에이전틱 빌드를 실행한 단일 리뷰어의 것이었으며, 현재 사실로 반복되기보다는 GA 서빙 기준으로 다시 테스트되어야 합니다.

라우터 경로의 실질적 가치는 Qwen3.8-Max가 이미 실행 중인 모델들과 동일한 OpenAI 호환 엔드포인트 뒤에 있다는 점입니다. 그래서 평가는 모델 문자열 변경만으로 끝납니다. 프로덕션 트래픽의 5%를 해당 모델로 보내고, 동일한 프롬프트에서 기존 모델과 비교한 뒤 폴백을 유지할 수 있습니다. 이는 복제되지 않은 공급업체 테이블을 가진 모델에게 마땅한 태세입니다. 바로 그 태세가 DigitalOcean 배포를 테스트하는 올바른 방법이기도 합니다. 2주 된 서빙 스택에 프로덕션 경로를 걸지 말고, 폴백을 마련한 채 일부 트래픽으로 시험해 보는 것입니다.

한계와 솔직한 위험

벤더 테이블은 여전히 미감사 상태입니다. 독립 점수가 나왔습니다(AA 지수 56). 하지만 알리바바 자체 벤치마크 테이블은 여전히 재현되지 않았으며, AA의 측정은 환각률이 최대 40%에 달하는 Omniscience 성능 회귀를 지적합니다. 독립적인 점수 산정은 도움이 되지만, 벤더 테이블을 감사 가능하게 만들지는 않습니다.

DigitalOcean 경로는 플래그십이 아닌 오픈 베이스입니다. 262K 컨텍스트, 텍스트 전용, 추론 항상 켜짐, NVFP4 양자화가 적용된 체크포인트를 제공합니다. DigitalOcean 자체 스팟 체크 점수는 GPQA Diamond에서 88점으로, Alibaba가 발표한 92.6점과 대비됩니다. DigitalOcean은 이 격차를 통제된 비교라기보다는 지표상의 차이라고 설명합니다. 전체 백만 토큰 멀티모달 API가 필요하다면 여전히 Alibaba에서 호스팅됩니다.

Qwen3.8-27B가 출시됐지만, 번호는 공급업체가 붙인 것입니다. 8월 14일 27B 가중치가 Apache 2.0 라이선스로 공개되면서 온프레미스 공백이 해소됐습니다. 다만 벤치마크 수치는 Alibaba가 보고한 것으로 재현되지 않았고, 커뮤니티 양자화 모델도 이번 업데이트 기준으로는 여전히 배포 중이었습니다.

• 맞춤형 라이선스로, Apache 2.0이 아닙니다. Qwen3.8-Max 라이선스는 저작자 표시를 조건으로 상업적 사용을 허용하지만, 두 가지 규모 게이트가 있습니다. 월간 활성 사용자(MAU) 1억 명 초과 또는 월 매출 2,000만 달러 초과 시 모델 이름을 눈에 띄게 표시해야 하며, 직전 12개월 매출 5,000만 달러를 초과하는 MaaS/AI-Work-Assistant 사업에는 별도의 라이선스가 적용됩니다. 임계값을 넘어 규모를 키우기 전에 라이선스를 읽어보세요.

장황함과 지시 이탈.IFBench 82.8은 알리바바 자체 테이블에서 가장 낮은 수치이며, 프리뷰 테스터들은 모델이 범위를 벗어나 요청하지 않은 기능을 추가하는 것을 반복적으로 확인했습니다. AA의 자체 수치가 이제 그 정도를 구체화합니다: GDPval-AA 태스크당 64 steps가 비용을 $1.14로 끌어올리며, 이는 Kimi K3보다 25% 높은 수준입니다. 데모에서는 매력적이지만, 출력이 $6/1M로 청구될 때는 비용이 많이 들고, 정확한 형식이 필요할 때는 불안정을 초래합니다.

콘텐츠 가드레일. 다른 중국 호스팅 프런티어 모델과 마찬가지로, 정치적으로 민감한 주제에 대한 응답은 제한됩니다. 제품이 개방형 질문을 처리하는 경우 관련이 있습니다.

추론 토큰은 출력으로 청구됩니다. 추론이 활성화되면 실제 비용은 단순 추정치보다 높아집니다. 실제로 배포할 방식으로 추론을 구성한 상태에서 측정하세요.

자주 묻는 질문

지금 Qwen3.8-Max를 사용할 수 있나요?

예. 2026년 8월 3일에 공식 출시(GA)되었으며, 게시된 요금표와 OpenAI 및 DashScope 호환 API를 갖추고 있습니다. 현재 프로덕션 스냅샷인 Qwen3.8-Max-0902(9월 2일 출시)는 QwenCloud의 API에서 운영 중이며, 표준 qwen3.8-max 엔드포인트가 현재 제공하는 버전입니다. 이는 7월 19일 미리보기 상태에서 Qwen Chat, Qwen App, Qoder의 크레딧 캠페인으로만 접근이 제한되었던 것과 달라진 점입니다.

Qwen3.8-Max-0902란 무엇인가요?

Qwen3.8-Max-0902는 Qwen3.8-Max의 2026년 9월 2일 프로덕션 갱신판으로, 동일한 2.4T 파라미터 희소 MoE(sparse-MoE) 플래그십과 1M 토큰 컨텍스트를 유지하면서 Coding 및 Cowork에 대해 추가 사후 훈련을 거쳤고, 동일한 $2/$6 요금으로 QwenCloud의 API에서 서비스됩니다. Qwen은 새 스냅샷이 복잡한 기업 및 과학 작업에서 더 강력하다고 밝혔지만, 이는 공급업체 주장일 뿐 아직 독립적으로 벤치마킹되지 않았습니다. 반면 코딩 축에서는 이미 독립적인 결과를 보유하고 있습니다: Code Arena: WebDev 보드에서 1,691점으로 1위, 그리고 혼합 기준 약 $5/MToken으로 비용 대비 성능 파레토 최전선의 최상위입니다. 이는 Alibaba가 라이브 아레나 등재를 발표한 데 따른 것이며, Qwen 자체 QwenCloud 계정을 통해 확인되었습니다.

Qwen3.8-Max의 가격은 얼마인가요?

입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00이며, 전체 100만 토큰 컨텍스트에 걸쳐 균일하게 적용되고 긴 프롬프트 할증료는 없습니다. 캐시된 입력 히트는 100만 개당 $0.25, 명시적 캐시 생성은 $2.50, 캐시 읽기는 $0.17입니다. 추론 토큰은 출력 요율로 청구됩니다. Artificial Analysis의 Intelligence Index에서 이 모델의 측정 비용은 작업당 $1.14입니다. 토큰 계산보다 높게 나오는 이유는 가격 책정 섹션을 참조하세요. DigitalOcean의 서버리스 경로는 캐시된 입력이 $0.20으로 동일한 $2/$6를 제시합니다.

Qwen3.8-Max는 몇 개의 파라미터를 가지고 있나요?

총 2.4조 규모의 희소 Mixture-of-Experts 구성이다. 실제로 서빙 비용과 지연 시간을 결정하는 활성 파라미터 수는 Qwen3.8-2.4T-A95B의 공식 모델 카드에 따라 950억 개 활성화로 확인되었다 (512개 전문가, 토큰당 라우팅 10개 + 공유 활성 1개).

Qwen3.8-Max의 가중치가 오픈되어 있나요?

네 — 2026년 8월 12일부터입니다. Qwen은 Hugging Face에 Qwen3.8-2.4T-A95B (BF16)과 Qwen3.8-2.4T-A95B-FP8을 게시했으며, 각각 213개의 가중치 파일이 포함되어 있습니다. 라이선스는 Apache 2.0이 아닌 맞춤형 Qwen3.8-Max 라이선스입니다(Hugging Face는 이를 "기타"로 분류합니다). 이 라이선스는 출처 표시를 조건으로 상업적 이용을 허용하며 두 가지 규모 기반 게이트를 포함합니다. 공개 체크포인트는 텍스트 전용이며 thinking 모드가 항상 활성화되어 있습니다. 호스팅 API는 비전, 선택적 non-thinking 모드, 그리고 전체 1M 컨텍스트를 추가로 제공합니다.

Qwen3.8-Max에 대한 독립적인 벤치마크가 있나요?

{{1}}네 — 2026년 8월 6일 기준입니다.{{/1}} Artificial Analysis는 Alibaba 공식 API에서 측정한 태스크당 $1.14 기준으로 Intelligence Index에서 이 모델에 56점을 부여했습니다. 이는 Qwen3.7-Max(46)보다 10포인트 높은 점수이며, Claude Opus 4.8(56)과 동급이고, Kimi K3(57)에는 1포인트 뒤처집니다. 다만 위 벤치마크 표는 여전히 Alibaba가 보고한 결과이며 독립적으로 재현되지 않았고, LMArena의 일반 리더보드에도 아직 공개 점수는 없습니다. 독립 아레나의 구도는 9월 2일에 바뀌었습니다. 0902 갱신판은 같은 플랫폼의 Code Arena: WebDev 보드에서 1,691점으로 1위에 데뷔했습니다. 이는 제3자의 블라인드 투표 결과이지 Alibaba의 표가 아닙니다. 또한 Code Arena의 비용 대비 성능 프론티어에는 이 모델이 혼합 기준 약 $5/MToken으로 해당 보드에서 가장 높은 점수를 받는 가치 항목으로 등재되어 있습니다. DigitalOcean이 양자화 빌드에 대해 수행한 스팟 점검(GPQA Diamond 88점)은 서빙 배포에 대한 첫 번째 제3자 검증이며, 통제된 평가라기보다는 명시적으로 참고 성격의 지표입니다. '독립' 열에 대한 한 가지 주의점: Qwen3.8-Max가 오픈 가중치 모델 중 1위를 차지한 CommerceAgentBench는 두 번째 독립 심판이 아닙니다. 이 벤치마크를 구축하고 발표한 Accio는 Alibaba의 자체 팀이기 때문입니다.

Qwen3.8-Max가 Qwen3.7-Max보다 더 좋은가요?

알리바바 자체 수치로도 상당히 — FrontierSWE 73.5 대 40.7 및 DeepSWE 1.1 56.6 대 21.6은 어려운 소프트웨어 엔지니어링 작업에서 거의 두 배에 가까운 성능 향상입니다. 또한 이전 모델의 $2.50/$7.50보다 저렴합니다. 독립적으로 AA는 Intelligence Index에서 세대 도약을 10포인트(56 대 46)로 평가합니다. 두 공급업체의 주장은 여전히 여러분의 워크로드에서 검증되어야 합니다.

제가 Qwen3.8-Max를 자체 호스팅할 수 있나요?

실질적으로는 그렇지 않습니다. 전체 2.4T 가중치 세트는 BF16 기준 약 4.9TB, FP8 기준 약 2.4TB, 4비트 기준 약 1.2TB입니다. H200당 약 141GB와 비교하면, 이는 최상위 GPU 8대 이상에 해당합니다. 토큰당 활성 파라미터가 95B이므로 토큰당 연산량은 비교적 적지만, 메모리 사용량이 결정적 제약 요인입니다. DigitalOcean이 B300에서 NVFP4로 서빙하는 것이 4비트로 단일 노드에 모델을 수용할 수 있다는 실증 사례입니다. Qwen3.8-27B는 약 17GB의 VRAM을 사용하는 것으로 알려졌으며 현실적인 온프레미스 옵션입니다. 해당 가중치는 2026년 8월 14일 Apache 2.0 라이선스로 배포되어 이제 약속이 아니라 실제로 다운로드할 수 있습니다.

Qwen3.8-27B란 무엇인가요?

플래그십과 함께 발표된 훨씬 작은 모델로, 실용적인 온프레미스 배포 경로로 포지셔닝되었다. 밀집형 27B 모델로, 기본적으로 멀티모달이며, 기본 컨텍스트 262K 토큰을 1M까지 확장할 수 있고 Apache 2.0 라이선스로 배포된다. 모델 가중치는 2026년 8월 14일 Hugging Face와 ModelScope에 공개되었으며, Unsloth의 Daniel Han은 약 17GB VRAM, 즉 하이엔드 소비자용 그래픽 카드 한 장으로 실행할 수 있다고 보고했다. 벤치마크 성능 수치는 Alibaba가 보고한 것으로, 독립적으로 재현된 적은 없다.

Qwen3.8-Max는 멀티모달인가요?

네 — 텍스트, 이미지, 비디오 입력을 받아 텍스트를 반환합니다. 또한 thinking 모드, 함수 호출, 내장 도구, 구조화된 출력을 지원합니다. 오픈 가중치 체크포인트는 텍스트 전용이며, 멀티모달 입력은 호스팅 API의 기능으로, DigitalOcean 경로에는 포함되지 않습니다.

DigitalOcean에서 Qwen3.8-Max를 사용할 수 있나요?

네 — 2026년 8월 14일부터입니다. DigitalOcean Serverless Inference는 오픈 가중치 체크포인트(NVIDIA HGX B300의 NVFP4)를 1M 토큰당 $2.00/$6.00에 제공하며, 캐시된 입력은 $0.20, 262K 토큰 컨텍스트, 텍스트 전용, thinking은 항상 켜짐입니다. Alibaba는 DigitalOcean을 'Day 0 출시 파트너'라고 부릅니다. 해당 리스팅 자체는 DigitalOcean의 것이며 그러한 표현과는 무관합니다. DigitalOcean의 측정 수치: 프리필은 초당 약 16K 토큰, 출력은 256개 동시 요청 기준 초당 약 1,937 토큰이며 오류는 0건입니다.

Qwen3.8-Max를 OrcaRouter를 통해 사용할 수 있나요?

네, qwen/qwen3.8-max로 라이브 상태이며, 9월 2일 스냅샷은 자체 날짜 ID(qwen/qwen3.8-max-0902)로 동일한 $2.00/$6.00 정가에 0% 마크업으로 제공됩니다. 라우팅 비용은 이미 사용 중인 OpenAI 호환 엔드포인트를 통한 직접 연결과 동일합니다. 당사의 7일 원격 측정 결과, p50 기준 첫 토큰 수신 시간은 1.64초입니다.

오늘 프로덕션 트래픽을 그것으로 옮겨야 할까요?

전면 교체는 아닙니다. 가격과 첫 독립 평가 점수 덕분에 진지한 평가가 저렴해졌고 지금 수행할 가치가 있지만, 작업당 비용이 Kimi K3보다 25% 높으므로 원칙적인 접근은 기존 모델과 동일한 프롬프트에서 트래픽을 분할하고 폴백을 마련하는 것입니다—마이그레이션이 아니라요. DigitalOcean 경로는 테스트할 두 번째 관리형 배포를 추가하므로 평가 비용이 더욱 낮아집니다.

결론

Qwen3.8-Max는 2주 동안 아무도 구매할 수 없는 가장 흥미로운 모델이었다. 일반 공개(GA) 시점에는 완전히 다른 제안이다. 백만 토큰 기준 $2/$6 플랫 요금은 공격적인 가격 책정이며, 캐시 요금 덕분에 반복적인 에이전트 작업이 저렴해진다. 또한 FrontierSWE와 DeepSWE에서의 세대적 도약 — 그 결과가 재현된다면 — 은 이 모델을 단순한 규모 과시가 아닌 진짜 코딩 모델로 만든다. 8월 12일 실제 라이선스를 갖춘 오픈 가중치가 공개되면서 “오픈 가중치가 곧 나온다”는 약속은 현실이 되었다. 또한 8월 14일 발표된 출시 당일 DigitalOcean 배포 옵션은 측정된 서빙 수치와 $0.20 캐시 읽기 가격을 제시해 “저렴하게 시도해 보기” 논거를 강화하며, 팀이 Alibaba 자체 API와 비교할 수 있는 관리형 타사 배포 옵션을 제공한다. 9월 2일 공개된 리프레시 버전 Qwen3.8-Max-0902는 이 논지를 그대로 유지한다. 즉, 동일한 $2/$6 가격과 1M 컨텍스트를 유지하면서, 이 모델이 원래부터 겨냥해 온 코딩 및 협업 작업에 사후 학습을 더 많이 적용한 것이다. 이번 리프레시는 또한 코딩 경쟁력 주장을 뒷받침할 독립적인 인간 선호도 리더보드를 추가했다. Qwen3.8-Max-0902는 Code Arena의 WebDev 리더보드에서 1,691점으로 데뷔와 동시에 1위에 올라 Claude Opus 5와 Kimi K3를 앞질렀으며, 혼합 기준 약 $5/백만 토큰 비용으로 해당 리더보드의 비용-성능 파레토 최적선상 모델 중 가장 높은 점수를 기록한 모델이다. Alibaba의 Accio 팀이 같은 주에 발표한 CommerceAgentBench 결과 — 실제 상거래 워크플로우로 구축된 벤치마크에서 Qwen3.8-Max가 오픈 가중치 모델 중 선두를 차지했다는 내용 — 은 협업 작업 논지에 그 자체로 구체적인 리더보드를 제공하지만, 공급업체가 운영하는 리더보드라는 한계가 있다.

바뀐 점은 심판과 가중치가 모두 도착했다는 것이다. 그리고 평결은 대체로 긍정적이되, 진짜 별표(조건)가 붙어 있다. AA는 Intelligence Index에서 Qwen3.8-Max를 56점으로 매겼는데, 이는 Claude Opus 4.8과 어깨를 나란히 하는 진정한 세대적 도약이다. 다만 같은 스코어카드에서는 Kimi K3가 태스크당 비용이 25% 낮으면서도 1점 앞섰고, 환각 비율이 오르면서 Omniscience가 10점 하락한 것도 지적됐다. 활성 파라미터 논쟁은 정리됐다. 95B 활성화가 모델 카드에서 확인됐고, 라이선스도 공개됐는데 Apache 2.0이 아닌 커스텀 라이선스다. 바뀌지 않은 것: 알리바바 자체 벤치마크 표는 여전히 독립 재현되지 않았고, 모델이 수많은 단계를 거쳐 연산하기에 태스크당 비용은 여전히 높으며, DigitalOcean에서 서빙되는 오픈 베이스 모델은 플래그십의 헤드라인 수치와는 다소 다른 모델이다(262K 컨텍스트, NVFP4, GPQA 스팟체크 88 대 92.6). Qwen3.8-27B의 벤치마크 주장 역시 가중치가 이미 출시됐음에도 벤더 보고에 그친다. 그런 조합이 Qwen3.8-Max를 나쁜 베팅으로 만들지는 않는다. 이 가격이면 사실상 해볼 수밖에 없는 실험에 가깝다. 다만 올바른 자세는 적극적으로 평가하고, 신중하게 라우팅하고, 폴백을 유지하는 것임을 의미한다. 이제 지켜봐야 할 사건은 태스크당 1.14달러라는 비용 뒤에 있는 에이전틱 단계 수를 워크로드가 흡수할 수 있는지, 0902 빌드의 Code Arena: WebDev 리드가 투표가 누적되면서 유지되는지, 그 Coding·Cowork 부문의 개선이 실제 워크로드에서 재현되는지, 알리바바 자체 하네스에서의 두 차례 집계 패스라는 CommerceAgentBench 오픈 가중치 리드가 독립 실행에서도 살아남는지, 27B의 벤치마크 주장이 유지되는지, 그리고 DigitalOcean 배포의 측정 처리량이 실제 트래픽에서도 유지되는지다. 그것이 “Fable 5에 이어 두 번째”라는 말이 포지셔닝이었는지, 예언이었는지를 결정할 것이다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트