‘Qwen3.8-Max vs Qwen3.7-Max’를 위한 히어로 타이틀 카드로, 부제는 ‘두 개의 Max 티어, 16 지수 포인트, 그리고 가격을 역전시키는 프로모션’이며, 푸터에는 Qwen3.8-Max 수치는 Alibaba의 2026년 9월 22일 공시와 Artificial Analysis에서 나왔고 Qwen3.7-Max 수치는 Artificial Analysis에서 나왔다고 명시되어 있습니다.
Guides & Insights

Qwen3.8-Max vs Qwen3.7-Max: 두 개의 Max 티어, 16 인덱스 포인트, 그리고 가격을 뒤집는 프로모션

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

나흘 전, 공급업체는 우리에게 Qwen3.8-Max는 8월에 출시한 모델이 아니라고 말했다. 2026년 9월 22일자 보도자료에서, 항저우에서 열린 Apsara Conference에서 회사는 자사의 플래그십이 33회의 반복 사이클에 해당하는 완전 자동화된 학습 및 후속 학습 작업을 한 달 넘게 완료했으며, 그 결과 만들어진 빌드가 Artificial Analysis Intelligence Index를 40에서 45로 끌어올렸다고 공개했다. 모델 ID는 결코 바뀌지 않았다. 그 뒤의 숫자는 바뀌었다.

그것이 가장 중요한 곳은 한 가지 특정 지점, 즉 Qwen3.8-Max와 Qwen3.7-Max, 그것이 대체한 Max 등급 사이의 비교입니다. Qwen3.8-Max는 2026년 8월 3일에 정식 출시되었고, Qwen3.7-Max는 5월에 출시되었습니다. 표면적으로 이것은 쉬운 세대 교체 판단처럼 보입니다 — 더 새로운 플래그십, 더 높은 점수, 넘어가면 됩니다. 하지만 숫자는 더 어색한 이야기를 합니다. 이전 등급은 3~4배 더 빠르고, 완료된 작업당 비용은 대략 5분의 1이며, 순수 지식 벤치마크에서는 새 등급과 동일합니다. 새 등급은 멀티모달이고, 에이전트 작업에서 훨씬 뛰어나며, 국제 요율표에서는 더 저렴합니다. 어느 쪽을 호출해야 하는지는 대부분의 비교가 건너뛰는 질문, 즉 지식을 사는 것인지 도구 호출을 사는 것인지에 달려 있습니다.

아프사라 공개가 실제로 주장하는 것

이 공개는 알리바바가 자체 보도 사이트에 게시한 공급업체 성명이며, 그렇게 읽어야 한다. 그 내용은 구체적이다: 파이프라인 설계, 데이터 검증, 반복적 실험 및 오류 진단에 걸친 한 달 넘는 완전 자동화 실행에서 Qwen3.8-Max는 33회 주기를 완료했으며, 자율 훈련 최적화와 사후 훈련 기법이 점수 변화를 만들어냈다. 알리바바는 또한 칩 설계에서의 두 번째 실험을 설명했는데, 여기서 모델은 설계 수명 주기 전반에 걸쳐 60시간 이상의 자기 개선을 실행했고, 10,000회 이상의 EDA 도구 호출을 수행했으며, 성능 저하가 없다고 밝힌 상태에서 칩 면적을 42% 줄이면서 양산급 칩 버스 모듈을 생산했다. 그 모든 것은 알리바바 자체 모델에 대한 알리바바의 설명이며, 회사 외부의 누구에 의해서도 재현되지 않았다.

하지만 점수 변화 자체는 벤더의 주장이 아니다. 이 Index는 Artificial Analysis의 것이고, 45는 그 제3자의 Qwen3.8 Max (0902) 페이지에 있다. 그것이 이동해 온 40은 같은 기관의 8월 3일 빌드 페이지에 있으며, 이 빌드는 이제 사용 중단으로 표시되어 현재 빌드를 가리킨다. 따라서 그 차이는 독립적으로 점수화된 효과에 결부된 벤더가 보고한 원인이며, 이는 어느 한쪽만 있을 때보다 더 강한 입장이다. 또한 이 글을 쓰는 시점에서 이것은, 프런티어 연구소가 새 버전 번호를 출시하지 않고 자사 플래그십의 측정된 역량을 변화시켰다는 사실에 관해 누구나 확인할 수 있는 가장 구체적인 공개 증거이기도 하다.

릴리스에 관한 두 가지 다른 점은 놓치기 쉽고, 둘 다 결정적으로 중요합니다. 첫째, Alibaba는 Qwen 4가 학습 중이며, Qwen 4.5와 Qwen 5 시리즈는 5~10조 개 매개변수까지 확장될 것으로 예상된다고 확인했습니다. 둘째, 갱신된 모델의 날짜가 명시된 스냅샷이 있습니다. Alibaba는 포스트 트레이닝된 빌드를 qwen3.8-max-0902로 9월 2일에 고정했으며, 이는 별도로 라우팅할 수 있습니다. 이 고정은 RSI 공개가 시사하는 모든 것에 대한 실질적인 답이며, 우리는 이 주제로 다시 돌아올 것입니다.

점수판

여섯 가지 차원, 양쪽 모두, 두 열이 동등하게 검증된 것이 아니므로 출처 관리 원칙을 명시적으로 유지한 채로.

• 컨텍스트 창 — Qwen3.8-Max 1,000,000 토큰 vs Qwen3.7-Max 1,000,000 토큰 (동일)

• 최대 출력 — 131,072 토큰 vs 알리바바 자체 모델 페이지 기준 131,072 토큰(동일함; 다만 Qwen3.7-Max에 관한 당사 카탈로그 페이지에는 64,000으로 기재되어 있는데, 이는 얼버무리지 않고 명시하는 불일치 사항임)

• 입력 모달리티 — 텍스트, 이미지, 동영상 vs 텍스트만

• 100만 토큰당 국제 정가 — $2.00 입력 / $6.00 출력 vs $2.50 입력 / $7.50 출력; 동일한 요율표는 베이징, 프랑크푸르트, 버지니아에서 이미 두 모델 모두 $1.65 / $4.951를 부과하고 있습니다

• Artificial Analysis Intelligence Index — 45 대 29

• 독립적인 출력 속도 — 39.7 tokens/sec 대 211.3 tokens/sec, 동일한 211개 모델 비교군을 기준으로 측정되었으며, 여기서 Artificial Analysis는 최신 티어를 눈에 띄게 느리다고, 이전 티어를 눈에 띄게 빠르다고 평가합니다

마지막 두 행이 이 기사의 전부다. 같은 지수 계열에서, 최신 티어는 16점 앞선다. 속도에서는 5배 이상 뒤처진다.

A two-column comparison scoreboard: left column 'Qwen3.8-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text / image / video, International price per 1M $2.00 / $6.00, AA Intelligence Index 45 and Output speed 39.7 tok/s; right column 'Qwen3.7-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text only, International price per 1M $2.50 / $7.50, AA Intelligence Index 29 and Output speed 211.3 tok/s; a footer credits Alibaba's 22 Sep 2026 disclosure and Artificial Analysis.

16점은 어디에서 비롯되는가 — 그리고 어디에서 비롯되지 않는가

Index를 여러 부분으로 쪼개 보면 업그레이드의 모습이 분명해진다. 그리고 그것은 마케팅이 암시하는 모습이 아니다.

지식과 추론에서 두 모델은 사실상 동등합니다. GPQA Diamond: 92.8 대 92.3. Humanity's Last Exam: 43.1 대 40.5. 장문맥 회상: 80.33 대 79. SciCode: 52.1 대 49.5. 워크로드가 대규모 코퍼스에 대한 질의응답이라면, 세대 간 도약은 반올림 오차에 불과합니다. 그 대가로 몇 배를 지불하는 것은 정당화하기 어려울 것입니다.

에이전트 및 코딩 작업에서 격차는 크게 벌어진다. Terminal-Bench 2.1: 88.76 vs 74.53. Artificial Analysis의 코딩 지수: 76.2 vs 66. 그리고 이 세트에서 가장 큰 차이는 뱅킹 도구 사용 과제에서 나타나는데, 여기서 Qwen3.8-Max는 47.84를 기록한 반면 Qwen3.7-Max는 11.75를 기록한다 — RSI 설명이 자동화된 주기들이 최적화하고 있었다고 말하는 바로 그 역량, 즉 파이프라인 설계, 데이터 검증, 반복적 실험, 오류 진단에서의 네 배 격차다. 자신의 훈련 루프를 한 달 동안 개선한 모델은 루프를 더 잘하게 된 모델이다.

개별 행들에 관해서는 솔직한 단서를 하나 달아 두겠습니다. 두 모델 페이지는 모두 동일한 Intelligence Index 리비전 패밀리(v4.3 및 v4.3.2)에 속하므로, 헤드라인의 45 대 29 비교는 공정한 비교입니다. 벤치마크별 행들은 동일 코호트가 아닙니다. Qwen3.7-Max의 작업 수준 수치는 5월 평가 기간에 해당하지만, Qwen3.8-Max의 수치는 9월 시리즈에서 나온 것입니다. 세 번째 유효 숫자가 아니라 변화의 방향을 읽으십시오.

가격 문제는 두 가지 질문이다

알리바바의 국제 요금표에서 더 새로운 Max는 그것이 대체한 모델보다 저렴합니다: $2.00 / $6.00 (Qwen3.8-Max의 경우) 대 $2.50 / $7.50 (Qwen3.7-Max의 경우), 백만 토큰당입니다. 세대가 진전될수록 양방향 모두 20% 인하되는 것은 이례적이며 그 자체로 주목할 만합니다. 캐시 경제성도 더 새로운 등급에 유리합니다 — 암시적 캐시는 $0.50 대비 $0.25, 명시적 캐시 읽기는 $0.25 대비 $0.17입니다.

그것이 첫 번째 질문인데, 대부분의 보도가 평면적으로 다루는 지역별 답이 있습니다. Alibaba는 두 모델 모두에 입력 $1.65 / 출력 $4.951을 베이징, 프랑크푸르트, 버지니아에서 청구합니다. 20% 격차는 싱가포르 국제 카드에서만 존재합니다. 트래픽이 나머지 세 지역에 도착한다면, 오늘날 두 Max 티어 모두 입력 및 출력 토큰 비용이 동일하고, 결정은 순수한 능력 문제로 귀결됩니다 — 그 시점에서 더 새로운 모델이 처리량을 제외한 모든 면에서 승리하며, 더 이상 계산할 산술은 남지 않습니다.

두 번째 질문은 함정입니다. Qwen3.7-Max는 현재 $2.50 / $7.50의 비용이 들지 않습니다. 이는 $1.25 / $3.75에 제공됩니다. 정가의 절반인 프로모션 요금입니다. 따라서 오늘날에는 이전 세대 티어가 더 저렴한 옵션이며, 그 차이는 상당합니다. 또한 이번 주에 측정할 수 있는 가격이 여러분이 확정하게 될 가격은 아니라는 뜻이기도 합니다. 알리바바의 자체 모델 페이지에는 게시된 표가 "한시적 프로모션을 제외한" 원래 가격을 보여준다고 명확히 명시되어 있으며, 현재 제공되는 혜택은 콘솔에서 확인하라고 안내합니다. 프로모션은 구조상 종료될 수 있는 요금입니다. 그렇게 되면 Qwen3.7-Max는 단지 오늘보다 비싸지는 것에 그치지 않고, 자신을 능가하는 모델보다 25% 더 비싸집니다.

우리는 제공업체 요율을 0% 마크업으로 그대로 전달하므로, 정가와 프로모션이 모두 변경되는 당일에 우리 쪽에서도 바로 적용됩니다 — 이는 비교에는 편리하지만 예산을 세우려는 경우에는 도움이 되지 않습니다. 모델은 정가 카드를 기준으로 세우고, 프로모션 요율은 업사이드로 취급하세요.

A screenshot of Alibaba Cloud Model Studio's 'Recommended models' documentation overview page, showing the console navigation on the left, the line 'Alibaba Cloud Model Studio offers Qwen and third-party models for text, image, audio, and video.', an 'Updated at: 2026-09-24 20:17:58' stamp, and category cards covering Text generation (listing qwen3.8-max and qwen3.7), Image & video, World models, and Audio & speech.

비용 논리를 뒤집는 숫자

토큰 가격은 작업에 드는 비용이 아니다. Artificial Analysis는 캐시 경제성, 추론량, 답변 길이를 반영한 작업당 비용 수치를 발표하는데, 그 기준에서는 순위가 완전히 뒤집힌다: Qwen3.8-Max의 Intelligence Index 작업당 $5.41 대 Qwen3.7-Max의 $1.15. 지역에 따라 토큰 요율이 20% 더 저렴하거나 동일한데도 4.7배의 프리미엄이다.

그 격차는 대부분 장황함 때문입니다. 동일한 평가에서 최신 모델은 1억 9천만 출력 토큰이전 모델은 1억 2천만 개의 출력 토큰을 생성했습니다. 그리고 최신 모델은 답에 도달하기 위해 길게 추론합니다. 대량의 중간 난이도 워크로드에서 출력 토큰당 비용을 지불한다면, 최신 Max는 어느 요율표에서든 어떤 토큰 가격에서도 더 저렴한 모델이 아닙니다. 그것은 더 비싼 모델이며, 토큰 정가는 이를 결정하기 위한 잘못된 도구입니다.

속도, 그리고 우리 자체 트래픽이 보여주는 것

처리량 격차는 아키텍처를 바꿀 만큼 충분히 큽니다. Artificial Analysis는 Qwen3.8-Max를 초당 39.7토큰으로 평가하며, 그 요약에서는 이 모델을 눈에 띄게 느리다고 부릅니다. 반면 Qwen3.7-Max는 211.3으로, 눈에 띄게 빠르다고 부릅니다. 이는 대화형 화면 뒤에 두는 모델과 큐 뒤에 두는 모델의 차이이며, Qwen3.8-Max에서는 우리 자체 통계 패널이 가장 먼저 보여주는 항목입니다.

지난 9월 25일까지 7일간의 우리 자체 플레이그라운드 텔레메트리는 지연 시간에 관해 약간 더 미묘한 이야기를 보여주며, 여기에는 한 가지 단서가 따릅니다. 이는 통제된 벤치마크가 아니라 우리 라우팅에서의 측정치입니다. Qwen3.8-Max는 첫 응답까지 중앙값 2,611ms, 초당 54.7토큰, 오류율 2.45%를 보였습니다. 고정된 0902 빌드는 중앙값 3,360ms, 초당 46.2토큰, 눈에 띄게 더 깨끗한 오류율 0.66%를 보였습니다. Qwen3.7-Max는 중앙값 4,509ms였지만 초당 169.8토큰, 오류율 3.80%였습니다. 따라서 더 오래된 등급은 처음에는 더 느리게 응답한 뒤 세 배 더 빠르게 스트리밍하지만, 더 자주 실패합니다. 워크로드가 버스트성이 높다면, 그 오류율 차이는 중앙값보다 더 주의를 기울일 가치가 있습니다.

두 티어 모두 고정된 스냅샷과 함께 하나의 OrcaRouter 키에서 라이브로 제공되며, 공급자 전반에 걸친 자동 장애 조치가 함께 작동합니다. 이와 같은 비교에서 실질적인 요점은 바로 이것입니다. 두 Max 세대 모두에 대해 자신의 프롬프트를 측정하는 것은 두 번째 계약이 아니라 구성 변경입니다.

A screenshot of OrcaRouter's own model page for Qwen3.7-Max (models/qwen/qwen3.7-max) in the dark theme, showing the Qwen3.7-Max heading, its model description, and the stat and price panel for the tier.

이제 재현성이 결정적 요인입니다.

다음은 아무도 가격에 반영하지 않은 Apsara 공시의 한 부분입니다. 한 달 동안 측정된 역량이 40에서 45로 올라갔지만 버전 변경도, 당시 공지도 없었던 라이브 모델 ID는 재현성 위험입니다. 제품 동작이 움직이는 ID의 함수라면, 고정된 평가 스위트, 캐시된 프롬프트 라이브러리, 또는 승인 완료된 회귀 세트 아래에서 개선되거나 — 또는 달라질 — 수 있는 모델을 가진 셈입니다.

두 세대 모두 날짜가 지정된 스냅샷을 제공하며, 그것이 완화책입니다. Qwen3.7-Max는 Alibaba에 의해 다음과 기능적으로 동등한 것으로 문서화되어 있습니다: qwen3.7-max-2026-05-20, 2026-05-17 및 2026-06-08의 추가 날짜 지정 빌드도 있습니다. Qwen3.8-Max에는 qwen3.8-max-0902, 즉 9월에 사후 학습된 빌드가 있으며, 45가 가리키는 것이 바로 이것입니다. 재현 가능해야 하는 것을 출시한다면 날짜 지정 ID를 고정하고, 플로팅 ID는 스테이징 대상으로 취급하세요. RSI 주기는 플로팅 ID의 기능이며, 고정은 그 주기에서 빠지는 방법입니다.

카탈로그를 잘못 읽지 않도록 알아 두면 좋은 이름 지정 세부 사항이 하나 있습니다. Alibaba는 qwen3.8-max-2026-09-02라는 세 번째 날짜 형식을 0902 별칭과 함께 나열하는데, 둘은 동일한 빌드를 가리킵니다. 원래 8월 3일 릴리스는 저희 쪽에서 더 이상 라우팅할 수 없습니다 — 저희가 제공하는 것은 Qwen3.8-Max, 그 모델의 0902 핀, 그리고 Qwen3.7-Max.

누가 무엇을 골라야 할까

결정은 어느 모델이 더 나은지에서 갈리지 않습니다. 무엇을 구매하는지에서 갈립니다.

Qwen3.7-Max를 계속 사용하세요 — 워크로드가 텍스트 전용이고, 도구 중심보다 지식 중심이며, 처리량에 민감하다면 — 대량 분류, 추출, 장문맥 검색, 배치 요약에 적합합니다. GPQA Diamond와 장문맥 회상에서 이 모델은 최신 모델과 1점 이내 차이이고, 스트리밍 속도는 3~4배 더 빠르며, 작업당 비용은 $5.41 대비 $1.15입니다. 또한 퓨전 또는 라우팅 구성에서 저렴한 세컨드 오피니언을 원하는 사람에게도 정답인데, 프로모션 요금에서는 가격대가 완전히 다르기 때문입니다. 두 가지 주의점이 있습니다: 프로모션은 프로모션일 뿐이고, Artificial Analysis는 이미 이 모델을 더 이상 권장되지 않는(deprecated) 것으로 표시했으며 Qwen3.8-Max가 이를 대체했습니다. 이 모델로 다년간의 약정을 시작하지 마세요.

Qwen3.8-Max로 전환하세요 다음 중 하나라도 해당한다면: 이미지나 동영상 입력이 필요한 경우 — Qwen3.7-Max는 이를 전혀 받지 않습니다. 긴 도구 호출 체인이나 여러 단계의 코딩 루프를 도는 에이전트형 워크로드인 경우 — Terminal-Bench 2.1에서의 88.76 대 74.53, 그리고 네 배에 달하는 도구 사용 격차가 출시와 미출시를 가릅니다. 또는 싱가포르 국제 요율표를 기준으로 작성하는 경우 — 최신 모델이 그냥 20% 더 저렴하고 저울질할 트레이드오프가 없습니다.qwen3.8-max-0902를 고정하세요 — 동작이 그대로 유지되길 원한다면.

베이징, 프랑크푸르트 또는 버지니아에 있다면, 선택은 어떤 비교가 시사하는 것보다 더 명확합니다. 두 Max 티어 모두 비용이 $1.65 / $4.951백만 토큰당입니다. 동일합니다. 그 요금이라면 멀티모달 입력에 추가 비용을 내지 않고도 16포인트 더 높은 Index와 네 배 더 나은 도구 사용 점수를 얻는 것은 선택의 문제가 아니라 공짜입니다 — 그리고 Qwen3.7-Max에 머무를 유일한 이유는 순수 처리량뿐입니다.

직접 답할 가치가 있는 두 가지 질문

33사이클 학습 실행은 기존 API 트래픽 아래에서 모델이 변경되었다는 뜻인가요? 공개 내용이 암시하는 바가 바로 그것이며, 날짜가 지정된 핀이 존재하는 이유도 바로 그것입니다. Alibaba는 개선된 모델을 "업데이트된 Qwen3.8-Max"라고 설명하는데, 이는 새로운 ID가 아니라 플로팅 ID입니다. 9월까지 플로팅 ID에서 워크로드를 운영했다면, 해당 기간 동안 측정된 역량이 변한 모델이 이를 처리했습니다. Alibaba는 그 사이의 빌드들에 대한 변경 로그를 공개하지 않았으므로, 어떤 동작을 사용 중인지 알 수 있는 유일하게 신뢰할 수 있는 방법은 핀을 지정하는 것입니다.

RSI 주장은 독립적으로 검증되었나요?그것이 산출한 점수는 독립적으로 검증되었습니다 — 그 Index는 Artificial Analysis의 것이고, 45는 그들의 페이지에 있습니다. 그 뒤의 메커니즘은 알리바바가 자사 학습 과정을 자체적으로 설명한 것이며, 외부 재현도, 공개된 평가 프로토콜도, 33회의 주기를 관찰한 제3자도 없습니다. ‘33회의 반복 사이클’을 공급업체의 주장으로, ‘40 이후 45’를 측정된 한 쌍으로 취급하십시오. 이 둘은 같은 종류의 진술이 아니며, 그 차이가 바로 이 헤드라인을 그대로 반복하기보다 주의 깊게 읽을 가치가 있는 이유입니다.

다음에 주목할 것은 Qwen 4가 아니다. Qwen3.7-Max의 반값 프로모션이, 그것을 대체할 예정인 모델이 등장한 뒤에도 살아남느냐 하는 것이다. 그렇지 않다면, 수많은 팀은 자신들이 정가와 할인가를 비교하고 있었다는 것, 그리고 두 형제 중 더 오래된 쪽이 처음부터 더 비쌌다는 것을 깨닫게 될 것이다.