'Qwen 4.5 및 Qwen 5: 5조에서 10조 개의 파라미터'라는 제목의 생성된 타이틀 카드가 있으며, 부제는 '사양이 아닌 로드맵 범위'이고, 세 장의 카드에는 각각 '로드맵 목표 / 5-10T 파라미터', '출시 플래그십 / Qwen3.8-Max 2.4T', '출시일 / 미발표'라고 적혀 있습니다. 하단에는 'Alibaba의 2026년 9월 22일 보도자료 기준, 모델 카드는 공개되지 않음.'이라는 푸터 문구가 있습니다. 흰색 배경 위에 파란색에서 청록색으로 이어지는 그라데이션 워시를 사용한 플랫 벡터 에디토리얼 스타일이며, OrcaRouter 로고가 오른쪽 아래에 합성되어 있습니다.
Guides & Insights

Qwen 4.5와 Qwen 5, 5조~10조 파라미터 목표: 알리바바가 말한 것과 말하지 않은 것

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 9월 22일 항저우에서 열린 자사 압사라 콘퍼런스(Apsara Conference)에서 이 회사는 그다음다음 세대의 규모를 제시했다.Qwen 4.5Qwen 5 시리즈는 회사 자체 영문 보도자료의 표현을 그대로 옮기면 "5조에서 10조 개의 파라미터로 확장될 것으로 예상된다" — 사양이 아니라 로드맵상의 한 줄이다. 두 모델 모두 출시일도, 모델 카드도, API 식별자도, 가격도, 공개된 벤치마크 점수도 없으며, 이는 둘 중 어느 것도 오늘날 호출할 수 없다는 뜻이다. 실제로 구매할 수 있는 플래그십은 Qwen3.8-Max로, 2026년 8월 3일부터 정식 제공 중이며 2조 4,000억 개의 파라미터를 갖추고 있다. 콘퍼런스 이후 며칠 동안 많은 보도에서 그 로드맵 문구는 10조 파라미터 모델이 나온다는 주장으로 단순화되었다 — 회사가 한 것보다 더 강하고 더 단순한 주장으로. 그 두 문장 사이의 간극은 대략 1년 치 계획에 해당한다.

그 주장, 그리고 그것이 퍼진 버전

무대에서 두 가지가 언급되었는데, 이 둘은 담고 있는 정보의 양이 매우 다르기 때문에 분리해서 볼 가치가 있습니다. 첫 번째는 현황 업데이트입니다: Qwen 4는 새로운 아키텍처로 학습 중입니다. 두 번째는 로드맵입니다: Qwen 4.5와 Qwen 5 시리즈는 5조에서 10조에 이르는 파라미터 범위에 도달할 것으로 예상됩니다.

알리바바의 영문 보도자료는 두 가지 모두를 특정 임원이 아닌 회사에 귀속시킨다. 한발 더 나아간 컨퍼런스 보도는 이 로드맵을 알리바바 토큰 허브에서 Qwen 대규모 언어 모델 프로젝트를 이끄는 류다이헝에게 귀속시키며, 그가 스케일링이 인공 초지능으로 향하는 핵심 경로라는 프레임을 제시했다고 전한다. 그 프레임이 바로 파라미터 수치가 제시된 맥락이며, 이것이 그 수치가 목표가 아니라 범위인 이유를 설명해 준다.

그때 퍼져 나간 것은 그 범위의 상단이었다. 뒤이은 영어 헤드라인에는 적어도 하나는 10조 개 매개변수 모델을 암시하는 내용을 다루고, 여러 개는 5조에서 10조 개 매개변수의 모델을 위한 계획을 다룬다. 둘 다 한 장의 슬라이드에 대한 정당한 해석이다. 어느 쪽도 사양은 아니며, 그 차이는 그것을 기준으로 계획해야 하는 사람 누구에게나 중요하다.

5조는 한 세대의 목표이고 10조는 또 다른 세대의 목표다

이 발표에서 가장 유용하게 제대로 짚어야 할 점은 5조에서 10조가 두 세대에 걸친 범위라는 것이지, 허용 폭이 넓은 하나의 모델이 아니라는 것입니다. Alibaba 자신의 문장은 이 범위를 “곧 출시될 Qwen 4.5 및 Qwen 5 모델 시리즈”에 연결합니다 — 시리즈, 즉 복수형을 함께 묶어 본 것입니다.

같은 콘퍼런스에 관한 중국어 보도는 또다시 다른 방향으로 정밀한데, 헤드라인에서는 Qwen 4.5 이후의 모델들이 5조~10조 범위로 확장한다고 설명한다. 그렇게 읽으면 10조 쪽 끝은 Qwen 4.5도 넘어선다. 모든 출처가 동의하는 단 하나의 진술은 그 범위가 Qwen 4.5에서 Qwen 5까지의 구간을 포괄한다는 것이다. 10조를 특히 Qwen 5에 배정하는 것은 인용이 아니라 헤드라인이 된 추론이다.

규모를 가늠해 보자면, 그리고 이 이야기에서 추정치가 아니라 발표된 유일한 숫자들은 다음과 같습니다:

• 5조에서 10조 — 알리바바의 보도자료가 Qwen 4.5 및 Qwen 5 시리즈에 제시하는 파라미터 대역

• 2.4조 — 공식 모델 카드 기준, 실제 출시된 플래그십 Qwen3.8-Max의 총 파라미터 수

• 950억 — 토큰당 Qwen3.8-Max의 활성 파라미터 수로, 토큰을 처리하는 데 드는 비용을 좌우하는 수치

• 10조 — 해당 범위의 최상단이자, 대부분의 영어 헤드라인에 오른 유일한 부분

• 0 — Qwen 4.5 또는 Qwen 5에 대해 공개된 사양, 출시일, 가격, 컨텍스트 윈도우 또는 벤치마크 점수의 수

A generated scoreboard titled 'Shipped vs projected - the scoreboard'. Left column 'Qwen3.8-Max (shipping)' reads GA August 3, 2026; 2.4 trillion total parameters; 95 billion active parameters; 1,000,000-token context window; $2.00 in / $6.00 out; benchmarks vendor table plus AA Index 45. Right column 'Qwen 4.5 / Qwen 5 (roadmap)' reads release none given; 5 to 10 trillion series; active parameters not published; context window not published; price not published; benchmarks none published. Footer reads 'Qwen3.8-Max specs per its model card; AA Index per Artificial Analysis; Qwen 4.5 and Qwen 5 per Alibaba's September 22, 2026 roadmap.'

정작 중요한 파라미터 수치는 아무도 공개하지 않은 것이다

전체 파라미터 수는 연구소가 말하기로 선택한 숫자입니다. 활성 파라미터 수는 구매자가 필요로 하는 숫자이며, 로드맵에는 그것이 포함되어 있지 않습니다.

Qwen3.8-Max는 총 2조 4,000억 개의 파라미터를 갖추고 토큰당 950억 개가 활성화되는 전문가 혼합(mixture-of-experts) 모델입니다. 이는 약 4%의 활성화 비율에 해당합니다. 즉, 이 모델은 특정 토큰을 처리할 때 읽지 않는 가중치에 방대한 지식을 담고 있으며, 그중 작은 일부에 대해서만 연산 비용을 지불합니다. 전체 파라미터는 이 모델이 얼마나 많은 메모리를 차지하고 얼마나 큰 박스가 필요한지를 알려줍니다. 활성 파라미터는 모델이 답변할 때마다 무엇을 지불하는지를 알려줍니다.

그 비율을 앞으로 밀어 보면 문제의 윤곽이 드러난다. 같은 4퍼센트 활성화로 만든 10조 파라미터 모델이라면 토큰당 약 4,000억 개 파라미터가 활성화될 것이다 — 이는 Qwen3.8-Max가 현재 활성화하는 양의 네 배가 넘는다. 이것은 명시된 가정에 대한 산술이지, Qwen 5에 대한 주장이 아니다: 희소성을 높이면 활성 파라미터 수는 줄고, 낮추면 늘어난다. 하지만 10조 파라미터 모델이 서비스되는 제품인지 연구용 결과물인지를 결정하는 것은 이 산술이며, 5조에서 10조라는 헤드라인이 초대해 놓고 끝내 완성하지 않는 계산이 바로 그것이다.

이 또한 라우팅 경제학이 추상적인 논의에서 벗어나는 지점입니다. OrcaRouter에서는 제공자의 정가가 0% 마크업으로 그대로 전달되므로, Qwen 티어에 대한 공급업체의 가격 인하는 갱신 시점이 아니라 같은 날 귀하의 키에 바로 반영됩니다. 서빙 비용이 진정으로 불확실한 세대야말로, 아무도 공개하지 않은 숫자를 기준으로 사전에 협상한 할인보다 그 패스스루가 더 가치 있는 바로 그 경우입니다.

칩 발표가 실제 일정이다

Alibaba는 같은 보도자료에서 모델 로드맵과 새로운 가속기를 발표했는데, 이 둘은 보도자료가 말하는 것보다 더 밀접하게 연결되어 있다.

T-Head의 Zhenwu V900은 216GB 메모리와 1,200GB/s의 칩 간 대역폭을 갖추고 FP8 및 FP4를 네이티브로 지원하며, 지난 5월 출시된 전작 Zhenwu M890보다 세 배의 성능을 낸다고 주장하는 훈련 및 추론 프로세서입니다. 양산과 상용 출시는 2027년 1분기로 예정되어 있습니다. 동반 슈퍼노드 서버는 최대 50만 장의 카드로 구성된 클러스터를 지원하며, T-Head는 Zhenwu 라인이 650개 이상의 고객사에 서비스를 제공해 왔다고 밝혔습니다.

두 발표를 함께 읽으면 그 순서가 분명해집니다. 10조 규모의 전문가 혼합(MoE) 모델을 학습하고 서빙하는 일은 연산 문제이기 전에 상호 연결 문제입니다. 전문가 병렬화는 칩 사이에서 활성값을 끊임없이 이동시키는 것을 뜻하고, 칩 간 대역폭 1,200 GB/s가 그것이 실행 가능한지를 결정하는 숫자이기 때문입니다. 그 일정에 맞춘 실리콘은 이런 종류의 프런티어 규모 실행에 대한 가장 이른 현실적 시점을 2027년 한참 뒤로 밀어 놓습니다. 그리고 설령 그때가 되어도, 칩이 출하된다는 사실은 학습 실행이 끝난다는 것을 말해주지 않습니다. 알리바바는 두 주제를 하나의 릴리스에 담아 연결했습니다. 그 연결 자체는 우리의 해석이며, 그렇게 표시되어 있습니다.

회사 자체의 시간 지평도 이와 일치한다. 에디 우 최고경영자(CEO)는 2032년까지 글로벌 알리바바 클라우드 데이터센터 용량을 20기가와트 이상으로 확보하겠다는 목표를 세웠다. 이는 실제 가동된 용량이 아닌 '용량' 목표이며, 다음 분기가 아닌 5년 이상의 장기적 지평을 뜻한다.

로드맵을 떠받치고 있는 자기계발 주장들

5조~10조 규모의 계획이 그저 비싼 것을 넘어 애초에 논쟁할 가치가 있는 이유는 재귀적 자기 개선에 있다. 훈련 파이프라인이 스스로를 개선하면 세대당 필요한 컴퓨팅이 줄고, 최전선은 감당 가능한 수준에 더 가까워진다. 그것이 이 로드맵을 떠받치는 핵심 주장이며, 동시에 Alibaba가 한 말 중 가장 검증하기 어려운 것이기도 하다.

회사가 보고한 내용: Qwen3.8-Max는 약 한 달간의 완전 자동화 작업에서 파이프라인 설계, 데이터 검증 및 오류 진단 전반에 걸쳐 33회의 반복 주기를 완료했고, Artificial Analysis 점수를 40에서 45로 끌어올렸다. 칩 설계 실험에서 이 모델은 설계 수명 주기 전반에 걸쳐 60시간 이상의 자기 개선을 수행했으며, 10,000회 이상의 전자 설계 자동화 도구 호출을 했고, 성능 손실 없이 칩 면적을 42퍼센트 줄였다. 학회에서 나온 한 보고서는 또한 새로운 T-Head GPU를 자율적으로 튜닝해 추론 처리량을 96퍼센트 향상시킨 사례도 담고 있다.

이것들은 벤더가 보고한 것이며 독립적으로 재현되지 않았습니다. 이는 단순한 형식적 문제가 아닙니다 — 자신의 실험을 스스로 채점하는 자율 루프는 자체 채점자에 비추어 자신을 측정하는 것이고, 외부 세계는 그 평가 기준을 확인할 방법이 없습니다. 학회에 대한 보도는 일반적으로 그렇게 말해 왔으며, 독자들은 그렇게 가정해야 합니다.

같은 주장에는 두 번째 함정이 있는데, 그것은 정직성이 아니라 표기에 관한 것이다. Alibaba는 자신의 40→45 변화가 Artificial Analysis Intelligence Index의 어느 개정판을 기준으로 측정된 것인지 밝히지 않았고, 그 지수는 이 모델이 출시된 이후 재구성되었다. 현재 Qwen3.8 Max (0902)의 Artificial Analysis 페이지에는 45가 적혀 있다 — 오늘 시행 중인 개정판 기준의 독립적인 수치다. 같은 모델에 대해 8월 중순에, 당시 시행 중이던 개정판 기준으로 기록된 수치는 56이었다. 45와 56은 같은 단위로 이루어진 같은 측정값이 아니며, 한쪽에서 다른 쪽을 빼면 아무 의미 없는 숫자가 나온다. 페이지에 없는 것은 Alibaba가 개선 전 수치라고 말하는 40이다: 그 변화량의 출발점은 회사 자체의 값이고, 종착점만이 현재 독립적 수치가 있는 위치에 우연히 놓여 있을 뿐이다. 이 변화는 측정값이 아니라 방향으로 읽어라.

A screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured September 23 2026, showing an Artificial Analysis Intelligence Index of 45 (ranked 24 of 212, badge 'Updated'), speed of 39.2 output tokens per second (159 of 212), $2.00 per 1M input and $6.00 per 1M output tokens with an 88% cache discount and $5.41 cost per Intelligence Index task (90 of 212), verbosity of 190M output tokens (88 of 212), and a technical specification listing a 984k context window with reasoning enabled.

알리바바가 같은 콘퍼런스에서 실제로 출시한 것

로드맵을 걷어내고 보면, 그 컨퍼런스에는 여전히 실제 출시작들이 담겨 있었고, 그 모두가 멀티모달이었다:

• Qwen3.8-LiveTranslate — 동시통역, 지연 시간(LAAL)을 거의 20% 단축해 2.8초에서 2.3초로

• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-TTS 및 Qwen-Audio-3.1-Realtime — 새로워진 음성 제품군

• Qwen-Audio-3.1-TTS-Next — 텍스트 대본의 대사와 앰비언스를 융합한 시네마틱 사운드스케이프로, 오디오북, 영화 및 TV, 팟캐스트, 게임을 대상으로 합니다

• Qwen-Image 3.1 — 크리에이티브 디자인과 이커머스 마케팅에 특화된 이미지 생성 모델로, 올해 하반기 출시 예정이며 네이티브 투명 배경 생성 기능을 제공

• Qwen Intelligence — 스마트폰 제조사를 겨냥한 풀스택 에이전트 플랫폼

그 목록의 모든 항목은 출시 시점이 정해진 제품이다. 프런티어 규모라는 주장은 의제에서 날짜가 붙지 않은 유일한 항목이며, 이 대비는 우연이 아니다: 멀티모달 티어를 출시하는 것이 로드맵 한 해에 자금을 대는 일이고, 로드맵은 다음 펀딩 라운드나 다음 클라우드 계약을 스프레드시트가 아니라 이야기로 만드는 일이다. 둘 다 실재한다. 그중 전화할 수 있는 것은 하나뿐이다.

오늘 무엇이 호출 가능하며, 그것이 바뀌려면 무엇이 바뀌어야 하는가

Qwen 3.8 세대는 여전히 구매 가능한 전체 라인업을 구성합니다. Qwen3.8-Max는 2026년 8월 3일부터 일반 제공되었으며, 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00으로, 1,000,000토큰 전체 컨텍스트에 걸쳐 동일하게 적용되고 장문 프롬프트 할증은 없습니다. 이 모델의 가중치는 2026년 8월 12일 Qwen3.8-2.4T-A95B로 BF16 및 FP8 형식으로 공개되었으며, 사용자 정의 Qwen 라이선스 하에 있습니다. 벤더 벤치마크 표는 강력하지만 감사되지 않았습니다 — Terminal-Bench 2.1은 86.6, GPQA Diamond는 92.6, OSWorld-Verified는 86.1로, 모두 알리바바 자체 수치입니다 — 독립적인 평가는 벤더 측보다 덜 호의적입니다. Artificial Analysis는 Qwen3.8 Max (0902)의 Intelligence Index를 45로, 212개 모델 중 24위로 평가하며, Intelligence Index 작업당 측정 비용 $5.41, 초당 출력 토큰 39.2개 — 212개 중 159위로, 해당 분야에서 거의 가장 느린 편입니다. 같은 페이지에서는 컨텍스트 창을 984k로 기재하고 있는데, 자체 모델 페이지의 1,000,000과 대비됩니다. 장문 컨텍스트 작업의 규모를 정하기 전에 알아둘 만한 차이입니다. 최전선급 점수, 중간권 속도: 이것이 출시된 플래그십에 대한 솔직한 요약이며, Qwen 4.5가 두 축 모두에서 동시에 능가해야 하는 기준선입니다.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), captured September 23 2026, showing the model id, 1M-token context, text image and video input with text output, vision tools JSON and reasoning badges, a dated snapshot label of 2026-08-03, input at $2.00 and output at $6.00 per 1M tokens, p50 TTFT 3.09s and p95 TTFT 10.00s, trailing-7-day traffic of 29.4M tokens, and a Python code sample posting to the OpenAI-compatible base_url https://api.orcarouter.ai/v1.

OrcaRouter는 Qwen 3.8 패밀리 — qwen/qwen3.8-max, qwen3.8-flash 및 qwen3.8-27b200개 이상의 다른 모델과 함께 하나의 OpenAI 호환 엔드포인트에서 제공합니다. 즉, Qwen 4.5 등급이 나오더라도 새로운 벤더 계약과 새로운 청구서, 새로운 SDK가 필요한 것이 아니라 기존 키에서 모델 ID만 바꾸면 된다는 뜻입니다. 실제로 출시되면 바로 그 카탈로그에 등장하게 됩니다. 현재 Qwen 4.5도 Qwen 5도 그 목록에 없습니다. 둘 다 아직 출시되지 않았기 때문이며, 아무리 많은 로드맵 보도자료도 그 사실을 바꾸지 못합니다.

이런 로드맵의 실질적인 용도는 마이그레이션 계획과는 정반대입니다. Qwen 4.5 티어가 언젠가 귀하의 워크로드에 그럴듯한 선택지로 보인다면, 이를 알아내는 저렴한 방법은 실제 트래픽의 일부를 자동 폴백을 뒤에 두고 그 모델로 라우팅하는 것입니다. 그래야 느리거나 비싸거나 기존 모델보다 못한 것으로 판명된 모델 때문에 한 워크로드의 4분의 1이 아니라 그중 일부 비율만큼만 비용을 치르게 됩니다. 페일오버는 바로 이런 때를 위한 것이며, 검증되지 않은, 출시된 지 며칠 된 프런티어 모델은 이를 사용해야 하는 가장 명확한 사례입니다.

무엇을 지켜봐야 하고, 무엇을 아직 믿지 말아야 하는가

로드맵의 한 줄은 구체적인 몇 가지가 나타날 때 하나의 릴리스가 된다. 총 파라미터 수, 활성 파라미터 수, 컨텍스트 윈도를 명시한 모델 카드. 요청에 넘길 수 있는 API 식별자. 모델 허브에 올라온 가중치. 날짜가 붙은 독립 리더보드의 항목. 가격. 이 중 어느 하나만으로도 신호이며, 대부분이 함께 나타나면 출시다.

릴리스가 아닌 것들, 아무리 기술적으로 보여도: 컨퍼런스 언급; 실험적 Qwen 빌드를 위한 아키텍처 브랜치를 추가하는 서빙 프레임워크의 풀 리퀘스트—이는 호출할 수 있는 모델이라기보다 누군가의 추론 스택에 대한 엔진 작업이다; 이미 출시된 세대에 대한 날짜가 찍힌 스냅샷 ID; 그리고 무대 발언을 요약한 소셜 게시물. 이 글을 만들어낸 신호는 그중 마지막이었고, 이를 글로 쓸 가치가 있었던 이유는 근본 주장을 알리바바 자체 보도자료와 대조해 확인할 수 있기 때문이다. 5조~10조 구간, Qwen 4 상태, RSI 수치가 모두 나오는 곳이 바로 거기다. 신호는 그 이야기를 가리켰을 뿐, 그 이야기 자체는 아니다.

단기적인 질문은 헤드라인이 시사하는 것보다 더 좁다. Alibaba는 Qwen 4가 학습 중이라고 밝혔는데, 이는 순서상 Qwen 4를 4.5와 5 모두보다 앞에 놓는다. 따라서 다음으로 주목할 것은 10조 매개변수 모델이 아니라 Qwen 4가 모델 카드, 가격, 엔드포인트를 갖추고 출시되는지, 그리고 언제인지다. 그 사슬에서 무언가가 실현되기 전까지, 5조~10조 구간에 대한 솔직한 입장은 그것이 공식적으로 밝혀진 진행 방향이며 거기에 붙은 사양도 날짜도 없다는 것이다. Qwen3.8-Max를 기준으로 계획하라, 4.5와 5 구간은 제품이 아니라 스케일링 명제로 지켜보라, 그리고 모델 카드가 없는 모델에 대해 보게 되는 모든 매개변수 수치는 예측으로 취급하라.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트