Một thẻ tiêu đề được tạo với tiêu đề 'Qwen 4.5 và Qwen 5: 5 đến 10 nghìn tỷ tham số', phụ đề 'Một dải lộ trình, không phải bản đặc tả' và ba thẻ ghi 'Mục tiêu lộ trình / 5-10T tham số', 'Mẫu chủ lực đang phát hành / Qwen3.8-Max 2.4T' và 'Ngày phát hành / chưa công bố'. Một dòng chân trang ghi 'Theo thông cáo báo chí ngày 22 tháng 9 năm 2026 của Alibaba; chưa có thẻ mô hình nào được công bố.' Phong cách biên tập vector phẳng trên nền trắng với lớp chuyển sắc từ xanh dương sang xanh lơ và logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Qwen 4.5 và Qwen 5 nhắm mục tiêu 5 đến 10 nghìn tỷ tham số: những gì Alibaba đã nói và chưa nói

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tại Hội nghị Apsara của mình ở Hàng Châu vào ngày 22 tháng 9 năm 2026, công ty đã đưa ra quy mô cho thế hệ sau thế hệ kế tiếp. Dòng Qwen 4.5Qwen 5 được "dự kiến mở rộng quy mô lên 5 đến 10 nghìn tỷ tham số," theo cách diễn đạt trong thông cáo báo chí tiếng Anh của chính công ty — một dòng lộ trình, không phải thông số kỹ thuật. Cả hai mô hình đều không có ngày phát hành, thẻ mô hình, mã định danh API, giá hay điểm chuẩn được công bố, nghĩa là không có gì về cả hai có thể gọi được ngay hôm nay. Mô hình chủ lực mà bạn thực sự có thể mua là Qwen3.8-Max, có sẵn rộng rãi kể từ ngày 3 tháng 8 năm 2026, với 2,4 nghìn tỷ tham số. Trong những ngày kể từ hội nghị, câu lộ trình đó đã bị đơn giản hóa trong nhiều bài đưa tin thành một tuyên bố rằng một mô hình 10 nghìn tỷ tham số đang đến — một tuyên bố mạnh mẽ hơn, đơn giản hơn so với tuyên bố mà công ty đã đưa ra. Khoảng cách giữa hai câu đó là khoảng một năm lập kế hoạch.

Tuyên bố đó, và phiên bản của nó đã lan truyền

Hai điều đã được nói trên sân khấu, và chúng đáng được tách bạch vì chúng mang lượng thông tin rất khác nhau. Điều thứ nhất là một cập nhật tình trạng: Qwen 4 đang được huấn luyện, trên một kiến trúc mới. Điều thứ hai là một lộ trình: dòng Qwen 4.5 và Qwen 5 được dự kiến sẽ đạt tới dải tham số từ 5 đến 10 nghìn tỷ.

Thông cáo báo chí tiếng Anh của Alibaba quy cả hai cho công ty thay vì một giám đốc điều hành được nêu tên. Bài đưa tin về hội nghị đi xa hơn quy lộ trình cho Liu Da Yiheng, người điều hành dự án mô hình ngôn ngữ lớn Qwen tại Alibaba Token Hub, và đưa tin về quan điểm của ông rằng mở rộng quy mô là một con đường then chốt dẫn tới siêu trí tuệ nhân tạo. Quan điểm đó là bối cảnh mà con số tham số được đưa ra, và nó giải thích tại sao con số đó là một khoảng chứ không phải một mục tiêu.

Điều được lan truyền sau đó là mức cao nhất của khoảng. Các tiêu đề tiếng Anh sau đó bao gồm ít nhất một tiêu đề mô tả một mô hình 10 nghìn tỷ tham số mới chỉ được nhá hàng, và một số tiêu đề mô tả kế hoạch cho một mô hình 5 đến 10 nghìn tỷ tham số. Cả hai đều là những cách diễn giải có thể biện minh được cho một slide. Không cái nào là đặc tả kỹ thuật, và sự khác biệt này quan trọng với bất kỳ ai phải lập kế hoạch dựa trên nó.

5 nghìn tỷ là mục tiêu của một thế hệ và 10 nghìn tỷ là của một thế hệ khác

Điều hữu ích nhất cần nắm đúng về thông báo này là 5 đến 10 nghìn tỷ là một dải trải dài hai thế hệ, chứ không phải một mô hình với dung sai rộng. Câu văn của chính Alibaba gắn dải đó với "dòng mô hình Qwen 4.5 và Qwen 5 sắp ra mắt" — tức dòng mô hình, ở dạng số nhiều, được xét cùng nhau.

Các bản tin tiếng Trung từ cùng hội nghị lại chính xác theo một hướng khác, với các tiêu đề mô tả những mô hình sau Qwen 4.5 mở rộng vào phạm vi 5–10 nghìn tỷ. Cách diễn giải đó cũng đặt đầu 10 nghìn tỷ vượt ra ngoài Qwen 4.5. Phát biểu duy nhất mà mọi nguồn đều đồng tình là dải này bao trùm khoảng từ Qwen 4.5 đến Qwen 5. Việc gán cụ thể 10 nghìn tỷ cho Qwen 5 là một suy luận đã trở thành tiêu đề, chứ không phải một trích dẫn.

Để thấy quy mô, và đây là những con số duy nhất trong câu chuyện này được công bố chứ không phải dự phóng:

• 5 đến 10 nghìn tỷ — dải tham số mà thông cáo báo chí của Alibaba gán cho dòng Qwen 4.5 và Qwen 5

• 2,4 nghìn tỷ — tổng số tham số của Qwen3.8-Max, mẫu flagship đang được phát hành, theo thẻ mô hình chính thức của nó

• 95 tỷ — số tham số hoạt động trên mỗi token của Qwen3.8-Max, con số quyết định chi phí để phục vụ mỗi token

• 10 nghìn tỷ — mức cao nhất của dải, và là phần duy nhất của nó lọt vào hầu hết các tiêu đề tiếng Anh

• 0 — số lượng thông số kỹ thuật, ngày phát hành, giá, cửa sổ ngữ cảnh hoặc điểm benchmark được công bố cho Qwen 4.5 hoặc Qwen 5

A generated scoreboard titled 'Shipped vs projected - the scoreboard'. Left column 'Qwen3.8-Max (shipping)' reads GA August 3, 2026; 2.4 trillion total parameters; 95 billion active parameters; 1,000,000-token context window; $2.00 in / $6.00 out; benchmarks vendor table plus AA Index 45. Right column 'Qwen 4.5 / Qwen 5 (roadmap)' reads release none given; 5 to 10 trillion series; active parameters not published; context window not published; price not published; benchmarks none published. Footer reads 'Qwen3.8-Max specs per its model card; AA Index per Artificial Analysis; Qwen 4.5 and Qwen 5 per Alibaba's September 22, 2026 roadmap.'

Con số tham số quan trọng chính là con số mà không ai công bố.

Tổng số tham số là con số mà một phòng thí nghiệm chọn để công bố. Số tham số hoạt động là con số mà người mua cần, còn lộ trình thì không có con số đó.

Qwen3.8-Max là một mô hình mixture-of-experts với tổng cộng 2,4 nghìn tỷ tham số và 95 tỷ tham số hoạt động trên mỗi token. Đó là tỷ lệ kích hoạt vào khoảng 4 phần trăm: mô hình nắm giữ một lượng lớn kiến thức trong các trọng số mà nó không đọc đến ở bất kỳ token nào, và chỉ trả chi phí tính toán cho một phần nhỏ trong đó. Tổng số tham số cho bạn biết mô hình chiếm bao nhiêu bộ nhớ và bạn cần một cỗ máy lớn đến mức nào. Số tham số hoạt động cho bạn biết bạn phải trả bao nhiêu mỗi lần nó trả lời.

Chạy tỷ lệ đó về phía trước, và hình dạng của vấn đề trở nên hiển hiện. Một mô hình 10 nghìn tỷ tham số được xây dựng với cùng mức kích hoạt 4 phần trăm sẽ kích hoạt vào khoảng 400 tỷ tham số mỗi token — hơn bốn lần mức mà Qwen3.8-Max kích hoạt hiện nay. Đó là phép tính dựa trên một giả định đã nêu, không phải một khẳng định về Qwen 5: đẩy độ thưa lên thì số lượng kích hoạt giảm, hạ nó xuống thì con số lại tăng. Nhưng chính phép tính này mới quyết định liệu một mô hình 10 nghìn tỷ tham số là một sản phẩm có thể phục vụ hay chỉ là một hiện vật nghiên cứu, và đó cũng là phép tính mà tiêu đề 5 đến 10 nghìn tỷ khơi gợi ra rồi lại bỏ dở.

Đây cũng là điểm mà tính kinh tế của việc định tuyến không còn trừu tượng nữa. Trên OrcaRouter, giá niêm yết của nhà cung cấp được chuyển thẳng qua với mức markup 0%, nên việc nhà cung cấp giảm giá cho một hạng Qwen sẽ có hiệu lực ngay trên khóa của bạn trong cùng ngày thay vì đợi đến kỳ gia hạn. Một thế hệ mà chi phí phục vụ thực sự khó nắm chắc chính là trường hợp mà việc chuyển thẳng đó đáng giá hơn một khoản chiết khấu được đàm phán trước dựa trên một con số mà chưa ai công bố.

Thông báo về chip mới chính là mốc thời gian thực tế.

Alibaba đã công bố lộ trình phát triển mô hình và một bộ tăng tốc mới trong cùng một thông cáo báo chí, và hai điều này có mối liên hệ với nhau nhiều hơn những gì thông cáo nói.

Zhenwu V900 của T-Head là bộ xử lý huấn luyện và suy luận với 216 GB bộ nhớ và băng thông liên chip 1.200 GB/s, hỗ trợ gốc cho FP8 và FP4, và được tuyên bố có hiệu năng gấp ba lần so với phiên bản tiền nhiệm Zhenwu M890 ra mắt hồi tháng 5. Việc sản xuất hàng loạt và phát hành thương mại được lên kế hoạch vào quý đầu tiên của năm 2027. Một máy chủ supernode đi kèm hỗ trợ các cụm lên tới 500.000 card, và T-Head cho biết dòng Zhenwu đã phục vụ hơn 650 khách hàng.

Đọc hai thông báo cùng nhau, trình tự sẽ trở nên rõ ràng. Huấn luyện và phục vụ một mô hình mixture-of-experts ở quy mô 10 nghìn tỷ là một bài toán kết nối trước khi là một bài toán tính toán, bởi vì song song chuyên gia (expert parallelism) nghĩa là liên tục di chuyển activation giữa các chip, và 1.200 GB/s băng thông giữa các chip là con số quyết định liệu điều đó có khả thi hay không. Silicon theo tiến độ đó đẩy cửa sổ khả dĩ sớm nhất cho một lần chạy ở quy mô tiên phong như thế này vào tận sâu trong năm 2027 — và ngay cả khi đó, việc một chip được xuất xưởng cũng chẳng nói lên điều gì về việc một lần chạy huấn luyện hoàn thành. Alibaba đã kết nối hai chủ đề bằng cách đặt chúng vào cùng một bản phát hành; bản thân mối liên hệ đó là cách đọc của chúng tôi, và nó được ghi nhãn đúng như vậy.

Tầm nhìn thời gian của chính công ty cũng nhất quán với điều đó. Giám đốc điều hành Eddie Wu đặt mục tiêu đạt hơn 20 gigawatt công suất trung tâm dữ liệu Alibaba Cloud toàn cầu vào năm 2032 — một mục tiêu công suất, không phải công suất đã triển khai, và là tầm nhìn từ năm năm trở lên thay vì chỉ một quý tới.

Những tuyên bố về khả năng tự cải thiện đang giữ cho lộ trình đứng vững

Lý do khiến một kế hoạch trị giá 5 đến 10 nghìn tỷ có thể tranh luận được chút nào, chứ không chỉ đơn thuần là đắt đỏ, nằm ở khả năng tự cải thiện đệ quy: nếu quy trình huấn luyện tự cải thiện chính nó, lượng tính toán cần cho mỗi thế hệ sẽ giảm xuống, và biên giới tiên tiến sẽ tiến gần hơn tới mức có thể chi trả. Đó là luận điểm trụ cột nằm dưới lộ trình, và nó cũng là điều ít có thể kiểm chứng nhất mà Alibaba đã nói.

Những gì công ty báo cáo: Qwen3.8-Max đã hoàn thành 33 chu kỳ lặp lại trong khoảng một tháng làm việc hoàn toàn tự động, bao gồm thiết kế pipeline, xác thực dữ liệu và chẩn đoán lỗi, và nâng điểm Artificial Analysis của mình từ 40 lên 45. Trong một thí nghiệm thiết kế chip, mô hình đã dành hơn 60 giờ tự cải thiện trong suốt vòng đời thiết kế, thực hiện hơn 10.000 lệnh gọi công cụ tự động hóa thiết kế điện tử, và giảm 42 phần trăm diện tích chip mà không làm giảm hiệu năng. Một báo cáo từ hội nghị cũng ghi nhận mức cải thiện 96 phần trăm thông lượng suy luận nhờ tự động tinh chỉnh một GPU T-Head mới.

Đây là những thông tin do nhà cung cấp tự báo cáo và chưa được tái lập một cách độc lập. Đó không phải là một chi tiết kỹ thuật đơn thuần — một vòng lặp tự trị tự chấm điểm các thí nghiệm của chính nó đang đo lường chính mình dựa trên bộ chấm điểm của chính nó, và thế giới bên ngoài không có cách nào để kiểm tra bộ tiêu chí đánh giá đó. Các bài đưa tin về hội nghị nhìn chung đều nói như vậy, và độc giả nên mặc định là như thế.

Có một cái bẫy thứ hai trong cùng tuyên bố đó, và nó nói về nhãn mác chứ không phải sự trung thực. Alibaba không nói mức dịch chuyển từ 40 lên 45 của mình được đo dựa trên bản sửa đổi nào của Chỉ số Trí tuệ Artificial Analysis, và chỉ số đó đã được xây dựng lại kể từ khi mô hình này ra mắt. Trang Artificial Analysis hiện tại cho Qwen3.8 Max (0902) ghi 45 — một con số độc lập, trên bản sửa đổi đang có hiệu lực hôm nay. Con số được ghi nhận cho cùng mô hình vào giữa tháng 8, theo bản sửa đổi khi đó đang có hiệu lực, là 56. 45 và 56 không phải cùng một phép đo trong cùng đơn vị, và lấy số này trừ số kia sẽ tạo ra một con số vô nghĩa. Điều mà trang đó không mang theo là con số 40 mà Alibaba nói mình đã cải thiện từ đó: điểm khởi đầu của mức chênh lệch ấy là của chính công ty, và chỉ điểm kết thúc tình cờ nằm đúng nơi mà con số đọc độc lập hiện giờ đang nằm. Hãy đọc sự dịch chuyển đó như một hướng đi, chứ không phải một phép đo.

A screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured September 23 2026, showing an Artificial Analysis Intelligence Index of 45 (ranked 24 of 212, badge 'Updated'), speed of 39.2 output tokens per second (159 of 212), $2.00 per 1M input and $6.00 per 1M output tokens with an 88% cache discount and $5.41 cost per Intelligence Index task (90 of 212), verbosity of 190M output tokens (88 of 212), and a technical specification listing a 984k context window with reasoning enabled.

Alibaba đã tung ra gì tại cùng hội nghị đó

Bỏ qua lộ trình, hội nghị vẫn có những bản phát hành thực sự, tất cả đều đa phương thức:

• Qwen3.8-LiveTranslate — phiên dịch đồng thời, với độ trễ (LAAL) giảm gần 20 phần trăm, từ 2,8 giây xuống 2,3 giây

• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-TTS và Qwen-Audio-3.1-Realtime — một bộ công cụ giọng nói được làm mới

• Qwen-Audio-3.1-TTS-Next — không gian âm thanh đậm chất điện ảnh, kết hợp đối thoại và âm thanh nền từ một kịch bản văn bản, hướng đến sách nói, điện ảnh và truyền hình, podcast và trò chơi

• Qwen-Image 3.1 — tạo hình ảnh được tinh chỉnh cho thiết kế sáng tạo và tiếp thị thương mại điện tử, dự kiến ra mắt vào cuối năm nay, với khả năng tạo nền trong suốt gốc

• Qwen Intelligence — nền tảng agentic full-stack hướng đến các nhà sản xuất điện thoại thông minh

Mỗi mục trong danh sách đó đều là một sản phẩm có khung thời gian giao hàng. Tuyên bố quy mô tiên phong là mục duy nhất trên chương trình nghị sự không gắn ngày tháng, và sự tương phản ấy không phải ngẫu nhiên: việc phát hành tầng đa phương thức chính là thứ tài trợ cho một năm lộ trình, và lộ trình chính là thứ biến vòng gọi vốn tiếp theo hoặc hợp đồng đám mây tiếp theo thành một câu chuyện thay vì một bảng tính. Cả hai thứ đều có thật. Chỉ một trong số đó là thứ bạn có thể gọi.

Điều gì có thể gọi được ngày hôm nay, và cần thay đổi điều gì để điều đó thay đổi?

Thế hệ Qwen 3.8 vẫn là toàn bộ dòng sản phẩm có thể mua được. Qwen3.8-Max đã được cung cấp rộng rãi kể từ ngày 3 tháng 8 năm 2026 với mức 2,00 USD cho mỗi triệu token đầu vào và 6,00 USD cho mỗi triệu token đầu ra, giữ nguyên trên toàn bộ ngữ cảnh 1.000.000 token mà không có phụ phí cho prompt dài. Trọng số của nó đã được công bố vào ngày 12 tháng 8 năm 2026 với tên Qwen3.8-2.4T-A95B ở định dạng BF16 và FP8 theo một giấy phép Qwen tùy chỉnh. Bảng benchmark của nhà cung cấp thì mạnh và chưa được kiểm toán — Terminal-Bench 2.1 đạt 86,6, GPQA Diamond đạt 92,6, OSWorld-Verified đạt 86,1, tất cả đều là số liệu của chính Alibaba — Bức tranh độc lập không mấy tốt đẹp bằng bức tranh từ phía nhà cung cấp: Artificial Analysis xếp Qwen3.8 Max (0902) ở Intelligence Index 45, thứ 24 trong 212 mô hình, với chi phí đo được là 5,41 USD cho mỗi tác vụ Intelligence Index và 39,2 token đầu ra mỗi giây — thứ 159 trong 212, gần mức chậm nhất của nhóm. Cùng trang đó liệt kê cửa sổ ngữ cảnh là 984k, so với 1.000.000 trên trang mô hình của chính chúng tôi, một khoảng cách đáng để biết trước khi bạn ước lượng quy mô cho một tác vụ ngữ cảnh dài. Điểm số đẳng cấp tiên phong, tốc độ tầm trung: đó là bản tóm tắt trung thực về mẫu flagship đang bán ra, và đó là mức cơ sở mà bất kỳ Qwen 4.5 nào cũng phải vượt qua trên cả hai trục cùng lúc.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), captured September 23 2026, showing the model id, 1M-token context, text image and video input with text output, vision tools JSON and reasoning badges, a dated snapshot label of 2026-08-03, input at $2.00 and output at $6.00 per 1M tokens, p50 TTFT 3.09s and p95 TTFT 10.00s, trailing-7-day traffic of 29.4M tokens, and a Python code sample posting to the OpenAI-compatible base_url https://api.orcarouter.ai/v1.

OrcaRouter cung cấp dòng Qwen 3.8 — qwen/qwen3.8-max, qwen3.8-flash và qwen3.8-27b — trên một endpoint tương thích OpenAI cùng với hơn 200 mô hình khác, nghĩa là một hạng Qwen 4.5 sẽ chỉ là thay đổi model-id trên một khóa hiện có, chứ không phải một hợp đồng nhà cung cấp mới, một hóa đơn mới và một SDK mới. Khi có một phiên bản như vậy ra mắt, danh mục đó chính là nơi nó sẽ xuất hiện. Hiện nay, cả Qwen 4.5 lẫn Qwen 5 đều không có trong đó, vì cả hai đều chưa được phát hành — và dù có bao nhiêu bài báo về lộ trình đi nữa cũng không thay đổi được điều đó.

Công dụng thực tế của một lộ trình như thế này ngược lại với một kế hoạch di trú. Nếu một tầng Qwen 4.5 cuối cùng có vẻ khả thi với khối lượng công việc của bạn, cách rẻ tiền để kiểm chứng là định tuyến một phần lưu lượng thật đến nó phía sau một cơ chế tự động dự phòng, để một mô hình hóa ra lại chậm, đắt đỏ hoặc tệ hơn mô hình hiện hữu chỉ khiến bạn tốn một tỷ lệ phần trăm của một khối lượng công việc thay vì một phần tư. Đó chính là mục đích của failover, và một mô hình tiên phong chưa được kiểm chứng, mới ra đời vài ngày, là trường hợp rõ ràng nhất để sử dụng nó.

Những điều cần theo dõi và những điều chưa nên tin vội

Một dòng trong lộ trình trở thành một bản phát hành khi một nhóm nhỏ những thứ cụ thể xuất hiện. Một thẻ mô hình mang tổng số tham số, số tham số hoạt động và cửa sổ ngữ cảnh. Một mã định danh API mà bạn có thể truyền trong yêu cầu. Các trọng số trên một trung tâm mô hình. Một mục trên bảng xếp hạng độc lập có kèm ngày tháng. Một mức giá. Bất kỳ điều nào trong số đó là một tín hiệu; hầu hết chúng cùng xuất hiện thì là một màn ra mắt.

Những thứ không phải là một bản phát hành, dù trông có vẻ kỹ thuật đến đâu: một lần được nhắc đến tại hội nghị; một pull request của framework phục vụ bổ sung một nhánh kiến trúc cho một bản dựng Qwen thử nghiệm, vốn là công việc engine trên stack suy luận của ai đó chứ không phải một mô hình bạn có thể gọi; một id ảnh chụp nhanh gắn ngày cho một thế hệ đã phát hành rồi; và một bài đăng mạng xã hội diễn giải lại một phát biểu trên sân khấu. Tín hiệu tạo ra bài viết này là cái cuối cùng trong số đó, và lý do nó đáng được viết ra là vì tuyên bố cốt lõi có thể kiểm chứng dựa trên thông cáo báo chí của chính Alibaba — nơi mà khoảng 5 đến 10 nghìn tỷ, tình trạng Qwen 4 và các con số RSI đều bắt nguồn từ đó. Tín hiệu chỉ hướng tới câu chuyện; nó không phải là câu chuyện.

Câu hỏi trước mắt hẹp hơn những gì các tiêu đề gợi ý. Alibaba đã nói Qwen 4 đang được huấn luyện, điều này đưa Qwen 4 lên trước cả 4.5 và 5 trong chuỗi — vậy nên thứ tiếp theo đáng để theo dõi không phải là một mô hình 10 nghìn tỷ tham số, mà là liệu Qwen 4 có ra mắt cùng model card, mức giá và endpoint hay không, và khi nào. Cho đến khi một mắt xích nào đó trong chuỗi đó thành hiện thực, quan điểm trung thực về dải 5 đến 10 nghìn tỷ là đây là một hướng phát triển, được công bố chính thức, không kèm thông số kỹ thuật nào và không có ngày cụ thể. Hãy lập kế hoạch cho Qwen3.8-Max, theo dõi dải 4.5 và 5 như một luận đề về mở rộng quy mô chứ không phải một sản phẩm, và coi mọi con số tham số bạn thấy cho một mô hình không có model card là dự báo.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày