
Qwen 4 Max được công bố tại Apsara 2026: những gì Alibaba đã xác nhận và những gì họ chưa xác nhận
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Hội nghị Yunqi ở Hàng Châu — Hội nghị Apsara — đã được dùng vào ngày 22 tháng 9 năm 2026 để giới thiệu bốn mô hình chưa được phát hành. Trưởng bộ phận LLM của phòng thí nghiệm, Liu Da Yiheng, đã giới thiệu trước Qwen 4 Max, Qwen 4 Flash, Qwen 4 Plus và Qwen 4 27B trên sân khấu, mô tả dòng mô hình này là đang được huấn luyện trên một kiến trúc thế hệ mới, và chỉ nói rằng nó sẽ sớm ra mắt. Tính đến thời điểm viết bài này, không có model card cho bất kỳ mô hình nào trong bốn mô hình, không có trọng số mở, không có mã định danh API, không có cửa sổ ngữ cảnh, không có giá và không có điểm chuẩn đánh giá. Mô hình chủ lực mới nhất mà bạn thực sự có thể gọi hôm nay là Qwen3.8-Max, được cung cấp rộng rãi kể từ ngày 3 tháng 8 năm 2026, và khoảng cách đó giữa một thông báo trên sân khấu và một endpoint có thể gọi được chính là phần đáng đọc kỹ trong câu chuyện này.
Bốn cấp độ, và mỗi cấp độ được dự định để trở thành gì
Dòng Qwen của Alibaba đã được tổ chức thành các bậc năng lực kể từ thế hệ Qwen 3, và thông báo về Qwen 4 vẫn giữ nguyên cấu trúc đó thay vì thay thế nó. Những gì được trình bày trên sân khấu là một danh sách, chứ không phải một bảng thông số kỹ thuật:
• Qwen 4 Max — hạng chủ lực, và là mẫu mà Alibaba định vị để đối đầu với mô hình hàng đầu từ mọi phòng thí nghiệm tiên phong khác.
• Qwen 4 Flash — phân khúc thông lượng cao, được thiết kế cho các tác vụ nhạy cảm với độ trễ và khối lượng lớn thay vì khả năng suy luận đỉnh cao
• Qwen 4 Plus — phân khúc tầm trung cân bằng, xét về lịch sử là phiên bản có độ phủ hỗ trợ đa phương thức rộng nhất
• Qwen 4 27B — phân khúc cục bộ trọng số mở, bản được tải xuống, tinh chỉnh và lượng tử hóa bởi những người chưa từng đụng đến API được lưu trữ
• Kiến trúc — được mô tả là một thế hệ mới và được mô tả là đang được huấn luyện, điều này không đồng nghĩa với việc đã hoàn thiện
• Khối lượng công việc chính — các tác vụ mang tính agent và sử dụng công cụ, theo cách định hình của hội nghị, thay vì trò chuyện
• Tính khả dụng — không có. Không hạng nào có ngày phát hành, giá, cửa sổ ngữ cảnh, danh sách phương thức hay điểm số được công bố.
Phân khúc 27B là phân khúc đáng để theo dõi vì một lý do chẳng liên quan gì đến các bài benchmark. Đây là phân khúc duy nhất trong dòng sản phẩm từng được phát hành dưới dạng trọng số mở, và thế hệ Qwen 3.8 đã cho thấy điều đó mở ra bao nhiêu công việc độc lập: chỉ trong vài ngày sau khi trọng số 27B xuất hiện, cộng đồng đã tạo ra các bản chuyển đổi MLX, các bản lượng tử hóa NVFP4 và các bản tinh chỉnh không kiểm duyệt. Một mẫu 27B được công bố là lời hứa về cả một hệ sinh thái hạ nguồn, và đây là phần trong lộ trình này có tiến độ phát hành dễ dự đoán nhất.
Con số 5–10 nghìn tỷ tham số không thuộc về Qwen 4
Các bài đưa tin về hội nghị đã khá mơ hồ về một con số. Mục tiêu "5 đến 10 nghìn tỷ tham số" được lan truyền cùng với tin tức về Qwen 4 không phải là thông số kỹ thuật của Qwen 4 — đó là một tuyên bố hướng tới tương lai về các thế hệ sau nó, tức giai đoạn Qwen 4.5 và Qwen 5. Alibaba chưa gắn bất kỳ con số tham số nào cho Qwen 4 Max, và dựa trên bằng chứng hiện có, sẽ là sai lầm nếu đưa ra một con số như vậy.
Điều này quan trọng vì số lượng tham số là con số mà độc giả bám vào và là con số được lan truyền. Một tuyên bố 5T tham số gắn với một mô hình không có kiến trúc được công bố là không thể phản chứng theo cả hai hướng: không ai có thể xác nhận nó, và không ai có thể chỉnh sửa nó một khi nó đã được lặp lại. Nếu tuần này bạn thấy Qwen 4 Max được mô tả là một mô hình nhiều nghìn tỷ tham số, thì con số đó đã được mượn từ một slide khác.
Điều có thể nói một cách trung thực là mẫu flagship tiền nhiệm là một mixture-of-experts 2,4 nghìn tỷ tham số với 95 tỷ tham số hoạt động trên mỗi token, được xác nhận trên model card chính thức của Qwen3.8-Max và trên bản phát hành open-weight theo sau nó. Dù Qwen 4 Max rốt cuộc có là gì, đó là mức cơ sở mà nó phải vượt qua, và đó là một con số đã được công bố, có thể kiểm chứng chứ không phải là một khát vọng trên lộ trình.

Kiến trúc không phải là tin đồn: một bản xem trước của nó đã được phát hành.
Điều hữu ích nhất về thông báo Qwen 4 là một phần kiến trúc đã được phát hành dưới một tên khác. Qwen3.8-Flash-Next đã được mở mã nguồn vào cuối tháng 8 năm 2026, và thẻ mô hình của nó ghi rõ ràng rằng đây là bản xem trước của kiến trúc Qwen 4. Điều đó khiến nó trở thành bằng chứng cụ thể duy nhất mà bất kỳ ai bên ngoài Alibaba có về cách dòng Qwen 4 được xây dựng.
Đây là một mô hình thưa với 125 tỷ tham số chính cộng với 51 tỷ tham số embedding N-gram, chỉ kích hoạt khoảng 6 tỷ tham số mỗi bước suy luận. Nó mang ngữ cảnh gốc 262.000 token mà thẻ cho biết có thể mở rộng tới 1 triệu, và Alibaba báo cáo rằng nó được huấn luyện với chi phí thấp hơn khoảng 90% so với Qwen3.7-Plus. Ba kỹ thuật được nêu trên thẻ:
• QSA, một lược đồ attention thưa dành riêng cho Qwen, chính là cơ chế đằng sau tuyên bố huấn luyện ngữ cảnh dài với chi phí thấp
• Kết nối phần dư có cổng, một biện pháp ổn định cho các mạng thưa sâu
• Embedding N-gram, một kho tham số riêng biệt gồm 51 tỷ tham số được tra cứu thay vì được tính toán dày đặc
Nếu các tầng của Qwen 4 kế thừa thiết kế đó, hệ quả thú vị sẽ mang tính kinh tế hơn là kiến trúc. Một dòng sản phẩm được thiết kế để đạt chất lượng cận biên giới với chi phí huấn luyện chỉ bằng khoảng một phần mười là một dòng sản phẩm có thể được định giá mạnh tay, và việc định giá mạnh tay từ Alibaba đã là động lực đáng tin cậy nhất trong kinh tế học mô hình trọng số mở suốt hai năm qua. Đó là một dự đoán, không phải sự thật, và nó nên được dán nhãn như vậy — nhưng đó chính là lý do để theo dõi lộ trình này thay vì bác bỏ nó.
Nên chạy gì trong lúc chờ
Không có gì trong thông báo Qwen 4 làm thay đổi những gì có sẵn trong tuần này, và câu trả lời trung thực cho bất kỳ ai đang xây dựng ngay hôm nay là thế hệ Qwen 3.8. Qwen3.8-Max đã được cung cấp rộng rãi kể từ ngày 3 tháng 8 năm 2026 với mức 2,00 USD cho mỗi triệu token đầu vào và 6,00 USD cho mỗi triệu token đầu ra, đồng nhất trên toàn bộ ngữ cảnh 1 triệu token mà không có phụ phí cho prompt dài, và trọng số của nó đã được công bố vào ngày 12 tháng 8 năm 2026 dưới dạng Qwen3.8-2.4T-A95B ở cả BF16 và FP8 theo giấy phép Qwen tùy chỉnh. Đây là mô hình mà các phiên bản Qwen 4 sẽ được lấy làm chuẩn để so sánh, và nó đang phục vụ lưu lượng production ngay hôm nay.
Nếu bạn muốn so sánh thế hệ Qwen đang được phát hành với phần còn lại của nhóm mô hình tiên tiến mà không phải quản lý tài khoản, khóa và hóa đơn riêng cho từng lab, OrcaRouter cung cấp dòng Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash và Qwen3.8-27B — cùng với Claude Opus 5, DeepSeek V4 Pro, Gemini 3.1 Pro Preview và GLM 5.3 trên một endpoint tương thích OpenAI. Đó là một API cho gần 200 mô hình với mức đánh dấu giá 0%, nghĩa là giá niêm yết của nhà cung cấp được giữ nguyên, nên đợt giảm giá của nhà cung cấp sẽ áp dụng cho khóa của bạn ngay trong cùng ngày thay vì vào chu kỳ thanh toán tiếp theo. Khi một hạng Qwen 4 thực sự được phát hành, cùng danh mục đó là nơi nó sẽ xuất hiện; hiện tại, không có cái nào như vậy.

Điểm mấu chốt
Qwen 4 Max là một thông báo có thật chứ không phải một sản phẩm có thật, và cả hai vế của câu đó đều quan trọng. Danh sách đã được xác nhận: bốn bậc, một kiến trúc thế hệ mới, định hướng agentic, và một bậc 27B trọng số mở sẽ có ý nghĩa với nhiều người hơn so với mẫu flagship. Mọi thứ mà một quyết định mua hàng cần — giá, ngữ cảnh, phương thức, trọng số, điểm số, một ngày cụ thể — đều đang thiếu.
Hãy coi đây là một tín hiệu lộ trình với dấu vết tài liệu tốt một cách bất thường, vì bản phát hành Qwen3.8-Flash-Next cho bạn bản xem trước kiến trúc miễn phí và Qwen3.8-Max cho bạn đường cơ sở đương nhiệm với trọng số đã công bố và mức giá đã công bố. Hãy theo dõi phân khúc 27B vì hệ sinh thái mà nó sẽ tạo ra và phân khúc Flash vì tính kinh tế thông lượng. Đừng công bố lại con số 5 đến 10 nghìn tỷ tham số như một dữ kiện về Qwen 4, và đừng lập kế hoạch di chuyển quanh một mô hình chưa có ngày phát hành — hãy lập kế hoạch quanh Qwen3.8-Max, và chuyển khi có một endpoint để chuyển đến.

So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
