Thẻ tiêu đề chính cho "Qwen 4 Max được công bố tại Apsara 2026" với phụ đề "Những gì Alibaba đã xác nhận, và những gì họ không", ba huy hiệu dạng viên thuốc ghi "4 phân hạng được xem trước", "0 thông số kỹ thuật được công bố" và "22 tháng 9, 2026", và logo OrcaRouter ở góc dưới cùng bên phải.
Guides & Insights

Qwen 4 Max được công bố tại Apsara 2026: những gì Alibaba đã xác nhận và những gì họ chưa xác nhận

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hội nghị Yunqi ở Hàng Châu — Hội nghị Apsara — đã được dùng vào ngày 22 tháng 9 năm 2026 để giới thiệu bốn mô hình chưa được phát hành. Trưởng bộ phận LLM của phòng thí nghiệm, Liu Da Yiheng, đã giới thiệu trước Qwen 4 Max, Qwen 4 Flash, Qwen 4 Plus và Qwen 4 27B trên sân khấu, mô tả dòng mô hình này là đang được huấn luyện trên một kiến trúc thế hệ mới, và chỉ nói rằng nó sẽ sớm ra mắt. Tính đến thời điểm viết bài này, không có model card cho bất kỳ mô hình nào trong bốn mô hình, không có trọng số mở, không có mã định danh API, không có cửa sổ ngữ cảnh, không có giá và không có điểm chuẩn đánh giá. Mô hình chủ lực mới nhất mà bạn thực sự có thể gọi hôm nay là Qwen3.8-Max, được cung cấp rộng rãi kể từ ngày 3 tháng 8 năm 2026, và khoảng cách đó giữa một thông báo trên sân khấu và một endpoint có thể gọi được chính là phần đáng đọc kỹ trong câu chuyện này.

Bốn cấp độ, và mỗi cấp độ được dự định để trở thành gì

Dòng Qwen của Alibaba đã được tổ chức thành các bậc năng lực kể từ thế hệ Qwen 3, và thông báo về Qwen 4 vẫn giữ nguyên cấu trúc đó thay vì thay thế nó. Những gì được trình bày trên sân khấu là một danh sách, chứ không phải một bảng thông số kỹ thuật:

• Qwen 4 Max — hạng chủ lực, và là mẫu mà Alibaba định vị để đối đầu với mô hình hàng đầu từ mọi phòng thí nghiệm tiên phong khác.

• Qwen 4 Flash — phân khúc thông lượng cao, được thiết kế cho các tác vụ nhạy cảm với độ trễ và khối lượng lớn thay vì khả năng suy luận đỉnh cao

• Qwen 4 Plus — phân khúc tầm trung cân bằng, xét về lịch sử là phiên bản có độ phủ hỗ trợ đa phương thức rộng nhất

• Qwen 4 27B — phân khúc cục bộ trọng số mở, bản được tải xuống, tinh chỉnh và lượng tử hóa bởi những người chưa từng đụng đến API được lưu trữ

• Kiến trúc — được mô tả là một thế hệ mới và được mô tả là đang được huấn luyện, điều này không đồng nghĩa với việc đã hoàn thiện

• Khối lượng công việc chính — các tác vụ mang tính agent và sử dụng công cụ, theo cách định hình của hội nghị, thay vì trò chuyện

• Tính khả dụng — không có. Không hạng nào có ngày phát hành, giá, cửa sổ ngữ cảnh, danh sách phương thức hay điểm số được công bố.

Phân khúc 27B là phân khúc đáng để theo dõi vì một lý do chẳng liên quan gì đến các bài benchmark. Đây là phân khúc duy nhất trong dòng sản phẩm từng được phát hành dưới dạng trọng số mở, và thế hệ Qwen 3.8 đã cho thấy điều đó mở ra bao nhiêu công việc độc lập: chỉ trong vài ngày sau khi trọng số 27B xuất hiện, cộng đồng đã tạo ra các bản chuyển đổi MLX, các bản lượng tử hóa NVFP4 và các bản tinh chỉnh không kiểm duyệt. Một mẫu 27B được công bố là lời hứa về cả một hệ sinh thái hạ nguồn, và đây là phần trong lộ trình này có tiến độ phát hành dễ dự đoán nhất.

Con số 5–10 nghìn tỷ tham số không thuộc về Qwen 4

Các bài đưa tin về hội nghị đã khá mơ hồ về một con số. Mục tiêu "5 đến 10 nghìn tỷ tham số" được lan truyền cùng với tin tức về Qwen 4 không phải là thông số kỹ thuật của Qwen 4 — đó là một tuyên bố hướng tới tương lai về các thế hệ sau nó, tức giai đoạn Qwen 4.5 và Qwen 5. Alibaba chưa gắn bất kỳ con số tham số nào cho Qwen 4 Max, và dựa trên bằng chứng hiện có, sẽ là sai lầm nếu đưa ra một con số như vậy.

Điều này quan trọng vì số lượng tham số là con số mà độc giả bám vào và là con số được lan truyền. Một tuyên bố 5T tham số gắn với một mô hình không có kiến trúc được công bố là không thể phản chứng theo cả hai hướng: không ai có thể xác nhận nó, và không ai có thể chỉnh sửa nó một khi nó đã được lặp lại. Nếu tuần này bạn thấy Qwen 4 Max được mô tả là một mô hình nhiều nghìn tỷ tham số, thì con số đó đã được mượn từ một slide khác.

Điều có thể nói một cách trung thực là mẫu flagship tiền nhiệm là một mixture-of-experts 2,4 nghìn tỷ tham số với 95 tỷ tham số hoạt động trên mỗi token, được xác nhận trên model card chính thức của Qwen3.8-Max và trên bản phát hành open-weight theo sau nó. Dù Qwen 4 Max rốt cuộc có là gì, đó là mức cơ sở mà nó phải vượt qua, và đó là một con số đã được công bố, có thể kiểm chứng chứ không phải là một khát vọng trên lộ trình.

A two-column scoreboard titled "Qwen 4 Max vs the model you can call today". Left column Qwen 4 Max: Release date not given, Input price not given, Output price not given, Context window not given, Open weights not given, Benchmarks not given. Right column Qwen3.8-Max: Release date August 3 2026, Input price $2.00 per 1M tokens, Output price $6.00 per 1M tokens, Context window 1M tokens, Open weights published August 12 2026, Benchmarks vendor and independent. Footer reads "Qwen 4 Max status per Alibaba's September 22 2026 conference; Qwen3.8-Max from its published model card.", with the OrcaRouter logo bottom-right.

Kiến trúc không phải là tin đồn: một bản xem trước của nó đã được phát hành.

Điều hữu ích nhất về thông báo Qwen 4 là một phần kiến trúc đã được phát hành dưới một tên khác. Qwen3.8-Flash-Next đã được mở mã nguồn vào cuối tháng 8 năm 2026, và thẻ mô hình của nó ghi rõ ràng rằng đây là bản xem trước của kiến trúc Qwen 4. Điều đó khiến nó trở thành bằng chứng cụ thể duy nhất mà bất kỳ ai bên ngoài Alibaba có về cách dòng Qwen 4 được xây dựng.

Đây là một mô hình thưa với 125 tỷ tham số chính cộng với 51 tỷ tham số embedding N-gram, chỉ kích hoạt khoảng 6 tỷ tham số mỗi bước suy luận. Nó mang ngữ cảnh gốc 262.000 token mà thẻ cho biết có thể mở rộng tới 1 triệu, và Alibaba báo cáo rằng nó được huấn luyện với chi phí thấp hơn khoảng 90% so với Qwen3.7-Plus. Ba kỹ thuật được nêu trên thẻ:

• QSA, một lược đồ attention thưa dành riêng cho Qwen, chính là cơ chế đằng sau tuyên bố huấn luyện ngữ cảnh dài với chi phí thấp

• Kết nối phần dư có cổng, một biện pháp ổn định cho các mạng thưa sâu

• Embedding N-gram, một kho tham số riêng biệt gồm 51 tỷ tham số được tra cứu thay vì được tính toán dày đặc

Nếu các tầng của Qwen 4 kế thừa thiết kế đó, hệ quả thú vị sẽ mang tính kinh tế hơn là kiến trúc. Một dòng sản phẩm được thiết kế để đạt chất lượng cận biên giới với chi phí huấn luyện chỉ bằng khoảng một phần mười là một dòng sản phẩm có thể được định giá mạnh tay, và việc định giá mạnh tay từ Alibaba đã là động lực đáng tin cậy nhất trong kinh tế học mô hình trọng số mở suốt hai năm qua. Đó là một dự đoán, không phải sự thật, và nó nên được dán nhãn như vậy — nhưng đó chính là lý do để theo dõi lộ trình này thay vì bác bỏ nó.

Nên chạy gì trong lúc chờ

Không có gì trong thông báo Qwen 4 làm thay đổi những gì có sẵn trong tuần này, và câu trả lời trung thực cho bất kỳ ai đang xây dựng ngay hôm nay là thế hệ Qwen 3.8. Qwen3.8-Max đã được cung cấp rộng rãi kể từ ngày 3 tháng 8 năm 2026 với mức 2,00 USD cho mỗi triệu token đầu vào và 6,00 USD cho mỗi triệu token đầu ra, đồng nhất trên toàn bộ ngữ cảnh 1 triệu token mà không có phụ phí cho prompt dài, và trọng số của nó đã được công bố vào ngày 12 tháng 8 năm 2026 dưới dạng Qwen3.8-2.4T-A95B ở cả BF16 và FP8 theo giấy phép Qwen tùy chỉnh. Đây là mô hình mà các phiên bản Qwen 4 sẽ được lấy làm chuẩn để so sánh, và nó đang phục vụ lưu lượng production ngay hôm nay.

Nếu bạn muốn so sánh thế hệ Qwen đang được phát hành với phần còn lại của nhóm mô hình tiên tiến mà không phải quản lý tài khoản, khóa và hóa đơn riêng cho từng lab, OrcaRouter cung cấp dòng Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash và Qwen3.8-27B — cùng với Claude Opus 5, DeepSeek V4 Pro, Gemini 3.1 Pro Preview và GLM 5.3 trên một endpoint tương thích OpenAI. Đó là một API cho gần 200 mô hình với mức đánh dấu giá 0%, nghĩa là giá niêm yết của nhà cung cấp được giữ nguyên, nên đợt giảm giá của nhà cung cấp sẽ áp dụng cho khóa của bạn ngay trong cùng ngày thay vì vào chu kỳ thanh toán tiếp theo. Khi một hạng Qwen 4 thực sự được phát hành, cùng danh mục đó là nơi nó sẽ xuất hiện; hiện tại, không có cái nào như vậy.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the on-page nav, the 1M token context badge, the model ID qwen/qwen3.8-max, multi-modality shown as text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, the code-samples panel with the OpenAI-compatible Python import, the Public benchmarks and Community buzz blocks, and the opening line of the model description calling Qwen3.8-Max Alibaba's newest flagship and highest-capability tier to date.

Điểm mấu chốt

Qwen 4 Max là một thông báo có thật chứ không phải một sản phẩm có thật, và cả hai vế của câu đó đều quan trọng. Danh sách đã được xác nhận: bốn bậc, một kiến trúc thế hệ mới, định hướng agentic, và một bậc 27B trọng số mở sẽ có ý nghĩa với nhiều người hơn so với mẫu flagship. Mọi thứ mà một quyết định mua hàng cần — giá, ngữ cảnh, phương thức, trọng số, điểm số, một ngày cụ thể — đều đang thiếu.

Hãy coi đây là một tín hiệu lộ trình với dấu vết tài liệu tốt một cách bất thường, vì bản phát hành Qwen3.8-Flash-Next cho bạn bản xem trước kiến trúc miễn phí và Qwen3.8-Max cho bạn đường cơ sở đương nhiệm với trọng số đã công bố và mức giá đã công bố. Hãy theo dõi phân khúc 27B vì hệ sinh thái mà nó sẽ tạo ra và phân khúc Flash vì tính kinh tế thông lượng. Đừng công bố lại con số 5 đến 10 nghìn tỷ tham số như một dữ kiện về Qwen 4, và đừng lập kế hoạch di chuyển quanh một mô hình chưa có ngày phát hành — hãy lập kế hoạch quanh Qwen3.8-Max, và chuyển khi có một endpoint để chuyển đến.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (English UI), showing the header reading "199 models, 15 providers, one API key, one bill", the sort and filter rail with Newest selected alongside controls for input modalities and context length, the "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions with a model and messages JSON body, and the first catalogue cards including openai/gpt-5-mini with a 200 Status badge.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày