Thẻ tiêu đề chính cho bài viết 'Qwen3.8-Flash-Next — BÁO CÁO RÒ RỈ' với huy hiệu 'CHƯA XÁC MINH — XEM TRƯỚC KIẾN TRÚC QWEN4', phụ đề 'Alibaba phát hành kiến trúc Qwen4 trước khi ra mắt mô hình', ba chip với nội dung 'Nguồn: @kimmonismus', '25 thg 8, 2026' và 'Phát hành: 26 thg 8, 23:00 UTC+08', thẻ bên trái ghi 'Tuyên bố: MoE đa phương thức trọng số mở xem trước kiến trúc Qwen4' và thẻ bên phải ghi 'Trạng thái: trọng số chưa phát hành, ~24h nữa ra mắt'. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Qwen3.8-Flash-Next: Alibaba hé lộ kiến trúc Qwen4 trước khi Qwen4 chính thức ra mắt

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Alibaba sắp công bố kiến trúc Qwen4 trước khi phát hành mô hình Qwen4. Qwen3.8-Flash-Next — một mô hình hỗn hợp chuyên gia (mixture-of-experts) đa phương thức, trọng số mở, được xây dựng trên kiến trúc thế hệ tiếp theo sẽ hỗ trợ dòng Qwen4 — dự kiến ra mắt công khai trên ModelScope lúc 23:00 giờ Bắc Kinh ngày 26 tháng 8 năm 2026. Alibaba định vị đợt phát hành này như một bản xem trước công nghệ: các nhà phát triển được tiếp cận kiến trúc sớm, còn dòng Qwen4 đầy đủ sẽ ra sau. Tại thời điểm viết bài này, số tham số, giấy phép và giá vẫn chưa được xác nhận, vì vậy đây là bài viết thuộc dạng "những gì chúng ta biết cho đến nay" — mỗi chi tiết cụ thể bên dưới đều được gắn nhãn về mức độ chắc chắn.

Nếu bạn chưa theo kịp nhịp ra mắt sản phẩm của Alibaba trong tháng này, điểm mốc chính là Qwen3.8-Max — mô hình chủ lực 2,4 nghìn tỷ tham số được phát hành vào ngày 3 tháng 8 và được mở mã nguồn dưới tên Qwen3.8-2.4T-A95B chưa đầy hai tuần sau đó. Qwen3.8-Flash-Next ra mắt chưa đầy một tháng sau đó. Cũng chính phòng thí nghiệm đã cho ra mắt mô hình trọng số mở 2,4 nghìn tỷ tham số này giờ đang công bố kiến trúc cho thế hệ kế tiếp, trước cả khi mô hình chủ lực của thế hệ đó được đặt tên.

Điều gì đã được công bố

Tín hiệu đến đấu trường qua các kênh thông thường. Một trang teaser ModelScope cho Qwen3.8-Flash-Next đã hoạt động từ ngày 25 tháng 8 với huy hiệu "Upcoming Open-Release", dòng giới thiệu "Onward to the Next-Gen — Lightning-Fast," và bộ đếm thời gian phát hành chỉ về 2026-08-26 23:00 (UTC+08:00). Đội ngũ Qw​en của Alibaba đã đăng trên X cùng ngày — "The next Qw​en wave is coming." Bài đăng chuyển bài này cho chúng tôi, từ @kimmonismus trên X, mô tả cùng điều đó bằng những từ hơi khác: một mô hình MoE đa phương thức trọng số mở trên kiến trúc thế hệ tiếp theo, truy cập sớm để cộng đồng chuẩn bị cho gia đình Qwen4.

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

Phần đáng đọc lại là {{1}}cách đặt vấn đề của chính Alibaba{{/1}}. Mô hình được mô tả là được xây dựng trên kiến trúc thế hệ mới {{2}}"sẽ làm nền tảng cho dòng Qwen4 sắp tới"{{/2}} — chứ không phải là bản thân Qwen4. Lý do Alibaba nêu ra là {{4}}các thay đổi về kiến trúc nên nằm trong tay cộng đồng trước khi dòng Qwen4 ra mắt{{/4}}, để các runtime, các bản lượng tử hóa và các ứng dụng sẵn sàng khi sản phẩm thực sự phát hành. Đó là một lập trường tiếp thị, nhưng cũng là một cam kết kỹ thuật: {{5}}giới thiệu trước phần khó, rồi đưa cộng đồng đi cùng.{{/5}}

Điều gì đã được xác nhận hôm nay, và điều gì chưa:

Đã xác nhận, theo teaser và tuyên bố của Qwen: Qwen3.8-Flash-Next có trọng số mở, đa phương thức và là mô hình MoE trên kiến trúc Qwen4.

Đã xác nhận, theo tuyên bố của Qw​en: nó giới thiệu hai thay đổi kiến trúc chính — kiến trúc lai GDN và Qw​en Sparse Attention (QSA).

• Đã xác nhận, theo teaser: thời gian phát hành là 2026-08-26 23:00 (UTC+08:00), trên ModelScope.

• Chưa được xác nhận: tổng số tham số hoặc tham số hoạt động, điều khoản cấp phép, độ dài ngữ cảnh, tính khả dụng hoặc giá API, và mọi điểm số chuẩn. Chưa có đánh giá độc lập nào vì trọng số chưa được công bố.

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

Tôi không có thông tin cụ thể về kiến trúc "Qwen4" vì đây có thể là mô hình chưa được công bố hoặc nằm ngoài phạm vi kiến thức của tôi. Nếu bạn muốn tìm hiểu về kiến trúc của các mô hình Qwen đã phát hành, tôi khuyên bạn nên tham khảo tài liệu chính thức từ nhóm Qwen hoặc các bài viết kỹ thuật đã được xác minh.

Hai cơ chế dẫn dắt câu chuyện này. Cơ chế đầu tiên, GDN — Gated Delta Network — là lớp attention tuyến tính của Alibaba. Trong khi transformer chuẩn duy trì một bộ đệm key-value tăng dần theo độ dài chuỗi, lớp GDN duy trì một trạng thái hồi quy kích thước cố định và cập nhật nó bằng quy tắc gating được học; dòng dõi của kiến trúc này chạy qua DeltaNet và Mamba-2. Lợi ích đạt được chính là thứ đã âm thầm tiếp sức cho dòng Qw​en kể từ Qwen3-Next: ngữ cảnh dài vẫn giữ chi phí thấp vì trạng thái không phình ra, trong khi một thiểu số lớp full-attention vẫn nằm trong sự kết hợp để phụ trách phần truy xuất chính xác mà attention tuyến tính làm kém. Ở thế hệ hiện tại, sự kết hợp đó chạy với tỷ lệ khoảng ba lớp GDN cho mỗi lớp full-attention — phân tích cộng đồng về checkpoint Qwen3.8-2.4T-A95B đếm được 69 lớp GDN so với 23 lớp attention. Qwen3.8-Flash-Next được mô tả là “kiến trúc lai GDN” trên đúng dòng dõi đó.

Thứ hai, QSA — Qw​en Sparse Attention — là thứ thực sự mới, và hiện chưa có mô tả kỹ thuật công khai nào về nó: chỉ có cái tên, cùng việc nó được xem là một trong hai thay đổi chủ đạo của bản xem trước. Chính sự thiếu vắng chi tiết ấy cũng là một phần của quy luật chung. Bản xem trước của Qwen3-Next cuối năm 2025 đã giới thiệu Gated DeltaNet cũng với sự khan hiếm tài liệu tương tự, và kiến trúc chỉ được đặc tả đầy đủ khi dòng Qw​en3.5 áp dụng nó. Đối với người đọc, điều rút ra thực dụng ở cả hai lần đều giống nhau: kiến trúc, đóng vai trò chim hoàng yến, xuất hiện trước; còn tài liệu và các mô hình sản xuất thì xuất hiện sau.

Kịch bản đã từng thành công một lần

Alibaba đã từng chạy chính kịch bản này, và nó đã hiệu quả. Vào cuối năm 2025, Qwen3-Next đã hé lộ Gated DeltaNet cùng một kiến trúc lai giữa attention tuyến tính và attention đầy đủ. Khi dòng Qw​en3.5 ra mắt, nó đã áp dụng bản thiết kế đó ở quy mô lớn — và kiến trúc lai này đã được duy trì qua thế hệ Qw​en3.8 kể từ đó, bao gồm cả mẫu chủ lực 2.4T. Lý do tiền lệ này quan trọng ở đây là thời điểm mà nó ngụ ý. Toàn bộ gia đình Qwen4 nên được mong đợi xuất hiện sau bản xem trước này, không phải ở bên trong nó; nếu khoảng cách của Qwen3-Next là một chỉ dẫn, thì khoảng cách giữa "đây là kiến trúc" và "đây là gia đình sản phẩm" được đo bằng tháng. Không có gì trong teaser xác nhận điều đó — đó là một suy luận từ một khuôn mẫu mà Alibaba đã thực hiện hai lần.

Những gì chúng ta vẫn chưa biết

Những điều chưa biết chính là điểm mấu chốt của một bản xem trước, và chúng là có thật:

• Tham số. Teaser không tiết lộ gì. Suy đoán của cộng đồng trên X và Reddit — không có sự hậu thuẫn chính thức — chỉ ra một cấu hình khoảng 125B tổng / 6B hoạt động, cùng với bảng tra cứu embedding n-gram lớn. Hãy coi đó là tin đồn.

• Hạng "Flash". Trong thế hệ Qw​en3.5, Qwen3.5-Flash chỉ dùng trên đám mây là một biến thể nâng cấp của mô hình trọng số mở Qwen3.5-35B-A3B. Vẫn chưa rõ liệu Qwen3.8-Flash-Next có phải là phiên bản trọng số mở tương ứng của một mô hình Qw​en3.8 có quy mô tương tự hay không; thay vào đó, nó có thể là mô hình thuộc lớp 125B-A6B. Cả hai cách hiểu đều chỉ là phỏng đoán.

• Giấy phép. Các bản phát hành Qw​en gần đây của Alibaba trải dài từ Apache-2.0 (Qw​en3.8-27B) đến giấy phép Qwen3.8-Max có giới hạn doanh thu. Việc Flash-Next thuộc loại giấy phép nào sẽ quyết định liệu nó có thể được sử dụng cho mục đích thương mại hay không, và trong phạm vi nào.

• Điểm chuẩn. Tuyên bố của Qwen nhấn mạnh lập trình tác nhân, các tác vụ dài hạn và trí tuệ đa phương thức, nhưng không có con số cụ thể và chưa có đánh giá độc lập nào cho đến khi các trọng số được công bố.

Một gia đình làm việc theo chu kỳ hai tuần

Nhịp ra mắt xung quanh tự nó đã là một câu chuyện. Qwen3.8-Max, mô hình chủ lực với 2,4 nghìn tỷ tham số, phát hành ngày 3 tháng 8; Qwen3.8-2.4T-A95B với trọng số mở tiếp nối vào ngày 12–13 tháng 8; Qw​en3.8-27B miễn phí theo Apache-2.0 ra mắt vài ngày sau đó; và giờ, trước khi tháng này khép lại, kiến trúc thế hệ tiếp theo đang được hé lộ. Hiện không phòng lab nào khác đang phát hành theo nhịp này. Với người đọc chọn mô hình, hệ quả thực tế là "Qw​en tốt nhất" là một mục tiêu di động — và khoảng cách giữa các thế hệ đang đến nhanh hơn tốc độ thích nghi thường thấy của hệ sinh thái xung quanh. Đầu tư vào một quyết định thay vì một mô hình ngày càng là lựa chọn hợp lý.

Một lập trình viên nên làm gì bây giờ?

{{1}}Hãy lập kế hoạch cho kiến trúc, không chỉ riêng mô hình.{{/1}} Qwen3.8-Flash-Next sẽ là {{2}}một bản xem trước chưa được kiểm chứng ngay từ ngày đầu ra mắt{{/2}}: {{3}}không có điểm chuẩn độc lập{{/3}}, {{4}}hệ sinh thái runtime vẫn đang bắt kịp{{/4}}, và {{5}}chỉ có những tuyên bố từ nhà cung cấp về các thế mạnh tác nhân và tầm nhìn dài hạn — những yếu tố quan trọng với các khối lượng công việc sẽ sử dụng nó{{/5}}. {{6}}Cách an toàn để đánh giá nó không phải là tích hợp nó vào đường dẫn sản xuất{{/6}} — {{7}}mà là định tuyến một bản sao rủi ro thấp của một khối lượng công việc đến nó{{/7}}, {{8}}so sánh đầu ra với mô hình hiện tại{{/8}}, và {{9}}để cơ chế chuyển đổi dự phòng tự động hấp thụ những thời điểm nhà cung cấp phục vụ một mô hình open-weight hoàn toàn mới hoạt động không ổn định{{/9}}. {{10}}Trên OrcaRouter, đó chính là cùng một endpoint và cùng một key mà bạn đã sử dụng{{/10}}: {{11}}Qwen3.8-Flash-Next và mô hình hiện tại của bạn nằm sau một API duy nhất{{/11}}, và {{12}}DSL định tuyến có thể chạy A/B giữa bản xem trước và mô hình hiện tại với cùng một prompt trước khi bất cứ điều gì được chốt{{/12}}.

Giá cả, khi có, cũng nên được hiểu theo cùng một cách. Alibaba chưa công bố giá API cho Flash-Next, và các bộ trọng số chưa phát hành không thể định tuyến ở bất cứ đâu. Khi một nhà cung cấp công bố nó, OrcaRouter chuyển thẳng giá niêm yết của nhà cung cấp với biên độ tăng giá 0% — vì vậy dù con số cuối cùng của Alibaba là gì, nó vẫn hiển thị không thay đổi ngay trong cùng ngày. Mốc tham chiếu gần nhất bạn thực sự có thể sử dụng hôm nay là Qwen3.8-Max (qwen/qwen3.8-max), sản phẩm chủ lực mà kiến trúc này cuối cùng sẽ nằm bên dưới: cửa sổ ngữ cảnh 1.000.000 token với giá $2,00 mỗi triệu token đầu vào và $6,00 mỗi triệu token đầu ra, được chuyển qua với giá niêm yết. Hãy giữ con số đó trong đầu khi giá của Flash-Next giảm; đó là chi phí mà thế hệ tiếp theo phải vượt qua.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

Xem gì khi ra mắt

Bốn điều quan trọng ngay khi bộ đếm thời gian phát hành hết giờ:

• Số lượng tham số và bậc tham số hoạt động — liệu đây có phải là mô hình lớp 125B-A6B mà các tin đồn mô tả hay là một phiên bản nhỏ hơn.

• Giấy phép — cởi mở như Qwen3.8-27B, hoặc hạn chế như giấy phép Max.

• Liệu các đánh giá độc lập đầu tiên có tái hiện được các tuyên bố về mã hóa tác nhân (agentic coding) và tầm nhìn dài hạn của nhà cung cấp hay không — những con số đáng tin cậy, chứ không phải lời tiếp thị.

Alibaba chờ bao lâu trước khi toàn bộ gia đình Qwen4 ra mắt sau bản xem trước?

Không điều nào trong số đó có thể biết được từ đây. Điều có thể biết hôm nay là hình dạng của quyết định mà Alibaba đã đưa ra: họ đang đặt cược rằng thế hệ kiến trúc tiếp theo đáng để trao đi trước cả sản phẩm chủ lực. Cược đó chính là câu chuyện — và các trọng số sẽ được công bố vào ngày mai.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube