Gặp gỡ Qwen3.8-Flash — một MoE đa phương thức trọng số mở, giới thiệu trước kiến trúc Qwen4. Hình minh họa được tái tạo.
Guides & Insights

Gặp gỡ Qwen3.8-Flash: MoE đa phương thức với trọng số mở, bản xem trước kiến trúc Qwen4 — $0,15/$0,47 mỗi 1M token trên QwenCloud

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào ngày 26 tháng 8 năm 2026, nhóm Qw​en đã mở mã nguồn các trọng số đằng sau Qwen3.8-Flash — được phát hành trên Hugging Face và ModelScope dưới tên Qwen3.8-Flash-Next — và ra mắt mô hình sản xuất mang tên Qwen3.8-Flash trên API QwenCloud, xác nhận giá chính thức của nó vào ngày hôm sau. Con số đáng chú ý — được Alibaba chính thức xác nhận trong thông báo của chính họ vào ngày 28 tháng 8 — là một mô hình hỗn hợp chuyên gia (mixture-of-experts) đa phương thức với 125 tỷ tham số, chỉ kích hoạt khoảng 6 tỷ tham số trên mỗi token, độ thưa khoảng 95%, được xây dựng trên kiến trúc mà Alibaba mô tả rõ ràng là bản xem trước ban đầu của thế hệ Qwen4. API sản xuất đang hoạt động trên QwenCloud với giá 0,15 đô la cho mỗi triệu token đầu vào, 0,47 đô la cho mỗi triệu token đầu ra và 0,016 đô la cho mỗi triệu token khi trúng bộ nhớ đệm (cache hits) — cách rẻ nhất để chạy thứ gì đó có cấu trúc hậu duệ từ mẫu flagship tiếp theo của Alibaba, và cũng là lần đầu tiên phòng thí nghiệm phát hành bản xem trước kiến trúc dưới dạng trọng số mở công khai trước khi toàn bộ dòng mô hình tồn tại.

{{1}}Một con số có sức nặng hơn toàn bộ bảng thông số kỹ thuật: 6B.{{/1}} {{2}}Qwen3.8-Flash không đạt được năng lực nhờ kích thước đồ sộ — mà nhờ vào nơi nó đặt sức mạnh tính toán.{{/2}} {{3}}Phần thân MoE 125B, bảng nhúng N-gram 51B và một mô-đun dự đoán đa token nhỏ lưu trữ gần 180B tham số trên đĩa, thế mà mỗi token chỉ đi qua 6B trong số đó.{{/3}} {{4}}Đó chính là canh bạc mà toàn bộ bản phát hành này dựa vào, và cũng là lý do khiến chi phí huấn luyện giảm sâu đến vậy.{{/4}}

Những gì thực sự đã được phát hành

Qwen3.8-Flash, không kèm hậu tố, là phiên bản mô hình production hiện đang hoạt động trên API QwenCloud và trong sản phẩm Qwen Office của Alibaba; nó có ngữ cảnh mặc định 1M token và các công cụ tích hợp sẵn, với giá $0.15/$0.47 mỗi triệu token, và $0.016 khi trúng cache. Vào ngày 28 tháng 8, phạm vi khả dụng đã được mở rộng: theo thông báo của Alibaba, Qwen3.8-Flash hiện cũng có thể truy cập qua OpenCode Go, gói đăng ký giá cố định của tác nhân lập trình terminal mã nguồn mở — danh sách mô hình của OpenCode ghi nhận nó là qwen3.8-flash với cùng mức giá $0.15/$0.47 mỗi triệu token.

A screenshot of the official Qwen Studio blog post 'Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency' (captured August 27, 2026), showing the Qwen Studio navigation bar, the article headline, and the 'Now Open Weights' announcement banner.

Thông báo chính thức từ Qwen Studio mô tả việc phát hành trọng số mở như một lời mời gọi đến hệ sinh thái: gửi sớm những thay đổi về cấu trúc để cộng đồng và các bộ công cụ suy luận có thể thích nghi trước khi dòng sản phẩm Qwen4 đầy đủ được xây dựng. Dấu hiệu đầu tiên cho thấy điều này thành công là SGLang — công cụ suy luận của LMSYS — công bố hỗ trợ ngay ngày đầu cho Qwen3.8-Flash-Next cùng ngày, với mô hình cũng đã được cấu hình cho Transformers, vLLM và TokenSpeed.

Kiến trúc là câu chuyện.

Đây không phải là mô hình thế hệ Qwen 3.8 được thu nhỏ. Qwen3.8-Flash giới thiệu bốn thay đổi mà nhóm nghiên cứu cho biết dòng Qwen4 sẽ kế thừa, và mỗi thay đổi đều nhắm vào một nút thắt cổ chai khác nhau.

• Attention — Gated DeltaNet cộng với Qw​en Sparse Attention. Gated DeltaNet (GDN) nén lịch sử thành các trạng thái có kích thước cố định tại ba trong bốn lớp, nhờ đó mô hình không phải đọc lại toàn bộ ở mỗi bước; QSA xử lý ngữ cảnh dài như một bài toán tìm kiếm — một bộ lập chỉ mục nhẹ gom chuỗi thành các vi khối, chấm điểm mức độ quan trọng của từng khối và định tuyến sự chú ý đến các vùng liên quan nhất. Theo đo lường của Alibaba, kernel chú ý QSA đạt tốc độ prefill nhanh hơn tới 7.6× và decode nhanh hơn 4.9× ở ngữ cảnh 1M token (do nhà cung cấp báo cáo).

• Residual — Residual có cổng. Luồng residual duy nhất được tách thành bốn nhánh song song với cơ chế gating theo từng phần tử, cho phép mạng tự quyết định với mỗi token mức độ đọc và ghi trên từng nhánh; một nhánh trở thành kênh truyền tầm xa kết nối các lớp attention ban đầu với các lớp sâu. Trạng thái residual được lưu dưới dạng FP8 để giảm băng thông bộ nhớ.

• Nhúng {{1}}— nhúng N-gram{{/1}}. Một bảng tra cứu 51B tham số được khóa theo token hiện tại cùng với một số token đứng trước. Nó bổ sung dung lượng mà không làm tăng chi phí tính toán cho từng token, và vì bảng có thể nằm trong bộ nhớ host và được nạp trước không đồng bộ, nó không chiếm bộ nhớ GPU một cách vĩnh viễn.

• Bộ tối ưu — Muon. Các tham số tuyến tính 2D lớn (attention, GDN, các chuyên gia MoE) được huấn luyện với Muon, trong khi embeddings, router và các phần hạng thấp Gated Residual giữ nguyên AdamW; nhóm nghiên cứu đã tái khớp scaling law cho kiến trúc mới dựa trên sự pha trộn này.

A single-column spec-sheet scoreboard titled 'Qwen3.8-Flash — the scoreboard' with the subtitle 'The 6B-active MoE that previews Qwen4', six rows reading 'Params: 125B MoE + 51B N-gram (~180B stored)', 'Active per token: ~6B (<5% activation)', 'Architecture: Qwen4 preview (QSA + GDN, gated residual, Muon)', 'Context: 262K native / 1M via YaRN', 'Price: $0.16 / $0.47 per 1M tokens', 'Open weights: Qwen3.8-Flash-Next (FP8 build available)', and a footer 'Benchmark figures vendor-reported; pricing as announced by Alibaba'; the OrcaRouter logo is composited in the bottom-right corner.

Đối với nhà phát triển, hai điều trong số này quan trọng ngay lập tức: ngăn xếp attention là lý do khiến ngữ cảnh 1M token có thể trở thành mặc định thay vì mục tiêu tham vọng, và bảng N-gram là lý do khiến mô hình 125B vẫn có thể được phục vụ tinh gọn. Phần còn lại là tài liệu xem trước cho Qwen4 — và đó chính xác là cách Alibaba đang định vị nó.

Bảng đánh giá chuẩn, được ghi nhãn trung thực

Mọi con số trong phần này đều là đánh giá của chính Alibaba, mới chỉ một ngày tuổi và chưa được bất kỳ phòng thí nghiệm độc lập nào tái lập tại thời điểm viết bài. Hãy coi chúng là những tuyên bố mang tính định hướng, không phải kết quả cuối cùng. Trên bộ đánh giá của Alibaba, Qwen3.8-Flash-Next (6B active) ghi nhận SWE-bench Pro 62.5, DeepSWE 1.1 58.7, CoWorkBench 73.9, AndroidWorld 84.5 và MathVision 95.7, cùng điểm JobBench 55.7 — và biến thể cơ sở, Qwen3.8-Flash-Next-Base, được báo cáo là mô hình mở tốt nhất trên 8/14 benchmark trong một vòng so sánh trực tiếp, bao gồm MMLU-Pro, SuperGPQA, BBH và MMMU.

Các tuyên bố của Alibaba về vị trí của mẫu mới trong dòng sản phẩm nên được gọi đúng bản chất — đó chỉ là tuyên bố. Công ty cho biết Qwen3.8-Flash đánh bại Claude Opus 4.6 với 9,1 điểm trên SWE-bench Pro và khoảng 20 điểm trên JobBench, đồng thời tiến đến gần tầm với của Claude Opus 4.8. Tất cả đều do nhà cung cấp công bố, tất cả đều chưa được tái lập. Những gì có thể kiểm chứng độc lập ngay hôm nay hẹp hơn nhiều: các trọng số mô hình đã được phát hành, ngăn xếp suy luận đã chạy được chúng, và SGLang đã ra mắt hỗ trợ ngay trong cùng ngày. Việc tái lập độc lập bảng điểm chuẩn sẽ sớm hoàn tất trong vài ngày, không phải vài tuần.

Chi phí là bao nhiêu

Giá cả là phần dễ xác minh nhất vì đây là mức giá được công bố chứ không phải điểm chuẩn — và vào ngày 27 tháng 8, Alibaba đã chính thức xác nhận mức giá production của QwenCloud: 0,15 USD mỗi triệu token đầu vào, 0,47 USD mỗi triệu token đầu ra và 0,016 USD mỗi triệu token cho cache hit, với mức giá nội địa Trung Quốc là 0,8/2,7/0,1 NDT. Con số cache hit mới là con số đáng quan tâm đối với các tác vụ tác tử (agentic workloads): một tác tử ngữ cảnh dài đọc lại một lịch sử lớn trong mỗi lượt chỉ phải trả vài xu cho các lần đọc lặp lại — đây chính xác là loại tác vụ mà ngăn xếp attention của Qwen4-preview nhắm tới. Báo chí Trung Quốc ngay lập tức so sánh mức giá gây chú ý này với các đối thủ — khoảng một phần ba mức phí DeepSeek-V4-Flash đưa ra, và chỉ là một sai số làm tròn bên cạnh các mô hình đóng tiên phong. Theo hạch toán của Alibaba, đợt huấn luyện này chỉ tốn khoảng một phần chín chi phí của Qwen3.7-Plus, và chính đòn bẩy cấu trúc đó là thứ giúp giá API duy trì ở mức như hiện tại.

Bên cạnh phần còn lại của gia đình Qw​en 3.8, sự chênh lệch rất rõ rệt: mẫu flagship Qwen3.8-Max có giá $2.00 và $6.00 cho mỗi triệu token, và hiện đã hoạt động trên OrcaRouter với đúng giá niêm yết của nhà cung cấp, không phụ phí. Giờ đây khi API Qwen3.8-Flash bản production đã mở, cơ chế chuyển thẳng giá tương tự cũng áp dụng cho mức giá chính thức $0.15/$0.47 và mức $0.016 cho cache-hit — lớp định tuyến tạo nên sự khác biệt giữa việc đọc về một đợt giảm giá và việc có nó ngay trong cấu hình. Cả hai mô hình dùng chung một khóa, failover giữa chúng, không cần hợp đồng thứ hai.

'Bản xem trước của Qwen4' nghĩa là gì

Đọc thông báo theo đúng nghĩa đen thì rủi ro đã rõ: đây không phải là một phiên bản mới của Qwen 3.8 — mà là kiến trúc Qwen4 được phát hành sớm, dưới thương hiệu bảo hộ của một mô hình nhỏ hơn, rẻ hơn. Lý do để làm vậy rất hợp lý: các framework, kỹ thuật lượng tử hóa (quantization) và các mô hình triển khai cần thời gian để hoàn thiện, và một mô hình 6B-active là cách rẻ để cộng đồng kiểm tra sức chịu tải (stress-test) GDN + QSA ở quy mô lớn trước khi Alibaba xây dựng thứ đắt tiền hơn dựa trên nó. Mặt trái là Qwen3.8-Flash production là một API được xây dựng trên kiến trúc mà hệ sinh thái rộng lớn hơn vẫn đang kiểm định. Những người áp dụng sớm, về bản chất, chính là tập kiểm thử.

Cách nhanh chóng để dùng thử

Hôm nay bạn có {{1}}bốn lựa chọn thực tế{{/1}}. {{2}}Tự lưu trữ các trọng số mở qua vLLM, SGLang, Transformers hoặc TokenSpeed{{/2}} — bản build FP8 là lựa chọn đầu tiên hợp lý cho mọi hệ thống chưa đủ quy mô một node hoàn chỉnh. {{3}}Gọi API QwenCloud{{/3}}, hiện đang hoạt động với mức giá chính thức $0.15/$0.47 và cache hit ở mức $0.016. {{4}}Sử dụng nó trong OpenCode Go, gói đăng ký giá cố định của tác nhân mã nguồn mở lập trình trên terminal{{/4}}, gói này vừa bổ sung Qwen3.8-Flash trong tuần này (được Alibaba công bố vào ngày 28 tháng 8, được xác nhận trên danh sách mô hình của chính OpenCode). Hoặc {{5}}gọi bản production của Flash qua một router giống như cách bạn vẫn gọi Qwen3.8-Max{{/5}}, với mức giá chính thức được truyền thẳng, không tính thêm phụ phí — không cần tích hợp tùy chỉnh nào để bảo trì.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the model description stating the artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default and built-in tools, plus License 'qwen-community-1.0', Model size 180B params, Tensor type BF16, and 2,551 downloads last month.

Câu hỏi mở là câu hỏi trung thực: {{1}}liệu một mô hình kích hoạt 6 tỷ tham số của nó có thể trụ vững trong môi trường production trên nhiều loại workload hay không, hay bảng benchmark hôm nay trông như mới một ngày tuổi sẽ vẫn như vậy sau một tháng?{{/1}} {{2}}Đó không phải là lý do để chờ đợi{{/2}} — {{3}}mà là lý do để đặt nó đằng sau failover thay vì trước toàn bộ hệ thống của bạn.{{/3}} {{4}}Trọng số đã được công bố, giá đã được định, và kiến trúc là hướng đi chính thức của Alibaba.{{/4}} {{5}}Vài tuần tới sẽ quyết định liệu 6B có đủ hay không.{{/5}}

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube