
Gặp gỡ Qwen3.8-Flash: MoE đa phương thức với trọng số mở, bản xem trước kiến trúc Qwen4 — $0,15/$0,47 mỗi 1M token trên QwenCloud
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianMỚIQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
Vào ngày 26 tháng 8 năm 2026, nhóm Qwen đã mở mã nguồn các trọng số đằng sau Qwen3.8-Flash — được phát hành trên Hugging Face và ModelScope dưới tên Qwen3.8-Flash-Next — và ra mắt mô hình sản xuất mang tên Qwen3.8-Flash trên API QwenCloud, xác nhận giá chính thức của nó vào ngày hôm sau. Con số đáng chú ý — được Alibaba chính thức xác nhận trong thông báo của chính họ vào ngày 28 tháng 8 — là một mô hình hỗn hợp chuyên gia (mixture-of-experts) đa phương thức với 125 tỷ tham số, chỉ kích hoạt khoảng 6 tỷ tham số trên mỗi token, độ thưa khoảng 95%, được xây dựng trên kiến trúc mà Alibaba mô tả rõ ràng là bản xem trước ban đầu của thế hệ Qwen4. API sản xuất đang hoạt động trên QwenCloud với giá 0,15 đô la cho mỗi triệu token đầu vào, 0,47 đô la cho mỗi triệu token đầu ra và 0,016 đô la cho mỗi triệu token khi trúng bộ nhớ đệm (cache hits) — cách rẻ nhất để chạy thứ gì đó có cấu trúc hậu duệ từ mẫu flagship tiếp theo của Alibaba, và cũng là lần đầu tiên phòng thí nghiệm phát hành bản xem trước kiến trúc dưới dạng trọng số mở công khai trước khi toàn bộ dòng mô hình tồn tại.
{{1}}Một con số có sức nặng hơn toàn bộ bảng thông số kỹ thuật: 6B.{{/1}} {{2}}Qwen3.8-Flash không đạt được năng lực nhờ kích thước đồ sộ — mà nhờ vào nơi nó đặt sức mạnh tính toán.{{/2}} {{3}}Phần thân MoE 125B, bảng nhúng N-gram 51B và một mô-đun dự đoán đa token nhỏ lưu trữ gần 180B tham số trên đĩa, thế mà mỗi token chỉ đi qua 6B trong số đó.{{/3}} {{4}}Đó chính là canh bạc mà toàn bộ bản phát hành này dựa vào, và cũng là lý do khiến chi phí huấn luyện giảm sâu đến vậy.{{/4}}
Những gì thực sự đã được phát hành
Qwen3.8-Flash, không kèm hậu tố, là phiên bản mô hình production hiện đang hoạt động trên API QwenCloud và trong sản phẩm Qwen Office của Alibaba; nó có ngữ cảnh mặc định 1M token và các công cụ tích hợp sẵn, với giá $0.15/$0.47 mỗi triệu token, và $0.016 khi trúng cache. Vào ngày 28 tháng 8, phạm vi khả dụng đã được mở rộng: theo thông báo của Alibaba, Qwen3.8-Flash hiện cũng có thể truy cập qua OpenCode Go, gói đăng ký giá cố định của tác nhân lập trình terminal mã nguồn mở — danh sách mô hình của OpenCode ghi nhận nó là qwen3.8-flash với cùng mức giá $0.15/$0.47 mỗi triệu token.

Thông báo chính thức từ Qwen Studio mô tả việc phát hành trọng số mở như một lời mời gọi đến hệ sinh thái: gửi sớm những thay đổi về cấu trúc để cộng đồng và các bộ công cụ suy luận có thể thích nghi trước khi dòng sản phẩm Qwen4 đầy đủ được xây dựng. Dấu hiệu đầu tiên cho thấy điều này thành công là SGLang — công cụ suy luận của LMSYS — công bố hỗ trợ ngay ngày đầu cho Qwen3.8-Flash-Next cùng ngày, với mô hình cũng đã được cấu hình cho Transformers, vLLM và TokenSpeed.
Kiến trúc là câu chuyện.
Đây không phải là mô hình thế hệ Qwen 3.8 được thu nhỏ. Qwen3.8-Flash giới thiệu bốn thay đổi mà nhóm nghiên cứu cho biết dòng Qwen4 sẽ kế thừa, và mỗi thay đổi đều nhắm vào một nút thắt cổ chai khác nhau.
• Attention — Gated DeltaNet cộng với Qwen Sparse Attention. Gated DeltaNet (GDN) nén lịch sử thành các trạng thái có kích thước cố định tại ba trong bốn lớp, nhờ đó mô hình không phải đọc lại toàn bộ ở mỗi bước; QSA xử lý ngữ cảnh dài như một bài toán tìm kiếm — một bộ lập chỉ mục nhẹ gom chuỗi thành các vi khối, chấm điểm mức độ quan trọng của từng khối và định tuyến sự chú ý đến các vùng liên quan nhất. Theo đo lường của Alibaba, kernel chú ý QSA đạt tốc độ prefill nhanh hơn tới 7.6× và decode nhanh hơn 4.9× ở ngữ cảnh 1M token (do nhà cung cấp báo cáo).
• Residual — Residual có cổng. Luồng residual duy nhất được tách thành bốn nhánh song song với cơ chế gating theo từng phần tử, cho phép mạng tự quyết định với mỗi token mức độ đọc và ghi trên từng nhánh; một nhánh trở thành kênh truyền tầm xa kết nối các lớp attention ban đầu với các lớp sâu. Trạng thái residual được lưu dưới dạng FP8 để giảm băng thông bộ nhớ.
• Nhúng {{1}}— nhúng N-gram{{/1}}. Một bảng tra cứu 51B tham số được khóa theo token hiện tại cùng với một số token đứng trước. Nó bổ sung dung lượng mà không làm tăng chi phí tính toán cho từng token, và vì bảng có thể nằm trong bộ nhớ host và được nạp trước không đồng bộ, nó không chiếm bộ nhớ GPU một cách vĩnh viễn.
• Bộ tối ưu — Muon. Các tham số tuyến tính 2D lớn (attention, GDN, các chuyên gia MoE) được huấn luyện với Muon, trong khi embeddings, router và các phần hạng thấp Gated Residual giữ nguyên AdamW; nhóm nghiên cứu đã tái khớp scaling law cho kiến trúc mới dựa trên sự pha trộn này.

Đối với nhà phát triển, hai điều trong số này quan trọng ngay lập tức: ngăn xếp attention là lý do khiến ngữ cảnh 1M token có thể trở thành mặc định thay vì mục tiêu tham vọng, và bảng N-gram là lý do khiến mô hình 125B vẫn có thể được phục vụ tinh gọn. Phần còn lại là tài liệu xem trước cho Qwen4 — và đó chính xác là cách Alibaba đang định vị nó.
Bảng đánh giá chuẩn, được ghi nhãn trung thực
Mọi con số trong phần này đều là đánh giá của chính Alibaba, mới chỉ một ngày tuổi và chưa được bất kỳ phòng thí nghiệm độc lập nào tái lập tại thời điểm viết bài. Hãy coi chúng là những tuyên bố mang tính định hướng, không phải kết quả cuối cùng. Trên bộ đánh giá của Alibaba, Qwen3.8-Flash-Next (6B active) ghi nhận SWE-bench Pro 62.5, DeepSWE 1.1 58.7, CoWorkBench 73.9, AndroidWorld 84.5 và MathVision 95.7, cùng điểm JobBench 55.7 — và biến thể cơ sở, Qwen3.8-Flash-Next-Base, được báo cáo là mô hình mở tốt nhất trên 8/14 benchmark trong một vòng so sánh trực tiếp, bao gồm MMLU-Pro, SuperGPQA, BBH và MMMU.
Các tuyên bố của Alibaba về vị trí của mẫu mới trong dòng sản phẩm nên được gọi đúng bản chất — đó chỉ là tuyên bố. Công ty cho biết Qwen3.8-Flash đánh bại Claude Opus 4.6 với 9,1 điểm trên SWE-bench Pro và khoảng 20 điểm trên JobBench, đồng thời tiến đến gần tầm với của Claude Opus 4.8. Tất cả đều do nhà cung cấp công bố, tất cả đều chưa được tái lập. Những gì có thể kiểm chứng độc lập ngay hôm nay hẹp hơn nhiều: các trọng số mô hình đã được phát hành, ngăn xếp suy luận đã chạy được chúng, và SGLang đã ra mắt hỗ trợ ngay trong cùng ngày. Việc tái lập độc lập bảng điểm chuẩn sẽ sớm hoàn tất trong vài ngày, không phải vài tuần.
Chi phí là bao nhiêu
Giá cả là phần dễ xác minh nhất vì đây là mức giá được công bố chứ không phải điểm chuẩn — và vào ngày 27 tháng 8, Alibaba đã chính thức xác nhận mức giá production của QwenCloud: 0,15 USD mỗi triệu token đầu vào, 0,47 USD mỗi triệu token đầu ra và 0,016 USD mỗi triệu token cho cache hit, với mức giá nội địa Trung Quốc là 0,8/2,7/0,1 NDT. Con số cache hit mới là con số đáng quan tâm đối với các tác vụ tác tử (agentic workloads): một tác tử ngữ cảnh dài đọc lại một lịch sử lớn trong mỗi lượt chỉ phải trả vài xu cho các lần đọc lặp lại — đây chính xác là loại tác vụ mà ngăn xếp attention của Qwen4-preview nhắm tới. Báo chí Trung Quốc ngay lập tức so sánh mức giá gây chú ý này với các đối thủ — khoảng một phần ba mức phí DeepSeek-V4-Flash đưa ra, và chỉ là một sai số làm tròn bên cạnh các mô hình đóng tiên phong. Theo hạch toán của Alibaba, đợt huấn luyện này chỉ tốn khoảng một phần chín chi phí của Qwen3.7-Plus, và chính đòn bẩy cấu trúc đó là thứ giúp giá API duy trì ở mức như hiện tại.
Bên cạnh phần còn lại của gia đình Qwen 3.8, sự chênh lệch rất rõ rệt: mẫu flagship Qwen3.8-Max có giá $2.00 và $6.00 cho mỗi triệu token, và hiện đã hoạt động trên OrcaRouter với đúng giá niêm yết của nhà cung cấp, không phụ phí. Giờ đây khi API Qwen3.8-Flash bản production đã mở, cơ chế chuyển thẳng giá tương tự cũng áp dụng cho mức giá chính thức $0.15/$0.47 và mức $0.016 cho cache-hit — lớp định tuyến tạo nên sự khác biệt giữa việc đọc về một đợt giảm giá và việc có nó ngay trong cấu hình. Cả hai mô hình dùng chung một khóa, failover giữa chúng, không cần hợp đồng thứ hai.
'Bản xem trước của Qwen4' nghĩa là gì
Đọc thông báo theo đúng nghĩa đen thì rủi ro đã rõ: đây không phải là một phiên bản mới của Qwen 3.8 — mà là kiến trúc Qwen4 được phát hành sớm, dưới thương hiệu bảo hộ của một mô hình nhỏ hơn, rẻ hơn. Lý do để làm vậy rất hợp lý: các framework, kỹ thuật lượng tử hóa (quantization) và các mô hình triển khai cần thời gian để hoàn thiện, và một mô hình 6B-active là cách rẻ để cộng đồng kiểm tra sức chịu tải (stress-test) GDN + QSA ở quy mô lớn trước khi Alibaba xây dựng thứ đắt tiền hơn dựa trên nó. Mặt trái là Qwen3.8-Flash production là một API được xây dựng trên kiến trúc mà hệ sinh thái rộng lớn hơn vẫn đang kiểm định. Những người áp dụng sớm, về bản chất, chính là tập kiểm thử.
Cách nhanh chóng để dùng thử
Hôm nay bạn có {{1}}bốn lựa chọn thực tế{{/1}}. {{2}}Tự lưu trữ các trọng số mở qua vLLM, SGLang, Transformers hoặc TokenSpeed{{/2}} — bản build FP8 là lựa chọn đầu tiên hợp lý cho mọi hệ thống chưa đủ quy mô một node hoàn chỉnh. {{3}}Gọi API QwenCloud{{/3}}, hiện đang hoạt động với mức giá chính thức $0.15/$0.47 và cache hit ở mức $0.016. {{4}}Sử dụng nó trong OpenCode Go, gói đăng ký giá cố định của tác nhân mã nguồn mở lập trình trên terminal{{/4}}, gói này vừa bổ sung Qwen3.8-Flash trong tuần này (được Alibaba công bố vào ngày 28 tháng 8, được xác nhận trên danh sách mô hình của chính OpenCode). Hoặc {{5}}gọi bản production của Flash qua một router giống như cách bạn vẫn gọi Qwen3.8-Max{{/5}}, với mức giá chính thức được truyền thẳng, không tính thêm phụ phí — không cần tích hợp tùy chỉnh nào để bảo trì.

Câu hỏi mở là câu hỏi trung thực: {{1}}liệu một mô hình kích hoạt 6 tỷ tham số của nó có thể trụ vững trong môi trường production trên nhiều loại workload hay không, hay bảng benchmark hôm nay trông như mới một ngày tuổi sẽ vẫn như vậy sau một tháng?{{/1}} {{2}}Đó không phải là lý do để chờ đợi{{/2}} — {{3}}mà là lý do để đặt nó đằng sau failover thay vì trước toàn bộ hệ thống của bạn.{{/3}} {{4}}Trọng số đã được công bố, giá đã được định, và kiến trúc là hướng đi chính thức của Alibaba.{{/4}} {{5}}Vài tuần tới sẽ quyết định liệu 6B có đủ hay không.{{/5}}
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
