Bản phát hành Qwen3.8-Flash-Next — Bên trong bản xem trước kiến trúc Qwen4 của Alibaba. Hình minh họa được tái tạo.
Guides & Insights

Phát hành Qwen3.8-Flash-Next: Bên trong bản xem trước kiến trúc Qwen4 của Alibaba

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tài liệu hữu ích nhất mà Ali​baba công bố vào ngày 26 tháng 8 năm 2026 không phải là bộ hồ sơ báo chí — mà là một bản báo cáo kỹ thuật. Qwen3.8-Flash-Next, mô hình hỗn hợp chuyên gia đa phương thức open-weight được phát hành ngày hôm đó, ra mắt cùng với một bài nghiên cứu có tựa đề "On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability," và chính bản báo cáo ấy mới là câu chuyện. Nó làm điều mà các buổi ra mắt sản phẩm của hãng gần như không bao giờ làm: công bố các thí nghiệm ablation, các kết quả tiêu cực và các thử nghiệm về công thức huấn luyện, sau đó vạch ra mối liên hệ từ từng phát hiện đến kiến trúc của dòng Qwen4 mà mô hình này dự kiến giới thiệu trước.

Thực sự đã phát hành vào ngày 26 tháng 8

Bản thân mô hình này khá khiêm tốn theo tiêu chuẩn năm 2026 của Qw​en, và điều đó là có chủ đích. Qwen3.8-Flash-Next lưu trữ 125B tham số mô hình chính cùng với một bảng embedding n-gram 51B riêng biệt — tổng cộng khoảng 176B trước mô-đun dự đoán đa token 4B — nhưng chỉ kích hoạt 6B cho mỗi token. Đây là mô hình mixture-of-experts với 512 chuyên gia, định tuyến top-10 và 48 tầng, hỗ trợ ngữ cảnh gốc 262.144 token và có thể mở rộng lên 1M qua YaRN. Nó nhận đầu vào là văn bản, hình ảnh và video, và xuất ra văn bản. Trọng số được đăng tải trên Hugging Face và ModelScope theo giấy phép qwen-community-1.0, và blog của chính Ali​baba gọi đây là "bản xem trước thử nghiệm của kiến trúc sẽ làm nền tảng cho Qwen4" — vai trò tương tự mà Qwen3-Next từng đóng cho dòng Qw​en3.5, một chú chim hoàng yến bay trước chiếc soái hạm.

Cùng ngày, Ali​baba ra mắt phiên bản thương mại: một bản dựng phục vụ tên là Qwen3.8-Flash trên API QwenCloud với giá $0.16 cho mỗi triệu token đầu vào và $0.47 cho mỗi triệu token đầu ra. Hai phiên bản này dễ bị nhầm lẫn và cần phân biệt rõ. Qwen3.8-Flash-Next là bản xem trước trọng số mở mà báo cáo kỹ thuật phân tích; Qwen3.8-Flash là bản dựng API sản xuất, có giá, với ngữ cảnh mặc định 1 triệu token và định dạng yêu cầu tương thích với Open​AI và Anthropic. Giá cả, các điểm chuẩn và các lập luận về kiến trúc đều bắt nguồn từ cùng một công trình kỹ thuật.

The official QwenLM/Qwen3.8-Flash-Next GitHub repository, showing the model card ('foundation model developed by Qwen Team, Alibaba Group'), 171 stars, and the tech_report.pdf file in the repository listing.

Bốn lựa chọn kiến trúc trong báo cáo kỹ thuật

Xương sống của bài báo là bốn đặt cược về việc một mô hình tiên phong có ngữ cảnh dài, chi phí thấp nên trông như thế nào, mỗi đặt cược đều kèm theo bằng chứng thực nghiệm.

• Attention — lai ghép GDN + QSA. Cứ bốn lớp thì có ba lớp sử dụng Gated DeltaNet, một lớp linear-attention nén lịch sử thành trạng thái hồi quy có kích thước cố định thay vì KV cache phát triển theo độ dài chuỗi. Lớp còn lại là Qw​en Sparse Attention, lớp này gộp chuỗi thành các micro-block, chấm điểm chúng với chi phí rẻ, và chỉ chạy full attention trên các vùng quan trọng. Ali​baba báo cáo tốc độ prefill tăng lên đến 7,6× và decode tăng 4,9× ở ngữ cảnh 1M; benchmark ngày đầu của chính SGLang đo được còn cao hơn, ở mức 10,2× và 6,6×. Với tỷ lệ trúng prefix cache 90%, thông lượng prefill đạt 8,6× so với Qwen3.7-Plus. Đây là những con số do nhà cung cấp và đối tác báo cáo, không qua kiểm toán độc lập.

• Luồng phần dư — Phần dư có cổng. Đường dẫn phần dư duy nhất được mở rộng thành bốn nhánh song song với cơ chế gating động theo từng phần tử — một thiết kế đa nhánh kiểu Hyper-Connection với cơ chế điều khiển kiểu GatedNorm. Cổng điều tiết việc đọc/ghi trên từng nhánh; theo bài báo, điều này giúp triệt tiêu các giá trị ngoại lai trong kích hoạt và, trong thực tế, cho phép lưu trữ các trạng thái phần dư dưới dạng FP8.

• Embedding — bảng n-gram 51B. Thay vì một embedding cho mỗi token, mô hình khóa một bảng tra cứu trên token hiện tại cùng các token trước đó, lưu trữ toàn bộ cụm từ và các mẫu cục bộ. Chi phí gần như bằng không cho mỗi token, và vì các địa chỉ tra cứu đã được biết trước, nó có thể nằm trong bộ nhớ host và được prefetch không đồng bộ, giữ hoàn toàn ngoài bộ nhớ GPU. Đây là thủ thuật cho phép checkpoint lưu trữ 176B chạy trên các máy hạng 75GB, và nó bắt nguồn từ embedding theo lớp của Gemma 3n và Engram của Deep​Seek.

• Tối ưu hóa — Muon, đã tinh chỉnh. Quá trình huấn luyện sử dụng trình tối ưu hóa Muon, một phương pháp momentum dựa trên trực giao hóa, áp dụng cho các ánh xạ tuyến tính hai chiều (trọng số attention, GDN và MoE expert) trong khi AdamW được giữ cho embeddings, router và các tham số hạng thấp. Bài báo cũng báo cáo một kết quả tiêu cực đáng đọc: batch-size warmup đã bị loại bỏ sau khi hóa ra nó tốn thêm 18,8% số bước tối ưu hóa mà không cải thiện được gì.

Bảng benchmark, hãy đọc kỹ

Tất cả những con số nổi bật ở đây đều do Qw​en tự công bố trên model card và trong báo cáo, và không con số nào trong đó đã được kiểm chứng độc lập — mô hình mới chỉ ra mắt được một ngày và chưa có bên thứ ba nào thẩm định. Dù đọc theo cách đó, đây vẫn là điều đáng chú ý, vì Qwen3.8-Flash-Next đang so kè quyết liệt với DeepSeek-V4-Flash-0731, một mô hình lớn hơn nhiều và đã có chỗ đứng vững chắc, chỉ với 6 tỷ tham số hoạt động.

• DeepSWE 1.1 — 58.7 so với 54.4 (do nhà cung cấp báo cáo).

• SWE-bench Pro — 62.5 so với 56.0 (do nhà cung cấp báo cáo).

Toolathlon Verified — 73.5 so với 70.3 (theo báo cáo của nhà cung cấp).

• LiveCodeBench v6 — 91.9 so với 90.6 (do nhà cung cấp báo cáo).

• GPQA Diamond — 91,7 so với 90,8 (theo báo cáo của nhà cung cấp).

• IFBench — 81.3 so với 79.2 (do nhà cung cấp báo cáo).

Rồi sự thiếu hụt mà báo cáo công bố công khai: NL2Repo-Bench, 48.1 so với 54.2 của DeepSeek-V4-Flash-0731 — một khoảng cách thực sự về khả năng tạo mã cấp độ kho lưu trữ, chiều lập trình tác tử duy nhất mà mô hình nhỏ hơn không theo kịp. Agents' Last Exam là ngang nhau với 24.3 so với 25.2. Về tự động hóa văn phòng, Qw​en báo cáo CoWorkBench 73.9 — nhưng đó là benchmark nội bộ và Ali​baba giữ nó khỏi bảng xếp hạng chính.

Scoreboard card for Qwen3.8-Flash-Next: 6B active of 176B stored params, 262K to 1M context (YaRN), DeepSWE 1.1 58.7, SWE-bench Pro 62.5, GPQA Diamond 91.7 (each marked vendor), API price $0.16 / $0.47 per 1M, with a footer noting all benchmark figures are vendor-reported and not independently verified.

Về thị giác, bảng tự báo cáo cho thấy AndroidWorld đạt 84,5 so với 62,0 của Claude Opus 4.6 Max và RealWorldQA đạt 88,5 so với 73,9. Humanity's Last Exam là hạng mục chính duy nhất mà Qw​en thua hoàn toàn Claude Opus 4.6 Max — và việc chấm điểm đó lại do chính GPT-4o thực hiện, nên ngay cả sự so sánh đó cũng không thực sự công bằng.

Giá: một phần mười hai so với bản flagship

Và đây là con số quan trọng đối với ngân sách. Phiên bản Qwen3.8-Flash được cung cấp có giá 0,16 USD cho mỗi triệu token đầu vào và 0,47 USD cho mỗi triệu token đầu ra trên QwenCloud. Mức giá này chỉ bằng khoảng một phần mười hai giá của mô hình chủ lực Qwen3.8-Max của Ali​baba — 2,00 USD cho mỗi triệu token đầu vào và 6,00 USD cho mỗi triệu token đầu ra — trên một mô hình mà theo báo cáo được huấn luyện với lượng tính toán chỉ bằng khoảng một phần chín so với Qwen3.7-Plus. Các nhà cung cấp mô hình Trung Quốc đã dành cả mùa hè để cắt giảm giá ở phân khúc flash, và bản phát hành này là phần của Qw​en trong chiến dịch đó, ra mắt kèm theo lý giải về kiến trúc thay vì chỉ đơn thuần là một đợt giảm giá.

Đối với những ai đang so sánh giữa các danh mục, phép tính sẽ trở nên dễ dàng hơn khi mọi nhà cung cấp hiển thị cùng một con số. OrcaRouter định tuyến phần còn lại của dòng sản phẩm Qw​en — Qwen3.8-Max, Qwen3.8-27B và Qwen3.8 — theo giá niêm yết của nhà cung cấp với mức cộng thêm 0%, vì vậy khi nhà cung cấp giảm giá, phía chúng tôi sẽ có hiệu lực ngay trong ngày công bố. Qwen3.8-Flash-Next chưa có trong danh mục của chúng tôi; khi nó đạt đến thời gian chạy mà chúng tôi định tuyến, nó sẽ nằm trong cùng cơ chế một khóa, giá niêm yết mà không cần hợp đồng thứ hai.

Những gì bạn có thể làm với nó ngày hôm nay

Hỗ trợ phục vụ ngay từ ngày đầu ra mắt rộng một cách bất thường. SGLang cung cấp một trang cookbook và image chuyên dụng (lmsysorg/sglang:qwen38flashnext); vLLM có vllm/vllm-openai:qwen38-flash-next; NVIDIA kiểm chứng cả hai nền tảng này cùng TensorRT LLM trên rack GB300 NVL72 với tốc độ hơn 16.000 token mỗi giây trên mỗi GPU ở dạng FP8, còn NeMo bao gồm cả tinh chỉnh. Ở quy mô dưới trung tâm dữ liệu, mô hình chạy được trên các cụm DGX Spark và máy trạm 4×RTX PRO 6000, và loạt lượng tử hóa từ cộng đồng ra mắt cùng ngày — các GGUF của Unsloth và bản dựng 1-bit nằm gọn trong 75GB RAM với độ chính xác khoảng 80% so với bản đầy đủ — đồng nghĩa checkpoint lưu trữ 176B thực sự chạy được trên phần cứng mà một nhóm nhỏ sở hữu. Những đội ngũ muốn gọi API hơn là tự chạy có thể truy cập API Qwen3.8-Flash qua QwenCloud của chính Ali​baba và một số nền tảng bên thứ ba, dù trọng số mở mới là thứ hầu hết người áp dụng sớm sẽ sử dụng trước tiên.

LMSYS's SGLang blog post 'Qwen3.8-Flash-Next: Day-0 Support in SGLang', dated August 26, 2026, describing the GDN + QSA hybrid attention and the day-0 runtime support for the model.

Phép tính VRAM đằng sau danh sách đó là bảng n-gram, và đó là nơi các ngăn xếp phục vụ sẽ hội tụ tiếp theo. Phần embedding theo lớp mà báo cáo kỹ thuật giữ ngoài bộ nhớ GPU là một cấu trúc tra cứu thuần túy — mỗi token được sinh ra, mô hình chỉ kéo khoảng 16 trong số 320 triệu hàng của nó — đó là điều khiến việc offload nó trở nên rẻ. vLLM phục vụ Qwen3.8-Flash-Next từ một dev image chuyên dụng trong khi pull request hỗ trợ kiến trúc vẫn còn mở, và phần mới nhất của công việc đó, một PR dự thảo từ cùng tác giả vLLM (vllm-project/vllm#54371, chưa được merge), bổ sung đường dẫn phục vụ PLE-Offload giữ bảng trong bộ nhớ host và đọc qua CUDA unified virtual addressing thay vì dành riêng VRAM. Ở FP8, bảng chiếm khoảng 48GB trong checkpoint ~173GB, vì vậy offload nó là khác biệt giữa một GPU trung tâm dữ liệu và một card 96GB duy nhất — RTX PRO 6000, hoặc một nhóm bộ nhớ thống nhất của DGX Spark. Còn sớm, vì vậy hãy coi nó như định hướng hơn là một tùy chọn được hỗ trợ hiện tại; nhưng đó là runtime đang bắt kịp những gì báo cáo kỹ thuật đã tuyên bố, và là thứ đáng theo dõi nếu con số VRAM là thứ đang kìm chân bạn.

{{1}}Một bản xem trước chỉ mới một ngày tuổi với những con số chưa được tái lập{{/1}} là trường hợp kinh điển cho việc không nên đặt cược một đường production vào nó, và đó chính xác là mục đích của failover. {{2}}Nếu một runtime đang chạy Qwen3.8-Flash-Next và bạn trỏ một endpoint vào nó với cơ chế failover tự động sang một mô hình bạn đã tin cậy{{/2}}, {{3}}bạn sẽ nhận được ưu điểm của kiến trúc mới trên các luồng lưu lượng không quan trọng và một phương án dự phòng sạch sẽ khi nó gặp trục trặc — không cần đấu nối lại, vì đó là một quy tắc định tuyến, không phải một thay đổi mã nguồn.{{/3}}

Bản xem trước này nói gì về Qwen4?

Alibaba đã từng chơi ván bài này rồi. Qwen3-Next đã giới thiệu Gated DeltaNet vào cuối năm 2025 với tài liệu sơ sài, và kiến trúc này chỉ được đặc tả đầy đủ sau khi dòng Qw​en3.5 áp dụng nó ở quy mô lớn. Khuôn mẫu này đang lặp lại: Qwen3.8-Flash-Next là canary, còn bản báo cáo chính là đặc tả thông qua thực nghiệm. Những điểm cụ thể cần theo dõi là liệu flagship Qwen4 có áp dụng tỷ lệ 3:1 GDN-to-QSA hay không, liệu n-gram embedding có trụ vững khi tiếp xúc với hệ thống serving production ở quy mô flagship hay không, và quan trọng nhất là liệu các đánh giá độc lập có xác nhận lợi thế 6B-active so với các mô hình lớn hơn hay không. Nếu luận điểm về hiệu suất đứng vững, flagship Qwen4 có thể ra mắt với chi phí serving thấp hơn đáng kể so với thế hệ trước.

Câu hỏi thường gặp

Qwen3.8-Flash-Next và Qwen3.8-Flash — có phải là cùng một mô hình không?

{{1}}Không, và sự khác biệt này rất quan trọng.{{/1}} Qwen3.8-Flash-Next là bản xem trước kiến trúc open-weights mà báo cáo kỹ thuật phân tích; còn Qwen3.8-Flash là bản build API phục vụ sản xuất mà Alibaba cung cấp trên QwenCloud với giá $0.16/$0.47 cho mỗi triệu token và ngữ cảnh mặc định 1M. {{2}}Cùng chung nguồn gốc kỹ thuật nhưng artifact khác nhau — một bên dành cho tự lưu trữ và kiểm tra, bên còn lại là dịch vụ quản lý có trả phí.{{/2}}

Có nên chuyển khối lượng công việc sản xuất sang nó ngay hôm nay không?

Không thể thiếu ý kiến thứ hai. Mọi benchmark đều do nhà cung cấp tự báo cáo và chưa được tái lập; kiến trúc này còn mới đến mức các serving stack vẫn đang dần hội tụ — bản thân vLLM cũng mới đang bổ sung hỗ trợ qua các pull request mở — và khoảng trống duy nhất về lập trình agentic (NL2Repo) lại nằm đúng ở loại tác vụ mà lập trình viên production thường gặp phải. Trọng số mở giúp bạn tự đánh giá với chi phí thấp, và hỗ trợ SGLang cùng vLLM ngay từ ngày đầu cho phép chạy pilot ngay trong tuần này — nhưng bắt đầu bằng một pilot đặt sau failover mới là cách trung thực, chứ không phải cutover.

Khi nào Qwen4 thực sự được phát hành?

Ali​baba vẫn chưa lên tiếng. Tín hiệu thời điểm duy nhất trong bản phát hành này mang tính lịch sử: con chim hoàng yến cuối cùng, Qwen3-Next, đã bay khoảng một mùa trước khi dòng Qw​en3.5 áp dụng kiến trúc của nó. Theo nhịp độ đó, các flagship của Qwen4 gần hơn so với vẻ ngoài — nhưng báo cáo này rõ ràng nói về kiến trúc, không phải lộ trình phát triển.

Điểm mấu chốt

Qwen3.8-Flash-Next là một bản phát hành hiếm hoi khi bài báo kỹ thuật chính là sản phẩm. Về bản thân mô hình, bảng đánh giá trung thực ghi nhận: {{1}}6B tham số hoạt động ngang bằng với các mô hình lớn hơn nhiều trên hầu hết các benchmark dùng chung, một khoảng cách được nêu tên ở cấp độ code repository, mức giá phục vụ chỉ bằng một phần mười hai so với mô hình hàng đầu, và một kiến trúc là câu trả lời của Qw​en cho câu hỏi làm thế nào một mô hình tiên phong trở nên rẻ.{{/1}} Báo cáo kỹ thuật nói rõ Qwen3.8-Flash-Next dùng để làm gì — {{2}}và nó không phải là mô hình. Nó là bằng chứng cho kiến trúc sẽ trở thành Qwen4,{{/2}} và điều đó đáng đọc trước khi Qwen4 ra mắt, {{3}}vì quyết định mà nó thay đổi chính là quyết định bạn sẽ đưa ra khi Qwen4 đến.{{/3}}

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube