Qwen3.8-Flash-Next so với Qwen3.8-27B — mô hình MoE Qwen4-preview so với con ngựa thồ mã nguồn mở. Hình minh họa tái tạo.
Guides & Insights

Qwen3.8-Flash-Next đấu với Qwen3.8-27B: MoE Qwen4-preview đối đầu với ngựa thồ trọng số mở

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Điều đáng ngạc nhiên về Qwen3.8-Flash-Next không phải là việc Alibaba tuyên bố một mô hình chỉ kích hoạt 6 tỷ tham số mỗi token đánh bại hầu hết các mô hình mở khác — mà là việc phục vụ nó cần nhiều bộ nhớ hơn mô hình dense 27 tỷ tham số mà nó đang được so sánh. Qwen3.8-Flash-Next, được mở mã nguồn vào ngày 26 tháng 8 năm 2026 như bản xem trước kiến trúc Qwen4, giữ một bảng tra cứu N-gram 51 tỷ tham số trong RAM hệ thống thay vì VRAM; Qw​en3.8-27B, mô hình dense đa phương thức Apache-2.0 ra mắt giữa tháng 8 và là con ngựa thồ mã nguồn mở của thế hệ Qw​en 3.8 hiện tại, vừa vặn trên một card đồ họa 24GB ở mức 4-bit. Trên bảng benchmark của chính Alibaba, MoE mới đánh bại 27B ở 21/22 benchmark được so sánh. Còn với bằng chứng độc lập — xếp hạng arena, một nghiên cứu về tác nhân pháp lý, các phép đo thông lượng bên thứ ba — thì 27B là mô hình duy nhất trong hai mô hình có bất kỳ bằng chứng nào. Chính sự kết hợp đó là toàn bộ yếu tố quyết định.

Cuộc so găng tóm gọn trong một câu: hai mô hình open-weight cùng thế hệ, hỗ trợ văn bản và hình ảnh, cùng ngữ cảnh gốc 262K, cả hai đều được thiết kế để chạy bên ngoài trung tâm dữ liệu — nhưng khác biệt về kiến trúc, giấy phép, giá cả và mức độ câu chuyện của chúng được xác minh. Qwen3.8-Flash-Next là mô hình sparse MoE cho thấy trước mọi thứ Qwen4 được kỳ vọng sẽ kế thừa. Qw​en3.8-27B là mô hình dense, nén những gì Alibaba học được khi xây dựng mô hình chủ lực 2.4T thành thứ mà một GPU duy nhất có thể chạy. Chọn giữa hai mô hình này ít nằm ở năng lực — Alibaba nói bản preview vượt trội hơn — mà nằm ở việc bạn tin vào bảng thông số của nhà cung cấp mới chỉ một ngày tuổi hơn là tin vào mô hình đã bị cộng đồng mổ xẻ.

Bảng tỷ số

Ưu tiên nguồn trước: mọi số liệu của Qwen3.8-Flash-Next dưới đây đều do chính Alibaba công bố, mới một ngày và chưa được kiểm chứng độc lập. Các tuyên bố benchmark nổi bật của Qwen3.8-27B cũng do Alibaba báo cáo, nhưng bản 27B có kết quả độc lập — xếp hạng arena về sở thích con người, một nghiên cứu lĩnh vực pháp lý và phép đo thông lượng AMD — mà bản xem trước không thể sánh được.

• Tổng tham số — Qwen3.8-Flash-Next: 125B MoE + 51B N-gram + MTP (~180B được lưu trữ), 6B kích hoạt. Qwen3.8-27B: ~27B dense (28B với bộ mã hóa thị giác), tất cả đều kích hoạt.

• Kiến trúc — Qw​en3.8-Flash-Next: Qwen4 preview — Qw​en Sparse Attention xen kẽ với Gated DeltaNet, residual có cổng, embedding N-gram, được huấn luyện bằng Muon. Qw​en3.8-27B: 48 lớp linear-attention GDN cộng với 16 lớp full-attention (3:1), dense.

• Ngữ cảnh — cả hai đều có 262.144 token gốc, có thể mở rộng lên 1M qua YaRN.

• Phương thức — cả hai đều chấp nhận đầu vào văn bản, hình ảnh và video, và trả về văn bản.

• Giấy phép — Qwen3.8-Flash-Next: qwen-community-1.0. Qwen3.8-27B: Apache 2.0.

• Giá — Qwen3.8-Flash-Next: $0.16 / $0.47 mỗi 1M (đã công bố; API production chưa mở). Qw​en3.8-27B: $0.33 / $2.40 mỗi 1M, có mặt ngay hôm nay.

• Dấu chân bộ nhớ khi chạy — Qwen3.8-Flash-Next: bảng 51B trong RAM host, ~96GB bộ nhớ hệ thống cộng thêm GPU (nếu có); FP8 ~186GB, Q4 GGUF ~82GB. Qwen3.8-27B: BF16 ~55.6GB, 4-bit vừa với card 24GB.

• Bằng chứng độc lập — Qwen3.8-Flash-Next: chưa có. Qw​en3.8-27B: mô hình mở số #1 trên Arena.ai Image-to-WebDev, #9 tổng thể trên Code Arena WebDev, #1 trọng số mở trên benchmark Legal Agent của Harvey, thông lượng đo bởi AMD.

A two-column comparison scoreboard titled 'Qwen3.8-Flash-Next vs Qwen3.8-27B — the scoreboard': left column Qwen3.8-Flash-Next with Params '125B MoE + 51B N-gram', Active per token '~6B', Architecture 'Qwen4 preview', Context '262K native / 1M via YaRN', Price '$0.16 / $0.47 per 1M', Independent score 'none yet'; right column Qwen3.8-27B with Params '27B dense', Active per token '27B (all)', Architecture 'GDN hybrid, current gen', Context '262K native / 1M via YaRN', Price '$0.33 / $2.40 per 1M', Independent score '#1 open Image-to-WebDev'; footer 'Flash-Next figures vendor-reported, unreproduced; 27B independent per Arena.ai, vendor figures Alibaba-reported'; the OrcaRouter logo is composited in the bottom-right corner.

Theo số liệu của chính Alibaba, bản xem trước thắng gần như mọi thứ.

Bảng so sánh được Alibaba công bố cho thấy Qwen3.8-Flash-Next đạt điểm số tương đương hoặc cao hơn trên 21/22 điểm chuẩn ngôn ngữ và thị giác so với Qw​en3.8-27B, và những chiến thắng này không chỉ mang tính hình thức. SWE-bench Pro 62.5 so với 61.7 là một lợi thế biên, nhưng DeepSWE 58.7 so với 42.2, JobBench 55.7 so với 33.4, và CoWorkBench 73.9 so với 70.7 là những khoảng cách thực sự trên đúng các khối lượng công việc tác nhân và văn phòng mà tầng flash hướng tới. Các con số nổi bật của bản xem trước — LiveCodeBench v6 91.9, GPQA Diamond 91.7, MathVision 95.7 — cũng vượt qua các hàng tương ứng của bản 27B trên bảng của Alibaba. Đây chính là luận điểm của bản phát hành được thể hiện bằng dữ liệu: phần lớn khả năng suy luận và lập trình của dòng Qw​en 3.8 lớn hơn, với chi phí tính toán chủ động chỉ bằng một phần nhỏ.

Giữ nguyên nhãn gắn với câu đó. Đây là những đánh giá của chính Alibaba, từ bộ đánh giá của chính Alibaba, chỉ mới một ngày trong trường hợp bản xem trước và chưa được lặp lại kiểm chứng cho cả hai. Bản phân tích kiến trúc KGP Talkie xếp hạng cho trận đối đầu này cũng đi đến kết luận cùng hình dạng, nhưng nó cũng dựa trên cùng một bảng dữ liệu của nhà cung cấp. Bảng dữ liệu của nhà cung cấp chỉ là một lời hứa; không có gì trong đoạn này được xác nhận một cách độc lập.

27B có gì mà Flash-Next không có: bằng chứng

Đây là lúc cuộc so tài không còn một chiều nữa. Qw​en3.8-27B đã được công khai hai tuần nay, và cộng đồng đã tạo ra ba điểm dữ liệu độc lập. Trên bảng xếp hạng Image-to-WebDev của Arena.ai — nơi người xem bỏ phiếu kín để chọn một trong hai output ẩn danh mà họ muốn triển khai — bản 27B đứng #1 trong số các mô hình mở và #7 toàn bảng với số điểm được công bố là 1,574. Trên bảng Code Arena WebDev cùng hệ, nó đứng #9 toàn bảng với 1,595 điểm, là mô hình duy nhất trong phân khúc kích thước của mình lọt vào top 10. Harvey, công ty AI pháp lý, và Engram đã chạy một nghiên cứu mô phỏng công ty luật, đưa một bản 27B được tùy biến lên đầu bảng benchmark tác tử pháp lý của họ — với lưu ý rằng mô hình đã được cho học bộ ngữ liệu kiểm tra từ trước, nên đây là minh chứng cho dư địa fine-tuning chứ không phải điểm số của bộ trọng số gốc. AMD đã công bố các phép đo thông lượng ngay trong ngày đầu: 24.5 token/giây trên Ryzen AI Max+ 395 và 51.8 token/giây trên Radeon AI PRO R9700. Không con số nào trong số này là chỉ số chất lượng tổng quát — vẫn chưa có chỉ số Artificial Analysis cho bản 27B — nhưng mỗi con số đều đến từ một bên thứ ba đã thực sự chạy mô hình.

Qwen3.8-Flash-Next không có điều nào trong số đó. Toàn bộ bảng điểm chuẩn của nó là của Alibaba, mới chỉ vài giờ tuổi tại thời điểm viết bài, và chưa có phòng thí nghiệm độc lập nào tái tạo được một hàng nào. Đó không phải là một lời buộc tội; đó là định nghĩa của một bản phát hành mới một ngày. Nhưng chính sự bất đối xứng đó mới là điều nên chi phối sự lựa chọn: bản xem trước dẫn trước trên những con số duy nhất hiện có, và mỗi con số trong số đó đều được viết bởi nhà cung cấp muốn bạn tin vào nó.

Nhánh triển khai

Sự khác biệt thực tế giữa hai mô hình này nằm ở chỗ các tham số sống ở đâu, và điều đó quyết định phần cứng bạn cần. Qwen3.8-Flash-Next cố ý chuyển bảng embedding N-gram 51B của nó sang bộ nhớ máy chủ, nơi nó có thể được nạp trước không đồng bộ — đó là lý do nó thêm 51B tham số dung lượng mà không tăng chi phí tính toán cho mỗi token. Hậu quả là mô hình sẽ không vừa trên card tiêu dùng 24GB như cách Qw​en cục bộ từng vừa trước đây. Ước tính cộng đồng đưa ra một tệp Q4 GGUF khoảng 82GB tổng cộng (khoảng 58GB trọng số chính cộng 24GB bảng tra cứu), bản FP8 khoảng 186GB, BF16 khoảng 360GB; công thức khả thi là một máy với khoảng 96GB RAM hệ thống cộng thêm một GPU bất kỳ chạy phần 6B đang hoạt động. Lợi ích là chi phí tính toán cho mỗi token rẻ — toàn bộ canh bạc của kiến trúc — và ngữ cảnh dài 1M token vẫn phải chăng vì các lớp GDN nén lịch sử thay vì tăng KV cache.

Qw​en3.8-27B là mô hình theo chiều ngược lại: dense (đặc), vì vậy mỗi token chạy toàn bộ 27B tham số, nhưng đủ nhỏ để toàn bộ khớp trên phần cứng bạn đã sở hữu. Trọng số BF16 xấp xỉ 55,6GB; ở mức 4-bit, nó chạy trên card 24GB như RTX 3090 hoặc 4090, và số đo của AMD cho thấy nó đạt 24,5 đến 51,8 token/s trên phần cứng AI Max-class và Radeon PRO. Nếu ràng buộc là một máy trạm duy nhất, bản 27B là bản thực sự phù hợp; nếu ràng buộc là chi phí mỗi token ở quy mô lớn, Flash-Next là bản thắng trên lý thuyết.

Phân nhánh giá

Giá API cũng kể cùng một câu chuyện từ phía bên kia. Qw​en3.8-27B đã hoạt động trên OrcaRouter hôm nay với giá $0.33 cho mỗi triệu token đầu vào và $2.40 cho mỗi triệu token đầu ra, giá niêm yết của nhà cung cấp được chuyển thẳng qua mà không cộng thêm phí — tùy chọn tự lưu trữ đã có thể gọi được, không cần mua GPU. Qwen3.8-Flash-Next chưa được định tuyến đi đâu cả: trọng số mở là con đường duy nhất cho đến khi Qwen3.8-Flash phiên bản sản xuất được mở trên API QwenCloud ở mức giá đã công bố $0.16/$0.47. Khi API đó mở, cơ chế chuyển thẳng tương tự sẽ đưa mức giá $0.16/$0.47 về phía chúng tôi ngay trong ngày, trên cùng một khóa API với bản 27B, kèm tự động chuyển đổi dự phòng giữa chúng — vì vậy, cách để áp dụng một kiến trúc mới ra đời được một ngày không phải là đặt cược cả hệ thống sản xuất vào nó, mà là trỏ một phần lưu lượng vào nó, với mô hình đã được kiểm chứng làm phương án dự phòng. Một lớp định tuyến cũng có thể đứng trước một mô hình mà bạn tự vận hành, đây là con đường thực tế để đánh giá trọng số mở của Flash-Next ngay hôm nay mà không cần tích hợp thêm lần nữa.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b (captured August 27, 2026), showing the model name 'Qwen3.8 27B', model id 'qwen/qwen3.8-27b', Vision/Tools/JSON/Reasoning tags, 'by Qwen - 2026-08-13', pricing $0.33 input and $2.40 output per 1M tokens, a p50 TTFT of 1.63s, the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure', and the OpenAI-compatible endpoint note.

Chạy cái nào?

Chọn Qwen3.8-Flash-Next nếu bạn muốn đi theo hướng Qwen4 ngay bây giờ, nếu khối lượng công việc của bạn đủ lớn để $0.16/$0.47 so với $0.33/$2.40 là một con số thực, hoặc nếu bạn có RAM để tự lưu trữ nó và cảm thấy thoải mái với bảng thông số nhà cung cấp. Chọn Qw​en3.8-27B nếu bạn cần điều khoản Apache-2.0, một card 24GB, một mô hình có thể gọi ngay hôm nay, hoặc bất kỳ mức độ bằng chứng độc lập nào — đây là mô hình duy nhất trong hai mô hình đã được chạy bởi bất kỳ ai ngoài Alibaba.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the description stating compatibility with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default, plus the license 'qwen-community-1.0' and model size 180B params.

Hai ảnh chụp ở trên là bề mặt công khai của từng nửa: danh sách OrcaRouter nơi Qw​en3.8-27B có thể gọi được hôm nay với giá $0.33/$2.40, và thẻ mô hình Qwen/Qwen3.8-Flash-Next trên Hugging Face.

Và kết luận trung thực là một câu hỏi, bởi vì cơ sở bằng chứng mới chỉ có một ngày tuổi: liệu một mô hình kích hoạt 6 tỷ tham số có thể giữ được kết quả quét 21/22 khi được tái lập độc lập, hay bảng N-gram giúp nó phục vụ tinh gọn cũng chính là thứ sẽ thất bại với khối lượng công việc thực tế? 27B đã sống sót qua hai tuần kiểm định của cộng đồng. Flash-Next đang ở vị trí mà 27B từng đứng hai tuần trước — đó là lý do thuyết phục nhất để chạy chúng song song thay vì phải lựa chọn.