Thẻ tiêu đề chính cho bài viết 'Qwen3.8-Flash-Next — BÁO CÁO RÒ RỈ' với huy hiệu 'CHƯA XÁC MINH — XEM TRƯỚC KIẾN TRÚC QWEN4', phụ đề 'Alibaba phát hành kiến trúc Qwen4 trước khi ra mắt mô hình', ba chip với nội dung 'Nguồn: @kimmonismus', '25 thg 8, 2026' và 'Phát hành: 26 thg 8, 23:00 UTC+08', thẻ bên trái ghi 'Tuyên bố: MoE đa phương thức trọng số mở xem trước kiến trúc Qwen4' và thẻ bên phải ghi 'Trạng thái: trọng số chưa phát hành, ~24h nữa ra mắt'. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Qwen3.8-Flash-Next Đã Ra Mắt: Alibaba Phát Hành Kiến Trúc Qwen4 Trước Khi Qwen4 Tồn Tại

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Qwen3.8-Flash-Next cuối cùng đã có những con số mà Alibaba không tạo ra — và chúng không nói lên điều mà phiên bản ồn ào nhất của câu chuyện khẳng định. Trên Artificial Analysis Intelligence Index, được cập nhật lại thành v4.3 vào ngày 7 tháng 9, bản xem trước trọng số mở của Alibaba đạt 40 điểm và xếp thứ năm trong số 113 mô hình thuộc lớp so sánh của nó. DeepSeek V4 Flash 0731 (Reasoning, Max Effort) — mô hình mà nó liên tục bị đem ra so sánh với — đạt 35 điểm và xếp thứ chín. Đó không phải là sự ngang bằng; đó là mức dẫn trước năm điểm của mô hình nhỏ hơn. Đây cũng là bảng điểm độc lập, toàn diện đầu tiên đánh giá một mô hình mà cho đến tháng này, những con số được công bố duy nhất vẫn thuộc về chính nhà cung cấp. Bản thân mô hình không phải là mới: các trọng số đã được đăng trực tuyến trên Hugging Face vào ngày 24 tháng 8 và bản phát hành chính thức trên ModelScope đã ra mắt vào ngày 26 tháng 8. Điều đã thay đổi trong tháng này là người đọc giờ đây có thể kiểm chứng các tuyên bố thay vì phải tin vào chúng.

Lời nhắc xem lại bài đăng này đến từ @teortaxesTex trên X, người đã hỏi liệu bản xem trước có đang âm thầm bị đánh giá thấp hay không: được cho là nằm cùng bậc Artificial Analysis với DeepSeek V4 Flash 0731, "nhỏ hơn gần 4 lần", với "số tham số hoạt động ít hơn gần 3 lần". Hai trong ba khẳng định đó không đứng vững khi đối chiếu với dữ liệu đã công bố — và sự đính chính này lại có lợi cho mô hình, vì ở những con số quan trọng, bản xem trước vượt trội so với đối tượng so sánh, chứ không ngang bằng với nó.

Bắt đầu với kích thước, nơi các con số rõ ràng không gây tranh cãi. Qwen3.8-Flash-Next lưu trữ khoảng 180B tham số — một phần thân mixture-of-experts 125B, một bảng embedding n-gram 51B riêng biệt, và khoảng 4B thuộc các lớp multi-token-prediction — và kích hoạt 6B trong số đó mỗi token. DeepSeek V4 Flash 0731 lưu trữ 284B và kích hoạt 13B. Đó là những con số trên thẻ mô hình của Qwen và tài liệu của DeepSeek, và chúng là những con số mà Artificial Analysis đưa trên cả hai trang mô hình. Các tỷ lệ mà chúng tạo ra là 1.6x trên tham số lưu trữ và 2.2x trên tham số kích hoạt. Đó là một câu chuyện hiệu quả thực sự, và đó là lý do kiến trúc này quan trọng — nhưng không phải 4x và không phải 3x. Chúng tôi không thể tìm thấy bất kỳ con số nào được công bố ở bất cứ đâu hỗ trợ các hệ số nhân lớn hơn. Nếu ý định là dấu chân bộ nhớ khi phục vụ thay vì số lượng tham số, thì con số đó cũng không được công bố.

Điều gì đã được công bố

Aliba​ba đã công bố kiến trúc Qwen4 trước khi công bố một mô hình Qwen4. Qwen3.8-Flash-Next — một mô hình hỗn hợp chuyên gia đa phương thức, trọng số mở, được xây dựng trên kiến trúc thế hệ tiếp theo sẽ làm nền tảng cho dòng Qwen4 — đã ra mắt theo hai bước: kho chính thức Qw​en/Qwen3.8-Flash-Next đã hoạt động trên Hugging Face vào ngày 24 tháng 8, hai ngày trước bản phát hành ModelScope mà đồng hồ đếm ngược teaser đã nhắm tới. Bản phát hành chính thức trên ModelScope đã diễn ra vào ngày 26 tháng 8 lúc 23:00 UTC+08:00, với biến thể Qwen3.8-Flash được phục vụ cũng được định giá cùng thời điểm. Tuyên bố nổi bật trên card, vốn đã lan truyền kể từ đó, là một mô hình kích hoạt 6B tham số mỗi token đánh bại Claude Opus 4.6 Max trên 8 trong 9 benchmark có thể so sánh trên bảng của chính Aliba​ba. Dòng Qwen4 đầy đủ, Aliba​ba vẫn nói, sẽ ra mắt sau.

Nếu bạn chưa theo dõi nhịp độ của Aliba​ba trong tháng này, thì điểm neo là Qwen3.8-Max — mẫu flagship 2,4 nghìn tỷ tham số được phát hành ngày 3 tháng 8 và được mã nguồn mở với tên Qwen3.8-2.4T-A95B chưa đầy hai tuần sau đó. Trọng số của Qwen3.8-Flash-Next được công bố chưa đầy một tháng sau đó. Cùng một phòng thí nghiệm đã phát hành mô hình trọng số mở 2,4 nghìn tỷ tham số giờ đang cung cấp kiến trúc cho thế hệ kế tiếp, trước cả khi mẫu flagship của thế hệ đó được đặt tên.

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

Phần đáng đọc lại chính là cách Alibaba tự định vị. Mô hình được mô tả là được xây dựng trên kiến trúc thế hệ tiếp theo “sẽ làm nền tảng cho dòng Qwen4 sắp ra mắt” — và nói rõ rằng nó không phải là Qwen4. Lý do Alibaba đưa ra là những thay đổi kiến trúc nên nằm trong tay cộng đồng trước khi dòng Qwen4 ra mắt, để các runtime, các phương pháp lượng tử hóa và các ứng dụng sẵn sàng khi sản phẩm thật được phát hành. Đó là một quan điểm tiếp thị, nhưng cũng là một cam kết kỹ thuật: xem trước phần khó trước, đưa cộng đồng cùng tham gia.

Những gì thẻ mô hình làm rõ, và những gì nó không làm rõ:

Đã xác nhận, theo thẻ mô hình chính thức: Qwen3.8-Flash-Next là mô hình trọng số mở (open-weight), đa phương thức, thuộc dạng hỗn hợp chuyên gia (mixture-of-experts) trên kiến trúc Qwen4 — thẻ mô hình gọi đây là "bản xem trước thử nghiệm của kiến trúc sẽ làm nền tảng cho Qwen4."

• Đã xác nhận, theo model card và cấu hình: hai thay đổi kiến trúc chính — Gated Delta Network (GDN) và Qwen Sparse Attention (QSA) — nằm trong một mô hình lai 48 lớp, chạy 36 lớp attention tuyến tính song song với 12 lớp full-attention.

• Đã xác nhận từ kho lưu trữ: tổng cộng 125B tham số với 6B được kích hoạt trên mỗi token (512 chuyên gia, 10 chuyên gia được định tuyến cộng thêm một chuyên gia dùng chung) — Artificial Analysis liệt kê 180B sau khi bảng nhúng n-gram 51B riêng biệt và các lớp MTP được tính vào — với ngữ cảnh gốc 262.144 token có thể mở rộng lên 1.000.000 theo Giấy phép Cộng đồng Qwen 1.0.

• Không còn ở tình trạng chưa được xác nhận: mô hình giờ đây đã được đánh giá độc lập, đến hai lần. Bảng của Alibaba vẫn là của chính nhà cung cấp và vẫn chưa được tái lập, nhưng nó không còn là bằng chứng duy nhất hiện có.

Các điểm số độc lập đầu tiên đã có — và chúng nói "dẫn trước", không phải "ngang bằng"

Artificial Analysis đã phát hành Intelligence Index v4.3 vào ngày 7 tháng 9, và việc chấm lại điểm chính là lý do khiến bất kỳ so sánh nào trong số này trở nên khả thi. Bản cập nhật v4.3 đã thay Terminal-Bench v2.1 bằng Terminal-Bench v4.0 khó hơn nhiều và đổi τ³-Banking lấy AutomationBench-AA, một benchmark quy trình công việc tác tử được xây dựng cùng Zapier trên một tập kiểm thử held-out riêng tư gồm 657 tác vụ. Tỷ trọng held-out riêng tư đã tăng lên 45%. Mục đích được nêu là ngăn các mô hình tiên phong thao túng chỉ số, và ảnh hưởng lên điểm số rất lớn: GPT-6 Astra và Claude Fable 5.1, hai cái tên dẫn đầu, đều đạt 53 điểm dù trước đó được chấm ở mức 60 mấy theo thang điểm cũ.

Điều đó quan trọng khi bạn đọc các con số của cộng đồng. Những con số "56 so với 52" được lan truyền cho Qwen3.8-Flash-Next và DeepSeek V4 Flash 0731 vào đầu tháng 9 được tính trên chỉ số trước v4.3; theo v4.3, cặp này ở mức 40 và 35. Đem một bộ số này so với bộ kia là đang so sánh hai bài kiểm tra khác nhau.

Trên chỉ số hiện tại, đây là cách hai mô hình thực sự so sánh với nhau trên các đánh giá của chính Artificial Analysis:

• Chỉ số Trí tuệ — Qwen3.8-Flash-Next 40 (thứ 5 trong số 113 trong cùng lớp) so với DeepSeek V4 Flash 0731 (Suy luận, Nỗ lực tối đa) 35 (thứ 9 trong số 113).

• Công việc tri thức dạng tác tử — AA-Briefcase 1587 so với 1259; GDPval-AA v2 1647 so với 1468; AutomationBench-AA 56% so với 54%.

• Terminal và lập trình — Terminal-Bench v4.0 25% so với 12%; SciCode 51% so với 50%.

• Suy luận tổng quát và khoa học — Humanity's Last Exam 38% so với 39%; CritPt 11% so với 17%; GDP.pdf 16% so với 11%; AA-LCR v1.1 80% so với 80%.

• Khả năng truy hồi thông tin thực tế so với sự bịa đặt — AA-Omniscience −10 so với −14, lợi thế bốn điểm cho bản xem trước Qwen.

• Giá — 0,15 USD mỗi triệu đầu vào / 0,47 USD mỗi triệu đầu ra so với 0,44 / 1,32; kết hợp 0,0882 USD mỗi triệu token so với 0,2298. Chi phí mỗi tác vụ Intelligence Index: 0,37 USD so với 0,22.

Tốc độ và độ trễ — 53 token đầu ra mỗi giây so với 210; thời gian đến token đầu tiên 2,80 giây so với 0,98 giây; phản hồi đầu-cuối 49,76 giây so với 12,88 giây; thời gian mỗi tác vụ 1.572,60 giây so với 221,65 giây.

• Mức sử dụng token — 108k token đầu ra mỗi tác vụ so với 62k, trong đó 72k là token suy luận so với 45k. Artificial Analysis gọi bản xem trước này là "rất dài dòng" và "chậm hơn mức trung bình."

• Ngữ cảnh và kích thước — 256k token so với 1,000k; tổng 180B / 6B hoạt động so với 284B / 13B.

Đọc cùng nhau, đó là một câu trả lời sắc bén hơn "cùng phân khúc". Qwen3.8-Flash-Next thắng trong lập luận về độ chính xác và hiệu quả trên gần như mọi trục mà Artificial Analysis đo lường — đây là mô hình có điểm số cao hơn, nhỏ hơn, và chi phí chỉ bằng khoảng một phần ba trên mỗi token. DeepSeek V4 Flash 0731 thắng thẳng trong lập luận về sản xuất: thông lượng gấp bốn lần, độ trễ đầu-cuối chỉ bằng một phần tư, thời gian thực tế cho mỗi tác vụ hoàn thành ít hơn bảy lần, và cửa sổ ngữ cảnh lớn gấp bốn lần. Và về chi phí cho mỗi tác vụ hoàn thành — con số đứng vững trước độ dài dòng token — Deep​Seek là mô hình rẻ hơn với $0.22 so với $0.37, bất chấp giá niêm yết cao hơn. Nếu "bị đánh giá thấp hơn thực tế" nghĩa là "tốt hơn danh tiếng của nó về chất lượng trên mỗi tham số", thì nhãn đó là hợp lý. Nếu nó nghĩa là "bạn nên chạy cái này thay vào đó", thì các cột tốc độ và độ trễ lại nói ngược lại.

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

Bên ngoài Artificial Analysis cũng có bằng chứng độc lập. Một bộ kiểm thử của bên thứ ba, smf-bench, đã công bố một lượt chạy “Official A” vào ngày 5 tháng 9: Qwen3.8-Flash-Next ở dạng lượng tử hóa NVFP4 của NVIDIA trên một DGX Spark duy nhất, tắt chế độ suy nghĩ, đạt 137 trên 157 (87,3%) với kết quả hoàn hảo 30 trên 30 ở phần lập trình, so với 117 trên 157 của một lượt chạy DeepSeek V4 Flash Vision-Exp trên hai Spark với cùng bộ kiểm thử gồm 157 bài. Đó là một bộ kiểm thử trên một lớp máy, và nó không thay thế cho một đánh giá toàn diện — nhưng nó là điểm dữ liệu thứ hai chỉ về cùng một hướng, và nó đến từ một người không có lợi ích gắn với nhà cung cấp nào trong hai bên.

Tôi không có thông tin cụ thể về kiến trúc "Qwen4" vì đây có thể là mô hình chưa được công bố hoặc nằm ngoài phạm vi kiến thức của tôi. Nếu bạn muốn tìm hiểu về kiến trúc của các mô hình Qwen đã phát hành, tôi khuyên bạn nên tham khảo tài liệu chính thức từ nhóm Qwen hoặc các bài viết kỹ thuật đã được xác minh.

Hai cơ chế làm nên câu chuyện. Cơ chế đầu tiên, GDN — Gated Delta Network — là lớp linear-attention của Aliba​ba. Trong khi một transformer tiêu chuẩn giữ bộ nhớ đệm key-value tăng theo độ dài chuỗi, thì một lớp GDN duy trì trạng thái hồi quy có kích thước cố định và cập nhật nó bằng một quy tắc cổng được học; nguồn gốc của nó bắt nguồn từ DeltaNet và Mamba-2. Lợi ích là thứ đã âm thầm vận hành dòng Qw​en kể từ Qwen3-Next: các ngữ cảnh dài vẫn rẻ vì trạng thái không tăng, trong khi một số ít lớp full-attention vẫn nằm trong hỗn hợp để thực hiện việc truy xuất chính xác mà linear attention làm kém. Trong thế hệ hiện tại, tỷ lệ đó vào khoảng ba lớp GDN cho mỗi lớp full-attention — phân tích cộng đồng về checkpoint Qwen3.8-2.4T-A95B đếm được 69 lớp GDN so với 23 lớp attention. Qwen3.8-Flash-Next cho thấy tỷ lệ chia ba-một tương tự: 36 lớp linear-attention so với 12 lớp full-attention.

Thứ hai, QSA — Qw​en Sparse Attention — là phần thực sự mới, và mô tả công khai về nó vẫn còn mỏng: thẻ mô hình nói thêm rằng nó hoạt động ở cấp vi khối với ngân sách 512 khối / 2048 token, nhưng chưa có bài viết kỹ thuật đầy đủ nào. Sự khan hiếm chi tiết đó tự nó là một phần của mô thức. Bản xem trước Qwen3-Next vào cuối năm 2025 đã giới thiệu Gated DeltaNet với tài liệu mỏng tương tự, và kiến trúc chỉ được đặc tả đầy đủ sau khi dòng Qwe​n3.5 áp dụng nó. Đối với người đọc, điểm rút ra thực tế là như nhau trong cả hai lần: canary kiến trúc xuất hiện trước, còn tài liệu và các mô hình sản xuất xuất hiện sau.

Kịch bản đã từng thành công một lần

Aliba​ba đã từng thực hiện đúng nước đi này trước đây, và nó đã hiệu quả. Vào cuối năm 2025, Qwen3-Next đã giới thiệu trước Gated DeltaNet và một dạng kết hợp giữa attention tuyến tính và attention đầy đủ. Khi dòng Qwe​n3.5 được phát hành, nó đã áp dụng bản thiết kế đó ở quy mô lớn — và dạng kết hợp này đã được duy trì xuyên suốt thế hệ Qwen3.8 kể từ đó, bao gồm cả mẫu chủ lực 2.4T. Lý do tiền lệ này quan trọng ở đây nằm ở thời điểm mà nó ngụ ý. Toàn bộ dòng Qwen4 nên được kỳ vọng sẽ nằm ở phía bên kia của bản xem trước này, chứ không phải bên trong nó; nếu khoảng cách của Qwen3-Next là một chỉ dấu, thì khoảng cách giữa "đây là kiến trúc" và "đây là dòng sản phẩm" được đo bằng nhiều tháng. Không có gì trong model card xác nhận điều đó — đây là một suy luận từ một mô thức mà Aliba​ba đã thực hiện hai lần.

Những gì chúng ta vẫn chưa biết

Những điều chưa biết đã thu hẹp lại, nhưng chúng vẫn chưa biến mất:

• Bảng benchmark của nhà cung cấp vẫn là của nhà cung cấp. Artificial Analysis giờ đã chấm điểm mô hình một cách độc lập, điều này giải quyết khoảng trống lớn nhất trong đưa tin về đợt ra mắt — nhưng tuyên bố hàng đầu của chính Aliba​ba, rằng mô hình vượt qua Claude Opus 4.6 Max trên 8 trong 9 benchmark có thể so sánh được, lại dựa trên các đánh giá nội bộ của chính Aliba​ba (CoWorkBench, JobBench, AndroidWorld) cùng với các bài công khai, và không bài nào trong số đó được bên thứ ba tái lập.

• Liệu bản xem trước có phải là cùng một mô hình với bản được phục vụ hay không. Thẻ này định vị Qwen3.8-Flash-Next là bản xem trước thử nghiệm trọng số mở, trong khi biến thể được phục vụ trong môi trường sản xuất — Qwen3.8-Flash của Qwen Cloud — bổ sung ngữ cảnh mặc định 1.000.000 token và các công cụ tích hợp sẵn. Liệu mô hình được phục vụ đó có cùng kiến trúc dưới một cửa sổ ngữ cảnh lớn hơn hay không thì vẫn chưa được nêu rõ, và các điểm số độc lập ở trên là dành cho bản xem trước trọng số mở, chứ không phải mô hình API được phục vụ.

• Giấy phép đã được biết đến và là một giấy phép thực sự: Qwen Community License 1.0 cho phép sử dụng thương mại, bao gồm bán các tác phẩm phái sinh, nhưng yêu cầu một thỏa thuận thương mại riêng với Alibaba nếu bạn điều hành một doanh nghiệp Model-as-a-Service hoặc trợ lý công việc AI vượt qua một ngưỡng doanh thu và người dùng hoạt động hàng tháng được xác định. Giấy phép này không giống với giấy phép Qwen3.8-Max giới hạn theo doanh thu, nhưng nó đáng để đọc trước khi xây dựng dựa trên các trọng số.

• Một báo cáo thực địa đáng để lưu ý: bài viết ngày 6 tháng 9 về bản dựng NVFP4 cộng đồng ghi nhận lỗi gọi công cụ bị ràng buộc ngữ pháp khi cả tính năng thinking và dự đoán nhiều token đều được bật, được truy vết tới nhánh giải mã có ràng buộc của xgrammar. Đó là lỗi runtime trong một bản dựng cộng đồng đã lượng tử hóa chứ không phải thuộc tính của mô hình — nhưng nếu harness đánh giá của bạn dựa nhiều vào các lệnh gọi công cụ bị ràng buộc ngữ pháp, thì đây là thứ đầu tiên cần kiểm tra.

Một gia đình làm việc theo chu kỳ hai tuần

Nhịp độ xung quanh ấy tự nó đã là một câu chuyện. Qwen3.8-Max, mẫu chủ lực 2,4 nghìn tỷ tham số, ra mắt ngày 3 tháng 8; bản trọng số mở Qwen3.8-2.4T-A95B tiếp nối vào ngày 12–13 tháng 8; bản Apache-2.0 miễn phí Qwen3.8-27B có mặt vài ngày sau đó; và giờ đây, trước khi tháng này kết thúc, kiến trúc của thế hệ kế tiếp đang được giới thiệu trước — rồi được đánh giá độc lập một tuần sau. Hiện không có phòng thí nghiệm nào khác đang lặp vòng phát triển với nhịp độ này. Với người đọc đang chọn mô hình, hệ quả thực tế là "Qwen tốt nhất" là một mục tiêu luôn dịch chuyển — và khoảng cách giữa các thế hệ đang đến nhanh hơn mức hệ sinh thái xung quanh thường thích ứng. Mua một quyết định thay vì mua một mô hình ngày càng là nước đi dễ biện minh.

Một lập trình viên nên làm gì bây giờ?

Các con số về hiệu quả thay đổi bài toán cân nhắc phục vụ cục bộ nhiều hơn cả bản thân buổi ra mắt. Một mô hình 6B tham số hoạt động, đạt 40 điểm trên chỉ số hiện hành, là mô hình có thể nén được: lượng tử hóa NVFP4 chính thức của NVIDIA là bản mà lần chạy smf-bench ngày 5 tháng 9 đã dùng, và các bản dựng NVFP4 cùng FP8 do cộng đồng tạo ra ngoài bản đó đã lưu hành, và chính điều này mới khiến việc triển khai một mô hình lưu trữ 180B trên hạng máy một GPU trở nên khả thi. Lưu ý vẫn không đổi — đây là một bản xem trước chưa được kiểm chứng, bảng số liệu của nhà cung cấp chưa được tái lập, và hình dạng của các điểm số độc lập (mạnh ở công việc tri thức và các tác vụ terminal, yếu hơn ở việc sinh repo tầm xa và tỷ lệ đạt của agent trong một lần thử) nghĩa là điểm yếu của mô hình xuất hiện đúng ở nơi những thay đổi mã nguồn sản xuất diễn ra. Hãy chạy thử một bản sao ít rủi ro của một khối lượng công việc thực tế trước khi nó chạm vào bất cứ thứ gì quan trọng, và để cơ chế chuyển đổi dự phòng tự động hấp thụ những lúc một bản xem trước cư xử sai.

Về giá, bức tranh còn mờ mịt khi ra mắt nay đã rõ ràng. Artificial Analysis niêm yết mức giá phục vụ của bản xem trước là 0,15 USD cho mỗi triệu token đầu vào và 0,47 USD cho mỗi triệu token đầu ra, so với 0,44 USD và 1,32 USD của DeepSeek V4 Flash 0731 — cùng bậc độ lớn với biến thể Qwen3.8-Flash được phục vụ, mà Qw​en Cloud niêm yết ở mức ¥1 và ¥3 (khoảng 0,16 USD và 0,47 USD). Biến thể production là bản bạn thực sự có thể gọi hôm nay: nó được định tuyến ở đây dưới dạng qwen/qwen3.8-flash, và OrcaRouter chuyển tiếp giá niêm yết của nhà cung cấp với mức markup 0%, nên khi Aliba​ba thay đổi con số đó, endpoint cũng thay đổi theo trong cùng ngày. Điều tương tự cũng đúng với mô hình so sánh trong bài này — DeepSeek V4 Flash 0731 được định tuyến dưới dạng deepseek/deepseek-v4-flash-0731 ở mức giá niêm yết của nhà cung cấp, khiến phần chi phí trên mỗi token của màn so sánh ở trên có thể kiểm chứng dựa trên lưu lượng của chính bạn thay vì dựa trên số token của một benchmark. Thứ không được định tuyến ở đây là chính bản xem trước Flash-Next trọng số mở: để dùng nó hôm nay, bạn phải tải trọng số về và tự phục vụ, đó chính là lý do câu chuyện lượng tử hóa ở trên quan trọng hơn giá niêm yết. Mức trần mà thế hệ này phải vượt qua vẫn hiển thị trên cùng endpoint: Qwen3.8-Max (qwen/qwen3.8-max) ở mức 2,00 USD mỗi triệu token đầu vào và 6,00 USD mỗi triệu token đầu ra, cũng được chuyển tiếp theo giá niêm yết của nhà cung cấp.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

Trình tự thực tế không thay đổi nhiều, nhưng mức độ tin cậy đằng sau nó thì có. Nếu bạn muốn biến thể production được phục vụ mà không phải tải 100GB trọng số, Qwen3.8-Flash đã có thể gọi được ở mức giá niêm yết. Nếu bạn muốn kiến trúc — GDN, QSA, bảng n-gram, các thủ thuật offload — thì trọng số có thể tải về và các runtime đã sẵn sàng: vLLM phục vụ nó ngay từ ngày đầu tiên với một đường offload giữ bảng nhúng n-gram 51 tỷ tham số trong bộ nhớ máy chủ thay vì VRAM thường trú, SGLang và TensorRT-LLM nằm trong danh sách Day 0 của NVIDIA, và thư viện của Ollama có bản build MLX mà bạn có thể tải trên Apple Silicon. Điều duy nhất cần dừng lại là coi mô hình này là một ẩn số về chất lượng. Nó đã được đo lường rồi, và kết quả đo rất tốt.

Xem gì tiếp theo

• Liệu các con số độc lập có còn đứng vững khi chỉ số trưởng thành hay không. Con số 40 của Qwen3.8-Flash-Next đi kèm với một hóa đơn token cao bất thường — nó đốt 245M token trong lần chạy chỉ số, so với mức trung vị 140M — và ghi chú của chính Artificial Analysis gọi nó là "cực kỳ dài dòng". Một điểm số tạo ra bằng cách suy luận lâu hơn vẫn là một điểm số, nhưng đó là kiểu thứ sẽ dịch chuyển khi cách đánh giá thay đổi. Bản cập nhật chỉ số tiếp theo mới là phép thử thực sự để biết liệu 40 là một đẳng cấp hay chỉ là một cực đại cục bộ.

• Liệu Qwen3.8-Flash được phục vụ có được chấm điểm riêng hay không. Mọi con số độc lập trong bài này đều dành cho bản xem trước trọng số mở. Biến thể sản xuất với ngữ cảnh 1M và các công cụ tích hợp sẵn không có điểm số độc lập của riêng nó, và nếu đó là cùng một kiến trúc dưới ngữ cảnh dài hơn, thì đấy là một đánh giá rẻ mà ai đó nên công bố.

• Khả năng hỗ trợ serving day-0 trụ vững trong thực tế đến đâu — các con số thông lượng GB300 do nhà cung cấp công bố vẫn chỉ là do nhà cung cấp tự công bố, và các cấu hình TP4 expert-parallel cùng KV-offload vẫn còn đủ mới để dễ mong manh.

• Alibaba sẽ chờ bao lâu trước khi toàn bộ dòng Qwen4 ra mắt sau bản xem trước.

Phần "những gì chúng ta biết đến nay" của câu chuyện này giờ đây phần lớn đã khép lại. Bảng thông số đã công khai, trọng số có thể tải xuống, kiến trúc đã được xác nhận, biến thể Qwen3.8-Flash được phục vụ đang hoạt động trên các API lưu trữ với mức giá niêm yết, và mô hình đã được hai bên độc lập chấm điểm — trong đó mô hình nhỏ hơn thắng về chất lượng còn mô hình lớn hơn thắng về thông lượng. Điều còn bỏ ngỏ là liệu một bản xem trước 6B-active có tổng quát hóa vượt ra ngoài các benchmark mà nó được tinh chỉnh dựa trên hay không, và Alibaba sẽ chờ bao lâu trước khi gia đình Qwen4 đầy đủ tiếp bước. Câu hỏi cuối cùng đó vẫn là điều mà bản phát hành để ngỏ, và nó vẫn là điều sẽ quan trọng nhất.

So sánh trong bài viết này3

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày