Thẻ tiêu đề hero cho 'Qwen3.8-Max vs Qwen 3.8' với phụ đề {{1}}Một lõi 2.4T — API cho thuê hoặc trọng số mở{{/1}}, huy hiệu cho {{2}}bản làm mới 0902 ngày 2 tháng 9 năm 2026{{/2}}, {{3}}API lưu trữ ở mức $2/$6 mỗi 1 triệu token{{/3}} và {{4}}trọng số mở ngày 12 tháng 8{{/4}}, cùng chân trang ghi chú rằng {{5}}Code Arena WebDev độc lập đứng #1 với 1.691 điểm cho bản dựng 0902{{/5}} và {{6}}checkpoint mở chưa có bất kỳ điểm số độc lập nào{{/6}}.
Guides & Insights

Qwen3.8-Max so với Qwen 3.8: Một lõi 2.4T, Thuê hay Tự chạy — Sau bản cập nhật 0902

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Ngày 2 tháng 9 năm 2026, Alibaba đã phát hành một bản cập nhật gắn ngày của Qwen3.8-Max — bản dựng mà họđặt tên là Qwen3.8-Max-0902 — và một bảng xếp hạng lập trình độc lập đã xếp bản mới này ở vị trí số 1 ngay trong tuần đó. Phiên bản tải xuống của chính lõi 2,4 nghìn tỷ tham số này, mô hình mà hầu hết mọi người muốn nói đến khi viết "Qwen 3.8" mà không kèm hậu tố, vẫn đang dừng ở checkpoint ngày 12 tháng 8: chỉ hỗ trợ văn bản, suy luận bị khóa ở chế độ bật, và thiếu hàng trăm gigabyte để có thể chạy trên bất cứ thứ gì nhỏ hơn một dàn GPU. Khoảng cách giữa bản chủ lực trực tuyến và bản trọng số mở đã không tồn tại vào tháng 8. Giờ đây nó là toàn bộ phép so sánh, và đó là lý do vì sao cùng một mô hình tiếp tục được bán cho bạn dưới hai cái tên.

Qwen3.8-Max là mô hình chủ lực được lưu trữ bởi Alibaba: một mô hình mixture-of-experts thưa với 2,4 nghìn tỷ tham số, khoảng 95 tỷ tham số hoạt động trên mỗi token, có mặt trên API tính phí từ ngày 3 tháng 8 và mang cửa sổ ngữ cảnh đa phương thức 1 triệu token. Qwen 3.8, khi được xem như một cái tên độc lập, là bản phát hành mở của cùng thế hệ — đáng chú ý nhất là Qwen3.8-2.4T-A95B, bộ trọng số Alibaba công bố vào ngày 12 tháng 8 theo giấy phép tùy chỉnh. Chúng không phải là một bản rẻ hơn và một bản cao cấp hơn. Chúng là cùng một bộ não được bán theo hai cách, và một đợt huấn luyện bổ sung vào tháng 9 đã bắt đầu tạo ra sự khác biệt giữa hai phiên bản. Bài viết này làm rõ bạn đang thực sự xem “Qwen 3.8” nào, bản làm mới 0902 đã thay đổi điều gì, và con đường nào — thuê API hay tự chạy bộ trọng số — bạn nên đi ngay hôm nay.

Cặp đấu không phải là sự kình địch

Trước khi nói đến các ngày và biểu giá, kiến trúc: Qwen3.8-Max và Qwen3.8-2.4T-A95B dùng chung thiết kế MoE hạt mịn với 512 chuyên gia mỗi tầng (10 được định tuyến cộng một dùng chung, tính cho mỗi tầng), 92 tầng, và một ngăn xếp lai trong đó 69 trên 92 tầng sử dụng chú ý tuyến tính — Gated DeltaNet kết hợp với gated attention — với full attention được xen kẽ cho các tác vụ ngữ cảnh dài. Đó là lý do bảng thông số mô hình có thể tuyên bố ngữ cảnh triệu token trên API và vì sao bản mở đạt chiều dài tự nhiên 262K, có thể mở rộng tới một triệu với cấu hình phục vụ phù hợp. Sự khác biệt giữa hai tên gọi không nằm ở kiến trúc trọng số; chúng nằm ở các ranh giới, và các ranh giới đã dịch chuyển kể từ ngày 2 tháng 9.

• Tham số — Qwen3.8-Max: 2.4T tổng / ~95B hoạt động, MoE. Qwen3.8-2.4T-A95B: cùng lõi, cùng số lượng hoạt động.

• Phân phối — Qwen3.8-Max: API được lưu trữ, hoạt động từ ngày 3 tháng 8, được cập nhật thành Qwen3.8-Max-0902 vào ngày 2 tháng 9. Qwen3.8-2.4T-A95B: trọng số có thể tải xuống, được xuất bản lần đầu vào ngày 12 tháng 8, không có checkpoint mới hơn kể từ đó.

• Phương thức — Qwen3.8-Max: đầu vào văn bản, hình ảnh và video. Qwen3.8-2.4T-A95B: chỉ văn bản.

• Kiểm soát suy luận — Qwen3.8-Max: bật/tắt chế độ suy luận, bao gồm chế độ không suy luận. Qwen3.8-2.4T-A95B: chế độ suy luận luôn bật, chỉ có núm chỉnh mức độ suy luận (thấp / cao / cực cao).

• Công cụ — Qwen3.8-Max: gọi hàm gốc, năm công cụ tích hợp sẵn và đầu ra có cấu trúc. Qwen3.8-2.4T-A95B: không có lớp công cụ gốc; những gì bạn nhận được phụ thuộc vào khung suy luận mà bạn dùng để phục vụ nó.

Những gì bản cập nhật ngày 2 tháng 9 đã thay đổi

Bản build 0902 là một vòng post-training bổ sung, không phải một kiến trúc mới. Alibaba đã nhắm nó vào đúng hai điểm mà Qwen3.8-Max vốn đã nổi tiếng — lập trình và "cowork", thuật ngữ của hãng dành cho các tác vụ agentic tầm xa cũng như công việc văn phòng — và những con số đi kèm bản build này chính là lý do khiến bản refresh này đáng được quan tâm. Trên bảng xếp hạng Code Arena: WebDev độc lập, Qwen3.8-Max-0902 ra mắt với 1.691 Elo, tăng 22 điểm so với bản build trước, đủ để giành vị trí số một ngay từ lần đầu góp mặt. Alibaba cũng mô tả đây là mô hình đạt điểm cao nhất trên đường biên Pareto chi phí–hiệu suất của bảng xếp hạng đó, với mức giá pha trộn khoảng 5 USD mỗi triệu token — mức giá niêm yết 2 USD và 6 USD được tính theo trọng số lưu lượng agentic nặng về đầu ra — tức chỉ bằng khoảng một phần tư chi phí cho một lượt gọi mô hình frontier tương đương ở những nơi khác. Các con số này là một sự kết hợp mà người đọc cần phân biệt rõ: 1.691 Elo là kết quả từ một arena độc lập; còn cách diễn giải đường biên Pareto là sự tự mô tả của Alibaba về chính bảng xếp hạng độc lập đó.

Các đánh giá nội bộ của Alibaba cho bản 0902, do nhà cung cấp báo cáo và chưa được tái lập, cho thấy cùng một hướng: Terminal-Bench 3.0 tăng từ 11.3 lên 29.0, ProgramBench từ 10.5 lên 28.0, JobBench từ 53.4 lên 64.0, và WorkArena Elo từ 1,348 lên 1,468. Hãy hiểu những con số đó là "bản cập nhật đã dịch chuyển các trục tác nhân và lập trình," chứ không phải là các điểm số đã được xác minh. Về phía trí tuệ tổng quát, Chỉ số Trí tuệ của Artificial Analysis xếp Qwen3.8-Max ở mức 56 — có sức cạnh tranh, nhưng không phải là lý do để chọn nó; các kết quả về lập trình và tác nhân mới là lý do.

Phần mà hầu hết các bài đưa tin đã bỏ sót là bản post-training 0902, tính đến thời điểm viết bài này, chỉ có trên API. Alibaba chưa công bố checkpoint mở nào cho mô hình được làm mới — các trọng số Qwen3.8-2.4T-A95B trên Hugging Face vẫn thuộc về bản phát hành ngày 12 tháng 8. Điều đó có nghĩa là Qwen3.8-Max được lưu trữ và phần lõi có thể tải về không còn là cùng một mô hình như hồi giữa tháng 8 nữa. API có bản post-training tháng 9; còn các trọng số thì không. Nếu toàn bộ lý do bạn chạy bản phát hành mở là để tái tạo chính xác những gì mô hình chủ lực làm, thì giả định đó đã âm thầm không còn đúng kể từ ngày 2 tháng 9.

A comparison scoreboard for Qwen3.8-Max (0902) and Qwen 3.8 (2.4T-A95B open): left column shows Hosted API with a Sep-2 build tag, Text + image + video, 1M native context, a thinking toggle including off, native tools and JSON, and $2/$6 per 1M with a $0.25 cache tag; right column shows Open weights with an Aug-12 tag, Text only, 262K native context, thinking always on, framework-level tools and JSON, and weights plus your own GPUs; the footer notes independent Code Arena WebDev 1,691 and AA Index 56 for the Max, and that the open checkpoint has no independent scores yet.

Năm điểm mà họ thực sự khác biệt

Nếu gác kiến trúc dùng chung sang một bên, những khác biệt thực tế sẽ hiện ra rất rõ ràng. Phương thức dữ liệu là bộ lọc đầu tiên: nếu tác vụ của bạn bao gồm hình ảnh hoặc video — ảnh chụp màn hình, biểu đồ, tài liệu có hình minh họa, khung hình video — chỉ Qwen3.8-Max tiếp nhận được chúng, và cửa sổ 1 triệu token của nó là thuần bản địa chứ không phải phần mở rộng. Bản trọng số mở chỉ xử lý văn bản. Bộ lọc thứ hai là kiểm soát suy luận: API lưu trữ có thể chạy ở chế độ tắt suy nghĩ, điều rất quan trọng đối với các tác vụ trích xuất khối lượng lớn nhạy cảm với độ trễ, nơi một chuỗi suy nghĩ chỉ là chi phí phụ thuần túy; còn bản mở thì không thể tắt nó. Bộ lọc thứ ba là công cụ: gọi hàm, năm công cụ tích hợp sẵn và chế độ JSON là một phần của sản phẩm lưu trữ, còn bản mở phụ thuộc vào bất cứ thứ gì mà lớp phục vụ của bạn cung cấp.

Ngữ cảnh tinh tế hơn những gì bảng thông số thể hiện. Cả hai phía đều có thể đạt tới khoảng một triệu token, nhưng mô hình lưu trữ (hosted model) làm điều đó một cách tự nhiên với đầu vào đa phương thức, trong khi bản mã nguồn mở có ngữ cảnh gốc 262K phải được mở rộng thông qua cấu hình, và mọi token trong cửa sổ mở rộng đó đều là văn bản. Giới hạn đầu ra cũng khác nhau — API cho phép tối đa khoảng 131K token đầu ra, còn bản mã nguồn mở thường được cấu hình với trần tương tự, nhưng giới hạn thực tế ở phía mã nguồn mở được quyết định bởi hạ tầng phục vụ (serving stack) của bạn, không phải bởi mô hình.

Chi phí thực tế của từng tuyến đường

Đây là điểm mà hai bản phân phối này không còn gì để so sánh với nhau nữa. Qwen3.8-Max có giá niêm yết: $2.00 cho mỗi triệu token đầu vào, $6.00 cho mỗi triệu token đầu ra và $0.25 cho mỗi triệu token đầu vào được phục vụ từ cache. Vì OrcaRouter truyền thẳng giá niêm yết của nhà cung cấp với mức phụ giá 0%, nên đó chính là mức giá bạn phải trả tại đây; và khi Alibaba thay đổi, con số mới sẽ có hiệu lực ngay trong ngày hôm đó. Bản snapshot 0902 được ghim riêng với định danh qwen/qwen3.8-max-0902 dành cho các đội muốn hành vi có thể tái lập — cùng mức giá, cùng khả năng, nhưng là một checkpoint cố định thay vì mô hình cập nhật liên tục. Trên traffic của OrcaRouter, thời gian trung vị từ lúc gửi yêu cầu đến token đầu tiên trong 7 ngày của Qwen3.8-Max là khoảng 2–4 giây, và Artificial Analysis đo được khoảng 45–48 token đầu ra mỗi giây: không chậm, nhưng khá dài dòng — đó là lý do vì sao các tác vụ agentic chạy trên mô hình này có thể tiêu tốn lượng token đáng ngạc nhiên dù giá rẻ.

A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the flagship description, the price card at $2.00 per 1M input and $6.00 per 1M output tokens, a 1,000,000-token context window, and 7-day median time-to-first-token and traffic figures.

Qwen3.8-2.4T-A95B không có giá niêm yết, vì cái giá phải trả chính là hạ tầng của bạn. Trọng số BF16 chiếm khoảng 4,9 TB và ngay cả bản dựng FP8 chính thức cũng vào khoảng 2,4 TB, nên đây là phần cứng quy mô rack: các cấu hình serving nhỏ nhất được ghi nhận bắt đầu từ khoảng tám GPU B300 hoặc GB300, và một rack GB300 NVL72 đầy đủ là phương án triển khai tham chiếu. Lượng tử hóa mạnh tay làm thay đổi ngưỡng tối thiểu — bản dựng NVFP4 nằm gọn trong khoảng 1,3 TB, còn lượng tử hóa phân lớp 1-bit của Unsloth nén mô hình xuống còn khoảng 397 GB, chính điều này cuối cùng khiến một node đơn lẻ được trang bị tốt trở nên khả thi — nhưng mọi hướng đi trong số đó đều giả định bạn vận hành GPU ở quy mô trung tâm dữ liệu. Các nhà cung cấp bên thứ ba phục vụ checkpoint mở sẽ bán token cho bạn với giá thấp hơn giá mỗi token của Max, nhưng đổi lại bạn từ bỏ đầu vào đa phương thức, chế độ không suy luận, bộ công cụ gốc và quá trình hậu huấn luyện 0902; và chưa có một điểm chuẩn độc lập nào về chính checkpoint có thể tải về đó được công bố. Thẻ mô hình của chính Alibaba cũng thẳng thắn về mối quan hệ này: họ mô tả Qwen3.8-Max là phiên bản chính thức được xây dựng dựa trên Qwen3.8-2.4T-A95B, bổ sung đầu vào thị giác, hỗ trợ chế độ không suy luận, ngữ cảnh mặc định 1M và các công cụ tích hợp bên trên lõi mở.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-2.4T-A95B, showing the Text Generation and Transformers tags and the card text explaining that Qwen3.8-Max is the official version built on Qwen3.8-2.4T-A95B with vision input, non-thinking support, a 1M default context, and built-in tools.

Số liệu độc lập so với tuyên bố của nhà cung cấp

Tính trung thực của nguồn thông tin ở đây quan trọng hơn trong hầu hết các cuộc so sánh, vì hai bên có độ tuổi bằng chứng rất khác nhau. Qwen3.8-Max đã được chấm điểm độc lập: kết quả Code Arena: WebDev 1.691 cho bản dựng 0902 và chỉ số Intelligence Index 56 của Artificial Analysis là các phép đo của bên thứ ba, và mức giá khiến tuyên bố về đường biên Pareto trở nên đáng chú ý là một bảng giá đã được công bố. Qwen3.8-2.4T-A95B chưa có được điều đó — bảng benchmark mà Alibaba công bố mô tả lõi lớp Max, chứ không phải một lần chạy độc lập trên bản checkpoint có thể tải về, nên phía mã nguồn mở của sự so sánh này phần lớn vẫn chỉ là "nhà cung cấp nói lõi đạt điểm như thế này." Nếu bạn đang quyết định giữa chúng dựa trên năng lực, hãy coi những con số nổi bật của bộ trọng số mở chỉ là tuyên bố cho đến khi bên thứ ba chạy thử chúng.

Ai nên chọn cái nào

Quyết định xuất phát từ danh sách trên. Hãy chọn bản hosted của Qwen3.8-Max — hôm nay, cụ thể là bản build 0902 — khi bạn cần bản post-training tháng 9, khả năng nhận đầu vào hình ảnh hoặc video, chế độ không suy luận, công cụ native và đầu ra có cấu trúc, hoặc cửa sổ ngữ cảnh triệu token mà không cần tự dựng hạ tầng. Đó là vị thế tiên phong về lập trình và agentic, và với mức giá $2/$6 cùng $0.25 cho đầu vào được cache, nó được định giá rất cạnh tranh so với những gì nó mang lại.

Chọn Qwen3.8-2.4T-A95B khi kiểm soát quan trọng hơn sự tiện lợi: bạn cần các bộ trọng số trên phần cứng của riêng mình hoặc một nhà cung cấp bạn đã vận hành, bạn muốn một checkpoint cố định có thể kiểm toán và tái tạo lại, hoặc khối lượng sử dụng ổn định của bạn khiến chi phí trên mỗi token trở thành yếu tố chi phối và bạn sẵn sàng vận hành một MoE 2.4T. Chấp nhận danh sách đánh đổi — chỉ văn bản, luôn bật chế độ suy luận, không có công cụ gốc, chưa có quá trình hậu huấn luyện 0902 — và xác minh các điều khoản giấy phép cho nhóm doanh thu của bạn, vì giấy phép tùy chỉnh Qwen3.8-Max không phải Apache 2.0 và bổ sung các điều kiện dành cho các nhà khai thác thương mại lớn.

Nếu khối lượng công việc của bạn yêu cầu thông lượng cao, chạy trên một GPU duy nhất, hoặc nhạy cảm với độ trễ, thì cả hai đều có thể không phải là làn đường phù hợp — phiên bản anh em 27 tỷ tham số của thế hệ này, Qwen3.8-27B, mới là phiên bản được thiết kế cho nhu cầu đó, và nó được trình bày riêng trong bài so sánh Qwen3.8-27B vs Qwen3.8-Max của chúng tôi.

Cách thử cả hai mà không phải cược hết số vốn của bạn

Cách gọn gàng nhất để đưa ra quyết định này là chạy thử cả hai phía trên các prompt của chính bạn — và đây chính là lúc một tầng định tuyến chứng tỏ được giá trị của nó, thay vì chỉ được lắp thêm vào như một giải pháp vá víu. Qwen3.8-Max và bản snapshot Qwen3.8-Max-0902 được ghim đều nằm sau một endpoint tương thích OpenAI trên OrcaRouter, nên việc chuyển đổi giữa bản flagship cập nhật liên tục và checkpoint tái lập được chỉ là thay đổi model-id, chứ không phải triển khai lại. Khi một nhóm quyết định đưa open weights về tự vận hành nội bộ, DSL định tuyến có thể đứng trước một endpoint vLLM hoặc SGLang tự lưu trữ đang phục vụ Qwen3.8-2.4T-A95B và đặt nó vào cùng một call graph — lưu lượng lớn dồn về hạ tầng tự triển khai của bạn, còn các prompt khó và yêu cầu đa phương thức được chuyển sang Qwen3.8-Max bản hosted, với khả năng failover tự động giữa chúng. Thử một checkpoint mới theo cách đó chỉ tốn một lần thay đổi cấu hình chứ không phải một cuộc di trú — điều bạn thực sự cần khi hai phía của phép so sánh này vẫn đang chuyển động với những tốc độ khác nhau.

Điểm mấu chốt

Qwen3.8-Max và Qwen 3.8 không phải là hai mô hình đang cạnh tranh cho cùng một vai trò. Chúng là một lõi duy nhất có 2,4 nghìn tỷ tham số, được cung cấp dưới dạng API thuê bao lẫn bộ trọng số tải về, và bản làm mới ngày 2 tháng 9 đã khiến hai kênh cung cấp này mang những ý nghĩa khác nhau. Thuê API, bạn nhận được bản post-training 0902 — bản đã giành vị trí dẫn đầu Code Arena: WebDev — cùng với vision, chế độ non-thinking, hệ công cụ native và cửa sổ ngữ cảnh native 1 triệu token, với giá $2/$6 và $0,25 cho input được lưu cache. Còn nếu chạy bộ trọng số mở, bạn có cùng kiến trúc ấy nhưng bị đóng băng ở trạng thái ngày 12 tháng 8 — chỉ văn bản, reasoning khóa chặt — chưa có điểm số độc lập nào, và kèm theo là hóa đơn phần cứng trung tâm dữ liệu. Nếu những lợi ích về coding và agentic của tháng 9 quan trọng với bạn, thì hôm nay chỉ một trong hai cái tên có được chúng. Nếu việc kiểm soát tái lập quan trọng hơn, thì chỉ một trong hai cái tên là của riêng bạn để nắm giữ.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày