Thẻ tiêu đề hero cho 'Qwen3.8-Max vs Qwen3.7-Max' với phụ đề 'Hai bậc Max, 16 điểm chỉ số, và một chương trình khuyến mãi đảo ngược giá', cùng chân trang ghi chú rằng số liệu của Qwen3.8-Max đến từ công bố ngày 22 tháng 9 năm 2026 của Alibaba và Artificial Analysis, trong khi số liệu của Qwen3.7-Max đến từ Artificial Analysis.
Guides & Insights

Qwen3.8-Max vs Qwen3.7-Max: Hai bậc Max, 16 điểm chỉ số và một chương trình khuyến mãi đảo ngược mức giá

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Bốn ngày trước, nhà cung cấp nói với chúng tôi rằng Qwen3.8-Max không phải là mô hình mà họ đã phát hành hồi tháng Tám. Trong một thông cáo báo chí đề ngày 22 tháng 9 năm 2026, từ Hội nghị Apsara ở Hàng Châu, công ty tiết lộ rằng mô hình chủ lực của mình đã hoàn thành 33 chu kỳ lặp công việc huấn luyện và hậu huấn luyện hoàn toàn tự động trong hơn một tháng, và bản dựng thu được đã nâng Chỉ số Trí tuệ Artificial Analysis của nó từ 40 lên 45. Mã định danh mô hình không hề thay đổi. Con số đằng sau nó thì có.

Điều đó quan trọng nhất ở một chỗ cụ thể: sự so sánh giữa Qwen3.8-Max và Qwen3.7-Max, bậc Max mà nó thay thế. Qwen3.8-Max đạt trạng thái sẵn sàng chung vào ngày 3 tháng 8 năm 2026; Qwen3.7-Max ra mắt vào tháng 5. Nhìn trên giấy tờ, đây có vẻ là một lựa chọn dễ dàng giữa các thế hệ — flagship mới hơn, điểm cao hơn, cứ thế mà tiến. Những con số lại nói lên điều gì đó khó xử hơn. Bậc cũ nhanh hơn ba đến bốn lần, rẻ hơn khoảng năm lần cho mỗi tác vụ hoàn thành, và giống hệt bậc mới hơn trên các bài kiểm tra kiến thức thuần túy. Bậc mới hơn có khả năng đa phương thức, tốt hơn đáng kể trong các tác vụ agent, và rẻ hơn theo bảng giá quốc tế. Bạn nên gọi cái nào phụ thuộc vào một câu hỏi mà hầu hết các so sánh đều bỏ qua: liệu bạn đang mua kiến thức hay mua lệnh gọi công cụ.

Tiết lộ của Apsara thực sự khẳng định điều gì

Công bố này là một tuyên bố của nhà cung cấp, được Alibaba đăng trên trang báo chí của chính mình, và cần được đọc đúng như vậy. Điều nó nêu rất cụ thể: trong hơn một tháng chạy hoàn toàn tự động bao gồm thiết kế pipeline, xác thực dữ liệu, thử nghiệm lặp lại và chẩn đoán lỗi, Qwen3.8-Max đã hoàn thành 33 chu kỳ, và việc tối ưu hóa huấn luyện tự động cùng các kỹ thuật hậu huấn luyện đã tạo ra sự thay đổi điểm số. Alibaba cũng mô tả một thí nghiệm thứ hai trong thiết kế chip, trong đó mô hình đã chạy hơn 60 giờ tự cải thiện trong môi trường thiết kế, thực hiện hơn 1,100 lệnh gọi công cụ A/E, và tạo ra các mô-đun bus chip đạt chuẩn sản xuất trong khi giảm 42% diện tích chip mà không có sự đánh đổi hiệu năng nào được nêu. Tất cả những điều đó là lời kể của Alibaba về mô hình của chính mình, chưa được bất kỳ ai bên ngoài công ty tái lập.

Tuy nhiên, bản thân sự dịch chuyển điểm số không phải là tuyên bố của nhà cung cấp. Chỉ số này là của Artificial Analysis, và con số 45 nằm trên trang Qwen3.8 Max (0902) của bên thứ ba đó. Con số 40 mà nó dịch chuyển từ đó nằm trên trang của cùng tổ chức ấy cho bản dựng ngày 3 tháng 8, hiện đã được đánh dấu là ngừng sử dụng và trỏ tới bản hiện tại. Vậy nên mức chênh lệch là một nguyên nhân do nhà cung cấp báo cáo gắn với một hiệu ứng được chấm điểm độc lập, một vị thế mạnh hơn so với từng nửa riêng lẻ. Tính đến thời điểm viết bài này, đây cũng là bằng chứng công khai cụ thể nhất mà bất kỳ ai có rằng một phòng thí nghiệm tiên phong đã thay đổi năng lực đo được của sản phẩm chủ lực mà không phát hành một số phiên bản mới.

Hai điều khác về bản phát hành này rất dễ bị bỏ sót và cả hai đều giữ vai trò then chốt.Qwen 4 đang được huấn luyện, với dòng Qwen 4.5 và Qwen 5 được dự kiến mở rộng quy mô lên 5–10 nghìn tỷ tham số. Thứ hai, có một bản chụp có ghi ngày của mô hình đã được làm mới. Alibaba đã ghim bản dựng sau huấn luyện là qwen3.8-max-0902 vào ngày 2 tháng 9, và nó có thể được định tuyến riêng. Việc ghim đó chính là câu trả lời thiết thực cho mọi điều mà tiết lộ RSI hàm ý, và chúng ta sẽ quay lại vấn đề này.

Bảng tỷ số

Sáu chiều, cả hai phía, với kỷ luật trích nguồn được nêu rõ ràng bởi vì hai cột không được xác minh như nhau.

• Cửa sổ ngữ cảnh — Qwen3.8-Max 1.000.000 token so với Qwen3.7-Max 1.000.000 token (giống hệt nhau)

• Đầu ra tối đa — 131.072 token so với 131.072 token theo các trang mô hình của chính Alibaba (giống hệt; lưu ý rằng trang danh mục của chúng tôi cho Qwen3.7-Max ghi 64.000, một điểm không khớp mà chúng tôi nêu ra thay vì lấp liếm)

• Phương thức đầu vào — văn bản, hình ảnh và video so với chỉ văn bản

• Giá niêm yết quốc tế cho mỗi 1 triệu token — $2.00 vào / $6.00 ra so với $2.50 vào / $7.50 ra; cùng một bảng giá đã tính phí cả hai mô hình $1.65 / $4.951 tại Bắc Kinh, Frankfurt và Virginia

• Chỉ số Trí tuệ Artificial Analysis — 45 so với 29

• Tốc độ đầu ra độc lập — 39,7 token/giây so với 211,3 token/giây, được đo dựa trên cùng lớp so sánh 211 mô hình, trong đó Artificial Analysis xếp hạng phân khúc mới hơn là chậm đáng kể và phân khúc cũ hơn là nhanh đáng kể

Hai hàng cuối là toàn bộ bài viết. Trên cùng một họ chỉ số, phân khúc mới hơn dẫn trước 16 điểm. Về tốc độ, nó lại chậm hơn gấp hơn năm lần.

A two-column comparison scoreboard: left column 'Qwen3.8-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text / image / video, International price per 1M $2.00 / $6.00, AA Intelligence Index 45 and Output speed 39.7 tok/s; right column 'Qwen3.7-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text only, International price per 1M $2.50 / $7.50, AA Intelligence Index 29 and Output speed 211.3 tok/s; a footer credits Alibaba's 22 Sep 2026 disclosure and Artificial Analysis.

16 điểm đến từ đâu — và những nơi chúng không đến từ đó

Tách Index thành các phần của nó, và hình dạng của bản nâng cấp trở nên rõ ràng, và đó không phải là hình dạng mà hoạt động tiếp thị gợi ý.

Về kiến thức và suy luận, hai mô hình thực chất ngang nhau. GPQA Diamond: 92,8 so với 92,3. Humanity's Last Exam: 43,1 so với 40,5. Khả năng nhớ ngữ cảnh dài: 80,33 so với 79. SciCode: 52,1 so với 49,5. Nếu khối lượng công việc của bạn là trả lời câu hỏi trên một kho ngữ liệu lớn, thì bước nhảy thế hệ chỉ là sai số làm tròn. Việc trả gấp nhiều lần cho nó sẽ khó mà biện minh.

Với công việc agentic và lập trình, khoảng cách mở ra rất rõ. Terminal-Bench 2.1: 88.76 so với 74.53. Chỉ số lập trình của Artificial Analysis: 76.2 so với 66. Và khác biệt lớn nhất trong bộ này là tác vụ sử dụng công cụ ngân hàng, nơi Qwen3.8-Max ghi nhận 47.84 so với Qwen3.7-Max ở mức 11.75 — khoảng cách gấp bốn lần đúng ở năng lực mà mô tả RSI nói rằng các chu kỳ tự động đang tối ưu hóa: thiết kế pipeline, xác thực dữ liệu, thử nghiệm lặp, chẩn đoán lỗi. Một mô hình dành một tháng để cải thiện vòng lặp huấn luyện của chính nó là một mô hình đã trở nên giỏi hơn ở các vòng lặp.

Một lưu ý trung thực về những hàng riêng lẻ đó. Cả hai trang mô hình đều nằm trong cùng một nhóm phiên bản của Chỉ số Thông minh (v4.3 và v4.3.2), điều này khiến cho so sánh tiêu đề 45 so với 29 là công bằng. Các hàng theo từng benchmark không cùng nhóm thuần nhất: các số liệu ở cấp tác vụ của Qwen3.7-Max có từ cửa sổ đánh giá tháng 5, trong khi số liệu của Qwen3.8-Max đến từ loạt đánh giá tháng 9. Hãy đọc xu hướng dịch chuyển, chứ không phải chữ số có nghĩa thứ ba.

Câu hỏi về giá thực ra là hai câu hỏi

Trên bảng giá quốc tế của Alibaba, Max mới hơn có giá rẻ hơn phiên bản mà nó thay thế: $2.00 / $6.00 cho Qwen3.8-Max so với $2.50 / $7.50 cho Qwen3.7-Max, tính trên mỗi triệu token. Mức giảm 20% ở cả hai chiều khi thế hệ tiến bộ là điều bất thường và đáng chú ý. Kinh tế cache cũng ưu ái hạng mới hơn — cache ngầm ở mức $0.25 so với $0.50, đọc cache tường minh ở mức $0.17 so với $0.25.

Đó là câu hỏi đầu tiên, và nó có một câu trả lời mang tính khu vực mà hầu hết các bài viết đều san phẳng. Alibaba tính phí cả hai mô hình $1.65 đầu vào / $4.951 đầu ra tại Bắc Kinh, Frankfurt và Virginia. Mức chênh lệch 20% chỉ tồn tại trên bảng giá quốc tế Singapore. Nếu lưu lượng của bạn đổ vào ba khu vực còn lại, thì hôm nay token đầu vào và đầu ra có cùng mức giá cho cả hai hạng Max, và quyết định thu hẹp lại chỉ còn thuần năng lực — khi đó mô hình mới hơn thắng ở mọi thứ trừ thông lượng, và không còn phép tính nào để làm nữa.

Câu hỏi thứ hai mới là cái bẫy. Hiện tại Qwen3.7-Max không có mức giá $2.50 / $7.50. Nó được cung cấp ở mức $1.25 / $3.75 — bằng một nửa giá niêm yết, tức một mức giá khuyến mại. Điều đó khiến tầng của thế hệ trước trở thành lựa chọn rẻ hơn trong hiện tại, với khoảng cách khá lớn. Nó cũng có nghĩa là mức giá bạn đo được trong tuần này không phải là mức giá mà bạn sẽ cam kết. Trang mô hình của chính Alibaba nói rõ rằng bảng giá được công bố chỉ thể hiện giá gốc "không bao gồm bất kỳ chương trình khuyến mại có thời hạn nào" và hướng bạn đến console để biết các ưu đãi hiện hành. Xét cho cùng, một chương trình khuyến mại là một mức giá có thể kết thúc. Nếu điều đó xảy ra, Qwen3.7-Max không chỉ trở nên đắt hơn so với hiện tại; nó còn đắt hơn 25% so với mô hình đánh bại nó.

Chúng tôi chuyển thẳng mức giá của nhà cung cấp với mức cộng thêm 0%, nên cả giá niêm yết lẫn chương trình khuyến mãi đều có hiệu lực ở phía chúng tôi ngay trong ngày chúng thay đổi — điều này thuận tiện cho việc so sánh và không hữu ích nếu bạn đang cố lập ngân sách. Hãy xây dựng mô hình dựa trên bảng giá niêm yết, và coi mức khuyến mãi là điểm cộng.

A screenshot of Alibaba Cloud Model Studio's 'Recommended models' documentation overview page, showing the console navigation on the left, the line 'Alibaba Cloud Model Studio offers Qwen and third-party models for text, image, audio, and video.', an 'Updated at: 2026-09-24 20:17:58' stamp, and category cards covering Text generation (listing qwen3.8-max and qwen3.7), Image & video, World models, and Audio & speech.

Con số đảo ngược lập luận về chi phí

Giá token không phải là chi phí của một tác vụ. Artificial Analysis công bố một con số chi phí trên mỗi tác vụ, trong đó đã tính gộp cả kinh tế học của bộ đệm, khối lượng suy luận và độ dài câu trả lời, và theo thước đo đó, thứ hạng đảo ngược hoàn toàn: $5.41 cho mỗi tác vụ trên Chỉ số Trí tuệ đối với Qwen3.8-Max so với $1.15 đối với Qwen3.7-Max. Mức chênh lệch 4.7×, trong khi mức giá token hoặc rẻ hơn 20% hoặc giống hệt nhau tùy theo khu vực của bạn.

Khoảng cách chủ yếu nằm ở độ dài dòng. Trong cùng một đánh giá, mô hình mới hơn đã tạo ra 190 triệu token đầu ra so với mức của mô hình cũ là 120 triệu, và nó suy luận dài dòng để đi đến câu trả lời. Nếu bạn đang trả tiền theo token đầu ra cho một khối lượng công việc lớn, có độ khó trung bình, thì Max mới hơn không phải là mô hình rẻ hơn ở bất kỳ mức giá token nào trên cả hai bảng giá. Nó là mô hình đắt hơn, và giá niêm yết theo token là công cụ sai để quyết định điều đó.

Tốc độ, và những gì lưu lượng truy cập của chính chúng ta cho thấy

Khoảng cách về thông lượng đủ lớn để buộc phải thay đổi kiến trúc. Artificial Analysis xếp Qwen3.8-Max ở mức 39,7 token mỗi giây — bản tóm tắt của họ gọi mô hình này là chậm một cách đáng chú ý — so với 211,3 token mỗi giây của Qwen3.7-Max, mô hình mà họ đánh giá là nhanh đáng chú ý. Đó chính là khác biệt giữa một mô hình bạn đặt sau một bề mặt tương tác và một mô hình bạn đặt sau một hàng đợi — và trên Qwen3.8-Max đó là điều đầu tiên bảng thống kê của chính chúng tôi hiển thị cho bạn.

Dữ liệu đo từ xa trên playground của chính chúng tôi trong bảy ngày tính đến ngày 25 tháng 9 kể một câu chuyện có phần tinh tế hơn về độ trễ, và đi kèm một lưu ý: đây là các phép đo của chúng tôi trên hệ thống định tuyến của chúng tôi, không phải một đánh giá chuẩn có kiểm soát. Qwen3.8-Max cho thấy trung vị 2.611 ms để có phản hồi đầu tiên ở 54,7 token mỗi giây với tỷ lệ lỗi 2,45%; bản dựng 0902 được ghim cho thấy trung vị 3.360 ms ở 46,2 token mỗi giây với tỷ lệ lỗi sạch hơn đáng kể là 0,66%. Qwen3.7-Max ở mức trung vị 4.509 ms nhưng đạt 169,8 token mỗi giây với tỷ lệ lỗi 3,80%. Vậy là tầng cũ hơn trả lời chậm hơn ở giai đoạn đầu rồi sau đó truyền phát nhanh gấp ba lần, nhưng lại lỗi thường xuyên hơn. Nếu khối lượng công việc của bạn có tính bùng nổ, thì khác biệt về tỷ lệ lỗi đó đáng được chú ý hơn là trung vị.

Cả hai hạng đều đang hoạt động trên cùng một khóa OrcaRouter, song song với snapshot đã ghim, với tính năng chuyển đổi dự phòng tự động giữa các nhà cung cấp. Với kiểu so sánh như thế này, đó chính là điểm thực tế: việc đo các prompt của riêng bạn với cả hai thế hệ Max là một thay đổi cấu hình, chứ không phải một hợp đồng thứ hai.

A screenshot of OrcaRouter's own model page for Qwen3.7-Max (models/qwen/qwen3.7-max) in the dark theme, showing the Qwen3.7-Max heading, its model description, and the stat and price panel for the tier.

Tính tái lập giờ đây là yếu tố quyết định.

Đây là phần của công bố Apsara mà chưa ai định giá. Một ID mô hình đang hoạt động có khả năng đo lường được đã thay đổi từ 40 lên 45 trong vòng một tháng, không có thay đổi phiên bản và không có thông báo vào thời điểm đó, là một mối nguy hiểm về khả năng tái lập. Nếu hành vi sản phẩm của bạn là một hàm của một ID đang thay đổi, bạn có một mô hình có thể cải thiện — hoặc thay đổi — bên dưới một bộ đánh giá đóng băng, một thư viện prompt được lưu trữ, hoặc một bộ hồi quy đã được phê duyệt.

Cả hai thế hệ đều cung cấp các bản chụp có ghi ngày, và đó là biện pháp giảm thiểu. Qwen3.7-Max được Alibaba ghi nhận là tương đương về mặt chức năng với qwen3.7-max-2026-05-20, với các bản dựng có ghi ngày khác vào 2026-05-17 và 2026-06-08. Qwen3.8-Max có qwen3.8-max-0902, bản dựng tháng 9 sau huấn luyện, đó là điều mà 45 đề cập đến. Nếu bạn đang phát hành bất cứ thứ gì cần tái tạo, hãy ghim ID có ghi ngày và coi ID trôi nổi như một mục tiêu thử nghiệm. Các chu kỳ RSI là một đặc điểm của ID trôi nổi; việc ghim là cách bạn chọn không tham gia chúng.

Một chi tiết về cách đặt tên đáng biết để bạn không đọc sai danh mục. Alibaba liệt kê một dạng có ngày thứ ba, qwen3.8-max-2026-09-02, cùng với bí danh 0902; chúng cùng chỉ một bản dựng. Bản phát hành ngày 3 tháng 8 ban đầu không còn định tuyến được ở phía chúng tôi — chúng tôi phục vụ Qwen3.8-Max, bản ghim 0902 của nó, và Qwen3.7-Max.

Ai nên chọn cái nào

Quyết định không nằm ở việc mẫu nào tốt hơn. Nó nằm ở việc bạn đang mua gì.

Hãy tiếp tục dùng Qwen3.7-Max nếu khối lượng công việc của bạn chỉ có văn bản, nặng về kiến thức hơn là nặng về công cụ, và nhạy cảm với thông lượng — phân loại khối lượng lớn, trích xuất, truy xuất ngữ cảnh dài, tóm tắt theo lô. Trên GPQA Diamond và khả năng truy xuất ngữ cảnh dài, nó chỉ kém mô hình mới hơn trong vòng một điểm, truyền phát nhanh hơn ba đến bốn lần, và tốn $1.15 mỗi tác vụ so với $5.41. Đây cũng là câu trả lời đúng cho bất kỳ ai muốn một ý kiến thứ hai giá rẻ trong cấu hình hợp nhất hoặc định tuyến, vì ở mức giá khuyến mại, nó hoàn toàn thuộc một đẳng cấp giá khác. Hai lưu ý: chương trình khuyến mại chỉ là khuyến mại, và Artificial Analysis đã đánh dấu mô hình này là không còn được hỗ trợ, bị thay thế bởi Qwen3.8-Max. Đừng bắt đầu một cam kết nhiều năm với nó.

Chuyển sang Qwen3.8-Max nếu bất kỳ điều nào sau đây đúng: bạn cần đầu vào hình ảnh hoặc video, thứ mà Qwen3.7-Max hoàn toàn không nhận; khối lượng công việc của bạn mang tính tác tử, với các chuỗi gọi công cụ dài hoặc vòng lặp lập trình nhiều bước, nơi con số 88.76 so với 74.53 trên Terminal-Bench 2.1 và khoảng cách gấp bốn lần về mức sử dụng công cụ chính là khác biệt giữa triển khai được và không; hoặc bạn viết mã theo bảng giá quốc tế Singapore, nơi mô hình mới hơn đơn giản là rẻ hơn 20% và không có gì phải cân nhắc. Ghim qwen3.8-max-0902 nếu bạn cần hành vi giữ nguyên không đổi.

Nếu bạn đang ở Bắc Kinh, Frankfurt hoặc Virginia, lựa chọn sẽ rõ ràng hơn mọi so sánh có thể gợi ý: cả hai bậc Max đều có giá $1.65 / $4.951 mỗi triệu token. Giống hệt nhau. Với mức giá đó, việc không phải trả thêm cho đầu vào đa phương thức, Chỉ số cao hơn 16 điểm và điểm sử dụng công cụ tốt hơn gấp bốn lần không còn là điều phải cân nhắc, mà là miễn phí — và lý do duy nhất để tiếp tục dùng Qwen3.7-Max trở thành thông lượng thô.

Hai câu hỏi đáng để trả lời trực tiếp

Việc chạy huấn luyện 33 chu kỳ có nghĩa là mô hình đã thay đổi trong khi lưu lượng API hiện có vẫn đang diễn ra không? Đó là điều mà thông tin công bố ngụ ý, và đó là lý do tồn tại bản ghim gắn ngày. Alibaba mô tả mô hình cải tiến là "Qwen3.8-Max đã cập nhật," tức là ID trôi nổi, chứ không phải một ID mới. Nếu bạn có các khối lượng công việc chạy trên ID trôi nổi đó suốt tháng Chín, thì chúng được phục vụ bởi một mô hình mà năng lực đo được đã thay đổi trong khoảng thời gian đó. Alibaba chưa công bố nhật ký thay đổi cho các bản dựng trung gian, nên cách duy nhất đáng tin cậy để biết mình đang có hành vi nào là ghim phiên bản.

Tuyên bố RSI có được xác minh độc lập không? Điểm số mà nó tạo ra thì có — Index là của Artificial Analysis, và con số 45 nằm trên trang của họ. Cơ chế đằng sau nó chỉ là mô tả của chính Alibaba về quy trình huấn luyện của chính mình, không có bên ngoài tái lập, không có giao thức đánh giá nào được công bố, và không có bên thứ ba nào quan sát 33 chu kỳ. Hãy coi "33 chu kỳ lặp" là một tuyên bố của nhà cung cấp và "45 sau 40" là một cặp số đo được. Chúng không phải cùng loại phát biểu, và sự khác biệt đó là lý do tiêu đề này đáng được đọc kỹ thay vì nhắc lại.

Điều tiếp theo cần để mắt tới không phải là Qwen 4. Mà là liệu chương trình khuyến mãi giảm nửa giá của Qwen3.7-Max có sống sót qua sự xuất hiện của mô hình được định sẽ thay thế nó hay không. Nếu không, rất nhiều đội ngũ sẽ phát hiện ra rằng họ đã so sánh giá niêm yết với giá đã giảm, và rằng đứa lớn hơn trong hai anh em cùng dòng hóa ra lại là đứa đắt hơn suốt từ đầu.