
Qwen3.8 Max Prime: Alibaba đặt một bảng giá hạng hai bên cạnh mẫu chủ lực của mình
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 584 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 187 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Vào ngày 22 tháng 9 năm 2026, tại Hội nghị Yunqi ở Hàng Châu, mảng kinh doanh MaaS của Alibaba đã công bố một cấp độ phục vụ mà họ gọi là Prime mode — 优速模式 — và đưa một ID mô hình mới vào bảng giá cho cấp độ đó: qwen3.8-max-prime. ID đó không phải là một mô hình mới. Nó là Qwen3.8-Max, mô hình chủ lực mixture-of-experts thưa 2,4 nghìn tỷ tham số đã đạt trạng thái khả dụng chung vào ngày 3 tháng 8 năm 2026, được cung cấp qua một làn nhanh hơn. Qwen3.8 Max Prime mang cùng trọng số, cùng cửa sổ ngữ cảnh, cùng bộ công cụ và cùng giới hạn sử dụng như mô hình cơ sở. Điều khác biệt là thông lượng và giá, và giá tăng khoảng gấp đôi.
Đây là lần thứ hai trong bảy tuần mà Alibaba thay đổi cách bán Qwen3.8-Max mà không thay đổi bản chất của nó. Vào ngày 2 tháng 9, công ty đã phát hành một bản làm mới sau huấn luyện được ghim tên là Qwen3.8-Max-0902, tập trung vào lập trình và công việc tác tử, chỉ dùng qua API. Ngày 22 tháng 9 bổ sung thêm hạng tốc độ. Cả hai đều không phải là một màn ra mắt, và coi bất kỳ cái nào như vậy sẽ khiến bạn tốn tiền.

Chế độ Prime thực chất là gì
Tài liệu của chính Alibaba mô tả chế độ Prime là một kênh dành cho "các tình huống nhạy cảm với tốc độ đầu ra" — trợ lý lập trình AI, suy luận đa bước của agent, hội thoại thời gian thực — và nêu rõ lợi ích: TPS được nâng lên gấp 1,5 đến 2 lần so với API tiêu chuẩn. Không có tham số mới nào cần đặt. Bạn chuyển giá trị model sang Prime ID và bạn đang ở làn đường nhanh.
Tài liệu cũng rõ ràng không kém về những gì không thay đổi: "Các khả năng được mô hình hỗ trợ và các hạn chế sử dụng đều giống như mô hình gốc." Vì vậy, không có ngữ cảnh lớn hơn, không có chế độ suy luận tốt hơn, không có bề mặt công cụ bổ sung. Đây vẫn là cùng một ngăn xếp phục vụ, nhưng có nhiều dư địa hơn phía sau.
The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.
Bảng giá, hãy đọc kỹ.
Trang định giá quốc tế của Alibaba liệt kê hai ID cạnh nhau, khiến việc so sánh trở nên rõ ràng một cách bất thường. Trên mỗi triệu token:
• Đầu vào — qwen3.8-max-prime $3.301 so với qwen3.8-max $1.65
• Đầu ra — qwen3.8-max-prime $9.902 so với qwen3.8-max $4.951
• Cache hit — qwen3.8-max-prime $0.413 so với mức giá đọc từ cache trên ID tiêu chuẩn mà cùng trang đó ghi kèm như một dòng giảm giá
• Tỷ lệ — 2.0× ở cả đầu vào và đầu ra, không phải là một con số xấp xỉ đã làm tròn mà là phép tính chính xác từ những con số đã công bố
Trên bảng giá Trung Quốc, mức gấp 2× tương tự vẫn đúng khi tính bằng nhân dân tệ: ¥24 cho đầu vào và ¥72 cho đầu ra trên mỗi triệu đối với Prime ID, so với ¥12 và ¥36 cho bản tiêu chuẩn, với các lượt trúng bộ nhớ đệm ở mức ¥3.
Con số ra mắt được trích dẫn rộng rãi cho Qwen3.8-Max là 2 USD cho đầu vào và 6 USD cho đầu ra trên mỗi triệu. Đó là tiêu đề mà các bài đưa tin hồi tháng 8 đã sử dụng, và đó không phải là con số trên bảng giá quốc tế ngày hôm nay. Nếu bạn đang mô hình hóa chi phí, hãy dùng bảng giá của khu vực bạn thay vì tiêu đề ra mắt, và kiểm tra lại trước khi bạn cam kết — Alibaba đã sửa đổi trang này hai lần kể từ ngày 2 tháng 9.

Quy tắc throttling mới là tính năng thực sự.
Dòng mà hầu hết mọi người lướt qua lại chính là dòng quan trọng nhất đối với môi trường production. Tài liệu Prime của Alibaba nêu rõ rằng khi mức sử dụng của bạn đạt đến giới hạn tốc độ, nếu nền tảng vẫn còn tài nguyên dư thừa, bạn sẽ không bị hạn chế tốc độ, vì vậy thông lượng thực tế khả dụng cho bạn sẽ không giảm xuống dưới mức giới hạn đã công bố.
Đó là một mức trần mềm với mức sàn cứng, một hình dạng khác so với giới hạn hạng tiêu chuẩn. Điều đó có nghĩa là con số 1,5–2× là một lời hứa về mức sàn, chứ không phải là một giới hạn áp lên mức trần: khi có tranh chấp, bạn nhận được giới hạn, còn khi dung lượng nhàn rỗi, bạn có thể nhận được nhiều hơn. Đối với một vòng lặp agent thực hiện hàng chục lời gọi tuần tự, sự bất đối xứng đó đáng giá hơn hệ số nhân TPS thô, bởi chính độ trễ đuôi ở lời gọi chậm nhất quyết định liệu quy trình của bạn có hoàn tất hay không.
Giới hạn TPM động của mô hình tiêu chuẩn được phân bậc theo mức chi tiêu hàng tháng cho Model Studio — cùng nhóm tài liệu đó cho thấy ID qwen3.8-max cơ sở ở mức 5,000,000, 10,000,000 và 20,000,000 TPM trên các bậc, được làm mới hàng tháng. Prime không loại bỏ cấu trúc đó; nó thay đổi cách cấu trúc đó gây sức ép.

Điều mà chưa ai đo lường được
Đây là khoảng cách trung thực. Con số 1,5–2× là do nhà cung cấp công bố. Không có phép đo thông lượng độc lập nào cho Prime-mode mà chúng tôi có thể tìm thấy, và điều đó quan trọng vì các con số độc lập của chính bản dựng tiêu chuẩn không mấy tích cực về tốc độ.
Artificial Analysis, đơn vị đo lường các mô hình trên bộ kiểm thử riêng của mình, hiện chấm Qwen3.8-Max trên bản dựng 0902 đạt Chỉ số Thông minh là 45, với GPQA Diamond đạt 92,8%, Terminal-Bench Hard đạt 38,9% và Humanity's Last Exam đạt 43,1% — đồng thời đặt chi phí đo được cho mỗi tác vụ ở mức $5.41. Đó là những con số độc lập trên SKU tiêu chuẩn, được ghi nhận ngày 2026-09-24. Chúng cũng là một lời nhắc rằng chỉ số này đã được sửa đổi kể từ các bài đưa tin ra mắt hồi tháng Tám, nên đừng đặt một giá trị chỉ số cũ bên cạnh một giá trị hiện tại rồi gọi đó là xu hướng.
Điều AA không có là một hàng Prime. Cho đến khi có ai đó đo nó, tuyên bố về tốc độ vẫn chỉ thuộc về riêng Alibaba, và cách tiếp cận đúng là kiểm thử nó trên chính khối lượng công việc của bạn thay vì mặc định rằng nó đứng đầu dải sản phẩm.
Điều này đặt quyết định định tuyến ở đâu
Prime là một hạng mà Alibaba bán trên API riêng của mình, và đó là nơi duy nhất để có được nó. Chúng tôi không lưu trữ qwen3.8-max-prime tại đây. Điều mà OrcaRouter định tuyến là bản tiêu chuẩn Qwen3.8-Max và bản ghim theo ngày của nó Qwen3.8-Max-0902, cả hai đều dùng cùng key với phần còn lại của dòng Qwen3.8 — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — cùng với hơn 200 mô hình khác, với giá niêm yết của nhà cung cấp được chuyển nguyên qua ở mức markup 0%. Phần cuối đó là lý do bản làm mới ngày 2 tháng 9 và bất kỳ thay đổi giá Max nào trong tương lai đều đến phía chúng tôi cùng ngày chúng đến với Alibaba.
Cách phân tách thực tế trông như thế này. Chạy lưu lượng mặc định của bạn trên ID tiêu chuẩn thông qua một router, nơi cơ chế chuyển đổi dự phòng bảo vệ bạn nếu một đường dẫn nhà cung cấp đơn lẻ bị suy giảm. Chuyển những lệnh gọi cụ thể mà độ trễ thời gian thực chính là sản phẩm — lượt hoàn thành tương tác, bước tác tử khắt khe về thời gian — sang Prime, và định giá quyết định đó dựa trên mức 2× thay vì mức 1.5×.
Ai nên chuyển đổi, và ai nên chờ đợi
Chuyển sang nếu người dùng của bạn đang chờ token: một tính năng tự động hoàn thành, một lượt trò chuyện, một vòng chỉnh sửa mã nơi con người đang theo dõi. Ở đầu trên của dải tốc độ, Prime trung tính về chi phí trên mỗi giây độ trễ được loại bỏ — bạn trả đúng gấp đôi cho đúng một nửa thời gian. Ở đáy dải, bạn đang trả 2× để nhận 1.5×, tức mức phụ trội 33% cho mỗi giây tiết kiệm được. Nếu khối lượng công việc của bạn là một tác vụ theo lô chạy qua đêm, khoản phụ trội đó chẳng mua được gì bạn cần.
Hãy cân nhắc nếu mô hình chi phí của bạn được xây dựng dựa trên mức giá $2/$6 được quảng bá khi ra mắt, hoặc nếu các yêu cầu của bạn nặng về đầu vào. Tuyên bố về tốc độ của nhà cung cấp là về TPS — token đầu ra mỗi giây — còn prefill là một giai đoạn khác của pipeline. Một yêu cầu có ngữ cảnh dài phải trả gấp đôi cho token đầu vào, bất kể đầu ra có đến nhanh hơn hay không. Hãy đo lường trường hợp đó trước khi bạn chuyển đổi nó.
Và hãy kiểm tra ngày trên bảng giá của bạn. Qwen3.8-Max đã có mặt trên thị trường từ ngày 3 tháng 8, đã được làm mới một lần, và được đóng gói lại một lần, mà vẫn chỉ mới bảy tuần tuổi. Cái mới nằm ở hạng dịch vụ; mô hình thì không.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
