
Step 5 Preview vs Qwen 3.8 Max Prime: Một điểm chỉ số, bốn đô la và ba mươi tám xu
- OrcaMỚIOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 trên 1 triệu token
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
Hãy bắt đầu bằng điều mà một ô tìm kiếm sẽ không nói cho bạn. Qwen 3.8 Max Prime không phải là một mô hình. Đây là một làn phục vụ — cũng chính bộ Qwen3.8-Max trọng số mà nhà cung cấp đã đưa tới trạng thái sẵn sàng chung vào ngày 3 tháng 8 năm 2026, được bán dưới một ID mô hình thứ hai với mức giá đúng gấp đôi bảng giá quốc tế. Step 5 Preview, mẫu chủ lực dạng đóng của StepFun, đã mở API vào ngày 20 tháng 9 năm 2026 và là một mô hình theo nghĩa thông thường: một endpoint, một mức giá, một bộ trọng số mà bạn không thể nắm giữ. Vậy nên phiên bản trung thực của cuộc so tài này đặt một mô hình đã được đo lường đối đầu với một hạng dịch vụ chưa được đo lường, và phép toán rút ra thì thẳng thừng hơn bất cứ điều gì mà cả hai nhà cung cấp sẽ đưa lên slide. Trên Chỉ số Trí tuệ Artificial Analysis độc lập, hai bên chỉ cách nhau một điểm, 44 so với 45, và về chi phí cho một tác vụ đã hoàn thành, chúng cách nhau 1,03 đô la so với 5,41 đô la. Một điểm, bốn đô la ba mươi tám xu, mỗi tác vụ — và đó là còn chưa tính tới phần tốc độ mà Prime thực sự thu tiền.
Phần sau đây là con số đó được mổ xẻ: nó đến từ đâu, vì sao Qwen ID tiêu chuẩn vốn đã là nửa đắt hơn trong phép so sánh trước khi Prime nhân đôi bất cứ thứ gì, và khoản thêm bốn đô-la mỗi tác vụ đang mua được gì và không mua được gì.
Cái tên đang gánh vác phần việc mà sản phẩm không hề làm
Alibaba đã công bố Prime — 优速模式, chế độ nhanh — tại Hội nghị Yunqi vào ngày 22 tháng 9 năm 2026 và công bố nó như một dòng trên bảng giá của Model Studio. Tài liệu của chính Alibaba nói rõ ràng, không mập mờ về những gì thay đổi: tốc độ đầu ra tăng lên 1,5 đến 2 lần so với API tiêu chuẩn, và, theo lời nhà cung cấp, các khả năng và hạn chế sử dụng giống hệt với mô hình gốc. Không có số lượng tham số mới, không có hợp đồng endpoint mới, không có khả năng nào mà ID tiêu chuẩn thiếu. Bạn chỉ cần thay đổi tên mô hình trong phần thân yêu cầu và bạn đã ở làn đường nhanh.

Điều đó biến cụm từ tìm kiếm thành một cái bẫy. Người đang tìm một mẫu flagship Qwen mới hơn Qwen3.8-Max sẽ thấy "Prime" và đọc nó như một số phiên bản. Đó là một mức giá. Mọi thứ mà cái tên ngụ ý về năng lực đều được chính Qwen3.8-Max cung cấp: một mô hình mixture-of-experts thưa với 2,4 nghìn tỷ tham số, khoảng 95 tỷ tham số hoạt động trên mỗi token, 512 chuyên gia mỗi lớp, và ngữ cảnh 983.616 token trên cấu hình mà hội đồng độc lập đã kiểm thử.
Step 5 Preview không có sự mơ hồ tương đương, và nó mắc vấn đề ngược lại. StepFun liệt kê nó ở khoảng 600 tỷ tham số tổng cộng với 27 tỷ tham số hoạt động, đầu vào văn bản, hình ảnh và video, cửa sổ ngữ cảnh 1M token và trần đầu ra 64.000 token đã được ghi rõ trong tài liệu, với mức độ nỗ lực suy luận có thể chọn ở mức thấp, trung bình hoặc cao. Nó là độc quyền. Một checkpoint BF16 đã được hứa hẹn cho ngày 15 tháng 10 năm 2026 và vẫn chưa được phát hành; các bản sao cộng đồng của một bản dựng BF16 đã lưu hành trên Hugging Face kể từ ngày API mở, nhưng việc tải lên lại không phải là một bản phát hành và StepFun chưa công bố bất kỳ thông báo nào về trọng số mở.
Vậy nên cặp đôi này thực sự vênh lệch ngay cả trước khi có một kết quả benchmark nào: một mô hình mới chỉ được giới thiệu xem trước, có thể sẽ trở thành bản tải về, đối lại với một gói dịch vụ phục vụ đã được điều chỉnh giá của một mô hình sẽ không như vậy.
Một điểm chỉ số tốn bao nhiêu
Cả hai mô hình đều đã được cùng một bên đánh giá độc lập chạy thử, và đây chính là lúc phép so sánh trở nên khó chịu đối với câu chuyện rẻ hơn trên mỗi token. Đọc tiếp vào ngày 10 tháng 10 năm 2026:
Chỉ số — Step 5 Preview 44, cao hơn hẳn mức trung vị 26 của các mô hình tương đương. Qwen3.8-Max trên bản dựng 0902, 45. Hơn một điểm.
• Chi phí cho mỗi tác vụ lập chỉ mục đã hoàn thành — $1.03 so với $5.41. Tốt hơn gấp năm lần.
• Giá đầu ra — $2.70 so với $6.00 mỗi triệu token trên ID tiêu chuẩn, mức này trở thành $9.902 khi bạn chuyển sang Prime. Step 5 Preview rẻ hơn 2,2 lần so với tiêu chuẩn và rẻ hơn 3,7 lần so với Prime.
• Giá đầu vào — $1.00 so với $2.00 tiêu chuẩn và $3.301 trên Prime. Đây là bản phản chiếu của cột đầu ra, và là thứ quan trọng hơn một khi bạn đọc phần phân tích chi phí bên dưới.
• Cache hit — $0.10 cho mỗi triệu token trên Step 5 Preview, mức giảm 90 phần trăm; $0.25 trên Qwen3.8-Max, mức giảm 87,5 phần trăm mà chính trang của nhà cung cấp làm tròn thành 88 phần trăm.
• Token đầu ra mỗi giây — 87 so với 35.4. Ở đây Qwen là bên chậm, và chậm hơn khoảng hai lần rưỡi.
Các cột theo từng token và cột theo từng tác vụ mâu thuẫn với nhau, và cột theo từng tác vụ mới là cột đáng tin, vì một lý do chỉ lộ ra khi bạn mở phần phân tích chi tiết chi phí. Trong lần chạy index của Step 5 Preview, 0,85 USD trong tổng 1,03 USD là phần đầu vào và 0,17 USD là phần đầu ra. Còn ở lần chạy của Qwen3.8-Max, 4,76 USD trong tổng 5,41 USD là phần đầu vào và 0,65 USD là phần đầu ra. Giá niêm yết chênh nhau khoảng gấp đôi; hóa đơn theo tác vụ chênh nhau gấp năm lần, bởi vì lần chạy Qwen đã đẩy khoảng 9,9 tỷ token đầu vào qua harness, so với 5,5 tỷ của Step 5 Preview, và vì phần lớn khối lượng đó là lưu lượng cache được đọc lại với mức chiết khấu bất kỳ mà nhà cung cấp đưa ra, thay vì theo mức giá niêm yết.
Step 5 Preview được bảng đánh giá mô tả là rất dài dòng, với khoảng 160 triệu token đầu ra trên toàn bộ bộ kiểm thử so với mức trung vị 82 triệu — và Qwen3.8-Max được mô tả bằng đúng những từ ngữ đó, ở mức khoảng 190 triệu so với cùng mức trung vị. Cả hai đều không phải là mô hình trả lời ngắn gọn. Nếu độ dài đầu ra là thứ bạn hy vọng tối ưu hóa, thì cả hai cột đều không giúp ích gì cho bạn.

Phép so sánh có một lỗ hổng, và nó có hình dạng Prime.
Mọi số liệu trong phần trước đều được đo trên ID Qwen3.8-Max tiêu chuẩn. Không có số liệu nào trong đó được đo trên Prime.
Đó không phải là chuyện kỹ thuật nhỏ. Toàn bộ luận điểm của Prime là token đến nhanh hơn, và con số tốc độ duy nhất trên bảng dành cho dòng này là 35,4 token đầu ra mỗi giây của ID tiêu chuẩn — chậm nhất trong ba ID được thảo luận ở đây với khoảng cách rất xa, và là hàng duy nhất mà Qwen3.8-Max không chỉ đắt đỏ mà còn kém hiệu suất thấy rõ. Nếu Prime đạt mức cao nhất trong dải mà Alibaba công bố, con số 35,4 đó sẽ trở thành khoảng 70, vẫn thấp hơn 87 của Step 5 Preview trong khi tốn gấp 3,7 lần cho mỗi token đầu ra. Nếu nó đạt mức thấp nhất của dải, con số đó sẽ vào khoảng 53.
Đó là những ước tính được xây dựng dựa trên một hệ số nhân do nhà cung cấp công bố, không phải các phép đo, và chúng nên được dán nhãn như vậy. Không ai mà chúng tôi có thể tìm thấy đã công bố một bài kiểm tra thông lượng độc lập cho chế độ Prime. Con số 1,5 đến 2× là của chính Alibaba, và nó là tuyên bố chịu lực duy nhất bên dưới toàn bộ hạng dịch vụ này.
Chi tiết cấu trúc duy nhất có lợi cho Prime là quy tắc điều tiết, và rất dễ bị bỏ qua khi đọc lướt. Tài liệu của Alibaba nêu rằng dưới Prime, khi khối lượng cuộc gọi đạt giới hạn tốc độ, nếu nền tảng vẫn còn tài nguyên dự phòng thì yêu cầu không bị điều tiết — vì vậy thông lượng khả dụng cho bạn không giảm xuống dưới giới hạn đã nêu. Đó là một trần mềm với sàn cứng: khi có tranh chấp, bạn nhận được giới hạn; khi dung lượng nhàn rỗi, bạn có thể nhận được nhiều hơn. Đối với một vòng lặp agent thực hiện hàng chục cuộc gọi tuần tự, điều này quan trọng hơn cả mức trung vị, bởi cuộc gọi chậm nhất quyết định thời điểm vòng lặp kết thúc. Đây cũng là lời giải thích rõ ràng nhất cho việc tại sao Prime tồn tại như một sản phẩm. Alibaba đang bán vị trí trong hàng đợi từ năng lực mà họ đã xây dựng, và tính gấp đôi cho quyền được phục vụ trước tiên từ đó.
Hai bảng giá nói gì khi bạn đặt chúng cạnh nhau
Alibaba công bố các hàng Qwen của mình liền kề nhau, khiến phép tính của hạng này rõ ràng một cách bất thường. Trên trang quốc tế, hàng Prime ghi $3.301 đầu vào và $9.902 đầu ra trên mỗi triệu token, so với $1.65 và $4.951 cho ID tiêu chuẩn và cho bản pin 0902 của nó. Đó chính xác là 2.0 ở cả hai cột — không phải một con số xấp xỉ được làm tròn mà là tỷ lệ nguyên văn của các con số đã công bố. Trang định giá tiếng Anh của StepFun liệt kê Step 5 Preview ở mức $1.00 đầu vào, $0.10 khi cache hit và $2.70 đầu ra, trong đó đầu vào cache-miss bao gồm chi phí ghi nội dung mới vào cache. Con số cache-hit được nhà cung cấp công bố là mức giảm giá 90 phần trăm; bảng độc lập ghi nhận 95 phần trăm từ cùng các tài liệu, và cần biết mình đang mô hình hóa theo cái nào trong hai cái đó.
Đặt ba thẻ vào cùng một cột là bức tranh đã rõ. Đầu ra của Prime, $9.902. Đầu ra của Standard Qwen, $6.00 trên bản ghi của bảng xếp hạng và $4.951 trên trang quốc tế của chính Alibaba. Đầu ra của Step 5 Preview, $2.70. Và ở làn giá rẻ mà không ai quảng cáo, giá đọc cache của Step 5 Preview là $0.10 so với $0.25 của Qwen — điều này quan trọng hơn cột đầu ra đối với bất kỳ tác vụ nào lặp lại tiền tố của nó.
Một lưu ý về những con số đã cũ, vì dòng sản phẩm này đã được điều chỉnh giá hơn một lần trong bảy tuần. Mức giá đầu vào $2 và đầu ra $6 được trích dẫn rộng rãi cho Qwen3.8-Max là thông tin chính khi ra mắt hồi tháng Tám, và đó vẫn là mức mà tab Singapore của Alibaba hiển thị. Các dòng quốc tế và toàn cầu hiện ghi $1.65 và $4.951. Nếu bạn đang tính toán chi phí, hãy dùng bảng giá cho khu vực của bạn và đọc lại vào ngày bạn chốt.
Hai cách đọc 2×
Vì Prime là cùng một mô hình với mức giá gấp đôi standard ID, nên phần phụ trội thì dễ định giá mà khó biện minh. Ở đầu cao nhất trong dải sản phẩm của Alibaba, bạn trả gấp 2 lần để có tốc độ gấp 2 lần, tức là trung tính về chi phí trên mỗi giây độ trễ được loại bỏ. Ở đầu thấp nhất, bạn trả gấp 2 lần để có 1,5 lần, tức mức phụ trội 33 phần trăm cho mỗi giây tiết kiệm được. Cả hai đầu đều không phi lý cho công việc tương tác; cả hai đều không thể biện minh cho một lô chạy qua đêm. Đó là lý do lời khuyên tiêu chuẩn về hạng này — các cuộc gọi nhạy cảm với độ trễ dùng Prime, mọi thứ khác dùng standard ID — cũng là lời khuyên đúng.
So sánh với Step 5 Preview là chỗ lập luận đổi hình dạng, và đây chính là phần mà cách đặt vấn đề "vs" khiến ta nhìn thấy rõ. Prime hoàn toàn không cạnh tranh với Step 5 Preview về giá. ID tiêu chuẩn vốn đã đắt hơn trên mỗi token đầu ra so với Step 5 Preview, đắt gấp năm lần trên mỗi tác vụ hoàn thành, mà lại chỉ hơn một điểm. Prime nhân lên phần chi phí của một phương trình vốn đã thua, rồi mua lại tốc độ mà Step 5 Preview có nhiều hơn một cách miễn phí. Nếu tốc độ là thứ bạn cần ở dòng này, thì phát biểu trung thực là mô hình ở phía bên kia trang này cho bạn 87 token mỗi giây với $2.70 mỗi triệu token đầu ra, còn làn nhanh cho bạn một khoảng đạt đỉnh, theo chính số liệu của Alibaba, vào khoảng 70 với $9.902.
Đó không phải là một lập luận rằng Step 5 Preview thắng. Đó là một lập luận rằng giá trị của Prime hoàn toàn nằm bên trong dòng sản phẩm của chính Alibaba, và rằng cơ sở lập luận cho nó dựa vào các khối lượng công việc mà lợi thế chỉ số một điểm của Qwen3.8-Max, ngữ cảnh 983,616 token hay hồ sơ tác vụ khác của nó làm được những việc mà ngữ cảnh 1M-token của Step 5 Preview không làm được. Đó là phép so sánh mà chưa ai có thể chạy được, bởi vì hàng Prime không tồn tại trên bất kỳ bảng độc lập nào.

Điều này có ý nghĩa gì đối với người mua
Cả hai đều không có trên OrcaRouter. Step 5 Preview có thể truy cập qua API riêng của StepFun và một vài nền tảng bên thứ ba; Prime là một gói của Alibaba Cloud Model Studio được cung cấp trên endpoint theo phạm vi workspace; và bạn có thể kiểm chứng cả hai khẳng định này với danh mục của chúng tôi ngay trong cùng phút bạn đọc chúng, một phép thử tốt hơn là chỉ tin vào lời chúng tôi.
Thứ mà chúng tôi định tuyến là một sản phẩm khác trong cùng dòng, và hoá ra nó lại chính là sản phẩm mà phép tính trong bài viết này cứ liên tục chỉ về. Qwen3.8-Max tiêu chuẩn và bản ghim theo ngày Qwen3.8-Max-0902 nằm trong danh mục trên cùng một khoá với các anh em của chúng là Qwen3.8-Max-Preview, Qwen3.8-Flash và Qwen3.8-27B, cùng với hơn 200 mô hình khác, với giá niêm yết của nhà cung cấp được chuyển tiếp ở mức đánh dấu 0 phần trăm. Có hai điều rút ra từ đó, và cả hai đều liên quan đến quyết định ở trên. Thứ nhất là việc thay đổi bảng giá tại Alibaba xuất hiện ở phía chúng tôi ngay trong ngày Alibaba công bố — đúng chính cái thuộc tính mà bạn muốn ở một nhà cung cấp vốn đã đổi giá cho dòng sản phẩm này hai lần trong bảy tuần. Thứ hai là đường cơ sở của bạn không còn là một canh bạc vào một nhà cung cấp duy nhất nữa: ID tiêu chuẩn chính là bậc mà bạn nhiều khả năng nhất sẽ giữ trên đường mặc định của mình, và việc giữ nó phía sau một lớp định tuyến thay vì tích hợp trực tiếp chính là điều khiến quyết định về Prime có thể đảo ngược theo từng endpoint thay vì theo hợp đồng.
Nếu bạn đang cân nhắc giữa hai cái tên trong tiêu đề của bài viết này, thì sự phân chia rất rõ ràng. Hãy chọn Step 5 Preview khi bạn muốn có điểm số, đầu vào video và hình ảnh cùng mức chiết khấu bộ nhớ đệm 90%, và chấp nhận rằng bạn đang thuê một bản xem trước mà checkpoint của nó chỉ là một lời hứa cho ngày 15 tháng 10 chứ không phải một giấy phép. Chỉ chọn Qwen 3.8 Max Prime nếu bạn đã cam kết với Qwen3.8-Max và đã đo lường, trên chính các prompt của mình, rằng tốc độ 35 token mỗi giây của ID tiêu chuẩn chính là thứ đang khiến bạn tốn tiền — và hãy định giá quyết định đó dựa trên mức 2× thay vì mức 1.5×, bởi vì mức cao nhất trong dải sản phẩm của một nhà cung cấp không phải là con số bạn sẽ thấy trong môi trường production.
Phép đo lẽ ra sẽ giải quyết được chuyện này thì không tồn tại, và đáng nói thẳng như vậy hơn là tô vẽ nó. Ai đó cần cho Prime chạy qua một harness cũng chạy Step 5 Preview, công bố phân phối thông lượng thay vì một hệ số nhân, và đặt con số chi phí trên mỗi tác vụ bên cạnh điểm chỉ số mà nó mua được. Cho đến lúc đó, những con số duy nhất mà cả hai bên cùng có là hai bảng giá, và chúng nói cùng một điều từ hai hướng ngược nhau: làn nhanh là cách đắt nhất để mua một token Qwen3.8-Max, và là cách chậm nhất để mua một giây thời gian thực so với mức mà lựa chọn thay thế tính cho cùng một giây.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
