
Step 5 Preview so với Claude Opus 5: Bảy điểm chỉ số đổi lấy hóa đơn gấp bảy lần
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Tài liệu ra mắt của StepFun cho Step 5 Preview mở đầu bằng một tuyên bố so sánh duy nhất: một tác vụ trên nó có chi phí bằng một phần tám so với cùng tác vụ trên Claude Opus 5. Cả hai mô hình hiện đều có mặt trên cùng một bảng độc lập, nên tuyên bố đó có thể được kiểm chứng thay vì tranh cãi. Artificial Analysis đã chạy từng mô hình qua Intelligence Index v4.3.2 — mười bài đánh giá — và công bố chi phí của từng lần chạy, trong đó Claude Opus 5 được chấm ở thiết lập nỗ lực suy luận tối đa của chính nó. Step 5 Preview: 44 điểm trên chỉ số, 922,84 USD để hoàn thành lần chạy. Claude Opus 5: 51 điểm trên chỉ số, 7.274,74 USD. Đó là số tiền gấp 7,9 lần để đổi lấy 7 điểm số, và tỷ lệ mà StepFun đã đưa ra hóa ra lại chính xác. Điều mà tỷ lệ này che giấu mới là phần thú vị, vì khoảng cách chủ yếu không nằm ở giá. Đó là khoảng cách về mức độ dài dòng đang khoác lên mình bộ áo của khoảng cách về giá, và việc tách bạch hai điều đó sẽ thay đổi việc bạn nên đặt mô hình nào trước loại khối lượng công việc nào.
Hai chi phí chạy, một bảng, và những gì thực sự nằm bên trong chúng
Tổng chi phí một lượt chạy là phép so sánh đơn lẻ rõ ràng nhất hiện có ở đây, bởi cả hai mô hình đã trả lời cùng những câu hỏi trong cùng một khung kiểm thử, và không nhà cung cấp nào đưa ra con số đó. Đây cũng là con số dễ bị hiểu sai nhất, nên đáng để mổ xẻ.
• Điểm chỉ số — Step 5 Preview 44 so với Claude Opus 5 51, Claude Opus 5 được đánh giá ở thiết lập nỗ lực suy luận tối đa
• Tổng chi phí để hoàn thành chỉ mục — Step 5 Preview $922.84 so với Claude Opus 5 $7,274.74
• Giá hỗn hợp theo tỷ lệ pha trộn 7:2:1 giữa trúng bộ đệm / đầu vào / đầu ra — Step 5 Preview 0,51 USD mỗi 1 triệu token so với Claude Opus 5 3,85 USD
• Token đầu ra được tạo trong lượt chạy chỉ mục — Step 5 Preview 160M so với Claude Opus 5 140M
• Giá niêm yết — Step 5 Preview $1.00 vào / $2.70 ra so với Claude Opus 5 $5.00 vào / $25.00 ra
Nhìn vào hàng ba và hàng năm cùng nhau và phép tính không còn là so sánh giá trực tiếp nữa. Mức giá kết hợp của Step 5 Preview rẻ hơn 7,5 lần, và mức giá niêm yết rẻ hơn 5 lần ở đầu vào và rẻ hơn 9,3 lần ở đầu ra — vậy nên mức kết hợp đang tạo ra tác động mà giá đầu vào không làm được. Đó là vì mức kết hợp được tính trọng số nghiêng về đầu ra, và đầu ra là nơi hai mô hình khác biệt nhiều nhất. Claude Opus 5 tính giá gấp 9,3 lần mức giá đầu ra của Step 5 Preview, và cả hai mô hình đều ghi một lượng rất lớn: 140 triệu token đầu ra cho Claude Opus 5 so với mức trung vị 92 triệu trên các mô hình mà chỉ số chấm điểm, và 160 triệu cho Step 5 Preview so với cùng mức trung vị 92 triệu.
Vậy nên cách hiểu trung thực thì hẹp hơn so với câu "mô hình rẻ là một món hời". Step 5 Preview rẻ hơn trên mọi phương diện, và nó không phải là một mô hình tiết kiệm — nó tạo ra lượng đầu ra nhiều hơn 74% so với mô hình trung vị mà nó được đối chiếu, và đó đúng chính là hành vi mà mức giá này được cho là nhằm trừng phạt. Claude Opus 5 tạo ra nhiều hơn 52% so với mức trung vị và tính giá cao gấp 9,3 lần cho mỗi token trong số đó. Một bên gọi có giới hạn độ dài đầu ra sẽ nhận được tỷ lệ khác so với bên gọi không giới hạn.
Câu hỏi không phải là cái nào tốt hơn. Mà là điểm giao thoa nằm ở đâu.
Giả sử chỉ số này là một đại diện hợp lý cho công việc mà bạn thực sự giao — các tác vụ agent tầm xa, viết mã, sử dụng công cụ qua nhiều bước. Vậy thì điểm hòa vốn rất dễ nói ra: Claude Opus 5 phải hữu ích hơn ít nhất 7,9 lần trên mỗi tác vụ thì mới đáng với số tiền bỏ ra, mà trên chỉ số này nó chỉ hơn 7 điểm trên thang 100 điểm. Hai dữ kiện đó không nhất thiết phải cùng chỉ về một hướng, bởi khoảng cách 7 điểm trên chỉ số không có nghĩa là giỏi hơn 16% ở mọi thứ. Đó là tổng hợp của mười phép đánh giá, và thành phần cấu thành quan trọng hơn tổng số.
Đó là lý do để quan tâm đến hình dạng của hai điểm số thay vì con số tiêu đề. Kết quả Terminal-Bench 4.0 của Step 5 Preview là 33,3% — một kết quả agentic thực sự, vượt qua DeepSeek V4.1 Flash ở mức 26,8% — nhưng chưa có gì trong hồ sơ đã công bố cho thấy nó sánh ngang Claude Opus 5 trên các đánh giá tầm xa mà mô hình của Anthropic mạnh nhất. Tài liệu của chính StepFun thừa nhận điều này qua cách diễn đạt: trên ALE-CLI, FrontierFinance và DRACO, công ty xếp Step 5 Preview ở vị trí thứ hai, sau một trong hai, GPT-6 Astra hoặc Claude Opus 5, và xếp trên các mô hình mở khác trong so sánh. Vị trí thứ hai với mức giá bằng một phần năm là một kết quả thực sự tốt. Nó cũng không phải vị trí thứ nhất, và những tác vụ mà một mô hình về nhì thường là những tác vụ cần vị trí thứ nhất.
Sự bất đối xứng còn lại nằm ở điều xảy ra khi mô hình đưa ra một phán đoán sai. Một câu trả lời sai từ một mô hình rẻ tiền, chỉ mất bốn giây và 2.000 token, thì bạn chỉ tốn thêm một lần thử lại; cũng câu trả lời sai đó từ Claude Opus 5 với giá 25 đô la cho mỗi triệu token đầu ra lại khiến bạn tốn một lần thử lại cộng thêm cả phần suy xét. Nếu pipeline của bạn thử lại khi gặp lỗi — hầu hết các vòng lặp agent đều làm vậy — thì chi phí thực tế cho mỗi tác vụ thành công mới là con số đáng quan tâm, và nó không có cùng tỷ lệ với giá niêm yết, bởi hai mô hình sẽ không thất bại ở cùng một tỷ lệ. Chưa ai công bố con số đó cho Step 5 Preview.

Đối chiếu thông số kỹ thuật, theo từng khía cạnh
• Điểm chỉ số — Step 5 Preview 44 so với Claude Opus 5 51, cả hai đều trên Intelligence Index v4.3.2, Claude Opus 5 ở thiết lập nỗ lực suy luận tối đa
• Giá trên 1M token — Step 5 Preview $1.00 vào / $2.70 ra so với Claude Opus 5 $5.00 vào / $25.00 ra
• Giảm giá cache — Step 5 Preview 95% so với Claude Opus 5 90%
• Ngữ cảnh — cả hai đều 1M token; StepFun chưa công bố mức trần đầu ra còn của Anthropic là 128K
• Đầu vào — cả hai đều nhận văn bản và hình ảnh; cả hai chỉ xuất ra văn bản
• Tốc độ xuất — Step 5 Preview 99.8 token/giây so với Claude Opus 5 55.3 token/giây
• Bề mặt điều khiển — Step 5 Preview cho phép extended thinking; Claude Opus 5 thay thế temperature và top_p bằng một núm điều chỉnh nỗ lực suy luận thích ứng
• Trọng số — Bản xem trước Step 5 đã đóng hôm nay, checkpoint BF16 dự kiến vào ngày 15 tháng 10; Claude Opus 5 vẫn độc quyền trong suốt thời gian
• Bằng chứng độc lập — cả hai đều được chấm điểm bởi Artificial Analysis; các dòng benchmark agentic của StepFun do nhà cung cấp tự chạy và chưa được tái lập
Hai hàng đáng để lưu ý. Khoảng cách tốc độ là có thật và trên thực tế lớn hơn mức bảng biểu gợi ra: 99,8 token mỗi giây so với 55,3 là một mô hình hoàn thành nhanh gấp đôi trên cùng một đầu ra, và thời gian đến token đầu tiên của Step 5 Preview là 2,96 giây so với 56,84 giây của Claude Opus 5 trên cùng một bảng là một mức độ khác hẳn — dù con số thứ hai đang đo cấu hình suy luận nỗ lực tối đa, nơi mô hình cân nhắc trước khi phát ra bất cứ thứ gì. Đó không phải là độ trễ mà một lệnh gọi production thấy. So với endpoint tiêu chuẩn, danh mục của chính chúng tôi báo cáo thời gian đến token đầu tiên p50 là 6,73 giây cho Claude Opus 5, đây là con số để lập kế hoạch dựa vào nếu bạn không cố ý yêu cầu mức suy luận tối đa.
Dòng chiết khấu bộ nhớ đệm là dòng âm thầm quyết định các khối lượng công việc lặp lại, và nó nghiêng về Step 5 Preview, 95% so với 90%. Một vòng lặp agent gửi lại cùng một lời nhắc hệ thống và ngữ cảnh kho lưu trữ trong mỗi lần gọi thì gần như tồn tại hoàn toàn nhờ mức chiết khấu đó, nên chênh lệch năm điểm sẽ cộng dồn qua một phiên dài.

Nơi Claude Opus 5 vẫn là câu trả lời duy nhất
Không có gì ở trên phản bác mô hình của Anthropic. Nó tốn kém đúng với cái giá của nó vì nó làm được điều mà chỉ số đang cố đo lường, và nó làm điều đó ở gần đỉnh bảng — 51 điểm trên Intelligence Index v4.3.2, hơn Step 5 Preview bảy điểm và chỉ còn cách những kẻ dẫn đầu của thế hệ hiện tại một quãng ngắn. Những khối lượng công việc mà khoảng cách tổng hợp 7 điểm còn đánh giá thấp sự khác biệt chính là những trường hợp không dung thứ cho một câu trả lời xếp thứ hai: một cuộc tái cấu trúc kéo dài nhiều giờ nơi chế độ thất bại là một thay đổi hành vi tinh vi, một mô hình tài chính nơi chuỗi lập luận phải có thể kiểm toán được, một đợt di trú nơi một quyết định sai bị phát hiện một tuần sau đó. Trong những trường hợp đó, việc thử lại không hề rẻ, và sự cân nhắc kỹ lưỡng chính là sản phẩm.
Những khối lượng công việc mà khoảng cách không hề quan trọng chính là những khối được dựng nên từ nhiều quyết định nhỏ: các bước phân loại và định tuyến, trích xuất, tóm tắt, khung kiểm thử, hàng nghìn lệnh gọi mà một agent thực hiện giữa hai lệnh gọi thực sự quan trọng. Với những khối đó, một mô hình ở mức 44 trả lời trong một nửa thời gian với chi phí đầu vào chỉ bằng một phần năm thì không phải là một sự đánh đổi. Đó là mặc định đúng đắn, còn mô hình đắt tiền được để dành cho bước buộc phải chính xác.
Thực hiện việc tách mà không cần chạy hai tích hợp
Phiên bản thực tiễn của so sánh này là một pipeline phân tầng, và lý do các đội ngũ không xây dựng một cái như vậy là do khâu mua sắm chứ không phải kỹ thuật — hai nhà cung cấp, hai hợp đồng, hai SDK, hai khóa cần luân chuyển. Claude Opus 5 có trong danh mục của chúng tôi với giá 5,00 USD và 25,00 USD, và những mô hình văn bản rẻ hơn mà bạn sẽ đặt phía trước nó cũng nằm trong cùng danh mục đó, tất cả đều nằm sau một khóa duy nhất cho hơn 200 mô hình, với giá niêm yết của nhà cung cấp được chuyển nguyên ở mức chênh lệch 0%. Step 5 Preview không có trong danh sách đó — nó chạy trên API riêng của StepFun, và cho đến khi trọng số được phát hành thì đó là nơi duy nhất nó chạy. Việc kết hợp phân tầng giữa các mô hình mà chúng tôi thực sự định tuyến là một biểu thức routing-DSL chứ không phải một thay đổi mã — gửi các cuộc gọi thông thường tới mô hình nhỏ, chuyển lên mô hình đắt tiền khi thỏa điều kiện về độ tin cậy hoặc độ phức tạp, và giữ cả hai chặng phía sau cùng một endpoint.
Tự động chuyển đổi dự phòng quan trọng ở đây vì một lý do cụ thể, chứ không phải như một tính năng chung. Step 5 Preview đã mở API của mình ngay trong ngày công bố mà không công bố trọng số và không tiết lộ hạ tầng phục vụ; đây là một endpoint preview mới chỉ vài ngày tuổi, và các endpoint preview bị giới hạn về năng lực theo cách mà những endpoint trưởng thành không bị. Claude Opus 5 được phục vụ bởi nhiều nhà cung cấp độc lập, đó chính là sự dư thừa mà một bản preview không thể mang lại. Giữ một mô hình đã được chứng minh làm chặng dự phòng — về phía chúng tôi, điều đó nghĩa là một mô hình production từ danh mục, chứ không phải bản preview — là cách bạn có được tín hiệu chất lượng thực sự trên chính khối lượng công việc của mình mà không khiến đường đi production của bạn phụ thuộc vào một hạ tầng vẫn đang trong quá trình định cỡ.

Quy tắc quyết định
Nếu khối lượng công việc của bạn là một số ít tác vụ rất khó, thì Claude Opus 5 không phải là lựa chọn đắt đỏ — nó là lựa chọn rẻ, bởi vì câu trả lời tốt thứ hai tốn kém hơn cả phần chênh lệch. Nếu khối lượng công việc của bạn là một lượng lớn các tác vụ thông thường với một số ít tác vụ khó xen lẫn trong đó, thì Step 5 Preview ở mức $1.00 và $2.70 cùng mức chiết khấu bộ nhớ đệm 95% là mặc định tốt hơn, và khoảng cách 7 điểm phần lớn chỉ là sai số làm tròn đối với công việc không cần đến nó.
Điều sẽ thay đổi phép tính đó là bằng chứng độc lập về tỷ lệ thất bại và về các hàng agentic tầm xa. Các con số của chính StepFun đặt mô hình ở vị trí thứ hai trên những đánh giá mà họ xây dựng quanh buổi ra mắt, và chưa có bên thứ ba nào tái lập được chúng. Hãy để ý checkpoint ngày 15 tháng 10 ở hai điểm: liệu giấy phép có cho phép tinh chỉnh để bạn thu hẹp khoảng cách 7 điểm trên dữ liệu của chính mình hay không, và liệu tính dài dòng có giữ nguyên khi hậu tố preview được gỡ bỏ hay không. Điều thứ nhất sẽ thay đổi tỷ lệ; điều thứ hai đã từng làm thay đổi nó một lần rồi.
