Đã tạo thẻ tiêu đề cho Step 5 Preview so với NVIDIA Nemotron 3 Ultra 550B A55B với dòng chữ 'hai mươi mốt điểm chỉ số cho hai mươi xu', cùng ba chip thống kê: Chỉ số Trí tuệ Artificial Analysis 44 so với 23, giá đầu ra $2,70 so với $2,50 mỗi triệu token, và chi phí cho mỗi tác vụ chỉ số $1,03 so với $0,60. Logo OrcaRouter nằm trong một dải màu trắng ở góc dưới bên phải.
Guides & Insights

Step 5 Preview so với Nemotron 3 Ultra: Hai mươi mốt điểm chỉ số với hai mươi xu

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Một trong những mô hình này bạn có thể tải về ngay chiều nay, và nó lại chính là mô hình thua kém tới hai mươi mốt điểm. Step 5 Preview, mẫu chủ lực đóng của StepFun, đã mở API vào ngày 20 tháng 9 năm 2026 và không có tệp giấy phép nào bạn có thể nắm giữ; NVIDIA Nemotron 3 Ultra 550B A55B đã có mặt trên Hugging Face từ ngày 4 tháng 6 năm 2026 theo một giấy phép thông thoáng kèm theo công thức huấn luyện. Trên Artificial Analysis Intelligence Index, cặp đôi này đạt 44 so với 23. Về giá đầu ra, con số là 2,70 đô la so với 2,50 đô la mỗi triệu token. Hai mươi mốt điểm đổi lấy hai mươi xu không phải là một so sánh có thể ngã ngũ rõ ràng theo bất kỳ hướng nào, vì vậy đáng để làm cho đúng thay vì chỉ liếc qua hai cột tiêu đề và chọn một bên.

Không cái nào trong hai cái này là một bản ra mắt trong tuần này, và điều đó quan trọng cho cách bạn đọc các con số bên dưới. Cả hai đã có thể gọi được trong nhiều tháng nay, cả hai đều đã trải qua cùng một bộ kiểm thử độc lập, và không cái nào có thay đổi biểu phí trong khoảng thời gian này. Điều đã thay đổi thì nhỏ hơn và thú vị hơn: chỉ số mà chúng được chấm điểm đã được xây dựng lại vào tháng Chín, và hai cái đó giờ đang được đánh giá dựa trên hai trung vị khác nhau được rút ra từ hai tập hợp khác nhau. Đó mới là nơi so sánh này thực sự được định đoạt.

Hai loại sản phẩm rất khác nhau

Đọc các bảng thông số kỹ thuật cạnh nhau và điều đầu tiên nhận thấy là chúng hầu như không cùng một loại thứ.

• Tham số — Step 5 Preview có tổng cộng khoảng 600 tỷ, với 27 tỷ hoạt động trên mỗi token theo tài liệu của chính StepFun; Nemotron 3 Ultra có tổng cộng 550 tỷ, với 55 tỷ hoạt động, theo số liệu mà hội đồng độc lập ghi nhận theo cấu hình của nó.

• Kiến trúc — StepFun không công bố mô tả nội bộ cho Step 5 Preview. Card của NVIDIA ghi nhận một thiết kế lai: các lớp Mamba-2 xen kẽ, một số lớp attention được chọn lọc, một cách bố trí LatentMoE và các đầu Multi-Token Prediction.

• Cửa sổ ngữ cảnh — 1M token trên bảng thông số kỹ thuật của Step 5 Preview, với đầu ra tối đa 64.000 token, cũng được StepFun ghi nhận. Nemotron 3 Ultra được bên đánh giá đã chạy nó ghi nhận ở mức 262.144 token; thẻ nhà cung cấp quảng cáo tối đa 1M, có thể đạt được thông qua một cấu hình phục vụ chứ không phải theo mặc định.

• Đầu vào — văn bản, hình ảnh và video trên Step 5 Preview, tối đa 60 hình ảnh mỗi yêu cầu và tệp MP4 dưới 128MB. Chỉ văn bản trên Nemotron 3 Ultra.

• Kiểm soát suy luận — cài đặt mức nỗ lực thấp, trung bình và cao đã được ghi tài liệu ở phía StepFun; một cờ chat-template ở phía NVIDIA để bật hoặc tắt dấu vết suy nghĩ.

• Trọng số — không có trọng số nào được công bố cho Step 5 Preview, đây là sản phẩm độc quyền và chỉ dùng qua API, với một checkpoint BF16 mà StepFun cho biết sẽ ra mắt sau vào ngày 15 tháng 10 năm 2026. Nemotron 3 Ultra phát hành các bản dựng BF16 và NVFP4 cùng một mô hình thưởng GenRM trên Hugging Face theo OpenMDW-1.1.

• Mức sàn triển khai — không áp dụng cho mô hình API; tám GPU thuộc lớp B200 hoặc lớp GB200, hoặc mười sáu H100, đối với bản mở, theo mức tối thiểu mà nhà cung cấp quy định.

• Bảng giá — 1,00 USD đầu vào, 0,10 USD khi có cache hit và 2,70 USD đầu ra cho Step 5 Preview, từ trang định giá tiếng Anh của StepFun. Khoảng 0,60 USD đầu vào, 0,16 USD khi có cache hit và 2,50 USD đầu ra cho Nemotron 3 Ultra, và hãy lưu ý kỹ nguồn gốc của cặp số đó: NVIDIA không công bố bảng giá, nên đó là mức giá nhà cung cấp quan sát được mà hội đồng độc lập ghi nhận, không phải con số do nhà cung cấp đưa ra.

Hàng mà hầu hết mọi người coi là mang tính quyết định lại là hàng đầu tiên, và đó là hàng ít thông tin nhất trong tám hàng. Hai tổng số chỉ chênh nhau trong khoảng chín phần trăm, trong khi các tham số hoạt động lại khác nhau gấp đôi, và tham số hoạt động chính là thứ chi phối chi phí tính toán của mỗi token được tạo ra. Không con số nào trong hai con số đó dự đoán được mức chênh lệch hai mươi mốt điểm.

Generated two-column comparison scoreboard for Step 5 Preview and NVIDIA Nemotron 3 Ultra 550B A55B across six shared rows: Artificial Analysis Intelligence Index 44 against 23; output price $2.70 against $2.50 per million tokens; cost per index task $1.03 against $0.60; output speed 87 against 135.6 tokens per second; weights, 'none, BF16 checkpoint promised 15 October' against 'BF16 and NVFP4 on Hugging Face today'; and input, 'text, image and video' against 'text only'. A footer reads that index, speed and cost-per-task figures are per Artificial Analysis and that the Nemotron rate is the recorded provider listing rather than a vendor rate card. The OrcaRouter logo sits in a white strip at the bottom right.

Số trung vị là một thứ khiến bạn đọc điểm số.

Hội đồng độc lập không chấm điểm các mô hình dựa trên một lĩnh vực duy nhất. Nó xếp chúng vào các nhóm — và nhóm mà một mô hình rơi vào sẽ thay đổi câu được in bên dưới điểm số của nó, mà không làm thay đổi điểm số.

Bước 5 Bản xem trước được xếp vào lớp suy luận tổng quát, lớp mà bảng xếp hạng đếm được 227 mô hình, và trung vị của các mô hình so sánh được với nó là 26. Nemotron 3 Ultra được xếp vào lớp trọng số mở, được đếm là 117 mô hình, với trung vị là 18. Vậy cùng một bảng xếp hạng mô tả 44 là “cao hơn mức trung bình rõ rệt” và 23 là “trên mức trung bình”, và cả hai mô tả đều đúng, vì 44 vượt trung vị của nó mười tám điểm còn 23 vượt trung vị của chính nó năm điểm.

Đây không phải là một trò lừa, và cũng không phải là chuyện bảng xếp hạng chơi không công bằng. Đó là cách đúng để trình bày một mô hình mở — bạn so sánh một checkpoint có thể tải xuống với những checkpoint có thể tải xuống khác, bởi vì một đội chỉ có thể nhận một bản tải về thì không phải đang lựa chọn từ 227. Nhưng điều đó có nghĩa là bất kỳ ai trích dẫn "trên trung bình" về Nemotron 3 Ultra và "trên trung bình" về một 44 đang so sánh hai câu khác nhau với nhau. Nếu bạn muốn một con số cho cặp đó, hãy dùng chỉ số thô và chấp nhận khoảng cách hai mươi mốt điểm; nếu bạn muốn quyết định, hãy dùng hạng và thừa nhận rằng bạn đã chọn lĩnh vực của mình rồi.

Screenshot of the Artificial Analysis model page for Nemotron 3 Ultra 550B A55B (Reasoning), showing an Intelligence Index of 23 in a class of 117 open-weights models with a comparable-model median of 18, pricing of $0.60 per million input tokens and $2.50 per million output tokens with a 73 percent cache discount, an average cost of $0.60 per index task, 110 million output tokens generated during the run against a 140 million median, 135.6 output tokens per second, and a 262,144-token context window.

Những gì một harness đo được trên cả hai

Bảng số liệu của các nhà cung cấp không thể trừ lẫn nhau, vì StepFun và NVIDIA đã chạy những bộ kiểm thử khác nhau vào những ngày khác nhau, và tài liệu của NVIDIA không chứa mọi benchmark mà StepFun báo cáo. Cơ sở trung thực nằm ở phần giao nhau: những gì một đơn vị đánh giá duy nhất đã chạy với cả hai.

Trên Artificial Analysis Intelligence Index, giao điểm đó là 44 so với 23. Về chi phí trên mỗi tác vụ chỉ số đã hoàn thành, con số là 1,03 đô la so với 0,60 đô la. Về tốc độ đầu ra, điều này đảo ngược, và đảo ngược rõ rệt: 87 token mỗi giây đối với Step 5 Preview so với 135,6 đối với Nemotron 3 Ultra, cho nên mô hình đạt điểm cao gần gấp đôi lại là mô hình trả lời chậm hơn khoảng nửa giây sinh trên mỗi token.

Dòng duy nhất sắc nét nhất là Terminal-Bench 4.0. Step 5 Preview đạt 33,3 phần trăm ở đó. Nemotron 3 Ultra đạt 0,5 phần trăm. Đó không phải lỗi làm tròn ở bên nào và cũng không phải một khoảng cách tinh tế — trên bộ kiểm thử agentic-terminal cụ thể đó, mô hình chủ lực trọng số mở gần như không xuất hiện. Cái bẫy là cùng bảng xếp hạng đó cũng liệt kê chính mô hình này ở mức 53,9 phần trăm trên Terminal-Bench 2.1. Hai benchmark gần như cùng tên, hai thế hệ khác nhau của cùng một họ nhiệm vụ, và một mô hình đứng ở 53,9 trên bản cũ hơn và 0,5 trên bản mới hơn. Nếu bạn từng thấy ai đó trích dẫn một con số Nemotron trong khoảng năm mươi, thì đó là nguồn gốc của nó, và đó không phải bộ kiểm thử hiện tại.

Một sự trùng khớp đáng được nhắc đến chính vì nó hiếm. Bảng thông số của chính NVIDIA tuyên bố 87,0 phần trăm trên GPQA mà không dùng công cụ; lượt chạy độc lập đo được 86,7 phần trăm. Một con số từ nhà cung cấp và một con số bên ngoài lệch nhau ba phần mười điểm chính là dáng vẻ của một bảng đánh giá đáng tin cậy, và nó khiến mức 0,5 phần trăm trên Terminal-Bench 4.0 dễ được chấp nhận là thật hơn là một lỗi của bên đánh giá.

Tiền thực sự đi đâu trong một đợt chạy chỉ số

Giá theo token dự đoán rất ít về chi phí của một khối lượng công việc, và cặp mô hình này minh họa điểm đó rõ hơn hầu hết. Bảng xếp hạng công bố bản phân tách chi phí cho toàn bộ lần chạy chỉ số của từng mô hình, và với cả hai mô hình này, khoản mục chiếm ưu thế không phải là tạo sinh.

Mức $1.03 mỗi tác vụ của Step 5 Preview được chia thành $0.85 đầu vào và $0.17 đầu ra. Trong phần đầu vào, $0.62 là đọc bộ nhớ đệm, $0.22 là ghi bộ nhớ đệm và chỉ $0.014 là đầu vào mới, chưa được lưu đệm. Trong phần đầu ra, $0.12 là dấu vết suy luận và $0.06 là câu trả lời cuối cùng.

Mức $0.60 mỗi tác vụ của Nemotron 3 Ultra được chia thành $0.53 cho đầu vào và $0.07 cho đầu ra, và thành phần bên trong khoản đầu vào gần như là hình ảnh phản chiếu — $0.48 cho ghi bộ nhớ đệm so với chỉ $0.04 cho đọc bộ nhớ đệm.

Hai kết luận được rút ra. Thứ nhất là trong một đánh giá tầm xa với việc tái sử dụng tiền tố nhiều, khoảng tám mươi phần trăm số tiền bạn trả nằm ở phía đầu vào của sổ chi phí, khiến tỷ lệ trúng bộ nhớ đệm và kỷ luật ngữ cảnh của bạn trở thành những con số cần tối ưu thay vì độ dài đầu ra. Thứ hai là hai mô hình đi đến hóa đơn theo những cách khác nhau: Step 5 Preview đang trả tiền để đọc lại một tiền tố chung lớn, còn Nemotron 3 Ultra đang trả tiền để ghi nội dung riêng biệt vào bộ nhớ đệm ngay từ đầu. Chi phí tổng thể tương tự, nhưng hai hóa đơn khác nhau — và nếu khối lượng công việc của bạn trông giống một trong những mẫu đó hơn mẫu kia, thì thứ tự ở mức $1.03 và $0.60 có thể đảo ngược.

Các con số về độ dài dòng chữ giải thích phần còn lại của dòng kết quả. Step 5 Preview tạo ra khoảng 160 triệu token đầu ra trên toàn bộ bộ chỉ mục, so với mức trung vị là 82 triệu, mà hội đồng mô tả thẳng thừng là rất dài dòng. Nemotron 3 Ultra tạo ra 110 triệu so với mức trung vị 140 triệu, và nó được cho là khá súc tích. Mô hình rẻ hơn chính là mô hình ngắn gọn, và nó ngắn gọn theo đúng hướng quan trọng đối với hóa đơn.

Screenshot of StepFun's English documentation page for Step 5 Preview showing the specification table - model ID step-5-preview, a 1M-token context window, text, image and video input with text output, a 1M maximum input and a 64k maximum output - together with the input and video format notes listing JPG, JPEG, PNG, WebP and static GIF at up to 60 images per request and MP4, QuickTime and Matroska video under 128MB per file.

Tải xuống mang lại những gì, và cái giá phải trả để giữ lại

Giá của Nemotron 3 Ultra không phải là 2,50 đô la cho mỗi triệu token đầu ra nếu bạn lấy checkpoint. Đó là giá thuê bản triển khai của người khác. Lấy bản tải về, bạn đã mua một bộ chi phí khác và một bộ quyền khác.

Các quyền này rất cụ thể và chúng là phần mà một mô hình chỉ API không thể sánh được ở bất kỳ mức giá nào. OpenMDW-1.1 đi kèm với các trọng số, và NVIDIA công bố các bộ sưu tập dữ liệu tiền huấn luyện và hậu huấn luyện cùng các công thức huấn luyện đi kèm. Có một bản dựng NVFP4 cho cùng mô hình nhưng chỉ bằng khoảng một nửa kích thước, và các trọng số Ultra được tiền huấn luyện bằng một công thức NVFP4 thay vì được lượng tử hóa sau đó — đó là lý do bản dựng nhỏ là một artifact hạng nhất trên card chứ không phải một thử nghiệm cộng đồng. Vị thế thương mại được nêu rõ ràng: sẵn sàng cho việc sử dụng thương mại và phi thương mại.

Chi phí cũng cụ thể không kém. Cấu hình triển khai tối thiểu là tám GPU lớp B200 hoặc mười sáu H100, và đó là mức sàn mà card nêu ra chứ không phải một gợi ý. Cửa sổ ngữ cảnh bạn thực sự có được phụ thuộc vào cách bạn cấu hình phục vụ, với 256K là mặc định và 1M nằm sau một thiết lập tường minh. Một đội nhóm không thể cam kết một tủ rack thì không phải đang chọn giữa hai mô hình này ở mức giá đầu vào $1.00 và $0.60; họ đang chọn giữa một mô hình và một đơn đặt hàng.

Có một phiên bản của so sánh này mà ở đó mô hình mở thắng trên trục mà người ta nói là họ quan tâm nhưng hiếm khi định giá — sự phụ thuộc. Step 5 Preview là một endpoint bạn gọi và một nhà cung cấp bạn tin tưởng, với một checkpoint được hứa chứ chưa được phát hành. Nếu StepFun sửa bảng giá, siết chặt giới hạn, ngừng hỗ trợ ID hoặc có một tuần tồi tệ, đòn bẩy duy nhất của bạn là khả năng xử lý lỗi của chính bạn. Trọng số của Nemotron 3 Ultra đã nằm trên đĩa trong cụm của ai đó, và điều đó đáng giá thật sự ngay cả khi cùng mô hình ấy đang thua kém 21 điểm chỉ số.

Đáng để nói chính xác “promised” có nghĩa gì ở phía bên kia, bởi bức tranh còn lộn xộn hơn mức mà cả hai phe thừa nhận. Nhiều bản mirror của bên thứ ba đối với một bản dựng BF16 đã xuất hiện trên Hugging Face vào ngày 20 tháng 9, ngày API mở, một số bản vượt xa một terabyte safetensors. Đó là các bản đăng lại của cộng đồng, không phải bản phát hành của nhà cung cấp, và StepFun không công bố thông báo trọng số mở nào cùng với chúng. Điều chúng chứng minh là các trọng số đang được lưu hành và rằng checkpoint ngày 15 tháng 10 được hứa hẹn sẽ là một sự chính thức hóa thay vì một sự công bố.

Một con số đã thay đổi trong lúc chúng ta đang đọc nó

Một con số trong bài viết này đã thay đổi giữa hai lần đọc cùng một trang, và điều đó đáng để gọi tên bởi vì đó chính xác là cách một phép so sánh âm thầm trở nên lỗi thời.

Bảng độc lập cho thấy chi phí $0,71 cho mỗi tác vụ trong chỉ số đối với Step 5 Preview trong bài đưa tin ngày 9 tháng 10 năm 2026. Đọc lại vào ngày 10 tháng 10, cùng trang đó ghi $1,03. Không có gì thay đổi về mô hình trong khoảng thời gian đó, vì không có gì có thể thay đổi về trọng số của một mô hình chỉ có API qua một đêm. Cái đã thay đổi là cách hạch toán đánh giá: khi giá bộ nhớ đệm của một nhà cung cấp thay đổi, khi bên đánh giá sửa lại các giả định về việc đọc bộ nhớ đệm, hoặc khi một lần chạy được tính lại theo một tổ hợp token khác, con số trên mỗi tác vụ thay đổi còn điểm chỉ số thì không.

Vậy hãy coi chi phí cho mỗi tác vụ như một con số sống, có đóng dấu ngày tháng, chứ không phải một thuộc tính của mô hình. Mọi con số cho mỗi tác vụ trong bài viết này đều là số liệu đọc vào ngày 10 tháng 10 và được dán nhãn là như vậy. Nếu bạn đang lập ngân sách từ trang này, hãy lập ngân sách từ một con số do chính bạn thu thập vào ngày bạn chốt — và nếu bạn đang so sánh hai bài viết từ các tuần khác nhau, hãy kiểm tra ngày thu thập trước khi kết luận rằng một mô hình đã trở nên rẻ hơn.

Bạn thực sự sẽ gọi cái nào?

Nói phần khó chịu trước: OrcaRouter không định tuyến mô hình nào trong hai mô hình này. Step 5 Preview có thể truy cập thông qua API riêng của StepFun và một số nền tảng bên thứ ba, còn Nemotron 3 Ultra được phục vụ từ các endpoint riêng của NVIDIA và bởi một số nhà cung cấp, và bạn có thể đối chiếu cả hai khẳng định này với danh mục của chúng tôi ngay trong cùng phút bạn đọc chúng.

Điều còn lại là hình dạng của sự phụ thuộc chứ không phải việc chọn mô hình, và đây chính là nơi duy nhất mà một lớp định tuyến chứng minh được giá trị của nó ở đây. Một bản xem trước chỉ qua API trên một đường dẫn nhà cung cấp duy nhất chính xác là kiểu bố trí mà một buổi chiều tồi tệ ở phía nhà cung cấp trở thành sự cố ngừng dịch vụ của bạn, và biện pháp bảo hiểm rẻ chính là một mặt phẳng điều khiển có thể chuyển một yêu cầu sang phương án dự phòng đủ điều kiện ngay khi một đường dẫn nhà cung cấp suy giảm. Đó là mục đích của chuyển đổi dự phòng tự động: không phải để thay thế cho Step 5 Preview, mà là thứ bạn đặt trước những mô hình mà bạn thực sự có thể gọi, để một endpoint dành riêng cho nhà cung cấp không bao giờ là con đường duy nhất vào production. Cũng chính danh mục làm được điều đó chứa hơn 200 mô hình chỉ với một khóa và một hóa đơn, với giá niêm yết của nhà cung cấp được chuyển tiếp nguyên vẹn ở mức markup 0 phần trăm — đây là nửa còn lại của lập luận, bởi vì một thay đổi bảng giá ở bất kỳ đâu phía thượng nguồn sẽ có hiệu lực ở phía chúng tôi ngay trong cùng ngày thay vì đến kỳ gia hạn hợp đồng tiếp theo.

Nếu cả hai mô hình đều không phải là mô hình bạn sẽ gọi, thì phiên bản ngắn gọn diễn ra như sau. Hãy chọn Step 5 Preview khi bạn muốn điểm số, đầu vào video và hình ảnh cùng mức giảm giá cache 90 phần trăm, và chấp nhận rằng bạn đang thuê một bản xem trước không có giấy phép đối với trọng số và một checkpoint tháng 10 mà bạn chưa từng thấy. Hãy chọn Nemotron 3 Ultra khi trọng số quan trọng hơn điểm số — vì các ràng buộc tại chỗ, vì việc tinh chỉnh, vì một giấy phép bạn có thể đọc — và hãy dự trù ngân sách cho dàn máy trước khi dự trù ngân sách cho token, bởi vì ở mức 0,60 đô la một triệu token đầu vào, một triển khai 550 tỷ tham số chỉ rẻ nếu ai đó khác đang trả tiền cho GPU.

Điều cần để ý là ngày 15 tháng 10. Nếu StepFun công bố checkpoint BF16 mà họ đã hứa, thì sự bất đối xứng trọng tâm của bài viết này — rằng chỉ một trong hai cái này là bản tải xuống — sẽ không còn đúng nữa, và hai mươi mốt điểm chỉ số sẽ trở nên khó bị gạt đi hơn đáng kể. Nếu ngày đó bị trì hoãn, lập luận dành cho mô hình trọng số mở sẽ mặc nhiên mạnh lên, một cách rất kỳ lạ để một khoảng cách năng lực được khép lại và cũng là một cách rất phổ biến.