
Step 5 Preview được công bố: Mô hình chủ lực 600B của StepFun thực sự được phát hành với những gì, và những gì vẫn còn thiếu
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
StepFun đã công bố Step 5 Preview vào ngày 20 tháng 9 năm 2026 — một mô hình chủ lực mixture-of-experts thưa với 600 tỷ tham số, 27B tham số hoạt động cho mỗi token, cửa sổ ngữ cảnh 1M token, đầu vào hình ảnh gốc và điểm Chỉ số Trí tuệ Artificial Analysis là 44. API đã mở cùng ngày. Thứ không mở chính là bản thân mô hình: kho lưu trữ Hugging Face stepfun-ai/Step-5-Preview-BF16 đã tồn tại vào buổi chiều ngày công bố và chỉ chứa đúng một tệp, .gitattributes, không có trọng số, không có giấy phép, không có thẻ mô hình và không có cấu hình. Các tài liệu của chính StepFun đưa ra thời điểm phát hành trọng số mở là ngày 15 tháng 10 năm 2026. Vậy nên tóm tắt trung thực trong một dòng về lần ra mắt này là mô hình có thể gọi được ngay hôm nay và có thể tải xuống trong khoảng ba tuần rưỡi nữa, và đó là hai chuyện khác nhau. Đây cũng chính là mô hình mà blog này đã đưa tin sớm hơn trong ngày hôm nay như một rò rỉ chưa được công bố, được đánh giá theo một thẻ kiểm thử trước khi StepFun công bố trang sản phẩm — một lời nhắc hữu ích rằng một bản xem trước có thể chuyển từ rò rỉ sang ra mắt mà không có một con số nào thay đổi.
Repo chỉ là một chỗ giữ chỗ, và đó là toàn bộ câu chuyện.
Khi một nhà cung cấp công bố trọng số, kho lưu trữ chính là bằng chứng. Nó có tệp giấy phép, tệp cấu hình chứa số lượng tham số, README với mục đích sử dụng dự kiến và bảng đánh giá, cùng các phân đoạn safetensors mà tổng kích thước cho bạn biết liệu tuyên bố về tham số có thật hay không. stepfun-ai/Step-5-Preview-BF16 không có bất kỳ thứ nào trong số đó. Bản ghi API Hugging Face của nó cho thấy dấu thời gian tạo là 2026-09-20T03:52Z, không lượt tải xuống, hai lượt thích, đối tượng cấu hình rỗng, không có pipeline_tag, không có giấy phép và chỉ một tệp anh em duy nhất. Trang tổ chức StepFun có liệt kê nó, và không liệt kê bất kỳ kho lưu trữ Step 5 nào khác — không có bản dựng FP8, không có bản dựng NVFP4, không có GGUF, không có bất kỳ biến thể lượng tử hóa nào đi kèm Step-3.7-Flash vào tháng Sáu.
Hãy hiểu điều đó như một vấn đề lịch trình, chứ không phải một bí ẩn. Hậu tố BF16 trong tên repo chính là manh mối: một phòng thí nghiệm có ý định công bố checkpoint bfloat16 trước — định dạng mà bạn tinh chỉnh và lượng tử hóa từ đó, trước khi các bản dựng phục vụ FP8 và NVFP4 xuất hiện — sẽ đặt tên repository như vậy ngay khi tạo và điền nội dung vào sau. StepFun đã nói ngày 15 tháng 10 trong tài liệu công bố của chính họ. Cho đến lúc đó, repository chỉ là một tuyên bố về ý định, và điều duy nhất nó chứng minh là StepFun đã đăng ký giữ không gian tên.
Điều này quan trọng vì một lý do thực tế. PreviewHậu tố {{2}}Preview{{/2}} và việc thiếu các trọng số là cùng một tín hiệu chỉ về cùng một hướng: mô hình có thể gọi được, giá đã được ấn định, và sản phẩm mà bạn sẽ chạy trên phần cứng của riêng mình vẫn chưa tồn tại. Bất kỳ kế hoạch nào giả định có một Step 5 Preview tự vận hành trước giữa tháng Mười đều là kế hoạch không có sản phẩm thực tế nào đằng sau.
Điều gì đã thực sự được công bố
Cách định vị của StepFun hẹp và cụ thể: Step 5 Preview là một mô hình nền tảng cho công việc agentic trong thế giới thực — lập trình AI, kỹ thuật phần mềm, công việc tri thức chuyên môn và tài chính — với trọng tâm là ngữ cảnh dài, gọi công cụ nhiều lượt và thực thi bền bỉ thay vì chất lượng hội thoại. Công ty đã bỏ qua hoàn toàn dòng Step 4.x, đi thẳng từ Step-3.7-Flash lên Step 5, và bản thân điều đó là một tuyên bố về việc họ xem đây là một bước tiến lớn đến mức nào.
Một chi tiết về ngày tháng đáng lưu ý, vì đây là kiểu thông tin có thể làm rối lịch mua sắm: Artificial Analysis định ngày cho mô hình này là 18 tháng 9 năm 2026, trước thông báo của chính StepFun hai ngày. Bảng xếp hạng chấm điểm một mô hình khi có thể truy cập được mô hình đó, và khoảng cách hai ngày ấy là độ trễ thông thường giữa lúc một mô hình có thể gọi được và lúc nhà cung cấp viết về nó. Thông báo của StepFun — ngày 20 tháng 9, với API và Studio mở cùng ngày — là ngày nên viện dẫn, còn ngày 15 tháng 10 của trọng số đến từ cùng những tài liệu đó.
Đặc tả như đã công bố:
• Tổng số tham số — 600B, hỗn hợp chuyên gia thưa
• Hoạt động trên mỗi token — 27B, khoảng 4,5% tổng số, một tỷ lệ thưa thớt bất thường
• Cửa sổ ngữ cảnh — 1M token
• Đầu vào — văn bản và hình ảnh nguyên bản; đầu ra chỉ có văn bản
• Lập luận — có, với suy nghĩ mở rộng
• Giá — $1.00 cho mỗi triệu token đầu vào, $2.70 cho mỗi triệu token đầu ra, cùng mức giảm giá 95% cho cache
• Tính khả dụng — API và Studio mở từ ngày 20 tháng 9; trọng số dự kiến vào ngày 15 tháng 10
Tuyên bố về hiệu quả mà StepFun đang dẫn dắt là việc phân tách 600B/27B đưa mô hình lên biên Pareto — năng lực trên mỗi đơn vị tính toán — và công ty khung hóa đó như ba thế hệ của cùng một mục tiêu theo đuổi, từ Step-3.5-Flash qua Step-3.7-Flash đến phiên bản này. Đó là một câu chuyện mạch lạc, và tỷ lệ thưa chính là cơ chế: với 27B hoạt động, chi phí phục vụ trên mỗi token nằm trong dải của một mô hình nhỏ hơn nhiều, trong khi tổng 600B chủ yếu là vấn đề dung lượng bộ nhớ.
Các tuyên bố của nhà cung cấp và những con số của bên thứ ba bên cạnh chúng
Hai nhóm số xuất hiện trong tài liệu ra mắt, và chúng không nên được đọc theo cùng một cách. Các đánh giá của chính StepFun là nhóm thứ nhất: tuyên bố chi phí cho một tác vụ đơn lẻ bằng một phần tám của Claude Opus 5; vị trí thứ hai sau GPT-6 Astra hoặc Claude Opus 5 trên ALE-CLI, FrontierFinance và DRACO; một lần chạy tối ưu hóa kernel GPU kéo dài 24 giờ giúp nâng hiệu năng đỉnh của kernel MLA lên 508 TFLOPS so với 493 của Claude Opus 5; một thí nghiệm hậu huấn luyện tự động đưa Qwen3-30B-A3B từ 53,3% lên 60% trên AIME24; DeepSWE v1.1 đạt 67,7% và StepCodeBench nội bộ của họ đạt 49,0%. StepFun tự xây dựng StepCodeBench — 553 kho mã, chín loại tác vụ, 33 ngôn ngữ lập trình — khiến nó trở thành một công cụ hợp lý để đo mô hình của chính mình chứ không phải một công cụ độc lập.
Lớp thứ hai được người khác đo lường, và đó là phần cần tính toán để đối phó. Artificial Analysis cho Step 5 Preview 44 điểm trên Intelligence Index v4.3.2, xếp nó thứ 24 trong số 200 mô hình — ngang bằng Kimi K3, kém GLM-5.3 một điểm, và ngang bằng với thiết lập mức nỗ lực suy luận trung bình của Claude Opus 5. Trên Terminal-Bench 4.0, cùng bảng này ghi nhận 33,3%, cao hơn DeepSeek V4.1 Flash ở 26,8% và cao hơn hẳn Kimi K3 ở khoảng 12,6%. Tốc độ đầu ra đo được 99,8 token mỗi giây và thời gian đến token đầu tiên là 2,96 giây — cả hai đều từ cùng một lần chạy độc lập, và đều thuộc loại con số quyết định liệu vòng lặp agent có mang lại cảm giác tương tác hay không.
Một con số của bên thứ ba lại đi theo hướng ngược lại và xứng đáng được đặt bên cạnh mức giá. Cùng một lượt chạy chỉ mục đã dùng 160M token đầu ra cho Step 5 Preview, so với mức trung vị 92M trên các mô hình được chấm điểm — mô hình này dài dòng. Ở mức $2,70 mỗi triệu token đầu ra, sự dài dòng đó không hề miễn phí: 160M token đầu ra tương đương khoảng $432 trong tổng $922,84 mà lượt chạy tiêu tốn, và trên một mô hình tính giá cao gấp ba lần, nó sẽ là dòng chiếm phần lớn trên hóa đơn. Một mức giá công bố thấp và số token cao cho mỗi tác vụ là hai nửa của cùng một con số, và chi phí cho mỗi tác vụ chỉ mục — $0,71 — chính là con số đã chứa cả hai.

Những gì vụ rò rỉ làm đúng, và một điều mà nó chưa giải quyết
Bài đưa tin trước đó của blog này được viết từ một lượt chạy đánh giá xuất hiện trước bất kỳ thông báo nào, và nó đã đánh dấu những tuyên bố mà mình không thể xác nhận. Thông báo đã giải đáp hầu hết số đó. Cặp 600B/27B giờ đây được nhà cung cấp công bố thay vì chỉ được suy đoán. Cửa sổ ngữ cảnh 1M token giờ đây nằm trong thông số kỹ thuật của chính StepFun thay vì chỉ trên một bảng của bên thứ ba. Giá $1.00 và $2.70 chính là mức giá. Tên gọi là Step 5 Preview, không phải một phương án thay thế được đồn đoán.
Điều mà thông báo không làm được là giải quyết mâu thuẫn về cửa sổ ngữ cảnh mà các tin bài về rò rỉ đã nêu ra. Một cấu hình bên thứ ba riêng biệt đang lưu hành trong công cụ dành cho nhà phát triển liệt kê mô hình ở mức 350.000 token ngữ cảnh với đầu ra tối đa 64.000 token. Cửa sổ 1M và cửa sổ 350k là những sản phẩm khác nhau với chi phí bộ nhớ khác nhau, và mức trần đầu ra 64k là một ràng buộc cứng đối với đúng loại công việc tác tử tầm xa mà mô hình này đang được bán để phục vụ. Thông báo của StepFun nói 1M và không đề cập đến giới hạn đầu ra. Đáng để biết xem định tuyến của bạn rốt cuộc chạy trên cái nào trước khi bạn xây dựng một pipeline phụ thuộc vào câu trả lời, và đó là câu hỏi dành cho tài liệu của nhà cung cấp chứ không phải cho bảng xếp hạng.
Điều khác nữa mà buổi ra mắt không thay đổi là khả năng tái lập độc lập. Mọi dòng điểm chuẩn ở trên không phải từ Artificial Analysis đều là của chính StepFun, chạy trên các harness của StepFun, và chưa có bên thứ ba nào tái lập được các kết quả agentic. Mô thức từ các flagship của phòng thí nghiệm Trung Quốc năm nay là chỉ số tổng hợp vẫn đứng vững, còn các dòng nổi bật của nhà cung cấp thì lệch đi; hãy coi chỉ số tổng hợp là con số để lập kế hoạch.
Những gì bạn có thể gọi ngay hôm nay, và những gì cần chuyển hướng trong lúc chờ đợi
Step 5 Preview không có trong danh mục của chúng tôi, và OrcaRouter không định tuyến nó — có một API công khai và một Studio ở phía StepFun, và đó chính là nơi nó chạy. Thứ chúng tôi có là tập hợp các mô hình mà nó đang được đo lường so sánh, nằm sau một khóa duy nhất: DeepSeek V4.1 Flash ở mức $0.15 cho đầu vào và $0.60 cho đầu ra mỗi triệu token, GLM-5.3 ở mức $1.26 và $3.96 so với $1.40 và $4.40 mà Z.ai niêm yết, Claude Opus 5 ở mức $5.00 và $25.00, cùng với Kimi K3 bên cạnh. Đó là hình dạng thực tế của ba tuần tới: một bản xem trước để bạn có thể đánh giá chuẩn, và một bộ mô hình production mà bạn thực sự có thể dựa vào, có thể truy cập qua một API cho hơn 200 mô hình với giá niêm yết của nhà cung cấp được chuyển nguyên ở mức markup 0% — vì vậy nếu giá của StepFun thay đổi trước tháng Mười, con số bạn phải trả cũng thay đổi theo ngay trong cùng ngày, chứ không phải đến kỳ gia hạn mới đổi.
Chuyển đổi dự phòng tự động có giá trị hơn mức thông thường trong giai đoạn này, vì kiểu hỏng của một bản xem trước không phải là nó dở — mà là nó bị giới hạn công suất. Một mô hình mở API ngay ngày công bố và chưa có trọng số là mô hình mà đội máy chủ phục vụ vẫn đang được xây dựng, và một endpoint xem trước suy giảm hiệu năng lúc 2 giờ sáng sẽ kéo theo cả vòng lặp agent của bạn. Đặt bản xem trước phía sau một router với một mô hình đã được chứng minh làm phương án dự phòng, và bạn có được tín hiệu chất lượng trên chính khối lượng công việc của mình mà không đặt cược đường đi production vào một đội máy chủ chưa được kiểm chứng.

Ngày quan trọng là ngày 15 tháng 10
Mọi điều ở trên chỉ mang tính tạm thời theo một cách cụ thể: trọng số mới là thứ khiến một mô hình trở nên vĩnh viễn. Một bản xem trước đóng với giá $1.00 và $2.70 là một mức giá tốt đến từ một nhà cung cấp duy nhất, còn một checkpoint BF16 theo một giấy phép được công bố là mức giá mà không một nhà cung cấp đơn lẻ nào còn kiểm soát được nữa. StepFun đã cam kết chọn phương án thứ hai cho ngày 15 tháng 10, và tên repository mà họ đã đặt trước cho thấy bfloat16 đứng đầu.
Điều đáng theo dõi trong khoảng thời gian tới rất hẹp và có thể kiểm chứng. Kho lưu trữ có được lấp đầy không — và với giấy phép nào? Một tệp cấu hình có xác nhận tổng 600B và 27B hoạt động không? StepFun có công bố mức trần đầu ra cùng với cửa sổ ngữ cảnh, qua đó giải quyết câu hỏi 350k/64k không? Mức giá có giữ nguyên khi bản xem trước không còn hậu tố không? Bốn câu trả lời đó quyết định liệu Step 5 Preview trở thành mô hình bạn tự vận hành, mô hình bạn thuê, hay mô hình bạn đánh giá một lần rồi bỏ qua. Cho đến khi kho lưu trữ có nhiều hơn một .gitattributes trong đó, thông báo này mới chỉ là khởi đầu của câu chuyện chứ chưa phải kết thúc.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
