
Step 5 Preview: Mẫu flagship 600B chưa được công bố của StepFun đã có mặt trên bảng xếp hạng
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Step 5 Preview có thứ hạng trên bảng xếp hạng, một mức giá đã được công bố, tốc độ đầu ra được đo lường và điểm Chỉ số Thông minh là 44 — cùng số điểm với Kimi K3, một mô hình có kích thước lớn hơn nó khoảng năm lần. Điều mà nó không có chính là một buổi ra mắt. StepFun chưa công bố nó, tài liệu nền tảng của chính StepFun cũng không liệt kê nó, và không có trọng số nào để tải về. Mọi con số dưới đây đều đến từ một bên thứ ba đã được cấp quyền truy cập trước khi nhà cung cấp nói bất cứ điều gì một cách công khai, khiến đây trở thành một bài viết tổng hợp những gì chúng ta biết cho đến nay thay vì một bài đánh giá. Hãy đọc những con số này như bằng chứng về những gì sắp tới, chứ không phải như một bảng thông số kỹ thuật.
Vụ rò rỉ chính là câu chuyện.
Dấu vết công khai đầu tiên của Step 5 Preview là một lần chạy đánh giá. Artificial Analysis có một trang mô hình trực tiếp dành cho nó, được chấm điểm qua API riêng của StepFun dưới thẻ kiểm thử step-5-preview-b, với nền tảng ghi ngày của mô hình là 18 tháng 9 năm 2026. Trang đó chính là nguồn của con số 44, mức giá, phép đo tốc độ và các hàng điểm chuẩn trong bài viết này.
Ngược lại với điều đó, phía nhà cung cấp lại trống rỗng. Tài liệu dành cho nhà phát triển của StepFun liệt kê các mô hình tối đa đến Step 3.7 Flash và Step 3.5 Flash rồi dừng lại — không có step-5, không có mục xem trước. Tổ chức Hugging Face stepfun-ai không có kho lưu trữ Step 5, điều này nhất quán với một mô hình chủ lực đóng trọng số thay vì một sự sơ suất. Các báo cáo cộng đồng trên diễn đàn nhà phát triển Trung Quốc chỉ ra khả năng ra mắt tại sự kiện AGI Frontier ở Thượng Hải vào ngày 19 tháng 9, tức khoảng một ngày sau khi các đánh giá xuất hiện. Tính đến thời điểm viết bài, không ai ngoài StepFun có thông số kỹ thuật chính thức, mức giá chính thức hay tên chính thức cho phiên bản phát hành.
Cách đặt tên tự nó đã là manh mối đầu tiên cho thấy đây là bản xem trước chứ không phải một màn ra mắt chính thức. StepFun đã bỏ qua hoàn toàn dòng Step 4.x và nhảy thẳng lên Step 5. Một mô hình được phát hành dưới hậu tố Preview, được đánh giá chuẩn trước cả khi có trang sản phẩm, là mô hình mà nhà cung cấp vẫn đang hiệu chỉnh — giá cả, định tuyến và các giới hạn đều có thể thay đổi trước khi được phát hành rộng rãi.
Đặc tả trông như thế nào, theo như bất kỳ ai có thể nhận định
Đây là những con số đang lan truyền, và chúng là những tuyên bố được nhắc đi nhắc lại nhiều nhất của vụ rò rỉ — điều đó không đồng nghĩa với việc chúng là những tuyên bố được xác nhận nhiều nhất:
• Tổng số tham số — khoảng 600B, so với khoảng 2,8T của Kimi K3
• Được kích hoạt cho mỗi lần suy luận — khoảng 27B, xấp xỉ 4,5% tổng số, một tỷ lệ hỗn hợp chuyên gia thưa thớt bất thường
• Các phương thức đầu vào — văn bản và hình ảnh; đầu ra chỉ là văn bản
• Lập luận — có, với suy nghĩ mở rộng
• Cửa sổ ngữ cảnh — 1M token trên Artificial Analysis; một cấu hình bên thứ ba riêng đang lưu hành trong bộ công cụ dành cho nhà phát triển ghi 350.000 với đầu ra tối đa 64.000
• Tính khả dụng của trọng số — đóng, không có kho lưu trữ
Mâu thuẫn về cửa sổ ngữ cảnh đó đáng được nêu rõ ràng, vì chưa có ai giải quyết nó. Cửa sổ 1M token và cửa sổ 350k token là những sản phẩm khác nhau với chi phí bộ nhớ khác nhau, và con số thứ hai đi kèm giới hạn đầu ra 64k mà con số thứ nhất không hề đề cập. Nếu bạn đang lên kế hoạch xây dựng pipeline tài liệu dài dựa trên con số 1M, thì cấu hình 350k chính là lý do để chờ trang của nhà cung cấp. Số lượng tham số cũng có độ mơ hồ tương tự: trình theo dõi của DataLearner vẫn ghi kiến trúc MoE và số lượng tham số cho Step 5 Preview là không có sẵn, nghĩa là cặp 600B/27B — chi tiết được trích dẫn nhiều nhất về mô hình này — cũng là một trong những điều ít được xác nhận chính thức nhất.
Con số thú vị là 27B, không phải 600B.
Các mô hình mixture-of-experts thưa chỉ dùng tính toán cho những expert mà một token thực sự được định tuyến tới, vì vậy con số được kích hoạt chính là con số chi phối cách mô hình hoạt động trong môi trường production. Ở mức khoảng 27B hoạt động, Step 5 Preview đang thực hiện khối lượng tính toán trên mỗi token ngang với các mô hình chỉ bằng một phần nhỏ kích thước của nó, trong khi tổng 600B phần lớn chỉ là vấn đề dung lượng bộ nhớ.
Hai hệ quả kéo theo, và cả hai đều thể hiện trong các phép đo của bên thứ ba. Chi phí phục vụ bám theo số tham số được kích hoạt, và đó là một phần lý do vì sao mức giá lại như hiện tại. Và tốc độ trên mỗi token cũng được hưởng lợi: Artificial Analysis đo được 99,8 token đầu ra mỗi giây, xếp thứ 42 trong số 200 mô hình, so với mức trung vị là 64,6. Thời gian đến token đầu tiên là 2,96 giây, so với mức trung vị khoảng 3,57 giây. Nếu tỷ lệ chia 600B/27B là chính xác, đây là một mô hình được thiết kế để rẻ khi phục vụ thay vì rẻ khi vận hành máy chủ — một khác biệt quan trọng nếu bạn là người trả tiền cho GPU chứ không phải cho token.
Nó xếp ở đâu trên Intelligence Index
Artificial Analysis cho Step 5 Preview 44 điểm trên Intelligence Index v4.3, chỉ số bao gồm mười bài đánh giá. Đó là vị trí thứ 25 trong số 200 mô hình trên bảng xếp hạng và cao hơn hẳn mô hình trung vị mà chỉ số này chấm điểm, vốn nằm ở mức 25.
• Chỉ số Trí tuệ — Step 5 Preview 44 vs Kimi K3 44
• Ngay phía trên — GLM-5.3 và Claude Opus 5, cả hai đều ở mức 45
• Ngay bên dưới — DeepSeek V4.1 Flash ở mức 40 và DeepSeek V4 Pro ở mức 36
• Terminal-Bench 4.0 — Step 5 Preview đạt 33,3% so với Kimi K3 ở mức khoảng 12,6%, và so với DeepSeek V4.1 Flash ở mức 26,8%
• SciCode — 59% cho Step 5 Preview, ngang bằng với Kimi K3
• Tốc độ đầu ra — 99,8 token mỗi giây so với trung vị của lĩnh vực là 64,6
Điểm đáng chú ý nhất là việc ngang bằng với Kimi K3, và cách đọc trung thực thì hẹp hơn những gì các tiêu đề gợi ý. Sánh ngang một mô hình 2.8T tham số trên một chỉ số tổng hợp ở mức tổng 600B là một kết quả hiệu quả thực sự, nhưng chỉ số tổng hợp che giấu hình dạng của nó: khoảng cách Terminal-Bench 4.0 nghiêng về Step 5 Preview là rất lớn, trong khi kết quả SciCode là ngang tài ngang sức. Ngang bằng trên chỉ số tổng hợp không có nghĩa là ngang bằng ở mọi nơi, và một bản dựng preview là thời điểm kém đáng tin cậy nhất để giả định rằng các khoảng cách sẽ giữ nguyên.
Một điểm sai lệch nữa đáng được nêu tên: Artificial Analysis báo cáo 44, trong khi trình theo dõi độc lập của DataLearner ghi nhận cùng lần chạy đó là 43.6. Đó là khác biệt do làm tròn chứ không phải bất đồng về năng lực, nhưng nó là kiểu chi tiết làm nổi bật vấn đề về các con số của mô hình này nói chung — chúng là các kết quả đọc từ bên thứ ba về một mô hình chưa được công bố, được thực hiện ở những thời điểm hơi khác nhau, và không con số nào trong đó đã được StepFun xác nhận. Không benchmark nào trong số này do nhà cung cấp báo cáo, điều này có cả hai mặt: không ai ở StepFun tuyên bố một con số nào ở đây, và cũng không ai ở StepFun đứng ra bảo chứng cho một con số nào.

Cái giá, và sự dài dòng ăn mòn nó
Giá cả là phần của vụ rò rỉ này sẽ ảnh hưởng đến ngân sách sớm nhất. Thông qua API của StepFun, Artificial Analysis ghi nhận như sau:
• Đầu vào — $1.00 mỗi triệu token, so với mức trung vị $1.88 của các mô hình tương đương
• Đầu ra — 2,70 đô la cho mỗi triệu token, so với mức trung vị là 10,00 đô la
• Cache — giảm giá 95% cho cache, đưa mỗi lượt cache hit xuống khoảng $0.05 mỗi triệu token
• Hỗn hợp — khoảng 0,51 USD mỗi triệu token theo tỷ lệ 7:2:1 giữa cache hit : đầu vào : đầu ra
• Chi phí mỗi tác vụ Intelligence Index — $0.71
• Chi phí cho một lần chạy lập chỉ mục đầy đủ — tổng cộng $918.34
Output ở mức $2.70 là dòng quan trọng nhất, vì nó chưa bằng một phần năm mức Kimi K3 tính cho cùng một triệu token ở $15.00. Nhưng có một cái bẫy mà so sánh theo từng token che giấu, và Artificial Analysis đo trực tiếp nó: độ dài dòng. Step 5 Preview đã tạo 160M token đầu ra để hoàn thành Intelligence Index, so với mức trung vị 90M của nhóm và xếp thứ 65 trong số 200 theo thước đo đó.
Hãy tính kỹ điều đó. Với mức 2,70 đô-la mỗi triệu token, 160 triệu token đầu ra tốn khoảng 432 đô-la — tức chừng một nửa tổng chi phí 918,34 đô-la của toàn bộ lần chạy index, số tiền ấy bị tiêu vào chính tật nói dài dòng của model chứ không phải vào các tác vụ. Đẩy đúng 160 triệu token đó qua mức giá đầu ra 15,00 đô-la của Kimi K3 thì bạn đã ở mức 2.400 đô-la, và đó chính là nơi lợi thế về giá đến từ. Nhưng lời cảnh báo thực tế là dành cho bất kỳ ai ước tính chi phí bằng cách bê nguyên số token từ một model khác sang: Step 5 Preview viết dài gấp khoảng 1,8 lần mức trung vị, cho nên một khối lượng công việc nặng về đầu ra vừa mua được mức giá rẻ hơn, vừa dùng nhiều token hơn cùng một lúc. Mức chiết khấu vẫn còn, nhưng nó nhỏ hơn vẻ ngoài mà phép so 1,00/2,70 đô-la với 3,00/15,00 đô-la để lại, và độ lớn của nó phụ thuộc hoàn toàn vào việc prompt của bạn khiến model nói dài dòng đến mức nào.
Mức chiết khấu 95% cho bộ nhớ đệm là đòn bẩy còn lại, và nó hung hãn một cách bất thường. Một khối lượng công việc tái sử dụng prompt nhiều — một system prompt dài, một tài liệu cố định, một codebase dùng chung — sẽ tiến gần hơn nhiều tới mức pha trộn $0.51 so với mức đầu vào $1.00. Con số pha trộn đó giả định tỷ lệ 7:2:1, vốn là một giả định mô hình hóa chứ không phải một bảo đảm, nhưng nó là dạng số học phù hợp để đem áp thử lên lưu lượng truy cập của chính bạn.

Những gì những người thử nghiệm ban đầu đang gặp phải
Đây là các báo cáo riêng lẻ từ diễn đàn nhà phát triển và bài đăng mạng xã hội trong những ngày quanh vụ rò rỉ, không phải các phép đo, và chúng cần được đánh trọng số cho phù hợp:
• Gọi công cụ là khiếu nại phổ biến nhất — chọn sai tên công cụ, và cố gắng chỉnh sửa mà không đọc tệp mục tiêu trước
• Lỗi được báo cáo khi vượt qua khoảng 340.000 token ngữ cảnh, đây là kiểu hỏng hóc cần để mắt tới nếu cửa sổ 1M hóa ra mới là con số thật
• Bộ lọc nội dung cắt ngắn đầu ra với một số lời nhắc
• Ấn tượng về năng lực không đồng nhất: một số người thử nghiệm đánh giá nó cao hơn GLM-5.3 Flash, số khác lại xếp nó thấp hơn DeepSeek V4.1 Flash
Một bản dựng xem trước chưa phát hành thất bại khi sử dụng công cụ không phải là một vụ bê bối — đó chính là mục đích của nhãn xem trước. Nhưng điều đó có nghĩa là con số 44 không nên được hiểu như một lời hứa về độ tin cậy của tác nhân, bởi vì Intelligence Index không kiểm tra điều mà những người thử nghiệm ban đầu phàn nàn nhiều nhất.
Cách bạn thực sự sẽ gọi nó — và nên dùng gì trong lúc chờ đợi
OrcaRouter không định tuyến Step 5 Preview. Không có endpoint công khai và không có trọng số, nên không có gì để định tuyến, và chưa có nền tảng bên thứ ba nào có thể tuyên bố khác một cách trung thực. Bất kỳ ai nói với bạn nơi có thể gọi nó ngày hôm nay là đang mô tả một endpoint đánh giá, chứ không phải một sản phẩm.
Những mô hình mà nó được đem ra so sánh lại là một câu chuyện khác. Kimi K3, GLM-5.3 và DeepSeek V4.1 Flash đều có sẵn thông qua OrcaRouter, cùng với 199 mô hình từ 15 nhà cung cấp phía sau một API key duy nhất và một hóa đơn duy nhất. Giá được chuyển tiếp nguyên theo giá niêm yết của nhà cung cấp với mức markup 0%, điều này đặc biệt quan trọng hơn mức thông thường ở một mô hình như thế này: nếu mức $1.00/$2.70 của Step 5 Preview giữ nguyên khi ra mắt và sau đó thay đổi, một tuyến chuyển tiếp giá sẽ thay đổi ngay trong cùng ngày thay vì theo lịch điều chỉnh giá của người khác.
Khi nó thực sự trở nên có thể gọi được, cách hợp lý để chạy một mô hình cận kề bản chưa phát hành chính là cách bạn sẽ chạy bất kỳ mô hình nào mà bạn chưa tin tưởng — đằng sau một tuyến có cơ chế chuyển đổi dự phòng tự động, để một lỗi gọi công cụ hay lỗi ngữ cảnh dài sẽ chuyển tiếp sang một mô hình hoạt động được, thay vì kéo sập ứng dụng của bạn theo. Đó chính là mẫu hình mà các báo cáo ban đầu lập luận cho trường hợp cụ thể này: một bản dựng xem trước với các vấn đề gọi công cụ được báo cáo và lỗi ngữ cảnh dài chính xác là mô hình mà bạn muốn có một phương án dự phòng phía sau, chứ không phải mô hình bạn muốn đặt trên luồng production một mình.

Điều gì sẽ biến cái này từ một vụ rò rỉ thành một bản phát hành?
Ba điều đáng để theo dõi, xếp theo mức độ chúng sẽ giúp làm sáng tỏ mọi chuyện. Thứ nhất, một trang model và mức giá trên nền tảng dành cho nhà phát triển của chính StepFun — thời điểm step-5 xuất hiện trong danh sách model, bảng thông số kỹ thuật của nhà cung cấp sẽ thay thế mọi thông tin từ bên thứ ba trong bài viết này, bao gồm cả cặp 600B/27B và tuyên bố về ngữ cảnh 1M. Thứ hai, việc giải quyết mâu thuẫn giữa ngữ cảnh 1M và 350k; giới hạn đầu ra 64k dưới một cửa sổ 1M là một khác biệt đáng kể đối với bất kỳ ai đang xây dựng pipeline xử lý tài liệu dài hoặc pipeline agentic, và hiện vẫn chưa được giải quyết. Thứ ba, liệu mức giá này là thế khởi động ban đầu hay một mức giá cố định lâu dài — giá xem trước trên các mô hình chủ lực của Trung Quốc vốn có tiền lệ thay đổi một khi năng lực bị thắt chặt, và 2,70 USD cho mỗi triệu token đầu ra là mức đủ mạnh để làm nảy sinh câu hỏi đó.
Cho đến khi ít nhất điều đầu tiên trong số đó thành hiện thực, tóm tắt trung thực là: Step 5 Preview trông như một mô hình thực sự hiệu quả — tổng cộng 600B nhưng đảm nhận khối lượng công việc tổng hợp tầm cỡ 2.8T, với mức giá rẻ hơn các đối thủ trên thị trường vài lần — đi kèm một thông số kỹ thuật chưa được xác minh, một khoản "thuế" dài dòng thực sự, và một danh tiếng về khả năng gọi công cụ vẫn chưa được chứng minh. Đáng để tính đến khi lập kế hoạch. Nhưng chưa đáng để đặt cược lộ trình sản xuất vào đó.
So sánh trong bài viết này4
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
