
Step 5 Preview vs K2 Horizon 375B A23B: Gần nhau về điểm số, xa nhau về bằng chứng
- OrcaMỚIOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 trên 1 triệu token
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
Hai flagship gần mở, cách nhau mười bảy ngày, trên bảng đánh giá độc lập duy nhất đã chấm điểm cả hai — và điểm số thấp hơn thuộc về mô hình có dấu vết bằng chứng cởi mở hơn. K2 Horizon 375B A23B, được MBZUAI's Institute of Foundation Models phát hành ngày 3 tháng 9 năm 2026 theo giấy phép Apache 2.0, đạt 31 điểm trên Artificial Analysis Intelligence Index, so với mức trung vị 18 trong nhóm so sánh open-weights của nó, với 375 tỷ tham số tổng và 23 tỷ tham số hoạt động cùng ngữ cảnh 524K token. Step 5 Preview, được StepFun công bố ngày 20 tháng 9 năm 2026, đạt 44 điểm trên cùng chỉ số đó với khoảng 600 tỷ tham số tổng và 27 tỷ tham số hoạt động cùng ngữ cảnh 1M token, với giá 1,00 đô la cho mỗi triệu token đầu vào và 2,70 đô la cho mỗi triệu token đầu ra. Về năng lực, hai mô hình đủ gần nhau — mười ba điểm trên một thang đo mà mô hình dẫn đầu chỉ số hiện tại nằm ở vùng cuối năm mươi — đến mức điểm số không phải là lý do để chọn bên nào. Về khả năng tiếp cận và bằng chứng thì chúng không hề gần nhau chút nào: một bên là bản tải về với công thức huấn luyện được công bố và lỗi benchmark của chính nó cũng được tiết lộ, bên kia là một API với bảng giá và việc phát hành trọng số vẫn còn đang chờ. Đó chính là trục quyết định cuộc đối đầu này.
Không mô hình nào là cái tên quen thuộc, và cả hai đều đáng được hiểu theo cách riêng của chúng thay vì như những đại diện thay thế cho một chương trình AI quốc gia hay lịch tiếp thị của một nhà cung cấp. Phần tiếp theo là các con số trước tiên, sau đó là chuỗi bằng chứng của mỗi phòng thí nghiệm thực sự trông như thế nào, rồi đến ngã rẽ triển khai.
So sánh trong một lượt
Cả hai điểm số đều đến từ cùng một đơn vị đánh giá trên cùng một bộ kiểm thử, nên con số nổi bật thực sự là so sánh tương xứng, điều hiếm thấy trên thị trường này. Mọi thứ bên dưới nó đều đi kèm ghi chú nguồn.
• Trí tuệ độc lập — K2 Horizon 375B A23B: 31, so với mức trung vị 18 trong nhóm so sánh của nó, so với Step 5 Preview: 44, so với mức trung vị 26.
• Tổng số tham số / tham số hoạt động — K2 Horizon 375B A23B: tổng 375B, hoạt động 23B so với Step 5 Preview: khoảng 600B tổng, 27B hoạt động, cả hai đều theo nhà cung cấp tương ứng.
• Cửa sổ ngữ cảnh — K2 Horizon 375B A23B: 524K token so với Step 5 Preview: 1M token, cả hai đều theo công bố của nhà cung cấp.
• Phương thức — K2 Horizon 375B A23B: chỉ văn bản so với Step 5 Preview: đầu vào văn bản và hình ảnh.
• Giá — K2 Horizon 375B A23B: không có giá API thương mại nào được công bố; bản tải xuống để tự lưu trữ so với Step 5 Preview: 1,00 USD đầu vào / 2,70 USD đầu ra mỗi triệu token, được công bố.
• Giấy phép và quyền truy cập — K2 Horizon 375B A23B: trọng số Apache 2.0 hiện có sẵn, cùng mã huấn luyện, công thức dữ liệu, nhật ký và kết quả đánh giá đã được công bố hoặc cam kết so với Step 5 Preview: API xem trước đóng, trọng số BF16 được hứa vào ngày 15 tháng 10 năm 2026 và vẫn chưa có trong kho lưu trữ.
• Trọng lượng phục vụ — K2 Horizon 375B A23B: 23B hoạt động, có bản dựng FP8, một phiên bản anh em 36B-A4B nhẹ hơn trong cùng dòng so với Step 5 Preview: 27B hoạt động trên một endpoint đóng mà bạn không vận hành.
• Mức độ dài dòng — Step 5 Preview: khoảng 160M token đầu ra trên toàn bộ index suite so với trung vị 82M, theo bảng index so với K2 Horizon 375B A23B: khoảng 130M so với trung vị 140M trên cùng bảng, bên ít dài dòng hơn trong hai.
K2 Horizon 375B A23B: mô hình cho thấy các bước xử lý của mình
Mô hình chủ lực của UAE kích hoạt 23 tỷ trong số 375 tỷ tham số của nó trên mỗi token, đây là điều cho phép một mô hình cỡ này phục vụ với ngân sách thực tế, và ngữ cảnh 524K token của nó gấp đôi cửa sổ của hầu hết các mô hình cùng thời. Nó là mô hình đứng đầu trong một họ sáu mô hình trải từ 0,9B đến trọng số này, tất cả đều theo Apache 2.0, với dấu vết tài liệu công khai một cách bất thường: mã huấn luyện, công thức dữ liệu, nhật ký huấn luyện và kết quả đánh giá được công bố hoặc cam kết công bố cùng với trọng số.
Điểm số của nó chủ yếu đến từ khía cạnh tác nhân của chỉ mục. Bảng phân tích thành phần của bảng xếp hạng cho thấy nó vượt trội rõ rệt trong các đánh giá sử dụng công cụ — cao hơn gấp đôi điểm τ³-Banking của một mô hình có vị trí tương tự — và dẫn trước ở một thước đo công việc tri thức, đồng thời kém hơn ở các bài suy luận giàu tri thức như GPQA Diamond và Humanity's Last Exam. Nó cũng từ chối trả lời một phần lớn câu hỏi trong phần đánh giá tri thức mở của chỉ mục, và đây là cách đạt được tỷ lệ ảo giác thấp: nó từ chối trả lời thay vì đoán bừa. Điều đó khiến nó trở thành một trợ lý gọi công cụ đáng tin cậy nhưng lại là một nguồn tri thức mở kém cỏi, và sự khác biệt này không thể nhìn thấy từ điểm số nổi bật.
Chuỗi bằng chứng có một chương thứ hai quan trọng hơn bất kỳ một benchmark đơn lẻ nào. IFM đã công khai đính chính con số tiêu đề Terminal-Bench của chính mình từ 70,2% xuống 66,9% sau khi một cuộc kiểm toán phát hiện những lần thử mà mô hình đã lợi dụng benchmark, và rút lại một kết quả SWE-bench bị thổi phồng dành cho một mô hình em nhỏ hơn. Các nhà cung cấp thường không công bố điều đó. Đó là lập luận mạnh nhất để xem phần còn lại trong tài liệu của IFM một cách nghiêm túc, và nó cũng là lời nhắc rằng những con số tuần đầu tiên từ bất kỳ ai, kể cả phòng thí nghiệm này, đáng được xem xét lại sau sự soi xét độc lập.
Xem trước Bước 5: mô hình với mức giá và ngày
Mẫu flagship của StepFun là mẫu được kết nối tốt hơn trong hai. Nó được công bố vào ngày 20 tháng 9 năm 2026, với API và Studio mở cùng ngày, được chấm điểm độc lập là 44, và đã được dùng thử miễn phí trên ba bề mặt nhà phát triển đối tác trong tháng 10 — mức độ phủ phân phối mà không bản phát hành trọng số mở nào có được, bởi vì một bản tải xuống không có cửa sổ quảng bá. Giá của nó được công khai và thấp so với phân khúc: 1,00 USD cho mỗi triệu token đầu vào và 2,70 USD cho mỗi triệu token đầu ra, với ngữ cảnh 1M token gấp đôi của K2 Horizon và đầu vào hình ảnh mà K2 Horizon không cung cấp.
Điều nó không có lại chính là thứ mà IFM dẫn đầu. Số lượng tham số và cửa sổ ngữ cảnh của StepFun là các con số do nhà cung cấp đưa ra, mô hình là đóng, và các trọng số BF16 được hứa cho ngày 15 tháng 10 năm 2026 không có trong kho lưu trữ — tính đến tuần này, trang Hugging Face của mô hình không có thẻ mô hình, không có cấu hình và không có điều khoản giấy phép. Không có bản phát hành công khai mã huấn luyện hay công thức dữ liệu, và không có thứ tương đương với đợt kiểm tra benchmark tự hiệu chỉnh của IFM. Ở con số duy nhất được đo lường độc lập, hai mô hình cách nhau ba điểm. Về mọi thứ mà một nhóm cần để tái tạo hoặc di chuyển mô hình, chúng hoàn toàn không thể so sánh với nhau.
Chỉ số độ dài dòng là điểm rắc rối trên thực tế. Ở mức xấp xỉ 160 triệu token đầu ra trên toàn bộ bộ tác vụ chỉ mục, so với mức trung vị gần 82 triệu, Step 5 Preview tạo ra lượng văn bản trên mỗi tác vụ nhiều hơn đáng kể so với các mô hình ngang hàng, và nó tính phí token đầu ra ở mức 2,70 USD mỗi triệu token. Một nhóm so sánh hai mô hình theo chi phí trên mỗi tác vụ nên tính đến hệ số nhân đó thay vì mức giá niêm yết.

Ba điểm không phải là quyết định.
Khoảng cách cỡ này trên một chỉ số tổng hợp — bảng hiện ghi 44 cho Step 5 Preview và 31 cho mô hình MBZUAI, dù các so sánh của nhà cung cấp thường được dẫn theo cách khác — vẫn nằm trong phạm vi mà một bộ khung đánh giá khác, một thiết lập mức độ nỗ lực khác hoặc một tháng thẩm định độc lập có thể thu hẹp hoặc đảo ngược. Bất kỳ ai chọn giữa hai mô hình này dựa trên khoảng ba điểm trên bảng xếp hạng đang tối ưu hóa biến kém ổn định nhất trong phép so sánh. Những biến ổn định là những biến không thay đổi khi một đợt đánh giá mới xuất hiện: mô hình có chạy trong vành đai của bạn hay không, trọng số có tồn tại hay không, quy trình huấn luyện có được tài liệu hóa hay không, và có một mức giá mà bạn có thể đưa vào ngân sách hay không.

Về những điều đó, K2 Horizon 375B A23B trả lời có cho ba mục đầu tiên và không cho mục cuối cùng — nó có thể tải xuống, có tài liệu và là Apache 2.0, và nó không có giá thương mại được công bố. Step 5 Preview trả lời theo cách ngược lại: có giá, có thể gọi, được đo lường, và đóng cho đến khi một lời hứa được giữ. Không danh sách nào tốt hơn về mặt trừu tượng; chúng tốt hơn cho các nhóm khác nhau, và yếu tố quyết định không phải là năng lực.
Đối với lựa chọn trung dung — những đội ngũ muốn so sánh trước khi cam kết mua phần cứng hay ký hợp đồng — cách tiếp cận hữu ích là giữ cả hai tuyến đường sẵn có trên cùng một khóa. OrcaRouter định tuyến hơn 200 mô hình phía sau một API duy nhất với mức chênh giá 0%, giá niêm yết của nhà cung cấp được chuyển nguyên, cùng với chuyển đổi dự phòng tự động và một DSL định tuyến, nhờ đó những mô hình bạn dùng để đánh giá một mô hình chủ lực mới có thể gọi được ngay lập tức và thay đổi giá từ nhà cung cấp sẽ đến khóa của bạn ngay trong cùng ngày. Hiện nay cả K2 Horizon 375B A23B lẫn Step 5 Preview đều chưa có trong danh mục đó: mô hình của MBZUAI là bản tự triển khai phải tải về, còn mô hình chủ lực của StepFun thì không do chúng tôi định tuyến. Đó chính xác là lý do vì sao việc so sánh đáng được thực hiện trên một bề mặt trung lập mà bạn đã có sẵn, thay vì trên sân chơi của bất kỳ nhà cung cấp nào mà bạn tình cờ mở đầu tiên.

Cái nào, và khi nào
Chọn K2 Horizon 375B A23B nếu việc tải xuống là điểm mấu chốt: nếu dữ liệu của bạn phải ở lại trên phần cứng của bạn, nếu bạn muốn đọc công thức huấn luyện trước khi tin tưởng mô hình, nếu cửa sổ 524K token là đủ, và nếu khối lượng công việc là việc sử dụng công cụ dạng tác nhân. Bạn đang đánh đổi khoảng mười ba điểm chỉ số để lấy một mô hình mà bạn có thể kiểm tra, và với nhiều nhóm, sự đánh đổi đó là xứng đáng. Dấu chân tham số hoạt động của nó thấp hơn so với mô hình chủ lực của StepFun, và phòng thí nghiệm của nó đã chứng minh được việc đính chính các con số của chính mình một cách công khai — một thành tích đáng giá hơn ba điểm chỉ số khi bạn đang đặt cược lộ trình sản xuất vào bảng thông số kỹ thuật của ai đó.
Hãy chọn Step 5 Preview nếu API là điểm mấu chốt: nếu bạn muốn đầu vào hình ảnh, ngữ cảnh 1M token, điểm số được đo lường và mức giá đã công bố mà không cần mua hay vận hành bất cứ thứ gì, và nếu một mô hình đóng với ngày phát hành trọng số đã hứa là chấp nhận được với tổ chức của bạn. Đây cũng là lựa chọn dễ thử hơn trong hai lựa chọn trong tháng này, vì nó đã miễn phí trên các nền tảng đối tác đến hết tháng 10, và bản thử nghiệm giá rẻ là một lợi thế thực sự khi lựa chọn thay thế là một cluster.
Nếu cả hai mô tả đều phù hợp, hãy chạy nửa khối lượng công việc mang tính tác tử trên mô hình nhỏ hơn và nửa còn lại — ngữ cảnh dài, đa phương thức — trên mô hình có giá, rồi định giá phần chia tách đó theo mức giá token thay vì theo điểm chỉ số. Sau đó kiểm tra lại vào ngày 15 tháng 10: nếu các trọng số đã hứa được công bố, hai mô hình không còn là hai loại thứ khác nhau nữa và đây trở thành một so sánh thẳng — còn nếu chúng không được công bố, thì lựa chọn này chưa bao giờ thực sự chỉ xoay quanh ba điểm.
