
Step 5 Preview so với Intern-S2 Mobius: Bạn cần một mô hình đầu bảng 600B, hay một mô hình suy luận 35B nhanh?
- OrcaMỚIOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 trên 1 triệu token
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
Lý do thật sự để so sánh Step 5 Previewvới Intern-S2 Mobiuskhông phải là vì chúng giống nhau. Mà là vì chúng là câu trả lời cho hai câu hỏi khác nhau từ cùng một người mua — đội ngũ có một khối lượng công việc suy luận cần chạy và không có hứng thú mua cả một cụm máy chủ. Về phía StepFun, Step 5 Preview, được công bố ngày 20 tháng 9 năm 2026, là câu trả lời lớn: khoảng 600 tỷ tham số tổng với 27 tỷ tham số hoạt động, ngữ cảnh 1M token, điểm Chỉ số Thông minh Artificial Analysis được đo độc lập là 44, và mức giá công bố là 1,00 USD mỗi triệu token đầu vào và 2,70 USD mỗi triệu token đầu ra. Về phía InternLM, Intern-S2 Mobius, phát hành ngày 29 tháng 7 năm 2026, là câu trả lời nhỏ: một mô hình trọng số mở 35 tỷ tham số được xây dựng trên kiến trúc Mobius-v0, được tiền huấn luyện liên tục từ Qwen3.5-35B, với tuyên bố cốt lõi không phải là năng lực mà là tốc độ — tăng tốc end-to-end khoảng 4 lần trên các benchmark suy luận so với baseline mà nó được huấn luyện từ đó, mà không có bất kỳ điểm benchmark độc lập nào. Một cái là flagship bạn thuê; cái kia là một mô hình nhỏ bạn tự chạy. Việc so sánh thực chất là về việc liệu khối lượng công việc trước mắt bạn có biện minh cho flagship hay không.
Một việc cần làm rõ trước khi đi vào các con số, vì nó khiến mọi người tốn thời gian thực tế: InternLM đã phát hành một số mô hình dưới danh nghĩa Intern-S2, và chúng không phải là cùng một thứ. Intern-S2-397B là mô hình chủ lực đa phương thức khoa học; Intern-S2 Mobius là mô hình suy luận hiệu quả 35B được bàn đến ở đây; một bản phát hành Intern-S2 trước đó lại là một mô hình riêng. Nếu bạn đang tìm kiếm "Intern-S2" và rơi vào các bảng benchmark của một mô hình 397B, thì bạn đang đọc về một checkpoint khác.
Mỗi mô hình thực sự tuyên bố điều gì
Các tuyên bố của Step 5 Preview là những tuyên bố thông thường đối với một mẫu flagship năm 2026, và một trong số đó được kiểm chứng độc lập. StepFun liệt kê khoảng 600B tham số tổng với 27B tham số hoạt động, đầu vào văn bản và hình ảnh, cửa sổ ngữ cảnh 1M token, và mức giá $1.00/$2.70 cho mỗi triệu token đầu vào và đầu ra. Artificial Analysis đo nó ở mức 44 trên Chỉ số Trí tuệ của mình, cao hơn mức trung vị 26 của các mô hình tương đương, với đầu ra đạt 87 token mỗi giây so với mức trung bình 78 và khoảng 160 triệu token đầu ra được tạo ra trên toàn bộ bộ tác vụ của chỉ số, so với trung vị 82 triệu — gần gấp đôi dấu chân dài dòng điển hình, điều này có ý nghĩa đối với một mô hình tính phí theo đầu ra.
Tuyên bố của Intern-S2 Mobius mang tính kiến trúc và hẹp hơn. Thiết kế của nó tách biệt tri thức khỏi tính toán: một Memory được chia sẻ toàn cục lưu giữ các vector tri thức, và nhiều Reasoner lặp đi lặp lại việc truy vấn và tinh chỉnh các trạng thái ẩn dựa trên đó, thay vì gắn kết lưu trữ và tính toán theo từng lớp như cách một transformer thông thường làm. Lợi ích được InternLM công bố là tốc độ nhanh hơn khoảng 4 lần từ đầu đến cuối trên các benchmark suy luận so với Qwen3.5-35B mà nó kế thừa, với điểm số suy luận tương đương hoặc mạnh hơn, cùng các chuỗi suy nghĩ hiển thị ngắn hơn. Mô hình dùng giấy phép Apache 2.0, nhận đầu vào văn bản và hình ảnh, và có thể tải về.
• Quy mô — Step 5 Preview: tổng khoảng 600B, 27B hoạt động cho StepFun so với Intern-S2 Mobius: tổng 35B.
• Điểm số độc lập — Step 5 Preview: 44 trên Artificial Analysis Intelligence Index so với Intern-S2 Mobius: chưa có bên thứ ba nào công bố.
• Tốc độ — Step 5 Preview: 87 token đầu ra mỗi giây so với mức trung bình 78, được đo bởi bảng chỉ số so với Intern-S2 Mobius: "gần gấp 4 lần" so với baseline Qwen3.5-35B của chính nó, do nhà cung cấp báo cáo và chưa được tái lập.
• Cửa sổ ngữ cảnh — Step 5 Preview: 1M token mỗi StepFun so với Intern-S2 Mobius: không có số liệu ngữ cảnh độc lập nào được công bố.
• Giá — Step 5 Preview: $1.00 đầu vào / $2.70 đầu ra mỗi triệu token so với Intern-S2 Mobius: không có giá API; bạn trả tiền cho phần cứng.
• Giấy phép và quyền truy cập — Step 5 Preview: bản xem trước đóng qua API của nhà cung cấp, trọng số BF16 được hứa hẹn vào ngày 15 tháng 10 năm 2026, so với Intern-S2 Mobius: trọng số theo Apache 2.0 đã có sẵn ngay bây giờ.
• Độ dài dòng — Bản xem trước Step 5: khoảng 160M token đầu ra trên toàn bộ bộ chỉ mục, so với mức trung vị 82M, theo bảng chỉ mục so với Intern-S2 Mobius: các dấu vết suy luận hiển thị ngắn hơn được InternLM tuyên bố, nhưng chưa được bất kỳ ai khác đo lường.
Tuyên bố 4x, và tại sao nó lại là con số thú vị ở đây
Đặt số liệu của hai nhà cung cấp cạnh nhau và sự lệch pha lộ ra ngay: con số chủ đạo của StepFun là điểm năng lực, còn của InternLM là hệ số nhân thông lượng. Đó không phải là chuyện ngẫu nhiên, và đó chính là điều hữu ích nhất trong phép so sánh này. Tốc độ nhanh hơn gấp 4 lần từ đầu đến cuối trên các tác vụ suy luận, nếu trụ vững được khi tiếp xúc với khung đánh giá của người khác, thì đối với một triển khai khối lượng lớn lại đáng giá hơn vài điểm trên một bảng chỉ số — nó thay đổi hoàn toàn bài toán vận hành khối lượng công việc. Intern-S2 Mobius đang nhắm đến những đội ngũ mà nút thắt cổ chai của họ là số token mỗi giây trên mỗi đô la, chứ không phải năng lực trần.
Lưu ý là hệ số nhân này được đo so với Qwen3.5-35B, mô hình mà Intern-S2 Mobius được tiền huấn luyện liên tục từ đó, và mô hình này chưa từng trải qua quá trình huấn luyện Mobius. Đó là so sánh với chính điểm khởi đầu của nó chứ không phải với một đối thủ. Không có bản tái lập độc lập nào cho tuyên bố về thông lượng, không có điểm chỉ số từ bên thứ ba, và không có cửa sổ ngữ cảnh nào được công bố từ bất kỳ ai ngoài nhà cung cấp. Hãy coi "gần 4x" là một tín hiệu kiến trúc thú vị và một giả thuyết để kiểm thử trên hệ thống kiểm thử của riêng bạn, chứ không phải là một thông số kỹ thuật.
Step 5 Preview có hồ sơ bằng chứng trái ngược. Con số năng lực của nó được đo lường độc lập; câu chuyện về hiệu quả mới là phần yếu. Chỉ số độ dài dòng chữ trên bảng xếp hạng — khoảng 160 triệu token đầu ra trong khi mô hình trung vị chỉ phát ra khoảng 82 triệu — chính là đối trọng trung thực cho mức giá đầu ra 2,70 USD, và điều đó có nghĩa là một khối lượng công việc dựa nhiều vào các lượt sinh dài có cấu trúc sẽ tiêu tốn nhiều hơn đáng kể so với mức giá niêm yết gợi ý. Điều mà nó có mà Intern-S2 Mobius không có chính là một mức giá API được công bố, và đó chính là điều khiến nó có thể so sánh được ngay từ đầu.
Kho lưu trữ Hugging Face dành cho bản dựng mà nhà cung cấp đã hứa kể nốt nửa kia của câu chuyện: đây là hình hài của một bản phát hành trọng số mở khi đã được công bố nhưng vẫn chưa ra mắt.

Nơi câu hỏi về dấu chân thực sự trở nên nhức nhối
Lợi thế thực sự của Intern-S2 Mobius không nằm ở điểm số, thứ chưa ai đo được, mà ở cái giá phải trả nếu sai về nó. Ba mươi lăm tỷ tham số là quy mô mà một đội có thể phục vụ trên phần cứng họ đã sở hữu, đánh giá mà không cần đơn đặt hàng, và từ bỏ mà không phải xóa sổ bất cứ thứ gì. Đó là lợi thế mang tính cấu trúc mà mô hình chủ lực không thể sánh được, bất kể nó đạt bao nhiêu điểm, và đó là lý do phép so sánh này đáng để thực hiện thay vì bị gạt đi như một sự không tương xứng.

Lợi thế của mẫu flagship chính là hình ảnh phản chiếu. Ngữ cảnh 1M token, đầu vào hình ảnh và năng lực suy luận tổng quát đã được đo lường của Step 5 Preview bao quát những công việc mà một mô hình 35B khó có thể bao quát tốt, và việc dùng thử chẳng tốn gì trong suốt độ dài của một cửa sổ miễn phí — mô hình này đã được miễn phí trên ba bề mặt dành cho nhà phát triển riêng biệt trong tháng Mười. Không điều nào trong hai sự thật đó khả dụng đối với một mô hình tự lưu trữ: không có một tuần miễn phí nào để chạy GPU của chính bạn, và cũng không có bảng giá nào chuyển quyết định đó thành một mục hàng.
Nếu bạn muốn phép so sánh này còn trụ được qua khỏi cửa sổ khuyến mãi, thứ cần dựng nên là một harness chứ không phải một sở thích. OrcaRouter định tuyến hơn 200 mô hình phía sau một API key và một hoá đơn duy nhất với mức markup 0%, giá niêm yết của nhà cung cấp được chuyển nguyên, cùng với tự động chuyển đổi dự phòng và một DSL định tuyến để điều hướng lưu lượng theo chi phí, độ trễ hoặc năng lực. Cả Step 5 Preview lẫn Intern-S2 Mobius đều không có trong danh mục đó — mô hình chủ lực của StepFun không do chúng tôi định tuyến và Intern-S2 Mobius là bản tải về tự lưu trữ — nên giá trị ở đây không nằm ở việc truy cập vào một trong hai. Mà là ở chỗ những mô hình bạn sẽ dùng để đối chiếu chúng chỉ cách một chiếc key, và một quyết định dựa trên đo lường sẽ dịch chuyển theo bằng chứng thay vì theo một bài blog ra mắt.

Cách quyết định
Nếu khối lượng công việc của bạn mang tính tác tử, đa phương thức, ngữ cảnh dài hoặc mở — kiểu mà bạn không thể liệt kê trước các tác vụ — thì câu trả lời, và Step 5 Preview là một ví dụ hợp lý của nó: được đo lường, được định giá, rẻ để thử nghiệm và có thể đảo ngược theo từng token. Chỉ cần dự trù ngân sách theo độ dài diễn đạt thay vì theo mức giá niêm yết.
Nếu khối lượng công việc của bạn hẹp, lặp lại, và là suy luận khối lượng lớn trên dữ liệu phải nằm trong vành đai của bạn, thì mô hình nhỏ chính là câu trả lời, và Intern-S2 Mobius là một ứng viên thực sự chính vì nó nhỏ: nó chạy trên phần cứng bạn đang có, nó theo Apache 2.0, và tuyên bố về tốc độ, nếu còn đứng vững, là kiểu điều quyết định một câu hỏi về kinh tế đơn vị. Hãy bước vào với nhận thức rằng bạn đang kiểm chứng tuyên bố của nhà cung cấp thay vì thừa hưởng phán quyết của người khác.
Sai lầm là coi lựa chọn này là vĩnh viễn. Hãy mua gói đánh giá của mô hình nhỏ trước, vì đó là phép thử rẻ; thuê mô hình đầu bảng cho những tác vụ mà mô hình nhỏ thất bại, vì đó là cách sửa chữa rẻ. Các đội nhóm giữ cả hai lựa chọn cùng tồn tại trên cùng một khóa và cùng một harness sẽ đưa ra quyết định này bằng dữ liệu của chính họ, và đó là phiên bản duy nhất của quyết định ấy trụ vững khi một trong hai nhà cung cấp tung ra phiên bản kế nhiệm.
