
Step 5 Preview 對比 Intern-S2 Mobius:你需要 600B 旗艦,還是快速的 35B 推理器?
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百萬 tokens
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
老實說,之所以要比較 Step 5 Preview 與 Intern-S2 Mobius,並不是因為它們很相似。而是因為它們是來自同一買家的兩個不同問題的答案——那個有推理工作負載要跑、卻無意購買一整個叢集的團隊。StepFun 的 Step 5 Preview 於 2026 年 9 月 20 日發布,是大型的那個答案:總參數約 6,000 億,其中 270 億為活躍參數,具備 1M token 的上下文,獨立測得的 Artificial Analysis Intelligence Index 分數為 44,且公布價格為每百萬輸入 token 1.00 美元、每百萬輸出 token 2.70 美元。InternLM 的 Intern-S2 Mobius 於 2026 年 7 月 29 日發布,是小型的那個答案:一個 350 億參數的開放權重模型,建構於 Mobius-v0 架構上,由 Qwen3.5-35B 持續預訓練而來,其核心主張不是能力,而是速度——在推理基準上相較於其訓練所依據的基線,端到端約有 4 倍加速,且沒有任何形式的獨立基準分數。一個是你租用的旗艦;另一個是你自行運行的小模型。這項比較真正要問的是,眼前的工作負載究竟是否值得使用旗艦。
在看數字之前,先交代一件小事,因為它真的會浪費大家不少時間:InternLM 已在 Intern-S2 這個名號下推出過好幾個模型,而它們並不是同一回事。Intern-S2-397B 是科學多模態旗艦模型;Intern-S2 Mobius 則是本文所討論的 35B 高效推理模型;而較早發布的 Intern-S2 又是另一個獨立的模型。如果你搜尋「Intern-S2」卻找到 397B 模型的基準測試表,那你讀到的是不同的檢查點。
每個模型實際上聲稱什麼
Step 5 Preview 的宣稱是 2026 年旗艦模型的常規說法,其中一項經過獨立驗證。StepFun 列出約 600B 總參數、27B 活躍參數、文字與圖像輸入、100 萬 token 的上下文視窗,以及每百萬輸入與輸出 token 分別為 $1.00/$2.70 的價格。Artificial Analysis 在其 Intelligence Index 上測得 44 分,高於同類模型的中位數 26,輸出速度為每秒 87 個 token,相較於平均值 78,且在該索引任務套件中產生約 1.6 億個輸出 token,相較於中位數 8,200 萬——大約是典型冗長輸出量的兩倍,這在按輸出計費的模型上很重要。
Intern-S2 Mobius 的主張屬於架構層面,而且範圍更窄。其設計將知識與運算分離:一個全域共享的 Memory 儲存知識向量,多個 Reasoners 則以迭代方式對其查詢並精煉隱藏狀態,而不是像傳統 transformer 那樣逐層綁定儲存與運算。InternLM 宣稱的效益是,在推理基準測試上相較於其衍生的 Qwen3.5-35B 約有 4 倍的端到端加速,推理分數相當或更強,且可見的思維鏈更短。該模型採用 Apache 2.0,支援文字與圖像輸入,並且可供下載。
• 規模 — Step 5 Preview:總計約 600B,StepFun 稱活躍參數為 27B,對比 Intern-S2 Mobius:總計 35B。
• 獨立評分 — Step 5 Preview:在 Artificial Analysis Intelligence Index 上取得 44 分;對比 Intern-S2 Mobius:無任何第三方公布的數據。
• 速度 — Step 5 Preview:每秒 87 個輸出 token,對比平均值 78,由 index board 實測,與 Intern-S2 Mobius 相比:相較於其自家的 Qwen3.5-35B 基準達「將近 4 倍」,為廠商自行報告且未經複現。
• 上下文視窗 — Step 5 Preview:StepFun 的 1M tokens,對比 Intern-S2 Mobius:未公布獨立的上下文數據。
• 價格 — Step 5 Preview:每百萬個 token 輸入 $1.00 / 輸出 $2.70,對比 Intern-S2 Mobius:無 API 價格;你需為硬體付費。
• 授權與存取 — Step 5 Preview:透過供應商 API 進行的封閉預覽,BF16 權重承諾於 2026 年 10 月 15 日提供,對比 Intern-S2 Mobius:Apache 2.0 權重現已可用。
• 冗長度 — Step 5 預覽:在整個 index 套件中約有 1.6 億個輸出 token,對比 8,200 萬的中位數;根據 index 排行榜,與 Intern-S2 Mobius 相比:InternLM 聲稱其可見推理軌跡較短,但其他人皆未測量。
4 倍的主張,以及為何它是這裡有趣的數字
並排閱讀兩家廠商的數字,落差顯而易見:StepFun 的主打數據是能力分數,InternLM 的則是吞吐量倍數。這並非巧合,而是這份比較中最有用的重點。在推理任務上達到 4 倍端到端加速,如果能在別人的測試框架中依然成立,對高流量部署的價值,會高於排行榜上的幾分——它會徹底改變執行這項工作負載的成本算式。Intern-S2 Mobius 鎖定的是瓶頸在於每美元每秒 token 數、而非能力上限的團隊。
需要注意的是,這個倍數是對照 Qwen3.5-35B 測得的,而 Intern-S2 Mobius 正是從這個模型持續預訓練而來,Qwen3.5-35B 從未接受過 Mobius 訓練。這是與自身起點的比較,而不是與競爭對手的比較。吞吐量宣稱沒有獨立重現,沒有第三方指數評分,也沒有廠商以外任何人公布的上下文視窗。請把「接近 4 倍」視為一個有趣的架構訊號,以及一個可在你自己的測試框架上驗證的假設,而不是一項規格。
Step 5 Preview 則呈現相反的證據特徵。它的能力數值是獨立測得的;效率表現才是它較弱的一環。指數榜的冗長度讀數——約 1.6 億個輸出 token,而中位數模型約輸出 8,200 萬個——是對 2.70 美元輸出價格的誠實制衡,這也意味著若工作負載偏向長時間的結構化生成,實際花費將明顯高於標價所暗示的水準。它真正擁有而 Intern-S2 Mobius 沒有的,是至少公布了 API 價格,而這正是讓兩者一開始得以互相比較的原因。
Hugging Face 上那個承諾的廠商版本儲存庫,道出了故事的另一半:這就是開放權重發布在已宣布、卻尚未推出時的樣子。

足跡問題真正造成影響的地方
Intern-S2 Mobius 真正的優勢不在於它的分數——那根本沒人測量過——而在於看錯它所需付出的代價。三百五十億個參數,是一個團隊能在自己已擁有的硬體上提供服務、無需採購單就能評估、且放棄時不必認列任何沖銷的規模。這是旗艦模型無論拿下多少分都無法匹敵的結構性優勢,也是這場比較值得進行、而非以「兩者不對等」為由加以駁斥的原因。

旗艦模型的優勢正是其鏡像。Step 5 Preview 的 1M-token 上下文、圖像輸入以及經實測的一般推理能力,能涵蓋 35B 模型不太可能妥善涵蓋的工作,而且在免費窗口期間試用它無須任何成本——該模型在十月期間已於三個不同的開發者平台上免費提供。這兩項事實都不適用於自架模型:沒有免費的一週可供你運行自己的 GPU,也沒有任何價目表能將這項決定轉化為單一條列項目。
如果你希望這項比較能延續到促銷期之後,該打造的是測試框架,而不是偏好。OrcaRouter 將超過 200 個模型導向單一 API 金鑰與單一帳單,0% 加成,並直接傳遞供應商定價,同時具備自動容錯移轉,以及一套路由 DSL,可依成本、延遲或能力引導流量。Step 5 Preview 和 Intern-S2 Mobius 都不在該目錄中——StepFun 的旗艦模型並非由我們路由,而 Intern-S2 Mobius 是自行託管的下載項目——所以這裡的價值不在於能存取這兩者。而在於你將用來與它們進行基準比較的那些模型,只差一把金鑰就能取得,而且以實測做出的決定會隨著證據移動,而不是隨著一篇發布部落格文章移動。

如何決定
如果你的工作負載屬於代理式、多模態、長上下文或開放式——也就是你無法事先列舉出所有任務的那種——旗艦版就是答案,而 Step 5 Preview 是它的一個合理實例:經過實測、已定價、試行成本低,而且可按 token 逐一撤回。只要針對輸出的冗長程度編列預算,而不是只看標示費率。
如果你的工作負載是針對必須留在你周界內的資料,進行範圍狹窄、重複且大量的推理,那麼小型模型就是答案;而 Intern-S2 Mobius 正是真正值得考慮的候選,正因為它小:它能在你現有的硬體上運行、採用 Apache 2.0,而且那項速度宣稱若然成立,正是那種能決定單位經濟問題的因素。著手時要清楚,你是在驗證供應商的說法,而不是承接別人的結論。
錯誤在於把這個選擇當成永久不變。先購買小型模型的評估,因為那是便宜的實驗;針對小型模型失敗的任務租用旗艦模型,因為那是便宜的修補。在同一把金鑰與同一套測試框架上讓兩種選項並存的團隊,最終會用自己的資料做出這個決定,而當任一供應商推出後繼產品時,這是唯一站得住腳的版本。
