
Intern-S2-Mobius:將知識與推理分離的35B模型
- qwen新Qwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 每百萬 tokens · 56 tok/s
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3150智能69程式
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 201 tok/s
- orca新OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropic新Anthropic: Claude Opus 52026-07-2461智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2150智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1651智能71程式
- kimiMoonshotAI: Kimi K32026-07-1557智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0951智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0955智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0959智能77程式
- grokxAI: Grok 4.52026-07-0854智能72程式
- tencentTencent: Hy32026-07-0641智能59程式
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42程式
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39程式
- anthropicAnthropic: Claude Sonnet 52026-06-3053智能72程式
- klingKling: Kling 3.0 Turbo2026-06-1757智能52程式57數學
- z-aiZ.ai: GLM 5.22026-06-1651智能69程式60數學
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242智能61程式61數學
上海人工智慧實驗室的 InternLM 團隊低調發表了 Intern-S2-Mobius,這是一個 350 億參數的開放權重基礎模型,做到幾乎其他已釋出模型都做不到的事:它不再把知識儲存在層內部。不同於標準 Transformer 的排列——每一層都帶有自己充滿記憶事實的前饋區塊——Mobius 把所有知識抽取出來,放進單一的全域共享記憶體,並讓少數幾個 Reasoner 反覆查詢它。宣稱的好處不是更高的基準分數,而是速度:用約三分之一到五分之一推理 token 得到相同答案,請求吞吐量最高達 4.6 倍。這份指南說明 Mobius 實際是什麼、它的設定檔揭露了模型卡沒有說的東西、已發佈基準逐行顯示的結果——包括它落敗的兩列——「快 4 倍」的主張在哪些地方成立、又在哪些地方消失,以及誰應該認真關注它。
準確度說明:以下所有數字均來自 InternLM 自家的模型卡、其公布的效能與效率數據、其部署指南,以及該模型在 Hugging Face 上的組態檔。截至撰寫本文時,Intern-S2-Mobius 尚無任何獨立的第三方評測——它未列於任何獨立排行榜,未由任何推論服務供應商部署,且其下載計數器仍為零。在所有比較數字被他人重現之前,請將所有比較數據視為廠商回報的數據。這麼新的型號,其規格與程式碼變化很快;在著手建置前請先驗證。
TL;DR。Intern-S2-Mobius 是一個擁有 35B 參數、採用 Apache 2.0 授權的多模態基礎模型,從 Qwen3.5-35B 持續預訓練而來,並隨後通過 SFT(監督式微調)和強化學習進行後訓練。其創新之處在於架構:Mobius-v0 設計以一個由 2,560 個專家組成的全局共享記憶體取代了與層綁定的前饋知識儲存,由四個堆疊的 Reasoner 區塊進行查詢,這些區塊能夠觸及自身深度之外的知識(反向殘差連接),並在解碼之前通過遞迴潛在迭代來精煉隱藏狀態(動態潛在推理)。在 InternLM 自己的評測中,它在九個通用基準中的七個上擊敗了它所基於的 Qwen3.5-35B 基線(平均 67.88 對 65.05),並在科學任務上碾壓了它(52.14 對 18.20),同時產生的推理軌跡平均縮短約 1.5 倍——在 MMLU Pro 上縮短 4.6 倍,在 GPQA Diamond 上縮短 5.0 倍。這種軌跡壓縮正是吞吐量提升的來源:在 batch 16 時為 2.9 倍,在 batch 256 時上升到 4.6 倍。這些隱憂是真實存在的:它在兩個最難的推理基準(HLE 和 UGD hard)上落敗,吞吐量的優勢在競賽數學上大幅消失,而且實驗室以外沒有人驗證過其中的任何結果。
關鍵要點
• 架構優先發布:Mobius-v0 將知識向量與推理運算子解耦——由一個共享的 2,560 專家記憶庫服務四個推理器區塊,而非 40 層各自囤積自己的 FFN 知識。
• 賣點在於效率,而非智慧:平均輸出長度下降約1.5倍,請求吞吐量在批次16時提升2.9倍,批次256時提升4.6倍,相較於Transformer基線。
• 它確實勝過其基礎模型:在一般任務上平均 67.88 對比 65.05,並贏得 MMLU Pro(89.05 對比 85.31)、AIME 2026(95.31 對比 92.08)及 HMMT 2026(85.51 對比 78.50)。
• 但在最需要深思熟慮的地方,它卻落敗了:HLE 19.11 vs 22.40 與 UGD hard 73.02 vs 78.02——這是該組中最困難的兩項評測,兩者皆由普通 Transformer 勝出。
• 科學領域的躍進是最大的單一成果:Biology-Instructions 51.40 對比 3.77,Mol-Instructions 45.73 對比 21.70,MolecularIQ 59.29 對比 29.13。
「開放但無法使用:Apache 2.0 權重已在 Hugging Face 上,但沒有推論供應商代管,約 73 GB 的 bfloat16 權重——目前自行架設是唯一能執行它的方式。」
Intern-S2-Mobius 實際上是什麼
Intern-S2-Mobius 是由 internlm 發布的 35B 基礎模型,internlm 是上海 AI 實驗室 Intern 系列背後的 Hugging Face 組織。模型權重於 2026 年 7 月 29 日上架 Hugging Face,隨附的 GitHub 儲存庫——README、部署指南及完整技術報告 PDF——於 2026 年 8 月 5 日公開。該模型以 Apache 2.0 授權發布,這在開放權重中可謂最寬鬆:允許商業使用、修改與再散布。
這不是微調,而是帶有架構手術的持續預訓練。InternLM 採用了阿里巴巴於 2026 年 3 月 4 日發布的開源權重 35B 混合專家模型 Qwen3.5-35B,重新調整了模型儲存和存取知識的方式,並繼續對其結果進行預訓練,然後再疊加監督式微調和強化學習。這樣的來歷對於解讀基準測試結果至關重要:InternLM 發布的每一項比較,都是 Mobius 與其衍生來源的原始模型之間的對比,這是對架構變更最純淨的消融實驗,而且恰好也是最可能對其有利的比較。
該模型是多模態的。Hugging Face 將其歸類為 image-text-to-text,其配置也確認了完整的視覺編碼器與影片 token 處理能力。此外,從隨權重一同發布的內容來判斷,它也明確瞄準科學領域——詳見下文。
Mobius 架構,白話解說
傳統的 Transformer 在每一層中交錯執行兩項工作。注意力機制在 token 之間傳遞資訊;前饋網路(或在混合專家模型中,一組專家 FFN)負責儲存知識。由於 FFN 位於層內部,它所保存的知識只能在該深度被存取。在第 30 層學到的事實,無法被第 5 層正在進行的推理所查詢。資訊逐層向前流動,而這是唯一的路徑。
Mobius打破了那個束縛。InternLM描述了三個後果。
知識與推理分離。原本綁定於各層的 FFN 儲存,改由一個全域共享的 Memory 取代。與其讓 40 層各自擁有模型知識的一部分,不如設有一個所有推理階段都能存取的單一池子。InternLM 的論點是,這樣能改善知識壓縮——相同的事實無需在多個深度重複學習——並讓每個 Reasoner 擁有比單一層 FFN 所能提供的更廣闊的知識空間。
反向殘差連接。因為記憶體共享,淺層與深層推理階段都會到達同一個儲存庫。知識的存取不再嚴格地向前流動。淺層階段可以引入在標準堆疊中原本要三十層之後才能取得的內容。InternLM 主張,這讓模型能夠更靈活地跨深度組合知識,而且關鍵的是,能用更少的推理步驟綜合出有用的資訊。最後那句正是這次發布的核心論點。
動態潛在推理。與其將每個思考步驟外化為可見的思維鏈 token,Mobius 在解碼任何內容之前,會透過循環潛在迭代來精煉其連續的隱藏狀態。部分「思考」發生在模型的內部表徵空間,而非生成的文字中,且該內部計算的量會依每個 token 動態分配。實際效果是,模型需要寫更少的字詞就能達成相同的結論——而且由於生成是自迴歸且序列化的,寫更少的字詞正是讓推理模型變得更快最直接的方式。
總而言之,這個賣點是一個推理模型,想得多、打得少。

設定檔所揭露的資訊
模型卡以散文方式描述架構。這個 code>config.json/code> 讓它更具體,而且其中包含幾個值得了解的數字。
• 跨越 40 層的四個 Reasoner。文本配置宣告了 40 個隱藏層,但實際上只有四個區塊。這 40 個層被組織成四個 Reasoner 階段,它們會針對共享的 Memory 反覆迭代,而非四十個獨立的知識加注意力單元。
• 2,560 個專家。這就是共享記憶的具體呈現。Mobius 搭載 2,560 個專家,每個 token 啟動 8 個,每個專家的中間維度僅 512,另外還有一個共享專家。作為規模對比,其兄弟模型 Intern-S2-Preview 使用 256 個專家。一個大十倍、由小得多的專家所組成的專家池,正是把「以單一全域知識庫取代逐層 FFN」寫成設定檔時的具體樣貌。
• 包裝上標示 35B,磁碟上約 36B,活躍參數約 3B。 模型卡上寫的是 35B;Hugging Face 的 safetensors 讀取器顯示 36B 參數;權重索引在 bfloat16 格式下總計 72.96 GB,換算下來大約是 36.5B。部署指南最為精確:它將這個版本稱為 30B-A3B 模型——每個 token 約有 3B 參數處於活躍狀態。與任何稀疏 MoE 一樣,你必須在記憶體中載入完整的權重集合,但每個 token 的計算量相當於小型模型。
• 混合注意力,3:1。層列表交替排列三個線性注意力層與一個全注意力層,一路向下——40 層中有十個全注意力層。線性注意力能防止長上下文記憶與計算量爆炸;週期性的全注意力層保留了純線性注意力所放棄的精確召回能力。線性層使用寬度為 4 的卷積核與 float32 的 SSM 狀態,這是目前標準的 gated-delta 風格配方。
• 256K 上下文。最大位置嵌入為 262,144。請注意架構支援的能力與實際評估方式之間的差距:InternLM 在 128K 下執行其文字基準測試,而在 MMLU Pro、SimpleQA 和 HLE 上則為 64K。256K 的上限並不等同於 256K 的經驗證品質。
• 一個內建的多 token 預測頭。 有一個單層 MTP 模組,配備自己的 256 個專家。這不是裝飾——部署指南建議以 MTP 推測解碼搭配四個草稿 token 來運行,因此實際速度有一部分來自推測解碼,而非僅是架構本身。
• 一個真正的視覺塔。一個 27 層、1152 個隱藏單元的視覺編碼器,使用 patch size 16、2x2 空間合併與影片時序分塊,投影至具備交錯多模態 RoPE 的 2048 維文字串流。影像與影片輸入,文字輸出。
其他好奇者可能有興趣的細節:16 個注意力頭,頭維度為 256;2 個鍵值頭(激進的群組查詢注意力);門控注意力輸出;部分旋轉因子為 0.25;RoPE theta 為 1000 萬;以及 251,392 個 token 的詞彙量。
基準測試,逐行
InternLM 使用 OpenCompass 進行評估,並僅發布了一項比較:Intern-S2-Mobius-35B 對比 Qwen3.5-35B——即其持續預訓練所基於的模型。九個通用基準測試,三個科學基準測試。
在一般任務上,Mobius 九戰七勝。MMLU Pro——涵蓋廣泛多領域知識、干擾項比原始 MMLU 更難——分數為 89.05 對 85.31,領先 3.7 分,是這組測試中知識結果最明確的一項。GPQA Diamond——研究生級科學題目,設計成無法靠 Google 搜尋解答——基本上打成平手:80.81 對 80.24。IMO Bench——奧林匹亞等級的數學——分數為 81.25 對 77.50。AIME 2026——美國數學邀請賽——分數為 95.31 對 92.08。HMMT 2026——哈佛—麻省理工數學錦標賽——是數學領域中差距最大的一項:85.51 對 78.50。AMO分數為 58.00 對 50.00。而SimpleQA——短答式事實回憶,最能直接衡量模型是否真正「知道」事物的基準——從 21.39 躍升至 28.90,相對提升 35%,是支持 InternLM「共享記憶能更有效地壓縮知識」主張最有力的單一證據。
接著是那兩項失利,它們正是有趣的資料列。 UGD hard則走向另一邊:Mobius 為 73.02,基線為 78.02,相差五分。而 HLE——Humanity's Last Exam,目前廣為使用的最困難通用評測,前沿模型仍只有十幾二十分——是 19.11 對 22.40。普通 Transformer 在特別設計來要求最多推理的基準上,以 3.3 分的優勢勝出。
That pattern is not noise, and it is not hidden: InternLM published it. The most plausible reading is that latent reasoning is a compression, and compression is lossy at the tail. Internalizing deliberation into continuous hidden states works beautifully when the deliberation is retrieval-heavy or follows a familiar shape — which describes MMLU Pro, SimpleQA, and most competition math. On problems that genuinely require long, exploratory, error-correcting chains of thought, the explicit token-by-token trace still appears to be worth its cost. The overall average — 67.88 against 65.05 — is a real win, but it is an average that conceals a trade, not a uniform improvement. 這種模式並非雜訊,也並非隱藏:InternLM 已將其發表。最合理的解讀是,潛在推理(latent reasoning)本質上是一種壓縮,而壓縮在尾端是有損的。將深思內化到連續隱藏狀態中,當 deliberation 屬於重檢索(retrieval-heavy)或遵循熟悉形狀時,效果極佳——這正是 MMLU Pro、SimpleQA 以及大多數競賽數學題的寫照。但對於真正需要冗長、探索性、具備錯誤修正能力的思維鏈的問題,顯式的逐 token 軌跡仍然顯示出其成本是值得的。整體平均——67.88 對上 65.05——確實是一場實質勝利,但這個平均數掩蓋的是一場取捨,而非全面性的提升。
科學結果的差異是另一個量級。Biology-Instructions從 3.77 提升到 51.40。Mol-Instructions涵蓋分子理解與生成,從 21.70 提升到 45.73。MolecularIQ從 29.13 提升到 59.29。平均值為 52.14,對比基準的 18.20。像 3.77 躍升至 51.40 這樣的數字並非架構的勝利;它們是針對性領域訓練的標誌——這些任務是基線模型從未被教導去做的。Qwen3.5-35B 在 Biology-Instructions 上得分低於 4%,這代表它不理解任務格式,而不是它在生物學上表現差。請將這三行解讀為「InternLM 增加了一項科學專業化」,這確實有價值,也正是 Intern-S 系列的意義所在——只是不要將其歸功於 Mobius 架構。
「4x faster」在哪些情況下是真的,哪些情況下不是
這個效率宣稱是這個模型存在的原因,所以值得仔細解讀。InternLM 的標題是「接近 4 倍端到端推論加速」。公布的吞吐量數字比標題更具資訊性,也更誠實。
以請求吞吐量相對批次大小衡量,並跨基準測試取平均,Mobius 比 Transformer 基線高出 2.9 倍(批次 16)和 4.6 倍(批次 256)。差距隨批次大小擴大,這正是當優勢來自於每個請求生成更少的 token 時所預期的結果:請求打包得越多,省下的解碼步驟累加效應就越顯著。「近 4 倍」的標題只是範圍的中點,而非固定常數。
逐項基準拆解來看,情況會更加清晰。在MMLU Pro和GPQA Diamond上,Mobius 在每個批次大小下都大幅更快——吞吐量曲線立刻分開,且持續擴大差距。在IMO Bench上,它持續領先,但幅度不大。在AIME 2026和HMMT 2026上,基準 Transformer 實際上更快——在中間批次大小下,Mobius 要到批次 256 才超前。在最困難的競賽數學題上,在大部分實用操作範圍內,吞吐量優勢不是持平就是更差。
為什麼?因為吞吐量幾乎完美地貼合軌跡壓縮。各基準測試的平均輸出長度縮短約 1.5 倍,從大約 20,400 個 token 降至大約 13,200 個。但這個平均值涵蓋了極大的範圍:在 MMLU Pro 上縮短 4.6 倍(約 1,100 個 token,對比 5,150 個),而在 GPQA Diamond 上縮短 5.0 倍(約 2,600 個,對比 12,900 個),而僅在 IMO Bench 上縮短 1.4 倍、在 AIME 2026 上縮短 1.5 倍,以及在 HMMT 2026 上縮短 1.2 倍。在模型能壓縮思考的地方,它便能飛快運行。在問題無論如何都要求長達 24,000 個 token 推導的地方,它就無法壓縮,而架構的開銷反而顯現出來。
實際的翻譯是:如果你的工作負載屬於知識檢索、選擇題、技術問答或分類,加速效果會既大且立即。如果你的工作負載是困難的數學或科學推導,預期大概持平,然後再期待驚喜。任何把「快 4 倍」當作模型普遍特性來引用的人,只是在引用兩種截然不同行為的平均值。

藏在檔案清單中的科學技術棧
這次發行中最能說明問題的地方,並不在模型卡中,而是在儲存庫的檔案清單裡。除了常見的 tokenizer 檔案之外,Intern-S2-Mobius 還附帶了三個額外的領域 tokenizer:code>tokenizer_PROT.model/code> 用於蛋白質序列,code>tokenizer_SMILES.model/code> 用於 SMILES 表示法中的分子結構,以及code>tokenizer_XNA.model/code> 用於核酸序列。此外,儲存庫中還出現了一個來歷不明、內含地震資料的 NumPy 陣列。
針對蛋白質、分子和 DNA/RNA 的專用 tokenizer 不是隨隨便便就能加上去的東西。它們代表模型經過訓練,能將這些序列類型視為第一級輸入來讀取,而不是當作恰好含有字母的普通文字。這就是為什麼在 Biology-Instructions 上的分數能從 3.77 躍升到 51.40,這也讓 Mobius 與其姊妹模型 Intern-S2-Preview 歸於同一家族——後者加入了時間序列與視覺模態,而且根據 InternLM 的說法,它是第一個具備材料晶體結構生成能力的開源模型。
如果你是一般用途的開發者,這只是冷知識。如果你從事計算生物學、化學資訊學或材料科學,這可能是這篇文章中最重要的一行:這是一個小巧、採用 Apache-2.0 授權、可自行託管的模型,原生支援 SMILES 和蛋白質序列。
它在 Intern 家族中的位置
Intern-S 系列是上海人工智能實驗室的科學多模態系列。Intern-S1 確立了其形態。Intern-S1-Pro 將其擴展至萬億參數級別。Intern-S2-Preview 在 Mobius 發布前不久推出,是主打效率的型號:總參數 36B、激活參數 3B,配備 256 個專家與 262K 上下文,InternLM 聲稱其在核心專業科學任務上可媲美萬億規模的 S1-Pro——參數量約縮減 30 倍,卻能實現相當的科學能力。
Intern-S2-Mobius 是第三種東西:一個架構發布版本,冠以 Intern-S2 之名。Mobius-v0 中的「v0」在這個名稱中確有實質意義——這是某個設計的首次公開迭代,而非成熟的產品線。它連接到ArchSpace,即 InternLM 用於驗證 LLM 架構創新的開放平台,其既定目標是「將 LLM 架構探索轉化為社群可重複使用的知識」,並設有同儕審查機制與公開成果,包括負面結果在內。當一個提案從 1B 規模的試探性模型蛻變為你可實際下載的 35B 模型時,Mobius 就是該計畫所呈現的樣貌。完整的技術報告會附於 GitHub 儲存庫中,供任何想了解推導過程的人參閱。
以這樣的角度來看,這兩項基準測試的損失是這次發布的一個特色,而非難堪之事。這是一個實驗室誠實地發布一項架構實驗,包括它在哪些方面退步了。
如何執行它
Intern-S2-Mobius 由三個推理堆疊支援,部署指南提供了每個堆疊的有效呼叫方式。
LMDeploy是建議的路徑,也是指南在單一 GPU 上顯示的唯一方式:以 PyTorch 後端提供服務,code>--trust-remote-code/code>、張量並行度為 1,並透過 qwen3_5_mtp 推測演算法以四個草稿 token 啟用 MTP 推測解碼。 vLLM則顯示為張量並行度 2、qwen3 推理解析器、qwen3_coder 工具呼叫解析器、自動工具選擇,以及使用四個推測 token 進行 MTP 推測解碼。 Transformers可用於基本推理:透過code>AutoModelForImageTextToText/code>搭配code>trust_remote_code=True/code>及 bfloat16 — 請注意,該模型附帶自訂建模程式碼,因此必須執行遠端程式碼,且設定檔以 Transformers 5.2 為目標。
InternLM 建議的採樣參數為 temperature 0.8、top-p 0.95、top-k 50、min-p 0.0——比起多數推理模型偏好的近乎貪婪(near-greedy)設定更為溫暖,這點值得尊重,而非基於習慣逕行覆蓋。
在硬體方面:大約 73 GB 的 bfloat16 權重,加上 KV 快取與激活值,代表單張 80 GB 加速器會很吃緊,而單張 141 GB 的顯示卡則游刃有餘;這大概就是為什麼 vLLM 範例使用兩張 GPU,而 LMDeploy 範例假設使用一張大卡的原因。長上下文任務會進一步推高需求。啟用 MTP——指南明確建議這麼做——而宣稱的加速效果中,有相當可觀的一部分來自 MTP,而非基礎架構本身。
最重要的實際注意事項:目前沒有任何推論供應商託管此模型。Hugging Face 的供應商面板已明白表示如此,而且在撰寫本文時,下載計數器仍為零。沒有 API 端點、沒有每百萬 token 的定價,也沒有受管的方式可以試用。自行託管是現今唯一的選項。

誰才真正該在乎
1. 運行大量以檢索為核心的推理工作負載的團隊
此架構正是為這種使用情境而打造。如果你透過推理模型處理大量技術問答、文件分析、結構化擷取或選擇題式分類,而帳單主要來自從未展示給使用者的推理 token,那麼一個能以五分之一 token 數達到相同答案的模型,就是直接的成本縮減。MMLU Pro 與 GPQA 的數據——4.6 倍與 5.0 倍更短的推理軌跡,同時準確度持平或更佳——正是這種形態。在相信之前,先用你自己的流量對它做基準測試,但此機制是合理的,誘因也很大。
2. 計算科學團隊
原生蛋白質、SMILES 與核酸標記化器,加上在生物學與分子基準測試上的大幅實測提升,且採用 Apache 2.0 授權、可在一或兩張 GPU 上運行的模型。對於需要資料留在本地、無法將分子結構傳送到商業 API 的實驗室來說,這種組合相當罕見。Intern-S 系列一直在朝這個方向發展,而 Mobius 是目前進入該系列最便宜的切入點。
3. 研究人員與建築觀察者
知識推理解耦與潛在推理(latent reasoning)向來是活躍的研究方向;但極少數能在35B規模下通過驗證,並在完整保留失敗案例的情況下公開釋出。如果你關心後Transformer架構的下一步走向,技術報告和那落敗的兩列,會比平均分數更有看頭。ArchSpace 的設計初衷,就是讓這類結果能被重複利用。
至少目前還不應該在意的人:任何正在尋找可投入生產環境的通用型助理的人。目前沒有託管端點、沒有獨立評估、沒有生態系工具,也沒有實績紀錄。這不是對該模型的批評——而是對一個剛滿一週的研究釋出的描述。
它如何融入生產技術棧
今天對 Intern-S2-Mobius 的誠實定位是評估候選,而非預設模型。它是一個未託管、未經驗證、僅一週大的研究產物,架構確實有趣,且有一項非常具體的長處——在檢索型任務上具備節省 token 的推理能力——此外也真正專精於科學序列資料。
一個合理的做法是,將正式環境的流量保留在 OrcaRouter 這類廠商中立的端點上,它可讓你在眾多模型之間使用單一 OpenAI 相容 API;同時在自己的 GPU 上另行部署 Mobius,專門處理它可能勝出的狹窄部分。對這個模型而言,要量測真正重要的指標:不是只有準確度,而是 每個正確答案所花費的 token 數。這正是 Mobius 最佳化的軸線,也是大多數評測框架忽略的軸線。如果它在你的工作負載上表現良好,你就擁有一條成本低廉且無法律負擔的自架路線;如果沒有,你只是損失一天的 GPU 時間,而你的正式環境路線完全沒有變動。
如果提供者最終將其託管,同樣的邏輯也反向適用:路由器讓你能夠在不重寫任何東西的情況下,將新模型與現行模型進行 A/B 測試,而這正是採納一種無人獨立測試過的架構的正確方式。
限制與注意事項
先從最大的問題說起:這篇文章中的任何數字都沒有獨立驗證。每一項基準測試、每一條吞吐量曲線、每一次 token 長度比較,全都來自 InternLM。這項比較在結構上也對 Mobius 有利——它只與其持續預訓練所依據的特定基線相比,而非與當前的技術前沿相比;而且額外的 SFT 與 RL 後續訓練意味著這並非一次乾淨的架構消融實驗,儘管它被如此呈現。部分增益來自 Mobius,部分純粹是更多訓練。
這些退步是真實的,而且出現在最困難的任務上。HLE 掉了 3.3 分、UGD hard 掉了 5 分,同時幾乎所有較簡單的任務都獲勝——對一個以推理效率為賣點的模型來說,這是一個一致且略令人擔憂的徵兆。
在操作上,摩擦相當顯著。自訂建模程式碼意味著 code>trust_remote_code/code> 以及一個最先進的 Transformers 版本。支援它的框架必須夠新,才能知道code>interns2_mobius/code> 是什麼,而 InternLM 自己的指南也警告,這些是仍在積極開發中的參考配置。約 73 GB 的權重不是筆電能跑的模型。沒有託管 API、沒有定價、沒有速率限制、也沒有 SLA——因為根本沒有服務。
最後,請注意哪些內容尚未公布:儘管配備了完整的視覺編碼器,卻沒有多模態基準測試結果;儘管宣稱 256K 的上下文上限,卻沒有長上下文評估;完全沒有程式設計基準測試;沒有安全性或對齊評估;也沒有與 Qwen3.5-35B 以外的任何模型進行比較。對於一般用途的部署而言,這些是很大的空白區塊。對於一篇附帶權重的架構論文來說,這些則根本不在範圍之內——這才是解讀本次發布的正確方式。
常見問題
什麼是 Intern-S2-Mobius?
一個350億參數、Apache 2.0授權的多模態基礎模型,來自上海人工智慧實驗室InternLM團隊,採用將知識儲存與推理計算分離的Mobius-v0架構。該模型從Qwen3.5-35B持續預訓練,並以SFT和強化學習進行後訓練,於2026年7月29日在Hugging Face上發布。
是什麼讓 Mobius 架構與眾不同?
傳統 Transformer 將知識儲存在每一層內的前饋區塊中,因此知識只能在它所在的深度被存取。Mobius 以一個全域共享的 Memory 取代此做法——在發布的配置中有 2,560 個專家——四個 Reasoner 區塊會反覆查詢它,從而實現跨深度的知識存取,並讓部分推理在連續的隱藏狀態中進行,而非透過生成的思維鏈 token。
Intern-S2-Mobius 真的快 4 倍嗎?
平均而言,在大批次大小下,大致是這樣:InternLM 在批次 16 時的請求吞吐量高出 2.9 倍,到批次 256 時上升到 4.6 倍。但這因任務而異。在 MMLU Pro 和 GPQA Diamond 上,每個批次大小的增益都很大;在 AIME 和 HMMT 競賽數學上,基準 Transformer 在中間批次大小下實際上更快。加速幅度與模型能縮短其推理軌跡的程度相關。
它與Qwen3.5-35B相比如何?
它在九項綜合基準中贏得七項,平均67.88對65.05,包括MMLU Pro(89.05對85.31)、AIME 2026(95.31對92.08)、HMMT 2026(85.51對78.50)和SimpleQA(28.90對21.39)。它在UGD hard(73.02對78.02)和HLE(19.11對22.40)上落敗。在科學任務上,它遙遙領先——平均52.14對18.20。
我可以透過 API 使用 Intern-S2-Mobius 嗎?
目前沒有。沒有推論供應商託管該模型,沒有公開的定價,Hugging Face 也未列出任何部署。現今只能透過 LMDeploy、vLLM 或 Transformers 自行託管來運行它。
執行它需要什麼硬體?
權重以 bfloat16 格式儲存時約為 73 GB,因此請規劃使用一個 141 GB 等級的加速器或兩個 80 GB 的 GPU,並為 KV 快取預留額外空間。InternLM 的 LMDeploy 範例使用張量並行度為 1,而其 vLLM 範例則使用 2。建議啟用具備四個草稿 token 的 MTP 推測解碼。
它的上下文長度是多少?
此配置支援 262,144 個 token(256K)。請注意,InternLM 在多數文字基準測試中以 128K 評估,而在 MMLU Pro、SimpleQA 和 HLE 上則以 64K 評估,因此完整 256K 下的驗證品質尚未獲得證實。
它是多模態的嗎?
是的。Hugging Face 將它歸類為 image-text-to-text,其配置包含一個 27 層的視覺編碼器,並具備影片 token 處理能力。不過,InternLM 在此次發布中並未公布任何多模態基準測試結果,因此其視覺能力在實務上並無文件記載。
為什麼它會隨附蛋白質和 SMILES 的 tokenizer?
由於Intern-S系列是一個科學模型家族。針對蛋白質序列、SMILES分子標記法及核酸的專用分詞器,使模型能將這些格式視為原生輸入類型來讀取,這就是為何它在Biology-Instructions上獲得51.40分,而基線僅得3.77分的原因。
這個授權真的是 Apache 2.0 嗎?
是的 — Apache 2.0,授權檔案位於儲存庫中。允許商業使用、修改和重新發布,這明顯比許多大型實驗室發布的開放權重版本更為寬鬆。
我應該在生產環境中使用它嗎?
還沒有。它才一週大,尚未託管,未經任何第三方驗證,也缺少程式碼、多模態、長上下文和安全性評估。請將其視為評估候選方案,用於節省 token 的推理或科學序列工作;透過廠商中立的端點將正式環境流量維持在既有模型上,並在獨立數據出爐時重新檢視。
底線
Intern-S2-Mobius 是今年真正值得關注的模型發布之一,而這幾乎與它的分數無關。InternLM 採納了一個真正的架構理念——不再將知識綁定於各層,而是放入一個共享的 Memory 中,讓模型在潛在空間中進行部分思考,而非完全依賴 token——將其擴展到 35B 參數,進行了適當的訓練,並以 Apache 2.0 授權發布了權重,同時附上技術報告以及那些不盡如人意的結果。其效率機制清晰可辨,相關證據也具備內部一致性:推論軌跡平均縮短 1.5 倍,在知識密集型任務上最多縮短 5 倍,而吞吐量的提升幅度與此精確吻合。
這些警示同樣明確。除了上海人工智能實驗室之外,沒有人驗證過任何一個數字。該比較是針對模型自身的基礎版本,而且包含了額外的後期訓練,因此並非表面上看起來的那種乾淨的消融實驗。加速效果在困難的數學問題上幾乎消失。在自家表格中,該模型在兩個最嚴苛的推理基準上落敗。而且如果不租用 GPU,根本無法試用。
所以:這不是本週就要部署的模型,但非常值得關注,而且對兩類特定對象來說,確實是極具吸引力的選擇——一類是推理帳單主要被沒人閱讀的 token 佔據的團隊;另一類是需要小巧、寬鬆授權,且原生就能理解蛋白質與分子的模型的科學研究團隊。生產技術棧請繼續採用經過驗證的模型,並透過像 OrcaRouter 這類供應商中立的端點來串接;Mobius 則只針對狹窄的特定場景,部署在你自己的硬體上;衡量指標請用「每個正確答案消耗的 token 數」,而不是單看準確率。如果這個架構能通過獨立審視,Mobius-v0 被記住的將不會是「35B 模型」這個標籤,而是「真正重要版本的前一版」。
