
FrogNano-4B-2609 對比 Intern Decision 4B:同一個基礎模型,兩種截然不同的押注
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 219 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
兩個實驗室拿了同一個檢查點 Qwen3.5-4B,把它推向彼此毫不相似的方向。microsoft/FrogNano-4B-2609以強化學習在約 1,500 個合成軟體工程環境上進行後訓練,直到它能透過五工具的工具組發出結構化工具呼叫與多檔案修補。internlm/Intern-Decision-4B則被微調成完全不輸出任何文字——它接收一個狀態加上一份具名問題的 schema,並在單次前向傳播中為每個選項回傳一個經過校準的機率。一個會寫程式碼。另一個拒絕寫任何東西,只回傳一個分布。拿它們比品質毫無意義;拿它們比執行成本,以及它們能被託付什麼任務,才是誠實的檢驗。
兩者都是在未事先公告的情況下推出,這是它們共有的另一點。兩者都沒有 Artificial Analysis 條目、沒有競技場評分,也沒有任何一項獨立評估。以下每一個數字——一邊是 SWE-bench 階梯,另一邊是 Brier 與 ECE 校準列——都是由訓練該模型的實驗室,在該實驗室自家的測試框架上產生的,而且從未遇過不是來自該實驗室的測試集。
這個分支發生在兩個模型都還不存在之前
基礎檢查點是一個稠密的 32 層混合式 Gated DeltaNet 與閘控注意力模型,而這兩個衍生模型都繼承了它的骨架。在那之後,這兩條後訓練流程便毫無共同點。
微軟的流程是一個閉環。TaskPilot 從真實快照產生候選的儲存庫任務,從當前檢查點執行 rollout,找出策略有時能解開的任務,保留這些任務,然後進行訓練。五個迭代,每個迭代都依據前一個迭代的策略進行校準,最終在 SWE-bench Verified 上達到 61.5%,在 SWE-bench Pro 上達到 37.6%。沒有蒸餾——模型卡指出,並未使用任何更強模型的軌跡、動作或推理軌跡作為目標。
InternLM 的 pipeline 是在固定任務型態上的一個單一監督式目標。模型會收到系統提示、一個狀態、一個決策 schema,以及一份完整的 assistant JSON 骨架,每個欄位各有一個佔位符。它會執行一次因果前向傳遞,讀取每個佔位符位置的 logits,並且只對該欄位允許的候選符號做 softmax。InternLM 的模型卡直接寫道:這條路徑「不會呼叫 generate() 或取樣自由形式的文字。」
那個差異不是規模上的差異。那是這件產物究竟是什麼的差異。FrogNano-4B-2609 是一個智慧體,能以一百種有趣的方式出錯,並透過測試來修正。Intern-Decision-4B 是一個評分器,其失效模式是一個自信的數字。
還有兩份合約:房東對不合標準住宅的行動,以及安寧享用權。
FrogNano 的契約是一個迴圈。模型會發出對Read、Write、Edit、Glob與Bash 的呼叫;Leaf 測試框架會在隔離的儲存庫沙箱中執行它們並回傳輸出;迴圈會持續到模型停止呼叫為止。評估在約 131K 合計 token 內以 150 個步驟執行,每回合助理最多產生 8,192 個 token。服務需要 SGLang,搭配 Qwen3 推理解析器與 Qwen3 coder 工具呼叫解析器——一旦弄錯,模型會在測試框架預期 JSON 的地方產生散文,從外部看起來就完全像是壞掉了。
Intern-Decision-4B 的契約是單次執行,且帶有硬性限制。題目與選項會維持其順序。選項會對應到單一 token 符號——A 到 Z,然後 a 到 z,然後 0 到 9,這就是一道題目最多只能有 62 個選項的算術原因。包裝器的上限是 8,192 個 token,而 InternLM 的模型卡明確指出,較長的輸入會被拒絕,不會截斷。支援三種題目類型:choice 搭配有序的準則對應表,score 搭配清單或以數字為鍵的對應表,以及 noul,一種二元類型。最多允許八張圖片,且其 token 會計入同樣的 8,192 上限。
• 輸出形態 — FrogNano-4B-2609 會輸出工具呼叫、推理文字與修補檔。Intern-Decision-4B 則每個欄位只輸出一個符號,別無其他。
• 決定性 — FrogNano 在三個種子上以溫度 0.6 取樣,因此其設計本質上具有機率性。Intern-Decision-4B 的 argmax 由前向傳遞固定;擬合溫度僅會改變其置信度。
• 失效面 — FrogNano 可能會幻想出一個 API、把編輯範圍過度擴大,或在通過測試的同時引入漏洞,而這些全都是它的卡片所點名的。Intern-Decision-4B 無法憑空編造答案,因為它只能從你提供的選項中挑選 — 它只可能是校準不當。
• 輸入上限——在評估配置下,FrogNano 約為 131K 合併 token,而 Intern-Decision-4B 的硬性上限為 8,192;兩者相差十六倍,且沒有任何變通方法。
• 成本結構 — FrogNano 按軌跡計費,而軌跡很長。Intern-Decision-4B 完全沒有輸出 token 可計費。
• 參數 — FrogNano 的模型卡給出「500M-5B」的區間,並描述約 4.66B,BF16 下載檔為 9.32 GB;Intern-Decision-4B 則標示為 4.54B,搭配 612 MB 的視覺塔與 54 MB 的投影器,以及其語言分片。
決定這個配對的數字
InternLM 的模型卡指出,在單張 RTX 4090 上,透過本機 Hugging Face 路徑,Intern-Decision-4B 的平均延遲為 44.16 毫秒、中位數為 44.03 毫秒,P95 為 44.60 毫秒。再讀一次那個分佈差距:中位數到尾部遠低於一毫秒,因為固定形狀的前向傳遞幾乎沒有什麼可變動的。這就是支持該架構的全部論點。
FrogNano 對應的數字並不是以毫秒為單位。它的評估允許 150 步的預算,每個任務的代理上限為 10,800 秒。這些不是可比較的單位,也絕不該和延遲宣告放在同一個句子裡——但它們確實能告訴你這種取捨的形狀。一個模型在四十四毫秒內回答一個決策,另一個則花上好幾分鐘的tool calls去追一個修補程式。如果你的問題是「把這張工單路由到六個佇列的其中一個,並告訴我你有多確定」,那麼第一個並不是第二個的便宜版本,它是截然不同的機器。
兩個實驗室都審慎地衡量自身,而這兩組測量數據都應該被解讀為意圖,而非結果。InternLM 報告在 1,728 個指定校準案例上,以溫度 1.99241824 擬合,七組平均為 90.02,Brier 分數為 0.347,期望校準誤差為 0.065。微軟報告在 SWE-bench Verified 上歷經五輪迭代從 39.4% 攀升至 61.5%,而同一篇論文的附錄則將同一進展記為 48.2%、53.4%、58.3%、58.6% 與 61.6%——這提醒我們,即使在同一間實驗室內,同一個事實以兩種方式衡量,也會產生兩套階梯。

破綻就在於每張牌選擇警告你什麼。
兩張卡都異常誠實,而這份誠實指向相反的方向——這正是這項比較中最有用的一點。
微軟的「已知限制」章節讀起來像是一則部署警告。僅支援英文與 Python。效能對測試框架與測試品質很敏感。即使通過測試,修補程式仍可能不正確或不安全。這張模型卡自己寫道,FrogNano「不應被視為已獨立完成安全對齊,可用於不受限制的自主任意部署」,並指出具體缺口:代理專屬的後訓練並未使用安全偏好、拒答或對抗性資料,因為它改為以功能正確性與避免迴歸為最佳化目標。它也主動揭露 1.71% 的平行工具呼叫率,意味著儘管測試框架允許,模型幾乎從不會在同一回合觸發兩個工具——這是相較基礎模型的真實能力退步,團隊因此加入一個整合階段試圖挽回。
InternLM 的模型卡警告的是相反類別的問題。沒有幻覺面向需要警告,所以注意事項是關於輸入:8,192 的拒絕、62 個選項的上限,以及底層文字塔宣告了 262,144 個詞元的位置上限、而發布的包裝器拒絕使用這件事實。它的風險在於,一個有把握的數字被信任得超過它應得的程度,而模型卡坦承,該校準縮小了與 Jev 基線的差距,卻未在每個切片上將其彌合。
合起來讀,它們描述的是兩種不同的信任姿態。FrogNano 需要監督,因為它會採取行動。Intern-Decision-4B 需要稽核,因為它會評分——而一個能左右正式環境決策的數字,正是那種沒有人會想到要去測試的輸出。
路由器適合的場合,以及對兩者的誠實說明
這兩個模型都不是託管端點。FrogNano 以權重加上一套 Kubernetes 評估測試框架的形式發布;Intern-Decision-4B 則以一個 Python 類別的形式發布,你必須先下載四個分片才能匯入。對於想讓任一個模型在真實系統面前試跑的團隊來說,兩者的安全模式相同,而且並不光鮮:把實驗性元件放在後備機制後面,這樣一來,糟糕的軌跡或校準失準的一天,付出的代價會是一次重試,而不是一場事故。
這種模式正是路由層存在的意義。OrcaRouter 用一組相容 OpenAI 的金鑰就能運行 200 多個模型且零加成——供應商的標價原樣傳遞,因此供應商調價當天就會反映到我們這邊——而且它的容錯移轉是放在你作為備援的一般模型前面,而不是放在這兩個模型前面。說白一點:我們並沒有提供 FrogNano-4B-2609 或 Intern-Decision-4B,兩者也都没有上市日期。單一端點在這裡能帶給你的,是讓比較本身變得便宜——一組憑證、一條帳務項目,而且每次你更換用來評測這個專用模型的一般模型時,都不需要再做第二次整合。

哪一個,以及何時?
當答案已存在於你的提示中,而你需要將它選出、附上信心分數,且速度達每秒數千次時,就採用 Intern-Decision-4B。固定分類法路由、評分規準評分、結構描述受限擷取、依封閉標籤集進行的審核。44 毫秒的前向傳遞與零輸出權杖費用就是產品本身,而校準則是你在信任它之前必須稽核的重點。
當答案尚不存在、必須藉由閱讀儲存庫並執行其測試才能發現時,就採用 FrogNano-4B-2609。那是一個耗時數分鐘、在沙箱中執行且可審查的流程,而 SWE-bench Verified 上的 61.5%——由廠商自行回報、尚未重現——是目前證明 4B 檢查點確實做得到這件事的最佳證據。
不論從哪一方來看,都不該放過的,是拿雙方分數相比的習慣。90.02 的七組平均與 61.5 的 SWE-bench Verified 通過率,衡量的是兩個不同的問題,由兩個實驗室、在兩套測試框架上產出,而這兩個數字都不曾經過第三方之手。它們除了同源之外,別無共通之處。

{{1}}來自共同祖先的那個真正有用的預測:{{/1}}因為兩個模型都從同一個 4B 檢查點出發,{{2}}它們之間的差異幾乎完全在後訓練階段,{{/2}}{{3}}這意味著對任何要在 Qwen3.5-4B 上建構的人來說,有趣的問題是這兩種獎勵結構中,哪一種能遷移到他們自己的領域。{{/3}}{{4}}一個對自身策略進行校準的合成任務迴圈,{{/4}}{{5}}或者一個帶有擬合溫度的固定形狀評分頭。{{/5}}{{6}}那是兩套配方,兩者都已發表,兩者都來自尚未讓其他人實際跑過它們的實驗室。{{/6}}{{7}}那是一種罕見的情況,值得觀察,而不是貿然買單。{{/7}}
