一張生成的標題卡寫著「FrogNano-4B-2609 vs Intern-Decision-4B」,副標題為「同一個 Qwen3.5-4B 祖先,兩種相反的輸出」,三個標籤分別寫著「工具呼叫與修補程式」、「每個欄位一個符號」和「兩者皆未經獨立評分」,頁腳寫著「兩份計分板皆由廠商自行回報;尚無第三方重現過任何一個」,以及 OrcaRouter 標誌合成於右下角。
Guides & Insights

FrogNano-4B-2609 對比 Intern Decision 4B:同一個基礎模型,兩種截然不同的押注

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩個實驗室拿了同一個檢查點 Qwen3.5-4B,把它推向彼此毫不相似的方向。microsoft/FrogNano-4B-2609以強化學習在約 1,500 個合成軟體工程環境上進行後訓練,直到它能透過五工具的工具組發出結構化工具呼叫與多檔案修補。internlm/Intern-Decision-4B則被微調成完全不輸出任何文字——它接收一個狀態加上一份具名問題的 schema,並在單次前向傳播中為每個選項回傳一個經過校準的機率。一個會寫程式碼。另一個拒絕寫任何東西,只回傳一個分布。拿它們比品質毫無意義;拿它們比執行成本,以及它們能被託付什麼任務,才是誠實的檢驗。

兩者都是在未事先公告的情況下推出,這是它們共有的另一點。兩者都沒有 Artificial Analysis 條目、沒有競技場評分,也沒有任何一項獨立評估。以下每一個數字——一邊是 SWE-bench 階梯,另一邊是 Brier 與 ECE 校準列——都是由訓練該模型的實驗室,在該實驗室自家的測試框架上產生的,而且從未遇過不是來自該實驗室的測試集。

這個分支發生在兩個模型都還不存在之前

基礎檢查點是一個稠密的 32 層混合式 Gated DeltaNet 與閘控注意力模型,而這兩個衍生模型都繼承了它的骨架。在那之後,這兩條後訓練流程便毫無共同點。

微軟的流程是一個閉環。TaskPilot 從真實快照產生候選的儲存庫任務,從當前檢查點執行 rollout,找出策略有時能解開的任務,保留這些任務,然後進行訓練。五個迭代,每個迭代都依據前一個迭代的策略進行校準,最終在 SWE-bench Verified 上達到 61.5%,在 SWE-bench Pro 上達到 37.6%。沒有蒸餾——模型卡指出,並未使用任何更強模型的軌跡、動作或推理軌跡作為目標。

InternLM 的 pipeline 是在固定任務型態上的一個單一監督式目標。模型會收到系統提示、一個狀態、一個決策 schema,以及一份完整的 assistant JSON 骨架,每個欄位各有一個佔位符。它會執行一次因果前向傳遞,讀取每個佔位符位置的 logits,並且只對該欄位允許的候選符號做 softmax。InternLM 的模型卡直接寫道:這條路徑「不會呼叫 generate() 或取樣自由形式的文字。」

那個差異不是規模上的差異。那是這件產物究竟是什麼的差異。FrogNano-4B-2609 是一個智慧體,能以一百種有趣的方式出錯,並透過測試來修正。Intern-Decision-4B 是一個評分器,其失效模式是一個自信的數字。

還有兩份合約:房東對不合標準住宅的行動,以及安寧享用權。

FrogNano 的契約是一個迴圈。模型會發出對Read、Write、Edit、Glob與Bash 的呼叫;Leaf 測試框架會在隔離的儲存庫沙箱中執行它們並回傳輸出;迴圈會持續到模型停止呼叫為止。評估在約 131K 合計 token 內以 150 個步驟執行,每回合助理最多產生 8,192 個 token。服務需要 SGLang,搭配 Qwen3 推理解析器與 Qwen3 coder 工具呼叫解析器——一旦弄錯,模型會在測試框架預期 JSON 的地方產生散文,從外部看起來就完全像是壞掉了。

Intern-Decision-4B 的契約是單次執行,且帶有硬性限制。題目與選項會維持其順序。選項會對應到單一 token 符號——A 到 Z,然後 a 到 z,然後 0 到 9,這就是一道題目最多只能有 62 個選項的算術原因。包裝器的上限是 8,192 個 token,而 InternLM 的模型卡明確指出,較長的輸入會被拒絕,不會截斷。支援三種題目類型:choice 搭配有序的準則對應表,score 搭配清單或以數字為鍵的對應表,以及 noul,一種二元類型。最多允許八張圖片,且其 token 會計入同樣的 8,192 上限。

• 輸出形態 — FrogNano-4B-2609 會輸出工具呼叫、推理文字與修補檔。Intern-Decision-4B 則每個欄位只輸出一個符號,別無其他。

• 決定性 — FrogNano 在三個種子上以溫度 0.6 取樣,因此其設計本質上具有機率性。Intern-Decision-4B 的 argmax 由前向傳遞固定;擬合溫度僅會改變其置信度。

• 失效面 — FrogNano 可能會幻想出一個 API、把編輯範圍過度擴大,或在通過測試的同時引入漏洞,而這些全都是它的卡片所點名的。Intern-Decision-4B 無法憑空編造答案,因為它只能從你提供的選項中挑選 — 它只可能是校準不當。

• 輸入上限——在評估配置下,FrogNano 約為 131K 合併 token,而 Intern-Decision-4B 的硬性上限為 8,192;兩者相差十六倍,且沒有任何變通方法。

• 成本結構 — FrogNano 按軌跡計費,而軌跡很長。Intern-Decision-4B 完全沒有輸出 token 可計費。

• 參數 — FrogNano 的模型卡給出「500M-5B」的區間,並描述約 4.66B,BF16 下載檔為 9.32 GB;Intern-Decision-4B 則標示為 4.54B,搭配 612 MB 的視覺塔與 54 MB 的投影器,以及其語言分片。

決定這個配對的數字

InternLM 的模型卡指出,在單張 RTX 4090 上,透過本機 Hugging Face 路徑,Intern-Decision-4B 的平均延遲為 44.16 毫秒、中位數為 44.03 毫秒,P95 為 44.60 毫秒。再讀一次那個分佈差距:中位數到尾部遠低於一毫秒,因為固定形狀的前向傳遞幾乎沒有什麼可變動的。這就是支持該架構的全部論點。

FrogNano 對應的數字並不是以毫秒為單位。它的評估允許 150 步的預算,每個任務的代理上限為 10,800 秒。這些不是可比較的單位,也絕不該和延遲宣告放在同一個句子裡——但它們確實能告訴你這種取捨的形狀。一個模型在四十四毫秒內回答一個決策,另一個則花上好幾分鐘的tool calls去追一個修補程式。如果你的問題是「把這張工單路由到六個佇列的其中一個,並告訴我你有多確定」,那麼第一個並不是第二個的便宜版本,它是截然不同的機器。

兩個實驗室都審慎地衡量自身,而這兩組測量數據都應該被解讀為意圖,而非結果。InternLM 報告在 1,728 個指定校準案例上,以溫度 1.99241824 擬合,七組平均為 90.02,Brier 分數為 0.347,期望校準誤差為 0.065。微軟報告在 SWE-bench Verified 上歷經五輪迭代從 39.4% 攀升至 61.5%,而同一篇論文的附錄則將同一進展記為 48.2%、53.4%、58.3%、58.6% 與 61.6%——這提醒我們,即使在同一間實驗室內,同一個事實以兩種方式衡量,也會產生兩套階梯。

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Intern-Decision-4B'. The left column reads Output tool calls and patch, Latency minutes per trajectory, Context about 131K evaluated, Independent evals none, Base Qwen3.5-4B, and Score 61.5% SWE-bench Verified vendor. The right column reads Output one symbol per field, Latency 44.16 ms mean, Context 8,192 tokens rejected above, Independent evals none, Base Qwen3.5-4B, and Score 90.02 seven-set average vendor. A footer reads 'Both scoreboards vendor-reported; no third party has reproduced either.'

破綻就在於每張牌選擇警告你什麼。

兩張卡都異常誠實,而這份誠實指向相反的方向——這正是這項比較中最有用的一點。

微軟的「已知限制」章節讀起來像是一則部署警告。僅支援英文與 Python。效能對測試框架與測試品質很敏感。即使通過測試,修補程式仍可能不正確或不安全。這張模型卡自己寫道,FrogNano「不應被視為已獨立完成安全對齊,可用於不受限制的自主任意部署」,並指出具體缺口:代理專屬的後訓練並未使用安全偏好、拒答或對抗性資料,因為它改為以功能正確性與避免迴歸為最佳化目標。它也主動揭露 1.71% 的平行工具呼叫率,意味著儘管測試框架允許,模型幾乎從不會在同一回合觸發兩個工具——這是相較基礎模型的真實能力退步,團隊因此加入一個整合階段試圖挽回。

InternLM 的模型卡警告的是相反類別的問題。沒有幻覺面向需要警告,所以注意事項是關於輸入:8,192 的拒絕、62 個選項的上限,以及底層文字塔宣告了 262,144 個詞元的位置上限、而發布的包裝器拒絕使用這件事實。它的風險在於,一個有把握的數字被信任得超過它應得的程度,而模型卡坦承,該校準縮小了與 Jev 基線的差距,卻未在每個切片上將其彌合。

合起來讀,它們描述的是兩種不同的信任姿態。FrogNano 需要監督,因為它會採取行動。Intern-Decision-4B 需要稽核,因為它會評分——而一個能左右正式環境決策的數字,正是那種沒有人會想到要去測試的輸出。

路由器適合的場合,以及對兩者的誠實說明

這兩個模型都不是託管端點。FrogNano 以權重加上一套 Kubernetes 評估測試框架的形式發布;Intern-Decision-4B 則以一個 Python 類別的形式發布,你必須先下載四個分片才能匯入。對於想讓任一個模型在真實系統面前試跑的團隊來說,兩者的安全模式相同,而且並不光鮮:把實驗性元件放在後備機制後面,這樣一來,糟糕的軌跡或校準失準的一天,付出的代價會是一次重試,而不是一場事故。

這種模式正是路由層存在的意義。OrcaRouter 用一組相容 OpenAI 的金鑰就能運行 200 多個模型且零加成——供應商的標價原樣傳遞,因此供應商調價當天就會反映到我們這邊——而且它的容錯移轉是放在你作為備援的一般模型前面,而不是放在這兩個模型前面。說白一點:我們並沒有提供 FrogNano-4B-2609 或 Intern-Decision-4B,兩者也都没有上市日期。單一端點在這裡能帶給你的,是讓比較本身變得便宜——一組憑證、一條帳務項目,而且每次你更換用來評測這個專用模型的一般模型時,都不需要再做第二次整合。

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face showing the model heading and the Qwen3.5-4B base-model line, the five-step explanation of how inference works (single-token symbol mapping, one causal forward pass, a softmax over each field's allowed symbols and the checkpoint's probability calibration), the Benchmark results table listing Intern-Decision-0.8B, Intern-Decision-2B and Intern-Decision-4B against the Jev, Laya, SemIf, Kev and JevK5 comparison rows, and the inference latency table with the 4B row at 44.16 ms mean, 44.03 ms median and 44.60 ms P95.

哪一個,以及何時?

當答案已存在於你的提示中,而你需要將它選出、附上信心分數,且速度達每秒數千次時,就採用 Intern-Decision-4B。固定分類法路由、評分規準評分、結構描述受限擷取、依封閉標籤集進行的審核。44 毫秒的前向傳遞與零輸出權杖費用就是產品本身,而校準則是你在信任它之前必須稽核的重點。

當答案尚不存在、必須藉由閱讀儲存庫並執行其測試才能發現時,就採用 FrogNano-4B-2609。那是一個耗時數分鐘、在沙箱中執行且可審查的流程,而 SWE-bench Verified 上的 61.5%——由廠商自行回報、尚未重現——是目前證明 4B 檢查點確實做得到這件事的最佳證據。

不論從哪一方來看,都不該放過的,是拿雙方分數相比的習慣。90.02 的七組平均與 61.5 的 SWE-bench Verified 通過率,衡量的是兩個不同的問題,由兩個實驗室、在兩套測試框架上產出,而這兩個數字都不曾經過第三方之手。它們除了同源之外,別無共通之處。

A screenshot of the file listing for the microsoft/FrogNano-4B-2609 repository on Hugging Face showing the model header with its size and the Safetensors, qwen3_5 and license:mit tags, the two safetensors shards model-00000-of-00002 and model-00001-of-00002, the config, tokenizer, vocab, merges, chat template and preprocessor files, and the commit column listing 'Update README.md', 'Upload FrogNano 4B SWE checkpoint' and 'Update FrogNano 4B README.md' across two contributors and four commits.

{{1}}來自共同祖先的那個真正有用的預測:{{/1}}因為兩個模型都從同一個 4B 檢查點出發,{{2}}它們之間的差異幾乎完全在後訓練階段,{{/2}}{{3}}這意味著對任何要在 Qwen3.5-4B 上建構的人來說,有趣的問題是這兩種獎勵結構中,哪一種能遷移到他們自己的領域。{{/3}}{{4}}一個對自身策略進行校準的合成任務迴圈,{{/4}}{{5}}或者一個帶有擬合溫度的固定形狀評分頭。{{/5}}{{6}}那是兩套配方,兩者都已發表,兩者都來自尚未讓其他人實際跑過它們的實驗室。{{/6}}{{7}}那是一種罕見的情況,值得觀察,而不是貿然買單。{{/7}}