一张生成的标题卡,上面写着“FrogNano-4B-2609 vs Intern-Decision-4B”,副标题为“同一个 Qwen3.5-4B 祖先,两种截然相反的输出”,三个标签分别写着“工具调用与补丁”、“每个字段一个符号”和“两者均未经独立评分”,页脚写着“两个记分榜均由厂商报告;没有任何第三方复现过其中任何一个”,右下角合成有 OrcaRouter 标志。
Guides & Insights

FrogNano-4B-2609 对比 Intern Decision 4B:同一个基础模型,两种截然不同的选择

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

两个实验室拿了同一个检查点,Qwen3.5-4B,并把它推向彼此毫不相似的方向。microsoft/FrogNano-4B-2609在大约 1,500 个合成的软件工程环境上,通过强化学习进行了后训练,直到它能够通过一个五工具框架发出结构化的工具调用和多文件补丁。internlm/Intern-Decision-4B则被微调为完全不输出文本——它接收一个状态以及一个由具名问题构成的模式,并在一次前向传播中为每个选项返回一个经过校准的概率。一个写代码。另一个拒绝写任何东西,只返回一个分布。比较它们的质量毫无意义;比较它们运行起来要花你多少成本,以及它们能被信任用来做什么,才是诚实的做法。

两者都是在没有公告的情况下发布的,而这正是它们共有的另一点。二者都没有 Artificial Analysis 条目、没有竞技场评分,也没有任何一项独立评估。下文的每一个数字——一侧是 SWE-bench 阶梯,另一侧是 Brier 和 ECE 校准行——都是由训练该模型的实验室、在该实验室自己的测试框架上生成的,而且从未遇到过不是来自其自身的测试集。

这个分支发生在两个模型出现之前

基础检查点是一个稠密的 32 层混合 Gated DeltaNet 与门控注意力模型,两个衍生模型都继承了它的骨架。此后,这两个后训练流程便毫无共同之处。

微软的流水线是一个闭环。TaskPilot 从真实快照中生成候选仓库任务,从当前检查点运行 rollout,找出策略有时能解决的那些任务,保留它们,然后进行训练。共五次迭代,每次都对照上一轮迭代的策略进行校准,最终在 SWE-bench Verified 上达到 61.5%,在 SWE-bench Pro 上达到 37.6%。没有蒸馏——模型卡明确指出,没有将更强模型的轨迹、动作或推理痕迹用作目标。

InternLM 的流水线是在固定任务形态上的单一监督目标。模型会获得系统提示、状态、决策模式,以及一个完整的助手 JSON 骨架,每个字段对应一个占位符。它运行一次因果前向传播,读取每个占位符位置处的 logits,并且仅对该字段被允许的候选符号进行 softmax。InternLM 的模型卡直言不讳:这条路径“不会调用 generate(),也不采样自由形式的文本。”

那种差异不是规模上的差异。它是关于这个产物究竟是什么的差异。FrogNano-4B-2609 是一个智能体,它可能以一百种有趣的方式出错,并能通过测试得到纠正。Intern-Decision-4B 是一个评分器,其失败模式是给出一个自信的数字。

两份契约,而两者都不是“发送提示词”

FrogNano 的契约就是一个循环。模型发出对 Read、Write、Edit、Glob和Bash 的调用;Leaf 框架在隔离的仓库沙箱中执行这些调用并返回输出;循环一直持续到模型不再发出调用为止。评估在约 131K 的组合 token 内运行了 150 步,每个助手回合最多生成 8,192 个 token。部署需要带有 Qwen3 推理解析器和 Qwen3 coder 工具调用解析器的 SGLang——一旦弄错,模型就会在框架期望 JSON 的地方输出散文,从外部看,这完全就像是一个坏掉的模型。

Intern-Decision-4B 的契约是一次性调用,且带有硬性限制。问题和选项保持其顺序。选项映射到单 token 符号——A 到 Z,然后是 a 到 z,然后是 0 到 9,这就是一个问题最多只能有 62 个选项的算术原因。wrapper 的上限是 8,192 个 token,InternLM 的模型卡明确指出,更长的输入会被拒绝,而不会截断。支持三种问题类型:choice 搭配有序标准映射,score 搭配列表或以数字为键的映射,以及 noul,一种二元类型。最多允许八张图像,其 token 也计入同一个 8,192。

• 输出形态 — FrogNano-4B-2609 输出工具调用、推理文本和一个补丁。Intern-Decision-4B 则每个字段仅输出一个符号,别无其他。

• 确定性——FrogNano 在三个随机种子上以温度 0.6 进行采样,因此从设计上就是概率性的。Intern-Decision-4B 的 argmax 由前向传播固定;拟合出的温度只影响其置信度。

• 失效面——FrogNano 可能幻觉出一个 API、把编辑范围放得过宽,或在通过测试的同时引入漏洞,而它的模型卡都点明了这些。Intern-Decision-4B 无法幻觉出答案,因为它只能从你提供的选项中挑选——它只可能校准失当。

• 输入上限——在评估配置下,FrogNano 的合并 token 总量约为 131K,而 Intern-Decision-4B 的硬性上限为 8,192,两者相差十六倍,且没有任何变通办法。

• 成本形态 —— FrogNano 按轨迹计费,而轨迹往往很长。Intern-Decision-4B 则根本没有可供计费的输出 token。

• 参数 — FrogNano 卡片给出“500M-5B”区间,并描述约为 4.66B,下载量为 9.32 GB 的 BF16;Intern-Decision-4B 标注为 4.54B,配有 612 MB 的视觉塔和 54 MB 的投影器,以及其语言分片。

决定这个配对的数字

InternLM 的模型卡显示,在单块 RTX 4090 上通过本地 Hugging Face 路径,Intern-Decision-4B 的平均延迟为 44.16 ms、中位数为 44.03 ms,P95 为 44.60 ms。再读一遍这个分布范围:从中位数到尾部远低于一毫秒,因为固定形状的前向传播几乎没有什么可变化的。这就是该架构的全部论据。

FrogNano 的对应数字并不是以毫秒计的。它的评测允许 150 步的预算,每个任务的智能体时间上限为 10,800 秒。这些不是可比的单位,绝不该和延迟宣称出现在同一句话里——但它们确实告诉了你这种权衡的形态。一个模型在四十四毫秒内给出一个决策,另一个则要花上几分钟的工具调用来追一个补丁。如果你的问题是“把这张工单路由到六个队列之一,并告诉我你有多大把握”,那么第一个并不是第二个的廉价版本,它就是另一台机器。

两家实验室都仔细地测量了自己,而这两组测量结果都应被解读为意图,而非结果。InternLM 报告七组平均值为 90.02,Brier 分数为 0.347,预期校准误差为 0.065,这是在 1,728 个指定校准案例上以 1.99241824 的温度拟合得到的。Microsoft 报告在 SWE-bench Verified 上五次迭代从 39.4% 攀升至 61.5%,而同一篇论文的附录将同一进展报告为 48.2%、53.4%、58.3%、58.6% 和 61.6%——这提醒我们,即使在同一个实验室内部,同一事实用两种方式测量也会产生两套阶梯。

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Intern-Decision-4B'. The left column reads Output tool calls and patch, Latency minutes per trajectory, Context about 131K evaluated, Independent evals none, Base Qwen3.5-4B, and Score 61.5% SWE-bench Verified vendor. The right column reads Output one symbol per field, Latency 44.16 ms mean, Context 8,192 tokens rejected above, Independent evals none, Base Qwen3.5-4B, and Score 90.02 seven-set average vendor. A footer reads 'Both scoreboards vendor-reported; no third party has reproduced either.'

玄机就在于每张牌选择警告你什么。

这两张卡都坦诚得非同寻常,而这份坦诚却指向相反的方向——这正是本次对比中最有价值的一点。

微软的“已知限制”部分读起来像一份部署警告。仅支持英语和 Python。性能对测试框架和测试质量很敏感。补丁可能不正确或不安全,尽管它们通过了测试。该卡片本身的一句话是,FrogNano“不应被视为已独立实现安全对齐、可用于不受限的自主部署”,并指出了具体的缺口:针对智能体的后训练没有使用安全偏好、拒绝或对抗性数据,因为它转而优化的是功能正确性和避免回归。它还主动披露了 1.71% 的并行工具调用率,这意味着尽管测试框架允许,该模型几乎从不会在一轮中触发两个工具——这是相对基础模型的真实能力退化,团队为此增加了一个整合阶段试图恢复。

InternLM 的模型卡警告的是相反类别的问题。这里没有需要警告的幻觉面,因此这些警示都与输入有关:8,192 的拒绝阈值、62 个选项的上限,以及底层文本塔宣称有 262,144 个 token 的位置限制、而发布的封装层却拒绝使用这一事实。其风险在于,一个自信给出的数字会被信任到超出其应得的程度,而模型卡也坦承,这种校准缩小了与 Jev 基线的差距,但并未在每一个切片上都弥合这一差距。

放在一起读,它们描述了两种不同的信任姿态。FrogNano 需要监督,因为它会行动。Intern-Decision-4B 需要审计,因为它会打分——而一个能左右生产决策的数字,恰恰是那种没人想得到要去测试的输出。

路由器适合的位置,以及对两者的坦诚说明

这两个模型都不是托管端点。FrogNano 以权重加一套 Kubernetes 评测工具链的形式交付;Intern-Decision-4B 则以一个 Python 类的形式交付,你在下载四个分片后导入它即可。对于想在真实业务前面试用其中任何一个的团队来说,两者安全可靠的模式是一样的,而且并不光鲜:把实验性组件放在一个兜底机制之后,这样一次糟糕的轨迹或一个校准失准的日子,代价不过是一次重试,而不是一场事故。

这种模式正是路由层的用武之地。OrcaRouter 在一个 OpenAI 兼容密钥背后运行 200 多个模型,零加价 — 按供应商标价原样透传,因此供应商一调价,当天就会落到我们这边——而且它的故障转移位于你所回退的通用模型之前,而不是位于这两个模型之前。说白了:我们并不提供 FrogNano-4B-2609 或 Intern-Decision-4B,两者也都没有上线日期。单一端点在这里给你带来的好处,是比较本身变得便宜——一份凭据、一条计费记录,而且每次更换你用来对标该专用模型的通用模型时,都不需要再做第二次集成。

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face showing the model heading and the Qwen3.5-4B base-model line, the five-step explanation of how inference works (single-token symbol mapping, one causal forward pass, a softmax over each field's allowed symbols and the checkpoint's probability calibration), the Benchmark results table listing Intern-Decision-0.8B, Intern-Decision-2B and Intern-Decision-4B against the Jev, Laya, SemIf, Kev and JevK5 comparison rows, and the inference latency table with the 4B row at 44.16 ms mean, 44.03 ms median and 44.60 ms P95.

哪一个,什么时候

当答案已经存在于你的提示词中、你只需要它被选出来并附带一个置信度,且要求达到每秒数千次的速度时,就用 Intern-Decision-4B。固定分类体系的路由、评分量表打分、schema 约束的抽取、针对封闭标签集的审核。44 毫秒的前向传播和零输出 token 的账单就是产品本身,而在你信任它之前,真正该审计的是它的校准。

以 FrogNano-4B-2609 为例,当答案尚不存在、必须通过阅读代码仓库并运行其测试来发现时,这是一个耗时数分钟、在沙箱中进行且可复核的过程,而 SWE-bench Verified 上的 61.5%——由厂商报告、尚未被复现——是目前 4B 检查点能够做到这一点的最佳证据。

无论如何都不该被接受的是,拿它们的分数作比较这种习惯。90.02 的七组平均分和 61.5 的 SWE-bench Verified 通过率,是对两个不同问题的测量,由两个实验室、在两套测试框架上得出,而且这两个数字都未经第三方之手。它们除了同源之外,再无其他共同之处。

A screenshot of the file listing for the microsoft/FrogNano-4B-2609 repository on Hugging Face showing the model header with its size and the Safetensors, qwen3_5 and license:mit tags, the two safetensors shards model-00000-of-00002 and model-00001-of-00002, the config, tokenizer, vocab, merges, chat template and preprocessor files, and the commit column listing 'Update README.md', 'Upload FrogNano 4B SWE checkpoint' and 'Update FrogNano 4B README.md' across two contributors and four commits.

源自共同祖先的那个真正有用的预测是:由于两个模型都从同一个 4B 检查点出发,它们之间的差异几乎完全在于后训练,这意味着对于任何基于 Qwen3.5-4B 进行构建的人来说,有趣的问题是这两种奖励结构中的哪一种能迁移到他们自己的领域。一个根据自身策略进行校准的合成任务循环,或者一个带有拟合温度的固定形状评分头。这是两种配方,都已发表,且都来自尚未让其他人运行它们的实验室。这是一种罕见的情况,值得观望,而不是盲目投入。