一张生成的标题卡,标题为“FrogNano-4B-2609 对阵 Qwen 3.8”,副标题为“在你自己的 GPU 上运行 4B 智能体,对阵 2.4T 托管旗舰”,三个标签分别写着“9.32 GB 下载”“每百万 $2 输入 / $6 输出”和“每个任务最多 150 步”,页脚写着“FrogNano 数据来自 Microsoft;Qwen3.8-Max 定价来自 Alibaba。此处内容均非独立”,右下角合成有 OrcaRouter 标志。
Guides & Insights

FrogNano-4B-2609 对比 Qwen 3.8:当权重属于你时,编码智能体的成本是多少

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

microsoft/FrogNano-4B-2609是一个四十亿参数级的仓库智能体,派生自 Qwen3.5-4B,由你自行下载并部署运行。Qwen3.8-Max则是托管旗舰——一个 2.4 万亿参数的稀疏专家混合模型,每个 token 约激活 950 亿参数,拥有一百万 token 的多模态窗口,费率表为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元;自 2026 年 8 月 3 日起可通过 API 密钥访问。其中一个要耗费一块 GPU 和一个下午。另一个在你使用之前分文不花,之后便按 token 计费,且计费落在常用场景中最长的那些轨迹上。真正的对决在于这种取舍,而非基准测试表格。

本文中 FrogNano 的数据来自微软的模型卡和技术报告;Qwen3.8-Max 的数据则来自阿里巴巴公布的定价,以及我们自有目录中的模型记录,凡出现独立评分之处,均标注为 Artificial Analysis 的数据。请务必留意命名:开放权重版本 Qwen3.8 已宣布但尚未发布,而 Qwen3.8-Max 已上线并已公布定价。本文中一切可调用的,都是后者。

决定比较结果的算术

先从一个单一任务的开销说起,因为它并不显而易见,而且并不小。

FrogNano 的评估让每条轨迹都在约 131K 的合计 token 内、以 150 步的预算运行,每个助手回合最多生成 8,192 个 token,并设有 10,800 秒的上限。把两个已公布的限值相乘,就得到单条最坏情况轨迹约 123 万个生成 token 的上限——而按 Qwen3.8-Max 每百万输出 token 6.00 美元计算,一个跑到预算尽头的单一任务大约要 7.38 美元。这是对两个已公布数字做的算术,而不是实测结果:真实轨迹会提前停止,平均值远低于上限,而且工具结果和 shell 输出按更便宜的输入费率而非输出费率计费。但它确立了这件事的形态。一个编码智能体不会在一个问题上只花几百个 token;它会花很长时间、推理密集地与自己对话,而这场对话的每一个 token 都是生成出来的。

现在,把账本的另一面放在它旁边。FrogNano-4B-2609 是 9.32 GB 的 BF16 权重,分为两个分片,无需门禁即可下载。要部署它,需要 SGLang,配上 Qwen3 推理解析器和 Qwen3 coder 工具调用解析器,再加一个用于这五个工具的隔离沙箱。在那之后,一条轨迹的边际成本就是电费,而它占用的内存取决于你的上下文增长到多大,而不是权重本身有多重。

• 成本模型 —— FrogNano-4B-2609 是固定硬件成本,边际成本几乎为零。Qwen3.8-Max 则是零固定成本、按 token 计费,采用 $2.00 / $6.00 的划分:前置部分不产生任何费用,全部后置到输出费率上。

• 这笔钱买到了什么 —— 一个运行在你自己芯片上的 4B 级智能体,对比一个你永远无需为其做容量规划的前沿规模模型。

• 盈亏平衡点——当你的每月轨迹量乘以每条轨迹的平均 token 费用超过你原本需要租用的 GPU 成本时,就达到了这一平衡点。对于一个每天运行少量仓库任务的团队来说,这条线还很遥远,而托管模型仅凭便利性就胜出。

两个模型做同样的工作

只有在产出具有可比性的情况下,成本对比才是公平的,而这里的情况并非如此,而这正是大多数规格表所掩盖的部分。

FrogNano-4B-2609 完全基于仓库级软件工程进行后训练。它的整个接口就是一个五工具循环——Read、Write、Edit、Glob和Bash——由 Leaf 运行框架在隔离沙箱中执行,反复迭代,直到模型停止调用为止。微软的模型卡标明其支持语言为英语,经验证的编程领域为 Python,并明确表示该检查点中的图像和视频组件从未经过后训练,因此不受支持。它不会对你的架构进行推理,不会回答关于你业务的问题,也不会读取截图。

Qwen3.8-Max 是一款通用模型。阿里巴巴的目录记录显示,它支持文本、图像和视频输入,输出文本,并具有 1,000,000 token 的上下文窗口。它能进行推理、写作、阅读文档和对话,其函数调用是通用模型的一项功能,而不是该检查点的全部意义所在。根据 2026 年 9 月 2 日记录中的 Artificial Analysis 数据,其智能指数为 45.4,编码指数为 76.2。

• 输入 — FrogNano-4B-2609 仅支持文本。Qwen3.8-Max 支持文本、图像和视频。

上下文——FrogNano 受评测配置的合计 token 数约为 131K,而 Qwen3.8-Max 为 1,000,000。这是七倍半的差距,而它影响最大的,恰恰是编码智能体会遇到的那种仓库规模的输入。

• 单轮输出——FrogNano 经验证的配置将单个助手单轮输出上限设为 8,192 个 token。Qwen3.8-Max 未公布与之等同的单次响应上限。

• 输出格式 — FrogNano 发出结构化的 Leaf 工具调用,需要一套执行框架来运行它们。Qwen3.8-Max 则返回散文式文本,或向您现有的任意客户端发起函数调用。

• 独立评分——除其自身卡片外,FrogNano-4B-2609 没有其他独立评分;上面的 Qwen3.8-Max 数据是第三方的,来自 Artificial Analysis。

• 参数——根据其卡片自身的描述,FrogNano 约为 46.6 亿,相比之下 Qwen3.8-Max 总参数为 2.4 万亿,激活参数约为 950 亿。

A screenshot of the OrcaRouter model page for Qwen3.8 Max showing the breadcrumb Home, Models, Qwen; the model name and the qwen/qwen3.8-max model id; the FEATURED badge with Vision, Tools, JSON and Reasoning capability chips; the 1M-token context, text, image and video input and text output row; the $2.00 and $6.00 per-million price cards with the p50 TTFT figure; the byline 'by Qwen, 2026-08-03'; the on-page section list for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ; and the opening of the long description describing Qwen3.8-Max as Alibaba's newest flagship.

4B 究竟在哪里真正赢得一席之地

有一个维度上,4B agent能直接完胜前沿模型,而且并非准确性。

FrogNano 的论文以 Qwen3.5-4B 为起点,该模型作为一个普通通用模型,在 Leaf harness 上于 SWE-bench Verified 中得分 39.4%。在约 1,500 个合成任务上进行五轮强化学习迭代后,其得分提升至 61.5%,同一篇论文的附录报告了逐轮进展:48.2%、53.4%、58.3%、58.6% 和 61.6%。该方法——生成与当前策略可学习前沿相匹配的任务,且不从不更强的模型进行蒸馏——是核心贡献,也是没有前沿模型预算的研究小组会关注它的原因。

想想这对比较意味着什么。微软的模型卡坦承,FrogNano 并非全面优于它所源自的那个模型:其并行工具调用率为 1.71%,因为后续迭代失去了发起并发调用的能力,团队为此添加了一个整合阶段,试图恢复这一能力。一个解决了更多问题、却在某一具体行为上变得更差的模型,是一件带有可见接缝的真实工程产物,而它的模型卡如实说明了这一点,而不是将其掩盖。

SWE-bench 的分数是一个闭环。基座模型基线、评测框架和最终得分全都出自同一家实验室,而且同一篇论文的两张表格对同一个实验给出了两条不同的阶梯。相比之下,Qwen3.8-Max 的编程分数是由 Artificial Analysis 而非阿里巴巴得出的——证据类型不同,可信度的性质也不同,两者绝不应相互抵扣。

你尚无法完全将其纳入计划的 4B

有两件事挡在 FrogNano-4B-2609 与生产环境的一席之地之间,而这两件事都出在它自己的文档里,而非任何评审者的看法中。

首先是硬件。模型卡给出 BF16 权重需求约为 9.3 GB,并补充说,随着组合上下文接近约 131K tokens,内存“会大幅增加”,然后才说明确切的最低 GPU 型号、VRAM 配置、运行时版本和性能概况“仍须在发布前验证”——而这句话出现在一个已经可下载的模型上。没有人公布过所评估配置的 VRAM 数字,模型卡中也没有。

第二点是安全态势。微软自己的对齐说明指出,该智能体专用的后训练没有使用任何安全偏好、拒答、有害内容或对抗性数据集,而是针对功能正确性和避免回归进行了优化,并且该模型“不应被视为已针对不受限制的自主部署独立完成安全对齐”。该卡片最后列举了具体风险:补丁即使通过了测试,也可能不正确或不安全;性能对这些测试的质量很敏感;每个候选补丁在使用前都需要合格的人工审查以及独立的回归测试和安全测试。通用托管模型不带有这些具体的注意事项,而且它也不会在你的代码仓库中运行 shell 命令。

无论你选哪一边,都是一把钥匙

在实践中做这种对比,一个有用的地方在于它只有一半需要下载。Qwen3.8-Max,以及你会拿来给自托管 agent 做基准测试的那些通用模型,都能通过 OrcaRouter 上同一个兼容 OpenAI 的端点访问,零加价——按提供商标价原样透传,所以厂商一调价,当天就会落到我们这边,而当你想要控制的正是编码 agent 的输出 token 账单时,真正会动的就是那个数字。这也让故障转移的问题变得简单:如果你流水线中托管的那一半性能下降,重试会自动进行,实验也会继续下去。

FrogNano-4B-2609 不是我们的路由之一,也没有发布日期。权重由你自行部署服务,而模型卡也如实说明:该服务配置尚未经过充分验证。我们能做的是让对比中的另一方零成本搭建起来,这样你最终回答的才是真正的问题——一个厂商报告成绩为 61.5% 的 SWE-bench 智能体,在你自己的 GPU 上,能否在你自己的任务上、按你自己的用量规模,击败一个按量计费的前沿模型。

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Qwen3.8-Max'. The left column reads Cost your GPU, electricity; Output tool calls and patches; Context about 131K evaluated; Input text only; Published score 61.5% SWE-bench Verified, vendor, unreproduced; Turn cap 8,192 tokens. The right column reads Cost $2.00 in / $6.00 out per million; Output prose or function call; Context 1,000,000 tokens; Input text, image, video; Published score AA Intelligence 45.4 and AA Coding 76.2, third-party; Turn cap not published. A footer reads 'FrogNano figures per Microsoft; Qwen3.8-Max scores per Artificial Analysis. Different benchmarks; not comparable.'

该选哪一个

当工作是通用性的、当应该由别人的运维团队来承担算力容量、当输入可能包含图像或长文档,或者当你今天就需要答案而不是等到周五才搭好一套服务栈时,就选 Qwen3.8-Max。它的第三方评分意味着你可以大致预判自己买到的是什么,而它的按 token 计费是一项在你做出承诺之前就能看到的可变成本。对于一个每月只运行少量仓库任务的团队来说,这笔账算下来差距一目了然。

当用量高到长轨迹上的按 token 计费成为制约因素时,当数据不能离开你的基础设施时,或者当那个研究问题——一个小型智能体能否在没有教师的情况下被训练到仓库级能力——才是你真正要测试的内容时,就该选用 FrogNano-4B-2609。开始前要明白三件事:61.5% 是实验室在其实验室维护的测试框架上自行测得的结果;没有人公布过所评估配置的 VRAM 数字;而且模型卡本身也说明服务部署方案尚未经过验证。

这对组合之所以值得一写,是因为它们两代之前共有一个祖先。FrogNano 出自 Qwen3.5-4B——来自同一家公司的一款通用模型,而该公司拥有 2.4 万亿参数的旗舰模型就摆在本页的另一侧。微软拿走了小的那个,在合成代码库上做了五轮强化学习,得到一个专才模型。阿里巴巴则走了另一条路,选择扩大规模。两个答案都已公开发布,而在下载的成本与调用 API 的成本之间的差距,才是二者之间做选择的诚实依据。

A screenshot of the microsoft/FrogNano GitHub repository README showing the description that FrogNano evaluates coding agents with the Leaf harness in isolated Kubernetes sandboxes against OpenAI-compatible endpoints and five tools Read, Write, Edit, Glob and Bash; the requirements list naming a Kubernetes cluster with pod and network-policy permissions and an OpenAI-compatible endpoint with reasoning and tool-call parsers configured for Qwen3.5; the frognano-eval run commands; and the benchmark table listing SWE-bench Verified at 500 tasks with an 8,192-token cap, SWE-bench Pro at 731 with 32,000, Terminal-Bench 2.0 Verified at 89 with 32,000 and PatchEval Verified at 230 with 8,192.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新