一张生成的标题卡,上面写着“Intern-Decision-4B vs ContextPilot-8B”,副标题是“一个拒绝长上下文,一个驾驭长上下文”,还有三个标签块,分别写着“两者都没有独立评测”“两者都是在没有公告的情况下发布的”以及“两者目前都无法路由”。OrcaRouter 的标识被合成在右下角。
Engineering & Research

Intern-Decision-4B vs ContextPilot-8B:一个压缩上下文的模型对决一个管理上下文的模型

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

自选毒药:internlm/Intern-Decision-4B 拒绝读取超过 8,192 个 token,而 tencent/ContextPilot-8B 则专门为了应对无界增长的上下文而存在。它们属于同一参数规模级别,都是 Qwen 基座的微调模型,并且都是在没有任何厂商公告、也没有任何形式的独立评估的情况下上架到 Hub 的——ContextPilot-8B 于 2026 年 8 月 27 日,Intern-Decision-4B 于 2026 年 9 月 26 日——而它们解决的是相反的问题。Intern-Decision-4B 是一个 45 亿参数的结构化决策模型,它运行一次前向传播,读取 logits,并为你提出的每个问题返回一个校准后的概率;它从不写出任何 token。ContextPilot-8B 是一个 81.9 亿参数的文本生成器,经过训练,可在长时间的智能体运行中规划、记忆并卸载自己的工作上下文。比较它们实际上并不是一个基准测试问题。它关乎的是:你更希望模型吞下你问题中的哪一半。

首先,他们真正共有的东西

这两个模型都没有哪怕一个数字得到过其自身实验室之外任何人的验证。这一点已经足够不寻常,值得放在其他所有内容之前先说明,因为本博客上的大多数比较至少还能就其中一方倚仗一个独立排行榜。

Intern-Decision-4B 在其模型卡上公布了一张完整的评估表——七个数据集上的平均值为 90.02,Brier 分数为 0.347,期望校准误差为 0.065——全部由 InternLM 在 InternLM 的测试框架上测得。ContextPilot-8B 则完全没有公布任何表格。其模型卡称该框架“在各种基础模型和基准上持续优于现有基线”,并指向一篇论文和一个评估流程以了解详情。因此,在这一对比中,诚实的来源说明很短:一方是厂商报告且未经复现,另一方是厂商声称且未公开发表,而本页上的任何内容都不是独立的。

A screenshot of the tencent/ContextPilot-8B model card on Hugging Face, showing the paper, live demo, GitHub and models badges, the description of ContextPilot as a proactive context-management framework built on Qwen3-8B, the three listed components, and the loading snippet alongside the note that loading the checkpoint alone does not execute the context-management tools and that the tool definitions and agent runtime are provided separately.

直白地说,这两个押注

Intern-Decision-4B 的赌注是,决策中最难的部分不是推理,而是做出决断。给它一个状态、一个由具名问题组成的模式,以及最多八张图像,它就会返回一个在你自己的选项字符串上的分布。推理流程是确定性的,并且形状固定:将选项映射到单 token 符号,渲染一个助手 JSON 骨架,每个字段一个占位符,运行一次因果前向传播,读取紧挨每个占位符之前的 logits,仅对该字段的候选执行 softmax,应用拟合出的温度。由于没有解码循环,因此没有解析器,也没有自由文本幻觉的暴露面。这个赌注的代价是一个硬性输入上限——模型卡上写着,超过 DecisionEngine(max_length=8192) 的输入会被“未经截断即拒绝”。

ContextPilot-8B 的押注则与之互为镜像:让智能体继续生成 token,但教会它编辑自己所携带的内容。它把规划、结构化长期记忆、检索和软性上下文卸载加入智能体的工具集,然后用一套强化学习配方训练该检查点:该配方围绕真正重要的上下文编辑决策采样分支,并在动作层面而非轨迹层面分配信用。模型卡对封装后果十分坦诚:加载该检查点并不会让你获得上下文管理能力。工具定义、智能体运行时和评估流水线都在别处,必须一并带上。

记分板,逐维度来看

• 输出 — Intern-Decision-4B 完全不输出任何文本,只给出针对你的选项取值的概率分布;ContextPilot-8B 则正常生成,其回答是需要你解析的自然语言文本和工具调用。

• 输入上限 — Intern-Decision-4B 会拒绝任何超过 8,192 个 token 的输入;ContextPilot-8B 继承了 Qwen3-8B 的 40,960 token 位置限制,其设计目标是在有效上下文不断增长的同时持续工作。

• 参数 — Intern-Decision-4B 为 4.54B BF16,分布在文本塔、视觉塔和投影器中;ContextPilot-8B 为 8.19B BF16,是一个普通的稠密 Qwen3 因果语言模型。

• 延迟——根据 Intern-Decision-4B 自己的模型卡,它在单块 RTX 4090 上平均耗时 44.16 ms,P95 为 44.60 ms;ContextPilot-8B 未公布任何延迟数据,而它的成本性质完全不同,因为它是在生成 token,而不是对 token 打分。

• 图像 — Intern-Decision-4B 最多可接收八张,且图像 token 计入 8,192 的上限;ContextPilot-8B 的说明卡描述的是一个纯文本生成的检查点,没有任何多模态通路。

• 许可证 — Intern-Decision-4B 采用 Apache-2.0 许可,其上游的 Qwen 许可证一并保留;ContextPilot-8B 的许可证以第 0 节开篇:"仅出于科学研究和开发的目的提供。你不得将其用于任何其他用途。"

• 已发表的证据 — 一侧是附有校准诊断的七组表格;另一侧是论文摘要和指向评估仓库的链接。

• 往绩——两者都悄无声息。Intern-Decision-4B 自 2026 年 9 月 26 日以来仅有 1 个点赞、0 次下载;ContextPilot-8B 自 2026 年 8 月 27 日以来有 11 个点赞和约一千次下载,关注度虽更高,但依然没有第三方评估。

A two-column comparison scoreboard titled 'Intern-Decision-4B vs ContextPilot-8B'. The left column reads: Output: no text, probabilities only; Input ceiling: 8,192 tokens, rejected not truncated; Parameters: 4.54B BF16; Latency: 44.16 ms mean on one RTX 4090; Images: up to eight; License: Apache-2.0. The right column reads: Output: generated text and tool calls; Input ceiling: 40,960-token position limit; Parameters: 8.19B BF16; Latency: not published; Images: none; License: research and development only. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.

每一个实际会在哪里出问题

Intern-Decision-4B 的失效模式是结构性的,值得具体说明。如果一项决策的证据放不进 8,192 个 token,模型并不会优雅降级——它会直接拒绝该请求。这是一个站得住脚的工程选择,却恰好极不适合 ContextPilot-8B 所针对的那类工作负载。该卡片自身的配置让这一矛盾更加尖锐:包装器之下的文本塔声明了 262,144 个 token 的位置上限。骨干网络能够寻址 25 万个 token,而发布的包装器却不会接受超过八千个。

ContextPilot-8B 的失效模式在于它并非任何意义上的即插即用方案。它是一个框架内的检查点,而行为存在于框架之中。如果脱离工具定义和智能体运行时来提取权重,你得到的只是一个 Qwen3-8B 微调模型,其独特能力处于惰性状态。再加上许可证的 Section 0,对于商业部署而言,实际答案就是:按原样交付你根本无法使用它——这也意味着它对我们来说不是一条候选路线,现在或不久都不是。

部署每一个,如果你打算这样做的话

Intern-Decision-4B 想要一块小小的 GPU,也不想要任何像样的服务栈:在 Python 3.12 下安装 PyTorch 2.9.1 和 Transformers 5.14.1,一次性加载四个分片,让引擎常驻内存,然后进行打分。由于前向传播是固定形状的,P50 和 P95 彼此相差不到 0.6 毫秒,因此容量规划关注的是并发量,而非尾部延迟。棘手之处在于,它以可导入的 Python 类而非 HTTP 服务的形式发布,所以要想把它放到生产调用方前面,就得自己封装一层。

ContextPilot-8B 需要的是相反的处理方式:一条真正的服务路径、一个工具执行器、记忆存储,以及一个支持分支的 rollout 环境——如果你确实打算按设计对它进行重新训练或评估的话。这不是你花一个下午就能试用的模型;这是一个你需要采纳的研究框架。

路由器在这里有用吗?

部分是,但诚实的说法比通常要狭窄得多。OrcaRouter 并未在其目录中列出 Intern-Decision-4B、ContextPilot-8B 或任何同类的决策评分检查点——我们两者的模型页面都返回 404,本文中的任何内容都不应被解读为可用性声明。统一端点确实能带给你的,是把一次失败的实验置于回退方案之后的能力:一个密钥通用于 200 多个模型,按提供商标价原样传递、0% 加价,以及 自动故障转移,让你仍在评估中的评分器永远不会成为单点故障。对于本次对比中 Intern-Decision 这一侧而言,这是实实在在的好处,因为该模型确实能以低成本在本地运行。而对 ContextPilot-8B 来说,这一点并无意义,因为仅限研发用途的许可证已排除了商业化路径,无论任何路由器支持什么都是如此。

那么,哪一个呢?

如果你的问题答案集合是封闭的、附带证据一起到来,并且需要的是概率而不是解释,那么 Intern-Decision-4B 是更有意思的对象——便宜、形状固定、按构造即校准,而且对自己不会接受的输入很诚实。如果你的问题在于证据源源不断地到来,那么没有任何决策评分器能帮到你,ContextPilot-8B 瞄准的正是这个目标,但有个附带条件:你采用的是框架和研究许可证,而不是一个模型。

真正能定论的,是一项两家厂商都还没做过的测试:给两者同一个简短、结构化的决策,其答案可从状态中推算得出,再看看那个评分器 90.02 的平均分在自己的测试框架之外是否依然站得住脚。在有人这么做之前,对这场对决的正确解读是:这两个模型根本就不是在争夺同一个位置。

A generated two-bet card titled 'Same size class, opposite bets'. The left card, 'Intern-Decision-4B — shrink the answer', lists: input ceiling 8,192 tokens, rejected not truncated; output probabilities over your option values; one forward pass, 44.16 ms mean on one RTX 4090; no text, so nothing to parse. The right card, 'ContextPilot-8B — manage the growing context', lists: inherits Qwen3-8B's 40,960-token position limit; generates text and tool calls; context planned, remembered and offloaded during the run; needs the tool definitions and agent runtime to work at all. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.