
AstaBrief 8B 与 ContextPilot 8B:同一 8B 基础模型的两种答案
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 220 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 113 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
把 AstaBrief 8B 和 ContextPilot 8B 放在同一张规格表上,前六行完全一致。两者都是从 Qwen/Qwen3-8B 微调而来的稠密 8B 检查点。两者继承相同的架构——36 层、隐藏维度 4096、32 个注意力头搭配 8 个键值头、151,936 词元的词表,以及基座模型 40,960 词元的位置上限。两者都不是新架构,也都没打算成为新架构。它们是两个实验室拿同一份冻结的基座权重,教它们做两份不同的工作,而这两份工作指向长时程研究智能体的两端:AstaBrief 8B 负责写出最终带引用的报告,ContextPilot 8B 则在智能体收集材料的过程中防止其工作上下文崩塌。
这就是整个比较,一句话就能概括;这也正是为什么你不该把它当作一场赢家通吃的正面对决来解读。在许可、证据和运行时要求上,这两个模型完全分道扬镳,而这种分歧比任何一家实验室公布的分数都更有信息量。
相同的检查点几何,两种不同的继承
从真正共通的部分开始,因为它界定了其余的一切。Ai2 的 AstaBrief 8B 和腾讯的 ContextPilot 8B 都声明以 Qwen3-8B 作为基础模型,且两者都大致为 80 亿参数。ContextPilot 8B 的代码仓库记录显示,其 BF16 权重为 16.38 GB,分布在四个 safetensors 分片中,这正是 8B 稠密模型的分量。上下文上限继承自基础模型,两者均未改变:配置中为 40,960 个位置,在 32K 上训练,并可通过 YaRN 扩展。这两个模型都不是长上下文模型。AstaBrief 8B 不需要是,因为它拿到的是摘录而非整个语料库。ContextPilot 8B 则刻意不是,因为它的主张是让一个小窗口更卖力地工作。
各家实验室所改变的,都是训练目标;而这些目标之间的差异,再大也不过如此了。
• 后训练方法 — AstaBrief 8B:先监督微调,再离线直接偏好优化,在八块H100上使用了47K条SFT样本和约6K对偏好数据。
• 后训练方法——ContextPilot 8B:在主动式上下文管理框架上进行强化学习,并将三次专门化 SFT 运行的任务向量合并叠加到原始基座之上。
• 任务 — AstaBrief 8B:根据一个问题以及检索到的文献摘录,一次性撰写一份包含多个章节、带有行内引用的报告。
• 任务 — ContextPilot 8B:规划、保留长期记忆、从索引中检索,并卸载智能体当前不需要的上下文,同时持续进行推理和调用工具。
• 运行时 — AstaBrief 8B:标准的 vLLM 或 Transformers 服务,外加来自 AstaBrief_prompts 数据集的推荐提示格式。
• 运行时 — ContextPilot 8B:来自 Tencent/ContextPilot 仓库的 Tencent 智能体运行时、工具定义和评估流水线。仅凭检查点本身并不是一个可工作的智能体。
• 许可证 — AstaBrief 8B:Apache-2.0。ContextPilot 8B:在 Apache-2.0 文本基础上定制的文本,新增了第 0 节,将使用限制为研究与开发。
• 证据 — AstaBrief 8B:供应商报告的基准测试表,加上来自 Ai2 的 Asta 平台的早期生产使用数据。ContextPilot 8B:一篇被 EMNLP 2026 主会接收的 arXiv 论文中的声称;模型卡未提供任何数字,且无第三方复现。
这个列表里有两行比其他行承担的分量更重。许可那一行决定你到底能不能把这个模型放进产品里:AstaBrief 8B 的 Apache-2.0 条款允许商业使用,而 ContextPilot 8B 附加的那项条款则不允许。运行时那一行则决定你在收下权重的同时,还得一并接纳这家实验室的多少东西。AstaBrief 8B 是一个可以直接放进现有服务栈的检查点。ContextPilot 8B 则是一个框架的组成部分,而让这个框架真正运转起来的那些环节——工具契约、rollout 逻辑、信用分配——都存在于腾讯的代码里,而不在你下载下来的那些分片中。

每一样东西真正赢得其位置的地方
比较它们的一种有用方式,是把它们视为同一条流水线中相邻的子代理;两个实验室正从相反方向朝这条流水线汇聚。
一个文献综述智能体包含检索层、上下文层和生成层。ContextPilot 8B 针对的是上下文层:它为智能体提供规划能力、带有写入/更新/读取笔记的结构化长期记忆、基于索引的检索,以及软性上下文卸载,从而使适度的窗口在长轨迹中依然可用。论文的论点是,此前的上下文编辑模型共有三个弱点,而该框架将它们一并解决——更广泛的工具集、把探索集中在真正改变轨迹的编辑上的上下文感知部分 rollout,以及细粒度的信用分配。评估目标是长上下文问答与深度搜索:InfBench、NovelQA、LongMemEval、BrowseComp+,这与我们此前对该仓库的解读一致。
AstaBrief 8B 针对的是生成层,并假设上下文问题已在上游得到解决。它不进行检索、对片段做摘要、对主题进行聚类,也不决定保留哪些证据。Ai2 将所有这些从模型的工作中移除,并训练它根据别人选定的摘录,一次性写出报告。这个押注的假设是:昂贵的脚手架并非质量所在之处:Ai2 报告称,这种单遍重写在它所追踪的指标上与由 Claude 驱动的多步流水线持平,同时将全流水线生成时间从 178.5 秒缩短到 51.1 秒。
综合起来看,这两个模型描述了一种任何一家实验室都可能设计出的分工。一个让工作集保持精简,并让证据持续流动。另一个把存留下来的证据转化为附带引用的文字。它们的失败模式是互补而非重叠的:一个丢弃了错误摘录的上下文管理器会毁掉一个好写手,而一个好写手拿到糟糕的摘录,就会写出一篇流畅但说错对象的报告。
这种互补性恰恰是应当把两者都视为可互换的组件、而非一种必须坚守的承诺的理由。如果你用 ContextPilot 8B 搭建上下文处理的那一半,那么报告生成的那一半就应当置于一个不关心背后是哪个模型的接口之后——一侧是自托管的 AstaBrief 8B,另一侧是托管的前沿模型,并且能够在两者之间切换而无需重写整条流水线。让两条分支都经由同一个端点,正是这一点使这件事成为一次配置变更,而不是一次迁移:一个 API 打通 200 多个模型,按提供商标价 0% 加价透传,当某个提供商服务降级时自动故障转移,以及当你想要把多个模型组合成单次调用时可用的路由 DSL。自托管的写作模型之所以保持自托管,是因为那正是涉及数据敏感性的环节;而它周围的一切之所以保持可路由,是因为灵活性在那里成本最低。

证据的真实状况
两个模型都没有独立的记分牌,而且这两家实验室衡量的甚至都不是同一回事。
• AstaBrief 8B,SQABench-CS2 平均分(厂商报告):在测试集上为 87.0,而自身 SFT 检查点为 83.7,基础版 Qwen3-8B 为 77.3。
• AstaBrief 8B,DeepScholarBench(厂商报告):53.50,落后于 Ai2 自家的 Asta ScholarQA(60.25)和 DR-Tulu-8B(56.26)。
• AstaBrief 8B,对阵 Ai2 的 Claude 驱动流程的成对胜率(厂商报告):SQABench-CS2 开发集上为 55%,测试集上为 72%。
• ContextPilot 8B:数据仅存在于论文中,涉及长上下文问答和深度搜索基准;没有模型卡数据,也没有第三方复现。
有一个注意事项适用于整个 AstaBrief 专栏,Ai2 在博客中自己也说明了这一点:大部分训练和评估是在 2025 年完成的,因此对比模型反映的是当时的前沿水平,而该实验室尚未针对当前的前沿模型重新运行评估。请把那些百分比理解为关于某个时间点一项设计选择的证据,而不是当前排名。ContextPilot 8B 的数字带有论文常见的保留说明——自行选定的基准测试套件、自行运行的评测框架、在 Tencent 之外没有复现。
第二个注意事项是针对 AstaBrief 8B 的,在实践中很容易踩坑。它的模型卡警告说,该检查点是针对一种提示格式进行微调的,并以数据集文件的形式发布,而其他格式可能会导致行为退化。如果你用通用的聊天测试框架对它进行基准测试,那么你测量的既是模型,也同样是你的测试框架。
你想要哪一个?
当交付物本身就是文档时,选择 AstaBrief 8B。它采用 Apache-2.0 许可,可在单块 GPU 上以 8B BF16 级别运行,无需在其外围搭建任何智能体框架,而且它专门针对一种输出进行训练:一份由他人检索到的证据汇编而成的带引用报告。对大多数团队而言,商业许可是决定性因素,而 Ai2 自身的开放仓库姿态——权重、SFT 混合数据、DPO 混合数据以及提示格式全部公开——正是它可被审计、而不仅仅是免费的原因。
当交付成果是一条可运行的轨迹,而你的问题是智能体会遗忘或淹没在信息中时,选择 ContextPilot 8B。仅限研究的许可证使大多数公司不会将其纳入生产考虑,而运行时要求意味着你采用的不只是一个模型,而是腾讯的框架。如果你是在把主动式上下文管理作为一种技术来研究,它是一个有充分文档记录的起点。如果你需要上线交付,它就不适合。
而且,如果你需要两种能力,答案就不是任何一个模型单独承担——而是这一对模型,以每个都能被替换的方式连接起来。这项比较最不该得出的结果,就是一个单一的赢家,因为这两个检查点并不是在系统中争夺同一个位置。
