用于文章《AstaBrief 8B:Ai2 的开源报告撰写器运行速度比它所取代的流水线快 3.5 倍》的主视觉标题卡,标注 51.1 秒对 178.5 秒的计时、Apache-2.0 许可证和 Qwen3-8B 基础模型,角落处带有 OrcaRouter 标志。
Guides & Insights

AstaBrief 8B:Ai2 的开源报告撰写器运行速度比它所取代的流水线快 3.5 倍

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Ai2 的 AstaBrief 8B 发布公告中,最引人注目的数字是一个秒表读数,而非基准测试得分:在完整的 Asta 流水线中,新模型平均只需 51.1 秒就能生成一份带引用的研究报告,而如今与之并列的、由 Claude 驱动的路径则需要 178.5 秒。这大约快了 3.5 倍,并且源于一个单一的架构决策——一次性写出整份报告,而不是先做摘要、聚类,再逐节撰写。AstaBrief 8B 是一个 8B 的开放权重模型,采用 Apache-2.0 许可,基于 Qwen3-8B 微调而来,它接收一个研究问题以及检索到的文献摘录,返回一份带行内引用的报告。它于 2026-10-02 作为"Fast mode"上线 Ai2 的 Asta 平台,同一天,模型权重、训练数据以及一个示例本地工作流也一并公开。

这个仓库比公告更早,这一点很重要

本次发布中有一个细节值得直白说明,因为它会改变你解读其他一切内容的方式:allenai/AstaBrief_8B 的 Hugging Face 仓库带有一个 2026-02-09 的内部创建时间戳,而配套的 DPO 数据集可追溯至 2025 年 11 月。10 月 2 日的公告是真的——博客文章、AI2 的推文和模型卡都在当天发布——但仓库的历史比新闻周期所暗示的要更久。

10月2日发生的事情是,Ai2 发布并记录了那个东西,并同步修改了仓库以与之匹配:发布日 UTC 16:18:06 到 16:18:20 之间,模型卡上合入了三个提交,向聊天模板中加入了一个响应模板,并删掉了一个空操作 token。这只是模型卡上的日常维护,而不是重新训练。Ai2 还在博客中明确指出,“所描述的大部分训练和评估都是在 2025 年完成的”,并且用于生成训练数据和作为对比点的专有模型“反映的是当时的前沿水平”。该实验室表示,其尚未针对当今的前沿模型重新运行完整评估。

A screenshot of the Ai2 blog post 'Open-sourcing AstaBrief, the fast report-generation model in Asta', dated October 2, 2026, showing the opening paragraphs about grounding scientific answers in evidence.

所以这是一次 GA 发布,其工作大部分在 2025 年就已完成——这是一次发布,带有发布文档和平台集成,建立在实验室账户中已存在数月的检查点之上。这没有任何不诚实之处,而且对于 Ai2 之外的所有人来说,这个模型都是全新的。但这确实意味着下面的比较数字描述的是 2025 年的前沿水平,Ai2 自己也这么说。

AstaBrief 8B 究竟做什么

Ai2 的 Asta 平台有一项报告生成功能:研究人员带着一个实质性问题和一个文献集合而来,得到一份带引用的综述,并将其视为一份可用的工作产物。该功能此前完全运行在 Ai2 所称的 Thinking 模式上:这是一个多步骤流程,它会对检索到的片段进行摘要、按主题聚类,并逐节撰写答案,背后由 Claude 模型支持。Thinking 模式详尽但缓慢。

AstaBrief 8B 是快速模式。给定相同的问题和相同的检索片段,它会在一次前向传播中写出最终报告。Ai2 的说法才是有意思的部分:绕过分段摘要、聚类以及逐节循环,并没有损害报告质量,至少在该实验室所跟踪的指标上是如此。该模型不是搜索引擎,也不做检索——它是检索流程末端的写作者,期望别人把证据交给它。

这使它成为一个组件,而非一个产品。这也正是 Ai2 在发布权重的同时还附带了一个示例工作流的原因:一个能把你自己 PDF 转换成报告的小型库,位于 ai2-scholarqa-lib 仓库中,为本地生成提供了一个起点。

这个训练配方刻意做得枯燥乏味,而这正是关键所在。

Ai2 自己此前的工作 DR Tulu 表明,强化学习可以提升开放权重模型的长篇报告生成能力。对于 AstaBrief,团队考虑过这条路径,但选择不走,理由是强化学习不稳定且成本高昂,他们想要更容易调试的方案。他们转而构建的是监督微调,随后是离线直接偏好优化。两个阶段,都很常规。

SFT 阶段始于通过 Ai2 的 Asta 系统提交的真实查询,而非合成提示。团队从收集到的日志中围绕质量、相关性和隐私进行筛选——剔除机器人和 beta 测试人员的流量,丢弃过短而无意义的查询,并运行一次 LLM 筛查,以捕捉非英语查询、非科学类请求以及包含个人信息的提示。这留下了 90,000 条以研究为重点的查询。这些查询的完整报告目标由多步骤 ScholarQA 流水线生成,使用 Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 和 GPT-4.1 作为支撑模型。经过质量筛选后:47,000 个可用的训练示例。

DPO 阶段需要一些不同的东西——成对的报告,并在它们之间标注偏好。每个查询的一份报告来自 ScholarQA 流程;与之竞争的报告则是将 ScholarQA 检索到的摘录输入另一个模型生成的,该模型从 o3、o4-mini、DeepSeek-V3 或 DeepSeek-R1 中选取。两个评判模型 GPT-4.1 和 DeepSeek-R1 为每一对选出胜者,只有两个评判都达成一致的配对才被保留。Ai2 报告称,LLM 评判与人类偏好之间的一致率为 95%。最终的偏好数据集大约有 6,000 个示例。SFT 混合数据和 DPO 混合数据都在 Hugging Face 上可供查看。

A screenshot of the Hugging Face model card for allenai/AstaBrief_8B showing the TextGeneration and PyTorch tags, the apache-2.0 licence line, the qwen3 and deep-research tags, the Ai2 organisation badge and the start of the model card text about supervised fine-tuning and offline DPO.

最具可迁移性的发现也是最不引人注目的。早期的 SFT 运行写出了更好的报告,但在答案精确度和引用质量上落后,因此团队在合成训练数据上测试了四种基于统计的过滤器:输出与输入 token 比率、被引用论文的平均检索相关性、引用密度(至少带有一处引用的陈述所占比例)以及引用多样性。最大的收益来自过滤掉引用密度低的合成报告——而更激进的过滤、过滤器组合以及学习率扫描并未带来有意义的增益。Ai2 的结论值得超越这一模型来借鉴:专业化并不在于向预训练中灌入更多科学文本,而在于后训练数据的构成与质量。

Ai2发布的排行榜,以及如何解读它

A screenshot of the Hugging Face dataset page for allenai/AstaBrief_DPO_Mix showing the cc-by-nc-4.0 licence, the json format tag and the dataset viewer with a 6.62k-row train split and prompt, chosen and rejected columns.

以下每项数据均由供应商报告。它来自 Ai2 的模型卡和博客,由该实验室自己的评估工具生成,且没有任何一项经过独立复现。主要目标是 SQABench-CS2,这是一组 100 个用户编写的计算机科学研究问题,并依据四项指标进行追踪:要素召回率(必要内容的覆盖程度)、答案精确率(每个段落是否相关)、引用精确率(每条引用是否支撑其主张),以及引用召回率(主张是否得到所给引用的充分支撑)。

• 总体平均 — AstaBrief 8B 87.0,其自身的 SFT 检查点 83.7,基础版 Qwen3-8B 77.3

• 成分召回 — AstaBrief 8B 90.2,SFT 85.2,Qwen3-8B 77.8

• 答案精确度 — AstaBrief 8B 89.0,SFT 90.4,Qwen3-8B 90.6

• 引用精确度 — AstaBrief 8B 90.5,SFT 87.7,Qwen3-8B 76.2

• 引用召回率 — AstaBrief 8B 78.2,SFT 71.3,Qwen3-8B 64.6

把各行放在一起看,DPO 阶段显得更有针对性,而非全面提升。总体平均值上升,成分召回率和两项引用指标均大幅提升,而答案精确率则略微下滑,低于 SFT 检查点和基础模型。如果你的使用场景最看重逐段相关性,那么微调并不自动就是你的答案。

在二次评估中,Ai2 将其最终模型与其自家的 ScholarQA 流程以及 DR-Tulu-8B 进行了对比测试。在 SQABench-CS2 开发集上,Asta ScholarQA 得分为 87.6,DR-Tulu-8B 为 86.5,AstaBrief 8B 为 86.3;在测试集上,ScholarQA 为 86.2,DR-Tulu-8B 为 88.8,AstaBrief 为 87.0。在 DeepScholarBench 这个包含 63 个查询的长篇综合基准上,ScholarQA 得分为 60.25,DR-Tulu-8B 为 56.26,AstaBrief 为 53.50——这是开放报告撰写器唯一落后于两个替代方案的一项。在与 Claude 驱动的流程进行的两项由 LLM 评判的成对比较中,AstaBrief 在开发集比较中赢得了 55%,在测试集比较中赢得了 72%。一项单独的人类研究仅覆盖了来自三名研究人员的 14 个问题,在总体偏好上 DR-Tulu 胜出,不过三名研究人员中有两人在引用准确性上更偏好 AstaBrief。来自三个人的十四个问题是一个信号,而非定论,Ai2 也如此呈现。

该实验室还发布了 Asta 集成功能的早期使用数据:在 374 名尝试过 Fast 模式的用户中,29.1% 在两天或以上使用该模式,用户平均生成 3.67 个报告线程,23% 的用户从未切换回 Thinking 模式,18% 的用户会根据任务在两种模式之间切换。Fast 模式获得 84.2% 的正面反馈,而 Thinking 模式为 85.2%——两者差距甚微,因此 Ai2 认为这些反馈过于稀疏,不足以得出强有力的结论。这是诚实的表述,因此请保留。

自己运行

AstaBrief 8B 采用 Apache-2.0 许可,并基于 Qwen/Qwen3-8B,因此它属于单 GPU 级别,而非数据中心级别:一个基于 Qwen3 架构的稠密 8B 模型,36 层,隐藏大小为 4096,32 个注意力头,配备 8 个键值头,151,936 token 的词表,以及基础模型的 40,960 token 位置上限。在 BF16 下,它能轻松装入 24GB 显卡,而该显卡自身的示例使用 vLLM,temperature 0.7、top-p 0.95,以及 4096 token 的输出上限。

模型卡上以粗体印着一条操作警告,而且很容易被略过:该检查点是针对一种特定的提示格式进行微调的,该格式以 sft_prompt.txt 的形式发布在 AstaBrief_prompts 数据集中。如果改用不同的提示或交互格式,Ai2 预计会出现性能下降或不一致的行为。如果你用自己的测试框架评估这个模型并得到较差的结果,在就权重得出任何结论之前,先检查提示。

这张模型卡对适用范围也很坦诚。AstaBrief 旨在用于研究和教育用途,而非作为通用助手;Ai2 也没有提供托管的推理端点——你要么下载它,要么在 Asta 内部使用它。我们目录中的任何提供商都不提供它,包括我们自己在内,所以没有可指向的路由;诚实的使用方式是在你自己的硬件上,或在你自己的防火墙后面使用它,而这正是 Ai2 最初为开放权重所提出的理由。

路由器在报告流水线中的位置

AstaBrief 在这条更长的链路里只占一个环节。有东西负责检索文献,有东西负责判断哪些摘录值得继续往下传,还有东西可能对最终报告进行评判或核验。这些调用都是普通的托管模型调用,也正是整条技术栈中你确实希望拥有供应商选择权的那部分:一套 API 覆盖 200 多个模型,供应商标价按 0% 加价率原样透传所以供应商一降价,你的账单当天就能体现出来,供应商服务劣化时自动故障转移,以及在你想要把多个模型组合成一次调用时可用的路由 DSL。把写作环节自托管,因为这部分涉及数据敏感性且有固定成本;把编排环节交给路由,因为这部分灵活性比自主可控更值钱。

这里还有一个成本很低的实验。Ai2 自己的对比集是 Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 和 GPT-4.1——有意选定的 2025 年前沿模型,而该实验室表示尚未重新运行过它。只要两边都能通过同一个端点访问,把 AstaBrief 的输出与当今托管模型在你自己的问题上的表现放在一起比较,就是一键即可完成的操作,而且它能回答那篇博文悬而未决的问题。

什么会改变局面

有三件事能把这次记录详尽的发布变成确凿的结果。对 SQABench-CS2 数字的独立复现,因为上文中的每个数字都是自行报告的。用当前前沿模型重新跑一遍,因为按实验室自己的承认,比较集已经过时一年。以及比三名研究人员的十四个问题更大规模的人工评估——Ai2 自己的博客在结尾主张,该领域需要超越引文支持的评估,去追问模型是否保留其来源的证据范围,包括它是否悄悄把样本特定的发现变成宽泛的概括。这是对整个评估类别的公允批评,也适用于这次发布。

就目前而言,实际的解读很简单。如果你从文献中生成带引用的报告,并且希望把撰写者放在你自己的硬件上、采用 Apache-2.0 许可证、训练数据开放,那么 AstaBrief 8B 是任何人已发布的最直接为此目的打造的开源选项,而 3.5 倍的墙钟时间缩减正是它存在的原因。如果你的工作依赖于尽可能最锐利的综合,请注意 Ai2 自己的表格显示,DR-Tulu 在总体人类偏好上领先,ScholarQA 在 DeepScholarBench 上领先——而 Thinking 模式仍然在那里,就在同一个产品中,正是出于这个原因。