一张用于“AstaBrief 8B 对比 Qwen3-8B:Ai2 微调为自身基础模型增添了什么”的主视觉标题卡,标明共享的 Qwen3 架构以及 SQABench-CS2 上 87.0 对 77.3 的平均值,角落处带有 OrcaRouter 标志。
Guides & Insights

AstaBrief 8B vs Qwen3-8B:Ai2 的微调为其自身基础模型带来了什么

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

这里没有架构上的故事,而这正是重点。AstaBrief 8B 是 Qwen/Qwen3-8B 的微调版本,这两个模型共享同一套配置,连最后一个注意力头都完全一致:Qwen3ForCausalLM、36 层、隐藏维度 4096、32 个注意力头配 8 个键值头、151,936 词元的词表,以及 40,960 词元的位置上限。将 Ai2 于 2026-10-02 发布的版本与 2025 年 4 月的基座模型区分开来的一切,都来自后训练。因此,有趣的问题不是总体上哪个更好——而是:一次特定且资金充足的后训练,能在你已经可以免费下载的基座模型之上为你换来什么,又会让你付出什么代价作为回报。

Ai2 的答案是一个报告撰写器,能在约 51 秒内生成一份带引用的多章节综述,而被它在 Asta 平台内取代的、由 Claude 驱动的管线则需要 178.5 秒——大约快 3.5 倍,Ai2 还声称在其追踪的各项指标上报告质量保持不变。Qwen3-8B 的答案是一个通用型模型,兼具混合思维与非思维模式、支持一百多种语言,并已有约一年半的下游使用历史。两者都是 Apache-2.0 许可。这里要权衡的,是狭窄能力加高速,对比广泛能力加灵活性,而下面的数据把这一格局呈现得相当具体。

架构行是空操作,提示词则不是。

因为检查点结构完全一致,你对 Qwen3-8B 的每一条部署直觉都能原封不动地迁移到 AstaBrief 8B。它是一个 BF16 的稠密 8B 模型,能装进 24GB 显卡,可在 vLLM 或 Transformers 上部署且无需自定义内核,并且继承了基座的 40K 位置上限——两个模型都不是长上下文模型,32K 的训练窗口也和基座一样能通过 YaRN 扩展。为这个微调做部署规划,就是在为基座做部署规划。这一点值得直说,因为对微调模型而言它并不总是成立,而这意味着你唯一要评估的就是行为表现。

锁定效应就体现在行为上。AstaBrief 的卡片用粗体写着一则警告:该模型是针对一种特定提示格式微调的,该格式以 sft_prompt.txt 为文件名发布在 AstaBrief_prompts 数据集中,Ai2 表示,使用不同的提示或交互格式可能会导致行为退化或不一致。那个提示并不是随意的聊天模板。读一读就会发现一份刻板的契约——一个带方括号的查询槽位、一个按标识符索引引文的 section_references 块、明确的引用语法要求引用键必须紧随其所支持的句子之后、一个指定标记用于表示模型知识且不得与其他来源合并,以及一条要求每个 section 都以两句 TLDR 开头的指令。Qwen3-8B 会接受你输入的任何内容。AstaBrief 8B 则只针对一种输入形态进行了调优,如果你给它另一种形态,它的表现就会不佳。

47,000 个示例和 6,000 条偏好换来了什么

这次微调完全属于后训练,而且其方案刻意保持常规:先进行监督微调,再进行离线直接偏好优化,没有强化学习。Ai2 从通过其 Asta 系统提交的真实查询出发,按照质量、相关性和隐私标准筛选了 90,000 条以研究为重点的提示词,并使用 Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 和 GPT-4.1 通过多步 ScholarQA 流水线生成报告目标,最终保留了 47,000 个示例。偏好阶段随后构建了大约 6,000 对,由 GPT-4.1 和 DeepSeek-R1 进行评判,只有双方一致认可的配对才得以保留。

在 SQABench-CS2 上——包含 100 个由用户编写的计算机科学研究问题——针对基础模型进行衡量,这就是它带来的结果,其中每个数字均由厂商报告,且无一经过独立复现:

• 总体平均分 — AstaBrief 8B 87.0 对比 Qwen3-8B 77.3,提升了 9.7 分。

• 成分召回率 — 90.2 对 77.8。

• 引用精确度——90.5 对 76.2。

• 引用召回率 — 78.2 对比 64.6。

• 答案精确度 — 89.0 对 90.6,较基线下降 1.6 个百分点。

最后一行才是应该用来塑造预期的那一行。为报告质量进行的微调并没有全面提升所有方面;它以少量逐段相关性的代价,换来了覆盖率和引用依据方面的大幅提升。如果你的任务最看重相关段落,那么基础模型未必是更差的选择,而微调模型也不自动就是你的答案。

钱没能买到的还有另外两样东西。AstaBrief 8B 在 DeepScholarBench 上没有任何高于 Ai2 自家替代方案的已报告分数——它的 53.50 落后于 Asta ScholarQA 的 60.25 和 DR-Tulu-8B 的 56.26——而它的人工验证只是来自三名研究者的十四个问题,在这项验证中 DR-Tulu 赢得了总体偏好。专用模型可能在自家基准上输给通用研究模型,而 Ai2 把这一点公布了出来。

A two-column scoreboard headed 'AstaBrief 8B vs Qwen3-8B — the scoreboard'. The AstaBrief column reads 'identity: fine-tune of Qwen3-8B', 'job: cited report writing', 'context: 40K inherited', 'prompt: one fixed format', 'licence: Apache 2.0', 'evidence: vendor-reported SQA-CS2'; the Qwen column reads 'identity: the base model', 'job: generalist, thinking modes', 'context: 40K, YaRN to 131K', 'prompt: open', 'licence: Apache 2.0', 'evidence: 11M downloads, established'. A footer reads 'AstaBrief SQA-CS2 average 87.0 vs base 77.3 per Ai2; unreproduced.'

基础版仍然更胜一筹的地方

这种比较并非单向的,而且其中通才的一方很容易被低估。

Qwen3-8B 自带混合思考与非思考模式,因此当问题需要时,它可以将 token 用于推理,而当问题不需要时,则直接作答。AstaBrief 8B 是为一次性报告写作而训练的,作为产品功能,它完全不继承这种审慎推理行为。Qwen3-8B 还继承了基座的多语言覆盖能力——超过一百种语言——而 AstaBrief 则是在一个明确过滤为英语科学查询的语料库上训练的,因此它在该领域之外的能力是未知的,而不仅仅是未经测试。

那么接下来是指令层面。当任务下周就会变化、当你需要工具调用、当输出模式是你自己而非 Ai2 的,或者当你还在做原型、尚不知道最终提示词长什么样时,你想要的就是一个通用模型。而在原始来源这个问题上——也就是当有人问起你为什么信任这个模型时真正要紧的那个问题——Qwen3-8B 已有超过一千一百万次下载和一年半的独立使用。AstaBrief 8B 才刚经历了一个发布周。

AstaBrief 8B 具备而基座模型无法匹敌的,是引用纪律。引用精确率与召回率,是微调版领先幅度最大、也最贴合其训练叙事的两项指标——Ai2 数据管道中最强的单一过滤器就是引用密度,即带有至少一条引用的陈述所占比例,而由此得到的模型也反映了这一优先级。让一个通用模型以固定键格式可靠地进行内联引用,同时不丢失对论断的支撑,这是需要你编写和维护的提示工程。Ai2 的微调则把这一点变成了模型的默认行为。

A screenshot of the Hugging Face model card for Qwen/Qwen3-8B showing the TextGeneration tag, the apache-2.0 licence line, the qwen3 tag, the 8B parameter size in BF16 and a downloads-last-month figure of 11,020,586.

自 2025 年 4 月以来,Qwen 系列已经向前发展了

还有一个复杂因素,而且是实际层面的:Qwen3-8B 已经有一年半了,拿一个新的微调模型和它比较,跟拿它和一个仍然可行的现有模型比较,并不是一回事。

Qwen 的产品线如今涵盖 Qwen3.5、Qwen3.6、Qwen3.7 和 Qwen3.8,当前这一代无需下载任何内容即可使用。Qwen3.8 27B 是我们目录中的一条实时路由,拥有 262,144 token 的上下文窗口,价格为每百万输入 token 0.33 美元、每百万输出 token 2.40 美元;Qwen3.8 Flash 提供百万 token 窗口,价格为 0.15 和 0.47 美元;Qwen3 VL 8B Instruct 覆盖多模态场景,每百万 token 0.18 和 0.70 美元,窗口为 131,072 token,并自 2025 年 10 月起就已接入路由。Qwen3-8B 本身并非我们提供的路由,AstaBrief 8B 也不是——两者都是下载即运行的权重,而诚实的说法是:基础版应当跑在你自己的硬件上,而现代的 Qwen 世代则不必如此。

这为你提供了 Ai2 无法运行的那项评估的第三条路径。把 AstaBrief 8B 放在你自己的 GPU 上,将 Qwen3-8B 基座部署在它旁边以确认所报告的差异,并将同一套评测框架指向托管的 Qwen3.8 模型以实现规模化。三条路径都只需一个端点即可触达,这正是它成为配置演练而非采购项目的原因——一个 API 覆盖 200 多个模型,供应商标价以 0% 加价透传,因此供应商一旦降价,当天就能在你这边生效,自动故障转移,以及一个路由 DSL,如果你想多个模型一起回答同一个问题。出于数据敏感性原因,自托管路径继续自托管;所有托管的部分都保持可替换,这在下一代 Qwen 一个季度内发布时至关重要。

如何决定

如果你的产品是引用文献综合,并且你希望引用行为成为模型的默认行为、而不是由你的提示词来负责,那就选 AstaBrief 8B。基座模型的几何结构意味着服务部署不会有意外,Apache-2.0 许可证以及公开的 SFT 和 DPO 配比使其可审计,而它在引用精确率和召回率上的领先,是 Ai2 表格中幅度最大、也最可解释的结果。

继续使用 Qwen3-8B,或者迁移到当前的 Qwen3.x,如果你的任务多种多样,如果你需要思考模式、工具或多语言覆盖,如果你仍在探索提示词,或者如果你不愿被一个并非由你撰写的、长达一万六千字符的指令块所束缚。基座模型在覆盖范围和引文依据上落败,而非相关性,并且它保留了微调版所放弃的某种东西。

要避免的是把 87.0 对 77.3 的平均分当成全部真相。Ai2 自己的表格显示,这次微调牺牲了答案精确度来换取引用规范;其自家实验室笔记也指出,大部分训练与评估是在 2025 年完成的,尚未针对当前前沿重新运行;而它所改进的基座模型,除了用于这项对比之外,已经不是你会挑选的那一代了。这次微调能够确证带来的,是一种输出的形态;这种形态是否值得以狭窄性为代价,完全取决于它是否契合你产品的形态。