為「AstaBrief 8B 與 Qwen3-8B:Ai2 微調為其自身基礎模型增添了什麼」設計的主視覺標題卡,並指明共享的 Qwen3 架構以及 87.0 對 77.3 的 SQABench-CS2 平均值,角落有 OrcaRouter 標誌。
Guides & Insights

AstaBrief 8B vs Qwen3-8B:Ai2 微調為其自身基礎模型增添了什么

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

這裡沒有架構故事,而這正是重點。AstaBrief 8B 是 Qwen/Qwen3-8B 的微調版本,這兩個模型共享同一套配置,精確到最後一個注意力頭:Qwen3ForCausalLM、36 層、隱藏大小 4096、32 個注意力頭搭配 8 個鍵值頭、151,936 個 token 的詞彙表,以及 40,960 個 token 的位置上限。Ai2 在 2026-10-02 發布的版本與 2025 年 4 月的基礎模型之間,一切差異都來自後訓練。因此,有趣的問題不是哪一個整體上更好——而是在一個你已經可以免費下載的基礎模型之上,一次特定且資金充足的後訓練能為你帶來什麼,以及反過來會讓你付出什麼代價。

Ai2 的解答是一套報告撰寫器,能在約 51 秒內產出附有引用的多章節綜合報告;相較之下,它在 Asta 平台內所取代、由 Claude 驅動的流程則需 178.5 秒——大約快上 3.5 倍,而 Ai2 聲稱在其追蹤的指標上,報告品質得以維持。Qwen3-8B 的解答則是一個通用型模型,具備混合思考與非思考模式、支援一百多種語言,並已有一年半的下游使用歷程。兩者皆為 Apache-2.0。當中的取捨是專精能力加速度,對上廣泛能力加彈性,而下方數據讓這樣的輪廓顯得相當具體。

架構列是無操作,因此提示則不然。

因為檢查點幾何結構完全相同,你對 Qwen3-8B 的所有服務直覺都能原封不動地轉移到 AstaBrief 8B。它是 BF16 的稠密 8B 模型,可放進 24GB 顯示卡,能在 vLLM 或 Transformers 上服務且無需自訂核心,並繼承基礎模型的 40K 位置上限——兩者都不是長上下文模型,而 32K 訓練視窗也能以 YaRN 延伸,方式與基礎模型完全相同。微調版的部署規劃就是基礎模型的部署規劃。這點值得直說,因為這對微調模型並不總是成立,而這也意味著你唯一要評估的就是行為。

行為正是鎖定效應之所在。AstaBrief 的模型卡上以粗體提出警告:該模型是針對某一種特定提示格式進行微調的,該格式以 sft_prompt.txt 之名發布於 AstaBrief_prompts 資料集中,而 Ai2 表示,使用不同的提示或互動格式可能導致行為退化或不一致。那份提示並不是隨意的聊天範本。讀過之後,你會發現它是一份僵硬的契約——一個以方括號標示的查詢插槽、一個以識別碼為鍵的引文 section_references 區塊、要求參照鍵必須接在它所支持的那句話之後的明確引用語法、一個專用於標示模型自身知識且不得與其他來源混用的標記,以及一項要求每個章節都以兩句 TLDR 開頭的指示。Qwen3-8B 會接受你輸入的任何內容。AstaBrief 8B 則是針對單一形狀的輸入調校而成,你若餵給它另一種,它的表現就會打折扣。

47,000 個範例與 6,000 筆偏好換來了什麼

這次微調完全屬於後訓練階段,而且流程刻意維持傳統做法:先進行監督式微調,接著做離線直接偏好優化,完全不使用強化學習。Ai2 從使用者透過其 Asta 系統提交的真實查詢著手,針對品質、相關性與隱私篩選了 90,000 筆以研究為導向的提示,並使用 Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 與 GPT-4.1,透過多步驟的 ScholarQA 流程生成報告目標,最後保留 47,000 筆範例。偏好階段接著建立了約 6,000 組配對,由 GPT-4.1 與 DeepSeek-R1 擔任評判,只有雙方一致認可的配對才會留存。

在 SQABench-CS2 —— 100 個由使用者撰寫的電腦科學研究問題 —— 上、對照基礎模型進行衡量,以下是這所換來的成果;其中每一項數字皆由廠商自行報告,且無任何一項經獨立重現:

• 整體平均 — AstaBrief 8B 87.0 對 Qwen3-8B 77.3,領先 9.7 分。

• 成分回想 — 90.2 對 77.8。

• 引用精確度 — 90.5 對比 76.2

• 引用召回 — 78.2 對比 64.6。

• 答案精確度 — 89.0 對比 90.6,相較於基準損失 1.6 點。

最後一列才是應該用來塑造預期的依據。為了報告品質所做的微調並沒有全面改善一切;它犧牲了少量的逐段相關性,換取涵蓋範圍與引用依據方面的大幅提升。如果你的任務最重視的是相關段落,那麼基礎模型顯然不見得是較差的選擇,而微調也不自動就是你的答案。

還有另外兩件事,是這筆錢沒能買到的。AstaBrief 8B 在 DeepScholarBench 上,沒有任何已回報的成績高於 Ai2 自家的其他方案——它的 53.50 落後於 Asta ScholarQA 的 60.25 與 DR-Tulu-8B 的 56.26——而它的人工驗證是來自三位研究員的十四個問題,在這些問題上,DR-Tulu 贏得整體偏好。專用模型可能在自身基準上輸給通用研究模型,而 Ai2 把這件事公開了。

A two-column scoreboard headed 'AstaBrief 8B vs Qwen3-8B — the scoreboard'. The AstaBrief column reads 'identity: fine-tune of Qwen3-8B', 'job: cited report writing', 'context: 40K inherited', 'prompt: one fixed format', 'licence: Apache 2.0', 'evidence: vendor-reported SQA-CS2'; the Qwen column reads 'identity: the base model', 'job: generalist, thinking modes', 'context: 40K, YaRN to 131K', 'prompt: open', 'licence: Apache 2.0', 'evidence: 11M downloads, established'. A footer reads 'AstaBrief SQA-CS2 average 87.0 vs base 77.3 per Ai2; unreproduced.'

基礎版仍做得更好的地方

這種比較並非單向的,而且其中通才的一面很容易被低估。

Qwen3-8B 內建混合思考與非思考模式,因此當問題需要時,它可以花費 token 進行推理,不需要時則直接回答。AstaBrief 8B 是為一次性報告撰寫而訓練,並沒有將那種刻意推理行為作為產品功能繼承下來。Qwen3-8B 也承襲了基礎模型的多語言覆蓋範圍——超過一百種語言——而 AstaBrief 則是在明確篩選為英語科學查詢的語料庫上訓練,因此它在該領域之外的能力是未知,而不只是尚未測試。

接著是指令介面。當任務下週就會改變、當你需要工具、當輸出結構定義是你自己的而不是 Ai2 的,或者當你還在開發、還不知道最終版本長什麼樣子時,你要用的就是通用型模型。而談到那個至關重要的來源可信度問題——也就是當有人問你為什麼信任這個模型時真正要緊的問題——Qwen3-8B 已有超過一千一百萬次下載,以及一年半的獨立使用經驗。AstaBrief 8B 才剛過完發布第一週。

AstaBrief 8B 擁有而基礎模型無法比擬的,是引用紀律。引用精確率與召回率是兩項指標,微調模型在此的領先幅度最大,也與訓練歷程最為一致——Ai2 資料管道中最強效的單一篩選條件是引用密度,也就是帶有至少一則引用的陳述所占比例,而由此產出的模型反映了這項優先考量。要讓通用模型以固定鍵格式可靠地行內引用,同時不漏掉對各項主張的支持,是一套得由你撰寫並維護的提示工程。Ai2 的微調則讓這成為模型的預設行為。

A screenshot of the Hugging Face model card for Qwen/Qwen3-8B showing the TextGeneration tag, the apache-2.0 licence line, the qwen3 tag, the 8B parameter size in BF16 and a downloads-last-month figure of 11,020,586.

Qwen 系列自 2025 年 4 月以來已有新發展

還有一個複雜因素,而且是實際層面的問題:Qwen3-8B 已經問世一年半,而把新的微調模型跟它比較,和把新的微調模型跟一個仍堪用的現役模型比較,並不一樣。

Qwen 的產品線如今涵蓋 Qwen3.5、Qwen3.6、Qwen3.7 與 Qwen3.8,而且不必下載任何東西就能取用當前世代。Qwen3.8 27B 是我們目錄中的一條即時路由,具備 262,144 個 token 的上下文視窗,每百萬個輸入 token 收費 $0.33、每百萬個輸出 token 收費 $2.40;Qwen3.8 Flash 提供百萬 token 視窗,價格為 $0.15 與 $0.47;Qwen3 VL 8B Instruct 涵蓋多模態情境,每百萬個收費 $0.18 與 $0.70,並具備 131,072 個 token 的視窗,自 2025 年 10 月起即已上線路由。Qwen3-8B 本身並非我們所提供的路由,AstaBrief 8B 也不是——兩者都是下載後自行執行的權重,而最誠實的說法是:基礎模型該放在你自己的硬體上,而現代 Qwen 世代則不必如此。

這讓你能為 Ai2 無法執行的那項評估補上第三條臂。在你自己的 GPU 上部署 AstaBrief 8B,把 Qwen3-8B 基礎模型架在它旁邊以確認所回報的差異,並把同一套測試框架指向託管的 Qwen3.8 模型以擴展規模。這三條臂都只差一個端點,這正是讓它成為一項設定作業、而非採購專案的原因——單一 API 涵蓋 200 多個模型,供應商牌價以 0% 加價直接傳遞,因此廠商降價當天就在你這邊生效,自動容錯移轉,以及一套路由 DSL,可在你想讓多個模型一起回答同一個問題時使用。基於資料敏感性的理由,自架的那幾條臂仍維持自架;所有託管的部分則保持可替換,這在下一代的 Qwen 於一季內推出時很重要。

如何決定

若你的產品是引用文獻綜合,且你希望引用行為成為模型的預設,而不是提示詞的責任,就採用 AstaBrief 8B。基礎模型幾何結構意味著服務時零意外;Apache-2.0 授權與已發布的 SFT 和 DPO 混合資料讓它可供稽核;而它在引用精確率與召回率上的領先,是 Ai2 表格中最大且最可解釋的結果。

留在 Qwen3-8B,或改用目前的 Qwen3.x——如果你的任務多樣、如果你需要思考模式、工具或多語言涵蓋範圍、如果你還在探索提示詞,或者你不想被綁定在一段並非由你撰寫的一萬六千字元指令區塊上。基礎模型輸在涵蓋範圍與引用依據,而非相關性;而且它保留了微調版本所放棄的某樣東西。

要避免的是把 87.0 對 77.3 的平均值當成事情的全貌。Ai2 自家的表格顯示,這項微調是為了換取引用紀律而放棄答案精確度;自家的實驗室筆記也指出,大部分的訓練與評估是在 2025 年完成,且尚未對照當前前沿重新執行;而它所改良的基礎模型,已不再是你除了這項比較以外還會挑選的世代。這項微調可明確增添的,是一種輸出型態;那個型態是否值得承受這種狹隘性,完全取決於它是否符合你產品的型態。