一張「AstaBrief 8B 對決 ContextPilot 8B:同一個 8B 基礎模型的兩種答案」的英雄標題卡,標明共用的 Qwen3-8B 基礎模型與這兩項截然不同的任務,並在角落放上 OrcaRouter 標誌。
Guides & Insights

AstaBrief 8B 對比 ContextPilot 8B:同一個 8 基礎模型的兩種答案

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

把 AstaBrief 8B 和 ContextPilot 8B 放在同一張規格表上,前六行完全相同。兩者都是從 Qwen/Qwen3-8B 微調而來的稠密 8B 檢查點。兩者都繼承了相同架構:36 層、隱藏維度 4096、32 個注意力頭搭配 8 個鍵值頭、151,936 詞元的詞彙量,以及基礎模型的 40,960 詞元位置上限。兩者都不是新架構,也無意成為新架構。它們是兩個實驗室,拿同一組凍結的基礎權重,教會它們兩份不同的工作,而這兩份工作指向長時程研究代理的兩端:AstaBrief 8B 撰寫完成並附有引註的報告,而 ContextPilot 8B 則在代理蒐集素材時,防止其工作上下文崩潰。

這就是整個比較的一句話總結,也是為什麼這場正面對決不該被解讀成贏者全拿。在授權、證據和執行階段需求上,這兩個模型完全分歧,而這種分歧比任何一家實驗室公布的分數都更具資訊價值。

相同的檢查點幾何,兩種不同的繼承

從真正共享的部分開始,因為它界定了其他一切。Ai2 的 AstaBrief 8B 與騰訊的 ContextPilot 8B 都宣告以 Qwen3-8B 作為基礎,且兩者都約略為 80 億參數。ContextPilot 8B 的儲存庫記錄了 16.38 GB 的 BF16 權重,分散於四個 safetensors 分片,這正是 8B 稠密模型的重量。上下文上限是基礎模型的上限,兩者皆未改變:配置中為 40,960 個位置,以 32K 訓練,並可用 YaRN 擴展。這兩個模型都不是長上下文模型。AstaBrief 8B 不需要是,因為它拿到的是摘錄而非語料庫。ContextPilot 8B 刻意不是,因為其核心主張是讓小視窗發揮更大作用。

每個實驗室所改變的是訓練目標,而這些目標再不同也不過了。

• 訓練後方法 — AstaBrief 8B:先進行監督式微調,再進行離線直接偏好優化,使用 47K 個 SFT 範例與約 6K 組偏好配對,在八張 H100s 上。

• 後訓練方法 — ContextPilot 8B:在主動式上下文管理框架上進行強化學習,並將三個專門的 SFT 訓練運行的任務向量合併疊加到原始基礎模型上。

• 任務——AstaBrief 8B:根據一個問題加上檢索到的文獻摘錄,一次寫出一份含內文引用的多段報告。

• 任務 — ContextPilot 8B:規劃、保有長期記憶、從索引中檢索,並卸載代理目前不需要的上下文,同時持續推理與呼叫工具。

• 執行階段 — AstaBrief 8B:標準 vLLM 或 Transformers 服務,以及來自 AstaBrief_prompts 資料集的建議提示格式。

• 執行環境 — ContextPilot 8B:來自 Tencent/ContextPilot 儲存庫的騰訊代理執行環境、工具定義與評估流程。單單檢查點本身並不是可運作的代理。

• 授權條款 — AstaBrief 8B:Apache-2.0。ContextPilot 8B:自訂的 Apache-2.0 條款文字,並新增第 0 條,限制僅供研究與開發使用。

• 證據 — AstaBrief 8B:廠商報告的基準測試表,加上 Ai2 的 Asta 平台早期實際使用數據。ContextPilot 8B:相關說法出自一篇已被 EMNLP 2026 主軌接受的 arXiv 論文;模型卡未提供任何數字,且尚無第三方重現這些結果。

那份清單中有兩列比其他列發揮更大的作用。授權條款那一列決定你究竟能不能把模型放進產品中:AstaBrief 8B 的 Apache-2.0 條款允許商業使用,而 ContextPilot 8B 額外加上的條款則不允許。執行環境那一列則決定你必須連同權重一起採用多少實驗室環境。AstaBrief 8B 是一個可直接放入現有服務堆疊的檢查點。ContextPilot 8B 則是某個框架的元件,而讓該框架得以運作的各個部分——工具契約、rollout 邏輯、信用分配——存在於 Tencent 的程式碼中,而不是在你下載的分片裡。

A two-column scoreboard headed 'AstaBrief 8B vs ContextPilot 8B — the scoreboard'. The AstaBrief column reads base model Qwen3-8B, job 'write the cited report', post-training 'SFT then DPO', context 40K inherited, licence Apache 2.0, evidence 'vendor tables only'; the ContextPilot column reads base model Qwen3-8B, job 'manage agent context', post-training 'RL plus task-vector merge', context 40K inherited, licence 'research-only clause', evidence 'paper claims only'. A footer reads 'Both vendor-reported, unreproduced; no independent scores yet.'

每一個實際上掙得自己一席之地的地方

比較它們的有用方式,是把它們視為同一條管線中彼此相鄰的子代理,而兩個實驗室正從相反方向朝這條管線匯聚。

一個文獻綜述代理具有檢索層、脈絡層與生成層。ContextPilot 8B 針對的是脈絡層:它賦予代理規劃能力、具備寫入/更新/讀取筆記的結構化長期記憶、對索引的檢索,以及軟性脈絡卸載,使適度的視窗在漫長的軌跡中仍能運作。該論文的主張是,先前的脈絡編輯模型共有三項弱點,而此框架將它們一併處理——更廣泛的工具集、能把探索集中於真正改變軌跡之編輯的脈絡感知部分 rollout,以及細粒度的功勞分配。評估目標為長脈絡問答與深度搜尋:InfBench、NovelQA、LongMemEval、BrowseComp+,此依據我們先前對該儲存庫的解讀。

AstaBrief 8B 直攻生成層,並假定上下文問題已在上游獲得解決。它不進行檢索、不摘要片段、不聚類主題,也不決定該保留哪些證據。Ai2 把這些全部從模型的工作中移除,並訓練它根據他人挑選的摘錄,一氣呵成寫出報告。這場賭注在於:昂貴的鷹架並不是品質所在——Ai2 報告指出,單次改寫在其追蹤指標上與多步驟、由 Claude 驅動的流程不相上下,同時把完整流程的生成時間從 178.5 秒縮短到 51.1 秒。

綜合來看,這兩個模型描述的是一種任何一間實驗室都設計得出來的分工。一個負責讓工作集保持精簡,並讓證據持續流入。另一個則把留存下來的證據轉化為附有引註的文章。它們的失效模式是互補而非重疊:一個丟錯節錄的上下文管理器會拖垮優秀的寫作者,而拿到糟糕節錄的優秀寫作者,則會產出一份流暢卻寫錯主題的報告。

這種互補性正是主張把兩者各自視為可替換元件、而非長期承諾的理由。如果你用 ContextPilot 8B 打造情境處理的那一半,報告生成的那一半就應該置於一個不在乎背後是哪個模型的介面之後——一邊是自架的 AstaBrief 8B,另一邊是託管的前沿模型,而且能在兩者之間切換,無須改寫整條流程。讓兩條路線都透過同一個端點執行,正是讓這件事成為一項組態變更、而非一次遷移的關鍵:單一 API 橫跨 200 多個模型,並以 0% 加成原樣轉嫁供應商定價,供應商效能退化時自動容錯移轉,以及當你想把多個模型組合成單一呼叫時可用的路由 DSL。自架的寫作模型維持自架,因為那才是有資料敏感性顧慮的環節;圍繞它的一切則保持可路由,因為那裡的彈性最為便宜。

A screenshot of the Hugging Face model card for Tencent/ContextPilot-8B showing the TextGeneration tag, the 'other' licence line, the qwen3, context-management, tool-use and agent tags, the arXiv identifier 2608.28476 and the model title 'ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL'.

證據的誠實狀態

這兩個模型都沒有獨立的計分板,而且這兩家實驗室甚至不是在衡量同一件事。

• AstaBrief 8B,SQABench-CS2 平均(廠商回報):在測試分割上為 87.0,相較於其自家 SFT 檢查點的 83.7,以及基礎 Qwen3-8B 的 77.3。

• AstaBrief 8B,DeepScholarBench(廠商回報):53.50,落後於 Ai2 自家的 Asta ScholarQA 的 60.25 以及 DR-Tulu-8B 的 56.26。

• AstaBrief 8B,對上 Ai2 的 Claude 驅動管線的成對勝率(廠商報告):在 SQABench-CS2 開發集上為 55%,在測試集上為 72%。

• ContextPilot 8B:數據僅見於論文,在長上下文問答與深度搜尋基準測試上;沒有模型卡數據,亦無第三方重現。

有一項但書適用於整個 AstaBrief 專欄,而 Ai2 也在部落格中親自說明:大部分的訓練與評估都是在 2025 年完成的,因此那些比較模型反映的是當時的前沿水準,而該實驗室並未針對當前的前沿模型重新執行評估。請把那些百分比解讀為某個時間點上某項設計選擇的證據,而非當前的排名。ContextPilot 8B 的數字則帶有一般論文常見的但書——自行挑選的基準測試套件、自行執行的評測框架、在騰訊之外未曾重現。

第二個注意事項是 AstaBrief 8B 特有的,而且在實務上很容易踩雷。它的模型卡警告,該檢查點是針對某一種提示格式微調而成,該格式以資料集檔案形式發布,而其他格式可能會導致行為退化。如果你用通用的聊天測試框架對它做基準測試,你測到的不只是模型,也同樣是在測你的測試框架。

你想要哪一個?

當交付項目就是文件本身時,選擇 AstaBrief 8B。它採用 Apache-2.0 授權,可在單一 GPU 上以 8B BF16 等級運行,周圍無需任何代理框架,而且是專為單一輸出而訓練:一份由他人檢索到的證據彙整而成、附有引用的報告。對大多數團隊而言,商業授權是決定性因素,而 Ai2 自身開放儲存庫的姿態——權重、SFT 混合資料、DPO 混合資料與提示格式全數公開——正是讓它可供稽核,而不只是免費的關鍵。

當交付成果是一條可運作的軌跡,而你的問題是代理會遺忘或淹沒時,就選擇 ContextPilot 8B。僅限研究的授權條款讓大多數公司不會將其納入正式生產環境的考量,而執行階段需求意味著你採用的是騰訊的框架,而不只是模型。如果你正在研究主動式情境管理這項技術,它是一個有完善文件記載的起點。如果你需要的是推出產品,那它並不適合。

而且如果你兩種能力都需要,答案並不是單靠任一個模型——而是這一對,並以各自都能替換的方式串接起來。這場比較最不該產生的,就是單一贏家,因為這兩個檢查點並不是在競爭系統中的同一個位置。