
AstaBrief 8B vs ContextPilot 8B: Hai câu trả lời cho cùng một mô hình cơ sở 8B
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 220 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 113 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Đặt AstaBrief 8B và ContextPilot 8B lên cùng một bảng thông số kỹ thuật thì sáu dòng đầu tiên giống hệt nhau. Cả hai đều là các checkpoint 8B dense được tinh chỉnh từ Qwen/Qwen3-8B. Cả hai đều kế thừa cùng một kiến trúc — 36 lớp, kích thước ẩn 4096, 32 đầu attention với 8 đầu key-value, từ vựng 151.936 token, và giới hạn vị trí 40.960 token của mô hình cơ sở. Không bên nào là một kiến trúc mới, và cũng không bên nào đang cố gắng trở thành như vậy. Đây là hai phòng thí nghiệm lấy cùng một bộ trọng số cơ sở đã đóng băng và dạy chúng hai công việc khác nhau, và hai công việc đó hướng đến hai đầu đối lập của một tác nhân nghiên cứu tầm xa: AstaBrief 8B viết báo cáo có trích dẫn đã hoàn thiện, còn ContextPilot 8B giữ cho ngữ cảnh làm việc của tác nhân không bị sụp đổ trong khi nó thu thập tài liệu.
Đó là toàn bộ sự so sánh gói gọn trong một câu, và đó cũng là lý do đây không phải là một cuộc đối đầu trực tiếp mà bạn nên đọc theo kiểu kẻ thắng ăn tất. Về giấy phép, bằng chứng và yêu cầu runtime, hai mô hình khác biệt hoàn toàn, và sự khác biệt ấy mang nhiều thông tin hơn bất kỳ điểm số nào mà cả hai phòng thí nghiệm công bố.
Cùng một hình học checkpoint, hai kiểu kế thừa khác nhau
Hãy bắt đầu từ những gì thực sự được chia sẻ, vì nó giới hạn mọi thứ khác. AstaBrief 8B của Ai2 và ContextPilot 8B của Tencent đều công bố Qwen3-8B là mô hình nền của chúng, và cả hai đều xấp xỉ 8 tỷ tham số. Kho lưu trữ của ContextPilot 8B ghi nhận 16,38 GB trọng số BF16 trải trên bốn phân đoạn safetensors, đúng bằng trọng lượng của một mô hình dense 8B. Giới hạn ngữ cảnh là của mô hình nền, không thay đổi ở cả hai: 40.960 vị trí trong cấu hình, được huấn luyện ở 32K và có thể mở rộng bằng YaRN. Không mô hình nào là mô hình ngữ cảnh dài. AstaBrief 8B không cần phải như vậy, vì nó được đưa các đoạn trích chứ không phải một tập ngữ liệu. ContextPilot 8B thì cố ý không như vậy, vì luận điểm của nó là làm cho một cửa sổ nhỏ hoạt động hiệu quả hơn.
Điều mà mỗi phòng thí nghiệm thay đổi là mục tiêu huấn luyện, và những mục tiêu đó khác biệt đến mức khó có thể khác biệt hơn được nữa.
• Phương pháp hậu huấn luyện — AstaBrief 8B: tinh chỉnh có giám sát sau đó tối ưu hóa sở thích trực tiếp ngoại tuyến, 47K ví dụ SFT và khoảng 6K cặp sở thích, trên tám H100.
• Phương pháp hậu huấn luyện — ContextPilot 8B: học tăng cường trên một khung quản lý ngữ cảnh chủ động, với việc hợp nhất vector nhiệm vụ của ba lần chạy SFT chuyên biệt được xếp lớp lên trên mô hình cơ sở gốc.
• Công việc — AstaBrief 8B: viết một báo cáo gồm nhiều phần với các trích dẫn nội tuyến từ một câu hỏi cùng các đoạn trích tài liệu đã truy xuất, chỉ trong một lượt.
• Công việc — ContextPilot 8B: lập kế hoạch, duy trì bộ nhớ dài hạn, truy xuất từ một chỉ mục và giải phóng ngữ cảnh mà tác nhân hiện không cần, trong khi vẫn tiếp tục suy luận và gọi công cụ.
• Runtime — AstaBrief 8B: phục vụ tiêu chuẩn bằng vLLM hoặc Transformers, cùng với định dạng prompt được khuyến nghị từ bộ dữ liệu AstaBrief_prompts.
• Runtime — ContextPilot 8B: môi trường chạy agent của Tencent, các định nghĩa công cụ và pipeline đánh giá từ kho lưu trữ Tencent/ContextPilot. Chỉ riêng checkpoint thì không thể tạo nên một agent hoạt động được.
• Giấy phép — AstaBrief 8B: Apache-2.0. ContextPilot 8B: văn bản Apache-2.0 tùy chỉnh có bổ sung Mục 0 giới hạn việc sử dụng cho nghiên cứu và phát triển.
• Bằng chứng — AstaBrief 8B: các bảng đánh giá chuẩn do nhà cung cấp báo cáo cùng những số liệu sử dụng trong môi trường sản xuất ban đầu từ nền tảng Asta của Ai2. ContextPilot 8B: các tuyên bố trong một bài báo arXiv đã được chấp nhận vào track chính của EMNLP 2026; thẻ mô hình không có số liệu nào và chưa có bên thứ ba nào tái lập được chúng.
Hai hàng trong danh sách đó gánh vác nhiều hơn phần còn lại. Hàng giấy phép quyết định liệu bạn có thể đưa mô hình vào một sản phẩm hay không: các điều khoản Apache-2.0 của AstaBrief 8B cho phép sử dụng thương mại, còn điều khoản bổ sung của ContextPilot 8B thì không. Hàng runtime quyết định bạn phải áp dụng bao nhiêu phần của phòng thí nghiệm cùng với trọng số. AstaBrief 8B là một checkpoint bạn có thể thả thẳng vào một serving stack hiện có. ContextPilot 8B là một thành phần của một framework, và những phần khiến framework hoạt động — hợp đồng công cụ, logic rollout, việc gán tín dụng — nằm trong mã của Tencent, chứ không nằm trong các shard bạn tải về.

Nơi mỗi thứ thực sự khẳng định được vị trí của mình
Cách hữu ích để so sánh chúng là coi chúng như các tiểu tác nhân liền kề trong một pipeline mà cả hai phòng thí nghiệm đang hội tụ về từ hai hướng đối lập.
Một tác nhân tổng hợp tài liệu có một lớp truy xuất, một lớp ngữ cảnh và một lớp sinh. ContextPilot 8B tấn công lớp ngữ cảnh: nó cung cấp cho tác nhân khả năng lập kế hoạch, bộ nhớ dài hạn có cấu trúc với các thao tác ghi/cập nhật/đọc ghi chú, truy xuất trên một chỉ mục, và giảm tải ngữ cảnh mềm, để một cửa sổ khiêm tốn vẫn khả dụng xuyên suốt một quỹ đạo dài. Luận điểm của bài báo là các mô hình chỉnh sửa ngữ cảnh trước đây cùng chia sẻ ba điểm yếu, và khung này giải quyết chúng một cách đồng thời — một bộ công cụ rộng hơn, rollout từng phần nhận biết ngữ cảnh giúp tập trung khám phá vào những chỉnh sửa thực sự thay đổi quỹ đạo, và gán tín dụng ở mức chi tiết. Các mục tiêu đánh giá là hỏi đáp ngữ cảnh dài và tìm kiếm sâu: InfBench, NovelQA, LongMemEval, BrowseComp+, theo như lần đọc kho lưu trữ trước đó của chúng tôi.
AstaBrief 8B tấn công vào lớp tạo sinh, và nó giả định rằng vấn đề ngữ cảnh đã được giải quyết ở thượng nguồn. Nó không truy xuất, tóm tắt các đoạn trích, gom nhóm chủ đề, hay quyết định bằng chứng nào cần giữ lại. Ai2 đã loại bỏ tất cả những điều đó khỏi nhiệm vụ của mô hình và huấn luyện nó viết báo cáo trong một lượt từ những đoạn trích do người khác chọn. Đánh cược là bộ khung đắt đỏ không phải nơi chất lượng nằm: Ai2 báo cáo rằng bản viết lại một lượt đạt tương đương quy trình nhiều bước chạy bằng Claude trên các chỉ số được theo dõi, đồng thời cắt giảm thời gian tạo sinh toàn quy trình từ 178,5 giây xuống 51,1 giây.
Khi đặt cạnh nhau, hai mô hình mô tả một sự phân công lao động mà bất kỳ phòng thí nghiệm nào cũng có thể đã vạch ra. Một mô hình giữ tập làm việc nhỏ và dòng bằng chứng luôn chảy. Mô hình kia biến những bằng chứng còn sót lại thành văn xuôi kèm trích dẫn. Các kiểu thất bại mang tính bổ trợ cho nhau chứ không trùng lặp: một trình quản lý ngữ cảnh loại bỏ nhầm đoạn trích sẽ đầu độc một người viết tốt, và một người viết tốt được giao những đoạn trích tồi sẽ tạo ra một báo cáo trôi chảy về sai đối tượng.
Sự bổ trợ đó là một lập luận để coi mỗi thành phần như một cấu phần có thể hoán đổi thay vì một cam kết. Nếu bạn xây dựng nửa phần ngữ cảnh bằng ContextPilot 8B, thì nửa phần tạo báo cáo nên nằm sau một giao diện không quan tâm mô hình nào đứng phía sau nó — AstaBrief 8B tự lưu trữ ở một bên, một mô hình tiên tiến dạng dịch vụ ở bên kia, cùng khả năng chuyển đổi giữa chúng mà không phải viết lại pipeline. Việc chạy cả hai nhánh qua một endpoint chính là điều biến đó thành một thay đổi cấu hình thay vì một cuộc di trú: một API duy nhất cho hơn 200 mô hình với giá niêm yết của nhà cung cấp được chuyển nguyên vẹn ở mức chênh lệch 0%, tự động chuyển đổi dự phòng khi một nhà cung cấp suy giảm, và một DSL định tuyến khi bạn muốn ghép nhiều mô hình vào một lệnh gọi duy nhất. Phần trình soạn thảo tự lưu trữ vẫn tự lưu trữ vì đó là phần gắn với câu chuyện nhạy cảm về dữ liệu; mọi thứ xung quanh nó vẫn có thể định tuyến vì đó là nơi tính linh hoạt có chi phí thấp.

Thực trạng trung thực của bằng chứng
Không mô hình nào có bảng điểm độc lập, và hai phòng thí nghiệm thậm chí còn không đo lường cùng một thứ.
• AstaBrief 8B, trung bình SQABench-CS2 (do nhà cung cấp báo cáo): 87,0 trên tập kiểm tra, so với 83,7 cho checkpoint SFT của chính nó và 77,3 cho Qwen3-8B gốc.
• AstaBrief 8B, DeepScholarBench (do nhà cung cấp báo cáo): 53.50, xếp sau Asta ScholarQA của chính Ai2 ở mức 60.25 và DR-Tulu-8B ở mức 56.26.
• AstaBrief 8B, tỷ lệ thắng theo cặp so với pipeline dùng Claude của Ai2 (do nhà cung cấp báo cáo): 55% trên SQABench-CS2 dev, 72% trên test.
• ContextPilot 8B: các số liệu chỉ tồn tại trong bài báo, trên các benchmark hỏi đáp ngữ cảnh dài và tìm kiếm sâu; không có số liệu trên model card và không có bản tái tạo từ bên thứ ba.
Một lưu ý áp dụng cho toàn bộ chuyên mục AstaBrief và chính Ai2 cũng nêu điều đó trong bài blog: phần lớn quá trình huấn luyện và đánh giá đã hoàn tất vào năm 2025, nên các mô hình so sánh phản ánh đường biên tiên phong tại thời điểm đó, và phòng thí nghiệm chưa chạy lại đánh giá với các mô hình tiên phong hiện tại. Hãy đọc những tỷ lệ phần trăm đó như bằng chứng về một lựa chọn thiết kế tại một thời điểm, chứ không phải như một bảng xếp hạng hiện thời. Các con số của ContextPilot 8B mang lưu ý thông thường của bài báo — bộ benchmark do nhóm tự chọn, khung đánh giá do nhóm tự chạy, không có tái lập bên ngoài Tencent.
Một lưu ý thứ hai dành riêng cho AstaBrief 8B và dễ mắc phải trong thực tế. Thẻ mô hình của nó cảnh báo rằng checkpoint đã được tinh chỉnh theo một định dạng prompt duy nhất, được công bố dưới dạng một tệp dataset, và rằng các định dạng khác có thể làm suy giảm hành vi. Nếu bạn đánh giá nó bằng một harness trò chuyện thông dụng, thì bạn đang đo lường harness của mình cũng nhiều như đang đo lường mô hình.
Bạn muốn cái nào?
Chọn AstaBrief 8B khi sản phẩm bàn giao chính là tài liệu. Nó dùng giấy phép Apache-2.0, chạy trên một GPU đơn trong phân khúc 8B BF16, không cần khung agent nào bao quanh, và được huấn luyện chuyên biệt cho đúng một đầu ra: một báo cáo có trích dẫn nguồn, được tổng hợp từ bằng chứng do người khác truy xuất. Giấy phép thương mại là yếu tố quyết định đối với hầu hết các đội nhóm, và lập trường mở kho của chính Ai2 — trọng số, hỗn hợp SFT, hỗn hợp DPO và định dạng prompt đều được công bố — chính là điều khiến nó có thể kiểm toán được, chứ không chỉ đơn thuần là miễn phí.
Chọn ContextPilot 8B khi kết quả bàn giao là một quỹ đạo hoạt động được và vấn đề của bạn là agent quên hoặc bị ngợp. Giấy phép chỉ dành cho nghiên cứu loại nó khỏi việc được cân nhắc đưa vào sản xuất đối với hầu hết các công ty, và yêu cầu runtime nghĩa là bạn đang áp dụng framework của Tencent, chứ không chỉ một mô hình. Nếu bạn đang nghiên cứu quản lý ngữ cảnh chủ động như một kỹ thuật, đây là một điểm khởi đầu được ghi chép đầy đủ. Nếu bạn cần phát hành sản phẩm, thì không.
Và nếu bạn cần cả hai năng lực, câu trả lời không phải là một mình mô hình nào — mà là cả cặp, được kết nối sao cho mỗi cái đều có thể được thay thế. Điều duy nhất mà so sánh này không nên tạo ra là một người thắng duy nhất, bởi vì hai checkpoint không cạnh tranh cho cùng một vị trí trong hệ thống.
