
AstaBrief 8B: Open Report Writer của Ai2 chạy nhanh gấp 3,5 lần so với pipeline mà nó thay thế
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 216 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 111 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 42 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Con số tiêu đề từ thông báo AstaBrief 8B của Ai2 là một chỉ số đồng hồ bấm giây, không phải điểm chuẩn đánh giá: trên toàn bộ pipeline Asta, mô hình mới tạo một báo cáo nghiên cứu có trích dẫn trong trung bình 51,1 giây, so với 178,5 giây cho lộ trình dùng Claude mà nó giờ đây song hành. Nhanh hơn khoảng 3,5 lần, và điều đó đến từ một quyết định kiến trúc duy nhất — viết toàn bộ báo cáo trong một lượt thay vì tóm tắt, phân cụm, rồi viết từng phần. AstaBrief 8B là một mô hình trọng số mở 8B, được cấp phép Apache-2.0, tinh chỉnh từ Qwen3-8B, nhận một câu hỏi nghiên cứu cùng các đoạn trích tài liệu được truy xuất và trả về một báo cáo có trích dẫn nội tuyến. Nó đã được đưa vào nền tảng Asta của Ai2 với tên "Fast mode" vào ngày 2026-10-02, và trọng số, dữ liệu huấn luyện cùng một quy trình cục bộ mẫu đã được công bố cùng ngày.
Kho lưu trữ cũ hơn thông báo, và điều đó quan trọng
Một chi tiết trong bản phát hành này đáng được nói rõ, vì nó thay đổi cách bạn nên đọc mọi thứ còn lại: kho lưu trữ Hugging Face tại allenai/AstaBrief_8B mang dấu thời gian tạo nội bộ là 2026-02-09, và bộ dữ liệu DPO đi kèm có niên đại từ tháng 11 năm 2025. Thông báo ngày 2 tháng 10 là có thật — bài đăng blog, dòng tweet của AI2 và model card đều ra mắt vào ngày hôm đó — nhưng lịch sử kho lưu trữ dài hơn chu kỳ tin tức gợi ý.
Điều xảy ra vào ngày 2 tháng 10 là Ai2 đã phát hành và ghi tài liệu cho thứ đó, đồng thời chỉnh kho mã nguồn cho khớp: ba commit đã được đưa lên thẻ mô hình trong khoảng 16:18:06 đến 16:18:20 UTC vào ngày phát hành, thêm một mẫu phản hồi vào mẫu trò chuyện và loại bỏ một token không có tác dụng. Đó là việc dọn dẹp trên một thẻ, không phải huấn luyện lại. Ai2 cũng nói rõ trong blog rằng "phần lớn quá trình huấn luyện và đánh giá được mô tả đã hoàn thành trong năm 2025", và rằng các mô hình độc quyền được dùng để tạo dữ liệu huấn luyện và làm điểm so sánh "phản ánh trình độ tiên tiến nhất vào thời điểm đó". Phòng thí nghiệm cho biết họ chưa chạy lại toàn bộ đánh giá với các mô hình tiên tiến nhất hiện nay.

Vậy đây là một bản phát hành GA của công việc phần lớn đã hoàn tất vào năm 2025 — một buổi ra mắt, với tài liệu của một buổi ra mắt và tích hợp nền tảng của một buổi ra mắt, dựa trên một checkpoint đã tồn tại trong tài khoản của phòng thí nghiệm từ nhiều tháng nay. Không có gì trong đó là không trung thực, và mô hình này mới mẻ với tất cả mọi người bên ngoài Ai2. Nhưng điều đó có nghĩa là các con số so sánh bên dưới mô tả một mốc tiên phong của năm 2025, và chính Ai2 cũng nói như vậy.
AstaBrief 8B thực sự làm gì
Tính năng tạo báo cáo của nền tảng Asta thuộc Ai2 cho phép các nhà nghiên cứu đưa vào một câu hỏi lớn và một khối tài liệu, rồi nhận lại một bản tổng hợp có trích dẫn mà họ coi như một tài liệu làm việc. Trước đây, tính năng này vận hành hoàn toàn bằng cái mà Ai2 gọi là Thinking mode: một quy trình nhiều bước tóm tắt các đoạn trích được truy xuất, phân nhóm chúng theo chủ đề và viết câu trả lời theo từng phần, với sự hỗ trợ của các mô hình Claude. Thinking mode rất kỹ lưỡng nhưng chậm.
AstaBrief 8B là chế độ Fast. Với cùng một câu hỏi và cùng các đoạn trích được truy xuất, nó viết báo cáo cuối cùng chỉ trong một lượt truyền xuôi. Phần đáng chú ý là tuyên bố của Ai2: việc bỏ qua tóm tắt đoạn trích, phân cụm và vòng lặp theo từng phần không làm giảm chất lượng báo cáo, ít nhất là trên các thước đo mà phòng thí nghiệm theo dõi. Mô hình không phải là công cụ tìm kiếm và nó không truy xuất — nó là người viết ở cuối một pipeline truy xuất, và nó mong được giao bằng chứng.
Điều đó biến nó thành một thành phần hơn là một sản phẩm. Đây cũng là lý do Ai2 phát hành một quy trình làm việc mẫu cùng với các trọng số: một thư viện nhỏ biến các tệp PDF của chính bạn thành báo cáo, trong kho lưu trữ ai2-scholarqa-lib, mang đến cho bạn điểm khởi đầu để tạo cục bộ.
Công thức huấn luyện cố tình nhàm chán, và đó chính là chủ ý.
Công trình trước đây của chính Ai2, DR Tulu, đã cho thấy rằng học tăng cường có thể cải thiện việc tạo báo cáo dài ở các mô hình trọng số mở. Với AstaBrief, nhóm đã cân nhắc hướng đi đó và chọn không thực hiện, với lý do rằng RL không ổn định và tốn kém, và họ muốn một thứ dễ gỡ lỗi hơn. Thay vào đó, thứ họ xây dựng là tinh chỉnh có giám sát, tiếp theo là tối ưu hóa sở thích trực tiếp ngoại tuyến. Hai giai đoạn, cả hai đều thông thường.
Giai đoạn SFT bắt đầu từ các truy vấn thực tế được gửi qua hệ thống Asta của Ai2 thay vì các prompt tổng hợp. Từ các nhật ký thu thập được, nhóm đã lọc theo chất lượng, mức độ liên quan và quyền riêng tư — loại bỏ lưu lượng từ bot và người thử nghiệm beta, loại bỏ các truy vấn quá ngắn để có ý nghĩa, và chạy một lượt LLM để phát hiện các truy vấn không phải tiếng Anh, yêu cầu phi khoa học và prompt chứa thông tin cá nhân. Kết quả còn lại là một nhóm gồm 90.000 truy vấn tập trung vào nghiên cứu. Các mục tiêu báo cáo đầy đủ cho những truy vấn đó được tạo bằng pipeline ScholarQA nhiều bước, sử dụng Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini và GPT-4.1 làm mô hình nền. Sau khi lọc chất lượng: 47.000 ví dụ huấn luyện dùng được.
Giai đoạn DPO cần một thứ gì đó khác biệt — các cặp báo cáo cùng một mức ưu tiên giữa chúng. Mỗi truy vấn có một báo cáo đến từ pipeline ScholarQA; báo cáo đối thủ đến từ việc đưa các đoạn trích được truy xuất của ScholarQA vào một mô hình khác, lấy từ o3, o4-mini, DeepSeek-V3 hoặc DeepSeek-R1. Hai giám khảo, GPT-4.1 và DeepSeek-R1, đã chọn ra bên thắng cho mỗi cặp, và chỉ những cặp mà cả hai giám khảo đồng ý mới được giữ lại. Ai2 báo cáo mức đồng thuận 95% giữa các giám khảo LLM và ưu tiên của con người. Tập ưu tiên cuối cùng có khoảng 6.000 ví dụ. Cả hỗn hợp SFT và hỗn hợp DPO đều có trên Hugging Face để kiểm tra.

Phát hiện có thể chuyển giao rộng rãi nhất cũng là phát hiện ít hào nhoáng nhất. Các lần chạy SFT ban đầu viết báo cáo tốt hơn nhưng kém hơn về độ chính xác của câu trả lời và chất lượng trích dẫn, nên nhóm đã thử nghiệm bốn bộ lọc dựa trên thống kê trên dữ liệu huấn luyện tổng hợp: tỷ lệ token đầu ra trên đầu vào, mức độ liên quan truy xuất trung bình của các bài báo được trích dẫn, mật độ trích dẫn (tỷ lệ các phát biểu có ít nhất một trích dẫn) và tính đa dạng trích dẫn. Lợi ích mạnh nhất đến từ việc lọc bỏ các báo cáo tổng hợp có mật độ trích dẫn thấp — và việc lọc tích cực hơn, kết hợp các bộ lọc, cùng các đợt quét tốc độ học đã không mang lại cải thiện có ý nghĩa. Kết luận của Ai2 đáng được mang ra ngoài mô hình này: chuyên biệt hóa không phải là vấn đề đổ thêm nhiều văn bản khoa học vào tiền huấn luyện, mà là thành phần và chất lượng của dữ liệu hậu huấn luyện.
Bảng điểm do Ai2 công bố, và cách đọc nó

Mọi số liệu dưới đây đều do nhà cung cấp báo cáo. Nó đến từ thẻ mô hình và blog của Ai2, được tạo ra bởi chính bộ khung đánh giá của phòng thí nghiệm, và không có phần nào trong đó được tái lập một cách độc lập. Mục tiêu chính là SQABench-CS2, một tập hợp 100 câu hỏi nghiên cứu khoa học máy tính do người dùng viết, được theo dõi trên bốn chỉ số: độ nhớ thành phần (mức bao phủ nội dung cần thiết), độ chính xác câu trả lời (liệu từng đoạn có liên quan hay không), độ chính xác trích dẫn (liệu mỗi trích dẫn có hỗ trợ cho tuyên bố của nó hay không), và độ nhớ trích dẫn (liệu các tuyên bố có được hỗ trợ đầy đủ bởi các trích dẫn được đưa ra hay không).
• Trung bình tổng thể — AstaBrief 8B 87.0, checkpoint SFT của chính nó 83.7, Qwen3-8B gốc 77.3
• Nhắc lại thành phần — AstaBrief 8B 90.2, SFT 85.2, Qwen3-8B 77.8
• Độ chính xác của câu trả lời — AstaBrief 8B 89.0, SFT 90.4, Qwen3-8B 90.6
• Độ chính xác trích dẫn — AstaBrief 8B 90.5, SFT 87.7, Qwen3-8B 76.2
• Độ thu hồi trích dẫn — AstaBrief 8B 78.2, SFT 71.3, Qwen3-8B 64.6
Đọc các hàng cùng nhau và giai đoạn DPO có vẻ được nhắm mục tiêu chứ không phải tốt hơn một cách đồng đều. Điểm trung bình tổng thể tăng, độ thu hồi thành phần và cả hai chỉ số trích dẫn đều tăng mạnh, còn độ chính xác câu trả lời giảm nhẹ xuống dưới cả checkpoint SFT lẫn mô hình cơ sở. Nếu trường hợp sử dụng của bạn đặt mức độ liên quan trên mỗi đoạn lên trên hết, thì bản tinh chỉnh không tự động là câu trả lời cho bạn.
Về các đánh giá thứ cấp, Ai2 đã kiểm thử mô hình cuối cùng với chính pipeline ScholarQA của mình và với DR-Tulu-8B. Trên tập dev SQABench-CS2, Asta ScholarQA đạt 87,6; DR-Tulu-8B đạt 86,5; và AstaBrief 8B đạt 86,3; trên tập test, ScholarQA đạt 86,2; DR-Tulu-8B đạt 88,8; AstaBrief đạt 87,0. Trên DeepScholarBench, một benchmark tổng hợp dạng văn bản dài gồm 63 truy vấn, ScholarQA đạt 60,25; DR-Tulu-8B đạt 56,26; và AstaBrief đạt 53,50 — đây là hàng duy nhất mà trình viết báo cáo mở này xếp sau cả hai đối thủ còn lại. Trong hai so sánh cặp do LLM đánh giá với pipeline dùng Claude, AstaBrief chiếm 55% số so sánh trên tập dev và 72% số so sánh trên tập test. Một nghiên cứu riêng với con người chỉ bao gồm 14 câu hỏi từ ba nhà nghiên cứu, và về mức độ ưu tiên tổng thể thì DR-Tulu thắng, dù hai trong ba nhà nghiên cứu thích AstaBrief hơn về độ chính xác trích dẫn. Mười bốn câu hỏi từ ba người là một tín hiệu, không phải một phán quyết, và Ai2 trình bày nó đúng theo cách đó.
Phòng thí nghiệm cũng đã công bố dữ liệu sử dụng ban đầu từ tích hợp Asta: trong số 374 người dùng đã thử Fast mode, 29,1% đã dùng nó trong từ hai ngày trở lên, trung bình người dùng tạo ra 3,67 luồng báo cáo, 23% chưa bao giờ chuyển trở lại Thinking mode, và 18% chuyển đổi giữa hai chế độ tùy theo tác vụ. Phản hồi tích cực đạt 84,2% đối với Fast mode so với 85,2% đối với Thinking mode — đủ sát nhau đến mức Ai2 mô tả phản hồi này là quá thưa thớt để có thể đưa ra kết luận chắc chắn. Đó là cách diễn giải trung thực, nên hãy giữ nguyên.
Tự chạy
AstaBrief 8B là Apache-2.0 và dựa trên Qwen/Qwen3-8B, nên nó nằm trong phân khúc GPU đơn thay vì phân khúc trung tâm dữ liệu: một mô hình dense 8B trên kiến trúc Qwen3, 36 lớp, kích thước ẩn 4096, 32 đầu chú ý với 8 đầu key-value, vốn từ 151.936 token, và giới hạn vị trí 40.960 token của bản cơ sở. Ở BF16, nó vừa vặn thoải mái trên card 24GB, và ví dụ của chính card đó dùng vLLM với temperature 0,7, top-p 0,95, và giới hạn đầu ra 4096 token.
Một cảnh báo vận hành được in đậm trên thẻ mô hình và rất dễ bị bỏ qua: checkpoint đã được tinh chỉnh với một định dạng prompt cụ thể, được công bố dưới tên sft_prompt.txt trong bộ dữ liệu AstaBrief_prompts. Nếu dùng một prompt hoặc định dạng tương tác khác, Ai2 cho rằng hành vi sẽ suy giảm hoặc không nhất quán. Nếu bạn đánh giá mô hình này bằng harness của riêng mình và nhận được kết quả kém, hãy kiểm tra prompt trước khi kết luận bất cứ điều gì về trọng số.
Thẻ này cũng thẳng thắn về phạm vi. AstaBrief được dành cho mục đích nghiên cứu và giáo dục, không phải như một trợ lý đa mục đích, và không có endpoint suy luận được lưu trữ nào từ Ai2 — bạn tải nó xuống, hoặc bạn dùng nó bên trong Asta. Không nhà cung cấp nào trong danh mục của chúng tôi cung cấp nó, kể cả chúng tôi, nên không có tuyến nào để trỏ tới; cách trung thực để dùng nó là trên phần cứng của riêng bạn hoặc sau tường lửa của riêng bạn, đó chính xác là lập luận mà Ai2 đưa ra cho trọng số mở ngay từ đầu.
Router nằm ở đâu trong một pipeline báo cáo
AstaBrief chiếm một vị trí trong một chuỗi dài hơn. Có thành phần truy xuất tài liệu, có thành phần quyết định đoạn trích nào đáng để truyền xuống, và có thành phần có thể đánh giá hoặc xác minh báo cáo hoàn chỉnh. Những lệnh gọi đó là các lệnh gọi mô hình được host thông thường, và chúng là phần của ngăn xếp mà bạn thực sự muốn có quyền chọn nhà cung cấp: một API bao phủ hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển nguyên với mức đánh thêm 0% để việc nhà cung cấp giảm giá xuất hiện trên hóa đơn của bạn ngay trong ngày, tự động chuyển đổi dự phòng nếu nhà cung cấp suy giảm, và một DSL định tuyến nếu bạn muốn kết hợp nhiều mô hình vào một lệnh gọi duy nhất. Tự host trình viết vì đó là phần có tác động đến độ nhạy cảm dữ liệu và chi phí cố định; định tuyến phần điều phối vì đó là phần mà tính linh hoạt đáng giá hơn quyền sở hữu.
Cũng có một thí nghiệm ít tốn kém ở đây. Bộ so sánh của chính Ai2 gồm Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini và GPT-4.1 — cố ý là một nhóm tiên phong năm 2025, và phòng thí nghiệm nói rằng họ chưa chạy lại nó. Đặt đầu ra của AstaBrief cạnh các mô hình được lưu trữ ngày nay trên câu hỏi của chính bạn là một thao tác một phím nếu cả hai nhánh đều có thể truy cập qua cùng một endpoint, và nó trả lời câu hỏi mà bài blog còn bỏ ngỏ.
Điều gì sẽ thay đổi cục diện
Ba điều sẽ biến đây từ một bản ra mắt được ghi chép đầy đủ thành một kết quả đã ngã ngũ. Một bản tái lập độc lập các số liệu của SQABench-CS2, vì mọi con số ở trên đều là tự báo cáo. Một lần chạy lại đối chiếu với các mô hình tiên tiến hiện thời, vì bộ so sánh đã cũ đi một năm theo chính lời thừa nhận của phòng thí nghiệm. Và một đánh giá con người quy mô lớn hơn mười bốn câu hỏi từ ba nhà nghiên cứu — blog của chính Ai2 khép lại bằng lập luận rằng lĩnh vực này cần những đánh giá vượt ra ngoài việc hỗ trợ trích dẫn để hỏi liệu một mô hình có bảo toàn phạm vi chứng cứ của các nguồn hay không, bao gồm cả việc liệu nó có âm thầm biến những phát hiện đặc thù theo mẫu thành những khái quát hóa rộng hay không. Đó là một phê bình xác đáng đối với toàn bộ phạm trù đánh giá, và nó cũng áp dụng cho bản phát hành này.
Hiện tại, cách diễn giải thực tế rất đơn giản. Nếu bạn tạo các báo cáo có trích dẫn từ tài liệu và bạn muốn trình viết chạy trên phần cứng của riêng mình, theo giấy phép Apache-2.0, với dữ liệu huấn luyện mở, thì AstaBrief 8B là lựa chọn mở được thiết kế trực tiếp cho mục đích này nhất mà bất kỳ ai đã công bố, và mức giảm 3,5 lần thời gian wall-clock chính là lý do nó tồn tại. Nếu công việc của bạn phụ thuộc vào khả năng tổng hợp sắc bén nhất có thể, hãy lưu ý rằng bảng của chính Ai2 xếp DR-Tulu vượt trội về mức độ ưa thích tổng thể của con người và ScholarQA vượt trội trên DeepScholarBench — và rằng Thinking mode vẫn ở đó, trong cùng sản phẩm, chính vì lý do đó.
