
AstaBrief 8B vs Qwen3-8B: Một bản tinh chỉnh của Ai2 bổ sung gì vào mô hình cơ sở của chính nó
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 220 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 113 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Ở đây không có câu chuyện kiến trúc nào cả, và đó chính là điểm mấu chốt. AstaBrief 8B là một bản tinh chỉnh của Qwen/Qwen3-8B, và hai mô hình chia sẻ cùng một cấu hình giống hệt nhau đến từng attention head: Qwen3ForCausalLM, 36 lớp, kích thước ẩn 4096, 32 attention head với 8 key-value head, vốn từ 151.936 token, và giới hạn vị trí 40.960 token. Mọi thứ phân biệt bản phát hành ngày 2026-10-02 của Ai2 với bản cơ sở tháng 4 năm 2025 đều nằm ở post-training. Vậy nên câu hỏi thú vị không phải là mô hình nào tốt hơn nói chung — mà là một đợt post-training cụ thể, được đầu tư bài bản, mang lại cho bạn những gì trên nền một mô hình cơ sở mà bạn đã có thể tải miễn phí, và cái giá bạn phải trả để đổi lại là gì.
Câu trả lời của Ai2 là một công cụ viết báo cáo tạo ra bản tổng hợp nhiều phần có trích dẫn trong khoảng 51 giây, so với 178,5 giây đối với quy trình chạy bằng Claude mà nó đã thay thế bên trong nền tảng Asta — nhanh hơn khoảng 3,5 lần, với việc Ai2 khẳng định chất lượng báo cáo vẫn được giữ vững trên các chỉ số mà họ theo dõi. Câu trả lời của Qwen3-8B là một mô hình tổng quát với các chế độ suy nghĩ lai và không suy nghĩ, hơn một trăm ngôn ngữ, và một năm rưỡi được sử dụng cho các tác vụ hạ nguồn. Cả hai đều theo giấy phép Apache-2.0. Sự đánh đổi là năng lực hẹp cộng với tốc độ, đối lại năng lực rộng cộng với tính linh hoạt, và dữ liệu dưới đây cho thấy khá rõ hình dạng của sự đánh đổi đó.
Dòng kiến trúc là một no-op, còn prompt thì không.
Vì hình học checkpoint là hoàn toàn giống nhau, mọi trực giác phục vụ mà bạn có về Qwen3-8B đều truyền nguyên vẹn sang AstaBrief 8B. Đây là một mô hình 8B dense ở BF16, vừa trên một card 24GB, phục vụ trên vLLM hoặc Transformers mà không cần kernel tùy chỉnh, và thừa hưởng giới hạn vị trí 40K của base — cả hai mô hình đều không phải mô hình ngữ cảnh dài, và cửa sổ huấn luyện 32K mở rộng bằng YaRN đúng như base. Lập kế hoạch triển khai cho bản fine-tune cũng chính là lập kế hoạch triển khai cho base. Điều đó đáng nói thẳng vì không phải lúc nào cũng đúng với các bản fine-tune, và điều đó có nghĩa thứ duy nhất bạn đang đánh giá là hành vi.
Hành vi là nơi sự khóa chặt tồn tại. Thẻ của AstaBrief mang một cảnh báo in đậm: mô hình đã được tinh chỉnh theo một định dạng lời nhắc cụ thể, được công bố dưới tên sft_prompt.txt trong bộ dữ liệu AstaBrief_prompts, và Ai2 nói rằng việc dùng một lời nhắc hoặc định dạng tương tác khác có thể dẫn đến hành vi suy giảm hoặc không nhất quán. Lời nhắc đó không phải là một mẫu trò chuyện thông thường. Đọc nó, bạn sẽ thấy một bản hợp đồng cứng nhắc — một ô truy vấn đặt trong dấu ngoặc, một khối section_references gồm các trích dẫn được gắn khóa theo mã định danh, cú pháp trích dẫn tường minh yêu cầu khóa tham chiếu phải theo sau câu mà nó hỗ trợ, một dấu đánh dấu được chỉ định cho kiến thức của mô hình, thứ không được kết hợp với một nguồn khác, và một chỉ dẫn yêu cầu mở đầu mỗi phần bằng TLDR hai câu. Qwen3-8B sẽ chấp nhận bất cứ thứ gì bạn gõ. AstaBrief 8B được tinh chỉnh cho một dạng đầu vào duy nhất và sẽ hoạt động kém hơn nếu bạn đưa cho nó một dạng khác.
47.000 ví dụ và 6.000 sở thích đã đem lại những gì
Quá trình tinh chỉnh hoàn toàn là hậu huấn luyện, và công thức được cố tình thiết kế theo hướng thông thường: tinh chỉnh có giám sát, tiếp theo là tối ưu hóa sở thích trực tiếp ngoại tuyến, không có học tăng cường. Ai2 bắt đầu từ các truy vấn thực tế được gửi qua hệ thống Asta của mình, lọc 90.000 lời nhắc tập trung vào nghiên cứu dựa trên chất lượng, mức độ liên quan và quyền riêng tư, tạo các mục tiêu báo cáo bằng pipeline ScholarQA nhiều bước sử dụng Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini và GPT-4.1, rồi giữ lại 47.000 ví dụ. Giai đoạn sở thích sau đó xây dựng khoảng 6.000 cặp, với GPT-4.1 và DeepSeek-R1 đánh giá và chỉ những cặp được cả hai đồng thuận mới được giữ lại.
Được đo trên SQABench-CS2 — 100 câu hỏi nghiên cứu khoa học máy tính do người dùng viết — so với mô hình cơ sở, đây là những gì nó mang lại, với mọi con số đều do nhà cung cấp báo cáo và không có con số nào được tái lập độc lập:
• Trung bình tổng thể — AstaBrief 8B 87.0 so với Qwen3-8B 77.3, mức tăng 9.7 điểm.
• Độ thu hồi nguyên liệu — 90,2 so với 77,8.
• Độ chính xác trích dẫn — 90.5 so với 76.2.
• Độ thu hồi trích dẫn — 78.2 so với 64.6.
• Độ chính xác của câu trả lời — 89,0 so với 90,6, giảm 1,6 điểm so với mô hình cơ sở.
Hàng cuối cùng là hàng nên định hình kỳ vọng. Việc tinh chỉnh để nâng cao chất lượng báo cáo không cải thiện mọi thứ một cách đồng đều; nó đánh đổi một chút mức độ liên quan của từng đoạn để lấy mức tăng lớn về độ bao phủ và căn cứ trích dẫn. Nếu bạn coi trọng các đoạn văn hơn tất cả, thì mô hình cơ sở không rõ ràng là lựa chọn kém hơn, và mô hình đã tinh chỉnh cũng không tự động là câu trả lời của bạn.
Hai thứ khác mà tiền không mua được. AstaBrief 8B không có điểm số được báo cáo nào trên DeepScholarBench cao hơn các lựa chọn thay thế của chính Ai2 — mức 53,50 của nó xếp sau Asta ScholarQA ở 60,25 và DR-Tulu-8B ở 56,26 — và phần thẩm định bởi con người của nó chỉ gồm mười bốn câu hỏi từ ba nhà nghiên cứu, trong đó DR-Tulu giành được mức độ ưa thích tổng thể. Một mô hình chuyên biệt có thể thua một mô hình nghiên cứu đa dụng trên chính bộ đánh giá của mô hình chuyên biệt, và Ai2 đã công bố điều đó.

Những gì bản cơ sở vẫn làm tốt hơn
Sự so sánh không chỉ diễn ra một chiều, và khía cạnh tổng quát của nó rất dễ bị xem nhẹ.
Qwen3-8B đi kèm với các chế độ tư duy kết hợp và không tư duy, nên nó có thể dùng token để suy luận khi một vấn đề đòi hỏi điều đó và trả lời trực tiếp khi không cần. AstaBrief 8B được huấn luyện để viết báo cáo một lần và không hề kế thừa hành vi suy luận có chủ đích đó như một tính năng sản phẩm. Qwen3-8B cũng mang theo độ phủ đa ngôn ngữ của mô hình cơ sở — hơn một trăm ngôn ngữ — trong khi AstaBrief được huấn luyện trên một kho ngữ liệu được lọc rõ ràng cho các truy vấn khoa học tiếng Anh, nên năng lực của nó bên ngoài lĩnh vực đó là chưa biết chứ không chỉ đơn thuần là chưa được kiểm chứng.
Còn có khả năng xử lý chỉ dẫn. Bạn muốn một mô hình đa dụng khi nhiệm vụ sẽ thay đổi vào tuần sau, khi bạn cần gọi công cụ, khi lược đồ đầu ra là của bạn chứ không phải của Ai2, hoặc khi bạn đang tạo nguyên mẫu và chưa biết prompt cuối cùng trông ra sao. Và về câu hỏi nguồn gốc thực tế — điều quan trọng khi ai đó hỏi vì sao bạn tin mô hình — Qwen3-8B đã có hơn mười một triệu lượt tải xuống và một năm rưỡi được sử dụng độc lập. AstaBrief 8B mới ra mắt được một tuần.
Điều mà AstaBrief 8B có mà bản cơ sở không thể sánh được là tính kỷ luật trích dẫn. Độ chính xác và độ phủ của trích dẫn là hai chỉ số mà bản tinh chỉnh dẫn đầu rõ rệt nhất và nhất quán nhất với câu chuyện huấn luyện — bộ lọc đơn lẻ mạnh nhất trong pipeline dữ liệu của Ai2 là mật độ trích dẫn, tỷ lệ các phát biểu mang ít nhất một trích dẫn, và mô hình thu được phản ánh ưu tiên đó. Việc khiến một mô hình đa dụng trích dẫn nội tuyến theo một định dạng khóa cố định, một cách đáng tin cậy, mà không đánh mất chỗ dựa cho các tuyên bố, là công việc prompt engineering mà bạn phải viết và duy trì. Bản tinh chỉnh của Ai2 biến điều đó thành hành vi mặc định của mô hình.

Dòng Qwen đã tiến xa kể từ tháng 4 năm 2025.
Thêm một rắc rối nữa, và đây là một rắc rối thực tiễn: Qwen3-8B đã ra đời được một năm rưỡi, và việc so sánh một bản tinh chỉnh mới với nó không giống như so sánh bản tinh chỉnh đó với một mô hình hiện hành khả thi.
Dòng Qwen hiện nay đã trải qua Qwen3.5, Qwen3.6, Qwen3.7 và Qwen3.8, và thế hệ hiện tại có thể truy cập được mà không cần tải xuống bất cứ thứ gì. Qwen3.8 27B là một route đang hoạt động trong danh mục của chúng tôi với cửa sổ ngữ cảnh 262,144 token ở mức $0.33 cho mỗi triệu token đầu vào và $2.40 cho mỗi triệu token đầu ra; Qwen3.8 Flash mang cửa sổ một triệu token với mức $0.15 và $0.47; Qwen3 VL 8B Instruct đáp ứng trường hợp đa phương thức ở mức $0.18 và $0.70 mỗi triệu với cửa sổ 131,072 token và đã được định tuyến từ tháng 10 năm 2025. Bản thân Qwen3-8B không phải là route mà chúng tôi phục vụ, và AstaBrief 8B cũng không — cả hai đều là trọng số dạng tải về rồi chạy, và cách nói trung thực là bản base thuộc về phần cứng của bạn còn thế hệ Qwen hiện đại thì không nhất thiết phải vậy.
Điều đó cho bạn một nhánh thứ ba cho phần đánh giá mà Ai2 không thể chạy. Đặt AstaBrief 8B lên GPU của riêng bạn, dựng Qwen3-8B base bên cạnh nó để xác nhận các mức chênh lệch được báo cáo, và hướng cùng một harness vào một mô hình Qwen3.8 được lưu trữ để mở rộng quy mô. Cả ba nhánh chỉ cách một endpoint, và chính điều đó biến đây thành một bài tập cấu hình thay vì một dự án mua sắm — một API duy nhất cho hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển tiếp với mức markup 0% nên khi nhà cung cấp giảm giá, phía bạn có ngay trong cùng ngày, tự động chuyển đổi dự phòng, và một DSL định tuyến nếu bạn muốn nhiều mô hình cùng trả lời một câu hỏi. Các nhánh tự lưu trữ vẫn tự lưu trữ vì lý do nhạy cảm về dữ liệu; mọi thứ được lưu trữ vẫn có thể hoán đổi, điều này rất quan trọng khi thế hệ Qwen tiếp theo ra mắt trong một quý.
Cách quyết định
Hãy chọn AstaBrief 8B nếu sản phẩm của bạn là tổng hợp tài liệu được trích dẫn và bạn muốn hành vi trích dẫn trở thành mặc định của mô hình thay vì trách nhiệm thuộc về prompt của bạn. Cấu trúc của mô hình nền đồng nghĩa với việc không có bất ngờ khi phục vụ, giấy phép Apache-2.0 cùng các hỗn hợp SFT và DPO đã công bố khiến nó có thể kiểm toán được, và lợi thế dẫn đầu về độ chính xác và độ hồi tưởng trích dẫn là kết quả lớn nhất và dễ giải thích nhất trong các bảng của Ai2.
Ở lại với Qwen3-8B, hay chuyển sang một Qwen3.x hiện hành, nếu tác vụ của bạn đa dạng, nếu bạn cần chế độ suy nghĩ hoặc công cụ hoặc khả năng bao phủ đa ngôn ngữ, nếu bạn vẫn đang khám phá prompt, hoặc nếu bạn không muốn bị khóa vào một khối chỉ dẫn dài mười sáu nghìn ký tự mà bạn không viết. Bản base thua về độ bao phủ và khả năng bám sát trích dẫn, không phải về độ liên quan, và nó vẫn giữ được điều gì đó mà bản tinh chỉnh đã từ bỏ.
Điều cần tránh là coi mức trung bình 87,0 so với 77,3 như toàn bộ câu chuyện. Bảng của chính Ai2 cho thấy bản tinh chỉnh đánh đổi độ chính xác câu trả lời để đạt được tính kỷ luật trích dẫn, còn ghi chú phòng thí nghiệm của chính họ thì cho thấy phần lớn quá trình huấn luyện và đánh giá đã hoàn tất vào năm 2025 và chưa được chạy lại đối chiếu với frontier hiện tại, và mô hình nền mà nó cải thiện không còn là thế hệ bạn sẽ chọn cho bất cứ thứ gì ngoại trừ so sánh này. Điều mà bản tinh chỉnh thể hiện rõ ràng là bổ sung thêm là một dạng đầu ra; liệu dạng đó có đáng để đánh đổi bằng sự thu hẹp hay không phụ thuộc hoàn toàn vào việc nó có khớp với dạng sản phẩm của bạn hay không.
