
AstaBrief 8B so với Gemma 4 12B: Một mô hình viết chuyên biệt đối đầu với một mô hình tổng quát làm được mọi thứ
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 216 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 101 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
AstaBrief 8B và Gemma 4 12B cùng phân khúc kích thước và cùng giấy phép, và ngoài điều đó ra, chúng là câu trả lời cho những câu hỏi khác nhau. AstaBrief 8B là mô hình trọng số mở 8B của Ai2, ra mắt ngày 2026-10-02 và được tinh chỉnh từ Qwen3-8B, chỉ làm đúng một việc: biến một câu hỏi nghiên cứu cùng các đoạn trích tài liệu được truy xuất thành một báo cáo có trích dẫn, trong một lượt, trong khoảng 51 giây từ đầu đến cuối. Gemma 4 12B là mô hình đa phương thức hợp nhất 11.95B của DeepMind, một mô hình đa dụng Apache-2.0 tiếp nhận văn bản, hình ảnh, âm thanh và video một cách gốc và xử lý 256.000 token ngữ cảnh. Một cái là con dao mổ chỉ làm một việc nhanh hơn cả quy trình đa dụng mà nó thay thế; cái kia là cả hộp công cụ, ngay trên thiết bị.
Sự cám dỗ là tuyên bố mô hình chuyên biệt làm tốt hơn công việc của nó rồi bỏ qua. Câu hỏi hữu ích hơn, nếu bạn đang triển khai trên một GPU tiêu dùng, là liệu lợi thế của mô hình hẹp có đủ lớn để biện minh cho việc chạy hai ngăn xếp thay vì một hay không — và câu trả lời phụ thuộc vào những con số mà chưa phòng thí nghiệm nào có được sự xác minh độc lập.
Những phần thực sự trùng lặp
Cả hai đều là những mô hình dense với trọng số mở mà bạn có thể chứa vừa trên một card duy nhất, cả hai đều theo Apache-2.0, và cả hai đều có sẵn để tải về thay vì nằm sau một API. Đó là điểm trùng lặp thực sự, và chính nó là lý do khiến việc so sánh này đáng để thực hiện ngay từ đầu.
Ngoài điều đó ra, sự khác biệt là hoàn toàn, và chỉ hai hàng đóng vai trò chủ yếu.
• Tham số — AstaBrief 8B: khoảng 8B dense, trọng số BF16 thuộc phân khúc GPU đơn. Gemma 4 12B: 11,95B dense, kiến trúc hợp nhất không có encoder.
• Các phương thức trong — AstaBrief 8B: chỉ văn bản, và cụ thể là một câu hỏi cùng các đoạn trích. Gemma 4 12B: văn bản, hình ảnh, âm thanh và video, với âm thanh và thị giác được chiếu trực tiếp vào không gian nhúng của bộ giải mã thông qua các lớp tuyến tính nhẹ thay vì các bộ mã hóa riêng biệt.
• Đầu ra phương thức — Cả hai: văn bản. AstaBrief 8B xuất ra một báo cáo có trích dẫn; Gemma 4 12B xuất ra văn bản thuần dưới bất kỳ dạng nào bạn yêu cầu.
• Bối cảnh — AstaBrief 8B: giới hạn vị trí 40.960 token của mô hình cơ sở, được huấn luyện ở 32K. Gemma 4 12B: 256.000 token, với cơ chế attention hỗn hợp xen kẽ attention cửa sổ trượt cục bộ (cửa sổ 1024 token) với attention toàn cục, và RoPE tỷ lệ trên các lớp toàn cục để kiểm soát bộ nhớ ngữ cảnh dài.
• Huấn luyện — AstaBrief 8B: tinh chỉnh có giám sát trên 47K ví dụ báo cáo rồi sau đó là khoảng 6K cặp DPO, trên tám H100. Gemma 4 12B: tiền huấn luyện tổng quát của Google DeepMind cùng với tinh chỉnh theo hướng dẫn, được ghi lại trong một báo cáo kỹ thuật.
• Công việc — AstaBrief 8B: một nhiệm vụ, tạo báo cáo kèm trích dẫn. Gemma 4 12B: suy luận, lập trình, quy trình tác tử, trò chuyện đa ngôn ngữ trên hơn 140 ngôn ngữ.
• Điểm số độc lập — Không có điểm nào dành cho AstaBrief 8B ngoài các bảng của chính Ai2. Gemma 4 12B xuất hiện trên các bảng xếp hạng công khai, bao gồm Artificial Analysis, nơi dòng phát hành này được chấm điểm; đó là các số liệu của bên thứ ba và là những số liệu duy nhất trong bài viết này không do nhà cung cấp nào cung cấp.
Hãy đọc dòng ngữ cảnh như sự khác biệt mang tính cấu trúc, chứ không phải một điểm trên bảng thông số. Mức trần 40K của AstaBrief 8B không phải là một giới hạn mà Ai2 đang tìm cách lách qua; đó là hệ quả của thiết kế. Mô hình không bao giờ nắm giữ toàn bộ ngữ liệu, mà chỉ giữ những đoạn trích do người khác chọn lọc và định cỡ. Cửa sổ 256K của Gemma 4 12B có nghĩa là cùng một tác vụ có thể được tiếp cận mà hoàn toàn không cần lớp truy xuất — dán một khối tư liệu lớn rồi hỏi — đây là một kiến trúc thực sự khác biệt để đạt cùng một kết quả, và là kiến trúc gộp hai hệ thống thành một.
Ở đâu chuyên gia chiếm ưu thế, và ưu thế đến mức nào
Lập luận của Ai2 dành cho AstaBrief là về thời gian, và đó là một lập luận tốt. Quy trình Thinking do Claude hỗ trợ của nó đạt trung bình 178,5 giây mỗi báo cáo; AstaBrief viết toàn bộ báo cáo trong một lượt đạt trung bình 51,1 giây, nhanh hơn khoảng 3,5 lần, và Ai2 khẳng định việc đơn giản hóa không làm giảm chất lượng trên các chỉ số được theo dõi của nó.
Công ty đáng bàn ở đây không phải là Claude. Mà chính là bộ khung nhiều bước — tóm tắt đoạn trích, phân cụm theo chủ đề và viết theo từng phần — tất cả những thứ mà AstaBrief xóa bỏ. Và bộ khung đó cũng chính là công việc mà nếu không có nó, bạn sẽ phải xây dựng thêm lên trên bất kỳ mô hình tổng quát nào, kể cả Gemma 4 12B, nếu bạn muốn có một báo cáo có cấu trúc, có trích dẫn từ nó. Một mô hình tổng quát khi được yêu cầu “một báo cáo có trích dẫn” sẽ tạo ra một báo cáo; nhưng khiến nó tạo ra báo cáo theo một lược đồ cố định, với các khóa trích dẫn khớp với danh sách nguồn, lại là phần kỹ thuật gợi ý mà bạn phải tự sở hữu và duy trì.
Tuyên bố về chất lượng chính là chỗ bạn phải chậm lại.
• SQABench-CS2 trung bình, tập kiểm tra (do nhà cung cấp báo cáo) — AstaBrief 8B 87,0, checkpoint SFT của chính nó 83,7, Qwen3-8B cơ sở 77,3. 100 câu hỏi khoa học máy tính do người dùng viết.
• DeepScholarBench (do nhà cung cấp báo cáo) — AstaBrief 8B 53.50, xếp sau Asta ScholarQA của chính Ai2 ở mức 60.25 và DR-Tulu-8B ở mức 56.26.
• So sánh đối đầu với pipeline dùng Claude của Ai2 (do nhà cung cấp báo cáo) — thắng 55% trên tập dev, 72% trên tập test.
• Nghiên cứu trên người (do nhà cung cấp báo cáo) — 14 câu hỏi từ ba nhà nghiên cứu, DR-Tulu được ưa thích hơn về tổng thể, với hai trong số ba người nêu độ chính xác trích dẫn của AstaBrief.
Không tồn tại điểm số tương đương cho Gemma 4 12B trên SQABench-CS2, theo cả hai hướng. Sự vắng mặt đó chính là tâm điểm trung thực của so sánh này: bạn không thể gán một con số cho chất lượng báo cáo của Gemma 4 12B so với AstaBrief 8B, bởi vì chưa ai cho mô hình đa dụng này chạy qua harness của Ai2 và cũng chẳng ai giả vờ là có. Bất kỳ ai nói với bạn rằng mô hình chuyên biệt này "hơn 26 điểm" đều đang đem so một con số do nhà cung cấp công bố với không gì cả.

Nơi người đa năng giành chiến thắng tuyệt đối
Những lợi thế của Gemma 4 12B không hề nhỏ nhặt và chúng rất dễ bị coi nhẹ.
Đầu tiên là độ bao quát. AstaBrief 8B là một thành phần được thiết kế để nhận bằng chứng từ bên ngoài. Gemma 4 12B đọc ảnh chụp màn hình, nghe âm thanh, xem video, viết mã và duy trì cuộc hội thoại 256K. Nếu công việc của bạn liên quan đến hình vẽ trong bài báo, các buổi nói chuyện được ghi lại hoặc tư liệu nguồn đa phương thức, thì mô hình chuyên biệt hoàn toàn không thể tham gia, và câu hỏi coi như đã khép lại.
Điều thứ hai là việc công khai rộng rãi bản thân nó cũng là một dạng bằng chứng. Gemma 4 12B có mặt trên các bảng xếp hạng của bên thứ ba; dòng này trải dài năm kích cỡ từ ... đến 31B; cả các biến thể được tinh chỉnh theo chỉ dẫn lẫn biến thể prefab đều được công bố cùng với một báo cáo kỹ thuật. Đó là nguồn gốc công khai, nhàm chán, có thể xác minh — chính xác là thứ mà cả AstaBrief 8B lẫn nhóm rộng hơn các mô hình truy xuất đều đang thiếu.
Thứ ba là chi phí thực tế của một stack thứ hai. Việc chạy AstaBrief 8B để viết báo cáo cùng với một mô hình tổng quát cho mọi việc khác đồng nghĩa với việc phải thường trú hai mô hình, hai định dạng prompt, hai khung đánh giá và hai lộ trình nâng cấp. Trên một card 24GB duy nhất ở BF16, điều đó không hề miễn phí — và thẻ mô hình của AstaBrief cảnh báo rằng nó đã được tinh chỉnh theo một định dạng prompt cụ thể, được công bố dưới dạng một tệp dataset, và rằng việc dùng một định dạng khác có thể làm suy giảm hành vi. Một mô hình tổng quát thì không có ràng buộc kiểu như vậy.
• Gemma 4 12B (do nhà cung cấp báo cáo) — chỉ số trí tuệ 9 trên cấu hình Reasoning; không có con số Gemma tương đương nào trên các benchmark trong báo cáo của Ai2.
• Dòng Gemma 4 — năm kích cỡ từ E2B đến 31B, Apache-2.0, báo cáo kỹ thuật đã được công bố, có mặt trên bảng xếp hạng của bên thứ ba.
• Gemma 4 26B A4B, được cung cấp trong danh mục của chúng tôi — 0,06 USD mỗi triệu token đầu vào, 0,33 USD mỗi triệu token đầu ra, cửa sổ ngữ cảnh 262.144 token. Gemma 4 31B cũng được định tuyến, ở mức 0,13 USD / 0,38 USD.
• Gemma 4 12B, cục bộ — 11.95B dense, ngữ cảnh 256K, cơ chế chú ý cửa sổ trượt kết hợp và chú ý toàn cục, cửa sổ cục bộ 1024 token.
Về tính khả dụng, các mô hình Gemma 4 được lưu trữ thương mại: Gemma 4 26B A4B là một tuyến đang hoạt động trong danh mục của chúng tôi với giá 0,06 đô la cho mỗi triệu token đầu vào và 0,33 đô la cho mỗi triệu token đầu ra, với cửa sổ ngữ cảnh 262.144 token, và Gemma 4 31B cũng được định tuyến. Điều đó quan trọng vì nó có nghĩa là bạn có thể đánh giá nhánh tổng quát mà không cần sở hữu GPU nào cả. Không có nhà cung cấp nào trong danh mục của chúng tôi phục vụ AstaBrief 8B, kể cả chúng tôi — đây là mô hình tải về và chạy, và cách trung thực để sử dụng nó là trên phần cứng bạn kiểm soát, hoặc bên trong sản phẩm Asta của chính Ai2.
Tự mình chạy so sánh với chi phí thấp
Điều mà bài viết này không thể quyết định thay bạn chính là việc bạn có thể làm xong trong một buổi chiều, bởi vì thí nghiệm này bất đối xứng về chi phí. AstaBrief 8B cần trọng số cục bộ và định dạng prompt đã công bố của nó; bạn có thể dựng nó trên một card duy nhất với vLLM theo cấu hình mà Ai2 tài liệu hóa, temperature 0.7 và top-p 0.95. Nhánh mô hình tổng quát có thể là một lệnh gọi qua dịch vụ lưu trữ — Gemma 4 26B A4B với mức $0.06 cho đầu vào và $0.33 cho đầu ra trên mỗi triệu token là đủ gần về tinh thần để hiệu chuẩn, và bạn có thể hướng harness của riêng mình vào cả hai mà không cần sở hữu GPU thứ hai.
Sau đó hãy đo điều mà các bảng của nhà cung cấp không đo: trên các câu hỏi của bạn, với các đoạn trích của bạn, có bao nhiêu báo cáo được trả về với trích dẫn chính xác và toàn bộ chuỗi mất bao lâu sau khi bạn đã thêm phần gắn kết lược đồ trích dẫn vào phía generalist. 3.5x của Ai2 được đo so với pipeline của chính Ai2, không phải so với Gemma 4 12B, và khoảng cách đó sẽ trông khác trong stack của bạn.
Việc giữ nhánh tổng quát phía sau một endpoint duy nhất chính là điều khiến việc này rẻ để lặp lại thay vì một dự án làm một lần: một API cho hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển nguyên với mức markup 0%, nên khi nhà cung cấp giảm giá, hóa đơn của bạn cũng giảm ngay trong ngày, tự động chuyển đổi dự phòng khi một nhà cung cấp suy giảm, và một DSL định tuyến nếu bạn muốn nhiều mô hình cùng trả lời. Vấn đề không phải là trung thành với mô hình nào; mà là việc chạy lại so sánh vào quý sau chỉ nên là một thay đổi cấu hình, vì cả hai mô hình này đều sẽ bị thay thế.

Cái nào bạn thực sự nên tải xuống
Chọn AstaBrief 8B nếu sản phẩm bàn giao là một báo cáo nghiên cứu có trích dẫn và bạn có một lớp truy xuất cấp dữ liệu cho nó. Thiết kế một lượt là một thành tựu kỹ thuật thực sự, việc giảm 3.5x thời gian sinh chính là lý do nó tồn tại, Apache-2.0 cùng dữ liệu huấn luyện được công bố khiến nó có thể kiểm toán được, và không một mô hình tổng quát nào sẽ khớp được cấu trúc đầu ra của nó nếu bạn không tự xây dựng và duy trì phần giàn giáo.
Hãy chọn Gemma 4 12B nếu công việc của bạn rộng hơn các báo cáo, nếu các nguồn của bạn là đa phương thức, nếu ngữ cảnh 256K cho phép bạn bỏ qua hoàn toàn việc xây dựng một lớp truy xuất, hoặc nếu bạn muốn mô hình có điểm số của bên thứ ba gắn với tên nó và một route được host sẵn mà bạn có thể gọi ngay hôm nay.
Và hãy lưu ý sự bất đối xứng trung thực trong bằng chứng, vì nó đi ngược lại mô hình chuyên biệt: các con số của AstaBrief 8B, kể cả những con số nghe có vẻ tốt nhất của chính nó, đến từ Ai2, mô tả một bộ so sánh năm 2025 mà phòng thí nghiệm nói rằng họ chưa chạy lại, và bao gồm một nghiên cứu trên người gồm mười bốn câu hỏi. Các con số của Gemma 4 12B đến từ những người không làm việc tại Google. Sự khác biệt về nguồn gốc đó đáng giá hơn vài điểm trên một benchmark mà chưa ai chạy trên cả hai.
