
AREX-2 vs Gemma 4 12B: Một trong số này là một mô hình
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 507 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 194 tok/s
- OrcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- xAISpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
A comparison between Gemma 4 12B and AREX-2 has a property no other matchup on this blog has: one of the two columns is empty because the model on that side does not exist yet. Gemma 4 12B is a shipped artifact — Google DeepMind published it on June 3, 2026 as an 11.95-billion-parameter dense open-weights model under Apache 2.0, with a full model card, a 256K-token context window, native audio and image input, and three and a half months of independent testing behind it. AREX-2 is a Hugging Face repository that BAAI created on September 29, 2026 at 17:56 UTC and has not yet put anything into: no weights, no card, no licence tag, no evaluation, no announcement.
Sự bất đối xứng đó không phải là lý do để bỏ qua việc so sánh. Nó chính là việc so sánh. Câu hỏi đáng để trả lời không phải là cái nào trong số này tốt hơn — không gì có thể trả lời điều đó cho đến khi AREX-2 có tệp trong đó — mà là liệu một tác nhân nghiên cứu BAAI thế hệ thứ hai có thậm chí cạnh tranh với một mô hình edge 12B ngay từ đầu hay không, hay liệu hai thứ này có chiếm những vị trí trong một stack không bao giờ chạm nhau hay không. Hiểu sai điều đó là sai lầm đắt giá, bởi vì đó là sai lầm khiến một đội lập ngân sách cho sai thứ.
Phía đã phát hành, theo cách riêng của nó
Gemma 4 12B is the small member of Google's fourth-generation open family, and its defining design choice is architectural: it drops the separate vision encoder entirely and feeds raw image patches and audio waveforms straight into the transformer. That is not a benchmark trick. It is what makes the model genuinely portable — roughly 27 GB of BF16 weights that quantise below 7 GB, and a card that names 16 GB of VRAM as the deployment target. On a laptop or a single mid-range card, this is a model you can actually hold.
The capability profile follows from that. Google's own card — vendor-reported, and worth labelling as such — lists DocVQA 94.9 and InfoVQA 88.4 for document understanding, MMLU-Pro 77.2, GPQA Diamond 78.8, AIME 2026 77.5 and LiveCodeBench v6 72.0 in thinking mode. Artificial Analysis, which is independent, scores the reasoning configuration at an Intelligence Index of 14, measures it at 114 tokens per second, and prices a typical served call at $0.10 per million input tokens and $0.30 per million output. Our own catalogue entry for the larger Gemma 4 31B carries 85.7 on GPQA Diamond. The shape of that is a small generalist that is unusually strong on documents and images, reasonable on reasoning, and nowhere near a frontier model on hard multi-step work.
Its job description is therefore concrete: local or single-tenant inference, document and screenshot understanding, modest agentic loops, and anything where the data cannot leave the building. It is not a deep-research engine and Google does not sell it as one.

Phía còn lại, vốn là một tên và một dấu thời gian
Mọi thông tin có thể xác nhận về AREX-2 trong tuần này đều gói gọn trong một câu. Đó là một kho lưu trữ thuộc tổ chức BAAI trên Hugging Face, được tạo vào ngày 29 tháng 9 năm 2026, chứa một tập tin có tên .gitattributes và không có gì khác — không có byte dữ liệu mô hình lưu trữ nào, không có lượt tải xuống nào, không có thẻ mô hình, không có tuyên bố giấy phép, không có triển khai từ nhà cung cấp nào. Bản thân BAAI chưa công bố gì.
Điều khiến nó đáng được ghi lại là dòng mô hình mà nó được đặt tên theo. Dòng AREX của BAAI đã ra mắt vào ngày 23 tháng 7 năm 2026 với hai mô hình: AREX-Base, một mô hình mixture-of-experts 122 tỷ tham số với 10 tỷ tham số hoạt động dựa trên Qwen3.5-122B-A10B, và AREX-Turbo, một mô hình dense 4B được xây dựng trên Qwen3.5-4B. Cả hai đều là Apache 2.0. Cả hai đều là tác nhân nghiên cứu sâu chứ không phải mô hình trò chuyện — một vòng lặp trong thu thập bằng chứng và tạo ra câu trả lời ứng viên với một con số độ tin cậy, và một vòng lặp ngoài kiểm tra câu trả lời đó dựa trên các ràng buộc ban đầu và có thể tinh chỉnh hoặc khởi động lại toàn bộ quỹ đạo. Theo các số liệu đã công bố của BAAI, AREX-Base đạt 82.5 trên BrowseComp, 85.4 trên GAIA và 89.9 trên DeepSearch QA; AREX-Turbo đạt 70.7, 81.6 và 78.5 trên cùng ba bài kiểm tra đó.
Tất cả những số liệu đó đều là của chính nhà cung cấp và không có số liệu nào được tái lập một cách độc lập. Chúng cũng nói về một mô hình khác. AREX-2 không có số liệu nào, và chữ "2" không cho bạn biết gì về kích thước, xương sống hay kiến trúc — một thế hệ thứ hai trong dòng này có thể là một tác nhân lớn hơn, một mô hình chưng cất nhỏ hơn, hoặc một khung đã được huấn luyện lại với phần xương sống được thay thế.
Hai người này có gặp nhau không vậy?
Đây là chỗ việc so sánh trở nên hữu ích hơn vẻ ngoài của nó. Hãy xét hai cách diễn giải hợp lý về việc AREX-2 trở thành gì.
Nếu nó là một tác nhân nghiên cứu thế hệ thứ hai ở bất kỳ quy mô nào tương đương với Base, thì nó và Gemma 4 12B không bao giờ cạnh tranh với nhau. Một mixture-of-experts 122B dẫn dắt tìm kiếm đa nguồn là một dịch vụ được lưu trữ, tính phí theo token, bị ràng buộc bởi mạng; Gemma 4 12B là một checkpoint mà bạn tự tải về và chạy. Quyết định giữa chúng không phải là so sánh chất lượng, mà là quyết định xem khối lượng công việc của bạn là một vòng lặp nghiên cứu hay một endpoint suy luận.
Nếu AREX-2 hóa ra thuộc phân khúc nhỏ — bản kế nhiệm của 4B Turbo chứ không phải 122B Base — thì hai mô hình quả thực cùng chung một kệ, và so sánh giữa chúng mới thực sự có ý nghĩa. Phiên bản AREX-2 đó sẽ có số tham số chỉ khoảng một phần ba của Gemma 4 12B, được chuyên biệt hóa cho tìm kiếm dựa trên công cụ thay vì bề rộng đa phương thức, và sẽ được đánh giá trên BrowseComp và GAIA thay vì trên DocVQA. Hai mô hình nhỏ, một cái được tối ưu để duy trì một quỹ đạo nghiên cứu dài, cái kia để nhìn và đọc trên phần cứng khiêm tốn. Một nhóm đang xây dựng pipeline tài liệu thì không nên quan tâm đến cái đầu; một nhóm đang xây dựng tác nhân nghiên cứu thì không nên quan tâm đến cái thứ hai.
• Những gì đang tồn tại — Gemma 4 12B có thể tải về ngay hôm nay với đầy đủ card. AREX-2 là một kho lưu trữ không có tệp nào bên trong.
• Tham số — 11.95B dense cho Gemma 4 12B. Không được nêu rõ, và chỉ có thể suy ra từ tên sản phẩm, đối với AREX-2.
• Ngữ cảnh — 256K token (262.144 vị trí) cho Gemma 4 12B. Chưa rõ đối với AREX-2.
• Phương thức — văn bản, hình ảnh và âm thanh đầu vào cho Gemma 4 12B. Chưa rõ đối với AREX-2; thế hệ AREX đầu tiên là văn bản kết hợp sử dụng công cụ.
• Giấy phép — Apache 2.0 cho Gemma 4 12B, được ghi rõ trên thẻ. Không được ghi rõ cho AREX-2; AREX-Base và AREX-Turbo từng là Apache 2.0.
• Dùng để làm gì — suy luận đa phương thức có thể triển khai trên phần cứng của chính bạn, so với, dựa trên bằng chứng từ dòng mô hình, tìm kiếm tầm xa và tổng hợp bằng chứng hướng tới một endpoint được lưu trữ.

Phần thực sự có thể so sánh được: nơi mỗi thứ chạy
Vì không thể so sánh về năng lực, nên so sánh về triển khai mới là phép so sánh trung thực cần thực hiện, và nó không hề sát nút.
Gemma 4 12B chạy ở nơi bạn đặt nó. Không có bảng giá, không có đồng hồ đo theo token và không có nhà cung cấp nào xen giữa bạn và mô hình — chi phí là phần cứng và điện năng, còn kiểu thất bại là do chính việc lập kế hoạch dung lượng của bạn. Khi AREX-Base ra mắt vào tháng 7, ngược lại, nó là một mô hình hỗn hợp chuyên gia 122B: một mô hình bạn phục vụ trên cụm hoặc thuê theo token, và 4B Turbo của chính dòng họ này tồn tại chính xác vì lựa chọn đó có cái giá của nó. Nếu thế hệ thứ hai đi theo cùng khuôn mẫu, bài toán kinh tế của AREX-2 sẽ là một hàm của số token tiêu thụ trên mỗi truy vấn nhân với số bước tìm kiếm mà một quỹ đạo thực hiện — một con số lớn hơn nhiều đối với một tác nhân nghiên cứu chuyên sâu so với một mô hình đọc tài liệu, vì tác nhân đọc lại một ngữ cảnh ngày càng lớn ở mỗi vòng lặp.
Đó là lúc một lớp định tuyến không còn là một khái niệm trừu tượng nữa mà trở thành một khoản mục chi phí. Nếu bạn chạy một tác nhân nghiên cứu trên một mô hình được lưu trữ (hosted) trong khi vẫn giữ một Gemma 4 12B cục bộ để xử lý tài liệu, thì trong trường hợp thông thường đó là hai tích hợp. Nhờ một API duy nhất đứng trước hơn 200 mô hình — với giá niêm yết của nhà cung cấp được chuyển thẳng qua và không cộng thêm phụ phí, nên khi nhà cung cấp thay đổi giá thì giá mới có hiệu lực ngay trong ngày — chúng trở thành một khóa, một hóa đơn và một client, và một quy tắc chuyển đổi dự phòng có thể đưa một yêu cầu ra khỏi nhà cung cấp đang gặp trục trặc trong một giờ nào đó mà vòng lặp tác nhân của bạn không hề hay biết. Hiện nay chúng tôi định tuyến Gemma 4 26B-A4B và Gemma 4 31B; chúng tôi không định tuyến 12B, và không có sản phẩm nào thuộc dòng AREX nằm trong danh mục của chúng tôi, vì vậy nếu một trong hai mô hình đó là thứ bạn cần, nó phải đến từ kênh phân phối của chính nhà cung cấp.
Việc cần làm trong tuần này
Nếu bạn cần một mô hình đa phương thức nhỏ gọn mà bạn có thể tự chạy, thì quyết định chưa từng phải chờ AREX-2. Gemma 4 12B đã được phát hành, có tài liệu, được đánh giá độc lập và có thể triển khai, còn cột so sánh ở phía bên kia thì trống. Đừng mua bất cứ thứ gì chỉ dựa vào sức mạnh của một cái tên được giữ chỗ.
Nếu bạn đang xây dựng một tác nhân nghiên cứu sâu và dòng AREX chính là thứ bạn thực sự muốn, thì điều cần để mắt tới không phải cái tên mà là cây thư mục: liệu safetensors có xuất hiện trong kho đó không, thẻ mô hình nói số lượng tham số là bao nhiêu, và thẻ giấy phép nào được gắn lên nó. Thế hệ đầu tiên phát hành theo Apache 2.0, và nếu thế hệ thứ hai cũng vậy, thì câu hỏi sẽ trở thành câu hỏi về lưu trữ chứ không phải về cấp phép. Cho tới lúc đó, AREX-Base là mô hình AREX mà bạn có thể chạy, và nó đã có sẵn từ tháng Bảy.
Điều duy nhất đáng nói thẳng thắn về phép so sánh mà bài viết này trên danh nghĩa đang bàn tới: một trang VS nơi một bên là commit trong kho lưu trữ còn bên kia là một mô hình đã được phát hành không phải là một cuộc đối đầu, mà là một lịch trình. Lịch trình nói rằng Gemma 4 12B hiện đã có sẵn còn AREX-2 thì hoàn toàn không có.
