
AREX-2 vs Qwen 3.8: Một cái là nền tảng mà cái kia có thể được xây dựng trên đó
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 507 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 194 tok/s
- OrcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- xAISpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Màn đối đầu giữa AREX-2 và Qwen3.8-Maxtrông giống như một cuộc đối đầu trực diện giữa các hệ thống chủ lực của hai phòng thí nghiệm Trung Quốc, nhưng thực tế không phải vậy — không phải vì AREX-2 chưa được kiểm chứng, dù đúng là như vậy, mà vì cả hai nằm ở những tầng khác nhau trong cùng một ngăn xếp. Qwen3.8-Max đã hoạt động từ ngày 3 tháng 8 năm 2026, với mức giá 2 đô la cho mỗi triệu token đầu vào và 6 đô la cho mỗi triệu token đầu ra cùng cửa sổ ngữ cảnh 1M token; các phiên bản anh em mở trọng số của nó, Qwen3.8-27B và Qwen3.8-Flash, đã ra mắt vào ngày 13 tháng 8 và ngày 26 tháng 8 với các chỉ số đánh giá và mức giá được công bố. AREX-2 là một kho lưu trữ do BAAI tạo trên Hugging Face vào ngày 29 tháng 9 năm 2026 lúc 17:56 UTC, chỉ chứa một tệp .gitattributes và không có gì khác. Và lý do hai bên không phải là đối thủ nằm ở sự thật nền tảng mà cả hai nhà cung cấp đều không quảng bá rầm rộ: mọi mô hình AREX mà BAAI đã phát hành cho đến nay đều được xây dựng trên nền tảng Qwen.
Đó không phải là phỏng đoán về AREX-2. Điều đó đã được ghi nhận trong tài liệu cho thế hệ hiện có. AREX-Base là một mixture-of-experts 122 tỷ tham số với 10 tỷ tham số hoạt động, được xây dựng trên Qwen3.5-122B-A10B, còn AREX-Turbo là mô hình dense 4B được xây dựng trên Qwen3.5-4B; cả hai đều được phát hành vào ngày 23 tháng 7 năm 2026 theo Apache 2.0. Vậy nên hình hài trung thực của phép so sánh này không phải là agent đối đầu flagship. Mà là: nền tảng Alibaba mang lại cho bạn điều gì hôm nay, lớp agent của BAAI bổ sung thêm gì lên trên, và có thể trả lời được bao nhiêu phần của câu hỏi thứ hai trước khi BAAI tải lên một tệp?
Có những gì đang hoạt động ở phía Qwen, và chi phí là bao nhiêu
Thế hệ Qwen3.8 dễ lý giải một cách bất thường vì nó được đặc tả đầy đủ và định giá công khai, ở ba phân khúc riêng biệt.
• Qwen3.8-Max — ra mắt ngày 3 tháng 8 năm 2026. Cửa sổ ngữ cảnh 1 triệu token, hỗ trợ gốc đầu vào văn bản, hình ảnh và video, chế độ suy nghĩ, gọi hàm và đầu ra có cấu trúc, cùng ba định dạng truyền tải (tương thích OpenAI, tương thích Anthropic và DashScope gốc) trên năm khu vực. 2,00 USD mỗi triệu token đầu vào và 6,00 USD mỗi triệu token đầu ra, với lượt đọc bộ nhớ đệm ở mức 0,25 USD.
• Qwen3.8-27B — phát hành ngày 13 tháng 8 năm 2026. Kiến trúc dense, 27B tham số, ngữ cảnh 256K (262.144 vị trí), nhận đầu vào văn bản, hình ảnh và video, trọng số Apache 2.0. Được công bố trên thẻ chính thức của Qwen với 90,3 trên LiveCodeBench v6, 89,2 trên GPQA Diamond, 84,3 trên OSWorld-Verified và 79,0 trên QwenSWEBench — do nhà cung cấp báo cáo, chưa được tái lập độc lập. Kết quả đo lường độc lập đặt nó ở mức Chỉ số Trí tuệ Artificial Analysis là 33,7 và 68,1 trên chỉ số AA Coding.
• Qwen3.8-Flash — ra mắt ngày 26 tháng 8 năm 2026. Cùng cửa sổ 1M token và cùng đầu vào đa phương thức, với mức giá 0,15 USD mỗi triệu token đầu vào và 0,47 USD cho đầu ra. Đây là bậc giá rẻ nhất của dòng sản phẩm, và là lựa chọn giúp lưu lượng agent khối lượng lớn trở nên tiết kiệm chi phí.
Ngoài ra còn có một mục Qwen3.8 chưa được gắn thẻ: mẫu flagship 2,4 nghìn tỷ tham số mà Alibaba cho biết trọng số đang trên đường ra mắt, và hiện chưa thể gọi được ở bất kỳ đâu. Nếu bạn đang tìm kiếm "Qwen 3.8" và mong đợi một mô hình duy nhất, thì đó là lý do câu trả lời là một gia đình gồm bốn mô hình, chứ không phải một.

Đối lập với tất cả những điều đó, đặc tả của AREX-2 chỉ dài một dòng: một kho lưu trữ, một dấu thời gian, và một cái tên ngụ ý thế hệ thứ hai của một thứ mà BAAI đã từng xây dựng một lần.
Chi tiết tái định hình toàn bộ phép so sánh
AREX không phải là đối thủ cạnh tranh của Qwen; nó là bên sử dụng Qwen. Cả hai mô hình AREX thế hệ đầu tiên đều được hậu huấn luyện trên các backbone Qwen3.5 và sau đó được bọc trong khuôn khổ biến chúng thành tác nhân thay vì mô hình trò chuyện: một vòng lặp bên trong tìm kiếm, duyệt web và tích hợp bằng chứng vào một câu trả lời ứng viên mang một chỉ số tin cậy, và một vòng lặp bên ngoài kiểm tra câu trả lời đó đối chiếu với các ràng buộc ban đầu và hoặc chấp nhận nó, tinh chỉnh nó, hoặc loại bỏ quỹ đạo và bắt đầu lại. Phần kỹ thuật thú vị trong AREX không nằm ở mạng. Mà nằm ở vòng lặp, cơ chế cập nhật ngữ cảnh giúp giữ cho các phát hiện đã xác minh, các ứng viên mở và các ràng buộc chưa giải quyết không bị lẫn lộn xuyên suốt một chặng đường dài, và giao diện công cụ đưa tìm kiếm và duyệt web đến mô hình như những hành động hạng nhất.
Đó là lý do vì sao những con số do chính dòng mô hình này công bố — 82,5 trên BrowseComp, 85,4 trên GAIA, 71,0 trên xbench-2510, 89,9 trên DeepSearch QA và 82,0 trên WideSearch-en đối với 122B Base, cùng với 70,7 / 81,6 / 57,0 / 78,5 / 68,5 đối với 4B Turbo — không thể so sánh với điểm mã hóa và agentic của Qwen3.8-27B, dù cả hai có chung nguồn gốc kiến trúc. Chúng đo những thứ khác nhau. QwenSWEBench hỏi liệu một mô hình có thể giải quyết một vấn đề trong kho mã hay không. BrowseComp hỏi liệu một tác nhân có thể tìm ra một sự thật vốn được cố tình làm cho khó tìm, qua nhiều lần tìm kiếm, mà không đánh mất câu hỏi hay không. Một checkpoint Qwen3.5 nguyên bản đạt điểm kém ở bài thứ hai và tốt ở bài thứ nhất, và đó chính xác là khoảng cách mà quá trình hậu huấn luyện cùng harness của BAAI tồn tại để lấp đầy.

Thế hệ thứ hai rất có thể sẽ là gì
Nếu AREX-2 tiếp tục theo mô thức này, cách lý giải khả dĩ nhất — suy luận, không phải sự thật — là một tác nhân nghiên cứu thế hệ thứ hai được hậu huấn luyện trên một xương sống Qwen mới hơn thế hệ 3.5 mà các mô hình AREX hiện tại đang dùng. Qwen3.8-27B là mô hình dense, đa phương thức và mang giấy phép Apache 2.0, khiến nó trở thành ứng viên tự nhiên cho một tác nhân thuộc phân khúc chất lượng; Qwen3.8-Flash có chi phí thấp trên mỗi token, điều này vô cùng quan trọng khi tác nhân của bạn thực hiện hàng chục lời gọi mỗi truy vấn và đọc lại một ngữ cảnh ngày càng lớn ở mỗi bước.
Không có điều nào trong số đó được xác nhận. Cái tên không mang theo quy mô, không có backbone và không có ngày tháng, và một số "2" trong một dòng sản phẩm là quy ước đặt tên chứ không phải thông số kỹ thuật. Điều được xác nhận thì hẹp hơn nhiều và nên được nêu đúng như vậy: BAAI đã tạo kho lưu trữ vào ngày 29 tháng 9 năm 2026, không đặt gì vào đó và chưa công bố bất cứ điều gì. Không có trọng số, không có model card, không có số lượng tham số, không có thẻ giấy phép, không có benchmark, không có nhà cung cấp nào phục vụ nó. Nếu bạn thấy các con số AREX-2 được trích dẫn ở bất cứ đâu trong tuần này, chúng không phải là kết quả đo lường.
Những gì bạn thực sự có thể mua vào chiều nay
Sự bất đối xứng thực tế giữa hai bên này không nằm ở chất lượng, mà là một bên có bảng giá còn bên kia chỉ có một mục trong danh bạ.
Nếu công việc của bạn mang tính tác tử và bạn muốn nền tảng cơ sở mà dòng AREX được xây dựng dựa trên, thì backbone chính xác có thể gọi được: Qwen3.5-122B-A10B nằm trong danh mục của OrcaRouter với giá $0.115 mỗi triệu token đầu vào và $0.917 mỗi triệu token đầu ra, tối đa 128K token, tăng lên $0.287 / $2.294 khi vượt ngưỡng đó, với các tính năng thị giác, sử dụng công cụ và suy luận đều được bật. Đó là mô hình mà AREX-Base hậu huấn luyện, có sẵn mà không cần chờ đợi bất cứ điều gì.
Nếu bạn muốn thế hệ hiện tại, cả hai gói Qwen3.8 mở đều có trong danh mục: Qwen3.8-27B ở mức $0.33 mỗi triệu token đầu vào và $2.40 đầu ra, chạy trên hạ tầng của chính chúng tôi vì trọng số mở và không có chi phí theo token từ nhà cung cấp để chuyển tiếp, và Qwen3.8-Flash ở mức $0.15 / $0.47 cho gói khối lượng lớn. Một API bao quát cả hai, giá niêm yết của nhà cung cấp được chuyển tiếp mà không cộng thêm gì cho mỗi token, nên khi Alibaba thay đổi giá thì con số ở đây thay đổi cùng ngày.
Và khi AREX-2 thực sự ra mắt, lý do nó thuộc về phía sau cùng lớp đó mang tính cấu trúc chứ không phải để quảng bá. Một vòng lặp tác tử thực hiện hai mươi lần gọi cho mỗi truy vấn sẽ nhân tỷ lệ thất bại của mọi nhà cung cấp lên hai mươi lần; một quy tắc định tuyến có chuyển đổi dự phòng tự động đưa ra quyết định ngay lúc chạy chính là sự khác biệt giữa việc một lần hết thời gian chờ là một lần thử lại và việc một lần hết thời gian chờ là một câu trả lời sai một cách đầy tự tin. Lập luận đó áp dụng cho bất kỳ tác tử nghiên cứu nào, và nó sẽ áp dụng cho AREX-2 bất cứ khi nào có một AREX-2 để định tuyến.
Ai nên hành động, và về vấn đề gì
Nếu hôm nay bạn cần một agent nghiên cứu, AREX-Base là mô hình AREX hiện có, nó đã ra mắt vào tháng 7 theo Apache 2.0, và các benchmark agent của nó là do chính nhà cung cấp thực hiện nhưng ít nhất chúng gắn với một mô hình có thể tải xuống. Nếu hôm nay bạn cần suy luận đa phương thức tiên tiến hoặc lưu lượng agent khối lượng lớn, các bậc Qwen3.8 đang hoạt động, đã được định giá và được chấm điểm độc lập một phần, và không có gì về sự tồn tại của AREX-2 làm thay đổi quyết định đó.
Tình huống duy nhất mà AREX-2 quan trọng đối với một quyết định bạn đang đưa ra trong tuần này là khi bạn đang chọn một backbone để fine-tune. Và ở đó, câu trả lời đã hiển nhiên trong danh mục: các backbone 3.5 mà AREX đã dùng vẫn rẻ và sẵn có, thế hệ 3.8 tốt hơn và cũng sẵn có, còn một AREX thế hệ thứ hai — bất cứ khi nào nó ra mắt — gần như chắc chắn sẽ là bằng chứng về việc BAAI cho rằng Qwen base nào đáng để xây dựng tiếp, chứ không phải là thứ thay thế cho nó.
Ba thứ sẽ giải quyết phần còn lại: các tệp trong cây, một thẻ có số lượng tham số và trường mô hình cơ sở, cùng một nhãn giấy phép. Thứ đầu tiên trong số đó mới là điều quan trọng, bởi vì cho đến khi nó xuất hiện, so sánh này chỉ là giữa một dòng sản phẩm đã có giá và một chỗ giữ chỗ.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
