Một thẻ tiêu đề được tạo tự động ghi 'AREX-2 vs Qwen3.8-Max - Một nền tảng và những gì chạy trên nó', với hai khung. Khung bên trái, có tiêu đề Qwen3.8-Max, liệt kê: hoạt động từ ngày 3 tháng 8 năm 2026; ngữ cảnh 1M token, đa phương thức; 2 đô la vào / 6 đô la ra trên mỗi 1M; có thể gọi được ngay hôm nay. Khung bên phải, có tiêu đề AREX-2, liệt kê: repo được tạo ngày 29 tháng 9 năm 2026; không có trọng số, không có thẻ mô hình; không có bảng giá ở bất kỳ đâu; không thể gọi được ở bất kỳ đâu. Phần chân trang ghi 'Thế hệ AREX đầu tiên đã được huấn luyện hậu kỳ trên nền tảng Qwen.' Logo OrcaRouter được ghép vào góc dưới cùng bên phải.
Guides & Insights

AREX-2 vs Qwen 3.8: Một cái là nền tảng mà cái kia có thể được xây dựng trên đó

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Màn đối đầu giữa AREX-2 và Qwen3.8-Maxtrông giống như một cuộc đối đầu trực diện giữa các hệ thống chủ lực của hai phòng thí nghiệm Trung Quốc, nhưng thực tế không phải vậy — không phải vì AREX-2 chưa được kiểm chứng, dù đúng là như vậy, mà vì cả hai nằm ở những tầng khác nhau trong cùng một ngăn xếp. Qwen3.8-Max đã hoạt động từ ngày 3 tháng 8 năm 2026, với mức giá 2 đô la cho mỗi triệu token đầu vào và 6 đô la cho mỗi triệu token đầu ra cùng cửa sổ ngữ cảnh 1M token; các phiên bản anh em mở trọng số của nó, Qwen3.8-27B và Qwen3.8-Flash, đã ra mắt vào ngày 13 tháng 8 và ngày 26 tháng 8 với các chỉ số đánh giá và mức giá được công bố. AREX-2 là một kho lưu trữ do BAAI tạo trên Hugging Face vào ngày 29 tháng 9 năm 2026 lúc 17:56 UTC, chỉ chứa một tệp .gitattributes và không có gì khác. Và lý do hai bên không phải là đối thủ nằm ở sự thật nền tảng mà cả hai nhà cung cấp đều không quảng bá rầm rộ: mọi mô hình AREX mà BAAI đã phát hành cho đến nay đều được xây dựng trên nền tảng Qwen.

Đó không phải là phỏng đoán về AREX-2. Điều đó đã được ghi nhận trong tài liệu cho thế hệ hiện có. AREX-Base là một mixture-of-experts 122 tỷ tham số với 10 tỷ tham số hoạt động, được xây dựng trên Qwen3.5-122B-A10B, còn AREX-Turbo là mô hình dense 4B được xây dựng trên Qwen3.5-4B; cả hai đều được phát hành vào ngày 23 tháng 7 năm 2026 theo Apache 2.0. Vậy nên hình hài trung thực của phép so sánh này không phải là agent đối đầu flagship. Mà là: nền tảng Alibaba mang lại cho bạn điều gì hôm nay, lớp agent của BAAI bổ sung thêm gì lên trên, và có thể trả lời được bao nhiêu phần của câu hỏi thứ hai trước khi BAAI tải lên một tệp?

Có những gì đang hoạt động ở phía Qwen, và chi phí là bao nhiêu

Thế hệ Qwen3.8 dễ lý giải một cách bất thường vì nó được đặc tả đầy đủ và định giá công khai, ở ba phân khúc riêng biệt.

• Qwen3.8-Max — ra mắt ngày 3 tháng 8 năm 2026. Cửa sổ ngữ cảnh 1 triệu token, hỗ trợ gốc đầu vào văn bản, hình ảnh và video, chế độ suy nghĩ, gọi hàm và đầu ra có cấu trúc, cùng ba định dạng truyền tải (tương thích OpenAI, tương thích Anthropic và DashScope gốc) trên năm khu vực. 2,00 USD mỗi triệu token đầu vào và 6,00 USD mỗi triệu token đầu ra, với lượt đọc bộ nhớ đệm ở mức 0,25 USD.

• Qwen3.8-27B — phát hành ngày 13 tháng 8 năm 2026. Kiến trúc dense, 27B tham số, ngữ cảnh 256K (262.144 vị trí), nhận đầu vào văn bản, hình ảnh và video, trọng số Apache 2.0. Được công bố trên thẻ chính thức của Qwen với 90,3 trên LiveCodeBench v6, 89,2 trên GPQA Diamond, 84,3 trên OSWorld-Verified và 79,0 trên QwenSWEBench — do nhà cung cấp báo cáo, chưa được tái lập độc lập. Kết quả đo lường độc lập đặt nó ở mức Chỉ số Trí tuệ Artificial Analysis là 33,7 và 68,1 trên chỉ số AA Coding.

• Qwen3.8-Flash — ra mắt ngày 26 tháng 8 năm 2026. Cùng cửa sổ 1M token và cùng đầu vào đa phương thức, với mức giá 0,15 USD mỗi triệu token đầu vào và 0,47 USD cho đầu ra. Đây là bậc giá rẻ nhất của dòng sản phẩm, và là lựa chọn giúp lưu lượng agent khối lượng lớn trở nên tiết kiệm chi phí.

Ngoài ra còn có một mục Qwen3.8 chưa được gắn thẻ: mẫu flagship 2,4 nghìn tỷ tham số mà Alibaba cho biết trọng số đang trên đường ra mắt, và hiện chưa thể gọi được ở bất kỳ đâu. Nếu bạn đang tìm kiếm "Qwen 3.8" và mong đợi một mô hình duy nhất, thì đó là lý do câu trả lời là một gia đình gồm bốn mô hình, chứ không phải một.

A screenshot of the OrcaRouter model page for Qwen3.8-27B, showing the Featured badge, a 256K-token context window, text, image and video input with text output, badges for Vision, Tools, JSON and Reasoning, the provider line 'by Qwen - 2026-08-13', a pricing row of $0.33 input and $2.40 output per million tokens with measured latency and 120.2M tokens of traffic, and the beginning of the model description covering the 27B dense multimodal model's Apache-2.0 licence and 256K context.

Đối lập với tất cả những điều đó, đặc tả của AREX-2 chỉ dài một dòng: một kho lưu trữ, một dấu thời gian, và một cái tên ngụ ý thế hệ thứ hai của một thứ mà BAAI đã từng xây dựng một lần.

Chi tiết tái định hình toàn bộ phép so sánh

AREX không phải là đối thủ cạnh tranh của Qwen; nó là bên sử dụng Qwen. Cả hai mô hình AREX thế hệ đầu tiên đều được hậu huấn luyện trên các backbone Qwen3.5 và sau đó được bọc trong khuôn khổ biến chúng thành tác nhân thay vì mô hình trò chuyện: một vòng lặp bên trong tìm kiếm, duyệt web và tích hợp bằng chứng vào một câu trả lời ứng viên mang một chỉ số tin cậy, và một vòng lặp bên ngoài kiểm tra câu trả lời đó đối chiếu với các ràng buộc ban đầu và hoặc chấp nhận nó, tinh chỉnh nó, hoặc loại bỏ quỹ đạo và bắt đầu lại. Phần kỹ thuật thú vị trong AREX không nằm ở mạng. Mà nằm ở vòng lặp, cơ chế cập nhật ngữ cảnh giúp giữ cho các phát hiện đã xác minh, các ứng viên mở và các ràng buộc chưa giải quyết không bị lẫn lộn xuyên suốt một chặng đường dài, và giao diện công cụ đưa tìm kiếm và duyệt web đến mô hình như những hành động hạng nhất.

Đó là lý do vì sao những con số do chính dòng mô hình này công bố — 82,5 trên BrowseComp, 85,4 trên GAIA, 71,0 trên xbench-2510, 89,9 trên DeepSearch QA và 82,0 trên WideSearch-en đối với 122B Base, cùng với 70,7 / 81,6 / 57,0 / 78,5 / 68,5 đối với 4B Turbo — không thể so sánh với điểm mã hóa và agentic của Qwen3.8-27B, dù cả hai có chung nguồn gốc kiến trúc. Chúng đo những thứ khác nhau. QwenSWEBench hỏi liệu một mô hình có thể giải quyết một vấn đề trong kho mã hay không. BrowseComp hỏi liệu một tác nhân có thể tìm ra một sự thật vốn được cố tình làm cho khó tìm, qua nhiều lần tìm kiếm, mà không đánh mất câu hỏi hay không. Một checkpoint Qwen3.5 nguyên bản đạt điểm kém ở bài thứ hai và tốt ở bài thứ nhất, và đó chính xác là khoảng cách mà quá trình hậu huấn luyện cùng harness của BAAI tồn tại để lấp đầy.

A generated pricing card headed 'The Qwen3.8 family is priced. AREX-2 is not callable.' It lists Qwen3.8-Max at $2.00 in / $6.00 out with a 1M context released 3 Aug 2026, Qwen3.8-27B at $0.33 in / $2.40 out with 256K context and open weights released 13 Aug 2026, Qwen3.8-Flash at $0.15 in / $0.47 out with a 1M context released 26 Aug 2026, Qwen3.5-122B-A10B at $0.115 in / $0.917 out as the backbone AREX-Base post-trains up to 128K, and a highlighted AREX-2 row reading 'no rate card' because there are no weights, card or licence tag. A footer reads 'Qwen3.8-27B scores 33.7 on the AA Intelligence Index; AREX-2 does not exist to score.' The OrcaRouter logo is composited in the bottom-right corner.

Thế hệ thứ hai rất có thể sẽ là gì

Nếu AREX-2 tiếp tục theo mô thức này, cách lý giải khả dĩ nhất — suy luận, không phải sự thật — là một tác nhân nghiên cứu thế hệ thứ hai được hậu huấn luyện trên một xương sống Qwen mới hơn thế hệ 3.5 mà các mô hình AREX hiện tại đang dùng. Qwen3.8-27B là mô hình dense, đa phương thức và mang giấy phép Apache 2.0, khiến nó trở thành ứng viên tự nhiên cho một tác nhân thuộc phân khúc chất lượng; Qwen3.8-Flash có chi phí thấp trên mỗi token, điều này vô cùng quan trọng khi tác nhân của bạn thực hiện hàng chục lời gọi mỗi truy vấn và đọc lại một ngữ cảnh ngày càng lớn ở mỗi bước.

Không có điều nào trong số đó được xác nhận. Cái tên không mang theo quy mô, không có backbone và không có ngày tháng, và một số "2" trong một dòng sản phẩm là quy ước đặt tên chứ không phải thông số kỹ thuật. Điều được xác nhận thì hẹp hơn nhiều và nên được nêu đúng như vậy: BAAI đã tạo kho lưu trữ vào ngày 29 tháng 9 năm 2026, không đặt gì vào đó và chưa công bố bất cứ điều gì. Không có trọng số, không có model card, không có số lượng tham số, không có thẻ giấy phép, không có benchmark, không có nhà cung cấp nào phục vụ nó. Nếu bạn thấy các con số AREX-2 được trích dẫn ở bất cứ đâu trong tuần này, chúng không phải là kết quả đo lường.

Những gì bạn thực sự có thể mua vào chiều nay

Sự bất đối xứng thực tế giữa hai bên này không nằm ở chất lượng, mà là một bên có bảng giá còn bên kia chỉ có một mục trong danh bạ.

Nếu công việc của bạn mang tính tác tử và bạn muốn nền tảng cơ sở mà dòng AREX được xây dựng dựa trên, thì backbone chính xác có thể gọi được: Qwen3.5-122B-A10B nằm trong danh mục của OrcaRouter với giá $0.115 mỗi triệu token đầu vào và $0.917 mỗi triệu token đầu ra, tối đa 128K token, tăng lên $0.287 / $2.294 khi vượt ngưỡng đó, với các tính năng thị giác, sử dụng công cụ và suy luận đều được bật. Đó là mô hình mà AREX-Base hậu huấn luyện, có sẵn mà không cần chờ đợi bất cứ điều gì.

Nếu bạn muốn thế hệ hiện tại, cả hai gói Qwen3.8 mở đều có trong danh mục: Qwen3.8-27B ở mức $0.33 mỗi triệu token đầu vào và $2.40 đầu ra, chạy trên hạ tầng của chính chúng tôi vì trọng số mở và không có chi phí theo token từ nhà cung cấp để chuyển tiếp, và Qwen3.8-Flash ở mức $0.15 / $0.47 cho gói khối lượng lớn. Một API bao quát cả hai, giá niêm yết của nhà cung cấp được chuyển tiếp mà không cộng thêm gì cho mỗi token, nên khi Alibaba thay đổi giá thì con số ở đây thay đổi cùng ngày.

Và khi AREX-2 thực sự ra mắt, lý do nó thuộc về phía sau cùng lớp đó mang tính cấu trúc chứ không phải để quảng bá. Một vòng lặp tác tử thực hiện hai mươi lần gọi cho mỗi truy vấn sẽ nhân tỷ lệ thất bại của mọi nhà cung cấp lên hai mươi lần; một quy tắc định tuyến có chuyển đổi dự phòng tự động đưa ra quyết định ngay lúc chạy chính là sự khác biệt giữa việc một lần hết thời gian chờ là một lần thử lại và việc một lần hết thời gian chờ là một câu trả lời sai một cách đầy tự tin. Lập luận đó áp dụng cho bất kỳ tác tử nghiên cứu nào, và nó sẽ áp dụng cho AREX-2 bất cứ khi nào có một AREX-2 để định tuyến.

Ai nên hành động, và về vấn đề gì

Nếu hôm nay bạn cần một agent nghiên cứu, AREX-Base là mô hình AREX hiện có, nó đã ra mắt vào tháng 7 theo Apache 2.0, và các benchmark agent của nó là do chính nhà cung cấp thực hiện nhưng ít nhất chúng gắn với một mô hình có thể tải xuống. Nếu hôm nay bạn cần suy luận đa phương thức tiên tiến hoặc lưu lượng agent khối lượng lớn, các bậc Qwen3.8 đang hoạt động, đã được định giá và được chấm điểm độc lập một phần, và không có gì về sự tồn tại của AREX-2 làm thay đổi quyết định đó.

Tình huống duy nhất mà AREX-2 quan trọng đối với một quyết định bạn đang đưa ra trong tuần này là khi bạn đang chọn một backbone để fine-tune. Và ở đó, câu trả lời đã hiển nhiên trong danh mục: các backbone 3.5 mà AREX đã dùng vẫn rẻ và sẵn có, thế hệ 3.8 tốt hơn và cũng sẵn có, còn một AREX thế hệ thứ hai — bất cứ khi nào nó ra mắt — gần như chắc chắn sẽ là bằng chứng về việc BAAI cho rằng Qwe​n base nào đáng để xây dựng tiếp, chứ không phải là thứ thay thế cho nó.

Ba thứ sẽ giải quyết phần còn lại: các tệp trong cây, một thẻ có số lượng tham số và trường mô hình cơ sở, cùng một nhãn giấy phép. Thứ đầu tiên trong số đó mới là điều quan trọng, bởi vì cho đến khi nó xuất hiện, so sánh này chỉ là giữa một dòng sản phẩm đã có giá và một chỗ giữ chỗ.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày