
AREX-2 so với LFM2.5 2.6B Base: Một repo trống và một checkpoint không có hướng dẫn
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 507 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 194 tok/s
- OrcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- xAISpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Đặt AREX-2 bên cạnh LFM2.5 2.6B Base và điều đầu tiên chúng có điểm chung là cả hai đều không phải là sản phẩm bạn có thể dùng ngay hôm nay — vì những lý do chẳng liên quan gì đến nhau. AREX-2 là một kho Hugging Face do BAAI tạo vào ngày 29 tháng 9 năm 2026 lúc 17:56 UTC; nó chỉ chứa một tệp .gitattributes, lưu trữ 0 byte dữ liệu mô hình, và không có model card, không có thẻ giấy phép cũng như không có bất kỳ thông báo nào. LFM2.5 2.6B Base, do Liquid AI công bố vào tháng 8 năm 2026, lại là kiểu chưa hoàn thiện ngược lại: một checkpoint chỉ dành cho văn bản, hoàn chỉnh và có thể tải xuống, với 2,69 tỷ tham số theo LFM Open License (lfm1.0), được phát hành cố ý mà không có tinh chỉnh theo chỉ dẫn, bởi vì nó được thiết kế để tinh chỉnh (fine-tune) chứ không phải để bị đặt câu hỏi.
Một cái là sự vắng mặt của một tạo tác. Cái kia là một tạo tác đang thiếu một bước mà lẽ ra nó không bao giờ phải có. Hai thứ đó chỉ cùng một loại nếu bạn đang đọc lướt, và việc coi chúng là cùng một loại chính là cách một nhóm rốt cuộc phải chờ đợi nhầm thứ. So sánh hữu ích giữa hai thứ này không phải là năng lực — không có AREX-2 để đo — mà là việc mỗi thứ là nguyên liệu thô cho cái gì, và cái giá phải trả để biết liệu nó có tốt hay không.
Sự khác biệt về loại, được nêu ra trước tiên
LFM2.5 2.6B Base là một chất nền. Nó là checkpoint tiền huấn luyện của dòng hybrid LFM2.5 thuộc Liquid AI: 30 lớp, trong đó 22 lớp là các khối tích chập ngắn cổng kép và 8 lớp là grouped-query attention, được huấn luyện trên khoảng 34 nghìn tỷ token thuộc 16 ngôn ngữ, với cửa sổ ngữ cảnh 131.072 token và một bản dựng lượng tử hóa nằm ở mức gần 1,67 GB tại Q4_K_M. Nó không có tinh chỉnh theo chỉ dẫn. Đưa nó một câu hỏi và nó sẽ tiếp tục văn bản; nó không trả lời. Thẻ mô hình của chính Liquid AI chỉ ra rằng tinh chỉnh chuyên sâu là mục đích sử dụng dự kiến, và có một mô hình anh em đã được hậu huấn luyện cho bất kỳ ai muốn một mô hình phản hồi lời nhắc. Nó là một chất nền, và việc nó đạt điểm kém trên các benchmark tuân theo lời nhắc không phải là khiếm khuyết — đó chính là định nghĩa của thứ này.
AREX-2 không phải là một chất hay một sản phẩm; nó là một không gian tên. Những dữ kiện duy nhất hiện có là tổ chức (BAAI), dấu thời gian tạo (29 tháng 9 năm 2026) và tên gọi. Chưa có gì được tải lên và chưa có gì được công bố. Bản thân cái tên thuộc về một dòng sản phẩm thực sự tồn tại: vào ngày 23 tháng 7 năm 2026, BAAI đã phát hành AREX-Base, một mô hình mixture-of-experts 122 tỷ tham số với 10 tỷ tham số hoạt động được xây dựng trên Qwen3.5-122B-A10B, và AREX-Turbo, một mô hình dense 4B được xây dựng trên Qwen3.5-4B — cả hai đều theo Apache 2.0, cả hai đều là tác nhân nghiên cứu chuyên sâu với thiết kế hai vòng lặp: thu thập bằng chứng, tạo ra một câu trả lời ứng viên kèm chỉ số độ tin cậy, rồi xác minh câu trả lời đó dựa trên các ràng buộc ban đầu và tinh chỉnh hoặc khởi động lại. Các con số đã công bố của nó, do nhà cung cấp báo cáo và chưa được tái lập độc lập, đạt tới 82,5 trên BrowseComp và 85,4 trên GAIA đối với bản Base, và 70,7 / 81,6 đối với bản Turbo.
• Tính khả dụng — LFM2.5 2.6B Base hiện đã có thể tải xuống. AREX-2 không có tệp nào trong kho lưu trữ của nó.
• Kích thước — 2,69B tham số dense cho mô hình Liquid, tất cả đều hiển thị trong checkpoint. Chưa rõ đối với AREX-2; họ mô hình này bao gồm một MoE 122B và một dense 4B, nên con số "2" không dự đoán được gì cả.
• Ngữ cảnh — 131.072 token cho LFM2.5 2.6B Base. Không có thông tin nào được công bố cho AREX-2.
• Giấy phép — LFM Open License v1.0, miễn phí dưới 10 triệu USD doanh thu hằng năm và yêu cầu giấy phép riêng khi đạt hoặc vượt ngưỡng đó. AREX-2 hiện chưa có nhãn giấy phép; thế hệ AREX đầu tiên dùng Apache 2.0.
• Đây là gì — một nền tảng để tinh chỉnh, so với — nếu lấy cả dòng sản phẩm làm căn cứ để suy đoán — một tác nhân được lưu trữ, nơi giá trị nằm ở vòng lặp tìm kiếm-và-xác minh chứ không phải ở trọng số của nó.

Những thẻ điểm trống mang ý nghĩa trái ngược nhau
Không mô hình nào có một benchmark mà bạn nên dựa vào để lập kế hoạch, và lý do thì hoàn toàn khác biệt.
Liquid AI không hề che giấu điều gì khi để Base không được chấm điểm. Đem một checkpoint đã huấn luyện trước ra chấm điểm trên các benchmark tuân thủ chỉ dẫn sẽ chỉ đo sự thiếu vắng của bước tinh chỉnh, chứ không đo chất lượng của chất nền — đó là lý do công ty đánh giá phiên bản anh em đã qua huấn luyện sau (post-trained) và để Base không được đánh giá. Khoảng trống đó có thể kiểm chứng được từ phía bạn, và đó chính là toàn bộ ý nghĩa: bạn có thể tải về 1.67 GB, tự chạy đánh giá trên tác vụ của chính mình, và biết câu trả lời trước khi phải chi ra bất cứ điều gì cho việc phục vụ.
Khoảng trống của AREX-2 không phải là một quyết định thiết kế, mà là một điều chưa đến. Không có gì để tải xuống, nên cũng không có gì để kiểm thử, và không có đánh giá nào bạn có thể chạy trong tuần này có thể cho bạn biết bất cứ điều gì về nó. Bất cứ ai công bố các con số benchmark của AREX-2 trong vài ngày tới đều đang công bố một thứ mà họ không thể nào đo được.

Hai câu hỏi tinh chỉnh khác nhau
Bởi vì cả hai đều là điểm khởi đầu chứ không phải những dịch vụ hoàn chỉnh, nên cần chính xác về việc mỗi cái sẽ là điểm khởi đầu cho điều gì, vì đó chính là chỗ chúng thực sự không còn giống nhau nữa.
Một checkpoint hybrid 2.69B là công cụ để tạo ra một mô hình nhỏ, rẻ, chuyên biệt. Những ứng dụng thú vị lại là những ứng dụng không hào nhoáng: một bộ phân loại đọc loại tài liệu trong một quy trình được quản lý, một mô hình trích xuất biến một biểu mẫu thành JSON có cấu trúc, một trình viết lại chuyên biệt theo lĩnh vực chạy trên một card duy nhất gần với dữ liệu. Giá trị đến từ việc bạn sở hữu thành phẩm sau đó và chi phí biên của một lần gọi là điện năng. Vòng lặp huấn luyện chính là công việc, và đó là công việc bạn có thể bắt đầu ngay hôm nay.
AREX-2 chỉ theo hướng ngược lại. Dòng AREX không được thiết kế để tinh chỉnh thành một sản phẩm; nó được thiết kế để được gọi như một tác nhân chạy tìm kiếm, tích hợp bằng chứng và tự xác minh câu trả lời của chính nó dựa trên các ràng buộc. Nếu một thế hệ thứ hai tiếp nối điều đó, thứ mà bạn sẽ đánh giá là một quỹ đạo — nó cần bao nhiêu bước, liệu nó có nhận ra một mâu thuẫn hay không, liệu con số độ tin cậy trên câu trả lời ứng viên của nó có ý nghĩa gì hay không. Đó không phải là một câu hỏi về tinh chỉnh và cũng không phải là một câu hỏi về trọng số. Đó là một câu hỏi về phục vụ, và nó bắt đầu bằng việc ai đó công bố trọng số và một thẻ.
Đây không phải là những phương án thay thế ở bất kỳ quy mô nào. Một nhóm cần một mô hình mà họ có thể sở hữu và huấn luyện lại thì không chờ AREX-2. Một nhóm cần một tác nhân nghiên cứu sẽ không tinh chỉnh một mô hình lai 2.6B thành một tác nhân như vậy.
Nơi lớp định tuyến phù hợp, đối với từng cái trong số chúng
Sự khác biệt thực tế giữa hai loại này thể hiện rõ ngay khi một mô hình đi vào một ứng dụng, vì hai loại này có mối quan hệ trái ngược với hosting.
LFM2.5 2.6B Base không có trong danh mục của OrcaRouter và cũng không có biến thể LFM2.5 nào, nên nó đến từ bản phân phối riêng của Liquid AI và các nguồn lưu trữ bên thứ ba quen thuộc — một artifact cục bộ chứ không phải một endpoint được định tuyến. AREX-Base và AREX-Turbo cũng không có trong danh mục của chúng tôi. Vai trò thực sự của một lớp định tuyến trong bức tranh này là mặt còn lại của kiến trúc: vào ngày bạn so sánh bản tinh chỉnh của mình với những mô hình mà nó phải vượt qua, bạn muốn phép so sánh đó chỉ tốn một thay đổi cấu hình thay vì một chu kỳ mua sắm. Một API đứng trước hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển nguyên, không cộng thêm gì trên mỗi token, một khóa cho toàn bộ bảng mô hình, và chuyển đổi dự phòng để một buổi chiều tồi tệ của nhà cung cấp không trở thành buổi chiều tồi tệ trong đánh giá của bạn. Đó là những điều kiện mà theo đó một bài kiểm tra A/B trên một mô hình chưa được kiểm chứng là đủ rẻ để thực sự chạy.
Đó cũng là cách diễn giải trung thực cho chính AREX-2. Khi nó ra mắt — giả sử nó phát hành trọng số mở, như hai phiên bản tiền nhiệm đã làm — cách hợp lý để thử một agent hoàn toàn mới trên một khối lượng công việc thực tế là chạy nó trên một luồng phụ, phía sau failover, chứ không phải là nhà cung cấp duy nhất mà vòng lặp production của bạn phụ thuộc vào.
Người biết điều làm gì với từng thứ trong tuần này
Nếu bạn có một tác vụ nhỏ, hẹp và dữ liệu không thể rời khỏi hạ tầng của bạn, thì checkpoint Liquid có sẵn, nhỏ, được cấp phép theo giấy phép thoáng dưới ngưỡng doanh thu, và có thể kiểm thử ngay chiều nay. Hãy tải nó xuống, chạy nó trên tập đánh giá của riêng bạn, và để kết quả quyết định. Không có gì ở AREX-2 làm thay đổi kế hoạch đó.
Nếu hôm nay bạn cần hành vi nghiên cứu tầm xa, mô hình để bạn tìm đến là mô hình đã tồn tại sẵn: AREX-Base, được phát hành vào tháng 7, với các benchmark agent được công bố mà ít nhất bạn có thể đối chiếu với một bài báo. AREX-2 là một cái tên gắn với một mốc thời gian, và hai điều có thể thay đổi vị thế của nó đều thấy được từ bên ngoài — liệu các tệp có xuất hiện trong cây hay không, và liệu một thẻ có số lượng tham số cùng giấy phép có xuất hiện cùng chúng hay không.
Kiểu thất bại mà bài viết này tồn tại để ngăn chặn là kiểu một cái tên dành riêng bị coi như một mục trong lộ trình. Nó không phải vậy. Nó là một repository mà BAAI đã tạo ngày hôm qua, và lượng lập kế hoạch đúng đắn cần làm xung quanh nó ngay lúc này là không có gì.
