
Nex-N2.5 Mini: Trọng số mở có mặt ngay khi ra mắt — Tác nhân sử dụng máy tính nhỏ nhất của Nex-AGI chính là lối vào
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Trí tuệ49Lập trình
Cách để biết liệu các tác nhân sử dụng máy tính mã nguồn mở đã sẵn sàng hay chưa, giờ đây chính là một mô hình bạn có thể tải về ngay trong ngày nó được công bố. Nex-AGI đã giới thiệu dòng Nex-N2.5 vào ngày 8 tháng 9 năm 2026 — ba phiên bản tác nhân: Nex-N2.5 Mini, Nex-N2.5 Pro và Nex-N2.5 Max — và phiên bản mang câu chuyện “tải về là chạy được” chính là bản nhỏ nhất. Nex-N2.5 Mini đã đưa các trọng số Apache-2.0 lên Hugging Face dưới dạng mười sáu phân đoạn BF16, với khoảng 35 tỷ tham số, trong đó có ~3 tỷ tham số được kích hoạt cho mỗi token theo công bố, cùng một bộ triển khai tham chiếu dùng hai H100. Phiên bản anh em đa phương thức lớn hơn, Nex-N2.5 Pro, vẫn được đánh dấu “coming soon” tính đến thời điểm bài viết này, trong khi Nex-N2.5 Max thuần văn bản với 1,6 nghìn tỷ tham số cũng đã được đăng tải nhưng cần tới mười sáu H200 trải trên hai node mới chạy được. Với bất kỳ ai đang kiểm chứng luận điểm đằng sau dòng sản phẩm này — rằng các mô hình tác nhân mã nguồn mở có thể trụ vững trong các phiên sử dụng máy tính kéo dài thay vì chỉ trả lời câu hỏi — thì Mini chính là lối vào.
Nex-AGI là ai? Cái tên còn mới, và sự ra mắt mang hơi hướng của một bản phát hành công khai đầu tiên. Các bài đưa tin về thông báo mô tả nỗ lực này là sự hợp tác giữa một số tổ chức tại Thượng Hải — Shanghai Innovation Institute, Shanghai Qiji Zhifeng, Mosi Intelligence và Kuafu Technology — với dòng mô hình được định vị là mã nguồn mở và đội ngũ vận hành dưới tài khoản @NexEcosystem. Thẻ mô hình ghi nhận Nex-N2.5-mini và Nex-N2.5-Pro là tiếp nối “nền tảng đa phương thức của Nex-N2”, bản phát hành Nex trước đó đã có trọng số mở. Điều thực sự mới ở đây là cách đặt vấn đề: Nex-AGI cho biết họ xây dựng các mô hình này cho những tác vụ có tầm nhìn dài (long-horizon) trong môi trường thực tế — điều khiển máy tính, dẫn dắt trình duyệt, thực thi và kiểm thử mã, cũng như tự điều chỉnh hướng đi dựa trên những gì thấy trên màn hình — và họ đã công bố trọng số để biến tuyên bố đó thành có thể kiểm chứng.
Ba cấp, một thông báo
Gia đình này phân chia theo quy mô và theo phương thức, và những khác biệt quan trọng hơn cái tên chung:
• Nex-N2.5 Mini — khoảng 35B tổng / ~3B hoạt động, mô hình đa phương thức nhận hình ảnh và văn bản, hướng đến việc sử dụng máy tính trực quan, duyệt web và các tác vụ cần phản hồi từ giao diện. Triển khai tham chiếu là một nút hai-H100 duy nhất.
• Nex-N2.5 Pro — được báo cáo có tổng cộng 397B / ~17B tham số hoạt động, cũng đa phương thức, dành cho các khối lượng công việc sử dụng máy tính nặng hơn. Bản triển khai tham chiếu gồm tám GPU H100. Trọng số của mô hình không thể tải xuống tại thời điểm ra mắt.
• Nex-N2.5 Max — tổng 1,6T / ~49B tham số hoạt động, chỉ xử lý văn bản, và theo lời của Nex-AGI thì đây là "nỗ lực hậu huấn luyện hoàn chỉnh đầu tiên ở quy mô nghìn tỷ tham số." Thẻ thông số cho biết mô hình được xây dựng trên nền tảng DeepSeek-V4-Pro-Base. Triển khai tham chiếu là 16×H200 trên hai node.
Cả ba đều là mô hình mixture-of-experts. Mini và Pro thuộc dòng mô hình Qwen3.5 — tài liệu ra mắt của Nex-AGI mô tả cả hai đều được hậu huấn luyện từ các biến thể Qwen3.5, và cấu hình riêng của Mini mang nhãn kiến trúc qwen3_5_moe — trong khi Max là mô hình ngoại lệ dựa trên DeepSeek. Vì vậy, dòng sản phẩm này không phải là một công thức ở ba kích thước; mà là hai công thức, với các tầng đa phương thức "thao tác trên màn hình" dùng chung một nguồn gốc, còn mô hình suy luận văn bản lớn thuộc một nguồn khác.
Nex-N2.5 Mini được giao thực sự là gì
Kho lưu trữ Hugging Face cho nex-agi/Nex-N2.5-mini là một checkpoint thực sự, có thể tải xuống, không phải bản giữ chỗ — 16 mảnh safetensors tổng cộng khoảng 70 GB, BF16, giấy phép Apache-2.0, được tạo lần đầu vào ngày 8 tháng 9. Tệp cấu hình đủ cụ thể để làm cơ sở thiết kế:
• Kiến trúc — Qwen3_5MoeForConditionalGeneration, thuộc dòng qwen3_5_moe, có bộ xử lý thị giác: thẻ mô tả nó là mô hình chuyển đổi hình ảnh-văn bản sang văn bản, và kho lưu trữ đi kèm tệp preprocessor_config.json cùng với cấu hình văn bản.
• Hình dạng — 40 lớp, kích thước ẩn 2048, cơ chế chú ý truy vấn nhóm với 16 đầu truy vấn và 2 đầu KV, từ vựng gồm 248.320.
• MoE — 256 chuyên gia định tuyến, mỗi token kích hoạt 8 chuyên gia cùng với một chuyên gia dùng chung, kích thước trung gian 512 — cấu hình kích hoạt thưa này giúp mô hình "lớp 35B" chỉ kích hoạt ~3B tham số có thể chạy được trên hai H100.
• Ngữ cảnh — max_position_embeddings là 262,144 token trong cấu hình đã phát hành, cùng con số 262K xuất hiện trong các công thức triển khai của dòng mô hình.
• Trọng số và giấy phép — BF16, Apache-2.0, không bị giới hạn truy cập; kho lưu trữ cũng trỏ đến một bản sao ModelScope và một tổ chức GitHub (nex-agi) chứa các công thức triển khai của dòng sản phẩm.
Tài liệu triển khai của Nex-AGI là phần mà hầu hết các bản phát hành mở đều làm sai — còn bản này lại làm đúng một cách hiếm thấy. Mini được phục vụ thông qua một image Docker SGLang tùy chỉnh (nexagi/sglang:v0.5.18-nex-patch) trên một nút đơn với hai H100, sử dụng tensor parallelism 2. Phương pháp lấy mẫu được khuyến nghị là temperature 0.7, top_p 0.95, top_k 40. Việc gọi công cụ chạy qua bộ phân tích qwen3_coder của SGLang, và mô hình cung cấp ba chế độ suy luận thông qua trường reasoning_effort — "none" cho chế độ không suy nghĩ, "medium" (mặc định thích ứng) và "high" cho chế độ luôn suy nghĩ. Với một mô hình tác tử nhỏ, khả năng kiểm soát chế độ suy nghĩ đó chính là sự khác biệt giữa một vòng lặp tác tử dùng được và một vòng lặp chậm chạp — và nó được nhúng sẵn vào công thức phục vụ thay vì để người dùng tự xử lý.

Trọng số: những gì thực sự có thể tải xuống
Trạng thái ra mắt của ba phiên bản cần được nêu chính xác, vì thông báo và các kho lưu trữ không hoàn toàn khớp nhau. Tại thời điểm viết bài này, Mini đã có thể tải xuống đầy đủ theo giấy phép Apache-2.0 — đó là nền tảng của bài viết này. Nex-N2.5 Max cũng đã được đăng tải, với kho lưu trữ Hugging Face chứa 644 phân đoạn safetensors, mặc dù việc tái tạo quy mô nghìn tỷ tham số của nó là một dự án cần 16×H200. Nex-N2.5 Pro là phiên bản bị giữ lại: kho lưu trữ Hugging Face của nó tồn tại nhưng chỉ chứa README và hình ảnh, không có phân đoạn mô hình, và thẻ mô hình vẫn cho biết trọng số sắp được phát hành. Nếu phiên bản bạn quan tâm là phiên bản đa phương thức lớn, thì đó chính là khoảng trống cần theo dõi — tài liệu ra mắt mô tả Pro là mô hình mạnh nhất trong gia đình về khả năng sử dụng máy tính, và đó cũng là mô hình bạn chưa thể chạy cục bộ.

Những con số mà Nex-AGI báo cáo — và lời cảnh báo đi kèm với chúng
Thẻ mô hình của Nex-AGI bao gồm một bảng benchmark đầy đủ cho phiên bản Mini, và mọi con số trong đó đều do chính nhà cung cấp tự báo cáo. Tính đến thời điểm bài viết này được đăng tải, chưa có một lần chạy độc lập nào được công bố, và thẻ mô hình nêu rõ rằng điểm số đến từ các bảng xếp hạng benchmark chính thức và các báo cáo đánh giá mới nhất khi có sẵn, còn các đánh giá khác do Nex-AGI tự thực hiện. Kết quả lập trình được tạo ra bằng bộ công cụ NexAU của nhóm; kết quả sử dụng máy tính và trình duyệt được tạo bằng bộ công cụ NexCUA, mà theo thẻ mô hình sẽ được mã nguồn mở. Hãy coi các hàng tiêu đề là trường hợp có lợi nhất của nhà cung cấp cho đến khi một bên trung lập tái lập được chúng.
Với cách trình bày đó, các kết quả được báo cáo của Mini là: về tác vụ văn bản và mã nguồn, Terminal-Bench 2.1 đạt 73,4; SWE-Bench Pro đạt 43,8; DeepSWE v1.1 đạt 36,1; AutomationBench v1.0.6 đạt 32,3; Toolathlon Verified đạt 54,6; BrowseComp đạt 83,4; và điểm GDPval-AA v2 là 1446. Về phía đa phương thức/sử dụng máy tính, những con số thu hút chú ý là OSWorld-Verified đạt 71,2; WebArena-Verified đạt 63,4; WebTest đạt 48,6 (chạy ở chế độ oracle với danh sách kiểm tra ground-truth); OSWorld-G đạt 82,9 và OmniDoc đạt 89,7, cùng với các kết quả khiêm tốn hơn là OSWorld-2 (30,5) và Vision2Web (52,9).
Hai lưu ý khi đọc. Thứ nhất, OSWorld-Verified và OSWorld-2 là hai bộ kiểm tra khác nhau — một là tập con đã được xác minh, chấm điểm dựa trên trạng thái môi trường thu được, còn cái kia là một phiên bản mới hơn và nhìn chung khắt khe hơn — vì vậy điểm 71.2 ở bộ này và 30.5 ở bộ kia không hề mâu thuẫn; chúng là những bài kiểm tra khác nhau, và bảng riêng của Nex giữ chúng ở các cột riêng biệt. Thứ hai, trong mọi hàng của bảng gia đình mô hình, Mini đều đạt điểm dưới Pro và Max, và đỉnh của mỗi cột thuộc về một mô hình tiên phong hiện có như Claude Opus 5 hay GPT-5.6 Sol. Câu chuyện của Mini không phải là nó đánh bại các mô hình tiên phong; mà là một mô hình mở với khoảng 3B tham số kích hoạt đạt được điểm số cạnh tranh trên các điểm chuẩn sử dụng máy tính với hạ tầng chỉ hai H100. Điều đó có đứng vững hay không chính xác là câu hỏi mà bộ trọng số mở cho phép bạn tự trả lời.
Hôm nay chạy Nex-N2.5 Mini
Công thức hai H100 khiến Mini trở thành cách rẻ nhất để thực sự chạm tay vào tuyên bố cốt lõi của họ model. Vì kiến trúc là Qwen3.5-MoE tiêu chuẩn với bộ phân tích lời gọi công cụ qwen3_coder, nó nạp được trên bản fork SGLang của Nex-AGI mà không cần mã suy luận tùy chỉnh, và các thiết lập khuyến nghị được công bố thay vì phải tự reverse-engineer. Kỳ vọng thực tế cần đặt ra trước khi bắt đầu: một checkpoint mới chỉ một ngày tuổi đi cùng bộ khung thử nghiệm hoàn toàn mới là một thí nghiệm, không phải thứ để dựa vào. Số lượt tải trên repo Mini vẫn ở mức một chữ số, và tại thời điểm viết bài, chưa có bên thứ ba nào công bố đánh giá độc lập — đó là trạng thái bình thường của một model vừa phát hành hôm qua, đồng thời là lý do khiến quy mô chỉ hai H100 trở nên quan trọng: bạn có thể tự mình chạy thí nghiệm ngay trong tuần này thay vì chờ người khác làm.

Nếu bạn muốn so sánh Mini với các tác nhân tiên phong (frontier agents) trong chính bảng benchmark của nó thay vì tự tinh chỉnh cho một lần triển khai duy nhất, thì đó là nơi tầng định tuyến (routing layer) phát huy giá trị. Khi một nhà cung cấp lưu trữ niêm yết Nex-N2.5 Mini — và các đối thủ hiện hữu mà nó được đem so sánh đã có thể truy cập qua các bộ định tuyến — thì một API duy nhất phủ hơn 200 mô hình, với giá niêm yết của nhà cung cấp được giữ nguyên ở mức chênh lệch 0% và tự động chuyển đổi dự phòng, là cách rẻ để chạy cùng một tác vụ trên nhiều mô hình trong số đó mà không cần tích hợp thêm lần thứ hai. Trên OrcaRouter, đó là thiết lập mặc định cho mọi mô hình chúng tôi định tuyến: cùng một khóa, cùng một dạng gọi, đúng giá của nhà cung cấp, không cộng thêm gì. Điều đó có ý nghĩa quan trọng nhất đối với một mô hình chưa được kiểm chứng như thế này, vì chính khả năng chuyển đổi dự phòng cho phép bạn thử nó trên một tuyến thực tế mà không phải đặt cược cả tuyến đó vào nó.
Ai nên kéo những quả tạ này?
Kéo chúng về nếu công việc của bạn là các tác nhân sử dụng máy tính, tự động hóa trình duyệt, hoặc công cụ định hướng thị giác và bạn muốn có một mô hình có giấy phép cho phép, tự lưu trữ để đối chuẩn với các mô hình dẫn đầu đang được lưu trữ. Giấy phép Apache-2.0 loại bỏ rào cản thường gặp đối với một phòng thí nghiệm Trung Quốc khi phát hành, mức yêu cầu hai GPU H100 nằm trong tầm với của một nhóm tác nhân nghiêm túc, và cơ chế kiểm soát mức độ suy luận cùng trình phân tích cú pháp lời gọi công cụ thực sự khiến nó trở thành một môi trường thử nghiệm đáng tin cậy chứ không phải một món đồ chơi. Hãy chờ đợi nếu bạn cần mô hình sử dụng máy tính mạnh nhất trong dòng họ — đó là vai trò của Pro, và bộ trọng số của Pro vẫn là thứ đang chờ được phát hành. Và giữ nguyên nhãn nhà cung cấp trên mọi hàng điểm chuẩn cho đến khi một lần chạy độc lập xác nhận chúng; số điểm 71.2 trên OSWorld-Verified từ một mô hình mã nguồn mở với ~3B tham số hoạt động là một tuyên bố gây chú ý, và đó chính là loại tuyên bố đáng để xác minh trong hệ thống thử nghiệm của riêng bạn trước khi xây dựng dựa trên nó.
Điều cần theo dõi tiếp theo. Việc công bố trọng số của bản Pro là tín hiệu quan trọng nhất — nó biến gia đình mô hình từ "Mini cộng với gã khổng lồ nghìn tỷ tham số" thành dòng sản phẩm đầy đủ như tài liệu ra mắt mô tả. Thứ hai là việc mở mã nguồn bộ khung NexCUA, nếu thiếu nó thì các con số về computer-use không thể được tái tạo một cách độc lập theo cùng một giao thức. Thứ ba là lần chạy trung lập đầu tiên — từ Artificial Analysis, một phòng thí nghiệm đại học, hoặc một học viên công bố bản tái tạo OSWorld-Verified của họ. Khi bất kỳ một trong ba điều đó xuất hiện, câu hỏi mà lần ra mắt này đặt ra — liệu các mô hình tác nhân mã nguồn mở đã thực sự thu hẹp khoảng cách với các bộ công cụ computer-use lưu trữ hay chưa — sẽ không còn là chuyện nằm trong các bảng số liệu của nhà cung cấp.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
