Hero 'Nex-N2.5 Pro vs Claude Opus 5' — thẻ tiêu đề được tạo hiển thị dòng chữ 'Nex-N2.5 Pro vs Claude Opus 5' với phụ đề 'Bản xem trước sử dụng máy tính mã nguồn mở miễn phí so với gương mặt dẫn đầu benchmark bạn có thể định tuyến ngay hôm nay' và dòng mở đầu 'Anthropic vs Nex-AGI — Tháng 9, 2026'.
Guides & Insights

Nex-N2.5 Pro vs Claude Opus 5: Nex-AGI đã chọn thước đo, và thước đo đã thắng.

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Nex-AGI chọn cây thước đo, và cây thước đo đã thắng. Khi liên minh mô hình mở có trụ sở tại Thượng Hải giới thiệu Nex-N2.5 Pro vào ngày 8 tháng 9 năm 2026, bảng sử dụng máy tính trên thẻ mô hình đặt Claude Opus 5 ở cột so sánh và Nex-N2.5 Pro ở vị trí ứng viên: 68,3 cho Claude Opus 5 so với 56,4 cho Nex-N2.5 Pro trên OSWorld-2, cả hai con số đều y hệt như Nex-AGI đã in trên thẻ của chính mình. Các bảng xếp hạng độc lập kể từ đó ngày càng nới rộng chứ không thu hẹp khoảng cách — bản chụp OSWorld 2.0 ngày 29 tháng 8 của BenchLM xếp Claude Opus 5 đứng đầu trong số mười lăm mô hình mà họ liệt kê, ở mức 70,6. Chấp nhận thua hai điểm so với người dẫn đầu nhóm trong điểm chuẩn mà bạn chọn công bố không phải là màn ra mắt thông thường, đó là lý do vì sao phần thú vị của cuộc so tài Nex-N2.5 Pro vs Claude Opus 5 không nằm ở con số. Nó nằm ở việc hai bên của con số đó thực chất là gì: một mô hình sử dụng máy tính mã nguồn mở 397 tỷ tham số mà chưa ai bên ngoài liên minh có thể chạy hoặc xác minh, và mô hình dẫn đầu điểm chuẩn của Anthropic, đóng kín, mang gánh nặng sản xuất từ cuối tháng Bảy.

Tóm tắt thẳng thắn ngay từ đầu: đây không phải cuộc so tài giữa hai đại lượng đã được đo lường, bởi chỉ một phía trong đó được đo bởi bất kỳ ai khác ngoài nhà sản xuất của nó. Nex-N2.5 Pro là mô hình mixture-of-experts thưa, có khoảng 17 tỷ tham số hoạt động trong tổng số 397 tỷ, được hậu huấn luyện từ dòng Qwen3.5, nhắm thẳng vào vận hành máy tính và trình duyệt trong thời gian dài với vòng phản hồi thị giác. Mô hình này hiện được phục vụ qua các điểm cuối lưu trữ miễn phí mà Nex-AGI liên kết từ thẻ mô hình, trong khi các trọng số Apache-2.0 mà gia đình này dựa trên vẫn bị gắn nhãn "sắp ra mắt" mà không có ngày cụ thể. Claude Opus 5 là mô hình chủ lực sản xuất của Anthropic cho các công việc suy luận, lập trình và tác tử đòi hỏi cao — một mô hình đóng với ngữ cảnh 1 triệu token, bộ điều chỉnh tư duy thích ứng, mức giá được công bố, và nhiều tuần hiện diện trên bảng xếp hạng công khai cùng lưu lượng sản xuất phía sau nó. Mọi lợi thế trong cuộc so tài này đều thuộc về một trong hai sự thật đó: một mô hình có thể chạy và kiểm chứng được, còn mô hình kia thì không.

Tiêu chuẩn mà {{1}}cả hai bên đồng ý{{/1}}

Các điểm chuẩn sử dụng máy tính khen thưởng cho cùng một hành vi mà các mô hình này được xây dựng để bán: một tác nhân nhìn vào màn hình, quyết định một hành động, thực hiện nó, và đọc lại màn hình đã thay đổi để kiểm tra xem hành động đó có hiệu quả hay không. Nex-N2.5 Pro được kiến trúc xoay quanh chính vòng lặp đó — thị giác không phải là một phương thức đầu vào được gắn thêm vào nó, mà là kênh phản hồi mà tác nhân dùng để xác minh. Claude Opus 5 coi cùng một vòng lặp đó như một trong nhiều khối lượng công việc, nhưng nó tình cờ lại rất giỏi ở việc này, đó là lý do vì sao Nex-AGI ban đầu đã dùng nó làm điểm tham chiếu.

Hai con số này, nói đúng ra, không đến từ cùng một bộ đánh giá. Nex-AGI tạo ra các số liệu OSWorld-2 của mình thông qua bộ đánh giá NexCUA riêng, mà họ tuyên bố sẽ mã nguồn mở nhưng đến nay vẫn chưa phát hành, còn con số 56,4 cho Nex-N2.5 Pro là kết quả từ nhà cung cấp chưa được tái lập. Con số 70,6 của Claude Opus 5 trên BenchLM là bản chụp từ bên thứ ba của OSWorld 2.0, ghi ngày 29 tháng 8 năm 2026, và nó nhất quán với con số 68,3 mà chính Nex-AGI trích dẫn từ các nguồn bảng xếp hạng. Các bộ đánh giá khác nhau và các phiên bản benchmark khác nhau đôi chút đồng nghĩa với việc khoảng cách chính xác — mười hai điểm trên thẻ tự công bố của Nex-AGI, gần mười bốn điểm hơn trên BenchLM — nên được hiểu mang tính định hướng. Nhưng không thể tranh cãi rằng Nex-N2.5 Pro, theo những con số tốt nhất hiện có từ cả hai phía, đang nằm dưới trình tác nhân máy tính tiên phong hiện tại.

A two-column scoreboard titled 'Nex-N2.5 Pro vs Claude Opus 5 — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Params 397B total / ~17B active; Focus computer use; OSWorld 2.0 56.4 vendor-reported; Weights Apache-2.0 pending; Price free hosted / no list price. Right column Claude Opus 5: Released Jul 24 2026; Params undisclosed; Focus general plus computer use; OSWorld 2.0 70.6 per BenchLM; Weights closed; Price $5.00 / $25.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Opus OSWorld per BenchLM Aug 29.'

Hai câu trả lời cho "hôm nay tôi có thể chạy nó không"

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

{{1}}Đây mới chính là nhánh rẽ thực sự quyết định kết quả so tài đối với một đội ngũ làm việc thực thụ, và nó không hề ưu ái người mới đến.{{/1}} Thẻ Hugging Face của Nex-N2.5 Pro vẫn hiển thị dòng thông báo rằng {{2}}trọng số sẽ sớm được phát hành theo giấy phép Apache-2.0, nhưng không kèm ngày phát hành cụ thể.{{/2}} Các bản dựng trực tiếp duy nhất là các endpoint lưu trữ miễn phí mà Nex-AGI liên kết từ thẻ — {{3}}có thể gọi được, nhưng thuộc sở hữu của người khác, không có giá niêm yết, không có điều khoản dịch vụ để đội ngũ có thể dựa vào lập kế hoạch, và không có cách nào để tái tạo dù chỉ một con số benchmark trên phần cứng của chính bạn.{{/3}} Khi trọng số cuối cùng cũng được phát hành, {{4}}công thức phục vụ được mô tả trong tài liệu là một node đơn với tám GPU H100 trên một image SGLang tùy chỉnh — một mức tài nguyên thực tế nhưng hết sức bình thường đối với một MoE 397B, và đó chính xác là lý do khiến thiết kế 17B-active trở nên thú vị.{{/4}} Cho đến khi điều đó xảy ra, Nex-N2.5 Pro chỉ là {{5}}một bản xem trước bạn có thể truy vấn, chứ không phải một mô hình bạn có thể xây dựng dựa trên nó.{{/5}}

Claude Opus 5 hoàn toàn ngược lại ở tất cả các hàng đó. Nó đã được cung cấp qua API của Anthropic và trên các nền tảng định tuyến kể từ ngày 24 tháng 7, giá của nó công khai và ổn định, trọng số của nó đóng và sẽ vẫn đóng, và mọi con số của nó đều có thể được kiểm chứng ngay hôm nay bằng cách chạy thử. Hệ sinh thái xung quanh — Claude Code, các công cụ MCP, và hàng loạt tác nhân sản xuất đã sử dụng nó dồn dập suốt sáu tuần — chính là thành tích tích lũy mà một mô hình chỉ mới ra đời một ngày không thể có được. Với một nhóm có yêu cầu “mô hình phải hoạt động được trong quý tới”, thành tích đó chính là tất cả.

Bảng thông số kỹ thuật — chỉ có vậy.

Đặt hai phong bì cạnh nhau:

Đã phát hành — Nex-N2.5 Pro: ngày 8 tháng 9 năm 2026 (các endpoint lưu trữ đã hoạt động, trọng số đang chờ phát hành). Claude Opus 5: ngày 24 tháng 7 năm 2026, phát hành rộng rãi.

Quy mô — Nex-N2.5 Pro: tổng 397B tham số / ~17B tham số kích hoạt MoE. Claude Opus 5: không tiết lộ số tham số.

Phương thức — Nex-N2.5 Pro: văn bản và hình ảnh đầu vào, văn bản đầu ra; thị giác đóng vai trò trung tâm trong vòng lặp sử dụng máy tính. Claude Opus 5: văn bản và hình ảnh đầu vào, văn bản đầu ra, với khả năng phân tích hình ảnh mạnh mẽ.

Context / output — Nex-N2.5 Pro: 262,144-token context, documented serving length. Claude Opus 5: 1M-token context, 128K-token output ceiling.

Kiểm soát suy luận — Nex-N2.5 Pro: bộ chuyển đổi reasoning_effort với none / medium (thích ứng, mặc định) / high. Claude Opus 5: tư duy thích ứng theo mặc định, với núm chỉnh mức nỗ lực tường minh từ thấp đến tối đa.

Trọng số — Nex-N2.5 Pro: Apache-2.0, sắp ra mắt, chưa có ngày cụ thể. Claude Opus 5: đóng.

Giá trên 1M token — Nex-N2.5 Pro: gói lưu trữ miễn phí, không công bố giá niêm yết. Claude Opus 5: $5.00 đầu vào / $25.00 đầu ra, $0.50 đọc bộ đệm, $6.25 ghi bộ đệm.

Các bao bì đủ khác biệt để bảng thông số kỹ thuật thực sự có giá trị: Opus 5 mang đến cửa sổ một triệu token và trần đầu ra 128K cho các phiên agent dài, trong khi ngữ cảnh 262K và gói miễn phí của Nex-N2.5 Pro phù hợp với tự động hóa theo màn hình ở phạm vi nhỏ hơn. Không thông số nào khiến thông số còn lại trở nên thừa; hai mô hình bất đồng về việc một agent sử dụng ngữ cảnh của nó vào việc gì.

Đọc bảng điểm của chính Nex-AGI một cách trung thực

Phần còn lại của bảng công bố cũng đáng đọc với cùng một bộ lọc. Các hạng mục computer-use khác của Nex-N2.5 Pro — OSWorld-G 87.4, OSWorld-Verified 82.2, WebArena-Verified 67.6, WebTest 52.8, Vision2Web 68.2 — cùng các hạng mục coding — Terminal-Bench 2.1 đạt 82.7, SWE-Bench Pro đạt 61.2, BrowseComp đạt 89.7 — đều là số liệu do nhà cung cấp đo lường thông qua bộ khung đánh giá của chính liên minh, và chưa được tái lập trong 48 giờ đầu. Kết luận duy nhất mà người đọc trung lập có thể rút ra từ bảng số liệu này là Nex-AGI tin rằng Nex-N2.5 Pro là một mô hình computer-use tầm trung mạnh, xếp sau tác nhân tiên phong ở hạng mục quan trọng nhất. Đây là một định vị nhất quán, thậm chí thận trọng, cho một mô hình mở 397B. Nó cũng là một tuyên bố đang chờ một phòng thí nghiệm thứ hai kiểm chứng.

Tiền, khi một bên không có giá

Không có cách so sánh giá nào trung thực ở đây, vì chỉ một phía có giá. Gói lưu trữ miễn phí của Nex-N2.5 Pro không cho bạn biết điều gì về giá trị thực của mô hình — các điểm cuối xem trước miễn phí là cách nhà cung cấp thu thập lưu lượng truy cập và phản hồi, và Nex-AGI chưa công bố mức giá trả theo token nào cho dòng mô hình này. Claude Opus 5 có giá $5.00 mỗi triệu token đầu vào và $25.00 mỗi triệu token đầu ra theo giá niêm yết của Anthropic, với lượt đọc bộ nhớ đệm ở mức $0.50, và đó là con số mà ngân sách phải gánh. Nếu bạn đang trả hóa đơn đó hôm nay cho các tác nhân sử dụng máy tính và muốn biết liệu một mô hình mở với 17B tham số kích hoạt có thể làm cùng công việc với chi phí thấp hơn hay không, câu trả lời là: có thể, nhưng bạn không thể biết được cho đến khi trọng số được phát hành và một bên độc lập nào đó chạy thử nó. Việc so sánh giá bị hoãn lại, chứ chưa ngã ngũ, và coi một điểm cuối miễn phí như bằng chứng về sự rẻ tiền sẽ là một lỗi phân loại.

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5) showing the header stats $5.00 input and $25.00 output per million tokens and the byline 'by Anthropic - 2026-07-24'.

Điều bạn có thể làm hôm nay là thiết lập bài kiểm tra A/B cho ngày nó trở nên khả thi. Claude Opus 5 có trên OrcaRouter với giá niêm yết của Anthropic — cùng mức $5,00 / $25,00, được chuyển qua mà không cộng thêm phí, nên hóa đơn ở đây khớp với hóa đơn của Anthropic và sẽ thay đổi đúng ngày Anthropic thay đổi giá. Một API key đặt nó đằng sau cùng một endpoint với hơn 200 mô hình khác, có tính năng tự động chuyển đổi dự phòng nếu nhà cung cấp gặp trục trặc, và routing DSL nếu bạn muốn Opus xử lý các tác vụ khó còn mô hình rẻ hơn lo các tác vụ thông thường. Nex-N2.5 Pro không có trên OrcaRouter — chúng tôi đã kiểm tra thư mục mô hình trước khi viết bài, và chưa có mô hình nex-agi nào được liệt kê ở đó. Ngay khi một nhà cung cấp phục vụ nó ở mức giá niêm yết, nó sẽ xuất hiện ở đây ngay trong ngày hôm đó, và phép so sánh trung thực mà bài viết này chưa thể chạy lúc này sẽ trở thành một quy tắc định tuyến thay vì một cuộc di chuyển.

Ai nên hành động, và ai nên chờ đợi

Nếu đội của bạn đang vận hành các khối lượng công việc computer-use hoặc agentic-coding trong sản xuất ở thời điểm hiện tại và cần một mô hình có mức giá công khai, hồ sơ lỗi rõ ràng và thành tích được kiểm chứng độc lập, thì Claude Opus 5 là lựa chọn hợp lý trong cuộc so sánh này — và không điều gì trong 48 giờ đầu tiên của Nex-N2.5 Pro thay đổi được điều đó. Nếu đội của bạn đang đánh giá các mô hình computer-use mã nguồn mở cho một hệ thống tương lai, Nex-N2.5 Pro xứng đáng có tên trong danh sách theo dõi — một MoE đa phương thức 397B với diện tích tự lưu trữ hợp lý và câu chuyện benchmark tầm trung đáng tin cậy chính là mẫu mô hình mã nguồn mở có thể tái định hình đường cong chi phí, miễn là các trọng số thực sự được phát hành và các con số trên bảng thông số sống sót qua một bài chạy độc lập. Lập trường hợp lý là cả hai cùng lúc: giữ nhà lãnh đạo đã được chứng minh trên tuyến đường quan trọng, và để ngày trọng số được tung ra quyết định liệu tân binh có xứng đáng được dùng thử hay không. Đó là phép so sánh duy nhất trong trận đấu này vẫn chưa diễn ra — và cũng chính là phép so sánh thực sự quan trọng.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày