
Nex-N2.5 Pro so với GLM-5.2: Cùng đạt 82.7 trên Terminal-Bench, Hai Nguồn Gốc Rất Khác Nhau
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0455Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0247Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0247Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0157Trí tuệ82Lập trình
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2646Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1849Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1541Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1251Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0547Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0347Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2140Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Trí tuệ49Lập trình
Hai mô hình tác tử trọng số mở, một sự trùng hợp đáng ngờ: Nex-N2.5 Pro và GLM-5.2 đều đạt 82.7 trên Terminal-Bench 2.1. Nex-AGI in con số 82.7 cho Nex-N2.5 Pro trên chính model card của mình, đo bằng bộ đánh giá NexCUA của liên minh — thứ mà công chúng chưa từng được thấy. Con số tốt nhất mà Z.ai báo cáo cho GLM-5.2 trên cùng bộ đánh giá cũng là 82.7 — nhưng khi một bộ đánh giá độc lập chạy lại mô hình, kết quả dừng ở 77.9, thấp hơn khoảng năm điểm so với con số của chính nhà cung cấp. Một cú hòa hoàn hảo giữa con số không ai kiểm chứng được và con số đã co lại ngay khi được kiểm chứng thì chẳng phải là hòa chút nào. Đây là minh chứng rõ ràng nhất cho việc vì sao sự khác biệt giữa "trọng số mở" và "trọng số sẽ tồn tại vào một ngày nào đó" định đoạt cuộc so tài này ngay trước khi một hàng điểm chuẩn nào được đọc đến.
Cả hai mô hình cùng thuộc một khu vực thương mại, nhưng không thể khác biệt hơn về bản chất. Nex-N2.5 Pro, được công bố vào ngày 8 tháng 9 năm 2026, là mô hình đa phương thức dùng để điều khiển máy tính — tổng cộng 397 tỷ tham số với khoảng 17 tỷ tham số hoạt động, thuộc dòng Qwen3.5, được thiết kế để đọc màn hình và vận hành một phiên duyệt web hoặc phiên máy tính để bàn thông qua vòng phản hồi thị giác. GLM-5.2 là mô hình chủ lực được cấp phép MIT của Z.ai (Zhipu AI) dành cho suy luận và lập trình tầm xa — tổng cộng khoảng 743 tỷ tham số với khoảng 40 tỷ tham số hoạt động, chỉ xử lý văn bản, GA từ ngày 16 tháng 6 năm 2026, và là mô hình đã làm trụ cột cho các điểm số đánh giá độc lập của phân khúc open-weights trong nhiều tháng. Một mô hình nhìn thế giới qua điểm ảnh và hành động trên thế giới đó. Mô hình còn lại tư duy bằng văn bản và cho ra đời mã nguồn. Giấy phép của cả hai đều cho phép bạn xây dựng doanh nghiệp dựa trên chúng; khác biệt nằm ở chỗ, với một trong hai, giấy phép đó hiện tại mới chỉ là một lời hứa.
Cùng một con số, hai nguồn gốc khác nhau
Hãy bắt đầu từ điểm hòa, vì nó cho thấy toàn bộ cục diện đối đầu. Thẻ thông số của Nex-AGI ghi Terminal-Bench 2.1 ở mức 82,7 cho Nex-N2.5 Pro, cùng với OSWorld-2 ở mức 56,4, SWE-Bench Pro ở mức 61,2 và BrowseComp ở mức 89,7 — tất cả đều được tạo ra thông qua bộ khung NexCUA và không một con số nào được kiểm chứng độc lập trong những ngày đầu ra mắt của mô hình, vì lý do đơn giản là trọng số không thể tải xuống. Con số 82,7 của Z.ai cho GLM-5.2 trên Terminal-Bench 2.1 là con số tốt nhất do chính nhà cung cấp báo cáo, nhưng nó nằm trên một mô hình mà bất kỳ ai cũng có thể kéo từ Hugging Face và chạy lại ngay chiều nay; phép đo độc lập qua bộ khung đã tồn tại ở mức 77,9, và nó thấp hơn tuyên bố của Z.ai khoảng năm điểm. Khi con số của một nhà cung cấp bị thu nhỏ dưới kiểm chứng độc lập, đó không phải là tai tiếng — đó là cái giá bình thường của việc tự đo lường. Khi con số của một nhà cung cấp đối thủ thậm chí không thể được kiểm chứng, việc thiếu vắng cái giá ấy mới là vấn đề, chứ không phải dấu hiệu cho thấy con số đó là hoàn hảo.

Hãy đọc các hàng xung quanh theo cùng một cách. GLM-5.2 giữ chỉ số độc lập cao nhất mà tầng mở đã tạo ra — khoảng đầu 50 trên Intelligence Index hiện tại của Artificial Analysis — đó là lý do vì sao nó là mô hình mở tham chiếu trong nhiều tháng dù không phải là bản phát hành mới hào nhoáng nhất. Nex-N2.5 Pro không có mục chỉ số độc lập nào cả. Trên các hàng mà cả hai nhà cung cấp đều công bố số liệu, con số có thể kiểm chứng là của nhà cung cấp hiện tại; trên các hàng chỉ có Nex-AGI công bố, các con số chưa được tái tạo. Đó không phải là phán quyết về việc mô hình nào thông minh hơn. Đó là phán quyết về việc mô hình nào bạn được phép kiểm chứng.
Các bảng thông số kỹ thuật đồng nhất với nhau hơn bạn nghĩ.
Bỏ các bài đánh giá hiệu năng sang một bên, hai mô hình này khá tương đồng về những điểm cốt lõi:
• Phát hành — Nex-N2.5 Pro: ngày 8 tháng 9 năm 2026 (các endpoint lưu trữ đã hoạt động, trọng số đang chờ công bố). GLM-5.2: GA ngày 16 tháng 6 năm 2026, trọng số đã có sẵn.
• Giấy phép — Nex-N2.5 Pro: Apache-2.0, trọng số sẽ sớm được phát hành. GLM-5.2: MIT, đã có thể tải xuống.
• Quy mô — Nex-N2.5 Pro: 397B tổng / ~17B kích hoạt. GLM-5.2: ~743B tổng / ~40B kích hoạt.
• Phương thức — Nex-N2.5 Pro: nhận văn bản và hình ảnh, xuất văn bản, vòng lặp thị giác sử dụng máy tính. GLM-5.2: mô hình suy luận thuần văn bản.
• Ngữ cảnh / đầu ra — Nex-N2.5 Pro: ngữ cảnh 262.144 token. GLM-5.2: ngữ cảnh 1M token, giới hạn đầu ra 128K.
• Kiểm soát suy luận — Nex-N2.5 Pro: none / medium (thích ứng, mặc định) / high. GLM-5.2: kiểm soát mức độ suy luận trên cùng chuỗi model.
• Giá cho mỗi 1M token — Nex-N2.5 Pro: gói lưu trữ miễn phí, không có giá niêm yết. GLM-5.2: $1.40 đầu vào / $4.40 đầu ra, $0.26 đầu vào cache.
Các phong bì khác nhau theo cách mà công việc của hai mô hình khác nhau: GLM-5.2 mang lại bối cảnh văn bản trọn vẹn một triệu token và giới hạn đầu ra 128K cho các phiên kỹ thuật dài, trong khi Nex-N2.5 Pro đánh đổi kích thước bối cảnh để lấy kênh thị giác và cửa sổ 262K nhỏ hơn, nhắm đến khối lượng công việc theo kích thước màn hình. Không có thông số nào là sai; chúng được định cấu hình cho các tác vụ khác nhau.
Trọng số mở, hai ý nghĩa khác nhau

Đây chính là lúc cuộc so sánh không còn xoay quanh các con số nữa. GLM-5.2 mở theo đúng cách người ta phát hành một sản phẩm để xây dựng doanh nghiệp trên đó: giấy phép MIT, bộ trọng số công khai trên Hugging Face, không hạn chế sử dụng thương mại, không điều khoản chia sẻ dữ liệu, không nhà cung cấp nào đứng sau dòm ngó bạn. Bạn có thể tải xuống, tinh chỉnh, phục vụ nó trong ranh giới tuân thủ của riêng mình, hoặc mang nó tới bất kỳ hạ tầng lưu trữ nào bạn muốn — và bởi vì bộ trọng số đã được mở, giá của nó có một mức sàn mà không một nhà cung cấp đơn lẻ nào có thể nâng lên. Nex-N2.5 Pro được hứa hẹn sẽ phát hành theo Apache-2.0, một giấy phép tự do tương đương, nhưng biểu ngữ trên thẻ Hugging Face của nó ghi rằng bộ trọng số sắp có mặt mà không đính kèm ngày cụ thể. Với một đội ngũ phải tuân thủ các quy định quản trị dữ liệu, hoặc một đội ngũ muốn loại bỏ hoàn toàn kiểu định giá theo token khi vận hành quy mô lớn, khác biệt đó là toàn bộ điều quyết định: GLM-5.2 là mô hình bạn có thể sở hữu ngay hôm nay, còn Nex-N2.5 Pro là mô hình bạn chỉ mới được hứa hẹn. Bài toán chi phí tự lưu trữ cũng nghiêng về kẻ mới đến khi bộ trọng số cuối cùng cũng được phát hành — 17B tham số hoạt động trên một nút 8 GPU H100 là một cấu hình dễ tiếp cận hơn nhiều so với cỗ máy khoảng 40B tham số hoạt động của GLM-5.2 — nhưng cụm từ "khi bộ trọng số được phát hành" đang phải gánh rất nhiều sức nặng trong câu đó.
Các gia đình đang di chuyển theo hai hướng ngược nhau
Cả hai mô hình đều nằm trong các dòng họ đang phát triển nhanh chóng, và quỹ đạo của chúng kéo theo những hướng khác nhau. Dòng dõi của GLM-5.2 minh bạch và lặp lại: Z.ai phát hành GLM-5.3 vào tháng 8 như một bản tinh chỉnh hậu huấn luyện trên cùng nền tảng 5.2 và GLM-5.3 Flash vào đầu tháng 9, vì vậy các trọng số 5.2 mà bạn xây dựng hôm nay là nền tảng mà dòng họ này tiếp tục cải thiện — kiến thức kiến trúc và các bộ tinh chỉnh của bạn được kế thừa. Dòng họ Nex-AGI là một canh bạc vào thế hệ hoàn toàn mới: Nex-N2.5 Mini ở 35B, Nex-N2.5 Pro ở 397B, và Nex-N2.5 Max chỉ hỗ trợ văn bản ở 1.6T với nền tảng gốc là DeepSeek-V4-Pro-Base, trong khi các trọng số Pro — thứ có thể giúp bất kỳ ai xác thực các tuyên bố của dòng họ — vẫn chưa được công bố. Một đội ngũ đang chọn nền tảng để xây dựng đang chọn giữa một dòng dõi có lộ trình cập nhật đã được công bố và một bản phát hành đầu tiên mà màn thứ hai của nó chưa xuất hiện.
Cái nào xứng đáng có mặt trong build của bạn?
Nếu yêu cầu của bạn là “mô hình phải là của chúng tôi” — vì quản trị dữ liệu, vì kiểm toán, vì một sản phẩm mà bạn không muốn một nhà cung cấp duy nhất kiểm soát — thì GLM-5.2 không phải là lựa chọn tốt hơn trong cuộc so sánh này; nó là lựa chọn duy nhất, bởi nó là mô hình duy nhất trong danh sách mà bạn có thể tải về. Nó cũng là mô hình duy nhất có điểm đánh giá độc lập, và được định giá theo bảng niêm yết của Z.ai với mức 1,40 USD mỗi triệu token đầu vào và 4,40 USD mỗi triệu token đầu ra. Nếu yêu cầu của bạn là một tác tử đa phương thức sử dụng máy tính mà về lâu dài có thể làm suy yếu các nhà dẫn đầu đóng, thì Nex-N2.5 Pro là luận điểm dài hạn thú vị hơn — một vision operator có 17 tỷ tham số được kích hoạt, đến từ một liên minh biết rõ mình muốn xây dựng điều gì — nhưng một luận điểm không phải là một sự phụ thuộc, và một endpoint được lưu trữ miễn phí không phải là một nền tảng.

Cách thực tế để hành động trên tất cả những điều này là phát triển dựa trên những gì đã tồn tại và đo lường lời hứa khi nó được hiện thực. GLM-5.2 có mặt trên OrcaRouter ở mức giá niêm yết của Z.ai — cùng mức $1,40 / $4,40, chuyển qua nguyên giá không phụ phí — và vì là mô hình open-weights, nó cũng có thể tự lưu trữ nếu bạn muốn phép đo bao gồm cả ngăn xếp phục vụ của riêng mình. Đây là điểm tham chiếu để chạy khối lượng công việc tác tử thực tế của bạn ngay hôm nay, với DSL định tuyến đóng vai trò dự phòng cho ngày Nex-N2.5 Pro xuất hiện trên một nhà cung cấp với giá niêm yết: khi điều đó xảy ra, việc chuyển đổi so sánh chỉ là một quy tắc định tuyến, chứ không phải một cuộc di chuyển. Cho đến khi các mảnh dữ liệu được công bố và một khung kiểm thử độc lập xác nhận — hoặc đính chính — con số 82,7 đó, Nex-N2.5 Pro so với GLM-5.2 là trận đấu giữa một mô hình bạn có thể xác minh và một con số bạn không thể.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
