
Nex-N2.5 Pro so với GPT-5.6 Sol: Số hiệu nhà cung cấp của kẻ mới đến xếp sau số độc lập của người đương nhiệm
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0455Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0247Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0247Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0157Trí tuệ82Lập trình
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2646Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1849Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1541Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1251Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0547Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0347Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2140Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Trí tuệ49Lập trình
Đặt cạnh nhau một điểm chuẩn duy nhất mà cả hai đều có số liệu, và thứ tự thực hiện là sai đối với một lần ra mắt. Bảng công bố của Nex-AGI đưa Nex-N2.5 Pro đạt 56.4 trên OSWorld-2, được đo bằng bộ khung NexCUA của liên minh, điều mà công chúng chưa từng thấy. Bảng xếp hạng OSWorld 2.0 của BenchLM, cập nhật ngày 29 tháng 8, đưa GPT-5.6 Sol lên 62.6 — một con số độc lập đánh bại thẳng thừng con số của nhà cung cấp mới. Trên sân nhà của mô hình mới chỉ mới một ngày tuổi — sử dụng máy tính bằng cách đọc màn hình, thứ duy nhất nó được thiết kế chuyên biệt — mô hình tổng quát trưởng thành đang bị đem so sánh thậm chí không cần một dấu hoa thị nào để vượt lên. Nex-N2.5 Pro so với GPT-5.6 Sol không phải là một cuộc đua sát sao trên bất kỳ khía cạnh nào được đo lường bởi người khác ngoài nhà sản xuất của kẻ mới đến. Đây là một nghiên cứu điển hình về giá trị của một kỷ lục trong thực tế vận hành, và chỉ riêng lý do đó cũng đáng để đọc.
Hai mô hình này hầu như không phải là đối thủ thực sự của nhau về mục đích. Nex-N2.5 Pro, được công bố vào ngày 8 tháng 9 năm 2026, là mô hình hỗn hợp chuyên gia thưa (sparse mixture-of-experts) với 397 tỷ tham số, trong đó có khoảng 17 tỷ tham số hoạt động, đa phương thức (nhận văn bản và hình ảnh, xuất văn bản), được hậu huấn luyện từ dòng Qwen3.5, và được xây dựng để vận hành máy tính và trình duyệt thông qua vòng phản hồi thị giác. Trọng số Apache-2.0 của nó vẫn được gắn nhãn "sắp ra mắt" trên Hugging Face, và các bản dựng đang hoạt động duy nhất của nó là các endpoint được lưu trữ miễn phí mà Nex-AGI liên kết từ thẻ mô hình của nó. GPT-5.6 Sol là mô hình chủ lực của OpenAI dành cho "những công việc khó khăn nhất" — suy luận đa bước sâu, kỹ thuật phần mềm quy mô lớn và các quy trình tác nhân dài hạn — đã có mặt trên API từ ngày 9 tháng 7, sở hữu trọng số đóng, và hiện đang mang trọng trách từng là điểm tham chiếu tiên phong cho đến khi OpenAI ra mắt GPT-6 Astra vào ngày 3 tháng 9. Trong khi Nex-N2.5 Pro là một chuyên gia chưa phát hành trọng số của riêng mình, GPT-5.6 Sol là một mô hình đa năng đã được kiểm chứng, đã được triển khai trong hai tháng để phục vụ lượng truy cập sản xuất khắt khe nhất trong ngành.
GPT-5.6 Sol là mô hình có một tệp.
Hãy bắt đầu với thứ mà Sol có mà Nex-N2.5 Pro không có: một bảng thành tích. Kể từ ngày 9 tháng 7, GPT-5.6 Sol đã được đưa qua các bộ kiểm thử độc lập, bị các nhà nghiên cứu bảo mật thử thách dồn dập, và được tích hợp vào các khung agent và quy trình Codex. Các phép đo độc lập của nó sâu rộng và công khai: 61 trên Chỉ số Trí tuệ Artificial Analysis ở mức suy luận tối đa, 88.0 trên Terminal-Bench 2.1 và 73.0 trên DeepSWE, được đo bằng cùng một bộ kiểm thử độc lập, cùng với tốc độ đầu ra đo được khoảng 71 token mỗi giây với chi phí khoảng 0,95 USD cho mỗi tác vụ trên Chỉ số Trí tuệ. Không điều nào trong đó khiến nó bất khả chiến bại — OpenAI từ đó đã xếp GPT-6 Astra lên trên nó — nhưng mỗi con số đó là một phép đo do người khác, không phải OpenAI, tạo ra. Nex-N2.5 Pro không có bất kỳ kết quả độc lập nào ở bất cứ đâu, vì một lý do mang tính cấu trúc: không ai bên ngoài liên minh có thể chạy nó.
Tiêu chuẩn duy nhất mà cả hai đều có một con số
{{1}}Phép so sánh OSWorld là thước đo rõ ràng nhất hiện có, vì vậy cần nêu rõ các hạn chế của nó trước khi sử dụng{{/1}}. Con số 56.4 của Nex-N2.5 Pro là phép đo do chính Nex-AGI thực hiện trên {{2}}OSWorld-2{{/2}} thông qua bộ khung NexCUA của họ. Con số 62.6 của GPT-5.6 Sol đến từ {{3}}bảng xếp hạng OSWorld 2.0{{/3}} của BenchLM, một bản ghi nhận từ bên thứ ba ghi ngày {{4}}29 tháng 8 năm 2026{{/4}}, liệt kê mười lăm mô hình và xếp Claude Opus 5 đứng đầu với 70.6, GPT-5.6 Sol đứng thứ hai với 62.6, còn GPT-5.6 Terra đứng thứ ba với 50.2. "OSWorld-2" và "OSWorld 2.0" là họ hàng gần nhưng chưa được chứng minh là giống hệt nhau, vì vậy khoảng cách chính xác từ bốn đến sáu điểm nên được hiểu là mang tính định hướng hơn là chính xác tuyệt đối. Điều còn giữ nguyên giá trị sau các hạn chế là thứ tự xếp hạng: theo con số tốt nhất mà mỗi bên có thể đưa ra, con số Sol độc lập đánh bại con số Nex của nhà cung cấp trên chính điểm chuẩn mà Nex chọn công bố. Một người mới có con số thấp hơn con số độc lập của bên đương nhiệm thì chưa đưa ra được lý do thuyết phục để chuyển đổi.

Phong bì đặc tả
Phần còn lại của bảng thông số kỹ thuật cũng theo cùng một hướng:
• Phát hành — Nex-N2.5 Pro: 8 tháng 9, 2026 (endpoint đã hoạt động, trọng số đang chờ xử lý). GPT-5.6 Sol: 9 tháng 7, 2026, hiện đã có sẵn rộng rãi.
• Quy mô — Nex-N2.5 Pro: 397B tổng / ~17B hoạt động (MoE). GPT-5.6 Sol: số tham số không được tiết lộ.
• Phương thức — Nex-N2.5 Pro: đầu vào văn bản và hình ảnh, đầu ra văn bản, vòng lặp thị giác để sử dụng máy tính. GPT-5.6 Sol: đầu vào văn bản, hình ảnh và tệp tin, đầu ra văn bản, hỗ trợ gọi công cụ và chế độ JSON.
• Ngữ cảnh / đầu ra — Nex-N2.5 Pro: ngữ cảnh 262.144 token. GPT-5.6 Sol: ngữ cảnh ~1,05M token, trần đầu ra 128K.
• Kiểm soát suy luận — Nex-N2.5 Pro: không / trung bình (thích ứng, mặc định) / cao. GPT-5.6 Sol: mức độ suy luận tối đa, cộng thêm tầng xử lý nhanh riêng biệt.
• Trọng số — Nex-N2.5 Pro: Apache-2.0, sắp ra mắt. GPT-5.6 Sol: đóng.
• Giá cho mỗi 1 triệu token — Nex-N2.5 Pro: gói lưu trữ miễn phí, không có giá niêm yết. GPT-5.6 Sol: $4.00 / $20.00 giá niêm yết khuyến mãi từ ngày 21 tháng 8, $0.40 cho input được lưu cache, chuyển lên mức $8.00 / $30.00 khi vượt quá 272K token đầu vào.
Ngữ cảnh khoảng 1.05M token và trần đầu ra 128K của Sol khiến khung cửa sổ 262K của Nex-N2.5 Pro trở nên nhỏ bé cho các tác vụ dài hơi, và giá của Sol, dù chưa hề rẻ, là một con số ổn định mà ngân sách có thể dự toán. Bậc miễn phí của Nex-N2.5 Pro là con số duy nhất đứng về phía nó, và đó không phải là một mức giá.
Giá trị của một điểm số đã một ngày tuổi

Mọi con số benchmark gắn với Nex-N2.5 Pro — OSWorld-2 ở mức 56,4, Terminal-Bench 2.1 ở mức 82,7, SWE-Bench Pro ở mức 61,2, BrowseComp ở mức 89,7 — đều có chung một đặc điểm: Nex-AGI tạo ra chúng, thông qua một bộ khung mà liên minh tuyên bố sẽ mã nguồn mở nhưng vẫn chưa thực hiện. Không một con số nào trong số đó được kiểm chứng độc lập, vì không thể kiểm chứng được: các trọng số (weights) không thể tải xuống, và không có mốc thời gian nào được gắn với biểu ngữ "sắp ra mắt". Điều đó quan trọng hơn trong cuộc so sánh này so với hầu hết các cuộc so sánh khác, vì mẫu mô hình mà Nex-N2.5 Pro đang được đem ra so sánh có thành tích kiểm chứng độc lập dài nhất trong ngành. Khi toàn bộ cơ sở bằng chứng của kẻ thách thức là tự công bố còn của người đương nhiệm thì không, nghĩa vụ chứng minh hoàn toàn thuộc về kẻ thách thức, và một điểm truy cập miễn phí không thể gánh thay nghĩa vụ đó. Khoảnh khắc các mảnh dữ liệu được phát hành và một phòng thí nghiệm độc lập chạy thử Nex-N2.5 Pro, các con số trong bài viết này sẽ trở nên kiểm chứng được và phép so sánh trở nên thực chất. Cho đến lúc đó, "điểm số mới chỉ một ngày tuổi" là cách diễn đạt chính xác — một con số không thể kiểm tra trên một mô hình không thể vận hành.
Giá cả, lộ trình và hình dạng của quyết định.
Chi phí là khía cạnh khó so sánh nhất giữa hai bên, vì chỉ một bên có chi phí. Mức giá $4.00 / $20.00 của GPT-5.6 Sol là giá niêm yết khuyến mãi của OpenAI, có hiệu lực từ ngày 21 tháng 8 và được thông báo sẽ duy trì ít nhất đến ngày 21 tháng 11, giảm từ mức $5.00 / $30.00 — một đợt cắt giảm khiến mẫu flagship trở nên phải chăng hơn đáng kể cho khối lượng công việc agentic lớn, đồng thời là đợt cắt giảm mà bộ định tuyến chuyển tiếp (pass-through router) phản ánh ngay trong ngày OpenAI thực hiện. Sol hiện diện trên OrcaRouter ở mức giá niêm yết đó, không đội giá, với batch tier và fast tier khả dụng qua cùng một API key với hơn 200 mô hình khác, nhờ đó một nhóm có thể định tuyến những yêu cầu cần đến chiều sâu của OpenAI sang Sol và dùng các mô hình rẻ hơn cho mọi việc còn lại. Nex-N2.5 Pro không có giá niêm yết, chỉ có các endpoint lưu trữ miễn phí — một cách tốt để đánh giá mô hình nhưng lại là cơ sở nghèo nàn để lập ngân sách production. Bạn không thể lên kế hoạch chi tiêu quanh một con số không tồn tại, và bạn không thể lên kế hoạch kiến trúc quanh những trọng số chưa được phát hành.

Quyết định mà cuộc so sánh này thực sự ép người dùng phải đưa ra nằm ở rủi ro, chứ không phải năng lực. Nếu bạn cần một mô hình vẫn còn tồn tại đến quý sau, với mức giá rõ ràng, hồ sơ lỗi rõ ràng và hàng tháng thử nghiệm đối kháng phía sau, GPT-5.6 Sol là lựa chọn hợp lý — và việc OpenAI ra mắt GPT-6 Astra ở phân khúc cao hơn càng củng cố thêm luận điểm này, vì giờ đây Sol là con ngựa thồ đã được kiểm chứng, với mức giảm giá nhắm thẳng vào khối lượng sản xuất. Nếu bạn đang xây dựng các tác nhân sử dụng máy tính trên nền trọng số mở và có thể chờ đợi một thứ gì đó kiểm chứng được, Nex-N2.5 Pro rất đáng để theo dõi — một chuyên gia đa phương thức 17B-active chính là dạng mô hình đã nhiều lần cắt giảm chi phí so với các mô hình tiên phong đóng. Nhưng "theo dõi" mới là từ khóa quan trọng. Ở mọi khía cạnh được đo lường bởi bất kỳ ai ngoài nhà sản xuất của nó, Nex-N2.5 Pro vẫn xếp sau mô hình có hồ sơ thực chứng, và cho đến khi trọng số được công bố, sự so sánh sẽ dừng lại tại đó.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
