Hero 'Nex-N2.5 Pro vs Claude Opus 5' — sebuah kartu judul hasil generasi yang menampilkan teks 'Nex-N2.5 Pro vs Claude Opus 5' dengan subjudul 'Pratinjau penggunaan komputer yang gratis dan terbuka vs pemimpin benchmark yang dapat Anda rutekan hari ini' serta overline 'Anthropic vs Nex-AGI — September 2026'.
Guides & Insights

Nex-N2.5 Pro vs Claude Opus 5: Nex-AGI Memilih Tongkat Ukur, dan Tongkat Ukur Itu Menang

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Nex-AGI memilih tolok ukur, dan tolok ukur itulah yang menang. Ketika aliansi model terbuka yang berbasis di Shanghai memperkenalkan Nex-N2.5 Pro pada 8 September 2026, tabel penggunaan-komputer pada kartu model menempatkan Claude Opus 5 di kolom perbandingan dan Nex-N2.5 Pro di slot penantang: 68.3 untuk Claude Opus 5 berbanding 56.4 untuk Nex-N2.5 Pro pada OSWorld-2, keduanya persis seperti yang dicetak Nex-AGI pada kartunya sendiri. Papan peringkat independen sejak itu justru memperlebar, bukan mempersempit, jarak tersebut — cuplikan OSWorld 2.0 BenchLM pada 29 Agustus menempatkan Claude Opus 5 di urutan pertama dari lima belas model yang didaftarnya, dengan skor 70.6. Tertinggal dua belas poin dari pemimpin peringkat pada tolok ukur yang mereka pilih untuk dipublikasikan bukanlah koreografi peluncuran yang lazim; itulah sebabnya bagian yang menarik dari Nex-N2.5 Pro vs Claude Opus 5 bukanlah skornya, melainkan apa yang sebenarnya menjadi kedua sisi skor itu: sebuah model penggunaan-komputer terbuka dengan 397 miliar parameter yang belum bisa dijalankan atau diverifikasi oleh siapa pun di luar aliansi, dan andalan tertutup Anthropic yang memimpin tolok ukur tersebut serta telah menangani lalu lintas produksi sejak akhir Juli.

Ringkasan jujur di awal: ini bukan persaingan antara dua kuantitas yang terukur, karena hanya satu sisinya yang pernah diukur oleh pihak lain selain pembuatnya. Nex-N2.5 Pro adalah model sparse mixture-of-experts dengan sekitar 17 miliar parameter aktif dari total 397 miliar, yang dilatih lanjut dari garis keturunan Qwen3.5, dan diarahkan langsung pada pengoperasian komputer dan browser jangka panjang dengan loop umpan balik visual. Model ini saat ini dilayani melalui endpoint gratis yang dihosting dari tautan Nex-AGI di kartu modelnya, sementara bobot Apache-2.0 yang menjadi dasar keluarga model tersebut masih ditandai "segera hadir" tanpa tanggal. Claude Opus 5 adalah andalan produksi Anthropic untuk pekerjaan penalaran, pengodean, dan agentik yang menuntut tinggi — model tertutup dengan konteks 1 juta token, dial berpikir adaptif, harga yang terdokumentasi, serta berminggu-minggu entri papan peringkat publik dan lalu lintas produksi di belakangnya. Setiap keunggulan dalam perbandingan ini hanya dimiliki oleh salah satu dari dua fakta tersebut: satu model dapat dijalankan dan diverifikasi, sedangkan yang lainnya tidak.

Tolok ukur yang disepakati kedua belah pihak

Benchmark penggunaan komputer memberi imbalan pada perilaku yang sama yang menjadi nilai jual model-model ini: agen yang melihat layar, memutuskan aksi, menjalankannya, lalu membaca layar yang telah berubah untuk memeriksa apakah aksi itu berhasil. Arsitektur Nex-N2.5 Pro dibangun tepat di sekitar siklus tersebut. Visi bukan sekadar modalitas masukan yang ditempelkan padanya, melainkan saluran umpan balik yang dijadikan acuan verifikasi oleh agen. Claude Opus 5 memperlakukan siklus yang sama sebagai satu beban kerja di antara banyak beban kerja lain, tetapi ia kebetulan sangat mahir dalam hal itu; itulah sebabnya Nex-AGI menggunakannya sebagai titik acuan sejak awal.

Dua angka tersebut, secara tegas, tidak berasal dari kerangka evaluasi yang sama. Nex-AGI menghasilkan angka OSWorld-2-nya melalui kerangka evaluasi NexCUA miliknya sendiri, yang menurut mereka akan dibuka sumbernya tetapi belum dirilis, dan 56.4 untuk Nex-N2.5 Pro adalah keluaran vendor yang belum terverifikasi ulang. 70.6 milik Claude Opus 5 di BenchLM adalah cuplikan pihak ketiga dari OSWorld 2.0, bertanggal 29 Agustus 2026, dan konsisten dengan 68.3 yang Nex-AGI sendiri kutip dari sumber papan peringkat. Perbedaan kerangka evaluasi dan versi benchmark yang sedikit berbeda membuat selisih pastinya — dua belas poin pada kartu Nex-AGI sendiri, mendekati empat belas pada BenchLM — harus dibaca sebagai indikasi arah. Namun tidak dapat disangkal bahwa Nex-N2.5 Pro, menurut angka terbaik yang tersedia dari kedua sisi, berada di bawah agen penggunaan komputer frontier yang ada saat ini.

A two-column scoreboard titled 'Nex-N2.5 Pro vs Claude Opus 5 — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Params 397B total / ~17B active; Focus computer use; OSWorld 2.0 56.4 vendor-reported; Weights Apache-2.0 pending; Price free hosted / no list price. Right column Claude Opus 5: Released Jul 24 2026; Params undisclosed; Focus general plus computer use; OSWorld 2.0 70.6 per BenchLM; Weights closed; Price $5.00 / $25.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Opus OSWorld per BenchLM Aug 29.'

Dua jawaban untuk "bisakah saya menjalankannya hari ini"

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

Inilah fork yang benar-benar menentukan hasil persaingan bagi tim yang bekerja, dan ini tidak menguntungkan pendatang baru. Kartu Hugging Face Nex-N2.5 Pro masih menampilkan spanduk bahwa bobot modelnya akan segera hadir di bawah lisensi Apache-2.0, tanpa tanggal rilis terlampir. Satu-satunya build yang aktif hanyalah endpoint gratis yang di-host dan ditautkan oleh Nex-AGI dari kartu tersebut — dapat dipanggil, tetapi dimiliki oleh pihak lain, tanpa harga resmi, tanpa ketentuan layanan yang bisa menjadi acuan perencanaan tim, dan tanpa cara untuk mereproduksi satu pun angka tolok ukur pada perangkat keras Anda sendiri. Ketika bobot modelnya benar-benar dirilis, resep serving yang terdokumentasi adalah satu node dengan delapan H100 pada image SGLang yang dikustomisasi — jejak nyata namun lumrah untuk MoE 397B, dan justru itulah mengapa desain dengan 17B aktif menarik. Sampai itu terjadi, Nex-N2.5 Pro hanyalah pratinjau yang bisa Anda kueri, bukan model yang bisa Anda bangun di atasnya.

Claude Opus 5 justru kebalikan dari semua baris tersebut. Model ini telah dilayani melalui API Anthropic dan platform yang dirutekan sejak 24 Juli, harganya publik dan stabil, bobotnya tertutup dan akan tetap tertutup, dan semua angkanya bisa dicek hari ini dengan menjalankannya. Ekosistem di sekitarnya — Claude Code, perkakas MCP, dan kawanan agen produksi yang telah menghantamnya selama enam minggu — adalah catatan akumulasi yang tidak bisa diklaim oleh model berumur sehari. Bagi tim yang kebutuhannya adalah “model harus berfungsi di kuartal depan,” catatan itulah segalanya.

Lembar spesifikasi, apa adanya.

Letakkan kedua amplop tersebut berdampingan:

Dirilis — Nex-N2.5 Pro: 8 September 2026 (endpoint yang dihosting aktif, bobot menunggu). Claude Opus 5: 24 Juli 2026, tersedia secara umum.

Skala — Nex-N2.5 Pro: total 397B / ~17B MoE aktif. Claude Opus 5: jumlah parameter tidak diungkapkan.

Modalitas — Nex-N2.5 Pro: masukan teks dan gambar, keluaran teks; kemampuan visual menjadi inti dalam siklus penggunaan komputernya. Claude Opus 5: masukan teks dan gambar, keluaran teks, dengan analisis visual yang kuat.

Konteks / output — Nex-N2.5 Pro: konteks 262,144 token, panjang serving yang terdokumentasi. Claude Opus 5: konteks 1M token, batas atas output 128K token.

Kontrol penalaran — Nex-N2.5 Pro: sakelar reasoning_effort dengan opsi none / medium (adaptif, default) / high. Claude Opus 5: pemikiran adaptif secara default dengan dial upaya eksplisit dari rendah hingga maksimal.

Bobot — Nex-N2.5 Pro: Apache-2.0, segera hadir, tanpa tanggal. Claude Opus 5: tertutup.

Harga per 1M token — Nex-N2.5 Pro: tingkat hosting gratis, tidak ada daftar harga yang dipublikasikan. Claude Opus 5: $5,00 input / $25,00 output, $0,50 untuk pembacaan cache, $6,25 untuk penulisan cache.

Kapabilitas keduanya cukup berbeda sehingga lembar spesifikasinya benar-benar berperan: Opus 5 membawa jendela satu juta token dan batas keluaran 128K untuk sesi agen yang panjang, sedangkan Nex-N2.5 Pro dengan konteks 262K dan tingkatan gratisnya cocok untuk otomasi berbasis layar dengan cakupan lebih sempit. Tak satu pun spesifikasi membuat yang lain menjadi mubazir; kedua model tidak sepakat tentang untuk apa agen menghabiskan konteksnya.

Membaca papan skor Nex-AGI sendiri dengan jujur.

Sisa kartu tersebut layak dibaca dengan filter yang sama. Baris-baris penggunaan komputer lainnya dari Nex-N2.5 Pro — OSWorld-G 87.4, OSWorld-Verified 82.2, WebArena-Verified 67.6, WebTest 52.8, Vision2Web 68.2 — dan baris-baris pengkodeannya — Terminal-Bench 2.1 pada 82.7, SWE-Bench Pro pada 61.2, BrowseComp pada 89.7 — semuanya merupakan pengukuran vendor melalui alat ukur milik aliansi itu sendiri, belum direproduksi dalam 48 jam pertama. Satu-satunya kesimpulan yang dapat ditarik oleh pembaca netral dari kartu tersebut adalah bahwa Nex-AGI percaya Nex-N2.5 Pro adalah model penggunaan komputer kelas menengah yang kuat yang tertinggal dari agen terdepan pada baris yang paling penting. Itu adalah posisi yang koheren, bahkan konservatif, untuk model terbuka 397B. Itu juga merupakan klaim yang menunggu laboratorium kedua.

Uang, ketika satu sisi tidak memiliki harga.

Tidak ada perbandingan harga yang jujur untuk dilakukan di sini, karena hanya satu pihak yang memiliki harga. Tier gratis Nex-N2.5 Pro tidak memberi tahu Anda apa pun tentang nilai model tersebut — endpoint pratinjau gratis adalah cara vendor mengumpulkan lalu lintas dan umpan balik, dan Nex-AGI belum menerbitkan tarif per-token berbayar untuk keluarga tersebut. Claude Opus 5 berharga $5.00 per juta input dan $25.00 per juta output pada harga daftar Anthropic, dengan cache reads sebesar $0.50, dan itulah angka yang harus diserap oleh anggaran. Jika Anda membayar tagihan itu hari ini untuk agen penggunaan komputer dan ingin tahu apakah model terbuka 17B-active dapat melakukan pekerjaan yang sama dengan lebih murah, jawabannya adalah: mungkin, tetapi Anda tidak akan tahu sampai bobotnya dirilis dan pihak independen menjalankannya. Perbandingan harga ditangguhkan, bukan diselesaikan, dan memperlakukan endpoint gratis sebagai bukti kemurahan akan menjadi kesalahan kategori.

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5) showing the header stats $5.00 input and $25.00 output per million tokens and the byline 'by Anthropic - 2026-07-24'.

Apa yang dapat Anda lakukan hari ini adalah menyiapkan A/B untuk hari ketika hal itu menjadi mungkin. Claude Opus 5 ada di OrcaRouter dengan harga daftar Anthropic — sama $5.00 / $25.00, diteruskan tanpa markup, sehingga tagihan di sini cocok dengan tagihan Anthropic dan berubah di hari yang sama saat Anthropic mengubahnya. Satu kunci API menempatkannya di endpoint yang sama dengan 200+ model lainnya, dengan failover otomatis jika penyedia bermasalah, dan DSL routing jika Anda menginginkan Opus untuk panggilan yang sulit dan model yang lebih murah untuk panggilan rutin. Nex-N2.5 Pro tidak ada di OrcaRouter — kami memeriksa direktori model kami sebelum menulis, dan belum ada model nex-agi yang terdaftar di sana. Begitu penyedia menyediakannya dengan harga daftar, model itu akan muncul di sini pada hari yang sama, dan perbandingan jujur yang belum dapat dijalankan artikel ini menjadi aturan routing, bukan migrasi.

Siapa yang harus bertindak, dan siapa yang harus menunggu

Jika tim Anda saat ini menjalankan beban kerja produksi computer-use atau agentic-coding dan membutuhkan model dengan harga yang diketahui, profil kegagalan yang diketahui, serta rekam jejak independen, Claude Opus 5 adalah pilihan rasional dalam perbandingan ini, dan tidak ada apa pun dalam 48 jam pertama kehadiran Nex-N2.5 Pro yang mengubah hal itu. Jika tim Anda sedang mengevaluasi model computer-use terbuka untuk pengembangan ke depan, Nex-N2.5 Pro layak masuk daftar pantau — sebuah MoE multimodal 397B dengan kebutuhan self-hosting yang masuk akal dan hasil tolok ukur tingkat menengah yang masuk akal adalah persis jenis model terbuka yang mengubah bentuk kurva biaya, asalkan bobotnya benar-benar dirilis dan angka pada kartu modelnya bertahan dalam pengujian independen. Posisi rasionalnya adalah keduanya sekaligus: pertahankan pemimpin yang sudah terbukti di jalur kritis, dan biarkan hari perilisan bobotnya yang memutuskan apakah pendatang baru layak mendapat uji coba. Itulah satu-satunya perbandingan dalam duel ini yang belum terjadi — dan itulah yang benar-benar akan berarti.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari