
Nex-N2.5 Pro vs GPT-5.6 Sol: Nomor Vendor Pendatang Baru Tertinggal dari Nomor Independen Petahana
- openaiBARUOpenAI: GPT-6 Astra2026-09-0455Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0247Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0247Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0157Kecerdasan82Koding
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2646Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1849Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1541Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1251Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0547Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0347Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2140Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Kecerdasan49Koding
Perhatikan satu-satunya benchmark yang memuat skor keduanya secara berdampingan: urutan operasinya keliru untuk sebuah peluncuran. Kartu model Nex-AGI memberi Nex-N2.5 Pro skor 56,4 pada OSWorld-2, diukur dengan harness NexCUA milik aliansi tersebut — sebuah harness yang belum pernah dilihat publik. Papan peringkat OSWorld 2.0 milik BenchLM, yang diperbarui pada 29 Agustus, menempatkan GPT-5.6 Sol pada skor 62,6 — sebuah angka independen yang jelas-jelas mengalahkan angka versi vendor dari si pendatang baru itu. Di kandang sendiri model yang baru berumur sehari — penggunaan komputer berbasis pembacaan layar, satu-satunya hal yang memang menjadi tujuan perancangannya — generalis matang yang menjadi pembanding model baru itu bahkan tidak perlu tanda bintang untuk unggul. Nex-N2.5 Pro vs GPT-5.6 Sol bukanlah pertarungan yang ketat pada dimensi mana pun yang diukur oleh pihak selain pembuat si pendatang baru. Ini adalah studi kasus tentang betapa berharganya sebuah rekor produksi, dan untuk alasan itu saja, ia layak dibaca.
Kedua model ini nyaris bukan pesaing dalam hal tujuan. Nex-N2.5 Pro, yang diumumkan pada 8 September 2026, adalah model sparse mixture-of-experts dengan 397 miliar parameter dan sekitar 17 miliar parameter aktif, multimodal (masukan teks dan gambar, keluaran teks), yang dilatih lanjut dari garis keturunan Qwen3.5 dan dirancang untuk mengoperasikan komputer serta peramban melalui putaran umpan balik visual. Bobot Apache-2.0-nya masih ditandai "coming soon" di Hugging Face, dan satu-satunya versi yang benar-benar berjalan adalah endpoint host gratis yang ditautkan Nex-AGI dari kartu modelnya. GPT-5.6 Sol adalah model unggulan OpenAI untuk "pekerjaan tersulit" — penalaran multi-langkah yang dalam, rekayasa perangkat lunak skala besar, dan alur kerja agenik berhorizon panjang — tersedia di API sejak 9 Juli, berbobot tertutup, dan kini memikul beban sebagai titik acuan paling mutakhir hingga OpenAI meluncurkan GPT-6 Astra pada 3 September. Jika Nex-N2.5 Pro adalah spesialis yang belum merilis bobotnya sendiri, GPT-5.6 Sol adalah generalis yang sudah teruji dan telah beredar selama dua bulan untuk melayani lalu lintas produksi paling menuntut di industri ini.
GPT-5.6 Sol adalah model dengan file.
Mulailah dari apa yang Sol miliki dan tidak dimiliki Nex-N2.5 Pro: rekam jejak. Sejak 9 Juli, GPT-5.6 Sol telah diuji melalui berbagai harness independen, digempur oleh para peneliti keamanan, dan diserap ke dalam kerangka kerja agen serta alur kerja Codex. Pengukuran independennya mendalam dan terbuka untuk publik: skor 61 pada Artificial Analysis Intelligence Index dengan penalaran maksimal, 88,0 pada Terminal-Bench 2.1, dan 73,0 pada DeepSWE yang diukur dengan harness independen yang sama, serta kecepatan keluaran terukur sekitar 71 token per detik dengan biaya sekitar $0,95 per tugas Intelligence Index. Semua itu tidak membuatnya tak terkalahkan — OpenAI sejak itu menempatkan GPT-6 Astra di atasnya — tetapi setiap angka tersebut adalah hasil pengukuran yang diproduksi oleh pihak selain OpenAI. Nex-N2.5 Pro tidak memiliki catatan independen di mana pun, dan ini karena alasan struktural: tidak seorang pun di luar aliansi tersebut yang dapat menjalankannya.
Satu-satunya tolok ukur di mana keduanya memiliki angka
Perbandingan OSWorld adalah tolok ukur paling jelas yang tersedia, sehingga perlu dinyatakan catatan-catatannya sebelum digunakan. Angka 56.4 milik Nex-N2.5 Pro adalah hasil pengukuran Nex-AGI sendiri pada OSWorld-2 melalui perangkat NexCUA-nya. Angka 62.6 milik GPT-5.6 Sol berasal dari papan peringkat OSWorld 2.0 BenchLM, sebuah cuplikan pihak ketiga bertanggal 29 Agustus 2026, yang mencantumkan lima belas model dan menempatkan Claude Opus 5 pertama dengan 70.6, GPT-5.6 Sol kedua dengan 62.6, dan GPT-5.6 Terra ketiga dengan 50.2. "OSWorld-2" dan "OSWorld 2.0" adalah kerabat dekat, tetapi belum terbukti identik, sehingga selisih empat hingga enam poin yang tepat harus dibaca sebagai indikasi arah, bukan sebagai angka presisi. Yang bertahan dari catatan-catatan tersebut adalah urutannya: berdasarkan angka terbaik yang dapat dihasilkan masing-masing pihak, angka Sol independen mengalahkan angka Nex dari vendor pada tolok ukur yang dipilih Nex untuk dipublikasikan. Pendatang baru yang angkanya sendiri lebih rendah daripada angka independen petahana belum memberikan alasan yang kuat untuk beralih.

Amplop Spesifikasi
Sisa lembar spesifikasinya berlanjut ke arah yang sama:
• Dirilis — Nex-N2.5 Pro: 8 September 2026 (endpoint yang di-host aktif, bobot masih tertunda). GPT-5.6 Sol: 9 Juli 2026, tersedia secara umum.
• Skala — Nex-N2.5 Pro: 397B total / ~17B aktif MoE. GPT-5.6 Sol: jumlah parameter tidak diungkapkan.
• Modalitas — Nex-N2.5 Pro: input teks dan gambar, output teks, loop visi untuk penggunaan komputer. GPT-5.6 Sol: input teks, gambar, dan file, output teks, dengan pemanggilan alat dan mode JSON.
• Konteks / keluaran — Nex-N2.5 Pro: konteks 262.144 token. GPT-5.6 Sol: konteks ~1,05 juta token, batas keluaran 128K.
• Kontrol penalaran — Nex-N2.5 Pro: tanpa / sedang (adaptif, bawaan) / tinggi. GPT-5.6 Sol: upaya penalaran hingga maksimal, ditambah tingkat pemrosesan cepat terpisah.
• Bobot — Nex-N2.5 Pro: Apache-2.0, segera hadir. GPT-5.6 Sol: tertutup.
• Harga per 1 juta token — Nex-N2.5 Pro: tier hosted gratis, tanpa harga tercantum. GPT-5.6 Sol: $4,00 / $20,00 harga promosi sejak 21 Agustus, $0,40 untuk input cache, serta penyesuaian ulang menjadi $8,00 / $30,00 jika input melebihi 272 ribu token.
Konteks ~1,05 juta token Sol dan batas output 128K jauh mengungguli jendela 262K Nex-N2.5 Pro untuk pekerjaan jangka panjang, dan harga Sol—meski tidak murah—adalah angka pasti yang bisa dimodelkan dalam anggaran. Tingkat gratis Nex-N2.5 Pro adalah satu-satunya angka yang menguntungkannya, dan itu bukanlah harga.
Berapa nilai skor yang berumur sehari

Setiap klaim benchmark yang dilampirkan pada Nex-N2.5 Pro — OSWorld-2 sebesar 56,4, Terminal-Bench 2.1 sebesar 82,7, SWE-Bench Pro sebesar 61,2, dan BrowseComp sebesar 89,7 — memiliki satu kesamaan: semuanya dihasilkan oleh Nex-AGI, lewat harness yang menurut aliansi akan dijadikan sumber terbuka, tetapi belum juga dilakukan. Angka-angka tersebut belum pernah direproduksi secara independen, dan memang tidak bisa: bobot modelnya tidak dapat diunduh, dan tidak ada tanggal yang tertera pada banner "segera hadir". Hal ini lebih penting dalam pertarungan ini daripada di kebanyakan kasus lain, karena model tandingan Nex-N2.5 Pro memiliki rekam jejak independen terpanjang di industri. Ketika seluruh basis bukti penantang adalah laporan sendiri, sementara basis bukti petahana tidak demikian, beban pembuktian sepenuhnya ada pada penantang, dan endpoint gratis tidak membebaskannya. Begitu shard-shard tiba dan laboratorium independen menjalankan Nex-N2.5 Pro, angka-angka dalam artikel ini menjadi dapat diverifikasi, dan perbandingan ini menjadi nyata. Sampai saat itu tiba, "skor berumur sehari" adalah ungkapan yang akurat — skor yang tidak dapat diperiksa pada model yang tidak dapat dijalankan.
Harga, rute, dan bentuk keputusan.
Biaya adalah aspek yang paling sulit dibandingkan di antara kedua pihak, karena hanya satu pihak yang memiliki biaya. Tarif GPT-5.6 Sol sebesar $4.00 / $20.00 adalah harga promosi OpenAI yang berlaku sejak 21 Agustus dan disebutkan akan bertahan setidaknya hingga 21 November, turun dari $5.00 / $30.00 — pemotongan yang membuat model unggulan tersebut jauh lebih terjangkau untuk pekerjaan agen AI bervolume tinggi, dan yang langsung diteruskan oleh router penerusan pada hari yang sama OpenAI menerapkannya. Sol tersedia di OrcaRouter dengan harga tersebut, tanpa markup, dan tingkatan batch serta tingkatan cepatnya dapat diakses melalui kunci API yang sama dengan 200+ model lainnya, sehingga tim dapat mengarahkan permintaan yang membutuhkan kedalaman OpenAI ke Sol, dan model yang lebih murah ke segala hal lainnya. Nex-N2.5 Pro tidak memiliki harga resmi, hanya endpoint hosted gratisnya — yang merupakan cara yang baik untuk mengevaluasi sebuah model, tetapi dasar yang buruk untuk anggaran produksi. Anda tidak dapat merencanakan pengeluaran berdasarkan angka yang tidak ada, dan Anda tidak dapat merencanakan arsitektur berdasarkan bobot yang belum dirilis.

Keputusan yang sebenarnya dipaksa oleh pertandingan ini adalah soal risiko, bukan kapabilitas. Jika Anda membutuhkan model yang masih akan ada di kuartal berikutnya, dengan harga yang diketahui, profil kegagalan yang diketahui, dan berbulan-bulan pengujian adversarial di belakangnya, GPT-5.6 Sol adalah pilihan yang rasional — dan peluncuran GPT-6 Astra oleh OpenAI di atasnya semakin memperkuat alasan tersebut, karena Sol kini menjadi pekerja keras yang teruji dengan pemotongan harga yang diarahkan tepat pada volume produksi. Jika Anda membangun agen computer-use di atas open weights dan mampu menunggu sesuatu yang bisa diverifikasi, Nex-N2.5 Pro layak untuk diperhatikan — spesialis multimodal dengan 17B aktif adalah persis bentuk model yang berulang kali memangkas harga di bawah frontier tertutup. Tetapi “memperhatikan” adalah kata kuncinya. Pada setiap dimensi yang diukur oleh siapa pun selain pembuatnya, Nex-N2.5 Pro tertinggal di belakang model yang memiliki file tersebut, dan sampai bobotnya dirilis, di situlah perbandingan berakhir.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
