Kartu judul hero untuk 'Nex-N2.5 Mini' dengan subjudul 'Bobot terbuka hadir saat peluncuran — agen kecil untuk penggunaan komputer'; chip bertuliskan 'APACHE-2.0', '35B TOTAL / ~3B AKTIF', dan '262K KONTEKS'; serta pita 'INPUT GAMBAR + TEKS — REFERENSI 2x H100'; dengan logo OrcaRouter dipadukan di pojok kanan bawah.
Guides & Insights

Nex-N2.5 Mini: Bobot Terbuka Tersedia Saat Peluncuran — Agen Penggunaan Komputer Terkecil Nex-AGI adalah Pintu Masuknya

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Cara untuk mengetahui apakah agen penggunaan komputer open-source siap digunakan kini adalah sebuah model yang bisa Anda unduh di hari yang sama saat diumumkan. Nex-AGI memperkenalkan keluarga Nex-N2.5 pada 8 September 2026 — tiga tingkatan agen, Nex-N2.5 Mini, Nex-N2.5 Pro, dan Nex-N2.5 Max — dan tingkatan yang bisa langsung diunduh dan dijalankan adalah yang terkecil. Nex-N2.5 Mini memiliki bobot Apache-2.0 yang tersedia di Hugging Face dalam enam belas pecahan BF16, sekitar 35 miliar parameter dengan laporan ~3 miliar aktif per token, serta penyebaran referensi dua H100. Saudara multimodalnya yang lebih besar, Nex-N2.5 Pro, masih ditandai "coming soon" hingga tulisan ini dibuat, sementara Nex-N2.5 Max yang hanya teks dengan 1,6 triliun parameter juga sudah tersedia tetapi membutuhkan enam belas H200 di dua simpul sebelum dapat dijalankan. Bagi siapa pun yang menguji tesis di balik keluarga ini — bahwa model agen open-source dapat bertahan dalam penggunaan komputer jangka panjang, bukan hanya menjawab pertanyaan — Mini adalah pintu masuknya.

Siapa Nex-AGI? Nama ini masih baru, dan peluncurannya terkesan seperti rilis publik pertama. Liputan tentang pengumuman tersebut menggambarkan upaya ini sebagai kolaborasi lintas beberapa organisasi Shanghai — Shanghai Innovation Institute, Shanghai Qiji Zhifeng, Mosi Intelligence, dan Kuafu Technology — dengan keluarga model ini diposisikan sebagai sumber terbuka dan timnya beroperasi di bawah pegangan @NexEcosystem. Kartu model mengaitkan Nex-N2.5-mini dan Nex-N2.5-Pro sebagai kelanjutan dari "fondasi multimodal Nex-N2," rilis Nex sebelumnya yang bobotnya sudah terbuka. Yang benar-benar baru di sini adalah kerangka kerjanya: Nex-AGI mengatakan mereka membangun model-model ini untuk tugas-tugas jangka panjang di lingkungan dunia nyata — mengoperasikan komputer, mengendalikan peramban, mengeksekusi dan menguji kode, serta mengoreksi arah berdasarkan apa yang dilihatnya di layar — dan mereka menerbitkan bobotnya agar klaim tersebut dapat diuji.

Tiga tingkat, satu pengumuman

Keluarga tersebut terbagi berdasarkan skala dan modalitas, dan perbedaan-perbedaannya lebih penting daripada nama yang sama:

• Nex-N2.5 Mini — sekitar 35B total / ~3B aktif, model multimodal yang menerima gambar dan teks, ditujukan untuk penggunaan komputer visual, penjelajahan web, dan tugas-tugas yang membutuhkan umpan balik dari antarmuka. Deployment referensinya adalah satu node dengan dua H100.

• Nex-N2.5 Pro — dilaporkan total 397B / ~17B aktif, juga multimodal, untuk beban kerja penggunaan komputer yang lebih berat. Referensi deployment adalah delapan H100. Bobotnya tidak dapat diunduh saat peluncuran.

• Nex-N2.5 Max — total 1.6T / ~49B aktif, khusus teks, dan menurut keterangan Nex-AGI, model ini adalah "upaya post-training lengkap pertama pada skala triliunan parameter." Kartu model tersebut menyebutkan bahwa model ini dibangun di atas fondasi DeepSeek-V4-Pro-Base. Deployment referensinya adalah 16×H200 di dua node.

Ketiganya adalah mixture-of-experts. Mini dan Pro berada di keluarga model Qwen3.5 — materi peluncuran Nex-AGI menyebut keduanya sebagai hasil post-training dari varian Qwen3.5, dan konfigurasi Mini sendiri memuat tag arsitektur qwen3_5_moe — sedangkan Max adalah outlier berbasis DeepSeek. Jadi keluarga ini bukan satu resep untuk tiga ukuran, melainkan dua resep: tingkatan multimodal yang "melakukan hal-hal di layar" berbagi satu garis keturunan, dan raksasa penalaran teks berada di garis keturunan yang lain.

Apa sebenarnya Nex-N2.5 Mini yang dikirimkan itu.

Repositori Hugging Face untuk nex-agi/Nex-N2.5-mini adalah checkpoint asli yang dapat diunduh, bukan sekadar tempat kosong — 16 pecahan safetensors dengan total sekitar 70 GB, BF16, lisensi Apache-2.0, pertama dibuat pada 8 September. File konfigurasinya cukup spesifik untuk dijadikan acuan desain:

• Arsitektur — Qwen3_5MoeForConditionalGeneration, keluarga qwen3_5_moe, dengan stack visi: kartu tersebut menandainya sebagai image-text-to-text, dan repositori menyertakan preprocessor_config.json di samping konfigurasi teks.

• Bentuk — 40 lapisan, ukuran tersembunyi 2048, atensi kueri berkelompok dengan 16 kepala kueri dan 2 kepala KV, dan kosakata 248.320.

• MoE — 256 pakar yang dirutekan dengan 8 pakar aktif per token plus satu pakar bersama, ukuran antara 512 — profil beraktivasi jarang yang membuat model "kelas 35B" dengan ~3B aktif dapat dijalankan pada dua H100.

• Konteks — max_position_embeddings 262.144 token pada konfigurasi yang dirilis, angka 262K yang sama juga muncul di seluruh resep penerapan dari keluarga model ini.

• Bobot dan lisensi — BF16, Apache-2.0, tidak dibatasi; repo tersebut juga mengarah ke mirror ModelScope dan ke organisasi GitHub (nex-agi) yang memuat resep deployment keluarga model tersebut.

Dokumentasi deployment Nex-AGI adalah bagian yang paling sering keliru pada sebagian besar rilis terbuka, dan yang ini justru dibuat dengan sangat tepat. Mini dilayani melalui image Docker SGLang khusus (nexagi/sglang:v0.5.18-nex-patch) pada satu node dengan dua H100 menggunakan tensor parallelism 2. Sampling yang direkomendasikan adalah temperature 0.7, top_p 0.95, top_k 40. Pemanggilan tool berjalan melalui parser qwen3_coder milik SGLang, dan model ini mengekspos tiga mode penalaran melalui field reasoning_effort — "none" untuk non-thinking, "medium" (default adaptif), dan "high" untuk thinking yang selalu aktif. Untuk model agentik berukuran kecil, kontrol mode thinking tersebut adalah pembeda antara loop agent yang dapat dipakai dan loop agent yang lambat, dan itu sudah tertanam dalam resep serving, bukan diserahkan kepada pengguna.

A single-column scoreboard titled 'Nex-N2.5 Mini - the scoreboard' with rows 'Params: 35B total / ~3B active (vendor-reported)', 'Architecture: qwen3_5_moe MoE - 256 experts / 8 active', 'Context: 262,144 tokens', 'Input: image + text', 'License: Apache-2.0 - BF16 weights live' and 'OSWorld-Verified: 71.2 (vendor-reported)', with a footer 'Specs from the HF config; benchmarks are Nex-AGI-reported, no independent run yet.'

Bobot: apa yang sebenarnya dapat diunduh

Status peluncuran tiga tingkatan pada hari rilis perlu dijelaskan secara presisi, karena pengumuman dan repositori tidak sepenuhnya selaras. Pada tulisan ini dibuat, Mini sudah sepenuhnya dapat diunduh di bawah lisensi Apache-2.0 — itulah dasar artikel ini. {{1}}Nex-N2.5 Max juga sudah tersedia, repositori Hugging Face-nya membawa 644 pecahan safetensors, meskipun untuk mereproduksi jejak triliunan parameternya dibutuhkan proyek 16×H200.{{/1}} {{2}}Nex-N2.5 Pro adalah yang ditunggu: repositori Hugging Face-nya sudah ada tetapi hanya berisi README dan gambar, tanpa pecahan model, dan kartunya masih menyatakan bahwa bobotnya akan segera hadir.{{/2}} Jika tingkatan yang Anda minati adalah model multimodal yang besar, itulah celah yang perlu diperhatikan — materi peluncuran menggambarkan Pro sebagai model penggunaan-komputer terkuat di keluarga ini, dan itulah model yang belum bisa Anda jalankan secara lokal.

A screenshot of the Hugging Face repository page for nex-agi/Nex-N2.5-mini (captured September 9, 2026), showing the model header with Text Generation / Transformers / Safetensors / qwen3_5_moe / image-text-to-text / conversational tags and 'License: apache-2.0', and the Files & versions tree for the main branch listing config.json, README.md, chat_template.jinja and the figures directory.

Angka-angka yang dilaporkan Nex-AGI — dan peringatan yang menyertainya

Kartu model Nex-AGI menyertakan tabel benchmark lengkap untuk Mini, dan setiap angka di dalamnya merupakan laporan dari vendor itu sendiri. Hingga tulisan ini dibuat, belum ada pengujian independen yang dipublikasikan, dan kartu tersebut secara eksplisit menyatakan bahwa skor berasal dari papan peringkat benchmark resmi, laporan evaluasi terbaru jika tersedia, serta evaluasi Nex-AGI sendiri untuk bagian lainnya. Hasil pengodean dihasilkan menggunakan harness NexAU milik tim; hasil penggunaan komputer dan peramban menggunakan harness NexCUA, yang menurut kartu tersebut akan dirilis sebagai open-source. Perlakukan baris-baris unggulan sebagai skenario terbaik dari vendor sampai ada pihak netral yang mereproduksinya.

Dengan kerangka itu, baris yang dilaporkan Mini adalah: untuk pekerjaan teks dan kode, Terminal-Bench 2.1 pada 73.4, SWE-Bench Pro pada 43.8, DeepSWE v1.1 pada 36.1, AutomationBench v1.0.6 pada 32.3, Toolathlon Verified pada 54.6, BrowseComp pada 83.4, dan skor GDPval-AA v2 sebesar 1446. Di sisi multimodal/penggunaan komputer, yang menarik perhatian adalah OSWorld-Verified pada 71.2, WebArena-Verified pada 63.4, WebTest pada 48.6 (dijalankan dalam mode oracle terhadap daftar periksa ground-truth), OSWorld-G pada 82.9 dan OmniDoc pada 89.7, bersama dengan hasil OSWorld-2 (30.5) dan Vision2Web (52.9) yang lebih sederhana.

Dua catatan singkat. Pertama, OSWorld-Verified dan OSWorld-2 adalah paket yang berbeda — yang satu subset terverifikasi yang dinilai dari keadaan lingkungan yang dihasilkan, yang lain versi yang lebih baru dan umumnya lebih keras — jadi 71,2 pada yang satu dan 30,5 pada yang lain tidaklah kontradiktif; keduanya tes yang berbeda, dan tabel Nex sendiri menempatkannya dalam kolom terpisah. Kedua, di setiap baris tabel keluarga, Mini mencetak skor di bawah Pro dan Max, dan puncak setiap kolom dimiliki oleh model frontier yang mapan seperti Claude Opus 5 atau GPT-5.6 Sol. Kisah Mini bukanlah bahwa ia mengalahkan model-model frontier; melainkan bahwa model terbuka dengan ~3B parameter aktif melaporkan skor kompetitif pada tolok ukur penggunaan komputer dengan jejak dua H100. Apakah hal itu bertahan justru merupakan pertanyaan yang dapat Anda jawab sendiri berkat bobot terbuka tersebut.

Menjalankan Nex-N2.5 Mini hari ini

Resep dua-H100 menjadikan Mini cara termurah untuk mencoba langsung klaim inti keluarga model ini. Karena arsitekturnya adalah Qwen3.5-MoE standar dengan parser pemanggilan tool qwen3_coder, model ini dapat dimuat di fork Nex-AGI SGLang tanpa kode inferensi khusus, dan pengaturan yang direkomendasikan telah dipublikasikan, bukan dibiarkan untuk direkayasa balik. Ekspektasi jujur yang perlu Anda tetapkan sebelum memulai adalah bahwa checkpoint yang baru berusia sehari dengan harness yang benar-benar baru adalah sebuah eksperimen, bukan ketergantungan. Unduhan di repositori Mini masih mencapai satu digit, dan belum ada pihak ketiga yang merilis evaluasi independen saat tulisan ini dibuat — yang merupakan kondisi normal untuk model yang dirilis kemarin, sekaligus alasan mengapa jejak dua-H100 itu penting: Anda dapat menjalankan eksperimennya sendiri minggu ini alih-alih menunggu orang lain.

A screenshot of the nex-agi collections page on Hugging Face (captured September 9, 2026), showing the Nex-N2.5 collection 'updated about 7 hours ago' with the three model entries nex-agi/Nex-N2.5-Max (Text Generation, 1.6T), nex-agi/Nex-N2.5-Pro and nex-agi/Nex-N2.5-mini, alongside the earlier Nex-N2, Nex-N1.1 and Nex-N1 collections listed on the left.

Jika Anda lebih suka membandingkan Mini dengan agen-agen frontier di tabel benchmark-nya sendiri daripada menyetel satu deployment secara manual, di situlah lapisan routing menunjukkan manfaatnya. Ketika penyedia hosting mencantumkan Nex-N2.5 Mini — dan para petahana yang menjadi pembandingnya sudah dapat diakses melalui router — satu API untuk 200+ model, dengan harga list penyedia diteruskan dengan markup 0% dan failover otomatis, adalah cara murah untuk menjalankan tugas yang sama terhadap beberapa model sekaligus tanpa integrasi kedua. Di OrcaRouter, itulah pengaturan standar untuk setiap model yang kami rute: kunci yang sama, bentuk panggilan yang sama, harga vendor itu sendiri tanpa tambahan apa pun. Hal itu paling penting untuk model yang belum teruji seperti ini, karena failover-lah yang memungkinkan Anda mencobanya di jalur nyata tanpa mempertaruhkan jalur tersebut pada model ini.

Siapa yang harus menarik beban-beban ini?

Ambillah jika pekerjaan Anda adalah agen computer-use, otomatisasi peramban, atau penggunaan alat berbasis visual, dan Anda menginginkan model berlisensi permisif yang dapat dihosting sendiri sebagai pembanding melawan para pemimpin yang terhosting. Lisensi Apache-2.0 menghapus friksi yang lazim untuk rilis dari laboratorium Tiongkok, kebutuhan dua H100 masih dalam jangkauan tim agen yang serius, dan kontrol upaya penalaran plus parser panggilan alat yang sesungguhnya menjadikannya testbed yang kredibel, bukan sekadar mainan. Tahan diri jika yang Anda butuhkan adalah model computer-use terkuat di keluarga ini — itu peran Pro, dan bobot Pro-lah yang masih belum dirilis. Dan biarkan label vendor tetap ada di setiap baris benchmark sampai pengujian independen mengonfirmasinya; skor 71.2 di OSWorld-Verified dari model terbuka dengan ~3B aktif adalah klaim yang mencolok — justru klaim semacam itulah yang layak diverifikasi di harness Anda sendiri sebelum Anda membangun di atasnya.

Yang perlu diperhatikan selanjutnya. Peluncuran bobot Pro adalah sinyal terbesar — ini mengubah keluarga dari "Mini plus raksasa dengan triliunan parameter" menjadi jajaran lengkap yang dijelaskan dalam materi peluncuran. Kedua adalah open-sourcing harness NexCUA, yang tanpanya angka penggunaan komputer tidak dapat direproduksi secara independen dengan protokol yang sama. Ketiga adalah uji coba netral pertama, dari Artificial Analysis, laboratorium universitas, atau praktisi yang memublikasikan reproduksi OSWorld-Verified mereka. Ketika salah satu dari ketiganya tiba, pertanyaan yang diajukan peluncuran ini — apakah model agenik terbuka benar-benar telah menutup kesenjangan dengan tumpukan penggunaan komputer yang dihosting — tidak lagi sekadar urusan tabel vendor.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari