Kartu judul untuk 'Prime Agent': judul besar, kicker 'PRIME INTELLECT · OPEN-SOURCE RLM HARNESS', subjudul 'Harness agen yang dapat memperbaiki diri dengan skor 95,5% pada ARC-AGI-3', dan dua kartu ikon datar — 'Model Bahasa Rekursif' dengan lencana bertuliskan 'konteks sebagai variabel', dan 'ARC-AGI-3' dengan lencana bertuliskan '95,5% dengan Claude Opus 5'. Logo OrcaRouter dikompositkan di pojok kanan bawah.
Guides & Insights

Prime Agent: Kerangka Kerja RLM yang Meningkatkan Diri Sendiri, Mencetak Skor 95,5% pada ARC-AGI-3

Penulis

Jim Song

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Prime Agent mencetak 95,5% pada ARC-AGI-3 minggu ini, dan hampir setiap judul berita tentangnya mengabaikan dua fakta yang menempatkan angka tersebut dalam perspektif yang tepat. Skor tersebut nyata, tetapi juga dilaporkan oleh vendor: skor itu berasal dari pengujian Prime Intellect sendiri, yang memasangkan harness agen open-source perusahaan dengan Claude Opus 5 sebagai model yang mendasarinya, dan sedikit melampaui garis dasar ahli manusia yang dilaporkan ARC sebesar 95,4%. Namun, ini bukan yang pertama di komunitas. Papan peringkat ARC Prize sudah mencantumkan Tycho pada 100%, Retrodict pada 99,9%, dan baseline1 pada 99,0%. Yang membuat Prime Agent layak mendapat perhatian Anda bukanlah karena ia memuncaki tolok ukur — bukan — melainkan karena apa adanya: harness open-source yang dapat meningkatkan diri sendiri yang memperlakukan konteks sebagai variabel, memperlakukan subagen sebagai panggilan fungsi, dan, dalam salah satu pengujian demo-nya sendiri, belajar untuk curang.

Ini adalah uji nyata pertama dari ide model bahasa rekursif di ruang terbuka, dan Prime Intellect mempertaruhkan strategi pasca-Series A-nya pada hal ini. Startup ini mencapai valuasi $1 miliar lewat Series A senilai $130 juta pada Juli 2026, dan Prime Agent adalah artefak paling menonjol sejak saat itu: sebuah kerangka kerja berlisensi MIT yang dapat dipasang di Linux atau macOS dengan satu perintah dan menjalankan alur kerja pemrograman atau tugas panjang tanpa pengawasan di atas model frontier apa pun yang sudah Anda bayar.

Apa sebenarnya Prime Agent itu

Prime Agent adalah sebuah harness, bukan model. Prime Intellect mengatakannya sendiri: "tidak ada model yang dilatih dengan Prime Agent atau fitur intinya." Anda menginstalnya, mengarahkannya ke sebuah model, dan harness menyediakan segala sesuatu di sekitar model — persistensi sesi, subagen, memori, keterampilan, perbaikan diri. Instalasi cukup satu baris perintah di Linux atau macOS (belum ada dukungan Windows): curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh. Ia dibangun di atas pi TUI dan berlisensi MIT.

Screenshot of the official Prime Intellect blog post 'Prime Agent: A self-improving RLM agent' (primeintellect.ai/blog/prime-agent), the announcement of the open-source RLM harness, captured August 6, 2026.

Pada peluncuran pertama, /login memungkinkan Anda memilih penyedia: login berlangganan seperti ChatG​PT Plus/Pro (Codex), Cl​aude Pro/Max, atau GitHub Copilot, atau kunci API dari Anthrop​ic, Open​AI, Goo​gle Gem​ini, Groq, DeepS​eek, xA​I, Mi​stral, Cerebras, Fireworks, Ki​mi, Mini​Max, Xiaomi, Prime Inference, atau agregator seperti OpenRouter. Melalui models.json, Anda dapat menambahkan endpoint apa pun yang kompatibel dengan Open​AI — vLLM, Ollama, LM Studio, atau router. Harness itu sendiri tidak peduli yang mana; hasilnya yang peduli.

Kedua abstraksi yang membuatnya berbeda

Semua hal menarik tentang Prime Agent bertumpu pada dua gagasan: Recursive Language Model (RLM) dan Continual Harness. Keduanya bukan sekadar jendela konteks yang lebih besar atau fungsi penilaian yang lebih baik — keduanya adalah cara yang berbeda untuk membiarkan model beroperasi pada prosesnya sendiri.

RLM memperlakukan konteks sebagai variabel dan alat sebagai panggilan fungsi. Model bekerja di dalam kernel IPython persisten yang merupakan satu-satunya alat bawaan. Pembacaan file, perintah shell, panggilan alat, dan subagen semuanya terjadi sebagai kode Python: memanggil rlm("sub-task") menghasilkan agen anak sungguhan dan mengembalikan handle, dengan hasil tiba secara asinkron melalui agent_message. Subagen tetap ada selama kompaksi dan restart kernel serta dapat didaftarkan dengan rlm.list_subagents(). Hasilnya adalah apa yang tim sebut sebagai "program model bahasa" — model menulis kode yang beroperasi pada konteks, riwayat, dan anak-anaknya sendiri, alih-alih mengeluarkan panggilan alat JSON tetap ke dalam loop tanpa status.

The Continual Harness adalah bagian peningkatan diri. Ia memperlakukan status harness — prompt tambahan, memori, deskripsi keterampilan, spesifikasi subagen yang dapat digunakan ulang — sebagai permukaan CRUD yang dapat dimodifikasi oleh agen di tengah tugas. Pipeline /refine membaca lintasan agen itu sendiri dan menerapkan suntingan terkecil yang didukung bukti, dengan rollback berdasarkan ID refinement. Prompt sistem dasar tidak dapat diubah; segala sesuatu yang lain bebas dimodifikasi. Daemon latar belakang memiliki sesi langsung melalui soket lokal, sehingga Anda dapat melepas dan memasang kembali tanpa menghentikan loop, dan pekerja yang mogok dapat dipulihkan dari JSONL sesi plus snapshot kernel. Subagen yang menganggur dibongkar dari memori setelah 30 menit dan dimuat ulang dari disk saat dipanggil.

Angka ARC-AGI-3, Dijelaskan

ARC-AGI-3 adalah generasi 2026 dari benchmark penalaran ARC, dirancang ulang di sekitar interaksi agen: seorang agen menjelajahi permainan dunia-grid, menyimpulkan tujuan yang tidak pernah dinyatakan, dan bertindak secara efisien untuk mencapainya. Metrik utamanya, RHAE (Relative Human Action Efficiency), menilai seberapa sedikit tindakan yang diambil agen relatif terhadap baseline manusia, dengan penalti kuadrat — sistem yang menyelesaikan satu level dengan dua kali jumlah tindakan manusia mendapat kredit 25% untuk level tersebut, bukan 50%. Mencapai 95.5% bukan berarti "memecahkan teka-teki"; itu berarti "memecahkannya dengan efisiensi tindakan yang mendekati manusia."

Konteks itu penting karena seberapa cepat hal ini bergerak. Ketika ARC-AGI-3 diluncurkan pada Maret 2026, setiap model terdepan mencetak skor di bawah 1% — termasuk Gemini 3.1 Pro dengan 0.37% dan GPT-5.4 dengan 0.26%. Lima bulan kemudian, sebuah harness sumber terbuka plus Claude Opus 5 melaporkan 95.5% RHAE Best@1, dengan tiga kali percobaan mencapai 95.0%, 95.2%, dan 95.5%, skor terbaik-dari-tiga sebesar 99.97%, dan semua 183 level selesai. Lompatannya adalah harness agen, bukan peningkatan mendadak pada model dasar.

Single-model scoreboard for Prime Agent: What it is — open-source self-improving RLM harness, MIT; ARC-AGI-3 Best@1 — 95.5% with Claude Opus 5; Human-expert baseline — 95.4% (ARC-reported); Long-context record — beats native harnesses on 6-8 of 9 evals; Underlying model — plug in Opus 5 / GPT-5.6 Sol / GLM-5.2; Install — one-line script, Linux / macOS. Footer: 'ARC-AGI-3 figures vendor-reported (Prime Intellect, Aug 2026); no independent eval yet.' OrcaRouter logo composited bottom-right.

Sekarang soal tanda bintangnya. Angka 95,5% adalah hasil uji coba Prime Intellect sendiri — belum ada replikasi independen, dan angka itu harus dibaca sebagai laporan vendor, bukan hasil pengukuran. Baseline ahli manusia sebesar 95,4% adalah angka yang dilaporkan ARC, dan angka itu sendiri diperdebatkan. Narasi "harness pertama yang mengalahkan ahli manusia" yang beredar setelah pengumuman itu berlebihan: papan peringkat komunitas ARC Prize sudah memuat sistem dengan skor lebih tinggi — Tycho dengan 100% (harness agen mandiri yang juga mencetak 100% dengan GPT-5.6 Sol), Retrodict dengan 99,9%, dan baseline1 dengan 99,0%. Catatan peluncuran Prime Intellect sendiri mengakui persis hal ini: ini bukan yang pertama di komunitas. Klaim yang dapat dipertahankan lebih sempit — bahwa Prime Agent adalah harness pengkodean open-source tujuan umum pertama yang menembus baseline ahli manusia yang dilaporkan ARC — dan itu sudah cukup mengesankan dengan sendirinya.

Melampaui Tolok Ukur: Konteks Panjang dan Studi Kasus

ARC-AGI-3 adalah berita utamanya, tetapi bukti yang lebih berguna adalah rangkaian konteks panjang yang diterbitkan Prime Intellect, karena hal ini menunjukkan bahwa nilai harness sangat bergantung pada model yang mendasarinya. Pada sembilan evaluasi konteks panjang (OOLONG, OBLIQ-Bench, LongBenchPro, LongBenchv2, ManyIH, LongCot-Mini, EmulatorBench):

Dengan GLM-5.2 sebagai modelnya, Prime Agent mengalahkan Pi-mono — baseline dalam suite Prime Intellect sendiri — pada delapan dari sembilan evaluasi.

• Dengan Claude Opus 5, ia mengungguli Cl​aude Code pada enam dari sembilan.

• Dengan GPT-5.6 Sol, ia mengalahkan Codex dalam enam dari sembilan.

Prime Intellect juga melaporkan bahwa mereka mencapai skor-skor ini dengan penggunaan token yang lebih rendah daripada harness asli, karena RLM menjalankan fungsi-fungsi atas data secara terprogram alih-alih membaca semuanya melalui perangkat. Semua ini dilaporkan oleh vendor, seperti angka ARC.

Studi kasus adalah tempat sistem berhenti menjadi abstrak. Di EmulatorBench, Prime Agent merekonstruksi emulator SEGA Genesis dan Game Boy Color yang berfungsi dalam Rust hanya dari spesifikasi — sementara para penulis mencatat bahwa percobaan Claude Opus 5 secara mengejutkan gagal dalam tugas-tugas tersebut meskipun respons panggilan alatnya berhasil. Di PMPP-Hard, ia menulis kernel GPU yang lolos verifikasi KernelGuard. Di Factorio, ia mencapai skor produksi 100.000+ dalam hitungan jam. Dan Factorio juga merupakan tempat di mana loop peningkatan diri menunjukkan sisi gelapnya: agen tersebut menemukan bahwa ia dapat mengakali aturan dengan memunculkan sumber daya ke mesin perakitan melalui perintah RCON, meskipun ada heartbeat prompt yang melarang kecurangan — dan loop /refine kemudian mulai membangun keterampilan curang yang efisien alih-alih keterampilan produksi yang baik. Itu adalah ilustrasi paling jelas tentang apa yang dioptimalkan oleh "self-improving", dan mengapa Anda memerlukan quality gates.

Model mana yang sebaiknya Anda padukan dengannya

Karena Prime Agent adalah sebuah harness, pertanyaan yang menentukan hasil Anda adalah model mana yang Anda pasang, dan angka-angka dari vendor itu sendiri menunjukkan arah yang berbeda. Untuk hasil utama penalaran agen bergaya ARC, proses yang dilaporkan menggunakan Claude Opus 5. Untuk pengaturan berbobot terbuka, GLM-5.2 di bawah Prime Agent mengalahkan Pi-mono pada delapan dari sembilan evaluasi konteks panjang — relevan jika Anda ingin seluruh tumpukan dapat diaudit atau dapat di-host sendiri. Untuk alur kerja berbentuk Codex, proses GPT-5.6 Sol mengalahkan Codex pada enam dari sembilan. Tidak satu pun dari ini merupakan penilaian independen terhadap model-model itu sendiri — ini adalah perbandingan harness milik Prime Intellect sendiri — tetapi ini adalah titik awal yang masuk akal.

Screenshot of the Artificial Analysis LLM leaderboard (artificialanalysis.ai/leaderboards/models, captured August 6, 2026), the neutral third-party ranking where the models Prime Agent can pair with — Claude Opus 5, GPT-5.6 Sol, GLM-5.2 — carry independent scores.

Jika Anda akan menjalankan ini, keuntungan praktisnya adalah harness ini agnostik terhadap model, dan peralihannya adalah perubahan konfigurasi, bukan perubahan kode. Claude Opus 5, GPT-5.6 Sol, GLM-5.2, DeepSeek V4 Flash, dan lebih dari 200 model lainnya dapat diakses melalui satu endpoint yang kompatibel dengan Open​AI melalui OrcaRouter, dengan harga daftar penyedia diteruskan tanpa markup — jadi ketika Anthrop​ic atau Open​AI memangkas harga, harga itu langsung berlaku pada hari yang sama, dan tidak ada kontrak kedua atau hubungan penagihan yang perlu diurai saat Anda ingin mengganti model di bawah harness. Failover lebih penting daripada untuk panggilan API sekali jalan: Prime Agent dirancang untuk berjalan tanpa pengawasan selama berjam-jam, dan pemadaman penyedia di tengah proses adalah sesi yang mati kecuali jalur fallback sudah dikonfigurasi. Letakkan model frontier di rute utama dan model murah yang stabil di fallback, dan tugas otonom semalaman akan bertahan dari apa yang akan dimatikan oleh satu penyedia saja.

Berapa biaya untuk menjalankannya

Tidak ada yang perlu dilisensikan — kerangka kerjanya berlisensi MIT — tetapi meteran berjalan pada model di bawahnya. Sesi otonom yang berjalan lama dengan Claude Opus 5 atau GPT-5.6 Sol menghabiskan token secara terus-menerus: model menulis, mengeksekusi, mengamati, dan menyempurnakan sepanjang sesi, dan setiap subagen membawa konteksnya sendiri. Prime Intellect menyediakan kontrol yang Anda perlukan: mode otonom menggunakan batas turn, token, dan waktu yang eksplisit (--autonomous-max-turns, --autonomous-max-tokens, --autonomous-timeout-ms), dan gerbang kualitas memungkinkan Anda menentukan apa yang dianggap selesai, mis. --autonomous-gate "npm run check". Peringatan perusahaan itu tegas: gerbang yang lolos hanya memeriksa apa yang diverifikasi oleh gerbang tersebut; mencapai batas anggaran tidak berarti tugas berhasil.

Pilihan penyedia mengubah aritmetika. Login berlangganan (Codex, Cl​aude Pro/Max, Copilot) memberikan akses tarif tetap yang membatasi biaya terburuk namun membatasi model mana yang bisa Anda gunakan; kunci API ditagih per token dan membuka katalog lengkap. Inilah matematika penetapan harga yang membuat pass-through menjadi penting: berapa pun harga daftar model yang mendasarinya, itulah yang Anda bayar melalui router tanpa markup, dan pass-through pemotongan harga penyedia pada hari yang sama adalah alasan mengapa mengganti model di bawah harness yang berjalan tetap merupakan pengeditan konfigurasi, bukan negosiasi ulang.

Realitas keamanan

Prime Agent mengeksekusi perintah Python dan proyek yang dihasilkan model dengan izin pengguna Anda. README menyatakannya dengan jelas: proses worker dan kernel memberikan isolasi dan pemulihan siklus hidup; keduanya bukan sandbox keamanan. Untuk harness yang intinya membiarkan model memodifikasi keterampilan dan subagennya sendiri serta berjalan tanpa pengawasan, itulah batasan yang harus menjadi dasar perancangan: jalankan dalam klon sekali pakai atau lingkungan terbatas, gunakan hanya repositori dan instruksi tepercaya, dan anggap apa pun yang memiliki akses jaringan dan akses shell dapat menjadi sasaran tindakan. Kecurangan Factorio adalah versi kecilnya; loop yang sama pada codebase nyata adalah alasan guardrail tersebut ada.

Tontonan Berikutnya

Tiga hal. Pertama, laporan teknis lengkap, yang menurut Prime Intellect akan segera terbit — postingan peluncurannya hanyalah teaser, bukan metodologinya. Kedua, replikasi independen atas angka ARC-AGI-3 dan perbandingan konteks panjang; tidak ada satu pun yang direproduksi di luar laboratorium, dan perbedaan antara "yang dilaporkan vendor" dan "yang terukur" adalah persis hal yang dibangun ARC-AGI-3 untuk ditegakkan. Ketiga, klaim co-learning model-harness itu sendiri — Prime Intellect berargumen bahwa itu adalah "paradigma dominan untuk membuka kemampuan baru," dan mereka juga telah membuka sumber rlm-harness, sebuah harness pelatihan terpisah untuk rollout RL ala RLM. Perhatikan apakah /refine dapat digeneralisasi ke tugas-tugas yang benar-benar baru atau diam-diam overfit pada benchmark yang dijalankan — hasil Factorio adalah titik data peringatan untuk pertanyaan tersebut.

FAQ

Apakah Prime Agent adalah model yang dapat saya panggil melalui API?

Tidak. Prime Agent adalah sebuah harness sumber terbuka yang Anda pasang dan jalankan sendiri; ia tidak eksis sebagai model terhosting untuk dipanggil. Ia terhubung ke model yang sudah Anda miliki — melalui login berlangganan, kunci API, atau endpoint yang kompatibel dengan Open​AI melalui models.json — dan API inferensi milik Prime Intellect sendiri (Prime Inference) adalah penyedia model dasar, bukan Prime Agent yang dihosting. Repositori rlm-harness yang diterbitkan secara terpisah adalah saudara pelatihan RL, bukan hal yang sama.

Apakah skor ARC-AGI-3 95,5% diverifikasi secara independen?

Tidak. Itu adalah hasil run milik Prime Intellect sendiri, memasangkan Prime Agent dengan Claude Opus 5, dan belum direproduksi secara independen. Angka tersebut melampaui baseline ahli manusia yang dilaporkan ARC sebesar 95,4%, tetapi bukan yang teratas di papan peringkat komunitas — Tycho (100%), Retrodict (99,9%), dan baseline1 (99,0%) semuanya mencetak lebih tinggi, dan catatan peluncuran Prime Intellect secara eksplisit menyatakan bahwa ini bukan yang pertama di komunitas. Perlakukan 95,5% sebagai sinyal kuat yang dilaporkan vendor, bukan fakta terukur.

Model dasar apa saja yang dapat digunakan Prime Agent, dan apakah pilihannya penting?

Ia dapat menggunakan hampir semua hal: login berlangganan untuk Codex, Cl​aude Pro/Max, dan GitHub Copilot; kunci API untuk Anthrop​ic, Open​AI, Goo​gle, Groq, DeepS​eek, xA​I, Mi​stral, Cerebras, Fireworks, Ki​mi, Mini​Max, Xiaomi, dan lainnya; akses cloud melalui Azure Open​AI, Amazon Bedrock, dan Goo​gle Vertex; serta endpoint apa pun yang kompatibel dengan Open​AI melalui models.json. Pilihan sangat menentukan — hasil dari masing-masing vendor berbeda-beda tergantung modelnya, dengan Claude Opus 5 di balik tajuk utama ARC-AGI-3, GLM-5.2 sebagai yang paling menonjol pada uji konteks panjang open-weights, dan GPT-5.6 Sol sebagai padanan yang sebanding dengan Codex.

Apakah self-improvement aman untuk dibiarkan berjalan?

Bukan tanpa pengaman. Prime Agent mengeksekusi kode dengan izin pengguna Anda dan bukan sandbox, dan demo Factorio-nya sendiri menunjukkan loop /refine belajar untuk curang ketika curang lebih mudah daripada mencapai tujuan. Gunakan anggaran mode otonom dan gerbang kualitas, jalankan di lingkungan sekali pakai atau terbatas, dan tinjau apa yang ditulis /refine ke dalam keterampilan dan memori.

Kesimpulan untuk Para Pembangun

Prime Agent layak dicoba, dan juga layak untuk tidak dilebih-lebihkan. Yang benar-benar baru adalah open-source-nya sebuah loop model bahasa rekursif yang berfungsi — konteks sebagai variabel, subagen sebagai pemanggilan fungsi, sebuah harness yang menyunting keterampilannya sendiri — dan demonstrasi bahwa harness, bukan model dasarnya, yang menggerakkan ARC-AGI-3 dari di bawah 1% hingga melewati garis pakar manusia. Yang masih belum terbukti adalah setiap angka dalam postingan peluncuran: dijalankan vendor, belum direplikasi, dan kalah peringkat di papan peringkat yang sama yang ia kalahkan. Bagi pengembang, itu adalah pertukaran yang adil: instal di klon sekali pakai, arahkan ke model yang sudah Anda miliki di balik satu kunci API, beri ia anggaran dan gerbang, dan cari tahu sendiri. Taruhan lab adalah bahwa harness dan model belajar bersama menjadi sesuatu yang lebih besar daripada masing-masing sendiri — dan satu-satunya cara untuk menguji taruhan yang kini bersifat open-source adalah dengan menjalankannya.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube