Kartu judul hero bertuliskan Gemini 4 Argon di FrontierSWE: Ia Berseru Eureka, Lalu Menilai Pekerjaan Rumahnya Sendiri, dengan chip bertuliskan FrontierSWE v2 rata-rata 55,0 persen pada 5, chip bertuliskan Ketiga dari sepuluh model, dan chip bertuliskan 129 dolar 36 per uji coba, serta baris footer bertuliskan angka FrontierSWE menurut papan peringkat publik Proximal Labs, 2026-09-30.
Guides & Insights

Gemini 4 Argon di FrontierSWE: Ia Berteriak "Eureka!", Lalu Menilai PR-nya Sendiri

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Gemini 4 Argon memiliki masalah kepribadian, dan itu adalah hal paling menarik yang pernah dikatakan siapa pun tentang model tersebut sejak Go​ogle mengumumkannya pada 2026-09-30. Pada benchmark FrontierSWE dengan horizon ultra-panjang, model yang finis ketiga — di belakang GPT-6 Astra dan Claude Opus 5.5 — meninggalkan kesan yang membekas pada para penilainya: kata favoritnya adalah "Eureka!", dan ia menghabiskan banyak dari anggaran tugas dua puluh jam untuk bersikap sangat keras terhadap dirinya sendiri. Itu adalah observasi satu sumber yang berdekatan dengan bocoran dari operator benchmark, bukan klaim vendor dan bukan catatan rilis, dan ada baiknya bersikap tepat tentang apa yang disampaikannya dan tidak disampaikannya kepada Anda. Tak satu pun dari tiga model di atas memiliki tanggal GA untuk Argon yang dilekatkan padanya; observasi ini tentang perilaku di dalam harness, dan angka-angka yang menyertainya adalah pengukuran independen pertama Argon pada benchmark yang tidak dijalankan sendiri oleh Go​ogle.

Apa sebenarnya komentar "Eureka!" itu

Sumbernya adalah unggahan dari @nrehiew_, seorang insinyur yang bekerja pada evaluasi model, yang diterbitkan pada 2026-09-30, mengutip pengumuman Gemini 4 Argon dari Sundar Pichai. Intinya adalah tiga klaim: Argon adalah model paling menghibur yang pernah mereka evaluasi di FrontierSWE; kata favoritnya adalah "Eureka!"; dan model itu sangat kritis terhadap dirinya sendiri. Pengunggah menggambarkannya sebagai peningkatan besar dibandingkan Gemini-Gemini sebelumnya sekaligus tetap mempertahankan kepribadian tersebut, dan menyebutnya mengesankan.

Baca itu dengan cermat, karena mudah untuk menafsirkannya secara berlebihan. Itu adalah kesan satu evaluator dari menonton jejak agen, bukan hasil yang dinilai, bukan metrik yang dipublikasikan, dan bukan sesuatu yang Proximal Labs — yang membangun dan menjalankan FrontierSWE — telah mengaitkan nama mereka sebagai temuan. Tidak ada kolom "kritik diri" di papan peringkat. Yang membuat pernyataan itu layak ditulis bukanlah karena pernyataan itu otoritatif; melainkan karena itu adalah satu-satunya pembacaan kualitatif yang ditawarkan siapa pun di luar Google tentang Argon, dan karena model tersebut tidak tersedia secara umum, jejak seperti ini saat ini adalah satu-satunya cara untuk melihat model itu berperilaku.

Hal ini juga mengarah pada pertanyaan nyata bagi siapa pun yang berencana menjalankan Argon sebagai agen. Sesi coding jangka panjang sebagian besar merupakan masalah pengelolaan anggaran: model yang menyela dirinya sendiri untuk mempertimbangkan ulang, yang menilai sendiri pekerjaan antaranya, dan yang mengumumkan terobosan, adalah model yang menghabiskan token untuk proses. Apakah itu sebuah kekuatan atau beban sepenuhnya bergantung pada apakah kritik diri tersebut konvergen atau berulang. Satu evaluator yang mengatakan “impresif” hanyalah satu titik data, bukan jawaban.

FrontierSWE v2, dan mengapa finis di posisi ketiga justru merupakan kisah yang sesungguhnya

FrontierSWE bukanlah jenis benchmark yang bisa Anda baca angka utamanya begitu saja. Benchmark ini dibuat oleh Proximal Labs dan dijelaskan di repositori mereka sebagai benchmark agen coding dengan horizon ultra panjang yang menguji implementasi, rekayasa performa, dan riset ML. Versi 2 dirilis pada September 2026 dengan 21 tugas baru di atas set awal, sehingga totalnya 34, dan mengharapkan agen untuk terus bekerja hingga dua puluh jam. Semuanya dijalankan melalui harness milik Proximal sendiri, proximus, yang dibangun di atas mini-swe-agent dan menambahkan pemadatan konteks, visi, dan alat submit eksplisit. Penilaian menggunakan mean@5 — rata-rata dari lima percobaan per tugas — dengan rentang ketidakpastian yang dilaporkan membentang dari rata-rata eksekusi terburuk tiap tugas hingga rata-rata eksekusi terbaiknya.

Metodologi itu penting untuk membaca baris Argon secara jujur:

• Skor — Gemini 4 Argon 55,0% mean@5, ±9,9, dibandingkan dengan GPT-6 Astra 65,5% dan Claude Opus 5.5 62,3%

• Sebaran — run Argon berkisar dari 44,5% (terburuk@5) hingga 64,3% (terbaik@5), rentang yang tumpang tindih dengan 52,0%–71,5% milik Opus 5.5 di bagian atas dan sama sekali tidak tumpang tindih dengan 55,1%–73,0% milik Astra

• Biaya per uji coba — Argon $129.36, Opus 5.5 $98.87, Astra $1,029.65

• Waktu nyata per percobaan — Argon 10,6 jam, Opus 5.5 14,2 jam, Astra 12,1 jam

Hal pertama yang Anda perhatikan adalah bahwa Argon berada di peringkat ketiga dan skornya tidak dekat dengan peringkat kedua. Hal kedua — yang seharusnya menentukan apakah Anda peduli — adalah bahwa pada tolok ukur ini Argon didominasi secara ketat oleh Claude Opus 5.5. Opus 5.5 memperoleh skor lebih tinggi (62,3% vs 55,0%) dan biayanya lebih rendah per percobaan ($98,87 vs $129,36). Tidak ada dimensi di sini tempat Argon menang. Satu keunggulannya adalah waktu: 10,6 jam versus 14,2 jam milik Opus 5.5, yang nyata jika Anda membayar untuk waktu aktual dan bukan untuk token, dan tidak relevan jika Anda membayar berdasarkan anggaran per percobaan.

Papan peringkat Proximal sendiri memuat catatan kaki pada baris Argon yang harus diulangi oleh setiap orang yang mengutip angka ini: "Gemini 4 Argon: Tingkat cache hit jauh lebih rendah karena pengaturan non-produksi." Itu adalah para evaluator yang menandai bahwa mereka menjalankan Argon di luar konfigurasi yang akan digunakan oleh penerapan produksi, yang membengkakkan biayanya dan mungkin juga latensinya. Ini adalah peringatan khusus pada angka biaya, dan inilah alasan $129.36 harus dibaca sebagai batas atas, bukan sebagai daftar tarif.

Angka yang tidak ditampilkan oleh bagan Google sendiri

Di sinilah penelusuran sumber menjadi benar-benar menarik, dan di sinilah sebagian besar tulisan tentang hasil ini akan keliru. Postingan pengumuman Google menyertakan bagan tolok ukur dengan baris FrontierSWE v2. Baris itu menunjukkan GPT-6 Astra 65,5%, Claude Fable 5.1 56,3%, Claude Opus 5.5 62,3%. Gemini 4 Argon tidak ada di dalamnya. Papan peringkat langsung Proximal menempatkan Astra pada 65,5% dan Opus 5.5 pada 62,3% — angka yang sama — tetapi menempatkan Claude Fable 5.1 pada 56,5%, bukan 56,3%, dan mencantumkan Gemini 4 Argon pada 55,0%.

Alasan penghilangan itu tidak misterius, dan Google sendiri yang mengatakannya: catatan metodologi yang menyertai rangkaian evaluasi mereka menyatakan bahwa hasil FrontierSWE dilaporkan dari papan peringkat publik resmi Proximal. Google tidak menghitung sendiri tolok ukur ini. Mereka mengutip pihak ketiga yang sama dengan kita, dan satu-satunya angka Argon yang diterbitkan pihak ketiga itu adalah 55,0%. Jadi tafsir yang jujur adalah bahwa skor FrontierSWE Argon merupakan pengukuran yang benar-benar independen — Proximal menjalankannya, pada harness mereka, pada tugas-tugas mereka — dan bahwa itu menempatkan Argon di belakang dua pesaing.

Semua hal lain dalam bagan Google dilaporkan oleh vendor dan sebaiknya diberi label seperti itu di dalam pikiran Anda: Argon 63.1% pada Vals Index dibandingkan 67.0% milik Opus 5.5, 41.4% AutomationBench dibandingkan 42.5% milik Opus 5.5, 89.6% Vibe Code Bench dibandingkan 90.3% untuk baik Astra maupun Opus 5.5, 87.5% LVBench dibandingkan 83.7%, 68.0% CWE-bench v1 dibandingkan 67.0% milik Opus 5.5. Itu adalah hasil uji Google atas evaluasi yang dipilih Google. Baris FrontierSWE adalah satu-satunya dalam gambaran itu yang dapat diperiksa sendiri oleh pembaca, dan itulah sebabnya finis di peringkat ketiga lebih berbobot daripada pola seri atau menang tipis di sekitarnya.

Apa yang dikatakan Artificial Analysis, secara independen

FrontierSWE adalah satu sudut pandang. Artificial Analysis adalah sudut pandang lainnya, dan ia sejalan dengan bentuk ceritanya. Pada Intelligence Index v4.3.2 mereka, Gemini 4 Argon dalam konfigurasi penalaran tingginya mendapat skor 52,56 — diukur secara independen pada perangkat keras mereka sendiri, bukan dilaporkan oleh Google — dengan harga daftar $2,00 per juta token masukan dan $10,00 per juta token keluaran, dengan diskon 95% untuk masukan yang di-cache. Instrumentasi mereka menetapkan biaya satu tugas indeks sebesar $1,99.

Perbandingan yang penting adalah perbandingan yang sama yang dihasilkan oleh FrontierSWE. Claude Opus 5.5 dalam konfigurasi tingginya mencetak skor lebih tinggi pada indeks, 53,58, dengan biaya per tugas yang lebih rendah, $1,82. Dua evaluator independen, yang menggunakan tugas dan harness berbeda, menempatkan Argon di belakang Opus 5.5 baik dalam hal kualitas maupun biaya. Itu adalah sinyal yang konsisten, bukan artefak benchmarking tunggal, dan itu adalah hal terkuat yang saat ini dapat Anda katakan tentang keekonomian Gemini 4 Argon.

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: FrontierSWE v2 mean at 5 55.0 percent, FrontierSWE spread 44.5 to 64.3 percent, FrontierSWE cost per trial 129 dollars 36, FrontierSWE wall clock 10.6 hours, AA Intelligence Index 52.6, AA cost per index task 1 dollar 99. Claude Opus 5.5 reads: FrontierSWE v2 mean at 5 62.3 percent, FrontierSWE spread 52.0 to 71.5 percent, FrontierSWE cost per trial 98 dollars 87, FrontierSWE wall clock 14.2 hours, AA Intelligence Index 53.6, AA cost per index task 1 dollar 82. A footer line reads that FrontierSWE v2 figures are per Proximal Labs' public leaderboard as of 2026-09-30 with Argon's cost marked as a non-production cache setting, and that AA figures are per Artificial Analysis Intelligence Index v4.3.2.

Diumumkan, bukan dirilis — dan mengapa pembingkaian itu bukan sekadar bertele-tele

Tidak ada ID model Gemini 4 Argon. Akses sedang digulirkan melalui Program Fairwind kepada para pembela siber yang telah diverifikasi, seiring dengan pembukaan bertahap untuk pelanggan API berbayar dan pelanggan Google AI Ultra, tanpa tanggal ketersediaan umum yang dipublikasikan. Postingan Google adalah pengumuman tentang sebuah model dan serangkaian evaluasi, bukan peluncuran endpoint yang dapat Anda panggil. Jika Anda membaca liputan yang menyebut ini sebagai rilis, liputan itu melampaui fakta yang ada.

Perbedaan itu memiliki konsekuensi praktis bagi siapa pun yang membaca angka FrontierSWE. Evaluasi tersebut dijalankan terhadap sebuah model yang Proximal memiliki akses terhadapnya berdasarkan suatu kesepakatan; ini memberi tahu Anda apa yang dapat dilakukan model, bukan apa yang dapat Anda miliki. Ini juga berarti angka-angka kinerjanya memiliki waktu paruh yang lebih pendek daripada biasanya. Model yang belum GA masih dapat berubah — pengaturan decoding, prompt sistem, default penggunaan alat, dan scaffolding keamanan semuanya masih disetel, dan alasan yang dinyatakan mengapa tingkat cache hit Argon buruk justru adalah karena para evaluator tidak menjalankan konfigurasi produksi. Perkirakan 55,0% dan $129,36 akan bergeser.

Apa yang akan mengubah gambaran ini: ID model yang diterbitkan dengan kartu tarif, tanggal GA, pengujian ulang FrontierSWE dalam setelan produksi, dan evaluator independen kedua yang mereproduksi hasil peringkat ketiga. Sampai setidaknya dua hal pertama itu ada, anggap setiap angka Argon — termasuk yang bagus di bagan Google sendiri — sebagai sementara.

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated 2026-09-30, credited to Koray Kavukcuoglu, with a standfirst describing frontier performance in complex workflows, cyber defense and software engineering and a benchmark chart whose FrontierSWE v2 row lists GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5 but omits Gemini 4 Argon.

Pembacaan kepribadian adalah bagian yang akan paling awet

Skor benchmark untuk model pra-GA memiliki masa simpan yang diukur dalam hitungan minggu. Observasi perilakunya tidak. Kerja agen dengan horizon panjang adalah tempat karakter model benar-benar muncul, karena anggaran dua puluh jam dengan 34 tugas memberi cukup ruang bagi kecenderungan model untuk menumpuk: bagaimana ia pulih dari pendekatan yang gagal, apakah ia berhenti untuk merencanakan ulang, apakah ia dapat membedakan antara masalah sulit dan langkah yang salah. Seorang evaluator yang menonton banyak jejak ini dan menggambarkan model sebagai kritis terhadap diri sendiri serta cenderung berseru ketika sesuatu berhasil sedang menggambarkan model yang mengeksternalisasi penalarannya tentang kemajuannya sendiri. Itu adalah hipotesis tentang mengapa sebaran run Argon berkisar dari 44,5% hingga 64,3% — rentang yang lebih lebar daripada yang dimiliki Opus 5.5 — dan itu dapat diuji setelah model tersebut dapat dipanggil.

Separuh lain dari pernyataan itu justru yang perlu disikapi dengan skeptis. "Peningkatan besar dibandingkan Gemini sebelumnya" adalah perbandingan dengan model-model yang belum pernah dinilai pada tolok ukur ini dalam rangkaian pengujian ini, sehingga sama sekali tidak dapat diperiksa terhadap papan peringkat. Itu hanyalah sebuah kesan, dan harus diperlakukan sebagai kesan, seberapa pun kredibelnya orang yang mengemukakannya.

A capture of the FrontierSWE public leaderboard showing ten models ranked by mean at 5. GPT-6 Astra leads at 65.5 percent, Claude Opus 5.5 second at 62.3 percent, Gemini 4 Argon third at 55.0 percent with a spread of 9.9, followed by GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp, Muse Spark 1.2 and Inkling, with per-trial average cost and time columns and a footnote that Gemini 4 Argon's cache hit rate is much lower due to a non-production setting.

Bagaimana posisi Anda jika Anda benar-benar membutuhkan agen dengan horizon panjang saat ini

Anda tidak dapat menyebut Gemini 4 Argon, jadi pertanyaan praktisnya bukanlah Argon versus apa pun — melainkan model mana yang seharusnya Anda jalankan untuk pekerjaan yang dipakai untuk benchmark Argon. Urutan FrontierSWE sendiri menjawabnya: GPT-6 Astra memuncaki papan dengan 65,5% tetapi dengan $1.029,65 per uji coba, sekitar sepuluh kali biaya dua model di bawahnya, sementara Claude Opus 5.5 memberikan 62,3% dengan $98,87. Pilihan terbaik dari segi nilai pada benchmark ini adalah Opus 5.5, dan itu juga model yang mengalahkan Argon di Artificial Analysis dengan biaya per tugas yang lebih rendah.

Kedua model itu, dan sebagian besar dari sepuluh besar di papan peringkat — GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp dan Muse Spark 1.2 di antaranya — dapat dirutekan melalui satu API OrcaRouter bersama 200-an lainnya — satu kunci, markup 0%, jadi harga daftar penyedia adalah yang Anda bayar dan pemotongan harga vendor langsung berlaku di sisi kami pada hari yang sama. Properti terakhir itu lebih bernilai daripada biasanya pada model pra-GA: jika harga Argon berubah antara sekarang dan GA, yang mungkin terjadi menurut catatan kaki cache non-produksi, tidak ada yang berubah pada integrasi Anda saat itu terjadi. Failover otomatis adalah bagian lain yang cocok untuk kasus spesifik ini — model yang belum dikenal yang mode kegagalannya belum dipetakan siapa pun justru adalah hal yang tidak Anda inginkan berada di satu jalur produksi yang di-hard-code.

Untuk memperjelas satu hal: Gemini 4 Argon tidak ada di katalog kami. Pencarian pada API model publik kami untuk google/gemini-4-argon mengembalikan "model not found," dan tidak ada pihak lain yang menghostingnya juga — model ini dibatasi di balik Fairwind Program milik Google tanpa ID model yang dipublikasikan. Saat model itu dapat dipanggil, kami akan merutekannya, dan angka FrontierSWE di atas adalah alasan untuk menantikan hari itu alih-alih menunggunya. Model-model yang mengalahkannya sudah ada di sana.

Apa yang harus ditonton

Sinyal-sinyal yang akan mengubah ini dari sekadar apa-yang-kita-ketahui-sejauh-ini menjadi sebuah keputusan bersifat spesifik. ID model yang diterbitkan beserta kartu tarifnya. Tanggal ketersediaan umum. Pengujian ulang FrontierSWE dalam pengaturan produksi, yang akan menentukan apakah biaya $129,36 per percobaan merupakan tarif nyata atau artefak dari konfigurasi cache yang ditandai Proximal. Dan, idealnya, evaluator kedua yang menerbitkan jejak Argon sehingga pengamatan "Eureka!" tidak lagi menjadi sampel dari satu.

Sampai saat itu, ringkasan yang jujur bersifat sempit dan layak dipertahankan: Gemini 4 Argon telah diumumkan, model ini luar biasa ekspresif dalam jejak agen jangka panjang menurut seorang evaluator, dan pada satu-satunya tolok ukur independen yang dapat kami periksa, ia finis ketiga di belakang dua model — salah satunya mengalahkannya dalam skor dan biaya sekaligus.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari