Kartu judul hero bertuliskan "Gemini 4 Argon vs Claude Opus 5.5 — pemisahan benchmark", dengan strip tanggal bertuliskan "Argon diumumkan 2026-09-30" dan "Opus 5.5 dirilis 2026-09-22", lencana bertuliskan "Argon: pilot terdefinisi, bukan ketersediaan umum", dan baris footer bertuliskan "Angka Argon dilaporkan vendor; angka indeks kedua model menurut Artificial Analysis."
Guides & Insights

Gemini 4 Argon vs Claude Opus 5.5: Perpecahan Benchmark yang Tidak Diduga Siapa pun

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Gemini 4 Argon dan Claude Opus 5.5 tidak setuju tentang siapa yang lebih baik, dan ketidaksetujuan itu bukan sekadar derau. Pada Intelligence Index milik Artificial Analysis, keduanya terpaut lima poin dengan keunggulan bagi Opus 5.5. Pada Vals Index — papan dampak ekonomi berbobot GDP — Gemini 4 Argon berada di posisi nomor satu dan Claude Opus 5.5 berada di posisi nomor tiga, di belakang baik Argon maupun Claude Sonnet 5.5. Kedua papan itu mengukur dua model yang sama pada minggu yang sama. Itulah keseluruhan artikelnya: mana yang harus Anda pilih bergantung pada apakah pekerjaan Anda lebih mirip pertanyaan ujian atau hari Selasa di sebuah firma hukum, dan pada apakah Anda sama sekali punya akses API ke Argon, yang per hari ini hampir tidak dimiliki siapa pun.

Google mengumumkan Gemini 4 Argon pada 2026-09-30 dalam postingan DeepMind yang dikreditkan kepada Koray Kavukcuoglu, SVP untuk Google DeepMind dan Chief AI Architect. Anthropic merilis Claude Opus 5.5 delapan hari sebelumnya, pada 2026-09-22. Salah satunya adalah rilis GA yang dapat Anda panggil sore ini. Yang satunya lagi adalah peluncuran bertahap kepada kelompok pembela siber yang disebutkan namanya plus para insinyur Google sendiri, dengan niat yang dinyatakan untuk menjangkau "pelanggan API berbayar dan pelanggan Google AI Ultra" begitu guardrail siap dan tanpa tanggal yang disematkan untuk itu.

Jawaban satu baris, sebelum perincian

Jika Anda membutuhkan penalaran umum terbaik yang terukur saat ini dan Anda membutuhkannya pada kunci produksi, Claude Opus 5.5 tersedia di OrcaRouter sekarang juga dan Gemini 4 Argon tidak ada di API publik mana pun. Jika Anda membangun untuk agen keuangan, hukum, pajak, atau coding yang dinilai berdasarkan keluaran ekonomi per dolar, angka Argon lebih baik dan harganya seperlima dari Opus 5.5 per tugas di satu-satunya papan peringkat yang mengukur persis hal itu. Jika Anda berkecimpung dalam pertahanan keamanan siber untuk infrastruktur kritis, Argon memiliki program yang dapat Anda lamar dan jawabannya mungkin ya.

Dari mana setiap angka sebenarnya berasal

Dua papan indeks, dua metodologi, dan penting untuk bersikap tepat tentang mana yang mana karena kedua kubu akan saling mengutip pernyataan masa lalu selama berbulan-bulan.

• Artificial Analysis Intelligence v4.3 — Claude Opus 5.5 pada 57,6 dan Claude 4 Argon pada 52,6, keduanya diambil dari Artificial Analysis pada 2026-09-30. Ini adalah komposit dari sepuluh evaluasi, yang sengaja bersifat umum untuk berbagai tugas, dan ini adalah papan yang paling banyak dikutip orang sebagai peringkat "the".

• Indeks Vals, diperbarui 2026-09-29 — Gemini 4 Argon pertama pada 68,90% (±0,97), Claude Sonnet 5.5 kedua pada 67,04% (±0,92), Claude Opus 5.5 ketiga pada 66,97% (±0,89). Vals memberi bobot pada tugas keuangan, coding, hukum, dan pajak berdasarkan pangsa tiap sektor dari PDB AS, sehingga model yang biasa-biasa saja dalam teka-teki tetapi sangat baik dalam peninjauan kontrak dan pekerjaan spreadsheet akan mendapat skor bagus di sini.

Kesenjangan AA lima poin itu nyata dan tidak kecil. Kesenjangan Vals dua poin juga nyata, dan dengan interval kepercayaan yang tercetak di papan peringkat, 68,90 ±0,97 milik Argon berbanding 66,97 ±0,89 milik Opus 5.5 adalah pemisahan sekitar 1,5 galat baku — lebih baik daripada lempar koin, tetapi belum sampai pada tingkat yang sangat meyakinkan. Tidak ada papan yang salah. Keduanya mengukur pekerjaan yang berbeda.

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, Vals Index 68.90% (rank 1), price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, throughput 48.9 tok/s. Claude Opus 5.5 reads: AA Intelligence Index 57.6, Vals Index 66.97% (rank 3), price $4 / $20, cost per index task $5.98, output ceiling 128K tokens, throughput 92.2 tok/s. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis on 2026-09-30.

Satu catatan konfigurasi, dan ini melemahkan pembacaan selisih AA sebagai perbandingan model murni. Artificial Analysis menampilkan Gemini 4 Argon pada setelan upaya tinggi dan Claude Opus 5.5 pada "Adaptive Reasoning, Max Effort, Default Fallback". Keduanya bukan titik yang sama pada kedua tangga upaya, sehingga angka utama 57,6-versus-52,6 bukan perbandingan setara pada anggaran penalaran yang sepadan. Itu angka yang dipublikasikan kedua halaman, dan itu angka yang harus dikutip jika Anda bersikap adil terhadap Anthropic, tetapi itu bukan eksperimen terkontrol.

Biaya per tugas adalah titik di mana kesenjangannya menjadi tidak nyaman

Artificial Analysis juga menerbitkan penghitungan biaya untuk menjalankan rangkaian indeksnya, dan dalam hal ini kedua model tersebut jauh berbeda.

• Biaya per tugas indeks — Gemini 4 Argon $1,99 versus Claude Opus 5.5 $5,98.

• Biaya untuk menjalankan seluruh rangkaian indeks — Gemini 4 Argon $2,407 versus Claude Opus 5.5 $8,708.

• Harga daftar per juta token — Gemini 4 Argon $2 untuk input / $10 untuk output (tarif perkenalan yang dinyatakan Google, dengan input yang di-cache diskon 95%, jadi $0.10) versus Claude Opus 5.5 $4 untuk input / $20 untuk output.

• Throughput Gemini 4 48.9 token keluaran per detik, token pertama setelah 2.79 detik; Gemini 4 Opus 5.5 92. token keluaran per detik tetapi latensi token pertama sebesar 702 pada harness yang sama, yang merupakan pajak extended-thinking yang muncul secara terbuka.

• Vals biaya per proses — Gemini 4 Argon $15,68 dibandingkan Claude Opus 5.5 $32,14 pada kumpulan tugas berbobot GDP yang sama.

Ada satu kejanggalan yang perlu ditandai, bukan ditutup-tutupi: papan peringkat Vals mencantumkan tarif Argon sebesar $4 masuk / $20 keluar, sementara pengumuman Google menyatakan $2 masuk / $10 keluar untuk periode perkenalan. Tafsiran yang paling mungkin adalah bahwa Vals menampilkan tarif daftar standar dan Google menampilkan tarif promosi, tetapi itu adalah inferensi dan bukan pernyataan yang dipublikasikan oleh pihak mana pun. Jika anggaran Anda bergantung pada angka itu, tanyakan kepada Google.

Apa yang diklaim Argon dan apa yang telah diperiksa

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst reading that Gemini 4 Argon delivers frontier performance in complex workflows across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

Pos Google padat dengan angka, dan semuanya dilaporkan oleh vendor. Sejauh yang dapat saya temukan, tidak ada satu pun yang telah direproduksi secara independen, dan papan-papan independen di atas mengukur hal-hal yang berbeda dari yang dipilih Google untuk ditonjolkan. Dinyatakan sebagai klaim Google sendiri:

• DeepSWE v1.1 — 77.9%, digambarkan sebagai pencapaian mutakhir baru dalam rekayasa perangkat lunak jangka panjang di dunia nyata.

• Pemahaman video panjang LVBench — 91,7%, digambarkan sebagai yang paling mutakhir.

• AutomationBench (tolok ukur Zapier untuk tugas bisnis end-to-end) — peringkat #1 dengan 51,3%.

• Remediasi kerentanan CWE-bench v1 — berbagi posisi pertama pada 68%, berdasarkan hasil Gemini 3.8 Flash Cyber di papan v0.

• Gray Swan Indirect Prompt Injection — digambarkan sebagai yang terdepan, tanpa angka yang dipublikasikan dalam pos tersebut.

• Vals Finance Agent v2 dan Harvey's Legal Agent Benchmark — digambarkan sebagai terdepan, demikian pula tanpa angka yang dicetak dalam pengumuman.

Dua keluarga klaim yang memang memiliki dukungan independen adalah yang paling layak dipercaya: Vals mengonfirmasi posisi indeks dengan angka dan interval, dan Artificial Analysis mengonfirmasi indeks 52,6 dan harganya. Anekdot produktivitas internal — peningkatan 40% dibandingkan baseline yang dipublikasikan pada subrutin kuantum, lebih dari 300 TiB memori yang dibebaskan di seluruh armada Google oleh agen Argon — adalah hasil internal perusahaan tanpa uji eksternal, dan harus dibaca sebagai demikian.

Apa itu Opus 5.5, kalau selama ini kamu hidup di bawah batu

Claude Opus 5.5 adalah produk andalan Anthropic: konteks 1 juta token, output maksimum 128K, input multimodal untuk teks, gambar, dan file, extended thinking, penggunaan alat, serta output terstruktur. Model ini menggantikan Claude Opus 5 pada 2026-09-22 dan sorotan utama peluncurannya bisa dibilang adalah harga yang dipotong — tingkat ini justru turun, bukan naik, menjadi $4/$20 dengan pembacaan cache sebesar $0.20. Kini model ini dapat dirutekan di OrcaRouter tepat dengan tarif tersebut, harga daftar penyedia diteruskan dengan tanpa markup, dan perubahan harga vendor sampai ke pihak kami pada hari yang sama saat perubahan itu sampai ke pihak mereka.

Pada skor tingkat tugas yang dimiliki kedua model, gambarannya benar-benar seperti jungkat-jungkit, bukan kemenangan telak:

• Terminal-Bench 4.0 — Claude Opus 5.5 59.6% versus Gemini 4 Argon 57.1%.

• SciCode — Opus 5.5 66,6% versus Gemini Ar 61,8%.

• Humanity's Last Exam — Claude Opus 5.5 61,4% versus Gemini 4 Argon 57,1%.

• Penalaran konteks panjang — Claude Opus 5.5 84,7% versus Gemini 4 Argon 79,7%.

• CritPt — Claude Opus 5.5 31,7% versus Gemini 4 Argon 27,1%.

• Omniscience — Claude Opus 5.5 46.4 versus Gemini 4 Argon 42.4.

• GDPval — Claude Opus 5.5 1.846 versus Gemini 4 Argon 1.611.

• AutomationBench-AA — Gemini 4 Argon 77,5% versus Claude Opus 5,5 69,5%. Ini adalah satu-satunya skor tugas adu langsung di mana Argon jelas menang, dan ini juga keluarga tugas yang paling dekat dengan apa yang dihargai Vals Index.

Jadi, polanya konsisten: Opus 5.5 unggul dalam tangga penalaran bernuansa akademis, dan Argon unggul dalam eksekusi tugas end-to-end. Itu bukan lagi kontradiksi antara kedua papan peringkat. Itu adalah temuan yang sama yang diungkapkan dua kali.

Kemampuan yang tidak dibandingkan oleh siapa pun

Plafon keluaran Gemini 4 Argon adalah 1.000.000 token dalam satu lintasan, naik dari 64K pada generasi sebelumnya. Claude Opus 5.5 membatasi keluaran pada 128K. Keduanya memiliki jendela konteks 1M token, tetapi konteks dan keluaran adalah anggaran yang berbeda, dan ini adalah lompatan spesifikasi tunggal terbesar dalam pengumuman tersebut.

Apakah itu penting sepenuhnya bergantung pada apa yang Anda jalankan. Batas keluaran 128K sangat lapang untuk chat, tinjauan kode, ekstraksi terstruktur, dan langkah agen. Batas itu menjadi dinding keras untuk menghasilkan seluruh set patch migrasi, laporan audit lengkap, atau dokumen panjang dalam satu kali proses — alur kerja yang dipilih Google untuk menggambarkan peluncuran ini. Jika pipeline Anda merangkai dua puluh panggilan agar tetap berada di bawah batas, batas Argon akan menghemat latensi dan kode orkestrasi Anda. Jika tidak, Anda membayar untuk ruang cadangan yang tidak akan Anda gunakan.

Ketersediaan adalah variabel penentu, bukan kualitas

Inilah bagian dari perbandingan yang tidak disertai tolok ukur apa pun dan justru lebih penting daripada semuanya.

Gemini 4 Argon tidak tersedia secara umum. Postingan Google menyebutkan bahwa model ini sedang diluncurkan kepada pertahanan siber tepercaya melalui Program Fairwind, bahwa perusahaan tersebut terlibat dalam proses akses model pra-rilis sukarela pemerintah AS, dan bahwa akses yang lebih luas bagi pengembang, perusahaan, dan konsumen akan hadir "secepat mungkin", dimulai dengan pelanggan API berbayar dan pelanggan Google AI Ultra. Tidak ada pengenal model, tidak ada endpoint, tidak ada kuota yang dipublikasikan, dan tidak ada tanggal. Model ini tidak ada di katalog kami dan juga tidak ada di API publik pihak lain mana pun, jadi halaman harga untuk Argon belum ada.

Claude Opus 5.5 dirilis hari ini. Di OrcaRouter, model ini adalah anthropic/claude-opus-5.5, diakses melalui endpoint yang kompatibel dengan OpenAI yang sama seperti lebih dari 200 model lain di katalog, dengan failover otomatis antar penyedia saat satu rute mengalami penurunan, dan DSL perutean untuk kasus saat Anda ingin mengirim sebagian lalu lintas ke Opus 5.5 dan sisanya ke tempat lain dengan kunci yang sama. Tidak perlu kontrak kedua, tidak perlu SDK kedua.

A capture of the OrcaRouter model page for Anthropic: Claude Opus 5.5, showing the Anthropic provider, a release date of 2026-09-22, a 1,000,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $4.00 input / $20.00 output per million tokens with cache reads at $0.20 and cache writes at $5.00.

Rekomendasi praktis untuk bulan depan memang tidak glamor: bangun di atas Opus 5.5, simpan nama model Anda dalam nilai konfigurasi alih-alih literal string, dan letakkan model murah di balik jalur percobaan ulang Anda agar lonjakan latensi pada proses token pertama selama 702 detik tidak ikut menjatuhkan produk Anda. Poin terakhir itu bukan teoretis — latensi token pertama Opus 5.5 pada harness AA adalah sebelas menit, dan apakah itu artefak harness atau model yang benar-benar berpikir lebih lama daripada apa pun sebelumnya, anggaran timeout Anda harus ditetapkan berdasarkan angka itu, bukan berdasarkan pemasaran.

Apa yang akan mengubah putusan ini

Tiga hal, dalam urutan kemungkinan. Ketersediaan umum Argon dengan harga yang dipublikasikan, yang akan membuat argumen biaya segera dapat ditindaklanjuti dan akan menguji apakah $2/$10 bertahan saat bersentuhan dengan lalu lintas nyata. Sebuah uji coba independen yang dapat direproduksi dari DeepSWE v1.1 dan CWE-bench v1 di luar Google, yang akan mengonfirmasi klaim vendor atau membantahnya. Atau konfigurasi Artificial Analysis dari Argon pada pengaturan upaya tertingginya, yang akan menentukan apakah selisih indeks lima poin merupakan perbedaan kapabilitas atau artefak pengaturan upaya.

Sampai salah satunya terwujud, ringkasan yang jujur adalah bahwa Opus 5.5 adalah model yang verifikasinya lebih baik dan Argon adalah klaim yang harganya lebih baik. Mana di antara itu yang benar-benar bisa Anda gunakan hari ini bukanlah pilihan yang sulit.

Claude Opus 5.5 sudah aktif di OrcaRouter dengan tarif daftar dari vendor tanpa markup, bersama seluruh katalog lainnya — jika Anda ingin mengukur performanya terhadap beban kerja Anda sendiri alih-alih terhadap papan peringkat, anthropic/claude-opus-5.5 adalah id yang perlu dipanggil, dan menggantinya dengan model lain nanti cukup mengubah satu baris pada kunci yang sama.

Dibandingkan dalam artikel ini3

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari