Kartu judul hero bertuliskan "Gemini 4 Argon vs GPT-6 Sol — seperlima harganya, empat kali tagihannya", dengan chip bertuliskan "Argon $2 / $10", "Sol $2 / $10" dan "Biaya per tugas indeks $1.99 vs $1.05", serta baris footer bertuliskan "Angka Argon dilaporkan vendor; angka indeks menurut Artificial Analysis, dibaca 2026-10-01." Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Gemini 4 Argon vs GPT-6 Sol: Seperlima Harga, Empat Kali Lipat Tagihannya

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Jalankan suite indeks Artificial Analysis pada Gemini 4 Argon dan hasilnya ditagih $2,407. Jalankan suite yang sama pada GPT-6 Sol dan hasilnya ditagih $1,546. Indeks yang sama, tugas yang sama, minggu yang sama. Kedua model memiliki harga daftar yang identik — $2.00 per juta token masukan dan $10.00 per juta token keluaran, Argon sebagai tarif perkenalan yang dinyatakan dari Google dan Sol sebagai tarif tetap OpenAI — namun biaya akhir untuk melakukan pekerjaan yang identik berbeda 56%, yang menguntungkan model yang skornya lima poin lebih rendah. Kesenjangan itulah alasan utama perbandingan ini layak ditulis, dan itu sama sekali tidak ada kaitannya dengan kartu tarif.

Google mengumumkan Gemini 4 Argon pada 2026-09-30, menyebutnya sebagai era berikutnya dari kecerdasan terdepan, dengan harga $2 untuk input dan $10 untuk output, dengan input yang di-cache diskon 95%, dan diluncurkan kepada para pembela siber tepercaya melalui Fairwind Program. GPT-6 Sol telah tersedia secara umum sejak 2026-09-22, ketika OpenAI merilis tier menengah dari lini GPT-6 dengan harga $2 untuk input dan $10 untuk output dengan diskon cache 90%. Salah satunya dapat dibeli hari ini di endpoint yang kompatibel dengan OpenAI dan yang lainnya tidak dapat dibeli oleh siapa pun di luar kelompok yang disebutkan, yang merupakan percabangan praktis dalam artikel ini. Namun, pembalikan biaya di atas tetap bertahan bahkan jika Anda mengesampingkan ketersediaan sepenuhnya, dan memahami alasannya adalah bagian yang berguna.

Inversi, dinyatakan secara gamblang

Artificial Analysis menerbitkan Intelligence Index sekaligus rincian biaya untuk menjalankan indeks tersebut. Jika dibaca bersama, keduanya menyatakan ini:

• Indeks Kecerdasan — Gemini 4 Argon 52,6 versus GPT-6 Sol 47,5. Selisih lima poin, diukur dengan Argon dicatat pada pengaturan upaya tinggi dan Sol pada maks, sehingga perbandingan ini lebih menguntungkan Sol daripada Argon.

• Harga daftar per juta token — identik. $2.00 masuk / $10.00 keluar pada keduanya. Pembacaan cache adalah satu-satunya perbedaan: $0.10 pada Argon, $0.20 pada Sol.

• Biaya per tugas pengindeksan — Gemini 4 Argon $1.99 dibandingkan dengan GPT-6 Sol $1.05. Argon memerlukan biaya sekitar dua kali lipat per tugas meskipun biaya per tokennya sama.

• Biaya untuk menjalankan suite lengkap — Gemini 4 Argon $2,407 dibandingkan dengan GPT-6 Sol $1,546.

• Kecepatan keluaran terukur — GPT-6 Sol 77,0 token per detik dibandingkan dengan Gemini 4 Argon 48,9, perbedaan 1,6× yang terlihat pada latensi maupun biaya.

Ada satu baris dalam daftar itu yang menjelaskan semua baris lainnya, dan itu bukan harganya. Itu adalah jumlah token. Pada tugas indeks itu sendiri, Gemini 4 Argon menghasilkan sekitar 561.000 token keluaran per tugas; GPT-6 Sol menghasilkan sekitar 282.000. Argon berpikir dua kali lebih lama untuk menjawab pertanyaan yang sama, dan pada tarif per token yang identik, itu tepat dua kali lipat tagihannya.

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Sol. The Gemini 4 Argon column reads: AA Intelligence Index 52.6, price $2 in / $10 out per million tokens, cost per index task $1.99, output tokens per task 561K, output speed 48.9 tok/s, max output 1M tokens. The GPT-6 Sol column reads: AA Intelligence Index 47.5, price $2 in / $10 out, cost per index task $1.05, output tokens per task 282K, output speed 77.0 tok/s, max output 128K tokens. A footer line reads that the prices are vendor list prices and the index figures are per Artificial Analysis, read 2026-10-01.

Mengapa token-token itu adalah harganya

Inilah koreksi yang layak diinternalisasi sebelum siapa pun menganggarkan migrasi, karena intuisinya berjalan ke arah yang salah. Ketika sebuah model dihargai sama dengan pesaingnya dan mengonsumsi token output dua kali lipat untuk menyelesaikannya, harga per token bukanlah harga yang sesungguhnya. Harga adalah harga per token dikalikan dengan berapa banyak token yang diputuskan model untuk dibelanjakan, dan faktor kedua itu adalah properti model, bukan kartu tarifnya.

Margin per tugas sangat bervariasi, yang memperburuk keadaan — Anda tidak dapat menerapkan pengali yang seragam lalu langsung melanjutkan:

• Terminal-Bench 4.0 — Argon 165.330 token keluaran per tugas dibandingkan Sol 97.372. Argon memakan biaya $6,78 per tugas di sini dibandingkan Sol $4,00, meskipun Argon mencetak skor 57,1% sedangkan Sol 43,9%.

• CritPt — Argon 109.533 token berbanding 31.848 milik Sol. Rasio token 3,4× pada tugas yang mana Sol justru meraih skor lebih tinggi, 30,9% berbanding 27,1%.

• GDPval — Argon 74.571 token berbanding 41.567 milik Sol, sebesar $1,82 per tugas berbanding $1,32.

• Omniscience — rasio token 938 versus 2.662 yang membuat Argon diunggulkan, dengan biaya $0,010 per tugas dibandingkan $0,027 milik Sol. Satu-satunya keluarga tugas yang arahnya berbalik.

• Penalaran konteks panjang — Argon 2.197 token dibandingkan 954 milik Sol, dan satu-satunya tugas dalam rangkaian ini di mana Sol jelas menang pada skor, 83,7% berbanding 79,7%.

CritPt adalah yang memberi pelajaran. Model yang menghabiskan tiga setengah kali jumlah token untuk menghasilkan jawaban yang sedikit lebih buruk untuk pertanyaan yang sama bukanlah narasi kemampuan; itu narasi kebiasaan pengeluaran. Penalaran Argon berjalan panjang, dan pada beberapa bentuk tugas panjang itu berubah menjadi skor dan pada yang lain ia hanya berubah menjadi dolar. Angka indeks 52,6 dan Sol 47,5 adalah agregat, dan agregat menyembunyikan tepat hal ini.

Dari mana sebenarnya kelima poin itu berasal

Karena kesenjangan indeks dan kesenjangan biaya menunjuk ke arah yang berlawanan, penting untuk mengetahui tugas mana yang mendorong masing-masing.

• Terminal-Bench 4.0 — Gemini 4 Argon 57,1% versus GPT-6 Sol 43,9%. Kemenangan tunggal terbesar Argon, dan keluarga tugas yang paling dekat dengan pengodean agentik jangka panjang.

• Kemahatahuan — Gemini 4 Argon 42.4 versus GPT-6 Sol 27.1. Selisih lima belas poin pada cakupan faktual, kesenjangan proporsional terbesar dalam rangkaian ini.

• AutomationBench-AA — Gemini 4 Argon 77,5% versus GPT-6 Sol 61,6%.

• SciCode — Gemini 4 Argon 61,8% versus GPT-6 Sol 57,6%.

• Ujian Terakhir Umat Manusia — Gemini 4 Argon 57,1% versus GPT-6 Sol 47,9%

• GDPval — Gemini 4 Argon 1.611 versus GPT-6 Sol 1.487.

• ApexAgents / AA-Briefcase — GPT-6 Sol 1.482,78 Elo melawan 1.493,84 milik Argon, selisih 11 poin yang berada di dalam interval kepercayaan yang dipublikasikan dan seharusnya disebut seri.

• Penalaran konteks panjang — GPT-6 Sol 83,7% versus Gemini 4 Argon 79,7%. Satu kemenangan jelas milik Sol.

• CritPt — GPT-6 Sol 30,9% versus Gemini 4 Argon 27,1%. Sol kembali menang, meski dengan selisih tipis.

Jadi bentuknya bukan "Argon lebih baik". Yang terjadi adalah Argon lebih baik pada dua hal yang menjadi andalan materi peluncurannya — eksekusi tugas bisnis secara end-to-end dan rekayasa perangkat lunak jangka panjang — dan Sol setara atau unggul pada tangga penalaran yang bernuansa akademis serta dalam mempertahankan koherensi di sepanjang konteks yang panjang. Bagi pembaca yang beban kerjanya adalah pipeline retrieval dengan prompt 400K token, Sol sekaligus merupakan model yang lebih baik dan yang lebih murah, sebuah posisi yang tidak biasa dan nyaman untuk berada di dalamnya.

Perbedaan spesifikasi yang bertahan lebih lama daripada diskusi benchmark

• Output maksimum — Gemini 4 Argon 1.000.000 token dalam satu lintasan, yang digambarkan Google sebagai yang terbesar di industri dan peningkatan dari batas 64K generasi sebelumnya. GPT-6 Sol 128.000 token.

• Jendela konteks — kartu vendor GPT-6 Sol menyatakan sekitar 1.050.000 token; milik Argon 1.000.000. Artificial Analysis mengukur Sol pada 872.000 token melalui harness-nya, yang merupakan pengukuran harness dan bukan angka pada kartu — perlakukan kartu sebagai spesifikasi dan angka harness sebagai apa yang sebenarnya dijalankan oleh evaluator.

• Modalitas masukan — keduanya menerima teks, gambar, dan berkas. Materi peluncuran Argon juga mengandalkan pemahaman video panjang, di mana Google mengklaim 91,7% pada LVBench dan menyebutnya sebagai yang tercanggih; itu adalah angka yang dilaporkan vendor dan belum ada dewan independen yang mereproduksinya.

• Input video — Lemah. Artificial Analysis menampilkan Argon dalam bagan dengan input video dinonaktifkan dan menyebut video secara eksplisit saat peluncuran, sedangkan kartu Sol sama sekali tidak mencantumkan video. Jika video menjadi penopang utama dalam pipeline Anda, tidak ada kartu yang bisa memastikannya dan Anda sebaiknya menguji sebelum merancang arsitektur.

• Upaya penalaran — Sol menyediakan upaya yang dapat dikonfigurasi (dari none hingga max, default medium) di API dan diplot pada max. Argon diplot pada high; belum ada yang mempublikasikan rangkaian pengujian yang sama pada pengaturan tertingginya.

Batas keluaran 1 juta token adalah yang benar-benar dapat mengubah arsitektur, bukan anggaran. Apa pun yang saat ini Anda pecah menjadi belasan panggilan berantai agar tetap di bawah batas 128K — kumpulan patch multi-file, laporan audit lengkap, dokumen panjang dalam satu kali proses — menjadi satu panggilan dengan lebih sedikit tempat bagi loop agen untuk kehilangan status. Apakah itu sepadan dengan biaya per tugas yang dua kali lipat sepenuhnya bergantung pada apakah Anda memiliki beban kerja tersebut. Jika ya, kemungkinan besar itu sepadan. Jika panggilan Anda bersifat klasifikasi-dan-kembalikan, itu uang yang dihabiskan untuk ruang cadangan yang tidak akan ditempati siapa pun.

Setelan upaya yang tak tertandingi, dan mengapa itu penting

Satu catatan perlu mendapat paragrafnya sendiri karena hal ini menyanggah pembacaan celah indeks lima poin sebagai perbedaan kemampuan murni. Artificial Analysis menampilkan Gemini 4 Argon pada setelan upaya penalaran high dan GPT-6 Sol pada max. Keduanya bukan tingkat yang sama pada kedua tangga itu, dan arah ketidaksesuaiannya menarik: Sol dijalankan pada setelan termahalnya, sedangkan Argon pada setelan menengah.

Ada dua tafsiran, dan data tidak dapat memisahkan keduanya. Entah Argon pada max akan mendapat skor lebih tinggi dari 52,6 — tetapi juga menghabiskan lebih dari 561.000 token per tugas dan berbiaya lebih dari $1,99 — atau skornya kira-kira sama, yang berarti dial upaya tidak banyak berpengaruh pada suite ini. Tidak ada proses uji yang dipublikasikan yang bisa memastikannya. Siapa pun yang mengutip 52,6 sebagai batas atas Argon sedang mengutip sebuah konfigurasi, bukan model, dan konfigurasi itu adalah yang dipilih vendornya untuk dipublikasikan lebih dulu.

Logika yang sama berlaku untuk Sol 47.5, hanya saja dalam arah sebaliknya: max berada di puncak jenjangnya, jadi angka itu lebih dekat ke plafon daripada ke lantai. Pertarungan yang adil dengan upaya yang sepadan dapat mempersempit selisih, dan juga dapat membalik perbandingan biaya, karena token yang dibakar max adalah token yang berbiaya $10 per juta.

Percabangan ketersediaan, yang menentukan jawaban sebenarnya

Gemini 4 Argon tidak tersedia secara umum. Pengumuman Google menyebutkan bahwa model ini diluncurkan secara bertahap kepada sekelompok pembela siber tepercaya melalui Fairwind Program, bahwa perusahaan terlibat dalam proses akses model pra-rilis sukarela pemerintah AS, dan bahwa akses umum bagi pengembang, perusahaan, dan konsumen akan hadir "secepat mungkin", dimulai dari pelanggan API berbayar dan pelanggan Google AI Ultra. Tidak ada pengidentifikasi model, tidak ada endpoint, tidak ada kuota, dan tidak ada tanggal. Ini tidak ada di API publik mana pun, termasuk milik kami — periksa katalognya dan akan menghasilkan 404, karena itu belum ada di sana.

GPT-6 Sol adalah produk yang dapat dipanggil. Di OrcaRouter, ia adalah openai/gpt-6-sol, pada endpoint yang kompatibel dengan OpenAI yang sama seperti lebih dari 200 model lain di katalog, dengan harga daftar OpenAI yang diteruskan dengan markup nol, jadi $2/$10 di atas dan langkah konteks panjang 272.000 token menjadi $4/$15 adalah yang sebenarnya Anda bayar, bukan seperti yang diklaim kartu tarif. Failover otomatis antar penyedia menangani kasus ketika rute menurun di tengah proses, dan DSL perutean memungkinkan satu aplikasi mengirim lalu lintas klasifikasinya yang murah ke model yang lebih kecil dan lalu lintas penalaran sulitnya ke Sol tanpa SDK kedua.

A capture of the OrcaRouter model page for openai/gpt-6-sol, listed by OpenAI with a 2026-09-22 date, a 1M-token context window, a 128K-token maximum output, text, image and file input, and pricing of $2.00 per million input tokens and $10.00 per million output tokens.

Penataan terakhir itu adalah jawaban jujur untuk perbandingan ini bagi sebagian besar tim. Argumen biaya untuk Argon memang nyata, tetapi hanya berlaku pada beban kerja yang didominasi pekerjaan agen jangka panjang; argumen biaya yang menentangnya nyata pada setiap beban kerja lainnya; dan lagipula, Anda tidak bisa membelinya bulan ini. Langkah murahnya adalah membangun harness evaluasi sekarang — prompt Anda sendiri, penilaian Anda sendiri, dijalankan terhadap Sol pada beberapa setelan upaya — sehingga saat Argon menjangkau pelanggan API berbayar, Anda memiliki jawaban terukur untuk pertanyaan yang akan dijawab orang lain dari papan peringkat.

Apa yang bisa menyelesaikannya

Tiga hal, dalam urutan seberapa besar pengaruhnya terhadap putusan. Ketersediaan umum Argon pada harga yang nyata, bukan harga perkenalan — kata "perkenalan" berarti $2/$10 bisa berubah, dan urutan Google sendiri menempatkan pelanggan API berbayar lebih dulu, jadi tarif pertama yang dipublikasikan setelah peluncuran adalah yang perlu dicermati. Satu hasil uji Artificial Analysis yang dipublikasikan atas Argon pada pengaturan upaya tertingginya, yang akan menunjukkan apakah 52.6 adalah batas atas atau sedikit di bawahnya. Dan satu reproduksi independen atas angka DeepSWE v1.1 — Google mengklaim 77.9% dan menyebutnya sebagai state of the art baru; angka itu dilaporkan vendor dan belum direproduksi di luar Google per hari ini.

Sampai saat itu, pembagiannya rapi dan sedikit ironis. GPT-6 Sol adalah model yang lebih terverifikasi, yang lebih cepat, yang lebih murah per tugas yang diselesaikan, dan yang bisa Anda panggil sore ini. Gemini 4 Argon adalah model dengan skor lebih tinggi di papan peringkat yang dipilih vendornya untuk dipublikasikan, kira-kira dua kali lebih mahal untuk benar-benar digunakan, dan belum dijual. Memilih di antara keduanya bukanlah penilaian tentang kemampuan. Ini adalah penilaian tentang kalimat mana dari kedua kalimat itu yang menggambarkan bulan Anda.

A capture of the Artificial Analysis model page for Gemini 4 Argon (High), dated September 2026 and credited to Google, marked a proprietary model. It reports an Artificial Analysis Intelligence Index score of 53, pricing of $2.00 per million input tokens and $10.00 per million output tokens with a 95% cache discount, an average cost of $1.99 per task on the Intelligence Index, a 1M-token context window, and text and image input.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari