Kartu judul hero bertuliskan "Gemini 4 Argon — anak tangga mana dari tangga Gemini 4?", dengan tangga vertikal berisi lima anak tangga berperingkat yang mencantumkan Claude Opus 5.5 pada 57.6, Gemini 4 Argon pada 52.6, GPT-6 Astra pada 52.7, Gemini 3.8 Flash pada 40.9 dan Gemini 3.1 Pro Preview pada 29.7, lencana bertuliskan "Tidak ada Gemini 4 Ultra — halaman Ultra mengalihkan ke paket langganan", dan baris footer bertuliskan "Angka indeks menurut Artificial Analysis, revisi v4.3.2; Argon tidak dapat dipanggil di API publik mana pun."
Guides & Insights

Tingkat Argon dalam Tangga Gemini 4 — dan Mengapa Tidak Ada G4 Ultra

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Jawaban singkat untuk pertanyaan yang memulai tulisan ini adalah bahwa Gemini 4 Argon adalah model teratas Goog​le dan bukan tier teratasnya, karena tier di atasnya belum ada — dan mungkin tidak dalam bentuk yang diharapkan siapa pun. Goog​le telah menerbitkan tepat satu model Gemini 4, Argon, dan satu-satunya halaman pihak pertama di domainnya sendiri di bawah jalur /models/gemini/ultra/ sama sekali bukan halaman model: halaman itu mengalihkan ke paket langganan Goog​le AI. Pengalihan itu adalah fakta paling berguna di artikel ini, dan dapat diperiksa dalam satu baris dari terminal. Sisanya di sini membahas di mana posisi Argon sebenarnya begitu Anda berhenti membaca harganya sebagai label tier dan mulai membacanya sebagai angka.

Dua hal itu benar sekaligus dan mudah tertukar. Argon adalah Gemini paling mumpuni yang ada, dan Argon bukanlah model tingkat terdepan. Ia mengungguli setiap model Google yang telah dirilis, dengan selisih yang cukup lebar sehingga perbandingannya sebenarnya bukanlah perbandingan, dan ia masuk ke Intelligence Index milik Artificial Analysis dalam selisih sepersekian poin dari dua flagship pesaing yang keduanya sendiri tertinggal lima poin penuh dari pemimpin saat ini. Google menetapkan harganya seolah-olah posisinya satu tingkat di bawah garis terdepan, dan pengukuran independen menyetujuinya. Jadi, harga tersebut bukan keputusan pemasaran yang meremehkan model itu. Itu adalah pernyataan yang akurat tentang model tersebut.

Ini adalah artikel tentang apa yang kita ketahui sejauh ini. Gemini 4 Argon diumumkan pada 2026-09-30 dalam pos Google DeepMind yang dikreditkan kepada Koray Kavukcuoglu, dan produk ini diluncurkan pertama kali kepada kohort pembela siber tertentu yang disebutkan namanya melalui Program Fairwind milik Google — bukan untuk pengembang, bukan untuk perusahaan, bukan untuk konsumen, dan bukan untuk siapa pun yang memiliki kartu kredit. Tidak ada ID model untuknya di Gemini API, tidak ada endpoint, dan tidak ada harga per token yang dipublikasikan yang dapat ditagihkan kepada Anda. Pengenal model, throughput, dan keandalan yang diukur pada lalu lintas nyata tidak tersedia untuknya, yang berarti pengukuran di bawah ini hanyalah hasil uji benchmark satu laboratorium dan tidak lebih. Jika suatu angka berasal dari Google, angka itu diberi label sebagai milik Google; jika berasal dari Artificial Analysis, angka itu diberi label sebagai milik mereka. Tidak ada apa pun di sini yang boleh dibaca sebagai klaim bahwa Argon adalah produk yang dapat dibeli.

Tangga yang benar-benar dirilis Google, terbaca dari halaman-halamannya sendiri

Cara tercepat untuk menjawab “di mana posisi Argon dalam jajaran Gemini 4” adalah berhenti bertanya tentang jajaran itu dan mulai mendaftar model yang halaman-halamannya diterbitkan Google. Jajaran adalah konsep pemasaran; halaman adalah fakta. Berikut adalah ke mana jalur pihak pertama mengarah per 1 Oktober 2026.

• deepmind/models/gemini/pro/ mengembalikan 200 dan judulnya adalah "Gemini 3.1 Pro — Google DeepMind". Slot Pro di situs Google sendiri masih merupakan model generasi 3.1.

• deepmind.google/models/gemini/flash/ mengembalikan 200 dan judulnya adalah “Gemini 3.8 Flash — Google DeepMind”. Slot Flash sudah berpindah tiga kali — 3.5, 3.6, 3.7, 3.8 — sedangkan slot Pro sama sekali tidak berpindah.

• deepmind.google/models/gemini/argon/ mengembalikan 404. Argon tidak mendapatkan jalur per model. Berandanya adalah halaman keluarga di deepmind.google/models/gemini/, tempat Google menaruh model yang saat ini diunggulkannya.

• deepmind.google/models/gemini/ultra/ mengembalikan 302 dan berakhir di one.google.com/about/google-ai-plans/, halaman langganan konsumen. Hal yang sama juga berlaku pada jalur lama deepmind.google/technologies/gemini/ultra/. “Ultra” pada jalur model Google adalah tingkatan penagihan, bukan checkpoint.

• deepmind.google/models/gemini/nano/ mengembalikan 301 ke halaman keluarga Gemini. Tidak ada slot Nano sebagai halaman model mandiri juga.

• deepmind.google/models/gemini/model-cards/ — indeks yang dikelola Google atas setiap kartu model yang telah diterbitkannya — tidak memuat entri untuk Argon dan tidak memuat entri dengan “Gemini 4” pada namanya. Baris Gemini terbarunya adalah 3.8 Flash, 3.8 Audio, 3.7 Flash, 3.6 Flash, 3.5 Flash, 3.5 Flash-Lite, dan 3.1 Pro. Indeks kartu adalah dokumen yang paling lambat berubah dalam kumpulan ini, jadi diamnya bukanlah bukti bahwa Argon tidak akan pernah memiliki kartu; itu adalah bukti bahwa dokumen administrasinya belum menyusul pengumuman tersebut.

• deepmind.google/models/, indeks model, mencantumkan “Gemini 4 Argon” sebagai kartu unggulan dengan tagline “Era berikutnya kami dalam kecerdasan terdepan”, tepat di atas “Gemini 3.8 Flash — Terbaik untuk menangani tugas agentik kompleks dalam skala besar”. Dua kartu Gemini, terpaut satu generasi, dalam urutan itu.

Jika digabungkan, bentuk tangga itu tidak ambigu. Permukaan model publik Google saat ini memiliki satu entri di tingkat Gemini 4, satu entri di tingkat Gemini 3.8, tingkat Pro yang sudah usang tiga setengah generasi ke belakang, dan tidak ada apa pun di atas semua itu. Kata “Ultra” di domain Google mengarah ke langganan. Tidak ada halaman Gemini 4 Pro, tidak ada halaman Gemini 4 Flash, tidak ada halaman Gemini 4 Ultra, dan tidak ada kartu model Gemini 4. Google mengumumkan sebuah model, bukan sebuah keluarga.

Apakah ada Gemini 4 Ultra? Bukti-buktinya, dan apa yang akan memfalsifikasinya

Ini pantas mendapat bagiannya sendiri karena ini adalah bagian dari pertanyaan yang paling mungkin dijawab secara berbeda dalam sepekan, dan karena jawaban yang jujur memiliki masa kedaluwarsa.

Bukti negatifnya spesifik, bukan samar. Kode 302 pada jalur Ultra menuju halaman paket langganan bukan sinyal lemah; itu adalah pengalihan yang dikonfigurasi oleh tim web Google sendiri. Beberapa pola URL di blog.google untuk postingan Gemini 4 Ultra mengembalikan 404 — jalur products, jalur innovation-and-ai models-and-research, dan jalur pengumuman biasa. Penamaan Ultra punya preseden di sini, dan preseden itu bertentangan dengan Gemini 4 Ultra. Pengumuman Gemini pertama Google memperkenalkan Gemini 1.0 “dioptimalkan untuk tiga ukuran berbeda: Ultra, Pro, dan Nano”, dengan Gemini Ultra digambarkan sebagai “model terbesar dan paling mumpuni kami”. Postingan peluncuran yang menyebut tiga ukuran seperti itulah bentuk pengumuman satu keluarga. Postingan Argon menyebut satu model dan sama sekali tidak menyebut model saudara. Google kemudian menghentikan nama model Ultra dan beralih ke tingkatan numerik, lalu memindahkan kata itu ke sisi langganan bisnis, tempat kata itu sekarang menamai paket konsumen teratas. Halaman model yang mengalihkan ke halaman paket itulah wujud nama model yang sudah dipensiunkan ketika situs pemasaran di sekitarnya telah dibersihkan.

Juga tidak ada apa pun dalam pengumuman itu yang menjanjikan saudara yang lebih besar. Pos peluncuran Argon menggambarkan Argon sebagai “model terdepan baru kami” dan menjelaskan peluncuran bertahap, pekerjaan pengamanan, dan penerapan internal, lalu berhenti. Tidak disebutkan “yang pertama di keluarga Gemini 4”, tidak ada pratinjau Pro atau Ultra, dan tidak ada nama penerus. Pembingkaian Google sendiri memperlakukan Argon sebagai hal utamanya, bukan sebagai yang kecil.

Apa yang akan memfalsifikasi kesimpulan itu mudah dinyatakan dan layak dicermati, karena salah satu dari hal-hal ini akan membalikkannya dalam waktu sehari.

• Status 200 pada deepmind.google/models/gemini/ultra/ yang menampilkan halaman model alih-alih halaman paket, atau models/gemini/ jalur anak baru yang muncul bersama pro dan flash.

• Baris Gemini 4 Ultra yang muncul di indeks kartu model, yang secara historis merupakan cara Google mengonfirmasi bahwa sebuah model ada sebagai artefak yang didokumentasikan.

• ID model kedua di API Gemini di gemini-4-* namespace. Argon saat ini tidak punya, jadi ID Pro atau Ultra akan menjadi bukti pertama bahwa keluarga ini nyata.

• Entri dalam daftar model Artificial Analysis, atau tabel benchmark di halaman keluarga dengan kolom keempat. Keduanya melacak rilis Google cukup ketat untuk bisa lebih awal.

• Postingan pengumuman Google I/O, Cloud Next, atau DeepMind yang menggunakan kata “family” tentang Gemini 4. Postingan Argon tidak.

Sampai setidaknya salah satu dari hal-hal itu terjadi, sebuah artikel yang mengklaim Gemini 4 Ultra akan datang adalah prediksi yang menyamar sebagai laporan. Perlakukanlah sebagaimana mestinya, termasuk dari kami.

A two-column comparison scoreboard titled "Gemini 4 Argon vs Gemini 3.8 Flash — the scoreboard", with the left column showing Gemini 4 Argon at AA Intelligence Index 52.6, 1M context window, $2 input per million tokens, $10 output per million tokens, $1.99 cost per Index task and 142,374 output tokens per Index task, and the right column showing Gemini 3.8 Flash at AA Intelligence Index 40.9, 1M context window, $0.75 input, $3.75 output, $1.24 cost per Index task and 154,230 output tokens per Index task, with a footer reading "Both columns' Index, price, context, cost-per-task and token-use figures per Artificial Analysis, v4.3.2 revision."

Membaca tangga harga sebagai pernyataan tingkatan

Harga adalah satu bagian dari ini yang Google terbitkan dengan sengaja, disertai catatan kaki, dan itu adalah pernyataan paling jelas tentang maksud tier dalam seluruh peluncuran. Harga perkenalan Argon adalah $2 per juta token input dan $10 per juta token output, dengan input yang di-cache diskon 95%, dan catatan kaki pertama Google sendiri menyatakan bahwa setelah periode perkenalan yang tidak dapat didefinisikannya, “harga $4 per 1 juta token input dan $20 per 1 juta token output akan berlaku.”

Baca dua pasangan itu terhadap lapangan, dan klaim tingkatannya akan terbukti dengan sendirinya.

• $4 / $20 adalah harga daftar Claude Opus 5.5. Tarif pasca-perkenalan Google untuk Argon persis menyamai daftar tarif pemimpin terdepan saat ini, untuk model yang berjarak lima poin di belakangnya.

• $2 / $10 adalah rentang promosi yang sama-sama ditempati oleh GPT-6 Sol dan Claude Sonnet 5.5. Tarif perkenalan Argon adalah $2 / $10 yang sama, sehingga menempatkan harga peluncuran Argon pada rentang yang sama dengan Sol kelas menengah, bukan pada rentang frontier.

• $10 / $50 adalah posisi Claude Fable 5.1 dan GPT-6 Astra. Argon seperlima dari harga input Fable 5.1 dan seperlima dari harga outputnya, dan skornya hanya terpaut 0,8 darinya.

• $0.75 / $3.75 adalah Gemini 3.8 Flash. Argon adalah 2.7× dari itu untuk input dan 2.7× untuk output — peningkatan yang rapi, bukan jurang.

Jadi Google telah menetapkan harga Argon sebagai model yang berada di bawah $10/$50 dan di atas $0.75/$3.75, dengan titik stabil akhirnya di $4/$20. Tidak ada apa pun dalam tangga itu yang menyiratkan “frontier”. Tangga itu menyiratkan “puncak pita menengah, dengan angka utama yang akan stabil pada tarif yang sama seperti yang dikenakan pemimpin saat ini, untuk kemampuan yang lebih rendah.” Itu adalah pilihan komersial yang dapat dipertahankan. Ini bukan penetapan harga untuk model yang diposisikan dua tingkat lebih tinggi dari apa pun.

Satu poin struktural yang layak diingat: kenaikan harga Argon adalah kenaikan yang sesungguhnya, didefinisikan dalam catatan kaki, dan tanpa tanggal. Keluarga Sonnet 5.5 dan GPT-6 melakukan hal serupa dengan tingkat konteks panjang, dan Sol naik ke $4/$15 setelah 272K. Kenaikan Argon didasarkan pada waktu, bukan pada panjang konteks — tarif $2/$10 yang sama berlaku di seluruh jendela 1M dan hanya kalender yang mengubah tarifnya. Itu bentuk yang tidak biasa dan membuat perbandingan biaya apa pun terhadap Argon menjadi latihan dua kolom: periode yang mana, dan penggunaan yang mana.

{{1}}{{2}}Di mana Argon berdiri{{/2}} {{3}}dibandingkan{{/3}}{{/1}} {{4}}angka-angka yang ada{{/4}}

Artificial Analysis memiliki pengukuran terhadap Gemini 4 Argon yang cukup cepat tersedia sehingga menjadi satu-satunya bacaan independen yang ada. Pada revisi yang berlaku pada 1 Oktober — v4.3.2 — Argon mencetak skor 52,56 pada Intelligence Index, dikonfigurasi dengan upaya penalaran tinggi. Model-model di sekitarnya bukanlah sampel acak dari bidang tersebut.

• Claude Opus 5.5 berada di 57,62, diukur pada upaya maksimal dengan fallback. Itu lima koma sekian poin di atas Argon, dan itu adalah puncak papan peringkat saat ini.

• Claude Fable 5.1 berada di 53.35, diukur pada effort maksimum dengan fallback. Argon tertinggal 0.79 di belakangnya.

• GPT-6 Astra berada di 52,67, diukur pada maks. Argon tertinggal 0,11 di belakangnya.

• Claude Sonnet 5.5 berada di 55,98, juga maksimum dengan fallback. Itu adalah model kelas menengah yang mengungguli Argon dengan 3,4 poin, dan angka itulah yang seharusnya mengkhawatirkan siapa pun yang ingin mengklaim “Gemini 4 Argon adalah model terbaik kedua di dunia”.

• GPT-6 Sol berada di 47,63, diukur pada maksimum, pada jendela konteks 872K. Argon unggul 4,9 darinya.

• Gemini 3.8 Flash berada di angka 40,93 pada upaya tinggi. Argon unggul 11,6 darinya.

• Gemini 3.1 Pro Preview berada di 29,72. Argon unggul 22,8 darinya, yang merupakan pernyataan paling jelas tentang seberapa jauh tier Pro yang dirilis Google tertinggal dari risetnya sendiri.

Tiga hal muncul dari daftar itu. Pertama, Argon setara dengan dua penantangnya, Fable 5.1 dan Astra, dan jelas tertinggal di belakang dua model Anthropic — Opus 5.5 dan, yang lebih mengganggu, Sonnet 5.5. Kedua, selisih antara Argon dan model terbaik Google sendiri yang sudah dirilis adalah lompatan generasi terbesar dalam jajaran saat ini, jauh berbeda. Ketiga, pembingkaian sinyal bahwa "frontier setidaknya dua tingkat di depan" benar secara substansi tetapi sedikit meleset secara geometri: ada satu tingkat model yang jelas di depan Argon (Opus 5.5 pada 57.6) dan model kedua di tingkat yang lebih murah yang juga di depannya (Sonnet 5.5 pada 56.0), yang merupakan masalah lebih tajam daripada berada dua anak tangga di bawah pada tangga yang sebenarnya Argon pijak.

Kerangka membandingkan harga dalam pertanyaan awal — “harga menunjukkan ini setara dengan Sol/Sonnet milik mereka” — ternyata kurang lebih benar soal harga peluncuran dan salah soal harga akhirnya. Argon dibuka pada tarif Sol dan Sonnet 5.5 lalu menetap pada tarif Opus 5.5. Harganya dipatok sebagai model kelas menengah yang berniat menjadi model berharga kelas frontier, sementara dari sisi pengukuran tidak berada di keduanya.

Gambaran biaya per tugas adalah tempat Argon paling kuat dan tempat narasi tier mendapat dimensi kedua. Pada tugas Index, Argon berbiaya $1,99 dan menghasilkan 142.374 token keluaran. Opus 5.5 berbiaya $5,98 dan menghasilkan 338.099. Sonnet 5.5 berbiaya $7,62 untuk 599.849. Fable 5.1 berbiaya $7,63 untuk 187.455. Astra berbiaya $3,26 untuk 68.691. Gemini 3.8 Flash berbiaya $1,24 untuk 154.230. Argon adalah cara termurah untuk membeli skor yang mendekati frontier, dan ia lebih murah daripada model Flash yang berada di atasnya dalam hal skor dengan selisih kurang dari satu dolar per tugas.

Pengaturan upaya adalah tanda bintang pada semua hal di atas dan para pelaku di bidang ini tidak melaporkannya secara seragam. Argon diukur pada tingkat tinggi; Opus 5.5, Fable 5.1, dan Sonnet 5.5 pada tingkat maks dengan fallback; Astra dan Sol pada tingkat maks. Run dengan upaya tinggi dan run dengan upaya maks bukanlah pengukuran yang sama, dan tangga upaya Anthropic sendiri menggeser skor sebuah model beberapa poin di antara pengaturan. Jika Argon yang diukur pada upaya maks memperoleh skor yang secara signifikan di atas 52,6, argumen tier berubah. Belum ada yang mempublikasikan run itu.

Apa yang diklaim oleh tabel milik Google sendiri, dan bagaimana perbedaannya dengan tabel independen

Halaman keluarga Gemini memuat tabel performa yang ditulis Google dengan empat kolom — Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5 — dan sembilan belas baris benchmark. Ini adalah kumpulan klaim paling terperinci yang dipublikasikan Google untuk model ini, dan seluruhnya dilaporkan oleh vendor. Membacanya terhadap Index independen sangat memberi wawasan justru karena keduanya tidak sepakat tentang bentuk bidang ini.

• Di tabel Google, Argon memenangkan tiga belas dari sembilan belas baris secara mutlak atau seri di posisi pertama, termasuk Vals Index Knowledge work pada 68,9, AutomationBench pada 51,3, Harvey’s Legal Agent Benchmark pada 19,6, DeepSWE v1.1 pada 77,9, LABBench 2 pada 88,8, GraphWalks pada 99,7 untuk pita ≤128K dan 84,2 untuk pita 256K–1M, Agent’s Last Exam pada 39,5, LVBench pada 91,7 dan Chartography pada 71,6.

• Claude Opus 5.5 memenangkan baris-baris yang terbaca seperti rekayasa berkelanjutan: FrontierSWE v2 pada 62,3 melawan 55,0 milik Argon, Terminal-bench 4.0 pada 66,4 melawan 57,4, Terminal-Bench Science 0.1 pada 63,3 melawan 57,6, dan PostTrainBench pada 49,3 melawan 45,3.

GPT-6 Astra meraih Terminal-Bench Science 0.1 dengan skor 68,1 dan subset offline OSWorld-2.0 dengan 72,6, serta menyamai Argon pada CWE-bench v1 dengan 68,0. Claude Fable 5.1 kalah di setiap baris kecuali hasil seri bersama pada Vibe Code Bench.

• Pada Index independen, urutannya adalah Opus 5.5 lebih dulu, lalu Sonnet 5.5, lalu Fable 5.1, lalu Argon dan Astra praktis setara. Tabel Google sama sekali tidak memiliki kolom Sonnet 5.5, yang merupakan kelalaian paling berdampak di dalamnya: empat kolom tabel tersebut dipilih, dan model yang mengungguli Argon di Index dengan harga lebih rendah tidak termasuk di antaranya.

Tidak ada dari semua itu yang membuat tabel Google tidak jujur. Tabel benchmark vendor itu dipilih, bukan diambil sebagai sampel, dan begitu pula tabel setiap lab. Itu menjadikannya klaim, bukan pengukuran, dan itu berarti pertanyaan soal tier tidak bisa diselesaikan darinya. Satu-satunya tempat tabel itu benar-benar memikul beban untuk artikel ini adalah sisi negatifnya: sembilan belas baris, empat kolom, dan tidak ada kolom kelima untuk Ultra.

A screenshot of Google DeepMind's Gemini 4 Argon page scrolled to its Performance section, showing the Performance heading and the line “Frontier performance in complex workflows” above the vendor-reported benchmark table, whose four model columns are Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, with rows running from Vals Index and AutomationBench down through FrontierSWE v2 and Terminal-bench 4.0 to GraphWalks and Agent's Last Exam.

Satu hal tentang Argon yang sama sekali bukan pertanyaan tier

Setiap argumen tier di atas mengasumsikan Argon adalah model yang pada akhirnya dapat Anda panggil. Ada baiknya memisahkan hal itu dari pertanyaan positioning, karena keduanya memiliki jawaban yang berbeda dan hanya satu di antaranya yang berkaitan dengan kemampuan.

Batas token keluaran Argon adalah 1 juta token, naik dari 64K, dan Google menyatakannya secara langsung. Itu adalah plafon keluaran, bukan jendela konteks. Perbedaan ini penting karena keduanya terus-menerus dicampuradukkan dalam liputan peluncuran ini, dan karena batas keluaran 1M adalah klaim rekayasa yang berbeda dari jendela konteks 1M — yang pertama menyangkut berapa lama satu lintasan dapat berjalan, yang kedua menyangkut berapa banyak yang dapat Anda serahkan kepada model sekaligus. Google telah eksplisit soal batas keluaran dan bungkam soal jendela konteks. Artificial Analysis mencatat 1.000.000 token untuk konteks Argon juga, tetapi itu adalah isian pelacak tersebut dan bukan pernyataan Google, jadi perlakukan kedua angka itu sebagai berasal dari ruangan yang berbeda meskipun bunyinya sama.

Yang secara jelas tidak tersedia adalah akses. Argon tidak tersedia secara umum, tidak ada di Gemini API dengan pengenal apa pun, dan tidak ada di katalog pihak ketiga mana pun. Argon tersedia bagi pembela siber yang telah diverifikasi melalui Fairwind Program dan bagi para engineer Google sendiri, dan tahap berikutnya yang disebut Google — “dimulai dengan pelanggan API berbayar dan pelanggan Google AI Ultra” — tidak memiliki tanggal yang menyertainya. Anda tidak dapat melakukan benchmark terhadapnya pada beban kerja Anda sendiri. Karena itu, setiap angka dalam artikel ini adalah pengukuran orang lain atas model yang tidak dapat Anda gunakan.

Apa yang akan membuat Argon naik satu tingkat

Penilaian tier adalah gambaran sesaat, dan ada sekitar lima hal yang akan mengubah penilaian ini, dalam urutan kasar berdasarkan seberapa besar pengaruhnya.

• Uji coba upaya maksimal yang diukur secara independen. Argon saat ini adalah pengukuran upaya tinggi pada 52,56. Tangga upaya milik Anthropic sendiri menggeser sebuah model beberapa poin di berbagai setelan, dan jika model Google berperilaku serupa pada upaya maksimal, posisi Argon yang sebenarnya dibandingkan dengan Fable 5.1 dan Astra lebih baik daripada yang dinyatakan artikel ini. Inilah perubahan tunggal yang paling mungkin.

• Sumber pengukuran kedua. Satu pelacak adalah satu pengukuran. Lab independen kedua yang menilai Argon pada harness-nya sendiri akan lebih mendukung klaim tier daripada baris benchmark tambahan apa pun dari Google.

• Gemini 4 Pro. Jika Google membuka tingkat Pro dari generasi 4 di bawah Argon, jajaran produknya menjadi keluarga yang memiliki bentuk, posisi Argon tidak lagi menjadi “satu-satunya” dan mulai menjadi “yang teratas dari tiga”, dan setiap argumen dalam tulisan ini tentang keluarga yang hilang perlu ditulis ulang. Layak untuk diperhatikan, dan lebih dekat daripada pertanyaan Ultra.

• Harga yang tidak naik secara bertahap. Jika periode pengenalan itu sekadar tidak pernah berakhir — Google belum menetapkan kapan berakhirnya — harga tetap efektif Argon adalah $2/$10 alih-alih $4/$20, dan keunggulan biaya per tugasnya dibanding Opus 5.5 melebar dari sekitar 3× menjadi sekitar 6×. Itu peristiwa komersial, bukan peristiwa kemampuan, tetapi itu mengubah gambaran keputusan pengadaan.

• Kartu model Argon, kartu sistem, atau halaman metodologi evaluasi. Tabel performanya menautkan ke halaman metodologi di domain Google; kartu model yang lengkap akan mencatat jendela konteks, konfigurasi deployment, dan envelope keselamatan secara resmi, dan akan menjadi artefak pertama yang memungkinkan seseorang di luar kohort Fairwind memeriksa angka-angka Google alih-alih sekadar membacanya.

Sebaliknya, hal yang paling mungkin membuat Argon turun bukanlah tolok ukur sama sekali. Hal itu adalah liputan Bloomberg tanggal 30 September, yang mengutip karyawan Google dengan akses ke model tersebut yang mengatakan bahwa model itu tampil kurang baik dalam pekerjaan nyata dibandingkan yang disiratkan oleh skornya. Klaim itu belum diverifikasi oleh siapa pun di luar Google dan bukanlah sebuah pengukuran, tetapi klaim semacam itu adalah jenis klaim yang dapat dikonfirmasi atau dipatahkan oleh tolok ukur independen kedua. Sampai saat itu, klaim tersebut tercatat sebagai tuduhan dengan media yang disebutkan namanya dan sumber yang tidak disebutkan namanya, dan hal itu termasuk dalam pembahasan tier karena model yang kesenjangan antara tolok ukur dan lapangannya diperdebatkan tidak dapat dipromosikan hanya berdasarkan tolok ukur.

Apa artinya ini jika Anda memilih model bulan ini

Tanpa argumen positioning, gambaran praktisnya cukup lugas sehingga satu paragraf sudah cukup untuk mencakupnya. Gemini 4 Argon adalah Gemini terbaik yang pernah dibuat Google dan tidak tersedia untuk Anda, jadi model Google yang benar-benar bisa Anda pilih saat ini adalah model yang sudah dirilis: Gemini 3.8 Flash, yang mengukur 40,93 pada Index dengan harga $0,75/$3,75, dan Gemini 3.1 Pro Preview, yang mengukur 29,72 dengan harga $2/$12. Jika Anda membutuhkan Gemini sekarang, itulah pilihan sebenarnya, dan Argon tidak termasuk di dalamnya.

Jika Anda memilih lintas vendor daripada di dalam Google, tidak ada apa pun dalam pengumuman Argon yang mengubah keputusan hari ini. Puncak Index adalah Claude Opus 5.5 pada 57.62, dengan Claude Sonnet 5.5 pada 55.98 tepat di belakangnya dengan tarif seperlima untuk input dan setengah untuk output. Gemini 4 Argon pada 52.56 tidak memiliki jalur ke aplikasi Anda, jadi ini bukan kandidat, seberapa pun bagusnya skor yang akhirnya diperoleh.

A screenshot of Google's own Google AI plans page, showing the three consumer Google AI plans side by side — Google AI Plus at $4.99/mo with 400 GB storage, Google AI Pro at $19.99/mo with 5 TB storage, and Google AI Ultra from $99.99/mo starting at 20 TB of storage — each with a “View plan benefits” link, illustrating that “Ultra” on Google's domain names a subscription plan rather than a Gemini model.

OrcaRouter adalah satu API di depan lebih dari 200 model dengan harga daftar dari penyedia yang diteruskan tanpa markup dan failover otomatis antar penyedia, yang berarti keputusan beralih model tidak memerlukan penataan ulang apa pun: ID di badan permintaan adalah keseluruhan perubahannya. Model-model Google di katalog kami saat ini adalah yang benar-benar telah dirilis Google — google/gemini-3.8-flash, google/gemini-3.6-flash, google/gemini-3.5-flash dan google/gemini-3.1-pro-preview. Gemini 4 Argon bukan salah satunya dan tidak akan menjadi salah satunya selama tidak memiliki pengenal model publik dan kartu tarif yang diterbitkan, jadi tidak seorang pun boleh menganggap ada klaim perutean dalam apa pun di atas. Ketika Google menempatkan Argon di API dengan ID, itu menjadi pertanyaan perutean. Sampai saat itu, versi jujur dari jawaban OrcaRouter adalah bahwa hal itu belum berlaku, dan hal berguna yang dilakukan katalog untuk keputusan khusus ini adalah memungkinkan Anda membandingkan harga model yang benar-benar dapat dipanggil secara berdampingan tanpa membuka empat akun untuk mengetahuinya.

Intinya

Gemini 4 Argon adalah andalan Google dan bukan model terdepannya. Model ini mencetak 52,56 pada Indeks v4.3.2 Artificial Analysis pada upaya tinggi — setara dengan Claude Fable 5.1 dan GPT-6 Astra, tertinggal lima poin dari Claude Opus 5.5, dan berada di belakang Claude Sonnet 5.5, model yang lebih murah dari lab pesaing. Google menetapkan harganya pada $2/$10 sebagai harga perkenalan, lalu naik menjadi $4/$20, yang menempatkan tarif akhirnya persis sama dengan Claude Opus 5.5 untuk kemampuan yang secara terukur lebih rendah. Keunggulannya sebesar 11,6 poin atas Gemini 3.8 Flash adalah celah antargenerasi terlebar di jajaran Google sendiri dan merupakan bukti terkuat bahwa generasi Gemini 4 adalah peningkatan nyata, bukan sekadar penggantian label.

Mengenai pertanyaan yang memicu semua ini: tidak ada Gemini 4 Ultra. Jalur Ultra Google di domainnya sendiri mengalihkan ke halaman paket langganan, indeks kartu model sama sekali tidak memuat entri Gemini 4, setiap pola URL pengumuman untuk postingan Gemini 4 Ultra menghasilkan 404, dan postingan peluncurannya mengumumkan satu model tanpa menjanjikan sebuah keluarga model. Itu adalah temuan nyata dan merupakan bukti pihak pertama, bukan inferensi, tetapi juga fakta dengan waktu paruh yang pendek — satu respons 200 pada satu jalur saja membalikkannya, dan tingkat Pro dari generasi Gemini 4 adalah yang lebih mungkin muncul lebih dulu.

Dua catatan untuk dibawa keluar dari artikel ini. Setiap angka Argon di sini adalah pengukuran orang lain terhadap model yang tidak dapat dipanggil oleh siapa pun di luar kohort pembela siber yang telah diverifikasi, dan tabel sembilan belas baris milik Google sendiri adalah klaim, bukan pengukuran — berguna sebagaimana adanya, dan bukan pengganti Index yang independen. Dan putusan yang adil atas pertanyaan tier bersifat sementara: Argon diukur pada upaya tinggi, bukan maks, dan eksekusi dengan upaya maks adalah cara termurah yang mungkin agar artikel ini keliru.

Dibandingkan dalam artikel ini4

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari