Kartu judul bertuliskan “Grok 4.7 vs Gemini 3.1 Pro” dengan subjudul “Papan peringkat bergeser; modelnya tidak”, dan tiga kartu: AA Index v4.3.2 46 vs 30, Harga standar per 1M $2/$6 vs $2/$12, dan Status GA vs pratinjau.
Guides & Insights

Grok 4.7 vs Gemini 3.1 Pro: Papan Peringkat Bergeser, Modelnya Tidak

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada 19 Februari 2026, Artificial Analysis menerbitkan artikel berjudul "Gemini 3.1 Pro Preview: Pemimpin baru dalam AI." Model itu memimpin enam dari sepuluh evaluasi dan unggul empat poin dari Claude Opus 4.6. Buka halaman model yang sama hari ini dan angkanya adalah 30, berada di peringkat keenam puluh sembilan dari 200. Vendor tidak mengubah apa pun. Yang berubah adalah alat ukurnya: Artificial Analysis merevisi Intelligence Index miliknya ke v4.3.2 pada 19 September 2026, menilai ulang setiap model dalam katalog terhadap kumpulan evaluasi yang berbeda, dan pemimpin Februari menjadi pemain tengah September sementara model itu sendiri tetap tidak tersentuh dalam pratinjau. Itulah latar belakang perbandingan dengan Grok 4.7 — dirilis oleh vendor pada 21 September 2026 — dan itulah alasan pertandingan ini kurang tentang model mana yang lebih pintar, melainkan tentang mana dari keduanya yang masih dapat Anda andalkan akan tetap menjadi hal yang sama bulan depan.

Apa sebenarnya masing-masing dari ini

Gemini 3.1 Pro adalah model tingkat Pro terbaru Google dan belum pernah mencapai ketersediaan umum. Model ini dirilis sebagai gemini-3.1-pro-preview pada 19 Februari 2026, dan tabel penonaktifan Google masih mencantumkannya dengan "tanggal penghentian belum diumumkan" — sebuah pratinjau yang kini sudah berstatus pratinjau selama tujuh bulan sementara Google merilis rangkaian Flash di bawahnya: 3.5 Flash pada Mei, 3.6 pada Juli, 3.7 pada Agustus, 3.8 pada September. Tidak ada model Pro GA yang lebih baru daripada Gemini 3 Pro. Model ini membawa jendela masukan 1.048.576 token dan batas atas keluaran 65.536 token, menerima masukan teks, gambar, video, audio, dan PDF dengan keluaran teks, serta menyediakan kontrol tingkat pemikiran pada rendah, sedang, dan tinggi tanpa parameter anggaran dan tanpa pengaturan minimal. Bobotnya tertutup.

Grok 4.7 baru berusia sehari dan juga berbobot tertutup. Model ini memiliki konteks 500k token — setengah dari milik Gemini — dan menerima masukan teks serta gambar, sehingga sama sekali tidak dapat menyerap video atau audio, yang merupakan perbedaan kemampuan paling mencolok dalam perbandingan ini. Harganya tercantum $2.00 per juta token masukan dan $6.00 per juta token keluaran untuk prompt di bawah 200k token, naik menjadi $4.00 dan $12.00 di atas ambang itu, dengan pembacaan cache $0.50 dan $1.00; xAI juga mencantumkan varian yang lebih cepat dengan kecepatan keluaran kira-kira dua kali lipat dan harga dua kali lipat. Tidak ada angka keluaran maksimum yang dipublikasikan untuknya dalam dokumentasi yang diperiksa di sini.

Sang penguasa bergerak. Itulah ceritanya.

Kedua model saat ini dinilai pada Artificial Analysis Intelligence Index v4.3.2, yang menggantikan Terminal-Bench 2.1 dengan Terminal-Bench 4.0 dan tau3-Banking dengan AutomationBench-AA, serta menambatkan ulang skala Elo GDPval-AA. Angka setiap model berubah ketika indeks itu dirilis. Angka Gemini 3.1 Pro bergeser lebih jauh daripada kebanyakan model, karena kekuatannya pada Februari terkonsentrasi pada evaluasi yang oleh indeks baru dihentikan atau bobotnya diubah. Membaca kedua kolom secara berdampingan hari ini:

Komposit — Grok 4.7 (xhigh): 46 pada Artificial Analysis Intelligence Index v4.3.2. Gemini 3.1 Pro Preview: 30 pada revisi yang sama, berada di peringkat #69 dari 200.

Konteks panjang — Grok 4.7: jendela 500k, AA-LCR v1.1 77%. Gemini 3.1 Pro: jendela 1M — dua kali lebih besar — dan batas keluaran 65K yang kira-kira setengah dari yang biasanya dibutuhkan sesi agentik konteks panjang.

Modalitas masukan — Grok 4.7: teks dan gambar. Gemini 3.1 Pro: teks, gambar, video, audio, dan PDF. Tidak dekat, dan bukan kesenjangan benchmark — kesenjangan kemampuan.

Kecepatan — Grok 4.7: belum ada pengukuran yang dipublikasikan. Gemini 3.1 Pro: 124,4 token keluaran per detik, peringkat #39 dari 200, dengan waktu ke token pertama 63,62 detik melalui Google AI Studio.

Harga, tingkatan standar — Grok 4.7: $2.00 masuk / $6.00 keluar per 1 juta. Gemini 3.1 Pro: $2.00 masuk / $12.00 keluar. Input identik, output dua kali lipat.

Harga, tier konteks panjang — Grok 4.7: naik dua kali lipat menjadi $4.00 / $12.00 pada 200k token prompt. Gemini 3.1 Pro: naik bertahap ke $4.00 / $18.00 pada batas 200k yang sama. Input sama, output 50% lebih banyak.

Kematangan — Grok 4.7: baru sehari, tolok ukur dari vendor sebagian besar belum direproduksi. Gemini 3.1 Pro: sudah tujuh bulan di pasar, tetapi masih versi pratinjau tanpa komitmen GA dan tanpa tanggal penghentian.

OrcaRouter model page for Gemini 3.1 Pro Preview showing the google/gemini-3.1-pro-preview identifier, a 1M-token context window, a 65K maximum output, audio, file, image, text and video input with text output, and list rates of $2.00 per 1M input and $12.00 per 1M output.

Masalah pratinjau kini menjadi masalah yang nyata

Pratinjau selama tujuh bulan akan menjadi keanehan, bukan risiko, jika tidak ada yang salah dengannya. Ada yang salah. Mulai 18 September 2026, pengguna mulai melaporkan bahwa Gemini 3.1 Pro telah hilang dari pemilih model AI Studio, dan hingga tulisan ini dibuat belum ada tanggapan dari staf Google, tidak ada pemberitahuan penghentian, dan tidak ada penyebab yang dinyatakan — sebuah insiden ketersediaan yang belum terselesaikan, bukan penghentian yang terkonfirmasi. Bandingkan itu dengan riwayat pengumuman: Google menyatakan di I/O pada Mei 2026 bahwa Gemini 3.5 Pro "akan diluncurkan bulan depan," dan laporan pers pada akhir Agustus menyebut model itu dibatalkan karena kandidat internal "tidak cukup lebih baik daripada seri Flash." Halaman Pro milik Google sendiri masih mengiklankan "3.5 Pro segera hadir," yang merupakan kontradiksi dalam satu layar. Apa pun penyelesaiannya, pembacaan praktisnya adalah bahwa Gemini 3.1 Pro adalah endpoint pratinjau tanpa tanggal GA, tanpa penerus yang disebutkan, dan dengan tanda tanya ketersediaan saat ini.

Risiko Grok 4.7 adalah cerminan sebaliknya dan lebih kecil dalam jenisnya. Umurnya baru satu hari, jadi angkanya masih tipis — Artificial Analysis belum menerbitkan pengukuran kecepatan atau latensi, dan rangkaian tolok ukur milik xAI untuk model ini belum direproduksi secara independen. Yang tidak dipertanyakan adalah bahwa model ini tersedia secara umum, memiliki harga, terdokumentasi, dan identitasnya stabil. Model yang identitasnya stabil dan angkanya belum terbukti jauh lebih mudah untuk dijadikan fondasi daripada model yang angkanya sudah dipublikasikan tetapi ketersediaannya tidak stabil.

Berapa biaya perpecahan itu, dalam praktiknya

Asumsikan Anda sedang memilih untuk pipeline dokumen. Untuk 100k token input dan 8k output, Grok 4.7 berbiaya $0.20 untuk input dan $0.048 untuk output — sekitar seperempat dolar. Gemini 3.1 Pro berbiaya $0.20 untuk input dan $0.096 untuk output — sekitar tiga puluh sen. Keduanya hanya terpaut dua puluh persen, dan jika dokumen Anda berupa hasil pindai, PDF, audio, atau video, Gemini adalah satu-satunya dari keduanya yang setidaknya dapat membacanya. Itu bukan argumen benchmark; itu mengakhiri perbandingan untuk beban kerja tersebut.

Kini anggap Anda memilih untuk agen konteks panjang. Pada input 300k dan output 8k, Grok 4.7 berbiaya $1,20 untuk input dan $0,096 untuk output, sekitar $1,30. Gemini 3.1 Pro berbiaya $1,20 untuk input dan $0,144 untuk output, sekitar $1,35. Praktis identik — dan di sini jendela 1M milik Gemini serta batas output 65K menjadi kendala yang menentukan, karena batas 65K adalah titik ketika proses agen jangka panjang ambruk. Tidak ada model yang menjadi opsi murah dalam pertandingan ini, dan tidak ada pula yang mahal menurut standar frontier.

Two-column scoreboard titled “Grok 4.7 vs Gemini 3.1 Pro - the scoreboard”: AA Index 46 vs 30, context 500k vs 1M, input modality “text + image” vs “text + image + video + audio + PDF”, max output “not stated” vs 65k, price per 1M $2/$6 vs $2/$12, and status GA vs preview.

Menghindari target yang bergerak

OrcaRouter menyediakan Gemini 3.1 Pro, yang tercantum di halaman modelnya sendiri dengan tarif penyedia — $2,00 masuk dan $12,00 keluar, dengan jendela 1M dan keluaran maksimum 65k — karena kami meneruskan harga daftar penyedia dengan markup 0%. Itu bukan sekadar kalimat pemasaran dalam kasus seperti ini: Google memiliki build pratinjau dengan durasi yang belum ditetapkan harganya yang ketersediaannya goyah pada September, dan hal berguna yang dilakukan sebuah router adalah menjaga integrasi tetap stabil sementara hal di baliknya berubah. Failover otomatis berarti endpoint pratinjau yang berhenti merespons menjadi peristiwa perutean alih-alih gangguan layanan, dan DSL perutean memungkinkan Anda menyusun model multimodal dengan model khusus teks dalam satu panggilan — yang persis merupakan bentuk yang disarankan pasangan ini, Gemini membaca video dan Grok melakukan penalaran atas transkripnya. Grok 4.7 tidak ada dalam katalog OrcaRouter pada saat penulisan ini; memanggilnya hari ini berarti harus melalui API xAI sendiri dan platform pihak ketiga yang menyediakannya.

Pola yang layak dibangun: pertahankan Gemini 3.1 Pro untuk apa pun yang harus menyerap video, audio, atau PDF, dan anggap status preview-nya sebagai risiko operasional yang perlu diakali, bukan alasan untuk menghindarinya. Tempatkan Grok 4.7 pada pekerjaan teks dan gambar, tempat harga outputnya yang lebih rendah dan skor kompositnya yang lebih tinggi berlaku, dan tempat model yang Anda integrasikan hari ini adalah model yang masih akan Anda panggil enam bulan lagi. Satu hal yang tidak boleh dilakukan adalah membaca peringkat ke-69 sebagai vonis terhadap model — itu adalah vonis terhadap revisi benchmark, dan revisi yang sama yang menurunkan peringkat Gemini 3.1 Pro juga menurunkan puluhan model yang tidak pernah disentuh Google.

Panggilan

Pada indeks saat ini, Grok 4.7 memimpin Gemini 3.1 Pro dengan selisih enam belas poin, dan pada harga output, biayanya setengah di tier standar dan sepertiga lebih murah di tier konteks panjang. Jika beban kerja Anda berupa teks dan gambar, itu sudah cukup untuk memutuskannya. Jika beban kerja Anda berupa video, audio, atau dokumen hasil pindai, Gemini 3.1 Pro adalah satu-satunya kandidat di antara keduanya dan perbandingannya berhenti di situ — Anda membeli sebuah kemampuan, bukan skor. Peringatan yang semestinya menyertai keduanya adalah tentang asal-usul, bukan performa: yang satu adalah pratinjau berusia tujuh bulan tanpa tanggal GA dan dengan insiden ketersediaan pada September di belakangnya, yang lain baru berusia sehari dengan angka utama dan tanpa reproduksi independen untuk hal lainnya. Tidak ada yang merupakan pilihan yang sudah mapan. Keduanya layak dirutekan ketimbang dijadikan komitmen.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari