Kartu judul hero bertuliskan "GPT-6 vs Gemini 3.1 Pro", dengan chip bertuliskan "Gemini 3.1 Pro: dalam pratinjau sejak 2026-02-19", dua baris harga bertuliskan "GPT-6 Sol $2 / $10" dan "Gemini 3.1 Pro $2 / $12", serta footer bertuliskan "Angka indeks menurut Artificial Analysis v4.3.2; item GPT-6 yang dilaporkan vendor dilabeli dalam teks." Logo OrcaRouter dikomposisikan di sudut kanan bawah.
Guides & Insights

GPT-6 vs Gemini 3.1 Pro: Lini Pro Google Belum Merilis Model Baru Sejak Februari

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Gemini 3.1 Pro telah berada di daftar harga Google selama tujuh setengah bulan dan belum pernah keluar dari pratinjau. Model ini diumumkan pada 19 Februari 2026, masih dilayani melalui endpoint bernama Gemini 3.1 Pro Preview, dan hingga hari ini tidak ada komitmen ketersediaan umum maupun tanggal penghentian — dua tanggal yang akan memberi tahu Anda posisi model ini dalam rencana vendornya sendiri. Sebaliknya, GPT-6 Sol dirilis pada 22 September 2026, dan pada 7 Oktober 2026 model itu menjadi model di balik tingkat berbayar dari peluncuran global ChatGPT kepada lebih dari 1,2 miliar pengguna mingguan.

Jadi perbandingan utamanya bukanlah antara dua tingkatan flagship. Ini adalah antara produk yang sudah dirilis dan pratinjau tanpa batas waktu, dan perbedaan itu ternyata lebih bernilai daripada selisih benchmark-nya. Letakkan keduanya berdampingan pada Intelligence Index v4.3.2 milik Artificial Analysis, dan pratinjau berusia tujuh bulan milik Google mencetak 29,7 versus 47,6 milik GPT-6 Sol sambil membebankan biaya 1,25× lebih mahal per tugas indeks yang diselesaikan — $1,30 versus $1,04. Kedua angka itu nyata, dan keduanya perlu disertai catatan sebelum Anda mengeluarkan uang untuk keduanya.

Yang membuat ini layak dibaca alih-alih diabaikan adalah bahwa pratinjau ini memang memenangkan beberapa hal. Ia mengalahkan GPT-6 Sol pada GPQA Diamond, pada penggunaan alat agentik τ²-Bench, dan pada satu pengukuran konteks panjang — dan ia menerima audio dan video sebagai masukan, yang tidak dilakukan GPT-6 Sol. Pratinjau berusia tujuh bulan yang masih memenangkan dua dari empat pertarungan bukanlah model yang bisa diabaikan. Ini adalah model yang siklus hidupnya, bukan kemampuannya, yang menjadi masalah.

Angka-angkanya, dan peringatan revisi yang harus menyertainya.

Artificial Analysis menjalankan ulang rangkaian pengujiannya dan menerbitkan ulang skor berdasarkan revisi indeks terkini, yang berarti model yang sama dapat memuat dua angka berbeda tergantung kapan Anda membacanya. Untuk Gemini 3.1 Pro, variasi itu luar biasa lebar: liputan sebelumnya tentang model ini melaporkan 57 pada revisi lama, sedangkan halaman seperti saat ini melaporkan 29.7 pada v4.3.2. Kedua angka itu asli dan keduanya berada di situs web yang sama.

Itu penting karena hanya angka dari revisi yang sama yang dapat dikurangkan. Angka 29.7 dan 47.6 adalah pasangan yang harus digunakan di sini, karena keduanya berasal dari v4.3.2 — run yang sama yang memberi skor Claude Opus 5.5 sebesar 57.6 dan GPT-6 Astra sebesar 52.7. Pembacaan dari run yang sama, satu baris per dimensi:

• Indeks Kecerdasan, v4.3.2 — GPT-6 Sol 47,6 vs Gemini 3.1 Pro 29,7
• Biaya per tugas indeks yang diselesaikan — Gemini 3.1 Pro $1,30 vs GPT-6 Sol $1,04; model yang lebih lama 25% lebih mahal per jawaban yang diselesaikan
• Harga input — $2,00 per 1 juta token pada keduanya, setara pada angka utamanya
• Harga output — GPT-6 Sol $10,00 vs Gemini 3.1 Pro $12,00; Sol 17% lebih murah
• Klausul konteks panjang — GPT-6 Sol menetapkan harga ulang seluruh permintaan pada $4,00/$15,00 di atas 272.000 token input; Gemini 3.1 Pro naik ke $4,00/$18,00 di atas 200.000
• Jendela konteks — GPT-6 Sol 1.050.000 token vs Gemini 3.1 Pro 1.048.576, praktis setara
• Output maksimum — GPT-6 Sol 128.000 token vs Gemini 3.1 Pro 65.536; Sol hampir dua kali lipat
• Modalitas input — GPT-6 Sol teks, gambar, file vs Gemini 3.1 Pro teks, gambar, audio, video, PDF

A two-column comparison scoreboard for GPT-6 Sol and Gemini 3.1 Pro, showing GPT-6 Sol at an Intelligence Index of 47.6, $1.04 per index task and a 128,000-token output ceiling, against Gemini 3.1 Pro at 29.7, $1.30 and 65,536 tokens, with input and output prices of $2.00/$10.00 against $2.00/$12.00 and a preview-since-2026-02-19 chip. A footer reads "Index figures per Artificial Analysis v4.3.2; Gemini 3.1 Pro is a preview product."

Dua baris di sana layak dijabarkan karena keduanya membalik pembacaan yang tampak jelas. Baris biaya-per-tugas menyatakan bahwa kartu tarif yang tampak lebih murah justru dimiliki oleh model yang lebih mahal per pekerjaan yang diselesaikan — tarif output $12 Gemini 3.1 Pro ditambah volume penalarannya melakukan lebih banyak pekerjaan daripada yang disiratkan oleh tarif input utamanya sebesar $2. Dan langkah konteks panjang perlu dibaca ulang dari kedua sisi: tingkat Gemini 3.1 Pro dimulai pada 200.000 token, lebih rendah daripada 272.000 milik GPT-6 Sol, tetapi menetapkan ulang harga output menjadi $18,00 sedangkan Sol menetapkan ulang harga menjadi $15,00. Keduanya bukan kartu tarif datar, dan titik persilangannya tidak sejajar.

Di mana pratinjau masih unggul

Model Google bukanlah peninggalan kuno. Tarik evaluasi yang dibawa kedua kartu itu:

• GPQA Diamond — Gemini 3.1 Pro 94,1% vs GPT-6 Sol, tidak ada angka sebanding yang dipublikasikan pada revisi ini
• τ²-Bench penggunaan alat agentik — Gemini 3.1 Pro 95,6% vs GPT-6 Sol, tidak dipublikasikan di papan peringkat yang sama
• recall konteks panjang — Gemini 3.1 Pro 82,0% vs GPT-6 Sol 83,7%, selisih 1,7 poin
• SciCode — Gemini 3.1 Pro 58,7% vs GPT-6 Sol 57,6%, praktis setara
• Terminal-Bench 4.0 — Gemini 3.1 Pro 4,0% vs GPT-6 Sol 43,9%; satu-satunya kategori di mana versi pratinjau tidak kompetitif

A screenshot of the Artificial Analysis leaderboard: the top of the table under the Model, Context Window, Creator, Intelligence Index, Cost per Task, Tokens/s, First Chunk and Response headings - Claude Opus 5.5 (max with fallback) at 58, Claude Sonnet 5.5 at 56, Claude Fable 5.1 at 53, GPT-6 Astra (max) at 53 and $3.26, Gemini 4 Argon (high) at 53 and GPT-6.1 Sol (max) at 52 and $0.72 - with the Gemini 3.1 Pro Preview row set below it, showing an index of 30 at $1.30 per index task, 67M tokens generated and 22M output tokens at 23.40 tokens per second.

GPQA Diamond 94,1% dan skor penggunaan alat agenik 95,6% adalah angka terdepan, bukan angka generasi lama, dan itulah alasan selisih indeks sebesar 17,9 poin melebih-lebihkan jarak praktisnya. Indeks ini adalah komposit dari sepuluh evaluasi, dan kekalahan Gemini 3.1 Pro terkonsentrasi di area yang bobot suite-nya sangat besar pada rekayasa perangkat lunak — Terminal-Bench 4.0 pada 4,0% adalah outlier katastrofik di samping SciCode-nya yang 58,7% dan Terminal-Bench 2.1-nya yang 73,8%. Model yang mencetak skor mendekati puncak pada satu benchmark agenik dan mendekati dasar pada penerusnya sedang memberi tahu Anda tentang tanggal pelatihannya, bukan batas atas kemampuannya.

Input audio dan video adalah keunggulan konkret lainnya, dan ini merupakan gerbang, bukan gradien. Jika pipeline Anda menerima rekaman rapat atau tangkapan layar sebagai input, Gemini 3.1 Pro dapat memasukinya dan GPT-6 Sol tidak bisa. Kepemimpinan indeks, sebesar apa pun, tidak dapat menggantikan hal itu.

Apa yang "masih dalam pratinjau" merugikan Anda, secara konkret

Status pratinjau bukan sekadar label kosmetik, dan biayanya adalah jenis yang baru muncul setelah Anda membangun sesuatu di atasnya.

Endpoint pratinjau tidak membawa komitmen ketersediaan umum, yang berarti vendor belum berjanji bahwa model tersebut masih akan tersedia sesuai jadwal yang bisa Anda rencanakan. Endpoint itu juga tidak mencantumkan tanggal penghentian, yang terdengar seperti sisi baiknya — tidak ada yang akan dipensiunkan — tetapi bisa dibaca sebaliknya juga: Goo​gle belum menerbitkan siklus hidup untuk model yang telah berada dalam status ini sejak Februari sementara merilis model kelas Flash sepanjang periode yang sama. Gemini 3.8 Flash, Gemini 3.5 Flash-Lite, lini 3.6 dan 3.8 Flash: tier Pro tetap seperti semula, dan penerusnya justru hadir sebagai Gemini 4 Argon, yang diumumkan Goo​gle pada 30 September 2026 dalam peluncuran bertahap kepada kohort mitra keamanan yang disebutkan namanya, juga tanpa tanggal ketersediaan umum.

Itulah pola yang sebenarnya menjadi inti perbandingan ini. Jika Anda membangun pipeline yang tahan lama di Gemini 3.1 Pro Preview, Anda membangun di atas model yang vendornya sendiri belum mengatakan kapan model itu akan lulus dari status preview, digantikan, atau dipensiunkan. Posisi GPT-6 Sol justru sebaliknya: ini adalah produk API yang tersedia secara umum dengan daftar harga yang dipublikasikan, dan sejak 7 Oktober 2026 produk ini juga menjadi default di aplikasi yang digunakan sebagian besar rekan Anda. Dilaporkan oleh vendor dan belum direproduksi, Ope​nAI mengatakan bahwa di ChatGPT GPT-6 menyusun jawaban menggunakan teks, grafik, bagan, dan kontrol interaktif melalui kemampuan yang disebutnya Intelligent UI, jawaban yang memerlukan penelusuran web mulai 44% lebih cepat daripada GPT-5.6 Instant, dan tingkat upaya Extra High mulai merespons secepat GPT-5.6 pada Medium. Tidak ada satu pun dari itu yang mengubah integrasi API. Semua itulah sebabnya GPT-6 kini menjadi default yang selalu hadir dan versi preview tidak.

Ada juga versi sederhana dari argumen ini. Anda membayar 25% lebih mahal per tugas yang diselesaikan, dengan skor kemampuan yang lebih rendah, untuk model yang siklus hidupnya tidak dideklarasikan. Kontra-argumennya nyata — Anda mendapatkan GPQA Diamond pada 94,1% dan input audio — tetapi itu argumen spesifik untuk beban kerja spesifik, bukan alasan umum untuk memilih model yang lebih lama.

Menguji pratinjau tanpa bertaruh padanya

Kesalahan yang perlu dihindari pada model yang berada di posisi Gemini 3.1 Pro adalah memperlakukan "haruskah kita menggunakannya" sebagai satu keputusan biner. Padahal bukan. Gemini 3.1 Pro Preview dan GPT-6 Sol sama-sama berada di katalog OrcaRouter di balik satu endpoint yang kompatibel dengan OpenAI dan satu kunci, dengan markup 0% di atas harga daftar penyedia — jadi versi preview ini adalah sesuatu yang dapat Anda pasang di jalur permintaan nyata, ukur terhadap beban kerja Anda sendiri, dan pertahankan atau lepaskan tanpa kontrak vendor kedua atau perubahan kode.

Failover otomatis adalah yang membuat hal itu aman bagi model dengan siklus hidup pratinjau. Arahkan lalu lintas audio dan video ke Gemini 3.1 Pro, satu-satunya di antara keduanya yang dapat menerima input tersebut; arahkan lalu lintas rekayasa perangkat lunak dan keluaran panjang ke GPT-6 Sol; dan konfigurasikan fallback sehingga jika endpoint pratinjau dihentikan, dibatasi lajunya, atau harganya diubah secara diam-diam, permintaan akan mendarat pada model yang tersedia secara umum alih-alih gagal. Itulah struktur yang layak didapat oleh pratinjau berusia tujuh bulan — bukan penghindaran, melainkan jalur yang tidak bergantung padanya.

Jika Anda ingin melangkah lebih jauh, DSL perutean menggabungkan beberapa model menjadi satu panggilan logis, sehingga sebuah permintaan dapat dicoba terhadap Gemini 3.1 Pro dan GPT-6 Sol dan jawabannya dipilih berdasarkan kriteria Anda sendiri, bukan kriteria satu vendor. Fusi model melakukan hal yang sama dalam arah sebaliknya — panel model yang menjawab satu pertanyaan — yang merupakan cara wajar untuk mengetahui di mana kekuatan spesifik sebuah pratinjau layak dibayar sebelum menetapkan jalur produksi untuknya.

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the Google vendor label, a 2026-02-19 release date, a 1M-token context window, a 65K-token maximum output, text, image, audio, video and file input, and pricing of $2.00 per million input tokens and $12.00 per million output tokens.

Putusan, dan angka yang perlu diperhatikan

Untuk pekerjaan baru, GPT-6 Sol adalah pilihan yang lebih aman pada empat dari enam dimensi yang menentukan penerapan, dan lebih murah per tugas yang diselesaikan sambil mencetak 17,9 poin indeks lebih tinggi pada revisi yang sama. Untuk beban kerja yang membutuhkan input audio atau video, atau di mana GPQA Diamond 94,1% adalah hal yang Anda beli, Gemini 3.1 Pro Preview masih menang dan label pratinjau adalah risiko yang harus dikelola bukan alasan untuk meninggalkannya.

Angka yang perlu diperhatikan bukanlah indeksnya. Melainkan tanggal pada nama endpoint Gemini 3.1 Pro. Ketika akhiran preview dihilangkan — atau ketika Argon mencapai ketersediaan umum dengan pengenal API yang sesungguhnya — perbandingan ini berubah bentuk sepenuhnya, dan jarak tujuh bulan antara rilis terakhir tier Pro dan hari ini menjadi hal yang dibahas dalam artikel tersebut.

Dibandingkan dalam artikel ini3

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari