
GPT-6.1 Sol vs Gemini 3.1 Pro: Tujuh Bulan Pratinjau Melawan Delapan Hari Pengiriman
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Gemini 3.1 Pro telah berada dalam daftar harga vendor selama tujuh setengah bulan dan tidak pernah keluar dari status pratinjau. Diumumkan pada 19 Februari 2026, didokumentasikan hari ini di endpoint yang berakhiran -preview, tanpa komitmen ketersediaan umum dan — yang lebih mencolok — juga tanpa tanggal penghentian. GPT-6.1 Sol baru berumur delapan hari, dirilis pada 29 September 2026 dengan harga $2,00 per juta token input dan $10,00 per juta token output. Sandingkan keduanya pada Artificial Analysis Intelligence Index dan pratinjau berumur tujuh bulan itu bukan sekadar kompetitif, melainkan hanya terpaut 22 poin dari model yang lebih baru pada revisi indeks terbaru — 29,7 berbanding 51,8 pada v4.3.2 — sekaligus memakan biaya 1,8× lebih mahal per tugas indeks, $1,30 berbanding $0,72. Kombinasi itulah yang membuat perbandingan ini menarik dan bukan sekadar formalitas: di papan ini, model yang lebih tua tertinggal dalam hal kemampuan sekaligus unggul dalam hal biaya, sebuah keadaan yang terbalik bagi pratinjau yang seharusnya sudah lulus. Namun catatan tentang revisi indeks lebih penting di sini daripada di bagian mana pun dalam kumpulan ini, karena angka 29,7 dan 53 sama-sama dikutip di situs yang sama dan keduanya bukan pengukuran yang sama.
Keduanya adalah model multimodal besar dengan jendela konteks kelas 1M. Gemini 3.1 Pro menerima teks, gambar, video, audio, dan PDF dengan plafon keluaran 65,536 token dan tier harga 200,000 token yang di atasnya tarifnya berlipat ganda. GPT-6.1 Sol menerima teks, gambar, dan file dengan jendela 1,050,000 token, plafon keluaran 128,000 token, lima tingkat upaya penalaran, dan tier konteks panjang di atas 272,000 token prompt. Yang satu adalah produk yang sudah dirilis dengan komitmen dukungan. Yang lainnya adalah pratinjau dengan siklus hidup terbuka, dan perbedaan itu ternyata bernilai lebih besar daripada kesenjangan indeksnya.
Nomor indeks perlu dilampirkan revisinya.
Artificial Analysis menjalankan ulang rangkaian pengujiannya dan menerbitkan ulang skor berdasarkan revisi indeks yang berlaku saat ini, yang berarti model yang sama dapat membawa dua angka berbeda tergantung kapan Anda membacanya. Untuk Gemini 3.1 Pro, selisih itu luar biasa lebar: liputan internal sebelumnya tentang model ini melaporkan 57 pada revisi yang lebih lama, sedangkan halaman yang ada saat ini melaporkan 29,7 pada v4.3.2, versi sepuluh evaluasi yang juga memuat 51,8 milik GPT-6.1 Sol. Kedua angka itu nyata dan keduanya ada di situs web yang sama.
Implikasinya bagi sebuah perbandingan bersifat sempit dan penting. Hanya angka dari revisi yang sama yang dapat dikurangkan. Angka 29,7 dan 51,8 dari v4.3.2 menghasilkan selisih 22 poin; angka 57 dan 51,8 menghasilkan selisih lima poin ke arah sebaliknya. Angka 22 poin adalah angka yang harus digunakan di sini, karena angka itulah yang diperoleh ketika kedua model diukur oleh suite yang sama pada skala yang sama — dan karena angka biaya per tugas, $1,30 versus $0,72, berasal dari pengujian yang sama.
• Indeks Kecerdasan, v4.3.2 — GPT-6.1 Sol 51.8 vs Gemini 3.1 Pro 29.7
• Biaya per tugas indeks — GPT-6.1 Sol $0.72 vs Gemini 3.1 Pro $1.30
• Biaya untuk menjalankan suite lengkap — GPT-6.1 Sol $1,082 vs Gemini 3.1 Pro $1,935
Jendela konteks — GPT-6.1 Sol 1.050.000 token vs Gemini 3.1 Pro 1.000.000 token
• Output maksimum — GPT-6.1 Sol 128.000 token vs Gemini 3.1 Pro 65.536 token
• Modalitas masukan — teks, gambar, dan file pada keduanya, serta video, audio, dan PDF pada Gemini 3.1 Pro
Dua dari baris tersebut menguntungkan pratinjau dan layak disampaikan secara gamblang. Gemini 3.1 Pro menerima video dan audio, sedangkan GPT-6.1 Sol tidak; jika pipeline Anda menyerap rekaman layar atau panggilan, itu adalah kesenjangan kemampuan yang tidak dapat ditutup oleh skor apa pun. Dan batas atas keluaran 65.536 token miliknya adalah setengah dari milik GPT-6.1 Sol, yang penting untuk pembuatan konten berdurasi panjang tetapi jarang menjadi penghambat dalam pekerjaan agentik, di mana keluaran bersifat pendek dan gilirannya banyak.
Mengapa angka yang lebih baru itulah yang seharusnya menggerakkan keputusan Anda
Pertanyaan harga lebih menarik daripada pertanyaan indeks.
Kartu tarif Gemini 3.1 Pro adalah $2,00 untuk input dan $12,00 untuk output per juta token, dengan input yang di-cache $0,20 dan penulisan cache $0,375, serta batas tier pada 200.000 token prompt yang di atasnya tarifnya menjadi $4,00 dan $18,00. GPT-6.1 Sol adalah $2,00 untuk input dan $10,00 untuk output, dengan input yang di-cache $0,10, penulisan cache $2,50, dan batas pada 272.000 token yang di atasnya tarifnya menjadi $4,00 dan $15,00. Harga input utama identik. Harga output 20% lebih rendah pada GPT-6.1 Sol, dan tahap konteks panjangnya lebih rendah pada kedua sumbu. Yang membedakan kedua kartu ini adalah caching: $0,10 versus $0,20 per juta token input yang di-cache, dengan model pratinjau menulis cache lebih murah, yaitu $0,375 versus $2,50.

Pasangan terakhir itu membalik pembacaan kasual. Jika beban kerja Anda berat cache — prompt sistem tetap yang panjang yang dikirim ulang setiap giliran, atau dokumen yang dibaca ulang sepanjang sesi — lini penulisan cache Gemini 3.1 Pro jauh lebih murah dan lini pembacaan cache-nya dua kali lipat. Model mana yang menang bergantung pada berapa kali Anda membaca ulang apa yang Anda tulis, dan itu adalah angka yang dibawa oleh log Anda sendiri dan tidak diterbitkan oleh tolok ukur mana pun. Yang tidak ambigu adalah biaya indeks: pada pekerjaan evaluasi yang identik, model berusia delapan hari berakhir 33% lebih murah, dan pratinjau berusia tujuh bulan berakhir 79% lebih mahal daripada model yang lebih baru secara keseluruhan.
Lencana pratinjau adalah fakta operasional
Inilah bagian dari perbandingan yang tidak dapat ditangkap oleh tabel skor, dan untuk deployment produksi, ini lebih diutamakan daripada semua hal di atas.
Gemini 3.1 Pro telah berada dalam tahap pratinjau sejak Februari tanpa pengumuman ketersediaan umum dan tanpa tanggal penghentian. Kedua ketiadaan itu penting dan keduanya mengarah ke arah yang berlawanan. Tidak adanya ketersediaan umum berarti tidak ada komitmen siklus hidup: endpoint pratinjau tidak dicakup oleh ketentuan pemberitahuan penghentian yang sama seperti endpoint yang tersedia umum, dan dapat direvisi tanpa kenaikan versi saat sedang digunakan oleh pemanggil, yang merupakan alasan standar untuk menyematkan pengenal model yang tepat di produksi alih-alih alias. Tidak adanya tanggal penghentian berarti Anda juga tidak dapat merencanakan jendela migrasi — model ini sudah bertahan melewati kuartal ketika semua orang mengharapkannya naik ke tahap ketersediaan umum, dan keluarga ini pernah menghentikan model Pro sebelumnya.
Posisi GPT-6.1 Sol adalah cerminan yang berlawanan. Usianya baru delapan hari, yang berarti rekam jejak evaluasi independennya baru sedalam satu konfigurasi dan mode kegagalannya belum terdokumentasi; tidak ada korpus praktisi yang bisa dirujuk ketika perilakunya menyimpang. Perilisannya sendiri menjadi beritanya, dan ia dirilis di bawah struktur dukungan yang tidak dimiliki versi pratinjau tersebut.
Itu adalah risiko yang berbeda, bukan besaran risiko yang berbeda. Pilih versi pratinjau, dan Anda bertaruh bahwa vendor akan terus melayani endpoint, padahal tidak ada kewajiban kontraktual bagi mereka untuk melakukannya. Pilih model yang berumur delapan hari, dan Anda bertaruh bahwa satu kali uji benchmark dan delapan hari ketersediaan sudah cukup menjadi bukti untuk beban kerja Anda. Indeks tidak akan membantu dalam kedua hal itu.
Satu hal yang akan membuat ini mudah
Pengumuman ketersediaan umum untuk Gemini 3.1 Pro, dengan pengenal model di luar -preview namespace dan komitmen siklus hidup yang dipublikasikan, akan mengatasi sebagian besar masalah ini. Hal ini tidak akan menutup kesenjangan indeks 22 poin atau kesenjangan biaya per tugas 1,8×, tetapi akan menghilangkan risiko depresiasi yang saat ini membuat perbandingan tidak seimbang, dan akan memungkinkan sebuah tim mengadopsi model tersebut tanpa menyematkan pengenal pratinjau dan berharap.
Ketiadaan pengumuman itu, setelah tujuh setengah bulan berjalan, sudah menjadi informasi tersendiri. Sebuah pratinjau yang dimaksudkan untuk memvalidasi pembaruan sebelum menuju GA "soon", dalam kata-kata vendor pada Februari, telah memiliki dua kuartal penuh untuk melakukannya. Entah validasinya masih berlangsung, atau pratinjaulah produknya — dan pemanggil tidak bisa tahu yang mana dari luar. Yang bisa dilakukan pemanggil adalah memperhitungkan ketidakpastian itu dan merutekan dengan tepat.
Keduanya pada satu kunci, jadi jawabannya bisa per beban kerja.

Gemini 3.1 Pro ada di OrcaRouter dengan tarif tercantumnya sendiri — $2.00 / $12.00, naik ke $4.00 / $18.00 di atas 200.000 token prompt, dengan baca cache $0.20. GPT-6.1 Sol ada di OrcaRouter dengan $2.00 / $10.00, naik ke $4.00 / $15.00 di atas 272.000 token prompt, dengan baca cache $0.10. Harga daftar penyedia untuk keduanya, tanpa tambahan, satu kunci dan satu tagihan.
Itu membuat bagian-bagian canggung dari perbandingan ini murah untuk diselesaikan. Ingest video dan audio tetap di preview karena tidak ada yang lain dalam pasangan ini yang menerimanya; pekerjaan teks dan coding bervolume tinggi dialihkan ke model yang lebih baru, yang lebih murah per tugas dan 33% lebih murah untuk pekerjaan evaluasi yang identik. Jika endpoint preview direvisi atau ditarik, failover otomatis memindahkan panggilan tersebut ke rute lain alih-alih menggagalkannya — yang merupakan lindung nilai spesifik yang dibutuhkan oleh risiko siklus hidup sebuah preview. Dan karena keduanya berada di belakang satu endpoint yang kompatibel dengan OpenAI, perbandingan harga yang benar-benar penting dapat dijalankan pada trafik Anda sendiri dalam satu sore, bukan diperdebatkan berdasarkan daftar harga.

Pembacaan yang dapat dipertahankan, dengan demikian, bukanlah model mana yang lebih baik. Melainkan bahwa keduanya dihargai sebagai hampir setara meskipun terpaut tujuh bulan dalam kematangan siklus hidup dan 22 poin pada papan independen saat ini, dan bahwa keunggulan nyata model pratinjau — input video dan audio, penulisan cache yang murah — sempit dan spesifik. Jika beban kerja Anda membutuhkan modalitas tersebut, Gemini 3.1 Pro adalah satu-satunya pilihan di antara keduanya dan selisih indeks adalah harga masuknya. Jika tidak, Anda ditawari endpoint pratinjau dengan masa depan yang tidak ditentukan pada biaya per tugas 80% lebih tinggi daripada model yang dirilis minggu lalu, dan beban pembuktian justru berjalan sebaliknya.
