Kartu judul hero yang dihasilkan untuk Claude Sonnet 5.5 vs Gemini 3.1 Pro, dengan subjudul 'Lebih murah per token, sebelas kali lebih mahal per tugas', menampilkan $2,00 dan $10,00 per juta token dibandingkan dengan $2,00 dan $12,00 dengan batas keluaran 65.536 token yang dicantumkan di sebelah kanan, dan logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Claude Sonnet 5.5 vs Gemini 3.1 Pro: Lebih Murah per Token, Sebelas Kali Lebih Mahal per Tugas

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada daftar tarif, Claude Sonnet 5.5 adalah model yang lebih murah, dan dari segi kemampuan, selisihnya tidak tipis. Model ini mencapai ketersediaan umum pada 28 September 2026 dengan harga $2,00 per juta token input dan $10,00 per juta token output; Gemini 3.1 Pro, yang diumumkan pada 19 Februari 2026 dan masih dilayani dari endpoint pratinjau, berharga $2,00 dan $12,00. Sonnet 5.5 juga mencetak skor 56 pada Intelligence Index v4.3 milik Artificial Analysis, dibandingkan dengan 30 milik Gemini 3.1 Pro Preview — selisih dua puluh enam poin pada satu harness yang sama. Konteks 1.048.576 token milik Gemini adalah satu-satunya angka utama yang dimenangkannya secara mutlak. Namun, evaluator yang sama melaporkan bahwa menyelesaikan satu tugas terbuka menghabiskan $0,67 pada model Google dan $7,60 pada model Anthropic, yang merupakan faktor sebelas dengan arah berlawanan. Kedua angka itu benar, dan alasan keduanya bisa hidup berdampingan — plafon output 65.536 token di satu sisi dan masalah verbositas di sisi lain — adalah inti dari keseluruhan perbandingan ini.

Apa sebenarnya masing-masing endpoint itu

Perbaiki identitas sebelum aritmetika. Subjek di sini adalah anthropic/claude-sonnet-5.5, dirilis 28 September 2026, input teks, gambar, dan file, konteks 1.000.000 token, output maksimum 128.000 token, pemikiran adaptif dengan parameter effort yang secara default bernilai high di Claude Platform. Pesaingnya adalah google/gemini-3.1-pro-preview, dirilis 19 Februari 2026, input teks, gambar, video, audio, dan file, konteks 1.048.576 token, output maksimum 65.536 token. Salah satu dari dua nama itu memuat kata yang tidak dimiliki nama lainnya, dan itu bukan hiasan.

Sufiks pratinjau telah melekat selama tujuh bulan. Google merilis beberapa versi Flash dalam rentang waktu itu dan tidak ada penerus untuk tier Pro; model yang digantikan oleh 3.1 Pro terdaftar sebagai telah dimatikan. Tidak satu pun dari itu merupakan cacat pada model — model ini telah aktif, stabil, dan diberi harga dengan benar sepanjang waktu — tetapi itu berarti endpoint yang menjadi sasaran integrasi Anda tidak tercakup oleh komitmen siklus hidup ketersediaan umum, dan keluarga ini sudah memensiunkan satu model Pro. Perlakukan itu sebagai pos tetap, bukan catatan kaki, karena ini mengubah besarnya biaya yang harus ditanggung dari keputusan arsitektur multi-tahun jika Anda salah.

Dua bilangan yang menunjuk ke arah yang berlawanan

Perbandingan per token lebih dulu, karena itulah yang dijalankan semua orang dan lebih menguntungkan model yang lebih baru.

• Input — $2.00 per juta untuk keduanya; seri persis pada tarif utama

• Output — $10.00 untuk Claude Sonnet 5.5 versus $12.00 untuk Gemini 3.1 Pro; model Anthropic 17% lebih murah

• Pembacaan cache — $0.20 per juta untuk keduanya di bawah batas tier

• Penulisan cache — $2,50 per juta untuk jendela lima menit pada Claude Sonnet 5.5 versus $0,375 untuk Gemini 3.1 Pro; Google sekitar tujuh kali lebih murah untuk menulis entri cache

• Konteks — 1.000.000 versus 1.048.576; perbedaan yang tidak memiliki konsekuensi praktis

• Output maksimum — 128.000 token dibandingkan 65.536; model Anthropic memiliki batas atas hampir dua kali lipat

• Modalitas masukan — teks, gambar, dan file dibandingkan dengan teks, gambar, video, audio, dan file

Lalu perbandingan per tugas, dari evaluator yang sama, pada minggu yang sama, dalam konfigurasi upaya maksimal di kedua sisi: $7,60 untuk Claude Sonnet 5.5 versus $0,67 untuk Gemini 3.1 Pro. Sebelas kali. Mekanismenya didokumentasikan di halaman yang sama, bukan disimpulkan — Sonnet 5.5 menghasilkan 410 juta token di seluruh rangkaian indeks dibandingkan median 88 juta untuk bidang tersebut, yang oleh evaluator digambarkan sebagai sangat bertele-tele, sementara Gemini 3.1 Pro digambarkan sebagai cukup ringkas. Ketika satu model menulis beberapa kali lebih banyak daripada model lainnya, keunggulan 17% pada tarif keluaran tidak bertahan saat bersentuhan dengan faktur.

Pelajaran ini berlaku umum melampaui kedua model tersebut: kartu tarif menetapkan harga per token, dan Anda ditagih untuk pekerjaan yang sudah selesai. Perbandingan apa pun yang berhenti pada lembar harga sedang mengukur kuantitas yang salah.

Batas tier pada 200.000 token

Harga Gemini 3.1 Pro tidak datar, dan lonjakannya cukup besar untuk membalik sebagian perbandingan di atas. Untuk prompt di bawah 200.000 token, tarifnya adalah $2.00 input dan $12.00 output dengan pembacaan cache $0.20. Di atas ambang itu, seluruh panggilan dihargai ulang pada $4.00 input, $18.00 output, dan $0.40 pembacaan cache — tarif input berlipat dua menjadi tepat dua kali milik Claude Sonnet 5.5, dan output berubah dari 17% lebih murah di sisi Anthropic menjadi 80% lebih mahal di sisi Google.

Batasnya tidak eksotis. Prompt 200.000 token adalah basis kode kecil, kumpulan kontrak yang panjang, beberapa jam transkrip, atau agen yang telah bekerja cukup lama. Pekerjaan konteks panjang justru menjadi alasan jendela 1 juta token dijual, jadi tingkat yang paling diuntungkan oleh jendela itu juga merupakan tingkat tempat keunggulan harga menghilang. Jika prompt Anda rutin melewati 200.000 token, evaluasilah Gemini 3.1 Pro pada $4,00 dan $18,00, bukan pada tarif di halaman landing.

Penulisan cache layak mendapat kalimatnya sendiri, karena keduanya terbalik ke arah sebaliknya dan tetap bertahan saat tier berubah. Pada $0,375 per juta dibandingkan $2,50, Gemini jauh lebih murah untuk mengisi cache, dan tarif itu tidak berubah saat Anda melewati batas. Bagi agen yang membangun ulang prefiks besar setiap giliran alih-alih menggunakannya kembali, satu baris itu bisa menjadi keunggulan struktural yang lebih besar daripada tarif input — dan itulah satu-satunya baris dalam perbandingan ini yang tidak disentuh oleh batas tier mana pun.

Batas atas 65.536 token, dan mengapa hal itu menentukan arsitektur

Angka yang paling mengubah apa yang dapat Anda bangun adalah keluaran maksimum: 65.536 token pada Gemini 3.1 Pro versus 128.000 pada Claude Sonnet 5.5. Batas atas bukanlah metrik performa; itu adalah batasan apakah suatu tugas muat dalam satu panggilan.

Apa pun yang menghasilkan artefak besar — file sumber lengkap, dokumen panjang, kumpulan data lengkap — di atas 65.000 token dalam kasus Gemini harus diuraikan menjadi rantai panggilan dengan status yang diteruskan di antara panggilan-panggilan tersebut. Penguraian menghabiskan lebih banyak token masukan pada setiap langkah, lebih banyak kode orkestrasi, dan titik kegagalan baru di sambungan tempat satu potongan berakhir dan potongan berikutnya dimulai. Kendala kedua memperburuknya: materi Anthropic sendiri menempatkan ambang batas keandalan 5.5 untuk pekerjaan panjang yang andal jauh lebih tinggi, dan batas atas Gemini adalah yang lebih ketat dengan faktor dua. Jika artefak terpanjang Anda 40.000 token, bagian ini tidak relevan dan Anda harus membandingkan berdasarkan biaya per tugas. Jika 100.000, keputusan ada di tangan batas atas.

Modalitas, satu-satunya sumbu yang sepenuhnya dikuasai Gemini

Gemini 3.1 Pro menerima video dan audio; Claude Sonnet 5.5 menerima teks, gambar, dan file serta tidak dapat menerima salah satu pun. Untuk beban kerja yang berpusat pada media — rekaman panggilan, tangkapan layar, video produk, audio rapat — tidak ada pengganti yang tersedia dalam pasangan ini, dan perbandingan harga menjadi tidak relevan karena hanya salah satu dari dua endpoint yang dapat menerima input sama sekali. Untuk beban kerja teks dan gambar, himpunan kemampuannya saling tumpang tindih dan aritmetika harga di atas yang berlaku.

Angka operasional Gemini yang lain layak disebutkan karena mudah terlewatkan pada halaman yang mengedepankan kecerdasan: katalog kami mengukur latensi token pertama median sebesar 10.000 ms pada p50 dan laju keluaran mendekati 1.283 token per detik, dengan tingkat galat tujuh hari sebesar 56,8%. Itu adalah model yang sangat cepat dengan tingkat kegagalan teramati yang sangat tinggi — kombinasi yang jauh lebih cocok untuk pekerjaan batch dengan anggaran percobaan ulang yang longgar daripada untuk apa pun yang sedang ditunggu pengguna. Sebagai perbandingan, Claude Sonnet 5.5 adalah profil yang lebih lambat dan lebih stabil. Tingkat galat tidak muncul di halaman landing kedua vendor; angka semacam itu hanya muncul ketika para kandidat berada di belakang satu endpoint tunggal yang mengukurnya, yang menjadi salah satu alasan untuk mengevaluasi keduanya dari satu tempat alih-alih dua dasbor.

Apa yang harus dirutekan ke mana

Kirimkan ke Claude Sonnet 5.5 ketika pekerjaannya berupa teks atau gambar, ketika standar kualitas cukup tinggi sehingga selisih indeks dua puluh enam poin menjadi penting, ketika artefak keluaran cukup panjang sehingga memerlukan plafon 128.000 token, atau ketika beban kerjanya interaktif dan tingkat kesalahan 56,8% tidak dapat diterima. Pada tugas terstruktur dan terbatas, penalti verbositas yang menghasilkan angka $7,60 sebagian besar menguap, dan keunggulan per token menjadi uang sungguhan.

Kirimkan ke Gemini 3.1 Pro ketika input berisi video atau audio, ketika prompt tetap di bawah 200.000 token dan volumenya tinggi, ketika Anda sering menulis cache besar dan biaya penulisan cache $0.375 terus menumpuk, atau ketika tugasnya berbentuk batch dan biaya per tugas adalah satu-satunya kolom yang penting — dengan $0.67 per tugas dibandingkan $7.60, Anda dapat melakukan banyak percobaan ulang.

Keduanya dapat dirutekan di OrcaRouter hari ini. google/gemini-3.1-pro-preview dan anthropic/claude-sonnet-5 keduanya merupakan entri katalog aktif pada satu kredensial dengan harga daftar penyedia tanpa markup 0%, yang berarti pembagian di atas dapat dinyatakan sebagai aturan routing alih-alih sebagai dua integrasi — permintaan berbentuk media ke satu endpoint, permintaan teks-dan-gambar ke endpoint lainnya, dengan failover jika salah satunya mulai mengalami error. Claude Sonnet 5.5 belum menjadi rute di platform kami; ketika sudah terdaftar, aturan yang sama akan mencakupnya tanpa kunci baru.

Putusan jujurnya untuk pertarungan ini: Claude Sonnet 5.5 adalah model yang lebih baik dengan selisih yang lebar dan yang lebih murah per token, dan Gemini 3.1 Pro kira-kira sebelas kali lebih murah per tugas yang diselesaikan pada pekerjaan terbuka, enam kali lebih murah untuk menulis cache, dan satu-satunya dari keduanya yang dapat melihat video. Siapa pun yang mengutip kartu tarif kepada Anda sedang menggambarkan perbandingan yang tidak ada; perbandingan yang benar-benar ada adalah tentang permintaan mana yang dapat Anda batasi.

A two-column scoreboard for Claude Sonnet 5.5 and Gemini 3.1 Pro Preview across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column Gemini 3.1 Pro Preview: input $2.00 rising to $4.00 over 200K tokens, output $12.00 rising to $18.00, cache read $0.20, cache write $0.375, 1,048,576-token context with a 65,536-token max output, input modality text, image, video, audio and file, AA Intelligence Index v4.3 score 30, $0.67 per task on the index run. The card heading reads "Cheaper per token, eleven times dearer per finished task", and a footer line notes that Gemini 3.1 Pro remains a preview endpoint seven months after its February 19, 2026 announcement.Screenshot of the OrcaRouter model page for Google Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), showing the model header, the 1,048,576-token context window, the 65,536-token maximum output, audio, file, image, text and video input, the Vision, Audio, Tools, JSON and Reasoning capability tags, a 10.00-second p50 time to first token, a "Public benchmarks by Google · 2026-02-19" line, and the $2.00 input and $12.00 output prices per million tokens.Screenshot of Artificial Analysis's model page for Gemini 3.1 Pro Preview, marked a proprietary model and released February 2026, showing In $2.00 and Out $12.00 with a 90% cache discount, the Intelligence Index score of 30, an output rate of 114 tokens per second, the $0.67 average cost per task, and 67M output tokens described as fairly concise against a median of 88M.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari