Kartu hero berjudul 'Claude Haiku 5.5 vs Gemini 3.7 Flash' yang menampilkan Claude Haiku 5.5 yang dirilis 7 Oktober 2026 di sebelah kiri berhadapan dengan Gemini 3.7 Flash yang ditandai sebagai usang di sebelah kanan, baris Intelligence Index v4.3.2 yang terbaca 43.40 berbanding 39.06, dan baris Terminal Bench 4.0 yang terbaca 0.3283 berbanding 0.1364.
Guides & Insights

Claude Haiku 5.5 vs Gemini 3.7 Flash: Salah Satu dari Keduanya Sudah Dipensiunkan

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ada fakta janggal yang mendasari setiap perbandingan Claude Haiku 5.5 versus Gemini 3.7 Flash yang ditulis hari ini: Gemini 3.7 Flash sudah tidak digunakan lagi. Vendor merilisnya pada 13 Agustus 2026, menggantinya dengan Gemini 3.8 Flash pada 2 September, dan Artificial Analysis kini memuat halaman 3.7 dengan penanda penghentian dukungan. Sebaliknya, Claude Haiku 5.5 diluncurkan pada 7 Oktober 2026 dan memiliki komitmen penghentian tidak lebih awal dari Oktober 2027.

Itu tidak membuat perbandingan ini tidak berguna. Itu mengubah pertanyaannya. Ini bukan lagi "mana dari keduanya yang harus saya panggil" — bagi sebagian besar tim, jawabannya adalah bukan keduanya, karena lini 3.7 telah digantikan di dalam keluarganya sendiri. Yang membuatnya berguna adalah sesuatu yang lebih halus dan bisa dibilang lebih bermanfaat: gambaran yang jelas tentang seberapa cepat tier flash Google bergerak dalam tiga minggu, dan tentang bagian mana dari lembar spesifikasi model tier flash yang sebenarnya menentukan apakah model itu dipakai.

Apa yang masih dapat Anda ukur

Kedua model telah dijalankan pada papan independen yang sama, yang merupakan satu-satunya tempat keduanya dapat disandingkan. Pada Artificial Analysis Intelligence Index v4.3.2, Claude Haiku 5.5 mencetak 43,40 dalam konfigurasi Max-nya, dibandingkan dengan 39,06 untuk Gemini 3.7 Flash dalam konfigurasi High-nya — selisih 4,33 poin.

Kedua vendor juga menerbitkan set evaluasi mereka sendiri, dan keduanya tidak tumpang tindih dengan cara yang memungkinkan perbandingan langsung. Baris independen yang sama adalah empat yang dijalankan Artificial Analysis pada keduanya:

• Terminal Bench 4.0 — 0.3283 untuk Claude Haiku 5.5 dibandingkan 0.1364 untuk Gemini 3.7 Flash. Kesenjangan absolut 19 poin, dan asimetri terlebar dalam kumpulan ini.

• SciCode — 0,5498 dibandingkan 0,5718. Gemini 3.7 Flash mengunggulinya dengan 2,2 poin.

• Humanity's Last Exam — 0,4439 versus 0,4787. Gemini 3.7 Flash dengan keunggulan 3,5 poin.

• AutomationBench, skor parsial — 0,3541 versus 0,6203. Gemini 3.7 Flash dengan 27 poin.

Bacalah kumpulan itu dengan saksama, karena kumpulan itu memuat hasil yang menarik. Gemini 3.7 Flash memenangi tiga dari empat tolok ukur bersama dan tetap kalah pada indeks komposit dengan selisih 4,3 poin. Indeks adalah campuran berbobot, dan pembobotannya menempatkan baris terminal-dan-kode — yang selisihnya bergerak ke arah sebaliknya dengan margin yang jauh lebih besar — di depan agregat dari yang lain. Itu bukanlah artefak penilaian, melainkan pernyataan tentang untuk apa indeks itu: indeks itu berusaha memprediksi apakah sebuah model dapat menyelesaikan suatu pekerjaan, dan pada pertanyaan itu lini 3.7 lemah dengan cara yang tidak mampu disembunyikan oleh skor tolok ukur sainsnya yang cukup terhormat.

A two-column scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.7 Flash - the scoreboard' with rows Index v4.3.2 43.40 against 39.06, Terminal Bench 4.0 0.3283 against 0.1364, SciCode 0.5498 against 0.5718, Humanity's Last Exam 0.4439 against 0.4787, cost per task $0.21 against $0.93 and input price $0.10 against $0.75, footed 'Gemini 3.7 Flash is listed as deprecated; all figures per Artificial Analysis v4.3.2.'

Apa yang sebenarnya menjadi kelemahan lini 3.7

Dua baris menceritakan kisahnya lebih baik daripada indeks.

Terminal Bench 4.0 pada 0,1364 adalah angka yang rendah, dan angka itu berada di samping 0,8577 pada generasi Terminal Bench sebelumnya dari model yang sama. Ini bukan model yang menjadi lebih buruk; ini adalah tolok ukur yang mengubah apa yang diukurnya, dan Gemini 3.7 Flash tidak berhasil melewati transisi tersebut. Claude Haiku 5.5, pada tolok ukur revisi yang sama, mencetak skor 0,3283 — tidak spektakuler secara absolut, tetapi hampir dua setengah kali lipat angka 3.7 Flash, pada baris yang paling langsung memprediksi kinerja pengodean agentik.

Baris kedua adalah Tau-Bench Banking, di mana Gemini 3.7 Flash mencetak skor 0,3278. Keandalan penggunaan alat dalam domain terstruktur adalah tepat alasan model murah diterapkan, dan skor di bawah 0,33 adalah jenis angka yang diam-diam mematikan proyek percontohan. Claude Haiku 5.5 tidak memiliki angka Tau-Bench yang dipublikasikan di tabel yang sama, jadi tidak ada perbandingan yang tersedia di sana — hal yang jujur adalah mengatakannya daripada menyimpulkan salah satunya.

Titik di mana Gemini 3.7 Flash tetap unggul adalah titik yang memang selalu menjadi kekuatannya: GPQA pada 0,9455 dan MMMU-Pro pada 0,8549 sama-sama merupakan kekuatan yang nyata, dan input multimodalnya tidak pernah dipertanyakan. Kegagalannya terletak pada bagian lembar spesifikasi yang menentukan apakah loop agen berfungsi, bukan pada bagian yang memenangkan baris papan peringkat.

Apa yang berubah dalam tiga minggu setelahnya

Gemini 3.8 Flash hadir pada 2 September 2026, dan dinamika di dalam tier flash milik Google sendiri adalah perbandingan yang lebih berguna bagi siapa pun yang merencanakan pipeline 2027.

Pada indeks yang sama, Gemini 3.8 Flash mencatat 40,93 berbanding 39,06 untuk lini 3.7 — kenaikan 1,87 poin dalam tiga minggu. Terminal Bench 4.0 bergerak dari 0,1364 ke 0,1970. Tau-Bench Banking bergerak dari 0,3278 ke 0,4495. Itulah baris-baris persis tempat model 3.7 paling buruk, yang menunjukkan bahwa penerusnya diarahkan tepat pada kelemahan ini, bukan pada peningkatan kemampuan secara umum.

Harga tidak bergerak sama sekali. Gemini 3.7 Flash tercatat pada $0.75 untuk input dan $3.75 untuk output per juta token, dan Gemini 3.8 Flash diluncurkan pada $0.75 dan $3.75 yang sama — kartu tarif yang identik, melekat pada model yang dua poin indeks lebih baik pada baris-baris yang penting bagi agen.

A capture of Google's Gemini API pricing documentation page, headed 'Gemini Developer API pricing', with the banner 'Gemini 3.8 Flash is now available. Try it out.' and the documentation's left-hand model list showing Gemini 3.8 Flash, Gemini 3.7 Flash, Gemini 3.6 Flash and Gemini 3.5 Flash.

Kartu tarif adalah titik di mana perbandingan ini benar-benar menentukan

Dibanding Claude Haiku 5.5, harga Google adalah segalanya dan tidak ada yang mendekati.

• Input — Claude Haiku 5.5 $0,10 per juta token hingga 100.000, $0,50 di atasnya; Gemini 3.7 Flash $0,75 tetap, atau tujuh setengah kali tarif Anthropic di dalam tier pertama.

• Keluaran — $0.50 untuk Claude Haiku 5.5 di dalam tingkat pertama, $2.50 di atasnya; $3.75 untuk Gemini 3.7 Flash.

• Input yang di-cache — $0.01 dan $0.125 untuk Claude Haiku 5.5; $0.075 untuk baca dan $0.75 untuk tulis bagi Gemini 3.7 Flash.

• Konteks — satu juta token untuk keduanya. Output maksimum: 128.000 token untuk Claude Haiku 5.5 dibandingkan dengan 65.536 untuk Gemini 3. Flash.

• Modalitas masukan — teks dan gambar untuk Claude Haiku 5.5; teks, gambar, ucapan, dan video untuk Gemini 3.7 Flash. Ini tetap menjadi satu-satunya baris di mana spesifikasi Google secara ketat lebih panjang, dan itu bertahan tanpa perubahan pada peralihan ke 3.8.

• Biaya independen per tugas Index yang selesai — $0,21 untuk Claude Haiku 5.5 versus $0,93 untuk Gemini 3.7 Flash. Kesenjangan 4,4× yang lebih lebar daripada yang disarankan oleh rasio input tujuh setengah banding satu, karena model Anthropic-lah yang bertele-tele di sini: 162.164 token keluaran per tugas Index versus 58.387 untuk Gemini 3.7 Flash. Anthropic juga mendokumentasikan tokenizer yang sama dengan Claude 4.7 dan yang lebih baru yang menghitung sekitar 30% lebih banyak token untuk teks yang sama, yang mendorong ke arah yang sama.

• Kecepatan — 212,3 detik per tugas Index untuk Gemini 3.7 Flash dibandingkan 424,6 untuk Claude Haiku 5.5. Model Google adalah yang lebih cepat di antara keduanya, dua kali lipat, yang merupakan satu-satunya baris di bagian ini di mana model yang lebih murah bukan juga yang lebih baik.

Apa artinya ini jika Anda memilih hari ini

Pembacaan praktisnya adalah bahwa tidak ada dari keduanya yang merupakan jawaban yang tepat, karena alasan yang berbeda.

Gemini 3.7 Flash sudah tidak lagi didukung (deprecated), dihargai dengan tarif yang sama seperti penerusnya, dan lebih buruk daripada penerusnya tepat pada baris-baris yang dibutuhkan model produksi murah. Merekomendasikannya berarti merekomendasikan daftar tarif yang melekat pada model yang sudah digantikan — penerusnya berbiaya sama dan melakukan lebih banyak. Tak seorang pun yang memilih di antara keduanya pada Oktober 2026 seharusnya mendarat di lini 3.7, dan fakta bahwa daftar tarifnya tidak berubah itulah yang menentukannya.

Claude Haiku 5.5 adalah model yang aktif, dan untuk pekerjaan teks-masuk, teks-keluar, model ini lebih murah dalam segala ukuran, lebih tinggi pada skor komposit, dan jauh lebih baik pada dua baris yang memprediksi keberhasilan agentic. Model ini juga yang lebih lambat dan tidak dapat menerima ucapan atau video. Apakah itu penting adalah pertanyaan tentang pipeline Anda, bukan tentang modelnya.

Opsi ketiga, yang terlihat dari selisih poin indeks antara 3,8 dan 3,7, adalah bahwa tier flash Google bergerak cukup cepat sehingga perbandingan yang berumur tiga minggu sudah menjadi historis. Anggap setiap adu langsung di tier flash sebagai memiliki masa berlaku yang diukur dalam minggu, bukan kuartal.

Menjalankan sisi mana pun yang Anda pilih

Gemini 3.8 Flash — penerusnya, bukan 3.7 yang sudah usang — ada di katalog OrcaRouter dengan harga daftar Google tanpa markup 0%, jadi tarif yang diterbitkan Google adalah tarif yang sampai ke tagihan Anda dan perubahan di sisi mereka langsung aktif di sisi kami pada hari yang sama. Claude Sonnet 5.5 dan Claude Opus 5.5 juga ada di katalog, sehingga uji routing dua vendor menjadi sekadar konfigurasi, bukan proyek: satu API untuk 200+ model, satu kunci, failover otomatis di baliknya, dan DSL routing saat Anda lebih suka menahan eskalasi di rute daripada di kode.

Gemini 3.7 Flash sendiri tidak ada di katalog kami, dan Claude Haiku 5.5 juga tidak. Keduanya tetap dapat diakses melalui API milik vendor masing-masing dan, dalam kasus Google, melalui beberapa platform pihak ketiga. Hal itu layak dinyatakan secara terang-terangan daripada membiarkan pembaca menemukannya sendiri.

A capture of the OrcaRouter model page for Gemini 3.8 Flash under google/gemini-3.8-flash, showing a 65K maximum output, text, image, video, file and audio input, benchmarks published by Google on 2026-09-02, a p50 time to first token of 3.838 seconds, and the rates $0.75 input and $3.75 output per million tokens.

Angka yang diambil

Bukan soal selisih indeks 4,33 poin. Persoalannya adalah Gemini 3.7 Flash memenangi tiga dari empat benchmark bersama dan tetap kalah dalam nilai komposit dengan selisih empat poin, karena benchmark yang paling besar bobotnya dalam indeks justru adalah benchmark yang hanya diberi skor 0,1364 olehnya. Skor sains model tingkat flash bisa terlihat baik-baik saja, tetapi ia gagal pada hal yang menjadi alasan orang membeli model murah.

Konsekuensinya adalah bahwa penerusnya memperbaiki tepat baris-baris itu dalam waktu tiga minggu, dengan harga yang tidak berubah. Berdasarkan bukti ini, tekanan persaingan di tingkat ini bukanlah harga. Melainkan apakah model dapat menyelesaikan tugas multi-langkah, dan hal itu sekarang bergerak lebih cepat daripada kartu tarif.