
Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite: Lebih Murah per Token, Lebih Mahal per Jawaban
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Claude Haiku 5.5 berbiaya $0,10 per juta token masukan dan $0,50 per juta token keluaran. Gemini 3.5 Flash-Lite berbiaya $0,30 dan $2,50 pada dua metrik yang sama. Model Anthropic adalah sepertiga dari harga untuk masukan dan seperlima dari harga untuk keluaran, dan skornya 43,40 berbanding 22,2 pada Artificial Analysis Intelligence Index v4.3.2 — selisih lebih dari dua puluh poin di bidang yang sepuluh poinnya merupakan lompatan antargenerasi. Dalam daftar tarif, ini bukan perbandingan yang tipis, dan dalam hal kemampuan, ini juga bukan perbandingan yang tipis.
Pada faktur, perbandingannya sangat ketat, dan hasilnya justru terbalik. Tempatkan kedua model pada papan independen yang sama dan bebankan biaya kepada masing-masing untuk tugas yang telah selesai, bukan per token, maka Gemini 3.5 Flash-Lite keluar sebagai lebih murah per jawaban. Artificial Analysis mencatat Claude Haiku 5.5 sebesar $0,21 per tugas Intelligence Index dan Gemini 3.5 Flash-Lite sebesar $0,1235 — keunggulan 1,7 banding satu bagi model yang membayar lima kali lebih mahal untuk setiap token yang dihasilkannya.
Pembalikan itulah inti dari perbandingan ini. Claude Haiku 5.5 menggantikan tier termurah yang pernah dirilis Anthropic dan mengalahkan semua yang berada di dekatnya di papan bersama. Gemini 3.5 Flash-Lite dirilis pada 21 Juli 2026 dan telah menjadi pilihan paling bernilai di segmen ini sejak musim panas. Pertanyaan yang sebenarnya dimiliki pembeli bukanlah mana yang lebih baik, karena jawaban atas itu sudah pasti. Melainkan mana yang harus dihadapkan pada permintaan yang harus menghasilkan respons dengan biaya murah.
Semua yang berikut ini dihitung per juta token dalam dolar AS. Harga daftarnya adalah tarif resmi yang diterbitkan sendiri oleh para vendor. Skor independen, angka biaya per tugas, dan pengukuran kecepatan yang diatribusikan kepada Artificial Analysis adalah milik evaluator tersebut. Angka latensi untuk Gemini 3.5 Flash-Lite berasal dari lalu lintas terukur kami sendiri. Jika suatu angka tercantum pada catatan model yang kami simpan, bukan dibaca dari halaman evaluator pada hari itu, kami memperlakukan evaluator tersebut sebagai sumbernya, bukan kami sendiri.
Stiker dan faktur tidak cocok.
Kesenjangan biaya per tugas tidak dijelaskan oleh kartu tarif, dan alasan kesenjangan itu ada patut diketahui sebelum salah satu model mendekati produksi.
Claude Haiku 5.5 bertele-tele, dan evaluator mengatakannya secara gamblang. Saat menjalankan Intelligence Index, Artificial Analysis mencatat 440 juta token output dari model ini, dibandingkan median 100 juta secara keseluruhan, dan menandainya sangat bertele-tele. Proses berpikir ditagih sebagai output, berpikir aktif secara default dengan pengatur upaya yang dimulai dari medium, dan tarif input yang murah tidak membantu beban kerja yang tagihannya sebagian besar berupa output.
Gemini 3.5 Flash-Lite juga tidak ringkas, tetapi secara terukur lebih murah per pekerjaan. Papan yang sama mencatat 17.507 token keluaran per tugas indeks yang diselesaikan untuknya — 10.405 di antaranya penalaran dan 7.102 jawaban. Bandingkan itu dengan volume token model Anthropic, dan perhitungannya pun menjadi jelas: keunggulan lima banding satu pada laju keluaran sebagian dikonsumsi oleh model yang mengeluarkan respons lebih besar, dan yang tersisa di tingkat tugas adalah kerugian kecil, bukan keuntungan besar.
Ada efek kedua yang lebih senyap yang bekerja dengan cara yang sama. Dokumentasi Anthropic menyatakan bahwa Claude Haiku 5.5 menggunakan tokenizer yang sama dengan Claude 4.7 dan versi setelahnya, sehingga teks yang sama dihitung sekitar 30% lebih banyak token daripada yang dihitung pada model yang digantikan oleh model ini. Tarifnya turun dengan faktor tiga dibandingkan tier Google. Jumlah tokennya tidak turun, dan pada teks yang sama justru meningkat.
Kedua model, pada angka-angka yang penting
Tarif cache dan harga daftar dari dokumentasi Anthropic dan Google sendiri; angka independen yang diatribusikan kepada Artificial Analysis; latensi langsung dari jendela trafik tujuh hari kami sendiri. Di-cache 2026-10-08.

• Masukan — Claude Haiku 5.5 $0.10 hingga 100.000 token dan $0.50 di atasnya; Gemini 3.5 Flash-Lite $0.30 tetap untuk jendela 1.048.576 token.
• Output — Claude Haiku 5.5 $0.50 hingga 100.000 token dan $2.50 di atasnya; Gemini 3.5 Flash-Lite $2.50 flat.
• Input yang di-cache — Claude Haiku 5.5 $0.01 hingga 100.000 token dan $0.05 di atasnya; Gemini 3.5 Flash-Lite $0.03. Penulisan cache adalah $0.125 dan $0.625 per juta token untuk Claude Haiku 5.5.
• Konteks dan output — satu juta token untuk masing-masing. Output maksimum adalah 128.000 token untuk Claude Haiku 5.5 dibandingkan 65.536 untuk Gemini 3.5 Flash-Lite, jadi batas atas Anthropic kira-kira dua kali lipat.
• Modalitas masukan — teks dan gambar untuk Claude Haiku 5.5; teks, gambar, video, audio, dan file untuk Gemini 3.5 Flash-Lite. Keduanya mengembalikan teks.
Skor independen — 43,40 untuk Claude Haiku 5.5 (Max), peringkat kedua dari 182 model pada Intelligence Index v4.3.2, dibandingkan dengan 22,2 untuk Gemini 3.5 Flash-Lite, peringkat ke-96 dari 147 dan berada pada persentil ketiga puluh empat di papan peringkat tersebut.
• Biaya independen per tugas — $0,21 dibandingkan dengan $0,1235 pada papan yang sama.
• Throughput — 241,9 token keluaran per detik yang diukur untuk Claude Haiku 5.5 oleh Artificial Analysis, dibandingkan dengan 280,0 untuk Gemini 3.5 Flash-Lite yang diukur di playground kami sendiri selama tujuh hari terakhir. Itu adalah dua harness, bukan satu, jadi bacalah keduanya sebagai perkiraan besaran dan bukan sebagai adu balap.
Dua puluh satu poin, dan terbuat dari apa poin-poin itu
Selisih dua puluh satu poin pada indeks yang mencapai enam puluhan bukanlah margin. Itu adalah perbedaan antara model yang dapat menjalankan loop agentik dan model yang seharusnya diberi satu panggilan dengan spesifikasi yang jelas.
Kedua vendor tidak mengukur harness satu sama lain, sehingga rangkaian uji milik mereka sendiri tidak dapat disandingkan. Anthropic menerbitkan hasil GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0, dan FrontierCode untuk Claude Haiku 5.5; Google menerbitkan rangkaiannya sendiri untuk tier Flash-Lite; tidak satu pun menjalankan milik yang lain. Satu-satunya perbandingan setara yang tersedia adalah papan independen, dan di sana model Anthropic unggul dengan selisih yang tidak tipis.
Subskor evaluator untuk Gemini 3.5 Flash-Lite mencatatkan bentuk tier tersebut secara resmi. Model ini mencetak 83,8% pada GPQA Diamond dan 54,2% pada SWE-Bench Pro, 54% pada Terminal-bench 2.1, 41,3% pada SciCode dan 39,2% pada MLE-Bench, serta 18,8% pada Humanity's Last Exam. Itulah angka-angka dari tier serbaguna yang mumpuni dan murah — kuat dalam pertanyaan pengetahuan, tetapi jelas tertinggal dalam evaluasi penalaran dan penelitian yang paling sulit. Claude Haiku 5.5 dengan skor 43,40 pada komposit berada di kelas yang sama sekali berbeda, dan pembacaan praktisnya adalah bahwa pekerjaan yang membutuhkan perencanaan multi-langkah dalam jangka panjang sama sekali bukan pekerjaan untuk tier Google.
Satu juta token untuk jendela, dan 65.536 untuk jawaban
Kedua jendela konteks itu berukuran sama dan keduanya bukan produk yang sama.
Konteks panjang pada Gemini 3.5 Flash-Lite menurun seiring bertambahnya jarak dengan cara yang layak diperhitungkan sebelum dipercaya. Pada GDM-MRCR v2, evaluasi pengambilan delapan-needle, nilainya rata-rata 72,2% ketika needle berada di dalam 128.000 token dan 21,3% pada varian pointwise satu juta token. Angka Long-Context Recall-nya adalah 76%, dan CharXiv Reasoning mencapai 74,5% tanpa alat dan 76,5% dengan alat. Jendela satu juta token adalah kemampuan yang nyata; mengambil informasi secara andal dari ujung terjauhnya adalah kemampuan yang lebih kecil, dan dua angka di atas adalah jarak di antara keduanya. Jendela model Claude belum diukur dengan cara yang sama pada papan evaluasi yang sama, jadi tidak ada angka setara yang tersedia untuknya, dan tulisan ini tidak akan mengarangnya.
Batas keluaran adalah perbedaan yang lebih langsung berguna. Claude Haiku 5.5 akan mengeluarkan 128.000 token dalam satu respons; Gemini 3.5 Flash-Lite berhenti pada 65.536. Jika artefak yang ingin Anda terima kembali adalah file panjang, migrasi penuh, rangkaian tes yang dihasilkan, atau penulisan ulang berskala transkrip, salah satu dari dua model ini dapat menghasilkannya dalam satu panggilan dan yang lain tidak — dan pekerjaan yang dipecah menjadi dua panggilan biayanya lebih dari dua kali lipat biaya satu panggilan, karena prefiks bersama dikirim dua kali.

Audio dan video bukanlah soal harga
Gemini 3.5 Flash-Lite menerima video, audio, dan file dengan tarif yang sama seperti teks. Claude Haiku 5.5 menerima teks dan gambar.
Untuk pipeline yang menyimak panggilan terekam, tangkapan layar, atau rekaman pengawasan, perbedaan kemampuan yang penting bukanlah dua puluh satu poin indeks. Yang penting adalah bahwa salah satu model ini menerima input secara langsung, sedangkan yang lain memerlukan tahap transkripsi atau ekstraksi bingkai di depannya — model kedua, tagihan kedua, dan mode kegagalan baru yang berada di antara sumber dan jawaban. Tim dalam posisi itu tidak memilih di antara dua tingkat murah. Mereka memilih antara satu model dan sebuah pipeline.
Hal sebaliknya berlaku untuk gambar dan dokumen. Kedua model membaca gambar secara native, dan Claude Haiku 5.5 melakukannya pada 43.40 pada komposit, jadi beban kerja ekstraksi gambar halaman atau pemahaman diagram tanpa audio di dalamnya berada di sisi Anthropic berdasarkan angka, bukan berdasarkan argumen modalitas.
Menjalankan salah satu dari keduanya dari sini
Gemini 3.5 Flash-Lite ada di katalog OrcaRouter dengan harga daftar Google dan markup 0%, yang berarti tarif penyedia diteruskan apa adanya alih-alih digabungkan, dan perubahan pada kartu harga Google sampai ke invoice Anda pada hari yang sama saat perubahan itu sampai ke invoice mereka. Itu berarti satu kunci dan satu SDK untuk tier Google bersama Claude Sonnet 5.5 dan Claude Opus 5.5, yang juga ada di katalog — jadi A/B antara jalur Google Flash-Lite dan jalur Anthropic sudah menjadi konfigurasi, bukan proyek integrasi. Failover otomatis berada di bawahnya, jadi tidak ada jalur yang menjadi titik kegagalan tunggal, dan DSL perutean akan mengungkapkan eskalasi di dalam rute jika memang di sanalah logikanya berada.
Profil latensi untuk segmen itu didasarkan pada pengukuran kami sendiri, bukan pada pengukuran vendor. Sepanjang tujuh hari terakhir lalu lintas langsung, Gemini 3.5 Flash-Lite mempertahankan p50 sebesar 2.426 milidetik dan p95 sebesar 8.600 milidetik pada 280 token keluaran per detik, dengan tingkat kesalahan 0,313%. Bacalah sebagai jendela bergulir dan bukan sebagai janji: angka itu bergerak seiring pergerakan lalu lintas dan kondisi penyedia, dan angka yang dapat dipercaya untuk pipeline tertentu adalah angka yang Anda ukur sendiri setelah satu minggu.

Claude Haiku 5.5 tidak ada di katalog. Model itu dirilis pada 7 Oktober 2026 — sehari sebelum ini ditulis — dan hari ini tidak dapat dirutekan dari kami, jadi sisi Anthropic dalam perbandingan ini untuk saat ini hanya dapat dijangkau di Anthropic. Mengatakannya secara terus terang lebih baik daripada membiarkannya tersirat. Kesenjangan antara sebuah model dirilis dan sebuah model dapat dipanggil melalui kami adalah hal yang normal, ini bukan janji tentang kapan jeda itu berakhir, dan pembaca yang merencanakan migrasi harus merencanakan berdasarkan kalender yang dapat mereka lihat, bukan kalender yang mereka inginkan.
Yang mana, dan untuk siapa
Jika pekerjaannya adalah teks masuk dan teks keluar, jika promptnya muat di bawah 100.000 token, dan jika tugasnya memerlukan perencanaan multi-langkah atau agen horizon panjang, Claude Haiku 5.5 adalah model yang lebih kuat dengan selisih dua puluh satu poin dan yang lebih murah per token dengan faktor tiga hingga lima. Anggarkan berdasarkan biaya per tugas, bukan berdasarkan kartu tarif, perkirakan sekitar $0.21 untuk jenis pekerjaan yang diukur oleh dewan independen, dan hitung ulang prompt Anda sebelum meramalkan apa pun, karena perubahan tokenizer menggeser jumlahnya sekitar tiga puluh persen dengan sendirinya.
Jika pekerjaannya singkat, bervolume tinggi, dan berbentuk jawaban — sebuah tag, kategori, ekstraksi, keputusan guardrail — maka aritmetikanya mendukung Gemini 3.5 Flash-Lite, dan itu karena alasan yang tidak mentereng. Biaya untuk panggilan yang menghasilkan sangat sedikit didominasi oleh input, kedua tarif inputnya adalah $0.30 versus $0.10, dan jejak tugas model Google yang jauh lebih pendek berarti tarif yang lebih murah memenangkan pekerjaan yang sudah selesai meskipun kalah di harga tertera. Tambahkan input video, audio, atau file dan pilihannya sama sekali tidak lagi soal harga.
Apa yang sebenarnya disimpulkan oleh pasangan ini lebih sempit daripada "Haiku baru itu murah." Ini menyimpulkan bahwa tarif utama pada tier murah adalah panduan yang buruk untuk mengetahui berapa biaya tier itu bagi Anda, dan bahwa model yang tampak tiga kali lebih mahal di halaman harga justru bisa mengirimi Anda tagihan yang lebih kecil. Bagaimanapun Anda memutuskannya, ukurlah token yang Anda keluarkan, bukan token yang Anda kirim, karena pada kedua model ini itulah meteran yang benar-benar menjadi dasar tagihan.
