Kartu hero yang dihasilkan untuk 'Lebih murah per token, lebih mahal per jawaban', berlabel 'BIAYA PER JAWABAN' dengan teks pengantar 'DUA TIER MURAH, SATU PAPAN BERSAMA' dan subjudul 'Claude Haiku 5.5 pada 43,40 dibandingkan dengan Gemini 3.5 Flash-Lite pada 22,2 di Intelligence Index v4.3.2.' Empat chip bertuliskan '43,40 vs 22,2', '$0,21 vs $0,12', '$0,10 vs $0,30' dan '$0,50 vs $2,50'. Dua kartu di bawahnya diberi label 'KEUNGGULAN ANTHROPIC' ('dua puluh satu poin lebih tinggi di papan bersama, dan lebih murah pada kedua meteran') dan 'KEUNGGULAN GOOGLE' ('lebih murah untuk tugas yang selesai, dan dapat menerima video serta audio'). Footer berbunyi 'Skor independen dan biaya per tugas dari Artificial Analysis; harga daftar tercatat pada 8 Oktober 2026.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite: Lebih Murah per Token, Lebih Mahal per Jawaban

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Claude Haiku 5.5 berbiaya $0,10 per juta token masukan dan $0,50 per juta token keluaran. Gemini 3.5 Flash-Lite berbiaya $0,30 dan $2,50 pada dua metrik yang sama. Model Anthropic adalah sepertiga dari harga untuk masukan dan seperlima dari harga untuk keluaran, dan skornya 43,40 berbanding 22,2 pada Artificial Analysis Intelligence Index v4.3.2 — selisih lebih dari dua puluh poin di bidang yang sepuluh poinnya merupakan lompatan antargenerasi. Dalam daftar tarif, ini bukan perbandingan yang tipis, dan dalam hal kemampuan, ini juga bukan perbandingan yang tipis.

Pada faktur, perbandingannya sangat ketat, dan hasilnya justru terbalik. Tempatkan kedua model pada papan independen yang sama dan bebankan biaya kepada masing-masing untuk tugas yang telah selesai, bukan per token, maka Gemini 3.5 Flash-Lite keluar sebagai lebih murah per jawaban. Artificial Analysis mencatat Claude Haiku 5.5 sebesar $0,21 per tugas Intelligence Index dan Gemini 3.5 Flash-Lite sebesar $0,1235 — keunggulan 1,7 banding satu bagi model yang membayar lima kali lebih mahal untuk setiap token yang dihasilkannya.

Pembalikan itulah inti dari perbandingan ini. Claude Haiku 5.5 menggantikan tier termurah yang pernah dirilis Anthropic dan mengalahkan semua yang berada di dekatnya di papan bersama. Gemini 3.5 Flash-Lite dirilis pada 21 Juli 2026 dan telah menjadi pilihan paling bernilai di segmen ini sejak musim panas. Pertanyaan yang sebenarnya dimiliki pembeli bukanlah mana yang lebih baik, karena jawaban atas itu sudah pasti. Melainkan mana yang harus dihadapkan pada permintaan yang harus menghasilkan respons dengan biaya murah.

Semua yang berikut ini dihitung per juta token dalam dolar AS. Harga daftarnya adalah tarif resmi yang diterbitkan sendiri oleh para vendor. Skor independen, angka biaya per tugas, dan pengukuran kecepatan yang diatribusikan kepada Artificial Analysis adalah milik evaluator tersebut. Angka latensi untuk Gemini 3.5 Flash-Lite berasal dari lalu lintas terukur kami sendiri. Jika suatu angka tercantum pada catatan model yang kami simpan, bukan dibaca dari halaman evaluator pada hari itu, kami memperlakukan evaluator tersebut sebagai sumbernya, bukan kami sendiri.

Stiker dan faktur tidak cocok.

Kesenjangan biaya per tugas tidak dijelaskan oleh kartu tarif, dan alasan kesenjangan itu ada patut diketahui sebelum salah satu model mendekati produksi.

Claude Haiku 5.5 bertele-tele, dan evaluator mengatakannya secara gamblang. Saat menjalankan Intelligence Index, Artificial Analysis mencatat 440 juta token output dari model ini, dibandingkan median 100 juta secara keseluruhan, dan menandainya sangat bertele-tele. Proses berpikir ditagih sebagai output, berpikir aktif secara default dengan pengatur upaya yang dimulai dari medium, dan tarif input yang murah tidak membantu beban kerja yang tagihannya sebagian besar berupa output.

Gemini 3.5 Flash-Lite juga tidak ringkas, tetapi secara terukur lebih murah per pekerjaan. Papan yang sama mencatat 17.507 token keluaran per tugas indeks yang diselesaikan untuknya — 10.405 di antaranya penalaran dan 7.102 jawaban. Bandingkan itu dengan volume token model Ant​hropic, dan perhitungannya pun menjadi jelas: keunggulan lima banding satu pada laju keluaran sebagian dikonsumsi oleh model yang mengeluarkan respons lebih besar, dan yang tersisa di tingkat tugas adalah kerugian kecil, bukan keuntungan besar.

Ada efek kedua yang lebih senyap yang bekerja dengan cara yang sama. Dokumentasi Anthropic menyatakan bahwa Claude Haiku 5.5 menggunakan tokenizer yang sama dengan Claude 4.7 dan versi setelahnya, sehingga teks yang sama dihitung sekitar 30% lebih banyak token daripada yang dihitung pada model yang digantikan oleh model ini. Tarifnya turun dengan faktor tiga dibandingkan tier Google. Jumlah tokennya tidak turun, dan pada teks yang sama justru meningkat.

Kedua model, pada angka-angka yang penting

Tarif cache dan harga daftar dari dokumentasi Ant​hropic dan Goo​gle sendiri; angka independen yang diatribusikan kepada Artificial Analysis; latensi langsung dari jendela trafik tujuh hari kami sendiri. Di-cache 2026-10-08.

A generated scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite - on the numbers that matter'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cached input $0.01 and $0.05, maximum output 128,000 tokens, input modality text and images, Intelligence Index v4.3.2 43.40, cost per task $0.21. Gemini 3.5 Flash-Lite reads input $0.30, output $2.50, cached input $0.03, maximum output 65,536 tokens, input modality text images video audio and files, Intelligence Index v4.3.2 22.2, cost per task $0.12. A footer reads 'Vendors' published list rates; independent scores and cost per task from Artificial Analysis.'

• Masukan — Claude Haiku 5.5 $0.10 hingga 100.000 token dan $0.50 di atasnya; Gemini 3.5 Flash-Lite $0.30 tetap untuk jendela 1.048.576 token.

• Output — Claude Haiku 5.5 $0.50 hingga 100.000 token dan $2.50 di atasnya; Gemini 3.5 Flash-Lite $2.50 flat.

• Input yang di-cache — Claude Haiku 5.5 $0.01 hingga 100.000 token dan $0.05 di atasnya; Gemini 3.5 Flash-Lite $0.03. Penulisan cache adalah $0.125 dan $0.625 per juta token untuk Claude Haiku 5.5.

• Konteks dan output — satu juta token untuk masing-masing. Output maksimum adalah 128.000 token untuk Claude Haiku 5.5 dibandingkan 65.536 untuk Gemini 3.5 Flash-Lite, jadi batas atas Ant​hropic kira-kira dua kali lipat.

• Modalitas masukan — teks dan gambar untuk Claude Haiku 5.5; teks, gambar, video, audio, dan file untuk Gemini 3.5 Flash-Lite. Keduanya mengembalikan teks.

Skor independen — 43,40 untuk Claude Haiku 5.5 (Max), peringkat kedua dari 182 model pada Intelligence Index v4.3.2, dibandingkan dengan 22,2 untuk Gemini 3.5 Flash-Lite, peringkat ke-96 dari 147 dan berada pada persentil ketiga puluh empat di papan peringkat tersebut.

• Biaya independen per tugas — $0,21 dibandingkan dengan $0,1235 pada papan yang sama.

• Throughput — 241,9 token keluaran per detik yang diukur untuk Claude Haiku 5.5 oleh Artificial Analysis, dibandingkan dengan 280,0 untuk Gemini 3.5 Flash-Lite yang diukur di playground kami sendiri selama tujuh hari terakhir. Itu adalah dua harness, bukan satu, jadi bacalah keduanya sebagai perkiraan besaran dan bukan sebagai adu balap.

Dua puluh satu poin, dan terbuat dari apa poin-poin itu

Selisih dua puluh satu poin pada indeks yang mencapai enam puluhan bukanlah margin. Itu adalah perbedaan antara model yang dapat menjalankan loop agentik dan model yang seharusnya diberi satu panggilan dengan spesifikasi yang jelas.

Kedua vendor tidak mengukur harness satu sama lain, sehingga rangkaian uji milik mereka sendiri tidak dapat disandingkan. Ant​hropic menerbitkan hasil GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0, dan FrontierCode untuk Claude Haiku 5.5; Goo​gle menerbitkan rangkaiannya sendiri untuk tier Flash-Lite; tidak satu pun menjalankan milik yang lain. Satu-satunya perbandingan setara yang tersedia adalah papan independen, dan di sana model Ant​hropic unggul dengan selisih yang tidak tipis.

Subskor evaluator untuk Gemini 3.5 Flash-Lite mencatatkan bentuk tier tersebut secara resmi. Model ini mencetak 83,8% pada GPQA Diamond dan 54,2% pada SWE-Bench Pro, 54% pada Terminal-bench 2.1, 41,3% pada SciCode dan 39,2% pada MLE-Bench, serta 18,8% pada Humanity's Last Exam. Itulah angka-angka dari tier serbaguna yang mumpuni dan murah — kuat dalam pertanyaan pengetahuan, tetapi jelas tertinggal dalam evaluasi penalaran dan penelitian yang paling sulit. Claude Haiku 5.5 dengan skor 43,40 pada komposit berada di kelas yang sama sekali berbeda, dan pembacaan praktisnya adalah bahwa pekerjaan yang membutuhkan perencanaan multi-langkah dalam jangka panjang sama sekali bukan pekerjaan untuk tier Google.

Satu juta token untuk jendela, dan 65.536 untuk jawaban

Kedua jendela konteks itu berukuran sama dan keduanya bukan produk yang sama.

Konteks panjang pada Gemini 3.5 Flash-Lite menurun seiring bertambahnya jarak dengan cara yang layak diperhitungkan sebelum dipercaya. Pada GDM-MRCR v2, evaluasi pengambilan delapan-needle, nilainya rata-rata 72,2% ketika needle berada di dalam 128.000 token dan 21,3% pada varian pointwise satu juta token. Angka Long-Context Recall-nya adalah 76%, dan CharXiv Reasoning mencapai 74,5% tanpa alat dan 76,5% dengan alat. Jendela satu juta token adalah kemampuan yang nyata; mengambil informasi secara andal dari ujung terjauhnya adalah kemampuan yang lebih kecil, dan dua angka di atas adalah jarak di antara keduanya. Jendela model Claude belum diukur dengan cara yang sama pada papan evaluasi yang sama, jadi tidak ada angka setara yang tersedia untuknya, dan tulisan ini tidak akan mengarangnya.

Batas keluaran adalah perbedaan yang lebih langsung berguna. Claude Haiku 5.5 akan mengeluarkan 128.000 token dalam satu respons; Gemini 3.5 Flash-Lite berhenti pada 65.536. Jika artefak yang ingin Anda terima kembali adalah file panjang, migrasi penuh, rangkaian tes yang dihasilkan, atau penulisan ulang berskala transkrip, salah satu dari dua model ini dapat menghasilkannya dalam satu panggilan dan yang lain tidak — dan pekerjaan yang dipecah menjadi dua panggilan biayanya lebih dari dua kali lipat biaya satu panggilan, karena prefiks bersama dikirim dua kali.

A screenshot of the Artificial Analysis model page for Gemini 3.5 Flash-Lite, showing the model name over the provider Google, the release month July 2026, a one-million-token context window, the input modality list covering text, image, video, audio and PDF, an Intelligence Index v4.3.2 score of 22, the per-million-token input and output rates with the cached-input discount, and the measured output speed, total response time and cost per task.

Audio dan video bukanlah soal harga

Gemini 3.5 Flash-Lite menerima video, audio, dan file dengan tarif yang sama seperti teks. Claude Haiku 5.5 menerima teks dan gambar.

Untuk pipeline yang menyimak panggilan terekam, tangkapan layar, atau rekaman pengawasan, perbedaan kemampuan yang penting bukanlah dua puluh satu poin indeks. Yang penting adalah bahwa salah satu model ini menerima input secara langsung, sedangkan yang lain memerlukan tahap transkripsi atau ekstraksi bingkai di depannya — model kedua, tagihan kedua, dan mode kegagalan baru yang berada di antara sumber dan jawaban. Tim dalam posisi itu tidak memilih di antara dua tingkat murah. Mereka memilih antara satu model dan sebuah pipeline.

Hal sebaliknya berlaku untuk gambar dan dokumen. Kedua model membaca gambar secara native, dan Claude Haiku 5.5 melakukannya pada 43.40 pada komposit, jadi beban kerja ekstraksi gambar halaman atau pemahaman diagram tanpa audio di dalamnya berada di sisi Ant​hropic berdasarkan angka, bukan berdasarkan argumen modalitas.

Menjalankan salah satu dari keduanya dari sini

Gemini 3.5 Flash-Lite ada di katalog OrcaRouter dengan harga daftar Goo​gle dan markup 0%, yang berarti tarif penyedia diteruskan apa adanya alih-alih digabungkan, dan perubahan pada kartu harga Goo​gle sampai ke invoice Anda pada hari yang sama saat perubahan itu sampai ke invoice mereka. Itu berarti satu kunci dan satu SDK untuk tier Goo​gle bersama Claude Sonnet 5.5 dan Claude Opus 5.5, yang juga ada di katalog — jadi A/B antara jalur Goo​gle Flash-Lite dan jalur Ant​hropic sudah menjadi konfigurasi, bukan proyek integrasi. Failover otomatis berada di bawahnya, jadi tidak ada jalur yang menjadi titik kegagalan tunggal, dan DSL perutean akan mengungkapkan eskalasi di dalam rute jika memang di sanalah logikanya berada.

Profil latensi untuk segmen itu didasarkan pada pengukuran kami sendiri, bukan pada pengukuran vendor. Sepanjang tujuh hari terakhir lalu lintas langsung, Gemini 3.5 Flash-Lite mempertahankan p50 sebesar 2.426 milidetik dan p95 sebesar 8.600 milidetik pada 280 token keluaran per detik, dengan tingkat kesalahan 0,313%. Bacalah sebagai jendela bergulir dan bukan sebagai janji: angka itu bergerak seiring pergerakan lalu lintas dan kondisi penyedia, dan angka yang dapat dipercaya untuk pipeline tertentu adalah angka yang Anda ukur sendiri setelah satu minggu.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing the Anthropic model name and an October 2026 release, Intelligence Index v4.3.2 of 43 ranking second of 182, speed ninth of 182 at 241.9 output tokens per second, a $0.21 cost per task, input $0.10 and output $0.50 per million tokens, and a one-million-token context window.

Claude Haiku 5.5 tidak ada di katalog. Model itu dirilis pada 7 Oktober 2026 — sehari sebelum ini ditulis — dan hari ini tidak dapat dirutekan dari kami, jadi sisi Anthropic dalam perbandingan ini untuk saat ini hanya dapat dijangkau di Anthropic. Mengatakannya secara terus terang lebih baik daripada membiarkannya tersirat. Kesenjangan antara sebuah model dirilis dan sebuah model dapat dipanggil melalui kami adalah hal yang normal, ini bukan janji tentang kapan jeda itu berakhir, dan pembaca yang merencanakan migrasi harus merencanakan berdasarkan kalender yang dapat mereka lihat, bukan kalender yang mereka inginkan.

Yang mana, dan untuk siapa

Jika pekerjaannya adalah teks masuk dan teks keluar, jika promptnya muat di bawah 100.000 token, dan jika tugasnya memerlukan perencanaan multi-langkah atau agen horizon panjang, Claude Haiku 5.5 adalah model yang lebih kuat dengan selisih dua puluh satu poin dan yang lebih murah per token dengan faktor tiga hingga lima. Anggarkan berdasarkan biaya per tugas, bukan berdasarkan kartu tarif, perkirakan sekitar $0.21 untuk jenis pekerjaan yang diukur oleh dewan independen, dan hitung ulang prompt Anda sebelum meramalkan apa pun, karena perubahan tokenizer menggeser jumlahnya sekitar tiga puluh persen dengan sendirinya.

Jika pekerjaannya singkat, bervolume tinggi, dan berbentuk jawaban — sebuah tag, kategori, ekstraksi, keputusan guardrail — maka aritmetikanya mendukung Gemini 3.5 Flash-Lite, dan itu karena alasan yang tidak mentereng. Biaya untuk panggilan yang menghasilkan sangat sedikit didominasi oleh input, kedua tarif inputnya adalah $0.30 versus $0.10, dan jejak tugas model Google yang jauh lebih pendek berarti tarif yang lebih murah memenangkan pekerjaan yang sudah selesai meskipun kalah di harga tertera. Tambahkan input video, audio, atau file dan pilihannya sama sekali tidak lagi soal harga.

Apa yang sebenarnya disimpulkan oleh pasangan ini lebih sempit daripada "Haiku baru itu murah." Ini menyimpulkan bahwa tarif utama pada tier murah adalah panduan yang buruk untuk mengetahui berapa biaya tier itu bagi Anda, dan bahwa model yang tampak tiga kali lebih mahal di halaman harga justru bisa mengirimi Anda tagihan yang lebih kecil. Bagaimanapun Anda memutuskannya, ukurlah token yang Anda keluarkan, bukan token yang Anda kirim, karena pada kedua model ini itulah meteran yang benar-benar menjadi dasar tagihan.