
Claude Haiku 5.5 vs Claude Haiku 4.5: Pemotongan Harga 90% Bukan Penghematan 90%
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Claude Haiku 5.5 dibanderol dengan harga $0,10 per juta token masukan dan $0,50 per juta token keluaran untuk prompt hingga 100.000 token. Claude Haiku 4.5 berbiaya $1 dan $5, tetap, untuk seluruh jendela 200.000 token yang selalu dimilikinya. Anthropic menyebut perbedaannya sebagai "90% lebih rendah" dalam satu catatan kaki dan "sekitar 75% lebih murah untuk dijalankan" dalam kalimat di atasnya — dan jarak sebelas bulan antara kedua model itu persis sama dengan jarak antara kedua angka tersebut.
Itu bukan trik pemasaran. Itu adalah bentuk jujur dari generasi model yang mengubah tokenizer-nya, mode berpikir default-nya, dan jendela konteksnya bersamaan dengan harganya, dan ini berarti siapa pun yang mengganti id model dan mengharapkan tagihannya turun dengan faktor sepuluh akan kecewa karena aritmetikanya, bukan karena produknya.
Kedua model, sebagaimana dikirim
Semua di bawah ini adalah per juta token, dalam dolar AS, dan diambil dari dokumentasi penetapan harga dan model milik Anthropic sendiri pada 2026-10-08 kecuali dinyatakan lain.

• Masukan — Claude Haiku 5.5 $0,10 hingga 100.000 token, $0,50 di atasnya; Claude Haiku 4.5 $1,00 berapa pun panjangnya.
• Output — Claude Haiku 5.5 $0.50 hingga 100.000 token, $2.50 di atasnya; Claude Haiku 4.5 $5.00 tanpa memandang panjangnya.
• Pembacaan cache — Claude Haiku 5.5 $0,01 hingga 100.000 token dan $0,05 di atasnya; Claude Haiku 4.5 $0,10. Penulisan cache — $0,125 dan $0,625 dibandingkan dengan $1,25.
• Konteks — 1 juta token dibandingkan dengan 200.000. Output maksimum — 128.000 token dibandingkan dengan 64.000.
• 思考 — Claude Haiku 5.5 是自适应的,并且默认开启,其 effort 调节默认设为 medium;Claude Haiku 4.5 采用旧版手动形式,完全没有 effort 参数。
• Skor independen — Artificial Analysis Intelligence Index v4.3.2 menempatkan Claude Haiku 5.5 (Max) pada 43,40, peringkat kedua dari 182 model, dan Claude 4.5 Haiku pada 16,88, peringkat ketiga puluh dari 61 — dengan penilai menandai skor 4.5 sebagai estimasi.
• Kecepatan — sumber yang sama mengukur 242 token keluaran per detik untuk Claude Haiku 5.5 dibandingkan 89,7 untuk generasi 4.5, yang merupakan satu-satunya tempat model lama masih terlihat nyaman.
Di mana kisah sepersepuluh harga itu runtuh
Tiga hal menggerogoti pemangkasan itu, dan hanya yang pertama di antaranya adalah peringatan Anthropic sendiri.
Tokenizer adalah faktor terbesar. Claude Haiku 5.5 menggunakan tokenizer yang lebih baru yang diperkenalkan dengan Claude 4.7, dan dokumentasi Anthropic mengatakan teks yang sama "terhitung sekitar 30% lebih banyak token daripada di Claude Haiku 4.5." Anda tidak membayar sepersepuluh tarif untuk jumlah token yang sama; Anda membayar sepersepuluh tarif untuk sekitar 1,3 kali jumlah token. Panduan migrasi vendor itu sendiri menjadikan ini item kedua dalam daftar periksanya, sebelum setiap perubahan kode: hitung ulang prompt Anda, lalu tinjau kembali max_tokens dan estimasi biaya Anda.
Token thinking ditagih sebagai token output, dan Claude Haiku 5.5 berpikir secara default. Halaman peluncuran Anthropic secara eksplisit menyatakan bahwa model itu "sangat verbose" berdasarkan grafiknya sendiri, dan pengukuran independen mendukung hal tersebut dengan lebih tajam daripada yang dilakukan vendor: saat mengevaluasi Intelligence Index, Artificial Analysis mencatat 440 juta token output dari Claude Haiku 5.5 dibandingkan dengan median 100 juta secara keseluruhan, dan menandai model tersebut sebagai sangat verbose. Tarif input yang murah tidak membantu beban kerja yang tagihannya sebagian besar berupa output.
Langkah 100.000 token adalah yang ketiga. Di atasnya, tarifnya adalah $0,50 dan $2,50 — setengah dari yang dibebankan Claude Haiku 4.5, untuk permintaan yang sama, yang merupakan penawaran bagus dan bukan penawaran yang mungkin sudah dibaca oleh sebagian besar pembaca. Anthropic mengatakan prompt di bawah ambang batas menyumbang sekitar 90% dari permintaan ke model Haiku sebelumnya, yang merupakan angka yang menjadikan pemotongan harga itu layak sebagai judul berita; itu juga merupakan komposisi lalu lintas vendor sendiri, bukan milik Anda.

Berapa biaya pekerjaan yang sama untuk kedua model tersebut
Biaya per tugas yang diselesaikan adalah metrik yang bertahan terhadap ketiga efek di atas, karena ini membebankan model untuk semua yang dihasilkannya, bukan hanya apa yang Anda kirimkan kepadanya.
Artificial Analysis menempatkan Claude Haiku 5.5 (Max) pada $0,21 per tugas Intelligence Index — angka yang dipublikasikannya bersama tarif input $0,10 dan tarif output $0,50. Untuk generasi 4.5, ia sama sekali tidak mempublikasikan angka biaya per tugas; petaknya bertuliskan tidak diketahui, karena model tersebut tidak pernah dijalankan pada Index dalam konfigurasi penalaran. Yang dipublikasikan halaman itu adalah label harga mentah $1,00 dan $5,00 serta skor terukur yang berbeda dan lebih rendah.
Jadi perbandingan yang jujur bagi pembeli bukanlah 10x pada token, melainkan lebih dekat ke ini: sepersepuluh tarif input untuk 30% lebih banyak token, setengah tarif output saat Anda melewati 100K, dan model yang menghabiskan lebih banyak token output per jawaban daripada pendahulunya — dibandingkan dengan lompatan kemampuan dari 16.88 ke 43.40 pada papan independen yang sama. Angka 75% yang dikutip Anthropic untuk beban kerja rata-rata adalah angka perencanaan yang masuk akal. Ini juga estimasi vendor gabungan atas campuran lalu lintas yang tidak Anda kendalikan.
Migrasi ini bukan penukaran model-id
Panduan migrasi Anthropic mencakup sepuluh poin bagi siapa pun yang beralih dari Claude Haiku 4.5, dan beberapa di antaranya merupakan kegagalan serius, bukan sekadar saran.
• Pemikiran manual tidak berfungsi — thinking: {"type": "enabled", "budget_tokens": N} menghasilkan error. Pemikiran adaptif menggantikannya, dan thinking.display harus diatur ke "summarized" jika Anda ingin melihat penalarannya sama sekali.
• Parameter sampling rusak — temperature, top_p dan top_k semuanya harus dikeluarkan dari permintaan.
• Prefill asisten bermasalah — percakapan yang diakhiri pada giliran asisten akan menghasilkan error; akhiri pada giliran pengguna.
• Perubahan urutan blok — respons dapat dimulai dengan blok pemikiran, sehingga kode yang membaca blok konten pertama sebagai jawaban harus memilih berdasarkan type sebagai gantinya.
• Penolakan adalah hal baru — model menjalankan pengklasifikasi keamanan, dapat mengembalikan stop_reason: "refusal", dan tidak ada fallback di sisi server.
• Pemutaran ulang dibatasi — blok pemikiran hanya berfungsi di akun yang menghasilkannya, atau akun yang tertaut dengannya.
• Priority Tier tidak berlaku — organisasi yang memiliki komitmen Priority Tier pada Claude Haiku 4.5 harus merencanakan kapasitas secara terpisah, karena tier ini tidak didukung pada Claude Haiku 5.5.
Dua di antaranya layak mendapat perhatian lebih daripada yang lain. Alasan berhenti refusal adalah perubahan alur kendali pada setiap perulangan yang mengasumsikan setiap respons memiliki konten, dan blok thinking yang terikat akun merusak setiap antrean yang menyimpan percakapan lalu memutarnya kembali melalui kumpulan kredensial. Keduanya baru muncul saat masuk tahap produksi.
Menjalankan kedua tier dengan satu kunci
Pertanyaan praktis bagi sebagian besar tim bukanlah model mana dari kedua model ini yang lebih baik, karena jawabannya sepenuhnya bergantung pada panggilan mana yang sedang Anda lakukan. Yang menjadi pertanyaan adalah apakah bagian murah dari sebuah kaskade dapat ditingkatkan secara independen dari segala sesuatu di sekitarnya.
Claude Haiku 4.5 kini tersedia di katalog OrcaRouter dengan harga daftar Anthropic tanpa markup 0%, sehingga tarif dari penyedia diteruskan langsung dan setiap perubahan yang dilakukan Anthropic langsung muncul di sisi kami pada hari yang sama. Claude Sonnet 5.5 dan Claude Opus 5.5 juga tersedia di sana, yang berarti pipeline dua tingkat — model kecil untuk mayoritas tugas rutin, model lebih besar untuk eskalasi — dapat dibangun sekarang dengan satu kunci, satu SDK dan failover otomatis di baliknya, serta bagian model kecil dapat ditukar ke Claude Haiku 5.5 nanti hanya dengan mengubah model-id, bukan menulis ulang.
Claude Haiku 5.5 belum ada di katalog, dan ada baiknya mengatakan itu secara gamblang daripada membiarkannya tersirat. Jeda pada hari peluncuran antara sebuah model dirilis dan sebuah model dapat dirutekan adalah hal yang normal dan itu bukan janji tentang kapan jeda itu berakhir; model yang dapat dipanggil melalui kami pagi ini adalah model yang disebutkan di atas.

Siapa yang harus beralih, dan panggilan mana yang harus dialihkan lebih dulu
Jika trafik Haiku 4.5 Anda adalah klasifikasi, ekstraksi, perutean, pemadatan, atau peringkasan dengan prompt di bawah 100.000 token, beralihlah — tarifnya sepersepuluh, jendelanya lima kali lebih lebar, dan tombol effort memberi Anda tuas biaya yang tidak pernah dimiliki model lama. Anggarkan sekitar 75% lebih rendah dan cocokkan dengan jumlah token Anda sendiri setelah satu minggu.
Jika prompt Anda rutin melewati 100.000 token, Anda membeli potongan 50%, bukan potongan 90%, dan tier kedua mengubah perbandingan sedemikian rupa sehingga membanding-bandingkan harga menjadi sepadan: tarif output di atas 100K sebesar $2,50 lebih tinggi daripada yang dikenakan beberapa model kecil pesaing untuk seluruh jendela konteks.
Dan jika Anda menggunakan Haiku 4.5 karena itu satu-satunya opsi murah yang cocok untuk dokumen 200.000 token, perhatikan apa yang berubah. Jendelanya kini satu juta token, yang merupakan produk berbeda, dan alasan untuk mempertahankan model lama telah diam-diam hilang bersama alasan model itu dulu murah.
