Kartu judul yang dihasilkan bertuliskan 'Claude Haiku 5.5: langkah harga 100K', menampilkan dua kartu harga — 'Di bawah 100K token: $0.10 masuk / $0.50 keluar' dan 'Di atas 100K token: $0.50 masuk / $2.50 keluar' — dengan grafik langkah menanjak di antara keduanya dan baris footer 'Harga daftar Anthropic, Oktober 2026.' Logo OrcaRouter asli dikompositkan di kanan bawah.
Guides & Insights

Kisah Sebenarnya dari Claude Haiku 5.5 Adalah Jurang 100K: Berapa Biaya Haiku Baru Melewati 100.000 Token

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Claude Haiku 5.5 hadir pada 7 Oktober 2026 dengan harga utama $0,10 per juta token masukan dan $0,50 per juta token keluaran, dan angka yang diulang di mana-mana adalah angka yang Anthropic sendiri cantumkan dalam pengumuman: potongan 90 persen dibandingkan tarif Haiku 4.5 untuk dua pos tagihan yang sama. Angka 90 persen itu nyata. Angka itu juga hanya mencakup separuh dari satu dimensi tagihan, dan begitu sebuah permintaan melewati 100.000 token, setiap tarif di dalamnya melakukan sesuatu yang sebagian besar liputan peluncuran lewatkan. Tulisan ini membahas garis batas itu — berapa biayanya, beban kerja mana yang benar-benar melewatinya, dan mengapa "90 persen lebih murah" adalah klaim tentang sepotong tagihan, bukan tentang tagihan Anda.

Kedua harga, dan di mana keduanya berganti

Anthropic menerbitkan dua kolom untuk model tersebut, dan peralihan di antara keduanya adalah ambang tunggal pada ukuran permintaan, bukan pada pengaturan model apa pun yang Anda pilih:

• Tingkat pendek, pada atau di bawah 100.000 token — $0,10 per juta token input, $0,50 per juta token output (daftar A​nthropic) • Tingkat panjang, di atas 100.000 token — $0,50 per juta token input, $2,50 per juta token output (daftar A​nthropic) • Pembacaan cache — $0,01 per juta (tingkat pendek) dan $0,05 per juta (tingkat panjang) • Batch API — diskon 50 persen untuk kolom mana pun, dan panjang output maksimum 300.000 token • Output maksimum standar — 128.000 token, dengan jendela konteks 1 juta token di kedua tingkat

A generated single-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' listing Input price (under 100K): $0.10 per million, Output price (under 100K): $0.50 per million, Input price (over 100K): $0.50 per million, Output price (over 100K): $2.50 per million, Context window: 1,000,000 tokens, AA Index: 43.4, with the footer 'Anthropic list prices; AA Index per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.

Itu adalah tarif terbitan A​nthropic sendiri, bukan tarif hasil pengukuran, dan itulah daftar saat ini: penetapan harga untuk model sebaru ini belum sempat berubah, meskipun A​nthropic tidak terikat pada komitmen apa pun untuk mempertahankannya.

Baca keempat angka itu secara berurutan dan bentuk persoalannya langsung jelas. Setiap tarif di tier konteks panjang persisnya lima kali tarif konteks pendek, dan ambangnya sama, yaitu 100.000 token untuk semuanya sekaligus. Tidak ada kurva bertahap, tidak ada interpolasi, tidak ada pita perantara — permintaan 99.000 token dan permintaan 101.000 token berbeda dengan faktor lima pada setiap token dalam tagihan, bukan hanya pada 2.000 token yang melewati batas itu. Itulah bagian yang menjadikannya jurang alih-alih lereng, dan itulah bagian yang tidak bisa dilihat oleh pembingkaian "90 persen lebih murah".

A screenshot of Anthropic's Claude Platform Docs pricing page, showing the model pricing table and the per-model rate columns for the Claude line, captured in English.

Kenapa luka itu terlihat lebih besar daripada yang sebenarnya

Dibandingkan dengan Haiku 4.5, perbandingan yang dibuat Anthropic, tier pendek benar-benar merupakan pengurangan 90 persen pada input maupun output — Haiku 4.5 mematok $1,00 dan $5,00 per juta untuk dua kolom yang sama. Tier panjang adalah cerita yang berbeda: $0,50 dan $2,50 dibandingkan dengan $1,00 dan $5,00 yang sama merupakan pemotongan 50 persen, bukan 90 persen. Jadi, versi jujur dari klaim peluncuran adalah bahwa Claude Haiku 5.5 adalah 90 persen lebih murah daripada Haiku 4.5 di bawah 100.000 token dan 50 persen lebih murah di atasnya, yang persis merupakan pembagian yang diberikan dokumentasi Anthropic sendiri begitu Anda membaca kedua kolom, bukan hanya satu. Persentase tunggal itu tidak salah; itu adalah persentase tier pendek, yang disajikan tanpa syaratnya.

Ada hal kedua yang menarik ke arah berlawanan, dan itu yang lebih menarik karena mudah terlewat dan sulit diakali. Claude Haiku 5.5 hadir dengan tokenizer baru, dan panduan Anthropic sendiri menempatkan jumlah token untuk sepotong teks tertentu sekitar 30 persen lebih tinggi daripada yang dihasilkan Haiku 4.5 untuk konten yang sama. Berapa pun yang dulu Anda bayarkan per token turun, dan yang Anda bayarkan per token dari teks *Anda* naik sekitar sepertiga, relatif terhadap penghitungan model lama. Angka bersih yang dinyatakan Anthropic, bahwa model ini sekitar 75 persen lebih murah untuk dijalankan rata-rata, sudah memperhitungkan ini — potongan harga daftar 90 persen dikurangi inflasi token sekitar 30 persen berada di kisaran itu pada trafik konteks pendek — tetapi kedua efek itu dapat dipisahkan dan layak dipisahkan. Pergerakan harga adalah perubahan harga daftar yang dapat Anda baca langsung dari halaman; pergerakan tokenizer mengubah berapa banyak unit harga tersebut yang dikonsumsi oleh prompt Anda yang sudah ada, dan itu muncul dalam jumlah token Anda sendiri sebelum muncul di tempat lain.

Untuk beban kerja yang sudah nyaman berada di bawah 100.000 token per panggilan, efek praktisnya adalah pengurangan biaya per panggilan yang lugas, sebagian diimbangi oleh tokenizer. Untuk beban kerja yang tidak demikian, perhitungannya berjalan ke arah sebaliknya dua kali pada separuh yang panjang.

Apa sebenarnya yang ada di atas 100.000 token?

Refleksnya adalah menggolongkan penetapan harga konteks panjang ke dalam "pengodean agentic dan RAG, bukan kita." Itu terlalu tergesa-gesa, karena batas 100.000 token adalah batas per permintaan, dan ukuran per permintaan tidak sama dengan ukuran tugas. Beberapa pola rutin melampauinya:

• Agen pembaca basis kode yang menyimpan kumpulan kerja besar dalam konteks sepanjang satu sesi, alih-alih mengambil ulang di setiap langkah

• Analisis dokumen dan kontrak yang inputnya berupa PDF panjang ditambah instruksinya sendiri dan contoh few-shot — jenis prompt yang sudah 60.000 token sebelum siapa pun menambahkan contoh-contohnya

• Pipeline ingestasi yang mengelompokkan banyak item kecil ke dalam satu panggilan untuk mengamortisasi overhead per panggilan, dan dengan demikian membuat seluruh batch melewati ambang batas

• Produk chat yang menyimpan riwayat percakapan lengkap secara inline alih-alih merangkumnya, di mana permintaan bertambah secara monoton sampai ada sesuatu yang memotongnya

• Input bergaya transkripsi audio dan video panjang, yang justru merupakan trafik yang diklaim dapat dimungkinkan oleh jendela 1 juta token

Jendela konteks 1 juta token adalah bagian dari lembar spesifikasi yang membuat jurang itu layak dibicarakan. Anthropic menjual kemampuan untuk memberikan permintaan yang sangat besar kepada model, dan struktur harganya dibuat sedemikian rupa sehingga 900.000 token terakhir dari permintaan tersebut berbiaya lima kali lipat dibandingkan 100.000 token pertama. Kedua fakta itu disengaja; keduanya hanya diumumkan di tempat yang berbeda. Jika jendela konteks panjang adalah alasan Anda sama sekali melihat model ini, kolom konteks panjang adalah kolom Anda, dan persentase peluncuran adalah milik orang lain.

Tekanan yang diberikan harga pada Flash tier

Niat yang dinyatakan Anthropic di balik model ini adalah memegang ujung stack yang murah dan memiliki throughput tinggi, dan daftar harganya mencerminkan niat itu secara gamblang. Pemberitaan Bloomberg tentang peluncuran tersebut membingkainya sebagai Anthropic yang mempertahankan posisi berbiaya lebih rendah terhadap pesaing open-weight yang lebih murah, dan pembingkaian dari sisi vendor melangkah lebih jauh — bahwa Haiku baru ini diberi harga untuk menjual lebih murah daripada rival langsungnya dengan selisih yang besar.

Perbandingannya hanya bersih pada tier pendek, di mana $0.10 dan $0.50 sangat rendah secara agresif. Di atas 100.000 token, tarif $0.50 dan $2.50 tidak lagi memotong harga tier pendek siapa pun; angka-angka itu adalah angka tier menengah yang biasa. Klaim "margin lebar" dari vendor adalah pernyataan tentang kolom pertama kartu tarif, dan A​nthropic berhak mengatakannya di sana — itu adalah pembacaan yang akurat atas angka-angka yang dipublikasikannya. Itu bukan klaim tentang berapa yang dibayar oleh beban kerja konteks panjang, dan tidak seharusnya dikutip sebagai klaim demikian.

Sisa dari model, secara singkat

Claude Haiku 5.5 mempertahankan fitur-fitur yang dirilis pada lini Sonnet dan Opus alih-alih memangkasnya untuk kelas ukuran tersebut. Adaptive thinking dengan pengaturan effort default medium tersedia, dan ini adalah model pertama di kelas Haiku dengan tombol effort yang dapat disesuaikan mulai dari Low hingga Max. Batas pengetahuan (knowledge cutoff) adalah Juni 2026 dan ID modelnya adalah claude-haiku-5-5. A​nthropic menyatakan tanggal penghentian tidak lebih cepat dari 7 Oktober 2027 — tanggal yang sama dengan perilisannya, satu tahun setelahnya — dan model ini terdaftar di Amazon Bedrock, G​oogle Cloud, dan Microsoft Azure bersama dengan API milik A​nthropic sendiri.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5, headlined 'Proprietary model — Released October 2026', with an Intelligence Index of 43.395, speed #10 of 182, and a cost comparison block showing $0.10 input.

Di sisi benchmark, semua yang ada dalam postingan peluncuran membawa label asal-usul yang sama dan pantas menyandangnya: ini adalah angka yang dilaporkan vendor, diukur oleh perusahaan yang menjual model tersebut, tanpa reproduksi independen yang diterbitkan pada saat penulisan.

• GDPval-AA v2.1 — menurut laporan vendor 1.620 untuk Claude Haiku 5.5, dibandingkan dengan 735 untuk Haiku 4.5 dalam harness yang sama

• AA-Briefcase v1.1 — dilaporkan vendor 1.578, dibandingkan dengan 614 pada generasi sebelumnya

• OSWorld 2.1 — 72,4 persen menurut laporan vendor, dibandingkan dengan 15,7 persen

• Terminal-Bench 4.0 — dilaporkan vendor 39.2, dibandingkan 0.0

• Humanity's Last Exam — dilaporkan vendor 45,9 persen, atau 57,4 dengan penggunaan alat

Besarnya delta-delta tersebut adalah alasan untuk {{1}}menandainya alih-alih mengutipnya{{/1}}. Lonjakan dari 15.7 ke 72.4 pada benchmark OS-agent yang diukur oleh vendor model itu sendiri adalah angka yang perlu dipegang dengan longgar sampai {{2}}pihak ketiga menjalankan harness yang sama{{/2}}. Artificial Analysis telah menerbitkan indeksnya sendiri untuk model tersebut per awal Oktober 2026 — angka independen sebesar 43.395, dengan 0.329 pada Terminal-Bench Hard dan 0.444 pada HLE — dan kumpulan angka itulah yang harus dikutip ketika klaim perlu bertahan menghadapi tantangan. Angka-angka vendor dan angka-angka independen tidak saling bertentangan; keduanya sekadar berasal dari harness yang berbeda, dan mencampurnya ke dalam satu kalimat adalah cara sebuah pos blog berakhir dengan menyatakan bahwa evaluasi vendor adalah fakta.

Catatan infrastruktur, karena kami menjalankan satu

Anthropic menjual Claude Haiku 5.5 melalui API-nya sendiri dan melalui Bedrock, Google Cloud, serta Azure. Jika Anda sedang memutuskan mana dari opsi tersebut yang akan dipanggil, atau Anda sedang menambahkannya di samping model lain yang sudah ada di stack Anda, perlu diketahui bahwa harga daftar dari vendor sama di mana pun model itu dijual, dan OrcaRouter dirancang untuk meneruskan harga daftar tersebut tanpa markup — sehingga perubahan harga Anthropic pada model ini langsung berlaku di sisi kami pada hari yang sama, bukan dengan jeda. Katalog kami juga memuat qwen/qwen3.8-flash dengan harga $0,15 dan $0,47 per juta serta z-ai/glm-5.3-flash dengan harga $0,15 dan $0,50, pasangan yang paling sering berakhir di slot di samping model kelas Haiku, pada kunci yang sama dan tagihan yang sama — hal yang membuat stack campuran hanya memerlukan satu kontrak alih-alih tiga. Kami tidak menyediakan Claude Haiku 5.5 itu sendiri; untuk itu, panggil Anthropic secara langsung.

Satu konsekuensi praktis dari jurang ini: jika Anda merutekan lebih dari satu model, batas 100.000 token adalah tempat di mana permintaan yang tadinya murah menjadi mahal tanpa ada perubahan yang berarti pada permintaan itu. Jika lapisan perutean Anda memungkinkan, bentuk yang masuk akal adalah menjaga trafik konteks panjang tetap diarahkan ke model mana pun yang murah di atas ambang tersebut dan membiarkan trafik konteks pendek jatuh ke model mana pun yang murah di bawahnya, alih-alih menganggap tarif utama satu model berlaku untuk keduanya.

Apa yang bisa diambil dari peluncuran

Pemotongan harganya nyata dan besar, di bawah 100.000 token. Model ini adalah Haiku pertama dengan set fitur yang sudah tuntas dirilis dan dial effort, yang lebih penting untuk penggunaan agentic daripada harganya. Delta benchmark-nya dilaporkan vendor dan harus dilabeli begitu setiap kali diulang. Dan daftar harganya memiliki lonjakan pada 100.000 token yang mengalikan setiap tarif dengan lima sekaligus — yang merupakan satu hal tentang peluncuran ini yang paling perlu diketahui oleh pembaca stack Anda, bukan pembaca siaran pers, sebelum anggaran token sprint berikutnya ditetapkan.

Jika Anda ingin memeriksa aritmetika terhadap trafik Anda sendiri, dua angka yang perlu diambil adalah persentil ke-95 dari ukuran permintaan Anda dan porsi pengeluaran Anda untuk permintaan di atas 100.000 token. Jika angka pertama berada di bawah garis, 90 persen berlaku untuk Anda dan liputan peluncuran benar tentang situasi Anda. Jika angka kedua merupakan bagian yang cukup besar dari tagihan, angka yang penting adalah 50, dan ada baiknya menghitung ulang estimasi biaya untuk model mana pun di stack yang Anda pilih berdasarkan asumsi 90.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari