
Kisah Sebenarnya dari Claude Haiku 5.5 Adalah Jurang 100K: Berapa Biaya Haiku Baru Melewati 100.000 Token
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Claude Haiku 5.5 hadir pada 7 Oktober 2026 dengan harga utama $0,10 per juta token masukan dan $0,50 per juta token keluaran, dan angka yang diulang di mana-mana adalah angka yang Anthropic sendiri cantumkan dalam pengumuman: potongan 90 persen dibandingkan tarif Haiku 4.5 untuk dua pos tagihan yang sama. Angka 90 persen itu nyata. Angka itu juga hanya mencakup separuh dari satu dimensi tagihan, dan begitu sebuah permintaan melewati 100.000 token, setiap tarif di dalamnya melakukan sesuatu yang sebagian besar liputan peluncuran lewatkan. Tulisan ini membahas garis batas itu — berapa biayanya, beban kerja mana yang benar-benar melewatinya, dan mengapa "90 persen lebih murah" adalah klaim tentang sepotong tagihan, bukan tentang tagihan Anda.
Kedua harga, dan di mana keduanya berganti
Anthropic menerbitkan dua kolom untuk model tersebut, dan peralihan di antara keduanya adalah ambang tunggal pada ukuran permintaan, bukan pada pengaturan model apa pun yang Anda pilih:
• Tingkat pendek, pada atau di bawah 100.000 token — $0,10 per juta token input, $0,50 per juta token output (daftar Anthropic) • Tingkat panjang, di atas 100.000 token — $0,50 per juta token input, $2,50 per juta token output (daftar Anthropic) • Pembacaan cache — $0,01 per juta (tingkat pendek) dan $0,05 per juta (tingkat panjang) • Batch API — diskon 50 persen untuk kolom mana pun, dan panjang output maksimum 300.000 token • Output maksimum standar — 128.000 token, dengan jendela konteks 1 juta token di kedua tingkat

Itu adalah tarif terbitan Anthropic sendiri, bukan tarif hasil pengukuran, dan itulah daftar saat ini: penetapan harga untuk model sebaru ini belum sempat berubah, meskipun Anthropic tidak terikat pada komitmen apa pun untuk mempertahankannya.
Baca keempat angka itu secara berurutan dan bentuk persoalannya langsung jelas. Setiap tarif di tier konteks panjang persisnya lima kali tarif konteks pendek, dan ambangnya sama, yaitu 100.000 token untuk semuanya sekaligus. Tidak ada kurva bertahap, tidak ada interpolasi, tidak ada pita perantara — permintaan 99.000 token dan permintaan 101.000 token berbeda dengan faktor lima pada setiap token dalam tagihan, bukan hanya pada 2.000 token yang melewati batas itu. Itulah bagian yang menjadikannya jurang alih-alih lereng, dan itulah bagian yang tidak bisa dilihat oleh pembingkaian "90 persen lebih murah".

Kenapa luka itu terlihat lebih besar daripada yang sebenarnya
Dibandingkan dengan Haiku 4.5, perbandingan yang dibuat Anthropic, tier pendek benar-benar merupakan pengurangan 90 persen pada input maupun output — Haiku 4.5 mematok $1,00 dan $5,00 per juta untuk dua kolom yang sama. Tier panjang adalah cerita yang berbeda: $0,50 dan $2,50 dibandingkan dengan $1,00 dan $5,00 yang sama merupakan pemotongan 50 persen, bukan 90 persen. Jadi, versi jujur dari klaim peluncuran adalah bahwa Claude Haiku 5.5 adalah 90 persen lebih murah daripada Haiku 4.5 di bawah 100.000 token dan 50 persen lebih murah di atasnya, yang persis merupakan pembagian yang diberikan dokumentasi Anthropic sendiri begitu Anda membaca kedua kolom, bukan hanya satu. Persentase tunggal itu tidak salah; itu adalah persentase tier pendek, yang disajikan tanpa syaratnya.
Ada hal kedua yang menarik ke arah berlawanan, dan itu yang lebih menarik karena mudah terlewat dan sulit diakali. Claude Haiku 5.5 hadir dengan tokenizer baru, dan panduan Anthropic sendiri menempatkan jumlah token untuk sepotong teks tertentu sekitar 30 persen lebih tinggi daripada yang dihasilkan Haiku 4.5 untuk konten yang sama. Berapa pun yang dulu Anda bayarkan per token turun, dan yang Anda bayarkan per token dari teks *Anda* naik sekitar sepertiga, relatif terhadap penghitungan model lama. Angka bersih yang dinyatakan Anthropic, bahwa model ini sekitar 75 persen lebih murah untuk dijalankan rata-rata, sudah memperhitungkan ini — potongan harga daftar 90 persen dikurangi inflasi token sekitar 30 persen berada di kisaran itu pada trafik konteks pendek — tetapi kedua efek itu dapat dipisahkan dan layak dipisahkan. Pergerakan harga adalah perubahan harga daftar yang dapat Anda baca langsung dari halaman; pergerakan tokenizer mengubah berapa banyak unit harga tersebut yang dikonsumsi oleh prompt Anda yang sudah ada, dan itu muncul dalam jumlah token Anda sendiri sebelum muncul di tempat lain.
Untuk beban kerja yang sudah nyaman berada di bawah 100.000 token per panggilan, efek praktisnya adalah pengurangan biaya per panggilan yang lugas, sebagian diimbangi oleh tokenizer. Untuk beban kerja yang tidak demikian, perhitungannya berjalan ke arah sebaliknya dua kali pada separuh yang panjang.
Apa sebenarnya yang ada di atas 100.000 token?
Refleksnya adalah menggolongkan penetapan harga konteks panjang ke dalam "pengodean agentic dan RAG, bukan kita." Itu terlalu tergesa-gesa, karena batas 100.000 token adalah batas per permintaan, dan ukuran per permintaan tidak sama dengan ukuran tugas. Beberapa pola rutin melampauinya:
• Agen pembaca basis kode yang menyimpan kumpulan kerja besar dalam konteks sepanjang satu sesi, alih-alih mengambil ulang di setiap langkah
• Analisis dokumen dan kontrak yang inputnya berupa PDF panjang ditambah instruksinya sendiri dan contoh few-shot — jenis prompt yang sudah 60.000 token sebelum siapa pun menambahkan contoh-contohnya
• Pipeline ingestasi yang mengelompokkan banyak item kecil ke dalam satu panggilan untuk mengamortisasi overhead per panggilan, dan dengan demikian membuat seluruh batch melewati ambang batas
• Produk chat yang menyimpan riwayat percakapan lengkap secara inline alih-alih merangkumnya, di mana permintaan bertambah secara monoton sampai ada sesuatu yang memotongnya
• Input bergaya transkripsi audio dan video panjang, yang justru merupakan trafik yang diklaim dapat dimungkinkan oleh jendela 1 juta token
Jendela konteks 1 juta token adalah bagian dari lembar spesifikasi yang membuat jurang itu layak dibicarakan. Anthropic menjual kemampuan untuk memberikan permintaan yang sangat besar kepada model, dan struktur harganya dibuat sedemikian rupa sehingga 900.000 token terakhir dari permintaan tersebut berbiaya lima kali lipat dibandingkan 100.000 token pertama. Kedua fakta itu disengaja; keduanya hanya diumumkan di tempat yang berbeda. Jika jendela konteks panjang adalah alasan Anda sama sekali melihat model ini, kolom konteks panjang adalah kolom Anda, dan persentase peluncuran adalah milik orang lain.
Tekanan yang diberikan harga pada Flash tier
Niat yang dinyatakan Anthropic di balik model ini adalah memegang ujung stack yang murah dan memiliki throughput tinggi, dan daftar harganya mencerminkan niat itu secara gamblang. Pemberitaan Bloomberg tentang peluncuran tersebut membingkainya sebagai Anthropic yang mempertahankan posisi berbiaya lebih rendah terhadap pesaing open-weight yang lebih murah, dan pembingkaian dari sisi vendor melangkah lebih jauh — bahwa Haiku baru ini diberi harga untuk menjual lebih murah daripada rival langsungnya dengan selisih yang besar.
Perbandingannya hanya bersih pada tier pendek, di mana $0.10 dan $0.50 sangat rendah secara agresif. Di atas 100.000 token, tarif $0.50 dan $2.50 tidak lagi memotong harga tier pendek siapa pun; angka-angka itu adalah angka tier menengah yang biasa. Klaim "margin lebar" dari vendor adalah pernyataan tentang kolom pertama kartu tarif, dan Anthropic berhak mengatakannya di sana — itu adalah pembacaan yang akurat atas angka-angka yang dipublikasikannya. Itu bukan klaim tentang berapa yang dibayar oleh beban kerja konteks panjang, dan tidak seharusnya dikutip sebagai klaim demikian.
Sisa dari model, secara singkat
Claude Haiku 5.5 mempertahankan fitur-fitur yang dirilis pada lini Sonnet dan Opus alih-alih memangkasnya untuk kelas ukuran tersebut. Adaptive thinking dengan pengaturan effort default medium tersedia, dan ini adalah model pertama di kelas Haiku dengan tombol effort yang dapat disesuaikan mulai dari Low hingga Max. Batas pengetahuan (knowledge cutoff) adalah Juni 2026 dan ID modelnya adalah claude-haiku-5-5. Anthropic menyatakan tanggal penghentian tidak lebih cepat dari 7 Oktober 2027 — tanggal yang sama dengan perilisannya, satu tahun setelahnya — dan model ini terdaftar di Amazon Bedrock, Google Cloud, dan Microsoft Azure bersama dengan API milik Anthropic sendiri.

Di sisi benchmark, semua yang ada dalam postingan peluncuran membawa label asal-usul yang sama dan pantas menyandangnya: ini adalah angka yang dilaporkan vendor, diukur oleh perusahaan yang menjual model tersebut, tanpa reproduksi independen yang diterbitkan pada saat penulisan.
• GDPval-AA v2.1 — menurut laporan vendor 1.620 untuk Claude Haiku 5.5, dibandingkan dengan 735 untuk Haiku 4.5 dalam harness yang sama
• AA-Briefcase v1.1 — dilaporkan vendor 1.578, dibandingkan dengan 614 pada generasi sebelumnya
• OSWorld 2.1 — 72,4 persen menurut laporan vendor, dibandingkan dengan 15,7 persen
• Terminal-Bench 4.0 — dilaporkan vendor 39.2, dibandingkan 0.0
• Humanity's Last Exam — dilaporkan vendor 45,9 persen, atau 57,4 dengan penggunaan alat
Besarnya delta-delta tersebut adalah alasan untuk {{1}}menandainya alih-alih mengutipnya{{/1}}. Lonjakan dari 15.7 ke 72.4 pada benchmark OS-agent yang diukur oleh vendor model itu sendiri adalah angka yang perlu dipegang dengan longgar sampai {{2}}pihak ketiga menjalankan harness yang sama{{/2}}. Artificial Analysis telah menerbitkan indeksnya sendiri untuk model tersebut per awal Oktober 2026 — angka independen sebesar 43.395, dengan 0.329 pada Terminal-Bench Hard dan 0.444 pada HLE — dan kumpulan angka itulah yang harus dikutip ketika klaim perlu bertahan menghadapi tantangan. Angka-angka vendor dan angka-angka independen tidak saling bertentangan; keduanya sekadar berasal dari harness yang berbeda, dan mencampurnya ke dalam satu kalimat adalah cara sebuah pos blog berakhir dengan menyatakan bahwa evaluasi vendor adalah fakta.
Catatan infrastruktur, karena kami menjalankan satu
Anthropic menjual Claude Haiku 5.5 melalui API-nya sendiri dan melalui Bedrock, Google Cloud, serta Azure. Jika Anda sedang memutuskan mana dari opsi tersebut yang akan dipanggil, atau Anda sedang menambahkannya di samping model lain yang sudah ada di stack Anda, perlu diketahui bahwa harga daftar dari vendor sama di mana pun model itu dijual, dan OrcaRouter dirancang untuk meneruskan harga daftar tersebut tanpa markup — sehingga perubahan harga Anthropic pada model ini langsung berlaku di sisi kami pada hari yang sama, bukan dengan jeda. Katalog kami juga memuat qwen/qwen3.8-flash dengan harga $0,15 dan $0,47 per juta serta z-ai/glm-5.3-flash dengan harga $0,15 dan $0,50, pasangan yang paling sering berakhir di slot di samping model kelas Haiku, pada kunci yang sama dan tagihan yang sama — hal yang membuat stack campuran hanya memerlukan satu kontrak alih-alih tiga. Kami tidak menyediakan Claude Haiku 5.5 itu sendiri; untuk itu, panggil Anthropic secara langsung.
Satu konsekuensi praktis dari jurang ini: jika Anda merutekan lebih dari satu model, batas 100.000 token adalah tempat di mana permintaan yang tadinya murah menjadi mahal tanpa ada perubahan yang berarti pada permintaan itu. Jika lapisan perutean Anda memungkinkan, bentuk yang masuk akal adalah menjaga trafik konteks panjang tetap diarahkan ke model mana pun yang murah di atas ambang tersebut dan membiarkan trafik konteks pendek jatuh ke model mana pun yang murah di bawahnya, alih-alih menganggap tarif utama satu model berlaku untuk keduanya.
Apa yang bisa diambil dari peluncuran
Pemotongan harganya nyata dan besar, di bawah 100.000 token. Model ini adalah Haiku pertama dengan set fitur yang sudah tuntas dirilis dan dial effort, yang lebih penting untuk penggunaan agentic daripada harganya. Delta benchmark-nya dilaporkan vendor dan harus dilabeli begitu setiap kali diulang. Dan daftar harganya memiliki lonjakan pada 100.000 token yang mengalikan setiap tarif dengan lima sekaligus — yang merupakan satu hal tentang peluncuran ini yang paling perlu diketahui oleh pembaca stack Anda, bukan pembaca siaran pers, sebelum anggaran token sprint berikutnya ditetapkan.
Jika Anda ingin memeriksa aritmetika terhadap trafik Anda sendiri, dua angka yang perlu diambil adalah persentil ke-95 dari ukuran permintaan Anda dan porsi pengeluaran Anda untuk permintaan di atas 100.000 token. Jika angka pertama berada di bawah garis, 90 persen berlaku untuk Anda dan liputan peluncuran benar tentang situasi Anda. Jika angka kedua merupakan bagian yang cukup besar dari tagihan, angka yang penting adalah 50, dan ada baiknya menghitung ulang estimasi biaya untuk model mana pun di stack yang Anda pilih berdasarkan asumsi 90.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
