Kartu judul yang dihasilkan bertuliskan 'Claude Haiku 5.5 sudah live' dengan lencana rilis 'GA 7 Okt 2026', dua kartu fakta bertuliskan 'Masukan $0.10 / 1M hingga 100K token' dan 'Keluaran $0.50 / 1M hingga 100K token', serta baris footer bertuliskan 'Satu potongan headline, dua catatan kaki: 90 persen di bawah ambang batas, 50 persen di atasnya, pada sekitar 30 persen lebih banyak token.' Logo OrcaRouter asli dikompositkan di kanan bawah.
Guides & Insights

Claude Haiku 5.5 Kini Hadir dengan $0.10 per Juta Token: Klaim 75%, dan Dua Catatan Kakinya

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Anthropic menempatkan Claude Haiku 5.5 dalam ketersediaan umum pada 7 Oktober 2026 dengan harga $0,10 per juta token masukan dan $0,50 per juta keluaran — dua angka yang sama dengan yang dikenakan OpenAI untuk GPT-6 Luna, dan seperlima dari biaya Claude Haiku 4.5 sejak 2025, saat diluncurkan pada $1,00 dan $5,00. Judul utama dalam tulisan peluncuran Anthropic adalah bahwa model baru ini "berbiaya sekitar 75% lebih murah untuk dijalankan" dibandingkan pendahulunya secara rata-rata, dan itulah angka yang diulang oleh setiap ringkasan sejak itu. Angka itu disertai dua catatan kaki yang sebagian besar ringkasan tersebut hilangkan: di bawah 100.000 token pemotongannya 90%, di atasnya pemotongannya 50%, dan Claude Haiku 5.5 menggunakan tokenizer yang lebih baru yang sama dengan Claude 4.7 dan setelahnya, sehingga teks yang sama dihitung sebagai sekitar 30% lebih banyak token dibandingkan pada Claude Haiku 4.5. Jadi 75% itu adalah pernyataan tentang tagihan, bukan tentang daftar tarif, dan bagi siapa pun yang prompt-nya panjang, keduanya adalah hal yang berbeda. Tabel perbandingan milik vendor sendiri juga menampilkan GPT-6 Luna dan Claude Sonnet 5.5 sebagai kolom di sebelahnya, yang membuat dokumentasi peluncuran ini luar biasa mudah untuk diperdebatkan.

Aritmetika di balik "75% lebih sedikit"

Ambil daftar tarifnya dulu, karena tarifnya tidak seragam. Input adalah $0,10 per juta hingga 100.000 token dan $0,50 per juta di atasnya — lima kali lipat. Output adalah $0,50 lalu $2,50. Caching mengikuti pola yang sama: penulisan cache lima menit adalah $0,125 per juta di bawah ambang dan $0,625 di atasnya, penulisan satu jam adalah $0,20 dan $1,00, dan pembacaan cache adalah $0,01 dan $0,05. Message Batches API memberi potongan 50% untuk kedua meter, dan pada jalur batch model mendukung hingga 300.000 token output dengan output-300k-2026-03-24 header beta.

Sekarang tambahkan tokenizer ke dalam perhitungan itu, karena di situlah klaim utama menjadi menarik. Sebuah prompt yang berukuran 90.000 token pada tokenizer Claude Haiku 4.5 berukuran sekitar 117.000 pada tokenizer baru. Ukurannya tidak berubah, tetapi telah melewati ambang 100.000 token, sehingga ditagih $0,50 per juta token input, bukan $0,10. Pada Claude Haiku 4.5, konten yang sama membutuhkan biaya input $0,09 ($1,00 per juta × 0,09 juta). Pada Claude Haiku 5.5, biayanya $0,0585. Itu adalah pemotongan 35% — nyata, dan jauh dari 90%. Angka 90% berlaku untuk permintaan yang tetap berada di bawah batas setelah tokenizer memperbesarnya, dan di sanalah sebagian besar lalu lintas panggilan pendek berada: panggilan klasifikasi 20.000 token menjadi 26.000 token, tetap berada di tier pertama, dan di sana harga inputnya benar-benar sepersepuluh dari sebelumnya.

Ada tiga hal yang timbul dari itu, dan ketiganya layak dipisahkan, bukan dirata-ratakan:

• Panggilan singkat mendapatkan diskon penuh. Ekstraksi, perutean, klasifikasi, peringkasan dokumen yang muat di bawah batas — semuanya mendapatkan angka 90% pada input dan output, dikurangi ekspansi tokenizer.

• Panggilan panjang mendapat potongan sekitar sepertiga, bukan tiga perempat. Permintaan yang berada di atas 100.000 token setelah tokenisasi ulang dikenai biaya $0,50 dan $2,50 per juta — masih setengah dari tarif Claude Haiku 4.5, tetapi tier yang ditempatinya adalah lima kali tier yang diiklankan label harga.

• Angka "75% lebih sedikit rata-rata" adalah angka yang dibobot berdasarkan lalu lintas dan itu milik Anthropic. Itu adalah deskripsi vendor sendiri tentang komposisi yang diharapkannya sendiri, dan Anthropic secara eksplisit menyatakan bahwa prompt di bawah ambang batas merupakan sekitar 90% dari permintaan ke Haiku sebelumnya. Jika komposisi Anda tidak seperti komposisi itu, rata-rata Anda tidak akan seperti rata-rata itu — dan satu-satunya cara untuk mengetahui yang mana adalah dengan menghitung token pada lalu lintas Anda sendiri, pada tokenizer baru, sebelum Anda menetapkan anggaran.

A generated one-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' with six rows reading 'Input: $0.10 / 1M up to 100K, then $0.50', 'Output: $0.50 / 1M up to 100K, then $2.50', 'Context: 1,000,000 tokens', 'Independent score: 43 at Max effort, rank 2 of 182', 'Cost per task: $0.21', and 'Throughput: 241.9 tokens per second', with a footer reading 'Independent figures per Artificial Analysis; pricing per Anthropic.' The real OrcaRouter logo is composited bottom-right.

Apa lagi yang dikirim bersamanya?

Model ini bukan hanya soal harga. Beberapa detail peluncurannya mengubah cara Anda menulis kode yang berinteraksi dengannya, dan salah satunya akan merusak klien yang sudah ada.

• Pemikiran adaptif aktif secara default, dengan pengatur upaya dari Rendah hingga Maks dan default sedang. Ini adalah model kelas Haiku pertama dengan pengaturan upaya yang dapat disesuaikan, dan ini adalah tuas utama untuk kualitas maupun biaya per jawaban.

• Parameter sampling ditolak. Mengirim non-default temperature, top_p atau top_k akan mengembalikan 400. Migrasi apa pun yang meneruskan argumen tersebut akan gagal secara mencolok pada permintaan pertama alih-alih menurun secara diam-diam, yang setidaknya merupakan kegagalan yang jujur.

• Konteks 1 juta token dan hingga 128.000 token keluaran di Messages API sinkron, dengan batas pengetahuan Juni 2026 dan komitmen penghentian tidak lebih cepat dari 7 Oktober 2027.

• Lima platform pada hari pertama: Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry, dan Claude Platform di AWS. Ini merupakan peluncuran di hari yang sama, bukan ketersediaan bertahap seperti yang sering terjadi pada peluncuran semacam ini.

• Perkakas juga ikut bergerak maju.SDK Python dan TypeScript Anthropic kini mendukung penggunaan komputer dan penggunaan browser dalam versi beta, dan perusahaan menambahkan kredit API bulanan untuk pelanggan Max 5x ($100), Max 20x ($200), serta Team (hingga $500 gabungan).

• Postur keamanannya lebih sempit daripada yang disiratkan oleh harganya. Anthropic mengatakan bahwa perlindungan siber pada Claude Haiku 5.5 lebih ketat daripada Claude Haiku 4.5 tetapi kurang ketat dibandingkan model-model frontier terkini — penggunaan defensif yang lebih luas daripada yang diizinkan Claude Sonnet 5.5, dengan pengujian penetrasi yang masih diblokir — dan bahwa perlindungan biologi setara dengan Claude Sonnet 5, Claude Sonnet 5.5 dan Claude Opus 5. Evaluasi alignment meningkat secara luas dibandingkan pendahulunya pada rangkaian pengujian milik Anthropic sendiri.

Apa yang dikatakan tabel vendor, dan apa yang dikatakan dewan independen

Anthropic menerbitkan tabel tolok ukur dengan tiga kolom perbandingan, dan tabel itu layak dibaca sebagai dokumen tentang bagaimana para vendor berargumen. Setiap angka di bawah ini dilaporkan oleh vendor, dihasilkan pada harness milik Anthropic, dan tidak satu pun telah direproduksi secara independen; ketika GPT-6 Luna muncul, itu adalah Anthropic yang menjalankan evaluasinya sendiri terhadap model pesaing.

• Pekerjaan berbasis pengetahuan — GDPval-AA v2.1 pada 1620 untuk Claude Haiku 5.5, dibandingkan 735 untuk Claude Haiku 4.5, 1437 untuk GPT-6 Luna dan 1840 untuk Claude Sonnet 5.5. AA-Briefcase v1.1 pada 1578, 614, 1336 dan 1824.

• Penggunaan komputer — OSWorld 2.1 offline pada 72,4% dibandingkan 15,7%, 48,9% dan 83,9%.

• Penalaran — Humanity's Last Exam pada 45,9% tanpa alat dan 57,4% dengan alat, dibandingkan dengan 10,2% dan 18,7% untuk Claude Haiku 4.5 serta 56,9% dan 64,5% untuk Claude Sonnet 5.5.

• Pengodean agentik — Terminal-Bench 4.0 sebesar 39,2% dibandingkan 0,0%, 16,4%, dan 70,6%. FrontierCode 1.1 (Main) sebesar 46,4% dibandingkan 42,4% untuk GPT-6 Luna dan 52,1% untuk Claude Sonnet 5.5.

• Pembacaan bagan — Chartography pada 46,4% tanpa alat dibandingkan dengan 6,4%, 29,1% dan 61,6%.

Pada tabel itu, Claude Haiku 5.5 memenangi setiap baris melawan Haiku sebelumnya maupun GPT-6 Luna, dan kalah dalam sebagian besar baris melawan Claude Sonnet 5.5 — yang merupakan gambaran jujur dari tier kecil: lompatan generasi yang besar, tetapi masih satu tier di bawah model menengah untuk pekerjaan tersulit. Anthropic menyatakan hal serupa dalam postingan tersebut, merekomendasikan Claude Sonnet 5.5 dan Claude Opus 5.5 untuk coding agentik yang kompleks sekaligus memposisikan Haiku untuk peran pemadatan, peringkasan, klasifikasi, dan subagen.

Gambaran independennya lebih bernuansa dan menuntut lebih banyak perhatian. Artificial Analysis mengukur Claude Haiku 5.5 pada upaya Max di angka 43 pada Intelligence Index v4.3.2 miliknya, peringkat kedua dari 182 model, dan 241,9 token keluaran per detik — cepat, seperti yang diiklankan. Lembaga itu juga mengukur biaya $0,21 per tugas Index yang diselesaikan, karena model tersebut menghasilkan 440 juta token keluaran saat menjalankan suite tersebut dibandingkan median 100 juta; evaluator menggambarkannya sebagai sangat verbose. GPT-6 Luna, pada 38 di indeks yang sama, berbiaya $0,07 per tugas. Harga label sama, tagihannya tiga kali lipat. Itu bukanlah kontradiksi dari klaim peluncuran — ini fenomena yang sama yang menjadi inti klaim peluncuran, dilihat dari ujung lainnya: daftar tarif adalah apa yang Anda bayar per token, dan angka yang sebenarnya Anda bayar adalah tarif dikali token, dan Claude Haiku 5.5 menghabiskan lebih banyak token per jawaban daripada yang dilakukan para pesaingnya. Upaya adalah tuasnya; default model adalah medium, bukan Max, dan tim yang menetapkannya lebih rendah akan melihat baik tagihan yang lebih kecil maupun skor yang lebih kecil.

Memanggilnya dari satu tempat

Pertanyaan migrasi yang ditimbulkan oleh peluncuran ini bukanlah "apakah ini lebih baik", melainkan "berapa biaya traffic saya di sana", dan jawabannya bergantung pada panjang prompt Anda, tingkat cache hit Anda, dan pengaturan effort yang Anda pilih. Untuk sampai ke titik itu, Anda perlu menjalankan set prompt Anda sendiri melalui kedua generasi — yang murah dilakukan di balik satu endpoint dan merepotkan jika dilakukan di dua endpoint.

Claude Haiku 5.5 sendiri belum ada di katalog OrcaRouter, dan mengatakan itu secara terus terang lebih berguna daripada menyiratkan sebaliknya. Sisa lini Anthropic adalah: Claude Haiku 4.5, Claude Sonnet 5.5, dan Claude Opus 5.5 semuanya dapat dipanggil dari kami hari ini dengan harga daftar penyedia, dengan markup 0% yang diteruskan, sehingga tahap "sebelum" dari uji migrasi berjalan pada kunci yang sama yang akan Anda pertahankan setelahnya, dan pemotongan harga dari vendor pada tahap itu langsung aktif di sisi kami pada hari yang sama. Tahap "sesudah" adalah API Anthropic sampai model baru mencapai runtime yang kami rutekan. Yang Anda dapatkan dari endpoint bersama untuk sementara adalah failover otomatis di bawah panggilan, sehingga model baru dapat membawa lalu lintas produksi tanpa jalur tersebut bergantung padanya, plus DSL perutean untuk kasus ketika eskalasi dari Haiku ke Sonnet sebaiknya berada di rute, bukan di kode aplikasi Anda.

A screenshot of OrcaRouter's model page for anthropic/claude-haiku-4.5, showing the model card and its list pricing of $1.00 per million input tokens and $5.00 per million output tokens, captured in English.

Dua hasil pelanggan dalam peluncuran ini layak diteruskan sebagai petunjuk awal, bukan sebagai bukti. Asana melaporkan pengurangan latensi lebih dari 30% dan inferensi hingga 2,5x lebih cepat per giliran agen; HubSpot melaporkan 92,8% rata-rata dari tiga kali uji pada suite CRM-nya; AlphaSense melaporkan 0,84 versus 0,76 pada 600 kueri. Ini adalah angka pelanggan yang dipilih vendor dalam pengumuman vendor itu sendiri, dan nilainya terletak pada memberi tahu Anda beban kerja mana yang harus diuji lebih dahulu, bukan pada memberi tahu Anda hasil yang akan Anda peroleh.

Apa yang akan mengubah gambaran

Angka 75% akan diselesaikan dengan cara yang sama seperti setiap klaim vendor yang dibobot berdasarkan lalu lintas diselesaikan: oleh tagihan Anda sendiri. Yang benar-benar masih terbuka di sisi independen adalah angka biaya per tugas. Jika angka itu bertahan seiring bertambahnya jumlah eksekusi, ringkasan jujur dari peluncuran ini adalah bahwa Anthropic memangkas daftar tarif sebesar 80% dan membangun model yang menghabiskan lebih banyak token per jawaban, sehingga penghematan efektifnya nyata, besar, bergantung pada beban kerja, dan jarang menjadi angka yang tertera di poster. Jika angka itu turun dengan pengaturan effort dan caching, tier-nya tampak lebih baik lagi. Apa pun itu, angka yang perlu diperiksa sebelum cutover adalah token per tugas Anda sendiri di bawah tokenizer baru — itulah satu angka yang tidak bisa diberikan oleh postingan peluncuran kepada Anda.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari