
Claude Haiku 5.5 vs Claude Sonnet 5.5: Kartu Tarif 20x, Tagihan Terukur 36x
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Claude Haiku 5.5 dan Claude Sonnet 5.5terpaut enam hari dan satu tingkat dalam keluarga yang sama, berbagi jendela konteks satu juta token, dan menjawab pada bentuk API yang sama. Pada kartu tarif yang dipublikasikan, yang lebih murah biayanya seperlima dari yang lebih mahal pada rentang tempat sebagian besar permintaan berada. Di papan Artificial Analysis yang independen, selisihnya lebih lebar dari itu: $0,21 untuk menyelesaikan satu tugas Intelligence Index pada Claude Haiku 5.5 versus $7,60 pada Claude Sonnet 5.5, untuk Intelligence Index 43 versus 56. Sinyal yang memicu artikel ini menggambarkannya sebagai Claude Haiku 5.5 yang "jauh lebih baik daripada GPT-6 Luna" dan "lebih dekat ke Sonnet 5.5". Paruh pertama dari itu kira-kira seperti yang ditunjukkan oleh kumpulan perbandingan milik vendor sendiri. Paruh kedua adalah titik ketika pengukuran berhenti sejalan dengan pemasaran, dan ada baiknya bersikap tepat tentang yang mana.
Dua model, terpaut enam hari dan satu tingkat
Claude Haiku 5.5 dirilis pada 7 Oktober 2026 dengan ID model claude-haiku-5-5. Model ini adalah pengganti langsung Claude Haiku 4.5, menerima teks dan gambar lalu mengembalikan teks, dan merupakan model kelas Haiku pertama yang oleh Anthropic diberi pengaturan effort yang dapat disesuaikan — Low, Medium, High, Xhigh, dan Max, dengan medium sebagai default API. Anthropic menyebutnya "model kecil termurah, tercepat, dan paling mumpuni yang pernah kami rilis", dan catatan kakinya membatasi klaim itu sebagai yang tercepat pada kecepatan standar masing-masing model, masih di belakang model-model Opus ketika model tersebut dijalankan dalam Fast Mode.
Claude Sonnet 5.5 dirilis enam hari lebih awal, pada 28 September 2026, sebagai claude-sonnet-5-5 — tier yang diposisikan Anthropic sebagai kombinasi terbaik dari kecepatan dan kecerdasan, dan yang direkomendasikannya untuk coding agentik yang kompleks. Jendela satu juta token yang sama. Tidak seperti Claude Haiku 5.5, model ini tidak memiliki rentang harga berdasarkan panjang prompt, yang ternyata lebih penting daripada keunggulan awal enam hari tersebut.
Keduanya kini tersedia di semua platform, termasuk Amazon Web Services, Google Cloud, dan Microsoft Azure, dan keduanya memiliki komitmen penghentian tidak lebih cepat dari satu tahun setelah peluncuran — 7 Oktober 2027 untuk Claude Haiku 5.5, 28 September 2027 untuk Claude Sonnet 5.5. Anthropic menyatakan Claude Sonnet 5.5 tersedia dengan retensi data nol, sama seperti Claude Opus 5.5 dan Claude Sonnet 5.
Kartu tarif, kedua sisinya, dalam satu tempat
Per juta token, dalam dolar AS, pada tarif yang diterbitkan Anthropic:
• Input — Claude Haiku 5.5 $0,10 untuk prompt hingga 100.000 token, $0,50 di atas batas tersebut; Claude Sonnet 5.5 $2,00 tetap, tanpa tahapan.
• Keluaran — Claude Haiku 5.5 $0,50 hingga 100.000 token, $2,50 di atasnya; Claude Sonnet 5.5 $10,00 tetap.
• Pembacaan cache — Claude Haiku 5.5 $0.01 di band bawah dan $0.05 di atasnya; Claude Sonnet 5.5 $0.10. Anthropic memangkas separuh pembacaan cache Claude Sonnet 5.5 dari $0.20 bersamaan dengan peluncuran Haiku, dan mengatakan bahwa karena pembacaan cache merupakan porsi besar dari penggunaan token agentik, Claude Sonnet 5.5 kini berbiaya sekitar 20% lebih murah untuk sebagian besar pekerjaan agentik.
• Penulisan cache — Claude Haiku 5.5 $0.125 untuk penulisan lima menit dan $0.20 untuk penulisan satu jam di rentang bawah, $0.625 dan $1.00 di atasnya; Claude Sonnet 5.5 $2.50 untuk penulisan lima menit dan $4.00 untuk satu jam.
• Batch — Batch API diskon 50% untuk input dan output. Itu menempatkan Claude Haiku 5.5 pada $0.05 dan $0.25 di bawah batas 100.000 token dan $0.25 dan $1.25 di atasnya, dibandingkan dengan Claude Sonnet 5.5 pada $1.00 dan $5.00.
Baca di sepanjang garis-garis itu dan polanya konsisten: pada pita bawah Anda melihat selisih input 20x dan selisih output 20x; di atas garis, 4x dan 4x. Klaim utama Anthropic adalah "sekitar 75% lebih murah untuk dijalankan" secara rata-rata dibandingkan Claude Haiku 4.5, yang diperjelas dalam catatan kaki menjadi 90% lebih murah di bawah 100.000 token dan 50% lebih murah di atasnya, dengan perubahan tokenizer ikut diperhitungkan dalam rata-rata tersebut.
Langkah 100.000 token adalah titik di mana aritmetikanya berubah
Dua hal menarik ke arah yang berlawanan, dan hanya satu di antaranya yang tercantum di daftar harga. Harga turun tajam dibandingkan Claude Haiku 4.5. Pada saat yang sama, Claude Haiku 5.5 hadir dengan tokenizer yang diperbarui, serupa dengan yang ada di Claude Sonnet 5.5 dan Claude Opus 5.5, yang menurut Anthropic "menggunakan sedikit lebih banyak token per tugas" — sehingga prompt yang identik menghasilkan jumlah token yang dapat ditagih lebih banyak daripada di generasi sebelumnya. Rata-rata 75% adalah hasil bersih dari keduanya, dan itu adalah angka dari vendor.
Batas 100.000 token adalah bagian yang menarik perhatian orang. Anthropic menetapkan harga Claude Haiku 5.5 berdasarkan panjang prompt: permintaan yang prompt-nya melebihi 100.000 token dikenai harga yang lebih tinggi untuk keseluruhan permintaan, bukan hanya untuk token yang melewati ambang batas. Panjang prompt menghitung semua token masukan, termasuk pembacaan cache dan penulisan cache, dan setiap permintaan diberi harga sendiri-sendiri — permintaan panjang dikenai band yang lebih tinggi bahkan ketika sebagian prompt-nya merupakan cache hit, dan permintaan sebelumnya tetap memakai harga yang ditagihkan padanya. Pipeline retrieval yang nyaman berada di 90.000 token membayar $0,10 dan $0,50. Geser jendelanya satu tingkat dan seluruh permintaan ditetapkan ulang harganya menjadi $0,50 dan $2,50. Claude Sonnet 5.5 tidak melakukan ini, karena jendela sejuta token penuh ditagih dengan harga standar.
Dua konsekuensi menyusul, mengarah ke arah yang berlawanan. Pertama, persilangan yang orang-orang harapkan — konteks panjang membuat model mahal menjadi yang lebih murah — tidak terjadi: Claude Haiku 5.5 di atas garis itu masih seperempat dari Claude Sonnet 5.5 pada kartu tarif. Kedua, selisih yang Anda andalkan menyempit dari 20x menjadi 4x tepat saat beban kerja Anda menjadi berat, yang justru saat angka absolut mulai penting. Lompatan itulah alasannya pipeline yang sensitif terhadap biaya memerlukan pos anggaran tersendiri alih-alih tarif per token.
Apa yang dilaporkan setiap vendor tentang skornya
Semua yang ada di bagian ini dilaporkan oleh vendor dan tidak direproduksi oleh pihak ketiga. Anthropic mempublikasikan set perbandingan yang sama di halaman Claude Haiku 5.5 dan Claude Sonnet 5.5 miliknya, dan pada bagian yang tumpang tindih antara kedua halaman, keduanya sepakat:
• GDPval-AA v2.1, pekerjaan berbasis pengetahuan — 1.620 untuk Claude Haiku 5.5, dibandingkan dengan 1.840 untuk Claude Sonnet 5.5, 735 untuk Claude Haiku 4.5 dan 1.437 untuk GPT-6 Luna.
• AA-Briefcase v1.1 — 1.578 untuk Claude Haiku 5.5, dibandingkan dengan 1.824 untuk Claude Sonnet 5.5, 614 untuk Claude Haiku 4.5 dan 1.336 untuk GPT-6 Luna.
• OSWorld 2.1, penggunaan komputer, subset offline — 72,4% untuk Claude Haiku 5.5, dibandingkan dengan 83,9% untuk Claude Sonnet 5.5, 15,7% untuk Claude Haiku 4.5, dan 48,9% untuk GPT-6 Luna.
• Terminal-Bench 4.0, pengodean agentic — 39,2% untuk Claude Haiku 5.5, dibandingkan 70,6% untuk Claude Sonnet 5.5, 0,0% untuk Claude Haiku 4.5 dan 16,4% untuk GPT-6 Luna.
• FrontierCode 1.1, Main — 46,4% untuk Claude Haiku 5.5, dibandingkan dengan 52,1% untuk Claude Sonnet 5.5 pada upaya Xhigh, 42,4% untuk GPT-6 Luna. Anthropic juga mencatat bahwa Claude Sonnet 5.5 mendapat skor lebih rendah pada upaya Max dibandingkan Xhigh untuk yang ini, yang dikaitkannya dengan penggunaan skill tinjauan kode yang lebih sering sehingga menyebabkan timeout atau penyuntingan di luar cakupan.
• Chartography, penalaran visual tanpa alat — 46,4% untuk Claude Haiku 5.5, dibandingkan dengan 61,6% untuk Claude Sonnet 5.5, 6,4% untuk Claude Haiku 4.5 dan 29,1% untuk GPT-6 Luna.
• Humanity's Last Exam — 45,9% tanpa alat dan 57,4% dengan alat tersebut untuk Claude Haiku 5.5; 64,5% dengan alat untuk Claude Sonnet 5.5, 18,7% untuk Claude Haiku 4.5, dan 56,9% tanpa alat untuk Claude Sonnet 5.5 di halaman yang sama. Anthropic mencatat angka keluarga GPT-6 mungkin sudah usang karena OpenAI memperbaiki bug pemahaman gambar dan skor pihak ketiga belum semuanya diperbarui.
Dua dari baris tersebut layak dibaca dua kali. Di FrontierCode, kedua model itu berdekatan — 46,4% versus 52,1% — dan di Chartography, yang tidak punya alat untuk dijadikan tempat berlindung, selisihnya 15 poin. Terminal-Bench 4.0 sama sekali tidak dekat: 39,2% versus 70,6% adalah kelas kemampuan yang berbeda, itulah sebabnya halaman Claude Sonnet 5.5 milik Anthropic masih menunjuk ke Claude Sonnet 5.5 dan Claude Opus 5.5 untuk pengodean agentik yang kompleks dan menggambarkan Claude Haiku 5.5 sebagai model untuk pekerjaan berskala sempit dan bervolume tinggi.
Apa yang dihadirkan dewan independen
Angka-angka Anthropic membandingkan model-modelnya sendiri satu sama lain dan dengan satu pesaing. Sebuah papan independen mengadu keduanya dengan seluruh bidang, dan angka yang dilaporkannya yang tidak dilaporkan oleh para vendor adalah biaya per tugas yang diselesaikan.
Artificial Analysis memberi Claude Haiku 5.5 skor pada Max effort dengan Intelligence Index 43, jauh di atas median 13 di antara model-model sebanding, menghasilkan 440M token output pada Index tersebut dibandingkan median 100M — sangat verbose — dengan $0,10 untuk input dan $0,50 untuk output per juta, serta 242 token output per detik. Biaya terukurnya adalah $0,21 per tugas Intelligence Index.
Papan yang sama memberi skor Claude Sonnet 5.5 sebesar 56, dibandingkan median 26, menghasilkan 410 juta token keluaran dibandingkan median 88 juta, dengan biaya input $2,00 dan output $10,00 serta diskon cache 90%. Biaya terukurnya adalah $7,60 per tugas Intelligence Index.


Sandingskan kedua baris itu dan rasionya adalah inti ceritanya. $0,21 dibandingkan $7,60 adalah sedikit di atas 36x, dan kedua model hampir setara dalam hal verbositas — 440M token keluaran dibandingkan 410M — jadi pengali itu hampir sepenuhnya merupakan kartu tarif yang melakukan apa yang dikatakan kartu tarif akan dilakukan. Pada kartu tarif vendor sendiri, perbandingan yang sama adalah 20x. Tambahan itu berasal dari hal-hal yang tidak dapat ditunjukkan oleh harga per token: model yang lebih murah mencapai jawabannya dengan lebih sedikit token yang ditagih per tugas pada pengaturan upaya ini, dan pembacaan cache ditagih sepersepuluh dari tarif Claude Sonnet 5.5. Harness yang sama, tugas yang sama, diukur secara independen.

Di mana tier murah sebenarnya habis
Angka pelanggan yang dipublikasikan Anthropic lebih sering menentukan pilihan daripada benchmark, dan semuanya menunjuk ke arah yang sama. Asana melaporkan latensi lebih dari 30% lebih rendah pada penyelesaian tugas dan inferensi hingga 2,5x lebih cepat per giliran agen. Box melaporkan skor 11 poin di atas Claude Haiku 4.5 dengan latensi sekitar setengahnya. HubSpot melaporkan skor terbaik yang pernah dilihatnya pada suite miliknya sendiri, 92,8% dirata-ratakan dari tiga kali pengujian, dengan tingkat hit tertinggi dan tingkat positif palsu terendah. AlphaSense menjalankan sekitar 8 juta panggilan seminggu melalui "Ask in Document" dan melaporkan peningkatan yang signifikan secara statistik dibanding Claude Haiku 4.5, 0,84 berbanding 0,76. Cognition melaporkan bahwa dengan Claude Haiku 5.5 sebagai pendamping, agen Fusion-nya memegang skor FrontierCode 66,2.
Tak satu pun dari itu adalah agen horizon panjang. Semuanya adalah solusi titik — satu langkah yang terdefinisi dengan baik, yang menjadi semakin cepat dan murah. Itulah bentuk yang dirancang untuk Claude Haiku 5.5, dan itu juga bentuk di mana keunggulan biaya 36x adalah uang sungguhan, bukan kesalahan pembulatan. Keunggulan itu berlipat ganda seiring volume panggilan dan menguap seiring kedalaman panggilan: seratus ribu panggilan klasifikasi per hari dengan $0.10 untuk input dan $0.50 untuk output adalah pos biaya yang Anda sadari mulai menghilang, sementara seratus giliran agen per sesi, yang masing-masing membaca ulang konteks yang terakumulasi, adalah pos biaya yang tumbuh secara superlinear karena setiap giliran di atas ambang batas dikenai band yang lebih tinggi.
Argumen tandingan Claude Sonnet 5.5 adalah biaya per upaya, bukan biaya per token. Anthropic mengatakan model ini berjalan 30%+ lebih cepat daripada Claude Sonnet 5 dan biayanya hingga 30% lebih murah untuk sebagian besar pekerjaan, dengan penghematan berasal dari kebutuhan token yang lebih sedikit, bukan dari tarif yang lebih rendah. Penguji pihak ketiga memberikan angka untuk itu: Slack melaporkan sekitar 14% lebih sedikit token keluaran, Balyasny sekitar 121k token per jawaban dibandingkan 497k, Box 2,4x lebih cepat dengan 12% lebih sedikit token, Lovable sekitar sepertiga lebih sedikit panggilan alat dan sekitar setengah eksekusi shell, Atlassian hingga 30% lebih cepat untuk Rovo Agents, dan Base44 3,6 iterasi per build dibandingkan 7,7 untuk Claude Opus 5. Satu giliran yang berhasil mengalahkan empat yang tidak.
Ada faktor ketiga yang bergerak ke arah sebaliknya. Anthropic telah memindahkan upaya ke dial tingkat model pada generasi ini — pengaturan upaya Claude Haiku 5.5 ditetapkan sekali per permintaan, bukan disesuaikan sebagai anggaran pemikiran per permintaan, dan mode budget_tokens lama sudah tidak digunakan lagi pada model 4.6 dan tidak diterima pada model yang lebih baru. Bagi armada yang memanggil satu ID model dari banyak layanan, ini adalah penyederhanaan. Bagi apa pun yang menyesuaikan penalarannya sendiri per panggilan, ini adalah penulisan ulang.
Menjalankan keduanya di balik satu endpoint
Alasan keputusan ini perlu diambil dengan benar adalah karena separuh yang salah darinya mahal untuk dibatalkan: mengubah koneksi jalur produksi dari satu ID model ke ID model lain berarti menyentuh setiap titik pemanggilan yang mengasumsikan perilaku ID model lama. Cara yang lebih murah untuk mengetahui tier mana yang cocok untuk suatu beban kerja adalah menjalankan keduanya di balik satu endpoint dan memindahkan trafik di antara keduanya lewat konfigurasi, bukan lewat refaktorisasi.
Itulah gunanya OrcaRouter. Claude Sonnet 5.5 ada di katalog sebagai anthropic/claude-sonnet-5.5, bersama Claude Sonnet 5, Claude Opus 5.5, dan Claude Haiku 4.5 — tier Haiku yang lebih lama tetap tersedia sebagai titik referensi selama Anda bermigrasi darinya. Platform ini meneruskan harga daftar penyedia tanpa markup, jadi $2.00 dan $10.00 di atas adalah tarif yang Anda bayar, dan hal yang sama berlaku sebaliknya: ketika vendor mengubah harga, harga baru langsung berlaku di sini pada hari yang sama, dan begitulah pemotongan harga cache-read Claude Sonnet 5.5 sampai ke kami. Dua fitur melakukan pekerjaan yang dibutuhkan oleh keputusan khusus ini. Failover otomatis menjaga model yang masih Anda evaluasi tetap di luar jalur kritis Anda dengan sendirinya, dan DSL routing memungkinkan Anda mengirim panggilan di bawah 100.000 token ke tier murah dan menyerahkan panggilan berkonteks panjang atau berjangka panjang ke tier yang lebih mahal dalam alur permintaan yang sama, tanpa kontrak kedua atau SDK kedua.
Untuk lebih tepatnya tentang apa yang dihosting dan tidak dihosting: Claude Sonnet 5.5 dapat dirutekan melalui kami saat ini. Claude Haiku 5.5 belum ada di katalog. Sampai saat itu tiba, ia berada di API milik Anthropic sendiri dan tiga platform cloud yang tercantum di atas.
Cara memutuskan
Pilih Claude Haiku 5.5 ketika tugasnya sempit, bervolume tinggi, dan dapat diperiksa — klasifikasi, ekstraksi, perutean, peringkasan, pekerjaan per giliran di dalam agen yang sudah Anda bangun. Selisih tarif 20x adalah inti persoalannya di sana, langkah 100.000 token dapat dihindari secara desain, dan biaya $0,21 per tugas yang diukur secara independen menunjukkan bahwa keunggulan itu tetap bertahan di luar laboratorium vendor sendiri. Setel dial upaya per kelas tugas, bukan membiarkannya pada nilai default; pada model kelas Haiku, perbedaan antara Low dan Max adalah pengganda biaya, bukan preferensi kualitas.
Pilih Claude Sonnet 5.5 ketika tugasnya berhorizon panjang, agentik, atau tidak dapat diverifikasi — kode yang harus dapat dikompilasi, penggunaan komputer yang harus meninggalkan layar dalam keadaan yang diketahui, apa pun di mana jawaban yang salah lebih mahal daripada panggilannya. Terminal-Bench 4.0 pada 70,6% berbanding 39,2% bukanlah nuansa, melainkan kelas kemampuan yang berbeda, dan kartu tarif tetap berarti konteks panjang tidak diam-diam mengubah harga seluruh permintaan. Jika beban kerja Anda benar-benar berada di antaranya, jawaban jujurnya adalah belum ada model pun yang memiliki kumpulan reproduksi pihak ketiga yang luas di belakangnya, skor indeks berasal dari satu harness, dan angka vendor yang dikutip di atas adalah milik vendor sendiri.
Apa yang akan mengubah jawaban ini
Tiga hal yang layak diperhatikan, dan tidak satu pun berupa rilis benchmark. Yang pertama adalah apakah evaluasi independen terhadap Claude Haiku 5.5 pada effort Low, High, dan Xhigh — bukan hanya Max — menunjukkan rasio biaya per tugas yang sama, karena pengatur effort adalah tuas termurah dalam perbandingan ini dan paling sedikit diukur. Yang kedua adalah apakah langkah 100.000 token bertahan; band ketiga, atau tidak ada band sama sekali pada generasi berikutnya, akan mengubah aritmetika bagi setiap pipeline retrieval di lini tersebut lebih daripada skor benchmark tunggal mana pun. Yang ketiga adalah tokenizer. Jika checkpoint yang lebih baru menokenkan teks yang sama pada laju lama, rata-rata 75% Anthropic menjadi batas bawah, bukan target, dan selisih terhadap Claude Sonnet 5.5 melebar tanpa keduanya mengubah harga.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
