
Ringkasan AI Harian, 8 Okt: Claude Haiku 5.5 Hadir dengan Harga $0.10 dan Pembacaan Cache Sonnet 5.5 Berkurang Setengah
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Claude Haiku 5.5 dirilis pada 7 Oktober 2026, dan itu adalah hal termurah yang pernah perusahaan letakkan di balik API: $0,10 per juta token input dan $0,50 per juta token output untuk prompt hingga 100.000 token, dengan jendela konteks 1 juta token dan tombol effort yang berjalan dari Low hingga Max. Pada hari yang sama, tanpa postingan peluncuran sendiri, pembacaan prompt-cache pada Claude Sonnet 5.5 turun dari $0,20 menjadi $0,10 per juta token. Salah satunya adalah produk dan yang lainnya adalah item baris, dan item baris itulah yang akan menggerakkan lebih banyak uang kuartal ini.
Harga dulu, karena itulah bagian yang bisa Anda tindak lanjuti hari ini. Lalu upaya, hal yang diam-diam menentukan harga. Lalu potongan cache, yang separuh orang yang membayar Sonnet 5.5 tidak akan mendengarnya sampai tagihan berikutnya.
Apa itu Claude Haiku 5.5, sesuai urutan kepentingannya
Penggambaran dari pihak vendor sendiri adalah "model kecil termurah, tercepat, dan paling mumpuni yang pernah kami rilis," dan tanggal rilisnya adalah 7 Oktober 2026 — sehari sebelum ringkasan ini. ID modelnya adalah claude-haiku-5-5. Masukannya berupa teks dan gambar, keluarannya berupa teks. Jendela konteksnya adalah 1.000.000 token, naik dari 200.000 pada Claude Haiku 4.5, dan keluaran maksimumnya adalah 128.000 token, dengan header beta pada Batch API yang menaikkannya menjadi 300.000. Batas waktu pelatihannya adalah Juni 2026, dan Anthropic berkomitmen untuk tidak menghentikannya sebelum 7 Oktober 2027.
Hal yang paling penting bagi siapa pun yang merutekan lalu lintas bukanlah jendela konteks. Poinnya adalah bahwa ini merupakan model kelas Haiku pertama dengan effort yang dapat disesuaikan. Effort tersedia dalam Low, Medium, High, Xhigh, dan Max, defaultnya adalah Medium, dan adaptive thinking aktif secara default — fitur Sonnet-dan-Opus yang hadir satu tingkat lebih rendah. Postingan peluncuran juga memuat dua hal yang berkaitan dengan membeli, bukan membangun: kredit API bulanan untuk paket Claude Max dan Team, $100 pada Max 5x dan $200 pada Max 20x dengan hingga $500 yang dikumpulkan untuk Team, serta dukungan beta computer-use dan browser-use di SDK. Keamanan tetap sejalan dengan tingkat tersebut: perlindungan siber lebih ketat daripada Claude Haiku 4.5, dengan permintaan pengujian penetrasi masih diblokir, dan perlindungan biologi setara dengan yang ada pada Claude Sonnet 5, Claude Sonnet 5.5, dan Claude Opus 5.

Harga, dan jurang 100.000 token di tengahnya
Tarif utama adalah $0.10 per juta token masukan dan $0.50 per juta token keluaran. Baca tanda bintangnya: itu adalah tarif untuk prompt pada atau di bawah 100.000 token. Di atas 100.000, kedua angka dikalikan lima, menjadi $0.50 untuk masukan dan $2.50 untuk keluaran. Penulisan cache dikenakan biaya $0.125 per juta pada tier lima menit dan $0.20 pada tier satu jam di dalam band murah, dan pembacaan cache dikenakan biaya $0.01 per juta — sepersepuluh dari tarif masukan, yang merupakan diskon cache terdalam yang pernah diterbitkan Anthropic pada model mana pun. Batch memangkas semuanya menjadi separuh lagi: $0.05 dan $0.25 di dalam band murah, $0.25 dan $1.25 di atasnya.
Bandingkan itu dengan Claude Haiku 4.5, yang masih ada di daftar harga dengan tarif tetap $1,00 untuk input dan $5,00 untuk output tanpa tingkatan berbasis konteks, pembacaan cache senilai $0,10, dan jendela 200.000 token. Model baru ini sepersepuluh harganya untuk bentuk prompt yang sama, dengan konteks lima kali lebih besar. Tidak ada kalkulasi migrasi yang perlu dijalankan di sini; angka-angkanya tidak berdekatan.
Tebing adalah bagian yang harus menjadi acuan desain. Prompt 99.000 token biayanya 99 sen per seribu panggilan pada tarif input. Prompt 101.000 token biayanya $5,05 per seribu. Selisih dua ribu token berarti tagihan 5 kali lebih besar, jadi apa pun yang Anda bangun di pita tarif murah sebaiknya entah tetap nyaman di bawah 100.000 token atau sengaja dan konsisten berada di atasnya — hasil terburuknya adalah pipeline yang mengangkangi garis tersebut dan membayar tarif tinggi untuk separuh trafiknya.
Upaya kini menjadi parameter penetapan harga, dan nilai bawaannya bukan yang paling murah
Karena effort secara default diatur ke Medium dan thinking aktif secara default, harga yang tertera dan harga sebenarnya bukan angka yang sama. Token penalaran ditagih sebagai token output. Dalam uji yang diterbitkan Anthropic sendiri untuk Artificial Analysis Intelligence Index — dilaporkan vendor, tidak kami reproduksi — Claude Haiku 5.5 mengeluarkan sekitar 162.000 token per tugas, dengan sekitar 129.000 di antaranya merupakan penalaran. Model median indeks tersebut mengeluarkan sekitar 100 juta token di seluruh rangkaian uji; Haiku 5.5 menghabiskan 440 juta. Dengan $0,50 per juta token output, verbositas itu terjangkau, dan justru itulah intinya: pada tarif Haiku 5.5, berpikir banyak tetap lebih murah daripada berpikir sedikit pada model yang mengenakan biaya output $5,00.
Atur effort ke Low untuk keputusan klasifikasi, ekstraksi, dan routing saat Anda menginginkan jawaban cepat alih-alih jawaban yang matang, dan biarkan pada Medium untuk apa pun yang akan dibaca pengguna. Menurunkan ke Low juga merupakan cara andal untuk menjaga agen yang bertele-tele tetap berada dalam kisaran 100.000 token, karena ini memangkas token penalaran sebelum memangkas kualitas jawaban.
Baris yang lebih senyap: pembacaan cache Sonnet 5.5 berkurang setengah
Claude Sonnet 5.5 membaca prompt yang di-cache seharga $0.10 per juta token per 7 Oktober, turun dari $0.20. Harga input Sonnet 5.5 adalah $2.00 dan outputnya $10.00, jadi pengali pembacaan cache 0,05x sekarang menjadi pengali yang sama dengan yang dimiliki Haiku 5.5, diterapkan pada tarif input dua puluh kali lebih besar. Perkiraan Anthropic sendiri adalah bahwa hal ini memangkas biaya sebagian besar pekerjaan agentik sekitar 20%, yang merupakan klaim tentang bentuk beban kerja, bukan tolok ukur: klaim itu hanya berlaku jika sebagian besar input Anda adalah prefiks stabil yang Anda kirim ulang setiap giliran. Jika prompt Anda unik pada setiap panggilan, perubahan ini tidak merugikan maupun menghemat apa pun.
Perlu dicatat apa implikasi dari pemotongan harga itu. Anthropic menetapkan harga yang agresif untuk prefiks berumur panjang pada model kelas menengah tepat saat merilis model kecil yang sangat murah, yang terbaca sebagai argumen untuk arsitektur dua model: satu jalur Sonnet 5.5 dengan cache panas untuk pekerjaan yang membutuhkan pertimbangan, dan satu jalur Haiku 5.5 untuk volume yang tidak membutuhkannya.
Apa yang ditunjukkan oleh angka-angka independen, sehari setelahnya
Artificial Analysis telah menilai Claude Haiku 5.5 sehari setelah peluncuran. Intelligence Index-nya tercatat 43 secara keseluruhan, dengan konfigurasi Max-effort dilaporkan pada 43,40, peringkat kedua dari 182 model di papan peringkat. Biaya per tugas indeks adalah $0,21, termurah keempat puluh enam. Harga campuran pada komposisi 7:2:1 input-terhadap-input-cache-terhadap-output adalah $0,08 per juta, angka yang membuat perbandingan tier sebelumnya terasa tidak adil bagi semua yang lain. Kecepatan output adalah 243,4 token per detik, tercepat kesembilan di papan peringkat, dengan latensi token pertama yang dilaporkan sekitar 0,3 detik dan diskon cache 90%.
Angka keluaran 440 juta token itu adalah catatan penting yang melekat pada nilai 43. Skornya nyata dan dijalankan secara independen; begitu pula verbositasnya. Model yang berpikir sebanyak ini murah per token dan tidak selalu murah per tugas, dan celah antara kedua angka itu adalah tempat keputusan perutean sebenarnya berada.
Sebagai gambaran skalanya, perbandingan yang diterbitkan Anthropic sendiri menempatkan Claude Haiku 5.5 pada 1620 di GDPval-AA v2.1 dibandingkan 735 untuk Claude Haiku 4.5, 72,4% pada OSWorld 2.1 dibandingkan 15,7%, 45,9% pada Humanity's Last Exam tanpa alat dibandingkan 10,2%, dan 39,2% pada Terminal-Bench 4.0 dibandingkan 0,0%. Itu adalah angka yang dilaporkan vendor pada evaluasi yang dipilih vendor dan harus dibaca sebagai indikatif, tetapi arahnya tidak samar — ini bukan peningkatan kecil pada model kecil.

Mengakses model-model ini tanpa kontrak kedua
Claude Haiku 5.5 tersedia melalui API milik Anthropic sendiri dan, dari sana, di mana pun model-model Anthropic dijual kembali. Di katalog OrcaRouter, lini Anthropic saat ini mencakup anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 dan anthropic/claude-fable-5.1 — kami tidak menghosting Claude Haiku 5.5, dan ringkasan ini tidak akan berpura-pura sebaliknya. Yang kami sediakan adalah tingkat di atasnya, dan OrcaRouter meneruskan harga daftar penyedia tanpa markup 0%, itulah sebabnya pemotongan biaya baca cache Sonnet 5.5 muncul di daftar harga kami pada hari yang sama Anthropic melakukannya, bukan pada siklus penetapan harga terjadwal.
Versi praktisnya: jika Anda ingin mencoba Haiku 5.5 pada jalur klasifikasi sementara jalur pertimbangan Anda tetap di Claude Sonnet 5.5, Anda memegang dua kunci alih-alih satu, dan lapisan perutean adalah tempat A/B ditentukan. Itulah keseluruhan argumen untuk gateway dibandingkan integrasi langsung — satu endpoint, string model, dan jalur failover saat penyedia goyah.

Apa yang perlu diperhatikan dari sini
Tiga hal. Apakah penyedia pihak ketiga mulai menjual kembali Haiku 5.5 dengan tarif campuran di bawah $0,10, yang merupakan titik di mana lapisan perutean membuktikan manfaatnya, bukan sekadar menyederhanakan pengadaan. Apakah Anthropic memperluas batas tier 100.000 token, karena tebing tepat di angka 100.000 adalah tempat yang aneh untuk dimiliki oleh model dengan jendela 1 juta token. Dan apakah angka verbositas 440 juta token turun dalam rilis poin, karena angka tunggal itulah yang menghalangi Haiku 5.5 menjadi default yang jelas untuk seluruh separuh bawah stack produksi.
