
Claude Opus 5.5 Memuncaki Indeks Agen Coding di 66 — dan Tagihan Tugas Naik 21%
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 180 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Vendor memotong harga token Claude Opus 5.5 sebesar 20% pada 22 September 2026. Dua hari kemudian, Artificial Analysis menerbitkan pengukuran agen coding yang menunjukkan dampak pemotongan itu terhadap tagihan agen: biaya per tugas naik 21%, menjadi $13.04, dari $10.79 yang dikenakan oleh indeks yang sama untuk Claude Opus 5. Skornya juga naik — 66 pada Coding Agent Index, yang oleh Artificial Analysis disebut sebagai yang tertinggi yang pernah diukurnya, unggul enam poin dari Claude Opus 5 dan unggul empat poin dari Claude Fable 5.1 dalam konfigurasi yang sama. Kedua hal itu benar sekaligus, dan alasan keduanya benar sekaligus adalah inti dari peringkat ini. Token yang lebih murah yang lebih banyak dihabiskan model bukanlah tugas yang lebih murah, dan pada upaya penalaran maksimum dalam proses agen yang panjang, Claude Opus 5.5 menghabiskan jauh lebih banyak token tersebut.
Apa yang sebenarnya dinilai oleh Coding Agent Index
Ini bukan papan peringkat model. Setiap baris di dalamnya adalah pasangan harness-dan-model — sebuah checkpoint yang berjalan di dalam agen coding tertentu, pada pengaturan upaya tertentu. Baris yang semua orang kutip adalah Claude Opus 5.5 pada upaya maks di dalam Claude Code, yang merupakan harness yang dibangun dan disetel oleh Anthropic. Angka 60 Claude Opus 5 dan 62 Claude Fable 5.1 berasal dari harness yang sama dan pengaturan upaya yang sama, itulah yang membuat keduanya menjadi perbandingan yang jujur; baris untuk salah satu model di agen coding yang berbeda adalah pengukuran yang berbeda dan tidak dicetak di sini seolah-olah itu pengukuran yang sama.
Indeks ini diberi versi, dan versinya lebih penting daripada nama merek yang tertera padanya. Papan yang saat ini diterbitkan sebagai v1.5 merata-ratakan tiga evaluasi, masing-masing diberi bobot yang sama, masing-masing dilaporkan sebagai pass@1 yang dirata-ratakan atas tiga percobaan per tugas:
• Terminal-Bench 4.0 — pekerjaan shell dan command-line yang agentik: menavigasi sistem berkas, menggunakan perkakas dengan benar, pulih dari kegagalan antara, dan menyelesaikan alur kerja multi-langkah.
• DeepSWE v1.1 — tugas rekayasa perangkat lunak, pekerjaan penyuntingan repositori.
• SWE-Atlas-QnA — pertanyaan pemahaman repositori, yang jawabannya ditemukan dengan membaca basis kode, bukan dengan mengubahnya.
Tiga evaluasi, satu angka, dan kolom biaya per tugas yang tercetak di sampingnya. Kolom biaya itulah sebabnya indeks ini lebih berguna daripada sekadar skor, dan juga sebabnya angka utamanya lebih sulit dibaca daripada kelihatannya.

Tiga komponen, dan dari mana keenam poin itu berasal
Artificial Analysis menerbitkan baris-baris komponen bersama kompositnya, dan semuanya tidak bergerak secara merata:
• Terminal-Bench 4.0 — 63,1% untuk Claude Opus 5.5 dibandingkan dengan 54,5% untuk Claude Opus 5, dengan peningkatan sebesar 8,6 poin. Ini adalah peningkatan tunggal terbesar dalam kumpulan ini.
• DeepSWE v1.1 — 68,4% terhadap 62,5%, naik 5,9 poin.
• SWE-Atlas-QnA — 66,4% dibandingkan dengan 62,1%, naik 4,3 poin.
Rata-ratakan ketiganya dan Anda mendapatkan 66,0, yang merupakan nilai komposit. Bentuk peningkatannya adalah bagian yang menarik: model paling sedikit meningkat dalam membaca basis kode dan paling banyak dalam mengendalikan shell. Terminal-Bench adalah evaluasi yang paling dekat dengan apa yang sebenarnya dimaksud orang dengan "coding agent" — sebuah loop berjalan panjang di mana model memilih perintah, membaca outputnya, dan memutuskan apa yang harus dilakukan selanjutnya, tanpa manusia di dalam loop di antara langkah-langkahnya. Lompatan 8,6 poin di sana adalah pernyataan tentang penggunaan alat secara berkelanjutan, bukan tentang pembuatan kode.
Perhatikan apa yang disiratkan oleh hal itu tentang di mana peningkatan dapat diharapkan. Jika beban kerja Anda adalah "menjelaskan repositori ini," Claude Opus 5.5 adalah peningkatan yang moderat dibandingkan Claude Opus 5 — empat poin. Jika beban kerja Anda adalah "jalankan sampai rangkaian pengujian lulus, perbaiki apa yang rusak," itu adalah lompatan terbesar dalam tabel.

Angka yang tercetak di samping peringkat: $13.04 per tugas
Berikut adalah perhitungan yang membuat pemotongan harga tampak berbeda dari cara pengumumannya. Harga daftar Anthropic untuk Claude Opus 5.5 adalah $4,00 per juta token masukan dan $20,00 per juta keluaran, turun dari $5,00 dan $25,00 untuk Claude Opus 5, dengan pembacaan cache turun 60% menjadi $0,20 per juta. Setiap baris tersebut lebih murah. Perkiraan Artificial Analysis tentang biaya sebuah tugas pada upaya maksimal justru lebih tinggi:
• Biaya per tugas — $13.04 untuk Claude Opus 5.5 dibandingkan $10.79 untuk Claude Opus 5, naik 21% pada indeks yang sama, harness yang sama, pengaturan effort yang sama.
• Total token per tugas — kira-kira 15.6M dibandingkan dengan 11.4M, naik sekitar 37%.
• Token output per tugas — sekitar 333.000 dibandingkan 137.000, lebih dari dua kali lipat. Output adalah arah yang mahal, dan itulah baris yang paling banyak bergeser.
• Input yang di-cache per tugas — sekitar 14,6M dibandingkan 10,9M, naik sekitar 34%. Pemangkasan 60% pada cache-read benar-benar berdampak di sini; hanya saja itu belum cukup untuk mengimbangi tugas yang membaca konteks sepertiga lebih banyak.
Lakukan perhitungan dengan tarif yang dipublikasikan dan bentuknya akan terlihat. Ambil token keluaran saja: 333.000 token dengan $20,00 per juta sekitar $6,66 — sekitar setengah dari keseluruhan estimasi $13,04, dari satu item baris yang berlipat ganda. Baris pembacaan cache sangat besar volumenya dan hampir gratis harganya: 14,6 juta token dengan $0,20 per juta kurang dari $3. Pemotongan 20% itu nyata dan pemotongan cache juga nyata; pada upaya maksimum dalam loop agen, keduanya sekadar dikalahkan oleh model yang berpikir lebih lama dan menulis lebih banyak.
Itu berdampak langsung pada cara Anda menganggarkan. Jika tim Anda menjalankan 500 tugas agen coding per hari dengan upaya maksimal, selisih antara $10,79 dan $13,04 adalah sekitar $1.125 per hari — sekitar $34.000 sebulan — untuk jumlah tugas yang sama. Itulah angka yang perlu diajukan kepada siapa pun yang menyetujui perubahan model, dan itu bukan angka yang tersirat dari pemotongan harga.
Mengapa $5.98 dan $13.04 keduanya benar
Artificial Analysis menerbitkan angka biaya-per-tugas yang berbeda untuk model yang sama beberapa hari sebelumnya, dan membaca keduanya bersama-sama tanpa label membuatnya tampak seperti sebuah kontradiksi. Padahal bukan — keduanya adalah dua evaluasi yang berbeda, dan perbedaannya memberi pelajaran.
Pada Intelligence Index, tulisan pada 22 September menempatkan biaya per tugas Claude Opus 5.5 di $5,98, kira-kira selevel dengan $5,86 milik Claude Opus 5, meskipun sekitar 119.000 token keluaran per tugas versus 73.000 milik Opus 5. Di sana, pemotongan harga dan token ekstra hampir tepat saling meniadakan. Pada Coding Agent Index, pada upaya maksimum, di Claude Code, model yang sama berbiaya $13,04 versus $10,79.
Keduanya adalah pengukuran yang jujur untuk beban kerja yang berbeda. Eval tanya-jawab adalah pertukaran singkat; tugas agen adalah loop panjang pemanggilan alat dengan konteks yang terus bertambah, dan pertumbuhannya terakumulasi ke arah output, tempat harganya paling tinggi. Pelajaran praktisnya adalah bahwa "apakah potongan harga mengimbangi token tambahan?" tidak punya jawaban tunggal — itu bergantung pada panjang tugas, dan semakin panjang serta semakin agentic tugasnya, semakin buruk pengimbangannya. Jika Anda menyusun anggaran dari benchmark jawaban singkat, Anda akan meremehkan tagihan agen.
Tiga peringatan yang seharusnya ada di baris tersebut
Angka 66 adalah angka Claude Code, bukan angka model tanpa harness. Indeks ini dengan sengaja memasangkan model dengan harness, dengan argumen bahwa perutean alat, logika percobaan ulang, dan pengelolaan konteks tidak dapat dipisahkan dari kinerja terukur sebuah agen. Hal itu menguntungkan Anthropic di sini, karena harness yang digunakan untuk menilainya adalah miliknya sendiri. Artificial Analysis menandai tampilan perbandingan harness sebagai segera hadir; sampai tampilan itu ada, tidak ada yang bisa mengatakan berapa banyak dari keunggulan enam poin tersebut yang berasal dari checkpoint dan berapa banyak yang berasal dari perancah di sekitarnya.
Angka Terminal-Bench 4.0 milik Anthropic sendiri lebih tinggi daripada komponen ini, dan dijalankan oleh Anthropic. Materi peluncuran melaporkan 66,4% pada xhigh effort; komponen Coding Agent Index adalah 63,1% pada max, dan proses independen terpisah dari Artificial Analysis mengukur 59,6% dalam harness-nya sendiri pada versi benchmark yang sama. Tiga angka, tiga konfigurasi, tiga produsen. Angka 63,1% pada baris di atas adalah komponen milik indeks itu sendiri dan hanya boleh dibandingkan dengan angka-angka lain pada indeks tersebut; angka 66,4% dari vendor dilaporkan oleh vendor, tidak direproduksi oleh pihak ketiga, dan termasuk pengaturan effort yang berbeda.
Revisi indeks bergerak. Blog ini melaporkan baris Coding Agent Index yang berbeda pada awal September, pada versi yang lebih awal dari papan yang sama, dan angka-angka lama tersebut tidak dapat dibandingkan dengan v1.5 — set evaluasinya sendiri berubah ketika Terminal-Bench 4.0 menggantikan versi sebelumnya. Mirror pihak ketiga masih membawa snapshot usang dengan label versi lama. Jika angka untuk Claude Opus 5.5 pada indeks ini bukan dari baris v1.5 saat ini, jangan menaruhnya di samping angka v1.5, dan jangan menghitung delta di antara keduanya.

Apa yang sebenarnya harus di-deploy
Peringkat ini adalah angka pada upaya maksimum, dan upaya maksimum adalah pengaturan yang hampir tidak seharusnya dijadikan bawaan oleh siapa pun. Claude Opus 5.5 memiliki lima pengaturan upaya — rendah, sedang, tinggi, xhigh, dan maks — dan model ini secara bawaan menggunakan sedang. Artificial Analysis belum menerbitkan baris Coding Agent Index pada pengaturan yang lebih rendah, sehingga penghematan biaya di sana belum terukur pada indeks ini; pada Intelligence Index, model yang sama pada pengaturan sedang memperoleh skor 51 — setara dengan maks Claude Opus 5 — dengan biaya $1.34 per tugas. Ke arah itulah penghematan berada, dan itu adalah soal pengaturan, bukan model yang berbeda.
Pola yang realistis adalah pemisahan: pertahankan upaya maksimum untuk loop otonom yang panjang, tempat keunggulan 8,6 poin di Terminal-Bench adalah hal yang Anda beli, dan jalankan pekerjaan rutin pada upaya yang lebih rendah, di mana model masih jauh lebih unggul daripada posisi akhir Claude Opus 5. Karena upaya adalah parameter permintaan, bukan penerapan, pemisahan itu adalah aturan perutean, dan kedua model berada dalam katalog yang sama — harga daftar Anthropic diteruskan dengan markup 0%, sehingga pemotongan harga vendor langsung berlaku pada anthropic/claude-opus-5.5 pada hari yang sama saat diumumkan, dan tidak ada kontrak kedua atau perubahan kode yang terlibat dalam melakukan A/B kedua model tersebut terhadap tugas Anda sendiri. Khusus untuk jalur upaya maksimum, di mana satu tugas bisa menjadi proses panjang tanpa pengawasan, failover otomatis adalah yang mencegah penyedia yang macet menghabiskan seluruh loop Anda.
Apa yang masih belum diukur
Tiga hal akan mengubah gambaran ini dan belum ada satu pun yang ada saat ini. Tidak ada perbandingan dengan upaya yang setara dan harness yang setara antara Claude Opus 5.5 dan checkpoint pesaing — setiap perbandingan lintas vendor yang tersedia hanyalah dua tabel vendor yang disusun berdampingan. Tidak ada uji Coding Agent Index yang dipublikasikan pada upaya sedang atau tinggi, yaitu posisi tempat sebagian besar trafik produksi akan berada. Dan pertanyaan atribusi harness — berapa besar dari angka 66 yang berasal dari model dan berapa besar dari Claude Code — telah diakui oleh indeks dan ditunda.
Apa yang dapat Anda tindak lanjuti hari ini lebih sempit dan lebih berguna daripada sebuah peringkat. Claude Opus 5.5 secara nyata lebih baik dalam pekerjaan agen berbasis shell yang berkelanjutan dibanding Claude Opus 5 — itu satu-satunya komponen dengan peningkatan besar, konsisten, dan dihasilkan secara independen. Biayanya juga lebih tinggi per tugas pada pengaturan tempat peningkatan itu diukur, sekitar $2,25 per tugas, dan pemotongan harga per token tidak mencapai angka itu. Terapkan pada upaya maksimum di tempat loop-nya panjang dan biaya kegagalannya tinggi; pertahankan pengaturan yang lebih murah di semua tempat lain; dan periksa ulang indeks saat baris dengan upaya lebih rendah muncul, karena itulah konfigurasi yang sebenarnya akan dibayar oleh sebagian besar tim. Jika Anda beralih hanya karena pemotongan harga, Anda membeli hal yang salah — modelnya lebih murah per token dan lebih mahal per tugas, dan hanya satu dari dua angka itu yang muncul di faktur Anda.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
