Kartu judul yang dihasilkan dengan judul 'level pada 165', dengan subjudul 'Epoch Capabilities Index, berkas 1 Oktober 2026', tiga kartu statistik yang menampilkan 165 (Claude Sonnet 5.5), 165 (Claude Fable 5.1) dan 11 vs 20 (evaluasi benchmark di balik setiap angka), serta logo OrcaRouter di sudut kanan bawah.
Guides & Insights

Claude Sonnet 5.5 Menyamai Claude Fable 5.1 di Epoch Capabilities Index

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Seri di puncak papan peringkat biasanya adalah hal yang paling tidak menarik di sana. Yang ini pengecualiannya, karena dua model yang sejajar di puncak tidak memakan biaya yang sama. Dalam file Epoch Capabilities Index yang diperbarui 1 Oktober 2026, Claude Sonnet 5.5 dan Claude Fable 5.1 keduanya tercatat 165 — baris ketiga dan keempat dari 253 model yang dilacak — dua poin di belakang Claude Opus 5.5 dan GPT-6 Astra, yang keduanya juga sejajar di 167, dan unggul dua poin dari Claude Opus 5 di 163. Claude Sonnet 5.5 dirilis pada 28 September 2026 dengan harga $2 per juta token input dan $10 per juta output. Claude Fable 5.1 dirilis pada 1 September dengan harga $10 dan $50. Satu angka mengatakan keduanya dapat dipertukarkan dalam kemampuan umum. Harga output lima kali lipat mengatakan tidak demikian. Keduanya tetap bertahan, dan alasan keduanya tetap bertahan bersama adalah bagian tabel yang tidak dikutip siapa pun.

Apa indeks itu sebenarnya, dan siapa yang mengukur

ECI bukanlah papan skor vendor. Indeks ini dibangun oleh Epoch AI, sebuah organisasi riset independen, sebagai komposit yang menyatukan skor dari lebih dari lima puluh tolok ukur berbeda ke dalam satu skala kemampuan umum, dengan menyimpulkan tingkat kesulitan relatif setiap tolok ukur dari model-model yang kebetulan muncul pada beberapa tolok ukur sekaligus. Metodologinya dijabarkan dalam sebuah makalah, “A Rosetta Stone for AI Benchmarks”, yang didanai oleh Google DeepMind dan ditulis bersama para peneliti dari tim AGI Safety & Alignment miliknya — tetapi Epoch menyatakan secara tegas bahwa indeks tersebut adalah produknya sendiri dan bahwa Epoch memegang hak penuh atasnya, dan kode fitting-nya bersifat publik. Perbedaan itu penting ketika pemberi dana riset dan penerbit skor bukan pihak yang sama.

Dua sifat skala ini menentukan bagaimana sebuah angka pada skala tersebut dapat dibaca. Yang pertama adalah bahwa ECI dijangkarkan alih-alih bersifat absolut: nilai mentah diskalakan ulang sehingga Claude 3.5 Sonnet berada di 130 dan GPT-5 di 150, yang berarti sebuah angka hanya bermakna jika bersanding dengan angka lain dari berkas yang sama. Yang kedua adalah tidak ada plafon. Tidak ada angka 100 untuk didekati, sehingga “puncak indeks” adalah pernyataan tentang suatu tanggal, bukan tentang batas yang telah dicapai siapa pun.

Sifat ketiga itulah yang mengubah hasil seri menjadi sebuah cerita. Interval yang diterbitkan di samping setiap skor — interval bootstrap 90%, yang dibangun dengan melakukan resampling terhadap hasil benchmark yang diamati dari masing-masing model sebanyak lima ratus kali — identik untuk kedua model pada 165: 162 hingga 169 untuk Claude Sonnet 5.5 dan 162 hingga 169 untuk Claude Fable 5.1. Jumlah yang menghasilkannya tidak sama. Angka 165 milik Claude Sonnet 5.5 diperoleh dari 11 evaluasi benchmark. Angka milik Claude Fable 5.1 diperoleh dari 20.

Mengapa interval yang sama tidak berarti bukti yang sama

ECI memerlukan minimal empat evaluasi benchmark sebelum sebuah model diberi skor sama sekali, jadi kedua angka itu melewati ambang batas dengan nyaman. Namun interval tersebut adalah pernyataan tentang seberapa besar hasil model itu sendiri menyebar, bukan tentang berapa banyak hasilnya — itulah sebabnya dua model dapat menghasilkan pita yang sama di sekitar estimasi titik yang sama sementara salah satunya hanya bersandar pada kira-kira setengah bukti. Anggap kedua angka 165 sama kokohnya, dan Anda telah membaca interval itu sebagai koreksi ukuran sampel, padahal bukan.

Asimetri ini memiliki konsekuensi praktis bagi waktu. Epoch melakukan refit pada keseluruhan model secara bersama di seluruh data setiap kali evaluasi baru masuk, sehingga angka suatu model dapat bergeser tanpa ada yang berubah dari model tersebut. Model dengan 11 observasi memiliki lebih banyak ruang untuk bergeser daripada model dengan 20 observasi, yang membuat Claude Sonnet 5.5 lebih mungkin di antara keduanya untuk bergeser pada revisi berikutnya — ke arah mana pun.

Pembingkaian Epoch sendiri atas pembacaan saat ini lebih sempit daripada judul-judul berita yang dihasilkannya. Ringkasan organisasi tersebut tentang pembaruan itu mengawali dengan Claude Opus 5.5 yang mengambil posisi teratas pada 167, sedikit di depan GPT-6 Astra, dan menempatkan kalimat kedua pada fakta bahwa Claude Sonnet 5.5 telah “kira-kira menyamai” Claude Fable 5.1 pada 165. Kira-kira menyamai adalah frasa yang menentukan, dan interval yang dipublikasikan adalah alasan mengapa frasa itu tepat.

Di mana kedua profil sebenarnya berbeda

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Fable 5.1 - the scoreboard'. Left column 'Claude Sonnet 5.5': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 11', 'Mystery Game Puzzles: 65%', 'Furniture Assembly: 75%', 'Price: $2 / $10'. Right column 'Claude Fable 5.1': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 20', 'Mystery Game Puzzles: 58%', 'Furniture Assembly: 70%', 'Price: $10 / $50'. A footer line reads 'Epoch Capabilities Index, file updated 1 October 2026; prices per the vendors' own rate cards.'

Level pada komposit tidak berarti level pada bagian-bagiannya. Epoch menerbitkan panel per tolok ukur di setiap halaman model, dan enam tolok ukur muncul baik di halaman Claude Sonnet 5.5 maupun halaman Claude Fable 5.1 — sehingga hanya keenam tolok ukur itu yang menyediakan perbandingan setara langsung dari indeks itu sendiri.

• Teka-teki Gim Misteri — Claude Sonnet 5.5 65% vs Claude Fable 5.1 58%

• FrontierMath Tingkat 1–3 (v2) — Claude Sonnet 5.5 89% vs Claude Fable 5.1 90%

• FrontierMath Tier 4 (v2) — Claude Sonnet 5.5 80% vs Claude Fable 5.1 88%

• OTIS Mock AIME 2024–2025 — Claude Sonnet 5.5 100% vs Claude Fable 5.1 100%

• Tolok Ukur Perakitan Furnitur — Claude Sonnet 5.5 75% vs Claude Fable 5.1 70%

• SimpleQA Verified — Claude Sonnet 5.5 47% vs Claude Fable 5.1 71%

Empat poin pergerakan ke kedua arah pada komposit yang sepadat ini, dan pemisahan yang mendasarinya jauh dari simetris. Claude Sonnet 5.5 unggul pada pekerjaan yang bersifat seperti permainan dan multimodal — pemecahan teka-teki, perakitan fisik — dan sejajar pada matematika kompetisi. Claude Fable 5.1 unggul 8 poin pada tingkat tersulit FrontierMath dan 24 poin pada SimpleQA Verified, kumpulan pengetahuan dunia di mana skor 47% versus 71% adalah kesenjangan tunggal terbesar dalam panel bersama. Pembeli yang memilih di antara kedua model ini tidak sedang memilih antara dua pembacaan atas kemampuan yang sama; mereka memilih antara model yang lebih murah yang lebih kuat pada sebagian pekerjaan dan model yang lebih mahal yang lebih kuat pada pekerjaan lain, dengan indeks kemampuan umum yang menolak memisahkan keduanya.

Indeks Epoch juga secara eksplisit menyatakan bahwa keunggulan per tolok ukur tidak harus muncul dalam komposit. Tolok ukur tidak dibobot berdasarkan akurasi, dan model yang berspesialisasi dapat memperoleh skor lebih rendah daripada rival yang bentuknya berbeda bahkan saat memimpin tes-tes individual — dokumentasinya mengatakan demikian secara langsung. Itu bukan cacat yang dimaklumi; itulah gunanya komposit atas sekitar lima puluh tes.

Dua instrumen independen itu menunjuk ke arah yang berlawanan.

A capture of the Epoch AI model page for Claude Sonnet 5.5, headed ECI #3, Anthropic, Sep. 28, 2026, Closed weights, and the line that it has an ECI score of 165 and ranks 3rd of 253 tracked models. Beneath it a comparison table headed 'Claude Sonnet 5.5 vs select alternatives' carries four columns - Claude Sonnet 5.5, Claude Opus 5.5, GPT-6 Astra and Kimi K3 - with an ECI score row reading 165, 167, 167 and 158, a ranking row reading #3, #1 - Best, #2 and #13, and per-benchmark rows for Mystery Game Puzzles, FrontierMath Tiers 1-3 (v2), FrontierMath Tier 4 (v2), OTIS Mock AIME 2024-2025, Furniture Assembly Benchmark, SciCode, GPQA Diamond, Text Arena (Coding) and SimpleQA Verified.

Ada pengukuran independen kedua yang beredar, dan pengukuran itu tidak sependapat dengan yang pertama tentang model mana di antara kedua model ini yang unggul. Pada Artificial Analysis Intelligence Index, angka yang dimuat katalog kami sendiri untuk kedua model tersebut adalah 56 untuk Claude Sonnet 5.5 dan 53.4 untuk Claude Fable 5.1, yang diambil dari revisi yang sama pada indeks tersebut dan karena itu membawa sampel model yang dievaluasi yang sama. Terpaut tiga poin, yang menguntungkan model yang lebih murah — sementara Epoch membacanya sebagai identik.

Tidak ada yang salah dari kedua pembacaan itu, dan cara menggunakannya adalah dengan memperhatikan apa yang mereka perselisihkan. Kedua indeks tersebut mencakup kumpulan benchmark yang berbeda dan memberi bobot secara berbeda; komposit Epoch dirancang untuk bertahan ketika benchmark mengalami saturasi, sedangkan indeks Artificial Analysis adalah agregat langsung dari kumpulan yang berbeda. Ketika sepasang model begitu berdekatan, pilihan instrumen lebih bernilai daripada selisih yang diukur. Pembaca yang menginginkan angka yang lebih tinggi di antara dua angka yang berdekatan sebaiknya melihat panel benchmark individual bersama di atas, bukan pada salah satu angka utamanya, karena hanya di situ kedua model dibandingkan satu sama lain dalam tes yang sama.

Ada satu lagi konteks yang tidak dibawa oleh komposit, sedangkan Epoch membawanya: tanggal rilis. Claude Fable 5.1 menduduki peringkat keempat dari 253 model yang dilacak saat ini. Pada saat perilisannya sendiri pada 1 September 2026, ia menduduki peringkat pertama dari 247 model yang dilacak saat itu. Bobotnya tidak berubah. Frontier hanya bergerak melewatinya enam posisi dalam satu bulan — itulah bentuk keseluruhan tabel, dan alasan pembacaan indeks bulanan hanyalah snapshot, bukan putusan.

Berapa biaya perbedaannya, dan di mana sisi murahnya

A capture of the OrcaRouter model page for Claude Sonnet 5.5, listed under anthropic/claude-sonnet-5.5, showing a 1M-token context window with up to 128K output tokens, input pricing at $2.00 per million tokens and output at $10.00 per million tokens, and the catalogue's capability tags for the model.

Tingkat kemampuan umum dan selisih 2,5 kali pada input serta 5 kali pada output adalah seluruh isi praktis dari bacaan ini. Kedua model tersedia di katalog kami sendiri — anthropic/claude-sonnet-5.5 dengan $2.00 per juta input dan $10.00 per juta output dengan pembacaan cache $0.20, dan anthropic/claude-fable-5.1 dengan $10.00 dan $50.00 dengan pembacaan cache $0.25 — dan keduanya diteruskan pada harga daftar penyedia sendiri tanpa markup tambahan, sehingga perubahan tarif vendor tiba di sisi kami pada hari yang sama saat tiba di sisi mereka.

Pengulangan lebih penting daripada angka utamanya. Ambil contoh beban kerja yang mengirim prefiks 120.000 token dari cache dan menghasilkan 8.000 token keluaran, dijalankan sekali sehari selama sebulan. Pada Claude Sonnet 5.5, prefiks itu berbiaya 120.000 token pada $0,20 per juta, sekitar 2,4 sen, ditambah 8.000 pada $10 per juta, 8 sen — kira-kira 10,4 sen per eksekusi, atau sekitar $3,12 selama tiga puluh hari. Pada Claude Fable 5.1, prefiks yang sama adalah 120.000 pada $0,25, 3 sen, ditambah 8.000 pada $50, 40 sen — sekitar 43 sen per eksekusi, atau $12,90 sepanjang bulan. Kedua model melayani jendela 1M token yang sama dengan keluaran hingga 128K, jadi perbedaannya adalah kartu harga, bukan batas atasnya.

Sebaliknya, enam tolok ukur bersama menunjukkan ke arah mana uang tambahan itu membuahkan hasil. Tim yang pekerjaannya tampak seperti FrontierMath Tier 4 atau recall faktual terbuka membeli selisih nyata 8 hingga 24 poin pada tes-tes itu dengan membayar empat kali lebih banyak; tim yang pekerjaannya tampak seperti pemecahan teka-teki atau perakitan multimodal membeli 5 hingga 7 poin ke arah sebaliknya sambil membayar jumlah yang lebih kecil. Di satu platform, ini bukan dua keputusan pengadaan. Kedua model berada di balik satu kunci API di antara lebih dari 200 model, sehingga membandingkannya pada trafik Anda sendiri adalah perubahan konfigurasi, bukan kontrak kedua, dan di mana keduanya dirutekan, failover otomatis berada di bawahnya — yang penting ketika dua instrumen independen tidak sepakat tentang mana yang lebih unggul.

Apa yang akan menggerakkan pembacaan ini

Ada tiga hal yang akan mengubahnya, dan hanya satu di antaranya yang melibatkan salah satu dari kedua model itu.

Yang pertama adalah lebih banyak evaluasi benchmark. Claude Sonnet 5.5 masuk ke indeks empat hari lalu dengan 11 evaluasi di belakangnya; setiap evaluasi tambahan mempersempit intervalnya dan dapat menggeser estimasi titiknya, dan refit bersama berarti pergeseran itu tidak terbatas pada baris baru.

Yang kedua adalah kedatangan model frontier lain. Empat baris teratas mencakup empat poin, dengan dua hasil seri di dalam rentang itu, sehingga satu pendatang baru yang dievaluasi dengan baik akan berada di dalam klaster, bukan di bawahnya — dan interval yang dipublikasikan, yang tumpang tindih pada keempatnya, berarti urutan di antara mereka hanyalah penentu seri, bukan sebuah pengukuran.

Yang ketiga adalah harga model itu sendiri, yang tidak dilacak oleh indeks mana pun. Kesenjangan yang menjadi fokus artikel ini adalah kesenjangan kartu tarif: $2 dan $10 versus $10 dan $50 saat ini. Perubahan pada salah satu kartu mengubah keputusan tanpa mengubah satu pun skor kemampuan.

Ringkasan yang dapat dipertahankan adalah ringkasan yang sempit. Pada komposit Epoch AI, dalam file yang diperbarui pada 1 Oktober 2026, Claude Sonnet 5.5 dan Claude Fable 5.1 memiliki angka yang sama — 165, sama-sama di peringkat ketiga, dengan interval yang dipublikasikan identik yang bertumpu pada jumlah bukti yang berbeda. Pada instrumen terpisah milik Artificial Analysis, dua model yang sama terpaut tiga poin. Pada enam tolok ukur tempat indeks membandingkan keduanya secara langsung, keduanya saling bergantian memimpin menurut domain, bukan berada setara. Dan pada kartu tarif, keduanya sama sekali tidak berdekatan. Satu hal yang tidak akan didukung oleh pembacaan ini adalah kalimat yang paling mungkin dikutip untuk merangkumnya: bahwa model-model itu setara.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari