Kartu judul hero berjudul 'Claude Opus 5.5 dan uji semangka', dengan subjudul 'Claude yang paling mudah dibaca sejauh ini — dan tetap saja mengubur intinya', dengan tiga lencana bertuliskan Flesch-Kincaid 6.95, Reading Ease 68.4, dan 22 September 2026, serta logo OrcaRouter di sudut kanan bawah.
Guides & Insights

Claude Opus 5.5 dan Watermelon Test: Anthropic Memperbaiki Prosanya, tetapi Intinya Masih Terkubur

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Salah satu sampel yang paling jauh menyebar di luar minggu peluncuran adalah cerita pendek tentang semangka. Beberapa ratus kata, tanpa tolok ukur yang dilampirkan, tanpa grafik — hanya sebuah model yang diminta menulis sesuatu yang kecil dan sebagian besar benar. Itu adalah artefak yang aneh untuk berada di dekat pusat rilis unggulan, tetapi itu menunjukkan hal yang dipilih vendor untuk diutamakan ketika meluncurkan Claude Opus 5.5 pada 22 September 2026: bukan poin lain di Terminal-Bench, melainkan prosa. Kerangka perusahaan adalah bahwa model ini menulis lebih sedikit "Claudish" — istilah mereka untuk ragam yang formulaik, terlalu berhati-hati, dan bertele-tele yang Claude Opus 5 menuai keluhan, dan yang Claude Fable 5.1, GPT-6 Astra dan GPT-5.6 Sol masing-masing telah diukur terhadapnya sejak saat itu. Jadi pertanyaan yang layak dijawab bukanlah apakah demo itu menawan. Melainkan apakah prosanya meningkat secara terukur, seberapa besar, dan di mana masih gagal.

Apa yang dikatakan Anthropic telah diperbaiki

Screenshot of Anthropic's Claude Platform release-notes page, showing the Claude Opus 5.5 entry dated September 22, 2026, with the model ID claude-opus-5-5, a 1M-token context window and 128K maximum output.

Klaim Anthropic cukup spesifik untuk diuji. Opus 5.5, katanya, menempatkan informasi terpenting lebih dulu, menggunakan lebih sedikit jargon, dan lebih patuh pada aturan penulisan yang dinyatakan pengguna dibandingkan model Opus sebelumnya. Materi pendukungnya dilaporkan oleh vendor dan tidak direproduksi: uji pemeriksaan fakta internal yang menurut Anthropic lulus 16 dari 18 percobaan, dibandingkan nol dari 18 untuk kedua Claude Fable 5.1 dan Claude Opus 5. Kutipan pelanggan dalam materi peluncuran mengarah ke arah yang sama — John Ruelas dari Ramp menggambarkan keluaran yang "menulis seperti kolega yang baik," Box melaporkan pengurangan verbositas sekitar 40% pada beban kerjanya sendiri.

Ada dua hal yang layak dipisahkan di sini. Yang pertama adalah bahwa "kurang seperti Claude" adalah mode kegagalan yang nyata dan bisa dinamai, bukan ciptaan pemasaran. Para praktisi telah mengeluh tentang prosa Claude yang padat dan berstruktur buruk sejak generasi Opus pasca-4.6, dan keluhannya spesifik: terlalu banyak pembukaan, terlalu banyak pengulangan prompt, kebiasaan baru sampai ke intinya dua paragraf setelah pembaca membutuhkannya. Yang kedua adalah bahwa angka-angka Anthropic sendiri yang menunjukkan hal itu telah diperbaiki memang tepat seperti itu — angka Anthropic sendiri. Angka 16 dari 18 tidak memiliki replikasi independen, dan "40% lebih sedikit verbositas" adalah pengukuran internal pelanggan, bukan metodologi yang diterbitkan.

Rilis ini juga membawa perubahan non-penulisan yang patut diketahui: Opus 5.5 adalah model Opus pertama yang dirilis dengan pengamanan keamanan siber, biologi, dan pengembangan LLM frontier yang setara dengan pengamanan pada Claude Fable 5.1. Ketika sebuah permintaan memicu salah satunya, Anthropic mengatakan bahwa pihaknya secara transparan mengarahkan permintaan tersebut ke model lain alih-alih menolaknya secara langsung.

Angka-angka yang bukan milik Anthropic

A single-column readability scoreboard for Claude Opus 5.5: Flesch-Kincaid grade 6.95 versus Opus 5 at 7.97; Reading Ease 68.4 versus 61.35; Fable 5.1 and GPT-6 Astra at 7.43 and 7.52 grade; GPT-5.6 Sol at 8.74 grade and 56.62 ease; ranked 4th of 5 tested as an editor; and an AA Intelligence Index of 58, first of 212 models, with a sourcing footer.

Bacaan independen paling berguna tentang klaim penulisan itu berasal dari Every's Vibe Check, yang menjalankan prompt yang sama pada lima model terdepan dan menilai outputnya dengan dua instrumen keterbacaan standar. Pada kumpulan prompt itu, Claude Opus 5.5 muncul sebagai yang paling mudah dibaca di antara kelompok itu — dan selisih dengan model yang digantikannya adalah inti ceritanya:

• Tingkat kelas Flesch-Kincaid — Claude Opus 5.5 pada 6.95, dibandingkan dengan Claude Opus 5 pada 7.97

• Flesch Reading Ease — 68,4 untuk Opus 5.5, dibandingkan 61,35 untuk Opus 5

• Claude Fable 5.1 — tingkat kelas 7,43, Kemudahan Membaca 66,09

• GPT-6 Astra — tingkat kelas 7,52, Kemudahan Membaca 64,55

• GPT-5.6 Sol — tingkat kelas 8,74, Kemudahan Membaca 56,62

Baca kedua instrumen itu secara bersamaan, karena keduanya bergerak ke arah yang berlawanan dan itulah intinya: tingkat kelas yang lebih rendah dan skor kemudahan yang lebih tinggi sama-sama berarti prosa yang lebih sederhana. Opus 5.5 berada sekitar satu tingkat kelas penuh di bawah Opus 5, kira-kira setengah tingkat di bawah Claude Fable 5.1 dan GPT-6 Astra, serta hampir dua tingkat di bawah GPT-5.6 Sol. Secara sederhana, tingkat membaca kelas tujuh alih-alih kelas delapan.

Itu adalah peningkatan yang nyata dan sekaligus peningkatan yang sempit. Ini adalah kumpulan prompt dari satu media saja, bukan tolok ukur dengan daftar tugas tetap dan papan peringkat di belakangnya. Ini memberi tahu Anda arah perkembangannya dan kira-kira seberapa besar langkahnya. Ini tidak memberi tahu Anda bahwa Opus 5.5 menulis dengan baik untuk pekerjaan Anda, dan catatan kualitatif Every sendiri memperjelas bahwa peninjau juga tidak berpikir demikian.

Di mana ia masih mengubur intinya

Ulasan yang sama yang menghasilkan angka keterbacaan itu blak-blakan tentang kegagalan yang bertahan setelah perbaikan. Ketika diminta membuka esai, Opus 5.5 membutuhkan 37 hingga 39 kalimat untuk mencakup apa yang dibahas pengulas dalam 21 kalimat, dan menghabiskan satu paragraf penuh untuk poin yang disampaikan pengulas dalam delapan kata. Ringkasan pengulas adalah bahwa model tersebut "masih mengubur intinya" — dan versi keluhan yang lebih tajam adalah bahwa model itu dapat mendiagnosis dengan benar apa yang dibutuhkan sebuah paragraf, lalu menghasilkan revisi yang mengabaikan diagnosisnya sendiri.

Sebagai editor, hasilnya lebih buruk daripada sebagai penulis. Jika dibandingkan dengan model lain dalam tugas penyuntingan, Opus 5.5 berada di belakang Claude Opus 5, GPT-5.6 Sol dan GPT-6 Astra — model ini lebih baik dalam menghasilkan kalimat yang enak dibaca daripada mengenali kalimat mana yang seharusnya muncul lebih dulu. Putusan peninjau itu terangkum dalam satu kalimat yang layak dikutip karena itulah hal paling berguna di seluruh ulasan: "Saya lebih senang menjadikannya kolaborator daripada dengan prosa yang dihasilkannya."

Pembacaan praktisnya mengikuti langsung dari hal itu. Susun draf dengannya, dan susun draf pada effort tinggi atau lebih tinggi — pengaturan effort yang lebih rendah adalah tempat padding menjadi paling parah. Berikan contoh Anda sendiri daripada memintanya mengarang contoh. Lalu pindahkan poinnya ke atas sendiri, atau serahkan draf itu kepada sesuatu yang akan memindahkannya ke atas. Yang diberikan Opus 5.5 kepada Anda adalah jalur yang lebih cepat menuju draf pertama yang bersih dan kolaborator yang benar-benar lebih baik untuk tahap-tahap setelahnya. Opus 5.5 tidak memberi Anda seorang editor.

Berapa biaya kata-kata tambahan itu

Screenshot of the Artificial Analysis model page for Claude Opus 5.5, showing an Intelligence Index of 58 ranked first of 212 models, a cost rank of 93 of 212 at $4.00 per million input and $20.00 per million output with a 95% cache discount and $5.98 per Index task, and a verbosity rank of 95 of 212 at 260 million output tokens against a median of 88 million.

Ada dimensi biaya pada masalah verbositas yang sebagian besar dilewatkan oleh ulasan penulisan, dan hal itu bertentangan dengan narasi peluncuran. Artificial Analysis, yang menjalankan evaluasinya sendiri alih-alih mengandalkan angka vendor, menempatkan Claude Opus 5.5 di peringkat pertama dari 212 model pada Intelligence Index-nya dengan skor 58 — tetapi ke-95 dari 212 dalam hal verbositas, dengan menghasilkan 260 juta token keluaran sepanjang proses Intelligence Index tersebut, dibandingkan median 88 juta. Biayanya $5,98 per tugas Intelligence Index untuk dievaluasi, dan totalnya $8.708,20.

Jika hal itu disandingkan dengan klaim efisiensi Anthropic sendiri, keduanya tidak jelas sejalan. Posisi yang dilaporkan vendor adalah bahwa Opus 5.5 menggunakan lebih sedikit token dan menghasilkan output lebih dari 30% lebih cepat daripada Opus 5. Uji independen Artificial Analysis menemukan model itu sangat bertele-tele dibandingkan para pesaingnya. Keduanya bisa sama-sama benar — campuran tugas berbeda, pengaturan effort berbeda, definisi yang berbeda tentang apa yang dimaksud lebih sedikit token — tetapi tidak seorang pun semestinya membaca pembingkaian peluncuran sebagai fakta yang sudah mapan tentang ekonomi token. Soal harga, gambarannya lebih jelas: $4 per juta token input dan $20 per juta token output, turun dari $5/$25, dengan diskon cache 95% dalam angka Artificial Analysis.

Jika Anda membayar per token keluaran, prosa yang bertele-tele bukanlah preferensi gaya. Itu adalah pos tagihannya.

Menjalankannya terhadap apa yang sudah Anda miliki

Satu catatan jujur sebelum bagian praktis: Claude Opus 5.5 bukan salah satu rute kami. Kami tidak menghostingnya, dan tidak ada apa pun di bawah ini yang boleh dibaca sebagai klaim bahwa kami melakukannya. Anda mendapatkannya melalui API milik Anthropic sendiri dan beberapa platform pihak ketiga.

Yang ada di OrcaRouter hari ini adalah model yang digantikannya dan tier di atasnya. Claude Opus 5 sudah tersedia di OrcaRouter hari ini, dan begitu pula Claude Fable 5.1, keduanya pada harga daftar penyedia dengan markup 0% yang diteruskan — artinya perubahan harga vendor sampai ke sisi kami pada hari yang sama, bukan kapan pun reseller sempat mengurusnya. Jika Anda sedang mencoba memutuskan apakah prosa Opus 5.5 sepadan dengan perpindahannya, itu pasangan yang berguna: Anda bisa menjalankan perbandingannya dengan satu key tanpa kontrak kedua atau perubahan kode, karena kedua model tersebut satu API untuk 200+ model jauhnya di endpoint yang sama.

Alasan lain untuk tetap menyertakan model kedua dalam alur adalah mode kegagalan yang menjadi topik artikel ini. Model yang mengubur intinya adalah model yang ingin Anda bisa dialihkan saat tugas sedang berjalan, dan failover otomatis ada justru supaya generasi yang buruk tidak berubah menjadi pipeline yang macet. Jika Anda lebih suka tidak memilih satu model sama sekali, DSL perutean menyusun beberapa model ke dalam satu panggilan dan fusi model menjalankan panel model yang menjawab bersama-sama — bentuk yang masuk akal untuk pekerjaan penyuntingan, di mana kegagalannya adalah soal penilaian, bukan kemampuan.

Siapa yang harus bertindak, dan siapa yang harus menunggu

Jika keluhan Anda tentang Claude Opus 5 adalah bahwa Anda harus menulis ulang bagian pembukanya, Opus 5.5 adalah perbaikan nyata untuk sekitar satu tingkat kelas dari masalah itu, dan data keterbacaan menunjukkan bahwa peningkatannya terukur, bukan sekadar kesan. Jika keluhan Anda adalah bahwa butuh tiga paragraf untuk sampai ke intinya, tidak ada apa pun dalam bukti independen yang mengatakan bahwa hal itu berubah. Itu adalah keluhan yang berbeda, dan liputan peluncurannya telah memperlakukan keduanya sebagai satu hal yang sama.

Untuk pekerjaan kreatif secara khusus, cerita semangka bukan bukti apa pun kecuali bahwa orang memilih prompt kecil, hangat, dan berisiko rendah ketika mereka ingin menjajaki model baru. Itu hal yang wajar dilakukan. Itu juga justru situasi ketika kecenderungan mengubur inti paling tidak terlihat, karena tidak ada yang membaca cerita semangka untuk gagasan utamanya. Hadapkan model pada dokumen yang pembacanya membutuhkan kesimpulan di dua kalimat pertama, dan Anda akan mengetahui manakah dari dua masalah itu yang sebenarnya Anda alami.

Hal berikutnya yang perlu dicermati adalah apakah model berikutnya dalam keluarga ini — Sonnet 5.5 dan Haiku 5.5 keduanya diperkirakan hadir dalam beberapa minggu mendatang — mewarisi peningkatan keterbacaan, dan apakah ada yang menerbitkan angka keterbacaan untuk penyuntingan, bukan penyusunan draf. Angka untuk penyusunan draf itu mudah. Angka untuk penyuntingan adalah saat Opus 5.5 masih berada di belakang tiga pesaingnya.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari