Kartu hero berjudul Claude Sonnet 5.5 vs GPT-6 Sol, dengan subjudul tier $2 kini memiliki dua produk unggulan di dalamnya, dengan pil bertuliskan harga sama: $2 / $10, Index 56 vs 47, dan konteks 1M vs 1.05M, serta footer yang mengutip Artificial Analysis v4.3.2 dan harga vendor.
Guides & Insights

Claude Sonnet 5.5 vs GPT-6 Sol: Tier $2 Sekarang Punya Dua Flagship di Dalamnya

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Claude Sonnet 5.5 dan GPT-6 Sol dibanderol dengan harga yang sama — $2 per juta token input, $10 per juta token output — dan keduanya hadir terpaut enam hari pada akhir September 2026. Kebetulan itu bukan bagian yang menarik. Bagian yang menarik adalah ketika Artificial Analysis mengukur keduanya pada Intelligence Index v4.3.2 miliknya, model Anthropic tingkat menengah itu unggul di atas model yang selama ini dijual OpenAI sebagai andalannya: 56 untuk Claude Sonnet 5.5 versus 47 untuk GPT-6 Sol. Pada revisi yang sama, Claude Sonnet 5 — model yang digantikan Sonnet 5.5 — berada di angka 38.

Jadi ini bukan lagi perbandingan tier murah dengan tier mahal. Ini adalah perbandingan dua model dengan harga yang sama, dari dua lab, dengan selisih 18 poin antara model Anthro​pic itu dan pendahulunya sendiri, serta selisih sembilan poin yang menguntungkan Anthro​pic terhadap rilis kelas atas Open​AI. Semua yang ada di bawah ini merupakan upaya untuk mencari tahu celah mana di antara semuanya yang bertahan saat berhadapan dengan beban kerja nyata, dan mana yang hanya artefak benchmark.

Apa sebenarnya setiap model itu

Claude Sonnet 5.5 adalah model kedua dalam generasi 5.5 Anthropic, yang dirilis pada 28 September 2026, lima hari setelah peluncuran Claude Opus 5.5 yang menjanjikannya. Model ini membawa id claude-sonnet-5-5 di seluruh Claude API, Amazon Bedrock, Google Cloud, dan Microsoft Foundry, mempertahankan jendela konteks 1M token dan batas output 128K pada tier ini, serta mempertahankan harga Claude Sonnet 5 secara persis: $2 masuk, $10 keluar, $0,20 per juta untuk pembacaan cache, $2,50 untuk penulisan cache lima menit. Model ini tersedia dengan retensi data nol sejak hari pertama, dan komitmen penghentian Anthropic berlaku hingga 28 September 2027.

Two-column scoreboard for Claude Sonnet 5.5 and GPT-6 Sol across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column GPT-6 Sol: input $2.00 per million, output $10.00 per million up to 272K then $4 / $15, 1,050,000-token context, AA Intelligence Index 47, cost per task not published, released September 22 2026. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

GPT-6 Sol adalah penerus model yang secara membingungkan disebut GPT-5.6 Sol — model yang masih dicantumkan OrcaRouter sebagai dapat dijangkau dengan harga $4 untuk input dan $20 untuk output, dan yang sejak itu ditandai Artificial Analysis sebagai usang dengan penunjuk ke GPT-6 Sol. Model baru ini diluncurkan pada 22 September 2026 dengan harga $2 / $10, jendela konteks 1.050.000 token, batas keluaran 128K, dan tarif berjenjang: harga utama $2 / $10 berlaku hingga 272.000 token masukan, dan segala sesuatu di atas itu ditagih dengan $4 / $15.

Detail terakhir itu adalah tempat pertama di mana kerangka "penetapan harga yang identik" mulai runtuh.

Kesamaan harga hanya benar untuk prompt pendek.

Kedua kartu tarif sama-sama mencantumkan $2 dan $10, dan hampir setiap perbandingan saat peluncuran berhenti sampai di situ. Sejajarkan keduanya berdasarkan ketentuan yang menentukan tagihan:

• Tarif utama — Claude Sonnet 5.5 $2 / $10 vs GPT-6 Sol $2 / $10

• Tarif konteks panjang — Sonnet 5.5 menagih seluruh jendela 1M dengan tarif standar; GPT-6 Sol menjadi dua kali lipat, yakni $4 / $15 di atas 272.000 token input

• Jendela konteks — 1.000.000 token vs 1.050.000 token

• Output maksimum — 128K token pada API sinkron untuk keduanya; Sonnet 5.5 mencapai 300K pada API Message Batches di balik output-300k-2026-03-24 header

• Diskon batch — potongan 50% untuk input dan output Sonnet 5.5; periksa ketentuan OpenAI yang berlaku saat ini untuk Sol alih-alih mengasumsikan paritas

• Pembacaan cache — $0.20 per juta untuk keduanya

Penyapuan repositori 800.000 token berbiaya dua kali lipat per token di GPT-6 Sol dibandingkan di Claude Sonnet 5.5, dan itulah beban kerja yang justru dipasarkan untuk kedua model. Jika prompt Anda pendek, kartu tarif memang imbang dan harga seharusnya tidak menentukan apa pun. Jika panjang, harga sudah menentukannya.

Papan skor Anthropic sendiri, baca dengan cermat.

Anthropic menerbitkan perbandingan empat kolom terhadap Claude Sonnet 5, Claude Opus 5.5, dan GPT-6 Sol. Angka-angka yang dilaporkan vendor, yang belum direproduksi oleh pihak ketiga mana pun:

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

• Terminal-Bench 4.0 — Sonnet 5.5 70.6% vs Sonnet 5 10.3%

• FrontierCode 1.1, Main — Sonnet 5.5 46,2% pada Max effort, Sonnet 5 42,4%, Opus 5.5 54,4%, GPT-6 Sol 49,3%

• CursorBench 4.0 — Sonnet 5.5 55,5% vs Sonnet 5 34,1% vs Opus 5.5 57,8%

• GDPval-AA v2.1 — Sonnet 5.5 1844 vs Sonnet 5 1449 vs Opus 5.5 1846 vs GPT-6 Sol 1487

• AA-Briefcase v1.1 — Sonnet 5.5 1811 vs Sonnet 5 1359 vs Opus 5.5 1822 vs GPT-6 Sol 1483

• Humanity's Last Exam, dengan alat — Sonnet 5.5 64,5% vs Sonnet 5 54,9% vs Opus 5.5 67,7%

• OSWorld 2.1, sebagian — Sonnet 5.5 80,1% vs Sonnet 5 57,0% vs Opus 5.5 81,8%

• Chartography, tanpa alat — Sonnet 5.5 61,6% vs Sonnet 5 15,6% vs Opus 5.5 64,4% vs GPT-6 Sol 53,6%

Dua dari baris tersebut memiliki catatan kaki dan keduanya penting. Angka GDPval-AA, AA-Briefcase, dan Chartography untuk GPT-6 Sol ditandai oleh Anthropic sebagai diukur setelah perbaikan pemahaman gambar di sisi OpenAI, dan angka FrontierCode untuk Sonnet 5.5 adalah hasil Max-effort-nya, yang menurut catatan Anthropic berada di bawah hasil Xhigh-nya sendiri pada evaluasi yang sama. Vendor yang membandingkan dirinya dengan pesaing pada benchmark yang dijalankannya sendiri, dengan catatan kaki yang memberi kualifikasi pada kedua sisi, bukanlah bukti netral. Itu adalah bukti terbaik yang tersedia pada hari peluncuran, dan itu bukan hal yang sama dengan pengukuran.

Apa yang dikatakan angka-angka independen, dan apa yang tidak

Artificial Analysis telah menerbitkan hasil independen pertama: Index 56 pada v4.3.2, biaya $7.60 per tugas Index, dan angka verbositas 410M token keluaran terhadap median 88M. Angka verbositas itu pantas mendapat lebih banyak perhatian daripada yang selama ini diberikan. Ini berarti model cenderung menghabiskan sangat banyak token dalam perjalanan menuju jawaban, dan itulah mekanisme di balik satu klaim efisiensi yang tidak berasal dari tabel milik Anthropic sendiri.

Anthropic mengatakan Claude Sonnet 5.5 menghasilkan output 30% lebih cepat daripada Claude Sonnet 5 dan berbiaya "hingga 30% lebih murah per tugas" pada tarif per token yang sama. Kedua klaim itu bersama-sama menggambarkan model yang melakukan pekerjaan yang sama dengan token lebih sedikit, bukan kartu tarif yang lebih murah. Apakah itu benar-benar berlaku adalah tepatnya alasan pembacaan verbositas 410 juta token dilakukan, dan satu pengujian independen tidak cukup untuk menyimpulkannya — tetapi cukup untuk mengatakan bahwa kalimat pemasaran dan jumlah token terukur menunjuk ke arah yang berlawanan, dan yang terukur itulah yang muncul di invoice.

Perhatikan juga apa yang belum termuat dalam indeks independen. Belum ada replikasi OSWorld, Terminal-Bench, atau CursorBench yang diterbitkan oleh pihak selain Anthropic. Dan angka 56 itu adalah komposit: angka itu tidak menjelaskan evaluasi mana dari sepuluh evaluasi di dalamnya yang mendorong selisih menuju 47 milik Sol. Keunggulan komposit sembilan poin bisa menyembunyikan kerugian lima belas poin pada satu eval yang menjadi tumpuan beban kerja Anda.

Di mana mereka berbeda dalam cara yang tidak dapat ditunjukkan oleh kartu tarif

Harga dan skor indeks adalah dua sumbu yang mudah. Yang menentukan migrasi adalah sumbu perilaku, dan di sini kedua model itu tidak dekat.

OrcaRouter model page for openai/gpt-5.6-sol, attributed to OpenAI and dated 2026-07-09, showing a 1M-token context window, 128K maximum output, text, image and file input, an input price of $4.00 and output price of $20.00 per million tokens, a p50 time to first token of 10.00 seconds, and OpenAI-compatible base URL https://api.orcarouter.ai/v1

Claude Sonnet 5.5 mengaktifkan pemikiran adaptif secara default dengan high sebagai upaya default, dan menghapus tiga hal yang diizinkan generasi sebelumnya: mengirim thinking: {"type": "disabled"} kini mengembalikan 400 dan harus diganti dengan between_tools; penggunaan alat yang dipaksa — tool_choice diatur ke "any" atau alat bernama — mengembalikan 400 secara langsung; dan versi lama dari computer_20251124 alat computer-use ditolak di Claude API dan Google Cloud demi seperangkat alat. Blok pemikiran juga sekarang terikat pada model yang menghasilkannya, sehingga percakapan dapat berpindah dari Claude Sonnet 5 ke Claude Sonnet 5.5 dan mempertahankan penalarannya, tetapi tidak dapat berpindah kembali keluar dengan penalaran itu.

Jika loop agen Anda menetapkan tool_choice: "any" untuk memaksa pemanggilan yang valid sesuai skema, Claude Sonnet 5.5 akan menolak permintaan tersebut sampai Anda beralih ke auto dengan penggunaan alat yang ketat atau output terstruktur. Itu adalah tugas migrasi yang nyata, dan hal semacam itulah yang mengubah penggantian ID model satu baris menjadi pekerjaan seharian.

Biaya beralih ke GPT-6 Sol berbeda jenis, karena model yang digantikannya masih ada di katalog dan masih dipanggil. GPT-5.6 Sol tidak ditarik; statusnya deprecated di Artificial Analysis, dibanderol dua kali lipat model baru, dan masih menerima trafik. Pengukuran OrcaRouter sendiri menunjukkan model itu menangani sekitar 95 juta token per minggu, yang merupakan proksi wajar untuk berapa banyak integrasi yang belum bermigrasi. Beralih ke GPT-6 Sol adalah keputusan harga yang bisa Anda ambil nanti; Anda tidak harus mengambilnya sekarang.

Menjalankan perbandingan pada satu kunci

Masalah praktis dengan perbandingan dua vendor adalah biasanya Anda perlu dua akun, dua jalur SDK, dan dua set batas laju sebelum Anda mempelajari apa pun. OrcaRouter hadir untuk memangkas itu: satu endpoint yang kompatibel dengan OpenAI, lebih dari 200 model, harga daftar penyedia diteruskan tanpa markup, dan failover otomatis antar penyedia.

Kedua model yang penting di sini dapat dirutekan di platform ini hari ini. GPT-6 Sol ada dalam katalog dengan harga $2 / $10 dengan tier konteks panjang yang tetap utuh, dan Claude Sonnet 5 — model yang masih digunakan oleh sebagian besar lalu lintas Claude API, dengan kecepatan terukur 150 token keluaran per detik dan waktu token pertama p50 sekitar lima detik — telah tersedia di platform sejak 30 Juni dengan tarif $2 / $10 milik Anthropic sendiri.

Claude Sonnet 5.5 sendiri belum ada di katalog kami. Meskipun begitu, jalur jujurnya adalah API milik vendor itu sendiri dan tiga cloud yang dicantumkan Anthropic, dan cara jujur untuk mengevaluasinya adalah mengarahkannya ke sebagian trafik yang Anda mampu kehilangan. Itulah gunanya lapisan routing: naikkan persentasenya, pantau tingkat kegagalannya, dan pertahankan model sebelumnya sebagai fallback, bukan sebagai rencana rollback.

Yang mana yang masuk ke produksi?

Pilih berdasarkan bentuk beban kerja, bukan berdasarkan skor komposit.

Claude Sonnet 5.5 adalah pembelian yang lebih baik untuk pekerjaan konteks panjang, untuk apa pun yang sudah ditulis terhadap permukaan tool-use dan computer-use Anthropic, dan untuk tim yang prompt-nya rutin melampaui seperempat juta token — jendela tarif tetap lebih bernilai di sana daripada delta indeks mana pun. Terimalah bahwa migrasi ini memiliki daftar periksa yang menyertainya: pemaksaan penggunaan alat, tombol thinking, pasangan alat advisor, dan perubahan alat computer-use.

GPT-6 Sol adalah pilihan kesinambungan yang lebih aman untuk stack yang berbentuk OpenAI, dan yang lebih murah jika prompt Anda pendek serta integrasi Anda sudah dibangun. Keunggulannya bukan kapabilitas — pada komposit ia tertinggal — melainkan bahwa pendahulunya masih melayani dan migrasinya tidak memiliki tenggat waktu.

Berdasarkan angka yang tersedia saat ini, Claude Sonnet 5.5 memenangi perbandingan langsung pada indeks independen dan pada ekonomi konteks panjang, serta tidak kalah dalam hal apa pun yang masih mampu dideteksi oleh pengukuran terbit mana pun di luar keyakinan tabel milik vendor sendiri. Itu klaim yang lebih sempit daripada yang dibuat oleh materi peluncuran, dan itulah klaim yang layak ditindaklanjuti.

Yang akan mengubah jawabannya adalah pelaksanaan independen kedua atas evaluasi agentic, dan angka token per tugas yang dipublikasikan untuk kedua model pada tugas yang sama. Sampai keduanya ada, indeks komposit adalah keunggulan sembilan poin bagi model yang lebih murah untuk dijalankan, dan keunggulan komposit sembilan poin tidak sama dengan keunggulan sembilan poin pada beban kerja Anda.

Dibandingkan dalam artikel ini3

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari