Kartu judul yang dihasilkan bertuliskan "GPT-6 vs Claude Opus 5", dengan chip bertuliskan "Opus 5 digantikan oleh Claude Opus 5.5, 22 Sep 2026" dan chip bertuliskan "GPT-6 Sol digantikan oleh GPT-6.1 Sol, 29 Sep 2026", serta footer bertuliskan "Kedua model masih dirutekan; angka indeks menurut Artificial Analysis." Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

GPT-6 vs Claude Opus 5: Kedua Sisi Pertarungan Ini Sudah Digantikan

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Hal paling berguna untuk diketahui tentang GPT-6 versus Claude Opus 5 adalah bahwa kedua sisi pertandingan ini tertinggal satu generasi di belakang vendor mereka sendiri. Claude Opus 5 dirilis pada 24 Juli 2026 dan digantikan oleh Claude Opus 5.5 pada 22 September. GPT-6 Sol dirilis pada 22 September dan digantikan oleh GPT-6.1 Sol pada 29 September. Jika Anda mencari perbandingan ini karena Anda sedang memilih di antara keduanya untuk pekerjaan baru, Anda sedang memilih antara dua model yang masing-masing vendornya sudah melampaui — dan versi jujur dari artikel ini adalah tentang kapan pasangan yang lebih lama masih merupakan pilihan yang tepat, bukan tentang siapa yang menang.

Apa sebenarnya kedua model itu

Claude Opus 5 adalah andalan Anthropic: jendela konteks 1.000.000 token, keluaran maksimum 128.000 token, masukan teks, gambar, dan file, dengan tarif $5.00 per juta token masukan dan $25.00 per juta token keluaran, dengan tarif masukan cache $0.50 dan tarif penulisan cache $10.00. Ini adalah model tunggal dengan satu id, anthropic/claude-opus-5.

GPT-6 Sol adalah tingkat menengah dari generasi tiga model — GPT-6 Astra di atasnya dan GPT-6 Luna di bawahnya — dengan konteks lebih dari 1.000.000 token yang sama (katalog mencantumkan 1.050.000 untuk sisi OpenAI dibandingkan 1.000.000 milik Opus 5), batas output 128.000 token yang sama, dan input teks/gambar/file yang sama. Tarifnya tercantum $2,00 / $10,00, dengan tarif input cache $0,20 dan tarif penulisan cache $2,50. Kartu tarifnya memiliki langkah yang tidak dimiliki kartu Anthropic: permintaan apa pun di atas 272.000 token input akan mengubah harga seluruh permintaan menjadi $4,00 / $15,00.

Itu adalah selisih harga per token sebesar 2,5x yang menguntungkan Sol pada rentang pendek, dan selisih itu juga bertahan pada cache — diskon input tercache 90% pada Sol versus diskon 98% pada Opus 5, yang mempersempit perbedaan menjadi $0,20 versus $0,50 per juta, bukan menghilangkannya. Pada beban kerja konteks panjang, selisihnya berkurang setengah, bukan hilang.

• Masukan — GPT-6 Sol $2,00 per juta vs Claude Opus 5 $5,00
• Keluaran — GPT-6 Sol $10,00 per juta vs Claude Opus 5 $25,00
• Masukan cache — GPT-6 Sol $0,20 per juta vs Claude Opus 5 $0,50
• Penulisan cache — GPT-6 Sol $2,50 per juta vs Claude Opus 5 $10,00
• Di atas masukan 272K — GPT-6 Sol menetapkan harga ulang seluruh permintaan menjadi $4,00 / $15,00; tidak ada langkah setara pada kartu Opus 5
• Konteks dan keluaran — 1.050.000 masuk dan 128.000 keluar vs 1.000.000 masuk dan 128.000 keluar

Dewan independen, di mana selisihnya lebih besar daripada harganya

Harga berpihak pada GPT-6 Sol sebesar 2,5x. Papan peringkat lebih memihak Claude Opus 5 daripada yang disiratkan oleh selisih harga, yang merupakan kebalikan dari kisah model murah yang biasa.

• AA Intelligence Index — Claude Opus 5 50.8, peringkat ke-11; GPT-6 Sol 47.6, peringkat ke-14
• AA Coding Index — Claude Opus 5 78.0, peringkat ke-2 di daftar itu; GPT-6 Sol 60.0
• GPQA Diamond — Claude Opus 5 93.2
• Humanity's Last Exam — Claude Opus 5 54.9 vs GPT-6 Sol 47.9
• Terminal-Bench 2.1 — Claude Opus 5 89.1
• Terminal-Bench 4.0 — Claude Opus 5 49.0 vs GPT-6 Sol 43.9
• τ-bench perbankan — Claude Opus 5 42.1
• SciCode — Claude Opus 5 56.4 vs GPT-6 Sol 57.6
• Recall konteks panjang — Claude Opus 5 79.3 vs GPT-6 Sol 83.7

Dua baris bergerak ke arah sebaliknya dan keduanya layak disebutkan, karena angka agregat menyembunyikannya. GPT-6 Sol mengalahkan Opus 5 pada recall konteks panjang dengan selisih 4,4 poin dan sedikit lebih unggul pada SciCode dengan 1,2 poin. Jadi gambaran yang jujur bukanlah "Opus 5 lebih baik dalam segala hal" — melainkan bahwa Opus 5 secara meyakinkan unggul di papan koding dan agentik (keunggulan 24 poin pada Coding Index adalah kelas hasil yang berbeda) sementara Sol memegang baris recall jendela panjang dan imbang pada salah satu dari dua ukuran kode sains.

Satu catatan metodologis sebelum angka mana pun dikutip di tempat lain: Artificial Analysis tidak menjamin bahwa dua halaman model dirender terhadap revisi indeks yang sama pada hari yang sama, dan Artificial Analysis memisahkan kelompok sejawatnya — model open-weight diperingkatkan terhadap model open-weight lain dari kelas ukuran yang sama, sedangkan model proprietary diperingkatkan dalam rentang harga proprietary. Kedua model di sini bersifat proprietary, jadi kedua angka tersebut berasal dari sisi yang sama dari garis pemisah itu, tetapi perlakukan perbedaan kurang dari satu poin sebagai arah, bukan sebagai pengukuran yang terkontrol. Setiap angka vendor dalam tulisan ini adalah hasil vendor melakukan benchmark atas modelnya sendiri terhadap pendahulunya sendiri dan diberi label demikian.

Apa yang diubah oleh kedua penggantian itu

Claude Opus 5.5 hadir pada 22 September dengan harga $4.00 / $20.00 — lebih murah daripada Opus 5 pada kedua meter, dengan tarif input cache $0.20 yang setara dengan Sol — dan mencetak skor 57,6 pada Intelligence Index yang sama. Itu 6,8 poin di atas Opus 5 dengan biaya 20% lebih murah. Argumen apa pun untuk mempertahankan Opus 5 dalam build baru harus menjelaskan mengapa hal itu layak 6,8 poin indeks dan $1.00/$5.00 per juta untuk tetap menggunakan checkpoint lama.

GPT-6.1 Sol hadir pada 29 September dengan harga yang sama, $2.00 / $10.00, seperti GPT-6 Sol, dengan skor 51,8 pada indeks berbanding 47,6 milik Sol, serta tarif input cache $0.10 yang memangkas separuh biaya pembacaan cache. Harganya sama, tetapi skornya lebih baik dan ekonomi cache-nya lebih baik. Satu-satunya argumen yang secara khusus mendukung GPT-6 Sol adalah argumen yang sama yang berlaku untuk Opus 5: rangkaian uji regresi yang dijadikan baseline terhadapnya, di mana mengganti model akan membatalkan perbandingan yang sudah Anda percayai.

Ada alasan kedua yang lebih senyap mengapa sebuah tim tetap bertahan pada pasangan yang lebih lama, dan ini bukan soal benchmark. Keduanya adalah checkpoint dengan riwayat produksi terpanjang di belakangnya. Opus 5 dapat dipanggil sejak 24 Juli dan GPT-6 Sol sejak 22 September, dan pengukuran evaluator independen pada keduanya telah berjalan cukup lama untuk menunjukkan suatu pola, bukan satu pembacaan tunggal. Lalu lintas Sol selama tujuh hari terakhir pada data routing kami sendiri mencapai sekitar 2,1 juta token; milik Opus 5 mencapai sekitar 23,0 juta. Angka-angka itu adalah jendela bergulir, bukan total seumur hidup, dan berubah antar pembacaan — tetapi itu menjadi pengingat bahwa Opus 5 masih melakukan pekerjaan nyata di produksi bahkan setelah penggantinya dirilis.

Bentuk latensi dan biaya, di sinilah Sol membuktikan nilainya

• Waktu median hingga token pertama — GPT-6 Sol 6.785 ms vs Claude Opus 5 4.652 ms
• Kecepatan output median — GPT-6 Sol 179,6 token/dtk vs Claude Opus 5 82,2 token/dtk
• Trafik tujuh hari yang kami amati — GPT-6 Sol ~2,1 juta token, Claude Opus 5 ~23,0 juta token

Sol menjawab token pertamanya sekitar 2,1 detik kemudian, tetapi setelah itu mengalirkannya dengan laju lebih dari dua kali laju Opus 5. Pada generasi panjang — jenis proses yang outputnya ribuan token, bukan puluhan — angka kedua itu mendominasi, dan model murah yang selesai lebih cepat bernilai lebih besar daripada yang disiratkan daftar tarifnya. Pada panggilan singkat yang sensitif terhadap latensi, angka token pertama itulah yang dirasakan pengguna.

Keduanya adalah pengukuran serving dari perutean kami sendiri, yang diambil selama jendela tujuh hari bergulir, dan nilainya bergeser di antara pembacaan. Keduanya berguna untuk membandingkan bentuk kedua model, bukan untuk dikutip sebagai ekspektasi tingkat layanan.

A generated two-column comparison scoreboard titled "GPT-6 Sol vs Claude Opus 5 — the scoreboard". The left column, GPT-6 Sol, reads Input $2.00, Output $10.00, AA Intelligence 47.6, AA Coding 60.0, Long-context recall 83.7, Output speed 180 tok/s. The right column, Claude Opus 5, reads Input $5.00, Output $25.00, AA Intelligence 50.8, AA Coding 78.0, Long-context recall 79.3, Output speed 82 tok/s. A footer line reads "Index figures per Artificial Analysis; serving figures are a rolling seven-day window from OrcaRouter." The OrcaRouter logo is composited in the bottom-right corner.

Menjalankan {{1}}pasangan{{/1}} sementara {{2}}migrasi{{/2}} {{3}}belum diputuskan{{/3}}

Alasan perbandingan ini layak dijawab sama sekali adalah bahwa tidak ada dari kedua penggantian itu yang merupakan keputusan yang bisa langsung diambil. Jika evaluasi Anda dibangun terhadap Claude Opus 5, beralih ke Opus 5.5 adalah penetapan ulang baseline, bukan peningkatan; hal yang sama berlaku untuk GPT-6 Sol dibandingkan GPT-6.1 Sol. Hal yang berguna untuk dilakukan dalam jendela itu adalah menjalankan kedua generasi secara berdampingan pada trafik Anda sendiri alih-alih memilih dari papan peringkat orang lain.

Keempat model berada dalam katalog yang sama di OrcaRouter — Claude Opus 5, Claude Opus 5.5, GPT-6 Sol, dan GPT-6.1 Sol, dipanggil melalui satu API di depan 200+ model, dengan harga daftar penyedia diteruskan dengan markup 0% sehingga pemotongan harga vendor sampai di sini pada hari yang sama, bukan pada rekonsiliasi berikutnya — yang menjadikan perbandingan ini sebagai pertanyaan routing, bukan pertanyaan pengadaan. DSL routing memungkinkan Anda memisahkan berdasarkan ukuran permintaan atau berdasarkan porsi: kirim sebagian lalu lintas produksi ke checkpoint yang lebih baru, bandingkan dengan baseline pada evaluasi Anda sendiri, perluas porsinya saat angkanya bertahan, dan pertahankan model lama sebagai fallback sampai angkanya bertahan. Failover otomatis antar penyedia mencakup kasus ketika rute menurun di tengah migrasi, yaitu mode kegagalan yang membuat orang meninggalkan migrasi di tengah jalan.

Screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the Anthropic vendor label, a 2026-07-24 catalogue release date, a 1M-token context window, a 128K maximum output, text, image and file input with Vision, Tools, JSON and Reasoning badges, and a rate strip reading $5.00 per million input, $25.00 per million output, a 4.65 s median time to first token, a 10.00 s p95, and 23.0M tokens routed in seven days.Screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 catalogue release date, a 1,050,000-token context window (shown as 1.05M-token context in the model blurb), a 128K maximum output, text, image and file input with Vision, Tools, JSON and Reasoning badges, and a rate strip reading $2.00 per million input, $10.00 per million output, a 6.79 s median time to first token, a 10.00 s p95, and 2.1M tokens routed in seven days.

Siapa yang seharusnya memilih yang mana, mengingat keduanya sudah digantikan?

Jika Anda memulai sesuatu yang baru: bukan keduanya. Claude Opus 5.5 lebih murah daripada Claude Opus 5 dan mencetak skor 6,8 poin lebih tinggi, dan GPT-6.1 Sol harganya sama dengan GPT-6 Sol dengan indeks yang lebih baik dan pembacaan cache yang dipangkas setengah. Satu-satunya alasan untuk memulai dengan pasangan yang lebih lama adalah ketergantungan keras pada checkpoint yang tidak dapat Anda ubah.

Jika Anda sudah menjalankan salah satunya: keputusannya adalah tentang rangkaian regresi Anda, bukan tentang papan peringkat. Claude Opus 5 tetap menjadi model coding dan agentic yang lebih kuat di antara keduanya dengan selisih yang lebar, jadi pipeline coding yang stabil padanya harus dibandingkan dengan Opus 5.5 alih-alih bermigrasi menyamping ke tier GPT-6. Pipeline bervolume tinggi yang sensitif terhadap biaya pada GPT-6 Sol memiliki jalur peningkatan yang lebih mudah — harga sama, skor lebih baik, cache lebih baik — dan alasan jujur untuk menunda hanyalah bahwa Anda belum menjalankan ulang evaluasi Anda.

Dan jika jawaban yang Anda inginkan hanyalah mana dari keduanya yang menang: Claude Opus 5 yang menang, di hampir semua papan peringkat, dengan biaya 2,5 kali lipat. Argumen GPT-6 Sol tidak pernah karena ia lebih baik. Argumennya adalah karena ia cukup murah sehingga sepadan dengan selisihnya — dan argumen itu sekarang menjadi milik GPT-6.1 Sol dengan harga yang sama dan skor yang lebih baik.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari