Kartu hero yang dihasilkan untuk GPT-6.1 Sol vs Claude Opus 5.5 berjudul 'Kesenjangan nyata, yang distribusinya tidak merata', dengan dua kartu info bertuliskan 'GPT-6.1 Sol: Intelligence Index 51.8, $0.72 per tugas indeks, recall konteks panjang 83.0%' dan 'Claude Opus 5.5: Intelligence Index 57.6, $5.98 per tugas indeks, recall konteks panjang 84.7%', footer bertuliskan 'Angka menurut Artificial Analysis, Intelligence Index v4.3.2, kedua model ditampilkan pada pengaturan upaya maksimumnya.', dan logo OrcaRouter di sudut kanan bawah.
Guides & Insights

GPT-6.1 Sol vs Claude Opus 5.5: Kesenjangan Nyata yang Tersebar Tidak Merata

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Kesenjangan 5,8 poin antara Claude Opus 5.5 dan GPT-6.1 Sol pada Artificial Analysis Intelligence Index adalah yang terbesar di antara pasangan mana pun dalam kumpulan ini, dan tidak seperti sebagian besar dari mereka, kesenjangan itu tidak akan menutup hanya dengan mengubah pengaturan. Claude Opus 5.5, yang dirilis pada 22 September 2026 dan dibanderol $4,00 per juta token input dan $20,00 per juta token output, mencetak skor 57,6. GPT-6.1 Sol, yang dirilis pada 29 September 2026 dengan harga $2,00 dan $10,00, mencetak skor 51,8. Claude Opus 5.5 adalah model dengan skor lebih tinggi dengan selisih yang lebih besar daripada selisih yang memisahkan sebagian besar model terdepan satu sama lain, dan biayanya 8,3× lebih mahal per tugas untuk mencapainya — $5,98 berbanding $0,72. Sejauh ini, model mahal itu sekadar menang, yang merupakan versi paling tidak menarik dari perbandingan ini. Yang membuatnya layak dibaca adalah bahwa 5,8 poin itu tidak tersebar merata di seluruh rangkaian uji: pada satu sumbu yang menentukan sebagian besar pekerjaan dokumen panjang dan sesi panjang, kedua model hanya terpaut dua poin satu sama lain.

Keduanya adalah model unggulan di segmen pasar yang sama: jendela konteks kelas 1M, batas keluaran 128K, masukan teks, gambar, dan file, pemikiran diperluas di satu sisi dan tangga upaya lima tingkat di sisi lain. Claude Opus 5.5 menggantikan Claude Opus 5 dan diposisikan untuk penalaran, pengodean, serta pekerjaan agentik berhorizon panjang yang menuntut; GPT-6.1 Sol berada satu tingkat di bawah GPT-6 Astra dan diposisikan untuk pengodean agentik, penggunaan komputer, dan pekerjaan profesional yang padat dokumen. Keduanya ditujukan untuk pekerjaan yang sama. Pengukuran menunjukkan keduanya tidak sama baiknya dalam semua pekerjaan itu.

Di mana 5,8 poin itu sebenarnya berada

Komposit indeks menyembunyikan komponen-komponennya. Tarik evaluasi individualnya, dan kesenjangan itu berhenti tampak seperti kesenjangan dan mulai tampak seperti sebuah profil.

• Humanity's Last Exam — Claude Opus 5.5 61,4% vs GPT-6.1 Sol 52,9%, selisih 8,5 poin dalam penalaran abstrak

• SciCode — Claude Opus 5.5 66,9% vs GPT-6.1 Sol 54,2%, selisih 12,7 poin pada kode tingkat riset

• Recall konteks panjang — Claude Opus 5.5 84,7% vs GPT-6.1 Sol 83,0%, selisih 1,7 poin dalam mengambil fakta dari input panjang

• Terminal-Bench 4.0 — Claude Opus 5.5 59,6% dibandingkan angka Sol yang tidak dipublikasikan pada revisi yang sama

• Jendela konteks — GPT-6.1 Sol 1.050.000 token vs Claude Opus 5.5 1.000.000 token, dengan batas keluaran 128.000 token pada keduanya

• Biaya per tugas indeks — Claude Opus 5.5 $5.98 vs GPT-6.1 Sol $0.72

Distribusinya adalah inti ceritanya. Ketika tugasnya adalah penalaran abstrak — soal ujian yang sulit, masalah pengodean setingkat riset yang belum ada jawaban untuk disalin — Claude Opus 5.5 secara meyakinkan unggul, dan selisih 12,7 poin pada SciCode bukanlah derau. Ketika tugasnya adalah menemukan bagian yang tepat dalam masukan yang sangat panjang dan memanfaatkannya, kedua model tersebut pada dasarnya setara, dan GPT-6.1 Sol mempertahankan posisi itu dengan kapasitas 50.000 token lebih banyak. Sebagian besar pekerjaan LLM di lingkungan produksi adalah jenis kedua: penjawaban dengan augmentasi retrieval, peninjauan kontrak dan berkas, analisis log dan transkrip, peninjauan kode pada repositori besar. Pekerjaan itu diukur oleh butir ketiga, bukan dua butir pertama, dan pada butir itu, versi premium memberi 1,7 poin.

Membaca baris indeks secara jujur

Dua catatan penting seharusnya menyertai angka-angka itu, bukan diletakkan di bagian bawah halaman.

Konfigurasinya berbeda. Artificial Analysis menampilkan Claude Opus 5.5 dalam konfigurasi "Max, Default Fallback" dan GPT-6.1 Sol pada upaya maksimum. Keduanya adalah pengaturan terkuat yang dipublikasikan untuk masing-masing model, sehingga perbandingannya adil, tetapi ini adalah perbandingan dua batas atas, bukan dua default yang dirilis. Default Claude Opus 5.5 sendiri di API yang dihosting mungkin berbeda dari run yang ditampilkan dalam bagan, dan upaya default GPT-6.1 Sol adalah medium.

Baris Terminal-Bench sengaja dibiarkan kosong di satu sisi. Angka 59,6% milik Claude Opus 5.5 berasal dari revisi Artificial Analysis tempat angka itu dipublikasikan; angka setara untuk GPT-6.1 Sol tidak tersedia pada revisi yang cocok. Mengutip angka dari eksekusi berbeda pada tolok ukur yang sama akan menjadi perbandingan yang keliru, dan langkah yang jujur adalah membiarkan sel itu kosong daripada mengisinya dengan sesuatu yang kira-kira benar.

Verbosity memberi pengaruh ke arah yang sama di sini seperti saat dibandingkan dengan model-model sekelas yang lebih murah: Claude Opus 5.5 menghasilkan 260M token keluaran pada suite indeks, dibandingkan 67M milik GPT-6.1 Sol, selisih 3,9× pada tarif yang sudah dua kali lebih tinggi. Dari situlah rasio 8,3× per tugas berasal, ketika kartu tarif menunjukkan 2× pada masukan dan 2× pada keluaran. Premi itu bukan 8,3× karena modelnya berbiaya 8,3× — melainkan 8,3× karena biayanya 2× dan berpikir 3,9× lebih lama.

Alasan untuk membayarnya

Jika pekerjaan Anda menyerupai dua butir pertama, perhitungannya lugas dan menguntungkan Claude Opus 5.5. Selisih 12,7 poin pada kode ilmiah setingkat riset, atau 8,5 poin pada penalaran abstrak yang sulit, adalah perbedaan antara agen yang menutup tiket tanpa pengawasan dan agen yang memerlukan manusia pada setiap langkah ketiga. Coding agentik pada basis kode besar adalah beban kerja yang disebut kedua vendor lebih dulu, dan itulah beban kerja dengan sebaran terlebar. Membayar $5,98 alih-alih $0,72 per tugas untuk menghindari eksekusi gagal yang menghabiskan dua puluh menit waktu seorang insinyur bukanlah keputusan yang sulit.

Ada argumen kedua yang sama sekali bukan tentang skor. Claude Opus 5.5 berusia lima belas hari dan telah menghasilkan banyak evaluasi pihak ketiga, ulasan, dan pengalaman penerapan yang tidak dimiliki model yang berusia delapan hari. Untuk jalur produksi, kematangan pengetahuan di sekitarnya bernilai sesuatu yang tidak diperhitungkan oleh indeks.

Argumen yang menentang, dan angka yang menentukan

Argumen tandingannya adalah baris konteks panjang. Jika bentuk dominan dari lalu lintas Anda adalah "masukan besar, jawaban singkat" — dan bagi banyak sekali tim memang demikian — maka sumbu yang dibebankan kepada Anda bukanlah sumbu yang Anda konsumsi. Pada recall konteks panjang, kedua model itu terpaut 1,7 poin dengan rasio harga 8,3×, dan model yang lebih murah membawa jendela yang lebih besar. Itulah kasus ketika premi itu nyata, terukur, dan dibelanjakan untuk kemampuan yang tidak pernah digunakan oleh beban kerja.

Angka yang menentukan, dengan demikian, bukanlah indeksnya. Itu adalah proporsi tugas Anda yang tampak seperti SciCode, bukan seperti recall. Tim yang dapat menjawab pertanyaan itu dari log mereka sendiri sebaiknya menjawabnya dari log mereka sendiri; rangkaian benchmark adalah proksi untuk campuran pekerjaan, dan campuran itulah variabelnya.

Keduanya pada satu kunci, itulah yang membuat pertanyaan itu dapat dijawab

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, credited to Anthropic and dated 2026-09-22, showing text, image and file input with text output, a 1,000,000-token context window reading 1M tokens with a 128K maximum output, and a rate row reading $4.00 input and $20.00 output per million tokens alongside a 3.68 s median time to first token and a 36.5M seven-day traffic figure.A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window with 128,000 max output tokens and an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.

Claude Opus 5.5 tersedia di OrcaRouter dengan harga $4.00 / $20.00 tersendiri, dengan pembacaan cache sebesar $0.20. GPT-6.1 Sol tersedia di OrcaRouter dengan harga $2.00 / $10.00, naik menjadi $4.00 / $15.00 di atas 272.000 token prompt, dengan pembacaan cache sebesar $0.10. Keduanya pada harga daftar penyedia, tanpa tambahan apa pun, dengan satu kunci dan satu tagihan.

Hal itu lebih penting daripada biasanya untuk pasangan ini, karena kedua model tersebut bukanlah pengganti satu sama lain — keduanya adalah keputusan perutean. Kirim pekerjaan dokumen panjang dan bervolume tinggi ke GPT-6.1 Sol, pertahankan pekerjaan penalaran sulit dan modifikasi kode pada Claude Opus 5.5, dan keduanya berada di balik endpoint yang sama dengan kredensial yang sama. Jika suatu rute mengalami degradasi, failover otomatis memindahkan panggilan alih-alih menggagalkannya, dan karena perutean bersifat deklaratif, perutean tersebut dapat dinyatakan per kelas tugas alih-alih per aplikasi. Menguji pemisahan tersebut adalah perubahan konfigurasi, bukan migrasi.

Hal terakhir yang layak disebut adalah masa berlaku perbandingan ini. Kedua model baru berusia beberapa hari atau beberapa minggu. GPT-6.1 Sol memiliki satu konfigurasi independen yang dipublikasikan; Claude Opus 5.5 punya satu. Satu kali eksekusi per model hanyalah potret sesaat, dan mode kegagalan yang menarik bukanlah bahwa salah satu angka ini salah — melainkan bahwa konfigurasi upaya menengah, atau evaluator kedua, menggambar ulang profilnya. Sampai saat itu, pembacaan yang dapat dipertahankan adalah yang diberikan oleh komponen-komponennya: kesenjangan yang menentukan pada penalaran sulit dan kode riset, kesenjangan kecil pada pekerjaan konteks panjang, dan tagihan 8,3× yang harus dibenarkan oleh bagian beban kerja Anda yang menyerupai yang pertama.

A generated scoreboard titled 'GPT-6.1 Sol vs Claude Opus 5.5 — the scoreboard' showing two columns on six shared rows: Intelligence Index 51.8 against 57.6; cost per index task $0.72 against $5.98; Humanity's Last Exam 52.9% against 61.4%; SciCode 54.2% against 66.9%; long-context recall 83.0% against 84.7%; context window 1,050,000 against 1,000,000 tokens. A footer reads 'Index, per-task cost and evaluation figures per Artificial Analysis, Intelligence Index v4.3.2.'

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari