
GPT-6.1 Sol vs GPT-5.6 Sol: Empat Setengah Poin Indeks, Separuh Biaya, Dua Regresi
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
OpenAI merilis GPT-6.1 Sol pada 29 September 2026, sebelas minggu setelah GPT-5.6 Sol, yang dirilis pada 9 Juli 2026 sebagai andalan generasi sebelumnya. Keduanya masih dijual, keduanya masih dapat dipanggil, dan selisih di antara keduanya pada papan netral adalah 4,8 poin — 51,8 berbanding 47,0 pada Intelligence Index dari Artificial Analysis, keduanya diukur pada upaya penalaran maksimum di rangkaian sepuluh evaluasi yang sama. Perbedaan harganya jauh lebih besar daripada perbedaan skornya: $0,72 per tugas indeks yang diselesaikan dibandingkan $1,99, dan $2,00/$10,00 per juta token dibandingkan $4,00/$20,00. Itu versi singkatnya. Versi panjangnya adalah bahwa peningkatan ini tidak seragam, dan dua dari evaluasi tersebut mengalami kemunduran.
Apa itu masing-masing model, dan apa yang menggantikan apa
GPT-5.6 Sol adalah model teratas di lini 5.6 — model tertutup yang hanya tersedia melalui API dengan jendela konteks 1.050.000 token, batas keluaran 128.000 token, masukan teks, gambar, dan berkas, serta tangga penalaran yang membentang dari none hingga max. Model ini digambarkan oleh OpenAI sebagai tingkatan yang dibuat untuk pekerjaan tersulit: alur kerja agen berjangkauan panjang, rekayasa perangkat lunak multi-berkas, penalaran mendalam, dan harganya pun disesuaikan, yaitu $4,00 dan $20,00 per juta token dengan masukan yang di-cache seharga $0,40 dan penulisan cache seharga $5,00. Di atas 272.000 token masukan, harganya berubah menjadi $8,00 dan $30,00, dan model ini juga memiliki tingkatan Batch seharga $2,50 dan $15,00.
GPT-6.1 Sol adalah kelas menengah dari generasi setelahnya: di bawah GPT-6 Astra, di atas GPT-6 Luna, dan kini menjadi model yang OpenAI arahkan bagi pengembang yang sensitif terhadap biaya. Model ini mempertahankan jendela 1.050.000 token dan batas keluaran 128.000 token, memperpanjang batas pengetahuan dari 20 April menjadi 30 April 2026, dan memangkas tangga effort dari enam tingkat menjadi lima — low, medium (default), high, xhigh, max. Nilai none yang diterima GPT-5.6 Sol kini mengembalikan error, dan panduan migrasi OpenAI secara eksplisit menyatakan bahwa penggantinya adalah low, bukan peningkatan diam-diam.
Ini layak direnungkan sejenak karena inilah satu-satunya perubahan dalam rilis ini yang menghabiskan biaya, bukan menghematnya. Pipeline yang mengandalkan none untuk mendapatkan panggilan yang murah, cepat, dan tanpa penalaran tidak lagi memiliki konfigurasi tersebut, pada kedua keluarga model. Tingkat termurah pada GPT-6.1 Sol adalah tingkat penalaran, dan token penalaran ditagih sebagai token keluaran, terlepas dari apakah Anda dapat melihatnya atau tidak.
Tangga itu, anak tangga demi anak tangga
Dewan independen menerbitkan skor dan biaya operasional untuk setiap pengaturan upaya pada kedua model, yang mengubah perbandingan langsung menjadi sesuatu yang lebih berguna daripada sekadar perbandingan tunggal. Disandingkan pada pengaturan yang setara:
• Tangga upaya, GPT-6.1 Sol — maks 51,8 pada $0,72 per tugas indeks; xhigh 51,0 pada $0,39; tinggi 50,2 pada $0,32; sedang (default) 47,8 pada $0,21 • Kecepatan output — 59,7 token per detik untuk GPT-6.1 Sol vs 87,8 untuk GPT-5.6 Sol
• Waktu sampai chunk pertama — 332 detik untuk GPT-6.1 Sol vs angka yang lebih cepat untuk GPT-5.6 Sol, dibandingkan median papan peringkat sekitar 4 detik
• Token output pada proses indeks — 67,2 juta untuk GPT-6.1 Sol vs 90,0 juta untuk GPT-5.6 Sol
• Harga input / output — $2,00 / $10,00 vs $4,00 / $20,00
• Input cache — $0,10 vs $0,40; penulisan cache $2,50 vs $5,00
• Tarif batch — tidak dipublikasikan untuk GPT-6.1 Sol vs $2,50 / $15,00 untuk GPT-5.6 Sol
• Langkah konteks panjang — di atas 272.000 token input, GPT-6.1 Sol menetapkan harga ulang menjadi $4,00 / $15,00 untuk seluruh permintaan vs $8,00 / $30,00 milik GPT-5.6 Sol
• Batas bawah upaya — rendah vs tidak ada
Ada dua hal yang muncul dari daftar itu. Yang pertama adalah pemotongan harga bersifat struktural, bukan promosional: tarif standar GPT-6.1 Sol sebesar $2,00 dan $10,00 berada di bawah tarif batch GPT-5.6 Sol sebesar $2,50 dan $15,00, sehingga bahkan tingkat diskon model lama lebih mahal daripada harga daftar model baru. Yang kedua adalah peningkatan ini tidak linear dalam hal latensi. GPT-6.1 Sol menghasilkan output sekitar sepertiga lebih lambat dan membutuhkan 332 detik untuk chunk pertama pada tes prompt panjang papan peringkat — orde besaran yang sama dengan 107 detik GPT-6 Sol dan sekitar delapan puluh kali median papan peringkat. Jika Anda membangun produk interaktif di atas GPT-5.6 Sol, ini adalah regresi fungsional yang tidak bergantung pada tolok ukur apa pun, dan perbaikannya bersifat arsitektural, bukan parameter.

Dua evaluasi bergerak ke arah yang salah
Kenaikan kompositnya adalah 4,8 poin. Komponen-komponennya tidak seluruhnya positif, dan skor per evaluasi dewan menunjukkan hal itu:
• SciCode — GPT-6.1 Sol 0.542 vs GPT-5.6 Sol 0.571. Regresi 2.9 poin pada pengodean ilmiah.
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575.1 vs GPT-5.6 Sol Elo 1611.3. Regresi Elo 36 poin pada pekerjaan berbasis pengetahuan yang bernilai secara ekonomi.
• Humanity's Last Exam — GPT-6.1 Sol 0.529 vs GPT-5.6 Sol 0.495. Peningkatan 3.4 poin.
• Terminal-Bench 4.0 — GPT-6.1 Sol 0.561 vs GPT-5.6 Sol 0.399. Peningkatan 16 poin, pergerakan tunggal terbesar dalam pasangan ini.
• AA-Omniscience — GPT-6.1 Sol 41.5 vs GPT-5.6 Sol 22.0, yang berkaitan dengan keandalan pengetahuan dan halusinasi, bukan daya ingat mentah.
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — lima sisanya, yang melengkapi komposit dan menjadi tempat diperolehnya sisa kenaikan 4.8 poin.
Model yang secara signifikan lebih baik pada pekerjaan terminal, jauh lebih baik pada keandalan faktual, dan secara terukur lebih buruk pada pemrograman ilmiah serta Elo pekerjaan profesional bukanlah model yang lebih baik secara mutlak. Ia adalah titik yang berbeda di garis depan, dan ia ditempatkan di sana dengan sengaja: kerangka peluncuran OpenAI sendiri untuk GPT-6.1 Sol adalah biaya per tugas yang diselesaikan pada kualitas yang mendekati kelas flagship, bukan skor maksimum. Jika beban kerja Anda berbentuk SciCode atau berbentuk GDPval, angka komposit bukanlah angka yang berlaku bagi Anda, dan regresinya itulah yang berlaku.
GPT-5.6 Sol masih memiliki hasil konteks panjang yang telah dipublikasikan
Satu-satunya tempat model lama memiliki angka yang tidak dimiliki model baru adalah akurasi pengambilan pada pita konteks tempat kartu tarif GPT-6.1 Sol berubah. GPT-5.6 Sol memiliki hasil delapan-jarum MRCR v2 yang dipublikasikan sebesar 91,5% dalam rentang 256.000 hingga 512.000 token. GPT-6.1 Sol tidak memiliki padanan yang dipublikasikan, dan di atas 272.000 token input, seluruh permintaannya dihargai ulang sebesar 2× input dan cache serta 1,5× output.
Gabungkan kedua fakta itu, dan segmen di mana sisi ekonomi model baru paling lemah justru adalah segmen di mana model lama memiliki satu-satunya kekuatan yang terdokumentasi. Penghematan tidak hilang — $4,00 dan $15,00 pada tier yang dihargai ulang dibandingkan dengan $8,00 dan $30,00 pada tier konteks panjang milik GPT-5.6 Sol sendiri tetap merupakan pengurangan separuh — tetapi narasi setengah harga adalah narasi beban kerja umum, dan pipeline pengambilan konteks panjang bukanlah itu. Jika itu beban kerja Anda, GPT-5.6 Sol pada $4,00 dan $20,00 dengan 91,5% yang dipublikasikan adalah pilihan yang dapat dipertahankan untuk tetap digunakan.
Hasil terbit lainnya dari GPT-5.6 Sol tetap utuh dan menjadi alasan sebagian tim tidak akan beralih: BrowseComp 90,4 untuk agen riset web, Terminal-Bench 2.1 pada 88,8 dan 88,0, SWE-Bench Pro 64,6, Agents' Last Exam 53,6, OSWorld 2.0 pada 62,6. Itu dilaporkan oleh OpenAI, pada harness OpenAI, dan dilaporkan pada Juli. Yang berubah sejak saat itu adalah papan skor kini menilai kedua model pada satu suite dengan satu set pengaturan, dan model yang lebih lama kalah pada skor komposit dan pada biaya.
Migrasi itu sendiri adalah perubahan string, dengan satu pengecualian.
Vendor yang sama, permukaan API yang sama, berdampingan dalam peringkat, jendela dan batas output yang sama — jadi untuk sebagian besar stack, ini adalah pengenal model dan harga yang turun setengah. Pengecualiannya spesifik dan layak disebutkan sebelum Anda menekan tombol beralih.
Jika kode Anda menetapkan reasoning.effort ke none atau minimal, ia akan gagal alih-alih menurunkan mutu, dan low adalah pengganti yang terdokumentasi. Jika trafik Anda melampaui 272.000 token masukan, periksa tingkatan yang harganya sudah disesuaikan sebelum Anda memperkirakan penghematannya. Jika produk Anda bergantung pada waktu ke token pertama, ukurlah sebelum merilis, karena angka 332 detik dari board itu bukan kesalahan pembulatan. Dan jika evaluasi Anda memiliki irisan berbentuk SciCode atau GDPval, jalankan irisan itu pada kedua model alih-alih memercayai angka kompositnya.
Kedua model tersedia di OrcaRouter dengan harga daftar milik OpenAI sendiri — GPT-6.1 Sol pada $2.00 dan $10.00 dengan input yang di-cache pada $0.10, GPT-5.6 Sol pada $4.00 dan $20.00 dengan input yang di-cache pada $0.40 — di bawah model pass-through yang menempatkan perubahan harga OpenAI di sisi kami pada hari yang sama saat diberlakukan, bukan setelah reseller menegosiasikan ulang. Karena daftar harga diteruskan tanpa perubahan, bukan dengan markup, aritmetika dalam artikel ini adalah aritmetika yang Anda dapatkan: model $0.72 per tugas yang sama, pemotongan separuh yang sama, tanpa premi platform yang ditambahkan di sisi mana pun.

Kegunaan praktis dari menempatkan keduanya di belakang satu endpoint adalah perbandingannya tetap aktif. Kirim lalu lintas baru ke GPT-6.1 Sol, biarkan GPT-5.6 Sol hanya berjarak satu perubahan konfigurasi sebagai fallback dan sebagai jalur konteks panjang, dan biarkan failover otomatis menutupi jendela waktu ketika ketersediaan serta pengaktifan Enterprise dari produk unggulan berusia dua bulan itu masih dalam proses stabil. Migrasi yang memangkas tagihan hingga setengah dan memundurkan dua sub-benchmark bukanlah keputusan yang dibuat sekali lalu dilupakan; melainkan keputusan yang dibuat per rute, dan lapisan routing-lah yang membuatnya murah.

Di mana masing-masing berada
• Pekerjaan agentik dan terminal umum — GPT-6.1 Sol. Enam belas poin pada Terminal-Bench 4.0 dan setengah harga bukanlah pilihan yang hampir imbang.
• Keandalan faktual, produk jawaban hasil pengambilan — GPT-6.1 Sol, pada selisih AA-Omniscience hampir dua puluh poin.
• Pengodean ilmiah — periksa evaluasi Anda sendiri dulu. Papan skor menunjukkan regresi 2,9 poin, dan komposit tidak akan memunculkannya.
• Pekerjaan pengetahuan yang bernilai ekonomis — kewaspadaan yang sama. Regresi Elo GDPval-AA adalah 36 poin.
• Pengambilan konteks panjang di atas 272.000 token — GPT-5.6 Sol, sampai GPT-6.1 Sol memiliki angka yang dipublikasikan di rentang tersebut.
• Permukaan interaktif yang sensitif terhadap latensi — ukur sebelum bermigrasi. Output lebih cepat, token pertama jauh lebih lambat.
• Panggilan non-penalaran termurah — bukan keduanya. Konfigurasi itu tidak lagi ada pada keluarga ini.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
