
GPT-6.1 Sol vs GPT-6 Sol: Apa yang Didapat dari Satu Minggu Kerja Ekstra, dan Apa yang Tidak
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 397 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 195 tok/s
- OrcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- xAISpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
Jika Anda memiliki GPT-6 Sol dalam produksi saat ini dan Anda sedang berusaha memutuskan apakah GPT-6.1 Sol layak untuk migrasi, jawabannya sepenuhnya bergantung pada mana biaya Anda yang lebih besar — dan kedua model ini dirancang sedemikian rupa sehingga jawabannya hampir tidak pernah "keduanya." GPT-6 Sol dirilis pada 22 September 2026 dengan harga $2,00 per juta token input, $0,20 untuk cache, dan $10,00 output. GPT-6.1 Sol dirilis pada 29 September 2026 dengan harga $2,00 input, $0,10 untuk cache, dan $10,00 output, dengan peningkatan 6,4 poin persentase yang dilaporkan vendor pada tugas-tugas rekayasa perangkat lunak yang kompleks dengan upaya penalaran yang lebih rendah. Harga input dan output tidak berubah. Tarif cache menjadi separuh. Satu baris yang berubah itulah keseluruhan dasar finansialnya, dan semua hal lainnya adalah argumen kemampuan yang, pada titik ini dalam masa peredaran rilis tersebut, berasal dari tepat satu sumber.
Tiga hal berubah. Salah satunya adalah tagihan.
Hilangkan bumbu pemasarannya, dan selisih antara kedua deployment ini cukup singkat untuk diingat.
• Input yang di-cache — $0,10 per juta token pada GPT-6.1 Sol vs $0,20 pada GPT-6 Sol. Diukur, bukan sekadar diklaim, dan satu-satunya perubahan yang muncul sebagai aritmetika.
• Kemampuan, menurut pihak vendor — OpenAI melaporkan keunggulan 6,4 poin pada DeepSWE v1.1 dengan upaya penalaran dan biaya yang lebih rendah, lebih dari dua kali lipat skor pada Terminal-Bench Science 0.1 pada upaya maksimum, tujuh poin pada set offline OSWorld 2.0 pada upaya maksimum, 4,8 poin pada AutomationBench pada upaya sedang, dan tingkat kesalahan faktual yang turun dari 11,4% menjadi 7,7% pada set prompt yang sengaja dirancang untuk memicu kesalahan. Semuanya belum direproduksi.
• Tangga penalaran — GPT-6.1 Sol mendukung low, medium, high, xhigh dan max, serta tidak mendukung none; GPT-6 Sol mendukung keenamnya. Inilah delta yang merusak kode, dan inilah satu-satunya yang tidak pernah dicantumkan siapa pun dalam pos peluncuran.
Semua hal lainnya identik atau nyaris sama: jendela konteks 1,050,000 token yang sama, batas keluaran 128,000 token yang sama, tarif penulisan cache $2.50 yang sama, ambang penetapan harga ulang 272K token yang sama yang di atasnya seluruh permintaan ditagih pada 2× input dan cache serta 1.5× output, persyaratan Responses-API yang sama untuk pemanggilan alat, dan ketiadaan dukungan fine-tuning yang sama. Batas pengetahuan berpindah dari 20 April ke 30 April 2026 — sepuluh hari, jenis angka yang memberi tahu Anda seberapa besar ini merupakan penyesuaian ulang, bukan pembangunan ulang.
Mengapa cache line lebih bernilai daripada yang terlihat

Pembacaan cache yang dipangkas setengah adalah hal yang aneh untuk dijadikan andalan dalam penyegaran produk, sampai Anda melihat seperti apa trafik agen sebenarnya. Loop agen mengirim ulang prefiks yang stabil — prompt sistem, skema alat, konteks yang diambil, riwayat percakapan — pada setiap giliran, dan dalam sesi panjang prefiks yang sama ditagih puluhan atau ratusan kali. Itulah trafik ketika tarif cache berhenti menjadi sekadar kesalahan pembulatan dan menjadi baris dominan pada faktur.
Hitung angkanya untuk satu sesi agen panjang. Asumsikan prefiks 120.000 token digunakan ulang selama 40 giliran, sehingga 4,8 juta token masukan yang di-cache per sesi, ditambah 150.000 token keluaran baru yang moderat. Pada GPT-6 Sol, pembacaan cache ditagih $0,96 dan outputnya $1,50 — sekitar $2,46 per sesi. Pada GPT-6.1 Sol, sesi yang sama ditagih $0,48 untuk pembacaan cache dan $1,50 yang sama untuk output: sekitar $1,98. Per sesi selisihnya 48 sen, yang bukan hal yang menentukan keputusan. Kalikan itu dengan seratus ribu sesi per bulan dan hasilnya $48.000 — yang justru menentukan.
Dua catatan penting membuat hal itu tetap jujur. Pembacaan yang di-cache hanya ditagih dengan tarif cache ketika prefiks benar-benar terkena, jadi penghematan yang terealisasi adalah tingkat hit Anda dikalikan selisihnya, bukan selisihnya itu sendiri. Dan prefiks harus berada di bawah 272.000 token agar tarif standar berlaku sama sekali: lewati batas itu dan seluruh permintaan dihargai ulang pada 2× input dan cache serta 1,5× output, yang dapat menenggelamkan penghematan 10 sen pada prefiks. Sesi berkonteks panjang adalah sesi yang paling kecil kemungkinannya membuat perhitungan cache terlihat seperti di brosur.
Kesenjangan benchmark itu nyata, dan berasal dari satu tempat
Postingan peluncuran OpenAI luar biasa spesifik tentang evaluasinya, dan itu menjadi poin positifnya, tetapi setiap angka tersebut berasal dari vendor yang menilai modelnya sendiri, dan itulah poin negatifnya. Pola di antara semuanya konsisten: perbandingan yang beredar selalu dengan GPT-6 Astra, dan perbandingan Astra selalu perbandingan biaya. Pada DeepSWE v1.1, klaimnya adalah menyamai Astra dengan biaya sekitar seperlima. Pada GDP.pdf, mendekati performa terbaik Astra dengan biaya per tugas sekitar seperlima. Pada OSWorld 2.0, hanya terpaut 2,1 poin dari Astra dengan biaya per tugas sekitar sepertujuh. Pada faktualitas, hanya terpaut 1,9 poin dari Astra dengan biaya per tugas kurang dari seperlima. Itu bukan kebetulan dalam penyusunan; itu adalah tesis produknya, dan itu adalah tesis tentang harga, bukan tentang keunggulan kemampuan.
Satu tempat di mana OpenAI menolak framing-nya sendiri patut mendapat apresiasi: pada Terminal-Bench Science 0.1, OpenAI menyatakan secara gamblang bahwa GPT-6 Astra masih memegang skor tertinggi di antara model yang diuji, yaitu 68,1%, dan sebaiknya digunakan untuk penelitian ilmiah paling sulit. Pos peluncuran yang memberi tahu Anda kapan harus membeli saudara yang lebih mahal adalah pos peluncuran yang punya sedikit disiplin.
Terhadap GPT-6 Sol secara khusus, keadaan perbandingan yang jujur adalah ini — tidak ada skor independen untuk kedua model pada konfigurasi ini. Artificial Analysis memiliki evaluasi lengkap GPT-6 Sol pada upaya penalaran maksimum: Intelligence Index 48, $1,06 per tugas indeks, 77 juta token keluaran yang dihasilkan dibandingkan median papan sebesar 88 juta, dan Coding Agent Index 57 pada $2,99 per tugas. Artificial Analysis sama sekali tidak memiliki entri GPT-6.1 Sol per 30 September; slug model tersebut menghasilkan 404 dan string itu tidak muncul di papan peringkat langsung. Jadi satu-satunya perbandingan terukur dari pihak ketiga yang tersedia hari ini adalah antara GPT-6 Sol dan model-model lab lain — bukan antara GPT-6 Sol dan penerusnya sendiri. Siapa pun yang menunjukkan kepada Anda grafik 6.1-versus-6.0 saat ini sedang menunjukkan slide OpenAI.
Migrasi ini hanyalah perubahan string, kecuali pada kasus yang tidak demikian.
Panduan migrasi OpenAI sendiri untuk keluarga GPT-6 layak dibaca sebelum Anda mengganti pengenal tersebut, karena ada dua hal di dalamnya yang merusak kode yang berfungsi. Yang pertama adalah tangga penalaran: jika ada permintaan yang mengirim reasoning_effort: "none", GPT-6.1 Sol menolaknya, dan solusi yang didokumentasikan adalah memulai dari low dan membandingkan pada tugas-tugas representatif alih-alih menganggap bahwa pengaturan terendah itu setara. Alur kerja yang menggunakan none sebagai baseline latensi kehilangan baseline tersebut. Yang kedua adalah pemanggilan alat: GPT-6.1 Sol mendukung Chat Completions tetapi tidak pemanggilan alat melaluinya — alat memerlukan Responses API. Jika stack Anda memanggil fungsi pada /v1/chat/completions, Anda tidak menukar string, Anda memindahkan endpoint. Instruksi vendor sendiri kepada pengembang yang sudah menggunakan GPT-6 Sol adalah meninjau panduan itu sebelum beralih, yang merupakan sinyal wajar bahwa ini bukan penyegaran drop-in seperti yang tersirat dari jeda satu minggu.
Parameter lainnya berperilaku sama: reasoning effort, structured outputs, streaming, prompt caching, dan kumpulan tool semuanya terbawa, dan aturan penetapan harga ulang 272K yang sama berlaku secara identik pada kedua model. Setel model ke gpt-6.1-sol, pertahankan pengaturan effort Anda di tempat yang didukung, dan hapus temperature, top_p dan top_logprobs setiap kali effort bukan none — yang terakhir berlaku untuk kedua model dan merupakan sumber umum error 400 setelah migrasi model reasoning apa pun.
Melakukan migrasi tanpa mempertaruhkan jalur produksi padanya

Migrasi yang realistis bukanlah cutover, melainkan shadow run: kirim sebagian trafik produksi ke identifier baru, biarkan yang lama tetap menjadi jalur yang menjawab, lalu bandingkan pada tugas-tugas Anda sendiri. Itu adalah persoalan routing, dan itulah satu-satunya tempat di mana platform yang Anda panggil mengubah bentuk pekerjaannya. OrcaRouter hari ini melayani GPT-6 Sol dengan harga list resmi OpenAI tanpa markup — kartu $2.00 / $0.20 / $10.00, termasuk aturan penyesuaian harga 272K — sehingga lengan baseline perbandingan itu aktif pada key yang sama dengan yang lainnya, dan lengan 6.1 dapat ditambahkan ke set route begitu ia dapat dipanggil, tanpa kontrak kedua atau SDK kedua. Sementara itu, posisi yang jujur adalah bahwa GPT-6 Sol adalah model yang tersedia untuk dipanggil, dan itu layak dikatakan secara terang-terangan alih-alih menyiratkan sebaliknya: openai/gpt-6.1-sol mengembalikan "model not found" pada endpoint katalog publik kami hari ini. Failover otomatis adalah yang membuat shadow run aman saat nanti benar-benar diterapkan — jika route baru mengalami error, permintaan selesai di route lama dan Anda mengetahuinya dari log, bukan dari pengguna Anda.
Siapa yang harus beralih sekarang: tim yang biayanya didominasi oleh input yang di-cache pada sesi agen yang panjang, dan tim yang alur kerjanya sudah menggunakan Responses API dan tidak pernah mengirim none. Bagi mereka, ini hampir merupakan peningkatan gratis — vendor melaporkan peningkatan kapabilitas, tingkat cache dipotong setengah, dan migrasinya hanya satu string. Siapa yang harus menunggu: tim dengan none di jalur yang kritis terhadap latensi, tim yang pemanggilan alatnya berjalan melalui Chat Completions, dan siapa pun yang membutuhkan angka dari luar OpenAI sebelum berkomitmen. Untuk kelompok terakhir itu, penantiannya tidak memiliki tanggal berakhir yang dipublikasikan, dan hal yang masuk akal untuk dilakukan dengan waktu tersebut adalah membangun set evaluasi yang akan dibutuhkan oleh perbandingan — karena ketika skor independen itu tiba, skor tersebut akan untuk lalu lintas orang lain.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
