
GPT-6 Sol dan GPT-6 Luna: Token yang Lebih Murah Tidak Selalu Berarti Tugas yang Lebih Murah
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Vendor merilis GPT-6 Sol dan GPT-6 Luna pada 22 September 2026, dan berita utama di mana-mana adalah harganya: Sol $2,00 per juta token input dan $10,00 output, Luna $0,10 dan $0,50, keduanya kira-kira setengah dari yang GPT-5.6 Sol dan GPT-5.6 Luna kenakan di bawah tarif promosi saat ini, dan keduanya berada jauh di bawah flagship GPT-6 Astra pada $10,00/$50,00. Pengumuman vendor sendiri dibuka dengan "kami juga telah membuat caching dan inferensi lebih efisien." Masalah dengan membacanya sebagai cerita diskon adalah bahwa satuan yang benar-benar masuk ke invoice Anda bukanlah token. Itu adalah tugas. Dan pengukuran independen pertama, yang diterbitkan pada hari yang sama, menunjukkan dua model baru bergerak ke arah yang berlawanan tepat pada satuan itu — dengan GPT-6 Luna, yang lebih murah di antara keduanya dengan faktor dua puluh pada input, tampil lebih buruk dibandingkan yang lain terhadap pendahulunya sendiri. Salah satu dari model ini adalah peningkatan langsung dan yang lainnya adalah trade-off yang nyata, dan pengumuman vendor tidak membedakan keduanya.
Sebelum angkanya, aturan sumber untuk tulisan ini, karena dua tumpukan bukti di sini layak diberi bobot yang sangat berbeda. Harga, jendela konteks, tarif cache, dan cutoff pengetahuan berasal dari dokumentasi API serta tabel harga OpenAI sendiri, dibaca pada 23 September 2026, dengan baris service-tier dan cache-write dikonfirmasi terhadap pelacak biaya pihak ketiga alih-alih hanya diambil dari pengumuman. Tabel benchmark OpenAI — AutomationBench, DeepSWE 1.1, OSWorld 2.0, Agents' Last Exam, dan evaluasi faktualitas internal — dilaporkan vendor dan tidak direproduksi, dan setiap angka yang diambil darinya di bawah ini dilabeli demikian. Angka independen berasal dari Artificial Analysis, yang menjalankan kedua model pada Intelligence Index dan Coding Agent Index miliknya pada hari peluncuran; itulah yang perlu dipercaya untuk mengambil keputusan. Jika keduanya tidak cocok, artikel menyebutkannya alih-alih merata-ratakannya.
Peluncuran, dalam satu paragraf
Sol dan Luna adalah anggota tingkat menengah dan bawah dari keluarga GPT-6, dilatih dengan metode di balik GPT-6 Astra dan diposisikan sebagai cara yang lebih cepat dan lebih murah untuk mencapai sebagian besar kemampuannya. Kerangka OpenAI adalah biaya per tugas, bukan kemampuan mentah: OpenAI mengatakan GPT-6 Sol membuat sekitar setengah jumlah kesalahan dibandingkan GPT-5.6 Sol pada evaluasi faktualitas internalnya, dan bahwa GPT-6 Luna pada upaya penalaran yang lebih tinggi menyamai faktualitas GPT-5.6 Sol dengan biaya tugas sekitar seperseratus. Keduanya menerima input teks dan gambar serta menghasilkan teks, keduanya memiliki jendela konteks 1.050.000 token dengan batas output 128K — Artificial Analysis mencantumkan 872k untuk model yang sama, jadi anggap ujung atas jendela itu sebagai yang dinyatakan vendor — dan keduanya mengekspos upaya penalaran dari none hingga max, level yang tidak ditawarkan GPT-6 Astra, karena Astra tidak memiliki none. ID modelnya adalah gpt-6-sol dan gpt-6-luna. Ketersediaan tersedia melalui API, melalui ChatGPT Work dan Codex untuk akun Plus, Pro, Business, Enterprise, dan Edu, serta melalui Amazon Bedrock, yang mengumumkan ketersediaan umum untuk keduanya pada hari yang sama. Pengguna Free dan Go mendapatkan Luna di aplikasi desktop; belum ada model yang tersedia di mode Chat biasa.
Apa kata empat angka independen itu, dan mengapa mereka tidak setuju
Mulai dari GPT-6 Sol, karena ceritanya sederhana. Artificial Analysis memberinya skor 48 pada Intelligence Index, peringkat ke-18 dari 212 model yang diukur, dengan $1,06 per tugas indeks dibandingkan $1,99 untuk GPT-5.6 Sol — sekitar setengah biaya untuk skor indeks yang setara, dan peningkatan biaya per tugas yang bertahan, bukan menguap. Indeks Agen Coding-nya naik menjadi 57 dari 55, dengan Terminal-Bench 4.0 bergerak dari 37% ke 43% dan SWE-Atlas-QnA dari 54% ke 58%, pada $2,99 per tugas di frontier Pareto. Tingkat halusinasinya turun dari 92% menjadi 60%, dan perilaku abstensinya berubah bentuk sepenuhnya: kini ia menjawab 83% pertanyaan yang pada generasi sebelumnya dijawab 99%, dan sebagai gantinya memperoleh seperempat lebih sedikit jawaban salah, dengan akurasi yang menurun dari 59% ke 54%. Itu adalah model yang telah diajari untuk diam ketika tidak tahu, dan AA-Omniscience Index yang bergerak dari 22 ke 27 adalah fakta yang sama yang dinyatakan sebagai skor.
Sekarang GPT-6 Luna, dan ceritanya berubah. Artificial Analysis memberinya skor 37 pada Intelligence Index — angka yang identik dengan yang diperoleh GPT-5.6 Luna. Biaya per tugas indeksnya turun dari $0.18 menjadi $0.07, sekitar 60% lebih murah, dan penghematan itu nyata. Tetapi Coding Agent Index-nya turun, dari 43 ke 41, dengan SWE-Atlas-QnA turun dari 49% ke 44% dan DeepSWE 1.1 turun dari 66% ke 64%. Tingkat halusinasinya membaik dari 93% menjadi 77%, dan perilaku abstensinya nyaris tidak berubah — akurasi 44% berbanding 43%, AA-Omniscience dari −10 ke 1. Dibaca bersama: kecerdasan terukur yang sama, dengan biaya tugas sekitar 40%, dengan agen coding yang lebih buruk dan kualitas jawaban yang pada dasarnya tidak berubah.
Itu bukan kontradiksi, dan alasannya penting. Token yang lebih murah memberi Anda lebih sedikit hanya jika model menghabiskan lebih banyak token untuk menyelesaikan pekerjaan yang sama — dan data independen menunjukkan model-model ini menghabiskan lebih banyak, bukan lebih sedikit. Output per tugas indeks naik dari 29k ke 31k token untuk Sol dan dari 41k ke 51k untuk Luna. Penghematan 60% GPT-6 Luna sepenuhnya berasal dari pemotongan harga, bukan dari berjalan lebih hemat. Pergeseran token per tugas cukup kecil sehingga aritmetikanya masih menguntungkan Anda di sini; namun tidak cukup kecil untuk diabaikan sebagai kategori, karena itulah mekanisme yang membuat pemotongan harga di masa depan dapat dinetralkan oleh model yang lebih banyak bicara. Kerangka berpikir OpenAI sendiri telah beralih ke biaya per tugas karena alasan yang sama.
Dua regresi berada di luar dua indeks utama dan layak disebutkan, karena keduanya tidak muncul dalam pengumuman OpenAI. Dalam GDPval-AA v2.1, yang mengukur hasil kerja berbasis pengetahuan, GPT-6 Sol kehilangan sekitar 100 Elo dibandingkan pendahulunya dan GPT-6 Luna sekitar 75. GPT-6 Luna juga kehilangan sekitar 45 Elo dalam AA-Briefcase v1.1, sementara Sol tetap stabil — Artificial Analysis mengaitkan kesenjangan tersebut dengan penyajian yang lebih lemah dan item rubrik yang hilang. Jika penggunaan Anda atas tier murah adalah untuk peringkasan massal, ekstraksi, dan klasifikasi, semua itu tidak memengaruhi Anda. Jika untuk menyusun draf sesuatu yang akan disetujui seseorang, itu berdampak pada Anda.

Perubahan caching adalah berita API yang sesungguhnya
Terkubur di bawah kartu tarif ada perubahan yang lebih penting bagi tagihan produksi daripada pemotongan utama, dan itulah bagian dari pengumuman yang disinggung oleh posting OpenAI sendiri dengan satu klausa. Tiga hal berubah, dan yang ketiga adalah yang perlu dibaca dua kali.
Yang pertama adalah diskon itu sendiri: pembacaan input yang di-cache ditagih sebesar 10% dari tarif input, diskon 90%, yang merupakan ketentuan yang sama yang sudah berlaku di keluarga ini, bukan ketentuan baru. Input yang di-cache Sol adalah $0,20 per juta dan Luna $0,01; penulisan cache dikenakan premi 1,25x, masing-masing $2,50 dan $0,125, dengan satu masa aktif 30 menit.
Yang kedua adalah kendali. Caching eksplisit melalui prompt_cache_options dan prompt_cache_breakpoint — parameter yang memungkinkan Anda menyatakan di mana awalan prompt yang dapat digunakan ulang berakhir, alih-alih berharap penyedia menebaknya — tersedia pada kedua model. Ini bukan permukaan API yang baru; yang baru adalah bahwa ini layak digunakan, karena tingkat hit bawaan meningkat.
Yang ketiga adalah yang mengubah arsitektur. Mengubah upaya penalaran atau menyalakan dan mematikan alat tidak lagi membatalkan prefiks yang di-cache. Sebelum ini, loop agen yang menaikkan upaya untuk langkah sulit dan menurunkannya kembali untuk langkah mudah harus membayar biaya memproses ulang seluruh konteksnya pada setiap perubahan setelan, demikian pula agen yang menambahkan atau menghapus alat di tengah percakapan. Pajak itu sekarang hilang pada kedua model ini. OpenAI mengutip GitHub, yang melaporkan bahwa perubahan tersebut memangkas porsi token prompt yang memerlukan pemrosesan baru lebih dari setengah di miliaran permintaan. Anggap itu sebagai angka dari vendor — angka itu kredibel dan tidak diaudit secara independen.
Lakukan perhitungan pada loop agen yang panjang, dan peringkat kedua pengumuman itu pun berbalik. Loop yang membawa prompt sistem dan skema alat 30.000 token selama 200 giliran memindahkan 6 juta token konteks. Tanpa caching, pada GPT-6 Sol, itu berarti $12,00 untuk input. Dengan prefix di-cache sebesar $0,20 per juta, hasilnya $1,20 ditambah biaya penulisan satu kali — satu orde besaran, hanya dari perubahan parameter, bahkan sebelum pemotongan tarif diterapkan sama sekali. Pemotongan tarif itulah yang dijual oleh pengumuman tersebut. Perilaku cache-lah yang sebenarnya menggerakkan angka itu, dan itulah alasan tarif yang ditonjolkan sebesar $2,00 berperilaku seperti sesuatu yang jauh lebih murah pada beban kerja yang dituju OpenAI saat memasarkan model-model ini.
Kartu tarif, termasuk bagian-bagian yang dilewatkan oleh pengumuman
Tarif utama bukanlah keseluruhan daftar tarif, dan tiga tingkatan mengubah keputusan untuk beban kerja tertentu.
• Base — GPT-6 Sol $2.00 input / $10.00 output; GPT-6 Luna $0.10 input / $0.50 output, per juta token, untuk prompt hingga 272K token input.
• Konteks panjang — di atas 272K token input, seluruh permintaan ditagih sebesar 2x input dan 1,5x output: $4,00/$15,00 untuk Sol dan $0,20/$0,75 untuk Luna. Ini adalah tebing, bukan tarif marginal. Jika prompt Anda mencapai 300K token, Anda membayar dua kali lipat untuk seluruh permintaan, bukan untuk 28K yang melewati batas, dan memecah dokumen menjadi dua panggilan di bawah ambang batas sering kali lebih murah daripada mengirimnya sekali di atas ambang batas.
• Tingkat layanan — Flex memangkas tagihan hingga setengah ($1.00/$5.00 untuk Sol, $0.05/$0.25 untuk Luna) dengan imbalan waktu proses yang lebih lambat; Priority menggandakannya. Keduanya dipilih melalui service_tier parameter. Flex adalah tempat yang seharusnya digunakan untuk pekerjaan bergaya batch, dan hampir tidak pernah demikian.
• Input cache — $0,20 per juta di Sol dan $0,01 di Luna, diskon 90%, dengan TTL 30 menit dan premi penulisan cache 1,25x.
• Konteks dan output — jendela 1.050.000 token, output maksimum 128K, masukan teks dan gambar, output teks, upaya penalaran tidak ada hingga maks dengan sedang sebagai default.
• Batas pengetahuan — 20 April 2026 untuk GPT-6 Sol dan 18 Mei 2026 untuk GPT-6 Luna, selisih satu bulan di dalam keluarga yang sama dan perlu diketahui sebelum Anda menganggap kedua model itu memiliki pandangan dunia yang sama.
Apa yang dikatakan tabel benchmark OpenAI, dan apa yang tidak
Perbandingan yang diterbitkan OpenAI semuanya berupa biaya per tugas, semuanya dibandingkan dengan Anthropic, dan semuanya dijalankan oleh vendor. Pada AutomationBench 1.0.6, evaluasi agentik dengan 47 alat, perusahaan melaporkan GPT-6 Sol pada upaya xhigh mencetak 33,2% dengan biaya $0,27 per tugas, dibandingkan Claude Opus 5 pada 26,9% dan sekitar 11 kali biaya per tugas. Pada DeepSWE 1.1, ia melaporkan Sol pada upaya maksimum mencetak 68,8% melawan Claude Fable 5 pada 69,9% — kalah dalam skor dengan biaya per tugas sekitar 80% lebih rendah — dan Luna pada 66,6%. Pada OSWorld 2.0, Sol mencetak 60,5% pada xhigh melawan 60,3% milik Opus 5, lagi-lagi dengan biaya per tugas sekitar 80% lebih rendah. Pada Agents' Last Exam, Sol mencapai 56,4%, yang menurut OpenAI mengalahkan hasil terbaik Opus 5 dengan biaya per tugas 60% lebih rendah.
Setiap angka itu dilaporkan vendor dan tidak direproduksi, dan dua peringatan perlu terus diingat alih-alih diarsipkan. Pertama, OpenAI melakukan benchmark terhadap Claude Opus 5, bukan Claude Opus 5.5 yang dirilis beberapa jam sebelum pengumuman, jadi belum ada perbandingan dengan harness yang sama yang menetapkan model mana yang sebenarnya memberikan biaya lebih rendah per keberhasilan tugas. Kedua, biaya per tugas bukanlah biaya per tugas yang benar: model yang menjawab 83% dari waktu dan abstain pada sisanya akan terlihat murah per tugas pada benchmark yang menghitung abstensi sebagai tugas. Data abstensi independen di atas itulah yang memungkinkan Anda menghitung biaya itu secara jujur — GPT-6 Sol yang menjawab 83% pertanyaan ketika model lama menjawab 99% adalah pertukaran yang disengaja, dan apakah itu pertukaran yang baik sepenuhnya bergantung pada berapa biaya jawaban yang salah bagi Anda.
OpenAI melaporkan bahwa GPT-6 Luna pada upaya yang lebih tinggi menyamai faktualitas GPT-5.6 Sol dengan biaya tugas sekitar seperseratusnya. Itu adalah perbandingan faktualitas, bukan perbandingan kemampuan, dan Coding Agent Index yang independen menempatkan GPT-6 Luna dua poin di bawah GPT-5.6 Luna, apalagi GPT-5.6 Sol.

Apa yang sebenarnya harus dilakukan dengan ini
GPT-6 Sol adalah pilihan yang lugas. Setengah biaya tugas pada skor indeks level, agen coding yang lebih baik, penurunan besar dalam halusinasi, dan perubahan nyata dalam perilaku abstensi berujung pada peningkatan yang dapat Anda lakukan sesuai jadwal, bukan sebagai pertaruhan. Jika Anda memakai GPT-5.6 Sol, ini adalah migrasi, dan satu-satunya pertanyaan nyata adalah prompt mana milik Anda yang bergantung pada kesediaan model lama untuk menjawab segalanya.
GPT-6 Luna adalah pilihan yang perlu diuji sebelum Anda beralih. Ia bukan GPT-5.6 Luna yang secara mutlak lebih baik; ia memiliki bentuk yang berbeda — lebih murah per tugas, lebih aman dalam hal apa yang akan diklaimnya, dan terukur lebih buruk dalam coding agentik. Untuk klasifikasi, ekstraksi, perutean, dan peringkasan dalam volume besar, pertukaran ini nyaris seperti uang gratis. Untuk apa pun yang memasok coding agent, atau menghasilkan dokumen yang disetujui seseorang, regresi Coding Agent dua poin dan penurunan GDPval adalah alasan untuk tetap mempertahankan GPT-5.6 Luna dalam alur sampai Anda menjalankan tugas Anda sendiri melalui keduanya.
Itu juga menjadi argumen untuk tidak mengunci salah satunya secara permanen. Kedua model saat ini hanya tersedia di OpenAI, dan beban kerja yang dilayani tier ini — routing, ekstraksi, klasifikasi murah — justru merupakan beban kerja yang paling tepat untuk itu: penyedia kedua di balik endpoint yang sama mengubah regresi model menjadi bukan masalah. OrcaRouter meneruskan harga daftar penyedia dengan markup 0%, sehingga perubahan tarif vendor sampai ke sisi kami pada hari yang sama saat perubahan itu sampai di sisi vendor, dan DSL routing memungkinkan Anda menempatkan GPT-6 Luna di balik model yang lebih murah untuk porsi lalu lintas yang mudah, sementara porsi yang lebih sulit diarahkan ke GPT-6 Sol — dengan failover otomatis jika salah satu jalur mengalami penurunan. Anda tidak perlu memilih pemenang pada hari peluncuran untuk mendapatkan manfaat dari peluncuran ini.
Klarifikasi jujurnya: GPT-6 Sol dan GPT-6 Luna tidak dapat dirutekan melalui OrcaRouter per 23 September 2026. Kami belum menghosting keduanya, dan tidak ada apa pun di atas yang boleh ditafsirkan sebagai klaim bahwa kami menghostingnya. Yang ada di pihak kami saat ini adalah kumpulan perbandingannya — GPT-5.6 Sol pada $4.00/$20.00, GPT-5.6 Luna pada $0.20/$1.20, dan GPT-6 Astra pada $10.00/$50.00 — yang persis itulah yang Anda butuhkan untuk memperkirakan biaya migrasi sebelum Anda memutuskan untuk melakukannya.

Tontonan Berikutnya
Tiga hal akan menentukan apa sebenarnya peluncuran ini. Yang pertama adalah apakah tarif $0.20/$1.20 GPT-5.6 Luna bertahan sepanjang kuartal, karena harga permanen dari satu vendor secara historis merupakan langkah pembuka, bukan akhirnya — dan peluncuran Claude Opus 5.5 pada hari yang sama menunjukkan bahwa tekanan yang menghasilkan pemotongan ini belum hilang. Yang kedua adalah apakah pergeseran abstensi bertahan di lapangan: GPT-6 Sol yang menolak menjawab satu dari enam pertanyaan adalah jenis perubahan yang terbaca sebagai peningkatan di laboratorium dan sebagai produk rusak di pipeline yang mengasumsikan adanya jawaban. Yang ketiga adalah apakah perilaku cache itu nyata pada trafik Anda, yang dapat diukur minggu ini dan hanya bisa dijawab dengan mengukur — diskonnya cukup besar sehingga satu jam yang dihabiskan untuk melakukan instrumentasi tingkat cache hit pada prompt terpanjang Anda lebih berharga daripada tabel benchmark lain.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
