
GPT-5.6 Luna Max: Bagaimana Pengembang Sebenarnya Menggunakannya di Codex — dan di Mana Ia Gagal
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 221 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Pada 1 Agustus, sebuah file konfigurasi empat baris mulai beredar di X. File itu membuat agen Codex bernama luna_worker, mengatur modelnya menjadi gpt-5.6-luna, mengatur upaya penalarannya menjadi max, dan menyerahkan separuh pekerjaan membosankan Anda kepadanya sementara GPT-5.6 Sol memegang rencana. Dalam hitungan hari, resep yang sama telah diunggah ulang dalam bahasa Inggris, Mandarin, Jepang, Korea, Spanyol, dan Arab, dan sebuah plugin yang dibangun dengan ide yang sama telah melewati 1.300 bintang GitHub dalam empat hari. Ini juga, kurang lebih pada hari ia menjadi viral, cara yang salah untuk merangkainya: penulis plugin itu menarik GPT-5.6 Luna dari proyeknya sendiri dalam 48 jam, secara publik, karena seorang rekannya mengatakan kepadanya bahwa ia tidak berfungsi sebagai subagen Codex — lalu memasangnya kembali dua hari kemudian, dengan cara yang sepenuhnya berbeda.
Keseluruhan alur itu terjadi dalam satu minggu, dan itu adalah hal paling berguna yang pernah dipublikasikan siapa pun tentang model ini. Hal itu memberi tahu Anda bahwa pola pekerja murah itu nyata, bahwa cara yang tampak jelas untuk merangkainya adalah cara yang salah, dan bahwa perbedaan antara keduanya adalah sebagian besar nilainya. Segala sesuatu dalam artikel ini yang menyangkut teknik berasal dari para praktisi yang memposting hasil mereka sendiri antara 30 Juli dan 5 Agustus 2026 — bukan dari dokumentasi perusahaan, yang menggambarkan GPT-5.6 Luna sebagai model untuk "beban kerja dengan volume tinggi yang sensitif terhadap biaya" dan tidak mengatakan apa pun tentang semua ini. Jika suatu angka diukur oleh pihak ketiga yang independen, kami menyatakannya; jika itu adalah log sesi dari seorang pengembang, kami juga menyatakannya, termasuk ketika keduanya saling bertentangan. Mereka memang sering bertentangan.
Apa itu "Luna Max", dan mengapa kebanyakan orang tidak pernah melihatnya.
Tidak ada model yang disebut Luna Max. Ada dua dial, dan Luna Max adalah salah satu kombinasi keduanya: tingkat termurah dari keluarga GPT-5.6, dijalankan pada pengaturan penalaran terdalam. Dial tingkat memilih antara GPT-5.6 Sol, GPT-5.6 Terra, dan GPT-5.6 Luna. Dial usaha memiliki enam posisi — none, low, medium, high, xhigh, dan max — dan dial ini mengatur seberapa banyak pemikiran yang dilakukan model sebelum menjawab.
Hampir tidak ada orang yang menggabungkan tier murah dengan pengaturan mendalam, karena alasan yang sepele: max disembunyikan secara default. Di aplikasi desktop ChatGPT/Codex, opsi ini berada di Settings → Configuration → Available reasoning efforts, tempat daftar tersebut hadir dengan opsi teratas yang tidak dicentang. Enam pengembang terpisah memposting perbaikan tiga-klik yang sama di minggu pertama bulan Agustus, yang merupakan indikator bagus tentang berapa banyak orang yang menjalankan Luna pada kedalaman default-nya dan menilai model berdasarkan hal tersebut. Di sisi API, tidak ada toggle yang perlu dicari: Anda memasukkan id model gpt-5.6-luna dan mengatur reasoning effort ke max di dalam body permintaan, dan itulah seluruh perubahannya.
Satu konsekuensi yang perlu diinternalisasi sebelum Anda membaca benchmark apa pun: ketika Artificial Analysis menerbitkan skor kecerdasan untuk model ini, halaman tersebut diberi judul GPT-5.6 Luna (max). Angka independen yang semua orang kutip untuk Luna adalah konfigurasi upaya maksimal. Jika Anda selama ini menggunakan pengaturan default dan bertanya-tanya mengapa pengalaman Anda tidak sesuai dengan papan peringkat, itulah alasannya.
Kenop yang tidak dijelaskan siapa pun: upaya mengubah jumlah token, bukan harga token
Meningkatkan upaya penalaran tidak membawa Anda ke tingkat harga yang lebih mahal. GPT-5.6 Luna berharga $0.20 per juta token masukan dan $1.20 per juta token keluaran pada setiap pengaturan upaya. Yang berubah adalah berapa banyak token yang dikeluarkan model untuk mendapatkan jawaban — dan pada maksimum, ia mengeluarkan banyak token.
Artificial Analysis mengukur hal ini dalam menjalankan Intelligence Index-nya, dan angka-angka tersebut merupakan konfirmasi independen paling jelas atas apa yang dikeluhkan para praktisi:
• Skor — 51 pada Artificial Analysis Intelligence Index, dengan median 17 untuk model-model yang dibandingkan di kelas tersebut.
• Kata-kata Berlebihan — 130M token keluaran yang dihasilkan selama proses indeks berjalan, dibandingkan dengan median 61M. Artificial Analysis menandai model ini sebagai "sangat bertele-tele."
• Kecepatan mentah — 182,5 token keluaran per detik, peringkat ke-16 dari 163 model. Cepat per token.
• Waktu hingga token pertama — kira-kira 136 detik pada usaha maksimal, yang menurut Artificial Analysis berada di kisaran atas bahkan untuk model penalaran di kelas harga tersebut.
• Total pengeluaran — $174.06 untuk mengevaluasi model pada seluruh indeks.
Bacalah baris ketiga dan keempat bersama-sama, karena pasangan itu adalah seluruh pengalaman pengguna. Luna pada kecepatan maksimum mengalirkan token dengan cepat tetapi butuh beberapa menit untuk memulai, dan kemudian menghasilkan token kira-kira dua kali lebih banyak daripada model tipikal pada pekerjaan yang sama. Itulah sebabnya keluhan paling umum dalam laporan lapangan bukanlah "itu salah," melainkan "itu lambat" — dan mengapa harga murah tidak berarti sesi yang proporsional murah. Anda membeli tarif rendah pada jumlah token yang tinggi.
Sebagai perbandingan: di halaman model kami sendiri untuk GPT-5.6 Luna, median waktu yang teramati hingga token pertama selama tujuh hari lalu lintas nyata adalah 1,78 detik, dengan persentil ke-95 sebesar 9,26 detik. Itu bukan kontradiksi dari angka 136 detik — itu adalah model yang sama yang diukur dengan campuran pengaturan usaha, yang sebagian besar bukan yang maksimal. Latensi yang Anda dapatkan adalah sifat dari pengaturan yang Anda pilih, bukan dari endpoint yang Anda panggil.

Apakah Luna Max benar-benar "Sol Medium dengan biaya seperenamnya"?
Inilah klaim yang membuat pola tersebut menjadi viral, dan berasal dari Dan McAteer, yang menyebutnya sebagai Luna dengan penalaran maksimum yang mencapai sekitar GPT-5.6, Sol dengan tingkat sedang, atau Claude Opus 5 dengan tingkat sedang, dengan biaya kira-kira seperenamnya. Klaim ini diulang oleh banyak akun, terkadang dengan kata-kata hati-hati yang dihilangkan, dan penting untuk memisahkan apa yang terukur dari apa yang sekadar perasaan.
Papan skor independen mendukung separuh biaya dari klaim tersebut dengan tegas, dan separuh kemampuan hanya sebagian. Menjalankan rangkaian benchmark yang sama dengan upaya maksimal di semua tingkatan, Artificial Analysis mencatat Luna pada indeks 51 dengan $174, Terra pada 55 dengan $1.403, Kimi K3 pada 57 dengan $2.437, dan Sol pada 59 dengan $2.824. Luna kehilangan delapan poin indeks dibandingkan Sol, dan biayanya sekitar seperenam belas untuk melakukan pekerjaan yang sama.

Papan skor independen tersebut menjadi lebih tajam pada 13 Agustus, ketika DeepSWE merilis v1.1 — sebuah revisi dari tolok ukur rekayasa dengan cakrawala panjang yang mempertahankan 113 tugas asli yang diambil dari 91 repositori dalam lima bahasa, tetapi kini menilai setiap perbaikan dengan menjalankan diff yang dikomit di dalam kontainer terisolasi, yang lebih sulit untuk dimanipulasi. Pada papan yang diperbarui, ketiga tingkat GPT-5.6 dengan usaha maksimum berada di posisi yang sama seperti yang ditulis pada Juli: Luna Max pada 67.2% pass@1 dan $0.61 per tugas, Terra Max sekitar 70%, Sol Max pada 73% dengan biaya $8.39 — enam poin tingkat keberhasilan dengan biaya kira-kira empat belas kali lipat.
Perbandingan yang layak dilihat sekali lagi terletak di bawah Luna, bukan di atasnya. Claude Sonnet 5 Max mencetak 54% pada 113 tugas yang sama — sekitar tiga belas poin di belakang Luna Max — dengan biaya $26.40 per tugas, yang kira-kira 44 kali lipat dari yang dibayarkan Luna untuk penyelesaian yang sama. Luna Max juga mengungguli Gemini 3.7 Flash (65% untuk konfigurasi upaya tinggi pada papan yang sama); postingan komunitas yang menandai putaran ini menempatkan selisih dengan Gemini 3.7 Flash Medium sekitar 1,7 poin. DeepSWE adalah perangkat uji independen milik Datacurve, bukan evaluasi perusahaan — klaim perusahaan sendiri bahwa keluarga GPT-5.6 mencapai hasil mutakhir di Terminal-Bench 2.1 dan DeepSWE tetap merupakan pernyataan terpisah yang dilaporkan vendor.
Lalu ada bukti dari lapangan yang benar-benar terbelah. Pawel Huryn menjalankan benchmark perbaikan bug miliknya sendiri — 105 bug yang ditanam di dua basis kode nyata, penilaian buta, satu putaran per model — dan melaporkan Luna dengan upaya maksimal memperbaiki 33 bug seharga $1,80, dibandingkan Claude Fable 5 yang memperbaiki 24 bug seharga $68. Di arah sebaliknya, Diego Haz menghabiskan dua hari menjalankan sesi berpasangan dan hasilnya bertentangan dengan pola tersebut: Luna rata-rata $1,20 per sesi sedangkan Sol rata-rata $29, tetapi dia harus mengulang sebagian besar keluaran Luna dan tidak mendapatkan apa pun yang layak dirilis untuk kasus penggunaannya, yang menjadikan penghematan itu ilusi, bukan diskon. Pengembang lain yang menjalankan kerangka yang sama melaporkan Sol pada level medium menghasilkan hasil yang jelas lebih baik daripada Luna pada level maksimal dalam waktu sekitar setengahnya. Sebuah kompetisi berbahasa Mandarin untuk satu tugas adegan 3D memberikan angka pada pola tersebut: Sol Medium selesai dalam 21m30s dengan peringkat kualitas tertinggi dan token paling sedikit; Luna Max memakan waktu 40m55s, menghabiskan sekitar 130 ribu token, mendapat skor kualitas terendah, dan menggunakan setengah dari kuota langganan mingguan.
Ringkasan jujur posisi komunitas setelah seminggu: Luna Max bukan Sol Medium. Luna Max jauh lebih murah daripada Sol Medium dan kualitasnya lebih buruk, dan apakah pertukaran itu baik sepenuhnya bergantung pada apakah tugasnya ditentukan dengan cukup ketat sehingga "lebih buruk" tidak menjadi masalah. Yang justru untuk itulah pola-pola perkabelan di bawah ini.
Pola yang bertahan dari kontak: Sol merencanakan, Luna mengimplementasikan, Sol yang baru meninjau.
Tidak seorang pun yang tetap menggunakan Luna Max menggunakannya sebagai agen pengodean serba guna. Pengaturan yang berhasil—yang dalam setiap versinya telah menjadi konsensus para praktisi—memiliki empat peran:
• Orkestrator — GPT-5.6 Sol dengan upaya tinggi, tetap berada di thread utama. Ia bertanggung jawab atas persyaratan, arsitektur, dekomposisi tugas, dan penerimaan akhir. Ia tidak menulis kode.
• Pengimplementasi rutin — GPT-5.6 Luna dengan upaya maksimal, pada pekerjaan yang terbatas dan sepenuhnya terspesifikasi: refaktor mekanis, penulisan pengujian, analisis modul, peninjauan dokumentasi, jenis tugas yang tujuannya tidak ambigu.
• Implementer tangguh — GPT-5.6 Terra dengan upaya maksimal, untuk build yang sarat konteks di mana penyimpangan instruksi Luna menjadi mahal.
• Peninjau — sebuah instance GPT-5.6 Sol yang baru dan hanya-baca yang melihat diff akhir dan tidak melihat apa pun lainnya. Inti dari "baru" adalah bahwa peninjau yang membawa konteks implementasi cenderung menyetujui penalarannya sendiri.
Implementasi referensinya adalah sol-advisor, plugin Codex berlisensi MIT oleh Dan McAteer yang mencapai sekitar 1.400 bintang dalam minggu pertamanya. Anda memasangnya melalui marketplace plugin Codex dengan menambahkan DannyMac180/sol-advisor sebagai repositori, lalu menambahkan sol-advisor sebagai plugin. Bentuknya saat ini instruktif: jalur native mengunci implementer Terra/High yang diikuti oleh reviewer Sol/High baru, sementara Luna pada maksimum adalah jalur opt-in eksplisit yang berjalan sebagai tugas terpisah yang terlihat pengguna, dengan sesi Sol utama meninjau dan menerima langsung pekerjaannya, bukan meneruskannya melalui reviewer native.
Jika Anda lebih suka tidak menginstal apa pun, versi minimal yang banyak disalin adalah definisi agen kustom di ~/.codex/agents/luna-worker.toml yang memiliki dua pengaturan — model = "gpt-5.6-luna" dan model_reasoning_effort = "max" — beserta deskripsi dan instruksi yang membatasinya pada pekerjaan yang didelegasikan dengan batasan yang jelas, melarangnya mengubah tujuan keseluruhan atau memperluas cakupannya sendiri, dan mengirim keputusan arsitektur serta persyaratan yang ambigu kembali ke agen utama. Nasihat yang beredar adalah meminta Sol menuliskan file ini untuk Anda, memvalidasinya terhadap versi Codex yang terinstal, dan menunjukkan diff-nya sebelum Anda menerimanya, yang masuk akal terlepas dari apakah Anda mempercayai resepnya atau tidak.
Jebakan subagent, dan solusi yang disepakati komunitas
Di sinilah versi viral dari pola ini dan versi yang berfungsi berpisah.
Sistem subagen asli Codex tidak memperlakukan GPT-5.6 Luna sebagai warga negara kelas satu. McAteer menemui hambatan keras — Luna tidak diizinkan sebagai subagen — dan mengatasinya dengan mendeklarasikannya sebagai agen kustom, lalu secara terbuka menunjukkan biaya dari solusi tersebut: agen kustom tidak berbagi konteks dengan agen utama seperti halnya subagen asli. Beberapa hari kemudian, ia menghapus jalur Luna dari sol-advisor sepenuhnya, mengutip temuan pengembang lain yang berfokus pada Codex bahwa Luna berperilaku buruk dalam peran subagen, dengan asumsi bahwa Luna belum mendapat pelatihan lanjutan untuk protokol multi-agen v2. Diego Haz secara independen menggambarkan hambatan yang sama dari sisi lain: Sol tidak dapat memunculkan Luna sebagai subagen, sehingga Luna harus berada dalam utas tingkat atas, yang membuat koordinasi menjadi rumit.
Resolusi, yang kini menjadi posisi mayoritas, adalah untuk berhenti melawannya:
• Berikan Luna Max utasnya sendiri, bukan slot dalam graf subagen. Instruksikan orkestrator Sol untuk meluncurkan tugas Codex tingkat atas yang terpisah di Luna, memantaunya, dan menarik kembali hasilnya. Inilah yang ditambahkan kembali oleh McAteer ke sol-advisor pada 4 Agustus, dan yang juga ditemukan secara independen oleh beberapa orang lain.
• Terimalah isolasi konteks sebagai harga yang harus dibayar. Utas terpisah berarti riwayat terpisah. Itulah pajak yang Anda bayar, dan itu juga sebabnya serah terima di bawah ini lebih penting di sini daripada dalam pengaturan subagen asli.
• Jika Anda harus memaksanya ke multi-agent v2, katalog adalah alasan ia disaring. Seorang pengembang melacak pengecualian tersebut ke katalog model bawaan yang menandai Luna sebagai v1, dan melaporkan solusi: salin ~/.codex/models_cache.json, setel milik Luna multi_agent_version menjadi v2, arahkan model_catalog_json ke salinan Anda, mulai ulang Codex, lalu suruh orkestrator memunculkan Luna secara maksimal dengan tingkat layanan cepat dan matikan forking. Anggap ini sebagai hack tidak resmi satu orang pada file internal — ini persis jenis hal yang dirusak oleh pembaruan Codex.
Paket serah terima: lima pertanyaan yang mengatasi keluhan yang paling umum
Kegagalan Luna Max yang paling sering dilaporkan adalah ia tidak mengikuti instruksi dengan cermat, terutama ketika Anda memberinya alur kerja tertentu atau loop iterasi untuk dijalankan. Keluhan itu muncul dari pengembang yang menyukai model tersebut dan pengembang yang meninggalkannya. Mitigasi yang terus ditemukan para praktisi bukanlah prompt yang lebih baik dalam hal gaya penulisan; melainkan kontrak yang lebih ketat. Sebelum utas Luna dimulai, jawab lima hal:
• Tugas spesifik apa yang harus diselesaikan agen ini? Bukan bidang pekerjaannya — melainkan keadaan akhirnya.
• Berkas, dokumen, atau sistem apa saja yang termasuk dalam cakupan? Tercantum, bukan tersirat.
• Apa yang tidak boleh diubahnya? Antarmuka, migrasi, konfigurasi, dan kontrak publik yang dilarang.
• Bukti apa yang menunjukkan penyelesaian? Tes yang disebutkan namanya, keluaran perintah tertentu, diff yang hanya memengaruhi file-file yang terdaftar.
• Keputusan apa yang hilang yang seharusnya membuatnya berhenti? Pemicu untuk kembali alih-alih menebak — inilah yang mencegah model murah yang terlalu bersemangat agar tidak mengarang arsitektur.
Ini juga tempat di mana panduan prompting dari perusahaan itu sendiri layak untuk diikutsertakan, dengan label yang memang layak: perusahaan melaporkan bahwa dalam evaluasi agen pengkodean internalnya, prompt sistem yang lebih ramping meningkatkan skor eval sebesar 10–15% sambil memangkas total token 41–66% dan biaya 33–67%, serta menyarankan untuk mengaudit prompt yang diwarisi dari GPT-5.5 atau GPT-5.4 daripada memindahkannya begitu saja. Itu adalah angka yang dilaporkan vendor. Namun arahnya sejalan dengan temuan lapangan: gambarkan tujuan secara presisi dan hapus narasi setiap langkah. Perhatikan ketegangan dengan paragraf di atas — presisi tentang ruang lingkup dan batasan tidak sama dengan verbositas, dan konsensus komunitas adalah bahwa Luna Max membutuhkan lebih banyak dari yang pertama dan lebih sedikit dari yang terakhir.
Mode kegagalan yang perlu diantisipasi
• Penyimpangan instruksi. Dikonfirmasi oleh banyak pengembang: ini mengabaikan sebagian dari brief awal, dan paling buruk ketika brief tersebut adalah prosedur untuk diikuti, bukan hasil untuk dicapai.
• Kelambatan waktu nyata. Berulang kali dilaporkan, dan konsisten dengan time-to-first-token ~136 detik yang diukur Artificial Analysis pada upaya maksimal. Cocok untuk pekerjaan yang bisa Anda biarkan berjalan; menyakitkan dalam putaran interaktif.
• Pembakaran konteks. Seorang pengembang melaporkan bahwa Luna Max menghabiskan jendela utas Codex 258k dengan kecepatan yang mengkhawatirkan, dan menduga bahwa konsumsi kuota melonjak begitu Codex mulai melakukan kompaksi di dekat batas. Bagian kompaksi itu adalah kesannya, bukan hasil pengukuran — tetapi laju pembakaran tersebut adalah konsekuensi yang bisa diduga dari verbositas yang diukur secara independen oleh Artificial Analysis. Di sisi API, perhatikan langkah konteks panjang: skema harga pass-through untuk model ini bergeser dari $0.20/$1.20 menjadi $0.40/$1.80 ketika sebuah permintaan melewati sekitar 272k token, sehingga utas yang terus bertambah menjadi lebih mahal per token, bukan hanya lebih mahal secara total.
• Apa pun yang visual.Ini adalah batas paling tajam dalam laporan lapangan. Seorang praktisi yang banyak dibaca, membatalkan langganan coding Kimi K3 demi Luna Max, menilainya sama bagusnya dengan yang dia tinggalkan dan jauh lebih murah — dengan pengecualian eksplisit untuk frontend. Yang lain lebih blak-blakan: jangan gunakan Luna untuk mengerjakan desain, grafis, format, atau pekerjaan slide; pembagian rencana-dengan-Sol-dieksekusi-dengan-Luna adalah untuk tugas instruksional langkah demi langkah, bukan yang estetis.
• Katalog subagen.Telah dibahas di atas — jika Luna tidak pernah terpilih secara diam-diam dalam proses multi-agen, itu sedang disaring, bukan gagal.
• Ekonomi palsu. Satu-satunya mode kegagalan yang tidak muncul dalam tolok ukur apa pun: sesi yang berbiaya $1.20 alih-alih $29 dan menghasilkan pekerjaan yang Anda tulis ulang secara manual, merugikan Anda $1.20 ditambah waktu sore Anda.
Kapan Tidak Perlu Menggunakan Max
Max bukanlah peningkatan gratis, dan panduan yang masih bertahan adalah tangga, bukan pengaturan:
• Transformasi yang jelas — penggantian nama kolom, ekstraksi mekanis, dan langkah pemformatan. Upaya rendah atau sedang di Luna. Syaratkan pada uji bernama yang lulus.
• Implementasi rutin — high atau xhigh. Default komunitas untuk worker Luna adalah xhigh, bukan max, justru karena max memakan waktu dan token pada tugas-tugas yang tidak pernah sulit.
• Terbatas namun benar-benar sulit — ini adalah tugas nyata max. Paketnya harus sulit dan dispesifikasikan dengan ketat agar penalaran ekstra dapat berubah menjadi hasil yang lebih baik.
• Investigasi ambigu — ubah tier-nya, bukan kenopnya. Jika model salah menilai alih-alih kurang merencanakan, berpikir lebih lama pada model yang lebih murah tidak akan memperbaikinya; itu tugas Sol.
• Brief yang tidak jelas — perbaiki kontraknya, bukan modelnya. Tidak ada pengaturan upaya yang dapat mengompensasi kriteria penerimaan yang tidak dinyatakan.
Peringatan khusus untuk langganan, dari panduan pihak ketiga dan mudah salah: tingkat kredit yang dibebankan Codex per model tidak memiliki rasio yang sama dengan harga daftar API, jadi Anda tidak bisa mengambil rasio harga API dan menggunakannya sebagai aturan perutean langganan Anda. Batas pesan lima jam yang dilaporkan pada tingkat Plus menggambarkan poin ini — kira-kira 15–90 pesan lokal di Sol, 20–110 di Terra, 50–280 di Luna, dengan rentang yang lebar karena "pesan" bukanlah unit kerja yang tetap. Jika keputusan perutean Anda didorong oleh batas langganan daripada faktur, ukurlah terhadap batas tersebut.
Melampaui Codex: ke mana lagi orang mengarahkannya
Kombinasi penalaran mendalam yang murah ternyata berguna di luar agen coding, dan berikut adalah penggunaan yang terbukti:
• Agen browser. Seorang pengembang menjalankan stack otomasi browser pada GPT-5.6 Luna untuk membuka 15 postingan teratas Hacker News, membaca setiap halaman tertaut, dan menulis laporan — total biaya, 3 sen. Horizon panjang, taruhan rendah, token tinggi: persis bentuk yang menjadi patokan harga model ini.
• Rantai keterampilan. Dua praktisi secara independen melaporkan menjalankan pipeline dua-keterampilan — generator gambar ke konverter gambar-ke-Three.js — dari satu tujuan Luna Max untuk mendapatkan objek 3D low-poly interaktif, masing-masing mencatat bahwa itu hampir tidak menggerakkan penghitung penggunaan mingguan mereka. Perlu dibaca bersama peringatan "jangan gunakan Luna untuk pekerjaan visual": Luna mengoordinasikan alat yang melakukan pekerjaan visual, bukan menilai estetika itu sendiri.
• Menjaga satu sesi tetap panas. Input cache pada model ini berbiaya $0,02 per juta token dibandingkan $0,20 untuk input baru — diskon 90% yang dicantumkan Artificial Analysis di panel harganya — dan periode cache sekitar 30 menit. Implikasi praktis yang ditemukan oleh beberapa panduan secara independen: satu sesi yang berjalan lama dan terus membaca ulang basis kode yang sama jauh lebih murah daripada sesi baru per tugas.
• Arbitrase kuota. Klaim paling agresif di seluruh rangkaian, dan jelas diberi label sebagai klaim: seorang pengembang melaporkan bahwa karena upaya hampir gratis sementara pengali tingkat besar, menjalankan upaya maksimal di tingkat murah memungkinkannya mendorong 4,9 miliar token selama tiga minggu pada paket $200 — enam digit dengan tarif API — dan bahwa ia menyimpan model Kimi K3, Grok, dan DeepSeek di pemilih yang sama di belakang router lokal sehingga mencapai batas satu penyedia tidak menghentikan pekerjaan. Tidak ada yang secara independen mereproduksi angka token tersebut. Namun, kebiasaan perutean di baliknya adalah bagian yang layak ditiru.
Menjalankan split yang sama tanpa langganan Codex.
Semua hal di atas adalah cerita berbentuk langganan: alasan orang peduli pada Luna Max adalah karena ia memperpanjang batas mingguan. Di sisi API, arsitektur yang sama lebih sederhana untuk dibangun dan lebih mudah dipahami, karena Anda membayar faktur, bukan mengelola alokasi — dan pemisahan orchestrator/worker tidak lagi menjadi plugin, melainkan menjadi routing biasa.
GPT-5.6 Luna tersedia melalui OrcaRouter dengan harga $0.20 per juta input dan $1.20 per juta output — harga daftar penyedia, diteruskan dengan markup 0%, itulah sebabnya penurunan harga pada 30 Juli sudah aktif di sisi kami pada hari perusahaan mengumumkannya, bukan satu siklus penagihan kemudian. Layanan ini disediakan melalui API yang kompatibel pada /v1/chat/completions dan /v1/responses, sehingga parameter reasoning-effort ikut disertakan dalam body permintaan persis seperti saat memanggil langsung, dan ID modelnya adalahopenai/gpt-5.6-luna. GPT-5.6 Sol dan GPT-5.6 Terra berada di balik kunci API yang sama, yang merupakan bagian penting dari pola ini: orkestrator di satu tingkat dan pekerja di tingkat lain adalah dua ID model dalam satu integrasi, bukan dua kontrak vendor. DSL routing memungkinkan Anda mengekspresikan pemisahan itu sebagai satu panggilan, bukan merangkai utas secara manual, dan failover otomatis menangani kasus yang dipecahkan oleh para pelaku arbitrase kuota dengan router lokal — ketika satu penyedia menurun performanya, permintaan akan mendarat di tempat lain alih-alih berhenti.

Dua peringatan jujur. Mekanisme khusus Codex — grafik subagen, pasar plugin, katalog model, jatah mingguan — adalah milik perusahaan, dan tidak ada satu pun yang disertakan dengan kunci API; jika pola yang Anda inginkan adalah sol-advisor di dalam aplikasi Codex, Anda memerlukan langganan Codex. Dan mode kegagalan di atas adalah properti model, bukan transport: perutean mengubah biaya panggilan dan apa yang terjadi ketika penyedia mengalami kegagalan, bukan apakah Luna mengikuti instruksi Anda.
Siapa yang harus menyalin ini, dan siapa yang tidak?
Jika pekerjaan Anda bervolume tinggi dan dapat dispesifikasikan secara mekanis — refactor, scaffolding pengujian, ekstraksi, dokumentasi, proses analisis pada repositori besar — aktifkan max, letakkan Luna di utasnya sendiri dengan serah terima lima pertanyaan, pertahankan instance Sol di depannya untuk perencanaan dan di belakangnya untuk peninjauan, dan perkirakan biayanya satu orde besarnya lebih kecil. Orang-orang yang melaporkan keuntungan terbesar semuanya melakukan versi semacam itu, dan angka biaya independen mendukung arah tersebut bahkan ketika tidak mendukung kerangka "sebagus Sol".
Jika pekerjaan Anda bersifat eksploratif, estetis, atau datang sebagai brief yang samar yang semakin jelas seiring berjalannya waktu, laporan lapangan menyatakan dengan tegas bahwa Anda akan menghabiskan penghematan itu dua kali lipat untuk mengerjakan ulang hasilnya. Dan jika Anda interaktif — duduk di sana menontonnya — cold start dua menit dengan usaha maksimal akan lebih mengganggu Anda daripada harga yang menyenangkan Anda.
Apa yang perlu diperhatikan: apakah perusahaan melakukan post-training pada Luna untuk protokol subagen v2. Setiap bagian janggal dari playbook saat ini — utas terpisah, konteks bersama yang hilang, hack katalog, seluruh episode retract-and-rewire — ada karena satu celah itu. Tutup celah itu dan versi terbaik dari pola ini menjadi beberapa langkah lebih sederhana.
Pertanyaan yang layak mendapat jawaban nyata
Apakah upaya penalaran maksimum memakan biaya lebih per token daripada default?
Tidak, dan ini adalah kesalahpahaman paling umum tentang pengaturan tersebut. GPT-5.6 Luna membebankan biaya $0,20 untuk token masukan dan $1,20 untuk token keluaran per juta token, apa pun tingkat usahanya. Yang diubah oleh pengaturan maksimum hanyalah jumlah token yang dihabiskan — model merencanakan lebih banyak, memeriksa diri sendiri, dan merevisi sebelum menjawab. Artificial Analysis mengukur model ini mengeluarkan 130M token keluaran pada rangkaian benchmark di mana model median mengeluarkan 61M token. Jadi, sesi dengan usaha maksimum lebih mahal daripada sesi dengan usaha menengah untuk tugas yang sama, murni karena volume, dan juga membutuhkan waktu lebih lama untuk menghasilkan token pertamanya. Effort adalah kenop penghitung token yang memakai label kualitas.
Apakah GPT-5.6 Luna sudah bisa berjalan sebagai subagen asli Codex?
Per 5 Agustus 2026, belum — dan komunitas sudah berhenti mencoba. Jalur subagen asli Codex tidak menerima Luna; solusi alternatif agen khusus membuatnya berjalan tetapi kehilangan konteks bersama dengan agen utama; dan pengembang di balik plugin paling terkenal untuk pola ini menghapus Luna, lalu menambahkannya kembali sebagai tugas tingkat atas yang dijalankan secara terpisah dan dipantau oleh orkestrator. Jika Anda melihat proses multi-agen di mana Luna tidak pernah terpilih, kemungkinan besar itu disaring karena katalog model standar menandainya sebagai v1, bukan v2, yang oleh satu pengembang telah ditambal secara manual dengan risikonya sendiri. Ini adalah hal yang paling mungkin berubah dalam daftar ini dengan pembaruan Codex, jadi periksa pada versi yang Anda instal daripada mempercayai resep apa pun, termasuk yang satu ini.
Apakah itu cukup baik untuk menggantikan langganan coding Claude atau Kimi K3?
Beberapa pengembang secara terbuka telah membatalkan paket $200/bulan justru karena hal ini. Postingan yang memunculkan pertanyaan ini ke permukaan datang dari seorang imunolog yang berkoding setiap hari: dia menghentikan langganan koding Kimi K3-nya bukan karena buruk, tetapi karena dia tidak bisa membenarkannya ketika GPT-5.6 Luna, menurut pengalamannya, sama bagusnya untuk pekerjaannya dan jauh lebih murah—kecuali untuk frontend. Angka biaya independen membuat kasus ini sulit untuk diabaikan: pada rangkaian tolok ukur yang sama, Kimi K3 dengan usaha maksimal mencetak 57 dengan biaya $2,437, sedangkan GPT-5.6 Luna dengan maksimal mencetak 51 dengan biaya $174. Tetapi bacalah pendapat yang berbeda sebelum Anda membatalkan apa pun. Para pengembang yang mengukur sesi yang setara dan hasilnya negatif sebenarnya tidak menguji model yang berbeda; mereka menguji jenis tugas yang berbeda—terbuka, visual, atau spesifikasinya longgar—dan pada tugas semacam itu model yang lebih murah kalah telak hingga menghapus penghematannya. Jawaban yang dapat dipertahankan adalah bahwa Luna Max menggantikan sebagian besar codingkerja, bukan berarti coding terbaik Anda model, dan bahwa para praktisi yang paling terbantu adalah mereka yang tetap mempertahankan tier frontier untuk merencanakan dan memeriksa.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
