
GPT-6 Luna vs GPT-5.6 Luna: Nama yang Sama, Harga Setengah, dan Hasil yang Lebih Buruk
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Dua model, satu kata yang sama, dan skor independen yang praktis identik. GPT-6 Luna mencapai 37,26 pada Artificial Analysis Intelligence Index; GPT-5.6 Luna mencapai 37,32. Selisih 0,07 poin bukanlah sebuah pengukuran, melainkan derau, dan itu adalah fakta tunggal terpenting tentang pasangan ini. Yang membedakan kedua model ini bukanlah kemampuan — melainkan $0,0681 per tugas indeks yang diselesaikan versus $0,1783, serta serangkaian regresi pekerjaan pengetahuan yang tidak disebutkan oleh pemotongan harga.
Tanggal-tanggal itu penting untuk membaca angka-angkanya. GPT-5.6 Luna dirilis pada 9 Juli 2026 dengan harga $0,20 per juta token masukan dan $1,20 per juta token keluaran. GPT-6 Luna dirilis pada 22 September 2026 dengan harga $0,10 dan $0,50 — tepat setengah tarif masukan dan 58% lebih murah dari tarif keluaran, yang digambarkan OpenAI sebagai permanen, bukan promosi. Itu adalah pemotongan harga yang nyata, dan itu juga merupakan bagian yang lebih kecil dari cerita ini. Bagian yang lebih besar adalah bahwa model yang lebih baru adalah model yang berbeda, bukan model yang sama yang diubah harganya.

Apa yang sebenarnya diberikan oleh migrasi, dalam angka
Sejajarkan keduanya pada dimensi-dimensi yang menentukan sebuah migrasi dan bentuknya tidak merata. Beberapa baris membaik, beberapa mengalami regresi, dan satu membaik sangat pesat.
• Harga — GPT-6 Luna $0,10 masuk / $0,50 keluar per juta token vs GPT-5.6 Luna $0,20 / $1,20. Setengah untuk masukan, diskon 58% untuk keluaran.
• Input yang di-cache — $0,01 per juta dibandingkan $0,02. Diskon 90% yang sama pada basis yang dipotong setengah, sehingga prefiks yang berulang hanya memakan biaya setengah dari biaya pada Juli.
• Biaya per tugas yang diselesaikan — $0,0681 dibandingkan $0,1783 pada suite yang sama. Pengurangan sebesar 62%, yang lebih besar daripada pemotongan harga token karena campuran tugasnya tidak identik.
• Token keluaran per tugas — 50.537 dibandingkan 41.235. Model baru ini 23% lebih cerewet per pekerjaan yang diselesaikan, dan 78% dari keluarannya adalah penalaran yang tidak pernah muncul dalam respons.
• Jendela konteks — 1.050.000 token dibandingkan dengan 1.000.000. Batas praktis yang sama; keduanya membatasi keluaran pada 128.000 token.
• Abstensi — tingkat halusinasi 76,7% pada AA-Omniscience dibandingkan 92,6%. Ini adalah peningkatan tunggal terbesar dalam kumpulan ini, dan ini bukan peningkatan pengetahuan: akurasi bergerak dari 42,7% ke 43,8%, pada dasarnya datar. Model yang lebih baru menolak untuk menjawab alih-alih mengarang, yang merupakan perubahan perilaku, bukan perubahan kemampuan.
• Luaran pekerjaan pengetahuan — AA-Briefcase v1.1 turun dari 1.345,38 Elo ke 1.299,23, dan GDPval-AA v2.1 turun dari 1.443,14 ke 1.367,09. Keduanya turun, masing-masing sekitar 46 dan 76 poin.
• Pengodean dan pekerjaan jangka panjang — Terminal-Bench 4.0 naik dari 11,6% menjadi 12,6% dan SciCode dari 53,6% menjadi 54,6%, dua baris di sini yang meningkat. Sebaliknya, Coding Agent Index turun dari 43 menjadi 41 dan evaluasi agentik bergaya SWE bergerak ke arah yang sama.
• AutomationBench-AA — 53,2% berbanding 50,2%. Naik, dan dengan selisih yang lebih besar daripada metrik agentik mana pun lainnya dalam kumpulan ini.

Regresi terletak pada artefaknya, bukan pada penalarannya
Pola pada dua baris terakhir itu layak diberi nama, karena itulah keseluruhan keputusannya. Model baru lebih baik dalam tindakan agentik satu langkah dan lebih buruk dalam mengembalikan dokumen yang sudah selesai. Artificial Analysis mengaitkan penurunan pekerjaan pengetahuan dengan kualitas presentasi dan hasil kerja yang melewatkan elemen rubrik yang diwajibkan, bukan dengan kegagalan faktual atau penalaran — yang justru merupakan jenis regresi yang lolos dari uji asap dan gagal dalam tinjauan.
Gabungkan kedua fakta ini, dan migrasi terbelah rapi berdasarkan apa yang mengonsumsi output. Jika pipeline Anda membaca output terstruktur — JSON, klasifikasi, bidang yang diekstrak, keputusan perutean — regresi presentasi tidak merugikan Anda, peningkatan abstensi adalah keuntungan nyata, dan pengurangan biaya tugas sebesar 62% berlaku sepenuhnya. Jika manusia yang membaca hasil akhirnya — laporan, memo, dokumen untuk klien — model yang lebih baru secara terukur justru lebih buruk tepat pada hal yang Anda bayar, dan penghematannya hanya membelikan Anda seorang peninjau.
Angka abstensi layak mendapatkan perlakuan yang sama. Model yang turun dari mengarang pada 93% hal yang tidak diketahuinya menjadi mengarang pada 77% adalah objek yang berbeda secara material bagi sebuah guardrail, penyaring kepatuhan, atau alur apa pun tempat jawaban salah yang penuh keyakinan merambat. Peningkatan itu nyata, diukur secara independen, dan merupakan argumen terkuat—yang sama sekali tidak bergantung pada harga—untuk memindahkan pekerjaan ke model baru.
Apa yang berubah dalam kode Anda, dan apa yang tidak
Lebih kecil daripada yang tersirat dari pemotongan harga sebesar ini, yang merupakan kabar baik. Jendela konteksnya berada di kelas yang sama, keluaran maksimumnya identik pada 128.000 token, dan klausul penetapan harga ulang konteks panjang keluarga ini tidak berubah: permintaan yang melebihi 272.000 token input dikenakan tarif input dan cache 2x serta output 1,5x, untuk keseluruhan permintaan, bukan hanya bagian yang melewati ambang tersebut. Permintaan yang mahal pada 300.000 token di GPT-5.6 Luna juga mahal di GPT-6 Luna — setengah tarifnya, jurang yang sama, jadi beban kerja yang seharusnya dipecah pada Juli tetap harus dipecah sekarang.
Tangga upaya adalah tempat perilaku berubah, bukan biaya. GPT-6 Luna menyediakan none, low, medium (bawaan), high, xhigh, dan max, dan nilai bawaan itu penting: pipeline yang disetel terhadap upaya bawaan satu model tidak otomatis disetel terhadap upaya bawaan model lain. Tim yang menetapkan pengaturan secara eksplisit tidak terpengaruh. Tim yang memakai nilai bawaan menjalankan konfigurasi yang berbeda daripada yang mereka jalankan pada bulan Juli, dan gejala yang terlihat adalah volume token, bukan kualitas.
Satu jebakan perlu dikemukakan kembali karena tidak hilang bersama model baru. Pada endpoint Chat Completions, pemanggilan fungsi hanya berfungsi saat reasoning effort diatur ke none; setiap tingkat effort lain, dan setiap alat bawaan, memerlukan Responses API. Tim yang memigrasikan loop pemanggilan alat hanya dengan mengubah string model akan mendapati alatnya secara diam-diam tidak tersedia pada effort medium bawaan, dan solusinya adalah menulis ulang permukaan pemanggilan, bukan mengubah parameter.
Apa yang dapat Anda rutekan hari ini, dan apa yang tidak
Ini adalah bagian dari migrasi yang tidak ada hubungannya dengan benchmark. GPT-5.6 Luna tersedia di OrcaRouter dengan harga daftarnya — $0,20 per juta token input, $1,20 per juta token output, jendela konteks 1.000.000 token, output maksimum 128.000 token, dan p50 waktu ke token pertama 1,60 detik yang diukur dari lalu lintas langsung di halaman model kami sendiri. Kami meneruskan harga daftar penyedia tanpa markup, sehingga saat OpenAI menetapkan ulang harga keluarga ini, perubahannya langsung berlaku di sisi kami, bukan menunggu siklus penagihan berikutnya.

GPT-6 Luna tidak dapat dirutekan melalui OrcaRouter per 23 September 2026. Ketersediaannya adalah API milik OpenAI sendiri dan katalog cloud yang menyediakan keluarga ini, dan kami tidak mencantumkan model yang tidak dapat kami layani. Konsekuensi praktisnya adalah tim yang merencanakan migrasi ini dapat memindahkan penetapan harga hari ini dan tidak dapat memindahkan perutean hari ini — dua bagian perubahan tersebut jatuh pada tanggal yang berbeda.
Yang dimungkinkan oleh hal itu untuk sementara ini adalah pengaturan yang pada akhirnya akan tetap diinginkan sebagian besar tim. Pertahankan GPT-5.6 Luna pada jalur di mana hasil akhirnya adalah produk, jalankan GPT-6 Luna di mana pun keluarannya dikonsumsi oleh kode, dan perlakukan batas itu sebagai tingkat alih-alih penulisan ulang. Karena model yang dapat Anda jangkau berada di balik satu endpoint dengan lebih dari 200 model pada kunci yang sama dan failover otomatis antar penyedia, menambah atau menghapus tingkat hanyalah entri konfigurasi alih-alih integrasi kedua — dan jalur eskalasinya berhenti bergantung pada tersedianya model tunggal mana pun.
Keputusan migrasi, dinyatakan secara gamblang
Alihkan pekerjaan ke tempat keluaran dibaca mesin dan kondisi keberhasilannya dapat diverifikasi. Klasifikasi, ekstraksi, keputusan perutean, panggilan guardrail, proses transformasi massal, dan tindakan agen satu langkah semuanya memenuhi syarat: kompositnya tidak berubah, perilaku abstensi jauh lebih baik, dan biaya tugas turun sekitar 62%. Dengan Batch setengah dari tarif standar dan input yang di-cache sepersepuluh dari basis yang dipotong setengah, pipeline yang tadinya marginal pada Juli kini bisa menjadi lugas.
Jangan pindahkan pekerjaan yang memerlukan persetujuan manusia atas artefaknya, dan jangan memindahkan jalur coding-agent secara membabi buta. Penurunan 46 poin pada AA-Briefcase dan penurunan 76 poin pada GDPval adalah angka-angka kecil yang menunjuk ke arah yang sama dengan penurunan dua poin pada Coding Agent Index, dan mode kegagalan yang digambarkan Artificial Analysis — elemen rubrik yang terlewat, penyajian yang lebih lemah — tidak terlihat oleh pemeriksaan otomatis. Pertahankan model sebelumnya di tempat polesan adalah hasil akhirnya.
Dan perlakukan hasil seri indeks 0,07 poin sebagai temuan yang memang demikian. Ini bukan model yang lebih pintar dengan harga lebih rendah. Ini adalah model dengan bentuk berbeda pada harga yang lebih rendah, dan pertanyaan yang harus dijawab oleh rencana migrasi adalah bentuk mana yang dikonsumsi beban kerja Anda — bukan skor mana yang lebih tinggi, karena pada catatan independen kedua skor itu adalah angka yang sama.
