OpenAI Memangkas Harga API GPT-5.6: Apa yang Berubah, Mengapa, dan Cara Mendapatkannya
Guides & Insights

OpenAI Memangkas Harga API GPT-5.6: Apa yang Berubah, Mengapa, dan Cara Mendapatkannya

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada 30 Juli 2026, OpenAI memangkas harga API dari dua model GPT-5.6 berbiaya rendahnya — menurunkan drastis tier termurah dan memangkas tier menengah. Tiga minggu kemudian giliran model unggulan: pada 21 Agustus 2026, OpenAI mengumumkan bahwa harga API GPT-5.6 Sol turun lebih dari 20% untuk tiga bulan ke depan seiring upaya perusahaan menjalankan model tersebut secara lebih efisien. Artikel ini menjelaskan secara tepat apa yang berubah dalam kedua putaran tersebut, rekayasa di baliknya, bagaimana harga baru dibandingkan para pesaing, biaya tersembunyi yang perlu diwaspadai, cara memangkas tagihan Anda lebih jauh — dan bagaimana harga yang lebih rendah tersebut sudah aktif di OrcaRouter dengan markup 0%.

Setiap gambar di bawah ini diberi label berdasarkan sumbernya. Harga dihitung per juta token (input / output). Tarif Luna dan Terra mencerminkan kartu tarif OpenAI tanggal 30 Juli 2026 sebagaimana dilaporkan oleh berbagai media termasuk Unite.AI; penurunan Sol mencerminkan pengumuman OpenAI tanggal 21 Agustus 2026, dengan harga per token sebagaimana dilaporkan oleh berbagai media termasuk Runtimewire dan Reuters. Halaman model pass-through OrcaRouter menampilkan angka yang sama; angka kompetitor diberi atribusi. Harga dapat berubah — verifikasi sebelum Anda membangun.

TL;DR. OpenAI menurunkan harga GPT-5.6 Luna menjadi $0,20 / $1,20 (dari $1 / $6, diskon ~80%) dan GPT-5.6 Terra menjadi $2 / $12 (dari $2,50 / $15, diskon ~20%) pada 30 Juli. Pada 21 Agustus, OpenAI memperluas diskon ke produk unggulannya: harga API GPT-5.6 Sol turun lebih dari 20% untuk tiga bulan ke depan — menjadi $4 / $20 per juta token dari $5 / $30 — sementara kredit Codex berbasis token dan ChatGPT Work memberi lebih banyak, dan penggunaan langganan tetap tidak berubah. Dua peningkatan efisiensi membiayai pemotongan bulan Juli: kernel GPU yang ditulis ulang (biaya penyajian sekitar 20% lebih rendah) dan model draf speculative-decoding yang dirancang ulang (generasi token 15%+ lebih cepat). Jika Anda merutekan melalui endpoint netral-vendor dengan markup 0% seperti OrcaRouter, tarif baru sudah aktif — harga sama, satu API yang kompatibel dengan OpenAI, dengan setiap model pesaing di sampingnya untuk dibandingkan dan dirutekan.

Poin-poin penting

• GPT-5.6 Luna: sekarang $0.20 / $1.20 per 1 juta token, turun dari $1 / $6 — kira-kira potongan 80%.

• GPT-5.6 Terra: sekarang $2 / $12, turun dari $2.50 / $15 — sekitar potongan 20%.

GPT-5.6 Sol (unggulan): kini $4 / $20 untuk tiga bulan ke depan, turun dari $5 / $30 — pemotongan >20% yang diumumkan pada 21 Agustus 2026.

• Kredit berbasis token Codex & ChatGPT Work kini memberi lebih banyak: input Sol turun menjadi 100 kredit dan output menjadi 500 kredit per 1M token (dari 125 / 750).

• Langganan tidak berubah: jatah penggunaan Plus, Pro, dan Business, batas lima jam per minggu, dan tarif kredit lama tidak terpengaruh.

• Mengapa: OpenAI membingkai kedua putaran tersebut sebagai dividen efisiensi — kernel GPU produksi yang ditulis ulang (biaya penyajian ~20% lebih rendah) plus desain ulang model draf dengan decoding spekulatif (efisiensi pembuatan token 15%+), menurut unggahan teknis OpenAI tanggal 29 Juli.

• Cara mendapatkannya: potongan harga sudah tercermin di OrcaRouter (markup 0%) — Luna seharga $0.20 / $1.20, Sol seharga $4 / $20 — melalui satu endpoint yang kompatibel dengan OpenAI.

Apa yang sebenarnya berubah?

Keluarga GPT-5.6 OpenAI beroperasi sebagai tangga tingkatan: Luna (cepat, termurah), Terra (menengah), dan Sol (unggulan). Pemotongan 30 Juli menyentuh dua tingkatan yang lebih murah. Menurut kartu tarif yang dilaporkan, GPT-5.6 Luna turun dari $1 / $6 menjadi $0,20 / $1,20 per juta token input/output — sekitar pengurangan 80% pada input dan output — dan GPT-5.6 Terra turun dari $2,50 / $15 menjadi $2 / $12, kira-kira 20%. GPT-5.6 Sol, unggulan yang dibangun untuk penalaran tersulit dan pengkodean agen, tidak tersentuh hari itu — tetapi pada 21 Agustus 2026, OpenAI mengumumkan pemotongan sementara untuknya juga: harga API turun lebih dari 20% untuk tiga bulan ke depan, menjadi $4 per juta token input dan $20 per juta token output, dengan input cache turun dari $0,50 menjadi $0,40. Pengumuman yang sama menyebutkan bahwa kredit yang Anda beli lebih berharga di Codex pada paket berbasis token, dan penggunaan yang termasuk dalam langganan Anda tetap sama.

Tarif dasar per token bukanlah keseluruhan cerita. Penetapan harga GPT-5.6 juga memiliki jenjang panjang input (konteks yang sangat panjang berpindah ke tarif lebih tinggi), diskon cache prompt (input yang di-cache jauh lebih murah daripada input segar), dan opsi batch (pekerjaan asinkron dengan diskon). Ketiganya tetap berlaku setelah pemotongan, sehingga harga efektif untuk beban kerja yang banyak menggunakan cache atau batch bisa lebih rendah lagi. Perhatikan jenjang konteks panjang ke arah sebaliknya: memberikan prompt yang sangat besar dapat menaikkan Anda ke jenjang yang lebih tinggi.

Dua optimasi di balik potongan ini

Ini bukan gestur loss-leader — OpenAI membingkainya sebagai dividen efisiensi. Dalam tulisan teknis tanggal 29 Juli 2026, para anggota staf teknis OpenAI memaparkan optimasi di seluruh proses inferensi dan harness agen di balik Codex dan ChatGPT Work. Dua hal menonjol. Pertama, penulisan ulang kernel GPU di seluruh infrastruktur produksi — dengan Sol, yang berjalan di dalam Codex, digunakan untuk menulis ulang kernel milik perusahaan itu sendiri — yang menurut OpenAI memangkas biaya penyajian end-to-end sekitar 20%. Kedua, model draf speculative-decoding yang didesain ulang dan dilaporkan meningkatkan efisiensi pembuatan token hingga lebih dari 15%. Biaya penyajian yang lebih rendah, diteruskan ke pelanggan sebagai harga yang lebih murah pada tier volume tinggi, itulah ceritanya — dan ini adalah sekilas dari lingkaran umpan balik yang sedang dikejar seluruh industri: menggunakan model frontier untuk mengoptimalkan infrastruktur yang melayani mereka.

Pemotongan Sol yang diumumkan pada 21 Agustus membawa kerangka yang sama. Menurut OpenAI, pengurangan — lebih dari 20% untuk tiga bulan ke depan — terjadi karena perusahaan membuat model lebih efisien untuk dijalankan, dan secara eksplisit bersifat sementara, bukan pengaturan ulang harga permanen.

Bagaimana perbandingan harga-harga baru

Pemotongan harga ini diarahkan langsung pada persaingan. Menurut laporan Unite.AI, harga baru Luna $0.20 / $1.20 memangkas harga Anthropic Haiku 4.5 sekitar 5x untuk input dan sekitar 4x untuk output, dan harga baru Terra $2 / $12 berada di bawah harga standar Claude Sonnet 5 (dilaporkan $3 / $15 yang berlaku setelah 31 Agustus 2026). Di antara model open-weight, Luna kini berada dekat dengan batas bawah biaya inferensi yang ditetapkan oleh lini DeepSeek V4 dan Zhipu GLM-5.2 (sekitar $1.20 / $4.10), dengan tingkat harga Alibaba Qwen dan Google Gemini Flash berada di kisaran yang sama. Pemotongan sementara Sol menjadi $4 / $20 menjaga produk unggulan tetap di atas tingkat harga volume mereka sendiri tetapi mengurangi premi — dan pengurangan sepertiga pada token output paling berarti untuk beban kerja agen yang berat pada output. Pemberitaan tentang langkah ini mencatat bahwa hal itu terjadi saat OpenAI menghadapi persaingan yang semakin ketat dari Anthropic dan model AI Tiongkok.

Inferensi terus semakin murah.

Mundur selangkah dan pemotongan harga ini sesuai dengan tren multi-tahun: biaya untuk tingkat kapabilitas tertentu telah turun tajam, generasi demi generasi, seiring laboratorium-laboratorium memeras lebih banyak throughput dari perangkat keras yang sama. Tingkatan lama OpenAI sendiri menggambarkan tren penurunan seiring waktu, dan setiap terobosan efisiensi — kernel yang lebih baik, speculative decoding, attention yang lebih murah — cenderung muncul sebagai pemotongan harga dalam hitungan bulan. Bagi pembeli, implikasi praktisnya adalah merancang arsitektur untuk dunia di mana inferensi menjadi lebih murah secara terjadwal: jangan terlalu terikat pada harga satu model, dan jaga agar biaya perpindahan tetap murah.

Biaya tersembunyi yang perlu diperhatikan: token penalaran

Model GPT-5.6 adalah model penalaran, dan hal itu membentuk pengeluaran di dunia nyata. Ketika penalaran diaktifkan, model mengeluarkan token penalaran internal yang ditagih sebagai keluaran — sehingga biaya keluaran efektif Anda bisa lebih tinggi daripada perkiraan naif "kata-kata dalam jawaban", terutama pada prompt sulit dengan upaya penalaran tinggi. Solusinya adalah menyetel upaya penalaran sesuai tugas (rendah atau nonaktif untuk panggilan sederhana), membatasi keluaran bila memungkinkan, dan mengukur penggunaan token aktual daripada berasumsi. Tarif per token yang lebih murah membantu, tetapi mengontrol berapa banyak token yang Anda hasilkan lebih membantu.

Apa artinya bagi pengembang

Jika Anda menggunakan GPT-5.6 Luna atau Terra untuk pekerjaan bervolume tinggi — klasifikasi, ekstraksi, perutean, agen ringan, obrolan — tagihan Anda baru saja turun, dalam beberapa kasus hingga sebagian besar nilainya, tanpa perlu perubahan kode. Hal itu membuat tingkatan volume semakin menarik untuk beban kerja yang sensitif terhadap biaya dan mempersempit kesenjangan harga dibandingkan model terbuka murah. Matematika unggulan juga telah berubah, setidaknya untuk saat ini: Sol seharga $4 / $20 untuk tiga bulan ke depan menurunkan biaya pekerjaan yang berat penalaran dan agenik di tingkatan teratas, dan kredit kerja Codex serta ChatGPT Work berbasis token bertahan lebih lama. Ini tetap menjadi pilihan premium untuk tugas-tugas tersulit — hanya saja lebih murah dari sebelumnya. Pola kemenangannya sama: rute berdasarkan tingkat kesulitan — tingkatan murah (atau model terbuka murah) untuk 80% yang mudah, dan unggulan hanya di tempat yang layak dengan biayanya.

Cara memangkas tagihan Anda lebih lanjut

Penurunan harga adalah fondasi untuk membangun, bukan garis akhir. Pengungkit tambahan terbesar: caching prompt (gunakan ulang prompt sistem yang stabil atau konteks panjang dan bayar tarif yang jauh lebih rendah untuk input yang di-cache); opsi batch (jalankan pekerjaan non-mendesak secara asinkron dengan diskon); perutean tier dan model (kirim setiap permintaan ke model termurah yang bisa menanganinya, termasuk model terbuka); dan kontrol penalaran (jangan bayar untuk penalaran mendalam pada panggilan sepele). Jika digabungkan, cara-cara ini secara rutin memangkas tagihan nyata jauh lebih besar daripada perubahan tarif tunggal mana pun. Sebagai patokan konkret: pada 10 juta token per bulan dengan 70% porsi input, tarif baru Luna sekitar $5 per bulan (sekitar $4,37 dengan caching); volume yang sama di Sol sekitar $125 per bulan — argumen paling jelas untuk perutean berdasarkan tingkat kesulitan.

Cara mendapatkan harga yang lebih rendah dengan segera

Inilah bagian yang menghubungkan semuanya. OrcaRouter mengenakan markup 0% dan meneruskan harga dari penyedia secara langsung, sehingga penurunan harga OpenAI sudah aktif di OrcaRouter: GPT-5.6 Luna menampilkan $0.20 / $1.20, Terra $2 / $12, dan GPT-5.6 Sol $4 / $20 di halaman model saat ini — tarif yang sama dengan kartu harga milik OpenAI sendiri, dapat diakses melalui satu endpoint yang kompatibel dengan OpenAI bersama 185+ model lainnya. Anda mendapatkan penurunan harga tanpa migrasi, dan Anda dapat membandingkan harga Sol, Luna, dan Terra dengan DeepSeek, GLM, Qwen, Gemini, dan Claude di satu tempat, lalu mengarahkan setiap permintaan ke opsi termurah untuk pekerjaan tersebut. Ada juga tier gratis dan halaman Offers untuk penghematan tambahan.

Potongan harga sudah berlaku di OrcaRouter: GPT-5.6 Luna seharga $0.20 / $1.20 dan GPT-5.6 Sol seharga $4 / $20 per 1 juta token, diteruskan dengan markup 0%.

Atur rute berdasarkan tingkat kesulitan untuk menghemat lebih banyak.

Tagihan termurah bukanlah satu model — melainkan model yang tepat untuk setiap permintaan. Karena OrcaRouter mengekspos seluruh lini model melalui satu endpoint, Anda dapat mengirim panggilan mudah bervolume tinggi ke Luna atau model open-source yang murah, dan menyimpan Sol atau model unggulan lain untuk tugas-tugas sulit, cukup dengan mengubah konfigurasi, bukan integrasi ulang. Pemotongan harga pada Luna membuat strategi penentuan rute berdasarkan tingkat kesulitan itu semakin murah, dan diskon sementara Sol juga menurunkan biaya panggilan sulit — tanpa perlu memasang ulang apa pun.

FAQ

Berapa besar OpenAI memotong harga GPT-5.6?

GPT-5.6 Luna turun dari $1 / $6 menjadi $0.20 / $1.20 per juta token (sekitar 80%), dan GPT-5.6 Terra dari $2.50 / $15 menjadi $2 / $12 (sekitar 20%). Pada 21 Agustus 2026, OpenAI juga memangkas harga GPT-5.6 Sol dari $5 / $30 menjadi $4 / $20 untuk tiga bulan ke depan.

Kapan potongan harga mulai berlaku?

Pemotongan Luna dan Terra mulai berlaku pada 30 Juli 2026, langsung pada kartu tarif yang diterbitkan. OpenAI mengumumkan pengurangan Sol sementara pada 21 Agustus 2026, untuk tiga bulan berikutnya.

Mengapa OpenAI menurunkan harga?

{{1}}OpenAI mengaitkan pemotongan bulan Juli dengan optimalisasi inferensi — kernel GPU produksi yang ditulis ulang (sekitar 20% lebih rendah biaya penyajian) dan model draf decoding spekulatif yang didesain ulang (efisiensi pembuatan token 15%+) — menurut postingan teknik pada 29 Juli 2026.{{/1}} {{2}}Ini menggambarkan pemotongan Sol dengan cara yang sama, sebagai langkah yang diambil sementara model menjadi lebih murah untuk dijalankan, di pasar dengan persaingan yang semakin ketat.{{/2}}

Apakah flagship (Sol) menjadi lebih murah?

Ya — untuk sementara. Pemotongan pada 30 Juli membuat GPT-5.6 Sol berada di $5 / $30, tetapi pada 21 Agustus 2026, OpenAI mengumumkan penurunan harga lebih dari 20% untuk tiga bulan berikutnya, menjadi $4 / $20 per juta token. Kredit berbasis token Codex dan ChatGPT Work juga memberi lebih banyak, sementara penggunaan langganan tetap tidak berubah.

Bagaimana harga baru dibandingkan dengan Anthropic dan model terbuka?

Berdasarkan laporan, Luna kini mematok harga lebih rendah dari Anthropic's Haiku 4.5, sekitar 5x lebih murah untuk input dan 4x untuk output, sementara Terra berada di bawah harga standar Claude Sonnet 5 ($3 / $15). Luna juga berada di dekat batas bawah model terbuka yang murah, yang ditetapkan oleh DeepSeek dan GLM-5.2.

Apa kelemahan dari token penalaran?

GPT-5.6 adalah model penalaran; token penalaran internal ditagih sebagai output, sehingga biaya output efektif dapat melebihi perkiraan sederhana. Sesuaikan upaya penalaran dan batasi output untuk mengendalikannya.

Bagaimana cara mendapatkan harga baru yang lebih rendah?

Mereka sudah tersedia di API OpenAI dan, dengan markup 0%, di OrcaRouter — di mana GPT-5.6 Luna menunjukkan $0,20 / $1,20 dan GPT-5.6 Sol $4 / $20 — melalui satu endpoint yang kompatibel dengan OpenAI, tanpa perlu perubahan kode.

Intinya

Pemotongan harga OpenAI pada 30 Juli membuat GPT-5.6 Luna dan Terra jauh lebih murah untuk pekerjaan volume tinggi, dan pengumuman 21 Agustus memperluas cerita ini ke model unggulan: GPT-5.6 Sol turun menjadi $4 / $20 untuk tiga bulan ke depan, sementara kredit token Codex memberi lebih banyak dan penggunaan langganan tetap tidak berubah. Kedua putaran ini adalah dividen efisiensi — penulisan ulang kernel dan peningkatan decoding spekulatif di satu sisi, penyajian yang lebih murah untuk dijalankan di sisi lain — serta respons yang jelas terhadap perang harga yang nyata. Rutekan berdasarkan tingkat kesulitan, andalkan caching dan batching, serta kendalikan token penalaran untuk menghemat paling banyak. Dan karena OrcaRouter meneruskan harga penyedia dengan markup 0%, tarif yang lebih rendah sudah aktif di sana — Luna seharga $0.20 / $1.20, Sol seharga $4 / $20 — harga yang sama, satu endpoint yang kompatibel dengan OpenAI, seluruh lanskap model di satu tempat. Manfaatkan pemotongan ini tanpa mengubah satu baris kode pun, dan biarkan setiap permintaan memilih model termurah yang bisa menyelesaikan pekerjaan.