
OpenAI Memangkas Harga API GPT-5.6: Apa yang Berubah, Mengapa, dan Cara Mendapatkannya
- qwenBARUQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 per 1 juta token · 55 tok/s
- deepseekBARUDeepSeek: DeepSeek V4 Flash 07312026-07-3150Kecerdasan69Koding
- qwenBARUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 206 tok/s
- orcaBARUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicBARUAnthropic: Claude Opus 52026-07-2461Kecerdasan78Koding
- googleBARUGoogle: Gemini 3.6 Flash2026-07-2150Kecerdasan69Koding
- googleBARUGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1651Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1557Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0854Kecerdasan72Koding
- tencentTencent: Hy32026-07-0641Kecerdasan59Koding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Kecerdasan42Koding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Kecerdasan39Koding
- anthropicAnthropic: Claude Sonnet 52026-06-3053Kecerdasan72Koding
- klingKling: Kling 3.0 Turbo2026-06-1757Kecerdasan52Koding57Matematika
- z-aiZ.ai: GLM 5.22026-06-1651Kecerdasan69Koding60Matematika
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Kecerdasan61Koding61Matematika
Pada 30 Juli 2026, OpenAI memangkas harga API dari dua model GPT-5.6 yang lebih murah — dengan tajam mengurangi tingkat termurah dan memangkas tingkat menengah, sementara model andalannya tidak tersentuh. Ini adalah langkah penting dalam perang harga yang semakin ketat, dan langsung tercantum di daftar tarif yang dipublikasikan. Artikel ini menjelaskan persis apa yang berubah, rekayasa di baliknya, bagaimana harga baru dibandingkan dengan para pesaing, biaya tersembunyi yang perlu diwaspadai, cara memangkas tagihan Anda lebih jauh — dan bagaimana harga yang lebih rendah sudah aktif di OrcaRouter dengan markup 0%.
Setiap angka di bawah ini diberi label berdasarkan sumbernya. Harga adalah per juta token (input / output) dan mencerminkan kartu tarif OpenAI tanggal 30 Juli 2026 sebagaimana dilaporkan oleh outlet termasuk Unite.AI, plus halaman model pass-through OrcaRouter; angka pesaing diberikan atribusi. Harga dapat berubah — verifikasi sebelum Anda membangun.
Singkatnya: OpenAI menurunkan harga GPT-5.6 Luna menjadi $0,20 / $1,20 (dari $1 / $6, turun ~80%) dan GPT-5.6 Terra menjadi $2 / $12 (dari $2,50 / $15, turun ~20%), sementara GPT-5.6 Sol tetap di $5 / $30. Dua efisiensi yang mendanai penurunan ini: penulisan ulang kernel GPU (biaya penyajian turun sekitar 20%) dan model draf speculative-decoding yang didesain ulang (generasi token lebih cepat 15%+). Pemotongan ini membawa Luna ke bawah Haiku 4.5 milik Anthropic dan mendekati batas bawah model open-source murah yang ditetapkan DeepSeek dan GLM. Jika Anda merutekan melalui endpoint netral-vendor tanpa markup 0% seperti OrcaRouter, tarif baru sudah aktif — harga sama, satu API yang kompatibel dengan OpenAI, dengan semua model pesaing di sisinya untuk dibandingkan dan dirutekan.
Poin-poin penting
• GPT-5.6 Luna: sekarang $0.20 / $1.20 per 1 juta token, turun dari $1 / $6 — kira-kira potongan 80%.
• GPT-5.6 Terra: sekarang $2 / $12, turun dari $2.50 / $15 — sekitar potongan 20%.
• GPT-5.6 Sol (unggulan): tetap di $5 / $30.
• Mengapa: kernel GPU produksi yang ditulis ulang (biaya penyajian ~20% lebih rendah) plus desain ulang model draft dengan decoding spekulatif (efisiensi pembuatan token 15%+), menurut pos rekayasa OpenAI tanggal 29 Juli.
• Cara mendapatkannya: potongan harga tersebut sudah tercermin di OrcaRouter (markup 0%) — Luna dengan harga $0,20 / $1,20 — melalui satu endpoint yang kompatibel dengan OpenAI.
Apa yang sebenarnya berubah?
Keluarga GPT-5.6 dari OpenAI berjalan sebagai tangga tingkatan: Luna (cepat, termurah), Terra (menengah), dan Sol (unggulan). Pemotongan 30 Juli menghantam dua tingkatan yang lebih murah. Menurut kartu tarif yang dilaporkan, GPT-5.6 Luna turun dari $1 / $6 menjadi $0.20 / $1.20 per juta token input/output — sekitar pengurangan 80% pada input dan output — dan GPT-5.6 Terra turun dari $2.50 / $15 menjadi $2 / $12, sekitar 20%. GPT-5.6 Sol, unggulan yang dibangun untuk penalaran paling sulit dan pengkodean agen, tetap di $5 / $30. Tingkatan volume menjadi jauh lebih murah; tingkatan teratas tidak bergerak.
Tarif dasar per token bukanlah keseluruhan cerita. Penetapan harga GPT-5.6 juga memiliki jenjang panjang input (konteks yang sangat panjang berpindah ke tarif lebih tinggi), diskon cache prompt (input yang di-cache jauh lebih murah daripada input segar), dan opsi batch (pekerjaan asinkron dengan diskon). Ketiganya tetap berlaku setelah pemotongan, sehingga harga efektif untuk beban kerja yang banyak menggunakan cache atau batch bisa lebih rendah lagi. Perhatikan jenjang konteks panjang ke arah sebaliknya: memberikan prompt yang sangat besar dapat menaikkan Anda ke jenjang yang lebih tinggi.

Dua optimasi di balik potongan ini
Ini bukan gestur loss-leader — OpenAI membingkainya sebagai dividen efisiensi. Dalam tulisan teknis tanggal 29 Juli 2026, para anggota staf teknis OpenAI memaparkan optimasi di seluruh proses inferensi dan harness agen di balik Codex dan ChatGPT Work. Dua hal menonjol. Pertama, penulisan ulang kernel GPU di seluruh infrastruktur produksi — dengan Sol, yang berjalan di dalam Codex, digunakan untuk menulis ulang kernel milik perusahaan itu sendiri — yang menurut OpenAI memangkas biaya penyajian end-to-end sekitar 20%. Kedua, model draf speculative-decoding yang didesain ulang dan dilaporkan meningkatkan efisiensi pembuatan token hingga lebih dari 15%. Biaya penyajian yang lebih rendah, diteruskan ke pelanggan sebagai harga yang lebih murah pada tier volume tinggi, itulah ceritanya — dan ini adalah sekilas dari lingkaran umpan balik yang sedang dikejar seluruh industri: menggunakan model frontier untuk mengoptimalkan infrastruktur yang melayani mereka.
Bagaimana perbandingan harga-harga baru
Pemotongan harga ini jelas ditujukan untuk bersaing. Menurut laporan Unite.AI, harga baru Luna yang $0.20 / $1.20 lebih rendah dari Haiku 4.5 milik Anthropic sekitar 5x untuk input dan sekitar 4x untuk output, dan harga baru Terra yang $2 / $12 berada di bawah harga standar Claude Sonnet 5 (dilaporkan $3 / $15 yang berlaku setelah 31 Agustus 2026). Dibandingkan dengan model open-weight, Luna kini berada dekat dengan batas bawah biaya inferensi murah yang ditetapkan oleh lini V4 DeepSeek dan GLM-5.2 Zhipu (sekitar $1.20 / $4.10), dengan Qwen dari Alibaba dan Gemini Flash dari Google berada di kisaran yang sama. Dengan kata lain, OpenAI memindahkan tier volume mereka ke tempat model-model murah yang mumpuni sudah berada—mempersempit penalti harga untuk memilih model proprietary dibandingkan model open.
Inferensi terus semakin murah.
Mundur selangkah dan pemotongan harga ini sesuai dengan tren multi-tahun: biaya untuk tingkat kapabilitas tertentu telah turun tajam, generasi demi generasi, seiring laboratorium-laboratorium memeras lebih banyak throughput dari perangkat keras yang sama. Tingkatan lama OpenAI sendiri menggambarkan tren penurunan seiring waktu, dan setiap terobosan efisiensi — kernel yang lebih baik, speculative decoding, attention yang lebih murah — cenderung muncul sebagai pemotongan harga dalam hitungan bulan. Bagi pembeli, implikasi praktisnya adalah merancang arsitektur untuk dunia di mana inferensi menjadi lebih murah secara terjadwal: jangan terlalu terikat pada harga satu model, dan jaga agar biaya perpindahan tetap murah.
Biaya tersembunyi yang perlu diperhatikan: token penalaran
Model GPT-5.6 adalah model penalaran, dan hal itu membentuk pengeluaran di dunia nyata. Ketika penalaran diaktifkan, model mengeluarkan token penalaran internal yang ditagih sebagai keluaran — sehingga biaya keluaran efektif Anda bisa lebih tinggi daripada perkiraan naif "kata-kata dalam jawaban", terutama pada prompt sulit dengan upaya penalaran tinggi. Solusinya adalah menyetel upaya penalaran sesuai tugas (rendah atau nonaktif untuk panggilan sederhana), membatasi keluaran bila memungkinkan, dan mengukur penggunaan token aktual daripada berasumsi. Tarif per token yang lebih murah membantu, tetapi mengontrol berapa banyak token yang Anda hasilkan lebih membantu.
Apa artinya bagi pengembang
Jika Anda menggunakan GPT-5.6 Luna atau Terra untuk pekerjaan volume tinggi — klasifikasi, ekstraksi, perutean, agen ringan, obrolan — tagihan Anda baru saja turun, dalam beberapa kasus hampir sebagian besar nilainya, tanpa perlu perubahan kode. Itu membuat tingkatan volume semakin menarik untuk beban kerja yang sensitif terhadap biaya dan mempersempit kesenjangan harga dibandingkan model terbuka murah. Perhitungan model andalan tidak berubah: Sol di $5 / $30 tetap menjadi pilihan premium untuk tugas-tugas tersulit. Pola yang menang adalah merutekan berdasarkan tingkat kesulitan — tingkatan murah (atau model terbuka murah) untuk 80% tugas mudah, dan model andalan hanya di tempat yang sepadan dengan biayanya.
Cara memangkas tagihan Anda lebih lanjut
Penurunan harga adalah fondasi untuk membangun, bukan garis akhir. Pengungkit tambahan terbesar: caching prompt (gunakan ulang prompt sistem yang stabil atau konteks panjang dan bayar tarif yang jauh lebih rendah untuk input yang di-cache); opsi batch (jalankan pekerjaan non-mendesak secara asinkron dengan diskon); perutean tier dan model (kirim setiap permintaan ke model termurah yang bisa menanganinya, termasuk model terbuka); dan kontrol penalaran (jangan bayar untuk penalaran mendalam pada panggilan sepele). Jika digabungkan, cara-cara ini secara rutin memangkas tagihan nyata jauh lebih besar daripada perubahan tarif tunggal mana pun. Sebagai patokan konkret: pada 10 juta token per bulan dengan 70% porsi input, tarif baru Luna sekitar $5 per bulan (sekitar $4,37 dengan caching); volume yang sama di Sol sekitar $125 per bulan — argumen paling jelas untuk perutean berdasarkan tingkat kesulitan.
Cara mendapatkan harga yang lebih rendah dengan segera
Inilah bagian yang menyatukan semuanya. a href="https://www.orcarouter.ai/">OrcaRouter/a> membebankan markup 0% dan meneruskan harga penyedia secara langsung, sehingga potongan harga OpenAI sudah aktif di OrcaRouter: GPT-5.6 Luna menampilkan $0,20 / $1,20 dan Terra $2 / $12 di halaman model saat ini — tarif yang sama dengan kartu OpenAI sendiri, dapat diakses melalui satu endpoint yang kompatibel dengan OpenAI bersama 185+ model lainnya. Anda mendapatkan potongan harga tersebut tanpa migrasi, dan Anda dapat membandingkan harga Luna dan Terra dengan DeepSeek, GLM, Qwen, Gemini, dan Claude di satu tempat, lalu mengarahkan setiap permintaan ke yang paling murah untuk tugas tersebut. Ada juga tingkat gratis dan halaman Offers untuk penghematan tambahan.

Potongan harga sudah tersedia di OrcaRouter: GPT-5.6 Luna seharga $0.20 / $1.20 per 1 juta token, diteruskan dengan markup 0%.
Atur rute berdasarkan tingkat kesulitan untuk menghemat lebih banyak.
Tagihan termurah bukanlah satu model — melainkan model yang tepat untuk setiap permintaan. Karena OrcaRouter mengekspos seluruh bidang melalui satu endpoint, Anda dapat mengirim panggilan mudah bervolume tinggi ke Luna atau model open-source murah, dan menyimpan Sol atau model unggulan lainnya untuk yang sulit, beralih dengan perubahan konfigurasi, bukan integrasi ulang. Penurunan harga pada Luna membuat strategi perutean berdasarkan tingkat kesulitan itu semakin murah, tanpa Anda perlu mengubah apa pun.

FAQ
Berapa besar OpenAI memotong harga GPT-5.6?
GPT-5.6 Luna turun dari $1 / $6 menjadi $0.20 / $1.20 per juta token (sekitar 80%), dan GPT-5.6 Terra dari $2.50 / $15 menjadi $2 / $12 (sekitar 20%). GPT-5.6 Sol tetap di $5 / $30.
Kapan potongan harga mulai berlaku?
30 Juli 2026, tercatat dalam changelog API OpenAI dan berlaku di kartu tarif yang dipublikasikan.
Mengapa OpenAI menurunkan harga?
OpenAI mengaitkannya dengan optimasi inferensi — kernel GPU produksi yang ditulis ulang (sekitar 20% lebih rendah biaya penyajian) dan model draf speculative-decoding yang didesain ulang (efisiensi pembuatan token 15%+) — menurut sebuah kiriman teknik pada 29 Juli 2026.
Apakah flagship (Sol) menjadi lebih murah?
Tidak. GPT-5.6 Sol tetap $5 / $30 per juta token. Hanya dua tingkatan yang lebih murah, Luna dan Terra, yang dipotong.
Bagaimana harga baru dibandingkan dengan Anthropic dan model terbuka?
Berdasarkan laporan, Luna kini mematok harga lebih rendah dari Anthropic's Haiku 4.5, sekitar 5x lebih murah untuk input dan 4x untuk output, sementara Terra berada di bawah harga standar Claude Sonnet 5 ($3 / $15). Luna juga berada di dekat batas bawah model terbuka yang murah, yang ditetapkan oleh DeepSeek dan GLM-5.2.
Apa kelemahan dari token penalaran?
GPT-5.6 adalah model penalaran; token penalaran internal ditagih sebagai output, sehingga biaya output efektif dapat melebihi perkiraan sederhana. Sesuaikan upaya penalaran dan batasi output untuk mengendalikannya.
Bagaimana cara mendapatkan harga baru yang lebih rendah?
Mereka sudah aktif di API OpenAI dan, dengan markup 0%, di OrcaRouter — di mana GPT-5.6 Luna menunjukkan $0,20 / $1,20 — melalui satu endpoint yang kompatibel dengan OpenAI, tanpa perlu perubahan kode.
Intinya
Pemangkasan harga OpenAI pada 30 Juli membuat GPT-5.6 Luna dan Terra jauh lebih murah untuk pekerjaan bervolume tinggi — dividen efisiensi dari penulisan ulang kernel dan peningkatan decoding spekulatif, serta respons yang jelas terhadap perang harga nyata yang kini memotong harga di bawah tingkatan murah Anthropic dan mendekati batas bawah model terbuka. Model unggulan Sol tidak berubah, jadi arahkan permintaan berdasarkan tingkat kesulitan, andalkan caching dan batching, serta kendalikan token penalaran untuk penghematan terbesar. Dan karena OrcaRouter meneruskan harga penyedia dengan markup 0%, tarif yang lebih rendah sudah aktif di sana — harga sama, satu endpoint yang kompatibel dengan OpenAI, seluruh lanskap model ada di satu tempat. Manfaatkan potongan harga ini tanpa mengubah satu baris kode pun, dan biarkan setiap permintaan memilih model termurah yang mampu menyelesaikan pekerjaannya.
