Kartu judul hero bertuliskan 'OpenAI's Decisions API', dengan subjudul 'GPT-6 Luna berhenti mengobrol dan memilih satu jawaban', dengan tiga kartu membulat bertuliskan 'Satu jawaban dari daftar yang Anda tentukan', 'Dinyatakan vendor ~150 ms' dan 'Belum ada harga yang dipublikasikan', footer bertuliskan 'Angka OpenAI dilaporkan vendor; belum ada pengukuran independen.', dan logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Decisions API OpenAI: GPT-6 Luna Berhenti Mengobrol dan Memilih Satu Jawaban

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

GPT-6 Luna dirilis pada 22 September 2026 sebagai tingkat murah dari rangkaian GPT-6 OpenAI. Yang baru pada 29 September adalah tugas untuknya yang tidak ada hubungannya dengan percakapan. Decisions API milik OpenAI menerima pertanyaan yang Anda tulis, daftar jawaban terbatas yang Anda izinkan, dan sepotong konteks — teks atau gambar — lalu mengembalikan salah satu jawaban tersebut. Bukan prosa. Bukan paragraf yang harus diurai lalu diharapkan. Satu pilihan saja, sehingga tiket dukungan masuk ke salah satu dari lima antrean, gambar masuk ke salah satu kategori moderasi, atau agen memilih langkah berikutnya berdasarkan kebijakan yang Anda tentukan. Ini diumumkan di DevDay 2026 dan sekarang dalam pratinjau terbatas, dengan OpenAI mengatakan bahwa rilis luas direncanakan dalam beberapa hari ke depan.

Sebagian besar dari apa yang dibutuhkan sebuah tim sebelum membangun di atas ini belum dipublikasikan. Tidak ada harga per panggilan, tidak ada batas yang dinyatakan tentang berapa banyak jawaban kandidat yang dapat dibawa oleh sebuah permintaan, tidak ada pernyataan tentang apakah Anda dapat menyetelnya dengan data Anda sendiri, dan — per 30 September — tidak ada entri untuknya di mana pun dalam indeks dokumentasi developer, changelog, atau referensi API milik OpenAI sendiri. Kami memeriksa ketiganya. Kemampuan tersebut saat ini ada dalam rekap DevDay OpenAI dan dalam pernyataan yang disampaikan seorang juru bicara OpenAI kepada wartawan pada hari peluncuran. Jadi sisa artikel ini menjaga tiga tingkatan tetap terpisah secara jelas: apa yang telah dikonfirmasi OpenAI, apa yang diklaim oleh satu pengukuran pada hari peluncuran, dan apa yang belum dapat diketahui siapa pun.

Apa sebenarnya keputusan yang dibatasi itu

Dua pendekatan yang sudah ada menjalankan tugas ini dengan buruk, dan Decisions API ditujukan untuk celah di antara keduanya. Yang pertama adalah memberikan prompt ke model chat: Anda menulis instruksi yang cermat yang memintanya memilih dari daftar, ia menuliskan kalimat untuk Anda, dan jika beruntung Anda dapat membaca probabilitas token dari respons untuk mendapatkan sesuatu yang menyerupai skor keyakinan. Cara ini berhasil, tetapi memakan token, dan angka keyakinannya hanyalah tebakan kasar. Yang kedua adalah melatih pengklasifikasi kecil: cepat, murah, dan membutuhkan data berlabel plus proses pelatihan ulang setiap kali kumpulan label berubah.

Model keputusan berada di antara keduanya. Model ini menerima label baru dalam prompt — sama seperti yang dilakukan prompt — tetapi mengembalikan skor atau pilihan yang dapat dijadikan cabang oleh pengembang tanpa parsing, yang merupakan properti yang dimiliki pengklasifikasi dan tidak pernah dimiliki model chat. OpenAI tidak asing dengan bentuk ini: Moderation API-nya telah mengembalikan skor per kategori alih-alih teks selama bertahun-tahun, dengan satu perbedaan yang penting di sini. Kategori Moderation adalah milik OpenAI. Kategori Decisions API adalah milik Anda.

Batasan adalah produknya, dan perlu untuk tepat mengenai apa yang diberikannya dan tidak diberikannya. Ruang keluaran yang terbatas berarti setiap nilai yang diizinkan diketahui sebelumnya, sehingga aplikasi Anda dapat menolak jawaban yang tidak didefinisikannya, melampirkan tingkat izin yang berbeda pada setiap cabang, dan beralih ke manusia ketika keyakinan atau konteksnya kurang. Ini juga membuat evaluasi offline dapat ditangani, karena setiap kasus uji memiliki kelas target dan biaya yang terukur ketika salah. Yang tidak diberikannya adalah kebenaran. Model yang dibatasi tetap dapat memilih jawaban valid yang salah, diarahkan oleh konteks yang menyesatkan, atau mewarisi bias dari kategori yang Anda tulis.

Klaim 150 milidetik, dan angka yang tidak dipublikasikan OpenAI

OpenAI mengatakan Decisions API membuat keputusan sekitar sepuluh kali lebih cepat daripada yang dilakukan GPT-6 Luna melalui API reguler — sekitar 150 milidetik berbanding sekitar 1,6 detik. Angka itu dinyatakan oleh vendor dan belum direproduksi; tidak ada pengukuran independen atasnya dalam dua hari sejak peluncuran, dan rekap OpenAI sendiri hanya menyebut "pengambilan keputusan waktu nyata." Tidak ada distribusi latensi, tidak ada wilayah, tidak ada ukuran input, tidak ada tingkat konkurensi, dan tidak ada perjanjian tingkat layanan yang menyertai angka tersebut.

Data lalu lintas kami sendiri bukan pengganti uji tersebut, tetapi menjelaskan mengapa distribusi yang hilang itu penting. Selama tujuh hari hingga 30 September, GPT-6 Luna yang dilayani melalui rute chat-completions normal OrcaRouter menunjukkan median 699 milidetik dan p95 7,6 detik untuk 3,23 miliar token dengan beban kerja campuran — sebaran lebih dari satu orde besaran antara bagian tengah dan ekor. Itu bentuk permintaan yang berbeda dari keputusan yang dibatasi, jadi bukan perbandingan dengan klaim 150 ms. Itulah alasan p50 tunggal sebagai judul adalah angka yang salah untuk dijadikan dasar merancang tenggat waktu. Jika Anda menguji pratinjau, catat median, p95, dan p99 secara terpisah untuk input teks dan gambar, sertakan waktu jaringan dan percobaan ulang, dan ukur tenggat waktu yang benar-benar dimiliki produk Anda — keputusan perutean untuk antrean asinkron dan keputusan yang berada di antara klik dan pembayaran tidak berbagi anggaran latensi.

A single-column scoreboard titled 'GPT-6 Luna and the Decisions API - the scoreboard' with six rows: Decisions API price 'not published', candidate-answer limit 'not published', fine-tuning on your data 'no statement', stated decision latency '~150 ms vendor-reported', GPT-6 Luna input / output '$0.10 / $0.50 per 1M', and AA Intelligence Index at max effort '37.3', with a footer reading 'OpenAI figures vendor-reported; Index per Artificial Analysis; unpublished means blank, not zero.' and the OrcaRouter logo composited in the bottom-right corner.

Harga: berapa biaya model yang mendasarinya, dan mengapa itu bukan harga API

OpenAI belum menerbitkan tarif apa pun untuk Decisions API. Juga tidak aman untuk mengasumsikan bahwa tarif token Luna berlaku, karena Decisions API adalah paket tersendiri — endpoint yang berbeda dengan batas yang berbeda, dan OpenAI telah mengatakan akan membagikan detail lebih lanjut "pada peluncuran luas." Siapa pun yang saat ini menyebutkan biaya per keputusan kepada Anda sedang menyimpulkannya.

Yang dipublikasikan adalah daftar tarif untuk model yang menjadi dasarnya, yang dibaca dari halaman harga OpenAI pada 30 September 2026:

• Input — $0,10 per juta token, yang menjadi $0,20 di atas 272.000 token input
• Output — $0,50 per juta token, yang menjadi $0,75 di atas 272.000 token input
• Input yang di-cache — $0,01 per juta token; penulisan cache ditagih sebesar $0,125, premi 25% atas tarif tanpa cache
• Pemrosesan Batch dan Flex — 50% dari tarif standar; Fast mode — 2x tarif yang berlaku

Batas konteks panjang adalah hal yang sering membuat orang lengah, dan cara kerjanya sama seperti di seluruh keluarga GPT-6: melewati 272.000 token masukan akan menghitung ulang seluruh permintaan pada tier yang lebih tinggi, bukan hanya bagian yang berlebih. API keputusan yang menyerahkan dokumen panjang atau kumpulan gambar berukuran besar kepada model adalah persis jenis panggilan yang dapat melewati batas itu, yang menjadi satu hal lagi yang dibiarkan terbuka oleh batas-batas preview yang belum dipublikasikan.

GPT-6 Luna menurut ketentuannya sendiri

Jika API-nya dikesampingkan, model di baliknya adalah model penalaran di dasar keluarga bertingkat tiga — di bawah GPT-6 Sol pada $2.00/$10.00 dan GPT-6 Astra sang unggulan pada $10.00/$50.00 — dengan jendela konteks 1.050.000 token, batas keluaran 128.000 token, batas pengetahuan 18 Mei 2026, dan upaya penalaran yang dapat diatur pada enam nilai mulai dari none hingga max. Model ini menerima masukan teks dan gambar serta mengembalikan teks, dan pada dokumentasi pengembang OpenAI sendiri, nilai default untuk upaya tersebut adalah medium. Satu catatan praktis dari halaman yang sama, tidak terkait dengan Decisions API tetapi relevan jika Anda memasang Luna sebagai cadangan: pada Chat Completions, pemanggilan fungsi hanya berfungsi bila upaya penalaran diatur ke none. Tool pada pengaturan upaya lainnya memerlukan Responses API.

Soal kualitas, angka independennya adalah Intelligence Index dari Artificial Analysis sebesar 37,3 untuk Luna pada upaya maksimal, dibandingkan 47,5 untuk GPT-6 Sol — selisih sekitar sepuluh poin, yang merupakan cara jujur untuk membaca selisih harga dua puluh kali pada input. Tidak satu pun angka tersebut merupakan pernyataan tentang Decisions API, yang tugas terbatasnya adalah pengukuran yang sepenuhnya berbeda dan tidak memiliki skor yang dipublikasikan.

OpenAI's developer documentation page for the gpt-6-luna model, showing the model heading with compare and playground controls, the reasoning, speed and price tiles, the '$0.1 - $0.5' price range, text and image input with text output, a 1,050,000-token context window, a 128,000-token maximum output, a May 18 2026 knowledge cutoff, the note that reasoning.effort supports none, low, medium (default), high, xhigh and max, and the note that Chat Completions supports function calling only with reasoning effort set to none.

Jev, Laya, dan kerangka "sistem satu"

Decisions API tidak hadir ke dalam bidang yang kosong. Jev milik TypeSafe AI, yang diluncurkan pada 15 September 2026 oleh Diogo Almeida dan tersedia secara umum sejak 21 September, adalah model yang membuat kategori ini dapat dibaca oleh para pengembang: model ini sama sekali tidak menghasilkan teks, melainkan mengembalikan jawaban bertipe dengan nilai keyakinan, dengan harga $0,042 per juta token masukan dan keluaran ditagih nol. Pengujian independen pertama terhadap Jev, yang dijalankan oleh Every, menempatkan 777 penilaian di 37 dokumen dalam waktu kurang dari 0,7 detik dengan biaya sekitar seperempat sen, dan pengujian kedua mencatat waktunya pada median 0,35 detik per paragraf dibandingkan 8,83 detik untuk Claude Fable 5.1 pada upaya tinggi — sekitar 25 kali lebih cepat dengan biaya kira-kira 1/580, sekaligus menangkap enam dari tujuh cacat yang sengaja ditanam, sementara Fable 5 menangkap ketujuhnya. "Bagus tetapi tidak sempurna" adalah putusan Every, dan itulah bacaan satu baris yang tepat. Laya adalah peserta ketiga dalam bentuk yang sama, sebuah model keputusan yang menjawab tanpa menulis satu token pun.

Apakah OpenAI membangun Decisions API karena Jev adalah spekulasi. The New Stack, yang melaporkannya pada hari peluncuran, menyebut reaksi terhadap TypeSafe "kemungkinan besar" dan mencatat OpenAI mungkin mempercepat pengumuman itu menjelang DevDay; OpenAI tidak mengatakan hal semacam itu, dan penanggalannya — ketersediaan umum Jev pada 21 September, DevDay pada 29 September — memberi petunjuk tetapi bukan bukti. Yang bukan spekulasi adalah bahwa keduanya belum bisa dibandingkan pada dimensi yang diperhatikan pembeli. Jev menerbitkan harga, bentuk per panggilan, dan tanggal GA. Decisions API tidak menerbitkan satu pun dari ketiga hal itu.

Di mana ia berjalan, dan apa yang perlu dijaga tetap hangat di sampingnya

Decisions API adalah paket milik OpenAI sendiri. Ini bukan model di katalog kami dan kami tidak merutekannya, jadi jika Anda menginginkan endpoint spesifik ini, di OpenAI-lah tempatnya. Model yang menjadi dasarnya adalah hal yang berbeda: GPT-6 Luna adalah rute langsung di OrcaRouter dengan harga daftar OpenAI tanpa markup yang diteruskan — $0.10 untuk input dan $0.50 untuk output per juta token, dengan tier di atas 272K dikenakan $0.20/$0.75 — dan selama tujuh hari hingga 30 September, model ini telah melayani 3,23 miliar token melalui kami dengan tingkat kesalahan 0,18%.

Itu penting bagi cara Anda mengurangi risiko sebuah pratinjau. Cara yang masuk akal untuk menguji endpoint keputusan yang dibatasi adalah dengan menjaga jalur berbasis prompt tetap siap sebagai fallback, karena sebuah pratinjau dapat mengubah batas atau harga tanpa pemberitahuan dan keputusan yang berada di jalur kritis perlu tempat untuk berpindah. Menjaga fallback tersebut pada kunci yang sama dengan model Anda yang lain berarti tidak ada kontrak kedua dan tidak ada perubahan kode pada jalur fallback: satu API untuk 200+ model, dengan failover otomatis di seluruh penyedia ketika salah satunya goyah. Dan jika keputusan Anda merupakan satu langkah dari rantai yang lebih panjang, DSL perutean menyusun model menjadi satu panggilan, yang persis merupakan pola orchestrator-plus-decider yang dipopulerkan oleh liputan Jev — model yang lebih besar merencanakan, model kecil memilih setiap langkah. Pola itu dapat dibangun hari ini dari model yang kami layani; Decisions API itu sendiri akan berada di luarnya sampai OpenAI membukanya.

Siapa yang harus bergerak, dan siapa yang harus menunggu.

Jika masalah Anda adalah pekerjaan klasifikasi atau perutean bervolume tinggi di mana cabang yang salah itu murah dan dapat dibalik, pratinjau ini layak untuk bentuk permintaan dan kumpulan berlabel minggu ini — kemampuannya nyata, batasannya adalah peningkatan yang sesungguhnya dibandingkan mengurai prosa, dan pratinjau adalah waktu paling murah untuk mempelajari di mana biaya kesalahannya berakhir. Jika keputusan Anda mengotorisasi uang, mengirim pesan ke pelanggan, atau berada di antara pengguna dan pembayaran, tidak ada yang berubah dari minggu ini dalam kalkulasi Anda: tidak ada harga yang dipublikasikan untuk dimodelkan, tidak ada batas yang dipublikasikan untuk dijadikan acuan desain, tidak ada SLA, dan tidak ada kabar apakah Anda dapat menyetel hal itu pada data Anda sendiri. Empat kekosongan itulah yang harus diisi oleh "peluncuran luas", dan sampai OpenAI menyebutkannya, pembacaan jujur atas Decisions API adalah antarmuka yang menjanjikan dengan jam yang dinyatakan vendor dengan cepat dan tanpa tagihan yang terlampir.

OrcaRouter's model page for openai/gpt-6-luna, showing the model name and OpenAI attribution dated 2026-09-22, capability pills for vision, tools, JSON and reasoning, the description of GPT-6 Luna as the fast cost-efficient model below GPT-6 Sol, the /v1/chat/completions route, a $0.10 input and $0.50 output rate per million tokens with a 699 ms p50 time to first token, a 1M-token context with 128K maximum output, and 3234.7M tokens of traffic.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari