
Di Mana API Decisions OpenAI Berakhir dan Jev Dimulai: Apa yang Ditunjukkan Klien Eksternal Pertama
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 145 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 296 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Pada 23:05 UTC pada 2026-10-06, sebuah plugin bernama llm-openai-decisions dirilis di PyPI, dan README-nya sendiri memuat kalimat yang tidak pernah dimuat oleh liputan peluncuran: "Berbeda dengan Jev, gpt-6-luna adalah model pengambilan keputusan baru yang mendukung masukan gambar selain teks." Penulisnya adalah Simon Willison, yang juga menulis klien pertama untuk model pengambilan keputusan TypeSafe, dan perbandingan yang ia tarik adalah antara GPT-6 Luna — model di balik API Decisions milik OpenAI — dan Jev 1.13, model System One milik TypeSafe yang hanya mendukung teks. Pos blog yang sama mencatat bahwa plugin itu sendiri ditulis oleh GPT-6 Astra saat membaca dokumentasi OpenAI.
Itulah hal yang berguna tentang klien yang dirilis seminggu setelah API: klien itu ditulis berdasarkan bentuk request, bukan keynote, sehingga memunculkan perbedaan yang dihaluskan oleh materi pemasaran. Tidak ada yang bocor di sini dan tidak ada yang belum dikonfirmasi — setiap angka di bawah ini berasal dari halaman yang diterbitkan oleh OpenAI, TypeSafe, atau repositori plugin itu sendiri, semuanya dibaca pada 2026-10-07. Yang masih kurang adalah pengukuran independen terhadap endpoint itu sendiri, dan celah itu dinyatakan di akhir alih-alih ditutup-tutupi.
Ketiga permukaan, dijaga terpisah
Hal pertama yang perlu diluruskan adalah bahwa ini adalah tiga lapisan yang berbeda, dan liputan pers mengaburkannya.
• Endpoint-nya. Milik OpenAI adalah POST /v1/decisions, sebuah rute khusus, bukan mode pada Responses API. Milik TypeSafe adalah POST /v1/systemone. Keduanya menerima body berisi bukti beserta daftar pertanyaan bertipe dan mengembalikan satu jawaban per pertanyaan, dengan kunci berupa nama yang Anda berikan.
• Model. Decisions API saat ini menerima tepat satu model, gpt-6-luna, yang juga merupakan tier murah dari lini GPT-6 umum OpenAI dan dirilis pada 2026-09-22 sebagai model teks dan gambar biasa. Jev 1.13 sepenuhnya adalah model keputusan — ia sama sekali tidak dapat mengeluarkan teks bebas. TypeSafe merilisnya pada 2026-09-15 dan telah tersedia secara umum sejak 2026-09-21.
• Para klien.SDK milik OpenAI sendiri telah mendukung endpoint ini sejak dibuka dalam beta publik pada 2026-10-06, jadi plugin ini bukan cara pertama untuk memanggilnya. Plugin ini adalah klien pertama di luar SDK milik OpenAI sendiri yang dapat kami verifikasi, dan yang pertama ditulis untuk alat command-line, bukan pustaka aplikasi.
Kedua meter itu, berdampingan
Di sinilah README klien lebih bernilai daripada pengumuman, karena angka-angkanya berada tepat di samping kata-katanya.
• Harga — Decisions API menagih $0,10 per juta token masukan tanpa biaya keluaran, tanpa biaya baca cache, dan tanpa biaya tulis cache. Jev 1.13 menagih $0,042 per juta token masukan dengan keluaran gratis. Keduanya menagih untuk apa yang Anda kirim dan tidak menagih apa pun untuk yang kembali, jadi sebuah keputusan berbiaya sepersekian sen pada harga mana pun dan perbedaan di antara keduanya adalah faktor 2,4, bukan model penagihan yang berbeda.
• Masukan — Decisions API menerima teks, atau pesan pengguna yang mencampur teks dengan gambar, dan README plugin menyatakan bahwa lampiran PNG, JPEG, WebP, dan GIF didukung dengan paling banyak 128 gambar dalam satu permintaan. Gambar harus dimasukkan sebagai URL data base64 inline; URL gambar HTTP atau HTTPS yang dihosting dan file_id masukan tidak diterima oleh endpoint, jadi plugin mengonversi URL atau jalur lokal sebelum mengirimnya. Dokumentasi Jev 1.13 tegas ke arah sebaliknya: "Tidak ada masukan gambar, audio, atau video," dan masukan non-teks harus diproses terlebih dahulu menjadi teks atau bidang terstruktur sebelum mencapai state.
• Jenis pertanyaan — OpenAI mendokumentasikan tiga: predikat (probabilitas dari 0 hingga 1 bahwa suatu kondisi yang dinyatakan terpenuhi), pilihan (satu nilai dari daftar Anda, ditambah distribusi dan field keyakinan terpisah), dan skor (rata-rata berbobot probabilitas di seluruh level terurut). Tiga tipe TypeSafe adalah tiga gagasan yang sama dengan nama berbeda: noul untuk ya/tidak, pilihan, dan skor. "Noul" adalah singkatan dari Bernoulli, dan nama itu adalah penanda yang tepat dari perbedaan budaya — satu vendor mengirimkan kata benda berbahasa Inggris yang lugas, yang lain mengirimkan lelucon statistika.
• Aritmetika skor — keduanya cocok persis, yang merupakan tanda terkuat bahwa ini adalah satu kategori produk, bukan dua. Dokumentasi OpenAI memberikan tiga tingkat keparahan dengan probabilitas 0,1, 0,7, dan 0,2 dan mendapatkan kembali skor 1,1 — sengaja berada di antara dua tingkat alih-alih membulatkan ke yang terdekat. Tingkat TypeSafe diindeks nol dengan cara yang sama, dan plugin untuk Jev menerima antara dua hingga sepuluh tingkat berurutan. Halaman OpenAI tidak menyatakan batas atas; itu adalah ketiadaan dalam dokumentasi mereka, bukan batas yang dapat kami nyatakan.
• Anggaran — Jev mendokumentasikan jendelanya secara tepat: sekitar 64.000 token per permintaan, sekitar 32.000 di antaranya mencakup state ditambah pertanyaan tunggal terpanjang, dibandingkan dengan konteks 1.050.000 token yang tercantum dalam katalog kami sendiri untuk GPT-6 Luna sebagai model umum. Halaman keputusan OpenAI tidak mempublikasikan anggaran token sama sekali, hanya catatan bahwa premi pemrosesan regional dan pengali input konteks panjang masih berlaku pada tarif.
Apa yang klien ungkapkan yang tidak diungkapkan oleh pengumuman
Ada tiga detail di dalam plugin dan README-nya yang layak disoroti, karena masing-masing mengubah cara Anda menghubungkan endpoint tersebut.
Yang pertama adalah bahwa sebuah keputusan dapat kembali sebagai penolakan. Dokumentasi OpenAI tidak pernah menjelaskan ini dalam prosa, tetapi setiap contoh SDK bercabang padanya — answer.type === "refusal" dalam JavaScript, sebuah OpenAI::Models::Decision::Answer::Refusal kasus di Ruby — dan README plugin menjelaskan bahwa pertanyaan yang ditolak dipertahankan sebagai {"name":"...","type":"refusal"}. Jadi tipe jawaban secara efektif adalah empat nilai, bukan tiga, dan loop produksi apa pun harus menangani cabang keempat yang tidak disebutkan oleh pengumuman mana pun.
Yang kedua adalah apa yang hilang dari plugin, bukan yang ada di dalamnya. Postingan Willison sendiri membingkai pekerjaan itu sebagai menyuruh GPT-6 Astra membaca dokumentasi baru dan membangun klien darinya — dari dokumentasi ke klien, sekali jalan, tanpa tutorial manusia. Itu sekarang adalah cara normal untuk menulis klien, dan itu berarti pertanyaan apakah dokumentasi suatu endpoint cukup lengkap untuk menghasilkan klien yang berfungsi darinya telah menjadi pertanyaan praktis, bukan pertanyaan editorial. Untuk endpoint ini, jawabannya sebagian besar ya, dengan tipe penolakan sebagai sambungan yang terlihat.
Yang ketiga adalah bentuk dari array pertanyaan. OpenAI memungkinkan Anda menaruh pertanyaan-pertanyaan independen dalam satu permintaan terhadap input bersama — periksa foto produk untuk kerusakan dan klasifikasikan kategorinya dalam panggilan yang sama — tetapi mengharuskan permintaan terpisah ketika pertanyaan berikutnya bergantung pada jawaban sebelumnya. Jev mengambil posisi yang sama untuk alasan yang sama: pertanyaannya dievaluasi secara paralel terhadap satu state, jadi apa pun yang bersifat sekuensial harus menjadi dua panggilan. Kedua vendor telah merancang untuk fan-out, dan keduanya memberi tahu Anda hal yang sama tentang ke mana anggaran latensi pergi.
Kategori itu sekarang memiliki tiga penghuni, dan dua di antaranya bukan model umum.
Ada baiknya menyebut yang ketiga, karena kerangka endpoint keputusan hanya masuk akal jika ketiganya dipertimbangkan. Perplexity merilis API Decisions miliknya sendiri, yang dilayani oleh pplx-decider-v1-27b — model pengambil keputusan berparameter 27 miliar yang dirilis di bawah Apache 2.0 dengan bobot di Hugging Face pada 2026-10-01. Itu memberi kategori ini bentuk yang benar-benar berbeda dari milik OpenAI: Jev 1.13 bersifat tertutup dan hanya teks, decider Perplexity berbobot terbuka dan menerima gambar, dan entri GPT-6 Luna adalah harness di sekitar model umum, bukan model yang dibangun untuk mengambil keputusan.
Bagi pembaca yang memilih hari ini, pembagian praktisnya lebih sempit daripada yang digambarkan pemasaran. Jika bukti Anda berupa kalimat atau catatan dan Anda menginginkan biaya per panggilan termurah dengan variasi perilaku paling kecil, Jev 1.13 adalah spesialisnya dan tarif $0.042-nya adalah yang terendah dari tiga harga terbit yang dapat kami verifikasi. Jika bukti Anda mencakup foto, atau Anda menginginkan keputusan dari model yang sudah Anda kenal dari tugas-tugas biasa, Decisions API adalah satu-satunya dari dua opsi tertutup yang menerima gambar. Opsi open-weight menjawab pertanyaan yang berbeda — kontrol dan self-hosting — dan kami belum mengujinya.
Apa yang sebenarnya bisa kita ukur, dan apa yang tidak dimiliki siapa pun
Klaim OpenAI untuk endpoint tersebut adalah bahwa endpoint itu "mengevaluasi teks, gambar, atau keduanya dan mengembalikan jawaban bertipe sekitar 10x lebih cepat daripada Responses API." Itu dinyatakan oleh vendor dan belum direproduksi: tidak ada wilayah, tidak ada ukuran input, tidak ada tingkat konkurensi, tidak ada perjanjian tingkat layanan, dan baseline-nya adalah Responses API secara umum, bukan beban kerja tertentu. Satu angka percepatan saja adalah angka yang salah untuk dijadikan dasar menetapkan tenggat.
Yang bisa kami letakkan di sampingnya adalah jendela penyajian tujuh hari milik kami sendiri yang berakhir 2026-10-07 pada dua model di bawahnya, dari trafik playground kami — dan penting untuk menyebutkan apa yang bukan termasuk angka-angka itu. Angka-angka itu menggambarkan permintaan generasi biasa, bukan keputusan.
• GPT-6 Luna, semua bentuk permintaan: median 1.448 ms dan p95 4.912 ms, tingkat kesalahan 1,31% selama 643.394.111 token dalam tujuh hari, yang menggambarkan seperti apa throughput sekitar 125 token keluaran per detik ketika model sedang menulis.
• Jev 1.13: median 149 ms dan p95 245 ms, dengan tingkat galat 0,10% pada 110.193.080 token. Itu endpoint yang benar-benar cepat, dan cepat karena tidak menghasilkan respons — ia mengembalikan angka untuk status yang di-ingest sekali.
Jika dibaca secara berdampingan, kedua baris itu merupakan peringatan, bukan perbandingan. Permintaan keputusan mengeluarkan sedikit token, sehingga pada Decisions API angka throughput keluaran yang mendominasi profil umum Luna tidak lagi menjadi kendala yang mengikat, dan angka yang mulai penting adalah berapa lama model membaca bukti. Kami belum mengukur itu pada endpoint decisions, dan sejauh yang kami tahu belum ada pihak di luar OpenAI yang mempublikasikannya.
Pertanyaan yang lebih dalam dan tidak terukur adalah kalibrasi, dan itulah yang menentukan apakah semua ini dapat digunakan. Probabilitas 0,92 untuk kerusakan yang terlihat hanya layak dijadikan dasar perutean jika, di seluruh lalu lintas Anda, foto-foto yang diberi skor mendekati 0,92 mengalami kerusakan sekitar 92% dari waktu. Dokumentasi OpenAI memberi tahu Anda untuk menetapkan ambang batas dari contoh berlabel dan memilihnya berdasarkan biaya positif palsu terhadap negatif palsu. Itu saran yang benar, dan itu juga pengakuan bahwa kalibrasi angka-angka ini adalah sesuatu yang harus Anda tetapkan sendiri. Sebagai langkah awal, ukurlah distribusi probabilitas yang dikembalikan pada sampel yang jawabannya sudah Anda ketahui. Jika semuanya kembali pada 0,99 atau 0,01, ambang batas itu tidak melakukan kerja apa pun dan endpoint tersebut hanyalah boolean yang sangat mahal.
Cara mencoba salah satu dari keduanya tanpa mempertaruhkan jalur produksi padanya
Sumbernya, secara gamblang: kontrak endpoint, harga, dan aturan gambar dalam artikel ini berasal dari dokumentasi Decisions API milik OpenAI sendiri dan README plugin, keduanya dibaca pada 2026-10-07; spesifikasi Jev 1.13 berasal dari dokumentasi model milik TypeSafe sendiri; angka serving adalah data playground kami sendiri selama rentang tujuh hari yang berakhir pada 2026-10-07; stempel waktu paket berasal dari PyPI dan riwayat Git proyek. Klaim kecepatan 10x adalah milik OpenAI dan dilabeli demikian. Lisensi dan tanggal rilis decider open-weight berasal dari repositori modelnya.
Decisions API sendiri adalah paket milik OpenAI dan kami tidak merutekannya; jika Anda menginginkan endpoint spesifik itu, OpenAI-lah tempatnya. Model-model di baliknya adalah perkara yang berbeda. GPT-6 Luna adalah rute aktif di OrcaRouter dengan harga daftar OpenAI tanpa markup yang diteruskan, dan typesafe/jev-1.13 dengan harga daftar ada pada kunci yang sama, yang membuat perbandingan dalam artikel ini menjadi sesuatu yang dapat Anda jalankan alih-alih baca: state yang sama, pertanyaan yang sama, dua endpoint, satu kontrak untuk dikelola, dan tanpa tagihan kedua.
Itu juga cara yang masuk akal untuk mengadopsi permukaan yang belum terbukti. Letakkan keputusan itu di balik fallback agar penolakan, timeout, atau batas beta yang berubah di bawah Anda terdegradasi menjadi panggilan berbasis prompt alih-alih gangguan layanan, dan pertahankan fallback itu pada kunci yang sama dengan yang utama sehingga tidak ada yang perlu dikonfigurasi ulang saat endpoint bergerak menuju ketersediaan umum. OpenAI mengatakan GA diperkirakan dalam beberapa minggu ke depan dan bahwa gpt-6-luna adalah satu-satunya model yang tersedia untuk sementara waktu; keduanya adalah alasan untuk membangun sesuai bentuknya dan menginstrumentasinya sekarang, dan tidak ada satu pun yang menjadi alasan untuk menaruh otorisasi pembayaran di belakangnya untuk saat ini.

Tontonan Berikutnya
Tiga hal akan menjawab pertanyaan-pertanyaan yang tidak bisa dijawab oleh tulisan ini. Anggaran token yang dipublikasikan untuk endpoint decisions, sehingga ukuran sebuah permintaan dapat diperkirakan alih-alih ditebak. Pengumuman GA apa pun, yaitu titik ketika tarif khusus input berhenti menjadi janji beta. Dan satu pengukuran independen atas latensi serta kalibrasi pada endpoint itu sendiri — orang pertama yang memasukkan beberapa ribu pasangan berlabel ke dalamnya dan menerbitkan kurva reliabilitas akan berbuat lebih banyak bagi kategori ini daripada yang dilakukan masing-masing tulisan peluncuran itu.
Sampai saat itu, ringkasan yang jujur itu sempit namun berguna: jika hal yang perlu Anda putuskan adalah teks, Jev 1.13 lebih murah dan ia mengembalikan angka dalam sekitar 150 milidetik pada trafik kami. Jika hal yang perlu Anda putuskan mencakup gambar, Decisions API milik OpenAI-lah yang akan melihatnya, dengan harga input 2,4 kali lipat, dengan label beta di kotaknya. Keduanya dapat dipanggil dari baris perintah sejak minggu ini, dan itu posisi yang lebih baik daripada posisi keduanya tujuh hari yang lalu.


