Kartu judul hero untuk GPT-6 Astra bertuliskan 'Cara Memanggil GPT-6 Astra', dengan subjudul 'ID model, endpoint, dan berapa biaya eksekusi jangka panjang', dengan baris tanggal bertuliskan 'Model dirilis 3 September 2026 — detail API diverifikasi 16 September 2026', dan tiga kartu di bawahnya: 'ID model: gpt-6-astra', 'Konteks: 1.050.000 token' dan 'Standar: $10,00 masuk / $50,00 keluar', dengan logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

GPT-6 Astra API: ID Model, Endpoint, dan Berapa Biaya Sebenarnya dari Tugas Berhorizon Panjang

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

The short version: GPT-6 Astra is callable today at https://api.openai.com/v1 under a single model id, gpt-6-astra, at $10.00 per million input tokens, $1.00 cached input and $50.00 output — the figures Ope​nAI's own pricing page carried on September 16, 2026. The model itself is from September 3, 2026, thirteen days before this page was written, so nothing here is launch coverage and nothing here is framed as an announcement. This is the reference page for the developer question that comes after availability: what string to pass, which endpoint takes it, what the 1,050,000-token window really buys, what the account has to look like first, and what one genuine long-horizon agent run costs on a rate card that quietly reprices itself above 272,000 input tokens. GPT-5.6 Sol appears throughout only as the price baseline it is sold above, never as the subject.

Alasan model berusia tiga belas hari layak mendapat halaman minggu ini adalah bahwa rute-rute menuju model itu berubah setelah peluncuran itu berubah, dan rute API kini menjadi rute yang biasa. Ketika Ope​nAI meluncurkan Astra pada 3 September, perusahaan itu menggambarkannya sebagai peluncuran bertahap alih-alih ketersediaan; pada 8 September, perusahaan itu mengatakan model tersebut telah diluncurkan sepenuhnya kepada pengguna Plus, Pro, Business, dan Enterprise di Co​dex dan ChatGPT Work, dan pada minggu 14 September, AWS telah mencantumkannya di Bedrock dan Microsoft Foundry telah menyediakannya secara umum. Bagi pemanggil API, urutan itu tidak sepenting kedengarannya — endpoint tersebut telah aktif dan terdokumentasi sepanjang waktu — tetapi itu berarti pertanyaan pengadaan seputar model tersebut kini memiliki jawaban yang tidak ada pada hari peluncuran. Semua yang di bawah ini dibaca dari dokumentasi model, halaman harga, dan halaman kontrol data milik Ope​nAI sendiri pada 16 September 2026, dan apa pun yang berasal dari sumber lain menyatakannya demikian dalam kalimat yang memuatnya.

ID model, dan pertanyaan snapshot dijawab dengan jujur

String yang harus diteruskan adalah gpt-6-astra — huruf kecil, menggunakan tanda hubung, tanpa prefiks vendor. Itu satu-satunya id yang didokumentasikan oleh OpenAI untuk model ini.

Jika Anda mencari snapshot bertanggal untuk dipin, tidak ada yang bisa ditemukan, dan kami tidak akan mengarang akhiran yang tampak masuk akal. Halaman model OpenAI untuk GPT-6 Astra mencantumkan tepat satu entri di bawah Snapshots, dan itu adalah gpt-6-astra polos. Tidak ada -2026-09-03 sebagai bentuk bertanggal, dan tidak ada -latest alias di sisi vendor. Kami melihat alias dinamis berbentuk ~openai/gpt-astra-latest pada daftar router selama riset; itu adalah konstruksi gateway yang dibangun di atas id vendor, bukan sesuatu yang diterbitkan OpenAI, dan itu tidak boleh dimasukkan ke konfigurasi Anda seolah-olah memang begitu.

Konsekuensi praktisnya kecil tetapi layak disebutkan. Anda dapat mengambil objek model untuk mengonfirmasi apa yang sedang Anda ajak bicara:

curl https://api.openai.com/v1/models/gpt-6-astra -H "Authorization: Bearer $OPENAI_API_KEY"

Sematkan id polos dalam sebuah nilai konfigurasi alih-alih mengetikkannya ke selusin lokasi pemanggilan. Jika Ope​nAI nanti menambahkan snapshot bertanggal, id polos itu menjadi sasaran yang bergerak dan nilai yang Anda sematkan mulai berubah di bawah Anda — satu tempat untuk diedit adalah perbedaan antara perubahan dua menit dan satu sore penuh grep.

Endpoint: URL dasar, kompatibilitas, dan request yang berjalan

The base URL is https://api.openai.com/v1. Per Ope​nAI's model documentation, GPT-6 Astra is supported on Responses (/v1/responses), Chat Completions (/v1/chat/completions) and Batch (/v1/batch). It is explicitly not supported on Realtime, Assistants, Fine-tuning, Embeddings, image generation and editing, video, audio, moderation, or the legacy Completions endpoint — and those absences matter as much as the presence list, because a team that planned around the Assistants API or a fine-tuned variant has to replan rather than rewrite.

Tentang kompatibilitas: ini adalah API pihak pertama milik OpenAI sendiri, yaitu format wire yang menjadi acuan penulisan setiap SDK dan klien yang kompatibel dengan OpenAI. Apa pun yang berbicara dalam format itu akan dapat berkomunikasi dengan gpt-6-astra tanpa shim — Anda cukup mengubah string model dan, jika Anda bermigrasi dari model OpenAI yang lebih lama, nama parameter di bawah ini. Pekerjaan baru sebaiknya menggunakan Responses API: itulah permukaan tempat OpenAI mendokumentasikan kontrol penalaran model ini, di situlah alat bawaan berada, dan dukungan Chat Completions untuk model terbaru secara historis merupakan yang lebih dangkal di antara keduanya.

Panggilan streaming minimal, dengan upaya penalaran yang ditetapkan:

curl https://api.openai.com/v1/responses \

-H "Authorization: Bearer $OPENAI_API_KEY" \

-H "Content-Type: application/json" \

-d '{"model": "gpt-6-astra", "input": "Buat daftar file yang akan Anda ubah untuk memindahkan layanan ini dari API auth lama.", "reasoning": {"effort": "high"}, "max_output_tokens": 16000, "stream": true}'

Dan hal yang sama dalam Python, yang justru merupakan tempat sebagian besar pembaca sebenarnya berada:

from openai import OpenAI

client = OpenAI()

stream = client.responses.create(model="gpt-6-astra", input="Sebutkan file-file yang akan Anda ubah untuk memindahkan layanan ini dari API autentikasi lama.", reasoning={"effort": "high"}, max_output_tokens=16000, stream=True)

for event in stream:

if event.type == "response.output_text.delta": print(event.delta, end="")

Tiga hal tentang permintaan itu spesifik untuk model ini, bukan disalin dari quickstart generik.

Tingkat upaya penalaran adalah pengatur biaya, bukan hanya pengatur kualitas. Halaman model OpenAI mencantumkan nilai yang didukung sebagai low, medium, high, xhigh, dan max. Perhatikan dari mana daftar itu dimulai: tidak ada none atau minimal untuk GPT-6 Astra, jadi batas bawahnya naik. Token penalaran ditagih sebagai token keluaran sebesar $50.00 per juta, yang berarti mengubah tingkat upaya dari high ke max adalah keputusan yang disertai biaya, bukan peningkatan kualitas gratis.

Streaming didukung, dan itu adalah cara yang jujur untuk menjalankan giliran panjang. Satu permintaan pada model ini dapat mengeluarkan hingga 128.000 token keluaran. Menunggu hal itu masuk ke dalam satu body respons, tanpa visibilitas apakah sedang berlangsung, adalah bagaimana Anda akhirnya menebak-nebak timeout.

Caching prompt bersifat eksplisit di sini. API Responses mendokumentasikan prompt_cache_breakpoint pada konten teks, gambar, dan file, dengan mode explicit, yang menandai "akhir persis dari prefiks prompt yang dapat digunakan kembali" dan mewarisi TTL-nya dari prompt_cache_options.ttl milik permintaan. Pada model yang tarif input ter-cache-nya sepersepuluh dari tarif input tanpa cache, tempat Anda meletakkan batas itu adalah baris paling berpengaruh dalam permintaan Anda.

Screenshot of OpenAI's developer documentation page for GPT-6 Astra, captured 16 September 2026, showing the model id gpt-6-astra described as the company's most capable model, a 1,050,000-token context window, 128,000 maximum output tokens, an Apr 30, 2026 knowledge cutoff, reasoning token support with reasoning.effort values of low, medium, high, xhigh and max, input modalities of text and image with text output and audio and video marked not supported, Standard pricing of $10.00 input, $1.00 cached input, $12.50 cache writes and $50.00 output per million tokens, the note that prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request, and supported endpoints of Responses, Chat Completions and Batch with Fine-tuning, Assistants, Embeddings and Images marked unsupported.

Apa arti sebenarnya dari jendela 1,050,000 token

Angka yang didokumentasikan adalah jendela konteks 1.050.000 token, input maksimum 922.000 token, output maksimum 128.000 token, dan batas pengetahuan 30 April 2026.

Mulailah dengan aritmetika yang sering dilewatkan orang: 922.000 ditambah 128.000 sama dengan 1.050.000. Jendela itu dibagi antara apa yang Anda kirim dan apa yang mungkin dikembalikan model, dan batas maksimum output dicadangkan darinya. Anda tidak dapat mengirim 1.050.000 token input; batas praktis untuk satu permintaan adalah 922.000, dan kurang dari itu jika Anda ingin ruang untuk jawaban yang sungguh-sungguh.

Apa yang bisa dibeli dengan satu juta token dalam satuan yang benar-benar Anda gunakan? Konversi token-ke-teks bersifat perkiraan, dan ini milik kami, bukan milik Ope​nAI, tetapi orde besarnya benar: pada sekitar empat karakter per token, 1.050.000 token berada di kisaran 750.000 kata, atau sekitar seratus ribu baris kode. Itu adalah repositori berukuran sedang, secara utuh, dengan ruang tersisa untuk keluaran alat yang dihasilkan agen saat bekerja. Kasus jangka panjang yang menjadi nilai jual model ini persis seperti ini: agen yang membaca sebuah file satu jam lalu dan masih dapat melihat apa yang dikatakannya, bukannya agen yang telah memadatkan pagi hari menjadi satu paragraf ringkasan.

Lalu, bagian yang seharusnya ada di halaman biaya, bukan halaman spesifikasi. Dokumentasi model Ope​nAI menyatakan bahwa prompt dengan lebih dari 272,000 token input dihargai sebesar 2x tarif input dan cache dan 1.5x output untuk permintaan penuh. Halaman harga mencantumkannya sebagai baris kedua: konteks panjang pada GPT-6 Astra adalah $20.00 input, $2.00 input cache, dan $75.00 output. Jadi, tiga per empat teratas dari jendela tersebut adalah pita harga, bukan hanya ruang cadangan. Satu run yang transkripnya berada di atas 272,000 token membayar dua kali lipat untuk setiap token input — termasuk yang di-cache — untuk keseluruhan permintaan, dan itulah perubahan terbesar dalam ekonomi model ini. Ini diuraikan secara lengkap di bawah.

Satu mekanisme lain yang perlu diketahui, karena ini adalah pengakuan vendor sendiri bahwa satu jendela bukanlah jawaban keseluruhan. Untuk Co​dex, Ope​nAI menjelaskan pendekatan konteks eksperimental yang dikirim bersama Astra di mana catatan tetap ada di seluruh jendela konteks alih-alih pemadatan berulang menjadi satu ringkasan, dengan jendela sebelumnya tetap dapat dicari sehingga persyaratan dan hasil pengujian dari pesan sebelumnya dan output alat tetap dapat ditemukan. Ope​nAI menyebutnya eksperimental, mengatakan bahwa itu diaktifkan di Co​dex config.toml, dan mengatakan bahwa itu akan menjadi default untuk Astra. Jika Anda membangun sendiri yang setara di API, itulah bentuk yang harus disalin: catatan yang tahan lama plus riwayat yang dapat diambil, bukan satu prompt yang heroik.

Dan batas dari angka itu sendiri: jendela yang besar adalah kapasitas, bukan jaminan adanya perhatian di sepanjang jendela tersebut. Angka jangka panjang yang dilaporkan vendor adalah panduan yang lebih baik untuk perilaku daripada jumlah token — OpenAI melaporkan OSWorld 2.0 sebesar 72,6% pada sekitar 40 menit per tugas, dan Terminal-Bench 4.0 sebesar 57,9% dibandingkan 37,3% untuk GPT-5.6 Sol. Itu adalah angka OpenAI sendiri, yang tidak kami reproduksi, dan gambaran independennya memang dekat tetapi tidak identik: Artificial Analysis mengukur Astra sebesar 59,1% pada Terminal-Bench v4.0 dibandingkan 52,0% untuk Claude Fable 5.1 dan 39,9% untuk GPT-5.6 Sol. Keduanya sepakat bahwa kesenjangan jangka panjang dibandingkan generasi sebelumnya nyata; tidak satu pun merupakan pengganti untuk menjalankan tugas Anda sendiri.

Modalitas masukan, dan pertanyaan berkas yang dibiarkan terbuka secara jujur

Halaman model Ope​nAI mencantumkan modalitas masukan berupa teks dan gambar, dengan keluaran teks. Tidak ada audio, tidak ada video, tidak ada pembuatan gambar pada model ini.

Input gambar dimasukkan sebagai bagian konten di dalam pesan pengguna. Jenis bagiannya adalah input_image, dan gambar diberikan baik sebagai URL yang sepenuhnya memenuhi syarat maupun URL data base64 pada image_url, atau sebagai file_id dari Files API. Ada detail opsional berupa auto, low, high, atau original, yang secara default bernilai auto. Bentuknya adalah:

{"model": "gpt-6-astra", "input": [{"role": "user", "content": [{"type": "input_text", "text": "apa yang berubah di tangkapan layar ini?"}, {"type": "input_image", "image_url": "data:image/png;base64,...", "detail": "high"}]}]}

Dokumentasi visi OpenAI mencantumkan PNG, JPEG, WEBP, dan GIF non-animasi sebagai format yang diterima, hingga total payload 512 MB per permintaan dan hingga 1.500 gambar per permintaan, dengan gambar yang melebihi 30.000 patch ditolak alih-alih diperkecil ukurannya. Itu adalah batas visi umum platform, bukan batas khusus Astra, dan gambar ditagih sebagai token seperti input lainnya.

Sekarang pertanyaan yang sebenarnya dibawa pembaca, dan jawaban yang jujur. Bisakah Anda mengirim file atau PDF? Kami tidak dapat mengonfirmasi input dokumen untuk model ini di dokumentasi Ope​nAI, dan kami tidak akan menyiratkan bahwa itu berfungsi. Responses API memang mendefinisikan bagian konten input_file, jadi infrastrukturnya ada di API secara umum; tetapi halaman Ope​nAI untuk GPT-6 Astra mencantumkan teks dan gambar sebagai modalitas inputnya dan tidak mencantumkan file, dan kami tidak menemukan pernyataan Ope​nAI yang mendokumentasikan input PDF untuk endpoint ini. Daftar router untuk model yang sama memang menampilkan file bersama teks dan gambar — anggap itu sebagai laporan router, yaitu apa yang dicatat router tentang suatu rute alih-alih apa yang dijamin vendor. Jika ingesti dokumen bersifat krusial untuk beban kerja Anda, ujilah terhadap endpoint nyata sebelum Anda membangun di atasnya, dan siapkan fallback OCR-ke-teks. Itulah perbedaan antara satu sore pengujian dan penulisan ulang.

Lini harga lengkap, dan satu proses jangka panjang yang telah dihitung biayanya

Setiap angka di bagian ini diambil dari halaman harga milik Ope​nAI sendiri pada 16 September 2026, dan semuanya dihitung per juta token pada tier Standard kecuali jika baris tersebut menyatakan sebaliknya.

Konteks pendek, hingga 272K input — $10,00 input, $1,00 input yang di-cache, $12,50 penulisan cache, $50,00 output.

Konteks panjang, input di atas 272K — $20.00 input, $2.00 input cache, $25.00 penulisan cache, $75.00 output, diterapkan pada keseluruhan permintaan.

Batch dan Flex — setengah dari Standard: $5,00 / $0,50 / $6,25 / $25,00 konteks pendek, $10,00 / $1,00 / $12,50 / $37,50 konteks panjang.

Mode cepat — dua kali lipat Standard: $20.00 / $2.00 / $25.00 / $100.00 konteks pendek, $40.00 / $4.00 / $50.00 / $150.00 konteks panjang. Ope​nAI mencatat Mode cepat tidak tersedia untuk GPT-6 Astra dengan residensi data UE.

Residensi data — endpoint yang menggunakannya dikenai kenaikan 10% untuk model yang dirilis pada atau setelah 5 Maret 2026. GPT-6 Astra memenuhi syarat, sehingga penerapan residensi berada 10% di atas setiap angka di atas.

Hal yang perlu diinternalisasi adalah tarif input yang di-cache. $1,00 dibandingkan $10,00 adalah diskon 90% untuk bagian prompt yang Anda kirim ulang — dan pada beban kerja agen, itu hampir seluruh prompt. Penulisan cache ditagih sebesar $12,50, atau 1,25x tarif input tanpa cache, jadi titik impasnya sederhana: 100.000 token yang dikirim tanpa cache dua kali biayanya $2,00, sedangkan menulis prefiks itu sekali dan membacanya kembali sekali biayanya $1,35. Penggunaan cache menguntungkan mulai dari penggunaan ulang kedua dan seterusnya, dan agen yang mengerjakan transkrip yang sama selama seratus giliran akan menggunakannya ulang seratus kali.

Hal ini membawa kita pada aritmetika yang sebenarnya menentukan apakah model ini terjangkau, karena tarif yang ditonjolkan bukanlah angka yang muncul di faktur. Berikut adalah eksekusi yang dimodelkan — milik kami, dibangun berdasarkan tarif yang dipublikasikan Ope​nAI, bukan tagihan hasil pengukuran — untuk jenis tugas yang menjadi sasaran penjualan model ini: agen coding otonom yang mengerjakan migrasi berskala repo selama beberapa jam, 120 panggilan model, transkrip kerja yang rata-rata sekitar 500.000 token input per panggilan seiring akumulasinya, 80% dari input tersebut dilayani dari cache, dan 400.000 token output sepanjang eksekusi termasuk penalaran.

Pada tarif Standar konteks pendek:

• Input tanpa cache — 12 juta token × $10.00 = $120.00

• Input cache — 48M token × $1.00 = $48.00

• Keluaran — 0.4M token × $50.00 = $20.00

Total ≈ $188.00 untuk proses ini

Proses yang sama pada rentang konteks panjang, yaitu yang sebenarnya diperoleh transkrip yang berada di atas 272.000 token per panggilan:

• Input tanpa cache — 12 juta token × $20,00 = $240,00

• Input cache — 48 juta token × $2,00 = $96,00

• Keluaran — 0,4M token × $75,00 = $30,00

Total ≈ $366,00 untuk proses ini

Dua kesimpulan muncul dari itu, dan tidak satu pun terlihat dari tarif utama. Pertama, di mana transkrip Anda disimpan sama pentingnya dengan model mana yang Anda pilih — tugas yang identik kira-kira menjadi dua kali lipat bergantung pada apakah melewati ambang 272K, yang menjadikan disiplin konteks (mengambil 100K yang tepat alih-alih membawa 600K) sebagai teknik pengendalian biaya pada model ini, bukan sekadar teknik performa. Kedua, caching bernilai lebih besar daripada yang disiratkan diskon: tanpa cache hit sama sekali, skenario pertama membawa input senilai $600.00 alih-alih $168.00, dan prosesnya berbiaya sekitar $620 alih-alih $188. Aktifkan caching sebelum Anda menaikkan upaya penalaran.

Untuk baseline, campuran token yang sama pada GPT-5.6 Sol dengan tarif yang ditampilkan halaman harga Ope​nAI pada 16 September — $4,00 input, $0,40 input cache, $20,00 output pada konteks pendek — sekitar $75,20, dan pada baris konteks panjang Sol ($8,00 / $0,80 / $30,00) sekitar $146,40. Itu membuat proses ini sekitar 2,5x pada kedua rentang. Dua catatan tentang kelipatan itu, karena sudah menimbulkan kebingungan di tempat lain: angka Sol adalah tarif promosi — Ope​nAI mengatakan promosi tersedia setidaknya hingga 21 November 2026 — sedangkan milik Astra adalah harga daftar, jadi kelipatan itu mengukur dua kartu tarif hari ini, bukan fakta stabil tentang model, dan akan menyempit jika promosi berakhir. Dan "2,5x" lama yang beredar untuk Astra kadang dihitung terhadap harga daftar Sol sebelum promosi, $5,00/$30,00, yang menghasilkan 2x pada input dan sekitar 1,67x pada output. Sebutkan tarif Sol mana yang Anda maksud atau angkanya tidak ada gunanya.

Satu baris lagi: tier Batch memangkas semuanya menjadi separuh, sehingga proses pertama menjadi sekitar $94. Apakah Anda dapat menggunakannya bergantung pada bagian berikutnya.

Single-column scoreboard titled 'GPT-6 Astra API — the scoreboard' with six rows reading 'Model id: gpt-6-astra', 'Context window: 1,050,000 tokens', 'Max output: 128,000 tokens', 'Price (Standard): $10.00 in / $50.00 out', 'Cached input: $1.00, a 90% discount' and 'Above 272K input: 2x input, 1.5x output', above a footer reading 'All figures per OpenAI's model and pricing pages, read September 16, 2026.', with the OrcaRouter logo composited in the bottom-right corner.

Retensi Data Nol, dan diskon yang mendiskualifikasi dirinya sendiri

OpenAI menyatakan bahwa Zero Data Retention tersedia untuk pelanggan API yang memenuhi syarat pada endpoint yang didukung, dengan syarat persetujuan — dan kedua bagian kalimat itu benar-benar berperan penting. Ini bukan tombol yang bisa diaktifkan sendiri: kelayakan bergantung pada persetujuan sebelumnya dari OpenAI dan penerimaan persyaratan tambahan, dan Anda memulainya dengan menghubungi tim penjualan. Setelah disetujui, fitur ini dikonfigurasi di tingkat organisasi atau proyek di bawah Settings → Organization → Data controls, pada tab Data Retention, tempat sebuah proyek dapat mewarisi default organisasi, menetapkan ZDR secara eksplisit, memilih Modified Abuse Monitoring, atau menonaktifkan keduanya.

Apa yang berubah dalam praktik: ZDR mengecualikan konten pelanggan dari log pemantauan penyalahgunaan, menggantikan retensi default hingga 30 hari, dan parameter store pada /v1/responses dan /v1/chat/completions diperlakukan sebagai false bahkan jika permintaan mencoba menyetelnya ke true.

Detail yang paling penting di halaman tentang biaya: /v1/batches tidak ada dalam daftar endpoint yang memenuhi syarat ZDR. Halaman kontrol data Ope­nAI mencantumkannya sebagai tidak memenuhi syarat, dengan status aplikasi yang disimpan hingga dihapus. Jadi pada GPT-6 Astra, diskon 50% untuk tier Batch dan Zero Data Retention saling eksklusif — beban kerja yang terikat kepatuhan yang membutuhkan ZDR harus menganggarkan tarif Standar, bukan tarif batch, dan angka $94 di atas tidak tersedia untuknya.

Tiga catatan tambahan, disampaikan secara terus terang karena halaman yang melebih-lebihkan ZDR lebih buruk daripada halaman yang tidak menyebutkannya. ZDR tidak bersifat absolut: di bawah "Eyes Off", Ope​nAI berhak membuat model tidak memenuhi syarat untuk ZDR bagi pelanggan tertentu, dengan pemberitahuan tertulis sebelumnya, dan di bawah "Safety Retention", konten dapat disimpan dan ditinjau oleh manusia jika pengklasifikasi menandai risiko berat. Input gambar dan file yang ditandai karena potensi CSAM tetap disimpan untuk peninjauan manual bahkan di bawah ZDR. Dan ZDR berhenti pada batas Ope​nAI — jika agen Anda memanggil server MCP jarak jauh atau API vendor lain, lalu lintas itu diatur oleh kebijakan retensi pihak tersebut, bukan kebijakan ini. Secara terpisah, residensi data adalah kontrol yang berbeda dari ZDR, memerlukan persetujuan tersendiri dan amandemen Modified Retention di luar Amerika Serikat, serta membawa kenaikan 10% yang disebutkan di atas. Jika Anda mengandalkan caching di bawah ZDR, bacalah halaman kontrol data Ope​nAI untuk mengetahui apa yang disimpan oleh caching; kami tidak akan mencetak angka retensi untuk itu yang tidak dapat kami baca sendiri di sana.

Batas laju sebagaimana didokumentasikan, dan yang menggigit lebih dulu

Halaman model OpenAI mempublikasikan batas per tier ini untuk GPT-6 Astra — permintaan dan token per menit, lalu batas antrean batch:

Tingkat 1 — 500 RPM, 500.000 TPM, antrean batch 1.500.000

Tingkat 2 — 5,000 RPM, 1,000,000 TPM, antrean batch 3,000,000

Tier 3 — 5.000 RPM, 2.000.000 TPM, antrean batch 100.000.000

Tingkat 4 — 10.000 RPM, 4.000.000 TPM, antrean batch 200.000.000

Tingkat 5 — 15.000 RPM, 40.000.000 TPM, antrean batch 15.000.000.000

Dua batas yang akan kami sebut sebagai tidak terdokumentasidaripada mengisinya: tidak ada batas tingkat gratis yang dipublikasikan, karena GPT-6 Astra sama sekali tidak berada di tingkat gratis; dan kami tidak menemukan batas atas yang dipublikasikan di atas Tier 5 maupun tabel batas terpisah untuk mode Fast. Jika vendor belum mempublikasikan suatu batas, anggap ketiadaannya sebagai belum terselesaikan — jangan berasumsi bahwa itu tidak terbatas.

Angka yang lebih dulu menggigit beban kerja agen adalah 500.000 TPM Tier 1. Satu panggilan pada model ini dapat membawa transkrip 500.000 token, yang berarti satu permintaan dapat menghabiskan satu menit penuh anggaran token Anda di tier awal. Jendela konteks satu juta token tidak banyak berguna bagi agen yang menghuni transkrip yang sama selama 120 giliran jika tier tersebut tidak dapat mendorong tokennya. Tentukan ukuran tier berdasarkan volume token dari contoh yang dikerjakan di atas, bukan berdasarkan jumlah permintaan — dan perhatikan bahwa peningkatan tier bergantung pada pengeluaran dan riwayat akun, jadi ada baiknya menetapkannya sebelum tenggat waktu, bukan saat tenggat waktu.

Azure dan AWS Bedrock, satu baris masing-masing

Microsoft Azure — GPT-6 Astra dapat di-deploy di Microsoft Foundry dengan id gpt-6-astra yang sama, dengan cakupan Foundry yang menetapkan ketersediaan umum pada awal September 2026 dan melaporkan deployment Global Standard dan US Data Zone, tanpa EU Data Zone saat peluncuran, serta tarif yang setara atau mendekati daftar harga OpenAI dengan baris konteks panjang. Kami membaca itu dari cakupan Foundry, bukan dari halaman katalog Microsoft sendiri, yang tidak dapat kami akses hari ini — verifikasi daftar deployment, kumpulan region, dan tarif terkini pada dokumentasi Microsoft sendiri sebelum merencanakan deployment di atasnya.

AWS Bedrock — terdaftar sebagai openai.gpt-6-astra, tersedia melalui API Bedrock yang didukung dan dikonfirmasi dalam rangkuman mingguan AWS tertanggal 15 September 2026, dengan perimeter tata kelola Bedrock itu sendiri (isolasi endpoint VPC, enkripsi KMS, Guardrails) serta pernyataan AWS bahwa data inferensi tidak digunakan untuk pelatihan model. Inferensi dalam wilayah dan lintas wilayah geografis di Bedrock dilaporkan ditagih 10% di atas tarif dasar; angka tersebut bersumber dari pihak kedua menurut pembacaan kami, jadi periksa halaman harga AWS sendiri.

Tidak satu pun dari kedua rute ini mengubah model. Keduanya mengubah pengadaan, yang bagi pembaca enterprise adalah intinya: penerapan Foundry atau Bedrock dapat berada di dalam komitmen cloud yang sudah ada, mewarisi IAM, logging, dan batas jaringan miliknya, serta masuk ke faktur yang sudah disetujui bagian keuangan — sering kali menjadi pembeda antara pilot dan sesuatu yang benar-benar dirilis. Imbalannya adalah Anda menerima siklus hidup model dari cloud tersebut dan tarif dari cloud tersebut, dan kedua cloud itu dilaporkan pada atau di atas daftar harga OpenAI, bukan di bawahnya.

Di mana router cocok, termasuk bagian-bagian yang menentangnya

GPT-6 Astra ada di katalog OrcaRouter sebagai openai/gpt-6-astra, dan OrcaRouter meneruskan harga daftar penyedia dengan margin 0% — harga vendor adalah harga kami, dan perubahan harga vendor masuk ke tagihan Anda pada hari yang sama, bukan saat perpanjangan. Untuk model dengan harga seperti ini, itu bukan klaim selisih pembulatan: perhitungan di atas adalah perhitungan yang sama yang akan Anda bayar jika langsung.

Screenshot of the OrcaRouter catalogue page for GPT-6 Astra, captured 16 September 2026, showing the listing openai/gpt-6-astra from provider OpenAI, a 1M-token context, 128K maximum output, input of text, image and file with text output, a p50 time to first token of 6.70 s and p95 of 10.00 s, $10.00 input and $50.00 output per million tokens, 181.0M tokens of routed traffic over seven days, and an OpenAI-compatible Python sample using base_url https://api.orcarouter.ai/v1.

Argumen jujur untuk routing di sini bukanlah harga, melainkan reversibilitas. Astra kira-kira 2,5 kali lipat model di bawahnya dan biayanya berfluktuasi pada ambang batas yang dikendalikan arsitektur Anda, jadi sebagian besar tim ingin mencobanya pada sebagian kecil trafik nyata sebelum berkomitmen ke jalur produksi. Dengan satu kunci, Anda dapat menempatkannya di belakang endpoint yang sama dengan model yang sudah Anda jalankan, mengirimkan sebagian trafik kepadanya, dan otomatis failover ke opsi yang lebih murah ketika ia tidak memberikan nilai yang sepadan dengan selisih biayanya — sebuah perubahan konfigurasi, bukan migrasi, dengan satu API yang mencakup 200+ model, DSL routing yang menyusun beberapa model menjadi satu panggilan, dan fusi model ketika Anda ingin sebuah panel menjawab bersama-sama.

Bagian-bagian yang menentangnya, dinyatakan secara lugas. Router adalah satu hop lagi dalam jalur permintaan dan satu pihak lagi dalam aliran data — dan pada model ini hal itu bukan hipotetis, karena ZDR disetujui per organisasi di Ope​nAI dan permintaan yang dirutekan tidak otomatis tercakup oleh persetujuan ZDR Anda. Jika Anda mengirim data teregulasi, konfirmasikan ketentuan data rute tersebut sebelum mengirimnya, dan bersiaplah untuk menghubungi vendor secara langsung untuk beban kerja itu. Perutean juga menambahkan komponen yang bisa gagal atau menambah latensi, dan membuat penggantian model begitu mudah sehingga memungkinkan untuk mengubah apa yang menjawab pengguna Anda tanpa meninjaunya. Tidak ada dari itu yang mengalahkan argumen uji coba dan reversibilitas bagi sebagian besar tim; semua itu layak diketahui sebelum Anda memutuskan bahwa router itu gratis. Kami mengadu platform perutean satu sama lain dalam artikel terpisah alih-alih mengulang perbandingannya di sini.

Tiga pertanyaan yang jawabannya bukan satu klausa

Bisakah saya melakukan fine-tuning pada GPT-6 Astra, atau menggunakannya dengan Assistants API? Tidak, untuk keduanya, dan ini adalah batas desain, bukan konfigurasi yang Anda lewatkan. Halaman model Ope​nAI mencantumkan Chat Completions, Responses, dan Batch sebagai endpoint yang didukung serta secara eksplisit mencantumkan Fine-tuning dan Assistants sebagai tidak didukung, dan tidak ada baris GPT-6 Astra dalam tabel harga fine-tuning Ope​nAI. Jika arsitektur Anda bergantung pada model unggulan yang telah di-fine-tune, Astra harus diberi prompt sebagai gantinya, yang memindahkan biaya dari pelatihan ke token masukan — dan pada $10,00 per juta untuk system prompt yang besar, itu merupakan pos anggaran yang nyata, bukan sekadar catatan kaki.

Apakah model akan menolak pekerjaan keamanan yang saya berwenang lakukan? Kadang ya, dan hal itu perlu diketahui sebelum Anda membangun. GPT-6 Astra adalah model Ope​nAI pertama yang mencapai ambang batas kemampuan keamanan siber Kritis di bawah Preparedness Framework perusahaan, dan sebagaimana dirilis, model ini menolak tugas siber lanjutan seperti menulis eksploit proof-of-concept. Ope​nAI mengatakan pihaknya berencana memperluas akses dengan pengaman yang kurang ketat melalui program Daybreak-nya. Bagi seorang defender, hal ini muncul sebagai penolakan yang bukan batas laju dan bukan bug — perhitungkan hal itu dalam penanganan galat Anda alih-alih mencoba ulang ke dalamnya.

Apakah saya perlu persetujuan khusus untuk memanggil model ini? Tidak untuk endpoint standar — tidak ada daftar tunggu dan tidak ada langkah persetujuan untuk memanggil gpt-6-astra, cukup akun dengan penagihan. Yang mungkin memerlukan persetujuan adalah semua hal di sekitarnya: Zero Data Retention, yang dibatasi berdasarkan aplikasi; residensi data di luar Amerika Serikat, yang memerlukan amandemen tersendiri; dan kenaikan tier, jika Anda berniat mendorong volume token berskala agen melalui akun Tier 1. Modelnya adalah bagian yang mudah dari pengadaan.

Apa yang perlu diperhatikan, dan siapa yang harus bergerak sekarang

Jika Anda membangun di atas model ini, empat hal yang layak dipantau semuanya berasal dari sisi vendor dan semuanya bertanggal. Apakah OpenAI menerbitkan snapshot bertanggal untuk gpt-6-astra — yang akan mengubah id polos itu menjadi sasaran bergerak dan membuat pinning menjadi bermakna. Apakah ambang 272.000 token bergeser, karena satu baris itu lebih berharga bagi tagihan Anda daripada benchmark mana pun di halaman tersebut. Apakah tarif Bedrock dan Foundry menyamai atau tetap di atas daftar harga OpenAI, karena itu menentukan jalur pengadaan sama seperti model itu sendiri. Dan apakah program Daybreak mengubah apa yang akan ditolak oleh endpoint, yang bagi tim keamanan adalah perbedaan antara alat yang dapat digunakan dan demo.

Adapun siapa yang harus bertindak, pembagiannya jelas. Jika Anda sudah membayar GPT-5.6 Sol dengan tarif promosi untuk pekerjaan agen berjangka panjang, angka 2,5x itu nyata dan pertanyaannya spesifik: apakah tingkat penyelesaian tugas pada beban kerja Anda sendiri mengalahkan selisih harganya? Jalankan pada sebagian kecil lalu lintas nyata dan cari tahu — contoh yang telah diuraikan di atas memberi tahu Anda berapa biaya bagian tersebut sebelum Anda memulai. Jika pekerjaan Anda adalah obrolan berkonteks pendek atau klasifikasi bervolume tinggi, ini bukan model untuk Anda; penetapan harga ulang konteks panjang dan tarif output $50.00 menjadikannya cara yang mahal untuk melakukan sesuatu yang GPT-5.6 Luna lakukan dengan sebagian kecil dari harganya. Dan jika Anda adalah perusahaan dengan persyaratan kepatuhan, mulailah percakapan ZDR terlebih dahulu, karena itu menentukan diskon Batch, kenaikan biaya residensi, dan pilihan jalur Anda — dan tidak satu pun dari itu merupakan keputusan yang dapat Anda buat pada hari Anda membutuhkannya.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari