Kartu judul yang dihasilkan untuk tier Ultrafast dengan judul utama 'GPT-6 Astra Ultrafast', subjudul 'Enam kali laju, di setiap lini' dan dua lencana bertuliskan 'berharga dan tersedia secara umum' serta 'jalur cepat bukan model kedua'.
Guides & Insights

GPT-6 Astra Ultrafast pada 6x: Berapa Sebenarnya Biaya Daftar Tarif yang Dipublikasikan untuk Anda

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

GPT-6 Astra Ultrafast tidak lagi menjadi daftar tunggu pada 29 September 2026. Sekarang ini adalah tier layanan yang dapat dibeli dengan harga yang dipublikasikan, dan harga itu persis enam kali standar pada setiap baris. Model di bawahnya — GPT-6 Astra, andalan perusahaan, dirilis pada 3 September 2026 — tidak berubah; yang berubah di DevDay adalah jalur cepat di atasnya menjadi tersedia secara umum, dan dokumentasi API perusahaan sekarang menyatakan dengan jelas bahwa Ultrafast "tersedia secara luas untuk GPT-6 Astra, dengan akses pratinjau untuk GPT-5.6 Sol." Untuk pertama kalinya Anda dapat menempatkan tier ini pada pos anggaran, dan angka yang harus dimasukkan ke sana adalah $60,00 per juta token masukan dan $300,00 per juta token keluaran, yang dibaca dari halaman harga perusahaan sendiri pada 30 September 2026.

Hal itu membuat ini menjadi pertanyaan yang berbeda dari pertanyaan yang dijawab oleh liputan peluncuran. Fakta menarik minggu ini bukanlah bahwa tier tersebut ada — pratinjau diumumkan pada 13 Agustus 2026, dan diliput habis-habisan. Fakta menariknya adalah bahwa tier yang tadinya tanpa harga kini punya harga, dan aritmetika yang mengikutinya tidak mengenakkan secara spesifik dan terukur. Enam kali bukanlah premi yang bisa Anda terima sambil mengangkat bahu; itu adalah premi yang harus Anda tebus kembali dalam jumlah giliran yang lebih sedikit, dan apakah Anda mampu melakukannya adalah sifat dari beban kerja Anda, bukan dari modelnya.

Ada banyak pegangan di setiap jalur, dan itulah hal pertama yang perlu dipahami.

Saat membaca halaman harga OpenAI pada 30 September 2026, kolom Ultrafast untuk GPT-6 Astra adalah tetap sebesar 6x dari kolom Standard, bukan markup yang dikenakan pada sebagian baris tetapi tidak pada baris lainnya. Itu penting, karena artinya Anda tidak dapat mengoptimalkan jalan keluar dari hal itu dengan mengubah bentuk permintaan Anda.

• GPT-6 Astra, layanan Standar, permintaan hingga 272.000 token input — $10.00 input, $1.00 input cache, $12.50 penulisan cache, $50.00 output, per 1 juta token.

• GPT-6 Astra Ultrafast, ambang batas sama — $60,00 input, $6,00 input cache, $75,00 penulisan cache, $300,00 output, per 1 juta token. Tepat 6x pada keempat baris.

• Di atas 272.000 token input, seluruh permintaan akan dihargai ulang — Standard beralih ke $20,00 / $2,00 / $25,00 / $75,00, Ultrafast ke $120,00 / $12,00 / $150,00 / $450,00. Masih 6x. Aturan konteks panjang yang didokumentasikan OpenAI untuk GPT-6 Astra adalah 2x tarif input dan cache dengan output 1,5x pada keseluruhan permintaan setelah Anda melewati ambang batas, dan aturan ini berlaku sama untuk kedua tier.

• Tingkat lain di kartu yang sama — Batch dan Flex adalah 50% dari Standard, dan mode Fast adalah 2x Standard. Jadi tangga pengali untuk model yang satu ini berjalan 0,5x, 1x, 2x, 6x, tanpa anak tangga di antara dua yang terakhir.

Tidak ada padanan Ultrafast untuk Batch. Batch dan Flex adalah diskon yang Anda beli dengan penjadwalan yang lebih longgar di jalur standar; tidak ada versi lambat-murah dari jalur cepat. Jika Anda menginginkan kecepatan itu, Anda membayar 6x untuk setiap token yang Anda kirim dan setiap token yang Anda terima kembali, dan tidak ada campuran input yang di-cache dan input baru yang memperbaiki rasio tersebut.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that data-residency endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP carries a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

Berapa biaya sebenarnya untuk satu panggilan

Abstraksi menjadi lebih mudah untuk dinalar dengan dua permintaan konkret. Keduanya menggunakan tarif per juta yang dipublikasikan OpenAI; aritmatikanya milik kami.

Panggilan sekali jalan dengan 20.000 token masukan dan jawaban 2.000 token ditagih $0,30 pada Standard — 20.000 token dengan $10 per juta adalah $0,20, ditambah 2.000 dengan $50 per juta adalah $0,10. Panggilan yang sama pada Ultrafast ditagih $1,80. Tepat enam kali, seperti yang diiklankan.

Sekarang kasus yang benar-benar menggambarkan loop agen: percakapan 200.000 token dengan 190.000 token merupakan prefiks yang di-cache dan hanya 10.000 token yang baru, menghasilkan langkah 1.000 token. Standard menagih $0,19 untuk pembacaan yang di-cache, $0,10 untuk input baru, dan $0,05 untuk output — $0,34 per langkah. Ultrafast menagih $1,14, $0,60, dan $0,30 — $2,04 per langkah. Lagi-lagi 6x, tetapi lihat apa yang dilakukan komposisi ini: caching adalah tuas biaya paling efektif pada model ini dan masih tepat 6x lebih murah di jalur Standard, jadi agen yang sangat banyak di-cache tidak mendapatkan apa pun secara proporsional dari tier cepat dan itu juga tidak meredam premi.

Konsekuensinya adalah bagian yang layak diinternalisasi. Karena pengalinya tetap, titik impas sama sekali bukan tentang campuran token Anda. Itu sepenuhnya tentang jumlah giliran. Ultrafast terbayar dengan sendirinya dalam suatu beban kerja hanya ketika menjalankannya memangkas jumlah giliran yang ditagih sekitar enam kali lipat — baik dengan meruntuhkan loop percobaan ulang menjadi satu lintasan, atau dengan menggantikan rangkaian panggilan klarifikasi singkat dengan satu sesi interaktif yang lebih cepat. Jika beban kerja Anda mengeluarkan jumlah giliran yang sama seperti sebelumnya, hanya lebih cepat, Anda membeli latensi tepat pada 6x dan tidak ada yang lain.

Batas laju dan geografi adalah plafon yang tidak diumumkan.

Dua batasan berada di luar harga dan mudah terlewat saat Anda membaca kartu tarif.

Pertama adalah throughput. Ultrafast untuk GPT-6 Astra tersedia bagi semua pengguna API, tetapi awalnya dengan batas laju yang rendah: OpenAI mendokumentasikan 500.000 token per menit untuk tier 1 sampai 3, 1.000.000 untuk tier 4, dan 5.000.000 untuk tier 5. Untuk tier yang dijual berdasarkan kecepatan, itu adalah batas atas yang nyata — konteks agen 200.000 token pada setengah juta token per menit berarti dua setengah permintaan per menit di tier rendah. Panduan OpenAI sendiri menunjukkan masalah yang sama dari sisi lain, sangat merekomendasikan WebSockets justru karena overhead jaringan per permintaan dapat memakan latensi yang dibayar oleh tier tersebut.

Yang kedua adalah residensi. Ultrafast hanya mendukung residensi data AS dan pemrosesan global. Ini tidak mendukung endpoint pemrosesan regional UE atau regional non-AS lainnya. Jika deployment Anda bergantung pada endpoint residensi UE untuk GPT-6 Astra, tier ini tidak tersedia untuk Anda berapa pun harganya, dan itu adalah batas mutlak, bukan pilihan konfigurasi. Perhatikan juga bahwa endpoint residensi dikenakan kenaikan harga 10% untuk model yang dirilis pada atau setelah 5 Maret 2026, dan GPT-6 Astra termasuk di dalamnya.

Headline kecepatan turun dari 14x menjadi 8x

Ini perlu dinyatakan dengan hati-hati, karena angka yang beredar di sebagian besar liputan sudah usang. Halaman dokumentasi Ultrafast milik OpenAI, seperti yang diterbitkan hari ini, memuat baris "tier layanan API tercepat kami, dengan kecepatan hingga 8x lebih cepat daripada mode Standard." Pengumuman pratinjau 13 Agustus 2026 untuk GPT-5.6 Sol menjanjikan "hingga 14x lebih cepat daripada pemrosesan Standard" dan hingga 750 token keluaran per detik pada perangkat keras Cerebras.

Itu bukan klaim yang sama, dan perbedaannya bukanlah penarikan, melainkan lebih sebagai pergantian pokok bahasan. Angka 14x diukur pada GPT-5.6 Sol dalam pratinjau terbatas; angka 8x adalah yang diterbitkan OpenAI untuk tier tersebut sebagaimana adanya sekarang, dengan GPT-6 Astra sebagai modelnya yang tersedia secara luas. Siapa pun yang menyusun anggaran berdasarkan 14x pada Astra berarti menyusun anggaran berdasarkan angka yang belum diterbitkan OpenAI untuk Astra. Pembacaan yang jujur adalah bahwa kedua angka itu merupakan batas atas throughput keluaran yang dilaporkan vendor, bahwa tidak satu pun darinya merupakan jaminan latensi untuk beban kerja Anda, dan bahwa waktu end-to-end tetap mencakup pemrosesan input, pemanggilan alat, dan orkestrasi Anda sendiri. Perlakukan 8x sebagai angka perencanaan dan perlakukan apa pun yang lebih baik sebagai bonus yang Anda verifikasi pada lalu lintas Anda sendiri, bukan sebagai asumsi.

Apa yang harus dilakukan dengan ini pada hari Senin

Aturan keputusan yang dihasilkan dari aritmetika itu lebih sempit daripada yang tersirat dalam pemasaran, dan penting untuk dituliskan sebelum seseorang mengusulkan mengaktifkan Ultrafast di seluruh estate.

Aktifkan ini ketika beban kerjanya terikat latensi dan bersifat interaktif, serta ketika ada manusia yang menunggu. Triase insiden, eskalasi dukungan langsung, loop riset tempat seorang analis beriterasi dalam satu sesi duduk — inilah kasus-kasus ketika nilai dari jawaban yang tiba sekarang alih-alih dalam empat menit tidak sebanding dengan harga token, dan ketika tagihan 6x untuk sedikit giliran jauh lebih kecil daripada biaya orang yang menunggu. Contoh-contoh OpenAI sendiri dalam pengumuman pratinjau persis berbentuk seperti ini: membaca log saat gangguan sedang berlangsung, memadatkan loop riset semalaman menjadi satu sesi kerja.

Biarkan nonaktif jika beban kerjanya terikat throughput atau berbentuk batch. Re-indeks tiap malam, proses klasifikasi massal, laporan terjadwal, backfill — tidak satu pun dari ini peduli pada latensi wall-clock, semuanya didominasi oleh jumlah token, dan semuanya memiliki opsi 0,5x yang tersedia tepat di kartu tarif yang sama di Batch dan Flex. Membayar 12x tarif batch agar selesai lebih cepat adalah cara paling jelas untuk membuang uang di tabel ini.

Bagian tengah yang janggal adalah loop pengodean agentik, dan di situlah aritmetika jumlah giliran menentukan. Jika kecepatan itu benar-benar menghilangkan percobaan ulang — jika percobaan pertama model pada perubahan multi-berkas lebih sering berhasil karena tidak sedang melawan timeout — maka Ultrafast bisa lebih murah per tugas yang diselesaikan meskipun 6x per token. Itu klaim yang dapat diukur tentang trace Anda sendiri, bukan klaim umum, dan pengukurannya murah: hitung giliran yang ditagih per tugas yang diselesaikan di kedua tingkat lalu kalikan dengan tarifnya. Jika rasionya tidak mendekati enam, tingkat cepat adalah pembelian latensi dan harus dibenarkan sebagai pembelian latensi.

Tier tersebut sudah diberi harga; rute-rute di sekitarnya bukanlah pertanyaan yang sama.

Satu catatan praktis tentang cara menyikapi ini. GPT-6 Astra pada layanan standar telah aktif di OrcaRouter sebagai openai/gpt-6-astra dengan tarif penyedia sendiri — $10.00 input dan $50.00 output per juta token, dengan langkah konteks panjang 272K menjadi $20.00 / $75.00 — dilayani dengan markup 0%, artinya harga daftar penyedia diteruskan apa adanya dan setiap perubahan dari vendor masuk ke tagihan Anda pada hari yang sama saat perubahan itu muncul di daftar tarif OpenAI, bukan pada perpanjangan kontrak berikutnya. Kunci yang sama menjangkau lebih dari 200 model, sehingga tier standar dapat berada di belakang klien yang sama dengan tier murah atau model pesaing tanpa integrasi kedua.

Yang tidak kami lakukan adalah melayani tier Ultrafast. Itu adalah flag service-tier pada akun OpenAI, bukan model yang dapat dirutekan secara terpisah — Anda menetapkan service_tier: "ultrafast" pada permintaan ke gpt-6-astra — dan OpenAI menagihnya ke akun Anda sendiri dengan tarif di atas. Jika Anda mengaktifkannya, itu berada dalam integrasi OpenAI langsung Anda, dan OrcaRouter adalah tempat yang tepat untuk lalu lintas tier standar yang Anda rutekan bersamanya. Mengatakannya secara terus terang lebih berguna daripada menyiratkan kemampuan yang tidak kami miliki.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1M-token context window, 128K maximum output, text, image and file input, text output, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure, and 155.1M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

Aturan keputusan, dalam satu paragraf

Enam kali adalah harga sebuah tier, bukan harga sebuah model: bobot, jendela konteks 1.050.000 token, batas output 128.000 token, dan jawabannya semuanya identik dengan GPT-6 Astra standar. Yang Anda beli adalah throughput output hingga 8x lebih cepat, pada kartu tarif yang 6x di setiap baris, dengan batas laju awal yang rendah dan pembatasan residensi AS yang sepenuhnya mengecualikan UE. Pertukaran itu jelas benar bagi manusia yang menunggu jawaban, jelas salah untuk pekerjaan batch terjadwal yang memiliki jalur setengah harga, dan sungguh belum pasti untuk loop agentik yang jawabannya bergantung pada apakah kecepatan menghilangkan giliran. Ukur jumlah giliran pada jejak Anda sendiri sebelum berkomitmen, dan rutekan sisanya pada harga daftar.

A screenshot of OpenAI's Ultrafast documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the recommendation to use WebSockets because per-request network overhead can reduce the latency gains, the note that Ultrafast for GPT-6 Astra is available to all API users at low rate limits with higher limits or Sol preview access available through an OpenAI account team, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari