
GPT-6 Astra Ultrafast Berjalan di Blackwell: NVIDIA Menyebut Perangkat Keras di Balik 8x
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 223 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Pada 1 Oktober 2026, NVIDIA menerbitkan postingan karya Dion Harris berjudul "Bagaimana GPU NVIDIA Membantu Mempercepat GPT-6 Astra Ultrafast milik OpenAI", dan kalimat di bagian tengahnya adalah pertama kalinya salah satu dari kedua perusahaan mengatakan apa yang menjalankan tier tersebut: "GPT-6 Astra Ultrafast, yang berjalan di GPU NVIDIA Blackwell, kini tersedia di API OpenAI dan bagi pengguna ChatGPT Work dan Codex yang memenuhi syarat." Itulah beritanya, dan cakupannya lebih sempit daripada yang disiratkan oleh judul. GPT-6 Astra, model tersebut, dirilis pada 3 September 2026. Tier layanan Ultrafast di atasnya menjadi tersedia secara luas pada 29 September 2026. Klaim kecepatan — hingga 8x lebih cepat dalam menghasilkan token dibandingkan mode standar Astra — sudah berusia dua hari ketika NVIDIA mengulanginya.
Yang memunculkan pertanyaan yang sebenarnya dijawab oleh postingan itu: bukan "seberapa cepatnya" melainkan "milik siapa silikonnya".

Tiga hal yang sebenarnya ditambahkan oleh postingan itu
Singkirkan pernyataan ulangnya, dan unggahan 1 Oktober menyumbang tiga fakta.
• Perangkat kerasnya — Blackwell. Dokumentasi Ultrafast milik OpenAI sendiri, yang diterbitkan pada 30 September, menjelaskan kecepatan tier tersebut, konfigurasinya, dan batas lajunya, dan sama sekali tidak menyebut GPU apa pun. Jadi atribusi silikon itu hanya bersumber dari satu pihak, yakni vendor perangkat keras. Itu tidak membuatnya salah; itu menjadikannya klaim vendor tentang peralatannya sendiri, dan layak diberi label sebagai demikian.
• Dua insinyur yang disebutkan namanya — Philippe Tillet, kepala inferensi OpenAI, dan Uday Ruddarraju, chief technology officer bidang komputasi OpenAI, keduanya dikutip secara terbuka tentang dari mana percepatan itu berasal.
• Audiensnya — "pengguna ChatGPT Work dan Codex yang memenuhi syarat," yang cakupannya lebih luas daripada kerangka khusus API saat tier ini diluncurkan. Dokumentasi OpenAI sendiri masih menyatakan bahwa Ultrafast untuk GPT-6 Astra "tersedia bagi semua pengguna API dengan batas laju yang rendah," dan catatan pembatasan rendah itu belum pernah dicabut secara resmi.
Dua kutipan itu, dan mengapa justru itulah bagian yang menarik
Kontribusi Tillet adalah sebuah loop, bukan tolok ukur. Investasi NVIDIA dalam perkakas dan dokumentasi, katanya, "telah memungkinkan kami membuat model kami sangat mahir dalam pemrograman," dan Astra kemudian dapat "mengubah pengetahuan itu menjadi kernel berkinerja tinggi yang membuat perangkat keras NVIDIA menarik." Ruddarraju lebih blak-blakan tentang arah pekerjaan itu: "Kami menggunakan model internal kami untuk mengoptimalkan inferensi pada GPU NVIDIA."
Jika dibaca bersama, itu adalah klaim tentang penerapan, bukan kemampuan: model-model terdepan OpenAI kini cukup baik dalam menulis kernel GPU sehingga OpenAI menggunakannya untuk mengoptimalkan stack serving miliknya sendiri. Hal ini juga konsisten dengan satu bagian dari tulisan NVIDIA yang sama sekali bukan tentang pekan peluncuran — sebuah judul yang berbunyi "Terus Meningkatkan Performa", yang berargumen bahwa inferensi yang telah diterapkan menjadi lebih cepat seiring waktu karena OpenAI terus mengarahkan model-modelnya sendiri ke perangkat lunak NVIDIA yang menjadi tempat sistemnya berjalan.
Tidak satu pun dari ini adalah pengukuran. Ini adalah dua insinyur yang menjelaskan sebuah proses, diterbitkan oleh perusahaan yang menjual GPU tersebut. Pembacaan yang jujur adalah bahwa proses itu masuk akal, mudah dipercaya, dan tidak dapat difalsifikasi dari luar — yang juga berlaku untuk setiap angka kecepatan dalam kisah ini.
Blackwell di sini, Cerebras di sana
Hal paling berguna yang dilakukan postingan ini adalah mengungkap perpecahan yang belum dijelaskan siapa pun. Pada 13 Agustus 2026, OpenAI mempratinjau tier cepat di atas model yang berbeda — GPT-5.6 Sol yang berjalan "hingga 14×" lebih cepat — dan menyebut Cerebras sebagai mitra di baliknya, seraya menjelaskan perangkat keras skala wafer yang menghasilkan hingga 750 token keluaran per detik. Tujuh minggu kemudian, tier cepat di atas Astra berjalan di Blackwell, dan angkanya adalah 8x.
Dua tier cepat, dua jawaban perangkat keras, salah satunya mitra spesialis dan yang lainnya pemasok terbesar perusahaan itu sendiri. Tidak ada vendor yang telah menerbitkan perbandingan antara kedua jalur serving tersebut, dan tidak ada evaluator independen yang mengukur salah satu pun. Perhatikan juga bagaimana postingan NVIDIA memperlakukan nama kedua: "Rubin" muncul sekali, di dalam kutipan Tillet tentang model yang menulis kernel untuk "Blackwell and Rubin GPUs." Ini adalah pernyataan tentang apa yang dapat diprogram oleh model-model OpenAI, bukan pernyataan bahwa ada yang sedang melakukan serving di Rubin hari ini.
Angka yang tidak dicetak NVIDIA
Ada sebuah angka dalam cerita ini yang belum ditempatkan oleh kedua perusahaan di samping 8x, dan itulah yang menentukan apakah sebuah tim mengaktifkan tier tersebut. Kartu tarif Ultrafast yang dipublikasikan OpenAI mencantumkan gpt-6-astra pada $60,00 per juta token input, $6,00 input cache, $75,00 penulisan cache, dan $300,00 output. Model yang sama pada tier standar adalah $10,00 dan $50,00, dengan input cache $1,00 dan penulisan cache $12,50. Setiap kolom persis enam kali tarif standar.
• Kelipatannya — 6.00x untuk input, output, input yang di-cache, dan penulisan cache. Bukan "hingga." Enam.
• Batas atas — 8x, angka yang dikutip kedua vendor dengan "hingga" yang disertakan dan tanpa syarat yang disebutkan.
• Apa artinya — kelipatan harga berada di bawah kasus terbaik yang diklaim oleh tier itu sendiri. Pada batas atas, pertukaran ini menguntungkan; pada berapa pun di bawah 6x untuk trafik Anda, Anda membayar lebih per unit waktu yang dihemat daripada yang tersirat dalam pemasaran. Itulah sebabnya satu-satunya uji yang bermakna untuk tier ini adalah pengukuran pada permintaan Anda sendiri.
• Tahap konteks panjang — di atas 272.000 token input, tarif Ultrafast menjadi $120,00 untuk input dan $450,00 untuk output, enam kali lipat tarif berjenjang tier standar itu sendiri.
• Detail operasional yang perlu dicermati — OpenAI mendokumentasikan tangga token per menit Ultrafast sebesar 500.000 untuk tier penggunaan 1 hingga 3, 1.000.000 untuk tier 4, dan 5.000.000 untuk tier 5; Ultrafast hanya mendukung residensi data AS dan pemrosesan global, tanpa endpoint pemrosesan regional UE atau regional non-AS lainnya; dan dokumentasi tersebut merekomendasikan WebSockets untuk Ultrafast "terutama untuk aplikasi agentic yang melakukan banyak panggilan tool secara cepat berturut-turut," sambil memperingatkan bahwa "tanpa koneksi persisten, overhead jaringan dapat mengurangi keuntungan latensi."

Poin terakhir itulah yang harus ditindaklanjuti. Tim yang mengaktifkan tier tersebut tetapi membiarkan HTTP per permintaan di bawahnya telah membayar enam kali tarif untuk mengembalikan sebagian peningkatan kecepatan itu kepada penyiapan koneksi — cara membuang uang yang terdokumentasi dan dapat dihindari.
Seperti apa ini dari satu endpoint
GPT-6 Astra tersedia di OrcaRouter sebagai openai/gpt-6-astra: jendela konteks 1.050.000 token, hingga 128.000 token keluaran, masukan teks, gambar, dan file, serta harga daftar OpenAI yang diteruskan langsung pada $10,00 masukan dan $50,00 keluaran per juta token, meningkat menjadi $20,00 dan $75,00 di atas 272.000 token masukan. Tolok ukur utama katalognya adalah 96,1 pada GPQA Diamond.
Tier Ultrafast tidak ada di OrcaRouter, dan memang tidak bisa ada: itu adalah atribut yang dikendalikan akses dari sebuah akun OpenAI, bukan sebuah id model, itulah sebabnya openai/gpt-6-astra-ultrafast mengembalikan model-not-found. Jika Anda mengaktifkan tier tersebut, ia berada di integrasi OpenAI langsung Anda. Apa yang diberikan oleh endpoint dengan lebih dari 200 model dengan markup 0% dalam situasi ini bukanlah jalur cepat — melainkan kendali. Karena harga daftar penyedia diteruskan apa adanya, bukan ditandai naik, perubahan tarif OpenAI sampai di sisi kami pada hari yang sama saat sampai di sisi mereka, dan karena jalur Astra standar sudah tersedia, eksperimen yang menyelesaikan keputusan ini adalah satu baris konfigurasi: prompt yang sama, tier standar, dan model yang lebih murah di sebelahnya, pada key yang sama. Itu adalah hal yang paling mendekati benchmark latensi yang akan pernah dijalankan sebagian besar tim, dan tidak ada biaya untuk menyiapkannya.

Apa yang masih belum diukur
Tiga hal dapat diperiksa hari ini. Tier tersebut ada, tercantum di rate card tepat enam kali tarif standar, dan per 1 Oktober secara publik dikaitkan dengan GPU NVIDIA Blackwell.
Satu hal yang tidak jelas: pengganda pada trafik Anda. Tidak ada vendor yang mempublikasikan distribusi latensi untuk tier itu pada tingkat konkurensi yang dinyatakan, dan tidak ada pihak ketiga yang telah mereproduksi 8x. Juga tidak ada benchmark yang membandingkan Astra pada Ultrafast dengan Astra pada standar, dan seharusnya tidak ada yang menyanjung — itu adalah checkpoint yang sama pada jalur yang lebih cepat, jadi pengaturan yang identik seharusnya menghasilkan jawaban yang identik pada kecepatan yang berbeda. Jika dua jalur Anda menyimpang pada prompt yang sama, Anda punya laporan bug, bukan fitur.
Jadi ringkasan berguna tentang 1 Oktober lebih kecil daripada yang tersirat dalam pengumuman. Ini adalah tier yang sama dengan harga yang sama dan plafon kecepatan yang sama yang belum diverifikasi, kini menyandang label perangkat keras. Label itu penting — label tersebut memberi tahu Anda lini akselerator mana yang OpenAI pakai untuk menskalakan ini, dan memberi tahu Anda bahwa kisah tier cepat telah berpindah dari mitra spesialis ke pemasok GPU terbesar di industri dalam waktu kurang dari dua bulan. Hanya saja, itu tidak memberi tahu Anda apa pun tentang anggaran latensi Anda sendiri, dan tidak akan ada posting yang melakukannya.
