Kartu judul bertuliskan 'GPT-6 Astra in Codex' dengan subjudul 'Catatan lintas jendela, tingkat upaya, dan tagihan sebenarnya', baris 'Model dirilis 3 September 2026 - halaman referensi diverifikasi 16 September 2026', dan tiga kartu berlabel untuk config.toml, Catatan plus riwayat yang dapat dicari, dan Biaya per sesi.
Guides & Insights

GPT-6 Astra di Codex: Catatan Lintas Jendela, Tingkat Upaya, dan Tagihan Sebenarnya

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

GPT-6 Astra adalah model dari 2026-09-03, dan halaman ini bukan liputan peluncuran — ini adalah referensi untuk mengarahkan agen coding Anda ke model itu sekarang setelah tersedia secara luas. Alasan seorang developer akan beralih adalah satu mekanisme spesifik, dan itu layak dipahami sebelum Anda mengeluarkan biaya apa pun untuknya: alih-alih memadatkan sesi panjang menjadi satu ringkasan lossy setiap kali jendela penuh, Co​dex dengan GPT-6 Astra menyimpan catatan lintas jendela konteks dan membuat jendela konteks sebelumnya tetap dapat dicari, sehingga persyaratan yang Anda nyatakan empat puluh giliran lalu dan keluaran tes yang gagal sepuluh giliran lalu keduanya masih dapat diambil, bukan diringkas hingga hilang. Ope​nAI menyebut fitur ini eksperimental, mengaktifkannya dengan satu baris di config.toml Co​dex Anda, dan mengatakan fitur ini akan menjadi default untuk Astra. Semua yang di bawah ini — konfigurasi persisnya, tingkat effort, hasil yang terukur, dan contoh perhitungan tagihan sesi yang menyebutkan baris input yang di-cache — dibaca dari halaman Ope​nAI sendiri pada 2026-09-16, dan setiap angka pihak ketiga diberi label demikian.

Ada dua hal yang terjadi minggu ini yang mengubah perhitungan dalam mengadopsinya. Pada 2026-09-12, pimpinan Co​dex dari Ope​nAI menerbitkan postmortem yang mengonfirmasi bahwa eksperimen manajemen konteks itu sendiri punya bug — eksperimen tersebut menyebabkan penghentian dini dan balasan terhadap pesan-pesan usang, dan dinonaktifkan untuk sekitar 4.000–5.000 pengguna yang menggunakannya — dan Ope​nAI menerbitkan reset penggunaan penuh untuk pengguna Co​dex dan Astra pada tengah malam 09-12 hingga 09-13. Pada minggu yang sama, workspace perusahaan yang memiliki Astra nonaktif secara default saat peluncuran menjadi dapat dikelola berdasarkan rate card mereka sendiri. Jadi, posisi yang jujur adalah: mekanismenya layak diadopsi, build-nya masih terus bergerak di bawah Anda, dan sebaiknya Anda mencobanya di sebuah branch, bukan pada tenggat waktu.

Apa yang benar-benar baru di Co​dex dengan GPT-6 Astra?

Minta agen coding mana pun bekerja selama enam jam dan Anda akan menabrak dinding yang sama. Jendela konteks terisi penuh, harness meringkas transkrip menjadi satu blok padat untuk memberi ruang, dan ringkasannya kehilangan informasi justru di bagian yang paling merugikan — alasan perbaikan sebelumnya gagal, bentuk persis dari tes yang gagal, sebuah batasan yang pengguna sebutkan secara sepintas pada giliran ketiga. Detail yang diambil kembali, bukan detail yang diringkas, adalah hal yang sebenarnya Anda inginkan.

Integrasi Co​dex milik Astra mengubah bentuk hal itu. Dokumentasi Co​dex Ope​nAI menyatakan secara gamblang: "Astra menyimpan catatan di seluruh jendela konteks dan dapat menelusuri pesan sebelumnya serta hasil alat dari tugas yang sama." Catatan bersifat tahan lama dan dapat ditulis; riwayat di baliknya tetap dapat dibaca, sehingga jendela sebelumnya masih dapat ditelusuri untuk bukti aslinya bahkan setelah catatan tentangnya ditulis. Persyaratan dan hasil pengujian dari pesan sebelumnya dan keluaran alat tetap dapat ditemukan.

Ope​nAI secara eksplisit menyatakan bahwa ini bukan pekerjaan yang sudah selesai. Referensi konfigurasinya mendeskripsikan flag tersebut sebagai "Aktifkan manajemen konteks eksperimental (nonaktif secara default)" dan mengatakan bahwa fitur ini "menggunakan catatan dan riwayat yang dapat dicari untuk mempertahankan detail yang terakumulasi". Dokumentasinya juga menyatakan bahwa fitur ini "tidak tersedia dengan proses masuk Business, Enterprise, atau API-key saat peluncuran". Ini juga bukan konteks tak terbatas — model tetap bernalar di dalam jendela yang terbatas, dan setiap pembacaan ulang catatan sebelumnya menghabiskan anggaran input giliran tersebut. Jendelanya adalah 1.050.000 token dengan maksimum 922.000 token input, menurut dokumentasi model Ope​nAI; mekanisme catatan berada di atasnya, bukan menggantikannya.

Konfigurasinya, persis seperti yang didokumentasikan OpenAI

Pengaturan ini adalah anak dari tabel [features] di Codex config.toml Anda — file tersebut berada di ~/.codex/ kecuali Anda telah menimpa CODEX_HOME. Jalur kunci yang didokumentasikan adalah features.context_management.experimental_mode, sebuah boolean, dan nilainya adalah true:

[features.context_management]
experimental_mode = true

Jika Anda sudah memiliki tabel [features] di dalam file, tambahkan key terkait di dalamnya alih-alih mendeklarasikan tabel tersebut dua kali:

[features]
context_management.experimental_mode = true

Gunakan salah satu bentuk saja. Tulisan komunitas tentang laporan flag menyebutkan bahwa mendeklarasikan jalur bertitik di root lalu membuka tabel [features] di bagian selanjutnya pada file yang sama bisa gagal diurai sebagai tabel yang dideklarasikan ulang, yang merupakan aturan TOML, bukan aturan Ope​nAI — tetapi hal ini sering mengganggu orang, jadi pilih satu bentuk dan konsistenlah dengannya. Setelah mengedit, mulaibaru: pengaturan tersebut tidak otomatis diterapkan ulang ke sesi yang sudah berjalan.

Bagian model dari file yang sama tidak istimewa, dan dokumen referensi Ope​nAI mendokumentasikan kunci-kunci ini secara langsung — model adalah "Model yang digunakan", model_provider secara default bernilai openai:

model = "gpt-6-astra"
model_provider = "openai"
model_reasoning_effort = "high"

Satu peringatan saat membaca versi dokumentasi. Referensi konfigurasi Co​dex mencantumkan model_reasoning_effort sebagai menerima minimal, low, medium, high, dan xhigh, dengan catatan xhigh bergantung pada model — sedangkan halaman model API Ope​nAI untuk gpt-6-astra mendokumentasikan reasoning.effort sebagai low, medium, high, xhigh, dan max. Slider klien dan API tidak menjelaskan kumpulan yang sama, jadi tetapkan effort secara eksplisit dan konfirmasi apa yang diterima klien Anda alih-alih berasumsi.

Memilih model — dan aturan akses yang sering membuat orang lengah

Dokumentasi model Codex OpenAI memberikan bentuk CLI secara langsung: codex -m gpt-6-astra. Dalam sesi interaktif, /model mengganti model dan menyesuaikan upaya penalaran; pada eksekusi sekali jalan, codex exec -m gpt-6-astra "Review the current changes" bekerja dengan cara yang sama. Di aplikasi desktop dan ekstensi IDE, kontrol model berada di bawah composer.

Aturan akses adalah tempat orang sering keliru, dan ini layak dibaca dua kali karena kedua fitur tersebut memiliki gerbang yang berbeda:

• Model ini — tersedia di ChatGPT Work, Codex, dan API, serta juga disediakan di Microsoft Azure dan AWS Bedrock. Halaman peluncuran OpenAI menyatakan Astra "sedang diluncurkan hari ini ke serangkaian organisasi terbatas dan dalam beberapa hari mendatang akan tersedia untuk semua pengguna ChatGPT Plus, Pro, Business, dan Enterprise".

• Manajemen konteks eksperimental — lebih sempit. Dokumentasi OpenAI menyatakan bahwa itu "Memerlukan login ChatGPT pada Plus, Pro, atau Pro Lite" dan bahwa itu "tidak tersedia dengan Business, Enterprise, atau login dengan kunci API saat peluncuran".

Baris kedua itulah yang perlu diinternalisasi. Anda bisa memanggil gpt-6-astra dengan kunci API, dan Anda bisa membayarnya lewat paket Business — tetapi fitur catatan lintas jendela tidak akan ada. Jika mekanisme catatan adalah alasan Anda beralih, Anda memerlukan sign-in ChatGPT Plus, Pro, atau Pro Lite di klien Co​dex, bukan kunci API. Ope​nAI menyebutnya sebagai ketersediaan yang bergantung pada "rollout, metode sign-in Anda, dan klien Anda", yang merupakan versi sopan dari hal yang sama.

A screenshot of OpenAI's official Codex models documentation showing the model and reasoning control beneath the composer set to '5.6 Sol Extra High', a note that Ultra mode uses subagents, and a Recommended models row of three cards - Astra described as the most capable model for complex work across code, apps and research with advanced reasoning and computer use, 5.6 Sol for complex coding and cybersecurity, and 5.6 Terra as the balanced lower-cost model. A GPT-5.5 retirement notice dated October 14, 2026 appears above.

Dua catatan tambahan lagi, yang dilabeli sebagai dilaporkan, bukan didokumentasikan vendor. Liputan tentang peluncuran menyatakan bahwa Co​dex CLI versi 0.153.0 atau lebih baru diperlukan untuk Astra; kami tidak dapat mengonfirmasi batas versi minimum tersebut di halaman Ope​nAI sendiri. Dan dokumentasi Co​dex menjelaskan preset pemilih model — Astra Light, Astra Medium, Astra Extra High, yang ditawarkan kepada akun Pro, Business ($100), dan Enterprise yang memenuhi syarat bersama penggeser penalaran. Itu adalah posisi pemilih, bukan produk terpisah: Ope​nAI mendokumentasikan satu id model, gpt-6-astra, dengan satu set spesifikasi dan satu harga, serta tidak menerbitkan spesifikasi atau tarif terpisah untuk konfigurasi "Astra Pro" atau "Astra Medium" mana pun. Anggap angka apa pun yang dikutip untuk tier Astra bernama sebagai belum diverifikasi.

Jika Anda ingin mencoba model ini sebelum menetapkan jalur produksi untuknya, merutekannya melalui satu endpoint bersama model Anda saat ini adalah cara murah untuk mengetahuinya — GPT-6 Astra ada di katalog OrcaRouter, jadi menjalankan perbandingan hanya memerlukan satu string model, bukan kontrak kedua dan SDK kedua.

Upaya penalaran: lima tingkat, dan berapa biaya masing-masing

Ope​nAI's dokumentasi API untuk gpt-6-astra mencantumkan lima tingkat upaya — low, medium, high, xhigh, dan max — dan panduan Co​dex bersikap blak-blakan tentang cara menggunakannya: "Gunakan tingkat penalaran terendah yang menghasilkan hasil yang Anda butuhkan," dan mulailah dari default, naikkan saat suatu tugas membutuhkan perencanaan yang lebih mendalam.

Alasan nasihat itu mahal untuk diabaikan khususnya pada model ini terletak pada posisi token penalaran dalam tagihan. Token penalaran adalah token keluaran, dan keluaran pada Astra adalah $50,00 per juta — sepuluh kali tarif masukan dan lima puluh kali tarif masukan yang di-cache. Jadi, pertukarannya tidak abstrak:

• Setiap tambahan 1.000 token penalaran per giliran dikenakan biaya $0,05 dengan tarif output.

• Dalam sesi 150 giliran, menyimpan 1.000 token penalaran ekstra per giliran berbiaya sekitar $7,50; menyimpan 5.000 token ekstra berbiaya sekitar $37,50.

• Dalam sesi yang dikerjakan di bawah ini, keluaran sudah menjadi baris tunggal terbesar pada $0.200 per giliran dibandingkan $0.090 untuk pembacaan cache — pertumbuhan penalaran adalah suku yang paling cepat menggerakkan total.

Apa yang Ope​nAI tidak menerbitkan adalah tabel per tingkat upaya: tidak ada angka vendor untuk berapa banyak token penalaran yang dikeluarkan xhigh atau max pada tugas coding relatif terhadap medium, dan tidak ada tolok ukur vendor yang dipecah berdasarkan tingkat upaya. Siapa pun yang mengutip kepada Anda rasio persis "max berbiaya 2x" sedang mengutip pengukuran mereka sendiri, bukan pengukuran Ope​nAI. Metode yang jujur adalah menjalankan satu tugas representatif pada dua tingkat upaya dan membaca blok penggunaan dalam respons — angka itu, dikalikan dengan $50 per juta, adalah premi upaya Anda yang sebenarnya.

Hasil yang diukur, masing-masing dengan sumbernya sendiri

Pekerjaan pengodean dan terminal, semuanya merupakan laporan vendor dari Ope​nAI kecuali ditandai sebaliknya. Terminal-Bench 4.0: GPT-6 Astra pada 57,9%, dibandingkan 37,3% untuk GPT-5.6 Sol dan 55,8% untuk Claude Fable 5.1 — dengan Ope​nAI memperkirakan biaya API sekitar 9% lebih rendah per tugas dibandingkan GPT-5.6 Sol dan 63% lebih rendah dibandingkan Claude Fable 5.1. DeepSWE v1.1 milik Datacurve menempatkan Astra pada 74,1% pada tolok ukur milik Datacurve sendiri, angka yang Datacurve gambarkan sebagai rekor baru dan yang oleh sebagian liputan dibulatkan menjadi 74%. Pada set agentik yang lebih luas, Ope​nAI melaporkan OSWorld 2.0 pada 72,6% dengan sekitar 40 menit per tugas — sekitar 47% lebih sedikit waktu per tugas dibandingkan GPT-5.6 Sol — di samping FrontierMath Tier 4 pada 98%, ARC-AGI-3 pada 99,9% dan ExploitBench pada 100%, semuanya digambarkan oleh Ope​nAI sebagai tingkat yang sudah jenuh atau efektif jenuh. Itu adalah angka vendor; kami belum mereproduksinya, dan pemeriksaan independen atas angka ARC-AGI-3 oleh ARC Prize menemukan bahwa angka itu diukur dalam lingkungan adaptor penyedia khusus dan turun dalam kondisi standar.

Hal yang bukan angka dari vendor adalah hal yang paling perlu diperhatikan oleh alur kerja tinjauan kode. CodeRabbit menerbitkan evaluasinya sendiri terhadap Astra pada 2026-09-04, dan hasilnya lebih sempit daripada judul utamanya. Pada pull request lintas berkas — tinjauan sulit yang mengharuskan menghubungkan suatu perubahan dengan konsekuensinya di tempat lain dalam basis kode — Astra menangkap sekitar 20% lebih banyak bug daripada GPT-5.6 Sol, dengan cakupan bug yang dapat ditindaklanjuti sebesar 57,1% berbanding 47,6%. Pada tinjauan keseluruhan, keuntungannya sebagian besar menguap: 61,3% berbanding 59,0%, kira-kira 4% lebih banyak. CodeRabbit menyebut keduanya sebagai "hasil awal yang bersifat indikatif" yang tidak menetapkan peringkat, dan mencatat bahwa metodenya tidak mengisolasi penyebab peningkatan tersebut. Halaman peluncuran OpenAI menyebut karya yang sama sebagai "lebih dari dua kali lipat pada pull request lintas berkas"; tulisan CodeRabbit sendiri memberikan angka 20% dan persentase cakupan di atas. Baca persentasenya, bukan ringkasannya.

A single-column scoreboard titled 'GPT-6 Astra in Codex - the scoreboard' with six rows: Terminal-Bench 4.0 at 57.9%, DeepSWE v1.1 at 74.1%, Mind2Web at 1.9x faster, context window of 1,050,000 tokens, cached input at $1.00 per 1M, and output at $50.00 per 1M. A footer reads 'OpenAI-reported except DeepSWE v1.1 (Datacurve); pricing per OpenAI, read September 16, 2026.'

Asimetri itu adalah angka tunggal yang paling berguna di halaman ini untuk memutuskan cara men-deploy model, dan ia mengarah ke arah yang sama dengan harga: keuntungannya terkonsentrasi pada penalaran lintas file, jadi di situlah Anda menggunakan model.

Apa yang diubah oleh penggunaan komputer di Co​dex untuk alur kerja Anda

OpenAI mengatakan bahwa harness Codex yang diperbarui membuat GPT-6 Astra 1,9x lebih cepat dalam menyelesaikan tugas di Mind2Web dibandingkan pengalaman GPT-5.6 Sol saat ini. Mind2Web adalah otomatisasi tugas web, jadi bacalah itu sebagai: pekerjaan agen yang harus menyentuh browser atau GUI selesai secara signifikan lebih cepat, dan harness yang diperbarui yang sama itulah yang Anda jalankan setiap kali Anda menggunakan Codex. Angka pendampingnya adalah hasil OSWorld 2.0 di atas — 72,6% pada kira-kira 40 menit per tugas, sekitar 47% lebih sedikit waktu per tugas dibandingkan Sol.

Bagi seorang developer, konsekuensi praktisnya adalah perubahan dalam hal apa yang layak didelegasikan. Alur kerja yang sebelumnya terlalu lambat untuk diotomatisasi secara end-to-end — menjalankan konsol staging tanpa API, mereproduksi bug melalui UI, menelusuri formulir bertahap untuk menghasilkan fixture — kini masuk ke rentang di mana satu kali menjalankan agen lebih murah daripada mengerjakannya secara manual. Hal ini juga meningkatkan nilai kontrol di sisi enterprise yang dirilis OpenAI bersamaan dengan itu: ChatGPT Work dan Codex menambahkan kebijakan konfirmasi, yakni persetujuan sebelum tindakan yang berdampak penting, serta peninjauan otomatis terhadap pemanggilan tool yang tidak aman atau tidak sah. Jika Anda membiarkan agen mengklik menembus antarmuka sungguhan, lapisan peninjauan itulah yang menjadi pembatas antara satu kali eksekusi yang buruk dan sore yang berantakan — dan itulah alasan mengapa akses enterprise yang nonaktif secara default, dengan administrator mengaktifkannya sesuai rate card yang berlaku, merupakan fitur tata kelola, bukan hambatan.

Menetapkan harga untuk alur kerja, bukan token

Inilah harganya, lengkap dengan nama dan tanggal. Dari halaman harga Ope​nAI, dibaca pada 2026-09-16, gpt-6-astra standar adalah $10.00 per juta token masukan, $1.00 per juta token masukan yang di-cache, $12.50 per juta penulisan cache, dan $50.00 per juta token keluaran. Batch dan Flex dikenakan setengah dari tarif tersebut; mode Fast menggandakannya. Baris masukan yang di-cache itulah yang menentukan tagihan Anda dalam loop agentik, karena agen coding mengirim ulang konteks besar yang sebagian besar tidak berubah setiap giliran, dan masukan yang di-cache biayanya sepersepuluh dari masukan baru.

Dua ambang batas penting sebelum perhitungan. Dokumentasi model Ope​nAI menyatakan bahwa prompt di atas 272.000 token masukan dikenakan tarif 2x untuk masukan dan tarif cache serta 1,5x untuk keluaran untuk keseluruhan permintaan — bukan hanya kelebihannya — dan halaman harga mencantumkan baris konteks panjang pada $20.00 masukan, $2.00 masukan yang di-cache, dan $75.00 keluaran. Dan setiap token penalaran ditagih pada tarif keluaran, seperti yang dibahas di atas.

Ambil refactor semalaman yang realistis: 150 giliran model, rata-rata 100.000 token masukan per giliran, yang 90.000 di antaranya adalah pembacaan cache dan 10.000 adalah token baru, dan 4.000 token keluaran per giliran termasuk penalaran. Di bawah ambang 272K, dengan tarif standar:

• Input yang di-cache — 90.000 token × $1,00 per juta = $0,090 per giliran

• Input baru — 10.000 token × $10,00 per juta = $0,100 per giliran

• Keluaran — 4.000 token × $50,00 per juta = $0,200 per giliran

• Total — $0.390 per giliran, jadi 150 giliran sekitar $58.50 untuk sesi ini

Sekarang pindahkan sesi yang sama melewati ambang batas. Pada 300.000 token masukan per giliran — 270.000 di-cache, 30.000 baru — seluruh permintaan dihargai ulang, sehingga masukan yang di-cache menjadi dua kali lipat menjadi $2,00, masukan baru menjadi dua kali lipat menjadi $20,00, dan output menjadi $75,00:

• Input yang di-cache — 270.000 × $2,00 per juta = $0,540 per giliran

• Input baru — 30.000 × $20,00 per juta = $0,600 per giliran

• Keluaran — 4,000 × $75.00 per juta = $0.300 per giliran

• Total — $1.44 per putaran, atau sekitar $216.00 untuk 150 putaran

Bentuk tugas yang sama, tagihannya sekitar 3,7x lipat, dan seluruh perbedaannya terletak pada sisi mana dari 272.000 token transkrip Anda berada. Itulah argumen untuk mekanisme catatan dalam satu kalimat: jika catatan yang tahan lama dan riwayat yang dapat dicari memungkinkan Anda menjaga konteks kerja tetap lebih ramping alih-alih menyeret seluruh transkrip ke depan, fitur ini membayar dirinya sendiri dalam token masukan bahkan sebelum ia membantu kualitas. Ini juga argumen untuk tidak membiarkan proses tanpa pengawasan menumbuhkan transkrip tanpa batas.

A screenshot of the OrcaRouter model page for GPT-6 Astra showing the catalog id openai/gpt-6-astra, 1M tokens of context and 128K max output, text, image and file input with text output, reasoning, coding and agentic use cases, $10.00 per 1M input and $50.00 per 1M output, the /v1/chat/completions and /v1/responses endpoints, and an OpenAI-compatible code sample pointed at api.orcarouter.ai/v1.

Sebagai gambaran, sesi 150 giliran yang sama dengan profil token yang sama pada tier yang lebih murah: GPT-5.6 Terra dengan tarif yang dipublikasikan sebesar $2.00 input / $0.20 cache / $12.00 output menjadi sekitar $12.90, dan GPT-5.6 Luna pada $0.20 / $0.02 / $1.20 menjadi sekitar $1.29. Itu adalah perhitungan aritmetika berdasarkan tarif yang dipublikasikan Ope​nAI, bukan klaim bahwa keduanya akan menyelesaikan tugas yang sama — yang justru menjadi inti dari dua bagian berikutnya.

Jika Anda membandingkan semua ini di berbagai penyedia, perlu diketahui bahwa OrcaRouter meneruskan harga daftar penyedia dengan markup 0%, sehingga perubahan harga vendor langsung berlaku pada endpoint yang dirutekan pada hari yang sama, bukan pada faktur berikutnya.

Mode kegagalan yang perlu diperhitungkan dalam desain

Astra adalah model long-horizon pada desain long-context, dan kedua bagian dari deskripsi itu adalah tempat masalahnya berada. Ini adalah temuan komunitas dan postmortem vendor, bukan pengukuran kami.

• Eksperimen manajemen konteks mengalami bug minggu ini. Postmortem OpenAI 2026-09-12 mengonfirmasi eksperimen opt-in tersebut "menyebabkan penghentian dini dan balasan terhadap pesan-pesan basi", memengaruhi sekitar 4.000–5.000 pengguna, dan eksperimen itu dinonaktifkan. Postmortem yang sama menyebutkan dua penyebab lain dari keluhan kualitas pada minggu peluncuran: skill yang ditulis untuk model-model sebelumnya tidak berfungsi sebagaimana mestinya dan mencegah Astra memeriksa pekerjaannya sendiri, serta mesin penyajian yang salah konfigurasi menurunkan kualitas pada sebagian kecil lalu lintas. Reset penggunaan menyusul pada tengah malam 09-12 hingga 09-13.

• Berpikir berlebihan dan penyebaran pengujian. Sebuah thread r/codex yang dibagikan secara luas menggambarkan Astra merespons permintaan fitur kecil dengan terlebih dahulu membangun lapisan-lapisan verifikasi, smoke test, dan pemeriksaan hash, menjalankannya dalam beberapa urutan, serta melaporkan meter penggunaan hampir habis jauh sebelum fitur itu ada. Laporan-laporan tersebut merupakan catatan individu, bukan pengukuran terkontrol, dan keluhan serupa beredar tentang model-model frontier lain pada bulan sebelumnya — jadi perlakukan itu sebagai pola nyata yang perlu dijadikan acuan cakupan, bukan laju yang dapat Anda rencanakan.

• Run yang tidak berhenti. Armin Ronacher, pencipta Flask, menceritakan membiarkan Astra berjalan tanpa pengawasan selama 35 jam, yang pada akhirnya menghasilkan sekitar 75.000 baris kode neto di 79 commit, sekitar 1.400 pesan antar-agen, dan sekitar $1.200 biaya API — sekitar $15,50 per commit — namun, menurut penilaiannya, tidak ada apa pun bernilai yang dihasilkan. Laporan mengenai jumlah token bervariasi, jadi anggap angka itu sekadar perkiraan kasar. Ia menilai tidak adanya kondisi berhenti sebagai masalah harness yang sama besarnya dengan masalah model, dan itulah pembacaan yang dapat ditindaklanjuti: tentukan definisi selesai sebelum Anda memulai.

• Kegagalan sebaliknya juga ada. Laporan komunitas menggambarkan Astra berhenti sebelum tugas benar-benar selesai dan menunggu prompt untuk melanjutkan, yang merupakan akar masalah yang sama jika dilihat dari sisi lain — gagasan tentang "selesai" yang kurang terdefinisi. Mendefinisikan "selesai" secara eksplisit adalah satu baris yang paling bernilai dalam prompt tugas Anda.

Sesi panjang dapat menjadi tidak dapat dipulihkan. Masalah Co​dex yang terbuka melaporkan situasi serba salah ketika jendela konteks penuh, pemadatan otomatis terpicu, tugas pemadatan itu sendiri kehabisan konteks, dan utas tidak dapat dipulihkan — dan secara terpisah, bahwa rute catatan dan riwayat bawaan mengembalikan 404 pada Pro dengan Astra dalam beberapa konfigurasi, sementara menukar jendela dapat membuang status tugas. Keduanya adalah laporan terbuka, bukan pernyataan vendor, tetapi keduanya mendukung agar proses tetap di-checkpoint di git daripada mempercayai sesi untuk bertahan.

• Catatan yang kedaluwarsa adalah sifat desain, bukan bug. Tidak ada yang menjamin sebuah catatan mencerminkan keadaan terkini dari file yang dijelaskannya, dan pencarian adalah pencocokan substring literal, bukan semantik. Simpan jalur sumber bersama catatan, verifikasi ulang saat ada perubahan, dan perlakukan catatan dari proses yang berjalan tanpa pengawasan sebagai bukti untuk diperiksa, bukan kebenaran yang bisa diandalkan.

• Batas penggunaan menjadi keluhan yang masih berlangsung. Laporan dari minggu 2026-09-14 mencakup batas hingga empat kali lebih ketat daripada minggu peluncuran dan keluhan yang belum terselesaikan bahwa upaya xhigh menghabiskan lebih sedikit jatah daripada medium — yang, jika hal itu berlaku, berarti upaya dan kuota tidak bergerak bersama. OpenAI belum menerbitkan batas numerik per paket untuk Astra.

Kapan model yang lebih murah adalah pilihan yang tepat

Hasil terukur di atas membuat keputusan perutean untuk Anda. Keunggulan Astra terkonsentrasi pada pekerjaan yang mencakup banyak file atau berlangsung selama berjam-jam: tinjauan lintas file, tugas agentik berhorizon panjang, alur penggunaan komputer. Pada penyuntingan file tunggal biasa, refaktor mekanis, perancah pengujian, dan pemformatan, selisih tinjauan keseluruhan sekitar 4% terhadap GPT-5.6 Sol tidak membenarkan harga per token saat ini yang sekitar 2,5 kali lipat — dan kesimpulan CodeRabbit sendiri mengarah ke hal yang sama, merekomendasikan perutean tugas yang cerdas alih-alih penggantian menyeluruh. Simpan model mahal untuk tugas-tugas yang menunjukkan keunggulannya, dan arahkan sisanya ke model yang lebih murah.

Secara konkret, pembagian kerja yang berhasil: GPT-6 Astra untuk perubahan lintas file, basis kode yang tidak dikenal, proses agen berjam-jam, dan apa pun yang menyentuh browser; GPT-5.6 Terra untuk suntingan terbatas, boilerplate, dan pembuatan tes; GPT-5.6 Luna untuk klasifikasi, ekstraksi, dan proses mekanis bervolume tinggi. Berdasarkan perhitungan sesi di atas, selisih antara menjalankan semuanya di Astra dan menjalankan sepertiganya di Astra adalah selisih antara sekitar $58,50 dan sekitar $28 untuk 150 giliran yang sama.

Memperoleh pembagian yang tepat itulah tujuan sebuah lapisan perutean. OrcaRouter menempatkan 200+ model di balik satu API, sehingga pembagian di atas hanyalah perubahan konfigurasi, bukan tiga integrasi — dan failover otomatis berarti fitur eksperimental yang sedang mengalami minggu buruk, seperti yang dialami fitur ini, akan menurunkan kualitas proses Anda alih-alih mengakhirinya. Untuk model yang mekanisme konteksnya sendiri masih dilabeli eksperimental oleh OpenAI dan sempat dinonaktifkan, memiliki jalur kedua yang terkonfigurasi bukanlah paranoia; itu adalah tingkat kehati-hatian yang tepat.

Apa yang perlu diperhatikan dari sini

Empat hal akan mengubah halaman ini, dan keempatnya masih terbuka. Apakah eksperimen manajemen konteks akan diaktifkan kembali dan dalam bentuk apa — OpenAI mengatakan bahwa itu akan menjadi default untuk Astra, yang berarti baris konfigurasi di atas pada akhirnya tidak lagi menjadi sesuatu yang Anda atur. Apakah laporan 404 untuk catatan dan riwayat di Pro akan ditutup, karena itulah perbedaan antara mekanisme yang bekerja sesuai dokumentasi dan yang bekerja hanya pada beberapa rute. Apakah OpenAI menerbitkan data token atau biaya per upaya, yang merupakan angka yang hilang dalam setiap keputusan upaya saat ini. Dan apakah batas penggunaan yang diperketat selama minggu peluncuran akan dilonggarkan setelah permintaan yang menghentikan sementara langganan baru Pro $200 pada 2026-09-10 terserap.

Sampai saat itu, playbook-nya singkat. Sematkan model dengan codex -m gpt-6-astra, aktifkan eksperimennya hanya jika Anda memiliki login Plus, Pro, atau Pro Lite di klien, atur effort secara eksplisit alih-alih memercayai label penggeser, jaga konteks kerja Anda di bawah 272.000 token karena di situlah tagihannya menjadi dua kali lipat, tetapkan definisi selesai sebelum Anda pergi, dan arahkan pekerjaan yang mudah ke tempat yang lebih murah. Model ini berasal dari 2026-09-03 dan tidak akan ke mana-mana; perkakas di sekitarnya-lah yang masih dalam proses menjadi mapan.

Pertanyaan-pertanyaan yang muncul

Apakah fitur catatan lintas jendela layak diaktifkan untuk tugas berukuran biasa? Umumnya tidak. Fitur ini ada untuk mengatasi kehilangan di batas jendela konteks, jadi pada tugas yang muat dalam satu jendela, fitur ini menambah bagian yang bergerak — termasuk jalur kode eksperimental yang dinonaktifkan karena bug pada 2026-09-12 — tanpa menghilangkan masalah apa pun. Aktifkan untuk pekerjaan jangka panjang dan biarkan nonaktif untuk penyuntingan yang terbatas.

Bisakah jendela 1.050.000 token menggantikan retrieval dalam konfigurasi saya? Bukan karena alasan biaya. Membaca kembali konteks yang besar pada setiap giliran akan ditagih pada setiap giliran, dan di atas 272.000 token input, seluruh permintaan dihargai ulang menjadi $20,00 untuk input dan $75,00 untuk output. Langkah retrieval yang menjaga konteks kerja tetap lebih kecil biasanya merupakan desain yang lebih murah, itulah sebabnya mekanisme catatan ini menarik: ia adalah retrieval yang tertanam di dalam harness.

Apa yang terjadi pada catatan ketika sebuah tugas berakhir? Dokumentasi Ope​nAI membatasi mekanisme ini pada tugas yang sama, dan tulisan-tulisan komunitas menggambarkan catatan tersebut disimpan pada tugas itu, bukan dibawa ke depan secara otomatis. Jangan berasumsi bahwa tugas baru mewarisi catatan tugas sebelumnya; apa pun yang harus bertahan sebaiknya berada di repositori Anda, bukan di memori agen.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari