Kartu judul untuk artikel, dengan judul 'GPT-6 Astra Benchmarks' dan subjudul 'Setiap skor, siapa yang mengukurnya, dan di mana angka-angka itu tidak lagi berarti apa-apa'. Tiga chip statistik bertuliskan 'FrontierMath Tier 4: 98% (jenuh)', 'Terminal-Bench 4.0: 57.9% (dilaporkan vendor)' dan 'DeepSWE v1.1: 74% (independen, seri di posisi teratas)'. Baris footer bertuliskan 'Model dirilis 3 September 2026. Angka dibaca ulang pada 16 September 2026.' Logo OrcaRouter terletak di sudut kanan bawah kanvas yang diberi padding.
Guides & Insights

Benchmark GPT-6 Astra: Setiap Skor, Siapa yang Mengukurnya, dan Di Mana Angka-angka Itu Berhenti Bermakna

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

GPT-6 Astra mencetak 98% pada FrontierMath Tier 4 dan 99,9% pada ARC-AGI-3, dan OpenAI sendiri menyebut kedua tolok ukur itu sudah jenuh — yang menjadikan dua angka paling banyak dikutip di halaman model tersebut justru dua angka yang paling sedikit memberi tahu Anda apakah sebaiknya menggunakannya. Dibandingkan dengan GPT-5.6 Sol dan Claude Fable 5.1, baris-baris yang benar-benar membedakan justru ada di tempat lain: 57,9% pada Terminal-Bench 4.0, 74% pada DeepSWE v1.1 yang independen dan sekaligus hasil imbang, serta angka waktu per tugas yang lebih menentukan soal kegunaan daripada persentase mana pun di sini. Modelnya sendiri berasal dari 3 September 2026 — baru berusia tiga belas hari saat kami menerbitkan ini, bukan berita peluncuran. Ini adalah halaman referensi tentang berapa skor GPT-6 Astra, siapa yang menjalankan setiap pengukuran, dan apa yang ditunjukkan serta tidak ditunjukkan oleh setiap angka.

Alasan sebuah model berusia tiga belas hari masih layak mendapat satu halaman minggu ini adalah bahwa hal-hal yang dapat ditindaklanjuti pembaca baru datang setelah peluncuran. Ketersediaan luas selesai: Ope​nAI mengatakan pada 8 September bahwa Astra telah diluncurkan sepenuhnya kepada pengguna Plus, Pro, Business, dan Enterprise di Co​dex dan ChatGPT Work, setelah dibuka pada 3 September dengan pernyataan bahwa model itu "diluncurkan hari ini ke sejumlah organisasi terbatas dan dalam beberapa hari mendatang akan tersedia bagi semua pengguna ChatGPT Plus, Pro, Business, dan Enterprise, serta melalui Ope​nAI API, Microsoft Azure, dan AWS Bedrock." Akses Enterprise, yang nonaktif secara default saat peluncuran, menjadi sesuatu yang dapat diaktifkan administrator berdasarkan daftar tarif yang berlaku, dan halaman kerja enterprise Ope​nAI untuk model tersebut — yang diterbitkan pada 9 September — menyertakan kontrol admin dan empat plugin enterprise. Dan evaluasi independen pertama atas model tersebut muncul, dan itulah yang mengubah ini dari papan skor yang dibaca dari slide vendor menjadi sesuatu yang dapat ditimbang oleh pembeli.

Daftar benchmark lengkap, dengan sumber di setiap baris

Semua di bawah ini dilaporkan oleh OpenAI kecuali barisnya menyatakan sebaliknya. Pembedaan itu bukan sekadar hiasan: hanya satu dari angka-angka utama ini yang dihasilkan oleh pihak selain perusahaan yang menjual model tersebut, dan itulah yang ternyata berakhir seri.

FrontierMath Tier 4 — 98%. Dilaporkan oleh vendor menurut Ope​nAI, dan digambarkan oleh Ope​nAI sebagai telah menjenuhkan tier ini.

ARC-AGI-3 — 99,9%. Dilaporkan oleh vendor, dan juga digambarkan sebagai sudah jenuh. Ope​nAI menambahkan bahwa Astra "melampaui baseline efisiensi tindakan manusia kami pada 96% level, sehingga secara efektif mencapai paritas manusia pada benchmark tersebut" — klaim yang lebih spesifik dan lebih menarik daripada 99,9%, dan tetap merupakan pengukuran Ope​nAI sendiri.

ExploitBench — 100%. Dilaporkan vendor, dan skor sempurna.

Terminal-Bench 4.0 — 57,9%.Dilaporkan oleh vendor, yaitu Ope​nAI, dibandingkan dengan 37,3% untuk GPT-5.6 Sol dan 55,8% untuk Claude Fable 5.1, dengan perkiraan biaya API per tugas masing-masing sekitar 9% dan 63% lebih rendah. Angka biaya tersebut tidak disertai metodologi yang dipublikasikan dalam materi yang kami baca.

DeepSWE v1.1 — 74%. Diukur oleh Datacurve, bukan Ope​nAI. Ini adalah baris independen.

OSWorld 2.0 — 72,6%. Dilaporkan oleh vendor, sekitar 40 menit per tugas, yang menurut OpenAI berarti sekitar 47% lebih hemat waktu per tugas dibandingkan GPT-5.6 Sol.

Mind2Web — penyelesaian tugas 1,9x lebih cepat daripada "pengalaman GPT-5.6 Sol saat ini," dengan harness Co​dex yang telah diperbarui. Dilaporkan oleh vendor, dan perbandingannya dilakukan terhadap Sol dengan harness yang berbeda, bukan terhadap scaffold yang sama dengan model lain di dalamnya.

Keamanan — internal untuk Ope​nAI. Astra menghasilkan hasil yang tidak diinginkan 89% lebih jarang dibandingkan GPT-5.6 Sol dan 74,7% lebih jarang dibandingkan Claude Fable 5.1. Dalam evaluasi yang dimodelkan berdasarkan insiden Hugging Face, GPT-5.6 Sol tanpa pengaman produksi melampaui target yang diizinkan dalam 48% kasus; Astra melakukannya dalam 0% kasus.

A single-column scoreboard card titled 'GPT-6 Astra - the scoreboard' with six labelled rows: 'FrontierMath Tier 4: 98% (saturated)', 'ARC-AGI-3: 99.9% (saturated)', 'Terminal-Bench 4.0: 57.9% (vs GPT-5.6 Sol 37.3%)', 'DeepSWE v1.1: 74% (Datacurve, tied at top)', 'OSWorld 2.0: 72.6% at about 40 min per task', and 'List price: $10.00 in / $50.00 out per 1M'. The footer reads 'Vendor-reported by OpenAI except DeepSWE v1.1, measured by Datacurve. Read September 16, 2026.' The OrcaRouter logo is composited in the bottom-right.

Jenuh berarti tolok ukur itu tidak lagi menjadi alasan untuk membeli.

Ketika Ope​nAI mengatakan FrontierMath Tier 4 dan ARC-AGI-3 sudah jenuh, ia sedang menyatakan sesuatu yang spesifik dan layak dimaknai secara harfiah: tes-tes itu sudah berhenti membedakan. Sebuah benchmark membuktikan nilainya dengan memisahkan model-model — dengan menciptakan jarak antara sistem terbaik dan sistem berikutnya, sehingga seorang pembeli dapat membaca sebuah angka sebagai sebuah perbedaan. Begitu setiap model terdepan berada pada plafon atau dalam rentang noise darinya, skor berhenti mengukur model-model itu dan mulai mengukur sisa ruang yang dimiliki tes tersebut.

Artinya untuk halaman ini adalah bahwa 98% dan 99.9% tidak seharusnya digunakan untuk memilih apa pun. Keduanya bukan bukti bahwa Astra lebih baik daripada GPT-5.6 Sol atau Claude Fable 5.1 dalam matematika atau penalaran abstrak; keduanya adalah bukti bahwa ketiganya sudah melampaui tingkatan tersebut. Perbedaan antara 99.9% dan 98% tidak dapat dibaca sebagai keunggulan 1,9 poin dalam pengertian yang berarti, karena variasi antar-run pada evaluasi sebesar ini lebih besar daripada selisihnya. Angka dari vendor yang berada di plafon adalah pernyataan tentang plafon itu sendiri.

Semua itu bukan tanpa nilai. Saturasi adalah informasi yang sah tentang sebuah tier: ia memberi tahu Anda bahwa benchmark yang mungkin Anda gunakan untuk membandingkan model pada 2025 tidak akan lagi mengurutkan model-model itu, dan bahwa Anda harus berhenti memberi bobot pada benchmark itu dalam keputusan pengadaan. Ia juga memberi tahu bahwa klaim kemampuan yang menarik telah berpindah ke tempat lain — angka efisiensi tindakan manusia 96%-dari-level adalah upaya OpenAI untuk mengatakan sesuatu yang melampaui plafon, dan itulah subklaim yang perlu diperdebatkan, bukan 99,9%.

Ada peringatan kedua yang berlaku untuk ketiga baris teratas. FrontierMath Tier 4 dan ARC-AGI-3 dipublikasikan dengan cukup rinci sehingga dapat dikenali, tetapi harness, pengambilan sampel, dan konfigurasi penilaian yang digunakan Ope​nAI tidak diuraikan dalam materi yang kami baca, dan 99,9% pada tolok ukur yang protokolnya merupakan konfigurasi privat adalah angka yang dapat Anda kutip dan tidak dapat diperiksa. Jika suatu skor tidak disertai metodologi yang dipublikasikan, katakan demikian dan lanjutkan. Itulah yang kami lakukan dengan ini.

100% ExploitBench mengukur kemampuan yang tidak dapat digunakan oleh sebagian besar pengguna.

Skor sempurna juga merupakan batas atas, dan yang ini memiliki paruh kedua yang tidak biasa. Astra adalah model pertama yang mencapai ambang kemampuan keamanan siber Kritis di bawah Kerangka Kesiapsiagaan Ope​nAI, itulah sebabnya peluncurannya sampai dibatasi. Saat dirilis, model ini menolak tugas siber tingkat lanjut seperti menulis eksploit proof-of-concept; Ope​nAI mengatakan pihaknya berencana memperluas akses dengan pengaman yang lebih longgar melalui program Daybreak.

Jadi ExploitBench sekaligus merupakan angka paling mengesankan dalam daftar itu dan yang paling tidak dapat digunakan. Ini membuktikan bahwa kemampuan tersebut ada dan bahwa OpenAI mengukurnya serta bertindak berdasarkan hasil pengukuran itu — yang merupakan pembacaan jujur atas penetapan Critical, dan alasan peluncurannya bertahap alih-alih seketika. Ini tidak membuktikan bahwa Anda dapat melakukan apa pun dengan kemampuan itu melalui API publik, karena secara desain Anda sebagian besar tidak bisa. Jika keamanan ofensif adalah kasus penggunaan Anda, baris yang relevan dalam dokumentasi bukanlah 100%, melainkan perilaku penolakan dan jalur akses program Daybreak.

Terminal-Bench 4.0: keunggulan 24,6 poin atas Sol dan selisih 2,1 poin yang tidak membuktikan apa pun

Terminal-Bench 4.0 adalah tempat angka-angka vendor mulai berguna, karena sebarannya cukup lebar untuk bertahan dari derau di satu ujung dan cukup sempit untuk menjadi tidak informatif di ujung lain. Dibandingkan 37,3% milik GPT-5.6 Sol, 57,9% milik Astra adalah selisih 24,6 poin — cukup besar sehingga perbedaan harness kecil kemungkinannya sepenuhnya menjelaskannya, meskipun ini masih satu vendor yang mengukur modelnya sendiri dan pendahulunya yang juga ia bangun. Dibandingkan 55,8% milik Claude Fable 5.1, keunggulan 2,1 poin berada dalam rentang di mana kita seharusnya mengatakan terus terang bahwa itu tidak membuktikan apa pun. Dua model yang diukur dalam dua harness berbeda, pada benchmark yang toleransi penilaiannya tidak diterbitkan di halaman yang kami baca, terpisah dua poin, adalah seri dengan langkah tambahan. Jika keputusan Anda bergantung pada 2,1 itu, Anda belum menemukan keputusan — Anda telah menemukan kalimat pemasaran.

Klaim biaya per tugas pantas mendapat kalimat kecurigaan tersendiri. OpenAI memperkirakan Astra berbiaya API per tugas sekitar 9% lebih rendah daripada Sol dan 63% lebih rendah daripada Claude Fable 5.1 pada beban kerja ini. Itu semua adalah perkiraan, yang dipublikasikan tanpa rincian akuntansi tingkat tugas di baliknya, dan "biaya per tugas" bukanlah properti suatu model — melainkan properti dari suatu model, harness, anggaran token, dan kebijakan percobaan ulang secara bersama-sama. Arahnya masuk akal: Fable 5.1 adalah model $10/$50 seperti Astra, tetapi tugas yang membuatnya memerlukan lebih banyak langkah akan lebih mahal. Anggaplah persentase itu sebagai akuntansi OpenAI sendiri, bukan sebagai daftar tarif.

DeepSWE v1.1: baris independen, dan seri di dalamnya

Satu angka yang tidak dihasilkan oleh Ope​nAI justru adalah angka yang paling layak dimiliki — dan juga yang paling perlu diberi catatan. Pada Datacurve DeepSWE v1.1, tolok ukur rekayasa perangkat lunak berhorizon panjang yang terdiri atas 113 tugas di 91 repositori dalam lima bahasa, dijalankan melalui satu harness mini-swe-agent, GPT-6 Astra mencetak skor 74% ±3% Pass@1 dengan biaya rata-rata $6,52 per tugas, menghasilkan 30k token keluaran dalam 29 langkah. Datacurve menyebut hasil itu sebagai rekor.

Baca papan skornya, dan catatan rekornya adalah seri. Snapshot papan peringkat yang sama yang kami baca pada 16 September 2026 — bertanggal 3 September 2026 — menunjukkan gemini-3.8-flash [high] juga di 74%, dengan interval yang lebih ketat ±1%, dan claude-opus-5 [max] di 74% ±4%, dengan gpt-5.6-sol [max] tertinggal satu poin di 73% ±3%. Tiga model berbagi skor teratas dengan interval kepercayaan yang saling tumpang tindih, dan papan itu sendiri mencatat bahwa model-model teratasnya mengelompok dalam rentang yang sempit. Tidak ada apa pun di sana yang menandai pemegang rekor. Rekor yang dipegang tiga model secara bersamaan, dalam batas galat, adalah klaim yang sangat berbeda dari "rekor baru," dan versi jujurnya adalah: Astra mencapai klaster teratas pada evaluasi coding independen terkuat yang tersedia, dan tidak terpisah darinya.

Apa yang membedakan, dan apa yang disembunyikan oleh skor semata, adalah bagaimana ia bisa sampai ke sana. Angka 74% milik Astra memerlukan 29 langkah dan 30 ribu token keluaran. Entri gemini-3.8-flash yang berbagi skor itu membutuhkan 166 langkah dan 143 ribu token keluaran; claude-opus-5 membutuhkan 99 langkah dan 118 ribu. Skor sama, usaha sekitar seperlimanya — itu properti yang nyata dan berguna bagi siapa pun yang membayar per token atau menunggu agen, dan angka Datacurve mendukungnya dengan cara yang tidak bisa dilakukan baris vendor Ope​nAI. Namun garis biaya justru berlawanan arah: pada $6,52 per tugas, Astra adalah yang termurah dari ketiganya hanya jika Anda mengabaikan bahwa gemini-3.8-flash mencapai skor yang sama dengan $2,36. Pada tolok ukur ini, Astra efisien dalam langkah dan berharga menengah dalam dolar. Ambil skor seri dan jumlah langkahnya; jangan ambil "rekor."

OSWorld 2.0 dan waktu per tugas: angka yang menentukan apakah sebuah agen dapat digunakan

OpenAI melaporkan 72,6% pada OSWorld 2.0 dengan sekitar 40 menit per tugas, sekitar 47% lebih sedikit waktu per tugas dibandingkan GPT-5.6 Sol. Ini layak mendapat bobot lebih besar daripada yang disiratkan oleh posisinya dalam daftar, karena bagi agen penggunaan komputer, skor hanyalah separuh keputusan. Tingkat penyelesaian 72,6% memang bagus; tingkat penyelesaian 72,6% pada 40 menit per tugas adalah produk yang berbeda dari tingkat yang sama pada 75 menit, dan perbedaannya bukanlah sebuah persentase. Perbedaan itu adalah berapa banyak tugas yang dapat dituntaskan sebuah tim dalam satu hari kerja, berapa lama waktu aktual yang ditunggu manusia saat agen bekerja, dan apakah satu tugas yang macet menghabiskan sepanjang sore.

Dua catatan kualifikasi, yang keduanya lebih penting daripada tajuk utamanya. Pertama, angka itu dilaporkan vendor dan kami tidak menemukan skor OSWorld 2.0 independen untuk Astra yang bisa dipakai untuk memeriksanya — entri indeks independen yang kami baca tidak menyertakan OSWorld di antara komponennya, jadi tidak ada pengukuran kedua untuk disandingkan dengan yang ini. Kedua, "sekitar 40 menit" adalah rata-rata, dan rata-rata menyembunyikan bagian yang sebenarnya dirasakan operator: ekornya. Apakah desil tugas yang paling lambat selesai dalam satu jam atau empat jam adalah hal yang menentukan apakah agen membutuhkan manusia yang duduk di sampingnya, dan tidak ada vendor yang menerbitkan distribusi itu. Klaim Mind2Web — penyelesaian tugas 1,9x lebih cepat daripada pengalaman GPT-5.6 Sol saat ini — memiliki bentuk masalah yang sama, sedikit diperburuk oleh perbandingan yang dilakukan terhadap Sol yang di-harness secara berbeda, bukan terhadap scaffold yang sama dengan model berbeda di dalamnya. Lebih cepat itu kredibel di sini; seberapa lebih cepat, pada beban kerja Anda, tidak terukur.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max), captured 16 September 2026, showing an Artificial Analysis Intelligence Index of 53 ranked #3 of 199, output speed 52.9 tokens per second ranked #111 of 199, a cost of $3.26 per Intelligence Index task ranked #71 of 199, $10.00 input and $50.00 output per 1M tokens with a 90% cache discount, 60M output tokens generated on the Intelligence Index, a 1M-token context window, a knowledge cutoff of April 30, 2026, reasoning support marked 'Yes', and a total cost of $5324.10 to run the full index.

Evaluasi keselamatan juga merupakan pengukuran, dan yang ini bersifat internal.

Angka keselamatan seharusnya ada dalam referensi tolok ukur, bukan dalam catatan kaki, karena itu adalah jenis klaim yang sama dengan baris performa: sebuah pengukuran, yang dilakukan oleh pihak berkepentingan, dengan perbandingan yang dinyatakan. Astra menghasilkan hasil yang tidak diinginkan 89% lebih jarang daripada GPT-5.6 Sol dan 74.7% lebih jarang daripada Claude Fable 5.1. Dalam evaluasi yang dimodelkan berdasarkan insiden Hugging Face, GPT-5.6 Sol tanpa pengaman produksi melampaui target yang diizinkan dalam 48% kasus; Astra melakukannya dalam 0%.

Arahnya bermakna dan aritmetikanya tidak simetris. Salah satu sisi dari perbandingan kedua itu secara eksplisit adalah model yang pengamannya dihilangkan, sedangkan sisi lainnya adalah Astra sebagaimana dirilis — jadi selisih 48-versus-0 sebagian merupakan pengukuran pagar pengaman, bukan model yang mendasarinya, dan menafsirkannya sebagai "Astra lebih aman daripada Sol" melebih-lebihkan apa yang diuji. Angka 89% dan 74,7% bersifat internal Ope​nAI tanpa replikasi eksternal, pada evaluasi yang konstruksinya tidak dapat kami periksa. Ketiganya menunjuk ke arah yang sama dan ketiganya milik vendor sendiri; anggap semuanya menggembirakan dan belum direproduksi. Bagi pembeli perusahaan, baris-baris itu juga adalah baris yang paling perlu benar — justru itulah sebabnya baris-baris itu seharusnya menjadi baris yang Anda minta dibuktikan oleh vendor, bukan baris yang Anda terima dari halaman peluncuran.

Harga: $10 / $50, dibaca 16 September 2026 — dan 2,5x yang membutuhkan penyebut

Halaman benchmark yang menghilangkan harga adalah halaman yang berhenti di tengah jalan. Menurut dokumentasi harga Ope​nAI sendiri pada 16 September 2026, tarif standar konteks pendek untuk gpt-6-astra adalah $10.00 per juta token masukan, $1.00 per juta masukan yang di-cache, dan $50.00 per juta keluaran. Permintaan konteks panjang kira-kira dua kali lipat — sekitar $20 untuk masukan dan $75 untuk keluaran per juta. Di bawah 1,05 juta token konteks tidak ada pengali konteks panjang yang perlu direncanakan, tetapi di atas ambang tersebut tarif efektifnya berubah, dan itu layak dimodelkan sebelum Anda mengasumsikan angka $10 berlaku untuk eksekusi agen pada basis kode besar.

Perbandingan yang semua orang cetak adalah Astra versus GPT-5.6 Sol, dan di sinilah pengganda tanpa tanggal menjadi keliru. Tarif Sol pada halaman yang sama, pada hari yang sama, adalah $4,00 input / $0,40 cached / $20,00 output — dan Ope​nAI menyatakan bahwa ini adalah harga promosi yang tersedia setidaknya hingga 21 November 2026. Dibandingkan dengan tarif promosi itu, Astra adalah 2,5x pada input maupun output. Dibandingkan dengan harga daftar pra-promosi Sol sebesar $5,00 / $0,50 / $30,00, Astra adalah 2x pada input dan sekitar 1,67x pada output. Kedua angka itu benar; keduanya dibagi dengan penyebut yang berbeda. Angka 2,5x adalah yang Anda bayar hari ini, sedangkan 2x dan 1,67x adalah yang akan Anda bayar jika promosi Sol berakhir — dan karena Ope​nAI tidak menerbitkan tarif pasca-promosi, tidak ada yang bisa memberi tahu Anda mana yang harus digunakan anggaran 2027 Anda. Jika Anda melihat "2x" atau "2,5x" tanpa tingkat harga yang disebutkan dan tanpa tanggal, Anda sedang membaca separuh fakta.

Dua catatan harga lainnya, karena keduanya sering tertukar dengan harga daftar. Kutipan endpoint berbeda dari kartu milik OpenAI sendiri: endpoint Azure telah dicantumkan pada $10/$50 dan $11/$55, setidaknya satu endpoint telah dicantumkan pada $20/$100, dan daftar router menunjukkan $10/$50 dengan tier batch di $5/$25. Itu adalah kutipan untuk endpoint yang terpisah, bukan harga daftar OpenAI, dan tidak dapat saling dipertukarkan. Dan sebagai gambaran skala, pada halaman dan tanggal yang sama: GPT-5.6 Terra adalah $2.00 / $0.20 / $12.00 dan GPT-5.6 Luna adalah $0.20 / $0.02 / $1.20 — jadi Astra bukan model yang Anda gunakan secara refleks untuk mengarahkan lalu lintas massal. Harganya ditetapkan untuk pekerjaan yang dijelaskan oleh baris benchmark di atas: tugas end-to-end berhorizon panjang, di mana waktu aktual 47% lebih singkat dan langkah agen yang lebih sedikit dapat menutup biaya tarif token 2,5x, dan bukan untuk chat.

Itulah aritmetika yang membuat lapisan perutean layak dipertahankan, dan ada baiknya kita bersikap konkret tentang alasannya. GPT-6 Astra ada di katalog OrcaRouter sebagai openai/gpt-6-astra, dan platform meneruskan tarif daftar Ope​nAI pada markup 0% — jadi perubahan harga vendor, termasuk tarif promosi yang menjadi sandaran bagian ini, langsung berlaku di sisi kami pada hari yang sama alih-alih menunggu siklus penetapan harga ulang. Ini juga berarti pertanyaan tentang tingkatan di atas tidak lagi hipotetis: Anda dapat menempatkan Astra pada pekerjaan berhorizon panjang dan membiarkan Sol, Terra, atau Luna menangani volume, di balik satu kunci, tanpa kontrak kedua atau perubahan kode, dan melakukan failover di antara keduanya ketika salah satunya mengalami degradasi.

Screenshot of the OrcaRouter model page for GPT-6 Astra (catalog id openai/gpt-6-astra) captured 16 September 2026 with the site language set to EN, showing a 1M-token context window, 128K maximum output, text, image and file input, INPUT $10.00 and OUTPUT $50.00 per 1M tokens, p50 TTFT 6.70 s, p95 TTFT 10.00 s, 181.0M tokens of traffic in seven days, and an OpenAI-compatible Python code sample pointed at https://api.orcarouter.ai/v1 using the model id openai/gpt-6-astra.

Spesifikasi, perubahan Co​dex, dan apa yang belum dipublikasikan Ope​nAI

ID model — gpt-6-astra dalam dokumentasi Ope​nAI sendiri.

Konteks dan keluaran — jendela konteks 1.050.000 token, maksimum 128.000 token keluaran.

Batas pengetahuan — 30 April 2026. Dukungan token penalaran: ya.

Modalitas — input terdaftar sebagai file, gambar, dan teks. Daftar khusus itu berasal dari router, bukan dari OpenAI, dan kami melabelinya sebagai dilaporkan router, bukan dikonfirmasi vendor.

Tersedia di — ChatGPT Work, Co​dex, dan API, serta Microsoft Azure dan AWS Bedrock. Ruang kerja Enterprise dinonaktifkan secara default; administrator mengaktifkan akses sesuai kartu tarif yang berlaku, dan mendapatkan kontrol untuk membatasi situs web dan aplikasi desktop yang disetujui, mengelola unggahan dan unduhan, serta mengontrol riwayat penjelajahan. ChatGPT Work dan Co​dex menambahkan kebijakan konfirmasi sebelum tindakan yang berdampak dan tinjauan otomatis terhadap panggilan alat yang tidak aman atau tidak sah. Empat plugin enterprise dirilis bersama di ChatGPT Desktop: Oracle Analytics, Power BI (layanan Microsoft Fabric), Navan dan Avalara. Zero Data Retention tersedia untuk pelanggan API yang memenuhi syarat pada endpoint yang didukung, tergantung persetujuan.

Satu mekanisme layak disorot karena mengubah cara model berperilaku pada pekerjaan panjang, bukan cara model mendapat skor. Codex mendapatkan pendekatan konteks baru dengan Astra: catatan tetap tersimpan di seluruh jendela konteks alih-alih dipadatkan berulang kali menjadi satu ringkasan, dan jendela konteks sebelumnya tetap dapat dicari, sehingga persyaratan dan hasil pengujian dari pesan-pesan sebelumnya serta keluaran alat tetap dapat ditemukan. OpenAI menyebutnya eksperimental, diaktifkan di config.toml Codex, dan mengatakan bahwa ini akan menjadi default untuk Astra. Pada benchmark yang diukur dalam 29 langkah, itulah mekanisme yang paling mungkin menjelaskan jumlah langkahnya.

Apa yang tidak dipublikasikan sama pentingnya dengan apa yang dipublikasikan. Ope​nAI tidak menyatakan jumlah parameter atau komputasi pelatihan untuk model ini, dan kami juga tidak mencantumkannya. Angka "lebih dari 100.000 GPU di Stargate" beredar sebagai informasi tangan kedua dan tidak ada di halaman yang kami baca. Dokumentasi Ope​nAI juga tidak mencantumkan "Astra Pro" yang memiliki harga terpisah atau didokumentasikan secara terpisah, atau tier lain apa pun — pemberitaan merujuk pada salah satunya, tetapi daftar yang ada di router bukanlah dokumentasi vendor, dan kami tidak menyajikan tier yang tidak dapat kami temukan di dokumentasi Ope​nAI sendiri.

Apa yang sebenarnya harus diambil pembaca dari ini

Urutkan baris-baris berdasarkan seberapa besar seharusnya baris-baris itu memengaruhi sebuah keputusan. Pasangan yang sudah jenuh — 98% pada FrontierMath Tier 4 dan 99,9% pada ARC-AGI-3 — seharusnya tidak memengaruhinya sama sekali; keduanya menunjukkan bahwa tolok ukurnya sudah habis, bukan bahwa Astra memenangkan tolok ukur tersebut. Angka 100% ExploitBench nyata dan sebagian besar tidak dapat dimanfaatkan melalui model publik karena desainnya, yang merupakan pilihan keamanan yang disengaja, bukan keterbatasan yang perlu diakali. Terminal-Bench 4.0 adalah klaim performa vendor terkuat, dengan selisih nyata atas Sol dan selisih 2,1 poin atas Claude Fable 5.1 yang terlalu tipis untuk dipastikan. DeepSWE v1.1 adalah satu-satunya baris yang diukur secara independen; ia menempatkan Astra dalam seri tiga arah di puncak, bukan sendirian, dan jumlah langkah serta tokennya adalah bagian dari hasil itu yang layak dikutip. Angka 40 menit per tugas OSWorld 2.0 adalah angka yang paling bermakna secara operasional di halaman ini dan yang paling sedikit diperiksa secara independen. Baris-baris keamanan bersifat internal, tidak direproduksi, dan mengarah ke arah yang benar.

Itu menyisakan pembagian yang lugas. Jika minggu ini Anda memilih model untuk pekerjaan agentik berjangka panjang — pengodean berjam-jam, penggunaan komputer, tugas end-to-end yang jika tidak akan diawasi manusia — Astra adalah model dengan bukti terkini paling banyak di belakangnya, dan argumen biayanya bertumpu pada waktu yang dihemat per tugas, bukan token yang dihemat per panggilan. Jika Anda memilih untuk pekerjaan bervolume tinggi dengan interaksi singkat, angka 2,5x dibandingkan tarif promosi Sol adalah angka yang menentukan, dan jawabannya mungkin tidak. Dan jika Anda memilih berdasarkan kekuatan 98% atau 99,9%, Anda memilih berdasarkan dua baris yang sudah tidak lagi membawa informasi.

Pertanyaan yang layak diajukan yang belum dijawab halaman ini

Apakah keunggulan 2,1 poin di Terminal-Bench atas Claude Fable 5.1 itu nyata? Tidak berdasarkan bukti ini. Kedua angka itu berasal dari OpenAI yang mengukur modelnya sendiri melawan pesaing, dalam harness yang tidak bisa kita bandingkan, tanpa toleransi penilaian yang dipublikasikan. Itu adalah keunggulan dalam penghitungan OpenAI sendiri dan berada dalam rentang di mana pengujian ulang bisa membalikkannya. Cara untuk menyelesaikannya adalah menjalankan keduanya pada tugas Anda sendiri, yang hanya butuh beberapa jam kerja dan lebih bernilai daripada 2,1 poin itu.

Mengapa papan peringkat Datacurve tidak menobatkan Astra, padahal materi peluncuran Ope​nAI mengutip sebuah rekor? Karena papan itu mengukur, sedangkan halaman peluncuran itu menjual. Cuplikan Datacurve sendiri menunjukkan tiga model di angka 74% dengan interval kepercayaan yang tumpang tindih dan tidak menandai pemimpin mana pun. Klaim rekor yang dibandingkan dengan papan yang seri bukanlah kebohongan, melainkan soal pilihan penyebut — mode kegagalan yang sama seperti kelipatan 2,5x, dan alasan kita mencantumkan tanggal pada setiap angka di sini.

Jika tolok ukur teratas sudah jenuh, apa yang sebaiknya digunakan pembeli sebagai gantinya?Waktu per tugas, biaya per tugas yang diselesaikan, dan jumlah langkah pada pekerjaan berhorizon panjang — dimensi di mana angkanya masih tersebar dan masih berkorelasi dengan apa yang dibayar sebuah tim. Itu adalah pengukuran yang lebih sulit ditemukan dalam publikasi, yang justru menjadi alasan halaman peluncuran vendor masih mengedepankan tolok ukur yang sudah jenuh.

Pertanyaan terbuka

Angka yang akan membuat halaman ini cepat usang adalah harganya. Tarif promosi Sol berlaku setidaknya hingga 21 November 2026, dan OpenAI belum menerbitkan tarif pascapromosi; ketika itu berubah, angka 2,5x dalam artikel ini ikut berubah, ke arah 2x. Yang kedua adalah apakah ada pihak yang menjalankan ulang evaluasi ini secara independen pada harness yang sama — DeepSWE adalah model tentang bagaimana hal itu seharusnya dilakukan, dan OSWorld 2.0 serta Terminal-Bench 4.0 adalah dua baris yang paling membutuhkan perlakuan tersebut. Sampai saat itu, ringkasan jujur dari tolok ukur GPT-6 Astra adalah bahwa angka-angka yang mengesankan sudah jenuh, angka-angka yang membedakan dilaporkan oleh vendor dan selisihnya tipis, dan satu-satunya angka independen adalah hasil seri yang oleh materi peluncuran vendor itu sendiri disebut sebagai rekor.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari