OpenAI Astra-1
Guides & Insights

OpenAI Astra: Semua yang Kita Ketahui Tentang Model yang Bukan GPT-6

Penulis

Jim Song

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Yang dapat Anda unduh hari ini bukanlah sebuah model. Itu adalah sepuluh file kode Lean. Pada 1 Agustus 2026, OpenAI menerbitkan sebuah tulisan riset tentang matematika, dan di dalamnya terkandung konfirmasi pertama tentang nama sistem frontier terbarunya: Astra. Tidak ada kartu model, tidak ada halaman harga, tidak ada endpoint API, dan tidak ada tanggal. Flagship saat ini yang benar-benar dapat Anda panggil masih GPT-5.6 Sol, dengan harga $5 per juta token input dan $30 per juta token output, persis seperti sejak 9 Juli.

Jika Anda mencari GPT-6, inilah versi singkatnya: OpenAI belum pernah mengumumkan model dengan nama itu, dan hingga saat ini mereka belum memutuskan apakah Astra akan dirilis sebagai GPT-6, sebagai rilis poin GPT-5 seperti GPT-5.7, atau sebagai tingkat keempat yang berdampingan dengan Sol, Terra, dan Luna. Ambiguitas penamaan itu bukan karena keengganan berhadapan dengan pers. Ini adalah pertanyaan internal yang masih terbuka, yang dilaporkan oleh The Information pada 31 Juli dan belum terpecahkan sejak saat itu.

Berikut ini memisahkan tiga hal yang dicampuradukkan oleh sebagian besar liputan kisah ini: apa yang dinyatakan OpenAI sendiri, apa yang ditambahkan oleh pemberitaan kredibel, dan apa yang beredar tanpa sumber yang jelas. Bukti-bukti tersebut adalah artefak nyata yang dapat Anda kompilasi. Angka 10-triliun-parameter adalah angka yang diketik seseorang di internet. Hal-hal itu layak diberi bobot yang sangat berbeda.

Apa yang sebenarnya dikatakan OpenAI — dan daftar yang jauh lebih panjang tentang apa yang tidak dikatakannya

Pengumuman itu tidak datang sebagai peluncuran produk, melainkan sebagai makalah. Postingan OpenAI menjelaskan hasil yang diproduksi oleh "versi internal Astra, model utama kami berikutnya," pada berbagai masalah yang, menurut kerangka penjelasannya, belum mengalami kemajuan pada hasil utama selama setidaknya satu dekade. Astra digambarkan sebagai sistem yang dibangun untuk pekerjaan jangka panjang: beberapa agen berkoordinasi pada berbagai bagian dari satu masalah besar dalam rentang waktu yang panjang, bukan menjawab dalam satu kali proses.

Itu hampir mencakup seluruh deskripsi teknis resmi. Jika dibandingkan dengannya, daftar ketidakhadirannya sangat mencolok:

Dikonfirmasi oleh OpenAI — nama Astra; bahwa itu adalah "model besar berikutnya"; bahwa versi internal menghasilkan sepuluh hasil; niat desain multi-agen, jangka panjang; manuskrip 249 halaman; sertifikat Lean 4 di repositori publik; perkiraan biaya token yang dikutip pada tarif GPT-5.6 Sol.

Tidak disebutkan oleh OpenAI — tanggal rilis; harga; jendela konteks; jumlah parameter; skor benchmark apa pun; kartu model; apakah mencapai ChatGPT atau hanya API; berapa banyak agen yang dijalankan, untuk berapa lama, pada perangkat keras apa; prompt; tingkat keberhasilan; nama produk akhir.

Pelaporan kredibel memberikan sedikit informasi tambahan. The Information melaporkan bahwa Sam Altman mendemonstrasikan Astra kepada para pembuat kebijakan di Washington pada akhir Juli — sebuah briefing yang, menurut laporan tersebut, dihadiri oleh Senator Raphael Warnock, Bernie Moreno, dan Mark Warner, dengan Menteri Keuangan Scott Bessent dan Menteri Perdagangan Howard Lutnick juga hadir. Keluarga model tersebut digambarkan sudah dalam tahap pengujian, dengan "Astra" sendiri masih berupa label sementara.

Belum ada seorang pun di luar OpenAI yang menjalankan model ini pada apa pun. Setiap klaim kemampuan yang beredar berasal dari sepuluh bukti yang dipublikasikan atau dari demo yang tidak dilihat publik.

Sepuluh bukti: luar biasa dapat diperiksa, dan masih belum tuntas.

OpenAI Astra-2

Di sinilah pengumuman ini benar-benar lebih kuat daripada pengumuman hasil benchmark biasa, dan penting untuk memahami alasannya secara tepat. OpenAI tidak sekadar memublikasikan skor dan meminta dipercaya. Mereka menerbitkan artefak yang dapat diperiksa mesin di bawah Apache 2.0 di repositori openai/ten-proofs — satu file Lean untuk setiap hasil, dikunci ke Lean 4.32.0 dengan dependensi mathlib, bersama direktori ComparatorChallenges untuk pemeriksaan independen. Repositori tersebut masuk sebagai satu commit pada 1 Agustus dan sejak itu telah mengumpulkan beberapa ratus bintang serta puluhan fork.

Sepuluh hasil tersebut, sebagaimana repositori menamainya, mencakup rentang bidang yang luar biasa luas:

Teori grup — konstruksi grup non-sofik, yang memberikan jawaban negatif atas pertanyaan yang telah terbuka sejak 1999. Sofisitas adalah sifat yang dipenuhi oleh hampir setiap grup yang dipelajari para matematikawan; pertanyaan apakah setiap grup diskret terhitung harus memenuhinya telah terbuka selama 27 tahun.

Aljabar operator — sebuah kontra contoh yang berkaitan dengan konjektur kekakuan Connes, yang diajukan oleh peraih medali Fields Alain Connes pada tahun 1980.

Geometri dimensi tinggi — sebuah perbaikan pada metode pengemasan bola, dilaporkan sebagai yang pertama dari jenisnya sejak 1978 — serta bentuk tajam dari pertidaksamaan volume Ehrhart.

Teori pengkodean — batas baru untuk kode biner dan kode bola.

Kompleksitas — batas bawah sirkuit aritmetika untuk permanen, dan hasil pengulangan paralel eksponensial untuk permainan terjerat.

Kriptografi kisi — kekerasan polinomial tetap untuk masalah vektor terdekat.

kombinatorika ekstremal — skala pertumbuhan bilangan Ramsey segitiga multiwarna, dan kontracontoh dalam teori graf ekstremal, termasuk karya tentang beberapa masalah Erdős yang telah dikatalogkan.

Reaksi para matematikawan lebih tertarik daripada meremehkan. Thomas Bloom, yang mengelola database masalah Erdős, menyebut hasil tersebut sebagai berita besar dan menilainya di atas contoh penyangkal konjektur jarak satuan dari bulan Mei. Noam Brown dari OpenAI memberikan kritik internal yang berguna: "Sayangnya, belum ada Masalah Hadiah Milenium."

Apa yang diselesaikan oleh sertifikat Lean, dan apa yang dibiarkannya terbuka.

Bukti Lean yang lolos pemeriksaan tipe valid secara konstruksi. Anda tidak perlu mempercayai metodologi evaluasi OpenAI, pilihan garis dasarnya, atau interpretasi hasilnya sendiri — Anda dapat mengompilasi berkas-berkasnya. Untuk industri yang menganggap "kami mencetak 94,1%" sebagai satuan standar bukti, ini adalah peningkatan yang berarti dalam hal keterpalsuan.

Hal ini juga lebih sempit daripada yang tersirat oleh judul-judul berita, dalam empat cara spesifik. Lean memeriksa bahwa bukti dari suatu pernyataan formal adalah sahih. Ia tidak memeriksa bahwa pernyataan formal tersebut adalah teorema yang diklaim oleh prosa. Ia tidak memeriksa bahwa definisi yang disandikan sesuai dengan apa yang dimaksud bidang tersebut dengan kata-kata itu. Ia tidak memeriksa reduksi informal yang menjembatani titik-titik ujung formal dengan hasil utama. Dan ia tidak mengatakan apa pun tentang kebaruan — apakah suatu hasil itu baru, atau sudah dikenal dengan nama yang berbeda.

Keempat hal tersebut adalah pertanyaan penilaian manusia, dan pada saat pengumuman, tidak satu pun yang melalui tinjauan sejawat. Naskah tersebut mengakui telah berkonsultasi dengan para spesialis; ucapan terima kasih bukanlah dukungan atas setiap klaim. Satu build parsial yang dipublikasikan dari repositori tersebut mengompilasi 8.820 dari 9.007 pekerjaan, yang merupakan gambaran formalisasi besar yang nyata di tengah verifikasi, bukan audit yang selesai. Status yang jujur saat ini adalah sepuluh klaim penelitian serius yang dikodekan secara formal — bukan sepuluh entri yang mapan dalam kanon matematika.

Ada batasan kedua yang lebih senyap: proses penemuan tidak dapat direproduksi oleh siapa pun di luar OpenAI. Bukti-buktinya bersifat publik; sistem pencarian, prompt, titik pemeriksaan, dan lingkungan eksekusinya tidak. Anda dapat memverifikasi tujuan. Anda tidak dapat mengulang perjalanan tersebut.

Angka $2.000, dan mengapa daya belinya lebih kecil dari yang terdengar.

OpenAI Astra-3

Angka yang paling banyak diperbincangkan adalah biayanya. OpenAI memperkirakan pengeluaran token untuk sepuluh solusi tersebut sekitar $2.000 dengan tarif GPT-5.6 Sol — sekitar $200 per masalah terbuka berusia satu dekade, menurut pembacaan yang paling umum dari susunan kalimatnya. Beberapa pemberitaan membaca kalimat yang sama sebagai di bawah $2.000 permasalah, perbedaan sepuluh kali lipat; kiriman OpenAI cukup ringkas sehingga kedua pembacaan tetap bertahan di media cetak, dan kami belum melihat perusahaan tersebut memberikan klarifikasi.

Ambil total bacaannya dan hitung. Sol menagih $5 per juta token input dan $30 per juta token output, dengan token penalaran ditagih sebagai output. Jika pengeluaran semuanya untuk output, $2.000 membeli paling banyak sekitar 67 juta token output — kira-kira 6,7 juta per soal. Itu banyak pemikiran, dan itu bukan jumlah pemikiran yang tidak masuk akal. Itu adalah jenis anggaran yang bisa dikeluarkan oleh kelompok riset yang didanai dengan baik untuk satu pertanyaan sulit.

Tiga peringatan lebih penting daripada judul utama:

Itu adalah harga kontrafaktual, bukan harga. Astra belum dirilis dan belum diberi harga. $2,000 tersebut menggambarkan berapa biaya yang akan dikenakan untuk token-token itu jika memakai tarif model lain. Sistem frontier yang dibangun untuk sesi multi-agen selama berjam-jam tidak memiliki alasan yang jelas untuk diberi harga seperti Sol, dan memiliki segala alasan untuk diberi harga di atasnya.

Itu hanya menghitung kemenangan. Tidak ada tingkat keberhasilan yang dipublikasikan. Kita tidak tahu berapa banyak masalah yang diberikan kepada Astra dan gagal dipecahkan, atau berapa biaya upaya-upaya tersebut. Biaya per keberhasilan yang dipublikasikan tanpa tingkat keberhasilan bukan biaya per hasil, dan selisihnya bisa mencapai satu orde besaran di kedua arah.

Token adalah bagian yang murah. Manusia yang merumuskan masalah, menyiapkan naskah, dan mendorong formalisasi. Tenaga kerja itu tidak termasuk dalam $2.000.

Satu-satunya bagian yang bisa Anda hitung harganya hari ini adalah garis dasarnya. Karena OrcaRouter meneruskan harga daftar penyedia secara langsung dengan markup 0%, GPT-5.6 Sol berharga sama $5/$30 di API kami seperti di API OpenAI — jadi jika Anda ingin memeriksa ulang perhitungannya terhadap beban kerja Anda sendiri, tarif dalam pengumuman tersebut adalah tarif yang sebenarnya akan Anda bayar. Yang belum bisa dihitung harganya oleh siapa pun adalah Astra itu sendiri, dan vendor mana pun yang mengatakan sebaliknya hanyalah menebak.

Tanggal rilis ditentukan oleh batas waktu 30 hari, bukan oleh kebocoran.

OpenAI Astra-4

Sebagian besar pemberitaan tentang "kapan GPT-6" adalah aritmetika rumor. Ada kendala yang lebih konkret yang tampak jelas, dan nyaris tidak dihubungkan dengan pertanyaan tersebut.

Sebuah perintah eksekutif yang ditandatangani pada 2 Juni 2026 mengarahkan badan-badan federal untuk membentuk proses peninjauan sukarela di mana pengembang frontier menyerahkan model untuk peninjauan pemerintah hingga 30 hari sebelum rilis publik. Kerangka kerja tersebut dijadwalkan mulai berlaku secara resmi pada 1 Agustus — hari yang sama saat posting Astra muncul. Pelaporan menunjukkan Astra diperkirakan menjadi model pertama yang melaluinya.

Kata "Voluntary" memikul beban yang cukup berat dalam kalimat itu. Dalam praktiknya, pemerintahan memang pernah menekan soal waktu rilis sebelumnya, dan perilaku OpenAI sendiri belakangan ini tampak seperti gladi bersih: GPT-5.6 dibatasi hanya untuk sekitar dua puluh organisasi terverifikasi mulai 26 Juni sebelum akses luas dibuka pada 9 Juli — peluncuran bertahap sekitar dua minggu.

Tumpuk kedua fakta itu dan Anda mendapatkan batas bawah kasar, bukan prediksi. Jika Astra melalui tinjauan pra-rilis 30 hari dan kemudian mengulangi pola GPT-5.6, ketersediaan luas akan tiba sekitar enam minggu setelah pengajuan. Dan tanggal pengajuan justru hal yang tidak kita ketahui. Inilah sebabnya tanggal-tanggal Agustus yang penuh keyakinan harus dipertanyakan: langkah penentu adalah proses dengan durasi yang dipublikasikan, dan jamnya belum terlihat mulai berjalan.

Pasar prediksi telah bergeser persis ke arah tersebut. Pada 5 Agustus 2026, tangga prediksi "GPT-6 released by" milik Polymarket berada di 1% untuk 7 Agustus, 3% untuk 14 Agustus, 13% untuk 21 Agustus, 25% untuk 31 Agustus, 68% untuk 30 September, dan 89% untuk 31 Desember, dengan volume hampir satu juta dolar. Anggap saja itu sebagai tebakan agregat dari kerumunan, bukan sumber — tetapi perhatikan bahwa kerumunan telah menggeser bobotnya ke Q4.

Ini juga membantu untuk mengingat rekam jejak. Setiap klaim "GPT-6 diluncurkan minggu depan" selama dua belas bulan terakhir ternyata salah. Kebocoran yang belum terverifikasi menetapkan 14 April 2026 sebagai hari peluncuran; yang sebenarnya dirilis, sembilan hari kemudian, adalah GPT-5.5.

Rumor-rumor, dinilai

Diurutkan berdasarkan seberapa besar bobot yang sebenarnya dibawa masing-masing:

Penamaan belum ditentukan (GPT-6 / GPT-5.7 / kelas tersendiri). Bersumber dari The Information. Klaim non-OpenAI yang paling dapat diandalkan dalam cerita ini, dan yang seharusnya mengatur ulang ekspektasi — sebuah sistem yang diumumkan melalui makalah matematika mungkin sama sekali tidak akan dilabeli sebagai lompatan generasi.

Nama kode "Zinc" dan "Magnesium" terlihat di Design Arena. Penampakan komunitas, entri dilaporkan dinonaktifkan, belum dikonfirmasi oleh OpenAI. Bisa dibaca sebagai: rilis poin GPT-5.x kemungkinan besar akan tiba sebelum Astra, yang tidak akan memenuhi ekspektasi siapa pun terhadap GPT-6 sambil menyerap siklus berita.

Kira-kira 2× GPT-5.6 Sol dalam skala; harga mendekati kisaran GPT-5.6. Rumor yang beredar. Pembocor di baliknya mengakui belum menguji model tersebut. Terdengar masuk akal namun sama sekali tidak berdasar.

Jendela konteks 1,5 juta token. Muncul dalam rangkuman bocoran tanpa sumber yang disebutkan. Perlu dicatat bahwa Sol sudah menghadirkan 1.050.000 token, jadi ini akan menjadi kenaikan, bukan lompatan — yang merupakan alasan untuk mencurigainya sebagai "bocoran" yang menjadi berita utama.

Sekitar 10 triliun parameter. Tidak ada atribusi di mana pun yang bisa kami lacak. Angka yang paling sering diulang dan paling sedikit didukung dalam keseluruhan cerita.

Memori dan personalisasi sebagai arah yang menentukan. Berdasarkan pernyataan publik Altman sendiri dari wawancara Agustus 2025 — nyata, tetapi sudah berusia setahun dan tentang arah pasca-GPT-5 secara umum, bukan tentang Astra secara khusus.

Apa yang sebenarnya harus dilakukan antara sekarang dan saat produknya dikirim

Langkah yang salah adalah merancang ulang arsitektur untuk model yang tidak memiliki kartu. Langkah yang benar adalah menyadari masalah mana yang akan diubah oleh sistem multi-agen dengan horizon panjang, karena bagian-bagian itulah dari tumpukan teknologi Anda yang saat ini masih kurang dibangun, apa pun yang dirilis OpenAI.

Tiga di antaranya layak untuk dibangun melawan GPT-5.6 Sol saat ini:

Batas biaya per tugas, bukan per panggilan. Jika satu pekerjaan dapat berjalan berjam-jam dan menghabiskan enam atau tujuh juta token keluaran, batas per-permintaan tidak lagi melindungi Anda. Anda membutuhkan anggaran yang diwarisi oleh seluruh tugas, dan penghentian yang tegas.

Checkpointing dan kemampuan melanjutkan. Panggilan sekali jalan entah berhasil atau gagal. Proses agen yang berjalan berjam-jam lalu mati di menit ke-90 tanpa menuliskan apa pun secara permanen adalah kategori kegagalan mahal yang belum pernah harus ditangani oleh sebagian besar codebase.

Evaluasi yang Anda percayai untuk masalah tanpa jawaban acuan. Sepuluh bukti tersebut menarik sebagian karena Lean menyediakan oracle. Hampir tidak ada yang melakukannya dalam produksi. Jika Anda tidak dapat membedakan proses enam jam yang baik dari proses yang buruk namun tampak meyakinkan, lebih banyak komputasi tidak akan membantu Anda.

Mengenai pertanyaan soal peralihan: Astra tidak tersedia di OrcaRouter, karena memang tidak tersedia di mana pun. Yang bisa kami katakan adalah bahwa masalah version-churn sebagian besar sudah teratasi di sisi kami. Satu kunci menjangkau 200+ model, jadi apakah ini dirilis sebagai GPT-6, GPT-5.7, atau tier GPT-5.6 keempat, mengadopsinya hanyalah perubahan model-string, bukan migrasi — tanpa kontrak kedua, tanpa SDK baru. Dan untuk model frontier yang belum teruji secara spesifik, failover otomatis adalah pembeda antara mengevaluasinya dalam workload nyata dan mempertaruhkan jalur produksi pada sistem yang belum pernah diuji stres oleh siapa pun di luar lab. Anda mengarahkan sebagian traffic ke model tersebut, menyimpan Sol di bawahnya sebagai fallback, dan Anda akan tahu hasilnya.

Pertanyaan yang layak dijawab

Apakah Astra sama dengan GPT-6?

Belum tentu, dan itulah ketidakpastian paling berdampak dalam cerita ini. OpenAI telah mengonfirmasi Astra sebagai model utama berikutnya, tetapi belum menentukan nama rilisnya; laporan menyebutkan GPT-6, GPT-5.7, dan kelas terpisah bersama Sol, Terra, dan Luna semuanya masih menjadi kandidat. Sangat mungkin model bernama GPT-6 tidak pernah muncul, dan lompatan kemampuan yang selama ini ditunggu-tunggu datang dengan nama yang tidak dipantau siapa pun.

Bisakah saya mengakses Astra dalam bentuk apa pun hari ini?

Tidak — bukan di ChatGPT, bukan lewat API, bukan lewat router atau penjual ulang mana pun. Yang tersedia untuk publik hanyalah makalah, panduan penalaran, dan repositori Lean. Jika ada layanan yang mengklaim menawarkan akses Astra, layanan itu entah menjual ulang sesuatu yang lain atau berbohong. Satu-satunya hal yang benar-benar berguna yang bisa Anda lakukan dengan rilis ini saat ini adalah mengompilasi sendiri bukti-bukti tersebut.

Apakah Astra benar-benar memecahkan masalah yang tidak bisa dipecahkan oleh matematikawan manusia?

Proses ini menghasilkan bukti yang diverifikasi secara formal untuk pernyataan-pernyataan yang telah terbuka setidaknya satu dekade, yang merupakan hasil nyata dan tidak biasa — dan verifikasinya satu tingkat di atas norma industri. Namun, "diperiksa Lean" bukanlah "penelaahan sejawat", dan pertanyaan pembingkaian tentang apakah setiap pernyataan formal menangkap masalah utama adalah justru bagian yang tidak dapat dijawab oleh Lean. Para spesialis yang membaca manuskrip-manuskrip tersebut bersikap positif; tidak ada satu pun yang melalui tinjauan sejawat. Perkirakan penilaian akan menguat dalam hitungan bulan, ke arah mana pun.

Apakah angka $2.000 berarti riset mutakhir kini murah?

Artinya, operasi token yang menang itu murah, dengan harga model lain, tidak termasuk kegagalan dan tidak termasuk manusia. Masing-masing dari ketiga pengecualian itu bisa sangat besar. Pembacaan yang jujur adalah bahwa biaya marjinal dari pencarian bukti otomatis yang berhasil telah turun cukup jauh untuk menjadi menarik, bukan bahwa sepuluh masalah terbuka kini berbiaya seharga laptop.

Apa yang sebenarnya akan menyelesaikan ini?

Tiga hal spesifik, tidak ada satu pun yang merupakan rumor, dan semuanya dapat diverifikasi saat hal itu terjadi.

Kartu model dan halaman harga. Itulah momen ketika Astra berhenti menjadi artefak riset dan menjadi sesuatu yang dapat Anda jadikan dasar perencanaan — dan momen ketika pertanyaan penamaan terselesaikan dengan sendirinya.

Pembangunan ulang independen dari repositori Lean oleh para spesialis yang mengaudit definisi dan reduksi informal, bukan hanya pemeriksaan tipe. Direktori ComparatorChallenges menunjukkan bahwa OpenAI mengharapkan hal ini. Jika pernyataan formal bertahan di bawah pengawasan tersebut, hasilnya menjadi jauh lebih sulit untuk diabaikan; jika ketidakcocokan muncul bahkan pada satu dari sepuluh, setiap klaim dalam himpunan tersebut dibaca ulang.

Bukti bahwa jam peninjauan federal telah berjalan. Dalam jendela pra-rilis 30 hari, pengiriman tersebut merupakan sinyal paling awal yang dapat diandalkan untuk tanggal perilisan — jauh lebih informatif daripada tangkapan layar berikutnya dari entri yang dinonaktifkan di papan peringkat arena.

Sampai saat itu, pernyataan yang akurat itu sempit dan layak dipegang: produk unggulan OpenAI berikutnya memiliki nama, sepuluh bukti yang dapat diperiksa mesin, sebuah demo Washington, dan tidak ada yang lain. Siapa pun yang memberi Anda tanggal sedang menebak, dan siapa pun yang memberi Anda jumlah parameter sedang mengarangnya.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube