
Memperkenalkan Astra for Law: OpenAI Menempatkan Indeks Pencarian Hukum di Balik GPT-6 Astra
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Astra for Law diumumkan pada 17 September 2026 — konfigurasi untuk pekerjaan hukum yang dibangun di atas GPT-6 Astra, model unggulan yang dirilis perusahaan dua minggu sebelumnya, pada 3 September. Ini bukan model baru. Ini adalah bobot yang sama di balik pintu masuk yang berbeda: indeks pencarian hukum khusus, instruksi khusus hukum, dan serangkaian alat yang ditujukan untuk riset yurisprudensi Amerika Serikat. Perbedaan itu lebih penting daripada yang disiratkan oleh pembingkaian peluncuran, karena setiap angka dalam pengumuman tersebut mengukur konfigurasi terhadap model dasar alih-alih kemampuan baru — dan konfigurasi itulah yang melakukan hampir semua pekerjaan.
Klaim utamanya adalah bahwa Astra for Law lulus pemeriksaan akurasi keseluruhan pada 54,0% dari 200 pertanyaan riset hukum AS yang diambil dari set validasi privat Legal Research Bench milik Vals AI, dibandingkan dengan 38,7% untuk GPT-6 Astra yang hanya menggunakan penelusuran web — peningkatan relatif sebesar 40%, seperti yang dikatakan OpenAI. Itu adalah angka yang dilaporkan vendor pada split privat, dan tidak ada laboratorium independen yang mereproduksinya. Yang terlihat secara independen justru lebih berguna: perbandingan publik Vals AI sendiri mencantumkan GPT-6 Astra pada 39,42% ±3,40 pada tolok ukur itu, yang pada dasarnya adalah baseline yang dijadikan pembanding oleh OpenAI. Kesenjangan itu berasal dari indeks penelusuran hukum dan instruksinya, bukan karena modelnya menjadi pengacara yang lebih baik.
Berikut adalah apa yang sudah dirilis, apa yang benar-benar telah diukur, dan apa yang masih belum ada.
Apa sebenarnya Astra for Law
Tiga hal ditambahkan di atas GPT-6 Astra, dan tidak satu pun merupakan perubahan bobot. Dalam sebuah pengarahan media, Jason Boehmig — salah satu pendiri Ironclad yang direkrut OpenAI pada Juni 2026 — dan insinyur Sherwin Wu menggambarkan rilis tersebut sebagai konfigurasi instruksi domain, pengaturan seperti panjang respons, dan peralatan industri hukum yang diperkirakan akan berkembang seiring waktu.
• Indeks Pencarian Hukum — lapisan pengambilan atas yurisprudensi, undang-undang, peraturan, aturan pengadilan, dan keputusan administratif Amerika Serikat yang mencakup lebih dari 230 juta URL, dengan sumber yang ditambahkan setiap hari.
• Asal usul korpus — indeks ini bersumber dari CourtListener, pustaka yang dikelola oleh Free Law Project nirlaba, yang menurut OpenAI mencakup lebih dari 99,9% putusan preseden Amerika Serikat yang dipublikasikan. Ini melengkapi konten berlisensi dari penyedia termasuk Thomson Reuters.
• Instruksi hukum — seperangkat instruksi domain untuk menerapkan penelitian pada fakta, mengembangkan argumen atau ketentuan kesepakatan, dan mengungkap kelemahan atau ketidakpastian dalam suatu posisi.

Demonstrasi dalam briefing itu konkret, bukan abstrak: Wu menyusun mosi pembatalan gugatan untuk sebuah rumah sakit yang menghadapi klaim diskriminasi disabilitas dan pembalasan, mengerjakan gugatan pemegang saham terhadap penjualan aset selama akhir pekan libur, dan menangani sengketa komitmen penjualan. Tak satu pun dari itu merupakan kemampuan baru bagi model terdepan. Yang baru adalah bahwa sisi pengambilan informasi dari pekerjaan itu tidak lagi melalui pencarian web umum.
Tolok ukurnya, baca dengan cermat.
Empat angka muncul dari peluncuran tersebut, semuanya dikaitkan dengan OpenAI, semuanya pada set validasi privat yang sama, dan semuanya layak dipisahkan satu dari yang lain:
• Ketepatan keseluruhan — 54,0% untuk Astra for Law versus 38,7% untuk GPT-6 Astra dengan pencarian web, pada upaya penalaran tertinggi.
• Kasus rujukan ditemukan — 24% lebih banyak pada pertanyaan yang berfokus pada yurisprudensi, sekali lagi pada upaya penalaran tertinggi.
• Bagian relevan yang diambil — hingga 54% lebih banyak dari putusan pengadilan yang tepat, dengan upaya penalaran yang sama seperti baseline.
• Panjang jawaban — rata-rata sekitar dua kali lebih panjang di seluruh pengaturan penalaran yang diuji.
Angka terakhir itu adalah angka yang perlu disandingkan dengan angka pertama. Pemeriksaan kebenaran secara keseluruhan yang memberi imbalan pada cakupan lebih mudah dilewati dengan jawaban yang lebih panjang, dan sebagian dari kenaikan 15,3 poin kemungkinan besar berasal dari lapisan pengambilan yang sekadar menempatkan lebih banyak materi di hadapan model. Ini bukan kritik terhadap hasilnya — menemukan 24% lebih banyak kasus referensi adalah peningkatan nyata yang dinyatakan secara terpisah — tetapi ini berarti angka komposit dan angka pengambilan harus dibaca bersama-sama, bukan angka kompositnya saja.
Masalah split privat adalah yang lebih besar. Set validasi yang dipegang OpenAI dan tidak dipublikasikan tidak dapat dijalankan ulang oleh siapa pun, dan papan peringkat publik dari benchmark yang sama menceritakan kisah yang lebih datar: halaman perbandingan milik Vals AI sendiri mencantumkan GPT-6 Astra pada 39,42% ±3,40 di Legal Research Bench, dengan Gemini 3.8 Flash pada 38,94% ±3,39. Apa pun yang menghasilkan lonjakan ke 54,0% tidak terlihat di papan publik, karena papan publik menilai model dasar tanpa indeks hukum yang dilampirkan.

Tie-out Legora, dan angka di dalamnya
Bukti pihak ketiga yang paling substantif dalam liputan peluncuran ini adalah uji alur kerja dari Legora, yang insinyur hukumnya, Percevale Perks, menjalankan tie-out laporan keuangan — mencocokkan angka draf akun dengan neraca saldo, jadwal konsolidasi, dan akun tahun sebelumnya. Agen Legora menyelesaikan tie-out tersebut pada 41 dokumen dalam satu kali proses, dalam hitungan menit, mencatat setiap pemeriksaan dan menghasilkan catatan baris demi baris untuk ditinjau. Agen itu menemukan keempat kesalahan yang ditanam Legora dalam akun tersebut, termasuk selisih £500.000 yang tersembunyi di catatan pendapatan, mempertahankan setiap pemeriksaan yang telah dilalui model sebelumnya, dan menambahkan sekitar lima puluh pemeriksaan lagi.
Itu adalah hasil yang benar-benar bagus pada kumpulan dokumen yang benar-benar sulit. Di situlah juga angka paling berguna dalam seluruh siklus peluncuran terkubur. Pada Benchmark for Agentic Reasoning milik Legora, yang mencakup tugas-tugas hukum end-to-end yang nyata, peningkatan pada alur kerja laporan keuangan sekitar 40% — dan rata-rata peningkatan di semua tugas BAR sekitar 3%. Kedua angka itu milik Legora, keduanya menggambarkan model yang sama, dan hanya satu yang tersebar luas. Jika Anda mengevaluasi ini untuk sebuah firma, angka 3% adalah patokan yang harus Anda rencanakan, dan angka 40% adalah patokan yang boleh Anda harapkan.
Pengujian independen menunjukkan mode kegagalan yang berbeda
Dua evaluasi independen layak disandingkan dengan angka-angka peluncuran, dengan catatan bahwa keduanya kecil dan bersumber tunggal.
HAQQ menguji GPT-6 Astra terhadap 41 pertanyaan hukum nyata di 20 bidang praktik pada penalaran sedang. Astra unggul dalam substansi hukum dengan 17,63 dari 20 — dengan selisih kurang dari satu poin. Biayanya $0,2622 per jawaban, sekitar sebelas kali biaya per jawaban GPT-5.6 Luna Pro untuk keunggulan komposit di bawah satu poin. Pembacaan HAQQ sendiri tajam: keunggulannya bukan karena modelnya lebih cerdas, melainkan karena model itu berhenti menulis. Tes yang sama menemukan bahwa mengubah upaya penalaran dari rendah ke tinggi mengalikan biaya sekitar 1,5× dan latensi sekitar 1,8× sekaligus menurunkan kualitas yang dinilai sebesar 0,17 poin — tuas biaya yang didandani sebagai tuas kualitas, dan alasan untuk mematok setelan upaya alih-alih membiarkannya di maks.
Temuan yang seharusnya bergema paling luas bukanlah tentang biaya. Di berbagai yurisdiksi di luar AS, ketiga model yang diuji mengutip ketentuan yang benar sekaligus salah menyatakan isinya. Astra benar secara hukum pada 66,7% butir tersebut; Claude Opus 5 benar pada 100%. Pemeriksa sitasi meloloskan jawaban itu, karena sitasinya ada dan merupakan sitasi yang tepat. Klien tidak. Inilah mode kegagalan yang paling tidak mampu ditangani oleh indeks pencarian hukum, karena indeks tersebut hanya mencakup AS dan kesalahannya terletak pada pembacaan, bukan pada temu kembali.
Apa yang benar-benar bisa Anda dapatkan, dan kapan
Astra for Law tidak tersedia secara umum. Akses dimulai melalui program Trusted Access baru yang ditujukan untuk firma Am Law 200, yang disediakan melalui ChatGPT dan Codex. API dijelaskan akan segera hadir dengan id model gpt-6-astra-law, muncul di pemilih model sebagai "GPT-6 Astra Law"; Harvey dan Legora disebut sebagai pelanggan API yang akan membangun di atasnya. Belum ada harga yang dipublikasikan untuk konfigurasi hukum tersebut, yang merupakan pertanyaan terbuka paling besar bagi siapa pun yang menyusun anggaran berdasarkan itu.
Trusted Access membawa dua ketentuan data: Zero Data Retention pada API, dan pengecualian penggunaan ChatGPT Enterprise dari tinjauan manusia secara default. Saat ditanya dalam briefing tentang pengecualian, Boehmig tidak mengklaim kebijakan itu bersifat absolut: “Ini jelas lebih rumit daripada satu kalimat itu,” katanya, seraya mencatat bahwa perjanjian lengkapnya sekitar 30 halaman, dan menambahkan bahwa OpenAI yakin 30 halaman itu memenuhi kebutuhan. OpenAI mengatakan pihaknya sedang bekerja sama dengan Latham & Watkins terkait izin informasi, sekat etis, instruksi klien, dan pengawasan firma.
Bagian ekosistem lebih besar daripada bagian model: 26 plugin vendor termasuk Thomson Reuters, Harvey, Legora, iManage, Relativity, Clio, Intapp, dan DeepJudge; sembilan plugin komunitas dari kelompok rekayasa hukum; serta 47 keterampilan khusus yang dibangun oleh pengguna mahir di bidang hukum. ChatGPT for Word juga mencapai ketersediaan umum untuk pengoreksian, saran penyuntingan, dan penandaan format. Insinyur OpenAI yang diterjunkan ke lapangan bekerja dengan Sullivan & Cromwell untuk penganalisis perjanjian, Ropes & Gray untuk uji tuntas M&A, dan Cooley untuk GO Public.
Sebagai konteks betapa padatnya lajur ini sekarang: Anthropic merilis Claude for Legal pada Mei 2026, tiga bulan sebelum Astra for Law ada.
Risiko yang tidak ditangkap oleh tolok ukur mana pun di halaman itu
Tidak ada apa pun dalam materi peluncuran yang membahas dua pertanyaan tata kelola yang pertama-tama akan diajukan oleh penasihat hukum umum firma. Per September 2026, belum ada sertifikasi SOC 2, ISO, atau HIPAA yang diterbitkan untuk GPT-6 Astra, dan tidak ada rincian yang diterbitkan tentang pemisahan data khusus firma, penerapan lokal, atau residensi data. Ketiadaannya bukan bukti kegagalan — itu hanya tidak terdokumentasi, yang merupakan masalah berbeda dan menjadi tanggung jawab firma untuk menyelesaikannya sebelum materi yang dilindungi hak istimewa dimasukkan.
Dari sisi etika, aturan yang berlaku adalah ABA Model Rule 1.6 tentang kerahasiaan, yang mengatur apa yang boleh dibagikan firma kepada penyedia pihak ketiga dan dapat mewajibkan pengungkapan yang diperbarui serta persetujuan setelah mendapat informasi, dan Rule 5.3 tentang pengawasan atas bantuan non-pengacara, yang di situlah hasil AI berada. Alasan keduanya masih aktual dan bukan sekadar teoretis adalah Mata v. Avianca, ketika para pengacara dikenai sanksi karena mengajukan perkara-perkara yang tidak ada yang dihasilkan AI. Indeks pencarian hukum atas putusan-putusan nyata membuat kegagalan spesifik itu lebih kecil kemungkinannya. Hal itu tidak membuatnya mustahil, dan tidak berpengaruh sama sekali terhadap kegagalan salah membaca ketentuan yang didokumentasikan HAQQ.
Jika Anda ingin membangun di atas ini sebelum API dibuka
Posisi jujurnya saat ini adalah bahwa gpt-6-astra-law tidak ada di API siapa pun, termasuk milik kami — OpenAI mengatakan akan segera hadir dan tidak menyebutkan tanggal. Yang ada saat ini adalah model dasar: openai/gpt-6-astra berada di OrcaRouter dengan markup 0%, artinya harga daftar dari penyedia OpenAI diteruskan tanpa perubahan, sehingga perubahan harga vendor pada model itu tercermin pada hari yang sama. Satu kunci menjangkau lebih dari 200 model, dengan failover otomatis antar penyedia dan DSL routing untuk menyusun beberapa model menjadi satu panggilan.

Konsekuensi praktisnya bagi tim rekayasa hukum adalah perpecahan. Semua hal dalam alur kerja Astra for Law yang tidak bergantung pada Legal Search Index — menyusun draf dari fakta yang Anda berikan, merestrukturisasi kumpulan klausul, memformat ke templat firma, menghasilkan daftar periksa tinjauan — dapat Anda prototipekan hari ini pada GPT-6 Astra dasar, dan tukar id modelnya saat varian hukum dibuka tanpa mengubah integrasi Anda. Semua hal yang bergantung pada indeks tersebut tidak dapat Anda prototipekan, karena indeks itulah bagian yang belum dijual. Dua catatan yang perlu dinyatakan secara gamblang: permintaan yang dirutekan tidak otomatis tercakup oleh persetujuan Zero Data Retention OpenAI, yang diberikan per organisasi, sehingga firma yang membutuhkan ZDR harus memastikan cakupannya pada rute spesifik yang digunakannya; dan router adalah hop tambahan di jalur data, yang merupakan biaya nyata untuk materi privilese bahkan ketika itu memberi Anda failover.
Apa yang harus ditonton
Tiga hal, dalam urutan seberapa besar hal-hal itu akan mengubah gambaran. Tanggal API untuk gpt-6-astra-law, karena itulah perbedaan antara pilot dan produk. Harga, karena $10 per juta token input dan $50 per juta token output model dasar membawa penyesuaian harga konteks panjang di atas 272.000 token input yang akan rutin dilampaui oleh kumpulan dokumen hukum — dan jika konfigurasi hukum dihargai dengan premi di atas itu, ekonomi dari tie-out 41 dokumen berubah secara material. Dan pengujian ulang independen atas 200 pertanyaan itu pada split yang dikendalikan pihak lain. Sampai itu ada, 54,0% adalah angka OpenAI tentang konfigurasi OpenAI, dan klaim yang dapat dipertahankan adalah yang lebih sempit: indeks yurisprudensi Amerika Serikat plus instruksi hukum menghasilkan temu kembali yang secara material lebih baik daripada pencarian web umum untuk pertanyaan riset hukum Amerika Serikat. Klaim itu layak ditindaklanjuti. Sisanya layak ditunggu.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
