
Presentazione di Astra for Law: OpenAI mette un indice di ricerca legale dietro GPT-6 Astra
Astra for Law è stato annunciato il 17 settembre 2026 — una configurazione per il lavoro legale basata su GPT-6 Astra, il modello di punta che l'azienda ha rilasciato due settimane prima, il 3 settembre. Non è un nuovo modello. Si tratta degli stessi pesi dietro una porta d'ingresso diversa: un indice di ricerca legale dedicato, istruzioni specifiche per il settore legale e una serie di strumenti finalizzati alla ricerca sulla giurisprudenza degli Stati Uniti. Questa distinzione conta più di quanto suggerisca l'inquadramento del lancio, perché ogni numero nell'annuncio misura la configurazione rispetto al modello di base anziché una nuova capacità — e la configurazione sta facendo quasi tutto il lavoro.
La rivendicazione principale è che Astra for Law ha superato il controllo complessivo di correttezza sul 54,0% di 200 domande di ricerca giuridica statunitensi estratte dal set di validazione privato del Legal Research Bench di Vals AI, contro il 38,7% di GPT-6 Astra usando solo la ricerca web — un miglioramento relativo del 40%, a detta di OpenAI. Sono cifre dichiarate dal fornitore su uno split privato, e nessun laboratorio indipendente le ha riprodotte. Ciò che è visibile in modo indipendente è più utile: il confronto pubblico di Vals AI stesso riporta GPT-6 Astra al 39,42% ±3,40 su quel benchmark, che è essenzialmente la baseline rispetto alla quale OpenAI sta misurando. Il divario deriva dall'indice di ricerca giuridica e dalle istruzioni, non dal fatto che il modello sia diventato un avvocato migliore.
Ecco cosa è stato rilasciato, cosa è stato effettivamente misurato e cosa manca ancora.
Che cos'è davvero Astra for Law
Tre cose sono state aggiunte sopra GPT-6 Astra, e nessuna di esse è un cambiamento dei pesi. In un briefing con i media, Jason Boehmig — il cofondatore di Ironclad assunto da OpenAI a giugno 2026 — e l'ingegnere Sherwin Wu hanno descritto il rilascio come una configurazione di istruzioni di dominio, impostazioni come la lunghezza delle risposte e strumenti per il settore legale che si prevede si espanderanno nel tempo.
• Legal Search Index — un livello di recupero su giurisprudenza, leggi, regolamenti, norme processuali e decisioni amministrative degli Stati Uniti che abbraccia più di 230 milioni di URL, con fonti aggiunte ogni giorno.
• Provenienza del corpus — l'indice si basa su CourtListener, la biblioteca gestita dall'organizzazione no-profit Free Law Project, che secondo OpenAI copre oltre il 99,9% della giurisprudenza statunitense pubblicata con valore di precedente. Integra i contenuti concessi in licenza da fornitori tra cui Thomson Reuters.
• Istruzioni legali — un insieme di istruzioni di dominio per applicare la ricerca ai fatti, sviluppare argomenti o termini contrattuali e far emergere debolezze o incertezze in una posizione.

La dimostrazione nel briefing era concreta anziché astratta: Wu ha redatto una mozione di archiviazione per un ospedale che affrontava una richiesta per discriminazione sulla disabilità e ritorsione, ha lavorato a una contestazione degli azionisti relativa a una vendita di attività durante un fine settimana festivo e ha gestito una controversia su un impegno di vendita. Nessuna di queste è una nuova capacità per un modello di frontiera. Ciò che è nuovo è che la metà del lavoro dedicata al recupero delle informazioni non passa più attraverso la ricerca web generica.
Il benchmark, leggi attentamente.
Quattro cifre sono emerse dal lancio, tutte attribuite a OpenAI, tutte sullo stesso set di validazione privato, e tutte da distinguere l'una dall'altra:
• Correttezza complessiva — 54,0% per Astra for Law contro 38,7% per GPT-6 Astra con ricerca web, al massimo livello di ragionamento.
• Casi di riferimento trovati — 24% in più sulle domande incentrate sulla giurisprudenza, ancora una volta con il massimo sforzo di ragionamento.
• Passaggi rilevanti recuperati — fino al 54% in più da pronunce giudiziali corrette, con lo stesso sforzo di ragionamento della baseline.
• Lunghezza della risposta — in media circa il doppio nelle impostazioni di ragionamento testate.
Quell'ultimo dato è quello da tenere accanto al primo. Una verifica di correttezza complessiva che premia la copertura è più facile da superare con una risposta più lunga, e parte del guadagno di 15,3 punti è verosimilmente dovuta al fatto che il livello di retrieval mette semplicemente più materiale davanti al modello. Non è una critica al risultato — trovare il 24% in più di casi di riferimento è un miglioramento reale, dichiarato separatamente — ma significa che il numero composito e i numeri del retrieval vanno letti insieme, anziché il composito da solo.
Il problema dello split privato è il più grande. Un set di validazione che OpenAI detiene e non pubblica non può essere rieseguito da nessuno, e la classifica pubblica dello stesso benchmark racconta una storia più piatta: la pagina di confronto di Vals AI elenca GPT-6 Astra al 39,42% ±3,40 su Legal Research Bench, con Gemini 3.8 Flash al 38,94% ±3,39. Qualunque cosa abbia prodotto il salto al 54,0% non è visibile sulla classifica pubblica, perché la classifica pubblica sta valutando il modello base senza l'indice legale allegato.

Il tie-out di Legora e il numero al suo interno
La prova di terze parti più sostanziale nella copertura del lancio è un test di flusso di lavoro di Legora, il cui ingegnere legale Percevale Perks ha eseguito una riconciliazione del bilancio — confrontando le cifre del bilancio di bozza con una bilancia di verifica, un prospetto di consolidamento e i conti dell'anno precedente. L'agente di Legora ha completato la riconciliazione su 41 documenti in un'unica esecuzione, in pochi minuti, registrando ogni controllo e producendo un registro riga per riga per la revisione. Ha trovato tutti e quattro gli errori che Legora aveva inserito nei conti, inclusa una discrepanza di £500.000 nascosta nella nota sui ricavi, ha mantenuto ogni controllo che il modello precedente aveva superato e ne ha aggiunti circa cinquanta.
È un risultato davvero buono su un insieme di documenti davvero difficile. È anche il punto in cui è sepolto il numero più utile dell'intero ciclo di lancio. Nel Benchmark for Agentic Reasoning di Legora, che copre attività legali reali end-to-end, il miglioramento sul flusso di lavoro dei bilanci è stato di circa il 40% — e il miglioramento medio su tutte le attività BAR è stato di circa il 3%. Entrambi i numeri sono di Legora, entrambi descrivono lo stesso modello, e solo uno dei due è circolato. Se lo stai valutando per uno studio legale, il 3% è la cifra su cui pianificare e il 40% è la cifra a cui sperare.
Test indipendenti indicano una diversa modalità di guasto
Due valutazioni indipendenti vale la pena metterle accanto ai numeri del lancio, con l'avvertenza che entrambe sono su piccola scala e provenienti da un'unica fonte.
HAQQ ha messo GPT-6 Astra alla prova su 41 domande legali reali in 20 aree di pratica con ragionamento medio. Astra era in testa sulla sostanza giuridica con 17,63 su 20 — per meno di un punto. È costato $0,2622 per risposta, circa undici volte il costo per risposta di GPT-5.6 Luna Pro per meno di un punto di guadagno composito. La lettura di HAQQ è acuta: il vantaggio non sta nel fatto che il modello sia più intelligente, ma nel fatto che smette di scrivere. Lo stesso test ha rilevato che portare lo sforzo di ragionamento da basso ad alto moltiplicava il costo di circa 1,5× e la latenza di circa 1,8×, riducendo al contempo la qualità giudicata di 0,17 punti — una leva di costo travestita da leva di qualità, e un motivo per fissare l'impostazione dello sforzo anziché lasciarla al massimo.
La constatazione che dovrebbe circolare di più non riguarda i costi. Nelle giurisdizioni non statunitensi, tutti e tre i modelli testati hanno citato la disposizione corretta fraintendendone però il contenuto. Astra era giuridicamente corretta nel 66,7% di quegli elementi; Claude Opus 5 lo era nel 100%. Un verificatore di citazioni accetta quella risposta, perché la citazione esiste ed è quella giusta. Un cliente no. Questa è la modalità di errore che l'indice di ricerca giuridica è meno attrezzato ad affrontare, poiché l'indice copre solo gli Stati Uniti e l'errore è nella lettura, non nel recupero.
Cosa puoi effettivamente ottenere, e quando
Astra for Law non è disponibile a livello generale. L'accesso inizia tramite un nuovo programma Trusted Access rivolto agli studi Am Law 200, erogato tramite ChatGPT e Codex. L'API è descritta come in arrivo prossimamente con l'ID del modello gpt-6-astra-law, che compare nel selettore dei modelli come "GPT-6 Astra Law"; Harvey e Legora sono indicati come clienti API che costruiranno su di essa. Non è stato pubblicato alcun prezzo per la configurazione legale, che è la più grande questione aperta per chiunque stia pianificando il budget di conseguenza.
Trusted Access comporta due condizioni sui dati: Zero Data Retention sull'API e l'esclusione, per impostazione predefinita, dell'utilizzo di ChatGPT Enterprise dalla revisione umana. Interrogato nel briefing sulle eccezioni, Boehmig non ha affermato che la politica fosse assoluta: «È decisamente più complicato di quella singola frase», ha detto, rilevando che l'accordo completo conta circa 30 pagine, e aggiungendo che OpenAI è certa che quelle 30 pagine soddisfino l'esigenza. OpenAI afferma di stare collaborando con Latham & Watkins su autorizzazioni informative, barriere etiche, istruzioni dei clienti e supervisione dello studio.
La parte relativa all'ecosistema è più ampia di quella relativa al modello: 26 plugin di fornitori tra cui Thomson Reuters, Harvey, Legora, iManage, Relativity, Clio, Intapp e DeepJudge; nove plugin della community provenienti da gruppi di legal engineering; e 47 skill personalizzate create da utenti avanzati del settore legale. Anche ChatGPT per Word ha raggiunto la disponibilità generale per la correzione di bozze, le modifiche suggerite e le segnalazioni di formattazione. Gli ingegneri OpenAI forward-deployed hanno lavorato con Sullivan & Cromwell su un analizzatore di accordi, con Ropes & Gray sulla due diligence M&A e con Cooley su GO Public.
Per dare un'idea di quanto sia ormai affollata questa nicchia: Anthropic ha lanciato Claude for Legal a maggio 2026, tre mesi prima che Astra for Law esistesse.
I rischi che nessun benchmark su quella pagina riesce a catturare
Nulla nei materiali di lancio affronta le due domande di governance che il direttore legale di uno studio porrà per prima cosa. A settembre 2026 non era stata pubblicata alcuna certificazione SOC 2, ISO o HIPAA per GPT-6 Astra, e non esiste alcun dettaglio pubblicato sull'isolamento dei dati specifico dello studio, sull'implementazione locale o sulla residenza dei dati. L'assenza non è prova di fallimento — significa semplicemente che non è documentato, il che è un problema diverso, e spetta allo studio risolverlo prima che vi venga inserito materiale protetto dal segreto professionale.
Sul piano etico, le regole operative sono ABA Model Rule 1.6 sulla riservatezza, che disciplina ciò che uno studio può condividere con un fornitore terzo e può richiedere comunicazioni aggiornate e consenso informato, e Rule 5.3 sulla supervisione dell'assistenza non legale, che è dove si colloca l'output dell'IA. Il motivo per cui entrambe sono attuali e non teoriche è Mata v. Avianca, dove gli avvocati sono stati sanzionati per aver depositato casi inesistenti generati dall'IA. Un indice di ricerca legale su opinioni reali rende meno probabile quel specifico fallimento. Non lo rende impossibile, e non fa nulla riguardo al fallimento di interpretazione errata delle disposizioni documentato da HAQQ.
Se vuoi sviluppare su questo prima che l'API apra
La posizione onesta oggi è che gpt-6-astra-law non è nell'API di nessuno, inclusa la nostra — OpenAI ha detto che arriverà presto e non ha indicato una data. Ciò che è disponibile è il modello base: openai/gpt-6-astra si trova su OrcaRouter a 0% di markup, il che significa che il prezzo di listino del provider OpenAI viene trasferito invariato, quindi un cambio di prezzo del provider su quel modello si riflette lo stesso giorno. Una chiave raggiunge più di 200 modelli, con failover automatico tra provider e un DSL di routing per comporre diversi modelli in una singola chiamata.

La conseguenza pratica per un team di legal engineering è una divisione. Tutto ciò che, nel flusso di lavoro di Astra for Law, non dipende dal Legal Search Index — redigere a partire dai fatti che fornisci, ristrutturare un insieme di clausole, formattare secondo il template di uno studio legale, generare una checklist di revisione — puoi prototiparlo oggi su base GPT-6 Astra e sostituire l'id del modello quando la variante law sarà disponibile, senza modificare la tua integrazione. Tutto ciò che dipende dall'indice non puoi prototiparlo, perché l'indice è la parte che non è ancora in vendita. Due avvertenze che vale la pena enunciare chiaramente: una richiesta instradata non è automaticamente coperta dall'approvazione Zero Data Retention di OpenAI, che viene concessa per organizzazione, quindi uno studio che necessita di ZDR dovrebbe confermare la copertura sulla specifica rotta che utilizza; e un router è un salto aggiuntivo nel percorso dei dati, un costo reale per il materiale privilegiato anche quando ti offre il failover.
Cosa guardare
Tre cose, in ordine di quanto cambieranno il quadro. La data dell'API per gpt-6-astra-law, poiché è la differenza tra un progetto pilota e un prodotto. Il prezzo, poiché i $10 per milione di token di input e i $50 per milione di token di output del modello base comportano un aumento di prezzo per il contesto lungo al di sopra dei 272.000 token di input che i set di documenti legali supereranno regolarmente — e se la configurazione legale viene prezzata a un premio rispetto a quello, l'economia di un tie-out di 41 documenti cambia in modo sostanziale. E una riesecuzione indipendente di quelle 200 domande su uno split controllato da qualcun altro. Finché non esiste, il 54,0% è il numero di OpenAI sulla configurazione di OpenAI, e l'affermazione difendibile è quella più ristretta: un indice di giurisprudenza statunitense più istruzioni legali produce un recupero sostanzialmente migliore rispetto alla ricerca web generica su domande di ricerca legale statunitense. Vale la pena agire su quell'affermazione. Per il resto, vale la pena aspettare.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
