
Introductie van Astra for Law: OpenAI zet een juridische zoekindex achter GPT-6 Astra
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Astra for Law werd aangekondigd op 17 september 2026 — een configuratie voor juridisch werk, gebouwd op GPT-6 Astra, het vlaggenschipmodel dat het bedrijf twee weken eerder uitbracht, op 3 september. Het is geen nieuw model. Het zijn dezelfde gewichten achter een andere voordeur: een speciale juridische zoekindex, juridisch-specifieke instructies en een set tools gericht op onderzoek naar jurisprudentie in de Verenigde Staten. Dat onderscheid is belangrijker dan de framing van de lancering suggereert, want elk cijfer in de aankondiging meet de configuratie af tegen het basismodel in plaats van tegen een nieuwe capaciteit — en de configuratie doet bijna al het werk.
De kopclaim is dat Astra for Law de algemene correctheidscontrole doorstond op 54,0% van 200 Amerikaanse juridische onderzoeksvragen uit de privévalidatieset van Vals AI's Legal Research Bench, tegenover 38,7% voor GPT-6 Astra met alleen webzoekopdrachten — een relatieve verbetering van 40%, zoals OpenAI het vertelt. Dat zijn door de leverancier gerapporteerde cijfers op een privé-split, en geen enkel onafhankelijk lab heeft ze gereproduceerd. Wat onafhankelijk zichtbaar is, is nuttiger: Vals AI's eigen openbare vergelijking vermeldt GPT-6 Astra op 39,42% ±3,40 op die benchmark, wat in wezen de baseline is waartegen OpenAI meet. Het gat komt voort uit de juridische zoekindex en de instructies, niet doordat het model een betere jurist is geworden.
Hier is wat is uitgeleverd, wat daadwerkelijk is gemeten, en wat nog ontbreekt.
Wat Astra for Law eigenlijk is
Bovenop GPT-6 Astra werden drie dingen toegevoegd, en geen ervan is een wijziging van de gewichten. Tijdens een mediabriefing beschreven Jason Boehmig — de Ironclad-medeoprichter die OpenAI in juni 2026 in dienst nam — en ingenieur Sherwin Wu de release als een configuratie van domeininstructies, instellingen zoals antwoordlengte, en tooling voor de juridische sector die naar verwachting in de loop van de tijd zal worden uitgebreid.
• Legal Search Index — een retrieallaag voor Amerikaanse jurisprudentie, wetgeving, regelgeving, gerechtsregels en administratieve beslissingen, die meer dan 230 miljoen URL's omvat, waarbij dagelijks bronnen worden toegevoegd.
• Herkomst van het corpus — de index put uit CourtListener, de bibliotheek die wordt onderhouden door de non-profitorganisatie Free Law Project, die volgens OpenAI meer dan 99,9% van de gepubliceerde Amerikaanse precedentrechtspraak bestrijkt. Hij vormt een aanvulling op gelicentieerde content van aanbieders, waaronder Thomson Reuters.
• Juridische instructies — een reeks domeininstructies voor het toepassen van onderzoek op feiten, het ontwikkelen van argumenten of transactievoorwaarden, en het blootleggen van zwakke punten of onzekerheid in een positie.

De demonstratie in de briefing was concreet in plaats van abstract: Wu stelde een verzoek tot afwijzing van de vordering op voor een ziekenhuis dat een claim wegens discriminatie op grond van een handicap en vergelding moest verdedigen, werkte tijdens een feestdagsweekend aan een door aandeelhouders aangespannen betwisting van een activaverkoop, en behandelde een geschil over verkooptoezeggingen. Geen daarvan is een nieuwe capaciteit voor een frontiermodel. Wat nieuw is, is dat het retrievaldeel van de taak niet langer via algemeen webzoeken verloopt.
De benchmark, zorgvuldig gelezen
Vier cijfers kwamen uit de lancering, allemaal toegeschreven aan OpenAI, allemaal op dezelfde private validatieset, en allemaal de moeite waard om van elkaar te onderscheiden:
• Algemene juistheid — 54,0% voor Astra for Law versus 38,7% voor GPT-6 Astra met webzoekopdracht, bij de hoogste redeneerinspanning.
• Referentiecasussen gevonden — 24% meer bij vragen gericht op jurisprudentie, opnieuw bij de hoogste redeneerinspanning.
• Relevante passages opgehaald — tot 54% meer uit correcte rechterlijke uitspraken, bij dezelfde redeneerinspanning als de baseline.
• Antwoordlengte — gemiddeld ongeveer twee keer zo lang bij de geteste reasoning-instellingen.
Dat laatste cijfer is het cijfer dat je naast het eerste moet leggen. Een algemene correctheidscontrole die dekking beloont, is gemakkelijker te doorstaan met een langer antwoord, en een deel van de winst van 15,3 punten valt aannemelijk toe te schrijven aan het feit dat de retrievallaag simpelweg meer materiaal vóór het model legt. Dit is geen kritiek op het resultaat — het vinden van 24% meer referentiecases is een echte, afzonderlijk vermelde verbetering — maar het betekent wel dat het samengestelde cijfer en de retrievalcijfers samen moeten worden gelezen in plaats van alleen het samengestelde cijfer.
Het probleem met de privésplit is het grotere probleem. Een validatieset die OpenAI bezit en niet publiceert, kan door niemand opnieuw worden uitgevoerd, en het publieke leaderboard van dezelfde benchmark schetst een vlakker beeld: Vals AI's eigen vergelijkingspagina vermeldt GPT-6 Astra op 39,42% ±3,40 op Legal Research Bench, met Gemini 3.8 Flash op 38,94% ±3,39. Wat de sprong naar 54,0% ook heeft veroorzaakt, is niet zichtbaar op het publieke leaderboard, omdat het publieke leaderboard het basismodel beoordeelt zonder de juridische index eraan gekoppeld.

De Legora-aansluiting, en het getal erin
Het meest substantiële bewijs van derden in de berichtgeving over de lancering is een workflowtest van Legora, waarvan de legal engineer Percevale Perks een afstemming van de jaarrekening uitvoerde — waarbij cijfers van de conceptrekening werden afgezet tegen een proefbalans, een consolidatieoverzicht en de rekeningen van het voorgaande jaar. De agent van Legora voltooide de afstemming over 41 documenten in één run, in enkele minuten, waarbij elke controle werd gelogd en een regel-voor-regel overzicht ter beoordeling werd geproduceerd. Het vond alle vier de fouten die Legora in de rekeningen had aangebracht, waaronder een verschil van £500.000 dat verborgen zat in de omzetnotitie, behield elke controle die het eerdere model had doorstaan, en voegde er ongeveer vijftig toe.
Dat is een werkelijk goed resultaat op een werkelijk moeilijke set documenten. Het is ook waar het nuttigste cijfer uit de hele lanceringscyclus begraven ligt. Op Legora's Benchmark for Agentic Reasoning, die echte end-to-end juridische taken omvat, was de verbetering op de workflow voor financiële overzichten ongeveer 40% — en de gemiddelde verbetering over alle BAR-taken was ongeveer 3%. Beide cijfers zijn van Legora, beide beschrijven hetzelfde model, en slechts één ervan heeft de ronde gedaan. Als je dit voor een kantoor evalueert, is de 3% het cijfer waarop je moet plannen en de 40% het cijfer waarop je kunt hopen.
Onafhankelijke tests wijzen op een andere faalmodus
Twee onafhankelijke evaluaties zijn het waard om naast de lanceringscijfers te leggen, met het voorbehoud dat beide klein zijn en uit één bron afkomstig zijn.
HAQQ liet GPT-6 Astra los op 41 echte juridische vragen binnen 20 rechtsgebieden bij medium reasoning. Astra leidde op juridische inhoud met 17,63 van de 20 — met minder dan een punt. Het kostte $0,2622 per antwoord, ongeveer elf keer de kosten per antwoord van GPT-5.6 Luna Pro voor minder dan een punt samengestelde winst. De eigen lezing van HAQQ is scherp: het voordeel is niet dat het model slimmer is, maar dat het stopt met schrijven. Dezelfde test vond dat het verhogen van de reasoning effort van laag naar hoog de kosten met ongeveer 1,5× vermenigvuldigde en de latentie met ongeveer 1,8×, terwijl de beoordeelde kwaliteit met 0,17 punten daalde — een kostenhefboom vermomd als kwaliteitshefboom, en een reden om de effort-instelling vast te zetten in plaats van op max te laten staan.
De bevinding die het verst zou moeten reiken, gaat niet over kosten. In rechtsgebieden buiten de VS citeerden alle drie de geteste modellen de juiste bepaling, maar gaven ze verkeerd weer wat erin staat. Astra was juridisch correct bij 66,7% van die punten; Claude Opus 5 was correct bij 100%. Een citatiecontroleur laat dat antwoord passeren, omdat de citatie bestaat en de juiste is. Een cliënt niet. Dit is de faalmodus die de juridische zoekindex het minst kan aanpakken, aangezien de index alleen de VS bestrijkt en de fout in het lezen zit, niet in het ophalen.
Wat je daadwerkelijk kunt krijgen, en wanneer
Astra for Law is niet algemeen beschikbaar. Toegang begint via een nieuw Trusted Access-programma gericht op Am Law 200-kantoren, geleverd via ChatGPT en Codex. De API wordt beschreven als binnenkort beschikbaar onder de model-id gpt-6-astra-law, die in de modelkiezer verschijnt als "GPT-6 Astra Law"; Harvey en Legora worden genoemd als API-klanten die erop zullen voortbouwen. Er is geen prijs voor de juridische configuratie gepubliceerd, wat voor iedereen die hiervoor een budget opstelt de grootste open vraag is.
Trusted Access kent twee data-afspraken: Zero Data Retention op de API, en dat ChatGPT Enterprise-gebruik standaard wordt uitgesloten van menselijke beoordeling. Toen hem tijdens de briefing naar uitzonderingen werd gevraagd, beweerde Boehmig niet dat het beleid absoluut was: "Het is beslist ingewikkelder dan die ene zin," zei hij, en merkte op dat de volledige overeenkomst ongeveer 30 pagina's beslaat, en voegde eraan toe dat OpenAI erop vertrouwt dat die 30 pagina's aan de behoefte voldoen. OpenAI zegt samen met Latham & Watkins te werken aan informatietoegangsrechten, ethische schermen, cliëntinstructies en toezicht door het kantoor.
Het ecosysteemdeel is groter dan het modeldeel: 26 plug-ins van leveranciers, waaronder Thomson Reuters, Harvey, Legora, iManage, Relativity, Clio, Intapp en DeepJudge; negen community-plug-ins van groepen voor juridische engineering; en 47 aangepaste vaardigheden die door juridische powerusers zijn gebouwd. ChatGPT for Word werd ook algemeen beschikbaar voor proeflezen, voorgestelde bewerkingen en opmaakmarkeringen. Vooruitgeschoven OpenAI-engineers werkten samen met Sullivan & Cromwell aan een overeenkomstenanalysator, met Ropes & Gray aan due diligence bij fusies en overnames, en met Cooley aan GO Public.
Voor context over hoe druk het in dit segment nu is: Anthropic bracht Claude for Legal uit in mei 2026, drie maanden voordat Astra for Law bestond.
De risico's die geen enkele benchmark op die pagina vastlegt
Niets in het lanceermateriaal behandelt de twee governancevragen die de general counsel van een kantoor als eerste zal stellen. Met ingang van september 2026 was er voor GPT-6 Astra geen SOC 2-, ISO- of HIPAA-certificering gepubliceerd, en er zijn geen gepubliceerde details over kantoorspecifieke data-afscherming, lokale implementatie of dataresidentie. De afwezigheid is geen bewijs van falen — het is simpelweg niet gedocumenteerd, wat een ander probleem is, en een dat het kantoor zelf moet oplossen voordat materiaal dat onder het verschoningsrecht valt erin gaat.
Aan de ethische kant zijn de geldende regels ABA Model Rule 1.6 inzake vertrouwelijkheid, die bepaalt wat een kantoor met een externe aanbieder mag delen en bijgewerkte openbaarmakingen en geïnformeerde toestemming kan vereisen, en Rule 5.3 inzake toezicht op bijstand door niet-juristen, waar AI-output onder valt. De reden dat beide niet theoretisch maar actueel zijn, is Mata v. Avianca, waarin advocaten werden gesanctioneerd voor het indienen van niet-bestaande, door AI gegenereerde zaken. Een juridische zoekindex over echte uitspraken maakt die specifieke fout minder waarschijnlijk. Het maakt het niet onmogelijk, en het doet niets aan de fout met verkeerd gelezen bepalingen die HAQQ documenteerde.
Als je hierop wilt voortbouwen voordat de API opent
De eerlijke stand van zaken vandaag is dat gpt-6-astra-law in niemands API zit, ook niet in de onze — OpenAI heeft gezegd dat het binnenkort komt en geen datum genoemd. Wat is live, is het basismodel: openai/gpt-6-astra staat op OrcaRouter tegen 0% opslag, wat betekent dat de lijstprijs van OpenAI als provider ongewijzigd wordt doorgegeven, zodat een prijswijziging van een leverancier voor dat model dezelfde dag nog wordt doorgevoerd. Eén sleutel bereikt meer dan 200 modellen, met automatische failover tussen providers en een routing-DSL om meerdere modellen in één aanroep te combineren.

De praktische consequentie voor een legal-engineeringteam is een splitsing. Alles in de Astra for Law-workflow dat niet afhankelijk is van de Legal Search Index — het opstellen op basis van feiten die u aanlevert, het herstructureren van een set clausules, het formatteren volgens een kantoorsjabloon, het genereren van een beoordelingschecklist — kunt u vandaag prototypen op base GPT-6 Astra, en het model-id omwisselen wanneer de law-variant opent, zonder uw integratie te wijzigen. Alles wat van de index afhankelijk is, kunt u niet prototypen, omdat de index het deel is dat nog niet te koop is. Twee kanttekeningen die we duidelijk moeten maken: een gerouteerd verzoek valt niet automatisch onder OpenAI's goedkeuring voor Zero Data Retention, die per organisatie wordt toegekend, dus een kantoor dat ZDR nodig heeft, moet de dekking bevestigen voor de specifieke route die het gebruikt; en een router is een extra hop in het datapad, wat een reële kostenpost is voor geprivilegieerd materiaal, zelfs wanneer het u failover oplevert.
Wat te kijken
Drie dingen, in volgorde van hoeveel ze het beeld zullen veranderen. De API-datum voor gpt-6-astra-law, want dat is het verschil tussen een pilot en een product. De prijs, want de $10 per miljoen inputtokens en $50 per miljoen outputtokens van het basismodel brengen een herprijzing voor lange context boven 272.000 inputtokens met zich mee die juridische documentsets routinematig zullen overschrijden — en als de juridische configuratie tegen een premie ten opzichte van dat wordt geprijsd, verandert de economie van een 41-document-tie-out wezenlijk. En een onafhankelijke heruitvoering van die 200 vragen op een split die iemand anders controleert. Totdat dat bestaat, is 54,0% het cijfer van OpenAI over de configuratie van OpenAI, en de verdedigbare bewering is de engere: een Amerikaanse jurisprudentie-index plus juridische instructies levert wezenlijk betere retrieval dan algemeen webzoeken bij Amerikaanse juridische onderzoeksvragen. Het is de moeite waard om op die bewering te handelen. De rest is het waard om op te wachten.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
