Ett genererat hero-kort med titeln 'Introducerar Astra for Law', med undertexten 'OpenAI:s juridiska konfiguration av GPT-6 Astra', med en datarad som lyder 'Astra for Law tillkännagavs 17 september 2026 · GPT-6 Astra släpptes 3 september 2026', ovanför tre kort märkta 'Juridiskt sökindex — 230M+ amerikanska juridiska URL:er', 'Korpus — CourtListener, Free Law Project' och 'API — gpt-6-astra-law, kommer snart', med sidfoten 'Benchmark-siffror leverantörsrapporterade; inte oberoende reproducerade.' och OrcaRouter-logotypen komponerad i nedre högra hörnet.
Guides & Insights

Nu introduceras Astra for Law: OpenAI lägger ett juridiskt sökindex bakom GPT-6 Astra

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Astra for Law tillkännagavs den 17 september 2026 – en konfiguration för juridiskt arbete byggd på GPT-6 Astra, företagets flaggskeppsmodell som släpptes två veckor tidigare, den 3 september. Det är inte en ny modell. Det är samma vikter bakom en annan framdörr: ett dedikerat juridiskt sökindex, juridiskt anpassade instruktioner och en uppsättning verktyg inriktade på forskning om amerikansk rättspraxis. Den distinktionen spelar större roll än lanseringens inramning antyder, eftersom varje siffra i tillkännagivandet mäter konfigurationen mot basmodellen snarare än en ny förmåga – och konfigurationen utför nästan allt arbete.

Rubrikpåståendet är att Astra for Law klarade den övergripande korrekthetskontrollen på 54,0 % av 200 amerikanska juridiska researchfrågor hämtade från den privata valideringsuppsättningen i Vals AI:s Legal Research Bench, mot 38,7 % för GPT-6 Astra med enbart webbsökning – en relativ förbättring på 40 %, som OpenAI framställer det. Det är leverantörsrapporterade siffror på en privat datadelning, och inget oberoende laboratorium har reproducerat dem. Det som är oberoende synligt är mer användbart: Vals AI:s egen offentliga jämförelse listar GPT-6 Astra på 39,42 % ±3,40 i det benchmarket, vilket i praktiken är den baslinje som OpenAI mäter mot. Gapet kommer från det juridiska sökindexet och instruktionerna, inte från att modellen har blivit en bättre jurist.

Här är vad som har levererats, vad som faktiskt har mätts och vad som fortfarande saknas.

Vad Astra for Law faktiskt är

Tre saker lades till ovanpå GPT-6 Astra, och ingen av dem är en ändring av vikterna. Under en mediebriefing beskrev Jason Boehmig – Ironclad-medgrundaren som OpenAI anställde i juni 2026 – och ingenjören Sherwin Wu releasen som en konfiguration av domäninstruktioner, inställningar som svarslängd och verktyg för juridikbranschen som förväntas utökas över tid.

Legal Search Index — ett söklager över amerikansk rättspraxis, lagar, förordningar, domstolsregler och administrativa beslut som omfattar fler än 230 miljoner webbadresser, med källor som läggs till dagligen.

Korpusproveniens – indexet bygger på CourtListener, biblioteket som underhålls av den ideella organisationen Free Law Project, vilket enligt OpenAI täcker mer än 99,9 % av publicerad amerikansk prejudicerande rättspraxis. Det kompletterar licensierat innehåll från leverantörer, däribland Thomson Reuters.

Juridiska instruktioner — en uppsättning domäninstruktioner för att tillämpa forskning på fakta, utveckla argument eller avtalsvillkor och synliggöra svagheter eller osäkerhet i en ståndpunkt.

A generated single-column scoreboard titled 'Astra for Law — the scoreboard' with six rows reading 'Underlying model: GPT-6 Astra', 'Legal Search Index: 230M+ U.S. law URLs', 'Corpus: CourtListener, 99.9% of precedential case law', 'Availability: Trusted Access, Am Law 200 only', 'API model id: gpt-6-astra-law, not yet open' and 'Headline benchmark: 54.0% vs 38.7% vendor-reported', above the footer 'All figures OpenAI-reported on a private validation set; no independent reproduction.' with the OrcaRouter logo composited in the bottom-right corner.

Demonstrationen i briefingen var konkret snarare än abstrakt: Wu utformade ett yrkande om avvisning åt ett sjukhus som stod inför ett anspråk om diskriminering på grund av funktionsnedsättning och repressalier, arbetade med en aktieägares invändning mot en försäljning av tillgångar under en långhelg och hanterade en tvist om ett försäljningsåtagande. Inget av dessa är en ny förmåga för en frontiermodell. Det som är nytt är att den halva av arbetet som består av informationshämtning inte längre går via allmän webbsökning.

Riktmärket, läs noga

Fyra siffror kom ut ur lanseringen, alla tillskrivna OpenAI, alla på samma privata valideringsset, och alla värda att skilja från varandra:

Övergripande korrekthet — 54,0 % för Astra for Law jämfört med 38,7 % för GPT-6 Astra med webbsökning, vid högsta resonemangsansträngning.

Hittade referensfall — 24 % fler på rättsfallsfokuserade frågor, återigen vid högsta resonemangsansträngning.

Relevanta avsnitt hämtade — upp till 54 % fler från korrekta domstolsutlåtanden, med samma resonemangsinsats som baslinjen.

Svararlängd — i genomsnitt ungefär dubbelt så lång i de testade resonemangsinställningarna.

Den sista siffran är den man bör ställa bredvid den första. En övergripande korrekthetskontroll som belönar täckning är lättare att klara med ett längre svar, och en del av ökningen på 15,3 punkter är rimligen att hämtningslagret helt enkelt lägger mer material framför modellen. Detta är inte en kritik av resultatet – att hitta 24 % fler referensfall är en verklig, separat redovisad förbättring – men det innebär att det sammansatta talet och hämtningstalen bör läsas tillsammans i stället för det sammansatta talet ensamt.

Problemet med den privata spliten är det större. Ett valideringsset som OpenAI har och inte publicerar kan inte köras om av någon, och den offentliga resultattavlan för samma benchmark ger en plattare bild: Vals AI:s egen jämförelsesida listar GPT-6 Astra på 39,42 % ±3,40 på Legal Research Bench, med Gemini 3.8 Flash på 38,94 % ±3,39. Vad det än var som orsakade hoppet till 54,0 % syns inte på den offentliga resultattavlan, eftersom den offentliga resultattavlan poängsätter basmodellen utan att det juridiska indexet är kopplat.

A screenshot of the Vals AI 'Compare Models' leaderboard captured September 18, 2026, comparing Gemini 3.8 Flash and GPT-6 Astra: Legal Research Bench (Agentic US legal research) shows Gemini 3.8 Flash 38.94% ±3.39 against GPT-6 Astra 39.42% ±3.40; Vals Index shows 62.25% against 66.61%; and the table also lists Finance Agent (V2) 61.44% vs 53.54%, Tax Agent Bench 66.77% vs 63.34%, MedCode 48.13% vs 48.49%, Terminal-Bench Science 8.57% vs 65.71%, Code Migration 36.55% vs 67.74%, Terminal-Bench 4.0 13.13% vs 57.07% and Vibe Code Bench v1.1 78.65% vs 89.59%, with a Vals Index date of 2026-09-11.

Legora-avstämningen, och numret i den

Det mest substantiella tredjepartsbeviset i lanseringsbevakningen är ett arbetsflödestest från Legora, vars juridiska ingenjör Percevale Perks genomförde en avstämning av finansiella rapporter — matchning av utkast till kontosiffror mot en råbalans, ett konsolideringsschema och föregående års konton. Legoras agent slutförde avstämningen över 41 dokument i en enda körning, på minuter, loggade varje kontroll och producerade en rad-för-rad-post för granskning. Den hittade alla fyra fel som Legora hade planterat i kontona, inklusive en lucka på 500 000 £ dold i intäktsnoten, behöll varje kontroll som den tidigare modellen hade klarat, och lade till ungefär femtio fler.

Det är ett genuint bra resultat på en genuint svår dokumentuppsättning. Det är också där det mest användbara talet i hela lanseringscykeln ligger begravt. På Legoras Benchmark for Agentic Reasoning, som täcker verkliga heltäckande juridiska uppgifter, var förbättringen i arbetsflödet för finansiella rapporter cirka 40 % – och den genomsnittliga förbättringen över alla BAR-uppgifter var cirka 3 %. Båda siffrorna är Legoras, båda beskriver samma modell, och bara en av dem fick spridning. Om du utvärderar detta för en byrå är 3 % den siffra du bör planera efter och 40 % den siffra du kan hoppas på.

Oberoende testning pekar på ett annat felmod.

Två oberoende utvärderingar är värda att ställa bredvid lanseringssiffrorna, med förbehållet att båda är små och bygger på en enda källa.

HAQQ körde GPT-6 Astra mot 41 verkliga juridiska frågor inom 20 rättsområden vid medelhög resonemangsansträngning. Astra ledde inom juridisk substans med 17,63 av 20 – med mindre än en poäng. Det kostade $0.2622 per svar, ungefär elva gånger kostnaden per svar för GPT-5.6 Luna Pro, för en sammansatt förbättring på under en poäng. HAQQ:s egen tolkning är skarp: fördelen är inte att modellen är smartare, utan att den slutar skriva. Samma test visade att en ändring av resonemangsansträngningen från låg till hög multiplicerade kostnaden med cirka 1,5× och latensen med cirka 1,8×, samtidigt som den bedömda kvaliteten sjönk med 0,17 poäng – en kostnadshävstång utklädd till kvalitetshävstång, och ett skäl att låsa ansträngningsinställningen i stället för att lämna den på max.

Det rön som borde nå längst handlar inte om kostnad. I jurisdiktioner utanför USA citerade alla tre testade modeller rätt bestämmelse samtidigt som de felaktigt återgav vad den säger. Astra var juridiskt korrekt i 66,7 % av dessa punkter; Claude Opus 5 var korrekt i 100 %. En citatkontroll godkänner det svaret, eftersom citatet finns och är det rätta. En klient gör det inte. Detta är det felmönster som det juridiska sökindexet är sämst rustat att hantera, eftersom indexet endast omfattar USA och felet ligger i läsningen, inte i hämtningen.

Vad du faktiskt kan få, och när

Astra for Law är inte allmänt tillgängligt. Åtkomst börjar via ett nytt Trusted Access-program som riktar sig till Am Law 200-firmor och levereras via ChatGPT och Codex. API:et beskrivs som kommande snart under modell-id:t gpt-6-astra-law, och visas i modellväljaren som "GPT-6 Astra Law"; Harvey och Legora anges som API-kunder som kommer att bygga vidare på det. Inget pris för den juridiska konfigurationen har publicerats, vilket är den enskilt största öppna frågan för alla som budgeterar kring den.

Trusted Access omfattar två datavillkor: Zero Data Retention för API:t, och att ChatGPT Enterprise-användning som standard undantas från mänsklig granskning. När han i briefingen tillfrågades om undantag hävdade Boehmig inte att policyn var absolut: "Det är definitivt mer komplicerat än den där ena meningen", sade han och noterade att det fullständiga avtalet omfattar omkring 30 sidor, och tillade att OpenAI är övertygat om att de 30 sidorna tillgodoser behovet. OpenAI säger att man arbetar med Latham & Watkins kring informationsbehörigheter, etiska murar, klientinstruktioner och byråns tillsyn.

Ekosystemdelen är större än modelldelen: 26 leverantörsplugins inklusive Thomson Reuters, Harvey, Legora, iManage, Relativity, Clio, Intapp och DeepJudge; nio communityplugins från grupper inom juridisk teknik; och 47 anpassade färdigheter byggda av avancerade juridiska användare. ChatGPT för Word blev också allmänt tillgängligt för korrekturläsning, föreslagna ändringar och formateringsflaggor. Utplacerade OpenAI-ingenjörer arbetade med Sullivan & Cromwell om en avtalsanalysator, Ropes & Gray om M&A-diligence och Cooley om GO Public.

För att sätta det i sammanhang: hur trångt detta fält nu är – Anthropic lanserade Claude for Legal i maj 2026, tre månader innan Astra for Law fanns.

Riskerna som ingen benchmark på den sidan fångar

Inget i lanseringsmaterialet tar upp de två styrningsfrågorna som en byrås chefsjurist kommer att ställa först. Per september 2026 hade ingen SOC 2-, ISO- eller HIPAA-certifiering publicerats för GPT-6 Astra, och det finns inga publicerade uppgifter om byråspecifik dataisolering, lokal driftsättning eller datalokalisering. Avsaknaden är inte ett bevis på misslyckande – den är helt enkelt odokumenterad, vilket är ett annat problem och ett som byrån måste lösa innan privilegierat material läggs in.

På etiksidan är de tillämpliga reglerna ABA:s modellregel 1.6 om konfidentialitet, som styr vad en advokatbyrå får dela med en tredjepartsleverantör och kan kräva uppdaterade upplysningar och informerat samtycke, samt regel 5.3 om tillsyn över medhjälpare som inte är jurister, vilket är där AI-utdata hamnar. Anledningen till att båda är aktuella snarare än teoretiska är Mata v. Avianca, där advokater sanktionerades för att ha lämnat in icke existerande AI-genererade rättsfall. Ett juridiskt sökindex över verkliga avgöranden gör att just det specifika felet blir mindre sannolikt. Det gör det inte omöjligt, och det gör ingenting åt det fel med felaktigt lästa bestämmelser som HAQQ dokumenterade.

Om du vill bygga vidare på detta innan API:et öppnas

Den ärliga positionen i dag är att gpt-6-astra-law inte finns i någons API, inte heller vårt – OpenAI har sagt att det kommer snart och inte angett något datum. Det som är tillgängligt är basmodellen: openai/gpt-6-astra finns på OrcaRouter med 0 % påslag, vilket innebär att OpenAI:s leverantörslistpris förs vidare oförändrat, så en prisändring från leverantören för den modellen återspeglas samma dag. En nyckel når mer än 200 modeller, med automatisk failover mellan leverantörer och ett routing-DSL för att kombinera flera modeller till ett enda anrop.

A screenshot of OpenAI's developer documentation page for GPT-6 Astra, captured September 18, 2026, showing the model badge labelled 'Default' with the line 'Our most capable model, built for the hardest end-to-end work', a 1,050,000 context window, 128,000 max output tokens, an Apr 30 2026 knowledge cutoff, reasoning token support, and the pricing card reading Input $10.00, Cached input $1.00, Cache writes $12.50, Output $50.00 per 1M tokens, with the notes that prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request, that cache writes are billed at 1.25x the uncached input token rate, and that Batch and Flex are priced at 50% of Standard rates while Fast mode is priced at 2x.

Den praktiska konsekvensen för ett team för juridisk teknik är en uppdelning. Allt i Astra for Law-arbetsflödet som inte är beroende av Legal Search Index – att skriva utkast utifrån fakta du tillhandahåller, att strukturera om en klausuluppsättning, att formatera enligt en byråmall, att generera en granskningschecklista – kan du prototypa redan i dag på bas-GPT-6 Astra och byta ut modell-id:t när juridikvarianten öppnas, utan att ändra din integration. Allt som är beroende av indexet kan du inte prototypa, eftersom indexet är den del som ännu inte är till salu. Två förbehåll förtjänar att sägas rakt ut: en routad begäran omfattas inte automatiskt av OpenAI:s godkännande för Zero Data Retention, vilket beviljas per organisation, så en byrå som behöver ZDR bör bekräfta täckningen för den specifika route den använder; och en router är ett extra hopp i datavägen, vilket är en reell kostnad för privilegierat material även när den ger dig failover.

Vad du ska titta på

Tre saker, i ordning efter hur mycket de kommer att förändra bilden. API-datumet för gpt-6-astra-law, eftersom det är skillnaden mellan en pilot och en produkt. Priset, eftersom basmodellens 10 dollar per miljon indatatoken och 50 dollar per miljon utdatatoken medför en prisjustering för lång kontext över 272 000 indatatoken som juridiska dokumentsamlingar rutinmässigt kommer att överskrida — och om den juridiska konfigurationen prissätts med ett premium i förhållande till det, förändras ekonomin för en avstämning av 41 dokument väsentligt. Och en oberoende omkörning av de 200 frågorna på en split som någon annan kontrollerar. Tills det finns är 54,0 % OpenAI:s siffra om OpenAI:s konfiguration, och det försvarbara påståendet är det snävare: ett index över amerikansk rättspraxis plus juridiska instruktioner ger väsentligt bättre hämtning än allmän webbsökning på amerikanska juridiska forskningsfrågor. Det påståendet är värt att agera på. Resten är värt att vänta på.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen