Wygenerowana karta hero zatytułowana „Przedstawiamy Astra for Law”, z podtytułem „Prawnicza konfiguracja GPT-6 Astra od OpenAI”, z wierszem daty o treści „Astra for Law ogłoszona 17 września 2026 · GPT-6 Astra wydana 3 września 2026”, nad trzema kartami oznaczonymi jako „Indeks wyszukiwania prawnego — ponad 230 mln adresów URL dotyczących prawa USA”, „Korpus — CourtListener, Free Law Project” i „API — gpt-6-astra-law, wkrótce”, ze stopką „Wyniki benchmarków raportowane przez dostawcę; nie zostały niezależnie odtworzone” oraz logo OrcaRouter wkomponowanym w prawym dolnym rogu.
Guides & Insights

Przedstawiamy Astra for Law: OpenAI umieszcza indeks wyszukiwania prawniczego za GPT-6 Astra

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Astra for Law została ogłoszona 17 września 2026 r. — konfiguracja do pracy prawniczej oparta na GPT-6 Astra, modelu flagowym, który firma wydała dwa tygodnie wcześniej, 3 września. To nie jest nowy model. To te same wagi za innymi drzwiami wejściowymi: dedykowany indeks wyszukiwania prawniczego, instrukcje specjalizowane pod kątem prawa i zestaw narzędzi ukierunkowanych na badanie orzecznictwa Stanów Zjednoczonych. To rozróżnienie ma większe znaczenie, niż sugeruje sposób prezentacji premiery, ponieważ każda liczba w ogłoszeniu mierzy konfigurację względem modelu bazowego, a nie nowej możliwości — a konfiguracja wykonuje niemal całą pracę.

Główne twierdzenie brzmi, że Astra for Law przeszła ogólną kontrolę poprawności w przypadku 54,0% z 200 amerykańskich pytań z zakresu badań prawnych pochodzących z prywatnego zbioru walidacyjnego Legal Research Bench firmy Vals AI, wobec 38,7% dla GPT-6 Astra korzystającego wyłącznie z wyszukiwania internetowego — co według OpenAI oznacza 40-procentową poprawę względną. Są to liczby deklarowane przez dostawcę na prywatnym podziale i żadne niezależne laboratorium ich nie odtworzyło. Bardziej użyteczne jest to, co widać niezależnie: własne publiczne zestawienie Vals AI podaje dla GPT-6 Astra wynik 39,42% ±3,40 w tym benchmarku, co zasadniczo stanowi punkt odniesienia, względem którego mierzy OpenAI. Ta różnica wynika z indeksu wyszukiwania prawnego i instrukcji, a nie z tego, że model stał się lepszym prawnikiem.

Oto co zostało wydane, co faktycznie zmierzono i czego wciąż brakuje.

Czym właściwie jest Astra for Law

Do GPT-6 Astra dodano trzy rzeczy i żadna z nich nie jest zmianą wag. Podczas briefingu medialnego Jason Boehmig — współzałożyciel Ironclad, którego OpenAI zatrudniło w czerwcu 2026 r. — oraz inżynier Sherwin Wu opisali to wydanie jako konfigurację instrukcji domenowych, ustawień takich jak długość odpowiedzi oraz narzędzi dla branży prawniczej, które z czasem mają zostać rozbudowane.

Indeks wyszukiwania prawnego — warstwa wyszukiwania obejmująca amerykańskie orzecznictwo sądowe, ustawy, rozporządzenia, przepisy sądowe i decyzje administracyjne, licząca ponad 230 milionów adresów URL, ze źródłami dodawanymi codziennie.

Pochodzenie korpusu — indeks korzysta z CourtListener, biblioteki prowadzonej przez organizację non-profit Free Law Project, która według OpenAI obejmuje ponad 99,9% opublikowanego amerykańskiego orzecznictwa precedensowego. Uzupełnia ona licencjonowane treści od dostawców, w tym Thomson Reuters.

Instrukcje prawne — zestaw instrukcji domenowych dotyczących stosowania wyników badań do stanu faktycznego, opracowywania argumentów lub warunków transakcji oraz ujawniania słabości lub niepewności w stanowisku.

A generated single-column scoreboard titled 'Astra for Law — the scoreboard' with six rows reading 'Underlying model: GPT-6 Astra', 'Legal Search Index: 230M+ U.S. law URLs', 'Corpus: CourtListener, 99.9% of precedential case law', 'Availability: Trusted Access, Am Law 200 only', 'API model id: gpt-6-astra-law, not yet open' and 'Headline benchmark: 54.0% vs 38.7% vendor-reported', above the footer 'All figures OpenAI-reported on a private validation set; no independent reproduction.' with the OrcaRouter logo composited in the bottom-right corner.

Demonstracja w briefingu była konkretna, a nie abstrakcyjna: Wu sporządził wniosek o oddalenie powództwa dla szpitala stojącego w obliczu roszczenia o dyskryminację ze względu na niepełnosprawność i roszczenia o działania odwetowe, zajął się zaskarżeniem przez akcjonariusza sprzedaży aktywów w czasie weekendu świątecznego oraz poprowadził spór dotyczący zobowiązania sprzedażowego. Żadna z tych rzeczy nie jest nową możliwością dla modelu frontier. Nowe jest to, że połowa zadania związana z wyszukiwaniem informacji nie przechodzi już przez ogólne wyszukiwanie internetowe.

Benchmark, przeczytaj uważnie.

Z premiery wyszły cztery liczby, wszystkie przypisane OpenAI, wszystkie na tym samym prywatnym zbiorze walidacyjnym i wszystkie warte odróżnienia od siebie:

Ogólna poprawność — 54,0% dla Astra for Law wobec 38,7% dla GPT-6 Astra z wyszukiwaniem internetowym, przy najwyższym poziomie rozumowania.

Znalezione sprawy precedensowe — o 24% więcej w pytaniach dotyczących orzecznictwa, ponownie przy najwyższym poziomie wysiłku rozumowania.

Pobrane istotne fragmenty — do 54% więcej z prawidłowych opinii sądowych, przy takim samym wysiłku rozumowania jak w przypadku poziomu odniesienia.

Długość odpowiedzi — średnio około dwa razy dłuższa w testowanych ustawieniach rozumowania.

Ta ostatnia wartość jest tą, którą należy zestawić z pierwszą. Kontrola ogólnej poprawności, która nagradza pokrycie, jest łatwiejsza do zaliczenia przy dłuższej odpowiedzi, a część 15,3-punktowego wzrostu prawdopodobnie wynika z tego, że warstwa wyszukiwania po prostu stawia przed modelem więcej materiału. To nie jest krytyka tego wyniku — znalezienie o 24% więcej przypadków referencyjnych to realna, osobno podana poprawa — ale oznacza, że wynik zbiorczy i wyniki wyszukiwania należy czytać razem, a nie sam wynik zbiorczy.

Problem prywatnego podziału jest większym problemem. Nikt nie może ponownie uruchomić zbioru walidacyjnego, który OpenAI przechowuje i nie publikuje, a publiczny ranking tego samego benchmarku przedstawia mniej spektakularny obraz: własna strona porównawcza Vals AI podaje GPT-6 Astra na poziomie 39,42% ±3,40 w Legal Research Bench, a Gemini 3.8 Flash na 38,94% ±3,39. Cokolwiek spowodowało skok do 54,0%, nie jest widoczne w publicznym rankingu, ponieważ publiczny ranking ocenia model bazowy bez dołączonego indeksu prawniczego.

A screenshot of the Vals AI 'Compare Models' leaderboard captured September 18, 2026, comparing Gemini 3.8 Flash and GPT-6 Astra: Legal Research Bench (Agentic US legal research) shows Gemini 3.8 Flash 38.94% ±3.39 against GPT-6 Astra 39.42% ±3.40; Vals Index shows 62.25% against 66.61%; and the table also lists Finance Agent (V2) 61.44% vs 53.54%, Tax Agent Bench 66.77% vs 63.34%, MedCode 48.13% vs 48.49%, Terminal-Bench Science 8.57% vs 65.71%, Code Migration 36.55% vs 67.74%, Terminal-Bench 4.0 13.13% vs 57.07% and Vibe Code Bench v1.1 78.65% vs 89.59%, with a Vals Index date of 2026-09-11.

Uzgodnienie Legora i liczba w nim zawarta

Najbardziej merytorycznym dowodem od strony trzeciej w materiałach z premiery jest test przepływu pracy od Legory, w którym jej inżynier prawny Percevale Perks przeprowadził uzgodnienie sprawozdania finansowego — porównując kwoty z projektu sprawozdania z bilansem próbnym, zestawieniem konsolidacyjnym i sprawozdaniami z poprzedniego roku. Agent Legory ukończył to uzgodnienie na podstawie 41 dokumentów w jednym przebiegu, w kilka minut, rejestrując każdą kontrolę i tworząc zapis wiersz po wierszu do przeglądu. Znalazł wszystkie cztery błędy, które Legora celowo wprowadziła do sprawozdań, w tym lukę w wysokości 500 000 funtów ukrytą w nocie o przychodach, zachował każdą kontrolę, którą zaliczył wcześniejszy model, i dodał około pięćdziesięciu kolejnych.

To naprawdę dobry wynik na naprawdę trudnym zestawie dokumentów. To także miejsce, w którym zakopana jest najbardziej użyteczna liczba całego cyklu premiery. W Legora's Benchmark for Agentic Reasoning, który obejmuje rzeczywiste, kompleksowe zadania prawnicze, poprawa w przepływie pracy ze sprawozdaniami finansowymi wyniosła około 40% — a średnia poprawa we wszystkich zadaniach BAR wyniosła około 3%. Obie liczby pochodzą od Legory, obie opisują ten sam model, a tylko jedna z nich trafiła do obiegu. Jeśli oceniasz to dla firmy, 3% to wartość, według której należy planować, a 40% to wartość, na którą można mieć nadzieję.

Niezależne testy wskazują na inny tryb awarii.

Dwie niezależne oceny warto postawić obok liczb z premiery, z zastrzeżeniem, że obie są niewielkie i pochodzą z jednego źródła.

HAQQ przetestowało GPT-6 Astra na 41 prawdziwych pytaniach prawnych z 20 obszarów praktyki prawnej przy średnim poziomie rozumowania. Astra była liderem pod względem merytoryki prawnej, uzyskując 17,63 na 20 — o mniej niż punkt. Koszt wyniósł 0,2622 USD za odpowiedź, około jedenaście razy więcej niż koszt odpowiedzi GPT-5.6 Luna Pro, za mniej niż punkt łącznego zysku. Własna interpretacja HAQQ jest trafna: przewaga nie polega na tym, że model jest mądrzejszy, ale na tym, że przestaje pisać. Ten sam test wykazał, że przełączenie wysiłku rozumowania z niskiego na wysoki zwiększyło koszt około 1,5×, a opóźnienie około 1,8×, jednocześnie obniżając ocenianą jakość o 0,17 punktu — dźwignia kosztowa przebrana za dźwignię jakości i powód, by ustalić ustawienie wysiłku na stałe, zamiast pozostawiać je na maksimum.

Ustalenie, które powinno rozprzestrzenić się najszerzej, nie dotyczy kosztów. We wszystkich jurysdykcjach poza Stanami Zjednoczonymi wszystkie trzy testowane modele cytowały właściwy przepis, jednocześnie błędnie przedstawiając jego treść. Astra miała rację pod względem prawnym w 66,7% tych pozycji; Claude Opus 5 — w 100%. Weryfikator cytowań uznaje tę odpowiedź za poprawną, ponieważ cytat istnieje i jest właściwy. Klient nie. To tryb awarii, do którego rozwiązania indeks wyszukiwania prawniczego jest najmniej przygotowany, ponieważ obejmuje wyłącznie USA, a błąd dotyczy odczytu, nie wyszukiwania.

Co faktycznie możesz otrzymać i kiedy

Astra for Law nie jest ogólnodostępna. Dostęp rozpoczyna się w ramach nowego programu Trusted Access skierowanego do firm z Am Law 200, realizowanego przez ChatGPT i Codex. API jest opisane jako mające pojawić się wkrótce pod identyfikatorem modelu gpt-6-astra-law, który pojawi się w selektorze modeli jako „GPT-6 Astra Law”; Harvey i Legora są wymieniani jako klienci API, którzy będą na nim budować. Nie opublikowano ceny konfiguracji prawnej, co jest największym otwartym pytaniem dla każdego, kto planuje na to budżet.

Trusted Access obejmuje dwa warunki dotyczące danych: Zero Data Retention w API oraz domyślne wyłączenie korzystania z ChatGPT Enterprise z przeglądu przez ludzi. Zapytany podczas briefingu o wyjątki, Boehmig nie twierdził, że polityka jest absolutna: „To zdecydowanie bardziej skomplikowane niż jedno zdanie” – powiedział, zauważając, że pełna umowa liczy około 30 stron, i dodając, że OpenAI jest pewne, że te 30 stron spełnia tę potrzebę. OpenAI twierdzi, że współpracuje z Latham & Watkins nad uprawnieniami do informacji, barierami etycznymi, instrukcjami klientów i nadzorem kancelarii.

Element ekosystemu jest większy niż element modelu: 26 wtyczek dostawców, w tym Thomson Reuters, Harvey, Legora, iManage, Relativity, Clio, Intapp i DeepJudge; dziewięć wtyczek społeczności od grup zajmujących się inżynierią prawniczą; oraz 47 niestandardowych skilli zbudowanych przez zaawansowanych użytkowników z branży prawnej. ChatGPT for Word osiągnął także ogólną dostępność w zakresie korekty, sugerowanych zmian i flag formatowania. Inżynierowie OpenAI oddelegowani do pracy na miejscu współpracowali z Sullivan & Cromwell nad analizatorem umów, z Ropes & Gray nad due diligence w M&A, a z Cooley nad GO Public.

Dla kontekstu, jak tłoczno jest teraz w tej niszy: Anthropic wypuścił Claude for Legal w maju 2026 roku, trzy miesiące przed tym, jak Astra for Law w ogóle zaistniała.

Ryzyka, których nie ujmuje żaden benchmark na tej stronie

Nic w materiałach premierowych nie odnosi się do dwóch pytań z zakresu ładu, które główny radca prawny firmy zada najpierw. Według stanu na wrzesień 2026 r. nie opublikowano żadnej certyfikacji SOC 2, ISO ani HIPAA dla GPT-6 Astra, a także nie podano szczegółów na temat silosowania danych poszczególnych firm, wdrożenia lokalnego ani rezydencji danych. Brak ten nie jest dowodem porażki — to po prostu brak dokumentacji, co stanowi odrębny problem i taki, którego rozwiązanie spoczywa na firmie, zanim do systemu trafią materiały objęte przywilejem.

Po stronie etyki obowiązującymi regułami są Modelowa Reguła ABA 1.6 dotycząca poufności, która reguluje, czym kancelaria może dzielić się z zewnętrznym dostawcą, oraz może wymagać zaktualizowanych ujawnień i świadomej zgody, a także Reguła 5.3 dotycząca nadzoru nad pomocą osób niebędących prawnikami, pod którą podpadają wyniki generowane przez AI. Powodem, dla którego oba te przepisy mają znaczenie praktyczne, a nie tylko teoretyczne, jest Mata v. Avianca, gdzie prawnicy zostali ukarani za złożenie nieistniejących spraw wygenerowanych przez AI. Prawniczy indeks wyszukiwania oparty na rzeczywistych orzeczeniach sprawia, że to konkretne niepowodzenie jest mniej prawdopodobne. Nie czyni go to jednak niemożliwym i nic nie robi w kwestii błędu polegającego na błędnym odczytaniu przepisu, udokumentowanego przez HAQQ.

Jeśli chcesz coś na tym zbudować, zanim API zostanie otwarte

Uczciwe stanowisko na dziś jest takie, że gpt-6-astra-law nie znajduje się w niczyim API, w tym w naszym — OpenAI zapowiedziało, że pojawi się wkrótce, i nie podało żadnej daty. Co jest dostępne, to model bazowy: openai/gpt-6-astra znajduje się w OrcaRouter przy 0% marży, co oznacza, że cena katalogowa dostawcy OpenAI jest przekazywana bez zmian, więc zmiana ceny tego modelu przez dostawcę znajduje odzwierciedlenie tego samego dnia. Jeden klucz daje dostęp do ponad 200 modeli, z automatycznym przełączaniem awaryjnym między dostawcami oraz DSL routingu do łączenia kilku modeli w jedno wywołanie.

A screenshot of OpenAI's developer documentation page for GPT-6 Astra, captured September 18, 2026, showing the model badge labelled 'Default' with the line 'Our most capable model, built for the hardest end-to-end work', a 1,050,000 context window, 128,000 max output tokens, an Apr 30 2026 knowledge cutoff, reasoning token support, and the pricing card reading Input $10.00, Cached input $1.00, Cache writes $12.50, Output $50.00 per 1M tokens, with the notes that prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request, that cache writes are billed at 1.25x the uncached input token rate, and that Batch and Flex are priced at 50% of Standard rates while Fast mode is priced at 2x.

Praktyczną konsekwencją dla zespołu inżynierii prawnej jest podział. Wszystko w przepływie pracy Astra for Law, co nie zależy od Legal Search Index — tworzenie projektów na podstawie dostarczonych faktów, restrukturyzacja zestawu klauzul, formatowanie do szablonu kancelarii, generowanie listy kontrolnej do przeglądu — można dziś prototypować na bazowym GPT-6 Astra, a identyfikator modelu podmienić, gdy wariant prawniczy zostanie udostępniony, bez zmiany własnej integracji. Wszystkiego, co zależy od indeksu, nie można prototypować, ponieważ indeks to część, która nie jest jeszcze w sprzedaży. Dwa zastrzeżenia warte wyraźnego powiedzenia: żądanie kierowane przez router nie jest automatycznie objęte zgodą OpenAI na Zero Data Retention, która jest przyznawana na poziomie organizacji, więc kancelaria potrzebująca ZDR powinna potwierdzić objęcie ochroną na konkretnej wykorzystywanej trasie; a router to dodatkowy przeskok na ścieżce danych, co stanowi realny koszt w przypadku materiałów objętych tajemnicą zawodową, nawet jeśli zapewnia przełączanie awaryjne.

Co obejrzeć

Trzy rzeczy, w kolejności od tego, jak bardzo zmienią obraz sytuacji. Data udostępnienia API dla gpt-6-astra-law, ponieważ to różnica między pilotażem a produktem. Cena, ponieważ model bazowy wycenia 10 USD za milion tokenów wejściowych i 50 USD za milion tokenów wyjściowych, a powyżej 272 000 tokenów wejściowych obowiązuje zmiana ceny dla długiego kontekstu, a zestawy dokumentów prawnych będą rutynowo przekraczać ten próg — a jeśli konfiguracja prawna jest wyceniona z premią względem tego, ekonomika uzgodnienia 41 dokumentów zmienia się istotnie. I niezależne ponowne uruchomienie tych 200 pytań na podziale kontrolowanym przez kogoś innego. Dopóki to nie istnieje, 54,0% to liczba OpenAI dotycząca konfiguracji OpenAI, a twierdzeniem, którego można bronić, jest to węższe: indeks orzecznictwa USA wraz z instrukcjami prawniczymi daje istotnie lepsze wyniki wyszukiwania niż ogólne wyszukiwanie internetowe w pytaniach z zakresu badań prawnych dotyczących prawa USA. Warto działać na podstawie tego twierdzenia. Na resztę warto poczekać.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie