
법률용 Astra 공개: OpenAI, GPT-6 Astra에 법률 검색 인덱스 탑재
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Astra for Law는 2026년 9월 17일에 발표되었습니다. GPT-6 Astra를 기반으로 구축된 법률 업무용 구성으로, 이는 회사가 2주 전인 9월 3일에 출시한 플래그십 모델입니다. 그것은 새로운 모델이 아닙니다. 서로 다른 정문 뒤에 놓인 동일한 가중치, 즉 전용 법률 검색 색인과 법률 특화 지침, 그리고 미국 판례 조사를 겨냥한 일련의 도구들입니다. 이러한 구분은 발표의 프레이밍이 시사하는 것보다 더 중요합니다. 왜냐하면 발표문의 모든 수치는 새로운 역량이 아니라 기본 모델과 대비한 이 구성의 성능을 측정한 것이며, 그 구성이 거의 모든 역할을 하고 있기 때문입니다.
대표적인 주장은 Astra for Law가 Vals AI의 Legal Research Bench 비공개 검증 세트에서 추출한 200개의 미국 법률 조사 질문 중 54.0%에서 전체 정확성 검사를 통과했다는 것입니다. 이는 웹 검색만 사용한 GPT-6 Astra의 38.7%와 대비되며, OpenAI가 말하는 바에 따르면 40%의 상대적 개선입니다. 이는 비공개 분할에 대한 공급업체 보고 수치이며, 이를 재현한 독립 연구소는 없습니다. 독립적으로 확인 가능한 것이 더 유용합니다. Vals AI 자체의 공개 비교에서는 해당 벤치마크에서 GPT-6 Astra를 39.42% ±3.40으로 기재하는데, 이는 본질적으로 OpenAI가 기준으로 삼는 베이스라인입니다. 그 격차는 모델이 더 나은 변호사가 되었기 때문이 아니라 법률 검색 색인과 지침에서 비롯됩니다.
다음은 출시된 것, 실제로 측정된 것, 그리고 아직 빠져 있는 것입니다.
Astra for Law는 실제로 무엇인가
GPT-6 Astra 위에는 세 가지가 추가되었으며, 그중 어느 것도 가중치 변경이 아니다. 미디어 브리핑에서 2026년 6월 OpenAI가 영입한 Ironclad 공동 창업자 Jason Boehmig와 엔지니어 Sherwin Wu는 이번 릴리스를 도메인 지침의 구성, 응답 길이와 같은 설정, 그리고 시간이 지나면서 확장될 것으로 예상되는 법률 업계 툴링이라고 설명했다.
• 법률 검색 인덱스 — 2억 3천만 개 이상의 URL에 걸친 미국 판례법, 법령, 규정, 법원 규칙 및 행정 결정을 아우르는 검색 계층으로, 소스가 매일 추가됩니다.
• 코퍼스 출처 — 이 색인은 비영리 단체인 Free Law Project가 운영하는 라이브러리인 CourtListener를 활용하는데, OpenAI에 따르면 이는 미국에서 공개된 선례적 판례법의 99.9% 이상을 포괄한다. 또한 Thomson Reuters를 비롯한 제공업체들의 라이선스 콘텐츠를 보완한다.
• 법률 지침 — 리서치를 사실에 적용하고, 논거나 거래 조건을 전개하며, 특정 입장의 약점이나 불확실성을 드러내기 위한 일련의 도메인 지침입니다.

브리핑에서의 시연은 추상적이라기보다 구체적이었다: 우는 장애 차별 및 보복 청구에 직면한 병원을 위해 각하 신청서를 작성했고, 연휴 주말 동안 자산 매각에 대한 주주 이의 제기를 처리했으며, 판매 약정 분쟁을 다뤘다. 그중 어느 것도 프런티어 모델에 새로운 능력은 아니다. 새로운 점은 그 작업의 검색 부분이 더 이상 일반 웹 검색을 거치지 않는다는 것이다.
벤치마크를 주의 깊게 읽으세요.
출시에서 네 개의 수치가 나왔는데, 모두 OpenAI의 것으로 귀속되었고, 모두 동일한 비공개 검증 세트에 대한 것이었으며, 모두 서로 구분해 볼 가치가 있습니다:
• 전체 정확도 — 최고 추론 노력 수준에서 Astra for Law는 54.0%, 웹 검색을 사용한 GPT-6 Astra는 38.7%.
• 참조 사례 검색됨 — 판례 중심 질문에서 24% 더 많았으며, 이 역시 최고 수준의 추론 노력에서 나타났습니다.
• 검색된 관련 구절 — 기준선과 동일한 추론 노력으로 정확한 법원 의견서에서 최대 54% 더 많습니다.
• 답변 길이 — 테스트된 추론 설정 전반에서 평균적으로 약 두 배 더 깁니다.
그 마지막 수치는 첫 번째 수치와 나란히 놓고 봐야 할 수치다. 커버리지를 보상하는 전반적 정확성 검사는 답변이 길수록 통과하기 더 쉽고, 15.3점 상승분의 일부는 검색 계층이 모델 앞에 더 많은 자료를 갖다 놓은 덕분일 가능성이 크다. 이것은 그 결과에 대한 비판이 아니다 — 참조 사례를 24% 더 찾아낸 것은 별도로 명시된 실질적인 개선이다 — 다만 이는 종합 수치와 검색 수치를 종합 수치만 따로 보지 말고 함께 읽어야 한다는 뜻이다.
비공개 분할 문제가 더 큰 문제다. OpenAI가 보유하고 공개하지 않는 검증 세트는 누구도 다시 실행할 수 없으며, 같은 벤치마크의 공개 리더보드는 더 밋밋한 이야기를 들려준다: Vals AI의 자체 비교 페이지에는 GPT-6 Astra가 Legal Research Bench에서 39.42% ±3.40, Gemini 3.8 Flash가 38.94% ±3.39로 나와 있다. 54.0%로의 도약을 만들어낸 무엇이든 공개 보드에서는 보이지 않는데, 공개 보드는 법률 인덱스가 붙지 않은 기본 모델을 채점하고 있기 때문이다.

Legora 타이아웃, 그리고 그 안의 숫자
출시 관련 보도에서 가장 실질적인 제3자 근거는 Legora의 워크플로 테스트로, Legora의 법률 엔지니어 Percevale Perks가 재무제표 대사(tie-out) — 즉 작성 중인 계정 초안 수치를 시산표, 연결 스케줄, 전년도 계정과 대조하는 작업 — 를 수행했습니다. Legora의 에이전트는 단 한 번의 실행으로 41개 문서에 걸친 대사를 몇 분 만에 완료했고, 각 검증 항목을 기록하며 검토용 항목별 보고서를 생성했습니다. 이 에이전트는 Legora가 계정에 심어둔 네 가지 오류를 모두 찾아냈는데, 여기에는 매출 주석에 숨겨진 50만 파운드(£500,000)의 차액도 포함되며, 이전 모델이 통과시킨 모든 검증 항목을 그대로 유지하면서 약 50개를 추가로 더했습니다.
그것은 정말로 어려운 문서 세트에서 정말로 좋은 결과입니다. 또한 전체 출시 주기에서 가장 유용한 수치가 묻혀 있는 곳이기도 합니다. 실제 엔드투엔드 법률 업무를 포괄하는 Legora의 Benchmark for Agentic Reasoning에서 재무제표 워크플로우의 개선은 약 40%였고, 모든 BAR 작업의 평균 개선은 약 3%였습니다. 두 수치 모두 Legora의 것이고, 둘 다 같은 모델을 설명하며, 그중 하나만 퍼졌습니다. 로펌을 위해 이것을 평가하고 있다면, 3%는 계획을 세울 때 기준으로 삼아야 할 수치이고 40%는 기대해 볼 수 있는 수치입니다.
독립적인 테스트는 다른 실패 모드를 가리킨다
독립적인 평가 두 건은 출시 수치와 나란히 놓고 볼 만하다. 다만 두 평가 모두 규모가 작고 출처가 단일하다는 점을 전제로 깔아야 한다.
HAQQ는 GPT-6 Astra를 20개 법률 실무 분야에 걸친 41개의 실제 법률 질문에 중간 추론으로 실행했습니다. Astra는 법률적 실질 내용에서 20점 만점에 17.63점으로 앞섰습니다 — 1점 미만 차이였습니다. 답변당 비용은 $0.2622였는데, 이는 종합 점수 1점 미만의 향상을 위해 GPT-5.6 Luna Pro의 답변당 비용의 약 11배에 해당합니다. HAQQ 자체의 해석은 날카롭습니다: 이점은 모델이 더 똑똑하다는 데 있는 것이 아니라, 모델이 글쓰기를 멈춘다는 데 있습니다. 같은 테스트에서 추론 노력을 낮음에서 높음으로 전환하면 비용은 약 1.5배, 지연 시간은 약 1.8배로 늘어난 반면 판정 품질은 0.17점 낮아지는 것으로 나타났습니다 — 품질 레버로 위장한 비용 레버이며, 노력 설정을 최대로 두기보다 고정해 둘 이유입니다.
가장 멀리 퍼져야 할 발견은 비용에 관한 것이 아니다. 미국 외 관할권 전반에서, 테스트된 세 모델 모두 올바른 조항을 인용하면서도 그 내용을 잘못 진술했다. Astra는 해당 항목의 66.7%에서 법적으로 정확했고, Claude Opus 5는 100% 정확했다. 인용 검사기는 그 답변을 통과시킨다. 인용이 존재하고 올바른 인용이기 때문이다. 의뢰인은 그렇지 않다. 이것은 법률 검색 인덱스가 가장 대처하기 어려운 실패 유형이다. 인덱스는 미국 전용이고, 오류는 검색이 아니라 읽기에 있기 때문이다.
실제로 얻을 수 있는 것, 그리고 언제
Astra for Law는 일반적으로 제공되지 않습니다. 접근은 Am Law 200 로펌을 대상으로 하는 새로운 Trusted Access 프로그램을 통해 시작되며, ChatGPT와 Codex를 통해 제공됩니다. API는 모델 ID gpt-6-astra-law로 곧 출시될 예정이라고 설명되어 있으며, 모델 선택기에서는 "GPT-6 Astra Law"로 표시됩니다. Harvey와 Legora는 이를 기반으로 구축할 API 고객으로 명시되어 있습니다. 법률 구성의 가격은 공개되지 않았으며, 이는 이와 관련해 예산을 책정하려는 모든 사람에게 가장 큰 미해결 질문입니다.
Trusted Access에는 두 가지 데이터 조건이 있다: API에서의 Zero Data Retention, 그리고 기본적으로 ChatGPT Enterprise 사용을 인간 검토에서 제외하는 것이다. 브리핑에서 예외에 관해 질문을 받았을 때, Boehmig는 그 정책이 절대적이라고 주장하지 않았다. "그 한 문장보다 확실히 더 복잡하다"라고 그는 말했으며, 전체 계약서가 약 30페이지에 달한다고 언급하고, OpenAI가 그 30페이지가 요구를 충족한다고 확신한다고 덧붙였다. OpenAI는 정보 권한, 윤리적 장벽, 고객 지침 및 로펌 감독과 관련하여 Latham & Watkins와 협력하고 있다고 말한다.
생태계 부분은 모델 부분보다 더 큽니다. Thomson Reuters, Harvey, Legora, iManage, Relativity, Clio, Intapp, DeepJudge를 포함한 26개의 벤더 플러그인, 법률 엔지니어링 그룹이 만든 9개의 커뮤니티 플러그인, 그리고 법률 파워 유저들이 구축한 47개의 맞춤형 스킬이 있습니다. Word용 ChatGPT도 교정, 수정 제안, 서식 플래그 기능으로 정식 출시되었습니다. 전방 배치된 OpenAI 엔지니어들은 Sullivan & Cromwell과 협력해 계약서 분석기를, Ropes & Gray와는 M&A 실사를, Cooley와는 GO Public을 진행했습니다.
이 분야가 이제 얼마나 붐비는지에 대한 맥락을 말씀드리자면: Anthropic은 2026년 5월에 Claude for Legal을 출시했는데, 이는 Astra for Law가 존재하기 세 달 전이었습니다.
그 페이지의 어떤 벤치마크도 포착하지 못하는 위험
출시 자료 어디에도 로펌의 법무총괄이 가장 먼저 물을 두 가지 거버넌스 질문을 다루는 내용은 없다. 2026년 9월 기준으로 GPT-6 Astra에 대해 공개된 SOC 2, ISO 또는 HIPAA 인증은 없었고, 로펌별 데이터 사일로화, 로컬 배포 또는 데이터 레지던시에 관한 공개된 세부 정보도 없다. 그 부재가 실패의 증거는 아니다 — 그것은 단지 문서화되지 않았을 뿐이며, 이는 다른 문제이고, 비밀특권이 적용되는 자료가 투입되기 전에 로펌이 해결해야 할 문제다.
윤리적 측면에서, 적용되는 규칙은 비밀유지에 관한 ABA 모델 규칙 1.6과 비변호사 보조 업무의 감독에 관한 규칙 5.3입니다. 규칙 1.6은 로펌이 제3자 제공업체와 공유할 수 있는 내용을 규율하며, 업데이트된 고지와 정보에 입각한 동의를 요구할 수 있습니다. 규칙 5.3은 AI 산출물이 적용되는 영역입니다. 두 규칙이 이론이 아니라 실제로 살아 있는 이유는 Mata v. Avianca 사건, 즉 변호사들이 AI가 생성한 존재하지 않는 판례를 제출하여 제재를 받은 사건입니다. 실제 판결문을 대상으로 한 법률 검색 색인은 그 특정 실패가 발생할 가능성을 낮춥니다. 하지만 그것이 불가능하게 만드는 것은 아니며, HAQQ가 문서화한 조항 오독 실패에 대해서는 아무것도 하지 않습니다.
API가 열리기 전에 이걸 기반으로 개발하고 싶다면
오늘날 정직한 입장은 gpt-6-astra-law가 우리를 포함해 누구의 API에도 들어 있지 않다는 것입니다 — OpenAI는 곧 출시될 예정이라고만 밝혔고 날짜는 제시하지 않았습니다. 실제로 제공되는 것은 기본 모델입니다: openai/gpt-6-astra가 OrcaRouter에 0% 마크업으로 올라 있는데, 이는 OpenAI의 공급자 정가가 그대로 전달된다는 뜻이므로 해당 모델의 공급업체 가격이 바뀌면 같은 날 반영됩니다. 키 하나로 200개 이상의 모델에 접근할 수 있으며, 공급자 간 자동 장애 조치와 여러 모델을 하나의 호출로 구성하는 라우팅 DSL도 제공됩니다.

법률 엔지니어링 팀에게 실질적인 결과는 양분입니다. Astra for Law 워크플로에서 Legal Search Index에 의존하지 않는 모든 것 — 제공한 사실로부터 초안 작성, 조항 집합 재구성, 로펌 템플릿에 맞춘 서식 지정, 검토 체크리스트 생성 — 은 오늘 base GPT-6 Astra에서 프로토타입할 수 있으며, law 변형이 출시되면 통합을 변경하지 않고 모델 ID를 교체할 수 있습니다. 인덱스에 의존하는 모든 것은 프로토타입할 수 없습니다. 왜냐하면 인덱스는 아직 판매되지 않은 부분이기 때문입니다. 분명히 밝힐 두 가지 주의 사항이 있습니다: 라우팅된 요청은 OpenAI의 Zero Data Retention 승인에 자동으로 포함되지 않습니다. 이 승인은 조직별로 부여되므로 ZDR이 필요한 로펌은 사용하는 특정 경로에서 적용 범위를 확인해야 합니다. 그리고 라우터는 데이터 경로에 추가 홉이며, 이는 장애 조치를 확보하더라도 특권 자료에 실질적인 비용이 됩니다.
볼 것
판도를 얼마나 바꿀지 순서대로 세 가지가 있습니다. gpt-6-astra-law의 API 날짜입니다. 그것이 파일럿과 제품을 가르는 차이니까요. 가격입니다. 기본 모델의 백만 입력 토큰당 $10, 백만 출력 토큰당 $50에는 272,000 입력 토큰을 넘으면 장문 컨텍스트 재가격이 적용되는데, 법률 문서 세트는 이를 일상적으로 넘어설 것이기 때문입니다. 그리고 법률 구성이 그보다 프리미엄으로 책정된다면, 41개 문서 대조의 경제성은 크게 달라집니다. 그리고 다른 누군가가 통제하는 분할에서 그 200개 질문을 독립적으로 재실행하는 것입니다. 그것이 존재하기 전까지, 54.0%는 OpenAI의 구성에 관한 OpenAI의 숫자이며, 방어 가능한 주장은 더 좁은 것입니다: 미국 판례법 인덱스에 법률 지침을 더하면 미국 법률 연구 질문에서 일반 웹 검색보다 실질적으로 더 나은 검색 결과를 낸다는 것입니다. 그 주장은 행동할 가치가 있습니다. 나머지는 기다릴 가치가 있습니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
