
Astra for Law vs GPT-6 Astra: 동일한 가중치, 추가 검색 인덱스 하나
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Astra for Law와 GPT-6 Astra는 두 개의 모델이 아니며, 이 선택을 맞대결로 규정하는 것이 가장 먼저 제대로 짚어야 할 점이다. Astra for Law는 검색 경로에 미국 법률 검색 색인을 결합하고, 그 위에 일련의 법률 초안 작성 지침을 얹고, 법률 도구를 덧붙인 GPT-6 Astra다. 가중치는 동일하다. 따라서 진짜 질문은 어느 모델이 더 똑똑한가가 아니라, 법률 검색 색인에 프리미엄을 지불할 가치가 있는지이며, 지금까지 입수된 증거로 볼 때 그 답은 당신의 업무가 판례 검색인지 문서 검토인지에 거의 전적으로 달려 있다.
그것이 중요한 이유는 OpenAI가 법률용 구성에 대한 가격을 공개하지 않았고, 이를 위한 API도 공개되어 있지 않으며, 기본 모델과의 유일한 직접 비교 측정은 OpenAI 자체가 비공개 검증 세트에서 수행한 것에서 비롯되기 때문입니다. 이 페이지에서는 실제로 알려진 내용, 독립적인 수치가 말하는 바, 그리고 주어진 법률 워크로드가 비교의 어느 쪽에 속하는지를 하나씩 살펴봅니다.
정확히 무엇이 그들을 구분하는가
세 가지가 추가되었는데, 그것들이 모두 똑같이 복제하기 어려운 것은 아닙니다.
• 법률 검색 인덱스 — 미국 판례법, 법령, 규정, 법원 규칙 및 행정 결정에 대한 검색, 2억 3천만 개 이상의 URL, 매일 추가되는 소스. 이것은 프롬프트로는 구축할 수 없는 부분입니다.
• 코퍼스 — 미국에서 출판된 선례 판례법의 99.9% 이상을 포괄하는 Free Law Project의 라이브러리인 CourtListener를 기반으로 구축되었으며, Thomson Reuters를 비롯한 제공업체의 라이선스 콘텐츠로 보완됩니다. 공개된 절반은 무료이지만, 라이선스가 적용된 절반과 매일 이루어지는 갱신은 개별 로펌이 재현할 수 있는 것이 아닙니다.
• 지침 및 설정 — 법률 분석 및 법률 문서 작성 지침, 그리고 응답 길이와 같은 설정입니다. 이들은 프롬프트 수준과 구성 수준에 해당합니다. 유능한 법률 엔지니어링 팀이라면 오늘날 기본 모델을 상대로 이들 중 상당 부분을 근사할 수 있습니다.

GPT-6 Astra 단독에서는 검색이 일반 웹 검색을 통해 이루어집니다. 그것이 리서치 경로에서의 차이 전부이며, 아래의 모든 수치가 측정하고 있는 축입니다.
현존하는 유일한 맞대결
OpenAI는 Vals AI의 Legal Research Bench 비공개 검증 세트에서 가져온 200개의 미국 법률 연구 질문에 대해 양쪽을 테스트했습니다. 최고 추론 노력에서 Astra for Law는 전체 정확성 검사에서 질문의 54.0%를 통과했으며, 웹 검색을 사용한 GPT-6 Astra는 38.7%를 기록했습니다 — 15.3포인트 차이로, 40%의 상대적 개선이라고 설명됩니다. 동일 실행에서 나온 뒷받침 수치: 판례 질문에서 24% 더 많은 참조 사례를 찾았고, 동일한 추론 노력에서 올바른 법원 의견에서 최대 54% 더 많은 관련 구절을 검색했으며, 답변 길이는 평균 약 두 배였습니다.
그 수치들에는 세 가지 주의가 따라붙어야 하며, 그중 어느 것도 이 수치를 일축할 이유는 아니다. 첫째, 이는 OpenAI가 보유한 분할에 대한 OpenAI 자체 수치이며, 이를 독립적으로 재현한 곳은 없다. 둘째, 두 배로 늘어난 답변 길이는 종합 점수와 나란히 두고 볼 가치가 있다. 커버리지를 보상하는 정확성 검사는 답변이 길수록 통과하기 더 쉽기 때문이다. 검색 수치(사례 24% 증가, 구절 54% 증가)가 인덱스가 실제로 무엇을 더하는지 보여주는 더 깔끔한 증거다. 셋째, 같은 벤치마크의 공개 버전에서는 그 도약이 나타나지 않는다. Vals AI 자체 비교 페이지에는 Legal Research Bench에서 GPT-6 Astra가 39.42% ±3.40, Gemini 3.8 Flash가 38.94% ±3.39로 기재되어 있다. 이는 인덱스가 없는 기본 모델이 사실상 OpenAI의 베이스라인이 위치한 곳에 자리 잡은 셈이다.

두 가지 독립적인 해석은 상황을 더욱 복잡하게 만든다. Legora는 41개 문서에 걸쳐 한 번에 재무제표 대사(tie-out)를 수행해 매출 주석의 £500,000 차액을 포함하여 심어놓은 네 가지 오류를 모두 찾아냈고, 이전 모델이 놓쳤던 약 50개의 검사를 추가로 수행했다 — 해당 워크플로에서 약 40% 개선이다. 그러나 Legora의 Benchmark for Agentic Reasoning 전체에서는 모든 작업에 걸친 평균 개선율이 약 3%였다. 한편 20개 실무 영역에 걸친 HAQQ의 41문항 테스트에서 Astra는 법적 실질(legal-substance) 부문에서 20점 만점에 17.63점을 기록했는데, 이는 더 저렴한 모델들을 1점 미만 차이로 앞선 것이었고, 답변당 비용은 $0.2622였다. 이 두 결과를 함께 읽으면, 솔직한 요약은 이 구성의 우위가 검색 비중이 높은 미국 판례법 작업에서는 크고 반복 가능하지만, 일반 법률 추론에서는 빈약하고, 비미국법에서는 대체로 검증되지 않았다는 것이다 — 같은 테스트에서 세 모델 모두 올바른 조항을 인용하면서도 그 조항이 말하는 내용을 잘못 진술한 곳이 바로 비미국법이다.
각 측이 법적 답변당 실제로 지불하는 비용
Astra for Law는 공개된 가격이 없습니다. GPT-6 Astra의 요금표는 공개되어 있으며, 비교는 바로 이 수치를 토대로 이루어져야 합니다. 법률용 구성은 동일한 모델에 검색 기능을 더한 것이므로, 자기가 감싸고 있는 모델보다 더 저렴할 수는 없기 때문입니다.
• 스탠다드 — 입력 토큰 100만 개당 $10.00, 출력 토큰 100만 개당 $50.00.
• 캐시된 입력 — 백만 개당 $1.00, 90% 할인, 그리고 상시 지침과 선례 표준 문구를 재사용하는 로펌에 가장 중요한 지렛대입니다.
• 캐시 쓰기 — 백만 개당 $12.50이며, 캐시되지 않은 입력 요율의 1.25배로 청구됩니다. 캐싱은 두 번째 재사용부터 이득을 봅니다.
• 272,000 입력 토큰 초과 — 입력 및 캐시 요율은 2배, 출력 요율은 1.5배가 적용되며, 대상은 전체 요청입니다. 임계값을 초과한 토큰에만 적용되는 것이 아닙니다. 실제로 이는 모든 장문 요청에 대해 백만 개당 입력 $20.00, 출력 $75.00를 의미합니다.
• 배치 — Standard의 50%. Fast 모드 — Standard의 2배이며, EU 데이터 레지던시를 사용하는 GPT-6 Astra에서는 사용할 수 없습니다.
그 272K 임계값은 이 비교에서 각주가 아닙니다. 그것이 바로 비교의 핵심입니다. 41개 문서 대조 검증, 전체 증언록 세트, 또는 수년간의 거래 파일은 일상적으로 272,000 토큰을 넘으며, 이는 현실적인 법률 요금이 롱컨텍스트 행, 즉 입력 $20.00와 출력 $75.00이지, 헤드라인 요금인 $10/$50이 아니라는 뜻입니다. 파일럿 규모를 산정하는 로펌에게 이 두 행의 차이는 예산에 맞는 프로젝트와 그렇지 않은 프로젝트의 차이이며, 이는 약정을 마친 뒤가 아니라 마치기 전에 사안별 실제 토큰 분량을 측정해야 하는 이유입니다.
독립 테스트에서 나온 비용 관련 메모가 두 가지 더 있습니다. HAQQ는 Astra에서 답변당 $0.2622를 측정했는데, 이는 1점 미만의 종합 이득을 얻는 대가로 GPT-5.6 Luna Pro의 답변당 비용의 약 11배에 해당합니다. 다만 그 격차는 부분적으로 Astra가 Claude Opus 5보다 토큰을 약 3.5배 적게 써서 해당 워크로드에서는 Opus 5보다 답변당 더 저렴하다는 점도 언급했습니다. 그리고 같은 테스트에서는 추론 노력 다이얼이 품질 레버가 아니라 비용 레버로 작동한다는 점을 발견했습니다. 낮음에서 높음으로 올리면 비용은 약 1.5배, 지연 시간은 약 1.8배로 늘어난 반면, 판정된 품질은 0.17점 떨어졌습니다. 추론 노력 설정을 고정하세요. 기본값으로 최대로 남겨두지 마세요.
기본 모델이 더 나은 선택일 때
GPT-6 Astra 단독에 대한 논거는 출시 당시의 프레이밍이 시사하는 것보다 더 강력하며, 이는 세 가지 관찰에 근거한다.
• 당신의 업무는 미국 판례 검색이 아닙니다. 인덱스는 미국 전용입니다. 계약 초안 작성, 조항 재구성, 인테이크, 연대기 작성, 또는 이미 손에 들고 있는 문서를 요약하는 작업에서 Astra for Law가 더해 주는 것은 대체로 무용지물입니다.
• 귀사는 이미 1차 법률 리서치 비용을 지불하고 있습니다. Westlaw나 LexisNexis를 구독하는 로펌이 감사할 수 없는 검색 계층에 프리미엄까지 지불한다면, 동일한 판례 커버리지를 두 번 구매하는 것입니다.
• 직접 통제하는 검색 경로를 원하시는 경우. 선별된 문서 세트를 기본 GPT-6 Astra에 투입하면 검증 가능한 인용 출처가 확보되며, 공급업체의 인덱스 갱신에 의존할 필요가 없습니다.
기반 모델이 약한 고리가 아니라는 제3자 증거가 있습니다. Mercor의 APEX-Agents 기업법 변호사 리더보드에서 GPT-6 Astra 구성은 160개 과제에서 Pass@1 73.4%를 기록했습니다. 이는 법률 에이전트 워크로드에 대한 제3자 결과이며, Legora가 자체 벤치마크 제품군 전반에서 측정한 평균 3% 향상과 나란히 놓입니다. 두 수치 모두 검색 인덱스에 관한 것이 아니며, 둘 다 기반 모델이 이미 대부분의 법률 작업을 수행하고 있음을 시사합니다.
구성이 그만한 프리미엄 가치를 입증할 때
Astra for Law를 선택할 근거는 더 좁은 범위에 있지만, 해당되는 경우에는 결정적입니다. 귀하의 업무가 미국 법적 근거를 찾아 적용하는 일 — 변론서의 판례 목록을 작성하고, 어떤 주장이 일련의 판결에서 살아남는지 확인하고, 50개 주 규제 조사를 수행하는 일 — 이라면, 참조 판례가 24% 더 많고 관련 구절이 최대 54% 더 많다는 것은 한계적 개선이 아니라, 법적 근거를 놓치는 어시스턴트와 그렇지 않은 어시스턴트의 차이입니다. Legora tie-out은 판례가 아닌 문서에 나타나는 동일한 효과를 보여 주는 현재 입수 가능한 최선의 예시입니다. 한 번에 41개 파일을 상호 참조하는 것은 바로 더 많은 검색 컨텍스트가 복리 효과를 내는 장문맥·대용량 비교 작업입니다.
두 가지 모두에 대한 솔직한 단서: 가격은 공개되지 않았고, 접근은 Trusted Access 프로그램을 통해 Am Law 200 로펌으로 제한되며, 어떤 독립 연구소도 이 직접 비교를 다시 실행하지 않았습니다. 귀하는 벤더 벤치마크와 한 파트너의 워크플로 테스트만을 근거로 프리미엄 지불을 확약하라는 요구를 받고 있습니다.
둘 다 하나의 엔드포인트를 통해 실행하기
여기서 라우팅 질문은 선택이라기보다 순서 문제입니다. gpt-6-astra-law는 아직 어떤 API에도 없습니다. 우리 것도 포함해서요 — OpenAI는 곧 출시된다고 했을 뿐 날짜는 밝히지 않았습니다 — 그래서 오늘 이 비교에서 실제로 호출할 수 있는 한쪽은 기본 모델뿐입니다. 지금 사용 가능한 것은 openai/gpt-6-astra가 OrcaRouter에서 0% 마크업으로 제공되며, 제공업체의 정가가 변경 없이 그대로 전달되므로 위의 $10/$50 및 $20/$75 행이 지불하는 금액이고 공급업체 가격 변경이 같은 날 반영됩니다. 200개 이상의 모델이 하나의 키로 이용 가능하며, 제공업체 간 자동 페일오버를 지원합니다.

라우팅 DSL은 바로 이 특정 결정에 대응하는 부분이다. 두 제품 사이의 차이가 검색 단계이기 때문에, 이를 직접 구성할 수 있다. 즉 한 번의 호출에서 기본 모델을 자체 문서 검색과 함께 라우팅하고, 그 출력을 웹 검색만 사용해 보낸 동일한 질문과 비교하면 된다. 이는 54.0% 대 38.7% 격차 중 얼마나 많은 부분을 자체 코퍼스가 재현하는지, 게이트가 걸린 프리미엄 제품에 전념하기 전에 측정하는 저렴한 방법이다. 하나의 프롬프트에 여러 모델 패널을 실행하는 모델 퓨전은 나머지 절반을 담당한다. 단일 모델이 조항을 잘못 읽을까 우려된다면, HAQQ가 미국 외 법률에서 발견한 것처럼, 패널은 불일치를 숨기는 대신 드러낸다. 라우팅은 양쪽을 하나의 키에 유지하므로, gpt-6-astra-law가 열릴 때 모델 ID를 바꾸는 것은 재통합이 아니라 구성 변경이다.
묻어두기보다 분명히 짚어둘 만한 주의점이 하나 있습니다. 라우팅된 요청이 OpenAI의 제로 데이터 보존(Zero Data Retention) 승인에 자동으로 포함되는 것은 아닙니다. 이 승인은 조직별로 부여되므로, ZDR이 필요한 회사는 자신이 사용하는 라우트에서 적용 범위를 확인해야 합니다. 그리고 라우터는 데이터 경로에 홉을 하나 더 추가하는 것입니다. 페일오버를 확보해 주더라도 특권 자료에는 실질적인 비용입니다.
이것이 어디로 귀결되는지
오늘 선택해야 한다면, 기본 모델을 선택하세요. Astra for Law는 아직 구매할 수 없고, 그 프리미엄도 알려지지 않았으며, 독립적인 증거에 따르면 GPT-6 Astra는 이미 인덱스 없이도 법률 에이전트 워크로드에서 높은 수준의 성능을 발휘합니다. 지금 openai/gpt-6-astra 위에 구축하고, 자체 검색 격차를 측정한 다음, 토큰 회계가 장문맥 행을 신경 쓸 만큼 272K를 자주 넘는지 알려주도록 하세요.
그런 다음 세 가지가 알려지면 다시 살펴보라: gpt-6-astra-law의 가격, 그 API 약관의 윤곽, 그리고 OpenAI가 아닌 다른 주체가 통제하는 분할에서 200개 질문 일대일 비교를 독립적으로 재실행한 결과. 가격이 기준 요율 근처에 안착하고 검색 이득이 OpenAI의 검증 세트 밖에서도 유지된다면, 그 구성은 미국의 연구 비중이 큰 작업에 명백한 기본값이 되고, 기본 모델은 나머지 모든 용도에 계속 적합하다. 그때까지 방어 가능한 주장은 좁은 것이다 — 미국 판례법 인덱스에 법률 지침을 더한 것이 미국 법률 질문에서 일반 웹 검색보다 실질적으로 더 잘 검색해낸다. 그것은 무언가를 지불할 가치가 있다. 얼마인지는 여전히 미해결 질문이다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
