
OpenAI推出面向法律领域的Astra:将法律搜索索引接入GPT-6 Astra
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Astra for Law于2026年9月17日发布——这是一种法律工作配置,建立在GPT-6 Astra之上;后者是该公司两周前、即9月3日推出的旗舰模型。这并不是一个新模型。它是同一套权重,只是换了另一扇前门:一个专用的法律搜索索引、法律专用指令,以及一套面向美国判例法研究的工具。这一区别比发布时的说法所暗示的更为重要,因为公告中的每一个数字衡量的都是该配置相对于基础模型的表现,而非一项新能力——而这个配置几乎承担了全部工作。
核心宣称是,Astra for Law 在 200 个美国法律研究问题上让整体正确性检查的通过率达到 54.0%,这些问题取自 Vals AI 的 Legal Research Bench 私有验证集;相比之下,仅使用网络搜索的 GPT-6 Astra 为 38.7%——按 OpenAI 的说法,这是 40% 的相对提升。这些是供应商在私有划分上报告的数字,尚无独立实验室复现。独立可见的信息更有用:Vals AI 自己的公开对比显示,GPT-6 Astra 在该基准上的成绩为 39.42% ±3.40,这基本上就是 OpenAI 拿来作对比的基线。差距来自法律搜索索引和指令,而不是模型变成了更优秀的律师。
以下是已交付的内容、实际测量到的结果,以及仍然缺失的部分。
Astra for Law 究竟是什么
在 GPT-6 Astra 之上增添了三项内容,其中没有一项是权重改动。在一次媒体简报会上,Jason Boehmig——OpenAI 在 2026 年 6 月聘用的 Ironclad 联合创始人——以及工程师 Sherwin Wu 将此次发布描述为一种配置:领域指令、诸如响应长度之类的设置,以及预计会随时间推移而扩展的法律行业工具。
• 法律检索索引——一个覆盖美国判例法、成文法、法规、法院规则和行政裁决的检索层,收录超过 2.3 亿个网址,且每日新增来源。
• 语料来源——该索引的数据来自 CourtListener,这是由非营利机构 Free Law Project 维护的文库,OpenAI 称其覆盖了超过 99.9% 已公布的美国先例性判例法。它补充了来自汤森路透等提供商的授权内容。
• 法律指令——一套领域指令,用于将研究应用于事实、构建论点或交易条款,并揭示某一立场中的弱点或不确定之处。

简报中的演示是具体的,而非抽象的:吴为一家面临残疾歧视与报复索赔的医院起草了一份驳回动议,在一个节假日周末处理了一起股东对资产出售的质疑,还应对了一起销售承诺纠纷。这些都不是前沿模型的新能力。新之处在于,这项工作中检索的那一半不再经由通用网络搜索来完成。
基准,请仔细阅读
这次发布带来了四个数字,全部归因于 OpenAI,全部基于同一个私有验证集,而且都值得彼此区分开来:
• 整体正确率——在最高推理强度下,Astra for Law 为 54.0%,而配合网络搜索的 GPT-6 Astra 为 38.7%。
• 找到参考案例——在侧重判例法的问题上多出 24%,同样是在最高推理强度下。
• 检索到的相关段落——在与基线相同的推理投入下,来自正确法院意见的相关内容最多可增加54%。
• 答案长度——在所测试的推理设置下,平均大约长两倍。
最后那个数字应当与第一个数字放在一起看。一个奖励覆盖率的整体正确性检查,在答案更长时更容易通过,而 15.3 个百分点的提升中,有一部分很可能只是因为检索层把更多材料摆在了模型面前。这并不是对结果提出批评——多找到 24% 的参考案例是一项真实的、单独说明的改进——但这确实意味着,综合数字和检索数字应当放在一起解读,而不是只看综合数字。
私有划分问题才是更大的问题。OpenAI 持有且不公开发布的验证集,任何人都无法重新运行,而同一基准的公开排行榜呈现的却是更平淡的图景:Vals AI 自己的对比页面列出 GPT-6 Astra 在 Legal Research Bench 上为 39.42% ±3.40,Gemini 3.8 Flash 为 38.94% ±3.39。无论是什么带来了跃升至 54.0%,在公开榜单上都看不到,因为公开榜单评分的是未附加法律索引的基础模型。

Legora 核对,以及其中的数字
发布报道中最具实质性的第三方证据,来自 Legora 的一项工作流测试。该公司的法律工程师 Percevale Perks 进行了一次财务报表勾稽核对——将草拟账目数据与试算平衡表、合并明细表及上年度账目进行比对。Legora 的智能体在单次运行中、短短几分钟内便完成了横跨 41 份文件的核对,记录下每一项核查,并生成逐行记录以供审查。它找出了 Legora 植入账目中的全部四处错误,包括隐藏在收入附注里的一笔 50 万英镑差额,保留了早期模型已通过的所有核查,并新增了约五十项。
在真正困难的文件集上,这是一个真正出色的结果。整个发布周期中最有用的数字也正埋藏于此。在 Legora 的 Benchmark for Agentic Reasoning 上,该基准涵盖真实的端到端法律任务,财务报表工作流的改进约为 40%——而所有 BAR 任务的平均改进约为 3%。这两个数字都来自 Legora,描述的是同一个模型,但只有其中一个得到了传播。如果你是在为一家事务所评估这一点,那么 3% 是应该据以规划的数值,而 40% 是应该寄予厚望的数值。
独立测试指向了一种不同的故障模式
有两项独立评估值得与发布数据并列来看,但需要注意的是,这两项评估规模都很小,且来源单一。
HAQQ 让 GPT-6 Astra 在中等推理强度下,针对 20 个执业领域中的 41 个真实法律问题进行了测试。Astra 在法律实质内容上以 20 分制 17.63 分领先——领先不到 1 分。它每份答案花费 0.2622 美元,约为 GPT-5.6 Luna Pro 每份答案成本的 11 倍,而综合得分增益不到 1 分。HAQQ 自己的解读很犀利:优势不在于模型更聪明,而在于它会停笔。同一项测试发现,把推理强度从低调到高,会让成本提高到约 1.5 倍、延迟提高到约 1.8 倍,同时使评审质量降低 0.17 分——这是一个披着质量杠杆外衣的成本杠杆,也是应当锁定推理强度设置、而不是让它保持在最高的理由。
最应传播得最远的发现并非关于成本。在美国以外的司法辖区,受测的三个模型都引用了正确的条款,却错误陈述了其内容。Astra 在这些条目上的法律正确率为 66.7%;Claude Opus 5 的正确率为 100%。引证检查器会放行这个答案,因为该引证存在且正确。客户则不会。这是法律检索索引最无力应对的失效模式,因为该索引仅限美国,而且错误出在解读,而非检索。
你实际能获得什么,以及何时能获得
Astra for Law 尚未普遍可用。访问首先通过一项面向 Am Law 200 律所的全新 Trusted Access 计划开始,经由 ChatGPT 和 Codex 提供。该 API 被描述为即将推出,模型 ID 为 gpt-6-astra-law,在模型选择器中显示为“GPT-6 Astra Law”;Harvey 和 Legora 被列为将基于它构建的 API 客户。该法律配置的价格尚未公布,这是任何围绕它做预算的人面临的最大未决问题。
Trusted Access 包含两项数据条款:API 上的零数据保留,以及默认将 ChatGPT Enterprise 的使用排除在人工审核之外。在简报会上被问及例外情况时,Boehmig 并未声称该政策是绝对的:“这绝对比那一句话复杂得多,”他说,并指出完整协议约有 30 页,还补充说 OpenAI 相信这 30 页足以满足需求。OpenAI 表示,它正在与 Latham & Watkins 合作,处理信息权限、道德隔离墙、客户指示和律所监督事宜。
生态部分的规模大于模型部分:包括 Thomson Reuters、Harvey、Legora、iManage、Relativity、Clio、Intapp 和 DeepJudge 在内的 26 个供应商插件;来自法律工程社群的 9 个社区插件;以及由法律领域高级用户构建的 47 项自定义技能。ChatGPT for Word 也已正式全面可用,支持校对、建议修改和格式标记。OpenAI 的前置部署工程师与 Sullivan & Cromwell 合作开发了协议分析工具,与 Ropes & Gray 合作开展并购尽职调查,并与 Cooley 合作推进 GO Public 项目。
关于这条赛道如今有多拥挤,可以这样理解背景:Anthropic 于 2026 年 5 月推出了 Claude for Legal,比 Astra for Law 问世早了三个月。
那个页面上没有任何基准能捕捉到的风险
发布材料中没有任何内容回应律所总法律顾问首先会提出的两个治理问题。截至2026年9月,GPT-6 Astra 尚未公布 SOC 2、ISO 或 HIPAA 认证,也没有公开任何关于律所专属数据隔离、本地部署或数据驻留的细节。这种缺失并不能证明其存在缺陷——它只是尚未被记录在案,而这属于另一类问题,需要由律所自身在享有保密特权的材料进入系统之前加以解决。
在伦理方面,实际适用的规则是美国律师协会《示范规则》第1.6条关于保密的规定,它规范律所可与第三方提供商共享哪些信息,并可能要求更新披露和知情同意;以及第5.3条关于对非律师协助的监督,而AI输出正属于这一条的范围。两者之所以是现实问题而非理论问题,原因在于,Mata v. Avianca案中,律师因提交不存在的AI生成案例而受到制裁。基于真实判决意见的法律检索索引会降低这种具体失误发生的可能性。但它并不能使之不可能发生,也无助于解决HAQQ所记录的误读条款失误。
如果你想在 API 开放之前基于此进行开发
今天最诚实的说法是,gpt-6-astra-law 尚未进入任何人的 API,包括我们的——OpenAI 表示即将推出,但未给出日期。真正已上线的是基础模型:openai/gpt-6-astra位于 OrcaRouter,加价 0%,这意味着 OpenAI 的提供商标价原样传递,因此该模型的供应商价格变动会在当天体现。一个密钥可访问 超过 200 个模型,并支持跨提供商自动故障转移,以及用于将多个模型组合为单次调用的路由 DSL。

对法律工程团队而言,实际的后果是一种分化。Astra for Law 工作流中,一切不依赖 Legal Search Index 的部分——根据你提供的事实起草、重构一套条款、按律所模板排版、生成审阅清单——你今天就能在基础版 GPT-6 Astra 上做原型,等法律版本开放时再替换模型 ID,而无需改动你的集成。而一切依赖该索引的部分,你都无法做原型,因为索引正是那部分尚未开售的东西。有两点值得直说:经路由的请求并不自动受 OpenAI 的零数据保留(Zero Data Retention)批准覆盖——该批准是按组织逐一授予的,因此需要 ZDR 的律所应确认其使用的具体路由是否在覆盖范围内;而路由器是数据路径上额外的一跳,即便它能为你换来故障转移,对受特权保护的材料来说这也是实实在在的成本。
看什么
三件事,按它们改变局面的程度排序。gpt-6-astra-law 的 API 日期,因为这决定了它是试点还是产品。价格,因为基础模型每百万输入 token 10 美元、每百万输出 token 50 美元,而对超过 272,000 个输入 token 的部分还有长上下文调价,法律文件集经常会越过这一门槛——而如果法律配置的定价相对于此还有溢价,那么 41 份文件核对的经济性就会发生实质性变化。还有,由别人控制的数据划分上,独立重新运行那 200 个问题。在此之前,54.0% 是 OpenAI 关于 OpenAI 配置给出的数字,而站得住脚的说法是更窄的那个:在美国法律研究问题上,美国判例法索引加上法律指令所产生的检索效果,明显优于通用网络搜索。这个说法值得据此行动。其余的则值得等待。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
