一张生成的 hero 卡片,标题为“Astra for Law 对比 GPT-6 Astra”,副标题为“相同权重——其中一个增加了法律检索索引”,日期行写着“Astra for Law 于 2026 年 9 月 17 日发布 · GPT-6 Astra 于 2026 年 9 月 3 日发布”,上方有两张卡片:左侧为“Astra for Law——法律索引 + 指令,价格未披露”,右侧为“GPT-6 Astra——网络搜索,每 1M 输入 $10 / 输出 $50”,页脚为“厂商数据未经复现;GPT-6 Astra 公开榜单得分依据 Vals AI。”,右下角合成有 OrcaRouter 标志。
Guides & Insights

Astra for Law 与 GPT-6 Astra:相同权重,多一个搜索索引

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Astra for LawGPT-6 Astra并不是两个模型,而把这一选择框定为正面交锋,是首先要搞对的事情。Astra for Law 就是 GPT-6 Astra,只是在其检索路径上外挂了一个美国法律检索索引,叠加了一套法律起草指令,并附带了法律工具。权重完全相同。所以,真正的问题不是哪个模型更聪明——而是法律检索索引是否值得为此支付溢价;而从目前可获得的证据来看,答案几乎完全取决于你的工作是判例法检索还是文档审阅。

这一点之所以重要,是因为 OpenAI 尚未公布该法律配置的价格,其对应的 API 并未开放,而唯一一项与基础模型的直接对比测量,是 OpenAI 自己在私有验证集上得出的。本页将梳理目前实际已知的情况、独立数据所说明的内容,以及某项具体的法律工作负载究竟属于这一比较的哪一侧。

那么,确切地说,是什么区分了它们

新增了三样东西,而它们并非同样难以复制。

法律检索索引——对美国判例法、成文法、法规、法院规则和行政裁决进行检索,收录超过 2.3 亿个 URL,数据源每日更新。这正是无法仅靠一句提示词构建出来的部分。

Corpus——基于 CourtListener 构建,这是 Free Law Project 的文库,涵盖超过 99.9% 已公布的美国具有先例效力的判例法,并辅以来自 Thomson Reuters 等提供商的授权内容。公开部分免费;授权部分和每日更新则并非单个律所能够复现的。

指令与设置——法律分析和法律写作方面的指令,以及诸如回复长度之类的设置。这些属于提示词层面和配置层面。如今,一支称职的法律工程团队可以基于基础模型近似复现其中相当可观的一部分。

A generated two-column scoreboard titled 'Astra for Law vs GPT-6 Astra — the scoreboard'. Left column 'Astra for Law' rows: 'Retrieval: Legal Search Index, 230M+ URLs', 'Instructions: legal-specific', 'Headline score: 54.0% vendor-reported', 'Availability: Trusted Access, Am Law 200', 'API model id: gpt-6-astra-law, coming soon', 'Price: not disclosed'. Right column 'GPT-6 Astra' rows: 'Retrieval: general web search', 'Instructions: general', 'Public board score: 39.42% on Vals AI', 'Availability: generally available now', 'API model id: gpt-6-astra', 'Price: $10.00 in / $50.00 out per 1M'. Footer reads 'Astra for Law figures OpenAI-reported on a private split; GPT-6 Astra public board figure per Vals AI.', with the OrcaRouter logo composited in the bottom-right corner.

单就 GPT-6 Astra 而言,检索通过通用网络搜索完成。这就是研究路径上的全部差异,也是下文每个数字所衡量的轴心。

唯一存在的正面对决

OpenAI 在 Vals AI 法律研究基准私有验证集中的 200 道美国法律研究问题上对双方进行了测试。在最高推理强度下,Astra for Law 在 54.0% 的问题上通过了整体正确性检查,而带网络搜索的 GPT-6 Astra 为 38.7%——相差 15.3 个百分点,被称为 40% 的相对提升。同一轮运行的支撑数据:在判例法问题上多找到 24% 的参考案例,在同等推理强度下从正确法院意见中检索到的相关段落最多多出 54%,答案平均长度约为两倍。

这些数字应当附带三点告诫,但没有哪一点足以成为否定它们的理由。第一,它们是 OpenAI 的数据,基于 OpenAI 自行持有的数据划分,且没有任何独立方复现过。第二,答案长度翻倍这一点值得与综合得分并置来看,因为一个奖励覆盖面的正确性检查,用更长的答案就更容易通过——检索数据(多出 24% 的案件、54% 的段落)才更能说明该索引实际带来了什么。第三,同一基准的公开版本并未显示出这一跃升:Vals AI 自己的对比页面列出 GPT-6 Astra 在 Legal Research Bench 上为 39.42% ±3.40,而 Gemini 3.8 Flash 为 38.94% ±3.39。那是未使用该索引的基础模型,其表现基本落在 OpenAI 基线所在的位置。

A screenshot of the Vals AI 'Compare Models' leaderboard captured September 18, 2026, comparing Gemini 3.8 Flash and GPT-6 Astra: Legal Research Bench (Agentic US legal research) shows Gemini 3.8 Flash 38.94% ±3.39 against GPT-6 Astra 39.42% ±3.40; Vals Index shows 62.25% against 66.61%; and the table also lists Finance Agent (V2) 61.44% vs 53.54%, Tax Agent Bench 66.77% vs 63.34%, MedCode 48.13% vs 48.49%, Terminal-Bench Science 8.57% vs 65.71%, Code Migration 36.55% vs 67.74%, Terminal-Bench 4.0 13.13% vs 57.07% and Vibe Code Bench v1.1 78.65% vs 89.59%, with a Vals Index date of 2026-09-11.

两项独立解读使情况进一步复杂化。Legora 一次运行对 41 份文件进行了财务报表勾稽核对,并发现了全部四处预设错误,包括收入附注中 50 万英镑的缺口,还补上了早先模型漏掉的约 50 项检查——在该工作流上提升了约 40%。然而,在 Legora 的智能体推理基准(Benchmark for Agentic Reasoning)总体评测中,所有任务的平均提升约为 3%。与此同时,HAQQ 覆盖 20 个执业领域的 41 题测试显示,Astra 在法律实质内容上的得分为 20 分中的 17.63 分,对更便宜模型的领先优势不到 1 分,而每条回答成本为 0.2622 美元。综合来看,诚实的总结是:该配置的优势在检索密集型的美国判例法工作中显著且可复现,在一般法律推理上则很微弱,而在非美国法律上基本未经检验——同一测试发现,三个模型都引用了正确条款,却错误陈述了其内容。

Astra for Law 没有公布价格。GPT-6 Astra 的价目表是公开的,而这一数字正是比较所必须依据的基准,因为法律版配置不过是同一模型外加检索,其费用不可能低于它所封装的模型。

标准 — 每百万输入 token 10.00 美元,每百万输出 token 50.00 美元。

缓存输入 — 每百万 1.00 美元,90% 的折扣,对于重复使用常备指令和先例范本的事务所而言,这是最为关键的杠杆。

缓存写入 — 每百万 $12.50,按未缓存输入费率的 1.25 倍计费;从第二次复用起,缓存便开始回本。

输入 token 超过 272,000——输入和缓存费率为 2 倍、输出费率为 1.5 倍,且适用于{{4}}整个请求{{/4}}{{5}},而不仅仅是超过阈值的那些 token。实际上,这意味着任何长请求的输入费用为每百万 $20.00、输出费用为每百万 $75.00。{{/5}}整个请求,而不仅仅是超过阈值的那些 token。实际上,这意味着任何长请求的输入费用为每百万 $20.00、输出费用为每百万 $75.00。

批量 — 标准版的 50%。快速模式 — 标准版的 2 倍,且不适用于采用欧盟数据驻留的 GPT-6 Astra。

272K 这个阈值不是这次比较的脚注,而是它的核心。一份 41 份文件的核对、一整套证词笔录,或一个跨多年的交易案卷,都会经常超过 272,000 个 token,这意味着现实中的法律费率是长上下文那一档——输入 $20.00、输出 $75.00——而不是标题上的 $10/$50。对于正在评估试点的律所来说,这两档之间的差异,就是一个能放进预算的项目和一个放不进预算的项目之间的差异,这也是一个理由:在承诺之前,而不是之后,先衡量你每个事项的实际 token 用量。

独立测试中的另外两条成本说明。HAQQ 在 Astra 上测得的每次回答成本为 $0.2622,大约是基于 GPT-5.6 Luna Pro 的每次回答成本的十一倍,而综合增益不到一个点——但也指出,这一差距部分是因为 Astra 写出的 token 比 Claude Opus 5 少约 3.5×,使其在该工作负载下每次回答比 Opus 5 更便宜。同一项测试还发现,推理努力程度旋钮表现为成本杠杆,而非质量杠杆:从低到高会使成本变为约 1.5 倍、延迟变为约 1.8 倍,而评判质量下降了 0.17 分。请锁定推理努力程度设置;不要默认将其留在最大值。

当基础款是更值得买的选择时

支持 GPT-6 Astra 的理由比发布时的表述所暗示的更为充分,而这基于三点观察。

• 你的工作不是美国判例法检索。该索引仅限美国。对于合同起草、条款重构、案件受理、时间线构建,或总结你手头已有的文件,Astra for Law 所增添的东西基本上不起作用。

• 你已经在为一手法律研究付费。一家拥有 Westlaw 或 LexisNexis 订阅的律所,如果还为一个无法审计的检索层支付溢价,那就是在为同样的判例覆盖范围付两次钱。

• 你希望拥有自己掌控的检索路径。将精心筛选的文档集输入基础版 GPT-6 Astra,可获得可检查的引用溯源,并且不依赖供应商的索引刷新。

有第三方证据表明,基础模型并非薄弱环节。在 Mercor 的 APEX-Agents 企业律师排行榜上,一个 GPT-6 Astra 配置在 160 项任务中取得了 73.4% 的 Pass@1——这是法律智能体工作负载上的第三方结果,与 Legora 在其自有基准测试套件中测得的平均 3% 提升并列。这两个数字都与搜索索引无关,并且都表明底层模型已经承担了大部分法律工作。

当配置足以支撑其溢价

Astra for Law 的适用理由更窄,但在其适用之处,则具有决定性。如果你的工作任务是查找并适用美国法律权威——构建一份书状的判例清单、核查某一主张能否在一系列判决中依然成立、开展五十州监管调查——那么多出 24% 的参考案例、最多多出 54% 的相关段落,就不是边际改进,而是一个会遗漏权威的助手与一个不会遗漏权威的助手之间的差别。Legora 的 tie-out 核对是同一效应作用于文档而非判例法的最佳例证:一次性交叉引用 41 份文件,正是那种长上下文、大批量的比对工作,此时更多检索到的上下文会产生累积放大效应。

对二者而言,必须坦诚说明的是:定价未披露,访问权限仅通过 Trusted Access 计划向 Am Law 200 律所开放,而且没有任何独立实验室重新进行过这项头对头测试。现在却要你仅凭一份供应商基准测试和一位合伙人的工作流测试,就承诺支付溢价。

将两者都通过一个端点运行

这里的路由问题是一个排序问题,而不是一个选择题。gpt-6-astra-law 目前尚未接入任何 API,包括我们自己的——OpenAI 表示即将推出,但未给出具体日期——所以今天这场对比中,你真正能调用的只有基础模型这一半。目前可用的是 openai/gpt-6-astra,在 OrcaRouter 上以 0% 加价提供,供应商的标价原样传递,因此上表中的 $10/$50 和 $20/$75 就是你实际支付的价格,供应商调价也会在同一天生效。超过 200 个模型共用一个密钥,并可跨供应商自动故障转移。

A screenshot of the OrcaRouter catalogue page for GPT-6 Astra, captured September 18, 2026, showing the listing openai/gpt-6-astra from provider OpenAI with a 1M token context, 128K max output, input of text + image + file with text output, p50 time to first token of 6.01 s and p95 of 10.00 s, $10.00 input and $50.00 output per 1M tokens, 162.0M tokens of routed traffic over seven days, and an OpenAI-compatible Python sample using base_url https://api.orcarouter.ai/v1.

路由 DSL 正是映射到这一具体决策的部分。由于两个产品之间的差异在于一个检索步骤,你可以自行组合它——在一次调用中用你自己的文档检索来路由基础模型,并将输出与仅通过网页搜索发送的同一问题进行比较。这是一种低成本的方法,可在你决定采用有访问门槛的高级产品之前,衡量你自己的语料库能复现 54.0% 对 38.7% 这一差距中的多少。模型融合——在一个提示词上运行一组模型——覆盖了另一半:如果你担心的是单个模型会误读某项条款,正如 HAQQ 在非美国法律上发现的那样,那么模型面板会暴露分歧,而不是将其隐藏。由于路由让双方共用一个密钥,当 gpt-6-astra-law 开放时切换模型 ID 只是配置变更,而不是重新集成。

有一点值得明说,而不是被埋没:经路由转发的请求并不会自动被 OpenAI 的零数据保留(ZDR)批准所覆盖,因为该批准是按组织授予的,因此需要 ZDR 的企业应确认其所用路由是否在覆盖范围内。而路由器是数据路径上多出的一跳——对于特权材料而言,这是实实在在的代价,即便它能换来故障转移。

这将如何收场

如果你今天就要做选择,那就选基础模型。Astra for Law 目前还买不到,其溢价未知,而独立证据表明,GPT-6 Astra 在没有该索引的情况下,已经在法律智能体工作负载上表现出高水平。现在就在 openai/gpt-6-astra 上构建,衡量你自己的检索差距,并让 token 核算告诉你,你跨越 272K 的频率是否高到需要在意长上下文这一行。

然后,在已知三件事时再重新审视:gpt-6-astra-law 的价格、其 API 条款的形式,以及在由 OpenAI 之外的某方掌控的数据划分上,独立重跑那场 200 题正面对比。如果价格落在基础费率附近,而且检索增益在 OpenAI 的验证集之外依然成立,那么该配置就会成为美国研究密集型工作显而易见的默认选择,而基础模型仍适用于其他所有情况。在那之前,站得住脚的说法是更窄的那个——美国判例法索引加上法律指令,在美国法律问题上的检索效果显著优于通用网络搜索。这值得为此付一些钱。付多少仍是一个未决问题。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新