
推出 Astra for Law:OpenAI 將法律搜尋索引置於 GPT-6 Astra 背後
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Astra for Law於 2026 年 9 月 17 日發布——這是一套法律工作配置,建立於GPT-6 Astra之上;後者是該公司兩週前、於 9 月 3 日推出的旗艦模型。它不是新模型。它是相同的權重,只是換了不同的前門:專用的法律搜尋索引、法律專用指令,以及一套針對美國判例法研究的工具。這個區別比發布框架所暗示的更重要,因為公告中的每個數字都是將該配置與基礎模型相比,而不是衡量一項新能力——而這個配置幾乎完成了所有的工作。
頭條宣稱是,Astra for Law 在 200 個美國法律研究問題中,整體正確性檢查的通過率為 54.0%,這些問題取自 Vals AI 的 Legal Research Bench 私人驗證集;相較之下,GPT-6 Astra 僅使用網路搜尋的通過率為 38.7%——按 OpenAI 的說法,這是 40% 的相對提升。這些是廠商在私人分割集上回報的數字,沒有任何獨立實驗室重現過。獨立可見的部分更有用:Vals AI 自己的公開比較在該基準上列出 GPT-6 Astra 為 39.42% ±3.40,而這基本上就是 OpenAI 用來衡量的基準線。差距來自法律搜尋索引與指令,而不是模型變成了更優秀的律師。
以下是已交付的內容、實際已測量的部分,以及仍然欠缺的部分。
Astra for Law 究竟是什麼
在 GPT-6 Astra 之上額外加入了三樣東西,而它們都不是權重變更。在一場媒體簡報會上,Jason Boehmig——OpenAI 於 2026 年 6 月延攬的 Ironclad 共同創辦人——與工程師 Sherwin Wu 將這次發布描述為領域指令的配置、諸如回覆長度之類的設定,以及預期會隨時間擴充的法律產業工具。
• 法律搜尋索引——一個涵蓋美國判例法、成文法、法規、法院規則與行政裁決的檢索層,收錄超過 2.3 億個網址,且每日新增資料來源。
• 語料來源 — 該索引採用 CourtListener,這是由非營利組織 Free Law Project 維護的資料庫,OpenAI 表示其涵蓋超過 99.9% 已公布的美國具先例效力判例法。它補充了來自 Thomson Reuters 等供應商的授權內容。
• 法律指令——一套領域指令,用於將研究應用於事實、擬定論點或交易條款,並揭示立場中的弱點或不確定性。

簡報中的示範具體而非抽象:吳為一家面臨身心障礙歧視與報復索賠的醫院起草了駁回動議,在一個連假週末處理了股東對資產出售提出的挑戰,並處理了一起銷售承諾糾紛。這些都不是前沿模型的新能力。新的是,這項工作中負責檢索的那一半,不再經由一般網頁搜尋來完成。
這項基準,請仔細閱讀。
四個數字出自這次發布,全都歸因於 OpenAI,全都基於同一個私人驗證集,而且全都值得彼此區分開來:
• 整體正確率 — 在最高推理強度下,Astra for Law 為 54.0%,而搭配網路搜尋的 GPT-6 Astra 則為 38.7%。
• 找到的參考案例 — 在聚焦判例法的問題上多出 24%,同樣是在最高推理強度下。
• 檢索到的相關段落——在與基線相同的推理投入下,從正確的法院意見中最多可多取得 54%。
• 回答長度——在所測試的推理設定下,平均約為兩倍長。
最後那個數字,應該和第一個數字並列來看。獎勵涵蓋範圍的整體正確性檢查,在答案較長時更容易通過,而這 15.3 分的增幅,有一部分很可能是檢索層單純把更多素材放到模型面前所致。這並不是在批評這個結果——多找到 24% 的參考案例,是一項確實存在、且另行陳述的改進——但這確實意味著,應該把綜合數字和檢索數字放在一起解讀,而不是只看綜合數字。
私有分割的問題才是更大的問題。OpenAI 手中持有且未公開的驗證集,任何人都無法重新執行;而同一項基準的公開排行榜則呈現出較為平淡的結果:Vals AI 自家的比較頁面列出 GPT-6 Astra 在 Legal Research Bench 上為 39.42% ±3.40,而 Gemini 3.8 Flash 為 38.94% ±3.39。無論是什麼造成了躍升至 54.0%,在公開排行榜上都看不到,因為公開排行榜評分的是未附掛法律索引的基礎模型。

Legora 的勾稽核對,以及其中的數字
發布報導中最具實質分量的第三方證據,是 Legora 的一項工作流程測試:該公司的法務工程師 Percevale Perks 執行了一次財務報表勾稽核對——將草擬帳目數字與試算表、合併明細表及上年度帳目進行比對。Legora 的代理程式在單次執行中,於數分鐘內完成橫跨 41 份文件的核對,記錄每一項檢查,並產出逐行紀錄供審閱。它找出了 Legora 在帳目中植入的全部四項錯誤,包括隱藏在收入附註中的 50 萬英鎊差額,保留了較早模型已通過的每一項檢查,並新增了約五十項檢查。
這在真正困難的文件集上確實是很好的結果。這裡也埋藏著整個發布週期中最有用的數字。在 Legora 的代理式推理基準(Benchmark for Agentic Reasoning)上——該基準涵蓋真實的端到端法律任務——財務報表工作流程的改善約為 40%,而所有 BAR 任務的平均改善約為 3%。這兩個數字都來自 Legora,描述的都是同一個模型,但只有其中一個流傳了出去。如果你正為一家律師事務所評估這件事,3% 是你該據以規劃的數字,40% 則是你該期盼的數字。
獨立測試指向了一種不同的故障模式
有兩項獨立評估值得與發布數據並列參考,但須留意的是,這兩項評估規模都很小,且都只有單一來源。
HAQQ 以中等推理程度,讓 GPT-6 Astra 針對橫跨 20 個執業領域的 41 道真實法律問題進行測試。Astra 在法律實質內容上以 20 分中的 17.63 分領先——差距不到一分。它每則答案花費 0.2622 美元,大約是 GPT-5.6 Luna Pro 每則答案成本的十一倍,換來的綜合增益卻不到一分。HAQQ 自身的解讀很犀利:優勢不在於模型更聰明,而在於它懂得停筆。同一項測試發現,將推理力度從低調到高,會使成本增加約 1.5 倍、延遲增加約 1.8 倍,同時讓評判品質下降 0.17 分——這是個披著品質槓桿外衣的成本槓桿,也是應該固定推理力度設定、而非讓它維持在最大的理由。
最值得廣泛傳播的那項發現,與成本無關。在非美國的各個司法管轄區,三套受測模型全都引用了正確的條文,卻錯誤陳述了它的內容。Astra 在這些項目上的法律正確率為 66.7%;Claude Opus 5 則是 100% 正確。引註檢查工具會讓這個答案過關,因為該引註確實存在,而且正是正確的那一條。但客戶不會接受。這正是法律檢索索引最無力處理的失效模式,因為該索引僅涵蓋美國,而錯誤出在閱讀理解,不在檢索。
你實際上能得到什麼,以及何時能得到。
Astra for Law 目前尚未全面開放。存取權一開始是透過一項全新的 Trusted Access 計畫提供,該計畫鎖定 Am Law 200 律師事務所,並經由 ChatGPT 與 Codex 提供。該 API 據稱即將推出,模型 ID 為 gpt-6-astra-law,並在模型選擇器中顯示為「GPT-6 Astra Law」;Harvey 與 Legora 被點名為將在其上建構應用的 API 客戶。這套法律配置的價格尚未公布,而這是任何要據此編列預算的人最大的未解問題。
Trusted Access 包含兩項資料條款:API 上的零資料保留,以及預設將 ChatGPT Enterprise 的使用排除於人工審查之外。在簡報會中被問及例外情況時,Boehmig 並未聲稱該政策是絕對的:「這絕對比那句話複雜得多,」他說,並指出完整協議約有 30 頁,還補充說 OpenAI 有信心這 30 頁能滿足需求。OpenAI 表示,正與 Latham & Watkins 就資訊權限、倫理牆、客戶指示及事務所監督等事項合作。
生態系統這部分比模型本身更大:26 個供應商外掛,包括 Thomson Reuters、Harvey、Legora、iManage、Relativity、Clio、Intapp 與 DeepJudge;九個來自法律工程社群的社群外掛;以及由法律領域重度使用者打造的 47 項自訂技能。ChatGPT for Word 也正式全面推出,可用於校對、建議編輯與格式標記。OpenAI 的前置部署工程師與 Sullivan & Cromwell 合作開發合約分析工具,與 Ropes & Gray 合作進行併購盡職調查,並與 Cooley 合作處理 GO Public。
作為這條賽道如今有多擁擠的背景:Anthropic 在 2026 年 5 月推出了 Claude for Legal,比 Astra for Law 問世早了三個月。
那個頁面上沒有任何基準能捕捉到的風險
發布資料中沒有任何內容回應一家公司的總法律顧問會最先提出的兩個治理問題。截至 2026 年 9 月,GPT-6 Astra 尚未公布任何 SOC 2、ISO 或 HIPAA 認證,也沒有已公布的細節說明針對個別公司的資料隔離、本地部署或資料駐留。這種闕漏並非失敗的證據——它只是尚未留下書面紀錄,而這是另一個問題,並且是該公司在受特權保護的資料存入之前必須自行解決的問題。
在倫理層面,實際適用的規則是《美國律師協會模範規則》第1.6條關於保密義務的規定——該條規範律師事務所可與第三方服務供應商分享哪些資訊,並可能要求更新告知內容並取得知情同意——以及第5.3條關於監督非律師協助人員的規定,而AI產出正是落在這一範疇。這兩者之所以都是現實存在、而非理論上的問題,原因在於Mata v. Avianca案,該案中的律師因提交不存在的AI生成案例而遭到制裁。針對真實判決見解建立的法律搜尋索引,能讓這種特定失誤較不易發生。但它並不能讓這種失誤變得不可能,也完全無法處理HAQQ所記錄的誤讀條文這類失誤。
如果你想在 API 開放之前以此為基礎繼續開發
老實說,目前的實情是 gpt-6-astra-law 不在任何人的 API 裡,包括我們自己的——OpenAI 只說了即將推出,並未給出任何日期。目前已經上線的是基礎模型:openai/gpt-6-astra在 OrcaRouter 上以0% 加價提供,意思是 OpenAI 的供應商定價會原封不動地傳遞過來,因此該模型一旦有廠商調價,當天就會反映。一組金鑰即可觸及超過 200 個模型,具備跨供應商的自動容錯移轉,以及可將多個模型組合成單次呼叫的路由 DSL。

對法律工程團隊而言,實際的後果是出現分岔。Astra for Law 工作流程中,所有不依賴 Legal Search Index 的部分——根據你提供的事實起草、重構一組條款、套用事務所範本排版、產生審查清單——你今天就能在基礎版 GPT-6 Astra 上做原型,等法律版本開放時再替換模型 ID,而不必更動你的整合。凡是依賴該索引的部分,你則無法做原型,因為索引正是目前尚未開賣的那一塊。有兩點但書值得直說:經過路由的請求不會自動納入 OpenAI 的 Zero Data Retention 核准範圍,該核准是按組織逐一授予的,因此需要 ZDR 的事務所應針對自己使用的特定路由確認是否涵蓋;其次,路由器是資料路徑上多出的一跳,即使能為你換得容錯移轉,對受特權保護的資料而言仍是實質成本。
看什麼
三件事,按它們將改變整體情況的程度排序。gpt-6-astra-law 的 API 上線日期,因為那正是試行與正式產品之間的差別。價格,因為基礎模型每百萬輸入詞元 10 美元、每百萬輸出詞元 50 美元的定價,在輸入超過 272,000 詞元後會觸發長脈絡重新定價,而法律文件集經常會跨過這個門檻——而且若法律組態的定價高於此,41 份文件勾稽的經濟效益就會有實質改變。還有,在由其他人掌控的切分上,獨立重跑那 200 道問題。在那之前,54.0% 是 OpenAI 針對自家組態得出的數字,而站得住腳的主張是範圍更窄的那一個:在美國法律研究問題上,美國判例法索引加上法律指示,能產生比一般網頁搜尋實質更好的檢索結果。那個主張值得據以行動。其餘的值得等待。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
