
Astra for Law 對比 GPT-6 Astra:相同權重,多一個搜尋索引
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Astra for Law與GPT-6 Astra並不是兩個模型,而把這個選擇框架成一場正面對決,正是首先要弄清楚的事。Astra for Law 就是在檢索路徑上加裝了一套美國法律檢索索引的 GPT-6 Astra,再疊上一組法律起草指令,並附上法律工具。權重完全相同。所以真正的問題不是哪個模型更聰明——而是那套法律檢索索引是否值得付出溢價,而就目前可得的證據來看,答案幾乎完全取決於你的工作是判例法檢索還是文件審閱。
這很重要,因為 OpenAI 尚未公布法律配置的價格,其 API 也尚未開放,而唯一與基礎模型進行的直接對比測量,來自 OpenAI 自己在私有驗證集上的結果。本頁將探討實際上已知的內容、獨立數據所顯示的結果,以及特定的法律工作負載應屬於比較中的哪一方。
確切地說,是什麼將它們區分開來?
新增了三樣東西,而它們複製起來的難度並不一樣。
• Legal Search Index — 檢索範圍涵蓋美國判例法、成文法、法規、法院規則與行政裁決,收錄超過 2.3 億個 URL,來源每日新增。這是無法只靠提示詞打造的部分。
• Corpus — 建構於 CourtListener 之上,這是 Free Law Project 的法律資料庫,涵蓋超過 99.9% 已公布的美國具先例效力判例法,並輔以來自 Thomson Reuters 等供應商的授權內容。公開的那一半免費;授權的那一半以及每日更新,並非個別律師事務所所能複製。
• 指令與設定 — 法律分析與法律寫作指令,以及回覆長度等設定。這些屬於提示詞層級與組態層級。一個有能力的法律工程團隊,今日即可在基礎模型上近似實現其中相當比例。

單就 GPT-6 Astra 而言,檢索是透過一般網頁搜尋進行的。這就是研究路徑上的全部差異,而它正是下方每個數字所衡量的軸線。
唯一存在的正面對決
OpenAI 在 200 道美國法律研究問題上測試了兩者,這些題目來自 Vals AI's Legal Research Bench 的私有驗證集。在最高推理投入下,Astra for Law 在 54.0% 的問題上通過整體正確性檢查,而搭配網頁搜尋的 GPT-6 Astra 則是 38.7%——差距 15.3 個百分點,被描述為 40% 的相對改善。同一輪測試的輔助數據:在判例法問題上找到的參考案例多 24%;在同等推理投入下,從正確法院裁判書中檢索到的相關段落最多多 54%;回答長度平均約為兩倍。
那些數字值得附上三點提醒,但這三點都不是無視它們的理由。第一,它們是 OpenAI 的數據,且是在 OpenAI 所持有的資料切分上取得,沒有任何獨立第三方重現過。第二,答案長度加倍這一點值得與綜合分數並列審視,因為獎勵涵蓋範圍的正確性檢查,用更長的答案更容易通過——檢索數據(多 24% 案例、多 54% 段落)才是該索引實際增添什麼的更明確證據。第三,同一基準測試的公開版本並未顯示這一躍升:Vals AI 自己的比較頁面列出 GPT-6 Astra 在 Legal Research Bench 上為 39.42% ±3.40,而 Gemini 3.8 Flash 為 38.94% ±3.39。那是沒有該索引的基礎模型,基本上正好落在 OpenAI 基準所在的位置。

兩項獨立解讀進一步使情況複雜化。Legora 在一次處理中對 41 份文件進行了財務報表核對,並發現了所有四個植入錯誤,包括收入附註中 50 萬英鎊的差額,增加了先前模型遺漏的約五十項檢查——在該工作流程上約有 40% 的改善。然而,在 Legora 的整體 Benchmark for Agentic Reasoning 上,所有任務的平均改善約為 3%。與此同時,HAQQ 針對 20 個執業領域的 41 題測試顯示,Astra 的法律實質領先優勢為 20 分中的 17.63 分,領先較便宜的模型不到一分,每題答案成本為 0.2622 美元。綜合來看,誠實的總結是:該配置的優勢在檢索密集型的美國判例法工作上既大且可重複,在一般法律推理上則很薄弱,且在非美國法律上基本上未經測試——同樣的測試發現,所有三個模型都引用了正確的條款,卻錯誤陳述了其內容。
各方每份法律解答的實際成本是多少
Astra for Law 沒有公開定價。GPT-6 Astra 的價目表是公開的,而這正是比較必須依據的數字,因為法律版配置就是同一個模型加上檢索,不可能合理地比它所包裝的模型更便宜。
• 標準 — 每百萬個輸入權杖 $10.00,每百萬個輸出權杖 $50.00。
• 快取輸入 — 每百萬 $1.00,可享 90% 折扣,對於重用現行指示與先例樣板的事務所而言,這是最關鍵的槓桿。
• 快取寫入 — 每百萬 $12.50,以未快取輸入費率的 1.25 倍計費;從第二次重複使用起,快取即可回本。
• 超過 272,000 個輸入 token——輸入與快取費率為 2 倍、輸出為 1.5 倍,並套用於整個請求,而不只是超過該門檻的 token。實際上,這代表任何長請求每百萬 token 的輸入費用為 $20.00、輸出費用為 $75.00。
• 批次 — 標準方案的 50%。 快速模式 — 標準方案的 2 倍,且不適用於採用歐盟資料駐留的 GPT-6 Astra。
對這項比較而言,272K 門檻不是註腳;它是核心所在。一份 41 份文件的核對、一整套庭外證言筆錄,或一個多年期交易檔案,經常會超過 272,000 個 token,這表示現實中的法律行情是長上下文那一列——輸入 $20.00、輸出 $75.00——而不是表面上主打的 $10/$50。對正在評估試行規模的事務所來說,這兩列之間的差距,就是一個能納入預算的專案與一個無法納入預算的專案之間的差距,而這也是為什麼要在投入之前,而不是之後,衡量你們每個案件實際的 token 用量。
來自獨立測試的另外兩則成本備註。HAQQ 在 Astra 上測得每次回答 $0.2622,約為 GPT-5.6 Luna Pro 每次回答成本的十一倍,而綜合增益卻不到一分——但也指出,這個差距部分是因為 Astra 的 token 用量約比 Claude Opus 5 少 3.5 倍,就該工作負載而言,這讓它每次回答比 Opus 5 更便宜。而同一項測試發現,推理努力程度旋鈕的行為更像成本槓桿,而非品質槓桿:從低到高會使成本增加約 1.5 倍、延遲增加約 1.8 倍,而評判品質卻下降 0.17 分。請固定努力設定;不要預設將其留在最高值。
當基本款更值得買時
GPT-6 Astra 本身的立論,比發布時的框架所暗示的更為有力,而且它建立在三項觀察之上。
• 你的工作不是美國判例法檢索。該索引僅限美國。至於合約起草、條款重整、案件收案、時序建立,或摘要你手邊已有的文件,Astra for Law 所增添的功能大致上都派不上用場。
• 你已經在為主要法律研究付費。一家擁有 Westlaw 或 LexisNexis 訂閱的事務所,如果還為一個它無法稽核的檢索層支付額外費用,就等於把同樣的先例涵蓋範圍買了兩次。
• 你想要的是由你掌控的檢索路徑。將一套精選文件集餵入 base GPT-6 Astra,可讓你獲得可檢視的引用出處,且不必依賴廠商的索引更新。
有第三方證據顯示,基礎模型並非薄弱環節。在 Mercor 的 APEX-Agents 企業律師排行榜上,某個 GPT-6 Astra 配置在 160 項任務中取得 73.4% 的 Pass@1——這是針對法律代理工作負載的第三方結果,與 Legora 在其自家基準測試套件中測得的平均 3% 增益並列。這兩個數字都與搜尋索引無關,且兩者都顯示底層模型已經完成了大部分法律工作。
當配置值得其溢價時
支持 Astra for Law 的論據較為狹窄,但在適用之處,卻具有決定性。若你的工作內容是查找並運用美國法律依據——建立書狀的案例清單、確認某個立場能否通過一連串判決的考驗、進行五十州法規調查——那麼多出 24% 的參考案例,以及最多多出 54% 的相關段落,就不是邊際性的改善,而是區分出會漏掉法律依據的助理與不會漏掉的助理之間的差別。Legora 的 tie-out 勾稽核對,則是同一效應套用在文件而非判例法上的最佳例證:一次交叉參照 41 份檔案,正是更多檢索脈絡會產生複合效果的那種長脈絡、高量比對工作。
兩者都有一個老實說的但書:定價未公開,使用權僅限 Am Law 200 律師事務所透過 Trusted Access 計畫取得,而且沒有獨立實驗室重新進行過正面對決測試。你被要求僅憑一份廠商基準測試和一位合夥人的工作流程測試,就承諾支付溢價。
將兩者都透過同一個端點執行
這裡的路由問題是排序問題,而非選擇問題。gpt-6-astra-law 尚未在任何 API 中提供,包括我們自家的在內——OpenAI 表示即將推出,但未給出日期——因此今天這場比較中,你真正能呼叫的只有基礎模型。目前可用的是openai/gpt-6-astra在 OrcaRouter 上,以0% 加成提供,供應商的定價原樣傳遞,因此上方的 $10/$50 與 $20/$75 方案就是你實際支付的價格,供應商調價當天即會反映。超過 200 個模型只需一組金鑰即可使用,並可跨供應商自動容錯移轉。

路由 DSL 正是對應到這個具體決策的一環。由於這兩項產品的差異在於一個檢索步驟,你可以自行組合——在一次呼叫中,用你自己的文件檢索來路由基礎模型,並將輸出與僅透過網路搜尋送出同一個問題的結果相比較。這是一種成本低廉的方式,可在你決定採用需審核的高階產品之前,衡量你自己的語料庫能重現 54.0% 對 38.7% 差距中的多少。模型融合——讓一組模型對同一個提示執行——則涵蓋了另一半:如果你擔心的是單一模型會誤讀某項條文,正如 HAQQ 在非美國法律上所發現的情況,那麼一組模型會讓分歧浮現,而不是將它隱藏起來。由於路由讓兩邊共用同一把金鑰,在 gpt-6-astra-law 開放時切換模型 ID 只是設定變更,而非重新整合。
有一點值得明說,而不是藏著不提:經路由的請求不會自動受到 OpenAI 零資料保留(Zero Data Retention)核准的涵蓋,該核准是依組織逐一授予的,因此需要 ZDR 的公司應確認其所使用路由是否受到涵蓋。而且路由器是資料路徑上多出的一個躍點——對受特權保護的資料而言是實實在在的成本,即使它能換得容錯移轉。
這會落在何處
如果你今天就要做選擇,選基礎模型。Astra for Law 還買不到,它的溢價未知,而獨立證據顯示,GPT-6 Astra 在沒有索引的情況下,於法律代理工作負載上已具備高水準表現。現在就以 openai/gpt-6-astra 為基礎來開發,衡量你自己的檢索落差,並讓 token 記帳告訴你,你跨越 272K 的頻率是否高到需要在意長脈絡那一列。
然後,等到三件事都明朗後再重新檢視它:gpt-6-astra-law 的價格、其 API 條款的樣貌,以及在由 OpenAI 以外某方掌控的資料切分上,獨立重跑那場 200 題正面對決。如果價格落在接近基本費率的水準,而且檢索增益在 OpenAI 的驗證集之外依然成立,那麼這個配置就會成為美國研究密集型工作顯而易見的預設選擇,而基礎模型則仍適合其他所有用途。在那之前,站得住腳的說法是那個範圍較窄的主張——美國判例法索引加上法律指令,在美國法律問題上的檢索效果顯著優於一般網頁搜尋。這值得付出一些代價。要付多少,仍是未定之數。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
