
Astra for Lawを発表:OpenAI、GPT-6 Astraの背後に法律検索インデックスを配置
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Astra for Lawは2026年9月17日に発表された——法務業務用の構成で、GPT-6 Astraを基盤に構築されている。同モデルは、同社が2週間前の9月3日に投入したフラッグシップモデルである。これは新しいモデルではない。異なる玄関口の背後にある同じ重み、すなわち専用の法務検索インデックス、法律に特化した指示、そして米国の判例法調査を目的とした一連のツールである。この区別は、発表時の見せ方が示唆する以上に重要だ。なぜなら、発表内のあらゆる数値は、新しい能力ではなく、この構成をベースモデルと比較して測定したものだからである——そして、作業のほぼすべてを担っているのはこの構成なのだ。
見出しの主張は、Astra for LawがVals AIのLegal Research Benchの非公開検証セットから抽出した米国の法律調査質問200件のうち54.0%で全体的な正確性チェックに合格したというもので、GPT-6 Astraがウェブ検索のみを使った場合の38.7%に対して、OpenAIの説明では40%の相対改善だ。これらは非公開の分割におけるベンダー報告の数値であり、独立した研究所が再現したものはない。独立に確認できるもののほうがより有用だ。Vals AI自身の公開比較では、そのベンチマークでGPT-6 Astraは39.42% ±3.40と記載されており、これは本質的にOpenAIが比較対象としているベースラインだ。その差は法律検索インデックスと指示から生じており、モデルがより優れた弁護士になったことによるものではない。
以下がリリース済みの内容、実際に測定されたもの、そしてまだ不足しているものです。
Astra for Lawとは実際に何なのか
GPT-6 Astra には3つのものが追加されており、そのいずれも重みの変更ではありません。メディア向けブリーフィングで、Ironcladの共同創業者で2026年6月にOpenAIが採用したJason Boehmigと、エンジニアのSherwin Wuは、このリリースを、ドメイン指示、応答の長さなどの設定、そして時間の経過とともに拡大する見込みの法務業界向けツールを組み合わせた構成だと説明しました。
• リーガルサーチインデックス — 米国の判例法、制定法、規則、裁判所規則、行政決定を対象とし、2億3,000万以上のURLに及ぶ検索レイヤーで、情報源は毎日追加されています。
• コーパスの出所 — このインデックスは、非営利団体フリー・ロー・プロジェクトが運営するライブラリであるCourtListenerを活用しており、OpenAIによれば、これは米国で公表された先例となる判例法の99.9%以上をカバーしている。トムソン・ロイターをはじめとする各プロバイダーからのライセンスコンテンツを補完するものである。
• 法的指示 — 調査を事実に適用し、主張や取引条件を展開し、立場の弱点や不確実性を明らかにするためのドメイン指示のセット。

ブリーフィングでの実演は抽象的ではなく具体的だった。Wuは、障害差別と報復の請求に直面する病院のために却下申立てを起草し、祝日の週末に資産売却に対する株主の異議申立てに取り組み、販売コミットメントをめぐる紛争を処理した。これらはいずれも、フロンティアモデルにとって新しい能力ではない。新しいのは、その仕事の検索の半分がもはや一般的なウェブ検索を経由しないことだ。
ベンチマークを注意深く読んでください。
そのローンチから4つの数値が登場した。いずれもOpenAIによるものとされ、いずれも同じ非公開の検証セットに基づくもので、それぞれを互いに切り分ける価値がある:
• 全体的な正確性 — 最高の推論エフォート設定において、Astra for Law は 54.0%、ウェブ検索を使用した GPT-6 Astra は 38.7%。
• 参照事例が見つかりました — 判例に焦点を当てた質問ではさらに24%増、これも最高レベルの推論エフォート時。
• 取得された関連箇所 — 正しい裁判所意見から最大54%多く、推論の労力はベースラインと同じ。
• 回答の長さ — テストした推論設定全体で、平均すると約2倍の長さになります。
その最後の数値は、最初の数値と並べて見るべきものだ。カバレッジを評価する全体的な正しさのチェックは、長い回答のほうが通りやすい。そして15.3ポイントの向上の一部は、検索層が単にモデルの前により多くの材料を置いたことによるものだと考えられる。これはこの結果への批判ではない——参照ケースを24%多く見つけられたことは、別途述べられている実際の改善だ——が、複合値と検索の数値は、複合値だけではなく一緒に読むべきだということは意味している。
非公開分割の問題のほうがより重大だ。OpenAIが保有し公開していない検証セットは、誰も再実行できない。そして同じベンチマークの公開リーダーボードは、より地味な結果を示している。Vals AI自身の比較ページでは、GPT-6 AstraがLegal Research Benchで39.42% ±3.40、Gemini 3.8 Flashが38.94% ±3.39と記載されている。54.0%への跳躍を生んだものが何であれ、公開ボードでは見えない。なぜなら公開ボードは、法的インデックスを付けずにベースモデルを採点しているからだ。

Legoraの突合、およびその中の数値
ローンチ報道における最も実質的な第三者証拠は、Legoraによるワークフローテストだ。同社のリーガルエンジニアであるPercevale Perksが財務諸表の突合を実施した——下書き勘定の数値を、試算表、連結スケジュール、前年度の勘定と照合するものだった。Legoraのエージェントは、41件の文書にまたがる突合を1回の実行で、しかも数分で完了し、各チェックを記録して、レビュー用の行単位の記録を作成した。Legoraが勘定に仕込んだ4つの誤りをすべて発見し、収益注記に隠された50万ポンドの差異も含まれていた。以前のモデルが通過したチェックはすべて維持し、さらに約50件を追加した。
それは、本当に難しい文書セットに対して、本当に優れた結果だ。そして同時に、ローンチサイクル全体で最も役立つ数字が埋もれている場所でもある。実際のエンドツーエンド法務タスクを対象とするLegoraのBenchmark for Agentic Reasoningでは、財務諸表ワークフローにおける改善率は約40%だった。一方、すべてのBARタスクにおける平均改善率は約3%だった。どちらの数字もLegoraのもので、どちらも同じモデルについて述べているのに、広まったのは一方だけだ。もしあなたがこれを法律事務所のために評価しているなら、3%は前提として計画すべき数字であり、40%は期待してもよい数字だ。
独立したテストは、別の故障モードを指し示している
2つの独立した評価は、立ち上げ時の数値と並べて検討する価値がある。ただし、どちらも小規模かつ単一の情報源に基づくという留保付きである。
HAQQはGPT-6 Astraを、20の実務分野にわたる41の実際の法的質問に対して、中程度の推論で試した。Astraは法的実質で20点中17.63点と首位だった——差は1点未満。回答1件あたりのコストは0.2622ドルで、総合スコアの1点未満の向上のために、GPT-5.6 Luna Proの回答1件あたりコストのおよそ11倍だった。HAQQ自身の見立ては鋭い。優位性はモデルがより賢いことにあるのではなく、書くのをやめることにある。同じテストでは、推論エフォートを低から高にすると、コストが約1.5倍、レイテンシが約1.8倍になり、その一方で判定品質が0.17点低下することが分かった——品質レバーの装いをしたコストレバーであり、推論エフォート設定を最大のままにせず固定すべき理由である。
最も広く伝わるべき発見は、コストに関するものではない。米国以外の法域では、テストした3モデルすべてが、正しい条項を引用しながら、その記載内容を誤って述べた。Astra はそれらの項目の66.7%で法的に正確だった。Claude Opus 5 は100%正確だった。引用チェッカーはその回答を合格とする。引用が存在し、それこそが正しい引用だからだ。依頼者はそうしない。これは、法務検索インデックスが最も対処しにくい失敗モードである。インデックスは米国限定であり、誤りは検索ではなく読解にあるからだ。
実際に何が手に入るのか、そしてそれはいつなのか
Astra for Lawは一般提供されていません。アクセスは、Am Law 200の法律事務所を対象とした新しいTrusted Accessプログラムを通じて始まり、ChatGPTとCodex経由で提供されます。APIは、モデルID gpt-6-astra-lawで近日提供予定と説明されており、モデルピッカーには「GPT-6 Astra Law」として表示されます。HarveyとLegoraは、これを基盤に構築するAPI顧客として名を挙げられています。法務向け構成の価格は公表されておらず、これが予算を組むすべての人にとって最大の未解決の課題となっています。
Trusted Accessには2つのデータ条件がある。APIにおけるZero Data Retentionと、ChatGPT Enterpriseの利用をデフォルトで人によるレビューから除外することだ。ブリーフィングで例外について尋ねられたBoehmigは、この方針が絶対的だとは主張しなかった。「それは間違いなく、あの一文よりも複雑です」と彼は述べ、完全な合意文書は約30ページに及ぶと指摘し、OpenAIはその30ページが必要を満たすと確信していると付け加えた。OpenAIは、情報の許可、倫理的な壁、クライアントからの指示、事務所による監督についてLatham & Watkinsと協力していると述べている。
エコシステム部分はモデル部分よりも大きい。Thomson Reuters、Harvey、Legora、iManage、Relativity、Clio、Intapp、DeepJudge を含む26社のベンダープラグイン、法務エンジニアリング団体による9つのコミュニティプラグイン、そして法務のパワーユーザーが構築した47のカスタムスキルがある。ChatGPT for Wordも、校正、編集提案、書式設定の指摘向けに一般提供を開始した。フォワードデプロイ型のOpenAIエンジニアが、契約書アナライザーでSullivan & Cromwellと、M&AデューデリジェンスでRopes & Grayと、GO PublicでCooleyと協働した。
この分野が今どれだけ混み合っているかの参考までに:Anthropicは2026年5月にClaude for Legalを投入したが、それはAstra for Lawが登場する3か月前のことだった。
そのページのどのベンチマークも捉えていないリスク
ローンチ資料のどこにも、法律事務所のゼネラル・カウンセルが最初に尋ねる2つのガバナンス上の疑問には触れていない。2026年9月時点で、GPT-6 AstraについてSOC 2、ISO、HIPAAのいずれの認証も公表されておらず、事務所固有のデータのサイロ化、ローカル展開、データレジデンシーに関する詳細も公表されていない。この不在は失敗の証拠ではない。単に文書化されていないだけであり、それは別の問題であって、特権対象資料を投入する前に事務所自身が解決すべき問題である。
倫理面では、適用される規則は、事務所が第三者プロバイダーと何を共有できるかを規律し、開示の更新やインフォームド・コンセントを要する場合がある守秘義務に関するABA模範規則1.6と、AIの出力が該当する非弁護士による支援の監督に関する規則5.3です。この両方が理論上のものではなく現実に生きている理由は、Mata v. Aviancaで、弁護士が存在しないAI生成の判例を提出したために制裁を受けたことです。実在の判例を対象とした法的検索インデックスは、その特定の失敗を起こりにくくします。しかし、不可能にするわけではなく、HAQQが記録した条文の読み違えという失敗には何の効果もありません。
APIが公開される前に、これをもとに構築したい場合は
今日、正直に申し上げると、gpt-6-astra-law は当社のものも含め、どのAPIにも存在していません — OpenAIは「近日公開」と述べているだけで、日付は明言していません。実際に利用可能なのはベースモデルです:openai/gpt-6-astraはOrcaRouter上で0%のマークアップで提供されています。つまり、OpenAIのプロバイダー定価がそのまま反映されるため、そのモデルのベンダー価格の変更は同日中に反映されます。1つのキーで200以上のモデルにアクセスでき、プロバイダー間の自動フェイルオーバーと、複数のモデルを単一の呼び出しに組み合わせるためのルーティングDSLを備えています。

リーガルエンジニアリングチームにとっての実務上の帰結は、二つに分かれるということだ。Astra for Lawのワークフローのうち、Legal Search Indexに依存しないものはすべて — 提供された事実からのドラフト作成、条項セットの再構成、事務所テンプレートへのフォーマット、レビューチェックリストの生成 — 今日、ベースのGPT-6 Astraでプロトタイプでき、法務版が公開されたら統合を変更することなくモデルIDを差し替えられる。インデックスに依存するものはすべてプロトタイプできない。インデックスがまだ販売されていない部分だからだ。率直に述べておく価値のある注意点が二つある。ルーティングされたリクエストは、OpenAIのZero Data Retention承認によって自動的にカバーされるわけではない。この承認は組織単位で付与されるため、ZDRを必要とする事務所は、利用する特定のルートでカバーされていることを確認すべきだ。また、ルーターはデータ経路における余分なホップであり、たとえフェイルオーバーを手に入れられるとしても、秘匿特権のある資料にとっては実際のコストとなる。
何を見るべきか
状況を大きく変える順に、三つの点。gpt-6-astra-law の API 提供日。それがパイロットと製品の違いを分けるからだ。価格。ベースモデルの入力100万トークンあたり10ドル、出力100万トークンあたり50ドルには、入力272,000トークンを超えるとロングコンテキストの再価格設定が伴い、法律文書セットは日常的にその閾値を超える——そして法務向け構成がそれに対してプレミアム価格になると、41文書の突合(tie-out)の経済性は大きく変わる。そして、誰か他の人が管理する分割で、その200問を独立に再実行すること。それが存在するまでは、54.0% は OpenAI の構成についての OpenAI の数値であり、防御可能な主張はより狭いものだ。すなわち、米国判例インデックスと法務向け指示を組み合わせると、米国の法律調査に関する質問において、一般的なウェブ検索よりも実質的に優れた検索結果が得られる、という主張である。その主張は行動に移す価値がある。残りは待つ価値がある。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
