生成されたヒーローカード。タイトルは「Astra for Law vs GPT-6 Astra」、サブタイトルは「同じ重み — 一方は法律検索インデックスを追加」、日付行は「Astra for Law 2026年9月17日発表 · GPT-6 Astra 2026年9月3日リリース」、その上に2枚のカード:左「Astra for Law — 法律インデックス + 指示、価格は非公開」、右「GPT-6 Astra — ウェブ検索、100万トークンあたり入力$10 / 出力$50」、フッターは「ベンダー公表値は未再現。GPT-6 Astraの公開ボードスコアはVals AIによる。」、右下隅にOrcaRouterロゴを合成。
Guides & Insights

Astra for Law vs GPT-6 Astra:同一の重み、追加の検索インデックスは1つだけ

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Astra for LawGPT-6 Astraは2つのモデルではなく、この選択を直接対決として捉えることこそ、まず正しく押さえるべき点です。Astra for Law は、GPT-6 Astra に米国の法律検索インデックスを検索経路へ組み込み、法的文書作成の指示群を上に重ね、法務ツールを付加したものです。重みは同一です。したがって本当の問いは、どちらのモデルがより賢いかではなく、法律検索インデックスに割増料金を払う価値があるかどうかであり、これまでに利用可能な証拠からすると、その答えは、あなたの業務が判例検索なのか文書レビューなのかにほぼ完全に依存します。

それが重要なのは、OpenAIが法務向け構成の価格を公表しておらず、そのAPIも公開されておらず、ベースモデルとの唯一の直接比較測定はOpenAI自身が非公開の検証セットで行ったものだからです。このページでは、実際に判明していること、独立系の数値が示すこと、そして特定の法務ワークロードが比較のどちら側に属するのかを順に検討します。

正確には、何がそれらを分けているのか

3つのものが追加されたが、それらは再現するのが同じくらい難しいわけではない。

法律検索インデックス — 米国の判例法、法令、規則、裁判所規則、行政決定を対象とした検索。2億3,000万件を超えるURLを収録し、情報源は毎日追加されています。これはプロンプトからは構築できない部分です。

Corpus — CourtListenerを基盤に構築されており、米国で公開された先例判例法の99.9%以上を網羅するFree Law Projectのライブラリで、Thomson Reutersをはじめとするプロバイダーからのライセンスコンテンツによって補完されています。公開部分は無料ですが、ライセンス部分と毎日の更新を個々の法律事務所が再現できるものではありません。

指示と設定 — 法的分析および法的文書作成に関する指示に加え、回答の長さなどの設定。これらはプロンプトレベルおよび構成レベルのものである。有能なリーガルエンジニアリングチームであれば、現行のベースモデルに対してそのかなりの部分を近似できる。

A generated two-column scoreboard titled 'Astra for Law vs GPT-6 Astra — the scoreboard'. Left column 'Astra for Law' rows: 'Retrieval: Legal Search Index, 230M+ URLs', 'Instructions: legal-specific', 'Headline score: 54.0% vendor-reported', 'Availability: Trusted Access, Am Law 200', 'API model id: gpt-6-astra-law, coming soon', 'Price: not disclosed'. Right column 'GPT-6 Astra' rows: 'Retrieval: general web search', 'Instructions: general', 'Public board score: 39.42% on Vals AI', 'Availability: generally available now', 'API model id: gpt-6-astra', 'Price: $10.00 in / $50.00 out per 1M'. Footer reads 'Astra for Law figures OpenAI-reported on a private split; GPT-6 Astra public board figure per Vals AI.', with the OrcaRouter logo composited in the bottom-right corner.

GPT-6 Astra だけでは、検索取得は一般的なウェブ検索を経由する。これが調査経路における違いのすべてであり、以下のあらゆる数値が測っている軸でもある。

存在する唯一の直接対決

OpenAIは、Vals AIのLegal Research Benchの非公開検証セットから選んだ200件の米国法律リサーチ質問について、両者をテストした。最高の推論エフォートでは、Astra for Lawは全体的な正しさのチェックを質問の54.0%で通過し、ウェブ検索を使ったGPT-6 Astraの38.7%に対して、15.3ポイント、40%の相対的改善と説明されている。同じ実行からの裏付け数値は次のとおり:判例問題で参照事例が24%多く見つかり、同等の推論エフォートで正しい裁判所意見から最大54%多く関連箇所が抽出され、回答の長さは平均で約2倍だった。

それらの数字には3つの注意点が付きまとうが、どれもそれらを退ける理由にはならない。第一に、これはOpenAI自身の数字であり、OpenAIが保有する分割データ上でのもので、独立して再現したものは存在しない。第二に、回答長が2倍になっている点は総合スコアと並べて見る価値がある。網羅性を評価する正確性チェックは、回答が長いほうが通りやすいからだ。検索の数値(ケースが24%増、パッセージが54%増)のほうが、インデックスが実際に何を付加しているかを示すより明確な証拠である。第三に、同じベンチマークの公開版ではこの跳躍は見られない。Vals AI自身の比較ページには、Legal Research BenchにおいてGPT-6 Astraが39.42% ±3.40、Gemini 3.8 Flashが38.94% ±3.39と記載されている。これはインデックスなしのベースモデルが、事実上OpenAIのベースラインと同じ位置に収まっているということだ。

A screenshot of the Vals AI 'Compare Models' leaderboard captured September 18, 2026, comparing Gemini 3.8 Flash and GPT-6 Astra: Legal Research Bench (Agentic US legal research) shows Gemini 3.8 Flash 38.94% ±3.39 against GPT-6 Astra 39.42% ±3.40; Vals Index shows 62.25% against 66.61%; and the table also lists Finance Agent (V2) 61.44% vs 53.54%, Tax Agent Bench 66.77% vs 63.34%, MedCode 48.13% vs 48.49%, Terminal-Bench Science 8.57% vs 65.71%, Code Migration 36.55% vs 67.74%, Terminal-Bench 4.0 13.13% vs 57.07% and Vibe Code Bench v1.1 78.65% vs 89.59%, with a Vals Index date of 2026-09-11.

2つの独立した評価結果は、状況をさらに複雑にする。Legoraは41文書にわたる財務諸表の突合を一度に実行し、仕込まれた4つの誤りすべてを発見した。これには収益注記における50万ポンドの乖離が含まれ、以前のモデルが見落としていた約50件のチェックを追加した——そのワークフローでは約40%の改善である。しかし、LegoraのBenchmark for Agentic Reasoning全体では、全タスクを通じた平均改善幅は約3%だった。一方、HAQQの20の実務領域にわたる41問テストでは、Astraの法的実体面での優位性は20点中17.63点で、より安価なモデルを1点未満しか上回っておらず、回答1件あたり$0.2622だった。総合して読むと、正直な要約はこうだ。この構成の優位性は、検索負荷の高い米国判例法の作業では大きく再現性があるが、一般的な法的推論では薄く、米国以外の法域ではほとんど検証されていない——そこでは、同じテストで、3モデルすべてが正しい条文を引用しながら、その述べている内容を誤っていることが分かった。

Astra for Lawには公開価格がありません。GPT-6 Astraの料金表は公開されており、比較はこの数字を基に構築するほかありません。なぜなら、法務向け構成は同じモデルに検索機能を加えたものであり、ラップする対象のモデルより安価になるとは到底考えられないからです。

スタンダード — 入力トークン100万あたり10.00ドル、出力トークン100万あたり50.00ドル。

キャッシュ済み入力 — 100万あたり$1.00、90%の割引、そして定型的な指示や前例の定型文を再利用する企業にとって最も重要なてことなるもの。

キャッシュ書き込み — 100万あたり$12.50、非キャッシュ入力レートの1.25倍で課金。キャッシュは2回目の再利用から元が取れます。

入力トークンが272,000を超える場合 — 入力およびキャッシュ料金は2倍、出力は1.5倍となり、適用対象はリクエスト全体で、しきい値を超えたトークンだけではありません。実際には、長いリクエストでは100万トークンあたり入力$20.00、出力$75.00となります。

バッチ — スタンダードの50%。高速モード — スタンダードの2倍、EUデータレジデンシーを使用するGPT-6 Astraではご利用いただけません。

その272Kというしきい値は、この比較における脚注ではない。むしろ比較の中心だ。41文書の突合、宣誓供述調書一式、複数年にわたる案件ファイルは、日常的に272,000トークンを超える。つまり現実的な法務向け料金は長文コンテキストの行——入力$20.00、出力$75.00——であり、見出しの$10/$50ではない。パイロットの規模を見積もる法律事務所にとって、この2行の差は、予算に収まるプロジェクトと収まらないプロジェクトの差であり、コミットする前(後ではなく)に案件ごとの実際のトークン量を測定すべき理由でもある。

独立系テストによるコスト面の所見がさらに2件ある。HAQQ は Astra 上で1回答あたり $0.2622 と測定され、GPT-5.6 Luna Pro の1回答あたりコストの約11倍だったが、総合スコアの向上は1ポイント未満だった。ただし、この差は一部には、Astra が Claude Opus 5 より約3.5分の1のトークン数で書くためでもあり、そのワークロードでは1回答あたり Opus 5 より安くなることも指摘された。また同じテストで、推論エフォートのダイヤルは品質のレバーではなくコストのレバーとして機能することが分かった。低から高にすると、コストは約1.5倍、レイテンシは約1.8倍になり、一方で評価品質は0.17ポイント低下した。エフォート設定は固定し、デフォルトで最大のままにしないこと。

ベースモデルのほうがお買い得なのはどんなときか

GPT-6 Astra単体の論拠は、ローンチ時の枠組みが示唆するよりも強力であり、それは三つの観察に基づいている。

• あなたの業務は米国判例法の検索ではありません。インデックスは米国専用です。契約書の作成、条項の再構成、インテーク、時系列の構築、またはすでに手元にある文書の要約に関しては、Astra for Law が加えるものはほとんど不活性です。

• あなたはすでに一次法源の調査に費用を払っている。WestlawやLexisNexisのサブスクリプションを持つ法律事務所が、監査できない検索レイヤーにも追加料金を払っているなら、同じ判例カバレッジを二重に買っていることになる。

• 取得経路を自分で管理したい場合。厳選したドキュメントセットをベースの GPT-6 Astra に投入すれば、検証可能な引用の出所が得られ、ベンダーのインデックス更新に依存することもありません。

ベースモデルが弱点ではないという第三者による証拠がある。MercorのAPEX-Agents企業法務弁護士リーダーボードでは、GPT-6 Astra構成が160タスクにわたりPass@1 73.4%を記録した。これは法務エージェントのワークロードにおける第三者結果であり、Legoraが自社のベンチマークスイート全体で測定した平均3%の向上と並んでいる。どちらの数値も検索インデックスに関するものではなく、どちらも基盤モデルがすでに法務作業の大半を担っていることを示唆している。

構成がそのプレミアムに見合うとき

Astra for Law の主張はより限定的であり、それが当てはまる場合には決定的である。あなたの業務が米国の法的根拠を見つけて適用すること——ブリーフの判例リストを作成し、ある主張が一連の判決を生き残るかどうかを確認し、50州の規制調査を実施すること——であるなら、参照判例が24%多く、関連箇所が最大54%多いことは、わずかな改善ではなく、法的根拠を見落とすアシスタントと見落とさないアシスタントの違いである。Legora の照合は、判例法ではなく文書に対する同じ効果を利用可能な中で最もよく示す例である:一度に41ファイルを相互参照することは、まさに、より多くの取得コンテキストが積み重なる長文脈・大量比較作業である。

両者に共通する正直な留保として、価格は非公開で、アクセスはTrusted Accessプログラムを通じてAm Law 200の法律事務所に限定されており、独立系ラボがこの直接対決を再検証したことはない。あなたは、ベンダーのベンチマークと1人のパートナーによるワークフローテストだけを根拠に、割増料金を支払う覚悟を求められている。

両方を1つのエンドポイントで実行する

ここでのルーティングの問いは、選択ではなく順序の問題です。gpt-6-astra-law は、当社のものを含め、まだどの API にも存在しません — OpenAI は近日提供と述べていますが、日付は明言していません — そのため今日、この比較で実際に呼び出せるのは、片方のベースモデルだけです。現在利用可能なのは openai/gpt-6-astraが OrcaRouter 上で0%のマークアップで提供されているもので、プロバイダーの定価がそのまま反映されるため、上の $10/$50 と $20/$75 の行が実際に支払う金額となり、ベンダーの価格変更も同日に反映されます。200 以上のモデルが 1 つのキーの背後にあり、プロバイダー間で自動フェイルオーバーが行われます。

A screenshot of the OrcaRouter catalogue page for GPT-6 Astra, captured September 18, 2026, showing the listing openai/gpt-6-astra from provider OpenAI with a 1M token context, 128K max output, input of text + image + file with text output, p50 time to first token of 6.01 s and p95 of 10.00 s, $10.00 input and $50.00 output per 1M tokens, 162.0M tokens of routed traffic over seven days, and an OpenAI-compatible Python sample using base_url https://api.orcarouter.ai/v1.

ルーティング DSL は、この特定の判断に対応する部分です。2 つの製品の差分は検索ステップなので、自分で構成できます — 1 回の呼び出しでベースモデルを独自の文書検索とともにルーティングし、同じ質問をウェブ検索のみで送った場合の出力と比較します。これは、ゲート付きプレミアム製品にコミットする前に、54.0% 対 38.7% のギャップのうちどれだけを自社コーパスが再現できるかを測る安価な方法です。モデル融合は、1 つのプロンプトに対してモデルのパネルを実行するものですが、残りの半分をカバーします。単一モデルが条項を誤読することが懸念なら — HAQQ が米国以外の法律について見つけたように — パネルは不一致を隠すのではなく浮き彫りにします。ルーティングは両側を 1 つのキーに保つため、gpt-6-astra-law が公開されたときにモデル ID を切り替えるのは、再統合ではなく設定変更です。

一つ、埋めてしまわずに明言しておく価値のある注意点がある。ルーティングされたリクエストが、組織単位で付与される OpenAI の Zero Data Retention 承認によって自動的にカバーされるわけではない。したがって ZDR を必要とする事務所は、利用するルートでカバーされていることを確認すべきだ。また、ルーターはデータ経路におけるもう一つのホップである——たとえフェイルオーバーが得られるとしても、秘匿特権の対象となる資料にとっては実際のコストになる。

これがどこに着地するか

今日選ぶなら、ベースモデルを選べ。Astra for Law はまだ購入できず、そのプレミアム料金は不明であり、独立した証拠は、GPT-6 Astra がインデックスなしでも法務エージェントワークロードですでに高水準の性能を発揮していると示している。今すぐ openai/gpt-6-astra 上に構築し、自分自身の検索ギャップを測定し、272Kを超える頻度がロングコンテキスト行を気にするほど高いかどうかを、トークン集計に判断させよ。

では、次の3つが判明した時点で再検討しよう。gpt-6-astra-lawの価格、そのAPI利用条件の内容、そしてOpenAI以外の誰かが管理する分割データセットでの200問の直接対決の独立再実行だ。もし価格が基準料金の近くに収まり、検索性能の向上がOpenAIの検証セットの外でも保たれるなら、その構成は米国の研究中心の業務にとって明白なデフォルトとなり、ベースモデルはそれ以外のすべてには引き続き適切なままだ。それまでは、正当化できる主張は狭いものにとどまる — 米国の判例法インデックスと法的指示を組み合わせれば、米国の法律問題について一般のウェブ検索よりも実質的により優れた検索ができる。それにはいくらか支払う価値がある。いくらなのかはまだ未解決の問題だ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新