Une carte hero générée intitulée « Astra for Law vs GPT-6 Astra », sous-titrée « Mêmes poids — l'une y ajoute un index de recherche juridique », avec une ligne de date indiquant « Astra for Law annoncé le 17 septembre 2026 · GPT-6 Astra publié le 3 septembre 2026 », au-dessus de deux cartes : à gauche « Astra for Law — index juridique + instructions, prix non communiqué » et à droite « GPT-6 Astra — recherche web, 10 $ en entrée / 50 $ en sortie pour 1 M », avec en pied de page « Chiffres du fournisseur non reproduits ; score public de GPT-6 Astra selon Vals AI. » et le logo OrcaRouter intégré dans le coin inférieur droit.
Guides & Insights

Astra for Law vs GPT-6 Astra : mêmes poids, un index de recherche supplémentaire

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Astra for Law et GPT-6 Astra ne sont pas deux modèles, et présenter le choix comme un face-à-face est la première chose à bien faire. Astra for Law est GPT-6 Astra avec un index de recherche juridique des États-Unis greffé sur son pipeline de récupération, un ensemble d'instructions de rédaction juridique superposées par-dessus, et des outils juridiques attachés. Les poids sont identiques. La vraie question n'est donc pas de savoir quel modèle est le plus intelligent — mais si l'index de recherche juridique vaut la peine de payer un supplément, et d'après les données disponibles à ce jour, la réponse dépend presque entièrement du fait que votre travail relève de la recherche de jurisprudence ou de la revue de documents.

Cela compte parce qu’OpenAI n’a pas publié de prix pour la configuration juridique, que l’API correspondante n’est pas ouverte et que la seule mesure en comparaison directe avec le modèle de base provient d’OpenAI elle-même sur un ensemble de validation privé. Cette page examine ce qui est réellement connu, ce que disent les chiffres indépendants et de quel côté de la comparaison se situe une charge de travail juridique donnée.

Qu'est-ce qui les sépare, précisément ?

Trois choses ont été ajoutées, et leur reproduction n’est pas également difficile.

Legal Search Index — recherche dans la jurisprudence américaine, les lois, les règlements, les règles de procédure des tribunaux et les décisions administratives, plus de 230 millions d’URL, sources ajoutées quotidiennement. C’est la partie que vous ne pouvez pas construire à partir d’un prompt.

Corpus— construit sur CourtListener, la bibliothèque du Free Law Project couvrant plus de 99,9 % de la jurisprudence américaine publiée faisant autorité, complétée par du contenu sous licence de fournisseurs, dont Thomson Reuters. La moitié publique est gratuite ; la moitié sous licence et l'actualisation quotidienne ne sont pas ce qu'un cabinet individuel peut reproduire.

Instructions et paramètres — instructions d'analyse juridique et de rédaction juridique, ainsi que des paramètres tels que la longueur des réponses. Ces éléments se situent au niveau du prompt et de la configuration. Une équipe compétente en ingénierie juridique peut aujourd'hui en reproduire approximativement une fraction significative avec le modèle de base.

A generated two-column scoreboard titled 'Astra for Law vs GPT-6 Astra — the scoreboard'. Left column 'Astra for Law' rows: 'Retrieval: Legal Search Index, 230M+ URLs', 'Instructions: legal-specific', 'Headline score: 54.0% vendor-reported', 'Availability: Trusted Access, Am Law 200', 'API model id: gpt-6-astra-law, coming soon', 'Price: not disclosed'. Right column 'GPT-6 Astra' rows: 'Retrieval: general web search', 'Instructions: general', 'Public board score: 39.42% on Vals AI', 'Availability: generally available now', 'API model id: gpt-6-astra', 'Price: $10.00 in / $50.00 out per 1M'. Footer reads 'Astra for Law figures OpenAI-reported on a private split; GPT-6 Astra public board figure per Vals AI.', with the OrcaRouter logo composited in the bottom-right corner.

Sur GPT-6 Astra seul, la récupération passe par la recherche web générale. C’est là toute la différence dans le parcours de recherche, et c’est l’axe que mesure chaque chiffre ci-dessous.

Le seul face-à-face qui existe

OpenAI a testé les deux systèmes sur 200 questions de recherche juridique américaines issues de l'ensemble de validation privé de Vals AI's Legal Research Bench. Au niveau d'effort de raisonnement le plus élevé, Astra for Law a réussi le contrôle global d'exactitude sur 54,0 % des questions, contre 38,7 % pour GPT-6 Astra avec recherche web — un écart de 15,3 points, décrit comme une amélioration relative de 40 %. Chiffres à l'appui de la même exécution : 24 % de cas de référence en plus trouvés sur les questions de jurisprudence, jusqu'à 54 % de passages pertinents en plus extraits de décisions de justice correctes à effort de raisonnement égal, et des réponses dont la longueur moyenne est environ deux fois supérieure.

Trois mises en garde s’imposent concernant ces chiffres, et aucune d’elles ne constitue une raison de les écarter. Premièrement, ils proviennent d’OpenAI, sur un split que détient OpenAI, et aucun travail indépendant ne les a reproduits. Deuxièmement, la longueur doublée des réponses mérite d’être mise en regard du score composite, car un contrôle d’exactitude qui récompense la couverture est plus facile à réussir avec une réponse plus longue — les chiffres de récupération (24 % de cas en plus, 54 % de passages en plus) sont la preuve la plus nette de ce que l’index apporte réellement. Troisièmement, la version publique du même benchmark ne montre pas ce bond : la page de comparaison de Vals AI elle-même indique GPT-6 Astra à 39,42 % ±3,40 sur Legal Research Bench, avec Gemini 3.8 Flash à 38,94 % ±3,39. C’est le modèle de base, sans l’index, qui se situe essentiellement là où se trouve la baseline d’OpenAI.

A screenshot of the Vals AI 'Compare Models' leaderboard captured September 18, 2026, comparing Gemini 3.8 Flash and GPT-6 Astra: Legal Research Bench (Agentic US legal research) shows Gemini 3.8 Flash 38.94% ±3.39 against GPT-6 Astra 39.42% ±3.40; Vals Index shows 62.25% against 66.61%; and the table also lists Finance Agent (V2) 61.44% vs 53.54%, Tax Agent Bench 66.77% vs 63.34%, MedCode 48.13% vs 48.49%, Terminal-Bench Science 8.57% vs 65.71%, Code Migration 36.55% vs 67.74%, Terminal-Bench 4.0 13.13% vs 57.07% and Vibe Code Bench v1.1 78.65% vs 89.59%, with a Vals Index date of 2026-09-11.

Deux lectures indépendantes compliquent encore davantage le tableau. Legora a effectué un rapprochement d’états financiers sur 41 documents en une seule passe et a trouvé les quatre erreurs introduites, y compris un écart de 500 000 £ dans la note sur les revenus, ajoutant environ cinquante vérifications que le modèle précédent avait manquées — soit une amélioration d’environ 40 % sur ce flux de travail. Sur le Benchmark for Agentic Reasoning de Legora dans son ensemble, cependant, l’amélioration moyenne sur toutes les tâches était d’environ 3 %. Par ailleurs, le test de 41 questions de HAQQ couvrant 20 domaines de pratique a placé l’avance d’Astra sur le fond juridique à 17,63 sur 20, à moins d’un point devant des modèles moins chers, à 0,2622 $ par réponse. Lus ensemble, le résumé honnête est que l’avantage de la configuration est important et reproductible sur les travaux de jurisprudence américaine à forte intensité de recherche, mince sur le raisonnement juridique général, et largement non testé sur le droit non américain — où le même test a constaté que les trois modèles citaient la bonne disposition tout en se trompant sur ce qu’elle dit.

Astra for Law n’a pas de prix publié. La grille tarifaire de GPT-6 Astra est publique, et c’est le chiffre sur lequel la comparaison doit être fondée, car la configuration juridique correspond au même modèle, plus la récupération, et ne peut pas vraisemblablement coûter moins cher que le modèle qu’elle englobe.

Standard — 10,00 $ par million de jetons d'entrée, 50,00 $ par million de jetons de sortie.

Entrée en cache — $1.00 par million, une remise de 90 %, et le levier qui compte le plus pour un cabinet réutilisant des instructions permanentes et des modèles de précédents.

Écritures de cache — 12,50 $ par million, facturées à 1,25× le tarif des entrées non mises en cache ; la mise en cache est rentable dès la deuxième réutilisation.

Au-delà de 272 000 jetons d'entrée — tarifs d'entrée et de cache × 2, et sortie × 1,5, appliqués à la requête entière, et non uniquement aux jetons dépassant le seuil. Concrètement, cela représente 20,00 $ en entrée et 75,00 $ en sortie par million pour toute requête longue.

Batch — 50 % de Standard. Mode rapide — 2× Standard, et indisponible pour GPT-6 Astra avec résidence des données dans l'UE.

Ce seuil de 272 K n’est pas une note de bas de page dans cette comparaison ; il en est le cœur. Un rapprochement de 41 documents, un jeu complet de transcriptions de dépositions ou un dossier de transaction pluriannuel dépasse régulièrement 272 000 jetons, ce qui signifie que le tarif juridique réaliste est la ligne du contexte long — 20,00 $ en entrée et 75,00 $ en sortie — et non les 10 $/50 $ mis en avant. Pour un cabinet qui dimensionne un projet pilote, la différence entre ces deux lignes est la différence entre un projet qui entre dans un budget et un qui n’y entre pas, et c’est une raison de mesurer votre volume réel de jetons par dossier avant de vous engager, plutôt qu’après.

Deux remarques supplémentaires sur les coûts issues de tests indépendants. HAQQ a mesuré 0,2622 $ par réponse sur Astra, soit environ onze fois le coût par réponse de GPT-5.6 Luna Pro pour moins d’un point de gain composite — mais a aussi noté que l’écart tient en partie au fait qu’Astra écrit environ 3,5× moins de tokens que Claude Opus 5, ce qui la rend moins chère par réponse qu’Opus 5 pour cette charge de travail. Et ce même test a constaté que le réglage de l’effort de raisonnement se comporte comme un levier de coût plutôt que de qualité : de faible à élevé, il a multiplié le coût par environ 1,5× et la latence par environ 1,8×, tandis que la qualité jugée a baissé de 0,17 point. Fixez le paramètre d’effort ; ne le laissez pas au maximum par défaut.

Quand le modèle de base est le meilleur achat

L’argument en faveur de GPT-6 Astra à lui seul est plus solide que ne le laisse entendre le cadrage du lancement, et il repose sur trois observations.

• Votre travail ne consiste pas en de la recherche de jurisprudence américaine. L’index est limité aux États-Unis. Pour la rédaction de contrats, la restructuration de clauses, la réception des dossiers, l’établissement de chronologies ou le résumé de documents que vous avez déjà en main, ce qu’Astra for Law apporte est largement inerte.

• Vous payez déjà pour la recherche juridique primaire. Un cabinet disposant d’abonnements à Westlaw ou LexisNexis achète deux fois la même couverture jurisprudentielle s’il paie aussi un supplément pour une couche de recherche qu’il ne peut pas auditer.

• Vous voulez la voie de récupération que vous contrôlez. Alimenter GPT-6 Astra de base avec un ensemble de documents sélectionnés vous donne une provenance des citations que vous pouvez inspecter, et aucune dépendance à l’actualisation de l’index d’un fournisseur.

Des preuves tierces montrent que le modèle de base n'est pas le maillon faible. Sur le classement APEX-Agents des juristes d'entreprise de Mercor, une configuration GPT-6 Astra a obtenu 73,4 % de Pass@1 sur 160 tâches — un résultat tiers sur une charge de travail d'agent juridique, qui vient s'ajouter au gain moyen de 3 % mesuré par Legora sur sa propre suite de benchmarks. Aucun de ces deux chiffres ne concerne l'index de recherche, et tous deux suggèrent que le modèle sous-jacent effectue déjà l'essentiel du travail juridique.

Quand la configuration justifie son surcoût

L'argument en faveur d'Astra for Law est plus restreint et, là où il s'applique, décisif. Si votre travail consiste à trouver et à appliquer le droit américain — constituer la liste de jurisprudence d'un mémoire, vérifier si une position résiste à une ligne jurisprudentielle, mener une étude réglementaire sur les cinquante États —, alors 24 % de cas de référence en plus et jusqu'à 54 % de passages pertinents en plus ne constituent pas une amélioration marginale : c'est la différence entre un assistant qui omet des sources et un qui ne le fait pas. Le tie-out de Legora est la meilleure illustration disponible du même effet sur les documents plutôt que sur la jurisprudence : recouper 41 fichiers en une seule passe est exactement le travail de comparaison à contexte long et à fort volume où davantage de contexte récupéré produit un effet cumulatif.

La réserve honnête dans les deux cas : la tarification n'est pas divulguée, l'accès est réservé aux cabinets Am Law 200 via le programme Trusted Access, et aucun laboratoire indépendant n'a refait la comparaison directe. On vous demande de vous engager à payer un supplément sur la seule foi d'un benchmark fournisseur et du test de flux de travail d'un associé.

Exécuter les deux via un seul point de terminaison

La question du routage relève ici d'un problème d'ordonnancement plutôt que d'un choix. gpt-6-astra-law n'est encore disponible dans aucune API, y compris la nôtre — OpenAI a annoncé « bientôt disponible » sans avancer de date — donc aujourd'hui, la seule moitié de cette comparaison que vous pouvez réellement appeler est le modèle de base. Ce qui est disponible dès maintenant, c'est openai/gpt-6-astra sur OrcaRouter à 0 % de marge, avec le prix catalogue du fournisseur répercuté sans modification : les lignes 10 $/50 $ et 20 $/75 $ ci-dessus correspondent donc à ce que vous payez, et toute modification tarifaire du fournisseur est appliquée le jour même. Plus de 200 modèles sont accessibles derrière une seule clé, avec basculement automatique entre fournisseurs.

A screenshot of the OrcaRouter catalogue page for GPT-6 Astra, captured September 18, 2026, showing the listing openai/gpt-6-astra from provider OpenAI with a 1M token context, 128K max output, input of text + image + file with text output, p50 time to first token of 6.01 s and p95 of 10.00 s, $10.00 input and $50.00 output per 1M tokens, 162.0M tokens of routed traffic over seven days, and an OpenAI-compatible Python sample using base_url https://api.orcarouter.ai/v1.

Le DSL de routage est l'élément qui correspond à cette décision spécifique. Parce que l'écart entre les deux produits est une étape de récupération, vous pouvez le composer vous-même — acheminez le modèle de base avec votre propre récupération de documents en un seul appel et comparez la sortie à celle de la même question envoyée avec la recherche web uniquement. C'est un moyen peu coûteux de mesurer quelle part de l'écart entre 54,0 % et 38,7 % votre propre corpus reproduit, avant de vous engager dans un produit premium à accès restreint. La fusion de modèles, qui exécute un panel de modèles sur une même invite, couvre l'autre moitié : si votre inquiétude est qu'un modèle unique interprète mal une disposition, comme HAQQ l'a constaté sur le droit non américain, un panel fait apparaître le désaccord au lieu de le masquer. Parce que le routage garde les deux côtés sur une seule clé, changer l'id du modèle lorsque gpt-6-astra-law ouvre est un changement de configuration, pas une réintégration.

Une mise en garde qu'il vaut mieux énoncer que passer sous silence : une requête routée n'est pas automatiquement couverte par l'approbation Zero Data Retention d'OpenAI, qui est accordée par organisation ; une entreprise qui a besoin du ZDR doit donc confirmer la couverture sur la route qu'elle utilise. Et un routeur est un saut de plus dans le chemin des données — un coût réel pour des éléments protégés par le secret professionnel, même lorsqu'il permet un basculement.

Où cela atterrit

Si vous choisissez aujourd'hui, choisissez le modèle de base. Astra for Law ne peut pas encore être acheté, son surcoût est inconnu, et les preuves indépendantes indiquent que GPT-6 Astra atteint déjà un haut niveau de performance sur les charges de travail d'agents juridiques sans l'index. Construisez dès maintenant sur openai/gpt-6-astra, mesurez votre propre écart de récupération, et laissez la comptabilité des tokens vous dire si vous dépassez 272K assez souvent pour vous soucier de la ligne de contexte long.

Revenez-y ensuite lorsque trois éléments seront connus : le prix de gpt-6-astra-law, la teneur de ses conditions d'API et une nouvelle exécution indépendante de la comparaison en face-à-face de 200 questions sur un découpage contrôlé par une entité autre qu'OpenAI. Si le prix s'établit près du tarif de base et que les gains de récupération se maintiennent en dehors de l'ensemble de validation d'OpenAI, cette configuration devient le choix par défaut évident pour les travaux à forte intensité de recherche aux États-Unis, et le modèle de base reste le bon choix pour tout le reste. D'ici là, l'affirmation défendable est la plus restreinte — un index de jurisprudence américaine complété par des instructions juridiques récupère nettement mieux que la recherche web générale sur les questions juridiques américaines. Cela vaut la peine de payer quelque chose. Le montant reste une question ouverte.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement