Una tarjeta principal generada titulada 'Presentamos Astra for Law', con el subtítulo 'la configuración legal de OpenAI de GPT-6 Astra', con una línea de fecha que dice 'Astra for Law anunciado el 17 de septiembre de 2026 · GPT-6 Astra lanzado el 3 de septiembre de 2026', sobre tres tarjetas etiquetadas 'Índice de búsqueda legal — más de 230 M de URL de leyes de EE. UU.', 'Corpus — CourtListener, Free Law Project' y 'API — gpt-6-astra-law, próximamente', con el pie de página 'Las cifras de benchmark las reporta el proveedor; no se han reproducido de forma independiente.' y el logotipo de OrcaRouter compuesto en la esquina inferior derecha.
Guides & Insights

Presentamos Astra for Law: OpenAI pone un índice de búsqueda legal detrás de GPT-6 Astra

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Astra for Law se anunció el 17 de septiembre de 2026 —una configuración de trabajo jurídico construida sobre GPT-6 Astra, el modelo insignia que la compañía lanzó dos semanas antes, el 3 de septiembre. No es un modelo nuevo. Son los mismos pesos detrás de una puerta de entrada distinta: un índice de búsqueda jurídica dedicado, instrucciones específicas para el ámbito legal y un conjunto de herramientas orientadas a la investigación de jurisprudencia de Estados Unidos. Esa distinción importa más de lo que sugiere el encuadre del lanzamiento, porque cada cifra del anuncio mide la configuración frente al modelo base en lugar de una capacidad nueva —y la configuración hace casi todo el trabajo.

La afirmación principal es que Astra for Law superó la verificación general de corrección en el 54,0 % de 200 preguntas de investigación jurídica de EE. UU. extraídas del conjunto privado de validación del Legal Research Bench de Vals AI, frente al 38,7 % de GPT-6 Astra usando únicamente búsqueda web —una mejora relativa del 40 %, según lo cuenta OpenAI. Son cifras reportadas por el proveedor sobre una partición privada, y ningún laboratorio independiente las ha reproducido. Lo que es visible de forma independiente es más útil: la propia comparación pública de Vals AI incluye a GPT-6 Astra con 39,42 % ±3,40 en ese benchmark, que es esencialmente la línea base contra la que OpenAI está midiendo. La brecha proviene del índice de búsqueda jurídica y de las instrucciones, no de que el modelo se haya convertido en un mejor abogado.

Esto es lo que se lanzó, lo que se ha medido realmente y lo que todavía falta.

¿Qué es realmente Astra for Law?

Se añadieron tres cosas sobre GPT-6 Astra, y ninguna de ellas es un cambio de pesos. En una sesión informativa para medios, Jason Boehmig —el cofundador de Ironclad al que OpenAI contrató en junio de 2026— y el ingeniero Sherwin Wu describieron el lanzamiento como una configuración de instrucciones de dominio, ajustes como la longitud de las respuestas y herramientas para el sector legal que se espera que se amplíen con el tiempo.

Índice de Búsqueda Jurídica — una capa de recuperación sobre jurisprudencia, estatutos, reglamentos, normas procesales y decisiones administrativas de EE. UU. que abarca más de 230 millones de URL, con fuentes que se añaden a diario.

Procedencia del corpus — el índice se nutre de CourtListener, la biblioteca mantenida por la organización sin ánimo de lucro Free Law Project, que según OpenAI cubre más del 99,9 % de la jurisprudencia precedencial publicada de Estados Unidos. Complementa el contenido con licencia de proveedores como Thomson Reuters.

Instrucciones jurídicas — un conjunto de instrucciones de dominio para aplicar la investigación a los hechos, desarrollar argumentos o términos del acuerdo, y sacar a la luz debilidades o incertidumbre en una posición.

A generated single-column scoreboard titled 'Astra for Law — the scoreboard' with six rows reading 'Underlying model: GPT-6 Astra', 'Legal Search Index: 230M+ U.S. law URLs', 'Corpus: CourtListener, 99.9% of precedential case law', 'Availability: Trusted Access, Am Law 200 only', 'API model id: gpt-6-astra-law, not yet open' and 'Headline benchmark: 54.0% vs 38.7% vendor-reported', above the footer 'All figures OpenAI-reported on a private validation set; no independent reproduction.' with the OrcaRouter logo composited in the bottom-right corner.

La demostración en el briefing fue concreta, no abstracta: Wu redactó una moción de desestimación para un hospital que enfrentaba una reclamación por discriminación por discapacidad y represalias, trabajó en una impugnación de accionistas a la venta de activos durante un fin de semana festivo y manejó una disputa por compromisos de ventas. Ninguna de esas es una capacidad nueva para un modelo de frontera. Lo nuevo es que la parte de recuperación de la tarea ya no se canaliza mediante la búsqueda web general.

El benchmark, léelo con atención.

Cuatro cifras salieron del lanzamiento, todas atribuidas a OpenAI, todas sobre el mismo conjunto de validación privado y todas merecedoras de distinguirse entre sí:

Corrección general — 54,0 % para Astra for Law frente a 38,7 % para GPT-6 Astra con búsqueda web, con el nivel más alto de esfuerzo de razonamiento.

Casos de referencia encontrados — un 24 % más en preguntas centradas en jurisprudencia, de nuevo con el nivel más alto de esfuerzo de razonamiento.

Pasajes relevantes recuperados — hasta un 54 % más de opiniones judiciales correctas, con el mismo esfuerzo de razonamiento que la referencia inicial.

Longitud de la respuesta — aproximadamente el doble de larga en promedio en las configuraciones de razonamiento probadas.

Esa última cifra es la que hay que poner junto a la primera. Una comprobación de corrección global que premia la cobertura es más fácil de superar con una respuesta más larga, y parte del aumento de 15,3 puntos es, plausiblemente, que la capa de recuperación simplemente ponga más material delante del modelo. Esto no es una crítica al resultado —encontrar un 24 % más de casos de referencia es una mejora real y expuesta por separado—, pero sí significa que la cifra compuesta y las cifras de recuperación deben leerse juntas, y no la compuesta por sí sola.

El problema de la división privada es el más importante. Un conjunto de validación que OpenAI posee y no publica no puede ser reejecutado por nadie, y la tabla de clasificación pública del mismo benchmark pinta un panorama más modesto: la propia página de comparación de Vals AI incluye a GPT-6 Astra con 39,42 % ±3,40 en Legal Research Bench, y a Gemini 3.8 Flash con 38,94 % ±3,39. Lo que haya producido el salto al 54,0 % no es visible en la tabla pública, porque la tabla pública está evaluando el modelo base sin el índice legal adjunto.

A screenshot of the Vals AI 'Compare Models' leaderboard captured September 18, 2026, comparing Gemini 3.8 Flash and GPT-6 Astra: Legal Research Bench (Agentic US legal research) shows Gemini 3.8 Flash 38.94% ±3.39 against GPT-6 Astra 39.42% ±3.40; Vals Index shows 62.25% against 66.61%; and the table also lists Finance Agent (V2) 61.44% vs 53.54%, Tax Agent Bench 66.77% vs 63.34%, MedCode 48.13% vs 48.49%, Terminal-Bench Science 8.57% vs 65.71%, Code Migration 36.55% vs 67.74%, Terminal-Bench 4.0 13.13% vs 57.07% and Vibe Code Bench v1.1 78.65% vs 89.59%, with a Vals Index date of 2026-09-11.

El cuadre de Legora, y el número dentro de él.

La evidencia de terceros más sustancial en la cobertura del lanzamiento es una prueba de flujo de trabajo de Legora, cuyo ingeniero legal, Percevale Perks, realizó un cuadre de estados financieros —cotejando cifras de cuentas preliminares con un balance de comprobación, un calendario de consolidación y cuentas de ejercicios anteriores—. El agente de Legora completó el cuadre de 41 documentos en una sola ejecución, en minutos, registrando cada comprobación y produciendo un registro línea por línea para su revisión. Encontró los cuatro errores que Legora había introducido en las cuentas, incluido un desfase de 500.000 £ oculto en la nota de ingresos, mantuvo todas las comprobaciones que el modelo anterior había superado y añadió aproximadamente cincuenta más.

Ese es un resultado genuinamente bueno en un conjunto de documentos genuinamente difícil. También es donde está enterrado el número más útil de todo el ciclo de lanzamiento. En el Benchmark for Agentic Reasoning de Legora, que abarca tareas legales reales de principio a fin, la mejora en el flujo de trabajo de estados financieros fue de alrededor del 40 % —y la mejora promedio en todas las tareas de BAR fue de alrededor del 3 %. Ambas cifras son de Legora, ambas describen el mismo modelo, y solo una de ellas trascendió. Si estás evaluando esto para un despacho, el 3 % es la cifra con la que conviene planificar y el 40 % es la cifra con la que se puede soñar.

Las pruebas independientes apuntan a un modo de fallo diferente.

Merece la pena poner dos evaluaciones independientes junto a las cifras de lanzamiento, con la advertencia de que ambas son pequeñas y de una única fuente.

HAQQ puso a prueba GPT-6 Astra contra 41 preguntas legales reales de 20 áreas de práctica con razonamiento medio. Astra lideró en sustancia jurídica con 17,63 sobre 20 — por menos de un punto. Costó $0,2622 por respuesta, aproximadamente once veces el costo por respuesta de GPT-5.6 Luna Pro por menos de un punto de mejora compuesta. La propia lectura de HAQQ es aguda: la ventaja no es que el modelo sea más inteligente, sino que deja de escribir. La misma prueba encontró que pasar el esfuerzo de razonamiento de bajo a alto multiplicó el costo por aproximadamente 1,5× y la latencia por aproximadamente 1,8×, mientras reducía la calidad evaluada en 0,17 puntos — una palanca de costos disfrazada de palanca de calidad, y una razón para fijar el ajuste de esfuerzo en lugar de dejarlo al máximo.

El hallazgo que debería llegar más lejos no tiene que ver con el costo. En jurisdicciones fuera de EE. UU., los tres modelos evaluados citaron la disposición correcta a la vez que tergiversaban lo que esta dice. Astra fue jurídicamente correcta en el 66,7 % de esos elementos; Claude Opus 5 lo fue en el 100 %. Un verificador de citas aprueba esa respuesta, porque la cita existe y es la correcta. Un cliente, no. Este es el modo de fallo que el índice de búsqueda legal está menos equipado para abordar, dado que el índice es solo de EE. UU. y el error está en la lectura, no en la recuperación.

Lo que realmente puedes obtener, y cuándo

Astra for Law no está disponible de forma general. El acceso se inicia a través de un nuevo programa de Acceso Confiable dirigido a las firmas del Am Law 200, ofrecido mediante ChatGPT y Codex. Se indica que la API llegará pronto bajo el id de modelo gpt-6-astra-law, y aparecerá en el selector de modelos como "GPT-6 Astra Law"; Harvey y Legora se mencionan como clientes de la API que desarrollarán sobre ella. No se ha publicado ningún precio para la configuración legal, lo cual constituye la mayor incógnita abierta para cualquiera que esté planificando su presupuesto en torno a ella.

Trusted Access conlleva dos condiciones de datos: retención cero de datos en la API y la exclusión por defecto del uso de ChatGPT Enterprise de la revisión humana. Cuando se le preguntó en la sesión informativa sobre las excepciones, Boehmig no afirmó que la política fuera absoluta: «Definitivamente es más complicado que la frase de una sola oración», dijo, y señaló que el acuerdo completo tiene unas 30 páginas, además de añadir que OpenAI confía en que esas 30 páginas cubren la necesidad. OpenAI dice que está trabajando con Latham & Watkins en permisos de información, barreras éticas, instrucciones de los clientes y supervisión de la firma.

La parte del ecosistema es más grande que la parte del modelo: 26 plugins de proveedores, entre ellos Thomson Reuters, Harvey, Legora, iManage, Relativity, Clio, Intapp y DeepJudge; nueve plugins de la comunidad, creados por grupos de ingeniería jurídica; y 47 habilidades personalizadas desarrolladas por usuarios avanzados del sector legal. ChatGPT for Word también alcanzó su disponibilidad general para la corrección de textos, las sugerencias de edición y los avisos de formato. Los ingenieros de OpenAI desplegados sobre el terreno trabajaron con Sullivan & Cromwell en un analizador de contratos, con Ropes & Gray en la diligencia debida de fusiones y adquisiciones, y con Cooley en GO Public.

Para que se entienda lo saturado que está ahora este nicho: Anthropic lanzó Claude for Legal en mayo de 2026, tres meses antes de que existiera Astra for Law.

Los riesgos que ningún benchmark en esa página captura

Nada en los materiales de lanzamiento aborda las dos preguntas de gobernanza que el asesor jurídico general de una firma planteará primero. A septiembre de 2026, no se había publicado ninguna certificación SOC 2, ISO o HIPAA para GPT-6 Astra, y no hay ningún detalle publicado sobre el aislamiento de datos específico de la firma, el despliegue local o la residencia de datos. La ausencia no es evidencia de fallo —simplemente no está documentado, lo cual es un problema distinto y uno que corresponde a la firma resolver antes de que se introduzca material privilegiado.

En el plano ético, las reglas operativas son la Regla Modelo 1.6 de la ABA sobre confidencialidad, que rige lo que un despacho puede compartir con un proveedor externo y puede exigir divulgaciones actualizadas y consentimiento informado, y la Regla 5.3 sobre supervisión de asistencia no abogada, que es donde recae la producción de la IA. La razón por la que ambas están vigentes en lugar de ser teóricas es Mata v. Avianca, donde se sancionó a unos abogados por presentar casos inexistentes generados por IA. Un índice de búsqueda legal sobre opiniones reales hace menos probable ese fallo específico. No lo hace imposible, y no hace nada respecto al fallo por lectura errónea de una disposición que HAQQ documentó.

Si quieres construir sobre esto antes de que se abra la API

La postura honesta hoy es que gpt-6-astra-law no está en la API de nadie, incluida la nuestra — OpenAI ha dicho que llegará pronto y no ha dado fecha. Lo que está disponible es el modelo base: openai/gpt-6-astra está en OrcaRouter con 0 % de margen, lo que significa que el precio de lista del proveedor de OpenAI se transmite sin cambios, por lo que un cambio de precio del proveedor en ese modelo se refleja el mismo día. Con una sola clave se accede a más de 200 modelos, con conmutación automática por error entre proveedores y un DSL de enrutamiento para componer varios modelos en una sola llamada.

A screenshot of OpenAI's developer documentation page for GPT-6 Astra, captured September 18, 2026, showing the model badge labelled 'Default' with the line 'Our most capable model, built for the hardest end-to-end work', a 1,050,000 context window, 128,000 max output tokens, an Apr 30 2026 knowledge cutoff, reasoning token support, and the pricing card reading Input $10.00, Cached input $1.00, Cache writes $12.50, Output $50.00 per 1M tokens, with the notes that prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request, that cache writes are billed at 1.25x the uncached input token rate, and that Batch and Flex are priced at 50% of Standard rates while Fast mode is priced at 2x.

La consecuencia práctica para un equipo de ingeniería jurídica es una división. Todo lo que hay en el flujo de trabajo de Astra for Law que no dependa del Índice de Búsqueda Jurídica —redactar a partir de los hechos que usted proporcione, reestructurar un conjunto de cláusulas, dar formato según la plantilla de un despacho, generar una lista de verificación para la revisión— se puede prototipar hoy con la versión base de GPT-6 Astra, y cambiar el id del modelo cuando se abra la variante para el ámbito jurídico sin modificar su integración. Todo lo que depende del índice no se puede prototipar, porque el índice es la parte que aún no está a la venta. Dos advertencias que conviene señalar con claridad: una solicitud enrutada no queda automáticamente cubierta por la aprobación de Zero Data Retention de OpenAI, que se concede por organización, por lo que un despacho que necesite ZDR debería confirmar la cobertura en la ruta específica que utilice; y un enrutador es un salto adicional en la ruta de los datos, lo cual supone un costo real para el material privilegiado, incluso cuando le aporta tolerancia a fallos.

Qué ver

Tres cosas, en orden de cuánto cambiarán el panorama. La fecha de la API para gpt-6-astra-law, ya que esa es la diferencia entre un piloto y un producto. El precio, ya que los 10 USD por millón de tokens de entrada y 50 USD por millón de tokens de salida del modelo base conllevan un reajuste de precio por contexto largo por encima de 272.000 tokens de entrada que los conjuntos de documentos legales superarán de forma habitual — y si la configuración legal tiene un precio superior a ese, la economía de una conciliación de 41 documentos cambia de manera sustancial. Y una nueva ejecución independiente de esas 200 preguntas sobre una partición que controle alguien más. Hasta que eso exista, 54,0 % es el número de OpenAI sobre la configuración de OpenAI, y la afirmación defendible es la más acotada: un índice de jurisprudencia de EE. UU. más instrucciones legales produce una recuperación sustancialmente mejor que la búsqueda web general en preguntas de investigación jurídica de EE. UU. Esa afirmación merece que se actúe en consecuencia. El resto merece esperar.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario