
Presentamos Astra for Law: OpenAI pone un índice de búsqueda legal detrás de GPT-6 Astra
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Astra for Law se anunció el 17 de septiembre de 2026 —una configuración de trabajo jurídico construida sobre GPT-6 Astra, el modelo insignia que la compañía lanzó dos semanas antes, el 3 de septiembre. No es un modelo nuevo. Son los mismos pesos detrás de una puerta de entrada distinta: un índice de búsqueda jurídica dedicado, instrucciones específicas para el ámbito legal y un conjunto de herramientas orientadas a la investigación de jurisprudencia de Estados Unidos. Esa distinción importa más de lo que sugiere el encuadre del lanzamiento, porque cada cifra del anuncio mide la configuración frente al modelo base en lugar de una capacidad nueva —y la configuración hace casi todo el trabajo.
La afirmación principal es que Astra for Law superó la verificación general de corrección en el 54,0 % de 200 preguntas de investigación jurídica de EE. UU. extraídas del conjunto privado de validación del Legal Research Bench de Vals AI, frente al 38,7 % de GPT-6 Astra usando únicamente búsqueda web —una mejora relativa del 40 %, según lo cuenta OpenAI. Son cifras reportadas por el proveedor sobre una partición privada, y ningún laboratorio independiente las ha reproducido. Lo que es visible de forma independiente es más útil: la propia comparación pública de Vals AI incluye a GPT-6 Astra con 39,42 % ±3,40 en ese benchmark, que es esencialmente la línea base contra la que OpenAI está midiendo. La brecha proviene del índice de búsqueda jurídica y de las instrucciones, no de que el modelo se haya convertido en un mejor abogado.
Esto es lo que se lanzó, lo que se ha medido realmente y lo que todavía falta.
¿Qué es realmente Astra for Law?
Se añadieron tres cosas sobre GPT-6 Astra, y ninguna de ellas es un cambio de pesos. En una sesión informativa para medios, Jason Boehmig —el cofundador de Ironclad al que OpenAI contrató en junio de 2026— y el ingeniero Sherwin Wu describieron el lanzamiento como una configuración de instrucciones de dominio, ajustes como la longitud de las respuestas y herramientas para el sector legal que se espera que se amplíen con el tiempo.
• Índice de Búsqueda Jurídica — una capa de recuperación sobre jurisprudencia, estatutos, reglamentos, normas procesales y decisiones administrativas de EE. UU. que abarca más de 230 millones de URL, con fuentes que se añaden a diario.
• Procedencia del corpus — el índice se nutre de CourtListener, la biblioteca mantenida por la organización sin ánimo de lucro Free Law Project, que según OpenAI cubre más del 99,9 % de la jurisprudencia precedencial publicada de Estados Unidos. Complementa el contenido con licencia de proveedores como Thomson Reuters.
• Instrucciones jurídicas — un conjunto de instrucciones de dominio para aplicar la investigación a los hechos, desarrollar argumentos o términos del acuerdo, y sacar a la luz debilidades o incertidumbre en una posición.

La demostración en el briefing fue concreta, no abstracta: Wu redactó una moción de desestimación para un hospital que enfrentaba una reclamación por discriminación por discapacidad y represalias, trabajó en una impugnación de accionistas a la venta de activos durante un fin de semana festivo y manejó una disputa por compromisos de ventas. Ninguna de esas es una capacidad nueva para un modelo de frontera. Lo nuevo es que la parte de recuperación de la tarea ya no se canaliza mediante la búsqueda web general.
El benchmark, léelo con atención.
Cuatro cifras salieron del lanzamiento, todas atribuidas a OpenAI, todas sobre el mismo conjunto de validación privado y todas merecedoras de distinguirse entre sí:
• Corrección general — 54,0 % para Astra for Law frente a 38,7 % para GPT-6 Astra con búsqueda web, con el nivel más alto de esfuerzo de razonamiento.
• Casos de referencia encontrados — un 24 % más en preguntas centradas en jurisprudencia, de nuevo con el nivel más alto de esfuerzo de razonamiento.
• Pasajes relevantes recuperados — hasta un 54 % más de opiniones judiciales correctas, con el mismo esfuerzo de razonamiento que la referencia inicial.
• Longitud de la respuesta — aproximadamente el doble de larga en promedio en las configuraciones de razonamiento probadas.
Esa última cifra es la que hay que poner junto a la primera. Una comprobación de corrección global que premia la cobertura es más fácil de superar con una respuesta más larga, y parte del aumento de 15,3 puntos es, plausiblemente, que la capa de recuperación simplemente ponga más material delante del modelo. Esto no es una crítica al resultado —encontrar un 24 % más de casos de referencia es una mejora real y expuesta por separado—, pero sí significa que la cifra compuesta y las cifras de recuperación deben leerse juntas, y no la compuesta por sí sola.
El problema de la división privada es el más importante. Un conjunto de validación que OpenAI posee y no publica no puede ser reejecutado por nadie, y la tabla de clasificación pública del mismo benchmark pinta un panorama más modesto: la propia página de comparación de Vals AI incluye a GPT-6 Astra con 39,42 % ±3,40 en Legal Research Bench, y a Gemini 3.8 Flash con 38,94 % ±3,39. Lo que haya producido el salto al 54,0 % no es visible en la tabla pública, porque la tabla pública está evaluando el modelo base sin el índice legal adjunto.

El cuadre de Legora, y el número dentro de él.
La evidencia de terceros más sustancial en la cobertura del lanzamiento es una prueba de flujo de trabajo de Legora, cuyo ingeniero legal, Percevale Perks, realizó un cuadre de estados financieros —cotejando cifras de cuentas preliminares con un balance de comprobación, un calendario de consolidación y cuentas de ejercicios anteriores—. El agente de Legora completó el cuadre de 41 documentos en una sola ejecución, en minutos, registrando cada comprobación y produciendo un registro línea por línea para su revisión. Encontró los cuatro errores que Legora había introducido en las cuentas, incluido un desfase de 500.000 £ oculto en la nota de ingresos, mantuvo todas las comprobaciones que el modelo anterior había superado y añadió aproximadamente cincuenta más.
Ese es un resultado genuinamente bueno en un conjunto de documentos genuinamente difícil. También es donde está enterrado el número más útil de todo el ciclo de lanzamiento. En el Benchmark for Agentic Reasoning de Legora, que abarca tareas legales reales de principio a fin, la mejora en el flujo de trabajo de estados financieros fue de alrededor del 40 % —y la mejora promedio en todas las tareas de BAR fue de alrededor del 3 %. Ambas cifras son de Legora, ambas describen el mismo modelo, y solo una de ellas trascendió. Si estás evaluando esto para un despacho, el 3 % es la cifra con la que conviene planificar y el 40 % es la cifra con la que se puede soñar.
Las pruebas independientes apuntan a un modo de fallo diferente.
Merece la pena poner dos evaluaciones independientes junto a las cifras de lanzamiento, con la advertencia de que ambas son pequeñas y de una única fuente.
HAQQ puso a prueba GPT-6 Astra contra 41 preguntas legales reales de 20 áreas de práctica con razonamiento medio. Astra lideró en sustancia jurídica con 17,63 sobre 20 — por menos de un punto. Costó $0,2622 por respuesta, aproximadamente once veces el costo por respuesta de GPT-5.6 Luna Pro por menos de un punto de mejora compuesta. La propia lectura de HAQQ es aguda: la ventaja no es que el modelo sea más inteligente, sino que deja de escribir. La misma prueba encontró que pasar el esfuerzo de razonamiento de bajo a alto multiplicó el costo por aproximadamente 1,5× y la latencia por aproximadamente 1,8×, mientras reducía la calidad evaluada en 0,17 puntos — una palanca de costos disfrazada de palanca de calidad, y una razón para fijar el ajuste de esfuerzo en lugar de dejarlo al máximo.
El hallazgo que debería llegar más lejos no tiene que ver con el costo. En jurisdicciones fuera de EE. UU., los tres modelos evaluados citaron la disposición correcta a la vez que tergiversaban lo que esta dice. Astra fue jurídicamente correcta en el 66,7 % de esos elementos; Claude Opus 5 lo fue en el 100 %. Un verificador de citas aprueba esa respuesta, porque la cita existe y es la correcta. Un cliente, no. Este es el modo de fallo que el índice de búsqueda legal está menos equipado para abordar, dado que el índice es solo de EE. UU. y el error está en la lectura, no en la recuperación.
Lo que realmente puedes obtener, y cuándo
Astra for Law no está disponible de forma general. El acceso se inicia a través de un nuevo programa de Acceso Confiable dirigido a las firmas del Am Law 200, ofrecido mediante ChatGPT y Codex. Se indica que la API llegará pronto bajo el id de modelo gpt-6-astra-law, y aparecerá en el selector de modelos como "GPT-6 Astra Law"; Harvey y Legora se mencionan como clientes de la API que desarrollarán sobre ella. No se ha publicado ningún precio para la configuración legal, lo cual constituye la mayor incógnita abierta para cualquiera que esté planificando su presupuesto en torno a ella.
Trusted Access conlleva dos condiciones de datos: retención cero de datos en la API y la exclusión por defecto del uso de ChatGPT Enterprise de la revisión humana. Cuando se le preguntó en la sesión informativa sobre las excepciones, Boehmig no afirmó que la política fuera absoluta: «Definitivamente es más complicado que la frase de una sola oración», dijo, y señaló que el acuerdo completo tiene unas 30 páginas, además de añadir que OpenAI confía en que esas 30 páginas cubren la necesidad. OpenAI dice que está trabajando con Latham & Watkins en permisos de información, barreras éticas, instrucciones de los clientes y supervisión de la firma.
La parte del ecosistema es más grande que la parte del modelo: 26 plugins de proveedores, entre ellos Thomson Reuters, Harvey, Legora, iManage, Relativity, Clio, Intapp y DeepJudge; nueve plugins de la comunidad, creados por grupos de ingeniería jurídica; y 47 habilidades personalizadas desarrolladas por usuarios avanzados del sector legal. ChatGPT for Word también alcanzó su disponibilidad general para la corrección de textos, las sugerencias de edición y los avisos de formato. Los ingenieros de OpenAI desplegados sobre el terreno trabajaron con Sullivan & Cromwell en un analizador de contratos, con Ropes & Gray en la diligencia debida de fusiones y adquisiciones, y con Cooley en GO Public.
Para que se entienda lo saturado que está ahora este nicho: Anthropic lanzó Claude for Legal en mayo de 2026, tres meses antes de que existiera Astra for Law.
Los riesgos que ningún benchmark en esa página captura
Nada en los materiales de lanzamiento aborda las dos preguntas de gobernanza que el asesor jurídico general de una firma planteará primero. A septiembre de 2026, no se había publicado ninguna certificación SOC 2, ISO o HIPAA para GPT-6 Astra, y no hay ningún detalle publicado sobre el aislamiento de datos específico de la firma, el despliegue local o la residencia de datos. La ausencia no es evidencia de fallo —simplemente no está documentado, lo cual es un problema distinto y uno que corresponde a la firma resolver antes de que se introduzca material privilegiado.
En el plano ético, las reglas operativas son la Regla Modelo 1.6 de la ABA sobre confidencialidad, que rige lo que un despacho puede compartir con un proveedor externo y puede exigir divulgaciones actualizadas y consentimiento informado, y la Regla 5.3 sobre supervisión de asistencia no abogada, que es donde recae la producción de la IA. La razón por la que ambas están vigentes en lugar de ser teóricas es Mata v. Avianca, donde se sancionó a unos abogados por presentar casos inexistentes generados por IA. Un índice de búsqueda legal sobre opiniones reales hace menos probable ese fallo específico. No lo hace imposible, y no hace nada respecto al fallo por lectura errónea de una disposición que HAQQ documentó.
Si quieres construir sobre esto antes de que se abra la API
La postura honesta hoy es que gpt-6-astra-law no está en la API de nadie, incluida la nuestra — OpenAI ha dicho que llegará pronto y no ha dado fecha. Lo que está disponible es el modelo base: openai/gpt-6-astra está en OrcaRouter con 0 % de margen, lo que significa que el precio de lista del proveedor de OpenAI se transmite sin cambios, por lo que un cambio de precio del proveedor en ese modelo se refleja el mismo día. Con una sola clave se accede a más de 200 modelos, con conmutación automática por error entre proveedores y un DSL de enrutamiento para componer varios modelos en una sola llamada.

La consecuencia práctica para un equipo de ingeniería jurídica es una división. Todo lo que hay en el flujo de trabajo de Astra for Law que no dependa del Índice de Búsqueda Jurídica —redactar a partir de los hechos que usted proporcione, reestructurar un conjunto de cláusulas, dar formato según la plantilla de un despacho, generar una lista de verificación para la revisión— se puede prototipar hoy con la versión base de GPT-6 Astra, y cambiar el id del modelo cuando se abra la variante para el ámbito jurídico sin modificar su integración. Todo lo que depende del índice no se puede prototipar, porque el índice es la parte que aún no está a la venta. Dos advertencias que conviene señalar con claridad: una solicitud enrutada no queda automáticamente cubierta por la aprobación de Zero Data Retention de OpenAI, que se concede por organización, por lo que un despacho que necesite ZDR debería confirmar la cobertura en la ruta específica que utilice; y un enrutador es un salto adicional en la ruta de los datos, lo cual supone un costo real para el material privilegiado, incluso cuando le aporta tolerancia a fallos.
Qué ver
Tres cosas, en orden de cuánto cambiarán el panorama. La fecha de la API para gpt-6-astra-law, ya que esa es la diferencia entre un piloto y un producto. El precio, ya que los 10 USD por millón de tokens de entrada y 50 USD por millón de tokens de salida del modelo base conllevan un reajuste de precio por contexto largo por encima de 272.000 tokens de entrada que los conjuntos de documentos legales superarán de forma habitual — y si la configuración legal tiene un precio superior a ese, la economía de una conciliación de 41 documentos cambia de manera sustancial. Y una nueva ejecución independiente de esas 200 preguntas sobre una partición que controle alguien más. Hasta que eso exista, 54,0 % es el número de OpenAI sobre la configuración de OpenAI, y la afirmación defendible es la más acotada: un índice de jurisprudencia de EE. UU. más instrucciones legales produce una recuperación sustancialmente mejor que la búsqueda web general en preguntas de investigación jurídica de EE. UU. Esa afirmación merece que se actúe en consecuencia. El resto merece esperar.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
