
Astra for Law vs GPT-6 Astra: mismos pesos, un índice de búsqueda adicional
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Astra for Law y GPT-6 Astra no son dos modelos, y plantear la elección como un enfrentamiento directo es lo primero que hay que acertar. Astra for Law es GPT-6 Astra con un índice de búsqueda jurídica de Estados Unidos incorporado a su ruta de recuperación, un conjunto de instrucciones de redacción jurídica superpuestas y herramientas jurídicas adjuntas. Los pesos son idénticos. Por lo tanto, la verdadera pregunta no es qué modelo es más inteligente — sino si vale la pena pagar un sobreprecio por el índice de búsqueda jurídica y, según la evidencia disponible hasta ahora, la respuesta depende casi por completo de si tu trabajo es la recuperación de jurisprudencia o la revisión de documentos.
Eso importa porque OpenAI no ha publicado un precio para la configuración legal, la API para ella no está abierta, y la única medición comparativa directa contra el modelo base proviene de la propia OpenAI en un conjunto de validación privado. Esta página analiza lo que realmente se sabe, lo que dicen los números independientes y a qué lado de la comparación corresponde una carga de trabajo legal determinada.
¿Qué los separa, exactamente?
Se añadieron tres cosas, y no son igualmente difíciles de replicar.
• Índice de Búsqueda Legal — recuperación sobre jurisprudencia, leyes, reglamentos, normas procesales y decisiones administrativas de EE. UU., más de 230 millones de URL, fuentes que se añaden a diario. Esta es la parte que no se puede construir a partir de un prompt.
• Corpus — se basa en CourtListener, la biblioteca de Free Law Project que abarca más del 99,9% de la jurisprudencia precedente publicada de EE. UU., complementada con contenido bajo licencia de proveedores como Thomson Reuters. La mitad pública es gratuita; la mitad bajo licencia y la actualización diaria no son algo que un despacho individual pueda reproducir.
• Instrucciones y ajustes — instrucciones de análisis jurídico y redacción jurídica, además de ajustes como la longitud de la respuesta. Estos operan a nivel de prompt y de configuración. Un equipo competente de ingeniería jurídica puede aproximar hoy una fracción significativa de ellos sobre el modelo base.

Solo en GPT-6 Astra, la recuperación pasa por la búsqueda web general. Esa es toda la diferencia en la ruta de investigación, y es el eje que mide cada número a continuación.
El único cara a cara que existe
OpenAI probó ambos sistemas con 200 preguntas de investigación jurídica de EE. UU. del conjunto de validación privado de Legal Research Bench de Vals AI. Con el mayor esfuerzo de razonamiento, Astra for Law superó la comprobación de corrección general en el 54,0 % de las preguntas, frente al 38,7 % de GPT-6 Astra con búsqueda web: 15,3 puntos, lo que se describe como una mejora relativa del 40 %. Cifras de apoyo de la misma ejecución: un 24 % más de casos de referencia encontrados en preguntas de jurisprudencia, hasta un 54 % más de pasajes relevantes recuperados de opiniones judiciales correctas con el mismo esfuerzo de razonamiento, y respuestas que promediaron aproximadamente el doble de longitud.
Tres advertencias deben acompañar a esas cifras, y ninguna de ellas es motivo para descartarlas. Primero, son de OpenAI, sobre una partición que OpenAI controla, y nada independiente las ha reproducido. Segundo, la duplicación de la longitud de las respuestas merece sopesarse junto con la puntuación compuesta, porque una verificación de corrección que recompensa la cobertura es más fácil de superar con una respuesta más larga; las cifras de recuperación (24% más de casos, 54% más de pasajes) son la evidencia más clara de lo que realmente aporta el índice. Tercero, la versión pública del mismo benchmark no muestra el salto: la propia página de comparación de Vals AI incluye a GPT-6 Astra con 39,42% ±3,40 en Legal Research Bench, con Gemini 3.8 Flash en 38,94% ±3,39. Ese es el modelo base, sin el índice, que queda esencialmente donde se sitúa la línea base de OpenAI.

Dos lecturas independientes complican aún más el panorama. Legora realizó una conciliación de estados financieros en 41 documentos en una sola pasada y encontró los cuatro errores introducidos, incluida una discrepancia de £500,000 en la nota de ingresos, añadiendo aproximadamente cincuenta verificaciones que el modelo anterior había pasado por alto —una mejora de alrededor del 40% en ese flujo de trabajo. En el Benchmark for Agentic Reasoning de Legora en general, sin embargo, la mejora promedio en todas las tareas fue de aproximadamente el 3%. Mientras tanto, la prueba de 41 preguntas de HAQQ en 20 áreas de práctica situó la ventaja de Astra en sustancia jurídica en 17,63 sobre 20, menos de un punto por delante de modelos más baratos, a $0.2622 por respuesta. Leídos en conjunto, el resumen honesto es que la ventaja de la configuración es grande y repetible en el trabajo de jurisprudencia estadounidense con gran carga de recuperación, escasa en razonamiento jurídico general y en gran medida no probada en derecho no estadounidense, donde la misma prueba encontró que los tres modelos citaban la disposición correcta mientras declaraban erróneamente lo que dice.
Cuánto cuesta realmente cada parte por respuesta legal
Astra for Law no tiene un precio publicado. La tarifa de GPT-6 Astra es pública, y es el número sobre el que debe construirse la comparación, porque la configuración legal es el mismo modelo más recuperación y no puede costar de forma plausible menos que el modelo que envuelve.
• Estándar — 10,00 $ por millón de tokens de entrada, 50,00 $ por millón de tokens de salida.
• Entrada en caché — $1.00 por millón, un descuento del 90 %, y la palanca que más importa para un despacho que reutiliza instrucciones permanentes y cláusulas modelo de precedentes.
• Escrituras en caché — 12,50 $ por millón, facturado a 1,25× la tarifa de entrada sin caché; el caché compensa desde la segunda reutilización en adelante.
• Más de 272,000 tokens de entrada — tarifas de entrada y caché 2× y de salida 1.5×, aplicadas a la solicitud completa, no solo los tokens por encima del umbral. En la práctica, eso significa $20.00 de entrada y $75.00 de salida por millón para cualquier solicitud larga.
• Por lotes — 50 % del Estándar. Modo rápido — 2× el Estándar, y no disponible para GPT-6 Astra con residencia de datos en la UE.
Ese umbral de 272K no es una nota al pie de esta comparación; es su centro. Un cuadre de 41 documentos, un conjunto completo de transcripciones de deposiciones o un expediente de acuerdo de varios años supera habitualmente los 272.000 tokens, lo que significa que la tarifa jurídica realista es la fila de contexto largo —$20,00 de entrada y $75,00 de salida—, no el titular de $10/$50. Para un despacho que dimensiona un proyecto piloto, la diferencia entre esas dos filas es la diferencia entre un proyecto que se ajusta a un presupuesto y uno que no, y es una razón para medir el volumen real de tokens por asunto antes de comprometerse, y no después.
Dos notas más sobre costos provenientes de pruebas independientes. HAQQ midió $0.2622 por respuesta en Astra, aproximadamente once veces el costo por respuesta de GPT-5.6 Luna Pro por menos de un punto de ganancia compuesta —pero también señaló que la brecha se debe en parte a que Astra escribe alrededor de 3.5× menos tokens que Claude Opus 5, lo que hace que su costo por respuesta sea menor que el de Opus 5 para esa carga de trabajo. Y esa misma prueba encontró que el control de esfuerzo de razonamiento se comporta como una palanca de costo en lugar de una palanca de calidad: pasar de bajo a alto multiplicó el costo por alrededor de 1.5× y la latencia por alrededor de 1.8×, mientras que la calidad evaluada cayó 0.17 puntos. Fija el ajuste de esfuerzo; no lo dejes en el máximo por defecto.
Cuando el modelo base es la mejor compra
El argumento a favor de GPT-6 Astra por sí solo es más sólido de lo que sugiere el planteamiento del lanzamiento, y se apoya en tres observaciones.
• Su trabajo no es la recuperación de jurisprudencia de EE. UU. El índice es exclusivo de EE. UU. Para la redacción de contratos, la reestructuración de cláusulas, la recepción de clientes, la elaboración de cronologías o el resumen de documentos que ya tiene en mano, lo que Astra for Law aporta es en gran medida inerte.
• Ya pagas por investigación jurídica primaria. Un despacho con suscripciones a Westlaw o LexisNexis está comprando la misma cobertura de precedentes dos veces si además paga un sobreprecio por una capa de recuperación que no puede auditar.
• Quieres la ruta de recuperación que tú controlas. Alimentar a GPT-6 Astra base con un conjunto de documentos curado te da una procedencia de citas que puedes inspeccionar, y ninguna dependencia de la actualización del índice de un proveedor.
Existen pruebas de terceros de que el modelo base no es el eslabón débil. En la clasificación de abogados corporativos APEX-Agents de Mercor, una configuración de GPT-6 Astra obtuvo un 73,4 % de Pass@1 en 160 tareas —un resultado de terceros en una carga de trabajo de agentes jurídicos, que se suma al aumento medio del 3 % que Legora midió en su propio conjunto de benchmarks—. Ninguno de los dos datos tiene que ver con el índice de búsqueda, y ambos sugieren que el modelo subyacente ya está haciendo la mayor parte del trabajo jurídico.
Cuando la configuración se gana su prima
El argumento a favor de Astra for Law es más acotado y, cuando aplica, decisivo. Si su carga de trabajo consiste en encontrar y aplicar autoridad de EE. UU. —armar la lista de casos de un escrito, comprobar si una postura sobrevive a una línea de decisiones, realizar un relevamiento regulatorio de los cincuenta estados—, entonces un 24 % más de casos de referencia y hasta un 54 % más de pasajes relevantes no es una mejora marginal: es la diferencia entre un asistente que pasa por alto autoridad y uno que no. El cotejo de Legora es la mejor ilustración disponible del mismo efecto en documentos en lugar de jurisprudencia: hacer referencias cruzadas de 41 archivos en una sola pasada es exactamente el trabajo de comparación de gran volumen y contexto extenso donde más contexto recuperado se acumula.
La salvedad honesta en ambos casos: el precio no se divulga, el acceso está restringido a las firmas de Am Law 200 a través del programa Trusted Access, y ningún laboratorio independiente ha vuelto a realizar la comparación directa. Se le pide comprometerse a pagar un sobreprecio basándose en el benchmark de un proveedor y en la prueba de flujo de trabajo de un solo socio.
Ejecutando ambos a través de un solo endpoint
La cuestión de enrutamiento aquí es un problema de secuenciación más que una elección. gpt-6-astra-law todavía no está en ninguna API, incluida la nuestra — OpenAI ha dicho que llegará pronto y no ha indicado ninguna fecha —, así que hoy la única mitad de esta comparación que puedes invocar de verdad es el modelo base. Lo que sí está disponible ahora es openai/gpt-6-astra en OrcaRouter con 0% de margen, con el precio de lista del proveedor trasladado sin cambios, de modo que las filas de $10/$50 y $20/$75 de arriba son lo que pagas y un cambio de precio del proveedor se aplica el mismo día. Más de 200 modelos están detrás de una sola clave, con conmutación por error automática entre proveedores.

El DSL de enrutamiento es la pieza que se corresponde con esta decisión concreta. Como la diferencia entre ambos productos es un paso de recuperación, puedes componerlo tú mismo: enruta el modelo base con tu propia recuperación de documentos en una única llamada y compara la salida con la misma pregunta enviada solo con búsqueda web. Esa es una forma barata de medir cuánto de la brecha de 54,0 % frente a 38,7 % reproduce tu propio corpus, antes de comprometerte con un producto premium con acceso restringido. La fusión de modelos, que ejecuta un panel de modelos sobre un mismo prompt, cubre la otra mitad: si tu preocupación es que un solo modelo malinterprete una disposición, como descubrió HAQQ en legislación no estadounidense, un panel revela el desacuerdo en lugar de ocultarlo. Como el enrutamiento mantiene ambas opciones con una sola clave, cambiar el id del modelo cuando se abra gpt-6-astra-law es un cambio de configuración, no una reintegración.
Una salvedad que conviene explicitar en lugar de ocultar: una solicitud enrutada no queda cubierta automáticamente por la aprobación de Zero Data Retention de OpenAI, que se concede por organización, así que una empresa que necesite ZDR debería confirmar la cobertura en la ruta que utiliza. Y un enrutador es un salto más en la ruta de los datos —un costo real para material privilegiado, incluso cuando aporta conmutación por error.
Donde esto acaba
Si vas a elegir hoy, elige el modelo base. Astra for Law aún no se puede comprar, se desconoce su premium, y la evidencia independiente dice que GPT-6 Astra ya rinde a un alto nivel en cargas de trabajo de agentes legales sin el índice. Construye sobre openai/gpt-6-astra ahora, mide tu propia brecha de recuperación y deja que la contabilidad de tokens te diga si cruzas los 272K con la frecuencia suficiente como para que te importe la fila de contexto largo.
Luego vuelve a revisarlo cuando se conozcan tres cosas: el precio de gpt-6-astra-law, la forma de sus términos de API y una repetición independiente de la comparación directa de 200 preguntas en una partición que controle alguien distinto de OpenAI. Si el precio se acerca a la tarifa base y las mejoras en la recuperación se mantienen fuera del conjunto de validación de OpenAI, la configuración se convierte en la opción predeterminada obvia para el trabajo intensivo en investigación de EE. UU. y el modelo base sigue siendo el adecuado para todo lo demás. Hasta entonces, la afirmación defendible es la más limitada: un índice de jurisprudencia de EE. UU. más instrucciones legales recupera sustancialmente mejor que la búsqueda web general en preguntas legales de EE. UU. Vale la pena pagar algo por eso. Cuánto es todavía una pregunta abierta.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
