
Apresentando o Astra for Law: a OpenAI coloca um índice de busca jurídica por trás do GPT-6 Astra
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Astra for Law foi anunciado em 17 de setembro de 2026 — uma configuração de trabalho jurídico construída sobre o GPT-6 Astra, o modelo de ponta que a empresa lançou duas semanas antes, em 3 de setembro. Não é um novo modelo. São os mesmos pesos por trás de uma porta de entrada diferente: um índice dedicado de pesquisa jurídica, instruções específicas para o direito e um conjunto de ferramentas voltadas para a pesquisa de jurisprudência dos Estados Unidos. Essa distinção importa mais do que o enquadramento do lançamento sugere, porque cada número no anúncio mede a configuração em relação ao modelo base, e não uma nova capacidade — e a configuração está fazendo quase todo o trabalho.
A alegação principal é que o Astra for Law passou na verificação de correção geral em 54,0% de 200 perguntas de pesquisa jurídica dos EUA extraídas do conjunto de validação privado do Legal Research Bench da Vals AI, contra 38,7% do GPT-6 Astra usando apenas busca na web — uma melhoria relativa de 40%, como relata a OpenAI. Esses são números relatados pelo fornecedor em uma divisão privada, e nenhum laboratório independente os reproduziu. O que é visível de forma independente é mais útil: a própria comparação pública da Vals AI lista o GPT-6 Astra em 39,42% ±3,40 nesse benchmark, que é essencialmente a linha de base contra a qual a OpenAI está medindo. A diferença vem do índice de busca jurídica e das instruções, não porque o modelo tenha se tornado um advogado melhor.
Eis o que foi entregue, o que foi realmente medido e o que ainda falta.
O que o Astra for Law realmente é
Três coisas foram acrescentadas ao GPT-6 Astra, e nenhuma delas é uma alteração nos pesos. Em um briefing com a imprensa, Jason Boehmig — o cofundador da Ironclad que a OpenAI contratou em junho de 2026 — e o engenheiro Sherwin Wu descreveram o lançamento como uma configuração de instruções de domínio, definições como o comprimento da resposta e ferramentas para o setor jurídico que devem se expandir com o tempo.
• Legal Search Index — uma camada de recuperação sobre jurisprudência, estatutos, regulamentos, regras judiciais e decisões administrativas dos EUA, abrangendo mais de 230 milhões de URLs, com fontes adicionadas diariamente.
• Proveniência do corpus — o índice baseia-se no CourtListener, a biblioteca mantida pela organização sem fins lucrativos Free Law Project, que, segundo a OpenAI, cobre mais de 99,9% da jurisprudência precedencial publicada nos EUA. Ele complementa conteúdo licenciado de fornecedores, incluindo a Thomson Reuters.
• Instruções jurídicas — um conjunto de instruções de domínio para aplicar pesquisa aos fatos, desenvolver argumentos ou termos do acordo, e revelar fragilidades ou incertezas em uma posição.

A demonstração no briefing foi concreta, e não abstrata: Wu redigiu uma moção de arquivamento para um hospital que enfrentava uma alegação de discriminação por deficiência e retaliação, trabalhou em uma contestação de acionista a uma venda de ativos durante um fim de semana de feriado e lidou com uma disputa sobre compromisso de vendas. Nenhuma dessas é uma nova capacidade para um modelo de fronteira. O que é novo é que a metade de recuperação do trabalho já não passa pela pesquisa geral na web.
O benchmark, leia com atenção.
Quatro números saíram do lançamento, todos atribuídos à OpenAI, todos no mesmo conjunto de validação privado, e todos merecem ser distinguidos entre si:
• Correção geral — 54,0% para o Astra for Law versus 38,7% para o GPT-6 Astra com pesquisa na web, no nível mais alto de esforço de raciocínio.
• Casos de referência encontrados — 24% mais em questões focadas em jurisprudência, novamente no nível mais alto de esforço de raciocínio.
• Trechos relevantes recuperados — até 54% mais de decisões judiciais corretas, com o mesmo esforço de raciocínio da linha de base.
• Comprimento da resposta — em média, cerca de duas vezes mais longo nas configurações de raciocínio testadas.
Esse último número é o que deve ser colocado ao lado do primeiro. Uma verificação de correção global que recompensa a cobertura é mais fácil de passar com uma resposta mais longa, e parte do ganho de 15,3 pontos é, plausivelmente, a camada de recuperação simplesmente colocando mais material diante do modelo. Isto não é uma crítica ao resultado — encontrar 24% mais casos de referência é uma melhoria real, declarada separadamente —, mas significa que o número composto e os números de recuperação devem ser lidos em conjunto, e não o composto isoladamente.
O problema da divisão privada é o maior. Um conjunto de validação que a OpenAI mantém e não publica não pode ser reexecutado por ninguém, e o leaderboard público do mesmo benchmark conta uma história mais modesta: a própria página de comparação da Vals AI lista o GPT-6 Astra com 39,42% ±3,40 no Legal Research Bench, com o Gemini 3.8 Flash em 38,94% ±3,39. O que quer que tenha causado o salto para 54,0% não aparece no quadro público, porque o quadro público está avaliando o modelo base sem o índice jurídico anexado.

O tie-out da Legora, e o número dentro dele
A prova de terceiros mais substancial na cobertura do lançamento é um teste de fluxo de trabalho da Legora, cujo engenheiro jurídico Percevale Perks realizou uma conciliação de demonstrações financeiras — comparando os valores das contas provisórias com um balancete, um mapa de consolidação e contas de exercícios anteriores. O agente da Legora concluiu a conciliação em 41 documentos numa única execução, em minutos, registando cada verificação e produzindo um registo linha a linha para revisão. Encontrou todos os quatro erros que a Legora tinha introduzido nas contas, incluindo uma diferença de £500.000 oculta na nota de receitas, manteve todas as verificações que o modelo anterior tinha aprovado e acrescentou cerca de mais cinquenta.
Isso é um resultado genuinamente bom num conjunto de documentos genuinamente difícil. É também onde está enterrado o número mais útil de todo o ciclo de lançamento. No Benchmark for Agentic Reasoning da Legora, que abrange tarefas jurídicas reais de ponta a ponta, a melhoria no fluxo de trabalho de demonstrações financeiras foi de cerca de 40% — e a melhoria média em todas as tarefas do BAR foi de cerca de 3%. Ambos os números são da Legora, ambos descrevem o mesmo modelo, e apenas um deles circulou. Se está a avaliar isto para um escritório, os 3% são o valor com que deve planear e os 40% são o valor com que pode sonhar.
Testes independentes apontam para um modo de falha diferente
Duas avaliações independentes merecem ser colocadas ao lado dos números de lançamento, com a ressalva de que ambas são pequenas e de fonte única.
A HAQQ testou o GPT-6 Astra em 41 perguntas jurídicas reais de 20 áreas de atuação com raciocínio médio. O Astra liderou em substância jurídica com 17,63 de 20 — por menos de um ponto. Custou US$ 0,2622 por resposta, cerca de onze vezes o custo por resposta do GPT-5.6 Luna Pro por menos de um ponto de ganho composto. A avaliação da própria HAQQ é incisiva: a vantagem não é que o modelo seja mais inteligente, e sim que ele para de escrever. O mesmo teste descobriu que mudar o esforço de raciocínio de baixo para alto multiplicou o custo por cerca de 1,5× e a latência por cerca de 1,8×, ao mesmo tempo que reduziu a qualidade avaliada em 0,17 ponto — uma alavanca de custo disfarçada de alavanca de qualidade, e um motivo para fixar a configuração de esforço em vez de deixá-la no máximo.
A conclusão que deveria ter maior alcance não diz respeito a custo. Em jurisdições fora dos Estados Unidos, os três modelos testados citaram a disposição correta, mas deturparam o que ela diz. O Astra estava juridicamente correto em 66,7% desses itens; o Claude Opus 5 estava correto em 100%. Um verificador de citações aprova essa resposta, porque a citação existe e é a correta. Um cliente, não. Esse é o modo de falha que o índice de busca jurídica está menos equipado para resolver, já que o índice abrange apenas os Estados Unidos e o erro está na leitura, não na recuperação.
O que você pode realmente obter, e quando
O Astra for Law não está disponível para o público em geral. O acesso começa por meio de um novo programa Trusted Access voltado para escritórios da Am Law 200, disponibilizado por meio do ChatGPT e do Codex. A API é descrita como "em breve" sob o id de modelo gpt-6-astra-law, aparecendo no seletor de modelos como "GPT-6 Astra Law"; Harvey e Legora são nomeados como clientes da API que construirão sobre ela. Nenhum preço para a configuração jurídica foi publicado, o que é a maior questão em aberto para quem está orçando com base nela.
O Trusted Access inclui dois termos de dados: Retenção Zero de Dados na API e exclusão do uso do ChatGPT Enterprise da revisão humana por padrão. Questionado no briefing sobre exceções, Boehmig não afirmou que a política era absoluta: “É definitivamente mais complicado do que a frase única”, disse ele, observando que o acordo completo tem cerca de 30 páginas e acrescentando que a OpenAI está confiante de que essas 30 páginas atendem à necessidade. A OpenAI diz que está trabalhando com a Latham & Watkins em permissões de informação, barreiras éticas, instruções de clientes e supervisão do escritório.
A parte do ecossistema é maior do que a parte do modelo: 26 plugins de fornecedores, incluindo Thomson Reuters, Harvey, Legora, iManage, Relativity, Clio, Intapp e DeepJudge; nove plugins da comunidade de grupos de engenharia jurídica; e 47 habilidades personalizadas criadas por usuários avançados da área jurídica. O ChatGPT for Word também alcançou disponibilidade geral para revisão, sugestões de edição e sinalizações de formatação. Engenheiros forward-deployed da OpenAI trabalharam com Sullivan & Cromwell em um analisador de contratos, Ropes & Gray em due diligence de M&A, e Cooley no GO Public.
Para dar contexto sobre o quão concorrido esse nicho está agora: a Anthropic lançou o Claude for Legal em maio de 2026, três meses antes de o Astra for Law existir.
Os riscos que nenhum benchmark naquela página captura
Nada nos materiais de lançamento aborda as duas questões de governança que o diretor jurídico de uma empresa fará primeiro. Em setembro de 2026, nenhuma certificação SOC 2, ISO ou HIPAA havia sido publicada para o GPT-6 Astra, e não há detalhes publicados sobre siloização de dados específica da empresa, implantação local ou residência de dados. A ausência não é evidência de falha — é simplesmente falta de documentação, o que é um problema diferente e que cabe à empresa resolver antes que material privilegiado seja inserido.
Do lado da ética, as regras operativas são a Regra Modelo 1.6 da ABA, sobre confidencialidade, que rege o que um escritório pode compartilhar com um prestador terceirizado e pode exigir divulgações atualizadas e consentimento informado, e a Regra 5.3, sobre supervisão de assistência de não advogados, que é onde se enquadram os resultados da IA. A razão pela qual ambas são aplicáveis, e não teóricas, é Mata v. Avianca, no qual advogados foram sancionados por apresentar em juízo casos inexistentes gerados por IA. Um índice de busca jurídica sobre decisões reais torna essa falha específica menos provável. Ele não a torna impossível, e não faz nada em relação à falha de leitura equivocada de dispositivo documentada pela HAQQ.
Se você quiser desenvolver em cima disso antes que a API abra
A posição honesta hoje é que o gpt-6-astra-law não está na API de ninguém, nem na nossa — a OpenAI disse que virá em breve e não informou data. O que está disponível é o modelo base: openai/gpt-6-astra está no OrcaRouter com 0% de markup, o que significa que o preço de tabela do provedor da OpenAI é repassado sem alterações, então uma mudança de preço do fornecedor nesse modelo é refletida no mesmo dia. Uma única chave acessa mais de 200 modelos, com failover automático entre provedores e uma DSL de roteamento para compor vários modelos em uma única chamada.

A consequência prática para uma equipe de engenharia jurídica é uma divisão. Tudo no fluxo de trabalho do Astra for Law que não depende do Legal Search Index — redigir a partir de fatos que você fornece, reestruturar um conjunto de cláusulas, formatar conforme um modelo do escritório, gerar uma lista de verificação de revisão — você pode prototipar hoje no GPT-6 Astra base, e trocar o ID do modelo quando a variante jurídica abrir, sem alterar sua integração. Tudo que depende do índice você não pode prototipar, porque o índice é a parte que ainda não está à venda. Duas ressalvas que vale a pena declarar sem rodeios: uma solicitação roteada não é automaticamente coberta pela aprovação de Zero Data Retention da OpenAI, que é concedida por organização, então um escritório de advocacia que precisa de ZDR deve confirmar a cobertura na rota específica que usa; e um roteador é um salto extra no caminho dos dados, o que é um custo real para material privilegiado mesmo quando oferece failover.
O que assistir
Três coisas, em ordem de quanto elas vão mudar o quadro. A data de disponibilidade da API do gpt-6-astra-law, já que essa é a diferença entre um piloto e um produto. O preço, já que os US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída do modelo base trazem um reajuste de contexto longo acima de 272.000 tokens de entrada que conjuntos de documentos jurídicos ultrapassarão rotineiramente — e, se a configuração jurídica tiver preço com prêmio em relação a isso, a economia de um tie-out de 41 documentos muda materialmente. E uma reexecução independente dessas 200 perguntas em um split controlado por outra pessoa. Enquanto isso não existir, 54,0% é um número da OpenAI sobre a configuração da OpenAI, e a afirmação defensável é a mais restrita: um índice de jurisprudência dos EUA mais instruções jurídicas produz recuperação materialmente melhor do que a busca geral na web em perguntas de pesquisa jurídica dos EUA. Vale a pena agir com base nessa afirmação. O resto vale a pena esperar.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
