Um cartão hero gerado intitulado “Astra for Law vs GPT-6 Astra”, com o subtítulo “Mesmos pesos — um adiciona um índice de busca jurídica”, com uma linha de data que diz “Astra for Law anunciado em 17 de setembro de 2026 · GPT-6 Astra lançado em 3 de setembro de 2026”, acima de dois cartões: à esquerda, “Astra for Law — índice jurídico + instruções, preço não divulgado” e, à direita, “GPT-6 Astra — busca na web, US$ 10 de entrada / US$ 50 de saída por 1M”, com o rodapé “Números do fornecedor não reproduzidos; pontuação no placar público do GPT-6 Astra segundo a Vals AI.” e o logotipo da OrcaRouter composto no canto inferior direito.
Guides & Insights

Astra for Law vs GPT-6 Astra: Mesmos pesos, um índice de busca extra

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Astra for Law e GPT-6 Astra não são dois modelos, e enquadrar a escolha como um confronto direto é a primeira coisa a acertar. O Astra for Law é o GPT-6 Astra com um índice de pesquisa jurídica dos Estados Unidos acoplado ao seu caminho de recuperação, um conjunto de instruções de redação jurídica sobreposto e ferramentas jurídicas anexadas. Os pesos são idênticos. Portanto, a verdadeira questão não é qual modelo é mais inteligente — é se vale a pena pagar a mais pelo índice de pesquisa jurídica e, pelas evidências disponíveis até agora, a resposta depende quase inteiramente de seu trabalho ser recuperação de jurisprudência ou revisão de documentos.

Isso importa porque a OpenAI não publicou um preço para a configuração jurídica, a API para ela não é aberta, e a única medição comparativa direta com o modelo base vem da própria OpenAI, em um conjunto de validação privado. Esta página examina o que se sabe de fato, o que os números independentes dizem e em qual lado da comparação uma determinada carga de trabalho jurídica se encaixa.

O que os separa, exatamente?

Três coisas foram adicionadas, e não são igualmente difíceis de replicar.

Legal Search Index — recuperação sobre jurisprudência, leis, regulamentos, regras de tribunais e decisões administrativas dos EUA, mais de 230 milhões de URLs, com fontes adicionadas diariamente. Esta é a parte que não pode ser construída a partir de um prompt.

Corpus — baseado no CourtListener, a biblioteca do Free Law Project que abrange mais de 99,9% da jurisprudência precedente publicada dos EUA, complementada por conteúdo licenciado de fornecedores, incluindo a Thomson Reuters. A metade pública é gratuita; a metade licenciada e a atualização diária não são algo que um escritório individual reproduza.

Instruções e configurações — instruções de análise jurídica e de redação jurídica, além de configurações como o comprimento da resposta. Estas são ao nível do prompt e da configuração. Uma equipa competente de engenharia jurídica consegue aproximar, atualmente, uma fração significativa delas em relação ao modelo base.

A generated two-column scoreboard titled 'Astra for Law vs GPT-6 Astra — the scoreboard'. Left column 'Astra for Law' rows: 'Retrieval: Legal Search Index, 230M+ URLs', 'Instructions: legal-specific', 'Headline score: 54.0% vendor-reported', 'Availability: Trusted Access, Am Law 200', 'API model id: gpt-6-astra-law, coming soon', 'Price: not disclosed'. Right column 'GPT-6 Astra' rows: 'Retrieval: general web search', 'Instructions: general', 'Public board score: 39.42% on Vals AI', 'Availability: generally available now', 'API model id: gpt-6-astra', 'Price: $10.00 in / $50.00 out per 1M'. Footer reads 'Astra for Law figures OpenAI-reported on a private split; GPT-6 Astra public board figure per Vals AI.', with the OrcaRouter logo composited in the bottom-right corner.

Apenas no GPT-6 Astra, a recuperação ocorre por meio da busca geral na web. É toda a diferença no caminho de pesquisa, e é o eixo que todos os números abaixo estão medindo.

O único cara a cara que existe

A OpenAI testou ambos os lados em 200 perguntas de pesquisa jurídica dos EUA do conjunto de validação privado do Legal Research Bench da Vals AI. No nível mais alto de esforço de raciocínio, o Astra for Law passou na verificação geral de correção em 54,0% das perguntas, contra 38,7% do GPT-6 Astra com busca na web — 15,3 pontos, descrito como uma melhoria relativa de 40%. Números de apoio da mesma execução: 24% mais casos de referência encontrados em perguntas de jurisprudência, até 54% mais passagens relevantes recuperadas de opiniões judiciais corretas com igual esforço de raciocínio, e respostas com aproximadamente o dobro do comprimento em média.

Três ressalvas cabem nesses números, e nenhuma delas é motivo para descartá-los. Primeiro, eles são da OpenAI, em um split que a OpenAI detém, e nada independente os reproduziu. Segundo, vale colocar o comprimento dobrado das respostas ao lado da pontuação composta, porque uma verificação de correção que recompensa cobertura é mais fácil de passar com uma resposta mais longa — os números de recuperação (24% mais casos, 54% mais passagens) são a evidência mais clara do que o índice realmente acrescenta. Terceiro, a versão pública do mesmo benchmark não mostra o salto: a própria página de comparação da Vals AI lista o GPT-6 Astra com 39,42% ±3,40 no Legal Research Bench, com o Gemini 3.8 Flash em 38,94% ±3,39. Esse é o modelo base, sem o índice, ficando essencialmente onde está o baseline da OpenAI.

A screenshot of the Vals AI 'Compare Models' leaderboard captured September 18, 2026, comparing Gemini 3.8 Flash and GPT-6 Astra: Legal Research Bench (Agentic US legal research) shows Gemini 3.8 Flash 38.94% ±3.39 against GPT-6 Astra 39.42% ±3.40; Vals Index shows 62.25% against 66.61%; and the table also lists Finance Agent (V2) 61.44% vs 53.54%, Tax Agent Bench 66.77% vs 63.34%, MedCode 48.13% vs 48.49%, Terminal-Bench Science 8.57% vs 65.71%, Code Migration 36.55% vs 67.74%, Terminal-Bench 4.0 13.13% vs 57.07% and Vibe Code Bench v1.1 78.65% vs 89.59%, with a Vals Index date of 2026-09-11.

Duas leituras independentes complicam ainda mais o quadro. A Legora executou uma conciliação de demonstrações financeiras em 41 documentos de uma só vez e encontrou todos os quatro erros plantados, incluindo uma discrepância de £500.000 na nota de receitas, acrescentando cerca de cinquenta verificações que o modelo anterior havia deixado passar — cerca de 40% de melhoria nesse fluxo de trabalho. No Benchmark for Agentic Reasoning da Legora como um todo, porém, a melhoria média em todas as tarefas foi de cerca de 3%. Enquanto isso, o teste de 41 perguntas da HAQQ em 20 áreas de atuação colocou a vantagem da Astra em substância jurídica em 17,63 de 20, menos de um ponto à frente de modelos mais baratos, a US$ 0,2622 por resposta. Lidas em conjunto, o resumo honesto é que a vantagem da configuração é grande e repetível em trabalho de jurisprudência dos EUA com uso intensivo de recuperação, reduzida em raciocínio jurídico geral, e em grande parte não testada em direito fora dos EUA — em que o mesmo teste descobriu que os três modelos citavam a disposição correta enquanto deturpavam o que ela diz.

O Astra for Law não tem preço publicado. A tabela de preços do GPT-6 Astra é pública, e é nela que a comparação tem de se basear, porque a configuração jurídica é o mesmo modelo mais recuperação e não pode, de forma plausível, custar menos do que o modelo que encapsula.

Padrão — $10.00 por milhão de tokens de entrada, $50.00 por milhão de tokens de saída.

Entrada em cache — US$ 1,00 por milhão, um desconto de 90%, e a alavanca que mais importa para um escritório que reutiliza instruções permanentes e textos padrão de precedentes.

Gravações de cache — $12.50 por milhão, cobradas a 1.25× a tarifa de entrada sem cache; o cache compensa a partir da segunda reutilização.

Acima de 272.000 tokens de entrada — taxas 2× para entrada e cache e 1,5× para saída, aplicadas à solicitação inteira, não apenas aos tokens acima do limite. Na prática, isso significa US$ 20,00 de entrada e US$ 75,00 de saída por milhão para qualquer solicitação longa.

Batch — 50% do Standard. Modo rápido — 2× o Standard, e indisponível para o GPT-6 Astra com residência de dados na UE.

Esse limiar de 272 mil não é uma nota de rodapé nesta comparação; é o centro dela. Uma conferência de 41 documentos, um conjunto completo de transcrições de depoimentos ou um dossiê de transação plurianual ultrapassa rotineiramente 272.000 tokens, o que significa que a tarifa jurídica realista é a linha de contexto longo — US$20,00 de entrada e US$75,00 de saída —, e não a taxa anunciada de US$10/US$50. Para um escritório dimensionando um projeto-piloto, a diferença entre essas duas linhas é a diferença entre um projeto que cabe no orçamento e um que não cabe, e é motivo para medir seu volume real de tokens por caso antes de se comprometer, e não depois.

Mais duas notas de custo de testes independentes. O HAQQ mediu US$ 0,2622 por resposta no Astra, cerca de onze vezes o custo por resposta do GPT-5.6 Luna Pro por menos de um ponto de ganho composto — mas também observou que a diferença se deve em parte ao fato de o Astra escrever cerca de 3,5× menos tokens que o Claude Opus 5, tornando-o mais barato por resposta que o Opus 5 para essa carga de trabalho. E esse mesmo teste descobriu que o ajuste de esforço de raciocínio funciona como uma alavanca de custo, e não de qualidade: de baixo a alto multiplicou o custo em cerca de 1,5× e a latência em cerca de 1,8×, enquanto a qualidade avaliada caiu 0,17 ponto. Fixe a configuração de esforço; não a deixe no máximo por padrão.

Quando o modelo básico é a melhor compra

O argumento a favor do GPT-6 Astra por si só é mais forte do que o enquadramento do lançamento sugere, e baseia-se em três observações.

• Seu trabalho não é a recuperação de jurisprudência dos EUA. O índice é exclusivo dos EUA. Para elaboração de contratos, reestruturação de cláusulas, triagem de casos, construção de cronologias ou resumo de documentos que você já tem em mãos, aquilo que o Astra for Law acrescenta é em grande parte inerte.

• Você já paga pela pesquisa jurídica primária. Um escritório com assinaturas da Westlaw ou da LexisNexis está comprando duas vezes a mesma cobertura de precedentes se também pagar um valor adicional por uma camada de recuperação que não consegue auditar.

• Você quer o caminho de recuperação que controla. Alimentar o GPT-6 Astra base com um conjunto de documentos curado dá a você proveniência de citações que pode inspecionar e nenhuma dependência da atualização do índice de um fornecedor.

Há evidências de terceiros de que o modelo base não é o elo fraco. No ranking de advogados corporativos APEX-Agents da Mercor, uma configuração do GPT-6 Astra obteve 73,4% de Pass@1 em 160 tarefas — um resultado de terceiros em uma carga de trabalho de agente jurídico, ao lado do ganho médio de 3% que a Legora mediu em seu próprio conjunto de benchmarks. Nenhum dos números se refere ao índice de pesquisa, e ambos sugerem que o modelo subjacente já está fazendo a maior parte do trabalho jurídico.

Quando a configuração merece o seu premium

O argumento a favor da Astra for Law é mais restrito e, onde se aplica, decisivo. Se a sua carga de trabalho envolve encontrar e aplicar jurisprudência dos EUA — construir a lista de casos de um memorial, verificar se uma posição sobrevive a uma linha de decisões, realizar um levantamento regulatório dos cinquenta estados —, então 24% mais casos de referência e até 54% mais passagens relevantes não é uma melhoria marginal, é a diferença entre um assistente que deixa passar jurisprudência e um que não deixa. O tie-out da Legora é a melhor ilustração disponível do mesmo efeito em documentos, em vez de jurisprudência: fazer referência cruzada de 41 arquivos numa só passagem é exatamente o trabalho de comparação de alto volume e contexto longo onde mais contexto recuperado se acumula.

A ressalva honesta sobre ambos: os preços não são divulgados, o acesso é restrito a firmas do Am Law 200 por meio do programa Trusted Access, e nenhum laboratório independente refez a comparação direta. Pede-se que você se comprometa com um preço premium com base no benchmark de um fornecedor e no teste de fluxo de trabalho de um único sócio.

Executando ambos através de um único endpoint

A questão de roteamento aqui é um problema de sequenciamento, e não uma escolha. O gpt-6-astra-law ainda não está em nenhuma API, incluindo a nossa — a OpenAI disse "em breve" e não informou data — então, hoje, a única metade desta comparação que você pode realmente chamar é o modelo base. O que está disponível agora é openai/gpt-6-astra no OrcaRouter com 0% de markup, com o preço de tabela do provedor repassado sem alteração, então as linhas de $10/$50 e $20/$75 acima são o que você paga, e uma mudança de preço do fornecedor entra em vigor no mesmo dia. Mais de 200 modelos ficam atrás de uma única chave, com failover automático entre provedores.

A screenshot of the OrcaRouter catalogue page for GPT-6 Astra, captured September 18, 2026, showing the listing openai/gpt-6-astra from provider OpenAI with a 1M token context, 128K max output, input of text + image + file with text output, p50 time to first token of 6.01 s and p95 of 10.00 s, $10.00 input and $50.00 output per 1M tokens, 162.0M tokens of routed traffic over seven days, and an OpenAI-compatible Python sample using base_url https://api.orcarouter.ai/v1.

A DSL de roteamento é a peça que se encaixa nessa decisão específica. Como a diferença entre os dois produtos é uma etapa de recuperação, você pode compô-la por conta própria — roteie o modelo base com sua própria recuperação de documentos em uma única chamada e compare a saída com a mesma pergunta enviada apenas com busca na web. Essa é uma forma barata de medir quanto da lacuna de 54,0% versus 38,7% seu próprio corpus reproduz, antes de você optar por um produto premium com acesso controlado. A fusão de modelos, que executa um painel de modelos sobre um único prompt, cobre a outra metade: se sua preocupação é que um único modelo interprete mal um dispositivo, como a HAQQ constatou em leis de fora dos EUA, um painel expõe a divergência em vez de escondê-la. Como o roteamento mantém os dois lados em uma única chave, trocar o id do modelo quando o gpt-6-astra-law abrir é uma mudança de configuração, não uma reintegração.

Uma ressalva que vale a pena declarar em vez de esconder: uma solicitação roteada não é automaticamente coberta pela aprovação de Zero Data Retention da OpenAI, que é concedida por organização, então uma empresa que precisa de ZDR deve confirmar a cobertura na rota que utiliza. E um roteador é mais um salto no caminho dos dados — um custo real para material privilegiado, mesmo quando oferece failover.

Onde isto vai parar

Se você está escolhendo hoje, escolha o modelo base. O Astra for Law ainda não pode ser comprado, seu prêmio é desconhecido, e as evidências independentes dizem que o GPT-6 Astra já apresenta alto desempenho em cargas de trabalho de agentes jurídicos sem o índice. Construa sobre openai/gpt-6-astra agora, meça sua própria lacuna de recuperação e deixe a contabilidade de tokens lhe dizer se você ultrapassa 272K com frequência suficiente para se importar com a linha de contexto longo.

Depois, volte a isto quando três coisas forem conhecidas: o preço do gpt-6-astra-law, o formato dos seus termos de API e uma repetição independente do confronto direto de 200 perguntas numa divisão controlada por outra entidade que não a OpenAI. Se o preço ficar próximo da taxa-base e os ganhos de recuperação se mantiverem fora do conjunto de validação da OpenAI, a configuração torna-se o padrão óbvio para o trabalho intensivo em investigação nos EUA e o modelo-base continua a ser o certo para todo o resto. Até lá, a afirmação defensável é a mais estreita — um índice de jurisprudência dos EUA mais instruções jurídicas recupera substancialmente melhor do que a pesquisa web geral em questões jurídicas dos EUA. Isso vale a pena pagar algo. Quanto ainda é uma questão em aberto.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente