Um cartão de título gerado para Claude Opus 5.5 vs. GPT-6 Astra, com o subtítulo 'Uma diferença de seis dólares, e uma sobretaxa acima de 272.000 tokens', com um ícone plano de balança e uma linha de rodapé com o texto 'Índice segundo a Artificial Analysis em esforço máximo; preços segundo os fornecedores.' O logotipo real do OrcaRouter é composto no canto inferior direito.
Guides & Insights

Claude Opus 5.5 vs GPT-6 Astra: A Diferença de US$ 6, e o Segundo Preço que a Astra Cobra Acima de 272K

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois fornecedores publicaram este mês tabelas comparativas de benchmarks para seus modelos principais, cada uma mostrando o próprio modelo vencendo, e nenhuma das tabelas contém uma única linha em que os dois modelos tenham sido colocados frente a frente. Claude Opus 5.5, lançado em 22 de setembro de 2026 a US$ 4 por milhão de tokens de entrada, e GPT-6 Astra, lançado em 3 de setembro de 2026 a US$ 10 por milhão de tokens de entrada, têm entre si exatamente dois benchmarks em comum — e ficaram empatados neles, com o Opus 5.5 levando os trabalhos próximos ao AutomationBench na tabela da Ant​hropic e o Astra levando-os na da Open​AI, e com o Astra claramente à frente em raciocínio científico em ambas. É isso que o material dos fornecedores pode lhe dizer. O quadro independente é menos ambíguo e aponta na direção oposta, e o quadro de preços é mais desequilibrado do que qualquer um dos dois.

O que cada lado publicou

A tabela da Anthropic para o Opus 5.5 usa seu próprio harness e suas próprias configurações de esforço e, onde lista a Astra, os números são da Anthropic, não de uma nova execução. Trate todo o conjunto como informado pelo fornecedor:

• Terminal-Bench 4.0 — Claude Opus 5.5 66,4% vs GPT-6 Astra 57,9% (a Anthropic observa que a execução do Opus usou esforço xhigh)

• FrontierCode v1.1 — Claude Opus 5.5 54,4% vs GPT-6 Astra 53,3%

• GDPval-AA v2.1, trabalho de conhecimento — Claude Opus 5.5 1.846 Elo vs GPT-6 Astra 1.542

• AutomationBench — Claude Opus 5.5 40,0% vs. GPT-6 Astra 41,4% (Astra à frente)

• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58,7% vs GPT-6 Astra 64,6% (Astra na frente)

• O Último Exame da Humanidade, com ferramentas — Claude Opus 5.5 67,7% vs GPT-6 Astra 57,2%

O lado da OpenAI nessa comparação é mais difícil de alinhar, porque a OpenAI publicou o Astra em comparação com seu próprio antecessor, e não com o carro-chefe da Anthropic, e os benchmarks que escolheu — uso de computador, engenharia de front-end, conhecimento geral — em sua maioria não aparecem de modo algum na tabela da Anthropic. Isso não é desonestidade, é um comportamento normal de lançamento, e é exatamente por isso que uma comparação construída a partir de duas tabelas de fornecedores é uma comparação de duas seleções, e não de dois modelos. O único ponto em que as duas tabelas concordam é que o Astra é forte em ciência agêntica e uso de computador, e que os dois modelos são próximos o suficiente em programação para que a escolha do harness possa alterar o resultado.

A leitura independente, que nenhum dos fornecedores escolheu

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra across six shared rows: Intelligence Index (58, ranked #1 of 210, against 53, ranked #6), price in and out ($4.00 / $20.00 per million against $10.00 / $50.00), long-context surcharge (none against 2x input and 1.5x output above 272K), context window (1M tokens on both), output speed (not yet published against 52.5 tokens per second) and time to first token (not yet published against 352.15s). The footer reads 'Index, speed and latency figures per Artificial Analysis; prices and the 272K step per the vendors.'

A Artificial Analysis executa todos os modelos numa única configuração publicada, portanto os seus números são os únicos aqui que foram produzidos pelo mesmo avaliador sob as mesmas condições:

• Índice de Inteligência — Claude Opus 5.5 58, classificado em #1 de 210 vs. GPT-6 Astra 53, classificado em #6

• Rótulo de configuração — Claude Opus 5.5 "Raciocínio Adaptativo, Esforço Máximo, Fallback Padrão", GPT-6 Astra "máx."

• Velocidade de saída — GPT-6 Astra 52,5 tokens/s, na extremidade inferior da sua faixa de preço em comparação com Claude Opus 5.5, ainda não publicado

• Tempo até o primeiro token — GPT-6 Astra 352,15s vs. uma mediana do painel de 3,83s; Claude Opus 5.5 ainda não publicado

• Preço — Claude Opus 5.5 US$ 4,00 de entrada / US$ 20,00 de saída por milhão vs GPT-6 Astra US$ 10,00 / US$ 50,00

• Contexto e saída — GPT-6 Astra com contexto de 1M e saída máxima de 128K vs Claude Opus 5.5 com 1M e 128K

Uma diferença de cinco pontos no índice não é decisiva por si só, e não deve ser lida como se fosse — ambos os modelos ficam na mesma faixa de capacidade, que é o que "frontier" significa neste trimestre. O que as linhas do Astra estabelecem é que o prêmio não está comprando uma liderança de capacidade no único ranking em que ambos os modelos aparecem. A linha de latência é a complicação honesta: 352 segundos até o primeiro token é o valor mais alto deste grupo, por uma margem ampla, embora seja medido em esforço máximo, e um modelo de raciocínio que pensa antes de emitir sempre vai parecer lento segundo essa métrica. O número de 52,5 tokens/seg é o mais portável, e está do lado baixo para um modelo a $10/$50.

O segundo preço da Astra, acima de 272.000 tokens

A generated graphic titled 'Where GPT-6 Astra's price steps', with a subtitle reading 'Crossing 272,000 input tokens reprices the whole call, not the excess.' Two panels compare per-million-token rates: below 272,000 input tokens Claude Opus 5.5 is $4.00 / $20.00 against GPT-6 Astra at $10.00 / $50.00, and above 272,000 input tokens Claude Opus 5.5 stays at $4.00 / $20.00 while GPT-6 Astra moves to approximately $20.00 / $75.00. The footer reads 'Per-million-token rates. Astra's step per OpenAI; Opus 5.5 bills its full 1M window at one rate per Anthropic.'

A tabela de preços é onde esses dois deixam completamente de ser comparáveis, porque o preço da Astra tem um degrau. As tarifas padrão são US$ 10,00 para entrada, US$ 1,00 para entrada em cache, US$ 12,50 para gravação em cache e US$ 50,00 para saída por milhão de tokens. No entanto, ao ultrapassar 272.000 tokens de entrada, toda a solicitação é reprecificada — não o excedente, a chamada inteira — com tarifas de entrada e cache 2x e de saída 1,5x. Isso coloca o trabalho de contexto longo em cerca de US$ 20 de entrada e US$ 75 de saída por milhão de tokens.

O Claude Opus 5.5 não faz isso. A Anthropic cobra US$ 4,00 e US$ 20,00 com a janela completa de 1M de tokens no preço padrão, e afirma explicitamente que uma requisição de 900K tokens é cobrada à mesma tarifa por token que uma de 9K tokens. Portanto, a proporção anunciada entre esses dois — a Astra custando 2,5x o Opus 5.5 nas duas direções — não é a proporção que se aplica às cargas de trabalho para as quais ambos os modelos são realmente vendidos. Em um agente de horizonte longo carregando um grande contexto de trabalho, a comparação é US$ 20/US$ 75 contra US$ 4/US$ 20, o que representa um fator de cinco na entrada e quase quatro na saída. O preço em lote agrava isso em vez de corrigi-lo: o Opus 5.5 cai pela metade, para US$ 2,00/US$ 10,00, enquanto o nível flex da Astra cai pela metade, para US$ 5,00/US$ 25,00, sobre uma base que já é cinco vezes maior no caso de contexto longo.

Esta é a assimetria mais relevante para a decisão nesta comparação, e ela é invisível em toda tabela de lançamento de qualquer uma das empresas, porque ambos os fornecedores divulgam a tarifa de destaque. Se seus prompts tiverem menos de 272K tokens, ignore isso. Se você estiver construindo um agente que lê um repositório ou um conjunto de documentos, precifique-o em $20/$75 antes de comparar qualquer coisa.

O acesso faz parte da especificação

Astra é o primeiro modelo da OpenAI a ultrapassar o limiar crítico de capacidade de cibersegurança segundo o próprio Preparedness Framework da empresa, e a implementação reflete essa classificação, e não a capacidade. O acesso foi aberto inicialmente a um conjunto limitado de organizações, o acesso empresarial exige que um administrador o ative antes que os usuários o vejam, e o modelo lançado recusa categoricamente algumas categorias de trabalho. Claude Opus 5.5 chega com uma versão do mesmo problema pela direção oposta: ele é lançado com o nível de salvaguarda que a Anthropic antes reservava ao Claude Fable 5.1, o que significa que a maioria dos pedidos de cibersegurança é redirecionada para o Claude Opus 4.8 e o trabalho de biologia recorre ao Claude Opus 5, a menos que a conta seja verificada.

Os dois comportamentos aparecem no mesmo lugar: na sua avaliação. A Artificial Analysis rotula a configuração do Opus 5.5 como "Default Fallback" justamente porque as requisições podem cair em um modelo diferente do que você indicou, e, em prompts de segurança ou de ciências da vida, isso acontece rotineiramente. Se a sua carga de trabalho está nesses domínios, a string do modelo na sua requisição não é garantia sobre o modelo que respondeu, e seus números de qualidade vão incluir um modelo menor em uma fração desconhecida das chamadas. Nenhum dos fornecedores está escondendo isso — ambos documentam o comportamento —, mas nenhum dos dois menciona isso em seus títulos de destaque.

Escolhendo entre eles

A decisão que este confronto na verdade coloca é se uma carga de trabalho de contexto longo justifica a precificação por etapas da Astra e, para a maioria das equipes, a resposta será não: o Opus 5.5 é mais barato em todas as linhas abaixo de 272K, drasticamente mais barato acima disso, obtém pontuação mais alta no único ranking independente e alcança 1M de tokens de contexto sem sobretaxa. O caso da Astra é mais restrito e real — raciocínio científico, uso de computador e as ferramentas do ecossistema OpenAI —, e, se suas avaliações a colocarem à frente nesses quesitos, o adicional é um item de custo, e não um erro.

Onde isso se torna prático é na forma como você coloca os dois frente a frente, porque uma comparação justa exige ambos os modelos na mesma chave e na mesma fatura. Ambos podem ser roteados pelo OrcaRouter ao preço de tabela do provedor, com 0% de markup — Claude Opus 5.5 a US$ 4,00/US$ 20,00 da Anthropic e GPT-6 Astra a US$ 10,00/US$ 50,00 — o que significa que a decisão dos 272K pode ser testada no seu próprio tráfego, em vez de discutida a partir de dois comunicados à imprensa. Fixar o Astra nas classes de tarefas em que ele vence e deixar o failover automático cuidar do restante é uma regra de roteamento, e uma requisição que cruza a linha dos 272K pode ser encaminhada por um caminho mais barato sem alteração de código, porque a regra fica no roteador, e não na sua aplicação.

A screenshot of OrcaRouter's own model page for openai/gpt-6-astra, headed 'GPT-6 Astra' and credited to OpenAI, showing a 1M-token context, 128K max output, a text, image and file input modality, and a stat strip reading INPUT $10.00 and OUTPUT $50.00 per 1M tokens with a 10.00s p50 time to first token and 298.0M tokens of traffic over 7 days.

O que mudaria a resposta

Uma coisa seria: um confronto controlado frente a frente, com esforço equiparado, em benchmarks compartilhados. Nenhum dos fornecedores publicou um, e nenhum tem incentivo para fazê-lo, o que deixa o índice independente como a única comparação em condições idênticas disponível — e esse índice coloca o Opus 5.5 cinco pontos e cinco posições acima da Astra a menos de metade do preço por token. O contra-argumento que merece atenção é que ambos os modelos foram avaliados com esforço máximo, enquanto o Opus 5.5 vem configurado por padrão como médio; se a vantagem da Astra em trabalho científico de longo horizonte sobreviver a uma execução com esforço equiparado, o argumento a favor do preço premium fica mais forte, não mais fraco. Até que alguém faça essa comparação, a posição defensável é que a Astra é uma especialista com preço de generalista, e o Opus 5.5 é o generalista que, por acaso, obtém pontuação mais alta.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente