
Claude Opus 5.5 vs GPT-6 Astra: A Diferença de US$ 6, e o Segundo Preço que a Astra Cobra Acima de 272K
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
Dois fornecedores publicaram este mês tabelas comparativas de benchmarks para seus modelos principais, cada uma mostrando o próprio modelo vencendo, e nenhuma das tabelas contém uma única linha em que os dois modelos tenham sido colocados frente a frente. Claude Opus 5.5, lançado em 22 de setembro de 2026 a US$ 4 por milhão de tokens de entrada, e GPT-6 Astra, lançado em 3 de setembro de 2026 a US$ 10 por milhão de tokens de entrada, têm entre si exatamente dois benchmarks em comum — e ficaram empatados neles, com o Opus 5.5 levando os trabalhos próximos ao AutomationBench na tabela da Anthropic e o Astra levando-os na da OpenAI, e com o Astra claramente à frente em raciocínio científico em ambas. É isso que o material dos fornecedores pode lhe dizer. O quadro independente é menos ambíguo e aponta na direção oposta, e o quadro de preços é mais desequilibrado do que qualquer um dos dois.
O que cada lado publicou
A tabela da Anthropic para o Opus 5.5 usa seu próprio harness e suas próprias configurações de esforço e, onde lista a Astra, os números são da Anthropic, não de uma nova execução. Trate todo o conjunto como informado pelo fornecedor:
• Terminal-Bench 4.0 — Claude Opus 5.5 66,4% vs GPT-6 Astra 57,9% (a Anthropic observa que a execução do Opus usou esforço xhigh)
• FrontierCode v1.1 — Claude Opus 5.5 54,4% vs GPT-6 Astra 53,3%
• GDPval-AA v2.1, trabalho de conhecimento — Claude Opus 5.5 1.846 Elo vs GPT-6 Astra 1.542
• AutomationBench — Claude Opus 5.5 40,0% vs. GPT-6 Astra 41,4% (Astra à frente)
• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58,7% vs GPT-6 Astra 64,6% (Astra na frente)
• O Último Exame da Humanidade, com ferramentas — Claude Opus 5.5 67,7% vs GPT-6 Astra 57,2%
O lado da OpenAI nessa comparação é mais difícil de alinhar, porque a OpenAI publicou o Astra em comparação com seu próprio antecessor, e não com o carro-chefe da Anthropic, e os benchmarks que escolheu — uso de computador, engenharia de front-end, conhecimento geral — em sua maioria não aparecem de modo algum na tabela da Anthropic. Isso não é desonestidade, é um comportamento normal de lançamento, e é exatamente por isso que uma comparação construída a partir de duas tabelas de fornecedores é uma comparação de duas seleções, e não de dois modelos. O único ponto em que as duas tabelas concordam é que o Astra é forte em ciência agêntica e uso de computador, e que os dois modelos são próximos o suficiente em programação para que a escolha do harness possa alterar o resultado.
A leitura independente, que nenhum dos fornecedores escolheu

A Artificial Analysis executa todos os modelos numa única configuração publicada, portanto os seus números são os únicos aqui que foram produzidos pelo mesmo avaliador sob as mesmas condições:
• Índice de Inteligência — Claude Opus 5.5 58, classificado em #1 de 210 vs. GPT-6 Astra 53, classificado em #6
• Rótulo de configuração — Claude Opus 5.5 "Raciocínio Adaptativo, Esforço Máximo, Fallback Padrão", GPT-6 Astra "máx."
• Velocidade de saída — GPT-6 Astra 52,5 tokens/s, na extremidade inferior da sua faixa de preço em comparação com Claude Opus 5.5, ainda não publicado
• Tempo até o primeiro token — GPT-6 Astra 352,15s vs. uma mediana do painel de 3,83s; Claude Opus 5.5 ainda não publicado
• Preço — Claude Opus 5.5 US$ 4,00 de entrada / US$ 20,00 de saída por milhão vs GPT-6 Astra US$ 10,00 / US$ 50,00
• Contexto e saída — GPT-6 Astra com contexto de 1M e saída máxima de 128K vs Claude Opus 5.5 com 1M e 128K
Uma diferença de cinco pontos no índice não é decisiva por si só, e não deve ser lida como se fosse — ambos os modelos ficam na mesma faixa de capacidade, que é o que "frontier" significa neste trimestre. O que as linhas do Astra estabelecem é que o prêmio não está comprando uma liderança de capacidade no único ranking em que ambos os modelos aparecem. A linha de latência é a complicação honesta: 352 segundos até o primeiro token é o valor mais alto deste grupo, por uma margem ampla, embora seja medido em esforço máximo, e um modelo de raciocínio que pensa antes de emitir sempre vai parecer lento segundo essa métrica. O número de 52,5 tokens/seg é o mais portável, e está do lado baixo para um modelo a $10/$50.
O segundo preço da Astra, acima de 272.000 tokens

A tabela de preços é onde esses dois deixam completamente de ser comparáveis, porque o preço da Astra tem um degrau. As tarifas padrão são US$ 10,00 para entrada, US$ 1,00 para entrada em cache, US$ 12,50 para gravação em cache e US$ 50,00 para saída por milhão de tokens. No entanto, ao ultrapassar 272.000 tokens de entrada, toda a solicitação é reprecificada — não o excedente, a chamada inteira — com tarifas de entrada e cache 2x e de saída 1,5x. Isso coloca o trabalho de contexto longo em cerca de US$ 20 de entrada e US$ 75 de saída por milhão de tokens.
O Claude Opus 5.5 não faz isso. A Anthropic cobra US$ 4,00 e US$ 20,00 com a janela completa de 1M de tokens no preço padrão, e afirma explicitamente que uma requisição de 900K tokens é cobrada à mesma tarifa por token que uma de 9K tokens. Portanto, a proporção anunciada entre esses dois — a Astra custando 2,5x o Opus 5.5 nas duas direções — não é a proporção que se aplica às cargas de trabalho para as quais ambos os modelos são realmente vendidos. Em um agente de horizonte longo carregando um grande contexto de trabalho, a comparação é US$ 20/US$ 75 contra US$ 4/US$ 20, o que representa um fator de cinco na entrada e quase quatro na saída. O preço em lote agrava isso em vez de corrigi-lo: o Opus 5.5 cai pela metade, para US$ 2,00/US$ 10,00, enquanto o nível flex da Astra cai pela metade, para US$ 5,00/US$ 25,00, sobre uma base que já é cinco vezes maior no caso de contexto longo.
Esta é a assimetria mais relevante para a decisão nesta comparação, e ela é invisível em toda tabela de lançamento de qualquer uma das empresas, porque ambos os fornecedores divulgam a tarifa de destaque. Se seus prompts tiverem menos de 272K tokens, ignore isso. Se você estiver construindo um agente que lê um repositório ou um conjunto de documentos, precifique-o em $20/$75 antes de comparar qualquer coisa.
O acesso faz parte da especificação
Astra é o primeiro modelo da OpenAI a ultrapassar o limiar crítico de capacidade de cibersegurança segundo o próprio Preparedness Framework da empresa, e a implementação reflete essa classificação, e não a capacidade. O acesso foi aberto inicialmente a um conjunto limitado de organizações, o acesso empresarial exige que um administrador o ative antes que os usuários o vejam, e o modelo lançado recusa categoricamente algumas categorias de trabalho. Claude Opus 5.5 chega com uma versão do mesmo problema pela direção oposta: ele é lançado com o nível de salvaguarda que a Anthropic antes reservava ao Claude Fable 5.1, o que significa que a maioria dos pedidos de cibersegurança é redirecionada para o Claude Opus 4.8 e o trabalho de biologia recorre ao Claude Opus 5, a menos que a conta seja verificada.
Os dois comportamentos aparecem no mesmo lugar: na sua avaliação. A Artificial Analysis rotula a configuração do Opus 5.5 como "Default Fallback" justamente porque as requisições podem cair em um modelo diferente do que você indicou, e, em prompts de segurança ou de ciências da vida, isso acontece rotineiramente. Se a sua carga de trabalho está nesses domínios, a string do modelo na sua requisição não é garantia sobre o modelo que respondeu, e seus números de qualidade vão incluir um modelo menor em uma fração desconhecida das chamadas. Nenhum dos fornecedores está escondendo isso — ambos documentam o comportamento —, mas nenhum dos dois menciona isso em seus títulos de destaque.
Escolhendo entre eles
A decisão que este confronto na verdade coloca é se uma carga de trabalho de contexto longo justifica a precificação por etapas da Astra e, para a maioria das equipes, a resposta será não: o Opus 5.5 é mais barato em todas as linhas abaixo de 272K, drasticamente mais barato acima disso, obtém pontuação mais alta no único ranking independente e alcança 1M de tokens de contexto sem sobretaxa. O caso da Astra é mais restrito e real — raciocínio científico, uso de computador e as ferramentas do ecossistema OpenAI —, e, se suas avaliações a colocarem à frente nesses quesitos, o adicional é um item de custo, e não um erro.
Onde isso se torna prático é na forma como você coloca os dois frente a frente, porque uma comparação justa exige ambos os modelos na mesma chave e na mesma fatura. Ambos podem ser roteados pelo OrcaRouter ao preço de tabela do provedor, com 0% de markup — Claude Opus 5.5 a US$ 4,00/US$ 20,00 da Anthropic e GPT-6 Astra a US$ 10,00/US$ 50,00 — o que significa que a decisão dos 272K pode ser testada no seu próprio tráfego, em vez de discutida a partir de dois comunicados à imprensa. Fixar o Astra nas classes de tarefas em que ele vence e deixar o failover automático cuidar do restante é uma regra de roteamento, e uma requisição que cruza a linha dos 272K pode ser encaminhada por um caminho mais barato sem alteração de código, porque a regra fica no roteador, e não na sua aplicação.

O que mudaria a resposta
Uma coisa seria: um confronto controlado frente a frente, com esforço equiparado, em benchmarks compartilhados. Nenhum dos fornecedores publicou um, e nenhum tem incentivo para fazê-lo, o que deixa o índice independente como a única comparação em condições idênticas disponível — e esse índice coloca o Opus 5.5 cinco pontos e cinco posições acima da Astra a menos de metade do preço por token. O contra-argumento que merece atenção é que ambos os modelos foram avaliados com esforço máximo, enquanto o Opus 5.5 vem configurado por padrão como médio; se a vantagem da Astra em trabalho científico de longo horizonte sobreviver a uma execução com esforço equiparado, o argumento a favor do preço premium fica mais forte, não mais fraco. Até que alguém faça essa comparação, a posição defensável é que a Astra é uma especialista com preço de generalista, e o Opus 5.5 é o generalista que, por acaso, obtém pontuação mais alta.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
