
Claude Opus 5.5 vs. GPT-6 Astra: Uma Prova de Sabor Que Superou os Benchmarks
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Alguém pediu a Claude Opus 5.5para fazer um vídeo curto sobre um laboratório rival resolvendo Navier-Stokes, publicou o resultado e depois escreveu a frase que torna esta comparação digna de ser feita: o modelo é "muito agradável", tem "ótimo gosto" e é o primeiro Claude desde o Opus 4.7 que eles realmente querem usar intensamente — mas eles ainda mantêm GPT-6 Astra e GPT-5.6 Sol como seus principais motores, porque o trabalho deles é intensivo em pesquisa. São três afirmações em uma única postagem, e elas puxam em direções diferentes. Um modelo pode ser a coisa mais agradável com que se trabalhar e ainda assim não ser aquele para o qual você direciona o tráfego de produção. A pergunta interessante não é qual modelo é melhor. É qual desses dois veredictos sobrevive ao contato com os números, e qual acaba sendo uma afirmação sobre gosto.
O post é o relato de um profissional, não uma execução de benchmark — trate-o como um sinal sobre como o modelo se sente em trabalho criativo e aberto, não como evidência sobre capacidade. Tudo o que é numérico abaixo está rotulado com quem o produziu.
O que um teste de sabor pode e não pode lhe dizer
O artefato importa aqui. Fazer um vídeo sobre um resultado matemático não é uma tarefa de programação com um critério de aprovação ou reprovação. Não há etapa de compilação, nem suíte de testes, nem harness do Terminal-Bench que dê uma nota para saber se a coisa é boa. O modelo teve de escolher um ângulo, decidir o que mostrar, manter a coerência e parar. Quando um profissional diz que um modelo tem "ótimo gosto", é exatamente isso que ele está descrevendo: julgamento sobre escopo e ênfase que aparece em trabalhos nos quais a especificação é deliberadamente vaga.
Isso é uma capacidade real, e é justamente aquela que as suítes de benchmark medem pior. É também por isso que a mesma pessoa pode elogiar um modelo e não trocar para ele. O bom gosto é o que você quer quando está explorando. Não é o que você quer quando tem 200.000 linhas de código para auditar e uma fatura para justificar.
A própria formulação de lançamento da Anthropic aponta para a mesma capacidade, em prosa em vez de vídeo: o Claude Opus 5.5 é apresentado como escrevendo de forma menos "Claudish" — menos rodeios, menos evasivas, mais disposição para colocar o ponto principal primeiro. Pontuações independentes de legibilidade corroboram a direção dessa alegação, mesmo quando discordam da magnitude. O fornecedor também relata que um teste interno de verificação de fatos passou em 16 de 18 tentativas, contra zero de 18 tanto para o Claude Fable 5.1 quanto para o Claude Opus 5; esse número é da própria Anthropic, não foi reproduzido, e deve ser lido como uma alegação, e não como um resultado.
Dois placares, uma divergência que importa

Em benchmarks brutos publicados, Claude Opus 5.5 supera o GPT-6 Astra na maioria das vezes. O problema é que as duas fontes mais citadas não concordam sobre o quanto.
A tabela de lançamento da Anthropic coloca o Claude Opus 5.5 em 66,4% no Terminal-Bench 4.0, com o GPT-6 Astra em 57,9% e o Claude Fable 5.1 em 55,8%. Trata-se de uma vantagem de 8,5 pontos relatada pelo fornecedor em codificação agêntica — o tipo de margem que encerra uma discussão em uma apresentação de marketing. A Artificial Analysis, executando seu próprio harness, mediu o Claude Opus 5.5 em 59,6% no mesmo benchmark: empatado com o GPT-6 Astra em esforço xhigh, e cerca de 11 pontos acima do Claude Opus 5. A liderança é real nas duas leituras. O tamanho não.
Onde os dois modelos trocam de lugar é mais útil do que onde eles não o fazem:
• Terminal-Bench 4.0 (codificação agêntica) — Claude Opus 5.5 66,4% segundo a própria tabela da Anthropic, 59,6% segundo a Artificial Analysis; GPT-6 Astra 57,9%.
• Humanity's Last Exam, com ferramentas — Claude Opus 5.5 67,7% relatado pelo fornecedor, medido independentemente em 61,4%; GPT-6 Astra 57,2%.
• GDPval-AA v2.1 (trabalho de conhecimento do mundo real em 44 ocupações) — Claude Opus 5.5 1.846 Elo; GPT-6 Astra 1.542 Elo. Ambos os valores vêm do ranking independente da Artificial Analysis, não do fornecedor.
• Terminal-Bench-Science 0.1 — GPT-6 Astra 64,6% vs Claude Opus 5.5 58,7%. Esta é uma vitória clara da Astra, e é o benchmark agêntico com temática científica.
• AutomationBench — GPT-6 Astra 41,4% vs Claude Opus 5.5 40,0%. Por pouco, mas Astra de novo.
• FrontierCode v1.1 — Claude Opus 5.5 54,4% vs GPT-6 Astra 53,3%. Por menos de um ponto.
Leia essa lista como o profissional faria. As cargas de trabalho com muita pesquisa — aquelas com um componente de ciência ou literatura, aquelas que executam um longo loop de uso de ferramentas e precisam que o modelo mantenha o equilíbrio — são exatamente onde o GPT-6 Astra se mantém firme. Os painéis de trabalho de conhecimento e de programação onde o Claude Opus 5.5 dispara são aqueles que você apontaria se seu trabalho fosse entregar software. Ambas as pessoas nesta conversa estão lendo seu próprio benchmark corretamente. Elas estão apenas lendo benchmarks diferentes.
A configuração de esforço está fazendo mais trabalho do que o modelo.
Há uma segunda razão, menos lisonjeira, pela qual as margens principais estão fracas. As comparações entre fornecedores não são executadas na mesma configuração.
Os números publicados do Claude Opus 5.5 vêm de uma configuração de esforço de raciocínio extra-alta (xhigh), contra o GPT-6 Astra no nível high. As execuções independentes da Artificial Analysis colocam ambos os modelos em xhigh, e a diferença em codificação desaparece — a vantagem de 8,5 pontos do fornecedor vira empate. Isso não é uma acusação de má conduta; é o que acontece quando um fornecedor escolhe a configuração que mostra seu modelo da melhor forma e um laboratório independente escolhe a configuração que corresponde à concorrência. Antes de mover uma carga de trabalho com base em uma tabela de benchmark, verifique em qual configuração de esforço ela foi executada, porque a resposta frequentemente é "a lisonjeira".
A conta de tokens conta a mesma história sob outro ângulo. O próprio material de lançamento da Anthropic mostra o Claude Opus 5.5 gastando na ordem de 119.000 tokens por problema, com cerca de 84.000 desses destinados ao raciocínio, enquanto o GPT-6 Astra resolve problemas comparáveis em cerca de 27.000 tokens. Tokens de raciocínio são cobrados como tokens de saída. Um modelo que usa quatro vezes os tokens a um quinto do preço de saída fica quase no empate — e isso antes de levar em conta que o modelo mais barato costuma ser aquele que você estaria disposto a rodar com uma configuração de esforço mais alta de qualquer forma.
Uma ressalva adicional está especificamente do lado do Claude Opus 5.5: o roteamento de salvaguardas da Anthropic pode encaminhar alguns pedidos adjacentes a cibersegurança e biologia para um caminho mais restritivo, o que reduz as pontuações publicadas nessas avaliações em relação ao que o modelo subjacente produziria. Se o seu trabalho envolve esses domínios, a lacuna entre o benchmark e a sua experiência será real, e será na direção de o benchmark ser otimista.
O que uma tarefa real custa em cada

O Claude Opus 5.5 é o modelo mais barato da tabela de preços, e não é por pouco:
• Claude Opus 5.5 — US$ 4,00 por milhão de entrada, US$ 20,00 por milhão de saída, US$ 0,20 por milhão de entrada em cache, US$ 5,00 por milhão de gravações em cache. Contexto de 1M tokens, saída máxima de 128k.
• GPT-6 Astra — US$ 10,00 por milhão de tokens de entrada, US$ 50,00 por milhão de tokens de saída, US$ 1,00 por milhão de tokens de entrada em cache, US$ 12,50 por milhão de gravações em cache. Após 272.000 tokens de entrada em uma única solicitação, a solicitação inteira passa a custar US$ 20,00 de entrada e US$ 100,00 de saída; o nível de lote é US$ 5,00/US$ 25,00.
Então Claude Opus 5.5 é 2,5 vezes mais barato na entrada e 2,5 vezes mais barato na saída, com entrada em cache cinco vezes mais barata. Se suas tarefas são semelhantes em tokens, essa é toda a decisão e a questão do gosto é decoração.
A ressalva sobre o uso de tokens acima é o que impede que seja assim tão simples, e a reprecificação de contexto longo do GPT-6 Astra é a outra armadilha. Ultrapasse 272.000 tokens de entrada em uma única requisição e a requisição inteira — não apenas o excedente — passa para a tarifa de contexto longo. Uma carga de trabalho de pesquisa que concentra um grande corpus em uma única chamada é exatamente o formato que a aciona. O processamento em lote pela metade do preço é a válvula de escape legítima, e fica na fila mais lenta.
O resumo honesto é que o quadro de custos se inverte dependendo do que você está fazendo. Para uma tarefa em que ambos os modelos usam tokens comparáveis, o Claude Opus 5.5 vence no preço por uma margem ampla. Para um longo ciclo de pesquisa agêntica em que as contagens de tokens divergem como o próprio material de lançamento da Anthropic mostra, os dois convergem — o que é uma manchete muito menos empolgante do que um corte de custos de 40%, e mais próxima do que o profissional estava relatando.
Por que o usuário que faz muitas pesquisas não trocou
Junte as peças e a frase "ainda prefiro a Astra" deixa de ser uma contradição da frase "ótimo sabor". É a mesma observação vista de um assento diferente.
As cargas de trabalho que o usuário mencionou são longas, abertas, usam ferramentas e são caras por execução. Nessas, o GPT-6 Astra domina os rankings de ciência e automação, usa uma fração dos tokens de raciocínio e — segundo medição independente — fica empatado em programação quando ambos os modelos operam com o mesmo esforço. As vantagens do Claude Opus 5.5 concentram-se no trabalho em que você consegue ver o resultado e julgá-lo: prosa, escolhas de design, delimitação de um briefing ambíguo, decidir o que um vídeo sobre Navier-Stokes deveria de fato mostrar. Isso é bom gosto, e bom gosto é exatamente a parte que não aparece em um eixo de benchmark.
Se você esperava um veredito de que um modelo vence, as evidências não sustentam isso. A versão defensável é mais restrita: Claude Opus 5.5 é o melhor modelo para trabalho em que o julgamento é o gargalo, GPT-6 Astra é o melhor modelo para trabalho em que o esforço sustentado com contextos longos é o gargalo, e a diferença de preço entre eles diminui para quase nada no segundo tipo de trabalho. Isso é uma decisão de roteamento, não uma conversão.
Executando ambos sem uma migração

Esta é a parte em que os dois modelos deixam de ser uma questão de um ou outro. O GPT-6 Astra está no OrcaRouter hoje pelo preço de tabela da própria OpenAI — US$ 10,00 de entrada, US$ 50,00 de saída, US$ 1,00 por leitura em cache, US$ 12,50 por gravação em cache — com 0% de margem, o preço de tabela do provedor repassado diretamente. Isso significa que uma mudança de tarifa do fornecedor chega ao nosso lado no mesmo dia, e não quando um revendedor sincroniza.
O Claude Opus 5.5 está acessível através da própria API da Anthropic e de várias plataformas de terceiros; não o estamos a listar como algo que servimos, e deve ser cético em relação a quem afirme o contrário antes de o modelo se ter propagado. O que pode fazer hoje é colocar ambos os modelos atrás de uma única chave e um único formato de endpoint, e encaminhar por carga de trabalho em vez de por preferência: enviar o pedido aberto e que exige muito discernimento para o Claude Opus 5.5 e o longo ciclo de investigação para o GPT-6 Astra, sem manter dois contratos ou duas integrações de cliente.
O failover automático é o que torna isso seguro de testar. Um novo modelo ainda não é um caminho de produção, e rotear por um único endpoint significa que um incidente do provedor ou um limite de taxa move a requisição em vez de fazê-la falhar. Se você quer descobrir se a lacuna de gosto é real no seu próprio trabalho, essa é a forma barata de descobrir — execute-o ao lado do que você já tem em vez de substituí-lo, e deixe sua própria suíte decidir em vez das tabelas de lançamento.
A pergunta que os benchmarks não conseguem responder
Duas coisas merecem atenção, e nenhuma delas é mais um ponto de benchmark.
A primeira é se a assimetria na configuração de esforço será resolvida. No momento, uma tabela de fornecedor em xhigh contra um concorrente em high produz uma vantagem de 8,5 pontos que testes independentes com configurações equivalentes transformam em empate. À medida que laboratórios independentes publicarem execuções com configurações equivalentes nos rankings de ciência e automação, onde o GPT-6 Astra lidera atualmente, esse cenário pode mudar em qualquer direção — e vai mudar com base em evidências, não no enquadramento de ninguém.
A segunda é a questão da eficiência de tokens. Se a sobrecarga de raciocínio do Claude Opus 5.5 diminuir em uma versão pontual, sua vantagem de 2,5x na tabela de preços deixa de ser compensada e o argumento de preço vence de forma definitiva. Se isso não acontecer, então o profissional que manteve o GPT-6 Astra como sua principal ferramenta não está atrás do ciclo de notícias. Ele interpretou corretamente sua própria carga de trabalho, e a tabela de lançamento simplesmente não estava medindo isso.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
