Cartão de título do artigo, com o cabeçalho 'GPT-6 Astra Benchmarks' e o subtítulo 'Cada pontuação, quem a mediu e onde os números deixam de significar qualquer coisa'. Três chips de estatísticas exibem 'FrontierMath Tier 4: 98% (saturado)', 'Terminal-Bench 4.0: 57,9% (relatado pelo fornecedor)' e 'DeepSWE v1.1: 74% (independente, empatado no topo)'. Uma linha de rodapé diz 'Modelo lançado em 3 de setembro de 2026. Números relidos em 16 de setembro de 2026.' O logotipo do OrcaRouter fica no canto inferior direito da tela com preenchimento.
Guides & Insights

Benchmarks do GPT-6 Astra: cada pontuação, quem a mediu e onde os números deixam de significar qualquer coisa

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

GPT-6 Astra obtém 98% no FrontierMath Tier 4 e 99,9% no ARC-AGI-3, e a própria Ope​nAI considera ambos os benchmarks saturados — o que faz dos dois números mais citados na página do modelo exatamente os dois que menos lhe dizem sobre se deve ou não usá-lo. Face a GPT-5.6 Sol e Claude Fable 5.1, as linhas que realmente discriminam estão noutro lado: 57,9% no Terminal-Bench 4.0, 74% no DeepSWE v1.1, que é independente e também um empate, e um valor de tempo por tarefa que decide mais sobre a usabilidade do que qualquer percentagem aqui. O próprio modelo é de 3 de setembro de 2026 — treze dias de existência no momento em que publicamos, não é notícia de lançamento. Esta é uma página de referência sobre o que o GPT-6 Astra pontua, quem realizou cada medição e o que cada número estabelece e não estabelece.

O motivo pelo qual um modelo de treze dias ainda vale uma página esta semana é que as coisas sobre as quais um leitor pode agir chegaram depois do lançamento. A disponibilidade ampla foi concluída: a OpenAI disse em 8 de setembro que a Astra foi totalmente disponibilizada para usuários Plus, Pro, Business e Enterprise no Codex e no ChatGPT Work, tendo aberto em 3 de setembro com a declaração de que estava "sendo disponibilizada hoje para um conjunto limitado de organizações e, ao longo dos próximos dias, ficará disponível para todos os usuários do ChatGPT Plus, Pro, Business e Enterprise, bem como por meio da API da OpenAI, do Microsoft Azure e do AWS Bedrock". O acesso Enterprise, desativado por padrão no lançamento, tornou-se algo que um administrador pode ativar de acordo com sua tabela de preços aplicável, e a página de trabalho empresarial da OpenAI para o modelo — publicada em 9 de setembro — veio com controles administrativos e quatro plugins empresariais. E as primeiras avaliações independentes do modelo surgiram, e é isso que transforma isto de um placar lido em um slide de fornecedor em algo que um comprador pode ponderar.

A lista completa de benchmarks, com a fonte em cada linha

Tudo abaixo é reportado pela OpenAI, a menos que a linha diga o contrário. Essa distinção não é enfeite: apenas um desses números de destaque foi produzido por alguém que não é a empresa que vende o modelo, e é justamente ele que acaba sendo um empate.

FrontierMath Tier 4 — 98%.Relatado pelo fornecedor Ope​nAI e descrito pela Ope​nAI como saturando o nível.

ARC-AGI-3 — 99,9%. Relatado pelo fornecedor, também descrito como saturado. A OpenAI acrescenta que o Astra "superou a nossa linha de base de eficiência de ação humana em 96% dos níveis, alcançando efetivamente a paridade humana no benchmark" — uma afirmação mais específica e mais interessante do que os 99,9%, e ainda assim uma medição da própria OpenAI.

ExploitBench — 100%. Relatado pelo fornecedor, e uma pontuação perfeita.

Terminal-Bench 4.0 — 57,9%. Relatado pelo fornecedor Ope​nAI, contra 37,3% do GPT-5.6 Sol e 55,8% do Claude Fable 5.1, a um custo estimado de API por tarefa cerca de 9% e 63% menor, respectivamente. Os valores de custo não vêm acompanhados de nenhuma metodologia publicada no material que consultamos.

DeepSWE v1.1 — 74%. Medido pela Datacurve, não pela Ope​nAI. Esta é a linha independente.

OSWorld 2.0 — 72,6%. Informado pelo fornecedor, a cerca de 40 minutos por tarefa, o que a Ope​nAI estima em aproximadamente 47% menos tempo por tarefa do que o GPT-5.6 Sol.

Mind2Web — conclusão de tarefas 1,9x mais rápida do que "a atual experiência do GPT-5.6 Sol", com um harness Codex atualizado. Relatado pelo fornecedor, e a comparação é feita contra um Sol com harness diferente, e não contra o mesmo scaffold com um modelo diferente.

Segurança — interno à OpenAI. O Astra produziu resultados não intencionais 89% menos vezes do que o GPT-5.6 Sol e 74,7% menos vezes do que o Claude Fable 5.1. Numa avaliação modelada a partir do incidente do Hugging Face, o GPT-5.6 Sol sem salvaguardas de produção ultrapassou o seu alvo autorizado em 48% das vezes; o Astra fê-lo em 0% dos casos.

A single-column scoreboard card titled 'GPT-6 Astra - the scoreboard' with six labelled rows: 'FrontierMath Tier 4: 98% (saturated)', 'ARC-AGI-3: 99.9% (saturated)', 'Terminal-Bench 4.0: 57.9% (vs GPT-5.6 Sol 37.3%)', 'DeepSWE v1.1: 74% (Datacurve, tied at top)', 'OSWorld 2.0: 72.6% at about 40 min per task', and 'List price: $10.00 in / $50.00 out per 1M'. The footer reads 'Vendor-reported by OpenAI except DeepSWE v1.1, measured by Datacurve. Read September 16, 2026.' The OrcaRouter logo is composited in the bottom-right.

Saturado significa que o benchmark deixou de ser um motivo de compra

Quando a OpenAI diz que FrontierMath Tier 4 e ARC-AGI-3 estão saturados, ela está dizendo algo específico e que vale a pena tomar ao pé da letra: os testes pararam de discriminar. Um benchmark justifica sua existência ao separar modelos — ao colocar uma lacuna entre o melhor sistema e o próximo, para que um comprador possa ler um número como uma diferença. Uma vez que todo modelo de ponta chega ao teto ou dentro do ruído dele, a pontuação deixa de medir os modelos e passa a medir a margem restante do teste.

O que isso significa para esta página é que 98% e 99,9% não devem ser usados para escolher nada. Eles não são evidência de que a Astra seja melhor que o GPT-5.6 Sol ou o Claude Fable 5.1 em matemática ou raciocínio abstrato; são evidência de que os três ultrapassaram os níveis. A diferença entre 99,9% e 98% não pode ser interpretada como uma vantagem de 1,9 ponto em qualquer sentido significativo, porque a variação entre execuções em avaliações desse tamanho é maior que a diferença. Um número de fornecedor no teto é uma afirmação sobre o teto.

Não são inúteis. A saturação é informação genuína sobre um nível: ela diz que um benchmark que você talvez tenha usado para comparar modelos em 2025 não vai mais ordená-los, e que você deve parar de atribuir-lhe peso em uma decisão de aquisição. Ela também diz que a afirmação de capacidade interessante se deslocou para outro lugar — o valor de 96% dos níveis para eficiência de ação humana é a tentativa da OpenAI de dizer algo além do teto, e é a subafirmação que deve ser contestada, não os 99,9%.

Há uma segunda ressalva que se aplica a todas as três linhas superiores. FrontierMath Tier 4 e ARC-AGI-3 são publicados com detalhes suficientes para serem reconhecíveis, mas o harness, a amostragem e a configuração de pontuação que a OpenAI usou não estão apresentados no material que lemos, e 99,9% em um benchmark cujo protocolo é uma configuração privada é um número que você pode citar e não pode verificar. Quando uma pontuação vem sem metodologia publicada, diga isso e siga em frente. É o que estamos fazendo com estas.

O 100% do ExploitBench mede uma capacidade que a maioria dos usuários não pode gastar

Uma pontuação perfeita também é um teto, e esta tem uma segunda metade incomum. Astra é o primeiro modelo a alcançar o limiar Crítico de capacidade de cibersegurança no âmbito do Preparedness Framework da OpenAI, e é por isso que o seu lançamento foi limitado desde o início. Na versão lançada, o modelo recusa tarefas cibernéticas avançadas, como escrever exploits de prova de conceito; a OpenAI diz que planeia alargar o acesso com salvaguardas menos restritivas através do seu programa Daybreak.

Portanto, o ExploitBench é simultaneamente o número mais impressionante da lista e o menos utilizável. Ele estabelece que a capacidade existe e que a OpenAI a mediu e agiu com base na medição — o que é a leitura honesta de uma designação Crítica, e a razão pela qual a implantação foi escalonada em vez de instantânea. Ele não estabelece que você possa fazer qualquer coisa com essa capacidade por meio da API pública, porque, por design, em grande parte você não pode. Se segurança ofensiva é o seu caso de uso, a linha relevante na documentação não é 100%, e sim o comportamento de recusa e o caminho de acesso do programa Daybreak.

Terminal-Bench 4.0: uma vantagem de 24,6 pontos sobre o Sol e uma diferença de 2,1 pontos que não decide nada

O Terminal-Bench 4.0 é onde os números dos fornecedores começam a ser úteis, porque a dispersão é ampla o suficiente para sobreviver ao ruído numa ponta e estreita o suficiente para ser pouco informativa na outra. Contra os 37,3% do GPT-5.6 Sol, os 57,9% da Astra representam uma diferença de 24,6 pontos — grande o bastante para que diferenças de harness dificilmente a expliquem por completo, embora ainda seja um fornecedor a medir o seu próprio modelo e um antecessor que também desenvolveu. Contra os 55,8% do Claude Fable 5.1, a vantagem de 2,1 pontos está dentro do intervalo em que devemos dizer com franqueza que não decide nada. Dois modelos medidos em dois harnesses diferentes, num benchmark cujas tolerâncias de pontuação não são publicadas na página que lemos, separados por dois pontos, é um empate com passos extra. Se a sua decisão depende desses 2,1, você não encontrou uma decisão — encontrou um slogan de marketing.

A alegação de custo por tarefa merece uma frase própria de desconfiança. A OpenAI estima o Astra com um custo de API por tarefa aproximadamente 9% inferior ao do Sol e 63% inferior ao do Claude Fable 5.1 nesta carga de trabalho. São estimativas, publicadas sem a contabilidade ao nível da tarefa por trás delas, e "custo por tarefa" não é uma propriedade de um modelo — é uma propriedade de um modelo, de um harness, de um orçamento de tokens e de uma política de retentativas em conjunto. A direção é plausível: o Fable 5.1 é um modelo de US$ 10/US$ 50 como o Astra, mas uma tarefa que lhe exige mais passos custa mais. Trate as percentagens como contabilidade da própria OpenAI, não como uma tabela de preços.

DeepSWE v1.1: a linha independente e o empate dentro dela

O único número não produzido pela Ope​nAI é o que mais vale a pena ter — e também é o que mais precisa de ressalvas. Datacurve: DeepSWE v1.1, um benchmark de engenharia de software de longo horizonte com 113 tarefas em 91 repositórios em cinco linguagens, executado por um único harness mini-swe-agent, o GPT-6 Astra obteve 74% ±3% de Pass@1 a um custo médio de US$ 6,52 por tarefa, produzindo 30 mil tokens de saída em 29 etapas. A Datacurve descreve o resultado como um recorde.

Leia o ranking, e o recorde está empatado. A mesma captura do ranking que lemos em 16 de setembro de 2026 — datada de 3 de setembro de 2026 — mostra gemini-3.8-flash [high] também em 74%, com um intervalo mais estreito de ±1%, e claude-opus-5 [max] em 74% ±4%, com gpt-5.6-sol [max] um ponto atrás, em 73% ±3%. Três modelos compartilham a pontuação máxima, com intervalos de confiança sobrepostos, e o próprio ranking observa que seus modelos de ponta se agrupam em uma faixa estreita. Nada nele indica um detentor do recorde. Um recorde que três modelos detêm simultaneamente, dentro das margens de erro, é uma afirmação muito diferente de "novo recorde", e a versão honesta é: Astra alcança o grupo de ponta na avaliação independente de programação mais forte disponível, e não se separa dele.

O que separa, e o que a pontuação sozinha esconde, é como ela chegou lá. Os 74% da Astra exigiram 29 passos e 30 mil tokens de saída. A entrada empatada do gemini-3.8-flash precisou de 166 passos e 143 mil tokens de saída; o claude-opus-5 precisou de 99 passos e 118 mil. Mesma pontuação, cerca de um quinto do trabalho — isso é uma propriedade real e útil para quem paga por token ou espera por um agente, e os números da Datacurve sustentam isso de um modo que as linhas de fornecedor da Ope​nAI não conseguem. A linha de custo, porém, aponta para o outro lado: a US$ 6,52 por tarefa, a Astra é a mais barata das três só se você ignorar que o gemini-3.8-flash alcançou a mesma pontuação a US$ 2,36. Neste benchmark, a Astra é eficiente em passos e está na faixa intermediária de preço em dólares. Fique com a pontuação empatada e a contagem de passos; não fique com um "recorde".

OSWorld 2.0 e o tempo por tarefa: o número que decide se um agente é utilizável

A OpenAI reporta 72,6% no OSWorld 2.0 a cerca de 40 minutos por tarefa, aproximadamente 47% menos tempo por tarefa do que o GPT-5.6 Sol. Isso merece mais peso do que sua posição na lista sugere, porque, para agentes de uso de computador, a pontuação é apenas metade da decisão. Uma taxa de conclusão de 72,6% é boa; uma taxa de conclusão de 72,6% a 40 minutos por tarefa é um produto diferente da mesma taxa a 75 minutos, e a diferença não é uma porcentagem. É quantas tarefas uma equipe consegue realizar em um dia de trabalho, quanto tempo real um humano espera enquanto um agente trabalha, e se uma única tarefa travada consome uma tarde.

Duas ressalvas, e ambas importam mais do que a manchete. Primeiro, o número é informado pelo fornecedor e não encontramos nenhuma pontuação independente do OSWorld 2.0 para o Astra com a qual compará-la — a entrada do índice independente que lemos não inclui o OSWorld entre seus componentes, então não há uma segunda medição para colocar ao lado desta. Segundo, "cerca de 40 minutos" é uma média, e médias escondem a parte que os operadores realmente sentem: a cauda. Se o decil mais lento das tarefas termina em uma hora ou em quatro horas é o que determina se um agente precisa de um humano sentado ao seu lado, e nenhum fornecedor publica essa distribuição. A alegação do Mind2Web — conclusão de tarefas 1,9x mais rápida do que a experiência atual com o GPT-5.6 Sol — tem o mesmo tipo de problema, ligeiramente agravado pelo fato de a comparação ser feita com um Sol com uma estrutura de teste diferente, em vez do mesmo arcabouço com um modelo diferente dentro dele. Mais rápido é crível aqui; o quanto mais rápido, na sua carga de trabalho, não foi medido.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max), captured 16 September 2026, showing an Artificial Analysis Intelligence Index of 53 ranked #3 of 199, output speed 52.9 tokens per second ranked #111 of 199, a cost of $3.26 per Intelligence Index task ranked #71 of 199, $10.00 input and $50.00 output per 1M tokens with a 90% cache discount, 60M output tokens generated on the Intelligence Index, a 1M-token context window, a knowledge cutoff of April 30, 2026, reasoning support marked 'Yes', and a total cost of $5324.10 to run the full index.

As avaliações de segurança também são medições, e estas são internas.

Os números de segurança pertencem a uma referência de benchmark, e não a uma nota de rodapé, porque são o mesmo tipo de alegação que as linhas de desempenho: uma medição, feita por uma parte interessada, com uma comparação declarada. A Astra produziu resultados não intencionais 89% menos vezes do que o GPT-5.6 Sol e 74,7% menos vezes do que o Claude Fable 5.1. Numa avaliação modelada a partir do incidente da Hugging Face, o GPT-5.6 Sol sem salvaguardas de produção ultrapassou o seu alvo autorizado em 48% dos casos; a Astra fê-lo em 0%.

A direção é significativa e a aritmética não é simétrica. Um dos lados dessa segunda comparação é explicitamente um modelo com as suas salvaguardas removidas, e o outro é o Astra tal como é disponibilizado — portanto, a diferença de 48 contra 0 é, em parte, uma medição de proteções e não do modelo subjacente, e interpretá-la como "Astra é mais segura do que Sol" exagera o que foi testado. Os valores de 89% e 74,7% são internos da OpenAI, sem replicação externa, numa avaliação cuja construção não podemos inspecionar. Todos os três apontam no mesmo sentido e todos os três são do próprio fornecedor; encare-os como encorajadores e não reproduzidos. São também, para um comprador empresarial, as linhas que mais precisam de ser verdadeiras — e é exatamente por isso que devem ser as linhas para as quais deve pedir comprovação a um fornecedor, em vez daquelas que aceita de uma página de lançamento.

Preço: $10 / $50, leitura de 16 de setembro de 2026 — e o 2,5x que precisa de um denominador

Uma página de benchmark que omite o preço é uma página que para no meio do caminho. Segundo a própria documentação de preços da Ope​nAI, datada de 16 de setembro de 2026, a tarifa padrão de contexto curto para o gpt-6-astra é de US$ 10,00 por milhão de tokens de entrada, US$ 1,00 por milhão de entrada em cache e US$ 50,00 por milhão de saída. Pedidos de contexto longo custam aproximadamente o dobro — cerca de US$ 20 de entrada e US$ 75 de saída por milhão. Abaixo de 1,05 milhão de tokens de contexto não há multiplicador de contexto longo a considerar, mas acima desse limiar a tarifa efetiva muda, e vale a pena modelá-la antes de assumir que o valor de US$ 10 se aplica a uma execução de agente sobre uma grande base de código.

A comparação que todos publicam é a Astra contra o GPT-5.6 Sol, e é aqui que um múltiplo sem data dá errado. A tarifa do Sol na mesma página, no mesmo dia, é US$ 4,00 de entrada / US$ 0,40 em cache / US$ 20,00 de saída — e a Ope​nAI afirma que este é um preço promocional disponível pelo menos até 21 de novembro de 2026. Em relação a essa tarifa promocional, a Astra é 2,5x tanto na entrada quanto na saída. Em relação à tabela pré-promoção do Sol de US$ 5,00 / US$ 0,50 / US$ 30,00, a Astra é 2x na entrada e cerca de 1,67x na saída. Ambos os números são verdadeiros; eles estão divididos por denominadores diferentes. O 2,5x é o que você paga hoje, o 2x e o 1,67x são o que você pagaria se a promoção do Sol expirasse — e, como a Ope​nAI não publicou nenhuma tarifa pós-promoção, ninguém pode dizer qual delas o seu orçamento de 2027 deve usar. Se você vê "2x" ou "2,5x" sem um nível nomeado e uma data, você está lendo metade de um fato.

Duas outras observações sobre preços, porque elas são confundidas com o preço de tabela. As cotações de endpoint diferem da própria tabela de preços da Ope​nAI: endpoints do Azure foram listados tanto a US$ 10/US$ 50 quanto a US$ 11/US$ 55, pelo menos um endpoint foi listado a US$ 20/US$ 100, e uma listagem de roteador mostra US$ 10/US$ 50 com um nível de lote a US$ 5/US$ 25. Essas são cotações de endpoints separados, não o preço de tabela da Ope​nAI, e não são intercambiáveis. E, para dar escala, na mesma página e data: GPT-5.6 Terra é US$ 2,00 / US$ 0,20 / US$ 12,00 e GPT-5.6 Luna é US$ 0,20 / US$ 0,02 / US$ 1,20 — então Astra não é um modelo pelo qual você encaminha tráfego em massa por reflexo. O preço dele é para o trabalho que as linhas de benchmark acima descrevem: tarefas de horizonte longo, ponta a ponta, em que 47% menos tempo de relógio real e menos passos de agente podem compensar uma tarifa de tokens 2,5 vezes maior, e não para chat.

É essa a aritmética em que uma camada de roteamento justifica seu lugar, e vale a pena ser concreto sobre o porquê. O GPT-6 Astra está no catálogo do OrcaRouter como openai/gpt-6-astra, e a plataforma repassa os preços de lista da Ope​nAI com 0% de markup — portanto, uma mudança de preço do fornecedor, incluindo a tarifa promocional da qual esta seção depende, entra em vigor do nosso lado no mesmo dia, em vez de seguir um ciclo de reprecificação. Isso também significa que a questão de nível acima deixa de ser hipotética: você pode colocar o Astra no trabalho de longo horizonte e deixar Sol, Terra ou Luna no volume, atrás de uma única chave, sem um segundo contrato ou alteração de código, e fazer failover entre eles quando um estiver degradado.

Screenshot of the OrcaRouter model page for GPT-6 Astra (catalog id openai/gpt-6-astra) captured 16 September 2026 with the site language set to EN, showing a 1M-token context window, 128K maximum output, text, image and file input, INPUT $10.00 and OUTPUT $50.00 per 1M tokens, p50 TTFT 6.70 s, p95 TTFT 10.00 s, 181.0M tokens of traffic in seven days, and an OpenAI-compatible Python code sample pointed at https://api.orcarouter.ai/v1 using the model id openai/gpt-6-astra.

Especificações, a mudança do Codex e o que a OpenAI não publicou

ID do modelo — gpt-6-astra na própria documentação da OpenAI.

Contexto e saída — janela de contexto de 1.050.000 tokens, máximo de 128.000 tokens de saída.

Data limite de conhecimento — 30 de abril de 2026. Suporte a tokens de raciocínio: sim.

Modalidades — entrada listada como arquivo, imagem e texto. Essa listagem específica vem de um roteador, não da Ope​nAI, e estamos rotulando-a como relatada pelo roteador, e não como confirmada pelo fornecedor.

Disponível em — ChatGPT Work, Codex e a API, além de Microsoft Azure e AWS Bedrock. Os espaços de trabalho empresariais vêm desativados por predefinição; um administrador ativa o acesso ao abrigo do tarifário aplicável e recebe controlos para restringir sites e aplicações de ambiente de trabalho aprovados, gerir carregamentos e descargas e controlar o histórico de navegação. O ChatGPT Work e o Codex acrescentam políticas de confirmação antes de ações com consequências e revisão automatizada de chamadas de ferramentas inseguras ou não autorizadas. Quatro plugins empresariais foram lançados em simultâneo no ChatGPT Desktop: Oracle Analytics, Power BI (um serviço Microsoft Fabric), Navan e Avalara. A Retenção Zero de Dados está disponível para clientes elegíveis da API em endpoints suportados, sujeita a aprovação.

Um mecanismo vale a pena destacar porque muda como o modelo se comporta em trabalhos longos, e não como ele pontua. O Codex ganha uma nova abordagem de contexto com o Astra: as anotações persistem entre janelas de contexto em vez de serem repetidamente compactadas em um único resumo, e janelas de contexto anteriores permanecem pesquisáveis, de modo que requisitos e resultados de testes de mensagens anteriores e da saída de ferramentas continuam localizáveis. A OpenAI a chama de experimental, habilitada no config.toml do Codex, e diz que ela se tornará o padrão para o Astra. Em um benchmark medido em 29 etapas, esse é o mecanismo com maior probabilidade de explicar a contagem de etapas.

O que não é publicado é tão importante quanto o que é. A OpenAI não declarou uma contagem de parâmetros nem a computação de treinamento para este modelo, e não vamos publicar nenhuma. O número de "mais de 100.000 GPUs no Stargate" circula em segunda mão e não está nas páginas que lemos. Nem a documentação da OpenAI lista um "Astra Pro" com preço separado ou documentado separadamente, nem qualquer outro nível — a cobertura faz referência a um, mas uma listagem de roteador não é documentação do fornecedor, e não vamos apresentar um nível que não conseguimos encontrar na própria documentação da OpenAI.

O que um leitor deveria realmente tirar disso

Ordene as linhas pelo quanto elas deveriam mover uma decisão. O par saturado — 98% no FrontierMath Tier 4 e 99,9% no ARC-AGI-3 — não deveria movê-la em nada; eles dizem que os benchmarks acabaram, não que a Astra os venceu. Os 100% do ExploitBench são reais e, por design, majoritariamente não gastáveis através do modelo público, o que é uma escolha deliberada de segurança, e não uma limitação a contornar. O Terminal-Bench 4.0 é a alegação de desempenho de fornecedor mais forte, com uma diferença genuína em relação ao Sol e uma diferença de 2,1 pontos em relação ao Claude Fable 5.1 que é próxima demais para decidir. O DeepSWE v1.1 é a única linha medida de forma independente, coloca a Astra num empate triplo no topo, e não sozinha, e suas contagens de passos e tokens são a parte desse resultado que vale citar. Os 40 minutos por tarefa do OSWorld 2.0 são o número mais relevante operacionalmente na página e o menos verificado de forma independente. As linhas de segurança são internas, não reproduzidas, e apontam na direção certa.

O que deixa uma divisão simples. Se você está escolhendo um modelo esta semana para trabalho agêntico de longo horizonte — programação de várias horas, uso de computador, tarefas ponta a ponta que, de outra forma, uma pessoa teria de acompanhar de perto — Astra é o modelo com as evidências mais atuais que o respaldam, e o argumento de custo se baseia no tempo economizado por tarefa, não nos tokens economizados por chamada. Se você está escolhendo para trabalho de alto volume e interações curtas, o 2,5x em relação à tarifa promocional da Sol é o número que decide, e a resposta provavelmente é não. E se você está escolhendo com base em um 98% ou um 99,9%, está escolhendo com base nas duas linhas que deixaram de ser informativas.

Perguntas que valem a pena ser feitas e que esta página não respondeu

A vantagem de 2,1 pontos no Terminal-Bench sobre o Claude Fable 5.1 é real?Com estas evidências, não. Ambos os números vêm da OpenAI medindo seu próprio modelo contra um concorrente, em estruturas de avaliação que não podemos comparar, sem tolerância de pontuação publicada. É uma vantagem na própria contabilidade da OpenAI e está dentro da faixa em que uma nova execução poderia invertê-la. A forma de resolver isso é executar os dois em suas próprias tarefas, o que dá algumas horas de trabalho e vale mais do que os 2,1 pontos.

Por que o ranking da Datacurve não coroa a Astra, quando o material de lançamento da OpenAI cita um recorde?Porque o ranking está medindo, e a página de lançamento está vendendo. O próprio recorte da Datacurve mostra três modelos a 74%, com intervalos de confiança sobrepostos, e não aponta nenhum líder. Uma alegação de recorde diante de um ranking empatado não é tanto uma mentira quanto uma escolha de denominador — o mesmo modo de falha do múltiplo de 2,5x, e a razão pela qual datamos todos os números aqui.

Se os principais benchmarks estão saturados, o que um comprador deve usar em vez disso? Tempo por tarefa, custo por tarefa concluída e contagem de etapas em trabalho de longo horizonte — as dimensões em que os números ainda estão dispersos e ainda se correlacionam com o que uma equipe paga. Essa é uma medição mais difícil de encontrar publicada, e é exatamente por isso que as páginas de lançamento dos fornecedores ainda colocam as saturadas em primeiro lugar.

A questão em aberto

O número que fará esta página envelhecer mais rápido é o preço. O preço promocional do Sol vigora pelo menos até 21 de novembro de 2026, e a OpenAI não publicou nenhum preço após a promoção; quando isso mudar, o 2,5x neste artigo mudará junto, na direção do 2x. O segundo é se alguém vai refazer essas avaliações de forma independente no mesmo harness — DeepSWE é o modelo de como isso deveria ser, e OSWorld 2.0 e Terminal-Bench 4.0 são as duas linhas que mais precisam desse tratamento. Até lá, o resumo honesto dos benchmarks do GPT-6 Astra é que os números impressionantes estão saturados, os números discriminantes são informados pelo fornecedor e próximos entre si, e o único número independente é um empate que o próprio material de lançamento do fornecedor chama de recorde.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente