Cartão de título hero para GPT-6 Astra vs Qwen3.8-Max com o subtítulo 'Dois carros-chefes agênticos e as letras miúdas sob cada um', chips de estatísticas exibindo 'Inteligência AA 61 vs 58', 'Preço de tabela $10 / $50 vs $2 / $6' e 'ARC-AGI-3: 99,9% vendor vs 62,7% harness neutro', um rodapé com a data de lançamento e o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

GPT-6 Astra vs Qwen3.8-Max: Dois carros-chefes agênticos e as letras miúdas de cada um

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Setembro de 2026 tem duas histórias de "carro-chefe agêntico", e GPT-6 Astra e Qwen3.8-Max são os protagonistas de ambas. A OpenAI lançou o GPT-6 Astra em 3 de setembro como o modelo que afirma ser o melhor do mundo em uso de computador, engenharia de software, ciência e cibersegurança; o Qwen3.8-Max da Alibaba, disponível desde 3 de agosto, é o carro-chefe agêntico do laboratório chinês mais forte — o único que a Artificial Analysis classifica entre os melhores da área em seu índice agêntico e o rival mais próximo do ecossistema aberto das alegações de trabalho autônomo da fronteira. Ambos são genuinamente fortes, e ambos são vendidos com números de destaque que encolhem sob escrutínio: o resultado de 99,9% ARC-AGI-3 da OpenAI cai para 62,7% quando o ARC Prize executa seu próprio harness neutro, e a brilhantismo agêntico do Qwen3.8-Max vem com uma regressão de alucinação medida de forma independente e um hábito de gastar 64 turnos e mais de um dólar em tarefas que seu predecessor concluía em 14. Esta é uma comparação de dois modelos — e de duas maneiras de ler um benchmark.

As duas manchetes

A proposta da OpenAI para o GPT-6 Astra é amplitude mais autonomia: um único modelo que opera um navegador, escreve e corrige código, executa análises científicas e — de forma única — encontra novas vulnerabilidades de segurança com competência suficiente para que a própria OpenAI classificasse o modelo inteiro como "crítico" em sua Estrutura de Preparação e restringisse as configurações mais capazes a parceiros credenciados. Os materiais de lançamento afirmam uma pontuação perfeita de 100% no ExploitBench, 97,6% no FrontierMath Nível 4, 96,0% no GPQA Diamond e a pontuação de saturação no ARC-AGI-3. A proposta da Alibaba para o Qwen3.8-Max é mais restrita, mas incisiva: um cavalo de batalha agêntico por US$ 2/US$ 6 que pontua no topo ou perto do topo das avaliações agênticas independentes, com os pesos subjacentes publicados (sob uma licença personalizada) em vez de trancados em uma caixa-preta.

O que o placar independente diz

A Artificial Analysis atualmente avalia a GPT-6 Astra (max) com Inteligência 61 — 8ª posição entre os 202 modelos que acompanha — e a Qwen3.8-Max com Inteligência 58, 24ª posição. Essa diferença de três pontos é menor do que a diferença de preço entre os dois e menor do que o marketing de qualquer um dos fornecedores; no índice agêntico separado da AA, a Qwen3.8-Max registra um 58 que a coloca no mesmo nível do que há de melhor na fronteira proprietária, enquanto a AA ainda não publica índice agêntico algum para a GPT-6 Astra. A leitura honesta: em inteligência puramente medida, os dois modelos são vizinhos próximos, e o enquadramento de "modelo mais inteligente do mundo" nos materiais de lançamento da OpenAI não é o que a avaliação independente da AA mostra.

Inteligência — GPT-6 Astra (max): AA Intelligence 61, rank #8/202. Qwen3.8-Max: AA Intelligence 58, rank #24/202; AA Agentic 58.

Preço de tabela — GPT-6 Astra: $10.00 / $50.00 por 1M, $1.00 leituras de cache, 2× a entrada acima de 272K tokens. Qwen3.8-Max: $2.00 / $6.00 por 1M, $0.25 leituras de cache.

Contexto / saída — GPT-6 Astra: 1,05M de entrada / 128K de saída. Qwen3.8-Max: 1M de entrada / ~128K de saída.

Evidência agêntica — GPT-6 Astra: ARC-AGI-3 99.9% (harness da OpenAI) vs 62.7% (harness padrão do ARC Prize); WANDR 0.682 @ $11.98/tarefa (relatado pela Perplexity). Qwen3.8-Max: AA GDPval 1,739 Elo com 64 turnos/tarefa (~$1.14/tarefa); Code Arena WebDev #1 com 1,691 Elo.

Bandeiras vermelhas independentes — GPT-6 Astra: ainda não está no seletor do ChatGPT, API em fase de lançamento, concessão de monitorabilidade. Qwen3.8-Max: regressão de alucinação AA-Omniscience de 23% para 40% em comparação com a geração anterior.

Pesos — GPT-6 Astra: proprietário. Qwen3.8-Max: checkpoint classe Max (Qwen3.8-2.4T-A95B), público sob licença personalizada desde 12 de agosto; a AA ainda lista o carro-chefe hospedado como proprietário.

Two-column comparison scoreboard for GPT-6 Astra vs Qwen3.8-Max. GPT-6 Astra column: AA Intelligence 61 (#8 of 202), AA Agentic not yet published, list price $10.00/$50.00, context/output 1.05M/128K, headline score ARC-AGI-3 99.9% on OpenAI's provider-adapter harness, independent caveat 62.7% on ARC Prize's standard harness. Qwen3.8-Max column: AA Intelligence 58 (#24 of 202), AA Agentic 58, list price $2.00/$6.00, context/output 1M/~128K, headline score GDPval 1,739 Elo on Artificial Analysis runs, independent caveat hallucination regression from 23% to 40% per AA-Omniscience.

A letra miúda, anotada

Considere primeiro o número do ARC-AGI-3, pois é o exemplo mais claro de como um número pode ser ao mesmo tempo verdadeiro e enganoso. A OpenAI relata 99,9% para o GPT-6 Astra em seu próprio harness de adaptador de provedor — uma configuração ajustada ao modelo. O ARC Prize, a organização que mantém o benchmark, executou o GPT-6 Astra em seu harness padrão neutro de provedor e mediu 62,7%. Ambos são estado da arte; nenhum é 99,9% em um harness que o fabricante do modelo não controla. O mesmo cuidado se aplica à pontuação WANDR de 0,682 da Perplexity — a mais alta já registrada pela Perplexity, mas medida por uma empresa que está simultaneamente integrando o GPT-6 Astra aos seus próprios produtos, o que acarreta um interesse comercial. O padrão merece ser nomeado: os números mais espetaculares da OpenAI vêm todos de harnesses que a OpenAI ou seus parceiros controlam, e o único número totalmente independente — Intelligence 61 da AA — é apenas excelente.

As letras miúdas do Qwen3.8-Max vão na outra direção: seus pontos fortes são medidos de forma independente, e seus pontos fracos também. A pontuação GDPval de 1.739 Elo é genuína — mas as execuções do Artificial Analysis mostram que o Qwen3.8-Max a alcança ao gastar 64 turnos e cerca de US$ 1,14 por tarefa, contra 14 turnos e US$ 0,53 para a geração anterior. Isso é um imposto de esforço: o modelo compra seu teto de agência com tokens de raciocínio, o que importa para qualquer pessoa que pague por token. E a avaliação Omniscience da AA mediu uma piora nas alucinações, de 23% para 40%, em relação à geração anterior do Qwen — um sinal independente e real exatamente para as cargas de trabalho autônomas, de múltiplas etapas, em que uma resposta errada e confiante é mais cara. Um modelo que se convence de erros em 64 turnos não é obviamente mais seguro de liberar do que um cujo fabricante admite a diminuição de sua monitorabilidade.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max) showing an Intelligence Index of 61 ranked #8 of 202, Cost ranked #86 of 202 with $10.00 input and $50.00 output per million tokens and a 90% cache discount, a $1.67 cost per Intelligence Index task, and a summary describing the model as among the leaders in intelligence but expensive for its class.

Preço, implantação e a maneira honesta de escolher

Em termos de preço, não há disputa: Qwen3.8-Max, a US$ 2,00 / US$ 6,00 por milhão de tokens, custa um quinto do preço de entrada do GPT-6 Astra e um oitavo do preço de saída, com um contexto de 1M de tokens que não inclui a sobretaxa da Astra por prompts longos. Em termos de implantação, a Qwen3.8-Max tem mais uma vantagem esta semana — ela pode ser chamada hoje, e está no ar no OrcaRouter pelo preço de tabela da Alibaba, repassado com 0% de markup e failover automático. O GPT-6 Astra, ainda em fase de lançamento e ainda não selecionável no ChatGPT para a maioria dos usuários até 4 de setembro, está acessível pela própria API da OpenAI e pelos principais marketplaces de nuvem, enquanto o acesso se expande. O padrão prático para uma equipe que constrói pipelines agênticos é colocar a carga de trabalho no modelo que você pode chamar hoje e tratar o outro como um benchmark a ser observado. Se você quiser avaliar alegações "agênticas" em vez de confiar nelas, uma camada de roteamento é a ferramenta: Qwen3.8-Max, Kimi K3, Grok 4.6 e 200+ outros modelos podem ser acessados com uma única chave no OrcaRouter, e o DSL de roteamento pode combinar vários deles em uma única chamada — assim você pode executar sua própria suíte de tarefas contra os concorrentes e ler os resultados você mesmo, em vez de escolher com base nas letras miúdas de dois fornecedores.

Duas perguntas que este confronto não para de levantar

Por que a OpenAI relata 99,9% no ARC-AGI-3 quando o ARC Prize mede 62,7%? Porque não são o mesmo teste. O harness de adaptador do provedor da OpenAI é uma versão do benchmark configurada para como o GPT-6 Astra é chamado em produção; o harness padrão do ARC Prize é uma configuração neutra projetada para comparar qualquer modelo de forma justa. O resultado de 62,7% é o que generaliza para "o que acontece se eu mesmo chamar este modelo", e ainda é a melhor pontuação que o ARC Prize já registrou nesse harness.

O Qwen3.8-Max tem pesos abertos? Em parte, com uma ressalva de licença. A Alibaba publicou em 12 de agosto o checkpoint da classe Max Qwen3.8-2.4T-A95B sob uma licença personalizada — os pesos podem ser baixados, mas não é o mesmo nível de abertura no estilo Apache-2.0 do Qwen3.8-27B, que é menor, e a Artificial Analysis ainda lista o carro-chefe hospedado como proprietário. Se o seu requisito é "posso executar exatamente o modelo pelo qual pago", essa distinção importa; se o seu requisito é "posso inspecionar a arquitetura e auto-hospedar uma variante próxima", o Qwen3.8-Max se qualifica e o GPT-6 Astra não.

A conclusão

Escolha o GPT-6 Astra se precisar das coisas específicas que só ele faz hoje — trabalho de segurança ofensiva, raciocínio científico de fronteira, as tarefas mais difíceis de uso autônomo de computador — e se sua organização conseguir passar pelo controle de acesso e arcar com o preço. Escolha o Qwen3.8-Max se quiser um modelo agêntico de primeira linha que você consiga de fato implantar já nesta semana por $2/$6, com os pesos como válvula de escape e uma regressão de alucinação que você agora sabe que precisa testar. A lição mais ampla é a própria letra miúda: em setembro de 2026, os dois principais carros-chefe "agênticos" são vendidos com números de destaque que nenhum dos fabricantes controla por completo, e o comprador racional lê o harness, conta os turnos e executa as próprias tarefas antes de escolher um lado.

Screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing the $2.00 per 1M input and $6.00 per 1M output prices, and Alibaba listed as the provider with the model's flagship reasoning and agentic positioning.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente