
A primeira pontuação independente do GPT-6.1 Sol chegou: 0,84 pontos atrás da Astra, com menos de um quarto do custo da tarefa.
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 397 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- OrcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Todos os textos sobre o GPT-6.1 Sol publicados nos dias seguintes ao lançamento do DevDay da OpenAI em 29 de setembro de 2026 — incluindo o deste blog — traziam a mesma ressalva: os números de capacidade eram do fornecedor e nenhum terceiro havia avaliado o modelo. Essa ressalva agora está desatualizada. O Artificial Analysis tem uma linha do GPT-6.1 Sol em seu Intelligence Index, executada com esforço máximo de raciocínio, e é o primeiro número na curta vida deste modelo que a OpenAI não produziu. Ele registra 51,8 contra 52,7 do GPT-6 Astra e 47,5 do GPT-6 Sol — uma diferença de menos de um ponto para o carro-chefe de US$ 10/US$ 50, e um avanço de 4,3 pontos em relação ao modelo que o GPT-6.1 Sol substitui. O número que torna a linha interessante é o que está ao lado dele: o painel precifica a execução de avaliação por trás de cada pontuação, e a execução no índice do GPT-6.1 Sol custou US$ 0,72 por tarefa, enquanto a da Astra custou US$ 3,26. Quatro vezes e meia o dinheiro por 0,84 ponto é a comparação inteira em uma linha, e agora é uma linha medida, e não o enquadramento feito por um fornecedor.
A própria linha, e em que ela foi executada

A Artificial Analysis publica seu Intelligence Index como um composto de dez avaliações, e a versão em execução em 30 de setembro de 2026 era a v4.3.2 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR v1.1. Os três modelos da OpenAI neste artigo estão sobre essa mesma versão, então a comparação abaixo é de igual para igual de um jeito que a própria tabela de lançamento de um fornecedor nunca é. O placar também registra a data de lançamento que tem para o modelo — 2026-09-29, a data do DevDay — e o avalia na configuração de esforço máximo, que é a configuração que a página nomeia em seu próprio título.
• Índice de Inteligência — 51,8 para GPT-6.1 Sol (max), 52,7 para GPT-6 Astra (max), 47,5 para GPT-6 Sol (max).
• Custo por tarefa do índice — $0,72 para GPT-6.1 Sol, $3,26 para Astra, $1,05 para GPT-6 Sol. Este é o número do próprio ranking para quanto custou executar uma avaliação completa do índice, não uma tabela de preços.
• Tokens de saída gastos na execução — 67,2 milhões para GPT-6.1 Sol, 60,0 milhões para Astra, 76,8 milhões para GPT-6 Sol. O próprio comentário da AA chama 67 milhões de "razoavelmente conciso" em comparação com a mediana do ranking de 82 milhões, o que é uma segunda vitória mais discreta sobre o modelo que ele substitui.
• Velocidade de saída — 66,8 tokens por segundo para GPT-6.1 Sol, 57,0 para Astra, 76,2 para GPT-6 Sol.
• Preços conforme listados pelo ranking — $2,00 de entrada e $10,00 de saída por milhão de tokens para GPT-6.1 Sol, com entrada em cache a $0,10 e gravações em cache a $2,50. Esses quatro números correspondem exatamente à página de preços do fornecedor, que é a coisa menos dramática e mais útil sobre a linha: uma lista independente das tarifas que já citamos.
Uma nota de enquadramento antes que os números sejam usados como munição. O índice da AA é composto por dez avaliações, e as avaliações com que a OpenAI abriu o seu próprio anúncio — DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1 — não estão entre elas. A AA executa a sua própria variante do AutomationBench, que não é o mesmo harness que a versão do AutomationBench citada pelo fornecedor. Assim, o registo independente não confirma nem refuta as quatro alegações principais do artigo de lançamento; mede um conjunto de tarefas em grande parte diferente, e vale a pena lê-lo como uma segunda opinião sobre a forma do modelo, e não como um veredicto sobre essas frases específicas.
O Astra ainda vence, por menos de um ponto, por quatro vezes e meia o preço.

Ambos os modelos expõem uma escada de esforço, e o painel agora publicou uma pontuação e um custo de execução para cada degrau de ambos. Alinhadas, as escadas dizem algo que a comparação única de manchete não consegue: a melhor configuração do GPT-6.1 Sol não está competindo com a melhor da Astra. Está competindo com a segunda melhor da Astra.
• GPT-6.1 Sol, max — 51.8, $0.72 por tarefa de índice. GPT-6 Astra, max — 52.7, $3.26.
• GPT-6.1 Sol, xhigh — 51.0, $0.39. GPT-6 Astra, xhigh — 52.4, $2.31.
• GPT-6.1 Sol, high — 50.2, $0.32. GPT-6 Astra, high — 50.9, $1.73.
• GPT-6.1 Sol, medium — 47.8, $0.21. GPT-6 Astra, medium — 49.6, $1.54.
• GPT-6.1 Sol, low — 42.1, $0.13. GPT-6 Astra, low — 45.8, $0.82.
A Astra lidera em todos os degraus, o que é o resumo honesto do confronto e também a parte menos interessante dele. A parte interessante é a taxa de conversão. Se você quer a configuração mais barata da Astra que supera a melhor do GPT-6.1 Sol, é a Astra em xhigh: 52,4 contra 51,8, por US$ 2,31 contra US$ 0,72. Isso é 0,56 de um ponto de índice por US$ 1,59 a mais por execução de avaliação — aproximadamente 3,2 vezes o custo por menos de um por cento da pontuação. Siga na direção oposta e reduza o GPT-6.1 Sol para xhigh, e você abre mão de 0,8 ponto enquanto a conta cai para US$ 0,39, o que é 5,9 vezes mais barato que o xhigh da Astra e um nono da execução de esforço máximo da Astra.
Há uma segunda leitura da mesma escada que argumenta contra comprar a Astra com esforço máximo. Os quatro degraus inferiores da Astra são todos mais baratos que o seu máximo, e o seu xhigh está 0,29 pontos abaixo do seu máximo — pouco mais de meio por cento da pontuação por um corte de 29% no custo de execução. Qualquer conversa de aquisição sobre este par que comece em "Astra no máximo" e termine em "Astra custa 4,5 vezes mais" está deixando os próprios degraus mais baratos da Astra fora da comparação.
Seis avaliações vão para Astra, duas vão para GPT-6.1 Sol, duas empatam
O composto esconde uma divisão. Avaliado avaliação por avaliação com esforço máximo, GPT-6.1 Sol não é um Astra uniformemente um pouco pior — ele é melhor em duas coisas e pior em seis.
• GDPval-AA — Elo 1575,1 para o GPT-6.1 Sol contra 1541,9 para o Astra, uma vantagem de 33 pontos em tarefas de trabalho profissional. Esta é a maior vitória independente isolada do modelo mais barato.
• AA-LCR v1.1, raciocínio de contexto longo — 0,830 contra 0,807. GPT-6.1 Sol lidera.
• AA-Briefcase v1.1 — Elo 1564,2 contra 1568,9. Astra por 4,7.
• AutomationBench-AA — 0,649 contra 0,685. Astra por 3,6 pontos.
• Terminal-Bench 4.0 — 0,561 contra 0,591. Astra por 3,0 pontos.
• SciCode — 0,542 contra 0,565. Astra por 2,3 pontos.
• Humanity's Last Exam — 0,529 contra 0,547. Astra por 1,8 pontos.
• AA-Omniscience — 41,5 contra 43,4. Astra por 1,9 pontos.
• GDP.pdf e CritPt — empates exatos em 0,310 e 0,317, respectivamente, em ambos os modelos.
Duas dessas linhas valem mais do que sua posição na lista. A margem do GDPval-AA é o único lugar em que a vantagem do modelo mais barato é grande o suficiente para sobreviver a uma mudança de harness, e ela recai exatamente sobre a carga de trabalho que a linha de posicionamento do fornecedor alega — trabalho profissional, intensivo em documentos. E os dois empates absolutos estão nas avaliações com as dispersões mais estreitas, o que é um lembrete de que uma diferença composta de 0,84 ponto está sendo montada a partir de linhas que, individualmente, variam de uma vitória de 33 pontos a uma derrota de 3,6 pontos.
Em comparação com o modelo que substitui, o ganho é real, mas não é uniforme.
A comparação que importa para qualquer pessoa que já executa o GPT-6 Sol em um caminho de produção é a que o 6.1 Sol faz em relação ao seu próprio antecessor, e o registro independente é mais incisivo quanto a isso do que a publicação do fornecedor foi. Oito de dez avaliações melhoram. Duas regridem.
• SciCode — GPT-6.1 Sol pontua 0,542, enquanto GPT-6 Sol pontuou 0,576. O modelo mais novo é 3,5 pontos pior em código científico.
• AA-LCR v1.1 — 0,830 para o 6.1 Sol contra 0,837 para o GPT-6 Sol. Uma diferença mínima, mas na direção errada, na avaliação de contexto longo.
• AA-Omniscience — 41,5 contra 27,1. Este é o maior movimento da linha: um salto de 14,4 pontos na avaliação de conhecimento, e a precisão nesse conjunto subindo de 0,545 para 0,621.
• Taxa de alucinação no mesmo conjunto — 0,543 para o GPT-6.1 Sol, abaixo de 0,601 para o GPT-6 Sol e ainda acima de 0,513 do GPT-6 Astra. O AA-Omniscience divide sua pontuação em "acertou" e "errou com confiança", e a divisão é onde a atualização 6.1 se justifica: é um modelo significativamente menos desonesto que o Sol, e ainda é o mais desonesto dos três.
• Terminal-Bench 4.0 — 0,561 contra 0,439, um ganho de 12,2 pontos. AA-Briefcase — 1482,8 a 1564,2 Elo. GDP.pdf — 0,248 a 0,310.
A leitura é que esta foi mais uma atualização de conhecimento e ferramentas do que uma atualização de raciocínio. As avaliações que mais mudaram são as que recompensam saber coisas e não inventá-las; a avaliação que caiu é uma avaliação restrita e técnica. Quem migrou para o 6.1 Sol por causa do cache ganha o conhecimento como bônus e não deve presumir que isso se estenda a todo harness que executar.
Onde o quadro o classifica, e o que está acima.

Na ordenação padrão do Intelligence Index do ranking, GPT-6 Astra com esforço máximo ocupa a 7ª posição e GPT-6.1 Sol com esforço máximo ocupa a 10ª, com GPT-6 Sol com esforço máximo em 20º. As nove linhas acima de GPT-6.1 Sol são duas configurações do Astra, três configurações do Claude Opus 5.5, uma configuração do Claude Sonnet 5.5 e duas configurações do Claude Fable 5.1 — portanto, o modelo do qual GPT-6.1 Sol está mais próximo é o carro-chefe de sua própria família, e o modelo que ele de fato deslocou nessa ordenação é seu próprio antecessor, treze posições abaixo.
Se retirarmos o ajuste de esforço, a ordenação se comprime de um modo que importa para o planejamento de custos: GPT-6.1 Sol no xhigh ocupa a 13ª posição, no high a 15ª, no medium a 19ª e no low a 35ª, enquanto Astra ocupa a 14ª posição no high, a 16ª no medium e a 26ª no low. Em outras palavras, GPT-6.1 Sol no xhigh fica à frente de Astra no high no ranking, e GPT-6.1 Sol no medium fica à frente de Astra no low. O esforço é uma alavanca maior aqui do que a escolha do modelo, pelo menos entre esses dois.
O que fazer com o número, sinceramente
A alegação do fornecedor que esta linha testou era que o GPT-6.1 Sol quase iguala o modelo de ponta a cerca de um quinto do preço. A versão independente dessa frase é: ele fica a 0,84 ponto de índice do modelo de ponta, e a execução de avaliação por trás de sua pontuação custou 22% da execução do modelo de ponta. Isso está suficientemente próximo da alegação para que ninguém deva se sentir enganado por ela, e é uma afirmação mais forte do que "não verificado" em todos os sentidos que importam para um comprador.
O que a linha não faz é precificar sua carga de trabalho. Uma execução do índice é uma mistura específica de tarefas, e o número que decide uma fatura real é a tabela de preços aplicada ao seu próprio perfil de tokens — e é por isso que a linha de cache continua sendo a linha a modelar: o input em cache do GPT-6.1 Sol a US$ 0,10 contra US$ 1,00 da Astra é uma diferença de dez vezes que nenhuma pontuação de índice alcança. Do nosso lado, vale o mesmo repasse: a OrcaRouter serve GPT-6 Astra, GPT-6 Sol e GPT-6 Luna pelos preços de lista da própria OpenAI, sem nenhum markup adicionado, então no dia em que a tarifa de um fornecedor mudar, a tarifa do nosso lado muda junto, em vez de esperar por um segundo contrato. O GPT-6.1 Sol não está nas nossas rotas — o catálogo público retorna "model not found" para openai/gpt-6.1-sol hoje, e não há maneira honesta de descrever um modelo que não podemos servir. O que uma única chave de API compra para você neste momento é o par sobre o qual o benchmark de fato discute — Astra para o trabalho mais difícil, Sol para o volume — com os preços de lista dos provedores repassados sem markup e failover automático entre provedores quando um deles apresenta erro.
Duas coisas tornariam isto ainda mais preciso. Um segundo harness independente no mesmo modelo diria se a vantagem do GDPval-AA é uma propriedade do modelo ou daquela avaliação, e é o dado ausente mais útil da linha. E uma medição independente do nível de contexto longo de 272.000 tokens importaria mais do que outro ponto compósito, porque é aí que o preço desta família deixa de ser barato.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
