Um cartão de título principal para um artigo que compara GPT-6 Sol com Qwen3.8-Max, com o texto 'GPT-6 Sol vs Qwen3.8-Max' e o subtítulo 'A única linha em que o modelo fechado não consegue competir', mostrando GPT-6 Sol como entrada de texto e imagem e Qwen3.8-Max como entrada de texto, imagem e vídeo.
Guides & Insights

GPT-6 Sol vs Qwen3.8-Max: A única linha onde o modelo fechado não pode competir

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Quase toda comparação entre GPT-6 Sol e Qwen3.8-Max será decidida com base no custo, e quase todas elas errarão o custo na mesma direção. Qwen3.8-Max, o modelo principal hospedado do fornecedor, tem preço de US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída desde sua disponibilidade geral em 3 de agosto de 2026, com o snapshot datado Qwen3.8-Max-0902 chegando em 2 de setembro. GPT-6 Sol alcançou disponibilidade geral em 22 de setembro de 2026, a US$ 2,00 de entrada e US$ 10,00 de saída. Preço de entrada idêntico, e saída 40% mais barata na tabela de preços do Qwen3.8-Max — e, no harness independente, cerca de cinco vezes o custo para concluir uma tarefa.

Mas há uma segunda diferença, mais clara, que o argumento de custo continua a enterrar, e é ela que, na verdade, decide algumas cargas de trabalho. O Qwen3.8-Max aceita vídeo. O GPT-6 Sol não. Isso não é uma linha de preço nem uma linha de benchmark; é uma capacidade que um destes modelos tem e que o outro não consegue aproximar, e é a única parte deste confronto que nenhuma quantidade de trabalho de eficiência de tokens resolverá.

A six-row scoreboard card titled 'GPT-6 Sol vs Qwen3.8-Max - the scoreboard', comparing the two models on output price, Intelligence Index, cost per task, input modality, maximum output and long-context handling. The left column lists GPT-6 Sol at $10.00 output, an Index of 48, $1.06 per task, text and image input, a 128,000-token maximum output and whole-request repricing above 272K; the right column lists Qwen3.8-Max at $6.00 output, an Index of 45, $5.41 per task, text, image and video input, a 131,072-token maximum output and a flat tier above 272K. A footer reads 'Vendor list rates; Index per Artificial Analysis.'

Dois carros-chefe, duas formas diferentes

O Qwen3.8-Max é um modelo de mistura de especialistas esparsa com 2,4 trilhões de parâmetros, com cerca de 95 bilhões de parâmetros ativos por consulta — o segundo maior modelo hospedado em produção, atrás do Kimi K3. Sua janela de contexto é de um milhão de tokens, com um limite de saída de 131.072 tokens, suas modalidades de entrada são texto, imagem e vídeo, e ele suporta esforço de raciocínio em baixo, médio e extra-alto, com saídas estruturadas e chamada de ferramentas. O modelo principal hospedado não possui pesos abertos; o artefato baixável da mesma geração é um lançamento separado com suas próprias limitações.

GPT-6 Sol recebe texto e imagem e retorna texto. Sua janela é de 1.050.000 tokens, com entrada máxima de 922.000 tokens e teto de saída de 128.000 tokens, com preço fixo de $2,00 e $10,00, leitura em cache de $0,20 e gravações em cache de $2,50, com reajuste de toda a solicitação acima de 272.000 tokens de entrada para $4,00 e $15,00. É fechado, com identificador único, e a OpenAI descreveu as tarifas como permanentes, e não promocionais.

Os números da janela ficam dentro de cerca de 7% uns dos outros, e os tetos de saída estão na mesma faixa. A lista de modalidades é a única lacuna estrutural — e ela é unidirecional.

Linha por linha

• Entrada — GPT-6 Sol $2,00 por milhão de tokens vs Qwen3.8-Max $2,00 por milhão de tokens; o número de destaque é idêntico

• Saída — GPT-6 Sol US$ 10,00 por milhão de tokens vs. Qwen3.8-Max US$ 6,00 por milhão de tokens; a tarifa da Alibaba é 40% menor

• Entrada em cache — GPT-6 Sol $0,20 por milhão de tokens vs Qwen3.8-Max $0,25 por milhão de tokens para leituras de cache implícitas, com uma leitura de cache explícita a $0,17 e uma gravação de cache explícita a $2,50

• Janela de contexto — GPT-6 Sol 1.050.000 tokens vs Qwen3.8-Max 1.000.000 tokens

• Saída máxima — GPT-6 Sol 128.000 tokens vs Qwen3.8-Max 131.072 tokens

• Modalidades de entrada — GPT-6 Sol texto e imagem vs Qwen3.8-Max texto, imagem e vídeo

• Tratamento de contexto longo — o GPT-6 Sol aplica novos preços a toda a solicitação acima de 272.000 tokens de entrada, com 2× as tarifas de entrada e de cache e 1,5× a de saída, em comparação com o Qwen3.8-Max, que tem uma tarifa única em toda a janela; este é o único ponto em que a tabela de preços do Qwen é estruturalmente melhor, em vez de apenas marginalmente mais barata.

• Esforço de raciocínio — GPT-6 Sol nenhum, baixo, médio (padrão), alto, xhigh, máximo vs Qwen3.8-Max baixo, médio e extra-alto

• Data de corte de conhecimento — GPT-6 Sol, 20 de abril de 2026 vs. Qwen3.8-Max não publicado como uma data única

• Snapshot datado — GPT-6 Sol um único identificador contínuo vs Qwen3.8-Max-0902 disponível como uma revisão fixada de 2 de setembro de 2026 pelo mesmo preço

A linha de contexto longo merece mais atenção do que costuma receber. A sobretaxa do GPT-6 Sol é um degrau aplicado à solicitação inteira, então uma execução de agente de 900.000 tokens é cobrada a US$ 4,00 e US$ 15,00 por token. O Qwen3.8-Max cobra uma única faixa em toda a janela. Para uma carga de trabalho que opera acima de 272.000 tokens, as duas tabelas de preços deixam de ser comparáveis por completo — o modelo mais barato no preço de destaque é o mais caro por uma margem ampla, e a direção da diferença depende inteiramente de onde o seu contexto se encontra.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured 23 September 2026, showing an Intelligence Index score of 45, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a cost of $5.41 per Intelligence Index task, 190 million output tokens generated during the index run, a 984,000-token context window and 39.2 output tokens per second.

A tabela de preços diz 40% mais barato. O harness diz cinco vezes a conta.

A Artificial Analysis mediu o Qwen3.8-Max-0902 com uma pontuação de 45 no Intelligence Index, custando US$ 5,41 por tarefa de índice concluída, tendo gerado 190 milhões de tokens de saída ao longo da execução. Seu resumo descreve o modelo como "notavelmente lento e muito verboso". O GPT-6 Sol obteve 48 a US$ 1,06 por tarefa com 77 milhões de tokens de saída.

Leia esses três pares em conjunto e o formato do confronto surge. O Qwen está três pontos no índice atrás, gerou duas vezes e meia a quantidade de tokens e custou cerca de cinco vezes mais por tarefa concluída — em uma tabela de preços na qual sua saída é 40% mais barata. O mecanismo não é sutil. A US$ 6,00 por milhão de tokens de saída, 190 milhões de tokens custam US$ 1,14 por execução do índice apenas em saída, antes que a entrada seja contada; a US$ 10,00 por milhão, os 77 milhões do Sol custam US$ 0,77. A tarifa mais barata está comprando mais tokens, não uma conta menor.

Este é o mesmo padrão que aparece em todo o campo de setembro, e vale a pena enunciá-lo como uma regra, e não como um fato sobre estes dois modelos: numa tabela de preços por token, um desconto de 40% na saída não vale nada se o modelo emitir duas vezes e meia tantos tokens. O custo por tarefa concluída é o único número que sobrevive.

O que a Alibaba publicou, e o problema de definição de esforço

A própria tabela de benchmarks da Alibaba é a mais longa desta comparação e a menos comparável. Os números divulgados pelo fornecedor colocam o Qwen3.8-Max à frente no PaperBench e no IFBench, mas atrás no SWE-bench Pro e no Humanity's Last Exam, com uma escala de esforço de raciocínio — baixo, médio, extra-alto — que não tem correspondência direta com a escala de seis níveis da OpenAI. Uma pontuação publicada em extra-alto não é o mesmo produto que uma pontuação publicada em médio, e nenhum dos fornecedores indica qual delas gerou determinado número em um gráfico comparativo.

Essa é a razão honesta para não se apoiar na tabela de nenhum dos fornecedores aqui. Os números da Alibaba são executados no harness da Alibaba com a configuração de esforço da Alibaba; os da OpenAI são executados nos da OpenAI. Os números da Artificial Analysis existem justamente porque ambos aqueles são inutilizáveis numa comparação direta, e são esses os usados acima.

Reprodutibilidade é um recurso de verdade, e tem preço zero

O snapshot datado é a linha mais subestimada desta comparação. Qwen3.8-Max-0902 é uma revisão fixada de 2 de setembro de 2026 que, segundo a Alibaba, traz as mesmas capacidades e o mesmo preço do modelo base. Fixá-la significa que o modelo por trás do seu endpoint não muda debaixo de você entre uma terça-feira e uma quinta-feira.

GPT-6 Sol não tem equivalente. É um identificador único e contínuo — a mesma página do modelo contém um snapshot padrão e nenhuma variante datada — o que significa que aquilo que você avaliou em setembro não tem garantia de ser aquilo que você está chamando em novembro. Para a maioria das equipes, isso é aceitável. Para um pipeline regulamentado que precisa demonstrar o que produziu uma saída, é uma diferença real, e é uma que a Alibaba oferece de graça, enquanto a OpenAI não a oferece de forma alguma.

A linha de vídeo é a que decide

Tudo acima é uma comparação. Esta parte não é. Se a sua entrada inclui vídeo — gravações de tela, filmagens de inspeção, captura de aulas, qualquer coisa em que a informação esteja em movimento e não em um quadro estático — o Qwen3.8-Max o aceita nativamente, e o GPT-6 Sol não tem caminho para isso. Não há como contornar uma modalidade por meio de prompts. Não dá para pré-processar um vídeo em imagens e obter a mesma coisa, porque a informação temporal é o ponto central, e nenhuma quantidade de pontos de índice em um benchmark de texto substitui a entrada que a sua tarefa realmente exige.

O caso inverso também merece ser mencionado, porque é aí que a comparação deixa de ser desequilibrada. Se a sua entrada for texto e imagens, o Sol é mais barato por tarefa, está quatro pontos à frente no ranking neutro e é mais barato em leituras em cache. A capacidade de vídeo não é um critério de desempate a seu favor; ela simplesmente não é usada.

Roteando uma decisão que tem duas respostas separadas

Screenshot of OrcaRouter's model page for Qwen3.8 Max (0902), captured 23 September 2026, showing the model id qwen/qwen3.8-max-0902 from provider Qwen, a 1M-token context window with a 131k-token maximum output, text, image and video input with text output, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, and a p50 time to first token of 3.50 seconds.

Este é um caso em que a arquitetura correta é genuinamente dois modelos, não um, e a razão é que a divisão se dá por modalidade de entrada, e não por dificuldade. Um pipeline que ingere vídeo e raciocina sobre texto precisa dos dois, e a regra de roteamento é uma propriedade da requisição, e não uma decisão subjetiva.

Qwen3.8-Max está no catálogo da OrcaRouter — o snapshot datado qwen/qwen3.8-max-0902 é roteável ao preço de tabela da Alibaba sob o modelo de repasse, o que significa que uma alteração de preço da Alibaba entra em vigor do nosso lado no mesmo dia em vez de depois que um revendedor renegocia. O GPT-6 Sol não está no nosso catálogo no momento em que escrevemos e é acessível pela própria API da OpenAI. A DSL de roteamento é a peça que se encaixa neste caso específico: uma regra que envia requisições com vídeo por um caminho e todo o resto pelo outro é exatamente para isso que serve, e o failover automático significa que o ramo de modalidade não se torna o ponto único de falha.

Onde cada um vence

• Vídeo como entrada, texto como saída — Qwen3.8-Max, e não há competição a descrever.

• Entrada de texto e imagem, custo por tarefa concluída como métrica — GPT-6 Sol, por cerca de cinco vezes no harness independente.

• Trabalho com prefixo em cache — GPT-6 Sol. Sua leitura em cache é marginalmente mais barata e seu volume de tokens é menos da metade.

• Requisições acima de 272.000 tokens de entrada — Qwen3.8-Max. A reprecificação de toda a requisição da Sol é a maior diferença de custo individual nesta comparação, e é invisível nas tarifas anunciadas.

• Fixação reproduzível — Qwen3.8-Max-0902, que não custa nada extra e é a única revisão fixada das duas.

• Se lhe mostraram um gráfico com o Qwen à frente no SWE-bench Pro — verifique de quem é o harness que o produziu e em qual configuração de esforço. O painel independente tem o Qwen três pontos atrás na pontuação composta, e as tabelas dos fornecedores não estão na mesma escala entre si.

Comparados neste artigo3

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente