
GPT-6 Sol vs Qwen3.8-Max: A única linha onde o modelo fechado não pode competir
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Quase toda comparação entre GPT-6 Sol e Qwen3.8-Max será decidida com base no custo, e quase todas elas errarão o custo na mesma direção. Qwen3.8-Max, o modelo principal hospedado do fornecedor, tem preço de US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída desde sua disponibilidade geral em 3 de agosto de 2026, com o snapshot datado Qwen3.8-Max-0902 chegando em 2 de setembro. GPT-6 Sol alcançou disponibilidade geral em 22 de setembro de 2026, a US$ 2,00 de entrada e US$ 10,00 de saída. Preço de entrada idêntico, e saída 40% mais barata na tabela de preços do Qwen3.8-Max — e, no harness independente, cerca de cinco vezes o custo para concluir uma tarefa.
Mas há uma segunda diferença, mais clara, que o argumento de custo continua a enterrar, e é ela que, na verdade, decide algumas cargas de trabalho. O Qwen3.8-Max aceita vídeo. O GPT-6 Sol não. Isso não é uma linha de preço nem uma linha de benchmark; é uma capacidade que um destes modelos tem e que o outro não consegue aproximar, e é a única parte deste confronto que nenhuma quantidade de trabalho de eficiência de tokens resolverá.

Dois carros-chefe, duas formas diferentes
O Qwen3.8-Max é um modelo de mistura de especialistas esparsa com 2,4 trilhões de parâmetros, com cerca de 95 bilhões de parâmetros ativos por consulta — o segundo maior modelo hospedado em produção, atrás do Kimi K3. Sua janela de contexto é de um milhão de tokens, com um limite de saída de 131.072 tokens, suas modalidades de entrada são texto, imagem e vídeo, e ele suporta esforço de raciocínio em baixo, médio e extra-alto, com saídas estruturadas e chamada de ferramentas. O modelo principal hospedado não possui pesos abertos; o artefato baixável da mesma geração é um lançamento separado com suas próprias limitações.
GPT-6 Sol recebe texto e imagem e retorna texto. Sua janela é de 1.050.000 tokens, com entrada máxima de 922.000 tokens e teto de saída de 128.000 tokens, com preço fixo de $2,00 e $10,00, leitura em cache de $0,20 e gravações em cache de $2,50, com reajuste de toda a solicitação acima de 272.000 tokens de entrada para $4,00 e $15,00. É fechado, com identificador único, e a OpenAI descreveu as tarifas como permanentes, e não promocionais.
Os números da janela ficam dentro de cerca de 7% uns dos outros, e os tetos de saída estão na mesma faixa. A lista de modalidades é a única lacuna estrutural — e ela é unidirecional.
Linha por linha
• Entrada — GPT-6 Sol $2,00 por milhão de tokens vs Qwen3.8-Max $2,00 por milhão de tokens; o número de destaque é idêntico
• Saída — GPT-6 Sol US$ 10,00 por milhão de tokens vs. Qwen3.8-Max US$ 6,00 por milhão de tokens; a tarifa da Alibaba é 40% menor
• Entrada em cache — GPT-6 Sol $0,20 por milhão de tokens vs Qwen3.8-Max $0,25 por milhão de tokens para leituras de cache implícitas, com uma leitura de cache explícita a $0,17 e uma gravação de cache explícita a $2,50
• Janela de contexto — GPT-6 Sol 1.050.000 tokens vs Qwen3.8-Max 1.000.000 tokens
• Saída máxima — GPT-6 Sol 128.000 tokens vs Qwen3.8-Max 131.072 tokens
• Modalidades de entrada — GPT-6 Sol texto e imagem vs Qwen3.8-Max texto, imagem e vídeo
• Tratamento de contexto longo — o GPT-6 Sol aplica novos preços a toda a solicitação acima de 272.000 tokens de entrada, com 2× as tarifas de entrada e de cache e 1,5× a de saída, em comparação com o Qwen3.8-Max, que tem uma tarifa única em toda a janela; este é o único ponto em que a tabela de preços do Qwen é estruturalmente melhor, em vez de apenas marginalmente mais barata.
• Esforço de raciocínio — GPT-6 Sol nenhum, baixo, médio (padrão), alto, xhigh, máximo vs Qwen3.8-Max baixo, médio e extra-alto
• Data de corte de conhecimento — GPT-6 Sol, 20 de abril de 2026 vs. Qwen3.8-Max não publicado como uma data única
• Snapshot datado — GPT-6 Sol um único identificador contínuo vs Qwen3.8-Max-0902 disponível como uma revisão fixada de 2 de setembro de 2026 pelo mesmo preço
A linha de contexto longo merece mais atenção do que costuma receber. A sobretaxa do GPT-6 Sol é um degrau aplicado à solicitação inteira, então uma execução de agente de 900.000 tokens é cobrada a US$ 4,00 e US$ 15,00 por token. O Qwen3.8-Max cobra uma única faixa em toda a janela. Para uma carga de trabalho que opera acima de 272.000 tokens, as duas tabelas de preços deixam de ser comparáveis por completo — o modelo mais barato no preço de destaque é o mais caro por uma margem ampla, e a direção da diferença depende inteiramente de onde o seu contexto se encontra.

A tabela de preços diz 40% mais barato. O harness diz cinco vezes a conta.
A Artificial Analysis mediu o Qwen3.8-Max-0902 com uma pontuação de 45 no Intelligence Index, custando US$ 5,41 por tarefa de índice concluída, tendo gerado 190 milhões de tokens de saída ao longo da execução. Seu resumo descreve o modelo como "notavelmente lento e muito verboso". O GPT-6 Sol obteve 48 a US$ 1,06 por tarefa com 77 milhões de tokens de saída.
Leia esses três pares em conjunto e o formato do confronto surge. O Qwen está três pontos no índice atrás, gerou duas vezes e meia a quantidade de tokens e custou cerca de cinco vezes mais por tarefa concluída — em uma tabela de preços na qual sua saída é 40% mais barata. O mecanismo não é sutil. A US$ 6,00 por milhão de tokens de saída, 190 milhões de tokens custam US$ 1,14 por execução do índice apenas em saída, antes que a entrada seja contada; a US$ 10,00 por milhão, os 77 milhões do Sol custam US$ 0,77. A tarifa mais barata está comprando mais tokens, não uma conta menor.
Este é o mesmo padrão que aparece em todo o campo de setembro, e vale a pena enunciá-lo como uma regra, e não como um fato sobre estes dois modelos: numa tabela de preços por token, um desconto de 40% na saída não vale nada se o modelo emitir duas vezes e meia tantos tokens. O custo por tarefa concluída é o único número que sobrevive.
O que a Alibaba publicou, e o problema de definição de esforço
A própria tabela de benchmarks da Alibaba é a mais longa desta comparação e a menos comparável. Os números divulgados pelo fornecedor colocam o Qwen3.8-Max à frente no PaperBench e no IFBench, mas atrás no SWE-bench Pro e no Humanity's Last Exam, com uma escala de esforço de raciocínio — baixo, médio, extra-alto — que não tem correspondência direta com a escala de seis níveis da OpenAI. Uma pontuação publicada em extra-alto não é o mesmo produto que uma pontuação publicada em médio, e nenhum dos fornecedores indica qual delas gerou determinado número em um gráfico comparativo.
Essa é a razão honesta para não se apoiar na tabela de nenhum dos fornecedores aqui. Os números da Alibaba são executados no harness da Alibaba com a configuração de esforço da Alibaba; os da OpenAI são executados nos da OpenAI. Os números da Artificial Analysis existem justamente porque ambos aqueles são inutilizáveis numa comparação direta, e são esses os usados acima.
Reprodutibilidade é um recurso de verdade, e tem preço zero
O snapshot datado é a linha mais subestimada desta comparação. Qwen3.8-Max-0902 é uma revisão fixada de 2 de setembro de 2026 que, segundo a Alibaba, traz as mesmas capacidades e o mesmo preço do modelo base. Fixá-la significa que o modelo por trás do seu endpoint não muda debaixo de você entre uma terça-feira e uma quinta-feira.
GPT-6 Sol não tem equivalente. É um identificador único e contínuo — a mesma página do modelo contém um snapshot padrão e nenhuma variante datada — o que significa que aquilo que você avaliou em setembro não tem garantia de ser aquilo que você está chamando em novembro. Para a maioria das equipes, isso é aceitável. Para um pipeline regulamentado que precisa demonstrar o que produziu uma saída, é uma diferença real, e é uma que a Alibaba oferece de graça, enquanto a OpenAI não a oferece de forma alguma.
A linha de vídeo é a que decide
Tudo acima é uma comparação. Esta parte não é. Se a sua entrada inclui vídeo — gravações de tela, filmagens de inspeção, captura de aulas, qualquer coisa em que a informação esteja em movimento e não em um quadro estático — o Qwen3.8-Max o aceita nativamente, e o GPT-6 Sol não tem caminho para isso. Não há como contornar uma modalidade por meio de prompts. Não dá para pré-processar um vídeo em imagens e obter a mesma coisa, porque a informação temporal é o ponto central, e nenhuma quantidade de pontos de índice em um benchmark de texto substitui a entrada que a sua tarefa realmente exige.
O caso inverso também merece ser mencionado, porque é aí que a comparação deixa de ser desequilibrada. Se a sua entrada for texto e imagens, o Sol é mais barato por tarefa, está quatro pontos à frente no ranking neutro e é mais barato em leituras em cache. A capacidade de vídeo não é um critério de desempate a seu favor; ela simplesmente não é usada.
Roteando uma decisão que tem duas respostas separadas

Este é um caso em que a arquitetura correta é genuinamente dois modelos, não um, e a razão é que a divisão se dá por modalidade de entrada, e não por dificuldade. Um pipeline que ingere vídeo e raciocina sobre texto precisa dos dois, e a regra de roteamento é uma propriedade da requisição, e não uma decisão subjetiva.
Qwen3.8-Max está no catálogo da OrcaRouter — o snapshot datado qwen/qwen3.8-max-0902 é roteável ao preço de tabela da Alibaba sob o modelo de repasse, o que significa que uma alteração de preço da Alibaba entra em vigor do nosso lado no mesmo dia em vez de depois que um revendedor renegocia. O GPT-6 Sol não está no nosso catálogo no momento em que escrevemos e é acessível pela própria API da OpenAI. A DSL de roteamento é a peça que se encaixa neste caso específico: uma regra que envia requisições com vídeo por um caminho e todo o resto pelo outro é exatamente para isso que serve, e o failover automático significa que o ramo de modalidade não se torna o ponto único de falha.
Onde cada um vence
• Vídeo como entrada, texto como saída — Qwen3.8-Max, e não há competição a descrever.
• Entrada de texto e imagem, custo por tarefa concluída como métrica — GPT-6 Sol, por cerca de cinco vezes no harness independente.
• Trabalho com prefixo em cache — GPT-6 Sol. Sua leitura em cache é marginalmente mais barata e seu volume de tokens é menos da metade.
• Requisições acima de 272.000 tokens de entrada — Qwen3.8-Max. A reprecificação de toda a requisição da Sol é a maior diferença de custo individual nesta comparação, e é invisível nas tarifas anunciadas.
• Fixação reproduzível — Qwen3.8-Max-0902, que não custa nada extra e é a única revisão fixada das duas.
• Se lhe mostraram um gráfico com o Qwen à frente no SWE-bench Pro — verifique de quem é o harness que o produziu e em qual configuração de esforço. O painel independente tem o Qwen três pontos atrás na pontuação composta, e as tabelas dos fornecedores não estão na mesma escala entre si.
Comparados neste artigo3
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
