
GPT-6.1 Sol vs Qwen3.8-Max: A Fatura, Não a Lista de Preços
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Pegue uma tarefa noturna de manutenção de repositório, execute-a uma vez por noite durante um mês e coloque GPT-6.1 Sol e Qwen3.8-Max nela, alternadamente. Segundo os números por tarefa do Artificial Analysis v4.3.2, o GPT-6.1 Sol custa US$ 21,72 por essas trinta noites e o Qwen3.8-Max custa US$ 162,27 — uma diferença de US$ 140,55 por mês, cerca de US$ 1.690 por ano, para uma tarefa cuja lista de preços por token indica US$ 2,00 de entrada e US$ 10,00 de saída contra US$ 2,00 de entrada e US$ 6,00 de saída. As tarifas por milhão são praticamente idênticas na entrada — dentro de um erro de arredondamento —, e o modelo chinês é 40% mais barato na saída, mas a fatura difere por um fator de 7,5. O fornecedor lançou o GPT-6.1 Sol em 29 de setembro de 2026; o Qwen3.8-Max está disponível desde 3 de agosto de 2026.
Essa diferença não é um truque de preços nem um artefato de benchmark — é tudo o que esta comparação tem a dizer, e vem de um número que nenhuma tabela de preços lhe mostra.
O que cada modelo é
O GPT-6.1 Sol é o atual carro-chefe da OpenAI em raciocínio e programação, lançado uma semana depois do GPT-6 Sol que ele substitui, pelo mesmo preço de tabela de US$ 2,00 / US$ 10,00, com uma tarifa de US$ 0,10 para entrada em cache e uma janela de contexto de 1.050.000 tokens. Ele é vendido para trabalho agêntico: as etiquetas best-for em nosso próprio cartão de modelo indicam raciocínio, programação e agêntico, e ele carrega a pontuação de qualidade do nível mais alto.
Qwen3.8-Max é o carro-chefe agêntico da Alibaba — um modelo fechado, somente de API, que aceita entrada de texto, imagem e vídeo e mantém um contexto de 1.000.000 de tokens. Ao contrário dos lançamentos menores da Qwen, este não tem pesos publicados. No Artificial Analysis, ele está em 45,42 no Índice de Inteligência, 17º de 147 modelos, com um índice de programação de 76,2 que ocupa o 9º lugar nesse campo. Não é um modelo fraco. É simplesmente caro deixá-lo pensar.
O número que não está na tabela de tarifas

O Artificial Analysis registra 107.730 tokens de saída por tarefa para o Qwen3.8-Max, dos quais 70.830 são tokens de raciocínio. O GPT-6.1 Sol produz 38.128 tokens de saída, 25.190 deles de raciocínio. O modelo chinês escreve 2,8 vezes mais tokens para responder à mesma pergunta, e os escreve a um custo 40% menor por token.
• Tokens de saída por tarefa — 38.128 vs 107.730; o Qwen escreve 2,8× mais
• Dos quais raciocínio — 25.190 vs 70.830
• Custo por tarefa — $0,724 vs $5,409; o Qwen custa 7,5× mais
• Tempo por tarefa — 640 s vs 2.152 s; cerca de 11 minutos vs cerca de 36
• Tempo até o primeiro token de resposta — 332,0 s vs 55,1 s
• Índice de Inteligência — 51,83 vs 45,42
• Janela de contexto — 1.050.000 vs 1.000.000 tokens
• Entradas aceitas — texto, imagem e arquivo vs texto, imagem e vídeo
Faça a multiplicação e o desconto desaparece. Um modelo que emite quase três vezes mais tokens a uma taxa 40% menor não custa menos — custa cerca de 1,7 vezes mais só na saída, e o número medido por tarefa situa o múltiplo real em 7,5 quando se levam em conta a entrada, as leituras em cache e o comprimento da resposta produtiva.
Observe a quarta e a quinta linhas, porque apontam em direções opostas e, juntas, explicam o que é o Qwen3.8-Max. Ele retorna seu primeiro token em 55 segundos, enquanto o GPT-6.1 Sol leva cinco minutos e meio, e depois passa trinta e seis minutos concluindo a tarefa, enquanto o modelo da OpenAI termina em onze. Esse é um modelo que começa a falar imediatamente e pensa de forma muito prolongada. Para uma interface de chat com resposta em streaming, isso é interpretado como responsividade. Para um trabalho noturno não assistido, é tempo de relógio que você também está pagando.
Três pontos em que o Qwen3.8-Max está genuinamente à frente
A diferença do índice é de 6,4 pontos em toda a suíte, que é o tipo de número citado como se fosse uniforme. Não é, e a discordância é instrutiva:
• GPQA Diamond — Qwen3.8-Max 0,9283 vs GPT-6.1 Sol não publicado nesta execução
• GDPval — 1.671,4 vs 1.575,09
• Terminal-Bench 2.1 — 0,8876 vs. não publicado nesta execução
• AutomationBench — 0,5619 vs 0,6487
• SciCode — publicado em 2 de 6 para GPT-8.1 Sol
• CritPT — 0,1771 vs 0,3171
Qwen3.8-Max vence as perguntas de ciências de nível de pós-graduação e a amostra de tarefas ocupacionais, o que é um resultado genuíno para um modelo da sua geração e a razão pela qual o seu índice de codificação está em 9.º entre 138. Perde nas avaliações mais difíceis, adjacentes à investigação — o CritPT por 14 pontos — e perde no AutomationBench por 8,7, que é aquele que mais se assemelha a trabalho de computador sem supervisão. Aquele que desses dois considerar mais importante para a sua carga de trabalho é a decisão real; o valor de destaque de 6,4 pontos é uma média sobre uma divergência, não um veredicto.
O que os tokens extras trazem, e o que não trazem
Longos traços de raciocínio não são desperdício por definição. Um modelo que gasta 70.830 tokens de deliberação numa tarefa difícil está a fazer algo que o modelo mais curto pode estar a saltar, e nas avaliações em que o Qwen3.8-Max está à frente, essa deliberação é plausivelmente a razão. O modo de falha é que você paga por isso em todas as tarefas, não apenas nas difíceis. As contagens de tokens de raciocínio são uma propriedade da calibração do modelo, não da dificuldade da pergunta, e um modelo que pensa demais numa extração de uma linha cobra você por isso.
A forma de descobrir qual das suas tarefas é qual é deixar de tratar a escolha do modelo como algo global. O que nos leva à parte que consiste numa mudança de configuração.
Nosso próprio cartão de modelo para o GPT-6.1 Sol traz os números servidos do sujeito: a tarifa de US$ 2,00 / US$ 10,00, a janela de contexto de 1.050.000 tokens, um p50 de 4,54 segundos até o primeiro token e um bloco de índice armazenado da Artificial Analysis na mesma página que o preço contra o qual um aplicativo realmente rotearia.

Uma chave, um medidor, dois modelos
Ambos os modelos são acessíveis por um único endpoint OrcaRouter — uma API para mais de 200 modelos, com o preço de lista do provedor repassado com 0% de markup. O cartão do OrcaRouter para o Qwen3.8-Max traz a tarifa praticada ao lado da janela de contexto de 1.000.000 de tokens, das modalidades de entrada texto/imagem/vídeo e do volume de 101,4 milhões de tokens em sete dias — os números com base nos quais um aplicativo roteia, ao lado daqueles sobre os quais o artigo discute. Esse repasse importa especificamente para o Qwen3.8-Max, porque um modelo cuja economia é dominada pelo volume de tokens de saída é um modelo cujo fornecedor pode reajustar seu preço a qualquer momento, e um medidor de repasse significa que a mudança chega à sua fatura no dia em que a Alibaba a publica, em vez de seguir o cronograma de um revendedor.

O uso mais interessante da camada de roteamento aqui é a DSL de roteamento, que permite compor modelos em uma única chamada em vez de escolher um para toda a aplicação. Divida o job noturno: um modelo barato classifica e extrai, o GPT-6.1 Sol cuida das etapas de raciocínio e verificação, e o Qwen3.8-Max fica reservado para as tarefas em que sua longa deliberação e sua força científica de nível GPQA realmente mudam a resposta. O failover automático cobre o resto — se um provedor degradar no meio da execução, a requisição é movida em vez de fazer o lote falhar.
Nenhuma delas é um motivo para escolher um modelo. Elas são o motivo pelo qual você não precisa fazer a escolha uma vez e conviver com ela.
A chamada, e a coisa a observar
Pague o multiplicador de 7,5 vezes apenas quando a deliberação justificar. Num job noturno de uso geral, o GPT-6.1 Sol a US$ 0,724 por tarefa é a escolha padrão defensável, e os US$ 1.690 por ano são reais. Quando a tarefa é de ciência exata ou raciocínio ocupacional com resposta verificável, o 0,9283 do Qwen3.8-Max no GPQA Diamond vale os tokens — é exatamente isso que ele faz melhor.
O ponto a observar é se a Alibaba vai reprecificar. Um modelo de 2,8× tokens a $2,00/$6,00 tem um preço como se os tokens fossem o recurso escasso; o próprio comportamento do modelo torna os tokens abundantes. Se o preço de saída mudar de forma material, a aritmética deste artigo muda com ele, e o medidor de repasse mostrará isso no mesmo dia em que acontecer.
Comparados neste artigo3
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
