Cartão de título hero gerado com a manchete 'GPT-6 Luna vs Qwen3.8-Max', com o subtítulo 'O modelo mais barato aqui não é o que assiste a vídeos', um rodapé com os dizeres 'Preços conforme OpenAI e Alibaba Cloud; números do índice conforme Artificial Analysis.', e o logotipo do OrcaRouter composto no canto inferior direito.
Guides & Insights

GPT-6 Luna vs Qwen3.8-Max: O Modelo Mais Barato Nesta Comparação Também É o Único Que Assiste a Vídeos

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O enquadramento óbvio para este emparelhamento é o errado. Qwen3.8-Maxestá listado a US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de saída, com leituras de cache a US$ 0,25. GPT-6 Lunaestá listado a US$ 0,10 e US$ 0,50, com leituras de cache a um centavo. Vinte vezes na entrada, doze vezes na saída, cinquenta vezes na entrada em cache — uma diferença de preço tão grande que a comparação parece resolvida antes mesmo de começar.

Não está resolvido, porque os dois modelos não competem pela mesma solicitação. O Qwen3.8-Max aceita texto, imagem e vídeo, e seu teto de saída de 131.072 tokens fica um pouco acima dos 128.000 do GPT-6 Luna. O GPT-6 Luna aceita apenas texto e imagem. O modelo da Alibaba marca 58 no Intelligence Index independente — primeiro da sua classe no quadro agêntico — e o GPT-6 Luna marca 37 em esforço máximo, 29 no padrão. Um é um topo de linha com uma linhagem de pesos abertos e uma modalidade de entrada de vídeo. O outro é um nível de volume com um índice de velocidade e uma taxa de cache de um centavo. A diferença de preço não é um desconto sobre a mesma coisa; é uma descrição de duas coisas diferentes.

O que cada um desses dois é

Qwen3.8-Max é o carro-chefe da Alibaba da geração 3.8, um checkpoint da classe Max cujo modelo subjacente — Qwen3.8-2.4T-A95B — foi disponibilizado publicamente sob uma licença personalizada em 12 de agosto de 2026, tornando-o o primeiro Qwen da classe Max a ter pesos abertos em absoluto. O próprio carro-chefe hospedado ainda é listado pelo conselho independente como proprietário. Ele possui uma janela de contexto de 1.000.000 de tokens, um teto de saída de 131.072 tokens, entrada de texto, imagem e vídeo, e esforço de raciocínio selecionável entre baixo, médio e extra-alto. Uma revisão fixada Qwen3.8-Max-0902 está disponível pelo mesmo preço, um pequeno detalhe com valor operacional real.

O GPT-6 Luna é o nível de eficiência da OpenAI de 22 de setembro de 2026, posicionado abaixo do GPT-6 Sol, a $2.00/$10.00, e do GPT-6 Astra, o carro-chefe, a $10.00/$50.00. Entrada de texto e imagem, saída de texto, uma janela de 1.050.000 tokens com máximo de entrada de 922.000, teto de saída de 128.000 tokens, e esforço de none a low, medium, high, xhigh e max, com medium como padrão. Fechado, com identificador único, disponível para qualquer pessoa com uma chave de API.

Um aceita vídeo e pode ser baixado em sua forma base. Um aceita imagens e é rápido. Ambos são precificados para uso em volume. A sobreposição entre essas duas afirmações é menor do que a proporção de preços sugere.

Os cartões, linha por linha

Uma linha por dimensão, ambos os lados em cada:

• Entrada por 1M — GPT-6 Luna $0.10 vs Qwen3.8-Max $2.00

• Saída por 1M — GPT-6 Luna $0,50 vs Qwen3.8-Max $6,00

• Entrada em cache por 1M — GPT-6 Luna $0.01 vs Qwen3.8-Max $0.25 para leituras de cache implícitas, com uma leitura de cache explícita a $0.17 e uma escrita de cache explícita a $2.50

• Cláusula de contexto longo — o GPT-6 Luna dobra a entrada e o cache e eleva a saída em 1,5× acima de 272.000 tokens de entrada, aplicada à requisição inteira, enquanto o Qwen3.8-Max tem uma faixa fixa ao longo de toda a janela, que é o único ponto em que o card do Qwen é estruturalmente melhor, e não apenas marginalmente mais barato

• Janela de contexto — GPT-6 Luna 1.050.000 tokens vs. Qwen3.8-Max 1.000.000 tokens

• Saída máxima — GPT-6 Luna 128.000 tokens vs Qwen3.8-Max 131.072 tokens

• Modalidades de entrada — GPT-6 Luna texto e imagem vs. Qwen3.8-Max texto, imagem e vídeo

• Esforço de raciocínio — GPT-6 Luna nenhum, baixo, médio (padrão), alto, extra-alto, máximo vs. Qwen3.8-Max baixo, médio e extra-alto

• Índice de Inteligência, independente — GPT-6 Luna 37 com esforço máximo vs Qwen3.8-Max 58

• Agentic Index, independente — Qwen3.8-Max 58, primeiro da sua categoria; nenhum valor comparável do GPT-6 Luna publicado

• Pontuação de esforço padrão — GPT-6 Luna 29 no seu nível médio padrão vs Qwen3.8-Max medido na sua configuração máxima

• Custo por tarefa do Index, independente — GPT-6 Luna cerca de US$ 0,07 vs Qwen3.8-Max US$ 5,41

• GDPval, independente — Qwen3.8-Max com 1.739 Elo em 64 turnos por tarefa, o que equivale a aproximadamente US$ 1,14 por tarefa concluída nessa avaliação; não há nenhuma execução comparável do GPT-6 Luna publicada

• Taxa de alucinação no AA-Omniscience — Qwen3.8-Max 40%, uma regressão em relação aos 23% da geração anterior; GPT-6 Luna 77%, uma queda em relação aos 93%

• Snapshot datado — GPT-6 Luna, um único identificador móvel, vs. Qwen3.8-Max-0902, disponível como uma revisão fixada de 2 de setembro de 2026 pelo mesmo preço

• Pesos — GPT-6 Luna fechado, apenas via API vs. Qwen3.8-Max, o checkpoint base Qwen3.8-2.4T-A95B público sob uma licença personalizada desde 12 de agosto de 2026, enquanto o carro-chefe hospedado está listado como proprietário

• No OrcaRouter — GPT-6 Luna não está no nosso catálogo vs Qwen3.8-Max roteável ao preço de tabela da Alibaba

Generated two-column scoreboard titled 'GPT-6 Luna vs Qwen3.8-Max - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index 37 at max effort, Context 1,050,000, Input text + image, Cost per index task $0.07. Right column Qwen3.8-Max rows: Price in/out $2.00 / $6.00, Cached input $0.25, AA Index 58, Context 1,000,000, Input text + image + video, Cost per index task $5.41. Footer: 'Prices per OpenAI and Alibaba Cloud; index figures per Artificial Analysis.'

Vídeo não é uma linha de recurso, é uma carga de trabalho diferente

A linha de modalidade é a que decide mais comparações reais do que a linha de preço, e geralmente é lida como uma caixa de seleção.

Qwen3.8-Max aceita vídeo. O GPT-6 Luna, não. Se o seu pipeline precisa raciocinar sobre uma gravação de tela, uma demonstração de produto, a captura de uma aula, um trecho de câmera de segurança ou um walkthrough de interface, a comparação termina nessa linha e a diferença de preço de vinte vezes se torna irrelevante — você não está escolhendo entre uma opção cara e uma barata, está escolhendo entre uma opção e nenhuma opção. Extrair quadros e passá-los como imagens é uma gambiarra, não um equivalente, e quem já construiu uma sabe a diferença tanto no custo quanto na qualidade.

Se o seu pipeline é texto e imagens, a linha da modalidade fica em silêncio e a linha do preço fala. Essa é a divisão honesta, e vale a pena ser direto sobre de que lado dela você está antes de ler qualquer outra coisa nesta página.

A lacuna agêntica é real e é a metade cara da diferença de preço

Qwen3.8-Max obtém 58 no Índice de Inteligência independente. GPT-6 Luna obtém 37 em esforço máximo e 29 em seu nível médio padrão. Vinte e um pontos em configurações equivalentes, vinte e nove nas configurações padrão — em uma métrica composta em que um único ponto está dentro do ruído de uma nova execução, uma diferença desse tamanho não é ruído.

A posição do Qwen3.8-Max concentra-se no trabalho agêntico. Ele obtém 58 no Agentic Index independente, o primeiro da sua categoria, e 1.739 de Elo no GDPval com 64 turnos por tarefa. Esse último número é o informativo, porque é uma medição de um modelo mantendo uma tarefa coesa ao longo de sessenta e quatro decisões sequenciais, e vem com um custo associado: cerca de US$ 1,14 por tarefa concluída nessa avaliação. Compare isso com o custo por tarefa no índice do GPT-6 Luna, de cerca de US$ 0,07, e a afirmação honesta não é que o Qwen seja caro. É que se está pedindo ao Qwen que faça algo muito mais difícil — e ele está fazendo.

O corolário é que o déficit de vinte e um pontos do GPT-6 Luna também não está distribuído uniformemente pela sua carga de trabalho. Em uma tarefa curta, bem especificada e consumida por programa — extrair este campo, classificar este chamado, encaminhar esta solicitação —, ambos os modelos produzirão a mesma resposta utilizável quase sempre, e a diferença no índice será invisível na sua avaliação. Em uma tarefa que exige sessenta e quatro ações sequenciais com um ponto de verificação no final, a diferença é entre terminar e parar silenciosamente no meio do caminho, e essa é a tarefa para a qual o Qwen3.8-Max foi construído e o GPT-6 Luna não.

Um número aponta na direção oposta e merece ser declarado, não enterrado. A taxa de alucinação do Qwen3.8-Max no ranking de onisciência é de 40%, acima dos 23% da geração anterior — uma regressão substancial, do tipo que aparece como respostas erradas dadas com confiança em produção, e não como uma linha de benchmark. A do GPT-6 Luna é de 77%, abaixo dos 93%. Ambos os números são altos em termos absolutos, e o modelo mais barato continua sendo o pior dos dois nessa medida. Nenhum dos números é razão para preferir um modelo; ambos são razões para manter um humano ou um verificador no circuito em qualquer coisa em que um fato fabricado seja caro.

A cláusula de contexto longo é a única linha em que o Qwen vence na estrutura

GPT-6 Luna contém uma cláusula que o Qwen3.8-Max não contém: solicitações acima de 272.000 tokens de entrada são cobradas pelo dobro das tarifas de entrada e de cache e 1,5× a tarifa de saída, aplicadas à solicitação inteira, e não à parte que ultrapassa o limite. Uma chamada de 300.000 tokens no GPT-6 Luna é cobrada a US$ 0,20 por milhão de entrada por todos os 300.000 tokens, porque ultrapassou em 28.000. Divida o mesmo documento em duas chamadas e o custo cai pela metade, sem qualquer alteração no prompt.

O Qwen3.8-Max mantém um preço constante ao longo de toda a sua janela de 1.000.000 de tokens. Para requisições únicas genuinamente enormes, isso faz com que a diferença de doze vezes no preço de saída pareça menor do que realmente é, e pode até invertê-la: acima de 272.000 tokens de entrada, a tarifa efetiva de entrada do GPT-6 Luna dobra para US$ 0,20, e sua tarifa de saída sobe para US$ 0,75, contra os US$ 2,00 e US$ 6,00 constantes do Qwen. A diferença diminui de vinte vezes para dez na entrada e de doze para oito na saída. Ainda é grande — mas as cargas de trabalho com maior probabilidade de ter um contexto de trabalho de 300.000 tokens são exatamente as agênticas para as quais ambos os fornecedores estão vendendo, e as equipes que as executam são as equipes que vão notar.

A outra linha estrutural é a revisão fixada. O Qwen3.8-Max-0902 está disponível pelo mesmo preço que o identificador móvel, o que significa que uma equipe que precisa de comportamento reproduzível ao longo de uma atualização de modelo pode tê-lo sem pagar um prêmio. O GPT-6 Luna não oferece equivalente. Isso é uma linha pequena numa tabela de preços e uma linha grande num post-mortem.

Executando um deles, ou ambos

Qwen3.8-Max está no OrcaRouter ao preço de tabela da Alibaba, sob a precificação de repasse, o que significa que uma mudança de tarifa do fornecedor entra em vigor do nosso lado no mesmo dia. Duas coisas na nossa camada de roteamento merecem seu lugar para este modelo específico: o failover automático, porque um modelo principal hospedado com uma base de pesos abertos publicada tem mais upstreams do que um modelo fechado de fornecedor único e mais formas de um deles se degradar; e o tratamento de revisão fixada, que permite que uma rota mantenha Qwen3.8-Max-0902 explicitamente em vez de herdar o que quer que o identificador rotativo resolva na próxima semana.

O GPT-6 Luna não está em nosso catálogo até o momento em que escrevemos e é acessado pela própria API da OpenAI, então uma equipe que queira os dois usa uma chave para o Qwen3.8-Max junto com a que já usa para a OpenAI. Este também é o pareamento em que a DSL de roteamento vale mais do que uma divisão estática, porque a fronteira entre os dois modelos é uma verificação de modalidade e uma verificação de comprimento, e não uma preferência: requisições que carregam vídeo vão para o Qwen3.8-Max porque nada mais pode atendê-las, requisições acima de 272.000 tokens de entrada vão para o Qwen3.8-Max porque o salto do outro modelo as torna mais caras ali, e todo o resto vai para o modelo que custa um vigésimo do preço. Isso é uma regra, e ela pertence à configuração, e não a uma ramificação da aplicação.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

Qual deles, e quando

Escolha o Qwen3.8-Max se qualquer uma das condições a seguir for verdadeira. Seu pipeline precisa de vídeo na entrada. Suas requisições rotineiramente ultrapassam 272.000 tokens de entrada, ponto em que seu nível fixo supera o reajuste de preços do GPT-6 Luna. Sua saída ultrapassa 128.000 tokens. Seu trabalho é execução agêntica de horizonte longo com um endpoint verificável, em que seu 58 no quadro agêntico e seus 1.739 de Elo no GDPval, a 64 turnos por tarefa, são a evidência que importa. Ou você precisa de uma revisão fixada para reprodutibilidade e está disposto a pagar por isso — o que, pelo mesmo preço do identificador móvel, significa que não está.

Escolha o GPT-6 Luna se nenhuma dessas condições se aplicar e sua carga de trabalho for de alto volume, consumida por programas, com texto e imagem, e curta. Classificação, extração, roteamento, sumarização em massa, o loop interno de um agente que precisa de uma resposta rápida, não de uma cuidadosa. Com US$ 0,10/US$ 0,50, com leitura em cache de um centavo e um custo por tarefa concluída em torno de um quinze avos do Qwen3.8-Max, a conta não é nem de perto comparável. Defina o parâmetro effort explicitamente — o padrão é medium e o 37 em destaque é um valor de esforço máximo — e mantenha chamadas longas do lado certo da linha de 272.000 tokens.

O erro que essa comparação convida a cometer é ler o preço de entrada vinte vezes maior como um veredito. Ele é um veredito sobre um formato de carga de trabalho e é omisso quanto às três linhas que decidem o outro: se a requisição inclui vídeo, se ultrapassa 272.000 tokens e se a resposta precisa sobreviver a sessenta e quatro etapas sequenciais.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) showing the breadcrumb Home > Models > Qwen > Qwen3.8 Max (0902), a NEW badge, the model id qwen/qwen3.8-max-0902, Vision, Tools, JSON and Reasoning chips, a Qwen attribution dated 2026-09-02, the description of a September 2, 2026 snapshot accepting text, image and video input with a 1M-token context, input pricing of $2.00 and output of $6.00 per 1M tokens, a p50 time to first token of 3.50s, a p95 of 9.38s, and traffic of 196.6M tokens over seven days.

Comparados neste artigo3

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente