
LongCat-2.5-Preview vs Qwen3.8-Max: Um sétimo do preço e nada no placar
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 610 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 189 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Meituan colocou LongCat-2.5-Previewna sua plataforma de API em 25 de setembro de 2026, com um registro de changelog, uma tabela de preços e nenhum benchmark de qualquer tipo — e depois definiu seu preço em cerca de um sétimo do que Qwen3.8-Max cobra pela mesma chamada. Isso não é uma diferença pequena, e não é uma diferença segura. O Qwen3.8-Max, o carro-chefe do fornecedor, está em disponibilidade geral desde 3 de agosto de 2026, possui um ranking independente da Artificial Analysis, publica um snapshot datado que você pode fixar pelo nome e cobra 6,7× mais pela entrada e 5× mais pela saída. A pergunta que esta comparação precisa responder não é qual modelo é melhor — ninguém fora da Meituan está em posição de responder isso ainda. É o que você está comprando com a diferença, e se a diferença vale a pena comprar.
O que cada lado realmente publicou
Comece pela proveniência, porque é isso que separa estes dois de forma mais nítida do que qualquer benchmark faria.
O LongCat-2.5-Preview chegou com uma entrada datada no próprio registro de alterações da Meituan — nas palavras do fornecedor: "Versão: 2026-09-25 — LongCat-2.5-Preview Já Disponível" — uma página de preços que o lista como o modelo atual de pagamento conforme o uso da plataforma, e um guia de início rápido que aborda ambos os formatos de comunicação. A própria conta da Meituan no X o descreve como "1,6T de parâmetros. ~48B ativos. Uma janela de contexto de 1M de tokens. Nativamente multimodal." Além disso, não há nada para ler. Nenhum repositório na organização meituan-longcat do Hugging Face cobre este modelo — o repositório mais recente da organização é o LongCat-Flash-Lite-Sparse, de 31 de julho — e o catálogo de modelos do OpenCode, que o disponibiliza, registra-o como de pesos fechados. Nenhum cartão de modelo, nenhum relatório técnico, nenhuma licença, nenhuma tabela de parâmetros publicada pelo fornecedor, e nenhuma avaliação independente em lugar algum: até 27 de setembro, não há página do LongCat-2.5-Preview no Artificial Analysis.
Qwen3.8-Max é o caso oposto em quase todos os aspetos. Ficou disponível para o público em geral a 3 de agosto de 2026, com uma tabela de preços publicada, e a Alibaba lançou uma atualização com nome próprio, Qwen3.8-Max-0902, a 2 de setembro. A Artificial Analysis mede-o: Índice de Inteligência 45,4, em 15.º lugar entre 145 modelos, e um Índice de Programação de 76,2, em 9.º lugar entre 138. Regista GPQA Diamond 92,8%, Humanity's Last Exam 43,1%, SciCode 52,1%, Long-Context Recall 80,3%, Terminal-Bench 2.1 com 88,8% e τ-bench bancário com 47,8%. Este é um modelo medido, com um comprovativo para cada número.
Portanto, o resumo honesto da coluna de evidências é desequilibrado de um modo que nada tem a ver com capacidade. Um desses modelos pode ser avaliado antes de você se comprometer. O outro só pode ser experimentado.
A tabela de preços, linha por linha
Ambos são modelos de um milhão de tokens com o mesmo limite de saída, então as fichas técnicas convergem exatamente onde uma ficha técnica é menos útil:
• Entrada não cacheada — LongCat-2.5-Preview $0,30 por 1M vs Qwen3.8-Max $2,00 por 1M, uma diferença de 6,7×.
• Entrada em cache — US$ 0,006 por 1M vs. US$ 0,25 por 1M, uma diferença de 41,7×.
• Saída — $1,20 por 1M vs $6,00 por 1M, uma diferença de 5×.
• Janela de contexto — 1.048.576 tokens vs 1.000.000 tokens. Na prática, um empate.
• Saída máxima — 131.072 tokens em ambos. Idênticos.
• Pontuação independente — nenhuma publicada vs AA Intelligence 45,4 e AA Coding 76,2.
Todos os números do LongCat ali vêm da própria página de preços da Meituan, e a página rotula a coluna inteira como "Preço com desconto (por tempo limitado)". Os valores do Qwen3.8-Max são o preço de tabela da Alibaba, extraídos do nosso próprio cartão de modelo, com leitura de cache a US$ 0,25 e gravação de cache a US$ 2,50 por milhão. O snapshot da Artificial Analysis está datado de 2 de setembro de 2026.
A linha de entrada em cache é aquela em que se deve fixar o olhar. Uma diferença de 42× nas leituras de cache é o maior número isolado nesta comparação, e ela recai sobre a dimensão em que as cargas de trabalho de agentes realmente vivem. Um loop de agente que reenvia um prompt de sistema de 100.000 tokens e o esquema de ferramentas a cada turno está pagando a tarifa de cache pela maioria de seus tokens, e não a tarifa de entrada anunciada.
Uma chamada de 150.000 tokens, precificada das duas formas
Considere uma requisição plausível no formato de agente: 150.000 tokens de entrada, 50.000 deles servidos a partir do cache, e uma resposta de 4.000 tokens. Na tarifa com desconto da Meituan, essa chamada custa US$ 0,0501. Na tarifa de tabela do Qwen3.8-Max, a chamada idêntica custa US$ 0,3365 — 6,7× mais, ou US$ 50 contra US$ 337 para mil chamadas por dia. Leve a composição para totalmente em cache, que é o estado estacionário de um prompt repetido, e a proporção aumenta para 12,3×: US$ 0,006 contra US$ 0,074 por chamada.
Nada nessa aritmética depende de o LongCat-2.5-Preview ser bom. É exatamente esse o problema. O multiplicador que estão lhe oferecendo é real, e a palavra que o acompanha na própria página do fornecedor é "limited-time", sem data de término e sem preço declarado para o sucessor. Um desconto de 6,7× sem expiração publicada é uma linha orçamentária que você não pode colocar em um plano; é uma linha orçamentária que você acompanha.
Há também uma assimetria de roteamento que vale a pena declarar com clareza. O Qwen3.8-Max é uma rota que atendemos — qwen/qwen3.8-max e o fixado qwen/qwen3.8-max-0902 — ao preço de tabela da Alibaba, sem nenhuma margem, de modo que uma mudança de preço do fornecedor chega ao nosso lado no mesmo dia, e não semanas depois. O LongCat-2.5-Preview não é uma das nossas rotas, e não vamos fingir o contrário; no lado barato desta comparação, você está lidando com a própria API da Meituan e com qualquer plataforma pela qual a acesse.
A única alegação que a própria API da Meituan contradiz
Esta é a descoberta que deve decidir a comparação para qualquer pessoa cuja carga de trabalho não seja texto puro.
O changelog do Meituan lista a compreensão de imagens como a principal novidade da geração 2.5: "Compreensão Multimodal: Nova capacidade de compreensão de imagens, capaz de interpretar o conteúdo de imagens, com suporte a perguntas e respostas entre modalidades, sumarização de conteúdo e raciocínio visual complexo." A publicação no X diz "nativamente multimodal". Essas são alegações dos fornecedores e, por si sós, seria razoável considerá-las em uma decisão.
Depois, o mesmo site de documentação publica a resposta de exemplo para recuperar os metadados do próprio modelo, e o modelo que ele retorna é somente texto. Para o id "LongCat-2.5-Preview", o payload mostra context_length: 1048576, input_modalities: ["text"], output_modalities: ["text"], e uma string de modalidade text->text. Nenhuma entrada de imagem. Não em um snapshot antigo — no exemplo prático na página que documenta o endpoint.
![A screenshot of Meituan's LongCat API documentation for the model-retrieval endpoint, showing the worked example response for 'LongCat-2.5-Preview': context_length 1048576, input_modalities ["text"], output_modalities ["text"] and modality "text->text". The word 'text' is visible in red against the grey page.](https://cms.orcarouter.ai/api/media/file/2-1349.png)
Isso não prova que o modelo não consegue ver. Prova que o fornecedor não conciliou sua prosa com seu próprio esquema de API, e significa que um comprador não pode faturar uma carga de trabalho de visão com base naquela frase do changelog até que alguém resolva isso. Coloque isso ao lado do outro lado: nosso catálogo lista o Qwen3.8-Max como capaz de receber entrada de texto, imagem e vídeo, com visão entre suas capacidades declaradas, e há uma tabela de benchmark independente por trás do modelo. Se sua tarefa for compreensão de documentos, triagem de capturas de tela ou análise de quadros de vídeo, a coluna cara é a que tem uma modalidade de entrada verificada, e a coluna barata é a que tem uma não resolvida. Essa única linha pode apagar todo o 6,7×.
A que uma pré-visualização não pode ser fixada
A Alibaba lança snapshots datados. qwen/qwen3.8-max-0902 é uma build nomeada e congelada com o mesmo $2/$6 do modelo base, o que significa que uma regra de roteamento que a nomeia continua retornando os mesmos pesos no próximo mês. Mudanças de comportamento chegam como um novo id que você pode adotar no seu próprio ritmo.
LongCat-2.5-Preview não tem esse identificador. O id do modelo é o id da pré-visualização, não há sufixo de snapshot, nem histórico de versões na plataforma, e nenhuma entrada de changelog que indicasse que os pesos mudaram — apenas que o desconto é "por tempo limitado". É uma pré-visualização no sentido comum: aquilo que está sob o nome pode mudar, e você descobriria pela sua saída, não por uma nota de lançamento.
A forma mais barata de comprar a evidência que falta é a janela que a Meituan abriu do outro lado disto: o OpenCode lista o LongCat-2.5-Preview como gratuito por tempo limitado, com o provedor seguindo uma política de retenção zero e não treinando nos seus dados, e afirmou em 26 de setembro que a janela dura duas semanas. Entrada gratuita, saída gratuita, leituras de cache gratuitas. Essa é uma forma legítima de construir a tabela de benchmark que ninguém publicou — rode seu próprio corpus de avaliação contra ele, e você terá um número onde o fornecedor lhe deu uma frase. O que isso não é: um preço em que você possa basear seu planejamento — as duas semanas terminam, e o número do outro lado delas cabe à Meituan definir.
Quem deve escolher qual
Recorra ao Qwen3.8-Max quando a carga de trabalho for o motivo pelo qual você está comprando o modelo. Se a entrada for imagens ou vídeo, se a resposta tiver de ser reproduzível de build para build, se um índice independente for um requisito de aquisição, ou se a tarefa for o tipo de codificação agêntica para o qual o Terminal-Bench e o Coding Index servem de proxy, o 6,7× é o preço de poder verificar o seu trabalho. Em uma chave, ele também fica atrás de uma cadeia de fallback, de modo que um modelo pontuado pode absorver um dia ruim do não pontuado sem que você precise executar duas integrações.

Recorra ao LongCat-2.5-Preview quando a carga de trabalho for de grande volume, de contexto curto, apenas texto e interna — classificação, extração, sumarização, reescrita em massa — e quando o custo de errar for uma nova tentativa e não um cliente. Nesse perfil, a linha de entrada em cache não é um desconto, é toda a economia do trabalho, e 42× é um número que vale o esforço de medir. Use a janela gratuita para produzir o benchmark que não existe. Não migre um caminho crítico para ele.
O que mudaria este veredito, em ordem de peso: uma avaliação independente do LongCat-2.5-Preview; uma data de término publicada e preço do sucessor para o desconto; um histórico de versões com instantâneos datados; e uma resolução sobre se a lista de modalidades é somente texto ou não. Qualquer um desses torna a coluna barata mais do que um desconto. Até que pelo menos um deles se concretize, esta comparação não é um confronto entre dois modelos — é um confronto entre um preço que você pode verificar e uma capacidade que você não pode.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
