
LongCat-2.5-Preview vs MiniMax M3: O lugar barato já está ocupado
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 610 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 189 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
A premissa da maior parte da cobertura do LongCat-2.5-Preview é que a Meituan praticou preços mais baixos que os concorrentes. Em comparação com o MiniMax M3, essa premissa evapora ao menor contato. O MiniMax M3 está listado a US$ 0,30 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída no nosso catálogo. A tabela de preços publicada do LongCat-2.5-Preview é US$ 0,30 por milhão de tokens de entrada não cacheados e US$ 1,20 por milhão de tokens de saída. Esses não são valores semelhantes; são os mesmos valores. O único ponto em que divergem é a entrada em cache, em que a Meituan cobra US$ 0,006 por milhão contra os US$ 0,06 da incumbente — uma diferença de dez vezes na linha mais barata da fatura. Portanto, a pergunta interessante não é se o LongCat-2.5-Preview é barato. É o que você está comprando e de que está abrindo mão quando um novo modelo chega exatamente ao preço da incumbente.
A resposta curta: um teto de saída muito maior, uma base de evidências muito mais escassa e um desconto de cache.
Mesmo preço anunciado, tetos publicados muito diferentes
O MiniMax M3 está oficialmente registrado desde 31 de maio de 2026. Nosso catálogo o inclui com uma janela de contexto de 1.048.576 tokens e saída máxima de 512.000 tokens — mais do que a maioria dos modelos permite, e quatro vezes os 131.072 do LongCat-2.5-Preview. Ele aceita texto, imagens e vídeo como entrada e retorna texto, com chamada de ferramentas, modo JSON e raciocínio disponíveis.

O LongCat-2.5-Preview, listado na Plataforma de API LongCat da Meituan em 25 de setembro de 2026, iguala no contexto em 1.000.000 de tokens e fica muito aquém na saída, com 131.072. Seu perfil de entrada é a questão em aberto: o changelog apresenta a compreensão de imagens como sua principal novidade, mas a resposta de exemplo na própria documentação "Retrieve Model" da Meituan ainda mostra input_modalities/ como ["text"]/ com uma text->text/ string de modalidade. O MiniMax M3 também aceita vídeo, algo que o LongCat-2.5-Preview não reivindica de forma alguma. Se o seu pipeline alimenta gravações de tela ou sequências de quadros, esta comparação termina aqui.
A assimetria de cache segue o sentido oposto e vale a pena ser mencionada em favor da Meituan, porque é a única dimensão em que o novo modelo realmente se diferencia. US$ 0,006 por milhão de tokens de entrada em cache contra US$ 0,06 é uma vantagem real para cargas de trabalho de agentes que reenviam o mesmo prefixo longo a cada turno — o que se aplica à maioria deles. Também é o item mais suscetível de mudar sem aviso, já que a Meituan sinaliza todo o cartão como um desconto por tempo limitado.
A lacuna de evidências, medida honestamente em ambas as direções
A posição do MiniMax M3 nos benchmarks não é forte, e dizê-lo faz parte de fazer esta comparação corretamente. A Artificial Analysis registra um Coding Index de 58,6 para ele — na quadragésima sexta posição entre os modelos acompanhados — e um Intelligence Index de 29,2 na sexagésima posição. GPQA Diamond 92,9%, Humanity's Last Exam 39%, SciCode 47,1%, Long-Context Recall 83, τ²-Bench banking 15,3, Terminal-Bench v2.1 65,2. Os números publicados pela própria MiniMax cobrem um terreno diferente: BrowseComp 83,5, GDPval rubrics 76,7, MCP Atlas 74,2, BankerToolBench 76,1. Esses são números comunicados pelo fornecedor e pertencem a uma coluna diferente da dos independentes, mas existem, e é essa a palavra-chave.

O LongCat-2.5-Preview não tem coluna nenhuma. Nenhuma tabela de benchmark publicada, nenhuma ficha de modelo, nenhum relatório técnico, nenhum repositório no HuggingFace ou na organização da Meituan no GitHub, e metadados de catálogo registrando pesos abertos como falsos. A contagem de parâmetros de aproximadamente 1,6 trilhão no total / 48 bilhões ativos é relatada a partir dos metadados do site da Meituan e da cobertura da imprensa especializada chinesa, em vez de documentação. Portanto, a afirmação precisa é: as pontuações do M3 são medíocres e obtidas de fontes independentes; as do LongCat-2.5-Preview estão ausentes. Um modelo que pontua na casa dos quarenta no índice de programação é uma quantidade conhecida em torno da qual você pode planejar. Um modelo sem pontuação é um tipo diferente de risco, e o fato de o preço ser idêntico remove a compensação que normalmente justifica assumi-lo.
Onde o mesmo preço muda o que você deve fazer
Quando um novo modelo surge com preço abaixo do mercado, o movimento racional é avaliá-lo — a vantagem é um desconto real. Quando um novo modelo chega exatamente ao mesmo preço de um concorrente que já está no mercado desde maio, a vantagem não é o preço. É a capacidade, e capacidade é justamente a única coisa que o LongCat-2.5-Preview não publicou. Isso reformula completamente a avaliação: você não está testando se ele é mais barato, e sim se ele é melhor, nas suas tarefas, começando do zero e sem nenhuma evidência em que se ancorar.
Há um detalhe de segunda ordem que torna esse teste mais barato do que parece. O LongCat-2.5-Preview é gratuito e ilimitado pelo OpenCode durante uma janela de duração não declarada, com uma política de retenção zero que o OpenCode documenta explicitamente — treinamento de modelo "Não utilizado", retenção de dados "0 dias", contra trinta dias da listagem de comparação. Assim, o custo de gerar sua própria avaliação é praticamente zero, e a política de retenção significa que você pode executá-la em código privado. O único detalhe de harness a definir primeiro é que o modelo retorna seu traço de raciocínio em um campo intercalado reasoning_content/; clientes que fazem o parsing de chat completions sem esperar por ele descartarão o raciocínio silenciosamente e farão o modelo parecer pior do que ele é.

O argumento de roteamento, específico para uma comparação de mesmo preço
Oferecemos o MiniMax M3 pelo preço de tabela da MiniMax com margem zero. O LongCat-2.5-Preview não é uma das nossas rotas — não o disponibilizamos, e nada aqui deve ser interpretado como afirmando o contrário.
Um confronto de preços iguais é exatamente o caso em que o roteamento se justifica, em vez de ser apenas uma conveniência. Se dois modelos custam o mesmo, a decisão entre eles é por solicitação e por tarefa: o M3 pelo teto de saída de 512.000 tokens e pela entrada de vídeo, o LongCat-2.5-Preview pelo desconto de prefixo em cache em longos loops de agente, depois que você se certificou da qualidade dele. A fusão de modelos é o mecanismo que torna isso literal — uma passagem de recuperação e uma etapa de síntese podem ser modelos diferentes em uma única solicitação, então você não é forçado a escolher um vencedor antes de ter evidências. E, como repassamos os preços de tabela dos provedores sem margem, uma mudança de tarifa de um fornecedor chega à sua fatura no mesmo dia, em vez de na próxima renovação de contrato, o que importa mais do que o habitual quando um dos dois cartões é explicitamente promocional. O failover automático, então cobre o caso em que um provedor se degrada, e é mais importante para o modelo sem histórico de serviço a inspecionar.
Frequentemente perguntado
• O LongCat-2.5-Preview é mais barato que o MiniMax M3? Não. Nas tabelas de preços publicadas, as tarifas de entrada e saída são idênticas, a US$ 0,30 e US$ 1,20 por milhão. A única vantagem de preço está na entrada em cache, US$ 0,006 contra US$ 0,06, e a Meituan classifica toda a sua tabela como um desconto por tempo limitado sem dizer o que vem depois.
• Qual tem a maior saída utilizável? O MiniMax M3, por uma margem ampla: 512.000 tokens contra 131.072. Para geração de textos longos, extração estruturada em documentos extensos ou qualquer coisa que escreva mais que um capítulo, esse teto é a especificação decisiva.
• Qual deles posso verificar? O MiniMax M3, e a verificação não o favorece — Coding 58,6 na 46ª posição e um Intelligence Index de 29,2 na 60ª posição, da Artificial Analysis. O LongCat-2.5-Preview não tem nenhuma avaliação publicada por ninguém. Se um benchmark do LongCat-2.5-Preview aparecer esta semana, trate-o como não verificável até conseguir rastreá-lo até um avaliador nomeado.
• Qual devo colocar em produção? Nenhum dos dois sem um teste seu. Entre os dois, o M3 é a escolha de menor variância porque seus pontos fracos estão documentados e suas modalidades de entrada são confirmadas; o LongCat-2.5-Preview é o de maior variância, com uma alegação de contexto maior, um teto de saída muito menor, um desconto de cache e zero evidência pública. Use-o gratuitamente enquanto a janela estiver aberta, mantenha os dois atrás de uma única chave, e deixe que seus próprios números decidam.
