Una card del titolo hero generata che riporta 'LongCat-2.5-Preview vs MiniMax M3' con l'overline 'Il posto economico è già occupato', e due pannelli: 'LongCat-2.5-Preview: $0,30 / $1,20 per 1M, 131.072 output massimo' e 'MiniMax M3: $0,30 / $1,20 per 1M, 512.000 output massimo'. Logo OrcaRouter in basso a destra.
Guides & Insights

LongCat-2.5-Preview vs MiniMax M3: il posto economico è già occupato

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

La premessa che sta alla base della maggior parte delle analisi su LongCat-2.5-Preview è che Meituan abbia battuto la concorrenza sul prezzo. Messa a confronto con MiniMax M3, questa premessa svanisce al primo contatto. Nel nostro catalogo, MiniMax M3 è listato a 0,30 $ per milione di token in input e 1,20 $ per milione di token in output. Il listino pubblicato di LongCat-2.5-Preview prevede 0,30 $ per milione di token in input non in cache e 1,20 $ per milione di token in output. Non sono cifre simili; sono le stesse cifre. L'unico punto in cui divergono è l'input in cache, dove Meituan indica 0,006 $ per milione contro gli 0,06 $ dell'incumbent: un divario di dieci volte sulla voce più economica della bolletta. Quindi la domanda interessante non è se LongCat-2.5-Preview sia conveniente. È che cosa si compra e a cosa si rinuncia quando un nuovo modello arriva esattamente al prezzo dell'incumbent.

La risposta breve: un tetto di output molto più alto, una base di prove molto più sottile e uno sconto sulla cache.

Stesso prezzo in evidenza, massimali pubblicati molto diversi

MiniMax M3 è ufficialmente noto dal 31 maggio 2026. Il nostro catalogo lo include con una finestra di contesto di 1.048.576 token e un output massimo di 512.000 token — più di quanto consentano la maggior parte dei modelli, e quattro volte i 131.072 di LongCat-2.5-Preview. Accetta in input testo, immagini e video e restituisce testo, con tool calling, modalità JSON e ragionamento esposti.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview, elencato sulla LongCat API Platform di Meituan il 25 settembre 2026, è in linea sul contesto a 1.000.000 di token e resta molto al di sotto sull'output a 131.072. Il suo profilo di input è la questione aperta: il changelog presenta la comprensione delle immagini come la sua novità di punta, ma la risposta di esempio nella documentazione "Retrieve Model" di Meituan mostra ancora input_modalities/ come ["text"]/ con una text->text/ stringa di modalità. Anche MiniMax M3 accetta video, cosa che LongCat-2.5-Preview non dichiara affatto. Se la tua pipeline riceve registrazioni dello schermo o sequenze di fotogrammi, questo confronto finisce qui.

L'asimmetria della cache va nella direzione opposta e vale la pena sottolinearla a favore di Meituan, perché è l'unica dimensione in cui il nuovo modello si differenzia davvero. 0,006 $ per milione di input in cache contro 0,06 $ è un vero vantaggio per i carichi di lavoro degli agenti che rinviano lo stesso lungo prefisso a ogni turno — cioè la maggior parte di essi. È anche la voce più suscettibile di cambiare senza preavviso, dato che Meituan segnala l'intera scheda come sconto a tempo limitato.

Il divario probatorio, misurato onestamente in entrambe le direzioni

La posizione di MiniMax M3 nei benchmark non è forte, e dirlo fa parte del fare questo confronto in modo adeguato. Artificial Analysis registra per esso un Coding Index di 58,6 — quarantaseiesimo tra i modelli monitorati — e un Intelligence Index di 29,2 al sessantesimo posto. GPQA Diamond 92,9%, Humanity's Last Exam 39%, SciCode 47,1%, Long-Context Recall 83, τ²-Bench banking 15,3, Terminal-Bench v2.1 65,2. Le cifre pubblicate da MiniMax stessa coprono un terreno diverso: BrowseComp 83,5, rubriche GDPval 76,7, MCP Atlas 74,2, BankerToolBench 76,1. Quelli sono numeri riportati dal fornitore e appartengono a una colonna diversa da quella dei numeri indipendenti, ma esistono, e questa è la parola che conta.

A screenshot of OrcaRouter's own model page for MiniMax M3 at /models/minimax/minimax-m3, showing the minimax/minimax-m3 identifier, a 1M-token context window, 512K maximum output, text + image + video input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-05-31, a p50 first-token figure of 3.35 s, $0.30 and $1.20 rate tiles, and the OpenAI-compatible code samples.

LongCat-2.5-Preview non ha alcuna colonna. Nessuna tabella di benchmark pubblicata, nessuna model card, nessun report tecnico, nessun repository su HuggingFace o nell'organizzazione GitHub di Meituan, e i metadati del catalogo registrano i pesi aperti come falsi. Il conteggio di circa 1,6 trilioni di parametri totali / 48 miliardi attivi è riportato dai metadati del sito di Meituan e dalla copertura commerciale cinese, non dalla documentazione. Quindi l'affermazione accurata è: i punteggi di M3 sono mediocri e provengono da fonti indipendenti; quelli di LongCat-2.5-Preview sono assenti. Un modello che ottiene punteggi intorno alla quarantina sull'indice di coding è una quantità nota su cui puoi pianificare. Un modello senza punteggio è un tipo diverso di rischio, e il prezzo identico elimina il compenso che di solito giustifica la scelta.

Dove lo stesso prezzo cambia ciò che dovresti fare

Quando un nuovo modello batte la concorrenza sul prezzo, la mossa razionale è valutarlo — il vantaggio è uno sconto reale. Quando un nuovo modello arriva esattamente allo stesso prezzo di un incumbent che è sul mercato da maggio, il vantaggio non è il prezzo. È la capacità, e la capacità è l'unica cosa che LongCat-2.5-Preview non ha pubblicato. Questo riformula completamente la valutazione: non stai verificando se è più economico, stai verificando se è migliore, sui tuoi compiti, partendo da zero senza alcuna prova su cui ancorarti.

C'è un dettaglio di secondo ordine che rende quel test meno costoso di quanto sembri. LongCat-2.5-Preview è gratuito e illimitato tramite OpenCode per una finestra di durata non specificata, con una politica di conservazione zero che OpenCode documenta esplicitamente — addestramento del modello "Not used", conservazione dei dati "0 giorni", contro i trenta giorni della voce di confronto. Quindi il costo di generare una valutazione propria è vicino a zero, e la politica di conservazione significa che puoi eseguirla su codice privato. L'unico dettaglio dell'harness da chiarire per primo è che il modello restituisce la sua traccia di ragionamento in un campo intercalato reasoning_content; i client che analizzano le chat completions senza aspettarselo scarteranno silenziosamente il ragionamento e faranno sembrare il modello peggiore di quanto sia.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs MiniMax M3' with the subhead 'Identical headline rates, four times the output ceiling, ten times the cache discount'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, no repo and catalogue open_weights false. Right column 'MiniMax M3' (MiniMax, released 2026-05-31, independently scored): 1,048,576-token context, 512,000 max output described as four times as much, text, image and video to text, $0.30 uncached / $0.06 cached input, $1.20 output, coding index 58.6 at rank 46 and intelligence index 29.2 at rank 60 by Artificial Analysis, long-context recall 83. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

L'argomento del routing, specifico per un confronto a parità di prezzo

Serviamo MiniMax M3 al prezzo di listino di MiniMax con zero ricarico. LongCat-2.5-Preview non è una delle nostre rotte — non lo serviamo, e nulla di quanto scritto qui deve essere interpretato come un'affermazione del contrario.

Un confronto a parità di prezzo è esattamente il caso in cui il routing si guadagna il suo posto invece di essere una semplice comodità. Se due modelli costano lo stesso, la decisione tra loro è per-richiesta e per-compito: M3 per il tetto di output di 512.000 token e l'input video, LongCat-2.5-Preview per lo sconto sul prefisso in cache nei lunghi cicli degli agenti, una volta che ti sei convinto della sua qualità. La fusione dei modelli è il meccanismo che rende tutto ciò letterale: un passaggio di retrieval e un passaggio di sintesi possono essere modelli diversi su una singola richiesta, quindi non sei costretto a scegliere un vincitore prima di avere le prove. E poiché trasferiamo i prezzi di listino dei fornitori senza ricarichi, una variazione delle tariffe di un fornitore arriva sulla tua fattura lo stesso giorno invece che al prossimo rinnovo contrattuale, cosa che conta più del solito quando una delle due schede è esplicitamente promozionale. Il failover automatico poi copre il caso in cui un fornitore si degrada, e conta soprattutto per il modello di cui non c'è uno storico di servizio da esaminare.

Domande frequenti

• LongCat-2.5-Preview costa meno di MiniMax M3? No. Nei listini pubblicati, le tariffe di input e output sono identiche: $0,30 e $1,20 per milione. L'unico vantaggio di prezzo riguarda l'input in cache, $0,006 contro $0,06, e Meituan etichetta l'intera sua scheda come sconto a tempo limitato senza dire cosa seguirà.

• Quale ha l'output utilizzabile maggiore? MiniMax M3, con un ampio margine: 512.000 token contro 131.072. Per la generazione di testi lunghi, l'estrazione strutturata da documenti di grandi dimensioni o qualsiasi attività che produca più di un capitolo, quel limite massimo è la specifica decisiva.

• Quale posso verificare? MiniMax M3, e la verifica non lo lusinga — Coding 58,6 al quarantaseiesimo posto e un Intelligence Index di 29,2 al sessantesimo, da Artificial Analysis. LongCat-2.5-Preview non ha alcuna valutazione pubblicata da nessuno. Se questa settimana compare un benchmark di LongCat-2.5-Preview, trattalo come non verificabile finché non riesci a risalire a un valutatore con nome.

• Quale dovrei mettere in produzione? Nessuno dei due senza un test tuo. Tra i due, M3 è la scelta a minore varianza perché i suoi punti deboli sono documentati e le sue modalità di input sono confermate; LongCat-2.5-Preview è quella a maggiore varianza, con una rivendicazione di contesto più ampia, un tetto di output molto più basso, uno sconto sulla cache e zero prove pubbliche. Provalo gratuitamente finché la finestra è aperta, tieni entrambi dietro una sola chiave, e lascia che siano i tuoi numeri a decidere.