Una scheda di titolo hero generata con la scritta 'LongCat-2.5-Preview vs GLM-5.2', con l'occhiello 'Stessa finestra da 1M, solo uno dei due misurato', e due pannelli: 'LongCat-2.5-Preview: contesto 1M, $0.30 / $1.20 per 1M, nessun benchmark pubblicato' e 'GLM-5.2: contesto 1M, AA Long-Context Recall 78.33'. Logo OrcaRouter in basso a destra.
Guides & Insights

LongCat-2.5-Preview vs GLM-5.2: Due finestre da 1M token, una delle quali misurata

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

LongCat-2.5-Preview e GLM-5.2 portano lo stesso numero di punta: una finestra di contesto di un milione di token. Quella singola coincidenza sta facendo tutto il lavoro nella maggior parte dei confronti che vengono scritti questa settimana, e non è sufficiente per confrontare due modelli. GLM-5.2 è documentato pubblicamente dal 16 giugno 2026 con un profilo di benchmark pubblico, un listino prezzi pubblicato e un punteggio di recall su contesto lungo da un valutatore indipendente. LongCat-2.5-Preview è apparso sulla LongCat API Platform di Meituan il 25 settembre 2026 con un listino scontato, un numero di parametri riportato dalla stampa specializzata cinese e nessun benchmark pubblicato di alcun tipo. Una finestra è misurata. L'altra è asserita. Tutto quanto segue tiene separate quelle due categorie, perché una scheda tecnica e un risultato di test non sono lo stesso tipo di fatto.

Questa è la versione onesta del confronto, ed è più utile di quella lusinghiera.

Quello che ciascuna parte ha effettivamente pubblicato

Il changelog di Meituan contiene una voce datata — «Versione: 2026-09-25, LongCat-2.5-Preview ora disponibile» — che elenca tre capacità dichiarate: comprensione delle immagini, coding e compatibilità con «Claude Code e altri ambienti di sviluppo mainstream», citando Hermes, OpenClaw, OpenCode e Kilo Code. La pagina dei prezzi del fornitore indica una tariffa a consumo di 0,30 $ per milione di token di input non in cache, 0,006 $ per milione di token di input in cache e 1,20 $ per milione di token di output, segnalata sulla pagina stessa come sconto a tempo limitato. La finestra di contesto è di un milione di token e l'output massimo è 131.072. Circa 1.600 miliardi di parametri totali, con circa 48 miliardi attivi per token, su un'architettura di base mixture-of-experts, provengono dai metadati del sito di Meituan stesso e dalla copertura della stampa specializzata cinese relativa all'annuncio — non dalla documentazione API. Nessun rapporto tecnico, nessuna model card e nessuna tabella di benchmark accompagnavano nulla di tutto ciò. Non esiste alcun repository LongCat-2.5-Preview su HuggingFace né alcun repository con quel nome nell'organizzazione GitHub di Meituan; i metadati del catalogo dei modelli inclusi in OpenCode riportano open weights: false.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

Il GLM-5.2 di Z.ai si trova nella posizione opposta. È un rilascio di giugno con un listino prezzi che offriamo a prezzo di listino: 1,40 $ per milione di token di input, 0,26 $ per milione di token di input in cache e 4,40 $ per milione di token di output nel nostro catalogo, con una finestra di contesto di 1.000.000 di token e 128.000 token di output massimo. I suoi punteggi pubblicati provengono da due fonti diverse, e la distinzione è importante: i numeri di Z.ai per AIME 2026, HMMT February 2026, GPQA-Diamond e la suite FrontierSWE sono dichiarati dal fornitore; le cifre del Coding Index e dell'Intelligence Index presenti nel nostro catalogo sono attribuite ad Artificial Analysis, che esegue le proprie valutazioni.

L'unica dimensione in cui sono davvero uguali

Entrambi i modelli dichiarano esattamente 1.000.000 di token di contesto. Solo uno dei due ha un punteggio pubblicato che verifica se un modello riesce ancora a usare ciò che c'è dentro. Artificial Analysis registra un valore di Long-Context Recall di 78,33 per GLM-5.2. LongCat-2.5-Preview non ha alcun numero equivalente, da nessuno. Quell'asimmetria è l'intero confronto racchiuso in una riga: una finestra da un milione di token è un'affermazione sulla capacità dell'architettura, non sul fatto che il modello recuperi correttamente al token 900.000. La capacità costa poco da stampare e molto da verificare, ed è per questo che ogni fornitore la stampa e quasi nessuno di loro pubblica il test di recall.

Quindi, se stai scegliendo tra queste due opzioni per il lavoro su contesti lunghi, stai scegliendo tra un'opzione con un punteggio di recall pubblicato e una senza — e quella senza è anche quella con il profilo di benchmark non misurato. Questo non è un argomento contro di essa. È un argomento contro il trattare le due come intercambiabili sulla base di un intero corrispondente.

A screenshot of OrcaRouter's own model page for Z.ai GLM-5.2 at /models/z-ai/glm-5.2, showing the z-ai/glm-5.2 identifier, a 1M-token context window, 128K maximum output, text input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-06-16, a p50 first-token figure of 5.13 s, $1.40 and $4.40 rate tiles, and the OpenAI-compatible code samples.

Come si presenta il divario di prezzo su un lavoro reale

Le tariffe non sono vicine, e la direzione non è quella che ci si aspetta da uno sfidante cinese open-weights contro un laboratorio di frontiera occidentale. LongCat-2.5-Preview costa circa 4,7 volte meno sull'input non in cache e 3,7 volte meno sull'output rispetto a GLM-5.2 — un rapporto che è aritmetica sulle due tariffe pubblicate, non una misurazione. Su una passata di elaborazione di un documento da 500.000 token che ne riscrive 20.000, si tratta di circa 17 centesimi contro circa 79 centesimi. Entrambi i modelli devono leggere lo stesso documento. Solo uno dei due ha un punteggio pubblicato su se presterà ancora attenzione alla fine.

C'è una seconda avvertenza che va fatta nello stesso respiro: Meituan definisce il proprio listino uno sconto a tempo limitato. La cifra di $0,30 è il numero promozionale, e il fornitore non dice cosa viene dopo. Un modello di costo basato su un prezzo promozionale ha una data di scadenza che non puoi leggere. Questo è un motivo per mantenere economica la migrazione tra fornitori, non un motivo per evitare il modello.

Su OrcaRouter, le route che serviamo stanno dietro una sola chiave al prezzo di listino del fornitore, senza alcun ricarico, così una variazione di prezzo di un fornitore arriva sulla tua fattura lo stesso giorno invece che al rinnovo successivo, e il failover automatico sposta una richiesta degradata verso un fornitore sano senza che la tua applicazione se ne accorga. GLM-5.2 è una delle nostre route. LongCat-2.5-Preview no — non lo serviamo, e nulla di quanto qui scritto va letto come un'affermazione contraria. Inoltre Z.ai è andata avanti da giugno: GLM-5.3 è disponibile nel nostro catalogo a partire dal 18 agosto 2026, quindi un confronto impostato come "nuovo modello contro modello attuale" sta già inquadrando GLM-5.2 come l'incumbent anziché come la frontiera.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs GLM-5.2' with the subhead 'Six dimensions, and which side of each one has evidence behind it'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, no repo and catalogue open_weights false. Right column 'GLM-5.2' (Z.ai, released 2026-06-16, independently scored): 1,000,000-token context, 128,000 max output, text to text only, $1.40 / $0.26 input, $4.40 output, coding index 68.8 at rank 30, long-context recall 78.33. Footnote credits OrcaRouter's catalogue and Artificial Analysis for the right column and notes LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Cosa risolverebbe la questione, e cosa no

• Un punteggio Long-Context Recall per LongCat-2.5-Preview, da Meituan o da un valutatore indipendente. Finché non esiste, la sua finestra da 1M è un'affermazione senza alcun test allegato, e il 78,33 di GLM-5.2 è l'unico numero del confronto che affronta la stessa questione.

• Una rate card del fornitore senza il flag di tempo limitato. Il prezzo scontato ti dice quanto costa il modello durante una promozione, non quanto costa.

• Una tabella di benchmark di qualsiasi tipo. Non una posizione in classifica — solo una valutazione pubblicata, così che il confronto non sia più una scheda tecnica contro una pagina di risultati.

• Una conferma dell'input di immagini. Il changelog presenta la comprensione delle immagini come un'aggiunta principale, ma la risposta di esempio nella documentazione "Retrieve Model" di Meituan mostra ancora input_modalities come ["text"] con una text->text stringa di modalità. Quel campione potrebbe essere semplicemente obsoleto. È comunque il contratto pubblicato dal fornitore, quindi considera l'input di immagini come dichiarato piuttosto che disponibile. GLM-5.2, al contrario, è input testuale e output testuale nel nostro catalogo senza alcuna modalità immagine — quindi su questa dimensione nessuno dei due modelli ti dà una risposta verificata, e uno di essi ti dà una dichiarazione.

• I tuoi numeri. Il divario tra ciò che è pubblicato e ciò che ti serve si colma eseguendo entrambi i modelli sui tuoi compiti, e la finestra gratuita su LongCat-2.5-Preview rende tutto questo economico proprio ora. Una traccia di ragionamento che arriva in un campo reasoning_content interlacciato è il dettaglio dell'harness da verificare per primo, perché un tooling che lo scarta silenziosamente perderà gran parte dell'utilità del modello senza segnalare errori.

Dove questo lascia il confronto

Se ti serve una decisione oggi e questa implica un contesto lungo, GLM-5.2 è quello che puoi effettivamente valutare: ha un recall pubblicato, un punteggio di coding indipendente di 68,8 e un Intelligence Index di 33,7 da Artificial Analysis, oltre a un prezzo su cui puoi basare il budget. Questi numeri descrivono un modello competente più che all'avanguardia — il successore della stessa Z.ai, GLM-5.3, ottiene un punteggio superiore — ma descrivono qualcosa. LongCat-2.5-Preview è una proposta più economica, con un contesto più ampio e del tutto non misurata, la cui qualità più attraente, il prezzo, è esplicitamente temporanea. L'atteggiamento corretto nei suoi confronti non è lo scetticismo. È una valutazione di due settimane con il tuo harness di scoring personale collegato, da eseguire prima che la tariffa promozionale scompaia.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno