Una hero title card generata che recita 'LongCat-2.5-Preview vs Grok 4.6' con il sopratitolo 'Uno ha una card di benchmark, l'altro ha un successore', e due pannelli: 'LongCat-2.5-Preview: contesto da 1M, zero retention tramite OpenCode' e 'Grok 4.6: AA Coding 76.8, Grok 4.7 già rilasciato'. Logo OrcaRouter in basso a destra.
Guides & Insights

LongCat-2.5-Preview vs Grok 4.6: uno ha una scheda di benchmark, l'altro ha un successore

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Confrontare LongCat-2.5-Preview con Grok 4.6 è scomodo per una ragione che non ha nulla a che fare con la qualità di nessuno dei due modelli: la domanda ha una scadenza. Grok 4.6 è stato rilasciato il 12 agosto 2026 e Grok 4.7 è stato rilasciato il 21 settembre 2026 — sei giorni prima che questo venga scritto — alle stesse tariffe di 2,00 $ / 6,00 $ per milione e con la stessa finestra di contesto da 500.000 token. LongCat-2.5-Preview, nel frattempo, è approdato sulla LongCat API Platform di Meituan il 25 settembre 2026 senza alcun successore annunciato all'orizzonte e senza alcun benchmark pubblicato. Quindi la vera scelta non è "quale modello sia migliore". È se si vuole una capacità misurata con un successore misurato già alle spalle, o una non misurata che è quantomeno quella attuale.

Quell'inquadramento è meno entusiasmante di un tabellone e considerevolmente più utile.

Inizia con ciò che Grok 4.6 ha effettivamente agli atti

Grok 4.6 è un modello ben documentato. Nel nostro catalogo presenta una finestra di contesto di 500.000 token, input di testo, immagini e file, e un listino prezzi di $2,00 per milione di token di input, $6,00 per milione di token di output e $0,50 per milione di token di input in cache, che sale a $4,00 e $12,00 oltre i 200.000 token di input. Il suo profilo indipendente di Artificial Analysis include un Coding Index di 76,8 — quinto tra i modelli monitorati da quell'indice — un Intelligence Index di 44,3 al diciottesimo posto, GPQA Diamond al 94,9%, Humanity's Last Exam al 42,9%, SciCode al 56,5%, Terminal-Bench v2.1 a 88,4 e τ²-Bench per il banking a 50,7. Il suo Long-Context Recall è 80,3.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview non ha nulla di tutto ciò. La voce del changelog di Meituan per il 25 settembre 2026 è un avviso di disponibilità datato che elenca tre presunte capacità — comprensione delle immagini, programmazione e compatibilità con "Claude Code e altri ambienti di sviluppo mainstream", inclusi Hermes, OpenClaw, OpenCode e Kilo Code — e nulla che assomigli a un risultato. La pagina dei prezzi del fornitore indica $0,30 per milione di input non in cache, $0,006 per milione di input in cache e $1,20 per milione di output, con esplicita indicazione di sconto a tempo limitato. La finestra di contesto è di 1.000.000 di token; l'output massimo è 131.072. Il numero di parametri, circa 1,6 trilioni totali / 48 miliardi attivi, proviene dai metadati del sito di Meituan e dalla copertura della stampa specializzata cinese piuttosto che dalla documentazione. Non esiste un repository per esso su HuggingFace né nell'organizzazione GitHub di Meituan, e i metadati del catalogo distribuiti da OpenCode registrano i pesi aperti come falsi.

La dimensione che un tabellone segnapunti non coglierebbe affatto

Questi due modelli differiscono su qualcosa che nessun benchmark misura, e per molti team è ciò che decide la questione da solo: cosa succede ai prompt che invii.

La documentazione di OpenCode stessa afferma che LongCat 2.5 Preview Free è servito da un fornitore che segue una policy di conservazione zero e non utilizza i tuoi dati per l'addestramento; la tabella sulla privacy di Zen lo quantifica — addestramento del modello "Non utilizzato", conservazione dei dati "0 giorni". La stessa tabella sulla privacy indica trenta giorni di conservazione per Grok 4.6 e Grok 4.7. Entrambe queste affermazioni sono di OpenCode, pubblicate sulle pagine di OpenCode, e descrivono specificamente la scheda gratuita e la scheda di confronto. Ma se stai indirizzando un agente verso un repository privato, questa è la differenza tra una conversazione che non devi avere con l'ufficio legale e una che invece devi avere — e non ha nulla a che fare con quale modello ottenga un punteggio migliore su SciCode.

A screenshot of OrcaRouter's own model page for xAI Grok 4.6 at /models/grok/grok-4.6, showing the grok/grok-4.6 identifier, a 500K-token context window, text + image + file input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-08-12, $2.00 and $6.00 rate tiles, and a performance strip whose first-token and token-traffic tiles both read 'Collecting' rather than a figure. The page copy describes Grok 4.6 as the current flagship of the Grok line and cites a headline GPQA Diamond score of 94.9.

Cosa ti dà e cosa non ti dà "misurato"

I numeri di Grok 4.6 sono migliori di quelli di LongCat-2.5-Preview nell'unico senso che qui conta: esistono. Ciò non equivale a dire che Grok 4.6 sia il modello migliore. Il suo Coding Index di 76,8 è inferiore a quello della generazione di Grok 4.7, e il modello con cui è stato confrontato non è più la frontiera della sua stessa famiglia. Il suo successore pubblicato ha un Intelligence Index di 46,4 contro il 44,3 di Grok 4.6, e un Long-Context Recall di 76,67 contro l'80,33 di Grok 4.6 — quindi il successore non è migliore su tutti gli assi, il che è esattamente il tipo di dettaglio che un numero di generazione nasconde.

C'è anche un'avvertenza sul serving live che vale la pena dichiarare apertamente, perché va contro la lettura lusinghiera per entrambi i modelli. Sul nostro campione di sette giorni nel playground, Grok 4.6 non ha registrato alcun throughput misurato né traffico di token, che è l'aspetto che assume un'assenza di dati in quella colonna, non un verdetto sulle prestazioni. LongCat-2.5-Preview non ha alcun campione di serving nostro, perché non lo instradiamo. Quindi qualsiasi confronto di latenza tra questi due è a senso unico in un modo che la prosa di solito maschera: non puoi fare benchmark di un modello a cui non stai inviando traffico.

Dove il livello di routing aiuta davvero, qui

Tre dei fatti sopra riportati sono del tipo per cui un router è progettato, e non semplicemente compatibile con essi. La tariffa di Grok 4.6 aumenta oltre i 200.000 token di input, quindi lo stesso compito logico può essere fatturato a due tariffe diverse a seconda di un numero che la tua applicazione già conosce prima di inviare qualsiasi cosa. Grok 4.6 ha un successore pubblicato a tariffe identiche, il che significa che il passaggio dall'uno all'altro dovrebbe essere una modifica di una riga e mai una re-integrazione. E la proprietà più attraente di LongCat-2.5-Preview — il suo prezzo — è etichettata esplicitamente come temporanea dal fornitore.

Su OrcaRouter serviamo Grok 4.6 al prezzo di listino di xAI con zero ricarichi, così una variazione delle tariffe di un fornitore arriva sulla tua fattura lo stesso giorno anziché al rinnovo successivo, e il failover automatico sposta una richiesta degradata verso un provider sano senza che il tuo codice sappia quale ha risposto. Un DSL di routing copre direttamente il caso dei prezzi a scaglioni, e la fusione di modelli copre il caso in cui il modello che vuoi per la lettura lunga non è quello che vuoi per la sintesi finale. LongCat-2.5-Preview non è una delle nostre rotte — non lo serviamo, e nulla qui afferma il contrario. Il punto di nominarlo non è indirizzarti altrove; è che un modello che stai valutando anziché eseguendo appartiene dietro la stessa chiave dei modelli che esegui, così valutarlo costa una voce di configurazione invece di un progetto.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Grok 4.6' with the subhead 'One model has a measured card and a measured successor; the other has a rate card'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, data retention 0 days on the free listing per OpenCode. Right column 'Grok 4.6' (xAI, released 2026-08-12, successor shipped 2026-09-21): 500,000-token context, max output not published, text, image and file to text, $2.00 input up to 200K then $4.00, $6.00 output up to 200K then $12.00, coding index 76.8 at rank 5 by Artificial Analysis, long-context recall 80.33, data retention 30 days on the comparison listing per OpenCode. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Come decidere

• Scegli Grok 4.6 se ti serve una risposta che puoi difendere. Ha una scheda indipendente, un profilo di input documentato e un prezzo che non scade. Il suo rischio principale non è la qualità ma la pertinenza: Grok 4.7 esiste agli stessi prezzi, e il costo di restare su 4.6 per inerzia è la differenza tra un Intelligence Index di 44.3 e 46.4 che non dovevi pagare.

• Scegli LongCat-2.5-Preview se il fattore decisivo è la ritenzione dei dati o la portata. L'accesso a ritenzione zero tramite OpenCode, una finestra di un milione di token, un tetto di output di 131.072 token e un listino prezzi pari a circa un settimo di quello di Grok 4.6 sono vantaggi reali — il primo dei quali è verificato dall'informativa sulla privacy di una terza parte, gli altri dichiarati solo dal fornitore.

• Non scegliere tra loro in base a una tabella di benchmark, perché ne esiste una sola. Il punteggio di 76,8 nel coding di Grok 4.6 e quello di 80,3 nel richiamo su contesto lungo descrivono Grok 4.6. Nulla descrive ancora LongCat-2.5-Preview. Chiunque questa settimana pubblichi un punteggio di LongCat-2.5-Preview accanto a un punteggio di Grok 4.6 sta citando un diverso modello LongCat oppure sta inventando il numero.

• Verifica il lato di input prima di costruirci sopra. Il changelog di Meituan inizia con la comprensione delle immagini, ma la risposta di esempio nella sua stessa documentazione "Retrieve Model" mostra ancora input_modalities come ["text"] con una text->text stringa di modalità — un'affermazione del fornitore contro un contratto pubblicato che dice il contrario. Grok 4.6 accetta testo, immagini e file senza tale ambiguità. E controlla che il tuo harness esponga un campo reasoning_content interlacciato prima di concludere qualsiasi cosa sulla qualità del ragionamento di LongCat-2.5-Preview; un client che omette quel campo fallirà silenziosamente.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno