
LongCat-2.5-Preview vs Grok 4.6: uno ha una scheda di benchmark, l'altro ha un successore
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 610 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 189 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Confrontare LongCat-2.5-Preview con Grok 4.6 è scomodo per una ragione che non ha nulla a che fare con la qualità di nessuno dei due modelli: la domanda ha una scadenza. Grok 4.6 è stato rilasciato il 12 agosto 2026 e Grok 4.7 è stato rilasciato il 21 settembre 2026 — sei giorni prima che questo venga scritto — alle stesse tariffe di 2,00 $ / 6,00 $ per milione e con la stessa finestra di contesto da 500.000 token. LongCat-2.5-Preview, nel frattempo, è approdato sulla LongCat API Platform di Meituan il 25 settembre 2026 senza alcun successore annunciato all'orizzonte e senza alcun benchmark pubblicato. Quindi la vera scelta non è "quale modello sia migliore". È se si vuole una capacità misurata con un successore misurato già alle spalle, o una non misurata che è quantomeno quella attuale.
Quell'inquadramento è meno entusiasmante di un tabellone e considerevolmente più utile.
Inizia con ciò che Grok 4.6 ha effettivamente agli atti
Grok 4.6 è un modello ben documentato. Nel nostro catalogo presenta una finestra di contesto di 500.000 token, input di testo, immagini e file, e un listino prezzi di $2,00 per milione di token di input, $6,00 per milione di token di output e $0,50 per milione di token di input in cache, che sale a $4,00 e $12,00 oltre i 200.000 token di input. Il suo profilo indipendente di Artificial Analysis include un Coding Index di 76,8 — quinto tra i modelli monitorati da quell'indice — un Intelligence Index di 44,3 al diciottesimo posto, GPQA Diamond al 94,9%, Humanity's Last Exam al 42,9%, SciCode al 56,5%, Terminal-Bench v2.1 a 88,4 e τ²-Bench per il banking a 50,7. Il suo Long-Context Recall è 80,3.

LongCat-2.5-Preview non ha nulla di tutto ciò. La voce del changelog di Meituan per il 25 settembre 2026 è un avviso di disponibilità datato che elenca tre presunte capacità — comprensione delle immagini, programmazione e compatibilità con "Claude Code e altri ambienti di sviluppo mainstream", inclusi Hermes, OpenClaw, OpenCode e Kilo Code — e nulla che assomigli a un risultato. La pagina dei prezzi del fornitore indica $0,30 per milione di input non in cache, $0,006 per milione di input in cache e $1,20 per milione di output, con esplicita indicazione di sconto a tempo limitato. La finestra di contesto è di 1.000.000 di token; l'output massimo è 131.072. Il numero di parametri, circa 1,6 trilioni totali / 48 miliardi attivi, proviene dai metadati del sito di Meituan e dalla copertura della stampa specializzata cinese piuttosto che dalla documentazione. Non esiste un repository per esso su HuggingFace né nell'organizzazione GitHub di Meituan, e i metadati del catalogo distribuiti da OpenCode registrano i pesi aperti come falsi.
La dimensione che un tabellone segnapunti non coglierebbe affatto
Questi due modelli differiscono su qualcosa che nessun benchmark misura, e per molti team è ciò che decide la questione da solo: cosa succede ai prompt che invii.
La documentazione di OpenCode stessa afferma che LongCat 2.5 Preview Free è servito da un fornitore che segue una policy di conservazione zero e non utilizza i tuoi dati per l'addestramento; la tabella sulla privacy di Zen lo quantifica — addestramento del modello "Non utilizzato", conservazione dei dati "0 giorni". La stessa tabella sulla privacy indica trenta giorni di conservazione per Grok 4.6 e Grok 4.7. Entrambe queste affermazioni sono di OpenCode, pubblicate sulle pagine di OpenCode, e descrivono specificamente la scheda gratuita e la scheda di confronto. Ma se stai indirizzando un agente verso un repository privato, questa è la differenza tra una conversazione che non devi avere con l'ufficio legale e una che invece devi avere — e non ha nulla a che fare con quale modello ottenga un punteggio migliore su SciCode.

Cosa ti dà e cosa non ti dà "misurato"
I numeri di Grok 4.6 sono migliori di quelli di LongCat-2.5-Preview nell'unico senso che qui conta: esistono. Ciò non equivale a dire che Grok 4.6 sia il modello migliore. Il suo Coding Index di 76,8 è inferiore a quello della generazione di Grok 4.7, e il modello con cui è stato confrontato non è più la frontiera della sua stessa famiglia. Il suo successore pubblicato ha un Intelligence Index di 46,4 contro il 44,3 di Grok 4.6, e un Long-Context Recall di 76,67 contro l'80,33 di Grok 4.6 — quindi il successore non è migliore su tutti gli assi, il che è esattamente il tipo di dettaglio che un numero di generazione nasconde.
C'è anche un'avvertenza sul serving live che vale la pena dichiarare apertamente, perché va contro la lettura lusinghiera per entrambi i modelli. Sul nostro campione di sette giorni nel playground, Grok 4.6 non ha registrato alcun throughput misurato né traffico di token, che è l'aspetto che assume un'assenza di dati in quella colonna, non un verdetto sulle prestazioni. LongCat-2.5-Preview non ha alcun campione di serving nostro, perché non lo instradiamo. Quindi qualsiasi confronto di latenza tra questi due è a senso unico in un modo che la prosa di solito maschera: non puoi fare benchmark di un modello a cui non stai inviando traffico.
Dove il livello di routing aiuta davvero, qui
Tre dei fatti sopra riportati sono del tipo per cui un router è progettato, e non semplicemente compatibile con essi. La tariffa di Grok 4.6 aumenta oltre i 200.000 token di input, quindi lo stesso compito logico può essere fatturato a due tariffe diverse a seconda di un numero che la tua applicazione già conosce prima di inviare qualsiasi cosa. Grok 4.6 ha un successore pubblicato a tariffe identiche, il che significa che il passaggio dall'uno all'altro dovrebbe essere una modifica di una riga e mai una re-integrazione. E la proprietà più attraente di LongCat-2.5-Preview — il suo prezzo — è etichettata esplicitamente come temporanea dal fornitore.
Su OrcaRouter serviamo Grok 4.6 al prezzo di listino di xAI con zero ricarichi, così una variazione delle tariffe di un fornitore arriva sulla tua fattura lo stesso giorno anziché al rinnovo successivo, e il failover automatico sposta una richiesta degradata verso un provider sano senza che il tuo codice sappia quale ha risposto. Un DSL di routing copre direttamente il caso dei prezzi a scaglioni, e la fusione di modelli copre il caso in cui il modello che vuoi per la lettura lunga non è quello che vuoi per la sintesi finale. LongCat-2.5-Preview non è una delle nostre rotte — non lo serviamo, e nulla qui afferma il contrario. Il punto di nominarlo non è indirizzarti altrove; è che un modello che stai valutando anziché eseguendo appartiene dietro la stessa chiave dei modelli che esegui, così valutarlo costa una voce di configurazione invece di un progetto.

Come decidere
• Scegli Grok 4.6 se ti serve una risposta che puoi difendere. Ha una scheda indipendente, un profilo di input documentato e un prezzo che non scade. Il suo rischio principale non è la qualità ma la pertinenza: Grok 4.7 esiste agli stessi prezzi, e il costo di restare su 4.6 per inerzia è la differenza tra un Intelligence Index di 44.3 e 46.4 che non dovevi pagare.
• Scegli LongCat-2.5-Preview se il fattore decisivo è la ritenzione dei dati o la portata. L'accesso a ritenzione zero tramite OpenCode, una finestra di un milione di token, un tetto di output di 131.072 token e un listino prezzi pari a circa un settimo di quello di Grok 4.6 sono vantaggi reali — il primo dei quali è verificato dall'informativa sulla privacy di una terza parte, gli altri dichiarati solo dal fornitore.
• Non scegliere tra loro in base a una tabella di benchmark, perché ne esiste una sola. Il punteggio di 76,8 nel coding di Grok 4.6 e quello di 80,3 nel richiamo su contesto lungo descrivono Grok 4.6. Nulla descrive ancora LongCat-2.5-Preview. Chiunque questa settimana pubblichi un punteggio di LongCat-2.5-Preview accanto a un punteggio di Grok 4.6 sta citando un diverso modello LongCat oppure sta inventando il numero.
• Verifica il lato di input prima di costruirci sopra. Il changelog di Meituan inizia con la comprensione delle immagini, ma la risposta di esempio nella sua stessa documentazione "Retrieve Model" mostra ancora input_modalities come ["text"] con una text->text stringa di modalità — un'affermazione del fornitore contro un contratto pubblicato che dice il contrario. Grok 4.6 accetta testo, immagini e file senza tale ambiguità. E controlla che il tuo harness esponga un campo reasoning_content interlacciato prima di concludere qualsiasi cosa sulla qualità del ragionamento di LongCat-2.5-Preview; un client che omette quel campo fallirà silenziosamente.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
