Una card del titolo hero generata che recita 'LongCat-2.5-Preview vs Kimi K3' con la sopralinea 'La questione del recall sul contesto lungo', e due pannelli: 'LongCat-2.5-Preview: contesto 1M, punteggio di recall non pubblicato' e 'Kimi K3: AA Long-Context Recall 88.67, il più alto che offriamo'. Logo OrcaRouter in basso a destra.
Engineering & Research

LongCat-2.5-Preview vs Kimi K3: la domanda sul recall a lungo contesto a cui nessuno sa ancora rispondere

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Kimi K3 ottiene 88,67 su Long-Context Recall. È il valore più alto di qualsiasi modello del nostro catalogo per la questione specifica se un modello utilizzi ancora informazioni sepolte in profondità dentro un input lungo. LongCat-2.5-Preview non ha alcun punteggio Long-Context Recall — né da Artificial Analysis, né da Meituan, né da nessuno. E LongCat-2.5-Preview è quello che pubblicizza una finestra da un milione di token come sua caratteristica principale. Questo disallineamento, un modello la cui affermazione centrale è il contesto lungo e per il quale non esiste alcuna misurazione del contesto lungo, è l'intera sostanza di questo confronto. Tutto il resto è secondario.

Vale la pena essere precisi su ciò che il numero mancante significa e non significa, perché è facile scivolare da "non misurato" a "probabilmente negativo", e nessuna delle due direzioni è supportata.

Ciò che ciascuno dei due modelli ha messo a verbale

Il Kimi K3 di MoonshotAI è stato rilasciato il 15 luglio 2026. Il nostro catalogo lo include con una finestra di contesto di 1.048.576 token, input di testo e immagini, e un listino di 3,00 $ per milione di token di input, 0,30 $ per milione di input in cache e 15,00 $ per milione di output. Il suo profilo indipendente di Artificial Analysis riporta: Coding Index 76,2, nono posto; Intelligence Index 43,6, diciannovesimo posto; GPQA Diamond 93,5%; Humanity's Last Exam 46,9%; SciCode 59,5%; Terminal-Bench v2.1 85,0; τ²-Bench banking 46,0. E Long-Context Recall 88,67, il valore più alto del nostro catalogo.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview di Meituan è apparso sulla LongCat API Platform il 25 settembre 2026. La sua voce di changelog elenca tre capacità dichiarate — comprensione delle immagini, programmazione e compatibilità con "Claude Code e altri ambienti di sviluppo mainstream", elencando Hermes, OpenClaw, OpenCode e Kilo Code. La pagina dei prezzi indica $0,30 per milione di input non in cache, $0,006 per milione di input in cache e $1,20 per milione di output, contrassegnati come sconto a tempo limitato. Finestra di contesto 1.000.000; output massimo 131.072. Il dato di ~1,6T totali / ~48B parametri attivi proviene dai metadati del sito di Meituan e dalla copertura commerciale cinese, non dalla documentazione. Nessuna tabella di benchmark, nessuna model card, nessun report tecnico, nessun repository su HuggingFace o nell'organizzazione GitHub di Meituan, e metadati di catalogo che registrano i pesi aperti come falsi.

Perché il numero mancante conta più qui che in qualsiasi altro confronto

Long-Context Recall non è uno dei tanti punteggi per questi due modelli. È il punteggio che mette alla prova ciò che entrambi vendono. Una finestra da un milione di token è una dichiarazione sulla capacità architetturale; il recall misura se il modello è ancora in grado di recuperare e usare un fatto collocato al token 900.000 anziché al token 900. I produttori pubblicano il primo perché è una specifica. I valutatori indipendenti pubblicano il secondo perché è un test, e la maggior parte dei modelli non se la cava così bene come lascerebbe pensare la dimensione della loro finestra.

Quindi la posizione onesta è più circoscritta di quanto non sembri. L'88,67 di Kimi K3 non significa che Kimi K3 sia il modello a contesto lungo migliore rispetto a LongCat-2.5-Preview. Significa che Kimi K3 è quello per cui la domanda è stata posta e ha ricevuto una risposta. LongCat-2.5-Preview potrebbe essere migliore. Potrebbe essere sostanzialmente peggiore. Il punto è che attualmente nessuno al di fuori di Meituan lo sa, e una finestra da 1M stampata su una pagina dei prezzi non costituisce una prova in nessuna delle due direzioni.

A screenshot of OrcaRouter's own model page for MoonshotAI Kimi K3 at /models/kimi/kimi-k3, showing the kimi/kimi-k3 identifier, a 1M-token context window, text + image input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-07-15, a p50 first-token figure of 8.24 s, $3.00 and $15.00 rate tiles, and the OpenAI-compatible code samples.

Il quadro dei costi, con lo stesso avvertimento aritmetico

Sulle tariffe pubblicate, LongCat-2.5-Preview costa 10 volte meno sull'input non in cache e 12,5 volte meno sull'output rispetto a Kimi K3. Una lettura da 500.000 token che ne riscrive 20.000 costa circa 1,80 $ su Kimi K3 e circa 17 centesimi su LongCat-2.5-Preview. Entrambi sono calcoli aritmetici sui prezzi di listino anziché misurazioni, e la cifra di LongCat comporta un'avvertenza aggiuntiva che quella di Kimi non ha: Meituan etichetta la propria tariffa come sconto a tempo limitato, quindi il numero che sopravviverà alla promozione è sconosciuto.

Metti questo a confronto con la questione della copertura. Se stai elaborando un input da 500.000 token e il recall del tuo modello a quella profondità non è misurato, la differenza di costo non è un risparmio — è il prezzo di un tasso di errore sconosciuto. Una richiesta da 17 centesimi che manca silenziosamente la sezione rilevante è più costosa di una richiesta da $1,80 che la trova, perché in entrambi i casi paghi la riesecuzione e il debug. Questa è la forma specifica del rischio, ed è per questo che il benchmark mancante è un problema di costi e non solo di marketing.

Cosa fare mentre il numero non esiste

Genera il tuo. Questo è il raro caso in cui la finestra gratuita è davvero adatta a colmare la lacuna: LongCat-2.5-Preview non costa nulla da chiamare tramite OpenCode per un periodo di durata non specificata, con una policy di conservazione zero documentata da OpenCode — addestramento del modello "Not used", conservazione dei dati "0 giorni" — il che significa che puoi puntarlo a un repository privato senza prima dover fare una conversazione sul trattamento dei dati. Costruisci un test needle-in-a-haystack alla profondità che usi davvero, eseguilo su entrambi i modelli e avrai il numero che nessuno dei due fornitori ha pubblicato. Due cose da verificare prima di fidarti del risultato: che il tuo harness faccia emergere il campo interlacciato reasoning_content restituito dal modello, e che l'input di immagini funzioni del tutto, dato che il changelog di Meituan lo dichiara mentre il suo stesso esempio "Retrieve Model" mostra ancora input_modalities come ["text"] con una text->text stringa.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Kimi K3' with the subhead 'The one model advertising a long window is the one with no recall score'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, long-context recall not published by anyone, coding index not published, no repo and catalogue open_weights false. Right column 'Kimi K3' (MoonshotAI, released 2026-07-15, independently scored): 1,048,576-token context, max output not published, text and image to text, $3.00 uncached / $0.30 cached input, $15.00 output, long-context recall 88.67 described as the highest we carry, coding index 76.2 at rank 9 and intelligence index 43.6 at rank 19 by Artificial Analysis. The footnote adds that a 500,000-token read writing 20,000 tokens back is roughly $1.80 on Kimi K3 against roughly 17 cents on LongCat-2.5-Preview at its published promotional rate. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

La parte di OrcaRouter in questo

Serviamo Kimi K3 a prezzo di listino di MoonshotAI con zero ricarico. LongCat-2.5-Preview non è una delle nostre rotte — non lo serviamo, e nulla in questo testo deve essere interpretato come un'affermazione in tal senso.

Per questo particolare confronto, la parte utile di un router non è il prezzo. È che il modello che stai valutando e il modello su cui fai affidamento possono stare dietro la stessa chiave. Il recall di Kimi K3, pari a 88,67, lo rende il modello attraverso cui oggi faresti passare un passaggio a contesto lungo; LongCat-2.5-Preview è il modello che vuoi testare contro di esso, perché se il suo recall regge a un dodicesimo del prezzo di output, l'economia del lavoro su documenti lunghi cambia. La fusione dei modelli è il meccanismo che rende tutto ciò concreto anziché teorico: un passaggio di recupero a contesto lungo e un passaggio finale di sintesi possono essere due modelli diversi su un'unica richiesta, così il modello economico non misurato e quello costoso misurato non devono essere un aut aut. Il failover automatico poi copre il caso in cui uno dei due si degrada, cosa che conta più del solito quando uno dei tuoi due candidati non ha uno storico di servizio che puoi ispezionare.

Il verdetto, enunciato con la propria incertezza annessa.

Se questa settimana ti serve un lavoro a contesto lungo affidabile, Kimi K3 è la scelta difendibile: un recall di 88,67 è il miglior dato disponibile per l'esatta capacità in questione, e il suo profilo più ampio — Coding 76.2, Intelligence 43.6, GPQA Diamond 93,5% — è solido più che spettacolare, il tutto proveniente da fonti indipendenti. Se sei disposto a dedicare un pomeriggio a generare la tua valutazione, LongCat-2.5-Preview è la scommessa più interessante: una finestra da un milione di token, un tetto di output di 131.072 token, accesso a ritenzione zero e una tariffa di un ordine di grandezza inferiore a quella di Kimi K3, il tutto basato su dichiarazioni del fornitore che nessuno ha ancora testato pubblicamente.

Ciò che non è difendibile è trattarli come equivalenti perché entrambi elencano un milione di token. A uno dei due è associato un numero a quella finestra, e l'altro ha un prezzo. Sono tipi diversi di evidenza, e il divario tra loro è l'unica cosa di cui questo confronto si occupa realmente.