
LongCat-2.5-Preview vs Qwen3.8-Max: un settimo del prezzo e nessuna presenza in classifica
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 610 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 189 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Meituan ha messo LongCat-2.5-Preview sulla sua piattaforma API il 25 settembre 2026, con una voce nel changelog, un listino prezzi e nessun benchmark di alcun tipo — per poi prezzarlo a circa un settimo di quanto Qwen3.8-Max fa pagare per la stessa chiamata. Non è un divario di poco conto, né un divario senza rischi. Qwen3.8-Max, il modello di punta del fornitore, è disponibile a livello generale dal 3 agosto 2026, ha una classificazione indipendente di Artificial Analysis, pubblica uno snapshot datato che si può fissare per nome, e fattura 6,7 volte tanto per l'input e 5 volte tanto per l'output. La domanda a cui questo confronto deve rispondere non è quale modello sia migliore — nessuno al di fuori di Meituan è ancora in grado di rispondere. È che cosa si compra con la differenza, e se quella differenza valga la pena di essere comprata.
Quello che ciascuna parte ha effettivamente pubblicato
Comincia dalla provenienza, perché è ciò che distingue questi due in modo più netto di quanto farebbe qualsiasi benchmark.
LongCat-2.5-Preview è arrivato con una voce datata nel changelog di Meituan stesso — parole del fornitore: "Versione: 2026-09-25 — LongCat-2.5-Preview ora disponibile" — una pagina dei prezzi che lo elenca come modello pay-as-you-go attuale della piattaforma, e una guida di avvio rapido che copre entrambi i formati wire. L'account di Meituan su X lo descrive così: "1,6T parametri. ~48B attivi. Una finestra di contesto di 1M token. Nativamente multimodale." Oltre a questo, non c'è nulla da leggere. Nessun repository nell'organizzazione meituan-longcat di Hugging Face copre questo modello — il repository più recente dell'organizzazione è LongCat-Flash-Lite-Sparse, del 31 luglio — e il catalogo di modelli OpenCode, che lo serve, lo registra come a pesi chiusi. Nessuna model card, nessun report tecnico, nessuna licenza, nessuna tabella dei parametri pubblicata dal fornitore, e nessuna valutazione indipendente da nessuna parte: al 27 settembre non esiste alcuna pagina di LongCat-2.5-Preview su Artificial Analysis.
Qwen3.8-Max è il caso opposto sotto quasi ogni aspetto. È diventato disponibile a livello generale il 3 agosto 2026 con un listino prezzi pubblicato, e Alibaba ha rilasciato un aggiornamento denominato, Qwen3.8-Max-0902, il 2 settembre. Artificial Analysis lo misura: Indice di Intelligenza 45,4, classificato 15º su 145 modelli, e un Indice di Programmazione di 76,2, classificato 9º su 138. Registra GPQA Diamond 92,8%, Humanity's Last Exam 43,1%, SciCode 52,1%, Long-Context Recall 80,3%, Terminal-Bench 2.1 all'88,8% e τ-bench banking al 47,8%. Questo è un modello misurato, con una ricevuta per ogni singolo numero.
Quindi il riepilogo onesto della colonna delle prove è sbilanciato in un modo che non ha nulla a che fare con la capacità. Uno di questi modelli può essere valutato prima di impegnarti. L'altro si può solo provare.
Il listino prezzi, riga per riga
Entrambi sono modelli da un milione di token con lo stesso limite massimo di output, quindi le schede tecniche convergono esattamente dove una scheda tecnica è meno utile:
• Input non in cache — LongCat-2.5-Preview 0,30 $ per 1M vs Qwen3.8-Max 2,00 $ per 1M, un divario di 6,7×.
• Input in cache — $0,006 per 1M vs $0,25 per 1M, un divario di 41,7×.
• Output — $1,20 per 1M rispetto a $6,00 per 1M, un divario di 5×.
• Finestra di contesto — 1.048.576 token contro 1.000.000 di token. Funzionalmente un pareggio.
• Output massimo — 131.072 token su entrambi. Identico.
• Punteggio indipendente — nessuno pubblicato vs AA Intelligence 45.4 e AA Coding 76.2.
Ogni cifra di LongCat che compare lì proviene dalla pagina dei prezzi di Meituan stessa, e la pagina etichetta l'intera colonna "Discounted Price (limited-time)". Le cifre di Qwen3.8-Max sono la tariffa di listino di Alibaba, lette dalla nostra scheda del modello, con una lettura della cache a 0,25 $ e una scrittura della cache a 2,50 $ per milione. Lo snapshot di Artificial Analysis è datato 2 settembre 2026.
La riga dell'input in cache è quella su cui soffermarsi. Una differenza di 42× nelle letture dalla cache è il singolo numero più grande in questo confronto, e cade proprio sulla dimensione in cui risiedono davvero i carichi di lavoro degli agenti. Un loop di agente che rinvia a ogni turno un prompt di sistema e uno schema degli strumenti da 100.000 token paga la tariffa della cache per la maggior parte dei suoi token, non la tariffa di input pubblicizzata.
Una chiamata da 150.000 token, prezzata in entrambi i modi
Prendi una plausibile richiesta in stile agente: 150.000 token di input, 50.000 dei quali serviti dalla cache, e una risposta di 4.000 token. Con la tariffa scontata di Meituan, quella chiamata costa $0,0501. Con la tariffa di listino di Qwen3.8-Max, la chiamata identica costa $0,3365 — 6,7× in più, ovvero $50 contro $337 per mille chiamate al giorno. Porta il mix completamente in cache, che è lo stato stazionario per un prompt ripetuto, e il rapporto si allarga a 12,3×: $0,006 contro $0,074 per chiamata.
Nulla in quell'aritmetica dipende dal fatto che LongCat-2.5-Preview sia buono. È esattamente questo il problema. Il moltiplicatore che ti viene offerto è reale, e la parola che gli è associata sulla pagina stessa del fornitore è «a tempo limitato», senza data di fine e senza alcun prezzo dichiarato per il successore. Uno sconto di 6,7× senza scadenza pubblicata è una voce di budget che non puoi inserire in un piano; è una voce di budget che tieni d'occhio.
C'è anche un'asimmetria di instradamento che vale la pena dichiarare apertamente. Qwen3.8-Max è una route che serviamo — qwen/qwen3.8-max e la versione pinned qwen/qwen3.8-max-0902 — al prezzo di listino di Alibaba senza alcun markup, così una variazione di prezzo del fornitore ricade dalla nostra parte lo stesso giorno, non settimane dopo. LongCat-2.5-Preview non è una delle nostre route, e non abbiamo intenzione di fingere il contrario; sul versante economico di questo confronto hai a che fare con l'API di Meituan e con qualunque piattaforma attraverso cui la raggiungi.
L'unica affermazione che l'API di Meituan stessa contraddice
Questo è il risultato che dovrebbe decidere il confronto per chiunque abbia un carico di lavoro non puramente testuale.
Il changelog di Meituan elenca la comprensione delle immagini come la novità principale della generazione 2.5: "Comprensione multimodale: nuova capacità di comprensione delle immagini, in grado di analizzare il contenuto delle immagini, supportando Q&A cross-modale, riepilogo dei contenuti e ragionamento visivo complesso." Il post su X dice "nativamente multimodale". Queste sono affermazioni dei fornitori e, di per sé, sarebbero ragionevoli da portare in una decisione.
Poi lo stesso sito di documentazione pubblica la risposta di esempio per recuperare i metadati di quel modello stesso, e il modello che restituisce è solo testo. In corrispondenza dell'id "LongCat-2.5-Preview", il payload mostra context_length: 1048576, input_modalities: ["text"], output_modalities: ["text"], e una stringa di modalità di text->text. Nessuna voce immagine. Non in una vecchia istantanea — nell'esempio svolto sulla pagina che documenta l'endpoint.
![A screenshot of Meituan's LongCat API documentation for the model-retrieval endpoint, showing the worked example response for 'LongCat-2.5-Preview': context_length 1048576, input_modalities ["text"], output_modalities ["text"] and modality "text->text". The word 'text' is visible in red against the grey page.](https://cms.orcarouter.ai/api/media/file/2-1349.png)
Ciò non prova che il modello non possa vedere. Prova che il fornitore non ha riconciliato la sua prosa con il proprio schema API, e significa che un acquirente non può imputare un carico di lavoro di visione a quella frase del changelog finché qualcuno non lo chiarisce. Mettilo accanto all'altro lato: il nostro catalogo elenca Qwen3.8-Max come accettante input di testo, immagini e video, con la visione tra le sue capacità dichiarate, e dietro il modello c'è una tabella di benchmark indipendente. Se il tuo compito è la comprensione di documenti, il triage di screenshot o l'analisi di fotogrammi video, la colonna costosa è quella con una modalità di input verificata e la colonna economica è quella con una modalità irrisolta. Quella singola riga può cancellare l'intero 6,7×.
A cosa non può essere fissata un'Anteprima
Alibaba distribuisce snapshot datati. qwen/qwen3.8-max-0902 è una build denominata e congelata allo stesso prezzo di $2/$6 del modello base, il che significa che una regola di routing che la nomina continuerà a restituire gli stessi pesi anche il mese prossimo. Le modifiche di comportamento arrivano sotto forma di un nuovo id che puoi adottare secondo i tuoi tempi.
LongCat-2.5-Preview non ha un identificatore del genere. L'ID del modello è l'ID di anteprima, non c'è alcun suffisso di snapshot, nessuno storico delle versioni sulla piattaforma e nessuna voce di changelog che ti direbbe che i pesi sono cambiati — solo che lo sconto è "a tempo limitato". È un'anteprima nel senso comune del termine: ciò che si trova sotto quel nome può cambiare, e lo scopriresti dai tuoi output anziché da una nota di rilascio.
Il modo più economico per comprare le prove mancanti è la finestra che Meituan ha aperto dall'altro lato di questo: OpenCode elenca LongCat-2.5-Preview come gratuito per un periodo limitato, con il provider che segue una politica di zero retention e non addestra sui tuoi dati, e il 26 settembre ha dichiarato che la finestra dura due settimane. Input gratuiti, output gratuiti, letture della cache gratuite. Questo è un modo legittimo per costruire la tabella di benchmark che nessuno ha pubblicato — esegui il tuo corpus di valutazione su di esso, e ottieni un numero dove il fornitore ti ha dato una frase. Quello che non è, è un prezzo su cui puoi pianificare: due settimane finiscono, e il numero dall'altro lato è di Meituan da stabilire.
Chi dovrebbe scegliere cosa
Scegli Qwen3.8-Max quando il carico di lavoro è il motivo per cui stai acquistando il modello in primo luogo. Se l'input è costituito da immagini o video, se la risposta deve essere riproducibile da build a build, se un indice indipendente è un requisito di approvvigionamento, o se il compito è il tipo di coding agentico per cui Terminal-Bench e il Coding Index fungono da proxy, il 6.7× è il prezzo da pagare per poter verificare il proprio lavoro. Su una chiave, inoltre, si trova dietro una catena di fallback, così un modello con punteggio può assorbire una brutta giornata per quello senza punteggio senza che tu debba eseguire due integrazioni.

Ricorri a LongCat-2.5-Preview quando il carico di lavoro è ad alto volume, a contesto breve, solo testo e interno — classificazione, estrazione, sintesi, riscrittura in blocco — e quando il costo di sbagliare è un nuovo tentativo anziché un cliente. Su quel profilo la voce dell'input in cache non è uno sconto, è l'intera economia del lavoro, e 42× è un numero che vale la pena misurare. Usa la finestra gratuita per produrre il benchmark che non esiste. Non migrare un percorso critico su di esso.
Cosa cambierebbe questo verdetto, in ordine di peso: una valutazione indipendente di LongCat-2.5-Preview; una data di scadenza pubblicata e un prezzo del successore per lo sconto; una cronologia delle versioni con istantanee datate; e una risoluzione su se l'elenco delle modalità sia solo testo oppure no. Uno qualsiasi di questi elementi rende la colonna economica più di uno sconto. Finché almeno uno non si concretizza, questo confronto non è una sfida tra due modelli — è una sfida tra un prezzo che puoi verificare e una capacità che non puoi.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
