
Mercury 2.5 vs Mercury 2.5 Preview: Un modello di diffusione, due date di lancio
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Ecco un confronto diretto in cui entrambi i contendenti condividono la stessa scheda tecnica. La Mercury 2.5 Preview di Inception, rilasciata il 31 agosto 2026, e la Mercury 2.5, rilasciata l'8 settembre 2026, sono lo stesso modello di linguaggio diffusion a otto giorni di distanza: un canale in anteprima che Inception ha aperto agli sviluppatori e la versione di produzione "pronta per le aziende" lanciata una settimana dopo. Inception non ha rivelato un checkpoint diverso, una velocità diversa o un prezzo diverso per la Mercury 2.5 — e i numeri che sono effettivamente cambiati tra i due annunci sembrano una sistemazione, non un nuovo modello. La cifra sul contesto è stata corretta da 256K nella pagina di anteprima a 260K al lancio, e il guadagno di intelligenza rispetto alla Mercury 2 è stato riformulato da "più di 10 punti" (materiali di anteprima) a "40 percento" (materiali di lancio). Il motore, l'affermazione di 1.107 token al secondo e il listino prezzi sono identici. Quindi non è la solita sfida su carta, e gonfiare una delle due sarebbe disonesto. Il confronto che conta tra questi due nomi riguarda confezione e tempistica: cosa ha realmente cambiato il lancio di produzione, cosa ti stava davvero dicendo l'etichetta "Preview" e quale nome dovrebbero usare ora le tue chiamate API.
Perché un modello viene confrontato con se stesso
I vendor di solito presentano un modello in anteprima e poi lo assorbono in silenzio nel nome principale; la scheda dell'anteprima scompare e nessuno scrive il confronto. Inception, invece, ha tenuto i due nomi affiancati per una settimana, e l'identità dell'anteprima viene ritirata solo ora — ed è esattamente questo a dare sostanza al confronto. L'anteprima era il percorso rapido che Inception ha usato per mettere la sua scommessa sui modelli a diffusione davanti agli sviluppatori. È apparsa il 31 agosto con la scheda tecnica che oggi è quella di Mercury 2.5: un LLM a diffusione (dLLM) che genera e rifinisce blocchi di token in parallelo invece di emettere un token alla volta; una velocità dichiarata di 1.107 token al secondo su GPU standard; un time-to-first-token dichiarato inferiore a 300 ms; una finestra di contesto da 260K token con output da 65.536 token; livelli di ragionamento regolabili; uso nativo degli strumenti, chiamate parallele agli strumenti e output strutturato. Ognuna di queste cifre è di Inception, e nessun laboratorio indipendente aveva misurato il modello quando l'anteprima è stata pubblicata.
L'8 settembre Inception ha lanciato Mercury 2.5 come "il prossimo livello di intelligenza per gli LLM a diffusione" e il suo modello di ragionamento più veloce in produzione — pronto per le aziende, pensato per agenti vocali, sottoagenti di codifica, ricerca aziendale e carichi di lavoro di supporto. Stesse specifiche, stesso posizionamento, stesso listino prezzi. Il lancio ha anche anticipato due modelli fratelli che chiariscono la direzione di Inception: Mercury Voice, un dLLM ottimizzato per un primo token in meno di 170 ms per gli agenti vocali, e Mercury Router, che instrada i prompt tra i modelli in base a qualità, velocità e costo. Mercury 2.5 è l'ammiraglia di una famiglia progettata per carichi di lavoro agentici sensibili alla latenza, piuttosto che per il segmento di qualità di frontiera.
Cosa ha effettivamente cambiato il lancio dell'8 settembre
Confronta i due nomi riga per riga e la differenza non è il motore — è tutto ciò che avvolge il motore:
• Stato — Anteprima Mercury 2.5: un'anteprima chiusa che potrebbe "modificare il comportamento o la disponibilità." Mercury 2.5: un modello di produzione lanciato con un impegno di livello enterprise, un canale di vendita e una scheda di produzione datata.
• Identità — La pagina dei modelli di Inception ora elenca Mercury 2.5, Mercury Voice e Mercury Router, senza alcuna traccia di Preview, e la sua nota di supporto indica Mercury 1, Mercury 2 e Mercury Edit 2 come i modelli che “restano supportati per i clienti esistenti”. La Preview non compare in nessuno dei due elenchi. Per quanto riguarda il fornitore, l’etichetta preview è stata assorbita in Mercury 2.5.
• Endpoint — La piattaforma per sviluppatori di Inception serve il modello come mercury-2.5, e la pubblicazione in produzione andata live l'8 settembre è quella su cui viene indirizzato il nuovo traffico. Nel catalogo che aveva inizialmente ospitato la Preview a fine agosto, il nome Preview ora non risolve ad alcun endpoint di servizio attivo, mentre la voce Mercury 2.5 aggiunta l'8 settembre risponde. Chi ha integrato il codice riferendosi alla Preview dovrebbe reindirizzarsi su Mercury 2.5 e verificare cosa il proprio provider sta effettivamente addebitando: l'id integrato nella prima settimana è quello che verrà ritirato.
• Prezzo — stesso prezzo di listino e identico sconto. Entrambi sono $0.20 per milione di input e $0.75 per milione di output, con input in cache a $0.02, ed entrambi sono stati lanciati con circa l'80% di sconto: $0.04 / $0.15, cache a $0.004. Lo sconto dell'anteprima era esplicitamente limitato all'8 settembre; Mercury 2.5 è stato lanciato con la stessa offerta dell'80% e la tariffa scontata è ancora quella che la sua scheda di produzione mostra al momento della scrittura. Questo è il tranello, spiegato di seguito.
• Onboarding — il lancio in produzione ha aggiunto una quota gratuita di token per i nuovi account sviluppatore — i materiali di lancio citano 100 milioni di token — e ha aperto un percorso di contatto aziendale che un'anteprima non aveva mai avuto.
• Evidenze — invariate. Nessuno dei due nomi ha un benchmark indipendente, e le affermazioni del fornitore sono le stesse affermazioni con una formulazione leggermente diversa: un salto di intelligenza di "più di 10 punti" rispetto a Mercury 2 nei materiali di anteprima diventa un aumento del "40 percento" nei materiali di lancio, insieme alla stessa parità dichiarata con il livello frontier ottimizzato in termini di costi (GPT-5.6 Luna in modalità low-effort, Gemini 3.5 Flash-Lite, Claude Haiku 4.5) e lo stesso 79% riportato dal fornitore su GPQA Diamond e il 77% su IFBench. Un'affermazione riformulata non è un'affermazione verificata.

La trappola dei prezzi al centro dell'abbinamento
Poiché i due nomi hanno lo stesso prezzo di listino e lo stesso teaser dell'80%, è facile supporre che costino sempre lo stesso. Non è detto. Lo sconto del Preview aveva una scadenza tassativa l'8 settembre; lo sconto di lancio di Mercury 2.5 riparte da un cronometro azzerato. Per una settimana è stato del tutto possibile pagare $0.20 / $0.75 per una chiamata al Preview mentre lo stesso motore rispondeva a $0.04 / $0.15 sotto il suo nome di produzione — o, più probabilmente, essere su un ID di anteprima che aveva silenziosamente smesso di servire mentre la fattura continuava ad arrivare. Uno sconto di lancio che scade per endpoint è esattamente il tipo di clausola in piccolo che trasforma una storia di "stesso modello, stesso prezzo" in una reale differenza di costo.
Il numero duraturo è il prezzo di listino, e il consiglio duraturo è di pianificare il budget attorno a esso: $0.20 / $0.75 per milione, input in cache $0.02 — economico per un modello di ragionamento con un contesto di 260K, comodamente sotto il livello flagship, ma non i $0.04 / $0.15 che i banner di lancio pubblicizzano. Tratta il prezzo scontato come un prezzo di prova con una durata limitata, verifica cosa il tuo fornitore ti addebita per l'ID esatto del modello nel tuo codice piuttosto che per il nome sulla pagina di marketing, e se hai iniziato con la Preview, migra a Mercury 2.5 prima che una scadenza o un endpoint dismesso decida per te.
Questa è anche la classe di problemi che un livello di routing esiste per eliminare. Un router di modelli che trasmette i prezzi di listino dei fornitori a un ricarico dello 0% mostra il prezzo che il fornitore fattura effettivamente, aggiornato lo stesso giorno in cui uno sconto di lancio entra in vigore o scade, e il failover automatico mantiene le chiamate attive quando un endpoint ti viene tolto da sotto. Mercury 2.5 non è su OrcaRouter al momento in cui scriviamo — Inception lo serve tramite la propria API e diverse piattaforme di terze parti — quindi per ora la pagina dei modelli del fornitore è la fonte di verità sul prezzo. Nel momento in cui un fornitore lo inserisce, ottieni queste meccaniche di pass-through su una sola chiave, e un taglio di prezzo o una scadenza di sconto compare dalla nostra parte lo stesso giorno in cui viene annunciato.
Il problema dell'evidenza condiviso da entrambi i nomi.
Il punteggio onesto per questo confronto è breve, perché le due colonne sono lo stesso modello con la stessa assenza di prove. Né Mercury 2.5 né Mercury 2.5 Preview hanno un punteggio indice indipendente, una run riprodotta o un posizionamento in arena al 9 settembre 2026. Le affermazioni di Inception — il salto di intelligenza rispetto a Mercury 2, la parità con il livello Haiku 4.5, il 79% su GPQA Diamond, i 1.107 token al secondo — sono parole dell'azienda, e sono identiche per entrambi i nomi perché il modello è identico.
L'unico elemento di prova indipendente nella famiglia indica come interpretare l'affermazione sulla velocità. Artificial Analysis ha misurato Mercury 2, il predecessore, a 684 token al secondo sull'endpoint di produzione, assegnandogli un punteggio di 22 sull'Intelligence Index — decisamente veloce, e prova che l'approccio a diffusione non è un miraggio, ma ben al di sotto dei circa 1.000 token al secondo che Inception pubblicizza per quel modello su hardware Blackwell. Bisogna aspettarsi un divario simile tra la cifra di 1.107 di Mercury 2.5 e ciò che un endpoint condiviso multi-tenant offre realmente sotto carico. La stessa cautela vale per la qualità: un modello a diffusione completamente nuovo, misurato solo dal suo creatore, non dovrebbe essere preso in parola sulla sua capacità di eguagliare Claude Haiku 4.5 finché una terza parte non lo testa.

I tracker che hanno iniziato a coprire il rilascio riflettono esattamente questo stato delle cose. Un record BenchLM per Mercury 2.5, pubblicato l'8 settembre, non assegna al modello né punteggio pubblico né posizione pubblica in classifica; riporta il 79% GPQA Diamond e il 77% IFBench di Inception, esplicitamente etichettati come segnalati dal fornitore, e nota che la velocità di esecuzione indipendente non è stata misurata. La prima voce nell'indice Artificial Analysis, una presenza su LMArena, o un run GPQA riprodotto trasformeranno Mercury 2.5 da un'affermazione a un oggetto confrontabile — e si applicherà a entrambi i nomi contemporaneamente, perché c'è un solo modello da misurare.

Quale nome dovresti chiamare?
• Nuova integrazione, nessuna legacy: chiama Mercury 2.5 e ignora la Preview. Il nome di produzione porta lo stesso motore, lo stesso sconto per ora, i termini enterprise e la garanzia che è l'ID che il vendor sta effettivamente servendo. La Preview aggiunge rischio di instabilità e nient'altro.
• Hai già integrato la Preview: verifica oggi cosa il tuo provider serve con quel nome e cosa ti addebita. Ripunta il client sull'ID di Mercury 2.5 e conferma la tariffa. Mantenere il nome Preview nel codice di produzione è ora una scommessa che un canale di anteprima esplicitamente limitato nel tempo sopravviva alla propria dismissione.
• Traffico enterprise o critico per la produzione: Mercury 2.5 tramite il percorso enterprise di Inception, non un'etichetta di anteprima senza alcun impegno alle spalle. Le esigenze di voce e routing fanno riferimento rispettivamente a Mercury Voice e Mercury Router, che sono anch'essi ancora in anteprima.
• Chiunque stia valutando il livello di diffusione: entrambi i nomi designano lo stesso obiettivo di valutazione, quindi esegui la tua valutazione su Mercury 2.5 una sola volta e considera il risultato come applicabile alla linea di modelli. Imposta il budget al prezzo di listino e considera le affermazioni del fornitore come ipotesi finché non arriva un punteggio indipendente.
Cosa guardare
Tre cose decideranno il confronto tra questi due modelli nelle prossime settimane. Primo, il primo benchmark indipendente — un piazzamento in una classifica o una riproduzione di un run GPQA o AIME — che metterà alla prova l'affermazione di parità su cui si basa l'intera scommessa commerciale. Secondo, se l'identità Preview scomparirà del tutto dall'ecosistema dei modelli, come già lascia intendere la pagina dei modelli di Inception stessa. Terzo, cosa succederà allo sconto di lancio dell'80% ora che è passata la scadenza dell'8 settembre a cui la Preview era ancorata: un'estensione renderebbe Mercury 2.5 strutturalmente conveniente, mentre un ritorno a $0,20 / $0,75 lo renderebbe semplicemente competitivo. Fino ad allora, la risposta corretta a "Mercury 2.5 o Mercury 2.5 Preview?" è che si tratta di un unico modello, e dovreste chiamare quello che è ancora un prodotto.
