Una scheda hero con il titolo 'Mercury 2.5 Preview vs Gemini 3.1 Pro' e il sottotitolo 'Due anteprime, a sei mesi di distanza'. Il pannello di sinistra, etichettato 'Mercury 2.5 Preview', mostra un fulmine, una pill 'contesto 256K', un tag 'solo testo' e una pill '$0.04 di lancio'; il pannello di destra, etichettato 'Gemini 3.1 Pro', mostra un set di glifi multimodali (immagine, audio, video), una pill 'contesto 1M', un badge 'AA Index 57 al lancio' e una pill '$2.00 / $12.00'. Un sottile badge 'vs' si trova tra i due. Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Mercury 2.5 Preview vs Gemini 3.1 Pro: due anteprime, a sei mesi di distanza

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Entrambi i modelli in questo confronto portano la parola "preview" nei loro nomi, e qui finiscono le somiglianze. Mercury 2.5 Preview e Gemini 3.1 Pro sono entrambi modelli di ragionamento che puoi richiamare da un'API oggi, ma sono anteprime in fasi opposte del loro ciclo di vita. Gemini 3.1 Pro, il modello di ragionamento di punta, è disponibile in anteprima dal 19 febbraio 2026 — con sei mesi di valutazioni indipendenti, posizionamenti in classifiche pubbliche e traffico di produzione alle spalle, un Artificial Analysis Intelligence Index di 57 al lancio, input multimodali su testo, immagine, audio e video, un contesto di 1 milione di token, e un prezzo di $2,00 / $12,00 per milione di token. Mercury 2.5 Preview, il LLM a diffusione di Inception rilasciato il 31 agosto 2026, ha due giorni: un modello solo testo con un contesto di 256K, una velocità dichiarata di 1.107 token al secondo, un prezzo di listino di $0,20 / $0,75 (circa $0,04 / $0,15 con uno sconto fino all'8 settembre), e nemmeno un benchmark indipendente. Chiamarli entrambi "preview" nasconde la vera domanda, ovvero quanto valga un vantaggio iniziale di sei mesi di evidenze rispetto a un modo fondamentalmente più veloce di generare testo.

Cosa è realmente ciascun modello

Gemini 3.1 Pro è un modello di punta proprietario, multimodale e di ragionamento generale. Legge testo, immagini, audio e video, gestisce una finestra di contesto da 1M di token con un tetto di output di 64K e adatta dinamicamente la profondità del proprio ragionamento — il fornitore descrive un'intensità di ragionamento su quattro livelli che aumenta con la complessità del compito. I suoi numeri di lancio — ARC-AGI-2 al 77,1%, GPQA Diamond al 94,3%, SWE-bench Verified all'80,6%, Terminal-Bench 2.0 al 68,5% — sono dichiarati dal fornitore, ma poggiano su sei mesi di scrutinio indipendente, inclusa una rimisurazione di Artificial Analysis su una scala dell'indice più rigorosa, dove il modello si attesta intorno a 46,5. Questa rimisurazione è esattamente ciò che un modello maturo si guadagna: è stato testato così a fondo che l'indice si è fatto più severo intorno a esso. Mercury 2.5 Preview è un modello a diffusione — genera e rifinisce i token in parallelo invece che uno alla volta — con ragionamento regolabile, chiamate a strumenti parallele e JSON allineato allo schema, costruito per i carichi di lavoro a latenza cumulativa che Inception cita: agenti di ricerca, pipeline vocali, subagenti di codifica. Ogni affermazione qualitativa che lo accompagna, incluso un balzo di oltre 10 punti rispetto a Mercury 2, proviene dal fornitore, e nessuna terza parte l'ha misurata.

A screenshot of the Artificial Analysis model page for Inception's Mercury 2, the diffusion model Mercury 2.5 Preview builds on, showing its independently measured output speed of 684 tokens per second, its $0.25 / $0.75 per-1M pricing, its 128K context window, and its Intelligence Index score of 22.

Il contrasto delle specifiche

Prezzo — Mercury 2.5 Preview: $0.20 / $0.75 per 1M in/out, ~$0.04 / $0.15 prezzo introduttivo fino all'8 set. Gemini 3.1 Pro: $2.00 / $12.00 per 1M, che passano a $4.00 / $18.00 oltre 200K di input.

Contesto / output — Mercury 2.5 Preview: contesto da 256K. Gemini 3.1 Pro: contesto da 1M, output massimo di 64K.

Input — Mercury 2.5 Preview: solo testo. Gemini 3.1 Pro: testo, immagine, audio, video, file.

Architettura — Mercury 2.5 Preview: LLM a diffusione, generazione parallela di token. Gemini 3.1 Pro: autoregressivo, profondità di ragionamento dinamica.

Velocità — Mercury 2.5 Preview: 1.107 token/sec dichiarati. Gemini 3.1 Pro: nessuna dichiarazione di punta paragonabile.

Evidenze — Mercury 2.5 Preview: solo dati dichiarati dal fornitore. Gemini 3.1 Pro: AA Index 57 al lancio (46.5 nella scala più recente), oltre a un lungo storico di valutazioni indipendenti.

A two-column scoreboard titled 'Mercury 2.5 Preview vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mercury 2.5 Preview': 'Price: $0.20 / $0.75 (intro $0.04 / $0.15)', 'Inputs: text only', 'Context: 256K', 'Speed: 1,107 tok/s (claimed)', 'Independent score: none yet', 'Preview since: Aug 31, 2026'. Right column 'Gemini 3.1 Pro': 'Price: $2.00 / $12.00', 'Inputs: text, image, audio, video', 'Context: 1M', 'Speed: autoregressive', 'Independent score: AA Index 57 at launch', 'Preview since: Feb 19, 2026'. A footer reads 'Gemini index per Artificial Analysis; Mercury figures vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.

Il divario di multimodalità è la differenza decisiva.

Per la maggior parte delle applicazioni, questo confronto si risolve prima ancora che entrino in gioco prezzi o benchmark, perché Mercury 2.5 Preview non può vedere. Gemini 3.1 Pro legge screenshot, diagrammi, audio e video: è il modello a cui punti un PDF, un grafico, la registrazione di una riunione o un'interfaccia utente quando vuoi una risposta su qualcosa che non è già testo. Mercury 2.5 Preview è solo testo per progettazione; un modello linguistico a diffusione che genera testo in parallelo non ha alcun percorso di input per immagini o audio. Per un'applicazione incentrata sui documenti, un agente visivo o qualsiasi prodotto multimodale, Gemini 3.1 Pro è l'unico candidato in questo scenario, punto e basta. Il vincolo di solo testo di Mercury 2.5 Preview non è una clausola in piccolo: è il confine che stabilisce per quali carichi di lavoro il modello sia persino idoneo.

Sei mesi di test contro due giorni

{{1}}Sulla base delle prove, questa non è una gara, ed è importante dire chiaramente perché.{{/1}} Gemini 3.1 Pro è stato passato al setaccio da laboratori indipendenti per sei mesi; il suo punteggio è stato determinato, rimisurato e dibattuto, ed è questo l'aspetto di un modello “affidabile”. {{2}}Mercury 2.5 Preview ha un'unica fonte di informazioni — il suo creatore — e tale fonte dichiara un balzo di oltre 10 punti in termini di intelligenza rispetto a Mercury 2 e la parità con il livello ottimizzato in termini di costi dei modelli di frontiera.{{/2}} Entrambe le affermazioni potrebbero essere vere. Nessuna delle due è stata confermata da alcuno al di fuori di Inception, e il modello è troppo nuovo perché ci si possa aspettare altro. {{3}}L'asimmetria non è che uno sia migliore; è che uno è conoscibile e l'altro non ancora.{{/3}}

Dove la velocità di Mercury vince davvero

The honest case for Mercury 2.5 Preview è ristretto, solo testo, e reale. La generazione parallela di token cambia la matematica della latenza in un modo che nessun modello autoregressivo — incluso Gemini 3.1 Pro — può seguire, perché un modello autoregressivo è seriale per costruzione. Per una pipeline vocale, l'ironia è che input e output sono audio ma il pensiero tra i due è testo: un livello di ragionamento testuale veloce è esattamente ciò che rende reattivo un agente vocale. Per un agente di ricerca che effettua chiamate a strumenti ripetute, e per un subagente di codifica che lancia molte piccole completazioni per attività, la latenza per chiamata si accumula in velocità percepita. Al prezzo di lancio — $0,04 in ingresso, $0,15 in uscita — Mercury 2.5 Preview costa circa 80 volte meno della tariffa di output standard di Gemini 3.1 Pro, il che lo rende non solo più veloce, ma una categoria di costo diversa per il ragionamento testuale ad alto volume. Il limite che deve accompagnare ognuna di queste frasi: la velocità è dichiarata, la parità di qualità è dichiarata, e non esiste alcuna misurazione indipendente.

Prezzi: il premium per contesto lungo di Gemini contro il teaser di Mercury

Il listino prezzi di Gemini 3.1 Pro ha un dettaglio da conoscere prima di confrontare i numeri principali: le richieste che superano i 200K token di input passano da $2,00/$12,00 a $4,00/$18,00 per milione. Su un modello con contesto da 1M, quel sovrapprezzo per il contesto lungo non è un caso limite — è il prezzo per usare davvero la finestra per cui il modello è famoso. Mercury 2.5 Preview non ha un simile scatto, e il suo contesto da 256K è improbabile che rientri spesso nel territorio del contesto lungo. Ma il prezzo basso di Mercury è un'esca con scadenza l'8 settembre, mentre quello di Gemini è una tariffa stabile e pubblicata. Quando confronti, confronta il prezzo di listino di Mercury di $0,20/$0,75 con il livello standard di Gemini, non con la cifra scontata: lo sconto è l'incentivo per provare, non il prezzo su cui pianificare.

La decisione di routing

Entrambi i modelli sono oggi instradabili, e questo cambia il modo in cui trattare ciascuno dei due. Gemini 3.1 Pro è su OrcaRouter come google/gemini-3.1-pro-preview, al prezzo di listino del fornitore, in pass-through con ricarico 0%, quindi i tier standard e long-context costano esattamente quanto pubblicato dal fornitore, come gli altri 200+ modelli raggiungibili con un’unica chiave API. Un badge preview è esattamente il tipo di elemento da aggirare con il routing, non qualcosa su cui scommettere: il pannello del tasso di errore nella pagina del modello non è lì per caso, e il failover automatico fa sì che una risposta preview degradata venga instradata verso un secondo fornitore senza modifiche al codice. Mercury 2.5 Preview non è ancora su OrcaRouter; Inception lo serve tramite la propria API e diverse piattaforme di terze parti. Un modello uscito da due giorni, che non puoi ancora proteggere con il failover, è un candidato per i test, non una dipendenza di produzione. Il giorno in cui un fornitore lo inserisce a listino, si applica lo stesso pass-through e lo sconto di lancio arriva qui lo stesso giorno: è in quel momento che questo confronto diventa una regola di routing invece di una decisione.

Il verdetto onesto è che queste due anteprime rispondono a domande diverse. Gemini 3.1 Pro risponde a "su quale modello dovrei costruire il mio prodotto oggi" — è multimodale, a contesto lungo, testato in modo indipendente e stabile, a un prezzo che riflette tutto questo. Mercury 2.5 Preview risponde a "quanto veloce può essere fisicamente il ragionamento testuale" — e la sua architettura di velocità è la cosa più interessante del modello, in attesa che un laboratorio indipendente confermi se la qualità che ne deriva sia reale. Se il tuo carico di lavoro è multimodale o a contesto lungo, la scelta è già fatta. Se invece il tuo carico di lavoro è solo testo, con una latenza che si accumula, ed è sensibile al prezzo, Mercury 2.5 Preview è la scommessa da tenere d'occhio — e l'8 settembre è la data con cui confrontarla.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview) showing the model header, the Home > Models > Google breadcrumb, the February 19, 2026 preview start date, and the description of Google's frontier reasoning model.
© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube