Una card hero per 'Mercury 2.5 Preview vs Grok 4.6' con il sottotitolo 'Può una Preview da 1.107 token/s battere il campione del rapporto qualità-prezzo?', che mostra un chip a forma di fulmine etichettato '1,107 tok/s', un chip a forma di bilancia etichettato 'PREZZO vs VELOCITÀ', un chip a forma di trofeo etichettato 'AA #3' e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Mercury 2.5 Preview vs Grok 4.6: può una preview da 1.107 token/s battere il campione del valore?

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Ecco la risposta in una frase: Mercury 2.5 Preview è il modello di ragionamento credibile più economico oggi in produzione a $0,04 / $0,15 per milione di token, e Grok 4.6 è il modello più economico alla frontiera dell'intelligenza a $2,00 / $6,00 — quindi la questione pratica tra i due è se un modello di diffusione in anteprima che Inception dichiara solo "paragonabile a" GPT-5.6 Luna (Low) e Claude Haiku 4.5 possa svolgere i lavori per cui altrimenti pagheresti il livello di frontiera. Mercury 2.5 Preview, rilasciato il 31 agosto 2026, genera token in parallelo e dichiara 1.107 token al secondo su GPU standard; Grok 4.6, il modello di punta della frontiera rilasciato il 12 agosto 2026, ottiene 61 sull'Artificial Analysis Intelligence Index, a pari merito al 3° posto globale, e lo fa a un prezzo che la frontiera non ha mai visto prima. Questo scontro — la massima velocità dichiarata in fondo alla curva dei prezzi che incontra il miglior valore in cima — è ciò di cui parla questo articolo.

Punti chiave

• Grok 4.6 a $2,00 / $6,00 con un AA Intelligence Index di 61 è il campione del rapporto qualità-prezzo del livello frontier; Mercury 2.5 Preview a $0,04 / $0,15 è una scommessa che una qualità abbastanza buona a 1/50 del prezzo batta la qualità frontier che raramente ti serve.

• Le affermazioni su velocità e qualità della Mercury 2.5 Preview sono attribuibili esclusivamente a Inception; il giorno del lancio non esisteva alcun punteggio benchmark indipendente.

• Lo sconto di lancio dell'80% su Mercury 2.5 Preview scade l'8 settembre 2026; dopo tale data il suo prezzo di listino sarà $0,20 / $0,75 — comunque 10 volte più economico di Grok 4.6 per l'input, ma una storia di minor rilievo.

• Grok 4.6 è instradato su OrcaRouter oggi al prezzo di listino; Mercury 2.5 Preview non è ancora instradato e viene servito tramite l'API proprietaria di Inception e diverse piattaforme di terze parti.

Il tabellone

A two-column scoreboard titled 'Mercury 2.5 Preview vs Grok 4.6 — the scoreboard': left column Mercury 2.5 Preview — Intelligence claimed cheap-tier parity, Price $0.04/$0.15 (80% off), Speed 1,107 tok/s (claimed), Context 260K, Agentic no public scores, Weights closed; right column Grok 4.6 — Intelligence AA Index 61 (#3), Price $2.00/$6.00, Speed not a headline spec, Context 500K, Agentic APEX-Agents 57.5, Weights closed; footer 'Mercury figures vendor-reported, unreproduced; Grok per xAI and Artificial Analysis'.

Intelligenza — Mercury 2.5 Preview: nessun indice indipendente; Inception dichiara la parità con il livello ottimizzato per i costi. Grok 4.6: AA Intelligence Index 61, a pari merito per il #3 a livello globale (secondo Artificial Analysis; i dati del laboratorio sono dichiarati dal fornitore).

Prezzo — Mercury 2.5 Preview: $0,04 / $0,15 per 1M (80% di sconto rispetto a $0,20 / $0,75, fino all'8 settembre 2026). Grok 4.6: $2,00 / $6,00 per 1M, con tariffa che raddoppia a $4,00 / $12,00 per prompt con almeno 200K token.

Velocità — Mercury 2.5 Preview: 1.107 token/sec dichiarati, riportati dal fornitore. Grok 4.6: la velocità non è una specifica di punta; il modello è progettato per lunghe esecuzioni agentiche, non per uno streaming veloce.

Contesto — Mercury 2.5 Preview: 260K. Grok 4.6: 500K.

Lavoro agentico — Mercury 2.5 Preview: nessun punteggio pubblico, sebbene le chiamate parallele agli strumenti siano supportate. Grok 4.6: APEX-Agents 57.5, DeepSWE v1.1 65.9, CursorBench v3.2 69.9 (riportati dal fornitore, in gran parte non riprodotti).

Pesi — Mercury 2.5 Preview: chiusi, proprietari. Grok 4.6: chiusi, proprietari.

Il campione del valore e il salto di prezzo.

La posizione di Grok 4.6 è insolita. Occupa il terzo posto per intelligenza nell'indice Artificial Analysis — a pari merito con GPT-5.6 Sol Max — pur essendo più economico di ogni modello entro dieci punti da esso; inoltre, la copertura del lancio ha evidenziato lunghe esecuzioni agentiche concluse in media a circa $0.84 per attività in una valutazione gestita da un fornitore. Questa è la definizione di campione del rapporto qualità-prezzo: capacità quasi di frontiera a un prezzo che rende i costi per attività visibili in un foglio di calcolo. Mercury 2.5 Preview non cerca di essere questo. Inception lo posiziona contro modelli come GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite e Claude Haiku 4.5 — il livello ottimizzato per i costi, non la frontiera. Se Inception ha ragione, Mercury 2.5 Preview è un livello sotto Grok 4.6 in capacità e diversi livelli sotto in prezzo, il che è un prodotto perfettamente coerente: un risparmio di prezzo per carichi di lavoro dove il livello di frontiera è uno spreco.

Cosa cambia realmente la decodifica parallela

L'architettura è la parte che vale la pena comprendere, perché cambia il significato di "veloce". I modelli autoregressivi emettono un token per passaggio, quindi il throughput è limitato dalla latenza sequenziale; un LLM a diffusione come Mercury 2.5 Preview genera un blocco di token in parallelo e li raffina attraverso passaggi di denoising, disaccoppiando così il throughput dal numero di token prodotti. Ecco perché Inception può dichiarare 1.107 token/sec su GPU standard — niente acceleratori speciali, niente trucchi di batching — e perché la vera affermazione di prodotto è un time-to-first-token inferiore a 300 millisecondi per carichi di lavoro interattivi. Per un agente vocale, una pipeline di ricerca o un sotto-agente di codifica che chiama il modello a ogni turno, quella differenza di latenza è il prodotto: è la differenza tra un loop vocale che sembra vivo e uno che fa pause. Il problema è che i modelli linguistici a diffusione sono un'area di ricerca giovane, il dato di 1.107 è di Inception, e nessun laboratorio indipendente ha riprodotto la velocità o misurato l'eventuale deriva qualitativa che la generazione parallela introduce su prompt lunghi o avversariali.

Dove Grok 4.6 fa ancora un ottimo lavoro

Niente di Mercury 2.5 Preview tocca le parti del mercato in cui Grok 4.6 sta effettivamente vincendo. I guadagni di Grok rispetto a Grok 4.5 si sono concentrati su benchmark agentici e di coding — DeepSWE in su di 11,9 punti, APEX-Agents in su di 10,4, Terminal-Bench in su di 10,3 — e la sua finestra di contesto da 500K esiste per agenti a lungo orizzonte che devono mantenere l'intero compito nel contesto. Mercury 2.5 Preview offre chiamate di strumenti parallele, ma un modello senza punteggi agentici indipendenti, un limite di output di 65.536 token e un contesto da 260K non è lo strumento per un'esecuzione di ingegneria del software in 50 passaggi. I due modelli si sovrappongono a malapena nell'uso: Grok 4.6 è il motore per il lavoro che deve effettivamente arrivare a compimento; Mercury 2.5 Preview è il motore per il lavoro che deve sembrare istantaneo e costare quasi nulla per chiamata.

La finestra di sconto dell'80%

Questo prezzo ha una data di scadenza e ciò cambia la decisione. Per Mercury 2.5 Preview, la tariffa di $0.04 / $0.15 è uno sconto dell'80% sul prezzo di listino di $0.20 / $0.75, e Inception ha detto che la promo è valida fino all'8 settembre 2026. La tariffa di $2.00 / $6.00 di Grok 4.6 è un prezzo di listino stabile con una struttura chiara — input in cache a $0.50, un livello prioritario a 2× e uno scatto per i prompt lunghi oltre 200K token che addebita l'intera richiesta alla tariffa più alta. Se confronti i numeri di oggi, Mercury risulta 50× più economico in input e 40× in output; se lo sconto scade come previsto, il divario reale a lungo termine è di 10× in input e 5× in output. Nessuna delle due prospettive è disonesta — sono solo orizzonti temporali diversi, e una pipeline basata sullo sconto senza un punto di rivalutazione è una pipeline che verrà colta di sorpresa il 9 settembre. La tariffa di $2.00 / $6.00 di Grok 4.6 è esattamente ciò che paghi su OrcaRouter, dove il prezzo di listino del provider viene trasferito con un markup dello 0% — quando il provider cambia un numero, la modifica è attiva sulla stessa chiave lo stesso giorno, con failover automatico se uno dei percorsi del provider impone limiti di frequenza.

Il verdetto in una riga

Se il lavoro deve essere portato a termine e vuoi capacità di frontiera al miglior prezzo della categoria, acquista Grok 4.6 — è un campione di valore comprovato, disponibile su OrcaRouter a $2.00 / $6.00 oggi. Se il lavoro è ragionamento testuale ad alto volume e sensibile alla latenza, dove risposte sufficientemente buone sono economiche da verificare, Mercury 2.5 Preview a $0.04 / $0.15 è un gradino di prezzo più basso che vale la pena testare all'interno della finestra di sconto — ricorda solo che ogni affermazione dalla sua parte del tabellone è di Inception, e la prova è ancora in sospeso.

A screenshot of the Inception documentation page 'Models, Endpoints, and Pricing' (captured September 1, 2026), showing the Mercury family pricing table — Mercury 2 and Mercury Edit 2 both at $0.25 input / $0.025 cached / $0.75 output per 1M tokens — and a cURL chat-completions API example.A screenshot of the OrcaRouter model page for Grok 4.6 (grok/grok-4.6), showing the model header, the '$2.00' price badge, and the model description noting the August 12, 2026 release.

OrcaRouter inoltra i prezzi di listino dei provider con un markup dello 0% e failover automatico, quindi una modifica del prezzo del fornitore è attiva sulla stessa chiave lo stesso giorno.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube