
Gemini 3.7 Flash vs Grok 4.6: la guerra dei prezzi di Google contro l'agente di auto-verifica di SpaceXAI
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0259Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0258Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0166Intelligenza82Codice
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
Tre settimane dopo il sostanziale flop di Gemini 3.6 Flash, Google ha dimezzato il prezzo e ha lanciato Gemini 3.7 Flash — una mossa che la maggior parte delle testate ha letto come un attacco diretto a Grok 4.6, il modello di punta ottimizzato per agenti che SpaceXAI aveva lanciato il giorno prima a $2 e $6. Il tempismo è la notizia: due modelli vicini alla frontiera, a un giorno di distanza, entrambi rivolti allo stesso acquirente — un team che vuole codifica agentica senza pagare prezzi di frontiera — e con prezzi basati su filosofie opposte. Google sta comprando la risposta con una promozione di cinque mesi. SpaceXAI sta vendendo fiducia per task a un prezzo di listino fisso.
Grok 4.6, rilasciato il 12 agosto 2026, è l'affinamento di SpaceXAI della sua base Grok 4.5 da 1,5 trilioni di parametri, progettato per agenti di lunga durata che verificano il completamento dei propri sottocompiti, con una finestra di contesto di 500K, input di testo e immagini, e una tariffa di $2/$6 che raddoppia oltre i 200K token di input. Gemini 3.7 Flash, rilasciato il 13 agosto 2026, è l'affinamento algoritmico di Google di Gemini 3.6 Flash — contesto da 1M, input multimodale inclusi video e audio, e una tariffa promozionale di $0.75/$3.75 che raddoppia a $1.50/$7.50 il 1° gennaio 2027. Nell'indipendente Artificial Analysis Intelligence Index, Grok 4.6 si attesta a 61, un netto passo avanti rispetto alle prime rilevazioni di circa 56 per Gemini 3.7 Flash.
La guerra dei prezzi, una riga per dimensione
• Prezzo per 1M di input — Gemini 3.7 Flash $0.75 (promo) vs Grok 4.6 $2.00. Google costa oltre il 60% in meno.
• Prezzo per 1M di output — Gemini 3.7 Flash $3,75 (prezzo di lancio) vs Grok 4.6 $6,00.
• Dopo il 1° gennaio 2027 — Gemini raddoppia a $1.50/$7.50, mentre Grok resta invariato a $2/$6.
• Finestra di contesto — Gemini 3.7 Flash 1M vs Grok 4.6 500K.
• Fatturazione per input lunghi — Gemini applica una tariffa fissa su tutta la sua finestra; Grok raddoppia arrivando a $4/$12 con input pari o superiori a 200K.
• Token di ragionamento — Gemini li fattura come output; il costo di Grok è compreso in un importo di ~$0.84 per attività, misurato in modo indipendente.
Il succo in una riga: Gemini 3.7 Flash oggi costa meno su ogni voce del listino, ma gran parte di quel vantaggio svanisce il 1° gennaio. Grok 4.6 costa ad agosto quanto costerà a marzo.

Dove sono finiti i soldi di Gemini 3.7 Flash
Le cifre stesse di {{1}}Google{{/1}} riportano salti notevoli per Gemini 3.7 Flash rispetto a 3.6 Flash: 65,3% su DeepSWE v1.1 (in aumento dal 49,0%), 43,6% su FrontierCode 1.1 Main (in aumento dal 34,4%), 85,8% su Terminal-bench 2.1 (in aumento dal 78,0%) e un Elo WebDev Arena di 1588 (in aumento da 1538). Sono numeri dichiarati dal fornitore e non riprodotti — il tipo di dato che misura una traiettoria, non un verdetto tra fornitori. Ma la traiettoria è il punto: le correzioni sono arrivate tre settimane dopo un lancio che i recensori avevano ampiamente bocciato, il che ti dice che {{2}}Google{{/2}} tratta il livello Flash come campo di battaglia, non come ammiraglia.
L'altra cosa che la promozione di Google fa è comprimere la finestra di acquisto. A $0.75/$3.75 il modello è abbastanza economico da essere testato in volume; a $1.50/$7.50 è ancora competitivo ma non è più un'arma della guerra dei prezzi. Qualsiasi team di produzione che lo adotti nella finestra di introduzione dovrebbe rivalutare la propria economia a dicembre, non dando per scontato che il numero si muova con loro.
Dove sono finiti i soldi di Grok 4.6
La proposta di Grok 4.6 è diversa: non token più economici, ma meno token sprecati. È stato addestrato a verificarsi da solo — a controllare che una sottoattività sia effettivamente completata prima di passare oltre — e una misurazione indipendente conferma l'effetto: Artificial Analysis stima il suo costo a circa $0,84 per attività, con un GDPVal-AA v2 di 1.753 e un Intelligence Index di 61. Queste sono cifre di terze parti e sono il dato più forte in questo confronto, perché catturano ciò che il prezzo per token non coglie: un modello che impiega meno passaggi per completare un lavoro è più conveniente per lavoro completato anche a un prezzo per token più alto.
Il compromesso è proprio dove il modello più economico ha margine di miglioramento. Il contesto da 500K di Grok 4.6 è la metà di quello da 1M di Gemini 3.7 Flash, e la sua tariffa di $2/$6 raddoppia oltre i 200K di input — quindi i carichi di lavoro con contesto lungo e input elevato sono esattamente il punto in cui il prezzo di listino di Grok 4.6 smette di essere competitivo con la tariffa promozionale di Gemini.
L'economia per attività
Al prezzo di lancio, la tariffa mista di Gemini 3.7 Flash con una ripartizione 80/20 input/output è di circa $1,35 per milione di token; quella di Grok 4.6 allo stesso rapporto è di $2,80 per milione prima della penalità per input lunghi. Su carta il modello Google sembra il vincitore in termini di volume, e di larga misura. La complicazione è che i token di pensiero di Gemini vengono fatturati come output, le sue affermazioni sui benchmark risalgono a una settimana fa, e la sua efficienza per attività non è ancora stata misurata in modo indipendente — mentre quella di Grok 4.6 sì. Token economici più passaggi sprecati possono costare più di token costosi che portano a termine il compito, e in questo confronto una delle due parti ha dati su questa questione e l'altra no.
Scommettere sul nuovo modello senza scommettere sulla pipeline
Grok 4.6 è su OrcaRouter al prezzo di listino di $2/$6 di SpaceXAI con ricarico 0%, incluso lo scaglione 2x oltre 200K, che la pagina del modello recupera in tempo reale dallo strato di routing. Gemini 3.7 Flash ha un giorno di vita ed è sull'API di Google stessa; il suo predecessore Gemini 3.6 Flash è su OrcaRouter al prezzo di listino di Google.


Se la domanda che questo confronto sta davvero ponendo è "dovrei scommettere la mia pipeline di agenti sul nuovo modello economico", il livello di routing è la copertura: una regola di failover che fa girare l'agente su Grok 4.6 oggi e passa a Gemini 3.7 Flash il giorno in cui arriva, oppure un pannello di fusione in cui entrambi rispondono e un giudice li riconcilia — il tipo di configurazione per cui esiste il DSL di routing, e una che non richiede di scegliere da che parte stare prima che le prove siano disponibili.
La lettura onesta
Se vuoi il token più economico oggi e ti fidi dei tempi di consegna di tre settimane, Gemini 3.7 Flash è la scommessa aggressiva: la guerra dei prezzi è reale, i guadagni nei benchmark sono riportati e la finestra di lancio è un vero sconto. Se vuoi un modello la cui efficienza degli agenti è misurata in modo indipendente, il cui prezzo non si muove a gennaio e il cui ciclo di auto-verifica è progettato per lavori di lunga durata, Grok 4.6 è la scelta conservativa, e i dati AA gli danno un vantaggio sul costo per attività completata. Da un lato c'è una vendita con conto alla rovescia; dall'altro un prezzo con uno storico affidabile. Entrambe le opzioni sono difendibili — ed è questo che rende il confronto reale, non una formalità.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
