
Cos'è Gemini 3.5 Flash Cyber? Il modello di caccia alle vulnerabilità a gate di Google, spiegato
- googleNUOVOGoogle: Gemini 3.6 Flash2026-07-2150Intelligenza69Codice
- googleNUOVOGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaNUOVOMeta: Muse Spark 1.12026-07-1651Intelligenza71Codice
- kimiNUOVOMoonshotAI: Kimi K32026-07-1557Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0854Intelligenza72Codice
- tencentTencent: Hy32026-07-0641Intelligenza59Codice
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenza42Codice
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenza39Codice
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligenza72Codice
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenza52Codice57Matematica
- z-aiZ.ai: GLM 5.22026-06-1651Intelligenza69Codice60Matematica
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligenza61Codice61Matematica
- anthropicAnthropic: Claude Fable 52026-06-0960Intelligenza77Codice
- qwenQwen: Qwen3.7 Plus2026-06-0139Intelligenza56Codice59Matematica
- minimaxMiniMax: MiniMax M32026-05-3144Intelligenza59Codice59Matematica
- AnthropicAnthropic: Claude Opus 4.82026-05-2856Intelligenza74Codice68Matematica
- GoogleGemini 3.5 Flash2026-05-2350Intelligenza70Codice51Matematica
Il 21 luglio 2026, Google DeepMind ha annunciato Gemini 3.5 Flash Cyber — il terzo e il più insolito dei tre modelli spediti quel giorno, insieme al modello generico Gemini 3.6 Flash e a Gemini 3.5 Flash-Lite. Non è un modello generico con cui puoi chattare o chiamare tramite API. È uno specialista della sicurezza del codice: un modello ottimizzato a partire da Gemini 3.5 Flash per trovare, convalidare e correggere vulnerabilità software, in esecuzione all'interno dell'agente CodeMender di Google. E fondamentalmente, è ad accesso limitato — disponibile solo per governi e "partner fidati" in un programma pilota ad accesso limitato, senza disponibilità pubblica, senza iscrizione self-service e senza prezzo pubblicato.
Questo lo rende fondamentalmente diverso dai suoi fratelli, che sono generalmente disponibili e hanno un prezzo per token come qualsiasi altro modello su un foglio prezzi. Flash Cyber non ha un foglio prezzi, perché non ha un prodotto pubblico a cui legarlo — vive interamente all'interno di un programma pilota chiuso. Questo approfondimento va oltre il titolo: cosa sia effettivamente Flash Cyber, quali dei suoi numeri di performance sono realmente indipendenti rispetto ai test interni di Google, come funziona realmente l'accesso e la situazione dei prezzi, e a chi — realisticamente — è destinato questo modello.
TL;DR verdetto. Gemini 3.5 Flash Cyber è un modello reale e controllato per la sicurezza del codice che funziona all'interno di CodeMender per trovare e correggere vulnerabilità software. Non è in GA, non ha API pubbliche né prezzi pubblici, ed è limitato a governi e partner fidati. Nell'unico benchmark di terze parti citato (CyberGym) viene riportato a circa l'83,2%, strettamente raggruppato con OpenAI GPT-5.5-Cyber (85,6%) e Anthropic Mythos 5 (83,8%) — il vantaggio di Google è presentato come efficienza dei costi, non come un'eccellenza di capacità. La maggior parte delle altre affermazioni di benchmark, inclusi i dati sul conteggio dei problemi di V8, sono valutazioni interne di Google stesse.
Punti chiave
• È uno specialista della sicurezza del codice, progettato per trovare, convalidare e correggere vulnerabilità software — non uno strumento SOC/threat-intel o di triage malware, e non un chatbot generico.
• È ad accesso limitato, non GA. L'accesso è limitato a governi e partner fidati tramite la piattaforma CodeMender; non esiste un'API pubblica né un prezzo per token pubblicato.
• Ottimizzato da Gemini 3.5 Flash, e distribuito come chiamate multiple parallele di sub-agent per rapporto di vulnerabilità (Google menziona fino a ~5), fusi in un unico risultato. La finestra di contesto non viene resa nota.
• Un benchmark di terze parti.CyberGym ~83.2% (riportato dalla stampa), contro GPT-5.5-Cyber 85.6% e Mythos 5 83.8%. Altri risultati (Big Sleep, Chrome, V8) sono valutazioni interne di Google.
• Doppio uso, deliberatamente. Un modello così bravo a trovare bug sfruttabili è pericoloso se usato in modo improprio, quindi la principale mitigazione di Google è il controllo degli accessi, più l'approvazione umana prima di qualsiasi patch e la validazione in sandbox dei risultati.
• È un modello diverso da Sec-Gemini.Il precedente modello separato di threat intelligence di Google gestisce l'analisi degli incidenti e delle cause profonde; Flash Cyber si occupa strettamente di correggere le vulnerabilità del codice.
• È costruito per difensori, non per sviluppatori. Gli utenti previsti sono team di sicurezza in prima linea, governi e partner aziendali verificati che conducono ricerche sulle vulnerabilità su larga scala — esplicitamente non consumatori o sviluppatori di app generici.
La maggior parte dei dati sulle prestazioni qui riportati provengono da valutazioni interne di Google; solo CyberGym è un benchmark genuinamente di terze parti, e persino il dato specifico dell'83,2% è meglio attribuibile all'analisi della stampa che al testo verbatim di Google — citarlo come “riportato”. Non descrivere Flash Cyber come generalmente disponibile né citare un prezzo per token; è soggetto a restrizione e senza prezzo. Non confonderlo con Sec-Gemini, il modello separato di threat intelligence di Google del 2025.
Cos'è Gemini 3.5 Flash Cyber
“Cyber” qui indica la sicurezza di codice e software — in particolare trovare, confermare e correggere vulnerabilità nel codice sorgente. Non è un analista di sicurezza operativa, un assistente di threat intelligence o un classificatore di malware, e non risponde a domande generali come farebbe un modello chat. Funziona all'interno di CodeMender, l'agente AI di Google DeepMind per la correzione automatica della sicurezza del codice (presentato per la prima volta nell'ottobre 2025), anziché essere venduto come prodotto chat o API autonomo. Questa inquadratura è importante: Flash Cyber non è un modello che si punta su un codice da soli, ma un componente all'interno di un pipeline più ampio e strettamente controllato che Google gestisce per conto dei suoi partner pilota.
In pratica, diversi sub-agenti di Flash Cyber operano in parallelo su un codebase — Google menziona fino a circa cinque per rapporto di vulnerabilità — e i loro risultati individuali vengono unificati in un unico rapporto consolidato. Si tratta di un'architettura agentica e multi-chiamata, non di uno scambio chatbot monofase, ed è in gran parte per questo che Google la presenta come competitiva rispetto a modelli molto più grandi: il vantaggio deriva dal modo in cui è orchestrata, non necessariamente dalle dimensioni del modello grezzo. Prima che qualsiasi correzione venga rilasciata, un essere umano la approva e la vulnerabilità sottostante viene validata in un ambiente sandbox — il modello propone e trova, ma sono le persone e l'infrastruttura a decidere cosa viene effettivamente distribuito.
È ottimizzato a partire da Gemini 3.5 Flash. Google non ha divulgato una dimensione della finestra di contesto né capacità multimodali specifiche per Flash Cyber, il che di per sé è un dato significativo: a differenza dei modelli Flash disponibili al pubblico, non esiste una scheda tecnica da consultare. I suoi utenti target sono difensori di prima linea, governi e partner aziendali verificati che conducono ricerche sulle vulnerabilità e triage delle patch su larga scala — esplicitamente non consumatori o sviluppatori generici, e chiaramente non un prodotto che puoi aggiungere al tuo stack semplicemente registrandoti.

Approfondimento sui benchmark: cosa significano i numeri
Esiste esattamente un benchmark di terze parti nei dati, e vale la pena capire cosa testa davvero. CyberGym è un benchmark accademico — creato da un gruppo che include Dawn Song di UC Berkeley — che valuta gli agenti su oltre 1.500 vulnerabilità documentate in 188 progetti open source reali. È un ambiente di test realisticamente significativo: codice reale, bug storici reali, non puzzle sintetici. La copertura stampa colloca Flash Cyber intorno all'83,2% su CyberGym, contro l'85,6% di OpenAI GPT-5.5-Cyber e l'83,8% di Anthropic Mythos 5. Si tratta di un gruppo ristretto a tre, non di un vantaggio schiacciante per nessuno — ed è proprio per questo che la comunicazione di Google punta sull'efficienza dei costi piuttosto che sul punteggio grezzo. Degno di nota, il blog di Google si limita all'affermazione qualitativa di "prestazioni competitive contro modelli significativamente più grandi"; il preciso 83,2% proviene dalle analisi della stampa sull'annuncio, non dal testo letterale di Google o da una classifica pubblica consultabile di persona.
Il risultato V8 è un tipo diverso di numero, ed è interamente una metrica di Google. In un test contro il motore JavaScript V8, Google riporta che Flash Cyber ha trovato 55 problemi confermati unici, rispetto ai 47 della versione standard di Gemini 3.5 Flash e ai 36 di Claude Opus 4.6 — inclusi 10 problemi che nessun altro modello ha individuato. Si tratta di un confronto dall'impatto notevole perché cita un modello rivale specifico e un conteggio preciso, ma è un test interno di Google eseguito sulla propria infrastruttura contro un target scelto da Google stesso. Nessuna parte esterna ha condotto questa valutazione, pubblicato la metodologia per la replica o verificato i conteggi in modo indipendente. È un risultato reale che Google afferma di aver osservato — ma è un'affermazione del fornitore, non una verifica certificata, e la distinzione conta più qui che nella maggior parte dei report di benchmark.
La valutazione “Big Sleep” segue lo stesso schema a una risoluzione ancora più bassa. Testando su codebase complesse e reali come Chrome e Safari, Google afferma che Flash Cyber “ha superato significativamente” le versioni principali Gemini 3.5 Flash e 3.6 Flash — ma si tratta di un’affermazione qualitativa senza numeri precisi, figuriamoci un controllo da parte di terzi sul confronto. Mettendo affianco tutti e tre i risultati emerge uno schema: l’unico numero con provenienza esterna (CyberGym) mostra un gruppo compatto e poco notevole; le due vittorie dal suono più appariscente (V8, Big Sleep) sono entrambe casi in cui Google valuta il proprio modello rispetto ai propri benchmark scelti.
Questo modello non è esclusivo di Google, ma qui è più difficile da correggere del solito, perché Flash Cyber è ad accesso limitato. Con un modello aperto o addirittura accessibile tramite API, i ricercatori indipendenti possono eventualmente rieseguire un benchmark e confermare o contestare il numero di un fornitore — è così che di solito vengono scoperte le affermazioni gonfiate. Con Flash Cyber, questo controllo non può in gran parte avvenire: i ricercatori esterni semplicemente non hanno accesso per eseguire il proprio CyberGym pass, la propria V8 sweep, o qualsiasi altro test sul modello reale. Anche il pedigree di terze parti di CyberGym copre solo la progettazione del benchmark, non una riesecuzione indipendente di Flash Cyber contro di esso — il punteggio stesso risale ancora alla divulgazione di Google. Fino a quando l'accesso non si amplierà oltre l'attuale fase pilota, ogni affermazione sulle prestazioni di questo specifico modello — che suoni indipendente o meno — si basa in ultima analisi sulla fiducia nel racconto di Google.

Non confonderlo con Sec-Gemini
Google ha più di un modello di "sicurezza", ed è facile confonderli. Sec-Gemini (annunciato intorno ad aprile 2025) è un modello sperimentale separato e precedente, pensato per flussi di lavoro di threat intelligence — analisi delle cause profonde e degli incidenti, integrato con Google Threat Intelligence e il database OSV. Se il tuo interesse riguarda i casi d'uso SOC/threat-intel, Sec-Gemini — non Flash Cyber — è la linea rilevante. Flash Cyber è strettamente incentrato sulla ricerca e la correzione delle vulnerabilità del codice, e risiede all'interno di CodeMender.
Accesso, prezzi e come ottenere effettivamente la capacità del modello di sicurezza
La storia dell'accesso è semplice, anche se poco utile per la maggior parte dei lettori: non ce n'è uno. Flash Cyber non è in vendita, non ha un prezzo indicato e non è raggiungibile tramite alcuna chiave API che tu possa richiedere. L'unico modo per entrare è essere un'agenzia governativa o un "partner fidato" sottoposto a verifica, ammesso al programma pilota CodeMender — non esiste un'iscrizione fai-da-te, nessun modulo di lista d'attesa che garantisca l'ingresso e nessun listino prezzi pubblicato, perché non esiste un prodotto pubblico da prezzare. Google ha dichiarato che l'accesso si amplierà nel tempo, ma non ha associato a questa affermazione una tempistica o una data di disponibilità generale, quindi "alla fine" è la risposta più specifica attualmente registrata.
Questo è un netto contrasto con gli stessi fratelli di Flash Cyber. Gemini 3.6 Flash e Gemini 3.5 Flash-Lite, annunciati lo stesso giorno, sono entrambi generalmente disponibili e hanno un prezzo per token come qualsiasi altro modello commerciale. Flash Cyber si colloca in una categoria completamente diversa — più vicino a una capacità interna di Google che per caso è stata resa pubblica che a una linea di prodotti. Il budget non è il vincolo qui; anche un'impresa ben finanziata senza alcuna relazione di ricerca sulla sicurezza con Google non ha accesso a una chiave API di Flash Cyber oggi.
Quindi cosa fanno effettivamente i team se vogliono un aiuto AI per trovare e correggere le vulnerabilità nel proprio codice in questo momento? Per la stragrande maggioranza che non fa parte del pilota, la via pratica è eseguire modelli frontiera di uso generale — il tipo che sono GA e a pagamento — sullo stesso tipo di lavoro: revisione del codice, triage delle vulnerabilità, redazione di patch, con la propria revisione umana e sandboxing intorno a loro. Si tratta di uno strumento sostanzialmente diverso da uno specialista creato appositamente e addestrato specificamente per questo compito, ma è l'opzione accessibile. Aggregatori come OrcaRouter, che si trova dietro oltre 200 modelli su un unico endpoint compatibile con OpenAI, sono il modo in cui la maggior parte dei team assembla oggi quel tipo di flusso di lavoro di sicurezza con modelli generali, piuttosto che aspettare un pilota ad accesso limitato a cui potrebbero non essere mai ammessi.
A chi è rivolto
Difensori verificati all'interno del pilota. Se sei un'agenzia governativa o un'organizzazione che Google ha già riconosciuto come partner di fiducia, Flash Cyber è uno strumento realmente progettato per uno scopo specifico: opera all'interno del flusso di lavoro scopri-verifica-approva-correggi di CodeMender, la sua architettura parallela di sottoagenti è progettata per scansionare codebase reali su larga scala, e i test di Google stesso suggeriscono che sia competitivo – o, secondo alcune metriche interne, superiore – a modelli generali più grandi per questo specifico compito. Per questo ristretto pubblico, la proposta di valore è reale anche se alcuni dei numeri a supporto sono auto-dichiarati.
Tutti gli altri — cioè quasi tutti. Se sei un tipico team di ingegneria, una società di consulenza sulla sicurezza senza una partnership con Google, o un singolo ricercatore, Flash Cyber semplicemente non è un'opzione, indipendentemente da quanto il tuo caso d'uso possa sembrare adatto. Non esiste un processo di candidatura che funzioni con certezza né un prezzo che tu possa pagare per sbloccarlo. Il tuo percorso realistico verso il lavoro di vulnerabilità assistito dall'IA oggi è un modello frontier generalmente disponibile — instradato tramite qualcosa come OrcaRouter se vuoi flessibilità tra più provider — combinato con la tua disciplina di revisione, poiché nessuno di quei modelli generali include le barriere di protezione integrate di CodeMender per l'approvazione umana e la validazione in sandbox.
I team che decidono se attendere. Se la tua organizzazione sta esplorando un percorso di partnership con Google specificamente per ottenere l'accesso, vale la pena pianificare tenendo conto che non esiste una data di GA — tratta qualsiasi flusso di lavoro di sicurezza attuale come se dovesse essere eseguito su modelli generalmente disponibili nel frattempo, e riconsidera se e quando il pilota di Google si espanderà. Scommettere una roadmap su un accesso limitato senza una tempistica annunciata è un rischio che la maggior parte dei team non dovrebbe correre.
Domande frequenti
Posso usare Gemini 3.5 Flash Cyber?
No, a meno che tu non sia un governo verificato o un partner fidato. È un progetto pilota ad accesso limitato all'interno di CodeMender, senza API pubblica, senza accesso self-service e senza prezzi pubblicati. Google dice che l'accesso si espanderà nel tempo ma non ha fornito una data di GA.
Cosa fa effettivamente?
Trova, convalida e corregge le vulnerabilità software nel codice sorgente, operando come sotto-agenti paralleli i cui risultati vengono unificati in un rapporto. Un umano approva qualsiasi correzione e le vulnerabilità vengono convalidate in una sandbox prima di essere segnalate.
Come si confronta con i modelli cyber di OpenAI e Anthropic?
Sull'unico benchmark condiviso di terze parti (CyberGym), i tre sono molto vicini: Flash Cyber ~83,2%, Anthropic Mythos 5 83,8%, OpenAI GPT-5.5-Cyber 85,6%. Google posiziona il suo vantaggio sull'efficienza dei costi piuttosto che sul punteggio grezzo più alto. Tutti e tre sono riservati a organizzazioni verificate.
Quali sono le sue specifiche?
È stato ottimizzato da Gemini 3.5 Flash. Google non ha pubblicato la finestra di contesto, la multimodalità o il conteggio dei parametri specificamente per Flash Cyber.
È pericoloso / a duplice uso?
Google riconosce il rischio del doppio uso — un modello bravo a trovare bug sfruttabili potrebbe essere utilizzato in modo offensivo — e cita il controllo degli accessi come sua principale mitigazione, insieme all'approvazione umana delle patch e alla validazione in ambiente sandbox dei risultati.
Il punteggio CyberGym è verificato in modo indipendente?
CyberGym stesso è un autentico benchmark accademico di terze parti. Tuttavia, il valore specifico dell'83,2% attribuito a Flash Cyber proviene da resoconti stampa sull'annuncio di Google, non dal testo verbatim di Google stesso o da una voce pubblica di una classifica in tempo reale. Inoltre, poiché il modello è sottoposto a restrizioni di accesso, nessun soggetto esterno può attualmente rieseguirlo autonomamente. Considera il numero come riportato, non come confermato in modo indipendente.
Quando sarà generalmente disponibile Flash Cyber?
Google non lo ha detto. Ha dichiarato che l'accesso si espanderà nel tempo oltre l'attuale fase pilota con governi e partner fidati, ma non è stata pubblicata alcuna data di GA né una tempistica, quindi non c'è ancora nulla di concreto su cui basarsi per pianificare.
Il risultato finale
Gemini 3.5 Flash Cyber è uno strumento ristretto e serio: un modello per la sicurezza del codice che caccia e corregge vulnerabilità all'interno di CodeMender, riservato a governi e partner fidati. È genuinamente capace nell'unico benchmark indipendente disponibile, ma si colloca in un gruppo ristretto insieme ai modelli cyber di OpenAI e Anthropic, senza distaccarsi, e quasi tutti i suoi numeri di spicco sono valutazioni interne di Google. Se non sei un partner certificato, non puoi usarlo – e per lavori generali affini alla sicurezza sul tuo codice, i modelli di frontiera accessibili rimangono la strada pratica. I confronti qui sotto lo allineano ai suoi due veri rivali.

