Czym jest Gemini 3.5 Flash Cyber? Model Google'a do poszukiwania luk w zabezpieczeniach z bramowaniem – wyjaśnienie
Guides & Insights

Czym jest Gemini 3.5 Flash Cyber? Model Google'a do poszukiwania luk w zabezpieczeniach z bramowaniem – wyjaśnienie

Autor

jinhao song

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

21 lipca 2026 roku Google DeepMind ogłosiło Gemini 3.5 Flash Cyber — trzeci i najbardziej nietypowy z trzech modeli, które tego dnia wypuściło, obok ogólnego przeznaczenia Gemini 3.6 Flash i Gemini 3.5 Flash-Lite. Nie jest to ogólny model, z którym można rozmawiać ani wywoływać przez API. Jest to specjalista od bezpieczeństwa kodu: model dostrojony z Gemini 3.5 Flash do znajdowania, walidowania i naprawiania luk w oprogramowaniu, działający wewnątrz agenta CodeMender od Google. Co kluczowe, jest on ograniczony — dostępny tylko dla rządów i “zaufanych partnerów” w pilotażu z ograniczonym dostępem, bez publicznej dostępności, bez samodzielnej rejestracji i bez opublikowanej ceny.

To odróżnia go fundamentalnie od jego rodzeństwa, które są ogólnie dostępne i wyceniane za token, jak każdy inny model w cenniku. Flash Cyber nie ma cennika, ponieważ nie ma publicznego produktu, do którego można by go dołączyć – istnieje wyłącznie w ramach zamkniętego programu pilotażowego. Ten artykuł wyjaśniający sięga głębiej niż nagłówek: czym tak naprawdę jest Flash Cyber, które z jego wyników wydajności są rzeczywiście niezależne, a które pochodzą z wewnętrznych testów Google, jak faktycznie wygląda kwestia dostępu i ceny, oraz dla kogo – realistycznie – ten model w ogóle jest przeznaczony.

Werdykt w skrócie. Gemini 3.5 Flash Cyber to prawdziwy, ograniczony dostępem model bezpieczeństwa kodu, który działa wewnątrz CodeMender, aby znajdować i naprawiać luki w oprogramowaniu. Nie jest ogólnodostępny (GA), nie ma publicznego API ani ceny, a dostęp jest ograniczony do rządów i zaufanych partnerów. W jednym cytowanym benchmarku strony trzeciej (CyberGym) osiąga około 83.2%, co plasuje go blisko OpenAI GPT-5.5-Cyber (85.6%) i Anthropic Mythos 5 (83.8%) – przewaga Google'a jest przedstawiana jako efektywność kosztowa, a nie przewaga możliwości. Większość innych twierdzeń dotyczących benchmarków, w tym dane o liczbie błędów w V8, pochodzą z wewnętrznych ocen Google'a.

Najważniejsze wnioski

To specjalista ds. bezpieczeństwa kodu, dostosowany do znajdowania, walidowania i łatania luk w oprogramowaniu — nie narzędzie do SOC/analityki zagrożeń ani triażu złośliwego oprogramowania, i nie ogólny chatbot.

•  Jest to system z ograniczonym dostępem, a nie GA. Dostęp jest ograniczony do rządów i zaufanych partnerów za pośrednictwem platformy CodeMender; nie ma publicznego API ani opublikowanej ceny za token.

Dostrojony z Gemini 3.5 Flash, i wdrożony jako wiele równoległych wywołań pod-agentów na raport podatności (Google wspomina o ~5), połączonych w jeden wynik. Okno kontekstu nie jest ujawnione.

•  Jeden zewnętrzny benchmark. CyberGym ~83.2% (wg doniesień prasowych), vs GPT-5.5-Cyber 85.6% i Mythos 5 83.8%. Inne wyniki (Big Sleep, Chrome, V8) to wewnętrzne oceny Google'a.

•  Podwójnego zastosowania, celowo. Model tak dobry w znajdowaniu luk do wykorzystania jest niebezpieczny w przypadku niewłaściwego użycia, więc głównym środkiem zaradczym Google jest kontrola dostępu, plus zatwierdzenie przez człowieka przed każdą łatką i izolowana walidacja wyników.

To inny model niż Sec-Gemini. Wcześniejszy, odrębny model analizy zagrożeń Google'a zajmuje się analizą incydentów i przyczyn źródłowych; Flash Cyber koncentruje się wąsko na łataniu luk w kodzie.

Jest przeznaczona dla obrońców, a nie dla programistów. Docelowymi użytkownikami są zespoły bezpieczeństwa pierwszej linii, rządy oraz zweryfikowani partnerzy korporacyjni prowadzący badania podatności na dużą skalę — wyraźnie nie konsumenci ani ogólni programiści aplikacji.

Większość tutaj podanych danych dotyczących wydajności pochodzi z wewnętrznych ocen Google; tylko CyberGym jest rzeczywistym benchmarkiem strony trzeciej, a nawet konkretna wartość 83,2% jest lepiej umocowana w analizach prasowych niż w dosłownym tekście Google – cytuj to jako „podawane”. Nie opisuj Flash Cyber jako ogólnie dostępnego ani nie podawaj ceny za token; jest ono ograniczone i nie ma ustalonej ceny. Nie myl go z Sec‑Gemini, osobnym modelem wywiadu zagrożeń Google na 2025 rok.

Czym jest Gemini 3.5 Flash Cyber

„Cyber” oznacza tu bezpieczeństwo kodu i oprogramowania – a konkretnie znajdowanie, potwierdzanie i naprawianie luk w kodzie źródłowym. Nie jest to analityk operacji bezpieczeństwa, asystent wywiadu zagrożeń ani klasyfikator złośliwego oprogramowania, i nie odpowiada na ogólne pytania tak jak model czatowy. Działa wewnątrz CodeMender – agenta AI od Google DeepMind do automatycznego łatania bezpieczeństwa kodu (pierwszy raz pokazanego w październiku 2025), a nie jest sprzedawany jako samodzielny czat lub produkt API. To istotne: Flash Cyber nie jest modelem, który samemu kierujesz na bazę kodu – to komponent w większym, ściśle kontrolowanym potoku, który Google prowadzi w imieniu swoich partnerów pilotażowych.

W praktyce kilka sub-agentów Flash Cyber działa równolegle na bazie kodu – Google wspomina nawet o około pięciu na raport podatności – a ich indywidualne wyniki są scalane w jeden, skonsolidowany raport. Jest to architektura agentowa, wielokrotnie wywołująca (multi-call), a nie jednorazowa wymiana z chatbotem, co w dużej mierze tłumaczy, dlaczego Google przedstawia ją jako konkurencyjną wobec znacznie większych modeli: przewaga wynika ze sposobu jej orchestracji, a niekoniecznie z surowego rozmiaru modelu. Zanim jakakolwiek poprawka zostanie wdrożona, zatwierdza ją człowiek, a leżąca u podstaw podatność jest walidowana w sandboxie – model proponuje i znajduje, ale ludzie i infrastruktura decydują, co faktycznie trafia do wdrożenia.

Jest dostrojony z Gemini 3.5 Flash. Google nie ujawniło rozmiaru okna kontekstowego ani możliwości multimodalnych specyficznych dla Flash Cyber, co samo w sobie jest punktem danych: w przeciwieństwie do ogólnie dostępnych modeli Flash, nie ma specyfikacji do sprawdzenia. Jego docelowymi użytkownikami są obrońcy pierwszej linii, rządy i zweryfikowani partnerzy korporacyjni zajmujący się badaniem podatności i triażem poprawek na dużą skalę — wyraźnie nie konsumenci ani ogólni programiści, i wyraźnie nie produkt, który można dodać do własnego stosu technologicznego poprzez rejestrację.

Dogłębna analiza benchmarku: co oznaczają liczby

W rejestrze znajduje się dokładnie jeden benchmark strony trzeciej i warto zrozumieć, co tak naprawdę testuje. CyberGym to benchmark akademicki — stworzony przez zespół, w skład którego wchodzi Dawn Song z Uniwersytetu Kalifornijskiego w Berkeley — który ocenia agentów na podstawie ponad 1500 udokumentowanych podatności w 188 rzeczywistych projektach open source. To realistyczne środowisko testowe: prawdziwy kod, prawdziwe historyczne błędy, a nie syntetyczne zagadki. Relacje prasowe podają, że Flash Cyber osiąga około 83,2% w CyberGym, wobec 85,6% dla OpenAI GPT-5.5-Cyber i 83,8% dla Anthropic Mythos 5. To ciasna trójstronna grupa, a nie miażdżące prowadzenie kogokolwiek — właśnie dlatego przekaz Google kładzie nacisk na opłacalność, a nie surowy wynik. Co istotne, blog Google zawiera jedynie jakościowe stwierdzenie o „konkurencyjnej wydajności w porównaniu ze znacznie większymi modelami”; dokładna wartość 83,2% pochodzi z analizy prasowej ogłoszenia, a nie z dosłownego tekstu Google ani z publicznego rankingu, który można samodzielnie sprawdzić.

Wynik V8 to inny rodzaj liczby i jest to całkowicie własna metryka Google. W teście na silniku JavaScript V8 Google raportuje, że Flash Cyber znalazł 55 unikalnych potwierdzonych problemów, w porównaniu z 47 dla standardowego Gemini 3.5 Flash i 36 dla Claude Opus 4.6 — w tym 10 problemów, których nie wychwycił żaden inny model. To brzmi uderzająco, ponieważ wymienia konkretny konkurencyjny model i konkretną liczbę, ale jest to wewnętrzny test Google przeprowadzony na własnej infrastrukturze Google przeciwko własnemu wybranemu celowi. Żadna zewnętrzna strona nie przeprowadziła tej oceny, nie opublikowała metodologii umożliwiającej replikację ani niezależnie nie zweryfikowała liczb. To rzeczywisty wynik, który Google twierdzi, że zaobserwował — ale to oświadczenie dostawcy, a nie audytowane, i to rozróżnienie ma tutaj większe znaczenie niż w większości raportów porównawczych.

Ocena „Big Sleep” przebiega według tego samego schematu, ale w jeszcze niższej rozdzielczości. Testując na złożonych, rzeczywistych bazach kodu, takich jak Chrome i Safari, Google twierdzi, że Flash Cyber „znacznie przewyższył” główne modele Gemini 3.5 Flash i 3.6 Flash – jest to jednak stwierdzenie jakościowe, bez podania dokładnych liczb, a tym bardziej bez weryfikacji porównania przez stronę trzecią. Zestawiając wszystkie trzy wyniki obok siebie, wyłania się pewien wzór: jedna liczba pochodząca z zewnętrznego źródła (CyberGym) tworzy zwartą, niczym niewyróżniającą się grupę; dwa pozostałe, bardziej efektownie brzmiące zwycięstwa (V8, Big Sleep) to przypadki, w których Google ocenia własny model względem wybranych przez siebie baz odniesienia.

Ten wzór nie jest unikalny dla Google, ale trudniej go tutaj skorygować niż zwykle, ponieważ Flash Cyber jest zamknięty. W przypadku otwartego modelu, a nawet modelu z dostępem API, niezależni badacze mogą ostatecznie ponownie uruchomić benchmark i potwierdzić lub zakwestionować liczbę producenta – w ten sposób zwykle wykrywane są zawyżone twierdzenia. W przypadku Flash Cyber taka kontrola w dużej mierze nie może mieć miejsca: zewnętrzni badacze po prostu nie mają dostępu, aby przeprowadzić własny test CyberGym, własne skanowanie V8 ani żaden inny test na rzeczywistym modelu. Nawet reputacja CyberGym jako strony trzeciej dotyczy tylko projektu benchmarku, a nie niezależnego ponownego uruchomienia Flash Cyber w stosunku do niego – sam wynik wciąż pochodzi z ujawnienia Google. Dopóki dostęp nie zostanie rozszerzony poza obecny pilotaż, każde twierdzenie o wydajności tego konkretnego modelu – czy brzmi niezależnie, czy nie – ostatecznie opiera się na zaufaniu do własnego opisu Google.

Nie myl tego z Sec-Gemini

Google ma więcej niż jeden model „bezpieczeństwa” i łatwo je pomylić. Sec-Gemini (ogłoszony około kwietnia 2025) to odrębny, wcześniejszy model eksperymentalny przeznaczony do przepływów pracy w zakresie analizy zagrożeń – analiza przyczyn źródłowych i incydentów, zintegrowany z Google Threat Intelligence i bazą OSV. Jeśli interesują Cię przypadki użycia SOC/analizy zagrożeń, Sec-Gemini – a nie Flash Cyber – jest odpowiednią linią. Flash Cyber koncentruje się wąsko na znajdowaniu i naprawianiu luk w kodzie i działa w ramach CodeMender.

Dostęp, ceny i jak faktycznie uzyskać funkcjonalność modelu zabezpieczeń

Historia dostępu jest prosta, choć dla większości czytelników mało pomocna: po prostu go nie ma. Flash Cyber nie jest sprzedawany, nie ma podanej ceny i nie jest osiągalny za pomocą żadnego klucza API, który można by poprosić. Jedyną drogą wejścia jest bycie agencją rządową lub zweryfikowanym „zaufanym partnerem” dopuszczonym do pilotażu CodeMender — nie ma samodzielnej rejestracji, formularza listy oczekujących gwarantującego przyjęcie ani opublikowanego cennika, ponieważ nie istnieje publiczny produkt do wyceny. Google powiedział, że dostęp będzie się z czasem rozszerzać, ale nie powiązał z tym oświadczeniem żadnego harmonogramu ani daty GA, więc „kiedyś” to najbardziej konkretna odpowiedź dostępna obecnie w oficjalnych źródłach.

To ostry kontrast z rodzeństwem Flash Cyber. Ogłoszone tego samego dnia Gemini 3.6 Flash oraz Gemini 3.5 Flash-Lite są ogólnie dostępne i wyceniane za token, jak każdy inny komercyjny model. Flash Cyber znajduje się w całkowicie innej kategorii – bliżej wewnętrznej zdolności Google, która akurat została ujawniona publicznie, niż linii produktów. Budżet nie jest tutaj ograniczeniem; nawet dobrze finansowane przedsiębiorstwo bez związku z Google w zakresie badań nad bezpieczeństwem nie ma dziś dostępu do klucza API Flash Cyber.

A więc co właściwie robią zespoły, jeśli chcą teraz pomocy AI w znajdowaniu i naprawianiu luk we własnym kodzie? Dla zdecydowanej większości, która nie znajduje się w pilotażu, praktyczną drogą jest korzystanie z ogólnych modeli granicznych – tych, które są ogólnie dostępne (GA) i wycenione – do tego samego rodzaju pracy: przeglądu kodu, triażu podatności, tworzenia poprawek, z własnym przeglądem i sandboxem wokół nich. To narzędzie zasadniczo różne od specjalisty stworzonego specjalnie do tego zadania, ale jest to opcja dostępna. Agregatory takie jak OrcaRouter, który obsługuje ponad 200 modeli na jednym punkcie końcowym zgodnym z OpenAI, są tym, z czego większość zespołów buduje dziś taki ogólny przepływ pracy z modelami bezpieczeństwa, zamiast czekać na zamknięty pilotaż, do którego mogą nigdy nie zostać dopuszczeni.

Dla kogo to jest

Zweryfikowani obrońcy w pilocie. Jeśli jesteś agencją rządową lub organizacją, którą Google już uznał za zaufanego partnera, Flash Cyber to narzędzie naprawdę stworzone do konkretnego celu: działa w ramach przepływu pracy CodeMender obejmującego odkrywanie, walidację, zatwierdzanie i łatanie (discover-validate-approve-patch), jego równoległa architektura sub-agentów jest zaprojektowana do skanowania rzeczywistych baz kodu na dużą skalę, a własne testy Google sugerują, że jest konkurencyjne – lub według niektórych wewnętrznych wskaźników nawet lepsze – od większych modeli ogólnych w tym konkretnym zadaniu. Dla tej wąskiej grupy odbiorców wartość oferty jest realna, nawet jeśli niektóre wspierające dane pochodzą z samodzielnych raportów.

Wszyscy inni — co oznacza prawie wszyscy. Jeśli jesteś typowym zespołem inżynieryjnym, firmą konsultingową ds. bezpieczeństwa bez partnerstwa z Google lub indywidualnym badaczem, Flash Cyber po prostu nie wchodzi w grę, niezależnie od tego, jak dobrze Twój przypadek użycia brzmi. Nie ma procesu aplikacyjnego, który gwarantowałby sukces, ani ceny, którą mógłbyś zapłacić, aby go odblokować. Twoją realistyczną ścieżką do pracy z podatnościami wspomaganej przez AI jest dziś ogólnie dostępny model graniczny — kierowany przez coś takiego jak OrcaRouter, jeśli potrzebujesz elastyczności między dostawcami — w połączeniu z własną dyscypliną przeglądu, ponieważ żaden z tych ogólnych modeli nie ma wbudowanych zabezpieczeń w postaci zatwierdzenia przez człowieka i walidacji w piaskownicy, jakie oferuje CodeMender.

Zespoły decydujące, czy czekać. Jeśli twoja organizacja rozważa ścieżkę partnerstwa z Google w celu uzyskania dostępu, warto zaplanować fakt, że nie ma ustalonej daty ogólnej dostępności (GA) — traktuj każdy bieżący przepływ bezpieczeństwa jako wymagający działania na ogólnie dostępnych modelach w międzyczasie i wróć do tematu, gdy i jeśli program pilotażowy Google się rozszerzy. Stawianie planu działania na ograniczony dostęp bez ogłoszonego harmonogramu to ryzyko, którego większość zespołów nie powinna podejmować.

Często zadawane pytania

Czy mogę używać Gemini 3.5 Flash Cyber?

Nie, chyba że jesteś zweryfikowanym rządem lub zaufanym partnerem. To pilotażowy program o ograniczonym dostępie w ramach CodeMender, bez publicznego API, bez dostępu samoobsługowego i bez opublikowanych cen. Google mówi, że dostęp będzie się z czasem rozszerzać, ale nie podał daty ogólnej dostępności.

Co to właściwie robi?

Znajduje, waliduje i naprawia luki w zabezpieczeniach oprogramowania w kodzie źródłowym, działając jako równoległe pod-agenty, których wyniki są scalane w raport. Człowiek zatwierdza każdą łatkę, a luki są walidowane w piaskownicy przed zgłoszeniem.

Jak to się ma do modeli cyber OpenAI i Anthropic?

W jednym wspólnym benchmarku strony trzeciej (CyberGym), trzy modele są ściśle zgrupowane: Flash Cyber ~83,2%, Anthropic Mythos 5 83,8%, OpenAI GPT-5.5-Cyber 85,6%. Google pozycjonuje swoją przewagę jako efektywność kosztową, a nie najwyższy surowy wynik. Wszystkie trzy są dostępne tylko dla zweryfikowanych organizacji.

Jakie ma specyfikacje?

Jest to dostrojona wersja Gemini 3.5 Flash. Google nie opublikował swojej długości okna kontekstowego, multimodalności ani liczby parametrów specjalnie dla Flash Cyber.

Czy to jest niebezpieczne / podwójnego zastosowania?

Google uznaje ryzyko podwójnego zastosowania — model, który dobrze znajduje luki możliwe do wykorzystania, może być używany ofensywnie — i wskazuje kontrolę dostępu jako główną metodę ograniczania tego ryzyka, obok zatwierdzania poprawek przez człowieka oraz izolowanej walidacji wyników.

Czy wynik CyberGym jest niezależnie zweryfikowany?

CyberGym samo w sobie jest autentycznym, zewnętrznym benchmarkiem akademickim. Jednak konkretna wartość 83,2% przypisywana Flash Cyber pochodzi z doniesień prasowych na temat ogłoszenia Google, a nie z własnego, dosłownego tekstu Google ani z wpisu na żywo na publicznej tablicy liderów, a ponieważ model jest objęty restrykcjami, żadna zewnętrzna strona nie może obecnie przeprowadzić go ponownie samodzielnie. Traktuj tę liczbę jako podaną, a nie niezależnie potwierdzoną.

Kiedy Flash Cyber stanie się ogólnie dostępny?

Google nie powiedział. Stwierdził, że dostęp będzie się z czasem rozszerzać poza obecny pilotaż rządów i zaufanych partnerów, ale nie opublikowano żadnej daty ogólnej dostępności (GA) ani harmonogramu, więc nie ma jeszcze nic konkretnego, co można by zaplanować.

Sedno sprawy

Gemini 3.5 Flash Cyber to wąskie, poważne narzędzie: model bezpieczeństwa kodu, który poluje na luki i je naprawia wewnątrz CodeMender, ograniczony do rządów i zaufanych partnerów. Jest rzeczywiście zdolny w jedynym dostępnym niezależnym benchmarku, ale znajduje się w ciasnej grupie z modelami cybernetycznymi OpenAI i Anthropic, zamiast wyprzedzać, a prawie wszystkie jego wyróżniające się wyniki to własne wewnętrzne ewaluacje Google. Jeśli nie jesteś zweryfikowanym partnerem, nie możesz go używać — a w przypadku ogólnych prac związanych z bezpieczeństwem w twoim własnym kodzie, dostępne modele graniczne nadal są praktyczną drogą. Poniższe porównania zestawiają go z jego dwoma prawdziwymi rywalami.


© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube