
Gemini 3.5 Flash Cyber란 무엇인가? Google의 게이트형 취약점 탐색 모델 설명
- googleNEWGoogle: Gemini 3.6 Flash2026-07-2150지능69코딩
- googleNEWGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaNEWMeta: Muse Spark 1.12026-07-1651지능71코딩
- kimiNEWMoonshotAI: Kimi K32026-07-1557지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0951지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0955지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0959지능77코딩
- grokxAI: Grok 4.52026-07-0854지능72코딩
- tencentTencent: Hy32026-07-0641지능59코딩
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232지능42코딩
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226지능39코딩
- anthropicAnthropic: Claude Sonnet 52026-06-3053지능72코딩
- klingKling: Kling 3.0 Turbo2026-06-1757지능52코딩57수학
- z-aiZ.ai: GLM 5.22026-06-1651지능69코딩60수학
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242지능61코딩61수학
- anthropicAnthropic: Claude Fable 52026-06-0960지능77코딩
- qwenQwen: Qwen3.7 Plus2026-06-0139지능56코딩59수학
- minimaxMiniMax: MiniMax M32026-05-3144지능59코딩59수학
- AnthropicAnthropic: Claude Opus 4.82026-05-2856지능74코딩68수학
- GoogleGemini 3.5 Flash2026-05-2350지능70코딩51수학
2026년 7월 21일, Google DeepMind는 발표했습니다 Gemini 3.5 Flash Cyber — 그날 출시된 세 가지 모델 중 세 번째이자 가장 특이한 모델이며, 범용 모델인 Gemini 3.6 Flash 및 Gemini 3.5 Flash‑Lite와 함께 출시되었습니다. 이는 사용자가 대화하거나 API를 통해 호출할 수 있는 일반 모델이 아닙니다. 코드 보안 전문가로서, Gemini 3.5 Flash를 기반으로 미세 조정되어 Google의 CodeMender 에이전트 내에서 실행되며 소프트웨어 취약점을 찾고, 검증하고, 패치하는 역할을 합니다. 그리고 중요한 점은, 이 모델은 접근이 제한되어 있습니다 — 제한된 액세스 파일럿을 통해 정부 및 “신뢰할 수 있는 파트너”에게만 제공되며, 공개적으로 사용할 수 없고, 셀프 서비스 가입도 없으며, 공개된 가격도 없습니다.
그로 인해 이 모델은 형제 모델들과 근본적으로 달라집니다. 형제 모델들은 일반적으로 제공되며, 다른 모델들과 마찬가지로 가격표에 토큰당 가격이 책정되어 있습니다. 플래시 사이버(Flash Cyber)에는 가격표가 없습니다. 왜냐하면 가격표를 붙일 공개 제품이 없기 때문입니다. 이 모델은 완전히 비공개 파일럿 프로그램 내에 존재합니다. 이 설명서는 헤드라인보다 더 깊이 들어갑니다: 플래시 사이버가 실제로 무엇인지, 그 성능 수치 중 어느 것이 구글 자체 내부 테스트와 별개로 진정으로 독립적인지, 접근 및 가격 책정 상황이 실제로 어떻게 작동하는지, 그리고 현실적으로 이 모델이 누구를 위한 것인지입니다.
TL;DR 결론.Gemini 3.5 Flash Cyber는 실제로 존재하는 게이트형 코드 보안 모델로, CodeMender 내에서 실행되어 소프트웨어 취약점을 찾고 패치합니다. 이 모델은 GA(General Availability) 상태가 아니며, 공개 API나 가격 정책이 없고, 정부 및 신뢰할 수 있는 파트너로 제한됩니다. 인용된 유일한 서드파티 벤치마크(CyberGym)에서 약 83.2%로 보고되었으며, OpenAI의 GPT-5.5-Cyber(85.6%) 및 Anthropic의 Mythos 5(83.8%)와 밀접하게 클러스터링되어 있습니다. Google의 우위는 능력의 폭발적 차이가 아닌 비용 효율성으로 설명됩니다. V8 이슈 수치를 포함한 대부분의 다른 벤치마크 주장은 Google 자체 내부 평가입니다.
주요 시사점
• 코드 보안 전문가로서, 소프트웨어 취약점을 찾고, 검증하며, 패치하는 데 특화되어 있습니다. SOC/위협 인텔리전스 또는 악성코드 분류 도구가 아니며, 일반 챗봇도 아닙니다.
• 게이트가 적용되어 있으며, GA가 아닙니다. 액세스는 CodeMender 플랫폼을 통해 정부와 신뢰할 수 있는 파트너에게만 제한되며, 공개 API나 게시된 토큰당 가격은 없습니다.
• Gemini 3.5 Flash에서 미세 조정되었으며, 취약점 보고서당 여러 병렬 하위 에이전트 호출로 배포되었으며 (Google은 최대 ~5개 언급), 하나의 결과로 병합됩니다. 컨텍스트 윈도우는 공개되지 않았습니다.
• 한 제3자 벤치마크.CyberGym ~83.2% (보도에 따름), GPT-5.5-Cyber 85.6% 및 Mythos 5 83.8%와 비교. 기타 결과(Big Sleep, Chrome, V8)는 Google의 내부 평가입니다.
• 이중 용도로, 의도적으로. 이렇게 취약한 버그를 찾는 데 능숙한 모델은 오용될 경우 위험하므로, Google의 주요 완화 조치는 접근 제어이며, 모든 패치 전 인간 승인 및 발견 사항의 샌드박스 검증이 포함됩니다.
• 이는 Sec-Gemini와 다른 모델입니다. Google의 이전 별도 위협 인텔리전스 모델은 인시던트 및 근본 원인 분석을 처리하며, Flash Cyber는 코드 취약점 패치에만 한정됩니다.
• 방어자를 위해 만들어졌으며, 개발자를 위한 것이 아닙니다. 대상 사용자는 최전선 보안 팀, 정부 기관, 그리고 대규모 취약점 연구를 수행하는 검증된 기업 파트너입니다 — 명시적으로 일반 소비자나 일반 앱 개발자가 아닙니다.
여기에 있는 대부분의 성능 수치는 Google 자체 내부 평가입니다. CyberGym만이 진정한 타사 벤치마크이며, 구체적인 83.2% 수치조차도 Google의 원문보다는 언론 분석에 더 잘 인용됩니다. 이를 "보고된" 것으로 인용하십시오. Flash Cyber를 일반적으로 사용 가능하다고 설명하거나 토큰당 가격을 인용하지 마십시오. 이는 게이트 처리되어 있으며 가격이 정해지지 않았습니다. 이를 Google의 별도 2025 위협 인텔리전스 모델인 Sec-Gemini와 혼동하지 마십시오.
Gemini 3.5 Flash Cyber란 무엇인가
"사이버"란 여기서 코드 및 소프트웨어 보안, 특히 소스 코드에서 취약점을 찾아 확인하고 수정하는 것을 의미합니다. 이는 보안 운영 분석가, 위협 인텔리전스 어시스턴트, 또는 악성코드 분류기가 아니며, 채팅 모델처럼 일반적인 질문에 답변하지 않습니다. CodeMender(Google DeepMind의 자동 코드 보안 패치 AI 에이전트, 2025년 10월 첫 공개) 내부에서 실행되며, 독립형 채팅이나 API 제품으로 판매되지 않습니다. 이러한 프레임이 중요합니다. Flash Cyber는 사용자가 직접 코드베이스에 적용하는 모델이 아니라, Google이 파일럿 파트너를 대신해 운영하는 더 크고 엄격하게 통제된 파이프라인 내의 구성 요소입니다.
실제로 여러 개의 Flash Cyber 하위 에이전트가 코드베이스에서 병렬로 실행됩니다. Google은 취약점 보고서당 대략 5개 정도라고 언급하며, 이들의 개별 결과는 하나의 통합 보고서로 병합됩니다. 이는 일회성 챗봇 교환이 아닌 에이전틱 다중 호출 아키텍처이며, 이것이 Google이 이를 훨씬 더 큰 모델에 비해 경쟁력 있다고 보는 주요 이유 중 하나입니다. 장점은 원시 모델 크기보다는 오케스트레이션 방식에서 비롯됩니다. 수정 사항이 출시되기 전에 사람이 승인하고, 샌드박스에서 기본 취약점이 검증됩니다. 모델이 제안하고 찾지만, 실제로 배포되는 것은 사람과 인프라가 결정합니다.
Gemini 3.5 Flash를 기반으로 파인튜닝되었습니다. Google은 Flash Cyber에 특화된 컨텍스트 윈도우 크기나 멀티모달 기능을 공개하지 않았는데, 이 자체가 하나의 데이터 포인트입니다. 일반적으로 제공되는 Flash 모델과 달리 확인할 수 있는 사양 시트가 없기 때문입니다. 의도된 사용자는 최전선 방어자, 정부 기관, 그리고 규모에 맞게 취약점 연구 및 패치 분류를 수행하는 검증된 엔터프라이즈 파트너입니다. 소비자나 일반 개발자를 대상으로 하지 않으며, 명시적으로 가입하여 자체 스택에 추가할 수 있는 제품이 아닙니다.

벤치마크 심층 분석: 숫자의 의미
기록상에는 단 하나의 제3자 벤치마크가 존재하며, 이 벤치마크가 실제로 무엇을 테스트하는지 이해하는 것이 중요합니다. CyberGym은 UC 버클리의 Dawn Song이 포함된 그룹이 구축한 학술 벤치마크로, 188개의 실제 오픈소스 프로젝트에 걸쳐 1,500개 이상의 문서화된 취약점을 대상으로 에이전트를 평가합니다. 이는 의미 있게 현실적인 테스트 환경입니다. 즉, 실제 코드, 실제 역사적 버그, 합성 퍼즐이 아닙니다. 언론 보도에 따르면 Flash Cyber는 CyberGym에서 약 83.2%를 기록한 반면, OpenAI의 GPT-5.5-Cyber는 85.6%, Anthropic의 Mythos 5는 83.8%를 기록했습니다. 이는 세 주체가 밀접하게 형성된 클러스터로, 누구도 압도적인 선두를 차지하지 못했습니다. 바로 이것이 Google이 자체 메시지에서 원점수보다는 비용 효율성에 초점을 맞추는 이유입니다. 특히, Google의 블로그는 "상당히 더 큰 모델 대비 경쟁력 있는 성능"이라는 정성적 주장만 할 뿐이며, 정확한 83.2% 수치는 Google 자체의 원문이나 사용자가 직접 확인할 수 있는 공개 리더보드 항목이 아닌, 발표에 대한 언론 분석에서 비롯된 것입니다.
V8 결과는 다른 종류의 숫자이며, 전적으로 Google 자체 지표입니다. Google은 V8 JavaScript 엔진을 대상으로 한 테스트에서 Flash Cyber가 표준 Gemini 3.5 Flash의 47건, Claude Opus 4.6의 36건과 비교해 확인된 고유 문제 55건을 발견했다고 보고했습니다. 여기에는 다른 모델이 찾지 못한 10건의 문제도 포함됩니다. 이는 특정 라이벌 모델과 구체적인 숫자를 언급하기 때문에 인상적으로 들리는 비교이지만, Google 자체 인프라에서 Google이 선택한 대상을 상대로 실행된 내부 테스트입니다. 외부 기관이 이 평가를 수행하거나 방법론을 공개해 재현하거나 독립적으로 개수를 검증한 것은 아닙니다. Google이 관찰했다고 말하는 실제 결과이지만, 이는 감사된 주장이 아닌 공급업체의 주장이며, 이러한 차이는 대부분의 벤치마크 보고보다 여기서 더 중요합니다.
“Big Sleep” 평가는 더 낮은 해상도에서 동일한 패턴을 따릅니다. Chrome 및 Safari와 같은 복잡한 실제 코드베이스를 테스트하면서 Google은 Flash Cyber가 주력 Gemini 3.5 Flash 및 3.6 Flash를 “크게 능가”했다고 말합니다. 그러나 이는 정확한 수치가 첨부되지 않은 질적 주장이며, 제3자가 비교를 확인하는 것은 물론입니다. 세 가지 결과를 나란히 놓으면 패턴이 나타납니다. 외부 출처(CyberGym)의 하나의 숫자는 빡빡하고 눈에 띄지 않는 클러스터를 보여주고, 더 화려하게 들리는 두 승리(V8, Big Sleep)는 모두 Google이 자체 모델을 Google이 선택한 기준선에 대해 평가한 것입니다.
그 패턴은 Google에만 국한된 것이 아니지만, 여기서는 평소보다 수정하기가 더 어렵습니다. Flash Cyber가 게이트(gated)되어 있기 때문입니다. 공개 또는 API 접근 가능한 모델의 경우, 독립적인 연구자들이 결국 벤치마크를 재실행하여 공급업체의 숫자를 확인하거나 반박할 수 있습니다. 그것이 부풀려진 주장이 일반적으로 적발되는 방식입니다. Flash Cyber의 경우, 그러한 검증은 대체로 불가능합니다. 외부 연구자들은 실제 모델에 대해 자신들의 CyberGym 패스, 자신들의 V8 스윕, 또는 다른 어떤 테스트도 실행할 수 있는 접근 권한이 없기 때문입니다. CyberGym의 제3자 출처조차도 벤치마크의 설계만을 다룰 뿐, Flash Cyber에 대한 독립적인 재실행을 다루지는 않습니다. 점수 자체는 여전히 Google의 공개에 기반합니다. 현재 파일럿을 넘어 접근이 확대되기 전까지는, 이 특정 모델에 대한 모든 성능 주장(독립적으로 들리든 아니든)은 궁극적으로 Google 자체의 설명을 신뢰하는 데 달려 있습니다.

Sec-Gemini와 혼동하지 마세요
Google에는 여러 '보안' 모델이 있으며, 이들은 혼동하기 쉽습니다. Sec-Gemini(2025년 4월경 발표)는 위협 인텔리전스 워크플로우(근본 원인 및 사고 분석)를 대상으로 하는 별도의 초기 실험 모델로, Google Threat Intelligence 및 OSV 데이터베이스와 통합됩니다. 관심 분야가 SOC/위협 인텔리전스 사용 사례라면 Flash Cyber가 아닌 Sec-Gemini가 관련 라인입니다. Flash Cyber는 코드 취약점을 찾고 수정하는 데만 초점을 맞추며, CodeMender 내에 있습니다.
액세스, 가격 및 보안 모델 기능을 실제로 얻는 방법
액세스 스토리는 간단하지만 대부분의 독자에게는 도움이 되지 않습니다. 즉, 존재하지 않습니다. Flash Cyber는 판매되지 않으며 가격도 표시되지 않으며 요청할 수 있는 API 키를 통해 접근할 수 없습니다. 입장할 수 있는 유일한 방법은 정부 기관이거나 CodeMender 파일럿에 승인된 검증된 “신뢰할 수 있는 파트너”가 되는 것입니다. 셀프 서비스 가입, 입장을 보장하는 대기자 명단 양식, 공개된 가격표도 없습니다. 가격을 책정할 공개 제품이 없기 때문입니다. Google은 시간이 지남에 따라 액세스가 확대될 것이라고 밝혔지만 해당 발언에 타임라인이나 GA 날짜를 첨부하지 않았으므로 “결국”이 현재 기록상 가장 구체적인 답변입니다.
이는 Flash Cyber의 자매 제품들과 확연히 대조된다. 같은 날 발표된 Gemini 3.6 Flash와 Gemini 3.5 Flash-Lite는 모두 일반에 공개되었으며, 다른 상용 모델처럼 토큰당 가격이 책정되어 있다. 반면 Flash Cyber는 완전히 다른 범주에 속한다. 제품 라인이라기보다는 우연히 공개된 Google의 내부 역량에 가깝다. 예산이 문제가 아니다. Google과 보안 연구 관계가 없는 자금력이 풍부한 기업이라도 현재로서는 Flash Cyber API 키를 얻을 방법이 전혀 없다.
그렇다면 팀이 자체 코드에서 취약점을 찾고 수정하는 데 AI 도움을 원할 때 실제로 무엇을 하나요? 파일럿에 참여하지 않은 압도적 다수의 경우 실용적인 방법은 일반 목적의 프론티어 모델, 즉 GA(일반 공개) 상태이고 가격이 책정된 모델을 동일한 유형의 작업(코드 리뷰, 취약점 트라이지, 패치 초안 작성)에 적용하고, 그 주변에 자체 인간 검토와 샌드박싱을 두는 것입니다. 이는 이 작업을 위해 특별히 훈련된 목적에 맞게 제작된 전문가 도구와는 본질적으로 다른 도구이지만, 접근 가능한 옵션입니다. 200개 이상의 모델을 하나의 OpenAI 호환 엔드포인트에서 제공하는 OrcaRouter 같은 집계 도구는 오늘날 대부분의 팀이 게이트가 걸린 파일럿(승인되지 않을 수도 있는)을 기다리지 않고 이러한 일반 모델 보안 워크플로를 구성하는 방식입니다.
누구를 위한 것인가요?
파일럿 내 검증된 방어자. 만약 귀하가 정부 기관이거나 Google이 이미 신뢰할 수 있는 파트너로 인정한 조직이라면, Flash Cyber는 진정으로 목적에 맞게 구축된 도구입니다. 이 도구는 CodeMender의 discover-validate-approve-patch 워크플로 내에서 실행되며, 병렬 하위 에이전트 아키텍처는 실제 코드베이스를 대규모로 스캔하도록 설계되었고, Google 자체 테스트에 따르면 이 특정 작업에서 더 큰 일반 모델과 경쟁력이 있거나 일부 내부 지표에서는 앞서는 것으로 나타납니다. 이 좁은 대상에게는 뒷받침하는 숫자 중 일부가 자체 보고된 것일지라도 가치 제안은 실제입니다.
그 외의 사람들 — 사실상 거의 모든 사람들입니다. 만약 당신이 일반적인 엔지니어링 팀, Google 파트너십이 없는 보안 컨설팅 회사, 또는 개인 연구자라면, 사용 사례가 아무리 적합해 보여도 Flash Cyber는 전혀 선택지가 아닙니다. 작동이 보장된 지원 절차도 없고, 잠금 해제를 위해 지불할 수 있는 가격도 없습니다. 오늘날 AI 기반 취약점 작업에 대한 현실적인 경로는 일반적으로 사용 가능한 프론티어 모델 — 공급자 간 유연성을 원한다면 OrcaRouter와 같은 것을 통해 라우팅 — 과 자신의 검토 규율을 결합하는 것입니다. 왜냐하면 그런 일반 모델들 중 어느 것도 CodeMender에 내장된 인간 승인 및 샌드박스 검증 보호 장치를 제공하지 않기 때문입니다.
대기 여부를 결정하는 팀들. 조직이 특히 액세스를 위해 Google과의 파트너십 경로를 탐색 중이라면, GA(일반 공개) 날짜가 존재하지 않는다는 사실을 염두에 두고 계획을 세우는 것이 좋습니다. 현재 보안 워크플로우는 당분간 일반 공개 모델에서 실행되어야 한다고 간주하고, Google의 파일럿이 확장되면 그때 다시 검토하세요. 발표된 일정 없이 제한된 액세스에 로드맵을 거는 것은 대부분의 팀이 감수해서는 안 될 위험입니다.
자주 묻는 질문
Gemini 3.5 Flash Cyber를 사용할 수 있나요?
당신이 검증된 정부 기관이거나 신뢰할 수 있는 파트너가 아니라면 안 됩니다. 이는 CodeMender 내부의 제한된 접근 파일럿으로, 공개 API, 셀프 서브 액세스, 공개된 가격이 없습니다. Google은 시간이 지남에 따라 접근이 확대될 것이라고 밝혔지만, GA(일반 공개) 날짜는 제공하지 않았습니다.
실제로 무엇을 하나요?
이것은 소스 코드에서 소프트웨어 취약점을 찾고, 검증하고, 패치하며, 병렬 하위 에이전트로 실행되어 결과가 보고서로 병합됩니다. 모든 패치는 인간이 승인하며, 취약점은 보고되기 전에 샌드박스에서 검증됩니다.
OpenAI와 Anthropic의 사이버 모델과 어떻게 비교되나요?
하나의 공유된 제3자 벤치마크(CyberGym)에서 세 모델은 근접하게 군집되어 있습니다: Flash Cyber 약 83.2%, Anthropic Mythos 5 83.8%, OpenAI GPT-5.5-Cyber 85.6%. Google은 자사의 강점을 최고 원점수가 아닌 비용 효율성으로 포지셔닝합니다. 세 모델 모두 검증된 조직만 접근할 수 있습니다.
사양이 뭐예요?
Gemini 3.5 Flash에서 미세 조정되었습니다. Google은 Flash Cyber에 대해 구체적으로 컨텍스트 윈도우, 멀티모달리티, 또는 파라미터 수를 공개하지 않았습니다.
위험하거나 이중 용도인가요?
Google은 이중 사용 위험을 인정합니다. 즉, 악용 가능한 버그를 잘 찾아내는 모델이 공격적으로 오용될 수 있다는 점입니다. 그리고 주요 완화 조치로 접근 제한을, 패치에 대한 인간 승인, 발견 사항의 샌드박스 검증과 함께 언급합니다.
CyberGym 점수는 독립적으로 검증되었나요?
CyberGym 자체는 실제로 제3자 학술 벤치마크입니다. 그러나 Flash Cyber에 귀속된 특정 83.2% 수치는 Google의 자체 원문이나 실시간 공개 리더보드 항목이 아닌 Google 발표에 대한 언론 보도에서 비롯된 것이며, 모델이 게이트(gated)되어 있기 때문에 현재 외부에서 직접 재실행할 수 없습니다. 이 수치는 보고된 것으로 간주하고, 독립적으로 확인된 것으로 간주하지 마십시오.
Flash Cyber는 언제 일반에 공개되나요?
Google은 말하지 않았습니다. 접근이 현재 정부 및 신뢰할 수 있는 파트너의 파일럿을 넘어 시간이 지남에 따라 확장될 것이라고 밝혔지만, GA 날짜나 일정은 공개되지 않았으므로 아직 구체적으로 계획할 내용이 없습니다.
결론
Gemini 3.5 Flash Cyber는 좁고 진지한 도구입니다. CodeMender 내에서 취약점을 찾아 패치하는 코드 보안 모델로, 정부 및 신뢰할 수 있는 파트너에게만 제공됩니다. 이 모델은 현재 사용 가능한 유일한 독립 벤치마크에서 실제로 능력을 보여주지만, OpenAI와 Anthropic의 사이버 모델들과 밀접하게 군집되어 있어 앞서 나가지는 않습니다. 그리고 눈에 띄는 수치의 거의 대부분은 Google 자체 내부 평가입니다. 검증된 파트너가 아니라면 사용할 수 없으며, 일반적인 보안 관련 작업에 대해서는 접근 가능한 프론티어 모델이 여전히 실용적인 경로입니다. 아래 비교는 두 실제 경쟁사와 비교한 것입니다.

