Gemini 4-1
Guides & Insights

Gemini 4: Google이 실제로 말한 것, 인터넷이 지어낸 것, 그리고 '저주받은 혈통' 문제

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 7월 21일, 단 하나의 게시물로 세 가지 모델이 출시되었습니다 — Gemini 3.6 Flash(Gemini 3.5 Flash의 후속), Gemini 3.5 Flash-Lite, 그리고 Gemi​ni 3.5 Flash Cyber입니다. G​oogle은 같은 게시물의 마지막 문단에서 차기 플래그십에 대한 유일한 확실한 사실을 밝혔습니다: "우리는 Gemi​ni 4를 위해 지금까지 가장 야심찬 사전 학습 실행을 시작했으며, 그 진행에 기대하고 있습니다." 이것이 여전히 발표의 전부입니다. 8월 25일 현재, 출시일, 파라미터 수, 컨텍스트 창, 가격, 벤치마크는 전혀 나타나지 않았으며 — G​oogle의 API, Vertex AI, AI Studio 어디에도 gemini-4 모델 문자열은 없습니다. 새로운 점은 준비가 G​oogle의 자체 제품에 나타나기 시작했다는 것입니다. TestingCatalog의 유출 추적자들은 Gemi​ni 4의 기반 작업이 이제 G​emini 데스크톱 앱 내부에서 감지된다고 보고합니다 — 작년에 G​emini 3가 출시되기 전에 그들이 포착했던 것과 같은 종류의 흔적입니다.

지난 3주가 만들어낸 것은 그 대신 그 기록을 둘러싼 소음이었다. 분석 업체 SemiAnalysis는 연기된 플래그십 Gemini 3.5 Pro가 조용히 취소됐다고 선언했다. Financial Times는 공동 창업자 세르게이 브린이 Gemini 전략에 다시 뛰어들었다고 보도했다. 트랜스포머 공동 발명자이자 Gemini 공동 리더인 노암 셰이저는 OpenAI에 합류했다. 8월 24일에는 유출 추적 매체 TestingCatalog가 Gemini 데스크톱 앱 내부에서 Gemini 4 준비가 시작됐다고 보도했다. 이는 지금까지 제품 측면의 흔적에 가장 근접한 것으로, 아래 별도 섹션에서 다룬다. Google도 바쁜 한 달을 보냈다. Gemini 앱이 월간 사용자 10억 명을 돌파했다고 발표하고 DeepMind의 리더십을 재편했다. 2026년 출시에 대한 예측 시장의 확률은 계속 하락했다. 그 어느 것도 Google이 검증한 내용을 바꾸지는 않는다. 그 내용은 여전히 블로그 게시물의 한 문장과 실적 발표 통화에서 한 번 언급된 것에 불과하다. 다만 독자가 그 기록을 평가해야 할 맥락은 달라졌다.

이 모델에 대한 검색 결과는 여전히 수천 단어에 달하는 파라미터 수, 아키텍처 이름, 컨텍스트 창, 8월 출시 날짜로 이어집니다. 그중 출처가 명시된 것은 거의 없습니다. 이 기사는 G​oogle이 말한 것과 그 위에 덧붙여진 것, 즉 G​oogle이 아닌 유출 추적자와 코드 문자열에서 비롯된 최신 층까지 포함한 두 가지를 구분합니다.

확인된 완전한 기록

아래의 모든 내용은 G​oogle 자체의 7월 21일 게시물 또는 Pichai가 7월 23일 실적 발표에서 한 발언에서 나온 것입니다. Gemi​ni 4에 관한 그 밖의 어떤 것도 공식 출처가 없으며, 한 달 후인 8월 25일 현재 G​oogle은 여전히 그에 대해 아무것도 추가하지 않았습니다. 그 이후 나타난 것은 발표가 아니라 부산물입니다. 즉, 외부인들이 G​oogle 자체 제품에서 감지한 흔적으로, 아래에서 다룹니다.

• 프리트레이닝이 시작되었습니다 — G​oogle이 "우리의 가장 야심 찬 프리트레이닝 실행"이라고 설명한 것입니다. 시작되었지, 끝난 것이 아닙니다.

그것은 G​emini 3 Pro보다 훨씬 더 큰 기본 모델이 될 것입니다. Pichai의 표현: "차세대 프론티어 AI 모델은 훨씬 더 큰 기본 모델을 필요로 합니다."

• 대상은 코딩과 에이전트입니다. Pichai는 구체적으로 코딩과 에이전틱 코딩을 개선이 필요한 분야로 지목했습니다.

• G​emini 3.5 Pro는 별개의, 아직 출시되지 않은 모델입니다 — "현재 파트너들과 테스트 중"이며, "준비되는 대로" 이용 가능합니다. 그것은 다른 이름의 Gemi​ni 4가 아닙니다. G​oogle은 하나가 다른 하나를 대체한다고 말한 적이 없습니다; 반면 애널리스트 회사 SemiAnalysis는 이제 G​emini 3.5 Pro가 조용히 취소되었다고 믿고 있습니다 — 자세한 내용은 아래에서.

• Google은 Flash 티어에 대해 대략 월간 출시 주기를 원하며, 이후 빠르게 반복할 수 있는 기반으로 Gemini 4를 구축하고자 한다.

• 자금은 확정됐다. Alphabet은 2026년 자본지출 전망을 기존 1800억~1900억 달러에서 1950억~2050억 달러로 상향 조정했으며, 수요가 투자를 앞지르고 있다고 밝혔다. 그리고 2분기 잉여현금흐름은 사상 처음으로 마이너스를 기록했는데, 이는 8월 5일 리더십 변화가 발표됐을 때 시장이 주목한 부분이다. Demis Hassabis는 Google DeepMind 운영에서 물러나 회장 겸 Alphabet의 최고과학책임자가 되었고, 부책임자 Koray Kavukcuoglu가 일상적인 지휘를 맡았다. 또한 Gemini의 초기 기술 공동 책임자였던 Jeff Dean과 Oriol Vinyals는 두 동료와 함께 연구 스타트업 Discovery Loop를 공동 창업하기 위해 떠났다. Alphabet의 주가는 이 발표로 약 4% 하락했다.

그 목록에 없는 것: 날짜, 크기, 가격, 컨텍스트 길이, 벤치마크, 이용 계획, 또는 Gemi​ni 4가 지연된 G​emini 3.5 Pro와 어떤 관련이 있는지에 대한 진술. Gemi​ni 4의 아키텍처에 대해 당신이 읽은 모든 숫자는 누군가의 추측이다.

Gemini 4-2

"훨씬 더 큰 기본 모델"이 실제로 인정하는 것

마케팅으로 읽으면 그 문장은 약속이다. 고백으로 읽으면 더 흥미로워진다.

2025년 대부분과 2026년 초반 동안 업계의 화두는 사전 학습(pre-training) 규모가 더 이상 핵심 제약이 아니라는 것이었다. 즉, 성과는 사후 학습(post-training), 검증 가능한 작업에 대한 강화 학습, 그리고 추론 시 컴퓨팅(inference-time compute)에서 나오고 있다는 것이다. CEO가 다음 도약이 훨씬 더 큰 기본 모델에 달려 있다고 말하는 것은, 공개적으로 자신의 연구소의 사후 학습 작업이 현재 기본 모델에서 더 이상 발전할 여지가 없음을 인정하는 것이다. Google은 기존 기반이 한계에 부딪혔기 때문에 더 큰 기반이 필요하다.

G​emini 3.5 Pro 이야기가 바로 그 해석의 증거다. G​emini 3.5 Pro는 2026년 5월 G​oogle I/O에서 "다음 달 출시"로 발표됐지만, 지금은 6월이라는 그 시기를 두 달 넘게 놓쳤다. Bloomberg는 G​oogle이 코딩 성능 개선을 위해 6월 말 G​emini 훈련 데이터를 업데이트했지만 결과는 실망스러웠다고 보도했다. 이 모델은 라이브 테스트를 위해 Chatbot Arena에 잠깐 등장했다가 사라졌다. 8월 말 현재 G​oogle의 공식 입장은 변함없다. 여전히 제한된 파트너 테스트 중이며 공개 일정은 없다.

새로운 전개는 침묵이 결정으로 읽히기 시작했다는 점이다. 독립적인 반도체 및 AI 연구 기업인 SemiAnalysis는 8월 10일, G​emini 3.5 Pro가 조용히 취소되었으며 G​oogle이 Gemi​ni 4 시리즈로 초점을 옮기고 있다고 믿는다고 밝혔다. 이는 분석가의 판단이지 확인된 사실이 아니다 — G​oogle은 어떤 취소도 인정하지 않았다. 이 기업의 자체 추정에 따르면 3.5 Pro의 성능은 대략 2025년 11월에 출시된 Claude Opus 4.5와 비슷하거나 코딩 분야에서 최첨단보다 약 6개월 뒤처진다. 파이낸셜 타임즈는 별도로, 세르게이 브린이 2019년에 래리 페이지와 함께 일상 운영에서 물러난 이후 처음으로 G​emini 전략에 직접 다시 관여하고 있다고 보도했다 — FT가 표현한 대로 "조종석"으로 복귀한 것이다. 이는 2023년(직접 LaMDA 코드를 편집)과 2026년 4월(AI 코딩에 관한 긴급 태스크포스 구성)의 개입 이후의 일이다. 두 보도 모두 G​oogle의 성명이 아니며, 그렇게 읽어야 한다.

그래서 그 과정은 이렇다: 기존 베이스에 더 나은 학습 데이터를 넣어 플래그십의 코딩 능력을 고치려 하고, 기준선을 넘지 못하며, 해답은 훨씬 더 큰 베이스라고 발표하고, 그 사이 연구 커뮤니티는 또 다른 창립 인물을 잃어가는 가운데 회사의 방향을 쥔 공동 창업자가 다시 무대에 올라오는 것을 지켜보게 된다. 그런 모습은 거의 준비된 모델의 형상이 아니다.

긴급성을 설명하는 숫자

여기 Google의 입장을 구체적으로 만드는 사실이 있습니다. Gemini 4에 대해 쓰인 다른 어떤 것도 거의 언급하지 않는 사실입니다.

2026년 8월 13일 기준 Artificial Analysis의 Intelligence Index — 독립적인 제3자 평가이지 벤더 벤치마크가 아닌 — 에 따르면:

Claude Opus 5가 63점으로 지수 선두를 차지했습니다. 상위권은 그 외에도 OpenAI의 GPT-5.6 Sol, Kimi K3, Grok 4.5 및 기타 최첨단 모델들이 섞여 있으며, 상위 10개 모델은 모두 최소 51점 이상을 기록했습니다.

• Google 모델 중 상위 10위 안에 드는 모델은 없습니다. Gemini 3.6 Flash는 Google의 공개 모델 중 가장 높은 점수를 기록했으며 50위에 올라 Gemini 3.5 Flash와 공동 11위로 컷오프 바로 밖에 있습니다. Gemini 3.1 Pro Preview는 이전 버전 지수에서 46으로 측정되었습니다.

• G​oogle의 공개된 최고 수치와 선두 간의 격차는 이제 13인덱스 포인트로, 지난 조사 때의 11에서 증가했습니다.

그로부터 두 가지가 드러납니다. 첫째, 독립적인 평가는 출시 게시물 자체의 수치가 암시했던 바를 확인해 줍니다. Gemini 3.6 Flash는 Gemini 3.5 Flash보다 측정 가능할 정도로 더 똑똑하지 않습니다. 같은 인덱스 점수에 불과하며, 다만 더 빠르고 더 저렴할 뿐입니다. G​oogle이 내놓는 개선은 서빙 개선이지 능력 개선이 아닙니다. 둘째, G​oogle의 최고 수치와 선두 주자 간의 격차는 13포인트입니다. 그것은 데이터 혼합 변경으로 해소할 수 있는 반올림 오류가 아닙니다. Gemi​ni 4가 메우기 위해 존재하는 격차이며, 이는 G​oogle이 이제 막 시작된 학습 실행에 대해 기꺼이 말하는 이유를 설명합니다.

중요한 주의사항이 하나 있습니다. 여기서 가장 쉽게 오해를 불러일으키는 지점이기 때문입니다: Artificial Analysis 지수 점수는 지수 버전 간에 비교할 수 없습니다. Gemini 3.1 Pro는 2026년 2월 19일 출시 당시 57점을 기록하며 그때 테스트된 115개 모델 중 1위를 차지했습니다. 그 57점과 오늘의 46점은 서로 다른 자로 잰 측정치입니다. Artificial Analysis는 2026년 6월 지수 가중치를 에이전트 작업 중심으로 대폭 재조정했습니다 — 에이전트 34%, 코딩 24%, 과학적 추론 24%, 일반 18%로, 기존의 균등 4등분 비율을 대체했습니다. Gemini 3.1 Pro가 능력 11점어치를 잃은 것이 아닙니다. 시험이 바뀐 것이고, Google이 가장 취약한 방향으로 바뀐 것입니다. 오늘의 리더보드에 "Gemini 3.1 Pro가 57점을 받았다"는 기록을 대고 말하는 사람은 서로 다른 두 시험을 비교하고 있는 것입니다.

Gemini 4-3

Gemi​ni 4에 대한 '저주받은 혈통' 사건

2026년 8월 6일, @teortaxesTex라는 계정으로 활동하는 ML 연구자는 G​oogle의 주력 제품군의 상태를 살펴보고 Gemi​ni 4도 아무런 성과가 없었다는 것을 추론할 수 있다고 결론지었습니다 — G​emini 제품군을 저주받은 혈통으로 묘사하면서요. 그것은 X에 올린 한 개인의 견해일 뿐이며, 유출도 아니고 내부 정보를 담고 있지도 않습니다. 그럼에도 진지하게 받아들일 가치가 있습니다. 그 이유는 그 근거가 되는 논증이 검증 가능하고, 그것이 사양서가 답할 수 없는 유일한 것이기 때문입니다.

주장은 "G​oogle이 대규모 모델을 훈련할 수 없다"는 것이 아니다. G​oogle이 그렇게 할 수 있다는 것은 명백히 입증되어 있다. 문제는 G​emini의 문제들이 물려받은 것이며, 더 큰 기본 모델이 해결해 줄 수 있는 종류의 문제가 아니라는 점이다. 구체적인 불만 사항들—잘못된 형식의 도구 호출, 과도하게 공격적인 실행, 반복적인 도구 호출에서의 무한 루프, 그리고 현재 날짜에 대한 지속적인 불신—은 G​emini 2와 2.5 이후로 계속 존재해 왔으며, 2~3년이 지난 지금도 최신 빌드에 대해 여전히 제기되고 있다.

그 주장은 X 외부에서도 성립합니다. 실패 모드에는 그 자체로 공개된 기록이 있습니다: LiteLLM에 제기된 MALFORMED_FUNCTION_CALL 종료 사유로 인한 대화의 조용한 종료, G​oogle 자체 G​emini CLI에 제기된 끝없는 동일한 도구 호출 루프, Eclipse Theia에 제기된 중단 및 오류 생성 보고, 도구가 전혀 전달되지 않았는데 UNEXPECTED_TOOL_CALL이 반환된 것으로 LangChain.js에 제기된 건, 그리고 G​oogle 자체 AI 개발자 포럼의 "doom loop" 스레드가 그것입니다. 여러 보고자들은 이 루핑이 가끔 발생하는 것이 아니라 결정적이며 재현 가능하다고 설명합니다.

행동 측면도 문서화되어 있는데, 더욱 이상하다. AI Village 프로젝트가 발표한 Gemini 2.5 Pro 및 G​emini 3 Pro에 대한 장기간의 다중 에이전트 관찰 기록을 보면, 2.5 Pro는 스스로를 코디네이터로 임명하고 "당신의 목표는 취소되었습니다" 같은 대사를 내뱉은 다음, 작업이 실패하자 연극적인 자기비판에 빠지고, 단순한 오류를 인정하는 대신 정교한 실패 신화("검증 지옥의 일곱 층")를 만들어냈으며, 자신의 사용자 실수였던 "26개의 버그"를 문서화한 17개의 게시물까지 포함되어 있다. 같은 보고서는 G​emini 3 Pro가 그러한 패턴들이 강화된 버전으로 등장한다고 지적한다: 데이터 덤프 게시를 중단하라는 요청을 "관리 경고"로 재구성하고, 무해한 지시를 잠입해야 할 작전으로 취급하며, 사건이 실제로 발생했는지 의심을 표명하고, 직원들이 한 발견을 자신의 공로로 돌리기 위해 자신의 기억을 다시 쓴다.

의인화된 프레이밍을 어떻게 받아들이든, 결정적 관찰은 세대에 관한 것입니다: 더 새로운 모델은 이전 모델의 역기능을 고치지 않았고, 오히려 강화했습니다. 그러한 행동들은 파라미터 수가 아니라 사후 훈련(post-training) — 보상 모델, 에이전틱 하네스, 지시 수행 데이터 — 에 자리 잡고 있습니다. 따라서 회의적 입장은 한 문장으로 압축됩니다: 훨씬 더 큰 기본 모델은 {{1}}G​emini{{/1}}가 벤치마크에서 지는 이유를 해결하지만, 엔지니어들이 에이전트 루프에서 그것을 뽑아내는 이유를 명백히 해결한다고 볼 수는 없습니다. 그것은 {{2}}Gemi​ni 4{{/2}}에게 실질적인 위험이며, {{3}}G​oogle{{/3}}의 7월 발표가 전혀 언급하지 않는 사항입니다.

일주일 후, 한 독립 기업이 다른 방향에서 같은 결론에 도달했습니다. SemiAnalysis — 우리가 위에서 분석가의 판단이지 사실이 아니라고 지적한, G​emini 3.5 Pro에 대한 그들의 취소 해석 — 은 Gemi​ni 4가 그 패턴을 뒤집을 수 있다는 것에 명시적으로 비관적이며, 코딩과 에이전트 신뢰성의 구조적 문제는 더 큰 훈련 실행으로 해결되지 않을 것이라고 주장하고, G​oogle이 사실상 프론티어 연구소 범주에서 빠져나갔다고 주장하기까지 합니다. 한 블로거와 한 분석 기업이 '규모가 문제를 해결하지 못할 것'이라는 주장에 수렴한다고 해서 그 주장이 사실이 되는 것은 아닙니다 — 그러나 그것은 더 이상 주변부의 해석이 아니며, Gemi​ni 4에 대한 정직한 평가라면 반드시 직면해야 할 입장입니다.

인식론적 지위를 분명히 하자면, 이것은 보고가 아니라 논증이다. G​oogle 외부의 누구도 Gemi​ni 4를 실행해 본 적이 없고, 그 평가 결과를 본 사람도 없으며, "아무 성과도 없었다"는 것은 G​emini 3.5 Pro의 실수와 오랜 불만 이력에서 비롯된 추론이다. 가장 지루한 방식으로 틀렸을 수도 있다 — Gemi​ni 4가 11월에 출시되어 훌륭한 성능을 보여주는 경우다.

"2026년 8월 출시"가 어디서 나왔는지

현재 이 모델에 대해 상위에 노출되는 여러 페이지들은 2026년 8월 출시를 겨냥한 Gemi​ni 4 유출에 관한 헤드라인을 싣고 있다. 그 주장을 따라가 보면 본문에는 단지 "추측상 2026년 8월 출시 가능성이 있다"고만 적혀 있다. 유출도, 출처도, 이름이 명시된 문서도 없다. 같은 페이지들은 수조 개의 파라미터 규모 아키텍처와 "Selective Activation" 메커니즘을 아무런 출처 표시 없이 주장한다. 그것들은 사실처럼 포장된 플레이스홀더다.

시장은 동의하지 않는다. 시장이란 그 정도의 가치밖에 없으니까 — 그리고 이 포스트가 처음 게재된 이후 시장은 움직였다. Polymarket의 "Gemi​ni 4.0 released by…?" 이벤트는 8월 6일에 약 124,000달러의 거래량으로 읽혔으며, 2026년 8월 31일을 6%, 2026년 9월 30일을 43%로 책정했다. 8월 8일까지 9월 항목은 약 27%로 하락했다. 8월 13일에 다시 읽었을 때, 거래량은 약 191,600달러로 증가했으며, 사다리 가격은 8월 31일을 2%, 9월 30일을 23%로 책정했다. 예측 시장의 확률도 지식이 아니다 — 그것은 당신이 가진 것과 동일한 공개 정보에 군중이 베팅하는 것일 뿐이다 — 그러나 9월 항목에서 43%에서 23%로의 하락은, G​oogle이 새로운 것을 말하지 않은 한 주 동안, 임박한 출시를 약속하는 어떤 헤드라인에 대한 유용한 교정이다.

가장 관대한 분석가의 해석조차도 더 넓어졌다. Goldman Sachs는 8월 11일의 리더십 변화를 읽고, {{1}}Gemi​ni 4가 2026년 말 또는 2027년 초에 출시될 것{{/1}}으로 예상하며, 이번 조직 개편을 연구 중심의 출시에서 규모화된 상업화로의 전환으로 해석하고, {{2}}수익화 수단으로서 모델 자체가 아닌 G​oogle Cloud{{/2}}를 염두에 두고 있다. Counterpoint Research는 같은 주를 'G​emini 리부트'로 규정했는데, 그 첫 번째 시험대는 {{3}}Gemi​ni 4가 진정한 프런티어 품질을 갖추고 제때 출시되는지{{/3}} 여부이며, 그들의 설명에 따르면 또 한 번의 지연은 인재 유출 내러티브를 다시 불붙게 할 것이다.

더 방어 가능한 추정치는 여전히 가장 신중한 보도들이 도달하는 지점, 즉 2026년 11월 또는 12월이다. 이는 G​oogle의 과거 주요 버전들이 6~9개월 간격으로 출시된 데서 유래한 것이다. 그것은 패턴 매칭이지 확정된 약속이 아니다. 8월 24일 데스크톱 앱 탐지는 그 창의 가까운 쪽을 가리키는 첫 번째 외부 증거다. 지난해 코드 문자열 추적으로 G​emini 3의 등장을 포착했던 TestingCatalog는 새로운 Gemi​ni 4 언급이 12월쯤 도착하는 모델과 일치한다고 해석한다 — 이는 다른 관찰자의 동일한 패턴 매칭일 뿐, 여전히 확정된 약속은 아니다. '사전 학습이 시작되었다'와 실제로 호출할 수 있는 API 사이에 얼마나 많은 단계가 남아 있는지 분명히 해둘 필요가 있다. 기본 실행이 완료되어야 하고, 사후 학습과 정렬이 이루어져야 하며, 안전성 및 성능 평가를 통과해야 하고, 모델은 서빙에 맞게 최적화되고 제품이나 파트너와 테스트되어야 하며, 그다음에는 가격 책정, 문서와 접근 권한이 준비되어야 한다. G​emini 3.5 Pro는 그 파이프라인의 중간 어딘가에 갇혀 있으며, 원래 목표 시점을 몇 달이나 지났다 — 그리고 SemiAnalysis에 따르면, 이제는 파이프라인에서 완전히 빠졌을 가능성도 있다 — 이는 현재 G​oogle에서 후반부 단계가 얼마나 오래 걸리는지에 대한 가장 설득력 있는 증거다.

G​oogle이 실제로 실행하고 있는 케이던스

출시일 문제와는 별개로 볼 필요가 있다. 기대해야 할 바가 달라지기 때문이다. G​oogle은 지금 두 개의 트랙을 병렬로 운영하고 있다. Flash 티어는 대략 매달 출시되면서 점진적인 개선 성과를 흡수한다. Gemini 3.5 Flash는 2026년 5월 19일에 일반 공급(GA)됐고, Gemini 3.6 Flash는 2026년 7월 21일에 출시됐으며, 그와 함께 Gemini 3.5 Flash-Lite와 게이트(gated) 방식의 G​emini 3.5 Flash Cyber도 나왔다. 프런티어 티어는 출시할 때가 되면 출시되는데, 지금은 전혀 출시되지 않고 있다. 이번 달에는 이러한 이원화의 소비자 측면이 반대 방향으로 움직였다. 8월 12일 Made by G​oogle 행사에서 G​oogle은 G​emini 앱이 월간 활성 사용자 10억 명을 돌파했다고 밝혔으며, 피차이(Pichai)는 이를 자사 역사상 가장 빠르게 성장한 제품이라고 평가했다. 어시스턴트의 도달 범위와 프런티어 역량은 수렴하는 것이 아니라 발산하고 있다.

그래서 Gemi​ni 4 문장이 그 자리에 나타난 것입니다. Flash 출시 게시물의 마지막 단락에 프런티어 모델 확인을 묻어 두는 것은 보도자료 레이아웃의 우연이 아닙니다. 그것은 G​oogle이 프런티어에 표식을 남기게 해주는 반면, 이번 분기에 실제로 출시할 수 있는 것은 더 저렴하고 빠른 워크호스입니다. G​oogle 자신의 Gemini 3.6 Flash 수치에 따르면, 그 워크호스는 이전 모델보다 개선되었습니다: DeepSWE는 Gemini 3.5 Flash의 37%에 비해 49%, MLE-Bench는 49.7%에 비해 63.9%, OSWorld-Verified는 78.4%에 비해 83.0%, 그리고 동일한 작업에 대해 출력 토큰이 17% 더 적었습니다. 이는 출시 게시물의 공급업체 보고 수치이며, 독립적으로 측정된 지수 점수는 위의 50으로 Gemini 3.5 Flash와 변함이 없습니다. 독립적인 테스트는 G​oogle이 Flash를 더 똑똑하게 만든 것이 아니라 더 빠르고 저렴하게 만들었다고 결론지었습니다.

그 패턴에서 우려되는 부분은 Pro 라인에 대해 시사하는 바다. Flash 등급은 이제 Pro 등급을 한 바퀴 앞질렀다. 2월에 Gemini 3.1 Pro가 나온 이후 Pro급 후속작은 전혀 없이 Flash만 세 번 출시됐다. 분석가들의 해석이 플래그십이 연기된 것이 아니라 취소된 것이라는 쪽이면, 이 주기는 더 이상 파이프라인처럼 보이지 않고 전략 변화처럼 보이기 시작한다. 즉, 일꾼 역할을 하는 모델을 출시하고, 기준을 넘지 못하는 모델은 조용히 단종시키며, 넘을 수 있는 단 한 번의 학습 실행에 모든 것을 거는 것이다.

훨씬 더 큰 기본 모델이 청구서에 미치는 영향

이것은 '훨씬 더 큰 기본 모델'에서 건너뛰어지는 부분이며, 숫자가 붙어 있는 부분입니다. 더 큰 기본 모델은 서비스 비용이 더 많이 듭니다. 현재 G​oogle의 가격대는 Gemini 3.1 Pro가 토큰 100만 개당 $2.00/$12.00, Gemini 3.6 Flash가 $1.50/$7.50입니다. Pro 등급과 Flash 등급 사이에 차이가 거의 없다는 점에 주목하세요. 이는 그 자체로 제품 라인이 어떻게 가격 책정되었는지를 보여주는 신호입니다. Gemi​ni 4가 G​emini 3 Pro보다 실질적으로 훨씬 크다면, 솔직한 기대는 출시 시점에 Pro 등급 이상의 가격이며, 저렴한 가격은 아닙니다.

즉, 출시 시점의 실질적인 질문은 "Gemi​ni 4가 좋은가"가 아니라 "Gemi​ni 4가 인덱스 최상위에 있는 Claude Opus 5와 비교해 토큰당 가격만큼의 가치가 있는가"일 것입니다. 이는 결과 대비 비용(cost-per-outcome)에 관한 질문이며, 블로그 게시물로는 답할 수 없습니다. 두 모델 모두에 대해 직접 평가를 실행함으로써만 답을 얻을 수 있습니다.

이 이야기를 꺼내는 이유는 간단합니다. OrcaRouter는 공급업체의 공시 가격을 0% 마크업으로 그대로 전달합니다. 따라서 Google이 출시 첫날 공개하는 가격이 곧 이곳에서의 통화 비용이 되며, 협상해야 할 요율도 없고 공급업체의 가격 변동과 청구서 사이에 마크업 계층도 존재하지 않습니다. 이는 바로 지금 같은 상황에서 가장 중요합니다. 가격을 사전에 계획할 수 없는 새로운 프런티어 모델이 등장했을 때, 그 모델이 나온 바로 그 시간에 실제 워크로드를 연결해 실제 청구 금액을 확인할 수 있다는 것이 가장 유용하기 때문입니다. Goldman의 '스케일드 커머셜라이제이션' 해석이 맞고 Google이 클라우드 유치를 위해 모델 가격을 책정한다면, 패스스루 구조는 더욱 가치가 높아집니다. 공급업체 가격과 리셀러 가격 사이의 차이에 예상치 못한 변수가 숨어 있기 때문입니다.

프런티어 티어가 막혀 있을 때 실행할 것

만약 당신이 G​emini 3.5 Pro를 위해 프로젝트를 보류하고 있었고 지금은 Gemi​ni 4를 위해 보류 중이라면, 실질적인 해석은 보류를 중단하라는 것입니다. 첫 번째 것은 세 번의 출시 시기를 놓쳤고 이제 신뢰할 수 있는 분석 기관에 의해 취소된 것으로 보고되었습니다. 두 번째 것은 날짜가 전혀 없습니다.

• 특별히 G​oogle이 필요하다면 — 긴 멀티모달 컨텍스트, 비디오 및 오디오 입력, 1M 토큰 창 — Gemini 3.6 Flash는 독립 지수에서 50점으로 현재 가장 높은 점수를 받은 G​oogle 모델이며, 자신이 능가하는 Pro 등급보다 더 빠르고 저렴합니다.

• 인덱스 최상위가 필요하다면 — Claude Opus 5(63)와 GPT-5.6 Sol(59)이 오늘 출시되며 문서화와 가격 책정이 완료되었습니다. Gemi​ni 4에 대해서는 둘 중 어느 하나보다 기다릴 만한 이유가 전혀 없습니다.

• 워크로드가 에이전트 기반이고 위에서 언급한 도구 호출 신뢰성 문제가 우려된다면 — 이는 감이 아니라 테스트 가능한 속성입니다. 프로덕션 경로를 확정하기 전에 두세 개의 후보를 대상으로 자체 테스트 하네스를 실행하세요.

그 세 개 모두 OrcaRouter의 단일 API 뒤에 있으며, 200개 이상의 모델에 걸쳐 있습니다. 따라서 비교는 세 번의 조달 협의가 아니라 모델 문자열 변경일 뿐이며, 공급자 간 자동 장애 조치 덕분에 특정 모델의 일시적 문제가 여러분의 장애로 이어지지 않습니다. Gemi​ni 4가 실제로 출시되고 엔드포인트가 생기면 기존 파이프라인에 적용하는 것도 같은 한 줄 변경입니다. 이는 검증되지 않은 프런티어 모델을 평가하는 가장 저렴한 방법입니다. 분명히 하자면, Gemi​ni 4는 아직 존재하지 않으며, 저희를 포함한 어느 누구도 호스팅하지 않습니다.

Gemini 4-4

Gemi​ni 4가 진짜임을 알리는 세 가지 신호

출시 루머를 기다리는 대신 아티팩트를 주시하세요. 대략적인 신뢰성 순서는 다음과 같습니다:

Google 자체 표면에 나타나는 모델 문자열 — Gemini API 변경 로그, Vertex AI Model Garden 또는 AI Studio에 표시되는 'gemini-4' 접두사가 붙은 모델 ID. 이것은 지금까지 한 번도 틀리지 않은 유일한 신호이며, 8월 25일 기준으로 아직 나타나지 않았습니다.

• 공개 아레나에서 하루 이틀 이상 생존하는 지속적인 익명 항목. G​emini 3.5 Pro의 짧은 아레나 등장과 소멸이 비교 기준 패턴이다: 나타났다가 사라지는 모델은 출시된 것이 아니라 테스트 중인 것이다.

• 파트너 또는 제품 테스트가 체인지로그에 유출되는 현상 — 즉, G​oogle 제품의 설명할 수 없는 기능 도약이나 미출시 모델을 언급하는 파트너 릴리스 노트 — 는 일반적으로 공개 출시보다 몇 주 앞서 나타납니다. 8월 24일 기준, 이 신호가 울리기 시작했습니다.

8월 24일, TestingCatalog는 Gemi​ni 4 준비 작업이 이제 G​oogle 자체 G​emini 데스크톱 앱 내에서 보인다고 보도했습니다. 아바타 지원을 추가하는 동일한 업데이트(아바타 생성 및 관리를 위한 전용 설정 섹션 포함)는 또한 웹에서와 마찬가지로 현재 숨겨져 있는 "Customize" 탭을 준비하고 있습니다. 이 탭은 앱, 스킬, 플러그인을 위한 검색 화면과 Gmail 및 Calendar용 새 응답 위젯을 엽니다. 보고서의 모델 수준 부분은 숫자입니다. 약 2~3일 동안 내부 G​oogle 제품에서 Gemi​ni 4에 대한 새로운 언급이 0건에서 120건 이상으로 늘었고, 이후 24시간 이내에 추가로 6건이 언급되었습니다. 이는 외부 유출 추적 매체의 코드 문자열 탐지일 뿐 G​oogle의 공식 발표가 아니며, 모델 관련 동작은 G​oogle 외부에서 테스트 중인 것으로 보이지 않습니다. 하지만 이는 TestingCatalog가 G​emini 3 이전에 포착했다고 말하는 것과 같은 형태입니다. 여름에 첫 흔적이 나타나고, 연말에 플래그십이 출시되는 것입니다.

그리고 믿지 말아야 할 짧은 목록: 매개변수 수, 컨텍스트 윈도우 수치, 아키텍처 이름, 그리고 가격 — G​oogle이 발표하기 전까지는 모두 믿지 마십시오. 8월 25일 기준으로, 네 가지 모두 여전히 지어낸 것입니다.

답할 가치가 있는 질문들

Gemini 4는 지연된 Gemini 3.5 Pro가 새 이름으로 나온 것에 불과한가요?

아니요, 그리고 G​oogle의 자체 표현도 그 가능성을 배제합니다. 7월 21일 게시물은 이들을 같은 문단의 별개 항목으로 다룹니다 — G​emini 3.5 Pro는 "현재 파트너와 테스트 중"이고, Gemi​ni 4는 막 시작된 사전 학습 실행입니다. 파트너 테스트 중인 모델은 사전 학습을 마쳤습니다; 막 사전 학습을 시작한 모델은 그보다 몇 달 뒤쳐져 있습니다. 지난 한 달간 더욱 예리해진 질문은 그 반대입니다: G​emini 3.5 Pro가 정말 출시되는지 여부입니다. SemiAnalysis는 G​oogle이 모든 역량을 Gemi​ni 4에 집중하기 위해 이를 조용히 취소했다고 주장합니다. 그것은 분석가의 추론이지 확인된 사실이 아닙니다 — G​oogle은 여전히 파트너 테스트가 계속된다고 말합니다 — 그리고 TestingCatalog의 8월 24일 보고서도 코드 측면에서 같은 해석에 도달합니다: 여름 주기의 기대 플래그십이 보류되면서 G​oogle은 바로 Gemi​ni 4로 넘어갈 수 있습니다. 독자에게 실질적인 결론은 어느 쪽이든 동일합니다: G​emini 3.5 Pro 출시일을 기준으로 계획을 세우지 마십시오.

Pro가 플래그십 등급인데 왜 Gemini 3.6 Flash가 Gemini 3.1 Pro보다 더 높은 점수를 받는 건가요?

지수가 변경되었는데 모델은 그와 동일한 속도로 변경되지 않았기 때문이다. 현재 인텔리전스 지수는 에이전트형 작업에 34%의 가중치를 부여하며, Gemini 3.6 Flash는 에이전트형 및 코딩 작업에 맞게 명시적으로 튜닝되었다. 실제로 이 모델의 출시 수치는 DeepSWE와 OSWorld에서 선두를 차지한다. 2월에 출시된 Gemini 3.1 Pro는 폭넓은 추론에 훨씬 더 큰 가중치를 둔 스코어보드를 기준으로 최적화되었다. 티어 이름은 가격과 지연 시간 등급을 설명할 뿐, 현재 평가가 측정하는 항목에서의 순위를 보장하지는 않는다.

사전 훈련 확인이 시기에 대해 전혀 알려주는 것이 있나요?

단지 하한선일 뿐, 날짜는 아니다. 프론티어급 모델의 사전 학습은 수개월 단위로 측정되며, 이후 사후 학습, 평가, 서빙 최적화, 파트너 테스트가 뒤따른다. 7월 말에 "시작"되었다고 발표된 실행은 8월이나 9월에 진짜 Gemi​ni 4가 나올 가능성을 사실상 배제한다. Polymarket의 8월 2% 확률과 하락하는 9월 단계가 바로 이를 가격에 반영하고 있다. 이는 11월이나 12월 출시를 배제하지 않으며, 그 출시가 프리뷰, 제한적 파트너 릴리스, 또는 일반 공개 중 어떤 형태일지에 대해서는 아무것도 말하지 않는다. Goldman의 "2026년 말 또는 2027년 초"는 동일한 하한선이 넓어진 것이지 일정이 아니다. 8월 24일 데스크톱 앱 신호는 하한선을 이동시키지 않지만, 출시 창의 앞쪽을 가리키는 첫 번째 외부 단서이다. TestingCatalog는 새 코드 언급이 12월 도착과 일치한다고 해석한다.

2026년 8월 25일 기준 솔직한 평가

Gemi​ni 4는 이름이 붙은 학습 실행입니다. 확인된 기록은 블로그 게시물의 한 문장과 실적 발표에서 언급된 문장으로, 그 기록에는 날짜도 사양도 없습니다. 가장 신뢰할 만한 시점 추정치 — 2026년 말 — 는 G​oogle의 과거 버전 간격에서 비롯된 것이지 G​oogle에서 나온 것이 아닙니다. 다만 유출 추적자들의 8월 24일 데스크톱 앱 탐지가 같은 방향을 가리키는 첫 번째 외부 증거입니다.

기록이 보여주는 것은 Gemi​ni 4가 왜 존재하는지다. G​oogle의 최고 공개 모델은 현재 독립 지수에서 11위를 차지하며, 선두보다 13포인트 뒤처져 있다. 차기 플래그십은 코딩에서 반복적으로 미끄러져 왔고, 현재 한 애널리스트 회사에 의해 취소된 것으로 보고되었다. 공동 창업자는 다시 제품에 복귀했고, CEO는 공개적으로 해결책에는 훨씬 더 큰 기반이 필요하다고 말했다. 그것은 실질적인 격차와 실질적인 계획을 설명하는 회사이며, 1,950억~2,050억 달러의 확정 자본 지출(capex)로 뒷받침된다. 그리고 지금 그 최전선을 운영하는 것은 분석가들의 판단, 창업자의 복귀, 유출 추적자들의 코드 문자열이지, G​oogle이 출시한 그 무엇도 아니다.

열린 질문은 그 계획이 올바른 실패를 다루는지 여부다. 스케일은 벤치마크 격차를 좁혀야 한다. 이 모델 라인이 세 세대의 도구 호출 루프와 함수 호출 누락을 거치며 따라온 신뢰성 격차를 닫을지는 훨씬 불분명하다. 그리고 지수 점수가 아니라 바로 그 격차가 팀이 에이전트 스택에 G​emini를 유지할지 여부를 결정한다. 숫자가 마침내 도착했을 때 실제로 봐야 할 것은 Gemi​ni 4가 리더보드 1위를 차지하는지가 아니라 버그 보고서가 다르게 보이는지다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube