기사 'Gemini 4 Carbon — 유출 보고서'의 히어로 타이틀 카드. '미검증' 배지, 부제 '대중이 호출할 수 없는 Google 내부 체크포인트 — 보고서가 말하는 내용', 세 개의 칩 '출처: TestingCatalog를 통한 Business Insider', '2026년 10월 9–10일', 'Google의 내부 플랫폼인 Jetski에서 테스트됨', 왼쪽 카드 '주장: 초기 내부 피드백에 따르면 Carbon은 코딩에서 Claude Opus 5.5에 필적한다', 오른쪽 카드 '맥락: Barium-B는 공개 Gemini 4 Argon 릴리스에 선택된 체크포인트이다'로 구성된다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있다.
Guides & Insights

Gemini 4 Carbon Leak: 직원들이 Claude Opus 5.5처럼 코딩한다고 말하는 Google의 내부 체크포인트

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 이야기에는 뉴스인 버전과 소음인 버전이 있고, 그 차이는 전적으로 그 이름들이 무엇에 붙어 있느냐에 달려 있다. 2026년 10월 9일과 10일, Business Insider가 보도했고 유출 추적 매체 TestingCatalog가 이를 전했는데, 검색 대기업의 직원들이 Carbon이라는 추가 Gemini 4 체크포인트를 내부적으로 테스트하고 있다는 것이다. 초기 내부 피드백에 따르면 Carbon은 코딩에서 Claude Opus 5.5와 비슷하게 느껴진다고 하며, Barium-B이 공개 Gemini 4 Argon 릴리스용으로 선택된 체크포인트이고, Carbon은 회사 내부 Jetski 플랫폼을 통해 테스트된, 별개이자 어쩌면 더 강력한 이터레이션이라는 것이다. 이 내용을 훑어보는 대신 읽을 가치가 있게 만드는 것은 마지막 절이다. 즉 Carbon이 Gemini 4 Argon 업데이트로 출시되는지, 아니면 자체적인 릴리스로 나오는지는 보고서 자체의 표현대로 확인되지 않았다. 그리고 이것이 증거의 전부다 — 발표도, 모델 식별자도, 엔드포인트도, 가격도, 모델 카드도, 벤더의 논평도 없다. 이 페이지에서 구체적인 모든 것은 유출이거나, 유출에서 끌어낸 추론이거나, 그 유출이 비교 기준으로 삼는, 실제 출시 가능한 다른 모델에 관한 사실이다.

보고서가 실제로 주장하는 것

신호는 미약하지만, 반증이 가능할 만큼 구체적이다. 그것이 이와 같은 페이지에 이 신호가 실릴 유일한 이유다. 군더더기를 걷어내면, 주장은 다음과 같다:

• 구글 직원들이 Carbon이라는 이름의 Gemini 4 체크포인트를 내부적으로 테스트하고 있습니다. 이는 공개된 모델이 아니며 어떤 API로도 호출할 수 없습니다.

• 초기 내부 피드백에 따르면 Carbon은 코딩에서 Claude Opus 5.5와 비슷하게 느껴진다고 한다 — 이는 직원 테스트에서 나온 인상일 뿐, 벤치마크 결과도 아니고, Google 외부에서는 누구도 재현할 수 없는 수치도 아니다.

• 대중이 실제로 들어본 모델인 Gemini 4 Argon의 기반이 되는 체크포인트는 Barium-B라고 불리며, Carbon은 두 개의 레이블이 붙은 동일한 빌드가 아니라 별개이며 잠재적으로 더 뛰어난 이터레이션으로 설명된다.

• 보고에 따르면 Carbon은 Jetski를 통해 실행되고 있으며, 같은 보도에서는 Jetski를 구글의 에이전트형 코딩 환경인 Antigravity와 관련된 구글 내부 명칭이라고 설명합니다.

• Carbon이 향후 Gemini 4 Argon 업데이트가 될지, 아니면 별도의 Gemini 4 릴리스가 될지는 알 수 없습니다. Google은 이에 대해 어떠한 언급도 하지 않았습니다.

그것이 바로 그 유출이다. 그것은 하나의 비교, 하나의 코드네임 관계, 그리고 진정으로 열린 질문 하나를 담고 있으며, 그 어느 부분도 공개된 것이 아니다.

A two-column infographic titled 'Gemini 4 Carbon — what the report says / what it does not'. Left column 'What the report says': '9–10 Oct 2026 — Business Insider, relayed by TestingCatalog', 'Google staff testing a Gemini 4 checkpoint named Carbon', 'Early internal feedback: feels comparable to Claude Opus 5.5 for coding', 'Barium-B is the checkpoint chosen for the public Gemini 4 Argon release', 'Tested via Jetski, tied to Antigravity'. Right column 'What it does not say': 'Whether Carbon ships as an Argon update or a separate Gemini 4 release', 'No model ID, endpoint or price of any kind', 'No model card, context window or parameter count', 'No benchmark number behind the Opus 5.5 comparison', 'No date, and no comment from Google'. Footer: 'All leak claims unverified; Google has not commented.'

코드네임 사다리, 그리고 어느 단이 중요한가

이 보고서에 해독기가 필요한 이유는 Google의 주기율표식 습관이 한 문단에 서로 평행해 보이지만 실제로는 그렇지 않은 세 가지 이름을 넣기 때문이다. 독자가 각각을 가지고 실제로 할 수 있는 일을 기준으로 정렬하면:

• Gemini 4 Argon — 발표됨. 자사 발표 게시물과 제품군 페이지를 갖춘 실제 모델 이름, 입력 백만 토큰당 $2, 출력 백만 토큰당 $10의 공개된 도입 가격, 공개된 100만 토큰 출력 한도, 그리고 검증된 사이버 방어 전문가들부터 시작해 다음에는 유료 API 고객으로 확대될 것이라고 설명된 제한적 배포까지 갖췄습니다. 아직 요청에 넣을 수 있는 모델 식별자가 없으며, 이는 발표된 모델과 호출 가능한 모델을 가르는 경계입니다.

• Barium-B — 제품이 아니라 체크포인트 이름이다. 같은 보고서에 따르면, 이것은 공개 Argon 릴리스에 선택된 빌드다. 이 레이블의 유용한 점이 바로 그것이다. 즉 Argon이라는 이름은 빌드 자체가 아니라 내부 빌드를 감싼 출시 결정에 붙여진 이름이라는 사실을 알려준다.

• Carbon — 직원들의 인상만 첨부된 내부 체크포인트, 그게 전부입니다. ID도, 가격도, 출시 시점도, 날짜도 없습니다. 코드명이 붙은 소문일 뿐이며, 코드명이란 값싼 것입니다.

그렇게 읽으면, 이 이야기는 "새 Gemini가 유출됐다"가 아니다. 그것은 Google이 둘 이상의 프런티어 체크포인트를 병렬로 돌리고 있는 것으로 보인다는 점, 대중에게 내건 이름을 붙인 쪽이 엔지니어들이 가장 열광하는 쪽은 아니라는 점, 그리고 회사 밖에서는 그 두 사실 중 어느 것이 결국 중요하게 드러날지 아무도 모른다는 점이다.

왜 "Claude Opus 5.5처럼 느껴진다"가 핵심을 떠받치는 문장인가

보고서의 모든 내용 중에서 이 비교가 가장 큰 역할을 하고 있으면서도 가장 검증하기 어렵기 때문에, 무엇과 비교되는지를 정확히 밝히는 것이 좋다. Claude Opus 5.5는 Anthropic의 플래그십이며, 독립적 측정 기준으로 현재 세대에서 폭넓게 호출 가능한 가장 강력한 코딩 모델이다. 즉, Google 엔지니어가 벤치마크를 대지 않고 "이게 바로 좋은 것"이라고 말하고 싶을 때 찾게 되는 기준점이다. 공개된 정가 기준으로 입력 토큰 100만 개당 $4.00, 출력 토큰 100만 개당 $20.00이며, 캐시 읽기는 100만 개당 $0.20이고, 1M 토큰 입력 윈도와 128K 토큰 최대 출력을 갖추고 있다.

그와 대조해 보면, 이 비교는 한 번에 두 가지를 말하는데, 두 번째가 사람들이 건너뛰는 쪽이다. 첫째는 경쟁적이다: 구글 내부 체크포인트가 선두 경쟁사의 플래그십과 같은 맥락에서 언급되고 있는데, 이는 구글이 블로그 글에는 결코 쓰지 않을 칭찬이다. 둘째는 포지셔닝에 관한 것이다: 이 비교는 코딩 감각에 대한 직원의 인상이며, 이는 채팅 창과 맞닥뜨리면 살아남고 리더보드와 맞닥뜨리면 죽는 바로 그런 종류의 주장이다. 아무도 Carbon에 대한 벤치마크를 발표하지 않았다. Artificial Analysis 항목도 없고, 벤더 벤치마크 표도 없고, 평가 방법론 PDF도 없다 — 그것들은 Gemini 4 Argon에는 존재하고 이것에는 존재하지 않는다. 느낌은 점수가 아니며, 이 페이지는 느낌을 점수로 포장하지 않을 것이다.

답을 아는 척하지 않으면서도 짚고 넘어갈 만한 가격 책정상의 결과도 있다. "코딩에서는 Claude Opus 5.5 같은 느낌"을 주는 체크포인트가 Google 내부에 자리하고 있는데, Google이 실제로 발표한 모델이 독립 지수에서 그보다 5점 낮은 곳에 있다면, 흥미로운 질문은 Carbon이 좋은지가 아니다. 바로 Google이 그 가격을 어디에 책정하겠느냐, 그리고 나머지 Gemini 라인이 출시돼 온 것과 같은 실무형 요금으로 팔릴 일이 있겠느냐이다.

무엇이 빠져 있으며, 왜 그 목록은 뉴스보다 더 긴가

존재하지 않는 것들에 대한 솔직한 목록이 이 글의 전부입니다. 그래서 여기 있습니다:

• 모델 식별자 — Carbon에는 없고, Gemini 4 Argon에도 없다. 어느 이름도 요청을 보낼 수 있는 곳 어디에도 나타나지 않는다.

• 가격 — Carbon은 어느 등급에서도 공개된 가격이 없으며, 출시 기념 요금조차 없습니다.

• 모델 카드 또는 시스템 카드 — 없음, 그리고 이를 뒷받침하는 공개된 평가 방법론도 없음.

• 컨텍스트 윈도, 출력 한도 또는 파라미터 수 — 그중 어느 것도 공개되지 않았으며, Google은 어떤 Gemini에 대해서도 파라미터 수를 공개하지 않았습니다.

• 벤치마크 결과 — Opus 5.5 비교는 직원의 인상일 뿐이며, 이는 숫자도, 테스트도, 재현성도 없음을 뜻한다.

• 날짜 — 발표도, 단계적 출시도, 출시 예정 시기도 없고, Carbon 출시가 애초에 계획되어 있는지에 대한 Google의 언급도 없다.

• 관계 — Carbon이 다음 Argon 업데이트인지 아니면 별도의 Gemini 4 모델인지 여부. 이는 보고서에서 가장 중대한 단일 미지수이며, 보고서 자체에서 명시적으로 확인되지 않았습니다.

그 목록에 없는 것은 모두 추론이며, 앞으로 2주 동안 이에 대해 쓰일 대부분의 글도 포함된다.

개발자가 오늘 이걸로 무엇을 할 수 있는지

유용한 답변은 거의 달라지는 것이 없다는 것이며, 그 이유를 정확히 말할 가치가 있습니다. Gemini 4 Argon도 Carbon도 OrcaRouter에 없습니다. 둘 중 어느 것을 우리 자체 카탈로그에서 조회해도 아무것도 반환되지 않으며, Google이 둘 중 하나를 호출 가능하게 만들기 전까지는 계속 아무것도 반환하지 않을 것입니다. Gemini 4라는 이름은 라우팅할 수 있는 대상이 아닙니다. 그것은 제한된 롤아웃에 붙은 이름입니다. 지금 "Gemini 4 Carbon" 접근을 제공하는 모든 계정은 이름표를 팔고 있는 것입니다.

실제로 중요한 것은 그 유출 정보가 비교 기준으로 삼는 모델이다. Claude Opus 5.5는 Anthropic의 정가로 OrcaRouter에서 라이브 상태입니다 — 백만 토큰당 입력 $4.00, 출력 $20.00, 캐시 읽기는 백만 토큰당 $0.20이며, 마크업 없이 그대로 전달됩니다 — 즉 Carbon이 비교 대상으로 언급되는 바로 그 모델을 오늘 바로, 다른 모든 것과 동일한 API 키로 호출할 수 있습니다. 이는 유출 정보보다 더 유용한 사실인데, 비교의 양쪽 중 검증할 수 있는 쪽이 바로 이것이기 때문입니다.

소문을 견뎌 내는 태도는 그 소문이 사실일 필요가 없는 태도입니다. 가장 까다로운 코딩 워크로드 뒤에는 Claude Opus 5.5를 두고, 그만한 성능이 필요 없는 트래픽에는 더 저렴한 티어로 넘어가는 페일오버 규칙을 유지하세요. 진짜 Gemini 4 식별자가 공급자 카탈로그에 등장하는 날에는, Google이 가격을 정하는 바로 그날 우리의 정가가 업데이트됩니다. 공급업체가 가격을 공개하는 것과 우리가それを 그대로 전달하는 것 사이에 재협상 단계가 없기 때문입니다. 200개 이상의 모델을 위한 하나의 API는 "마이그레이션해야 하나?"를 라우팅 DSL 편집과 실시간 트래픽에서의 A/B 테스트로 바꿔 놓습니다. 읽어서 아는 이름이 아니라 결과를 기준으로 라우팅하세요.

A screenshot of Google's own Gemini API models documentation page, listing the Gemini 3.8 family and earlier models with their model codes and pricing, and containing no entry for Gemini 4 Argon or Gemini 4 Carbon.A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, showing the model id, its capability chips, a 1M-token context window, a 128K maximum output, and pricing of .00 per 1M input tokens and 0.00 per 1M output tokens with cache reads at /bin/bash.20 per 1M.

우리가 보고 있는 것

• 구글이 과연 무슨 말이라도 하는지 여부. 댓글 하나, 패밀리 페이지 변경 하나, 출시 게시물의 한 줄이라도 있다면 이 모든 것이 단번에 유출 칼럼에서 빠져나올 것이다. 침묵은 이 모든 것을 현재 자리에 그대로 붙잡아 둔다.

• Argon 롤아웃의 두 번째 단계. 이 발표는 유료 API 고객과 Ultra 구독자를 검증된 방어자 다음의 차기 코호트로 묘사했으며, Gemini 4 식별자의 등장은 “발표됨”을 “호출 가능함”으로 바꾸는 사건이다. 실행 가능한 엔드포인트가 등장한다면, 그 체크포인트가 Barium-B인지 아니면 더 새로운 것인지라는 질문이 구체화된다.

• Carbon에 대한 독립적인 측정이라면 무엇이든. 이런 체크포인트가 직원의 인상이 아니라 중립적인 리더보드에 등장하는 순간, Opus 5.5라는 문장은 더 이상 느낌이 아니라 데이터 포인트가 되기 시작한다 — 아니면 더 이상 사실이 아니게 된다.

• 가격표. 구글이 자사 엔지니어들이 선호하는 프런티어 체크포인트에 가격을 매기는 지점이, Carbon이 Argon 업데이트인지 아니면 그 자체로 하나의 티어인지를 판별하는 단서다.

• 코드네임 관계가 출시와의 접촉을 견뎌내고 살아남을 수 있는지. Argon 뒤에 있는 Barium-B와 그 곁의 Carbon은 오늘날 깔끔한 이야기다. 출시 게시물은 깔끔한 이야기를 하나의 모델, 하나의 ID로 뭉개버리는 습성이 있다.

이것을 과장하지 않는 요약은 짧습니다. 구글 직원들이 Carbon이라는 내부 Gemini 4 체크포인트를 테스트하고 있다고 알려져 있으며, 초기 인상은 Claude Opus 5.5처럼 코딩한다는 것입니다. 공개된 Gemini 4 Argon 릴리스의 기반이 된 체크포인트는 Barium-B라는 다른 것이고, Carbon이 언젠가 제품이 될지 — 업데이트인지, 별도 모델인지, 아무것도 아닌지 — 는 확인되지 않았습니다. 그 문장에서 실행에 옮길 수 있는 절반은 Claude Opus 5.5를 지목하는 절반입니다. 왜냐하면 그것이 이 문단에서 모델 식별자와 가격, 엔드포인트를 갖춘 유일한 모델이기 때문입니다. 호출할 수 있는 것은 계속 호출하고, 다른 이름이 호출 대상이 되는 날을 대비해 페일오버 규칙을 준비해 두세요.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트