Gemini 3.8 Live라는 제목의 생성된 히어로 카드에는 굵은 미확인 배지가 있고, 부제는 'Google Cloud 할당량 페이지에 있는 두 개의 미공개 음성 슬러그 - 지금까지 알려진 내용'이며, 칩에는 '출처: X/@testingcatalog', '2026년 9월 15일' 그리고 '비공개 - 모델 카드 없음'이라고 적혀 있고, 세 개의 카드에는 '보고된 슬러그: Gemini 3.8 Live', '보고된 슬러그: Live Extended Thinking' 그리고 '오늘의 라이브 라인: gemini-3.1-flash-live-preview, 2026년 3월'이라고 적혀 있으며, 바닥글은 '두 슬러그 모두 미확인 - Google은 어느 쪽도 인정하지 않았습니다.'입니다.
Guides & Insights

Gemini 3.8 라이브 유출: 두 개의 새로운 음성 슬러그, 그리고 "라이브 확장 사고"가 더 중요한 이유

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이번 주 GCP 할당량 페이지에서 어떤 공개 문서에도 등장하지 않는 두 개의 문자열이 발견되었습니다: Gemini 3.8 Live, 그리고 Live Extended Thinking이라는 무언가였습니다. 이들은 릴리스 추적 계정 @testingcatalog에 의해 포착되어 9월 15일에 게시되었으며, 둘 다 공개된 것이 아니라는 단도직입적인 단서가 붙었습니다. 지금까지의 공개 기록은 이것이 전부입니다 — 모델 카드도, 가격 정보도, API 변경 로그 항목도, 공식 확인도 없습니다. 하지만 이 두 이름은 아주 또렷하게 읽히는 흐름의 끝에 자리하고 있습니다.Gemini 3.1 Flash Live는 여전히 회사 자체 문서가 Live API 작업에 권장하는 모델이며, Gemini 3.5 Live와 Gemini 3.5 Live Experimental은 8월 26일 Gemini Audio 패밀리로 등장했고, 같은 패밀리의 텍스트 쪽인 — Gemini 3.8 Flash — 는 9월 2일부터 출시되어 왔습니다. "3.8 Live"라면 그 격차를 메울 수 있을 것입니다. 두 번째 슬러그가 둘 중 더 흥미롭습니다.

먼저 레이블부터. 유출 보도는 레이블에 따라 성패가 갈리기 때문이다. 이것은 출시가 아니다. 어느 슬러그도 구글이 발표하거나 문서화하거나 가격을 책정하거나 확인하지 않았다. 그리고 출처는 출시를 추적하는 단일 계정뿐이다. 아래에서 Gemini 3.8 Live와 Live Extended Thinking에 관한 모든 내용은 검증되지 않았다. 이미 출시된 모델 — Gemini 3.1 Flash Live, Gemini 3.5 Live, Gemini 3.8 Flash — 에 관한 아래의 모든 내용은 문서화되어 있고 확인 가능하며, 어느 것이 어느 것인지 곳곳에 표시해 두었다.

시그널이 말하는 것과 말하지 않는 것

• 보고됨 — "Gemini 3.8 Live"와 "Live Extended Thinking"이라는 두 개의 슬러그가 Google Cloud 할당량 페이지에 나타났으며, 9월 15일에 "비공개"라는 메모와 함께 게시됨

• 보고되지 않음 — 발표, 모델 카드, 가격, 컨텍스트 윈도우, 출시일, API ID, 어떠한 벤치마크 수치 또는 Google로부터의 어떠한 확인

• 교차 검증 — 이 글을 쓰는 시점 기준으로 없음. Google의 Gemini API 모델 페이지는 9월 4일에 마지막으로 업데이트되었으며, 정확히 두 개의 대화형 Live 모델을 나열합니다: gemini-3.1-flash-live-previewgemini-3.5-live-translate-preview, 그리고 어느 쪽도 "Live Extended Thinking" 변형을 갖고 있지 않습니다

• 같은 브리핑, 별도의 주장 — 동일한 9월 15일 게시물은 또한 Grok 4.7이 "Opus 5.0 근처에 출시되어야 하며, 5.1은 아니다"라고 예측했고, 그 멀티모달 작업은 "여전히 개선이 필요하다"고 했다. 그것은 다른 벤더의 모델이며 아티팩트가 아니라 예측이다. 여기서는 출처의 완전성을 위해서만 언급한다

• 이름 자체가 내포하는 바 — Google Cloud의 할당량 항목은 모델별 SKU이므로, 이는 소비자용 Gemini 앱 내부의 기능이라기보다는 유료 API 모델을 뒷받침합니다. 이는 해당 문자열이 등장한 표면으로부터의 추론일 뿐, 확인된 사실이 아닙니다.

A generated six-row scoreboard titled 'Gemini 3.8 Live - the scoreboard', rows reading 'Status: leak - quota page only, not public', 'Reported slugs: Gemini 3.8 Live + Live Extended Thinking', 'Live line today: gemini-3.1-flash-live-preview, March 2026', 'Thinking control: thinkingLevel minimal/low/medium/high', 'Text sibling: Gemini 3.8 Flash, shipped Sept 2', 'Independent score: none - nothing to test', with the footer 'Gemini 3.8 Live and Live Extended Thinking unverified; Live-line details per Google's Gemini API docs.'

쿼터 페이지가 모델이 가장 먼저 유출되는 곳인 이유

이 부분은 이해할 가치가 있습니다. 왜 두 단어짜리 산출물이 글 한 편 전체를 차지할 만한지 설명해 주기 때문입니다. 할당량 페이지는 마케팅용 표면이 아닙니다. 그것은 청구 및 속도 제한 인프라입니다. Cloud 고객이 호출할 수 있는 모든 모델은 첫 유료 요청이 처리되기 전에 프로젝트별 할당량 항목이 필요하며, 그 항목은 모델을 정식 출시할 수 있도록 준비하는 동일한 엔지니어링 작업을 통해 프로비저닝됩니다. 거기에 슬러그가 나타난다는 것은 누군가가 SKU를 위한 기반 구조를 구축했다는 뜻이지, 누군가가 보도자료 초안을 작성했다는 뜻이 아닙니다.

그것은 양날의 검이다. 그리고 솔직한 해석은 신중한 쪽이다. 쿼터 항목은 연구 논문 속 코드명보다 더 진전된 단계인데, 이는 의도된 고객 대면 접점을 함의하기 때문이다. 그것은 또한 출시 전에 만들어지고, 테스트되고, 조용히 이름이 바뀌는 바로 그런 종류의 것이다. 이 패밀리의 텍스트 쪽은 그것을 구체적으로 보여줄 만큼 빠르게 움직였다: Gemini 3.6 Flash는 7월 21일에, Gemini 3.7 Flash는 8월 13일에, Gemini 3.8 Flash는 9월 2일에 나왔다 — 6주 동안 세 번의 Flash 릴리스다. 그렇게 빠르게 반복하는 모델 라인은 그 이름들로 출시하는 것보다 더 많은 SKU를 준비해 두는 라인이다.

Live 라인은 한 버전 뒤처진 상태로 운영되어 왔습니다

"Gemini 3.8 Live"가 단순한 작명상의 흥미거리가 아니라 진짜 이야깃거리가 되는 이유는 이것이다. 구글의 음성 모델은 텍스트 모델을 전혀 따라가지 못했다.

• 오늘 권장되는 Live API 모델 — gemini-3.1-flash-live-preview, 2026년 3월 최신 업데이트 기준, Google 자체 문서에서 여전히 모든 Live API 사용 사례에 사용하도록 권장되는 모델로 설명됨

• 한계 — 입력 토큰 131,072개와 출력 토큰 65,536개로, 텍스트, 이미지, 오디오, 비디오를 입력받아 텍스트와 오디오를 출력합니다

• 8월 26일에 발표된 Gemini Audio 제품군 — Gemini 3.5 Live, Gemini 3.5 Live Experimental 및 Gemini 3.5 Transcribe, Transcribe 모델은 음성-텍스트 변환을 위해 Chirp 3를 대체합니다.

• 한편 텍스트 라인은 — Gemini 3.5 Flash, Gemini 3.6 Flash, Gemini 3.7 Flash 및 Gemini 3.8 Flash — 거의 같은 기간에 네 개의 공개 버전을 거쳤습니다.

A screenshot of Google's Gemini API documentation page for gemini-3.1-flash-live-preview, captured September 15, 2026, showing the banner 'Gemini 3.8 Flash is now available', the heading 'Gemini 3.1 Flash Live preview' described as a low-latency audio-to-audio model, model code gemini-3.1-flash-live-preview, supported data types text/images/audio/video in and text and audio out, an input token limit of 131,072 and an output token limit of 65,536, and capability chips including Live API Supported and Thinking Supported.

그래서 오디오 라인은 3.5 세대에 있는 반면, 텍스트 라인은 3.8에 있습니다. "Gemini 3.8 Live" 슬러그는 구글이 음성을 다시 텍스트와 같은 세대로 올리려 한다는 첫 번째 증거입니다 — 이는 음성 에이전트를 만드는 사람이라면 누구나, Live 세션 아래의 추론이 한 세대가 아니라 한 번에 세 텍스트 모델 세대만큼 뛰어오를 수 있다는 뜻입니다.

왜 "Live Extended Thinking"이 더 흥미로운 슬러그인가

오늘날 Gemini Live 모델에서 사고는 모델이 아니라 다이얼입니다. Live API는 thinkingLevel 매개변수를 제공하며, 여기에는 네 가지 설정 — minimal, low, medium, high — 이 있고 기본값은 minimal이며, 가장 낮은 지연 시간을 위해 명시적으로 선택되었습니다. 그 기본값은 이 제품이 무엇을 위한 것인지 알려 줍니다: 잠시 멈추는 것조차 버그로 취급되는 대화입니다.

"Live Extended Thinking"이라는 별도 슬러그는 Google이 이를 하나의 다이얼이 아닌 두 개의 제품으로 분리할 준비를 하고 있음을 시사하며, 그 근거는 간단합니다. 음성 모델에서 지연 시간과 숙고는 직접적으로 상충합니다. 즉, 즉시 답변하면서 답변 전에 깊이 생각할 수는 없습니다. 따라서 토글이 있는 단일 모델은 모든 호출자가 모든 요청마다 그 선상의 한 지점을 선택하도록 강제합니다. 두 개의 SKU를 사용하면 고객이 빠른 경로(중단 처리, 끼어들기, 빠른 조회)와 느린 경로(다단계 작업을 처리하는 음성 에이전트)를 각각 다르게 튜닝된 엔드포인트로 라우팅할 수 있으며, 한쪽이 다른 쪽을 저하시키지 않습니다.

그 선례는 이미 Google 자체의 8월 출시 안에 존재한다. Gemini 3.5 Live Experimental은 "말하면서 직접 추론"할 수 있고 작업 중 진행 상황을 단계별로 설명할 수 있는 변형으로 묘사되었다 — 명시적으로 사고 성향을 띤 음성 모델로, 설정이 아니라 자체 ID로 출시되었다. "Live Extended Thinking"은 그런 본능이 실험적 라벨에서 이름 붙은 제품으로 승격하는 것처럼 읽힌다. 그것은 문자열로부터의 추론이고, 추론이긴 하다 — 하지만 이 특정 제품 라인이 이전에 보상해 온 종류의 추론이다.

오늘 실제로 전화할 수 있는 것

여기 있는 어떤 내용도 지금 당장 당신이 접근할 수 있는 것을 바꾸지 않습니다. 그리고 이 점은 솔직하게 말할 가치가 있습니다. 호출할 수 있는 Gemini 3.8 Live 엔드포인트는 없고, 켤 수 있는 Live Extended Thinking 설정도 없으며, 둘 중 어느 것에도 접근 권한을 살 방법도 없습니다. 오늘날 "Gemini 3.8 Live 액세스"를 판매하는 계정은 모델이 아니라 이름표를 파는 것입니다. 당신이 실제로 사용할 수 있는 Live 모델은 gemini-3.1-flash-live-preview와 gemini-3.5-live-translate-preview이며, 둘 다 Google 자체 API를 통해 프리뷰로 제공됩니다.

텍스트 쪽은 상황이 다릅니다. 그리고 실제로 라우팅이 가능한 부분이 바로 여기입니다. Gemini 3.8 Flash — 9월 2일 출시되었고, Google 자체 정가 기준 입력 토큰 100만 개당 $0.75, 출력 100만 개당 $3.75이며, 2027년 1월 1일에는 $1.50와 $7.50로 두 배 인상될 예정입니다 — 동일한 정가로 OrcaRouter에서 실행되며, 여기에 0% 마진만 더해집니다. 인상이 사전 예고된 모델에서는 패스스루 가격 책정이 평소보다 더 중요합니다. 1월 요율이 발효되는 날 이곳의 가격도 같은 날 바뀌며, 재협상할 두 번째 계약도, 고쳐야 할 코드도 없습니다.

The OrcaRouter model page for google/gemini-3.8-flash, showing the Google vendor name and the 2026-09-02 date, a 1M-token context window, 65K max output, text, image, video, file and audio input with text output, a p50 time-to-first-token of 3.46s, and pricing of $0.75 per 1M input tokens and $3.75 per 1M output tokens.

음성 라인은 오늘날 OrcaRouter에 없습니다. 어떤 공급업체의 Live 또는 네이티브 오디오 SKU도 마찬가지입니다. 따라서 여기 있는 어떤 내용도 우리가 그것을 호스팅한다는 뜻으로 읽혀서는 안 됩니다. 라우팅 계층이 진정으로 유용한 지점은 이 이야기의 나머지 절반에 있습니다. 3.8세대 Live 모델이 실제로 출시되고, 그 옆에 사고형 변형 두 번째가 출시되면, 빠른 음성 경로와 숙고하는 경로 중에서 선택하는 일은 재작성이 아니라 라우팅 결정이 됩니다. 하나의 키 뒤에 두 엔드포인트가 있고, 구축 대상으로 삼았던 preview id가 폐기될 경우 자동 페일오버가 제공됩니다. 올해 이미 한 번 이름을 바꾼 라인에서, 그것은 가정이 아닙니다.

무엇이 이것을 확증해 주며 — 무엇이 이것을 무효로 만들까

유출 기사라면 그것이 어떻게 틀릴 수 있는지 알려주어야 한다. Gemini 3.8 Live와 Live Extended Thinking의 경우, 이를 뒷받침하는 증거는 구체적이고 검증 가능하다:

• 할당량 항목이 공개되는 것 — 동일한 슬러그가 스크린샷에만 있는 것이 아니라, 속도 제한이 붙은 Google Cloud 또는 Vertex AI 모델 목록에 나타나는 것

• Gemini API 변경 로그 항목 또는 모델 페이지의 행으로, 현재 gemini-3.1-flash-live-preview와 gemini-3.5-live-translate-preview에서 끝납니다.

• DeepMind 모델 카드 — 8월 오디오 모델은 보도에서 Live와 Transcribe로 불렸지만, 그 카드에는 "Gemini 3.5 Audio"로 기록되어 있었으므로, 이 카드가 이름을 확정하는 근거 자료다

• 가격 책정 항목 — 준비된 SKU를 누군가 구매할 수 있는 제품으로 만들어 주는 단 하나의 요소

• 반증 — 슬러그들의 이름이 바뀌거나, 기존 모델의 사고 설정에 편입되거나, 아니면 그저 다시는 나타나지 않는 것. 세 가지 모두 할당량 페이지에서 흔한 결과이며, 그중 어느 것이든 이 글이 옳았다기보다는 시기상조였음을 뜻한다.

무엇을 주시하고, 누가 행동해야 하는가

Live API에서 음성 에이전트를 구축하고 있다면, 이번 주에 아키텍처를 바꿀 필요는 전혀 없습니다 — 기반으로 삼을 모델은 여전히 gemini-3.1-flash-live-preview이며, 솔직한 조언은 모델 ID를 구성 값 뒤에 두고 두 번째 Live 엔드포인트를 대기 상태로 유지하라는 것입니다. 왜냐하면 이 라인은 이미 한 번 이름을 바꿨고 또 그럴 수 있기 때문입니다. 텍스트 모델을 선택하는 중이라면 이 유출은 당신과 무관합니다. Gemini 3.8 Flash는 출시되어 지금 가격이 책정되고 측정 가능하며, 더 유용한 질문은 음성 슬러그가 아니라 1월 가격 변경입니다.

실제로 지켜봐야 할 것은 출시가 아니다. 그것은 "Live Extended Thinking"이 두 번째 모델로 등장하는지, 아니면 첫 번째 모델의 다섯 번째 설정으로 등장하는지다. 만약 그것이 별도의 SKU라면, Google은 생각하는 음성 에이전트와 말하는 음성 에이전트가 서로 다른 제품이라고 개발자들에게 말하는 셈이다 — 그리고 그것은 이름에 들어 있는 어떤 버전 번호보다도 더 중대한 주장이다.

무엇에 라우팅 계층진정으로 유용한지가 바로 이 이야기의 나머지 절반이다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트