
Gemini 3.8 Live Extended Thinking vs Gemini 3.8 Live: 중요한 38점을 위해 4배를 지불하다
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
두 모델, 하나의 출시, 하나의 요금표, 그리고 대부분의 기사가 한결같이 같은 방향으로 잘못 짚는 하나의 결정. Gemini 3.8 Live Extended Thinking과 Gemini 3.8 Live는 2026년 9월 15일에 함께 출시되었습니다. 둘 다 Gemini 3 Pro를 기반으로 하고, 둘 다 97개 언어를 처리하며 대화 중 자동 전환을 지원하고, 둘 다 거의 실시간 시각 입력을 받아들이고, 둘 다 생성된 오디오에 SynthID로 워터마크를 넣습니다. Artificial Analysis가 공개하는 종합 Speech to Speech Index에서 두 모델은 6.6점 차이입니다 — 82.6 대 76.0. 같은 리더보드가 측정하는 시간당 오디오 비용에서는 두 모델이 4배 조금 넘게 차이 납니다.
그 둘 중 어느 것도 당신의 아키텍처를 결정해야 할 숫자는 아닙니다. 결정해야 할 숫자는 38입니다: τ-Voice, 즉 에이전트형 작업 완료 구성 요소에서 두 변형 사이의 격차인데, 여기서 추론 변형은 복제된 고객 서비스 시나리오의 68.6%를 해결하고 표준 변형은 30.1%를 해결합니다. 당신은 좋은 모델과 더 나은 모델 중에서 선택하는 것이 아닙니다. 당신은 대화형 인터페이스와, 말을 하기도 하는 추론 시스템 중에서 선택하는 것이며, 가격 차이는 그 선택에서 가장 덜 흥미로운 부분입니다.
실제로 청구되는 단위로 본 가격 포크
청구서부터 시작하세요. 사람들이 제대로 짚고 나서 지나치게 비중을 두는 부분이 바로 그것이기 때문입니다. 두 모델 모두 Live API를 통해 동일한 공개 요금을 적용합니다. 오디오 입력은 분당 $0.005, 오디오 출력은 분당 $0.018이며, Extended Thinking 쪽에서는 해당 출력 토큰에 사고 과정이 포함됩니다. 같은 카드, 같은 요금이며, 추론을 위한 별도의 프리미엄 티어는 없습니다.
차이는 분이 아니라 작업량을 측정할 때 드러난다. Artificial Analysis의 입력 오디오 시간당 비용 열 — 고정된 40개 질문 Big Bench Audio 하위 집합을 완료하는 비용을 시간당 수치로 정규화한 값 — 은 두 모델을 완전히 다른 구간에 놓는다:
• Gemini 3.8 Live Extended Thinking (High) — 입력 오디오 1시간당 $3.50, Artificial Analysis 자체 측정 기준
• Gemini 3.8 Live — 시간당 $0.84, 그 게시판에서 가장 낮은 유료 요금
• GPT-Live-1 (Astra 백엔드, 중간 수준 노력) — 시간당 $5.83, 따라서 추론 변형은 자신이 능가하는 모델보다 약 40% 저렴하다
• Grok Voice Think Fast 2.0 High — 시간당 $4.80
• GPT-Realtime-2.1 High — 시간당 $10.75
그것이 바로 분기점입니다: 동일한 공개 분당 요율인데도 시간당 오디오 비용이 네 배입니다. 추론 변형이 같은 양의 청취를 처리하면서 더 많은 토큰을 소비하기 때문입니다. 표준 모델의 $0.84는 할인이 아니라, 전체 보드의 하한선입니다.
38점으로 무엇을 살 수 있나
합성 이미지를 분리하고 나면, 두 모델은 더 이상 한 쌍처럼 보이지 않습니다:
• 음성 대 음성 지수 — Gemini 3.8 Live Extended Thinking (High) 82.6 vs Gemini 3.8 Live 76.0
• 에이전트 성능(τ-Voice 작업 완료) — 68.6% vs 30.1%
• 음성 추론(Big Bench Audio) — 98% 대 92%
• 대화 역동성 — 91.9% vs 96.1%
• 아레나 선호도(Elo) — 990 대 1083
• 작업 성공률 — 89.1% vs 93.2%
• 첫 오디오까지의 시간 — 1.35초 vs 1.18초
• 입력 오디오 시간당 비용 — $3.50 vs $0.84
솔직하게 읽어 보면, 더 저렴한 모델이 여덟 개 항목 중 네 개에서 이긴다. 첫 오디오까지 더 빠르고, 아레나에서 더 선호되며, 얕은 작업을 완수할 가능성이 더 높고, 대화 역학에서 더 좋은 평가를 받는다 — 마지막 항목은 위로상이 아니다. 왜냐하면 대화 역학은 통화자가 알아차리는 것이기 때문이다. 이 모델이 할 수 없는 것은 단계가 있는 작업을 끝내는 일이다. 30.1% 대 68.6%는 이번 릴리스 어디에서나 가장 큰 단일 격차이며, 에이전트와 인터페이스를 구분하는 단 하나의 축에 놓인다.
그 행들에는 두 가지 유의점이 있습니다. 지수 안의 아레나 선호도 수치는 모델이 공개 자격을 얻는 시점에 고정되므로, 실행 중인 Elo가 아니라 스냅샷입니다. 즉, 실시간 Speech Agent Arena 차트가 아니라 특정 시점의 평점으로 읽어야 합니다. 그리고 τ-Voice 보드 최상위권은 접전입니다. 추론 변형의 68.6%가 67.9%(Astra 백엔드, medium effort)의 GPT-Live-1을 0.7포인트 앞서며, GPT-Live-1(Sol, low effort)이 59.3%, Grok Voice Think Fast 2.0 High가 56.5%로 뒤를 잇습니다. GPT-Live-1에 대한 0.7포인트 우위는 노이즈 범위 안입니다. 이 쌍 안의 38포인트 격차는 그렇지 않습니다.

나머지 4배: 추론 티어가 코드로 치르게 하는 대가
이번 릴리스에는 두 번째 포크가 있으며, 그것은 어떤 리더보드에도 나타나지 않습니다. 두 모델은 그대로 갈아 끼워 쓸 수 있는 호환 대상이 아닙니다. 추론 변형이 클라이언트가 준수해야 하는 계약을 바꾸기 때문입니다.
표준 모델에서 Gemini 3.8 Live는 Live API 클라이언트가 기대하는 방식으로 동작합니다: 백그라운드 도구 및 API 호출은 모델이 계속 말하는 동안 실행되며, turnComplete: true는 여전히 턴의 끝을 표시합니다. 선택할 사고 수준 설정은 없습니다. 따로 구성할 것이 없기 때문입니다 — 모델이 답하고, 답이 끝나면 턴이 끝납니다.
에서는Gemini 3.8 Live Extended Thinking세 가지가 동시에 바뀝니다:
• 함수 호출은 항상 비동기입니다. 블로킹 도구 선언은 얌전히 대기열에 들어가지 않습니다 — 하드 오류를 반환합니다. 표준 모델용으로 작성한 모든 도구 스키마는 비블로킹으로 다시 선언해야 합니다.
• 새로운 상태 필드가 실제 상태를 전달합니다. 클라이언트는 interaction_status를 읽어야 하며, turnComplete를 신뢰하는 대신, 이 필드는 모델이 아직 추론 중이거나 도구가 아직 실행 중일 때 IN_PROGRESS를 나타내고, 전체 작업이 완료되었을 때만 IDLE로 전환됩니다. 턴은 작업이 끝나지 않았는데도 종료될 수 있습니다.
• 사고 깊이는 조절 손잡이입니다. 이 모델은 구성 가능한 추론 수준 — 낮음, 중간, 높음 — 을 제공하며, 보드의 82.6 및 68.6 수치는 (높음) 구성입니다. 낮음으로 낮추면 품질과 토큰 비용이 모두 달라지며, 인덱스에는 낮음 설정이 작업 완료 측면에서 어떤 비용을 치르게 하는지 알려주는 것이 없습니다.
세 번째 요점은 마이그레이션 함정입니다. Extended Thinking은 툴 호출이 관여하기 전까지는 표준 모델과 네트워크상에서 동일하게 응답하므로, 팀은 모델 ID를 바꾸고 작동하는 데모를 확인한 뒤, 예약 도구가 결과 대신 오류를 반환하는 프로덕션 단계에 이르러서야 비동기 계약을 발견하게 될 수 있습니다. 4× 오디오 요율과 함께 클라이언트 리팩터링 비용도 예산에 포함하세요. 성숙한 통합에서는 두 비용 중 더 큰 쪽이 이 비용입니다.
워크로드가 실제로 요구하는 것은 어느 쪽인가
결정을 내리는 깔끔한 방법은 그 세션이 얼마나 똑똑하기를 바라는지가 아니라, 무엇을 위한 것인지를 묻는 것이다.
대화 자체가 결과물일 때는 Gemini 3.8 Live를 택하세요. 응대하기, 대화 맥락 이어가기, 메시지 받아두기, 발신자 자격 확인하기, 그리고 친절하고 빠르고 저렴하기. 입력 오디오 1시간당 $0.84로, 현재 공개된 유능한 음성 모델 중 가장 저렴하며, 아레나에서 선호되고, 얕은 작업에서 더 안정적이며, 첫 오디오까지 170밀리초 더 빠릅니다 — 발신자가 체감하는 차이입니다. 받아들여야 할 단 한 가지는 상한선입니다. 다단계 작업 완료율 30.1%는 단계가 있는 일을 끝내지 못한다는 뜻이며, 아무리 프롬프트 엔지니어링을 해도 그 숫자는 움직이지 않습니다.
을 선택하세요.Gemini 3.8 Live Extended Thinking세션에 처리할 작업이 있을 때 말입니다. 예약, 변경, 취소, 계정 문제 해결, 통화자가 기다리는 동안 여러 단계로 된 절차를 안내하기. 그것이 바로 38점 라인이고, 시간당 $3.50의 가치가 있습니다. 참고로 이는 이 모델이 종합 점수에서 앞서는 두 모델보다 여전히 저렴합니다. 기다림을 견딜 만하게 만들어 주는 내레이션 동작도 함께 얻을 수 있습니다. 이 모델은 추론과 발화를 동시에 하므로, 무언가를 조회하는 동안 침묵하는 대신 통화자는 "확인해 볼게요…"라는 말과 함께 진행 상황을 듣게 됩니다. 이는 전이중(full-duplex) 아키텍처가 오디오를 결코 멈추지 않는 방식으로 해결하는 것과 같은 문제인데, Google의 답은 작업을 하면서 계속 말하는 것입니다.
따져볼 만한 두 개의 행이 더 있습니다. Google은 또한 Sierra의 τ³-Banking 리더보드에서 Extended Thinking 모델이 35.1%를 기록했다고 보고했는데, 이는 GPT-Live-1 Astra의 32.0%와 대비됩니다. 이 수치는 독립적인 검증이 뒷받침되지 않은 공급업체 보고 수치이며, 절대적인 기준에서 보면 냉정하게 만드는 수치입니다. 35.1%는 해당 리더보드에서 가장 우수한 모델이 현실적인 은행 업무 시도 세 번 중 약 두 번을 실패한다는 뜻이기 때문입니다. 그리고 Google이 자체 자료에서 인용하는 Speech Agent Arena에서 표준 모델이 차지한 2위는 작업 완료가 아닌 선호도를 측정하는 다른 리더보드에서 나온 실제 결과입니다. 두 진술 모두 성립합니다. 이 둘을 종합하면, 저렴한 모델은 대화 상대가 되는 데 매우 뛰어나고, 비싼 모델은 둘 중 실제로 작업을 맡길 수 있는 유일한 모델이라는 것을 말해줍니다.
두 통합 없이 둘 다 실행
이 모든 것에 대한 실용적인 반론은 워크로드별로 선택한다는 것이 두 개의 경로를 유지보수하는 것을 의미한다는 점이다. 꼭 그럴 필요는 없다. 두 변형 모두 동일한 부류의 백엔드 앞에 위치한다 — 백그라운드 도구 실행과 다단계 계획은 평범한 텍스트 모델 호출로 귀결된다 — 그리고 그 계층이 바로 비용 편차가 존재하는 곳이며, 전환이 저렴한 곳이다.
OrcaRouter는 단일 키로 190개 모델을 공급자 정가 그대로, 마크업 없이 제공합니다. 따라서 벤더 가격이 변경되면 다음 계약 갱신 때가 아니라 같은 날 바로 우리 쪽에 반영됩니다. 저렴한 대화형 계층과 값비싼 추론형 계층 사이를 라우팅하는 스택에서 중요한 두 가지 속성은 음성 통합을 건드리지 않고도 라이브 트래픽에서 위임 대상을 교체할 수 있다는 점과, 백엔드에서 오류가 발생하거나 타임아웃될 때 자동 페일오버가 세션을 계속 살려 둔다는 점입니다. 우리가 호스팅하는 것과 하지 않는 것을 정확히 말하자면, Gemini 3.8 Live 및 Gemini 3.8 Live Extended Thinking 엔드포인트는 우리 라우터에 없습니다 — 이들은 Google 자체 API, 즉 Gemini API, Live API 및 Google AI Studio에서 제공됩니다. 이러한 에이전트가 작업을 넘기는 텍스트 모델은 매우 자주 우리 라우터에 있으며, Gemini 3.8 Flash도 그중 하나입니다.
각 모델이 보드에서 어디에 위치하는지
아래 캡처는 2026년 9월 16일에 찍은 것이며, Speech to Speech Index의 상단은 다음과 같습니다:
• Gemini 3.8 Live 확장 사고(높음) — 82.6, 1위
• GPT-Live-1 (Astra 백엔드, 중간 노력) — 81.5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1 (Sol 백엔드, 낮은 노력) — 80.1
• Gemini 3.8 Live — 76.0, 5위
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71.5
그 목록을 읽는 동안 한 가지 명명 참고 사항: (High) 접미사는 이 모델에 대한 보도에서 붙는 것으로, 추론 강도 구성 레이블이며 별도의 릴리스가 아닙니다. 이는 보드가 Grok Voice Think Fast 2.0 High 및 GPT-Realtime-2.1 High에 사용하는 것과 동일한 관례입니다.

아직 커밋되지 않은 것은 무엇인가요?
이 두 모델에 관해 한 가지는 쉽게 오해하기 쉬우므로 분명히 말해 둘 가치가 있습니다. 두 모델 모두 계약상 의미에서 일반 제공되는 것은 아닙니다. 비록 둘 다 가격이 책정되어 있고 문서화되어 있기는 하지만요.
개발자는 Gemini 3.8 Live를 Gemini API, Live API 및 Google AI Studio에서 ID gemini-3.8-live로 이용할 수 있습니다. 기업은 Gemini Enterprise에서 비공개 프리뷰로 이용할 수 있으며, Gemini Enterprise for Customer Experience는 출시 예정으로 안내되어 있습니다. 소비자는 Search Live에서 이용할 수 있습니다. Gemini 3.8 Live Extended Thinking은 gemini-3.8-live-extended-thinking으로 동일한 개발자 인터페이스를 제공하며, 소비자 접근 경로도 더 넓습니다 — Gemini Live, Google AI Pro 및 Ultra 구독자를 위한 Docs Live, 모든 Google AI 구독자를 위한 Gmail Live와 Keep Live. Workspace 비즈니스 고객은 출시 예정으로 안내되어 있습니다.
빠진 것은 기업이 이 서비스를 매출 라인에 올리기 전에 필요로 하는 것입니다: 정식 출시(GA) 약속, 공개된 가동률 수치, 그리고 Google이 유지하겠다고 약속한 요금입니다. 가격은 공개되어 있지만, 프리뷰 가격은 변하기 마련입니다. 지금 프로토타입을 만들고 마이그레이션을 계획하되, 제시받지 않은 가용성 목표에 서명하지 마십시오.

이 두 모델이 실제로 제시하는 결정은 지수가 보여주는 것보다 더 좁으며, 품질 사다리가 아닙니다. 에이전트의 임무가 대화라면, 저렴한 모델은 타협이 아닙니다 — 그것은 더 낮은 가격에 더 나은 제품이며, 4배 더 저렴한 요금은 논거라기보다 보너스입니다. 에이전트의 임무가 뭔가를 완수하는 것이라면, 추론 변형은 둘 중 그 작업을 맡을 수 있는 유일한 모델이며, 시간당 $3.50은 그렇지 않으면 실패할 예약에 비하면 반올림 오차에 불과합니다. 피해야 할 실수는 차이를 절충하는 것입니다: 좋은 대화만 필요했던 작업에 추론 깊이를 위해 비용을 지불하는 것, 이는 팀이 6.6점 종합 격차를 읽고 38까지 스크롤하지 않을 때 발생하는 일입니다.
