Gemini 3.8 Live 대 GPT-Live-1의 히어로 타이틀 카드로, 킥커는 'OrcaRouter · 모델 레이더 — 정면 대결'이고 부제는 '전이중 대 턴 기반 - 아키텍처 논쟁, 다시 읽기'다. 두 장의 카드에는 'Gemini 3.8 Live — 턴 기반, 현재 비전 지원, 97개 언어, 더 저렴한 분당 요금'과 'GPT-Live-1 — 전이중, 백채널, 프런티어 백엔드로 위임'이라고 적혀 있으며, 칩에는 지수 76.0 대 81.5, 분당 $0.018 대 $0.05, OpenAI에서 영상 곧 출시가 표시된다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성된다.
Guides & Insights

Gemini 3.8 Live vs GPT-Live-1: 전이중 vs 말하면서 생각하는 모델

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

약 두 달 동안, 그 논쟁은 아키텍처로 인해 정리되었다. GPT-Live-1은 진정한 전이중 방식이다 — 말하면서 동시에 듣고, "음"이나 "알겠어" 같은 맞장구를 내며, 초당 여러 번 말할지 양보할지 결정한다. Gemini 3.8 Live는 2026년 9월 15일에 발표된 턴 기반 모델이다. 예전의 틀에 따르면 그것 때문에 비교가 쉬웠지만, 이제는 그것이 잘못된 해석 방식이다.

달라진 것은 Google이 풀듀플렉스를 따라잡았다는 점이 아니다. 달라진 것은 Google이 풀듀플렉스가 보완하려고 쓰이던 바로 그 기능을 내놓았다는 점이다: 여러 단계로 이루어진 작업이 백그라운드에서 실행되는 동안에도 대화를 나눌 수 있는 음성 모델, 그리고 작업하는 동안 소리 내어 추론하는 두 번째 변형 모델이다. 아키텍처 차이는 실재한다. 다만 그것은 더 이상 구매를 결정하는 축이 아니다.

대화를 이어가는 두 가지 방법

전이중 방식에 대한 베팅은 대화 품질이 곧 제품이라는 것이다. GPT-Live-1은 음성-텍스트 변환 → 언어 모델 → 텍스트-음성 변환으로 연쇄하는 대신, 단일 모델 내에서 입력 및 출력 오디오를 연속적이고 동기적으로 처리한다. 이는 단계 간 정보 손실을 없애고, 사람들이 실제로 체감하는 동작을 만들어낸다: 답변 도중에 끼어들어도 적응하고, 잠시 멈추거나 배경 소음이 있어도 당신의 발언이 끝난 것으로 오인하지 않으며, 호출될 때까지 조용히 있는다.

Gemini 3.8 Live가 거는 턴 기반의 베팅은 대화가 작업을 위한 발판이라는 것이다. 그 기능들은 자연스러운 리듬을 유지하는 것이 아니라 세션을 생산적으로 유지하는 데 있다: 준실시간 시각 입력 처리, 대화 중 97개 지원 언어 간 자동 전환, 그리고 요청을 확인하고 호출이 완료될 때까지 계속 말하는 백그라운드 도구 및 API 실행.

두 모델 모두 생각하는 동안 당신과의 통화를 끊기를 거부한다. 다만 거부하는 방식이 다를 뿐이다. GPT-Live-1은 오디오 스트림을 결코 멈추지 않는 방식으로 그렇게 한다. Google은 작업 중에도 말을 겹쳐서 그렇게 한다.

A two-column scoreboard comparing Gemini 3.8 Live and GPT-Live-1. Index score 76.0 vs 81.5; architecture turn-based vs full-duplex; video and screen available today vs not at launch; agentic tau-Voice not published vs 67.9%; languages 97 vs a narrower set; voice price $0.005 in and $0.018 out per minute vs $0.05 per minute plus backend tokens. Footer reads 'Index figures per Artificial Analysis, Sep 16 2026; GPT-Live-1 all-in measured at $4.47-$5.83 per hour.' The OrcaRouter logo is composited in the bottom-right corner.

인덱스가 실제로 말하는 것

Artificial Analysis는 Speech to Speech Index를 유지합니다 — 음성 추론, 에이전트 성능, 아레나 선호도, 작업 성공률의 가중 복합 지표입니다. 2026년 9월 16일에 캡처된 보드를 주의 깊게 읽어 보십시오. 헤드라인이 구조를 숨기고 있기 때문입니다:

Gemini 3.8 Live Extended Thinking — 82.6 (1위)

• GPT-Live-1 (Astra 백엔드, 중간 노력) — 81.5

Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1 (Sol 백엔드, 낮은 노력) — 80.1

Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

그 순위에서 세 가지가 도출됩니다. 첫째, Google이 1위 자리를 차지하지만, 그것은 대부분의 사람들이 배포할 변형이 아니라 값비싼 변형으로 차지한 것입니다. 둘째, GPT-Live-1이 두 번 나타나는데, 이는 Artificial Analysis가 음성 프런트엔드가 아니라 전체 시스템을 평가하기 때문입니다 — 그리고 두 구성 간의 1.4점 차이는 1위와 2위 간의 0.2점 차이보다 일곱 배 더 큽니다. 셋째, 이번 맞대결 제목에 있는 모델인 Gemini 3.8 Live는 두 GPT-Live-1 구성 아래인 5위에 자리합니다.

동일 기준으로 — 표준 티어 대 표준 티어로 — 비교한다면, GPT-Live-1이 종합 지수에서 이 맞대결을 이기며, 격차는 크다. 82.6은 Gemini 3.8 Live Extended Thinking의 수치인데, 이는 가격도 출시 방식도 다른 별개의 제품이다.

Screenshot of the Artificial Analysis Speech to Speech leaderboard page, captured September 16, 2026. The AA-Speech to Speech Index bar chart shows Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 (Astra) at 81.5, Grok Voice Think Fast 2.0 at 81.3, GPT-Live-1 (Sol) at 80.1 and Gemini 3.8 Live at 76.0, alongside speed and cost-per-hour-of-input-audio panels.

GPT-Live-1이 여전히 앞서는 부분

전이중은 마케팅상의 구분이 아니며, 벤치마크 분할은 그것이 어디에서 실제 이점으로 전환되는지를 보여줍니다:

에이전틱 성능 — GPT-Live-1은 τ-Voice에서 67.9%로 Grok의 56.5%를 상대로 결정적으로 앞서 있습니다. Google은 Gemini 3.8 Live에 대해 비교 가능한 τ-Voice 수치를 공개하지 않았으며, Extended Thinking 변형에 대해서만 68.6%를 제시했습니다.

대화 역학 — 전이중 방식의 발화 순서 교대는 여전히 자연스러움의 기준이며, 턴 기반 모델은 역사적으로 이 부분에서 뒤처져 왔습니다.

위임 깊이 — GPT-Live-1은 어려운 쿼리를 최전선 텍스트 모델에 넘기며, GPT-5.5GPT-6 Astra가 모두 백엔드로 문서화되어 있고, 추론 노력 선택기를 제공합니다.

출처 표기 — ChatGPT의 음성 전사에는 인용 링크가 함께 제공되는데, 이는 음성 상호작용 전반에서 일반적으로 흔치 않은 일입니다.

반대편에 놓이는 점은 GPT-Live-1이 순수 음성 추론에서 뒤처진다는 것입니다: Big Bench Audio에서 90.1%로 Grok의 97.2%에 못 미칩니다. 그리고 Full Duplex Bench에서의 대표적인 지연 시간 수치인 0.798초는 API의 첫 오디오까지 걸리는 시간과는 다른 측정치이며, 후자는 1.24–1.34초입니다.

Gemini 3.8 Live가 앞서는 부분

Google의 강점은 대화 자체보다 세션에서 무엇을 할 수 있는지에 더 있습니다:

비전, 현재 — Gemini는 한동안 카메라 입력과 화면 공유를 지원해 왔습니다. GPT-Live-1은 영상이나 화면 공유 없이 출시되었으며, OpenAI는 곧 지원될 예정이라 밝히면서 구형 Advanced Voice Mode를 임시방편으로 지목했습니다. Gemini 3.8 Live는 여기에 거의 실시간에 가까운 시각 입력 처리를 더합니다.

언어 지원 범위 — 대화 중간에 자동으로 전환되는 97개 지원 언어로, OpenAI 쪽의 훨씬 좁은 범위와 대조됩니다.

비용 — 공표된 요율은 오디오 입력 1분당 $0.005, 오디오 출력 1분당 $0.018입니다. GPT-Live-1은 프런트엔드만 기준으로 음성 1분당 $0.05가 청구되며, 백엔드 토큰까지 합산하면 측정된 총비용은 시간당 약 $4.47–$5.83입니다.

소리 내어 추론하는 두 번째 계층 — Gemini 3.8 Live Extended Thinking은 "잠시 확인해 볼게요…"와 같은 신호로 진행 상황을 설명하는데, 이는 침묵 문제에 대한 전이중 방식과는 다른 해답이다.

중요한 비용 비교

프런트엔드 요금은 완패나 다름없어 보인다 — 분당 $0.018 대 $0.05 — 그리고 시간당 수치는 훨씬 더 극명하다. Artificial Analysis의 입력 오디오 시간당 비용 차트는 Gemini 3.8 Live를 시간당 $1.50으로 책정하는데, 이는 GPT-Realtime-2 High의 $4.14, GPT-Realtime-2.1 High의 $10.75와 대비된다. Grok Voice Think Fast 2.0은 $4.80이다.

문제는 두 숫자 중 어느 것도 실제 청구액이 아니라는 점이다. GPT-Live-1의 분당 $0.05는 음성 프런트엔드만을 포함한다. 실제 추론을 수행하는 백엔드 텍스트 모델은 별도로 청구되며, 그래서 $0.05라는 대표 숫자가 시간당 총 $4.47–$5.83이 된다. Gemini 3.8 Live도 구조적 형태는 같다. 백그라운드 도구 실행은 텍스트 모델 작업이며, Google은 그 비용이 얼마인지 공개하지 않았다.

그러니까 솔직히 해석하자면, Gemini 3.8 Live가 초기 진입 가격에서 훨씬 더 저렴하고, 총비용 비교는 자신의 워크로드를 측정하기 전까지는 두 제품 모두 알 수 없습니다. 이는 회피가 아니라, 정보의 실제 상태입니다.

둘 모두가 위임하는 계층

이 맞대결을 보기보다 덜 락인적인 결정으로 만드는 구조적 사실이 여기 있습니다. 두 모델 모두 위임합니다. GPT-Live-1은 설계상 어려운 질의를 백엔드 텍스트 모델로 넘기고, Gemini 쪽의 백그라운드 도구 실행은 평범한 모델 호출로 귀결됩니다. 두 경우 모두 음성 프런트엔드는 추론을 수행하는 텍스트 모델 위에 놓인 얇은 계층이며, 바로 그 텍스트 계층이 비용 변동성이 존재하는 곳이고 전환이 저렴한 곳입니다.

OrcaRouter는 단일 키 뒤에 190개의 모델을 공급자 정가 그대로, 마크업 없이 제공합니다. 따라서 상위 가격 인하는 다음 계약 갱신 때가 아니라 같은 날 우리 쪽에도 반영됩니다. 음성 스택에서 중요한 두 가지 속성은 음성 통합을 건드리지 않고도 라이브 트래픽에서 위임 대상을 교체할 수 있다는 점, 그리고 백엔드에서 오류가 발생하거나 시간 초과가 일어나도 자동 장애 조치가 통화를 유지한다는 점입니다. 한 가지 분명히 하자면, 달리 암시되기 쉬운데, 우리는 Gemini 3.8 Live나 GPT-Live-1 음성 엔드포인트를 호스팅하지 않습니다. 그것들은 벤더 자체 API에서 제공됩니다. 그들이 작업을 넘기는 텍스트 모델은 일반적으로 라우터에 있습니다.

Screenshot of the OrcaRouter model page for google/gemini-3.8-flash, showing the 1M-token context window, 65K max output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and p50 time to first token of 3.35 seconds.

선택하는 방법

을 선택하세요GPT-Live-1 — 대화 품질이 곧 제품이라면, 즉 자연스러운 인터럽션 처리와 백채널, 그리고 그것을 조작하는 것이 아니라 무언가와 대화하고 있다는 느낌이 중요하다면, 그리고 총비용을 감당할 수 있다면. 다만 총비용은 표면 요금이 시사하는 것보다 상당히 높습니다. 참고로 이 API는 2026년 9월에야 제공되기 시작했으므로, 이를 둘러싼 서드파티 도구는 아직 초기 단계입니다.

지금 비전 기능이 필요하거나, 수십 개가 넘는 언어가 필요하거나, 분당 비용 경제성이 모델 선택을 좌우한다면 Gemini 3.8 Live를 선택하세요. 다만 이것이 표준 티어 구매이며, 종합 지수에서 1위가 아니라 5위에 해당한다는 점, 그리고 모두가 인용하게 될 82.6은 Extended Thinking 변형의 점수라는 점을 받아들이세요.

선택하세요Gemini 3.8 Live Extended Thinking — 추론이 핵심이고 현재 지수 선두주자를 원한다면요. 다만 먼저 출시 상황을 확인하세요. Gemini Live, Docs, Gmail, Keep을 통한 배포 경로가 표준 모델보다 넓고, 기업용 제공은 아직 비공개 프리뷰 단계이기 때문입니다.

다음 분기에 지켜볼 것은 풀 듀플렉스가 계속 해자로 남을지 여부다. 턴 기반 모델들은 다른 경로로 대화 격차를 좁히고 있다 — 작업이 진행되는 동안 나레이션으로 오디오를 계속 바쁘게 유지하는 방식이다 — 그리고 이것이 실제 트래픽에서도 버틴다면, 1년 동안 이 범주를 정의해 온 아키텍처적 구분은 더 이상 구매자들이 묻는 것이 아니게 될 것이다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트