Gemini 3.8 Live Extended Thinking 대 GPT-Live-1을 위한 히어로 타이틀 카드로, 지수 1.1포인트 차이를 보이면서 서로 다른 과금 모델을 가진 두 음성 모델을 보여줍니다.
Guides & Insights

Gemini 3.8 Live Extended Thinking 대 GPT-Live-1: 1.1점 차 무승부와 두 가지 다른 청구서

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

종합 점수에서는 동률입니다. Gemini 3.8 Live Extended Thinking은 Artificial Analysis의 Speech to Speech Index에서 82.6에 위치하며, GPT-Live-1은 Astra 백엔드에서 중간 수준의 추론 노력으로 81.5에 위치합니다. 그 아래의 에이전트 구성 요소인 τ-Voice 작업 완료에서는 격차가 0.7점이며, 68.6% 대 67.9%입니다. 추론 구성 요소에서는 격차가 더 크고 방향은 반대입니다: Gemini 모델은 Big Bench Audio에서 97.7%, GPT-Live-1은 90.1%입니다. 그 차이 중 어느 것도 두 번째 벤치마크 실행에서는 그대로 유지되지 않으며, 그 어느 것도 당신이 결정해야 할 기준이 아닙니다.

이 둘을 가르는 것은 품질이 아닙니다. 음성 에이전트란 무엇인지, 누가 사고를 담당하는지, 그리고 — 예산 항목에 가장 먼저 영향을 미치는 부분인 — 세션이 어떻게 청구되는지에 대해 두 제품의 입장이 다르기 때문입니다. Gemini 3.8 Live Extended Thinking은 오디오 토큰 기준으로 과금하며, 말하는 모델과 동일한 모델에서 추론합니다. GPT-Live-1은 누군가 말하고 있든 아니든 세션 시간에 대해 정액 요금을 부과하고, 실제 사고는 별도로 선택하고 비용을 지불하는 텍스트 모델에 맡깁니다. 이 둘은 같은 벤치마크 점수를 걸치고 있는 서로 다른 제품이며, 어느 쪽이 맞는지는 리더보드가 결코 묻지 않는 질문에 달려 있습니다: 귀사의 회선에서 평균적인 통화는 어떤 모습인가요?

1.1점 차 동점, 그리고 그것이 실제로 깨지는 지점

숫자부터 시작하자, 헤드라인의 얇음이 바로 핵심이기 때문이다:

음성 대 음성 지수 — Gemini 3.8 Live Extended Thinking (High) 82.6 대 GPT-Live-1 (Astra 백엔드, 중간 노력) 81.5

에이전트 성능(τ-Voice 작업 완료율) — 68.6% 대 67.9%, GPT-Live-1은 Sol 백엔드를 낮은 노력으로 실행할 때 59.3%

음성 추론(Big Bench Audio) — 97.7% 대 90.1%, 격차가 노이즈가 아닌 유일한 구성 요소

복잡한 은행 업무 워크플로(Sierra τ³-Banking, 공급업체 보고 기준) — 35.1% 대 32.0%

첫 오디오까지의 시간 — API를 통한 1.24–1.34초 대비 1.35초

측정된 시간당 비용 — Astra 구성 기준 $3.50 대 $5.83, 둘 다 Artificial Analysis의 입력 오디오 측정 기준

솔직히 해석하자면, 두 모델은 종합 점수에서는 구분되지 않고, 음성 추론에서는 구분되며 Gemini 모델이 거의 8점 앞서고, 비용에서는 약 40% 앞서면서 구분된다. GPT-Live-1이 앞서는 부분은 벤치마크가 점수화하기 어려워하는 경험의 영역이다. 그것은 진정한 전이중 방식으로, 말하면서 듣고, 추임새를 내보내며, 말할지 양보할지 1초에 여러 번 결정한다. Gemini 3.8 Live Extended Thinking은 턴 기반이다. 그것은 같은 근본 문제 — 에이전트가 작업하는 동안 통화자가 침묵에 빠지는 문제 — 를 대신 내레이션하는 방식으로 해결한다. 작업이 실행되는 동안 '확인해 볼게요…' 같은 신호와 함께 추론하고 동시에 말한다.

두 접근 방식 모두 라인을 살려 둡니다. 둘은 느낌이 다릅니다. 그중 하나만 인덱스에 나타납니다.

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and GPT-Live-1 across six dimensions: Speech to Speech Index 82.6 vs 81.5, agentic performance on tau-Voice 68.6 percent vs 67.9 percent, speech reasoning on Big Bench Audio 97.7 percent vs 90.1 percent, billing model per audio token vs per session minute, reasoning location in-model vs delegated to a backend text model, and cost per hour $3.50 vs $5.83.

두 가지 청구 모델, 그리고 요율표가 오해를 부르는 이유

이것은 대부분의 배포를 결정하는 부분이며, 바로 커버리지가 건너뛰는 부분이다.

Gemini 3.8 Live Extended Thinking은 토큰 모델과 동일한 방식으로 청구됩니다. Live API를 통한 공개 요금은 오디오 입력 토큰 100만 개당 $3.00 — 대략 오디오 입력 1분당 $0.005 — 이며, 오디오 출력 토큰 100만 개당 $12.00, 대략 1분당 $0.018이고, 사고 토큰은 해당 출력에 포함됩니다. 비용은 오디오가 흐르는 동안에만 지불됩니다. 발신자가 잠시 멈추거나, 생각하거나, 보류 상태가 되더라도 조용히 있는 동안에는 비용이 전혀 들지 않습니다.

GPT-Live-1은 전화선 요금이 청구되는 방식과 동일하게 청구됩니다. 누가 말하고 있는지 또는 아무도 말하지 않는지와 관계없이 세션 시간 1분당 $0.05의 정액 요금이 초 단위로 부과됩니다. 추론 백엔드는 포함되지 않습니다. 사고를 담당하는 텍스트 모델과 그것이 호출하는 모든 도구는 별도로 추가 청구됩니다. 이렇게 해서 $0.05라는 대표 요금이 Artificial Analysis가 측정한 기준으로 Sol 백엔드에서는 시간당 약 $4.47, Astra medium에서는 시간당 $5.83의 총액이 됩니다.

그 둘을 나란히 놓고 보면, 순진한 비교 — 분당 $0.018 대 $0.05, 2.8배 차이 — 는 양쪽 방향 모두에서 틀렸습니다. 실측 시간당 수치는 실제 격차를 $3.50 대 $5.83, 즉 1.7배에 가깝게 보여줍니다. 하지만 세션 시계 모델은 청구서의 수준뿐 아니라 형태까지 바꿉니다: GPT-Live-1에서는 비용이 통화 시간을 따라가므로, 길고 조용하며 내용이 적은 통화 — 지원 대기열, 인증 단계, IVR 연결 — 가 많은 회선은 통화 밀도가 높은 회선과 같은 요금을 냅니다. Gemini 쪽에서는 비용이 오디오를 따라가므로, 침묵은 무료이고 장황함은 무료가 아닙니다. 분당 요금으로 계산하기 전에 먼저 자신의 평균 통화 길이로 계산해 보십시오. 그 수치가 이 중 어느 쪽이 더 저렴한지를 결정하기 때문이며, 예약 회선과 트리아지 회선의 답은 같지 않습니다.

생각이 일어나는 곳

두 번째 구조적 차이는 위임이며, 이것이 바로 이 스택에서 실제로 얼마나 많은 부분을 교체할 수 있는지를 결정하는 요소입니다.

GPT-Live-1은 프런트엔드입니다. 양방향 오디오를 처리하며, 쿼리에 실제 추론이 필요할 때는 작업을 별도의 백엔드 모델에 넘깁니다. GPT-5.5GPT-6 Astra가 모두 백엔드로 문서화되어 있고, 추론 노력 선택기를 통해 해당 백엔드를 얼마나 쓸지 선택할 수 있습니다. 이것이 바로 보드가 GPT-Live-1을 서로 다른 점수로 두 번 올린 이유입니다. Astra에서 중간 노력으로 81.5, Sol에서 낮은 노력으로 80.1입니다. 자체 두 구성 사이의 1.4점 차이는 이번 맞대결의 두 모델 사이 1.1점 격차보다 크며, 이는 OpenAI 쪽에서는 어떤 벤더를 선택하느냐보다 어떤 구성을 선택하느냐가 더 중요하다는 것을 알려줍니다.

Gemini 3.8 Live Extended Thinking 말하는 바로 그 모델에서 추론합니다. 선택할 별도 백엔드도 없고 그에 대한 별도 청구도 없습니다. 그 대신 같은 모델에서 사고 수준 — 낮음, 중간, 높음 — 으로 깊이를 조정하며, 82.6과 68.6 수치는 (높음) 구성입니다. 백그라운드 도구와 API 실행은 양쪽에서 비동기적으로 실행되므로, 어느 모델도 작업하는 동안 멈추지 않습니다.

한 가지 실용적인 결과: GPT-Live-1의 지능은 음성 프런트엔드 뒤에 있는 구매한 텍스트 모델이기 때문에, 그 품질 상한은 OpenAI가 음성 모델을 출시할 때가 아니라 텍스트 모델을 출시할 때 움직인다. Gemini 3.8 Live Extended Thinking의 상한은 Google이 오디오 모델을 재학습할 때 움직인다. 음성 플랫폼에 2년짜리 베팅을 하고 있다면, 그 업그레이드 주기의 차이는 1.1 지수 포인트보다 더 많은 고민을 할 가치가 있다.

어느 쪽으로 가든, 전환 비용은 무엇인가

이 둘 중 어느 것도 모델 ID 교체가 아니며, 그렇게 취급하는 팀은 프로덕션에서 그 사실을 알게 된다. 다음으로 Gemini 3.8 Live Extended Thinking로 이동한다는 것은 다른 턴 계약을 받아들인다는 뜻이다. 함수 호출은 항상 비동기식이므로, 블로킹 도구 선언은 대기열에 쌓이는 대신 하드 오류를 반환하며, 클라이언트는 interaction_status 필드를 읽어야 한다 — IN_PROGRESS는 추론이나 도구가 아직 실행 중일 때, IDLE은 오직 전체 작업이 완료될 때만이며, turnComplete가 작업이 완료되었다는 뜻이라고 신뢰하는 대신이다. 다음으로 GPT-Live-1로 이동한다는 것은 자체 백엔드 선택 체계와 두 번째 과금 표면을 도입하고, 2026년 9월 10일에야 개발자에게 정식 제공되기 시작한 — 그보다 앞선 7월 8일 ChatGPT에서 처음 선보인 — API와 함께 살아가야 한다는 뜻이다. 그래서 이를 둘러싼 서드파티 도구, SDK, 관측성은 몇 년이 아니라 몇 달에 불과하다. 어느 방향으로 이동하든, 토큰 청구서 옆에 통합 작업 비용도 함께 계산해 두어라. 성숙한 음성 스택에서는 보통 리팩터링이 둘 중 더 큰 쪽이다.

이런 비교를 그것에 베팅하지 않고 어떻게 진행하나요?

1.1점 차이 문제를 해결하는 합리적인 방법은 두 시스템을 자체 트래픽에서 모두 실행해 보는 것이고, 곤란한 점은 그렇게 하면 보통 두 개의 통합, 두 개의 계약, 두 세트의 자격 증명이 필요하다는 것입니다. 그렇다고 해서 두 개의 아키텍처가 필요한 것은 아닙니다. 두 시스템 모두에서 음성 프런트엔드는 일반 텍스트 모델 호출 위에 놓인 얇은 계층입니다 — GPT-Live-1에서는 이 점이 명시적이고, Gemini 쪽에서는 백그라운드 도구 실행이 같은 방식으로 처리됩니다 — 그리고 바로 그 텍스트 계층이 비용 차이가 발생하는 곳이며 전환이 진정으로 저렴한 곳입니다.

OrcaRouter는 단일 키로 190개 모델을 공급사 정가에 마크업 없이 제공하며, 따라서 업스트림 가격이 바뀌면 다음 계약 갱신 때가 아니라 같은 날 바로 우리 쪽에 반영됩니다. 음성 스택에서 중요한 두 가지 속성은 음성 통합을 건드리지 않고도 실시간 트래픽에서 위임 대상을 교체할 수 있다는 점, 그리고 백엔드에서 오류가 나거나 타임아웃이 발생해도 자동 페일오버가 통화를 계속 유지해 준다는 점입니다. 덕분에 검증되지 않은 구성을 실제 트래픽에서 시험해 보면서도 그 뒤에 프로덕션 라인을 두지 않아도 됩니다. 우리가 호스팅하는 것과 하지 않는 것을 분명히 하자면, Gemini 3.8 Live Extended Thinking 엔드포인트와 GPT-Live-1 엔드포인트는 둘 다 우리 라우터에 없습니다 — 이들은 Google과 OpenAI 자체 API에서 제공됩니다. 이들이 위임하는 텍스트 모델은 대개 우리 라우터에 있으며, Gemini 3.8 Flash도 그중 하나입니다.

보드의 상단, 그리고 그것이 얼마나 좀처럼 안정되지 않는지

아래 캡처는 2026년 9월 16일에 촬영되었습니다:

Gemini 3.8 Live 확장 사고(높음) — 82.6, 1위

GPT-Live-1 (Astra 백엔드, 중간 노력) — 81.5

Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1 (Sol 백엔드, 낮은 노력) — 80.1

• Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

주목할 만한 세 가지가 있습니다. 첫째, 1위와 3위는 1.3점 차이고 1위와 5위는 6.6점 차이므로, 이 순위표의 상단은 서열이라기보다 접전입니다. 둘째, 이 비교 제목에 있는 모델은 5위인 Gemini 항목이 아닙니다. 그것은 표준 Gemini 3.8 Live로, 여기서 비교되는 추론 변형과 혼동해서는 안 되는, 훨씬 저렴한 다른 제품입니다. 셋째, 단일 지수 수치를 잠정적인 것으로 취급할 선례가 있습니다. xAI는 7월에 Grok Voice Think Fast 2.0에 대해 82.9를 보고했지만, 그 모델은 이 순위표에서 81.3으로 나타납니다. 벤더가 보고한 지수 점수가 실제 리더보드와 마주쳐도 항상 그대로 유지되지는 않습니다. 이제 68.6%와 67.9%라는 τ-Voice 수치는 Artificial Analysis 자체 하네스로 운영되는 공개 순위표에 올라 있으므로, 단순한 주장이 아니라 검증된 것입니다. 다만 동일한 하네스에서 두 모델 간의 0.7점 차이는 차이라고 할 수 없습니다. 여러분의 트래픽에서 확인하거나, 무시하십시오.

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6, GPT-Live-1 at 81.5 and 80.1, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

이 비교에서 가장 불편한 숫자이기에, 결정에 넣어 계산해 볼 만한 또 하나의 수치가 있습니다. Google은 Sierra의 τ³-Banking 리더보드에서 Gemini 3.8 Live Extended Thinking이 35.1%를 기록했다고 보고하며, 이는 GPT-Live-1 Astra의 32.0%와 대비됩니다. 이는 벤더가 보고한 수치이고 재현된 바 없으며, 해당 보드의 선두 음성 에이전트가 현실적인 은행 업무 시도 세 번 중 대략 두 번 실패하는 세계를 보여줍니다. 여러분의 에이전트가 규제를 받는 다단계 작업을 완수해야 한다면, 이 모델들 중 어느 것도 완성된 것이 아닙니다 — 그리고 그 벤치마크에서의 3.1포인트 우위는 벤더를 선택할 이유가 아니라, 인간을 루프 안에 두어야 할 이유입니다.

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

그러니까, 대화의 자연스러움이 곧 제품이고 여러분의 호출이 짧고 밀도가 높다면, GPT-Live-1의 전이중 동작은 지수가 보지 못하는 진짜 장점이며, 세션 시계 과금은 그 정도 호출 길이에서는 감내할 만하다. 호출이 길거나 조용하거나 변동성이 크다면, 또는 음성 추론과 시간당 비용이 더 중요하다면, Gemini 3.8 Live Extended Thinking이 중요한 구성 요소에서 앞서 있고 그러면서 시간당 약 40% 더 저렴하다 — 단, 턴 기반이고 기업용은 아직 프리뷰이며, 여러분의 도구를 실행하려면 먼저 클라이언트 리팩터링이 필요하다는 전제가 있다. 이 중 어느 것도 1.1 지수 포인트의 강점만으로 둘 중 하나를 고르는 일을 정당화하지는 못한다. 입수 가능한 증거로 볼 때, 이 둘 중에서 선택하는 솔직한 이유는 과금 모델과 그 밑에 있는 아키텍처다. 그리고 둘 다 이번 주에 여러분의 트래픽에서 직접 측정할 수 있는 것들이다.

OrcaRouter에서는 자동 장애 조치가 통화를 계속 유지합니다.백엔드에서 오류가 발생하거나 타임아웃될 때

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트