'GPT-Live-1 vs Gemini 3.5 Live Translate'라고 적힌 히어로 타이틀 카드가 있고, 부제는 '출시된 범용 모델 대 프리뷰 특화 모델'이며, 문구는 'GA는 분당 $0.05, 프리뷰는 분당 약 $0.037'입니다. 그 아래에는 두 개의 패널이 있습니다: 왼쪽은 양방향으로 휘어진 화살표가 있는 전이중 오디오 파형과 채워진 'GA' 배지를 보여 주고, 오른쪽은 두 개의 말풍선이 있는 지구본과 외곽선으로 된 'PREVIEW' 배지를 보여 주며, 구석에는 OrcaRouter 로고가 합성되어 있습니다.
Guides & Insights

GPT-Live-1 vs Gemini 3.5 Live Translate: 출시된 범용 모델 대 프리뷰 전문 모델

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 두 모델이 비교되는 이유는 둘 다 실시간 음성을 API에 넣기 때문인데, 모델 카드를 읽는 순간 그 비교는 무너진다. GPT-Live-1은 Ope​nAI가 2026년 9월 10일 개발자 API로 옮긴 범용 전이중 음성 모델로, 7월 8일 ChatGPT 내부에 출시된 지 석 달 만이다. Gem​ini 3.5 Live Translate는 Goo​gle DeepMind가 2026년 6월 9일 공개한 단일 목적 오디오-투-오디오 번역 모델이며, 모델 ID에는 여전히 preview라는 단어가 붙어 있다. 이 중 하나는 공개된 요금제로 오늘 유료 고객 앞에 내놓을 수 있다. 다른 하나는 Goo​gle이 지원 중단 공지도 없이 당신 발밑에서 바꿔버릴 수 있다. 선택을 결정해야 하는 것은 벤치마크 표가 아니라 바로 이 비대칭성이다.

같은 이름표를 달고 있는 서로 다른 두 대의 기계

이것들이 얼마나 겹치지 않는지 솔직히 말할 가치가 있다. Gem​ini 3.5 Live Translate는 번역을 한다. 한 언어의 스트리밍 오디오를 받아 다른 언어의 스트리밍 오디오로 반환하며, 화자의 목소리와 어조를 보존하고, 70개 이상의 언어와 2,000개 이상의 언어 쌍에 걸쳐 자동 언어 감지와 양방향 작동을 지원한다. 대화를 나누거나, 함수를 호출하거나, 질문에 답하지는 않는다. 이것은 동시통역 엔진이다.

GPT-Live-1은 정반대의 형태다. 대화형 모델인 그것은 동시에 듣고 말하며, 계속 들을지, 잠시 멈출지, 끼어들지, 도구를 호출할지 초당 여러 번 결정하고, 무거운 작업—웹 검색, 더 깊은 추론, 에이전트 작업—을 대화가 이어지는 동안 Responses API를 통해 별도의 추론 모델에 넘긴다. Ope​nAI가 공개한 자체 WebRTC 예제는 그 위임을 GPT-5.6 Terra에 연결한다. 번역은 이 모델이 할 수 있는 일 중 하나이며, 반대 방향으로 Goo​gle의 모델이 이에 상응하는 기능을 갖고 있지는 않다.

그래서 실질적인 질문은 헤드라인 맞대결이 시사하는 것보다 더 좁습니다: 만들고 있는 것이 통역이라면 Goo​gle의 모델은 목적에 맞게 설계된 것이고 Ope​nAI의 모델은 범용입니다. 만들고 있는 것이 이따금 번역하는 음성 에이전트라면, GPT-Live-1은 둘 중 올바른 제품 범주에 속하기라도 하는 유일한 제품입니다.

각각 오디오 1분당 비용은 얼마인가요?

바로 이 지점에서 전문가가 제 몫을 해내며, 그 계산은 OpenAI에게 진짜로 곤란한 문제다.

• GPT-Live-1 — 음성 1분당 $0.05이며, 다음 1분 단위로 올림하지 않고 초 단위로 청구됩니다. 위임된 백엔드에서 수행되는 추론 및 도구 호출은 해당 모델의 일반 요율로 별도 청구됩니다.

• Gem​ini 3.5 Live Translate — 오디오 입력 토큰 100만 개당 $3.50, 오디오 출력 토큰 100만 개당 $21.00이며, 청구는 오디오 1초당 25토큰으로 계산됩니다. 이를 합치면 번역된 오디오 1분당 약 $0.037입니다.

순수 번역 분 기준으로, Google이 약 25% 더 저렴하다. 이는 규모가 커졌을 때 단순한 반올림 차이가 아니다: 한 달에 10,000 통역 분을 사용하면 GPT-Live-1의 음성 레이어에서는 약 $500인 반면, Gemini 3.5 Live Translate에서는 대략 $368이다. 그리고 이 격차는 과금 측정 방식 변경의 부산물이 아니라 실제 격차다. 두 모델이 정말로 서로 다른 단위로 과금하기 때문이다.

반대 방향에도 함정이 있습니다. GPT-Live-1의 $0.05라는 대표 가격은 음성 계층만의 가격입니다. 에이전트가 번역을 하면서 무언가를 찾아보거나, 어려운 문장을 추론 모델로 에스컬레이션하면, 그 위임에 대한 비용을 추가로 지불하게 됩니다. 그리고 위임된 모델은 여느 프런티어 모델과 마찬가지로 토큰당 과금됩니다. 번역만 하는 워크로드는 결코 그런 상황을 촉발하지 않습니다. 번역에 다른 무엇이든 더한 워크로드는 촉발하며, 분당 비교의 승자는 더 이상 명확하지 않게 됩니다.

A two-column comparison scoreboard titled 'GPT-Live-1 vs Gemini 3.5 Live Translate - the scoreboard'. The GPT-Live-1 column lists Status GA, Sept 10; Price $0.05 / minute; Scope conversational agent; Languages limited, vendor-flagged gaps; Tool calling yes, delegated; Tone preservation no. The Gemini 3.5 Live Translate column lists Status preview; Price about $0.037 / minute; Scope translation only; Languages 70+; Tool calling no; Tone preservation yes. A footer reads 'GPT-Live-1 figures per OpenAI; Gemini figures per Google. Different models, different jobs.'

미리보기 라벨은 아무도 가격에 반영하지 않는 위험이다

Gem​ini 3.5 Live Translate의 모델 ID는 gemini-3.5-live-translate-preview입니다. 이 모델은 Gem​ini Live API와 Goo​gle AI Studio에 공개 프리뷰로 출시되었고, 동시에 Android와 iOS의 Goo​gle Translate 앱에도, 그리고 일부 Workspace 고객을 대상으로 한 Goo​gle Meet의 비공개 프리뷰에도 적용되었습니다. 프리뷰는 Goo​gle에서 늘 그래왔던 것과 같은 의미입니다. 안정성 보장도, 공개된 지원 중단(디프리케이션) 기간도, 지금 지불하는 요금이 다음 릴리스에서도 유지된다는 약속도 없습니다.

소비자 앱이라면 그것으로 충분합니다. 이 모델이 실제로 겨냥하는 워크로드 — 콜센터의 실시간 통역, 회의 제품, 여행 제품 — 에서는 스택에서 가장 큰 단일 통합 위험입니다. 당신은 Goo​gle이 명시적으로 약속하지 않은 모델에 프로덕션 의존성을 구축하고 있는 것입니다.

GPT-Live-1은 반대 문제를 안고 있는데, 그 규모는 더 작지만 0은 아니다. 일반 제공 중이고, 공개된 요금이 있으며, 문서화된 엔드포인트가 있고, 사라지지도 않는다. 하지만 그 API 범위는 기존 OpenAI 통합에 바로 들어간다고 가정하는 팀들을 놀라게 할 만큼 좁다: 모델 ID가 정확히 하나, 엔드포인트가 하나뿐이며, Chat Completions, Responses, Realtime, Batch, Assistants, 파인튜닝을 통하는 경로가 없다. 유일한 진입 방법은 WebRTC를 통한 v1/live/sessions의 Live Sessions 엔드포인트이며, 데이터 채널에서 이벤트를 처리한다. 이는 파라미터 변경이 아니라 새로운 통합이다.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

언어, 그리고 제너럴리스트가 솔직히 더 약한 부분

Google이 제시하는 수치는 음성과 어조 보존을 지원하는 70개 이상의 언어입니다. OpenAI의 자체 문서는 자체 지원 범위에 대해 현저히 덜 확신합니다: 출시 자료는 특정 언어에서 모델이 비원어민 억양을 지니거나 유창성에 격차를 보일 수 있다고 언급하며, Google에 맞먹는 언어 수는 공개하지 않습니다.

그것은 벤더가 얼버무리는 것이 아니다 — 그것은 해당 문제로 훈련된 전문가 옆에 범용 대화형 모델을 놓았을 때의 모습이다. 당신 제품의 가치 제안이 "우리는 40개 언어를 잘 해석합니다"라면, 전문가 모델이 정직한 선택이며 범용 모델은 롱테일에서 당신을 난처하게 만들 것이다. 당신 제품이 번역 기능을 덧붙인 영어권 시장용 음성 에이전트라면, 범용 모델의 언어적 공백은 결코 드러나지 않을 것이다.

두 모델 모두 생성된 오디오에 SynthID로 워터마크를 삽입합니다. 이는 합성 음성의 출처 증명을 요구하는 관할권이나 고객 계약이 있는 경우 중요합니다. 그 부분은 무승부입니다.

A screenshot of Google's Gemini Live API overview documentation page, showing the banner 'Preview: The Live API is in Preview', the description that the Live API enables low-latency real-time voice and vision interactions by processing continuous streams of audio, images and text, an architecture diagram in which an app exchanges text, audio and video with the Live API over a WebSocket, and a left navigation listing Live translate under Live.

위임 아키텍처가 빌드를 변경하는 지점

이 둘의 구조적 차이는 GPT-Live-1이 실제로는 중간에 이음매가 있는 두 개의 모델이라는 점입니다. 음성 계층은 대화를 계속 이어가고, 별도의 추론 모델이 사고를 담당합니다. 그 이음매가 바로 여러분의 엔지니어링 노력이 들어가는 곳이며, 동시에 비용 모델이 복잡해지는 곳이기도 합니다.

위임된 절반은 다른 모델처럼 라우팅할 수 있는 평범한 텍스트 모델이라는 점을 알아두면 좋습니다. Ope​nAI 자체 예시의 백엔드인 GPT-5.6 Terra는 OrcaRouter를 통해 입력 토큰 백만 개당 $2.00, 출력 토큰 백만 개당 $12.00에 제공되며, 1M 토큰 컨텍스트 창과 /v1/chat/completions 및 /v1/responses가 모두 노출됩니다. 음성 에이전트 뒤의 추론 두뇌를 바꾸고 싶다면 — 간단한 통화에는 더 저렴한 모델로, 에스컬레이션에는 더 강력한 모델로 — 스택의 그 절반에는 선택지가 있습니다. 왜냐하면 그것은 하나의 키로 약 190개의 다른 모델.

음성 쪽은 그렇지 않습니다. GPT-Live-1은 OrcaRouter에 없고, Gemini 3.5 Live Translate도 마찬가지입니다. 둘 다 이를 만든 벤더에서만 이용할 수 있습니다. 이런 아키텍처에서 라우터가 제 역할을 하는 곳은 오디오 이후의 모든 단계입니다. 검색, 요약, CRM 역기록, 에스컬레이션을 수행하는 텍스트 모델들이 바로, 실제로 하나의 키와 하나의 청구서로 통합할 수 있는 비용의 절반입니다.

실제로 무엇을 골라야 할까

• 번역 자체가 제품이고, 분당 가격이 계약 안정성보다 더 중요하며, 기반 프리뷰 모델이 바뀌는 것을 감당할 수 있다면 Gem​ini 3.5 Live Translate를 선택하세요. 분당 약 $0.037을 예산으로 잡고, 호출 위에 추상화 계층을 유지해 GA 모델이 재작성 없이 이를 대체할 수 있게 하세요.

• 번역도 겸하는 대화형 에이전트가 필요하거나, 음성 루프 안에서 함수 호출과 도구 사용이 필요하거나, 조달 팀이 모델이 퇴역하면 어떻게 되는지 물을 예정인데 “아마 아무것도 없겠죠”보다 나은 답이 필요하다면 GPT-Live-1을 선택하세요.

• 어느 쪽도 벤치마크에서 이겼다는 이유로 선택하지 마세요. 양측의 벤치마크는 비교할 수 없습니다 — OpenAI의 전이중(full-duplex) 수치는 자체 측정치로, 어떤 제3자도 재현하지 않았으며, Google의 언어 관련 주장은 동일한 오디오 세트에서 범용 모델을 상대로 검증되지 않았습니다.

앞을 내다보는 한 가지 참고 사항: 두 표면은 충돌하기보다 수렴하고 있습니다. Goo​gle의 번역 모델은 이미 Gem​ini Live 안에 들어가 있으며, GPT-Live-1의 음성 계층은 새로운 프런티어 모델을 그 뒤에 배치할 수 있도록 명시적으로 설계되어 있습니다. 합리적으로 예상할 수 있는 것은 두어 번의 릴리스 주기 안에 범용 모델의 번역이 개선되고 전문 모델의 통합 스토리에 대한 위험 부담이 줄어든다는 점입니다. 오늘 구축 중이고 결정이 팽팽하다면, 이는 더 저렴하고 더 교체하기 쉬운 옵션을 선택할 근거가 되며, 어느 쪽이든 오디오 경로를 인터페이스 뒤에 격리해 두는 근거가 됩니다.