Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe — 앱이 호출해야 하는 엔드포인트 재생성된 일러스트레이션.
Guides & Insights

Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe: 앱에서 호출해야 할 엔드포인트는?

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Go​ogle이 2026년 8월 26일 Ge​mini 3.5 Transcribe 제품군을 출시했을 때, 이름과 사명을 공유하지만 대화의 서로 다른 단계를 위해 만들어진 두 가지 모델을 제공했습니다: Live API를 통해 제공되는 스트리밍 엔드포인트인 Ge​mini 3.5 Transcribe Live와 Interactions API를 통해 제공되는 사전 녹음 엔드포인트인 Ge​mini 3.5 Transcribe입니다. 대부분의 팀이 첫 주에 저지르는 실수는 이것을 버튼 두 개가 달린 하나의 모델로 취급하는 것입니다. 이는 두 개의 SKU입니다 — 서로 다른 API, 서로 다른 가격, 서로 다른 하드 한도 — 그리고 둘 사이의 정확도 비교는 공정한 싸움이 아닙니다. 서로 다른 규칙으로 측정되었기 때문입니다. 이 글은 두 모델을 나란히 비교하여, 결정이 리더보드가 아닌 워크로드에 달려 있도록 합니다.

두 가지를 한눈에

• API — Ge​mini 3.5 Transcribe Live는 Live API(WebSocket, 양방향 스트리밍)에서 실행되는 반면, Ge​mini 3.5 Transcribe는 Interactions API(파일 입력, 텍스트 출력)에서 실행됩니다.

• 작업 — 실시간 대화, 자막, 음성 에이전트 vs 미팅, 통화 기록, 아카이브 오디오.

• 정확도 — Go​ogle이 인용한 Artificial Analysis 자료에 따르면, 스트리밍 WER 4.0% vs 비스트리밍 WER 2.6%. 측정 방식이 서로 달라 직접 비교할 수 없음.

• 지연 시간 — 음성 종료 후 0.40초 만에 최종 텍스트 제공 vs 전체 파일의 배치 처리

• 세션 — 라이브 세션당 10분 상한 vs 최대 60분 파일(화자 분리 및 타임스탬프 활성화 시 30분).

• 스피커 — 스트리밍 측에는 없음, 사전 녹음 측에는 단어 수준 타임스탬프가 있는 최대 3명의 스피커.

• 가격 — 분당 약 $0.009 (혼합) 대 분당 약 $0.005 (혼합)

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe - the scoreboard'. Left column Gemini 3.5 Transcribe Live: API Live API streaming, WER 4.0% streaming, Final latency 0.40s after speech, Session 10-minute cap, Speaker ID not supported, Timestamps none. Right column Gemini 3.5 Transcribe: API Interactions API files, WER 2.6% non-streaming, Final latency batch async, Session 60-minute files (30 with diarization), Speaker ID up to 3 speakers, Timestamps word-level. Footer reads 'WER per Artificial Analysis, cited by Google; limits per Google launch materials.'

아키텍처 결정: Interactions API 또는 Live API

두 모델 모두 GoogleGemini Audio 제품군에 속하며, 둘 다 공개 미리보기 상태입니다. 차이는 전송 방식에서 시작됩니다. gemini-3-5-transcribe-live는 WebSocket을 열고 계속 유지합니다. 원시 오디오가 지속적으로 스트리밍되며, 일반적인 프레이밍은 16kHz 또는 24kHz 16비트 PCM 청크입니다. 모델은 사용자가 말하는 동안 부분적인 기록을 반환하고, 음성이 끝나면 각 발화에 대한 최종 기록을 반환합니다. gemini-3-5-transcribe는 완전한 파일을 받아 처리한 후, 화자 표시와 단어 수준 타임스탬프가 포함된 완성된 기록을 반환합니다.

전송 결정이 다른 모든 것을 좌우합니다. 제품이 말이 발화되는 대로 단어를 렌더링한다면 — 라이브 캡션, 문장 중간에 의도를 읽는 음성 에이전트, 통화가 진행되는 동안 작동하는 통화 어시스턴트 — Live 경로에 있는 것입니다. 제품이 기록을 생성한다면 — 회의 노트, 통화 로그, 아카이브 — Interactions 경로에 있는 것입니다. 혼란스러운 점은 둘 다 텍스트를 생성한다는 것입니다. 차이는 텍스트가 실시간 상태인지 최종 산출물인지에 있습니다.

정확성: 스트리밍 세금은 실재한다.

독립 벤치마크 기관으로, 출시 게시물에서 Go​ogle이 수치를 인용한 Artificial Analysis는 스트리밍 엔드포인트의 평균 단어 오류율을 4.0%, 비스트리밍 엔드포인트는 2.6%로 측정했습니다. FLEURS 다국어 벤치마크에서 Go​ogle은 스트리밍 5.50%, 비스트리밍 5.04%를 보고했습니다. 2.6%라는 수치는 출시 시점에 Ge​mini 3.5 Transcribe를 AA의 WER 리더보드에서 5위에 올렸으며, 2.2%의 ElevenLabs Scribe v2와 2.4%의 Microsoft MAI-Transcribe-1.5 뒤에 위치합니다. 이는 Go​ogle의 주장이 아니라 AA의 측정값입니다.

스트리밍 수치는 동일한 테스트의 더 나쁜 버전이 아닙니다. 그것은 다른 방식입니다. 모델이 문장의 끝을 듣기 전에 단어를 확정하고, 그 대가를 치릅니다. 정확도만으로 둘 중 하나를 선택하지 마십시오. 주어진 워크로드에 따라 격차가 뒤집힐 수 있기 때문입니다. 제약 조건에 따라 선택하십시오. 스트리밍 엔드포인트는 10분 세션 상한이 있고, 화자 분리 기능이 없으며, 타임스탬프도 없습니다. 사전 녹음 엔드포인트는 1시간 길이의 파일을 처리하고, 최대 3명의 화자를 식별하며, 단어 수준의 타임스탬프를 반환합니다. 앱에 화자 레이블이 필요하다면, 스트리밍 모델은 WER이 어떻든 간에 그 일을 할 수 없습니다.

A screenshot of the Artificial Analysis speech-to-text leaderboard page showing the WER Index (Non-streaming) view with model rows including an entry for Gemini 3.5 Transcribe alongside ElevenLabs and Deepgram, plus AA-WER Index dataset filters, captured August 27 2026.

그들이 공유하는 것

두 엔드포인트는 'intelligent transcription' 엔진을 공유하며, 공유 기능에 있어서는 둘 사이의 선택이 중립적입니다:

• 85개 이상의 언어 자동 감지, Live 경로에서 스트림 중간 언어 전환 포함

• 비유창성 정리 — 필러 제거, 자기 수정 반영 ("화요일 — 아니, 수요일"은 수정된 요일로 표시됨).

• 자동 서식 — 출력에 적용되는 구두점, 대소문자 및 문단 구조.

• 사용자 지정 용어집 — 전문 용어 및 제품 이름에 대해 최대 1,000개 용어, Google 문서에서는 최상의 결과를 위해 약 100개를 권장합니다.

두 경우 모두에 적용되는 한 가지 주의사항은 다음과 같습니다. 출력을 읽기 쉽게 만드는 '스마트' 정리는 축어적 충실도를 희생하는 설계 결정입니다. 어색한 표현은 다듬어지며, 텍스트는 모델이 의도를 해석한 결과이지 법정 기록이 아닙니다. 정확한 전사본이 필요하다면, 해당 옵션이 제공되는 곳에서는 축어적 옵션을 사용해야 하며, 어느 쪽이든 자신의 오디오에서 동작을 직접 확인해야 합니다.

분당 비용: 라이브 프리미엄

Google은 오디오를 토큰 기준으로 과금하며, 초당 25개의 오디오 토큰을 사용합니다. 트랜스크립트 1분당 출력은 약 175개의 텍스트 토큰입니다. 정가 기준, 오디오 1분당 혼합 비용은 gemini-3-5-transcribe의 경우 약 $0.005, gemini-3-5-transcribe-live의 경우 약 $0.009입니다. 입력은 백만 토큰당 $2 대 $3.50, 출력은 백만 토큰당 $12 대 $21입니다. 두 제품 모두 현재 무료 등급이 있습니다.

프리미엄은 더 높은 정확도가 아니라 실시간 경로를 사는 것입니다. 스트리밍 엔드포인트는 분당 약 80% 더 비싸고, WER은 더 높게 전사됩니다. 이것이 솔직한 설명입니다. 사전 녹음 모델은 더 저렴하면서도 더 정확합니다. 스트리밍 모델은 일부 제품이 파일이 끝날 때까지 기다릴 수 없기 때문에 존재합니다.

어떤 엔드포인트를 기반으로 구축해야 하나요?

• 실시간 캡션 및 자막 — Ge​mini 3.5 Transcribe Live, 그리고 시간 정렬 출력이 필요하면 타임스탬프 없음 제한을 확인하세요.

• 음성 에이전트 — 문장 중간에 의도를 파악하려면 Ge​mini 3.5 Transcribe Live를 사용하고, 긴 세션의 경우 10분 제한에 맞춰 계획하세요.

• 회의, 인터뷰, 아카이빙 — 2.6% WER, 화자 구분, 단어 수준 타임스탬프를 위한 Ge​mini 3.5 Transcribe.

• 통화 후 분석 — 완료된 기록용 Ge​mini 3.5 Transcribe; 분석이 통화 중에 실행되어야 하는 경우에만 Ge​mini 3.5 Transcribe Live.

• 긴 연속 오디오 — Gemini 3.5 Transcribe, 60분짜리 파일이 10분짜리 라이브 세션을 손으로 이어 붙이는 것보다 낫기 때문입니다.

A generated decision card titled 'Which endpoint - by workload' with a left column headed 'Pick Transcribe Live if' listing live captions, voice agents reading intent mid-sentence, and in-call analytics, and a right column headed 'Pick Transcribe if' listing meetings and interviews, call logs needing speaker labels, word-level timestamps for alignment, and long continuous audio, a footer reading 'Both are Google APIs in public preview since Aug 26 2026', and the OrcaRouter logo in the bottom-right corner.

트랜스크립트 위의 레이어

어느 모델도 OrcaRouter가 호스팅하는 것이 아닙니다. 우리는 현재 음성-텍스트 변환을 라우팅하지 않으며, 어느 엔드포인트든 Google API를 직접 호출하게 됩니다. 음성 파이프라인에서 라우팅 레이어가 하는 일은 트랜스크립트 위에 위치하는 것입니다: 요약기, 엔티티 추출기, 스트림을 결정으로 전환하는 액션 아이템 모델. 바로 그 레이어에서 OrcaRouter의 가치가 발휘됩니다 — 200개 이상의 모델에 걸친 단일 API, 공급자 목록 가격에 마크업 없음, 공급자 간 자동 장애 조치, 그리고 여러 모델을 단일 호출로 구성하는 라우팅 DSL. 워크로드에 따라 전사 엔드포인트를 선택한 다음, 하나의 키로 트랜스크립트를 읽는 모델을 실행하세요.

결론

Gemini 3.5 Transcribe Live와 Gemini 3.5 Transcribe는 같은 제품군에 속하지만 서로 다른 제품입니다. 대화가 끝나기 전에 트랜스크립트가 존재해야 하고, 10분 세션과 화자 라벨 없음, 타임스탬프 없음을 감수할 수 있다면 Live를 선택하세요. 출력이 기록용이고 정확성과 화자 귀속이 속도보다 더 중요하다면 Transcribe를 선택하세요 — 더 저렴하고, 더 정확하며, 제약이 훨씬 적습니다. 유일한 오답은 하나의 엔드포인트가 두 가지를 모두 처리한다고 가정하는 것입니다.