'Gemini 3.5 Transcribe를 이용한 지능형 전사' 히어로 타이틀 카드: 사운드 웨이브가 서식 있는 텍스트로 변환되는 모습, 85개 이상의 언어가 표시된 지구본, 화자 라벨 칩, 비스트리밍 WER 2.6%와 혼합 기준 약 $0.005/분이라는 헤드라인 수치, 그리고 오른쪽 하단 모서리의 OrcaRouter 로고.
Engineering & Research

Gemini 3.5 Transcribe를 통한 지능형 전사

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Gemini {{1}}3.5{{/1}} Transcribe는 2026년 8월 26일에 공개 미리보기에 진입했으며, 진정으로 {{3}}Gemini{{/3}} 모델로 판매되는 최초의 {{2}}Google{{/2}} 음성-텍스트 모델입니다. 모델 ID로 {{4}}Gemini API{{/4}}를 호출하면 오디오가 토큰 단위로 과금되며, {{5}}Google{{/5}}은 가격 페이지에 오디오 분당 비용을 명시합니다. 그 마지막 세부 사항이 소비자 대상 보도가 간과하는 부분입니다. 출시 당일 기사는 Gboard의 필러 단어 제거와 음성 편집에 관한 것이지만, 개발자에게 실제로 달라진 점은 전사 기능이 이제 나머지 {{6}}Gemini{{/6}} 라인과 동일한 API 표면에 자리 잡았으며, 화자 구분과 단어 수준 타임스탬프가 별도의 추가 기능이 아닌 기본 모델에 포함된다는 것입니다. 이 글은 API 레퍼런스처럼 읽히는데, 이는 첫 번째 보도 물결이 남겨둔 공백이기 때문입니다.

먼저 두 가지 주의사항을 밝혀 두어야 아래 숫자가 오해를 일으키지 않을 것이다. Go​ogle은 Gemini 3.​5 Transcribe를 "우리가 가진 가장 정확한 음성-텍스트 모델"이라고 말하지 않는다. 그 표현은 지능형 음성 상호작용에 가장 정밀한 모델이라는 뜻으로, 이는 전혀 다른 주장이며 WER 수치를 읽을 때 그 차이가 중요하다. 그리고 여기의 모든 내용은 공개 미리보기에 관한 것이다. 두 모델 ID, 가격, 벤치마크 수치는 Go​ogle이 현재 제공하는 것이며, 이 모두가 GA(정식 출시) 전에 변경될 수 있다.

두 API 경로 — 그리고 기억해야 할 모델 ID

Gemini 3.​5 Transcribe는 두 개의 엔드포인트로 제공되며, 올바른 엔드포인트를 선택하는 것이 팀이 내리는 첫 번째 아키텍처 결정입니다:

• gemini-3-5-transcribe — Interactions API를 통한 사전 녹음 경로입니다. 파일을 보내면 화자 속성(최대 3명의 화자, 3명 초과는 실험적)과 단어 수준 타임스탬프가 포함된 트랜스크립트를 받을 수 있습니다. 이는 배치 및 비동기 처리를 담당하는 핵심 도구입니다.

• gemini-3-5-transcribe-live — Live API를 통한 실시간 경로. 양방향 스트리밍과 1초 미만의 지연 시간을 제공하며, 실시간 대화, 자막 생성, 음성 기반 인터페이스를 대상으로 합니다.

이러한 분할은 나머지 G​emini Audio 제품군이 구성되는 방식을 반영하며, 'live'가 자체 가격을 가진 별도의 SKU이기 때문에 중요합니다. 이번 출시에 대한 여러 초기 해석은 하나의 모델이 두 가지 역할을 모두 한다고 가정하지만, 그렇지 않습니다.

A generated two-card infographic titled 'Gemini 3.5 Transcribe - two API paths' showing the pre-recorded Interactions API path on the left labeled gemini-3-5-transcribe with a file-in transcript-out flow and speaker attribution, and the streaming Live API path on the right labeled gemini-3-5-transcribe-live with bidirectional streaming and sub-second latency, a footer reading 'Public preview, August 2026', and the OrcaRouter logo in the bottom-right corner.

"intelligent transcription"이 실제로 의미하는 것

Go​ogle의 출시 게시물은 이것을 발음의 정확성을 넘어 이해로 나아가는 것으로 규정합니다. 그 프레이밍에서 뒤따르는 기능들이 프레이밍 자체보다 평가할 대상입니다:

• 비유창성 처리 — 'um'과 'ah'는 생략되고, 자기 수정은 해소됩니다. '화요일에 만나자 — 아니다, 수요일'은 잘못된 시작의 기록이 아니라 수정된 요일로 전사됩니다. 그것은 모델이 내리는 결정이며, Google이 이를 지능적이라고 부르는 의미입니다.

• 자동 서식 지정 — 출력은 구두점, 대소문자, 문단 구조가 적용된 다듬어진 텍스트로 반환되며, 원시 토큰 스트림이 아닙니다.

• 다중 화자 식별 — 사전 녹음된 오디오에서 단어 수준 타임스탬프와 함께 최대 3명의 화자가 식별됩니다. 3명 이상의 화자는 실험적 기능입니다. 이는 별도의 화자 분리 서비스가 아닌 기본 모델에 포함되어 있습니다.

• {{1}}맞춤 어휘{{/1}} — {{2}}어휘를 제공하여 전문 용어, 제품명, 특이한 철자에 대한 인식을 편향시킬 수 있습니다. 이는 수직 도메인을 위한 메커니즘입니다.{{/2}}

• 85개 이상의 언어 — 자동 감지, 지역별 억양과 방언이 명시적으로 표시됩니다.

• 함수 호출 — 모델은 이미지 생성이나 파일 분석 같은 작업을 다른 Gemini 모델에 위임할 수 있으며, 이는 전사를 최종 단계가 아닌 더 큰 에이전트의 구성 요소로 만듭니다.

• 엔티티 캡처 — Go​ogle은 잡음이 많은 실제 오디오와 우편 번호 및 주문 ID와 같은 영숫자 엔티티에서 강력한 성능을 주장합니다.

언론 보도에서는 또한 96,000-토큰 컨텍스트 창(분할 없이 약 1시간 분량의 회의 오디오에 해당)과 감정 감지 기능이 있다고 보도했습니다. 둘 다 출시 프레임과 일치하지만, Go​ogle이 게시한 모델 카드에는 이를 전면에 내세우지 않으므로, GA 사양서가 나올 때까지는 확정된 사실이 아닌 보도된 내용으로 취급하시기 바랍니다.

A generated single-column scoreboard titled 'Gemini 3.5 Transcribe - the scoreboard' with rows Release Aug 26 2026 public preview, Languages 85+ auto-detect, WER 2.6% non-streaming / 4.0% streaming, Price ~$0.005 per minute blended, APIs transcribe plus transcribe-live, and Context ~96K tokens reported, a footer reading 'WER per Artificial Analysis, cited by Google; context window press-reported', and the OrcaRouter logo in the bottom-right corner.

표시된 정확도 수치

Google이 인용한 WER 수치는 Artificial Analysis에서 가져온 것으로, 스트리밍 평균 단어 오류율 4.0%, 비스트리밍 전사 2.6%입니다. FLEURS 다국어 벤치마크에서 Google은 스트리밍 WER 5.50%, 비스트리밍 5.04%를 보고합니다. Google은 또한 이전 모델인 Chirp 3 대비 최종 전사 완료 시간이 70% 개선되었다고 주장합니다.

정직하게 읽자면, 이 측정값들은 Artificial Analysis가 Google이 아니라는 점에서 독립적이지만, Google이 선별한 측정값이며, Google 자체 발표문 안에 실린, 하루 동안 호출 가능했던 모델에 대한 것입니다. Google 외에는 아직 그 누구도 대부분의 팀이 비교 대상으로 삼는 오픈 가중치 모델들과 정면 일대일 비교를 수행하지 않았고, 출시 자료에는 Whisper 계열이나 NVIDIA의 Parakeet 라인과의 직접 비교도 없습니다. Chirp-3보다 70% 빠르다는 수치는 공급업체의 주장일 뿐입니다. 2.6%와 4.0%는 확정된 사실이 아니라 강력한 초기 신호로 간주하세요.

비용

Go​ogle의 가격 책정 페이지는 각 모델을 토큰 및 예상 오디오 시간(분)으로 견적합니다. gemini-3-5-transcribe의 경우 혼합 추정치는 정가 기준 오디오 1분당 약 $0.005이며, 입력은 약 $0.003/분, 출력은 약 $0.002/분입니다. gemini-3-5-transcribe-live의 경우 혼합 추정치는 분당 약 $0.009입니다. 두 모델 모두 현재 무료 등급을 제공합니다.

분당 수치는 가정된 토큰 비율(입력 오디오 초당 25토큰, 출력 텍스트 분당 175토큰)을 기준으로 산출된 추정치이므로, Go​ogle이 토큰 계산 방식을 변경하면 달라질 수 있습니다. 확실한 것은 원칙입니다. 공개 가격이 곧 가격이라는 원칙이요. 이는 OrcaRouter와 같은 패스스루 라우터가 작동하는 바로 그 원칙입니다. 마크업 0%, 공급업체 공개 가격을 그대로 전달하는 방식이죠. 따라서 Go​ogle이 프리뷰에서 GA(일반 제공) 전환 기간에 전사(transcription) 요금을 인하하면, 그 인하는 리셀러가 요율표를 업데이트한 이후가 아니라 당일 바로 저희 쪽에도 반영됩니다.

어디에 출시되고 있는지

개발자에게 오늘의 공개 미리보기는 두 가지 표면을 뜻합니다: Go​ogle AI Studio의 G​emini API와 엔터프라이즈 워크로드를 위한 G​emini Enterprise Agent Platform입니다. 소비자 측면에서 G​emini 3.​5 Transcribe는 이미 Android의 Gboard에 있는 Rambler 받아쓰기 기능과 macOS의 G​emini 앱을 지원합니다. 다음은 Chrome입니다 — 모든 웹 필드에서 말로 입력하는 기능 — 그 뒤로 Search Live, G​emini Live, Docs, Keep, Gmail이 이어집니다. 이를 평가하는 팀에게 실질적인 답은 더 간단합니다: 오늘, 영어로, G​emini API를 사용할 수 있는 지역에서 코드에서 호출할 수 있다는 것입니다.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

이것이 파이프라인에 의미하는 바

{{1}}진정으로 새로운 것은 WER 수치가 아닙니다. 핵심은 Go​ogle이 이제 기본 모델에 팀들이 이전에 직접 조합하던 두 가지 기능, 즉 화자 라벨과 단어 수준 타임스탬프를 포함한 전사를 판매하며, 함수 호출을 지원하는 G​emini API 상에서 제공한다는 점입니다.{{/1}} {{2}}일반 전사기와 별도의 다이어라이저, 포맷팅 패스를 조합해 화자 분리된 회의록 파이프라인을 구축하고 있었다면, 이는 그러한 단계들을 하나로 통합한 최초의 Go​ogle 모델입니다.{{/2}} {{3}}여전히 열린 질문은 2.6%의 비스트리밍 WER이 여러분의 실제 오디오에서도 유지되느냐는 것입니다. 독립적인 재현 결과가 나오기 전까지, 프로덕션 팀이 취할 책임 있는 선택은 Go​ogle이 선정한 벤치마크를 기준으로 예산을 잡기보다 실제 샘플을 API에 돌려보는 것입니다.{{/3}} {{4}}전사 결과 위에서 실행되는 LLM 작업, 즉 요약, 구조화 추출, 액션 아이템은 라우팅이 제 역할을 다하는 계층이며, OrcaRouter가 커버하는 계층이기도 합니다. 200개 이상의 모델에 걸친 단일 API, 공급자 간 자동 장애 조치, 여러 모델을 단일 호출로 구성하는 라우팅 DSL이 바로 그것입니다.{{/4}} {{5}}전사 단계 자체는 누군가가 내세운 수치를 믿기 전에 여러분의 오디오로 직접 테스트해야 합니다.{{/5}}

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube