
Gemini 3.5 Transcribe를 통한 지능형 전사
- 智谱NEWZ.ai: GLM 5.3 Flash2026-08-26$0.07 / $0.25 100만 토큰당
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
Gemini {{1}}3.5{{/1}} Transcribe는 2026년 8월 26일에 공개 미리보기에 진입했으며, 진정으로 {{3}}Gemini{{/3}} 모델로 판매되는 최초의 {{2}}Google{{/2}} 음성-텍스트 모델입니다. 모델 ID로 {{4}}Gemini API{{/4}}를 호출하면 오디오가 토큰 단위로 과금되며, {{5}}Google{{/5}}은 가격 페이지에 오디오 분당 비용을 명시합니다. 그 마지막 세부 사항이 소비자 대상 보도가 간과하는 부분입니다. 출시 당일 기사는 Gboard의 필러 단어 제거와 음성 편집에 관한 것이지만, 개발자에게 실제로 달라진 점은 전사 기능이 이제 나머지 {{6}}Gemini{{/6}} 라인과 동일한 API 표면에 자리 잡았으며, 화자 구분과 단어 수준 타임스탬프가 별도의 추가 기능이 아닌 기본 모델에 포함된다는 것입니다. 이 글은 API 레퍼런스처럼 읽히는데, 이는 첫 번째 보도 물결이 남겨둔 공백이기 때문입니다.
먼저 두 가지 주의사항을 밝혀 두어야 아래 숫자가 오해를 일으키지 않을 것이다. Google은 Gemini 3.5 Transcribe를 "우리가 가진 가장 정확한 음성-텍스트 모델"이라고 말하지 않는다. 그 표현은 지능형 음성 상호작용에 가장 정밀한 모델이라는 뜻으로, 이는 전혀 다른 주장이며 WER 수치를 읽을 때 그 차이가 중요하다. 그리고 여기의 모든 내용은 공개 미리보기에 관한 것이다. 두 모델 ID, 가격, 벤치마크 수치는 Google이 현재 제공하는 것이며, 이 모두가 GA(정식 출시) 전에 변경될 수 있다.
두 API 경로 — 그리고 기억해야 할 모델 ID
Gemini 3.5 Transcribe는 두 개의 엔드포인트로 제공되며, 올바른 엔드포인트를 선택하는 것이 팀이 내리는 첫 번째 아키텍처 결정입니다:
• gemini-3-5-transcribe — Interactions API를 통한 사전 녹음 경로입니다. 파일을 보내면 화자 속성(최대 3명의 화자, 3명 초과는 실험적)과 단어 수준 타임스탬프가 포함된 트랜스크립트를 받을 수 있습니다. 이는 배치 및 비동기 처리를 담당하는 핵심 도구입니다.
• gemini-3-5-transcribe-live — Live API를 통한 실시간 경로. 양방향 스트리밍과 1초 미만의 지연 시간을 제공하며, 실시간 대화, 자막 생성, 음성 기반 인터페이스를 대상으로 합니다.
이러한 분할은 나머지 Gemini Audio 제품군이 구성되는 방식을 반영하며, 'live'가 자체 가격을 가진 별도의 SKU이기 때문에 중요합니다. 이번 출시에 대한 여러 초기 해석은 하나의 모델이 두 가지 역할을 모두 한다고 가정하지만, 그렇지 않습니다.

"intelligent transcription"이 실제로 의미하는 것
Google의 출시 게시물은 이것을 발음의 정확성을 넘어 이해로 나아가는 것으로 규정합니다. 그 프레이밍에서 뒤따르는 기능들이 프레이밍 자체보다 평가할 대상입니다:
• 비유창성 처리 — 'um'과 'ah'는 생략되고, 자기 수정은 해소됩니다. '화요일에 만나자 — 아니다, 수요일'은 잘못된 시작의 기록이 아니라 수정된 요일로 전사됩니다. 그것은 모델이 내리는 결정이며, Google이 이를 지능적이라고 부르는 의미입니다.
• 자동 서식 지정 — 출력은 구두점, 대소문자, 문단 구조가 적용된 다듬어진 텍스트로 반환되며, 원시 토큰 스트림이 아닙니다.
• 다중 화자 식별 — 사전 녹음된 오디오에서 단어 수준 타임스탬프와 함께 최대 3명의 화자가 식별됩니다. 3명 이상의 화자는 실험적 기능입니다. 이는 별도의 화자 분리 서비스가 아닌 기본 모델에 포함되어 있습니다.
• {{1}}맞춤 어휘{{/1}} — {{2}}어휘를 제공하여 전문 용어, 제품명, 특이한 철자에 대한 인식을 편향시킬 수 있습니다. 이는 수직 도메인을 위한 메커니즘입니다.{{/2}}
• 85개 이상의 언어 — 자동 감지, 지역별 억양과 방언이 명시적으로 표시됩니다.
• 함수 호출 — 모델은 이미지 생성이나 파일 분석 같은 작업을 다른 Gemini 모델에 위임할 수 있으며, 이는 전사를 최종 단계가 아닌 더 큰 에이전트의 구성 요소로 만듭니다.
• 엔티티 캡처 — Google은 잡음이 많은 실제 오디오와 우편 번호 및 주문 ID와 같은 영숫자 엔티티에서 강력한 성능을 주장합니다.
언론 보도에서는 또한 96,000-토큰 컨텍스트 창(분할 없이 약 1시간 분량의 회의 오디오에 해당)과 감정 감지 기능이 있다고 보도했습니다. 둘 다 출시 프레임과 일치하지만, Google이 게시한 모델 카드에는 이를 전면에 내세우지 않으므로, GA 사양서가 나올 때까지는 확정된 사실이 아닌 보도된 내용으로 취급하시기 바랍니다.

표시된 정확도 수치
Google이 인용한 WER 수치는 Artificial Analysis에서 가져온 것으로, 스트리밍 평균 단어 오류율 4.0%, 비스트리밍 전사 2.6%입니다. FLEURS 다국어 벤치마크에서 Google은 스트리밍 WER 5.50%, 비스트리밍 5.04%를 보고합니다. Google은 또한 이전 모델인 Chirp 3 대비 최종 전사 완료 시간이 70% 개선되었다고 주장합니다.
정직하게 읽자면, 이 측정값들은 Artificial Analysis가 Google이 아니라는 점에서 독립적이지만, Google이 선별한 측정값이며, Google 자체 발표문 안에 실린, 하루 동안 호출 가능했던 모델에 대한 것입니다. Google 외에는 아직 그 누구도 대부분의 팀이 비교 대상으로 삼는 오픈 가중치 모델들과 정면 일대일 비교를 수행하지 않았고, 출시 자료에는 Whisper 계열이나 NVIDIA의 Parakeet 라인과의 직접 비교도 없습니다. Chirp-3보다 70% 빠르다는 수치는 공급업체의 주장일 뿐입니다. 2.6%와 4.0%는 확정된 사실이 아니라 강력한 초기 신호로 간주하세요.
비용
Google의 가격 책정 페이지는 각 모델을 토큰 및 예상 오디오 시간(분)으로 견적합니다. gemini-3-5-transcribe의 경우 혼합 추정치는 정가 기준 오디오 1분당 약 $0.005이며, 입력은 약 $0.003/분, 출력은 약 $0.002/분입니다. gemini-3-5-transcribe-live의 경우 혼합 추정치는 분당 약 $0.009입니다. 두 모델 모두 현재 무료 등급을 제공합니다.
분당 수치는 가정된 토큰 비율(입력 오디오 초당 25토큰, 출력 텍스트 분당 175토큰)을 기준으로 산출된 추정치이므로, Google이 토큰 계산 방식을 변경하면 달라질 수 있습니다. 확실한 것은 원칙입니다. 공개 가격이 곧 가격이라는 원칙이요. 이는 OrcaRouter와 같은 패스스루 라우터가 작동하는 바로 그 원칙입니다. 마크업 0%, 공급업체 공개 가격을 그대로 전달하는 방식이죠. 따라서 Google이 프리뷰에서 GA(일반 제공) 전환 기간에 전사(transcription) 요금을 인하하면, 그 인하는 리셀러가 요율표를 업데이트한 이후가 아니라 당일 바로 저희 쪽에도 반영됩니다.
어디에 출시되고 있는지
개발자에게 오늘의 공개 미리보기는 두 가지 표면을 뜻합니다: Google AI Studio의 Gemini API와 엔터프라이즈 워크로드를 위한 Gemini Enterprise Agent Platform입니다. 소비자 측면에서 Gemini 3.5 Transcribe는 이미 Android의 Gboard에 있는 Rambler 받아쓰기 기능과 macOS의 Gemini 앱을 지원합니다. 다음은 Chrome입니다 — 모든 웹 필드에서 말로 입력하는 기능 — 그 뒤로 Search Live, Gemini Live, Docs, Keep, Gmail이 이어집니다. 이를 평가하는 팀에게 실질적인 답은 더 간단합니다: 오늘, 영어로, Gemini API를 사용할 수 있는 지역에서 코드에서 호출할 수 있다는 것입니다.

이것이 파이프라인에 의미하는 바
{{1}}진정으로 새로운 것은 WER 수치가 아닙니다. 핵심은 Google이 이제 기본 모델에 팀들이 이전에 직접 조합하던 두 가지 기능, 즉 화자 라벨과 단어 수준 타임스탬프를 포함한 전사를 판매하며, 함수 호출을 지원하는 Gemini API 상에서 제공한다는 점입니다.{{/1}} {{2}}일반 전사기와 별도의 다이어라이저, 포맷팅 패스를 조합해 화자 분리된 회의록 파이프라인을 구축하고 있었다면, 이는 그러한 단계들을 하나로 통합한 최초의 Google 모델입니다.{{/2}} {{3}}여전히 열린 질문은 2.6%의 비스트리밍 WER이 여러분의 실제 오디오에서도 유지되느냐는 것입니다. 독립적인 재현 결과가 나오기 전까지, 프로덕션 팀이 취할 책임 있는 선택은 Google이 선정한 벤치마크를 기준으로 예산을 잡기보다 실제 샘플을 API에 돌려보는 것입니다.{{/3}} {{4}}전사 결과 위에서 실행되는 LLM 작업, 즉 요약, 구조화 추출, 액션 아이템은 라우팅이 제 역할을 다하는 계층이며, OrcaRouter가 커버하는 계층이기도 합니다. 200개 이상의 모델에 걸친 단일 API, 공급자 간 자동 장애 조치, 여러 모델을 단일 호출로 구성하는 라우팅 DSL이 바로 그것입니다.{{/4}} {{5}}전사 단계 자체는 누군가가 내세운 수치를 믿기 전에 여러분의 오디오로 직접 테스트해야 합니다.{{/5}}
