'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo'를 위한 히어로 타이틀 카드로, 부제는 '베이스라인을 교체해야 할까요?'이다. 왼쪽에는 Gemini 3.5 Transcribe로 표시된 관리형 API 카드가 비스트리밍 기준 2.6% WER을 보여주고, 오른쪽에는 Whisper Large v3 Turbo로 표시된 오픈 가중치 카드가 LibriSpeech clean 기준 2.1%를 보여주며 MIT 배지와 809M 태그가 있다. 오른쪽 하단 모서리에는 OrcaRouter 로고가 있다.
Guides & Insights

Gemini 3.5 Transcribe vs Whisper Large v3 Turbo: 베이스라인 교체가 필요한가?

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Whisper Large v3 Turbo는 'speech-to-text'라는 문구가 업계의 상당 부분에서 기본적으로 지칭하는 모델이며, Gemini 3.​5 Transcribe는 그러한 기준선에 도전하는 모델로 명시적으로 판매되는 최초의 Go​ogle 전사 모델이다. 2026년 8월 26일부터 공개 미리보기로 제공되는 Gemini 3.​5 Transcribe는 전사를 추론 작업으로 재구성한다. 자체 수정을 해결하고, 출력 형식을 지정하고, 화자를 구분하며, 다른 G​emini 모델을 자체적으로 호출한다. Whisper Large v3 Turbo는 Ope​nAI의 8억 900만 파라미터 규모의 Whisper Large-v3 증류 모델로, MIT 라이선스, 자체 호스팅 가능, 99개 언어를 지원하며 하드웨어에 따라 증류 원본 모델보다 약 4~8배 빠르다. 하나는 오디오를 처리하는 관리형 지능 계층이고, 다른 하나는 원하는 곳 어디서나 실행할 수 있는 무료이면서도 잘 이해된 구성 요소다. 이 페이지가 답하고자 하는 질문은 '어느 쪽이 더 나은가'보다 더 좁고 더 유용하다. 기준선은 언제 더 이상 충분하지 않게 되는가?

이게 기준이야, 혹시 얼마나 좋은지 잊었을까 봐.

Whisper Large v3 Turbo는 기본 상태가 되어 마땅하므로, 그 근거를 먼저 제시합니다.

• 어디서나 실행 가능 — MIT 라이선스, 오픈 가중치(open weights), 노트북, 단일 GPU 또는 서버리스 함수에 설치 가능. 벤더 없음, 미터링 없음, 네트워크를 벗어나는 데이터 없음.

속도가 빠릅니다 — 증류된 디코더(인코더 32개 레이어, 디코더 4개 레이어, 32개에서 줄어든)는 일반적인 하드웨어에서 Whisper Large-v3보다 약 4배 빠르게 만들고, 일부 하드웨어에서는 그 이상이며, 정확도의 대부분을 유지합니다. Ope​nAI 자체 수치는 A100에서 약 8배입니다.

• 전사 기능에서 99개 언어를 지원하며, 이는 Gemini 3.5 Transcribe의 85개 이상보다 더 많은 언어 목록입니다.

• 그 정확성은 잘 문서화되어 있습니다: LibriSpeech test-clean에서 2.1% WER, test-other에서 4.2%, Common Voice English에서 9.1% — 이 수치들은 수년간 커뮤니티 전반에 걸쳐 재현되어 왔습니다.

• 생태계는 엄청납니다 — faster-whisper, whisper.cpp, ONNX 내보내기, 그리고 여러분이 이미 사용하는 모든 추론 프레임워크. 모델을 실행할 수 있다면, 이 모델도 실행할 수 있습니다.

A screenshot of the Hugging Face model page for openai/whisper-large-v3-turbo, showing the MIT license tag, the automatic-speech-recognition pipeline tag, the Transformers and Safetensors tags, the 99-languages tag, and the model card for the 809 million parameter distilled version of Whisper Large-v3, captured August 27 2026.

영어 및 영어에 준하는 대규모 배치 전사에 있어, Whisper Large v3 Turbo는 어떤 벤치마크 격차도 쉽게 무너뜨릴 수 없는 구조적 이유로 현행 표준입니다: 무료이고, 여러분의 것이며, 어디에나 있기 때문입니다.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo - the scoreboard'. Left column Gemini 3.5 Transcribe: Deployment managed API, Languages 85+, WER 2.6% non-streaming, Speaker ID built in, Formatting intelligent, Price ~$0.005/min. Right column Whisper Large v3 Turbo: Deployment anywhere self-host, Languages 99, WER 2.1% LibriSpeech clean, Speaker ID none, Formatting plain, Price free to run. Footer reads 'Gemini WER per Artificial Analysis, cited by Google; Whisper WER on LibriSpeech - a different set, see text.'

Gemini 3.5 Transcribe가 추가로 더하는 것

관리형 도전자의 가치는 깨끗한 영어에서 기준선을 이기는 것이 아니다. 그것은 숫자조차도 아직 깔끔하게 결정하지 못하는 싸움이다. 그 가치는 단어 위에서 이루어지는 작업, 즉 Whisper가 명시적으로 수행하지 않는 작업에 있다:

• 화자 속성 — 기본 모델에서 최대 3명의 화자에 대한 단어 수준 타임스탬프 제공. Whisper는 하나의 음성 스트림을 전사하며, 누가 말했는지에 대한 개념이 없습니다.

• 지능형 서식 — 머뭇거림 제거, 자기 수정 정리, 구두점 및 대소문자 적용. {{1}}Whisper는 말한 그대로 단어를 반환하며, '음'과 같은 머뭇거림도 포함합니다.{{/1}}

• 사용자 정의 어휘 — 전문 용어와 특이한 철자에 편향됩니다. Whisper에는 이러한 메커니즘이 없으므로, 사후 처리하거나 미세 조정해야 합니다.

• 함수 호출 — 트랜스크립트는 다른 G​emini 모델에 핸드오프할 수 있으며, 이로써 전사가 최종 출력이 아니라 에이전트 파이프라인의 한 단계가 된다.

• 긴 세션 — 한 번의 처리로 약 1시간 분량의 오디오를 다루는 것(언론에 보도된 96K 컨텍스트)과, Whisper가 긴 파일을 청크로 나누고 이어 붙여야 하는 현실적 필요성의 대비.

그것은 다른 제품입니다. 그것은 Go​ogle이 "지능형 전사"라고 부르는 것이며, 벤치마크 계산에 의존하지 않는 비교의 일부입니다.

아직 아무도 명확히 답할 수 없는 정확성의 문제

두 모델의 대표 수치는 실제로 정면으로 맞붙는 수치가 아니다. Gemini 3.​5 Transcribe의 비스트리밍 WER 2.6%는 Go​ogle이 인용한 Artificial Analysis 측정값으로, 85개 이상의 언어를 대상으로 산출되었다. Whisper Large v3 Turbo의 LibriSpeech test-clean 2.1%는 Ope​nAI 자체 증류(distillation) 논문에서 비롯된 영어 벤치마크로, 널리 재현되었다. 말뭉치도, 언어 범위도, 공급 주체도 다르다. 정직하게 말할 수 있는 것은 이렇다. 깨끗한 영어 음성에서는 오픈 베이스라인과 관리형 도전자가 비슷한 수준대에 있을 가능성이 높으며, 관리형 모델의 우위는 입증된 영어 WER 승리가 아니라 다국어 및 구조적 기능에 있다. Go​ogle의 출시 자료에는 Whisper 계열 모델과의 정면 비교가 없고, Gemini 3.​5 Transcribe가 공개된 지 하루밖에 되지 않았기 때문에 독립적인 대결 비교도 아직 존재하지 않는다. 그런 비교가 나타나기 전까지 정확도의 왕관은 주인 없는 상태이며, 이 두 수치로 WER 승자를 선언하는 어떤 기사(이 글 포함)도 무리수다.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

비용: 분당 $0.005에 비해 무료 실행

Whisper Large v3 Turbo는 하드웨어 비용만 있고 사용량 측정(미터)이 없습니다. 이미 보유한 GPU에서 실행하면 전사된 분당 한계 비용이 거의 0에 가깝고, GPU를 빌리면 작업하는 동안 해당 인스턴스 비용만 청구됩니다. Gemini 3.​5 Transcribe는 혼합 기준 오디오 분당 약 $0.005를 청구하며, 라이브 SKU는 분당 약 $0.009이고 무료 등급이 있습니다. 오디오 1,000시간의 경우 G​emini 미터 기준 약 $300인 반면, 오픈 베이스라인에서는 GPU 시간으로 몇 달러에 불과합니다. 이 격차가 이번 대결의 실제 비용 이야기이며, 이것이 오픈 베이스라인이 대용량 영어 배치 작업에서 오랫동안 기본 선택지로 남게 될 이유입니다. 관리형 모델의 경제성은, 다이어리제이션, 포맷팅, 어휘 제어처럼 번들로 제공되는 기능들을 Whisper 위에 직접 조립하는 데 드는 엔지니어링 시간이 더 클 때에만 비슷해집니다.

언어 및 스트리밍

Whisper Large v3 Turbo는 99개 언어, Gemini는 85개 이상의 언어를 지원하지만, 실제 다국어 처리에서는 상황이 다릅니다. Whisper는 자동 감지 없이 99개 언어를 모두 한 번에 전사하며, 저자원 언어와 잡음이 많은 언어에서 정확도가 가장 크게 저하됩니다. 이는 증류 모델의 트레이드오프입니다. Gemini는 85개 이상의 언어 중에서 자동 감지하고, Google은 지역 억양과 방언을 강조합니다. 스트리밍의 경우 Whisper에는 네이티브 실시간 모델이 없습니다. 실시간 배포는 자체 하드웨어에서 faster-whisper와 유사한 프레임워크를 사용하는 반면, Gemini 3.5 Transcribe는 전용 라이브 엔드포인트를 갖추고 있으며, 1초 미만 지연 시간을 주장하고 그에 맞는 가격이 책정되어 있습니다. 워크로드가 실시간 및 다국어라면 관리형 엔드포인트가 운영하기 더 간단하고, 배치 작업에 영어라면 오픈 베이스라인이 더 저렴합니다.

평결, 그런 것이긴 하지만

Whisper Large v3 Turbo는 대규모 영어 배치 전사, 자체 인프라에서 실행해야 하는 모든 작업, 그리고 동결되고 감사 가능한 산출물을 원하는 팀에게 여전히 올바른 기본 선택입니다. Gemini 3.5 Transcribe는 전사 결과가 단순한 단어 이상이어야 할 때 — 화자 라벨, 깔끔한 형식, 도메인 어휘, 다국어 지원, 또는 에이전트 연동 — 그리고 이러한 기능에 대해 비용을 지불할 의향이 있을 때 올바른 선택입니다. 이 둘은 공존하며, 공존을 저렴하게 만드는 패턴은 라우팅 경계입니다: 오디오에 맞는 전사기를 선택한 다음, 텍스트로 무엇을 할지 결정하는 LLM 계층입니다. OrcaRouter가 운영하는 것이 바로 이 계층입니다 — 200개 이상의 모델을 아우르는 하나의 API, 공급자 간 자동 장애 조치(failover), 그리고 여러 모델을 하나의 호출로 조합하기 위한 라우팅 DSL입니다. 어떤 음성 모델도 우리 측에서 호스팅되지 않습니다. 전사 선택은 여러분의 GPU와 Google의 종량제 사이의 문제이며, 둘 다 오랫동안 계속 존재할 것입니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube