기사 히어로 카드에는 'Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe'라는 문구, '모델 비교' 배지, '스트리밍 부문은 둘 중 하나의 몫입니다'라는 부제목, 2.7% vs 4.0% 스트리밍 WER, 3.4% vs 5.8% 첫 부분, 0.49초 vs 0.40초 최종, 1,000분당 $1.67 vs $5.00가 적힌 칩이 있으며, 흰색에서 파란색으로 이어지는 그라데이션 위 오른쪽 아래에는 OrcaRouter 로고가 있습니다.
Guides & Insights

Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe: 스트리밍 레인의 주인은 그중 하나

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Grok Voice Transcribe 2.0과 Gemini 3.5 Transcribe는 경쟁 연구소들이 내놓은 두 최신 최전선 음성-텍스트 모델이며, 이들을 비교하는 솔직한 방법은 처음부터 이 둘이 같은 작업용으로 만들어진 게 아니라는 점을 인정하는 것입니다. 2026년 9월 18일 출시된 SpaceXAI의 Grok Voice Transcribe 2.0은 배치 모드가 딸린 스트리밍 우선 모델로, 최종 전사에서는 2.7%, 첫 부분 결과에서는 3.4%의 단어 오류율로 AA-WER 스트리밍 보드 1위를 차지하며, 둘 다 발화 종료 후 0.49초에 도착합니다. 2026년 8월 26일 출시된 Gemini 3.5 Transcribe는 스트리밍 SKU가 딸린 배치 우선 모델이고, 그 두 부분은 매우 다르게 동작합니다. 사전 녹음 경로는 Artificial Analysis의 비스트리밍 보드에서 2.6% AA-WER를 기록하는 반면, 별도의 gemini-3.5-transcribe-live 엔드포인트는 스트리밍 보드에서 4.0%를 0.40초에 기록합니다. 그 네 숫자를 나란히 놓으면 이 맞대결의 형태는 뻔합니다. Gemini 3.5 Transcribe가 강한 정확도에서는 둘이 가깝고, Grok Voice Transcribe 2.0이 강한 곳에서는 둘이 가깝지 않습니다.

그들이 둘 다 싸우는 유일한 라인

두 모델 모두 실시간 오디오를 전사할 수 있으므로, 스트리밍은 직접 비교가 의미를 갖는 유일한 분야입니다. 그곳에서 Grok Voice Transcribe 2.0은 최종 전사 정확도에서 Gemini 3.5 Transcribe Live를 1.3포인트 앞서는데, 동일한 테스트 환경, 약 8시간의 동일한 오디오, 그리고 AA-AgentTalk, VoxPopuli 및 Earnings22에 걸친 동일한 50/25/25 가중치에서 WER이 2.7% 대 4.0%입니다. 이는 반올림 차이가 아닙니다. 그 오류율에서는 구글 모델이 전사하는 75개 단어마다 대략 잘못된 단어가 하나 더 있는 셈입니다. 첫 부분 전사에서는 격차가 더욱 큽니다. 3.4% 대 5.8%이며, 부분 전사는 라이브 음성 에이전트가 화자가 말을 마치기 전에 대응해야 하는 전사입니다.

지연 시간은 반대 방향으로 작용하며, 이번 비교에서 놓치기 쉬운 부분이 바로 여기다. Gemini 3.5 Transcribe Live는 발화 종료 후 0.40초 만에 최종 트랜스크립트를 반환하는 반면 Grok은 0.49초이고, 첫 부분 결과는 0.25초 대 Grok의 0.49초로 — 첫 사용 가능한 단어에 도달하는 속도가 대략 두 배 빠르다. 두 모델 모두 이 보드에서 진짜 빠른 끝단과 경쟁하지는 않는다. 그곳에서는 Deepgram Flux가 0.02초, Soniox v5가 0.05초를 기록한다. 하지만 이 둘 사이의 맞교환은 명확하다: Google은 더 빨리 말하고, SpaceXAI는 말할 때 더 맞을 가능성이 높다. 통화자의 말을 덮어써서는 안 되는 턴테이킹 에이전트에게 0.24초의 추가 부분 지연은 정확도 이득이 정당화해야 하는 실질적 비용이다.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% streaming final WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and a 100-concurrent-session cap; the right column gives Gemini 3.5 Transcribe 4.0%, 5.8%, 0.40s, $5.00, about $5.40 and a 10-minute session cap.

Gemini 3.5 Transcribe가 실제로 우위를 점하는 곳

언어 지원 범위는 가장 명확한 차이점이며, 그 격차는 크게 벌어져 있습니다. Google의 모델은 85개 이상의 언어를 처리하고, Grok Voice Transcribe 2.0은 수십 개 언어를 지원하며, 표기형 포매팅 — 말한 숫자, 날짜, 통화, 이메일 주소를 표기 형태로 바꾸는 역텍스트 정규화 — 이 25개 언어에 걸쳐 문서화되어 있습니다. 오디오가 포르투갈어, 베트남어, 또는 한 문장 안에서 두 언어가 코드 스위칭된 혼합어라면, Artificial Analysis 보드에서 어느 모델이 더 정확한지는 대체로 학술적인 질문에 불과합니다. 그 보드는 영어에 치중되어 있고 에이전트 대화 비중이 높기 때문입니다. Google은 자체 다국어 제품군 전반에서 FLEURS에 대해 스트리밍 5.50%, 비스트리밍 5.04% WER을 보고하는데, 이 수치는 벤더가 보고한 것이며 독립적으로 재현된 것은 아니지만 적어도 다국어 사례를 어느 정도는 설명합니다.

두 번째 이점은 무료 티어입니다. Gemini 3.5 Transcribe는 Google의 API에서 무료 입력 및 출력 토큰을 제공합니다. 단, 무료 티어 콘텐츠는 Google 제품 개선에 사용되지만 유료 티어 콘텐츠는 그렇지 않다는 점이 조건입니다. 프로토타입, 사이드 프로젝트 또는 전사하려고 따로 비용을 지불하지는 않을 오디오를 처리하는 내부 도구라면, 이는 시간당 과금 업체가 따라올 수 없는 실질적인 선택지입니다. Grok Voice Transcribe 2.0은 첫 오디오 시간부터 유료입니다.

그리고 세 번째는 Gemini 3.5 Transcribe가 전사 모드를 갖춘 범용 멀티모달 모델이지, 전용 ASR 서비스가 아니라는 점입니다. 이는 프롬프트를 받을 수 있고, 텍스트를 컨텍스트로 취할 수 있으며, Google이 출시하는 다른 모든 것과 동일한 API 표면에 위치합니다. 전사가 전사록에 대한 추론도 필요한 파이프라인의 한 단계라면, 둘 다 하나의 모델 호출로 유지하는 것은 단어별 오류율이 포착하지 못하는 가치가 있습니다.

가격 계산, 1,000분당

Artificial Analysis는 두 모델을 오디오 1,000분당 비용으로 정규화하는데, 이는 시간당 정액 요금을 토큰 청구와 비교할 수 있는 유일한 방법입니다:

• 배치, 사전 녹음 — Grok Voice Transcribe 2.0은 1,000분당 $1.67($0.10/시간) vs Gemini 3.5 Transcribe는 1,000분당 $5.00($0.30/시간, 100만 입력 토큰당 $2.00 및 100만 출력 토큰당 $12.00부터)

• 스트리밍 — Grok Voice Transcribe 2.0은 1,000분당 $3.33 (시간당 $0.20) vs Gemini 3.5 Transcribe Live는 약 1,000분당 $5.40 (1M 오디오 입력당 $3.50 및 1M 텍스트 출력 토큰당 $21.00에서 혼합)

• 배치 처리량 — 동일한 보드에서 Grok Voice Transcribe 2.0은 약 162× 실시간, Gemini 3.5 Transcribe는 약 88×이므로, 파일 작업에서는 더 저렴한 모델이 더 빠른 모델이기도 하다

• 라이브 세션 상한 — Grok Voice Transcribe 2.0은 팀당 동시 세션 100개 외에 공개된 세션 상한 없이 WebSocket을 통해 스트리밍하는 반면, Gemini 3.5 Transcribe Live는 세션당 10분으로 제한됨

그 마지막 줄은 정확도 수치보다 더 많은 아키텍처를 결정하는 운영상의 세부 사항이다. 라이브 세션에 대한 10분 상한은 긴 통화, 긴 회의, 긴 스트림을 잘라서 다시 설정해야 함을 의미하며, 재설정할 때마다 맥락이 유실되는 이음매가 된다. Grok의 스트리밍 엔드포인트는 배치 경로에서 500MB의 파일 크기 상한을, 스트리밍 경로에서 팀당 100개 세션의 동시성 제한을 두는데, 이는 지속 시간이 아니라 처리량이라는 다른 종류의 제약이다.

토큰 청구는 Google 쪽을 선택하기 전에 이해해 둘 가치가 있습니다. 왜냐하면 청구서가 하나가 아닌 두 변수의 함수가 되기 때문입니다. Gemini는 오디오 입력과 텍스트 출력에 대해 각각 요금을 부과하므로, 장황한 형식을 만들거나 같은 내용을 반복하는 모델은 그렇지 않은 모델보다 비용이 더 많이 들고, 단어가 더 긴 언어는 더 짧은 언어보다 비용이 더 많이 듭니다. Grok의 시간당 정액 요금은 이 중 어느 것에도 영향을 받지 않습니다. 대용량 워크로드의 경우 정액 요금이 예측하기 더 쉽고, OrcaRouter가 제공업체의 정가를 0% 마크업으로 그대로 전달하기 때문에, 어느 벤더 쪽의 변경이든 다음 계약 갱신 때가 아니라 발생한 당일 청구서에 반영됩니다.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first at 2.728% final-transcript word error rate and 0.490s, Gemini 3.5 Transcribe Live at 3.998% and 0.395s with a 5.774% first-partial figure, and the faster Deepgram Flux and Soniox v5 rows for latency context.

기능 형태: 각각이 거부하는 것

능력 목록은 정확도 수치가 시사하는 것보다 더 크게 갈라지며, 그 격차는 특정 애플리케이션에 중요한 부분에 있습니다:

• 화자 분리 — Grok Voice Transcribe 2.0에서 추가 비용 없이 포함됨; Gemini 3.5 Transcribe Live에서는 지원되지 않으므로, 해당 엔드포인트에서는 화자별 실시간 전사본을 전혀 사용할 수 없습니다

• 단어 수준 타임스탬프 — Grok Voice Transcribe 2.0은 단어별 신뢰도 점수와 함께 이를 반환합니다; Gemini 3.5 Transcribe Live는 아무것도 반환하지 않으므로, 이는 신뢰도 임계값 설정과 정밀한 자막 정렬을 불가능하게 합니다

• 멀티채널 오디오 — Grok Voice Transcribe 2.0은 한 번에 최대 8개의 독립 채널을 전사합니다; Gemini 3.5 Transcribe Live에는 이에 상응하는 기능이 없으므로 다채널 통화 녹음에는 채널별 세션이 필요합니다

• 핵심 용어 바이어싱 — Grok Voice Transcribe 2.0은 요청당 최대 100개의 도메인 용어를 허용하며, Gemini 3.5 Transcribe는 사용자 지정 어휘와 선택적 언어 힌트를 허용합니다

• 음성 에이전트 연결 체계 — Grok Voice Transcribe 2.0은 군더더기 단어 제거와 Smart Turn 턴 종료 감지를 제공하고, Gemini 3.5 Transcribe Live는 스트리밍 사례를 다루지만 턴 로직은 애플리케이션에 맡긴다

• 입력 처리 — Grok Voice Transcribe 2.0은 최대 500MB의 직접 파일 업로드를 12가지 오디오 형식으로 지원합니다. Gemini 3.5 Transcribe의 사전 녹음 경로는 15분 및 300MB 제한이 있는 공용 HTTPS URL을 필요로 하며, Smart formatting 모드를 단어 타임스탬프나 화자 레이블과 결합할 수 없습니다.

그 목록에 담긴 패턴은 SpaceXAI는 전사 제품을 만들었고 Google은 전사 기능을 만들었다는 것이다. 화자 분리, 타임스탬프, 채널 분할, 턴 감지는 전사가 애플리케이션 전체일 때 필요한 기능이고, 프롬프트 가능성, 언어 폭, 모든 것을 위한 단일 API는 전사가 더 큰 애플리케이션 안의 한 단계일 때 원하는 것이다. 추상적으로는 어느 목록이 더 낫지 않으며, 정확도만으로 고르는 팀은 결국 필요하지 않았던 세트를 놓치게 된다.

Screenshot of the Google ai.google.dev speech-generation documentation for Gemini 3.5 Transcribe, showing the pre-recorded and live transcription endpoints, the token-based audio-input and text-output pricing, the supported-language list and the 10-minute live session ceiling.

그중에서 고르기, 그리고 답을 바꾸는 요인

오디오가 아직 재생 중일 때도 전사가 정확해야 한다면 Grok Voice Transcribe 2.0을 선택하세요: 실시간 상담원 턴테이킹, 틀리면 안 되는 실시간 자막, 화자 귀속과 채널 분리가 요구사항의 일부인 컨택트 센터 스트림, 또는 1,000분당 $1.67과 162× 처리량이 모두 중요한 배치 파이프라인이라면 더욱 그렇습니다. 오디오가 Grok의 문서화된 언어 세트 밖의 언어로 된 다국어라면, 전사 결과가 그것에 대해 추론도 해야 하는 모델로 입력된다면, 무료 티어로 프로토타이핑하고 싶다면, 또는 배치 경로의 2.6% AA-WER가 지금 하는 일에 충분하고 추가 언어 커버리지가 가격 차이보다 더 가치 있다면 Gemini 3.5 Transcribe를 선택하세요.

여기서 대부분의 팀이 실제로 하는 일은 하나를 고르는 게 아니다. 두 모델 모두 하나의 OrcaRouter API 키를 통해 200개 이상의 다른 모델과 함께 접근할 수 있으므로, 두 개의 벤더 계약, 두 개의 청구 관계, 두 세트의 자격 증명을 유지하지 않고도 실시간 에이전트 트래픽은 Grok Voice Transcribe 2.0으로, 긴 다국어 아카이브는 Gemini 3.5 Transcribe로 라우팅할 수 있다. 이는 또한 자신의 오디오에 대한 정확도 문제를 해결하는 방법이기도 하다. 동일한 녹음에 두 모델을 모두 실행하고, 실제로 얻은 전사본을 비교한 다음, 라우팅 DSL이 트래픽을 알맞은 곳으로 보내게 하면 된다. 리더보드는 다른 사람의 8시간짜리 영어 에이전트 대화에서 어느 모델이 이기는지 알려줄 뿐이고, 자신의 오디오에서 어느 모델이 이기는지는 오직 자신의 오디오만이 알려준다.

남은 질문은 Google이 다음에 Live 엔드포인트를 개정할 때 그 스트리밍 격차가 어떻게 되는가이다. Gemini 3.5 Transcribe Live는 공개 프리뷰로 출시되었고, 4.0% 수치는 호출 가능해진 지 대략 하루 뒤에 측정되었다 — 강력한 초기 신호지만, 현재 자신이 뒤지는 Grok 수치보다 안정화될 시간이 더 적었다. Google이 0.25초 부분 지연을 유지하면서 1.3포인트 스트리밍 격차를 좁힌다면, 트레이드오프는 더 이상 트레이드오프가 아니게 되고 Grok의 이점은 가격과 기능으로 좁혀진다. 그때까지는 구분이 명확하다: 가장 빠른 부분 결과는 Google의 것이고, 가장 정확한 부분 결과는 SpaceXAI의 것이며, 보드 위 어떤 모델도 둘 다는 아니다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트