Gemini 3.8 Live vs GLM-4-Voice의 히어로 타이틀 카드로, 킥커는 'OrcaRouter · 모델 레이더 — 정면 대결'이고 부제는 '음성 AI의 21개월이 실제로 무엇을 가져왔는가.'입니다. 두 카드에는 'Gemini 3.8 Live — 2026년 9월, 호스팅, 도구, 97개 언어'와 'GLM-4-Voice — 2024년 12월, 오픈 웨이트, 9B, 중국어 및 영어'라고 적혀 있으며, 21개월 차이, Apache-2.0 코드 및 커스텀 가중치 라이선스를 나타내는 칩이 함께 있습니다. OrcaRouter 로고는 오른쪽 하단 모서리에 합성됩니다.
Guides & Insights

Gemini 3.8 Live vs GLM-4-Voice: 21개월의 음성 AI가 실제로 얻은 것

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

GLM-4-Voice는 2024년 12월 3일에 출시되었습니다. Gemini 3.8 Live는 2026년 9월 15일에 발표되었습니다. 그것은 21개월이며, 이 비교에서 가장 중요한 사실입니다 — 어떤 벤치마크보다도 더 중요합니다. 왜냐하면 그것은 여러분이 실제로 어떤 종류의 질문을 하고 있는지를 결정하기 때문입니다.

이 두 모델은 경쟁자가 아니다. 2026년에 음성을 대규모로 배포하는 사람 중 누구도 품질을 두고 이 둘 사이에서 선택하지 않는다. 진짜 질문은 GLM-4-Voice가 제기하고 Gemini 3.8 Live는 답할 수 없는 질문이다. 이것을 빌리는 대신 소유하려면 무엇이 필요할까? 그 질문에는 진정한 답이 있으며, 그 답은 21개월 동안 생각보다 덜 바뀌었다.

구글이 출시한 것과 즈푸가 출시한 것

Gemini 3.8 Live는 호스팅 방식의 폐쇄형 가중치 실시간 대화 모델입니다. 거의 실시간에 가까운 시각 입력을 처리하고, 대화 도중 97개 지원 언어를 자동으로 감지해 언어 간을 전환하며, 대화가 계속되는 동안 백그라운드에서 도구와 API 호출을 실행합니다. 개발자는 Gemini API와 Google AI Studio를 통해 이용할 수 있고, Gemini Enterprise에서는 비공개 프리뷰로, Search Live에서도 제공됩니다. Live API를 통해 공개된 가격은 오디오 입력 분당 $0.005, 오디오 출력 분당 $0.018입니다. Artificial Analysis의 입력 오디오 시간당 비용 차트는 독립적으로 이를 시간당 $1.50으로 산정합니다. 그 자매 모델인 Gemini 3.8 Live Extended Thinking은 현재 같은 지수에서 82.6으로 1위를 차지하고 있으며, Gemini 3.8 Live 자체는 76.0을 기록하고 있습니다.

GLM-4-Voice는 Zhipu AI의 첫 엔드투엔드 음성 모델이며, 다운로드 가능한 체크포인트입니다. 이는 세 부분으로 이루어진 조립체입니다: 약 0.4B 파라미터의 벡터 양자화 병목을 갖춘 Whisper-large-v3 인코더 기반 음성 토크나이저, 자기회귀 언어 모델(GLM-4-Voice-9B, GLM-4-9B에서 초기화됨)로 약 9B 파라미터 규모, 그리고 CosyVoice에서 재학습된 플로 매칭 디코더입니다. 중국어와 영어를 구사하고, 명령으로 제어되는 감정, 어조, 말속도, 방언 — 광둥어, 충칭 만다린, 베이징어 등 — 을 지원하며, 음성을 12.5Hz로 약 175bps의 단일 코드북 스트림으로 토큰화하는데, 이는 일반적인 신경 오디오 코덱보다 한 자릿수 낮은 수준입니다.

치수, 나란히 비교:

• 출시 — Gemini 3.8 Live: 2026년 9월 15일. GLM-4-Voice: 2024년 12월 3일.

• 가중치 — 비공개, 호스팅 전용 vs 다운로드 가능, Apache-2.0 코드에 사용자 정의 가중치 라이선스 적용.

• 언어 — 중국어 및 영어 대비 대화 중 전환 포함 97개.

• Vision — 거의 실시간 시각 입력 대 없음.

• 도구 호출 — 대화 도중 백그라운드 도구 및 API 실행 vs 도구 채널이 전혀 없음.

• 컨텍스트 — Google에서 공개하지 않음 vs 8K 컨텍스트, 4K 최대 출력.

• 셀프 호스팅 최소 기준 — 해당 없음 vs 공식적으로 32GB RAM과 CUDA GPU; int4에서 약 12GB VRAM.

• 워터마킹 — 모든 생성된 오디오에 SynthID 적용 vs 아무 설명 없음.

A two-column scoreboard comparing Gemini 3.8 Live and GLM-4-Voice. Released Sep 15 2026 vs Dec 3 2024; weights closed and hosted vs open with a custom licence; languages 97 vs Chinese and English; tool calling background execution vs none; self-host floor not applicable vs 32 GB RAM plus a GPU or about 12 GB VRAM at int4; cost $1.50 per hour of input audio vs no per-minute bill. Footer reads 'GLM-4-Voice VoiceBench and UTMOS figures self-reported or third-party, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

21개월은 품질만이 아니라 역량을 사들였다

쉽게 떠올릴 수 있는 이야기는 2026년 프런티어 모델이 2024년 오픈 체크포인트를 능가한다는 것이다. 실제로 그렇고 격차도 크다 — 하지만 더 유용한 관찰은 그 범주가 하나의 축을 따라 이동한 것이 아니라 형태가 바뀌었다는 점이다.

Zhipu 자체 기술 보고서에서 GLM-4-Voice는 Topic-StoryCloze에서 음성-텍스트 정확도 93.6%, 음성-음성 82.9%, UTMOS 자연스러움 4.45, 음성 QA는 일반 5.40/10 및 지식 5.20/10을 기록했습니다 — 모두 자체 보고된 수치이며 재현되지 않았습니다. 독립 평가는 더 드물고 덜 호의적입니다: VoiceBench에서는 전체 56.48을 기록해 한 집계에서는 42개 중 약 29위, 다른 집계에서는 40개 중 30위에 위치하며, 두 언어 모두에서 다중 턴 이해력이 약하다고 설명됩니다. C³ 다중 턴 대화 이해 벤치마크에서는 중국어 11.09%, 영어 33.22%를 기록했습니다. VCB Bench는 중국어 SIF 하위 지표에서 93.0으로 감정 제어에서 앞섰고 텍스트-음성 정렬이 강하다고 평가했지만, TELEVAL 방언 처리는 명시적 지시 없이는 4.57%에 그쳤습니다.

그 숫자들은 음성 표현은 뛰어나지만 지속적인 이해력은 떨어지는 모델을 설명한다. 그게 2024년 음성 모델을 한 문장으로 요약한 것이다.

Gemini 3.8 Live가 Artificial Analysis의 Speech to Speech Index에서 기록한 76.0은 음성 추론, 에이전트 성능, 아레나 선호도, 작업 성공률을 종합한 점수다. 더 새로운 모델이 같은 작업에서 더 큰 배수로 더 뛰어나다는 뜻이 아니다. 종합 점수에 이제 에이전트 성능과 작업 성공이 아예 포함된다는 뜻이다 — GLM-4-Voice가 도구 채널이 없어 경쟁할 수 없는 범주들이다. 2024년 모델은 애초에 하도록 만들어지지 않은 게임에서 채점받고 있는 것이다.

Screenshot of the OrcaRouter models catalogue, showing hosted models listed with provider names and per-million-token pricing behind a single API key.

라이선스는 사람들이 건너뛰는 부분이다.

GLM-4-Voice가 공개되어 있다는 이유로 보고 있다면, 가중치 다운로드가 끝나기 전에 약관을 읽어 보세요. 그 구분은 실재하며 오해하기 쉽습니다:

• 코드 — Apache-2.0. 정말로 허용적인 라이선스입니다.

• 가중치 — 상업적 사용 시 저작자 표시와 Zhipu 등록을 요구하는 사용자 지정 라이선스입니다.

"오픈 웨이트"와 "Apache-2.0"은 같은 주장이 아니며, 이 모델에 관한 많은 2차 보도는 이 둘을 혼동한다. GLM-4-Voice를 기반으로 상용 제품을 출시할 계획이라면, 등록 요건은 형식적인 절차가 아니라 법적 단계이며, 핵심 경로에 올려야 한다. 한 트래커는 더 나아가 이 모델을 조건부 상업적 사용이 가능한 독점 모델이라고 설명한다. 어느 쪽이든, 분당 요금 청구가 없다는 것이 상업적 관계가 없다는 뜻은 아니다.

비용 산수, 정직하게 계산함

셀프 호스팅을 해야 하는 근거는 규모가 커지면 고정 월 비용이 분당 비용보다 낫다는 것입니다. 그 근거는 실재하지만, 운영해야 하는 것들을 따져 보면 보이는 것보다 작습니다.

GLM-4-Voice는 공식적으로 32GB RAM과 CUDA GPU를 요구합니다. 커뮤니티에서 만든 int4 양자화 버전은 대략 12GB VRAM에서 실행되며, 실제로는 약 10~11GB를 사용합니다. 이는 RTX 3060급 영역이고, 실질적인 상한은 턴당 약 30초 분량의 음성입니다. 시간당 약 $0.50~$1.00의 클라우드 A10은 계속 실행되는 인스턴스 기준 월 $350~$700에 해당합니다. 이는 단 한 명의 사용자도 서비스하기 전의 비용이며, 페일오버도, 버스트 용량도 없고, 새벽 3시에 디코더가 노이즈를 뱉어낼 때 호출할 담당자도 없습니다.

그에 반해, 입력 오디오 1시간당 $1.50인 Gemini 3.8 Live는 $350이면 약 233시간의 음성을 살 수 있다는 뜻이다. 그게 분명히 더 나쁜 것도 아니고, 프로비저닝하지 않은 용량까지 함께 제공한다. 교차점은 존재한다. 그것은 대표적인 비교가 시사하는 것보다 더 높으며, 트래픽이 꾸준한지 버스트성인지에 따라 달라진다. 버스트성 트래픽은 분당 요금제가 결정적으로 우세한 경우인데, 유휴 GPU도 사용 중인 GPU와 청구 금액이 정확히 같기 때문이다.

돈을 들여 얻는 것에도 차이가 있습니다. 양자화된 GLM-4-Voice 배포에 관한 커뮤니티 보고에서는 연속 대화 지연 시간을 38–120ms로 제시하지만, 그 수치는 Zhipu가 아니라 외부 글에서 나온 것입니다. Gemini 3.8 Live의 지연 시간은 Google이 전혀 공개하지 않았습니다. 낮은 지연 시간이 반드시 충족해야 할 요구 사항이라면, 이 둘 중 어느 쪽도 계획의 기준으로 삼을 수 있는 수치를 갖고 있지 않습니다. 하나는 제3자 커뮤니티 측정치가 있고, 다른 하나는 파트너 추천사만 있을 뿐 수치는 없습니다.

Screenshot of Google's official blog post titled 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated Sep 15, 2026 and credited to Tom Ouyang and Malini Jaganathan of the Gemini Audio Team, with the summary describing the models as Google's most advanced live dialogue models with major upgrades in intelligence and parallel reasoning.

중간 옵션: 로직은 소유하고, 역량은 임대하라

이것을 자체 호스팅 대 호스팅으로 프레이밍하는 것은 대부분의 팀이 실제로 도달하게 되는 구성을 놓치고 있다. GLM-4-Voice에는 도구 채널이 없으므로, 이를 기반으로 만든 모든 제품은 조회를 수행할 별도의 텍스트 모델이 필요하다 — 즉 어느 쪽이든 자체 호스팅 음성 모델이 호스팅 텍스트 모델 앞에 놓이게 된다. 배포 결정과 역량 결정은 분리될 수 있다.

그 분리가 바로 라우터가 실제로 일을 하는 지점입니다. OrcaRouter는 단일 키 뒤에 190개 모델을 공급사 정가 그대로, 마크업 없이 제공합니다. 따라서 음성 프런트엔드 뒤의 위임 대상은 실시간 트래픽에서도 아무것도 다시 구축하지 않고 교체할 수 있고, 업스트림 가격 인하는 다음 갱신 시점이 아니라 같은 날 바로 여러분에게 반영됩니다. 자동 장애 조치는 자체 호스팅 환경에서 평소보다 더 중요합니다. 왜냐하면 넘어져 버린 것이 바로 여러분 자신의 GPU 인스턴스일 때, 백엔드 모델은 여전히 접근 가능하며 세션이 그것과 함께 죽을 필요가 없기 때문입니다. 이 비교는 혼동을 부르기 쉬우니 두 가지를 분명히 하겠습니다. 우리는 GLM-4-Voice를 호스팅하지 않으며, Gemini 3.8 Live 엔드포인트도 우리 라우터에 없습니다 — 그것들은 각 공급사에서 제공됩니다. 라우터에 있는 것은 두 서비스가 작업을 넘기는 텍스트 계층입니다.

그 결정, 그리고 그 밑에 있는 교훈

다음과 같은 경우 GLM-4-Voice를 선택하세요: 모델을 자체 하드웨어에서 사용해야 하고, 트래픽이 대용량에서 정말로 꾸준하며, 중국어나 영어로만 구축하고, 모델을 호출하기보다 수정해야 하는 경우입니다. 라이선스 등록을 실제 작업으로 예산에 포함하고, 멀티턴 이해는 직접 해결해야 한다고 예상하세요 — 이는 이 모델의 문서화된 약점이며, 4K 출력 상한을 둘러싼 아무리 많은 파인튜닝으로도 그것을 완전히 숨길 수 없습니다.

를 선택하세요Gemini 3.8 Live요구 사항에 비전, 도구 호출, 세 개 이상의 언어 또는 변동이 심하다고 표현할 만한 트래픽 패턴이 포함된다면 말입니다. 이 모델은 컨텍스트와 지연 시간 수치가 공개되지 않은 프리뷰 모델이라 실질적인 계획 리스크가 있지만, 둘 중 문장 중간에 정보를 찾아볼 수 있는 유일한 모델이기도 합니다.

일반적인 교훈은 두 판정 어느 쪽보다도 더 가치가 있다. 21개월에 걸친 음성 AI는 주로 더 나은 음성 모델이라기보다 에이전트에 얹히는 음성 인터페이스인 모델을 낳았다. 오픈 웨이트를 원한 이유가 비용이었다면, 계산상 차이는 라이선스 무료라는 프레이밍이 시사하는 것보다 더 작다. 이유가 통제였다면, 그것은 전혀 상품화되지 않았으며, GLM-4-Voice는 Gemini 3.8 Live가 다루지 않는 질문에 대한 정당한 답으로 남아 있다.