
Gemini 3.8 Live vs GLM-4-Voice: O que 21 meses de IA de voz realmente trouxeram
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 459 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 183 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
GLM-4-Voice foi lançado em 3 de dezembro de 2024. Gemini 3.8 Live foi anunciado em 15 de setembro de 2026. São 21 meses, e esse é o fato mais importante nesta comparação — mais importante do que qualquer benchmark, porque determina que tipo de pergunta você está realmente fazendo.
Esses dois modelos não são rivais. Ninguém que esteja implantando voz em escala em 2026 está escolhendo entre eles com base na qualidade. A verdadeira questão é a que o GLM-4-Voice levanta e o Gemini 3.8 Live não consegue responder: o que seria necessário para possuir isto em vez de alugá-lo? Essa pergunta tem uma resposta genuína, e ela mudou menos em 21 meses do que você poderia esperar.
O que o Google lançou, e o que a Zhipu lançou
Gemini 3.8 Live é um modelo de diálogo ao vivo hospedado, de pesos fechados. Ele lida com entrada visual em tempo quase real, detecta e alterna automaticamente entre 97 idiomas compatíveis no meio da conversa, e executa ferramentas e chamadas de API em segundo plano enquanto a conversa continua. Está disponível para desenvolvedores por meio da Gemini API e do Google AI Studio, em pré-visualização privada no Gemini Enterprise, e no Search Live. O preço anunciado é $0,005 por minuto de entrada de áudio e $0,018 por minuto de saída de áudio pela Live API; o gráfico de custo por hora de áudio de entrada da Artificial Analysis o posiciona, de forma independente, em $1,50 por hora. Seu modelo irmão, Gemini 3.8 Live Extended Thinking, atualmente lidera esse mesmo índice com 82,6, enquanto o próprio Gemini 3.8 Live fica em 76,0.
GLM-4-Voice é o primeiro modelo de fala ponta a ponta da Zhipu AI e é um checkpoint baixável. Trata-se de uma montagem de três partes: um tokenizador de fala construído sobre um codificador Whisper-large-v3 com um gargalo de quantização vetorial com cerca de 0,4B de parâmetros, um modelo de linguagem autorregressivo (GLM-4-Voice-9B, inicializado a partir do GLM-4-9B) com cerca de 9B de parâmetros, e um decodificador flow-matching retreinado a partir do CosyVoice. Ele fala chinês e inglês, suporta emoção, tom, velocidade da fala e dialeto controlados por instruções — cantonês, mandarim de Chongqing, fala de Pequim, entre outros — e tokeniza a fala a 12,5 Hz em um único fluxo de codebook a aproximadamente 175 bps, uma ordem de magnitude inferior à dos codecs de áudio neurais típicos.
As dimensões, lado a lado:
• Lançamento — Gemini 3.8 Live: 15 de setembro de 2026. GLM-4-Voice: 3 de dezembro de 2024.
• Pesos — fechado, somente hospedado vs. disponível para download, código Apache-2.0 com uma licença personalizada para os pesos.
• Idiomas — 97 com troca no meio da conversa vs chinês e inglês.
• Visão — entrada visual quase em tempo real vs nenhuma.
• Chamada de ferramentas — execução de ferramentas e APIs em segundo plano no meio da conversa vs. nenhum canal de ferramentas.
• Contexto — não publicado pelo Google vs contexto de 8K, saída máxima de 4K.
• Requisito mínimo para auto-hospedagem — não aplicável vs 32 GB de RAM mais uma GPU CUDA oficialmente; cerca de 12 GB de VRAM em int4.
• Marca d'água — SynthID em todo áudio gerado vs nenhum descrito.

21 meses proporcionaram capacidade, não apenas qualidade
A história fácil é que um modelo de fronteira de 2026 supera um checkpoint aberto de 2024. Supera, e a margem é grande — mas a observação mais útil é que a categoria mudou de forma em vez de avançar ao longo de um único eixo.
No relatório técnico da própria Zhipu, o GLM-4-Voice obtém 93,6% de precisão de fala para texto no Topic-StoryCloze, 82,9% de fala para fala, uma naturalidade UTMOS de 4,45 e QA falado de 5,40/10 em geral e 5,20/10 em conhecimento — tudo autorrelatado e não reproduzido. A avaliação independente é mais escassa e menos lisonjeira: no VoiceBench, registra 56,48 no geral, ficando em torno de 29º de 42 em uma tabulação e 30º de 40 em outra, com a compreensão multiturno descrita como fraca nos dois idiomas. No benchmark de compreensão de diálogo multiturno C³, alcança 11,09% em chinês e 33,22% em inglês. O VCB Bench constatou que ele liderou no controle emocional, com 93,0 na sub-métrica SIF chinesa, e teve forte alinhamento texto–fala, mas o tratamento de dialetos do TELEVAL ficou em 4,57% sem instrução explícita.
Esses números descrevem um modelo que é bom em expressão vocal e ruim em compreensão sustentada. Essa é a descrição de um modelo de fala de 2024 em uma frase.
O 76,0 do Gemini 3.8 Live no Speech to Speech Index da Artificial Analysis é um composto de raciocínio de fala, desempenho agêntico, preferência em arena e taxa de sucesso em tarefas. Não é que o modelo mais novo seja melhor na mesma tarefa por um múltiplo maior. É que o composto agora inclui, de fato, desempenho agêntico e sucesso em tarefas — categorias nas quais o GLM-4-Voice não pode competir porque não tem canal de ferramentas. O modelo de 2024 está sendo avaliado em um jogo para o qual nunca foi criado.

A licença é a parte que as pessoas pulam
Se você está olhando para o GLM-4-Voice porque ele é aberto, leia os termos antes que os pesos terminem de baixar. A divisão é real e é fácil de interpretar mal:
• Código — Apache-2.0. Genuinamente permissiva.
• Pesos — uma licença personalizada que exige atribuição e registro na Zhipu para uso comercial.
“Pesos abertos” e “Apache-2.0” não são a mesma afirmação, e muita cobertura secundária deste modelo confunde as duas coisas. Se você pretende lançar um produto comercial baseado no GLM-4-Voice, o requisito de registro é uma etapa jurídica, não uma formalidade, e deveria estar no caminho crítico. Uma ferramenta de acompanhamento vai além e descreve o modelo como proprietário, com uso comercial condicional. De qualquer forma, a ausência de uma cobrança por minuto não é a ausência de uma relação comercial.
A aritmética dos custos, feita com honestidade
O argumento a favor da auto-hospedagem é que um custo mensal fixo supera um custo por minuto em escala. Esse argumento é real, e é menor do que parece quando você contabiliza o que está operando.
O GLM-4-Voice oficialmente exige 32 GB de RAM e uma GPU CUDA. As quantizações int4 da comunidade rodam com cerca de 12 GB de VRAM, na prática cerca de 10–11 GB, o que é território de RTX 3060, com um teto prático de aproximadamente 30 segundos de fala por turno. Uma A10 na nuvem a cerca de US$ 0,50–US$ 1,00 por hora equivale a algo entre US$ 350 e US$ 700 por mês para uma instância em execução contínua — antes de você ter atendido um único usuário, e sem failover, sem capacidade para picos e sem ninguém para acionar quando o decodificador produz ruído às 3 da manhã.
Em contrapartida, o Gemini 3.8 Live a $1.50 por hora de áudio de entrada significa que $350 compram aproximadamente 233 horas de voz. Isso não é obviamente pior, e vem com capacidade que você não provisionou. O ponto de equilíbrio existe; ele é mais alto do que a comparação de manchete sugere, e varia conforme seu tráfego seja constante ou em rajadas. Tráfego em rajadas é o caso em que a precificação por minuto vence de forma decisiva, porque GPUs ociosas geram exatamente a mesma cobrança que as ocupadas.
Também há uma diferença no que você recebe pelo dinheiro. Relatos da comunidade sobre implantações quantizadas do GLM-4-Voice colocam a latência de diálogo contínuo em 38–120 ms, embora esses números venham de textos escritos, e não da Zhipu. A latência do Gemini 3.8 Live não foi publicada pelo Google de modo algum. Se a baixa latência é um requisito inegociável para você, nenhum desses tem um número com o qual você possa planejar — um tem medições da comunidade de terceiros, o outro tem depoimentos de parceiros e nenhum número.

A opção intermediária: domine a lógica, alugue a capacidade
Enquadrar isso como auto-hospedado versus hospedado ignora o arranjo no qual a maioria das equipes realmente acaba. O GLM-4-Voice não tem canal de ferramentas, então qualquer produto construído sobre ele precisa de um modelo de texto separado para fazer a consulta — o que significa que o modelo de fala auto-hospedado fica na frente de um modelo de texto hospedado de qualquer forma. A decisão de implantação e a decisão de capacidade são separáveis.
É nessa divisão que um roteador faz trabalho de verdade. O OrcaRouter oferece 190 modelos por trás de uma única chave, pelo preço de tabela do provedor e sem sobretaxa, então o alvo de delegação por trás do seu front-end de fala pode ser trocado em tráfego ao vivo sem reconstruir nada, e um corte de preço a montante chega até você no mesmo dia, em vez de só na próxima renovação. O failover automático importa mais do que o normal em uma configuração auto-hospedada, porque quando é a sua própria instância de GPU que caiu, o modelo de backend continua acessível e a sessão não precisa morrer junto com ela. Dois esclarecimentos, já que esta comparação convida à confusão: nós não hospedamos o GLM-4-Voice, e os endpoints do Gemini 3.8 Live também não estão no nosso roteador — eles vêm de seus fornecedores. O que está no roteador é a camada de texto à qual os dois entregam trabalho.
A decisão, e a lição por trás dela
Escolha o GLM-4-Voice se você precisar do modelo em seu próprio hardware, se seu tráfego for genuinamente constante em alto volume, se você estiver desenvolvendo apenas em chinês ou inglês e se precisar modificar o modelo em vez de chamá-lo. Considere o registro da licença no orçamento como uma tarefa real e espere ter de resolver a compreensão de múltiplos turnos por conta própria — é o ponto fraco documentado do modelo, e nenhuma quantidade de ajuste fino em torno de um teto de saída de 4K conseguirá esconder isso por completo.
Escolha Gemini 3.8 Live se seus requisitos incluírem visão, chamada de ferramentas, mais de dois idiomas ou qualquer padrão de tráfego que você descreveria como tendo picos. É um modelo de prévia com números de contexto e latência não publicados, o que é um risco real de planejamento, mas também é o único dos dois que consegue consultar algo no meio da frase.
A lição geral vale mais do que qualquer um dos veredictos. Vinte e um meses de IA de voz produziram um modelo que não é principalmente um modelo de voz melhor — é uma interface de voz para um agente. Se o seu motivo para querer pesos abertos era o custo, as contas são mais equilibradas do que sugere o enquadramento isento de licenças. Se o seu motivo era o controlo, isso não foi de modo algum comoditizado, e o GLM-4-Voice continua a ser uma resposta legítima para uma pergunta que o Gemini 3.8 Live não aborda.
