
Gemini 3.8 TTS vs Sesame Preview: Um deles é um download, o outro é um aplicativo.
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
Procure por uma comparação entre Gemini 3.8 Flash TTS e Sesame Preview e você encontrará muitos textos que os tratam como dois produtos da mesma categoria. Não são, e a diferença não é um detalhe técnico. O Gemini 3.8 Flash TTS é um endpoint de API: tem um identificador de modelo, uma tabela de preços publicada, uma posição no ranking em 2º lugar com um Elo de 1.260 em 1.999 amostras na Artificial Analysis Provider Voice Arena, e um formato de requisição documentado. O Sesame Preview é um aplicativo gratuito de assistente de voz para consumidores, com agentes nomeados, conversas com múltiplos turnos e um limite de 30 minutos por chamada. Ele não tem API, nem ID de modelo, nem plano de cobrança, nem pontuação nesse ranking.
O único artefato da Sesame sobre o qual você pode realmente construir é outra coisa ainda: CSM-1B, um checkpoint Apache 2.0 no Hugging Face que gera códigos de áudio a partir de texto usando um backbone Llama e um decodificador de áudio Mimi. Não é a voz de que as pessoas falam quando descrevem o quão humana a aplicação soa. Então a comparação se resume a uma pergunta que tem resposta: você quer alugar um modelo de fala ou quer baixar um?

Duas coisas chamadas Sesame, e só uma delas pode ser construída
A nomenclatura é a fonte da maior parte da confusão, então separe-a antes de prosseguir.
• Sesame Preview — o aplicativo. Gratuito para usar, agentes chamados Maya, Miles, Simone e Charlie, conversa com vários turnos e contexto que persiste entre os turnos, pesquisa na web e lembretes como recursos, apenas em inglês, limite de 30 minutos por chamada. Não há superfície para desenvolvedores: nada para autenticar, nada para medir, nenhum endpoint para chamar.
• CSM-1B — o checkpoint. Publicado no Hugging Face sob sesame/csm-1b com uma licença Apache 2.0, um backbone Llama e um decodificador menor que produz códigos de áudio Mimi. Cerca de 2 bilhões de parâmetros, inglês, pesos F32, e roda por meio do Hugging Face Transformers. O cartão do modelo registra a variante 1B lançada em março de 2025 e o suporte nativo ao Transformers chegando em maio de 2025.
Esses dois compartilham uma empresa e uma linhagem de pesquisa, e é mais ou menos aí que a relação termina. O aplicativo é um produto; o checkpoint é um artefato da pesquisa que o precedeu. Avaliadores que elogiam a memória conversacional do aplicativo estão descrevendo um sistema com recuperação e gerenciamento de estado em torno de um modelo de fala, não uma propriedade do checkpoint de 2B que você pode baixar.
O que está realmente no checkpoint
O CSM-1B é um modelo de text-to-speech no sentido arquitetural que importa para qualquer pessoa que planeje executá-lo: ele recebe texto e contexto de áudio como entrada e emite códigos de áudio RVQ, que o decodificador transforma em forma de onda. Os fatos práticos da ficha do modelo:
• Licença — Apache 2.0. Esta é a linha mais decisiva da página. Ao contrário de licenças de pesos apenas para investigação, a Apache 2.0 permite uso comercial sem um acordo separado, o que torna o CSM-1B um dos poucos checkpoints de fala abertos genuinamente utilizáveis.
• Tamanho — cerca de 2B parâmetros em F32. Grande o suficiente para precisar de hardware real para qualquer coisa concorrente, pequeno o suficiente para rodar em um único acelerador para desenvolvimento.
• Idioma — Inglês, conforme o card. Não é um modelo multilíngue.
• Tração — 141.461 downloads no último mês, no momento em que escrevo, com cerca de 245.000 curtidas no repositório. Esse é um checkpoint amplamente utilizado segundo os padrões de modelos de fala abertos, e é o argumento mais forte de que o artefato tem uma base real de usuários independentemente da divulgação do aplicativo.

O que a ficha não oferece é uma alegação de qualidade que você possa comparar com qualquer coisa. Não há uma linha em arena, nenhum benchmark de fornecedor reproduzido por terceiros e nenhuma avaliação publicada de como a saída do checkpoint se relaciona com a do aplicativo. Quem lhe disser que o modelo baixável soa como o aplicativo está inferindo isso a partir do nome.
Por que não há uma comparação direta, e por que isso não é uma lacuna de pesquisa
Não existe uma comparação entre Gemini 3.8 TTS e Sesame Preview nas tabelas de classificação porque não pode existir. A arena classifica os modelos fazendo com que ouvintes comparem clipes produzidos por um endpoint hospedado. Um dos lados desse par não tem um endpoint, portanto não pode ser inscrito.
Vale a pena ser preciso sobre isso, porque "não existe comparação direta" muitas vezes é descrito como se os dados estivessem faltando. Não estão faltando. São indefinidos. As duas coisas que estão sendo comparadas não compartilham uma superfície mensurável:
• O Gemini 3.8 Flash TTS é avaliado com base nas suas vozes hospedadas nativas. O Sesame Preview não tem vozes nativas para avaliar nesse sentido — tem agentes.
• O Gemini 3.8 Flash TTS publica uma tabela de preços em tokens. O Sesame Preview é gratuito e não publica nada, porque não há nada a cobrar.
• O Gemini 3.8 Flash TTS recebe um script e retorna áudio. O Sesame Preview recebe uma conversa e retorna uma conversa, com toda a recuperação e memória que o app adiciona por cima.
A coisa mais próxima de uma comparação legítima é entre Gemini 3.8 Flash TTS e CSM-1B, e mesmo essa é desigual: um tem um Elo independente e uma tabela de preços do fornecedor, o outro não tem nenhum dos dois. O que se pode comparar é a forma do compromisso — uma API com medição contra um checkpoint baixável — e essa comparação não precisa de um ranking.
O único lado disto com números.
Tudo o que é quantitativo neste pareamento está do lado do Google, o que, por si só, é justamente o ponto.
Na Artificial Analysis Provider Voice Arena, capturada em 24 de setembro de 2026, o Gemini 3.8 Flash TTS está na 2ª posição, com um Elo de 1.260 em 1.999 amostras e 8 vozes da arena, tendo sido lançado em 23 de setembro de 2026. Seu modelo irmão, o Gemini 3.8 Flash-Lite TTS, está na 6ª posição, com 1.235. O Google cobra pelo Flash TTS US$ 0,50 por milhão de tokens de texto de entrada e US$ 9,00 por milhão de tokens de áudio de saída até 31 de dezembro de 2026, passando depois para US$ 18,00, e pelo Flash-Lite TTS US$ 0,50 e US$ 6,00, passando depois para US$ 12,00; a Artificial Analysis normaliza esses valores para US$ 16,50 e US$ 11,00 por milhão de caracteres, para que possam compartilhar um mesmo ranking com modelos que cobram em outras unidades. Essa normalização é a aritmética do ranking, não uma citação do Google.
Em contrapartida, o CSM-1B não tem preço porque não tem medidor. Tem uma contagem de downloads, uma licença e uma contagem de parâmetros. Se o seu arcabouço de decisão precisa de um Elo, esta comparação não fornecerá um para o lado da Sesame, e a conclusão honesta é que as duas opções estão sendo avaliadas com base em critérios diferentes, e não que uma delas não tenha sido comprovada.

Se o que você queria era a experiência do app
Muitas pessoas que pesquisam essa comparação não estão escolhendo modelo nenhum. Elas usaram o aplicativo Sesame, gostaram de como a conversa parecia e querem isso no produto delas. Esse é um problema diferente, e o download não vai resolver isso.
O que faz o aplicativo ter a sensação que tem não é, em sua maior parte, o modelo de fala. Contexto persistente entre turnos, a decisão de pesquisar na web no meio da conversa, o momento em que um agente fala — isso é orquestração, e nada disso mora em um checkpoint de 2B. Baixar o CSM-1B lhe dá uma voz. Construir o comportamento do aplicativo em cima disso é engenharia sua, e o limite de 30 minutos por chamada e a ausência de uma API significam que você também não pode alugar a versão pronta.
Se o que você queria era um modelo de fala que você possa chamar, a resposta honesta é que o Gemini 3.8 Flash TTS é a opção com interface documentada, preço publicado, pontuação independente e diálogo entre dois falantes em uma única requisição. Se o que você queria eram pesos que você possa guardar, o CSM-1B sob Apache 2.0 é o único dos dois que você realmente pode manter — e a contrapartida é que você mesmo fornece o hardware, a pilha de serviço e todas as garantias de qualidade.
O OrcaRouter não hospeda nenhum destes. O modelo do Google é chamado através da própria API do Google e das superfícies nomeadas no seu anúncio de 23 de setembro; o CSM-1B é um checkpoint que você mesmo executa. O propósito do OrcaRouter é a camada acima dessa escolha: mais de 200 modelos por trás de uma única chave, ao preço de tabela do provedor e sem markup, de modo que uma mudança de tarifa do fornecedor entra em vigor no mesmo dia, failover automático para que uma rota experimental não seja uma dependência de produção, e uma DSL de roteamento que compõe modelos em uma única chamada quando uma só voz não dá conta do trabalho todo.
A versão resumida desta comparação é que ela não é bem uma comparação. Um lado tem uma tabela de preços e um Elo; o outro tem uma licença e um número de downloads. Escolha aquele cuja coluna você consegue de fato preencher.
