Cartão de título principal para 'Realtime-Venus vs Grok Voice Think Fast 2.0', com o subtítulo 'Um pode ser comprado hoje à tarde. O outro é um download.', com três cartões dizendo 'Grok Voice Think Fast 2.0: US$ 0,08 por minuto de áudio, 0,70 s até o primeiro áudio', 'Realtime-Venus: pesos Apache-2.0, sem API, sem tabela de preços' e 'A aposta em comum: raciocinar enquanto fala, não antes', acima de uma faixa de rodapé dizendo 'Números do Grok segundo a Artificial Analysis e a documentação da xAI; números do Realtime-Venus segundo seu relatório técnico, não reproduzidos.' O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

Realtime-Venus vs Grok Voice Think Fast 2.0: Apenas um deles tem preço

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque Realtime-Venus e Grok Voice Think Fast 2.0 lado a lado e a primeira diferença não é um benchmark, é um pedido de compra. Grok Voice Think Fast 2.0 é um modelo hospedado de fala para fala que foi posto à venda em 29 de julho de 2026 a US$ 0,08 por minuto de áudio, com um tempo até o primeiro áudio publicado de 0,70 segundos e pontuações de benchmark de terceiros. Realtime-Venus é um sistema full-duplex de 9B da equipe Venus da Ant Group e da Universidade Tsinghua que existe como pesos Apache-2.0, um relatório técnico datado de 12 de setembro de 2026, e nada que você possa chamar. Um deles você consegue conectar a uma linha telefônica antes do fim da semana. O outro você pode ler. Essa assimetria acaba sendo uma comparação muito mais útil do que um placar seria, porque os dois modelos fizeram quase a mesma aposta arquitetural e depois divergiram completamente sobre o que fazer com ela.

A resposta curta

Escolha o Grok Voice Think Fast 2.0 se você precisar de um agente de voz funcional agora, em produção, com uma tabela de preços que você pode incluir em um orçamento e uma garantia de latência que você pode testar. Escolha o Realtime-Venus se você precisar ser dono da stack — se seus dados não puderem sair da sua infraestrutura, se você precisar fazer ajustes finos no front end ou se estiver avaliando a arquitetura em vez de lançar um produto. Não há um terceiro caso em que eles competem, porque um tem uma API e o outro não.

Eles concordam sobre o problema difícil.

O interessante é como o diagnóstico é semelhante. Os dois modelos existem por causa da mesma contradição: o controle da conversa precisa operar em granularidade inferior a um segundo, e o raciocínio leva segundos. Um modelo que faz uma pausa para pensar deixa de parecer presente.

O Grok Voice Think Fast 2.0 resolve isso raciocinando enquanto fala. A linha Think Fast foi criada com base na ideia de que o modelo não deve inferir primeiro e gerar fala depois; em vez disso, ele transmite a fala e pensa em paralelo, de modo que uma chamada de ferramenta pode ser disparada antes que o agente termine sua primeira frase. A xAI relata que a versão 2.0 usa aproximadamente 0,4 vezes os tokens de raciocínio de sua predecessora, o que é apresentado como uma melhoria de custo e latência, e não de qualidade.

O Realtime-Venus resolve isso ao não resolver isso no frontend de forma alguma. Seu runtime de duplo loop mantém um loop de interação de um segundo em execução — percepção, controle de turno, geração de fala — e entrega qualquer coisa custosa a um componente separado chamado Realtime-Venus-Harness por meio de marcadores de delegação assíncronos emitidos na própria sequência oculta do modelo. A conversa em primeiro plano nunca pausa. Resultados em segundo plano são reintegrados quando chegam.

Essas são respostas de engenharia diferentes para a mesma pergunta, e têm modos de falha diferentes. Raciocinar enquanto fala coloca o ônus sobre o modelo de manter ambas as linhas de raciocínio coerentes. A delegação coloca o ônus sobre o runtime de impedir que os dois laços se corrompam mutuamente — e é por isso que a captura causal de tarefas do artigo Realtime-Venus, um instantâneo de estado isolado por tarefa delegada, é o detalhe que sustenta o design.

A única métrica pela qual ambos podem ser medidos

Os benchmarks full-duplex são o único ponto em que esses dois se sobrepõem, e eles não se sobrepõem de forma limpa.

• Tratamento de interrupções — O Realtime-Venus informa que responde a 75% das interrupções do usuário no Full-Duplex-Bench v1.5. O Grok Voice Think Fast 2.0 obtém 95,1% no Full Duplex Bench, segundo a Artificial Analysis, um aumento em relação aos 77,8% da versão 1.0.

• Continuação sob sobreposição — Realtime-Venus relata 97% de continuação sob backchannels, 88% sob fala dirigida a outros e 86% sob fala de fundo, e afirma superar Gemini 3.1 Live e GPT-4o nas três.

• Instrumentos diferentes, autores diferentes — os números do Realtime-Venus vêm de seu próprio relatório técnico, sem reprodução externa. Os números do Grok vêm de um terceiro que executou o modelo. Comparar um número autorrelatado com um medido independentemente não é uma comparação, e a diferença acima é tão provavelmente metodológica quanto real.

A leitura honesta: com base nas evidências disponíveis, o Grok Voice Think Fast 2.0 é o único dos dois cujo comportamento full-duplex foi medido por alguém sem qualquer interesse no resultado.

Onde os números independentes colocam o Grok Voice Think Fast 2.0

A leitura atual mais limpa vem do Speech Agent Arena da Artificial Analysis, que pontua modelos por preferência cega em conversas de voz ao vivo em tarefas como marcar uma consulta odontológica e pedir comida para viagem. Em 18 de setembro de 2026, o Grok Voice Think Fast 2.0 High ocupa o sétimo lugar entre mais de vinte entradas, com um Elo de 1.011 em 552 amostras — atrás do Gemini 3.1 Flash Live Minimal do Google, com 1.096, do Gemini 3.8 Live, com 1.083, e do GPT-Live-1, com 1.053, e bem à frente de seu próprio antecessor, o Grok Voice Think Fast 1.0, com 908.

A coluna ao lado do Elo é a mais interessante. Na taxa de sucesso em tarefas, o Grok Voice Think Fast 2.0 registra 94,6%, o maior número em qualquer lugar do top vinte visível — acima dos 93,2% do Gemini 3.8 Live, dos 91,5% do GPT-Realtime-2.1 High e dos 90,9% do GPT-Live-1. Sétimo em preferência, primeiro em conclusão de tarefas, é um perfil incomum e bastante específico: os ouvintes não adoram a voz, mas ela dá conta do recado. Se o seu produto faz coisas em vez de conversar, é essa a coluna que prevê o seu resultado, e é a evidência independente mais forte que qualquer um desses dois modelos tem.

A screenshot of the Artificial Analysis Speech Agent Arena Leaderboard captured 18 September 2026. The table reads, in rank order: Gemini 3.1 Flash Live Minimal Elo 1,096 with a 74.6% task success rate; Gemini 3.8 Live Elo 1,083 and 93.2%; Gemini 3.1 Flash Live High Elo 1,063 and 71.8%; GPT-Live-1 (Sol, low) Elo 1,053 and 90.9%; GPT-Live-1 (Astra, medium) Elo 1,048 and 87.4%; Cartesia Line Elo 1,027 and 77.5%; Grok Voice Think Fast 2.0 High Elo 1,011, 552 samples and 94.6%; GPT-Realtime-1.5 Elo 1,000 and 85.1%; and further down Grok Voice Think Fast 1.0 at Elo 908 with 80.7%.

Os números que a xAI publicou no lançamento são um instrumento diferente e devem ser lidos separadamente: 82,9% no índice de qualidade de fala para fala da Artificial Analysis, primeiro lugar no benchmark agêntico τ-Voice com 56,5%, 97,2% no Big Bench Audio e 95,1% no Full Duplex Bench. Essas eram as classificações quando o modelo foi lançado no final de julho de 2026, e os rankings dessa categoria mudam todo mês — e é exatamente por isso que a tabela da arena acima, lida hoje, vale mais do que os números do lançamento.

A two-column comparison scoreboard titled 'Realtime-Venus vs Grok Voice Think Fast 2.0 — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Availability: Apache-2.0 weights, no API', 'Price: none published', 'Modality: audio, video and text', 'Interruption response: 75% reported', 'Continuation under overlap: 97 / 88 / 86% reported', 'Independent scores: none'. The right column, labelled Grok Voice Think Fast 2.0, reads 'Availability: hosted API since 29 July 2026', 'Price: $0.08 per audio minute', 'Modality: audio and text', 'Interruption handling: 95.1% Full Duplex Bench at launch', 'Time to first audio: 0.70 s', 'Independent scores: Elo 1,011 and 94.6% task success on the Speech Agent Arena'. The footer reads 'Realtime-Venus figures from its technical report, unreproduced; Grok figures per Artificial Analysis and xAI documentation.'

A fatura, e as partes dela que não estão na fatura.

Grok Voice Think Fast 2.0 custa US$ 0,08 por minuto de áudio, aproximadamente US$ 4,80 por hora, mais US$ 0,004 por cada mensagem de entrada de texto. Isso representa um aumento de 60% em relação aos US$ 0,05 por minuto que a versão 1.0 cobrava no lançamento, e a xAI migrou o alias contínuo grok-voice-latest para a 2.0 automaticamente em 5 de agosto de 2026, de modo que as equipes que queriam manter o preço antigo tiveram de fixar uma versão explícita antes dessa data. O modelo por minuto também significa que as melhorias de eficiência ficam com o fornecedor: se o modelo ficar melhor em concluir chamadas mais rapidamente, sua fatura por chamada cai, mas seu custo por minuto não.

O Realtime-Venus não tem fatura, porque não tem serviço. O que ele tem, em vez disso, é um piso de hardware. Dois checkpoints de 9B em BF16 somam cerca de dezoito gigabytes de pesos cada antes da memória de ativação, e o cartão documenta um loop de streaming por segundo que precisa ser executado continuamente. Um nó de GPU capaz disso tem um custo mensal, e é um custo fixo — você paga independentemente de alguém chamar ou não. Para um produto com tráfego constante, isso é mais barato que $4,80 por hora. Para um produto com tráfego intermitente, é dramaticamente mais caro, e o ponto de cruzamento é a única questão financeira que importa aqui.

Pesos, controle e o que cada um permite alterar

É aqui que os dois modelos deixam de ser comparáveis por completo.

• Fine-tuning — Realtime-Venus inclui os pesos. Você pode ajustá-los, quantizá-los, executá-los em ambiente air-gapped e inspecionar cada camada. O Grok Voice Think Fast 2.0 é um modelo fechado e hospedado; o que você pode alterar é o prompt, a seleção de voz e as ferramentas que você registra.

• Voz — O Grok Voice Think Fast 2.0 vem com vozes predefinidas e oferece suporte à clonagem de voz personalizada a partir de cerca de um minuto de fala. O Realtime-Venus inclui uma voz de referência e um decodificador token-to-waveform integrado, e qualquer coisa além disso é problema seu.

• Alcance — Grok Voice Think Fast 2.0 oferece suporte a mais de 25 idiomas e fala PCM16 a 24 kHz por padrão, com μ-law para telefonia, em uma sessão WebSocket compatível com OpenAI Realtime. Essa compatibilidade é um verdadeiro ativo de migração: a maior parte do código de voz em tempo real existente precisa de uma alteração na URL base e na chave. Realtime-Venus documenta inglês e chinês.

• Vídeo — Realtime-Venus-Omni recebe vídeo em streaming e imagens por meio de um codificador SigLIP2 e realiza percepção visual contínua. Grok Voice Think Fast 2.0 é áudio e texto; não há caminho para câmera.

• Contexto longo — Realtime-Venus possui um contexto de 40.960 tokens e uma memória para vídeos longos sem treinamento que pode ser ativada em uma janela de quarenta minutos. Grok Voice Think Fast 2.0 é um modelo de sessão sem nenhum recurso de memória publicado comparável.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Any-to-Any, Transformers, Safetensors, audio, video, speech, streaming and full-duplex tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Onde cada um quebra

As falhas para as quais vale a pena planejar são opostas. A exposição do Grok Voice Think Fast 2.0 é a concentração de fornecedores e o marketing não verificável: os resultados A/B do Starlink da xAI, os seus multiplicadores de precisão de transcrição e a forma como enquadra a velocidade são todos informados pela empresa, sem dados subjacentes publicados, e um modelo por minuto que altera o preço em 60% entre versões já demonstrou que vai alterar o preço. Fixe a sua versão e execute as suas próprias avaliações no seu próprio áudio.

A exposição do Realtime-Venus é que ninguém o executou. Seus benchmarks são autorrelatados, seu harness não está documentado em relação à sua importância, e sua latência em uma implantação real é desconhecida — o relatório descreve uma cadência de interação de um segundo, que é um parâmetro de projeto, não um tempo medido até o primeiro áudio. Um modelo sem API e sem reprodução não tem histórico, apenas uma especificação.

Há um caminho intermediário que vale a pena declarar sem rodeios, porque é o que a maioria das equipes de fato fará. Se você está construindo um sistema baseado em delegação — escolha seu próprio front end, entregue o trabalho caro a um modelo de texto —, o front end e a etapa de raciocínio não precisam vir do mesmo lugar. O OrcaRouter não oferece nem o Realtime-Venus nem o Grok Voice Think Fast 2.0; ambas as camadas de voz ficam fora do que servimos, e dizemos isso em vez de insinuar o contrário. A etapa delegada é outra história. Quase 200 modelos de texto ficam atrás de uma única chave, pelo preço de tabela do provedor e sem markup, com failover automático para que uma indisponibilidade a montante não derrube uma chamada em andamento, uma DSL de roteamento para compor vários modelos em uma única chamada e fusão de modelos para decisões que merecem mais de uma opinião. Essa é a metade de um agente de voz que se beneficia de ser intercambiável, e é a metade que você pode mudar sem tocar no modelo que está conduzindo a conversa.

Qual escolher

Escolha o Grok Voice Think Fast 2.0 neste trimestre. Ele está disponível, passou por benchmark independente, está em primeiro lugar na avaliação agêntica que prevê se o seu agente consegue fazer algo útil, e 0,70 segundos até o primeiro áudio é um número sobre o qual você pode construir uma experiência de usuário. Reserve orçamento para o aumento de preço de 60% em relação à versão 1.0 e fixe a versão do seu modelo.

Escolha o Realtime-Venus apenas se a restrição for a propriedade. Se a sua implantação não puder chamar uma API externa, se você precisar fazer ajuste fino no front end conversacional, ou se precisar da câmera — esses três casos são o caso inteiro, e são fortes quando se aplicam.

O que não deveria decidir isso é a tabela de benchmark, porque os dois lados dela foram produzidos por pessoas diferentes sob condições diferentes. Os números do Grok Voice Think Fast 2.0 foram medidos por outra pessoa. Os do Realtime-Venus não foram. Até que isso mude, a comparação que está de fato disponível é entre um produto e um artigo.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente