
Realtime-Venus vs Grok Voice Think Fast 2.0: Apenas um deles tem preço
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Coloque Realtime-Venus e Grok Voice Think Fast 2.0 lado a lado e a primeira diferença não é um benchmark, é um pedido de compra. Grok Voice Think Fast 2.0 é um modelo hospedado de fala para fala que foi posto à venda em 29 de julho de 2026 a US$ 0,08 por minuto de áudio, com um tempo até o primeiro áudio publicado de 0,70 segundos e pontuações de benchmark de terceiros. Realtime-Venus é um sistema full-duplex de 9B da equipe Venus da Ant Group e da Universidade Tsinghua que existe como pesos Apache-2.0, um relatório técnico datado de 12 de setembro de 2026, e nada que você possa chamar. Um deles você consegue conectar a uma linha telefônica antes do fim da semana. O outro você pode ler. Essa assimetria acaba sendo uma comparação muito mais útil do que um placar seria, porque os dois modelos fizeram quase a mesma aposta arquitetural e depois divergiram completamente sobre o que fazer com ela.
A resposta curta
Escolha o Grok Voice Think Fast 2.0 se você precisar de um agente de voz funcional agora, em produção, com uma tabela de preços que você pode incluir em um orçamento e uma garantia de latência que você pode testar. Escolha o Realtime-Venus se você precisar ser dono da stack — se seus dados não puderem sair da sua infraestrutura, se você precisar fazer ajustes finos no front end ou se estiver avaliando a arquitetura em vez de lançar um produto. Não há um terceiro caso em que eles competem, porque um tem uma API e o outro não.
Eles concordam sobre o problema difícil.
O interessante é como o diagnóstico é semelhante. Os dois modelos existem por causa da mesma contradição: o controle da conversa precisa operar em granularidade inferior a um segundo, e o raciocínio leva segundos. Um modelo que faz uma pausa para pensar deixa de parecer presente.
O Grok Voice Think Fast 2.0 resolve isso raciocinando enquanto fala. A linha Think Fast foi criada com base na ideia de que o modelo não deve inferir primeiro e gerar fala depois; em vez disso, ele transmite a fala e pensa em paralelo, de modo que uma chamada de ferramenta pode ser disparada antes que o agente termine sua primeira frase. A xAI relata que a versão 2.0 usa aproximadamente 0,4 vezes os tokens de raciocínio de sua predecessora, o que é apresentado como uma melhoria de custo e latência, e não de qualidade.
O Realtime-Venus resolve isso ao não resolver isso no frontend de forma alguma. Seu runtime de duplo loop mantém um loop de interação de um segundo em execução — percepção, controle de turno, geração de fala — e entrega qualquer coisa custosa a um componente separado chamado Realtime-Venus-Harness por meio de marcadores de delegação assíncronos emitidos na própria sequência oculta do modelo. A conversa em primeiro plano nunca pausa. Resultados em segundo plano são reintegrados quando chegam.
Essas são respostas de engenharia diferentes para a mesma pergunta, e têm modos de falha diferentes. Raciocinar enquanto fala coloca o ônus sobre o modelo de manter ambas as linhas de raciocínio coerentes. A delegação coloca o ônus sobre o runtime de impedir que os dois laços se corrompam mutuamente — e é por isso que a captura causal de tarefas do artigo Realtime-Venus, um instantâneo de estado isolado por tarefa delegada, é o detalhe que sustenta o design.
A única métrica pela qual ambos podem ser medidos
Os benchmarks full-duplex são o único ponto em que esses dois se sobrepõem, e eles não se sobrepõem de forma limpa.
• Tratamento de interrupções — O Realtime-Venus informa que responde a 75% das interrupções do usuário no Full-Duplex-Bench v1.5. O Grok Voice Think Fast 2.0 obtém 95,1% no Full Duplex Bench, segundo a Artificial Analysis, um aumento em relação aos 77,8% da versão 1.0.
• Continuação sob sobreposição — Realtime-Venus relata 97% de continuação sob backchannels, 88% sob fala dirigida a outros e 86% sob fala de fundo, e afirma superar Gemini 3.1 Live e GPT-4o nas três.
• Instrumentos diferentes, autores diferentes — os números do Realtime-Venus vêm de seu próprio relatório técnico, sem reprodução externa. Os números do Grok vêm de um terceiro que executou o modelo. Comparar um número autorrelatado com um medido independentemente não é uma comparação, e a diferença acima é tão provavelmente metodológica quanto real.
A leitura honesta: com base nas evidências disponíveis, o Grok Voice Think Fast 2.0 é o único dos dois cujo comportamento full-duplex foi medido por alguém sem qualquer interesse no resultado.
Onde os números independentes colocam o Grok Voice Think Fast 2.0
A leitura atual mais limpa vem do Speech Agent Arena da Artificial Analysis, que pontua modelos por preferência cega em conversas de voz ao vivo em tarefas como marcar uma consulta odontológica e pedir comida para viagem. Em 18 de setembro de 2026, o Grok Voice Think Fast 2.0 High ocupa o sétimo lugar entre mais de vinte entradas, com um Elo de 1.011 em 552 amostras — atrás do Gemini 3.1 Flash Live Minimal do Google, com 1.096, do Gemini 3.8 Live, com 1.083, e do GPT-Live-1, com 1.053, e bem à frente de seu próprio antecessor, o Grok Voice Think Fast 1.0, com 908.
A coluna ao lado do Elo é a mais interessante. Na taxa de sucesso em tarefas, o Grok Voice Think Fast 2.0 registra 94,6%, o maior número em qualquer lugar do top vinte visível — acima dos 93,2% do Gemini 3.8 Live, dos 91,5% do GPT-Realtime-2.1 High e dos 90,9% do GPT-Live-1. Sétimo em preferência, primeiro em conclusão de tarefas, é um perfil incomum e bastante específico: os ouvintes não adoram a voz, mas ela dá conta do recado. Se o seu produto faz coisas em vez de conversar, é essa a coluna que prevê o seu resultado, e é a evidência independente mais forte que qualquer um desses dois modelos tem.

Os números que a xAI publicou no lançamento são um instrumento diferente e devem ser lidos separadamente: 82,9% no índice de qualidade de fala para fala da Artificial Analysis, primeiro lugar no benchmark agêntico τ-Voice com 56,5%, 97,2% no Big Bench Audio e 95,1% no Full Duplex Bench. Essas eram as classificações quando o modelo foi lançado no final de julho de 2026, e os rankings dessa categoria mudam todo mês — e é exatamente por isso que a tabela da arena acima, lida hoje, vale mais do que os números do lançamento.

A fatura, e as partes dela que não estão na fatura.
Grok Voice Think Fast 2.0 custa US$ 0,08 por minuto de áudio, aproximadamente US$ 4,80 por hora, mais US$ 0,004 por cada mensagem de entrada de texto. Isso representa um aumento de 60% em relação aos US$ 0,05 por minuto que a versão 1.0 cobrava no lançamento, e a xAI migrou o alias contínuo grok-voice-latest para a 2.0 automaticamente em 5 de agosto de 2026, de modo que as equipes que queriam manter o preço antigo tiveram de fixar uma versão explícita antes dessa data. O modelo por minuto também significa que as melhorias de eficiência ficam com o fornecedor: se o modelo ficar melhor em concluir chamadas mais rapidamente, sua fatura por chamada cai, mas seu custo por minuto não.
O Realtime-Venus não tem fatura, porque não tem serviço. O que ele tem, em vez disso, é um piso de hardware. Dois checkpoints de 9B em BF16 somam cerca de dezoito gigabytes de pesos cada antes da memória de ativação, e o cartão documenta um loop de streaming por segundo que precisa ser executado continuamente. Um nó de GPU capaz disso tem um custo mensal, e é um custo fixo — você paga independentemente de alguém chamar ou não. Para um produto com tráfego constante, isso é mais barato que $4,80 por hora. Para um produto com tráfego intermitente, é dramaticamente mais caro, e o ponto de cruzamento é a única questão financeira que importa aqui.
Pesos, controle e o que cada um permite alterar
É aqui que os dois modelos deixam de ser comparáveis por completo.
• Fine-tuning — Realtime-Venus inclui os pesos. Você pode ajustá-los, quantizá-los, executá-los em ambiente air-gapped e inspecionar cada camada. O Grok Voice Think Fast 2.0 é um modelo fechado e hospedado; o que você pode alterar é o prompt, a seleção de voz e as ferramentas que você registra.
• Voz — O Grok Voice Think Fast 2.0 vem com vozes predefinidas e oferece suporte à clonagem de voz personalizada a partir de cerca de um minuto de fala. O Realtime-Venus inclui uma voz de referência e um decodificador token-to-waveform integrado, e qualquer coisa além disso é problema seu.
• Alcance — Grok Voice Think Fast 2.0 oferece suporte a mais de 25 idiomas e fala PCM16 a 24 kHz por padrão, com μ-law para telefonia, em uma sessão WebSocket compatível com OpenAI Realtime. Essa compatibilidade é um verdadeiro ativo de migração: a maior parte do código de voz em tempo real existente precisa de uma alteração na URL base e na chave. Realtime-Venus documenta inglês e chinês.
• Vídeo — Realtime-Venus-Omni recebe vídeo em streaming e imagens por meio de um codificador SigLIP2 e realiza percepção visual contínua. Grok Voice Think Fast 2.0 é áudio e texto; não há caminho para câmera.
• Contexto longo — Realtime-Venus possui um contexto de 40.960 tokens e uma memória para vídeos longos sem treinamento que pode ser ativada em uma janela de quarenta minutos. Grok Voice Think Fast 2.0 é um modelo de sessão sem nenhum recurso de memória publicado comparável.

Onde cada um quebra
As falhas para as quais vale a pena planejar são opostas. A exposição do Grok Voice Think Fast 2.0 é a concentração de fornecedores e o marketing não verificável: os resultados A/B do Starlink da xAI, os seus multiplicadores de precisão de transcrição e a forma como enquadra a velocidade são todos informados pela empresa, sem dados subjacentes publicados, e um modelo por minuto que altera o preço em 60% entre versões já demonstrou que vai alterar o preço. Fixe a sua versão e execute as suas próprias avaliações no seu próprio áudio.
A exposição do Realtime-Venus é que ninguém o executou. Seus benchmarks são autorrelatados, seu harness não está documentado em relação à sua importância, e sua latência em uma implantação real é desconhecida — o relatório descreve uma cadência de interação de um segundo, que é um parâmetro de projeto, não um tempo medido até o primeiro áudio. Um modelo sem API e sem reprodução não tem histórico, apenas uma especificação.
Há um caminho intermediário que vale a pena declarar sem rodeios, porque é o que a maioria das equipes de fato fará. Se você está construindo um sistema baseado em delegação — escolha seu próprio front end, entregue o trabalho caro a um modelo de texto —, o front end e a etapa de raciocínio não precisam vir do mesmo lugar. O OrcaRouter não oferece nem o Realtime-Venus nem o Grok Voice Think Fast 2.0; ambas as camadas de voz ficam fora do que servimos, e dizemos isso em vez de insinuar o contrário. A etapa delegada é outra história. Quase 200 modelos de texto ficam atrás de uma única chave, pelo preço de tabela do provedor e sem markup, com failover automático para que uma indisponibilidade a montante não derrube uma chamada em andamento, uma DSL de roteamento para compor vários modelos em uma única chamada e fusão de modelos para decisões que merecem mais de uma opinião. Essa é a metade de um agente de voz que se beneficia de ser intercambiável, e é a metade que você pode mudar sem tocar no modelo que está conduzindo a conversa.
Qual escolher
Escolha o Grok Voice Think Fast 2.0 neste trimestre. Ele está disponível, passou por benchmark independente, está em primeiro lugar na avaliação agêntica que prevê se o seu agente consegue fazer algo útil, e 0,70 segundos até o primeiro áudio é um número sobre o qual você pode construir uma experiência de usuário. Reserve orçamento para o aumento de preço de 60% em relação à versão 1.0 e fixe a versão do seu modelo.
Escolha o Realtime-Venus apenas se a restrição for a propriedade. Se a sua implantação não puder chamar uma API externa, se você precisar fazer ajuste fino no front end conversacional, ou se precisar da câmera — esses três casos são o caso inteiro, e são fortes quando se aplicam.
O que não deveria decidir isso é a tabela de benchmark, porque os dois lados dela foram produzidos por pessoas diferentes sob condições diferentes. Os números do Grok Voice Think Fast 2.0 foram medidos por outra pessoa. Os do Realtime-Venus não foram. Até que isso mude, a comparação que está de fato disponível é entre um produto e um artigo.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
