Grok Voice Think Fast 2.0: o agente de voz mais rápido e mais caro da xAI, explicado
Guides & Insights

Grok Voice Think Fast 2.0: o agente de voz mais rápido e mais caro da xAI, explicado

Autor

Jim Song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

xAI lançou Grok Voice Think Fast 2.0 em 29 de julho de 2026 — descrito pela própria xAI como o "modelo de voz speech-to-speech mais capaz" e o novo carro-chefe de sua linha de agentes de voz. Ele responde mais rápido do que qualquer concorrente entre os cinco primeiros (0,70s até o primeiro áudio), lidera o benchmark de voz agêntica e transcreve com mais precisão do que a geração anterior. Ele também é 60% mais caro por minuto do que o modelo que substitui, vem com um medidor por minuto que aumenta sua fatura silenciosamente, e inclui uma troca de alias de versão que acontece automaticamente em uma semana. Este guia explica o que é o Think Fast 2.0 na prática, o que a xAI mudou nos bastidores, como a história do benchmark se divide em pontuações independentes e alegações relatadas pelo fornecedor, quanto ele realmente custa com as contas feitas, e como chamá-lo — além das ressalvas que você faria bem em ler antes de rotear um fluxo de chamadas de produção por ele.

Nota de precisão: os detalhes do lançamento, os preços, e a precisão da manchete e as alegações comerciais vêm do anúncio e dos documentos da xAI (2026-07-29). As pontuações compostas do Artificial Analysis são independentes e medidas por terceiros. As alegações reportadas pela xAI — os resultados do teste A/B da Starlink, os multiplicadores de transcrição, os "60% menos tokens de raciocínio" e a caracterização de "quase 5x mais rápido" — não têm dados subjacentes publicados; trate-os como valores direcionais do fornecedor e execute suas próprias avaliações. As especificações, os preços e o comportamento do alias podem mudar; verifique antes de criar.

TL;DR. O Grok Voice Think Fast 2.0 é o modelo speech-to-speech de ponta a ponta da xAI para agentes de voz: áudio entra, áudio sai via WebSocket, sem pipeline separado de ASR→LLM→TTS. Ele é genuinamente rápido (0,70s de tempo até o primeiro áudio, o único modelo entre os cinco primeiros abaixo de um segundo) e genuinamente forte em trabalho de voz agêntica, ficando em primeiro no benchmark de agentes τ-Voice da Artificial Analysis (56,5%) e em segundo no índice geral de qualidade speech-to-speech (82,9%), atrás do Qwen Audio 3.0 Realtime Plus (84,1%). Ele raciocina enquanto fala — reduzindo o uso mediano de tokens de raciocínio para cerca de 40% do modelo antigo — e custa US$ 0,08 por minuto, ante US$ 0,05. O detalhe é o medidor: a voz é cobrada por minuto de áudio em tempo de relógio, então um aumento de 60% no preço de um modelo que é mais barato de servir vai direto para a sua fatura. E em 5 de agosto, o alias grok-voice-latest começa a rotear automaticamente para a 2.0, então as equipes na versão antiga precisam fixá-lo deliberadamente antes disso.

Principais conclusões

• Conversão de fala para fala nativa: um único modelo do microfone ao alto-falante, sem a cadeia ASR→LLM→TTS — por isso o primeiro áudio chega em 0,70s.

• Líder agêntico: nº 1 no benchmark de agente τ-Voice da Artificial Analysis (56,5%), muito à frente do GPT-Realtime-2.1 (45,7%) e do Gemini 3.1 Flash (37,7%).

• Não é o líder geral: #2 no índice de qualidade de fala para fala (82,9%), atrás do Qwen Audio 3.0 Realtime Plus (84,1%); a OpenAI ainda vence em dinâmica conversacional (95,7% vs 95,1%).

• 60% mais caro: $0,08/min (~$4,80/hora) vs $0,05/min para Think Fast 1.0 — apesar de o modelo supostamente usar ~60% menos tokens de raciocínio.

• Troca de alias em 5 de agosto: grok-voice-latest roteia automaticamente para 2.0; fixe grok-voice-think-fast-1.0 antes disso para permanecer na versão mais barata.

• Rotule cada afirmação: as pontuações da Artificial Analysis são independentes; o A/B do Starlink, os multiplicadores de transcrição e o enquadramento de velocidade são relatados pela xAI e não publicados.

O que é Grok Voice Think Fast 2.0

{{1}}A Grok Voice é a família de modelos em tempo real, de fala a fala, da xAI.{{/1}} {{2}}O "Think Fast" é a linha de resposta rápida, lançada originalmente com o Voice Agent Builder em abril de 2026;{{/2}} {{3}}o Think Fast 2.0 é a segunda geração dessa linha, lançada em 29 de julho de 2026.{{/3}} {{4}}O modelo é de ponta a ponta: ele consome áudio bruto, raciocina e emite áudio diretamente, em vez de executar um pipeline de um modelo de reconhecimento de fala alimentando um LLM de texto que alimenta um modelo de texto para fala.{{/4}} {{5}}Essa escolha de arquitetura é a raiz de sua vantagem de latência —{{/5}} {{6}}não há saltos seriais nem texto intermediário, então o modelo pode começar uma resposta enquanto ainda ouve.{{/6}}

A xAI posiciona isso explicitamente para agentes de IA de voz: linhas de suporte ao cliente, vendas por telefone, recepção, telefonia e outras aplicações em que um sistema conversa com uma pessoa em tempo real e precisa realmente realizar tarefas — agendar uma chamada, qualificar um lead, atualizar um registro, pesquisar na web — em vez de apenas conversar. A ênfase em agentes, não na transcrição ou síntese brutas, é o campo de batalha ao qual o lançamento se dirige.

O que há de novo em relação ao Think Fast 1.0

A atualização da versão 1.0 é mais do que uma simples mudança numérica; a xAI descreve três mudanças estruturais:

• Raciocínio paralelo de fala. O modelo raciocina através de uma consulta enquanto fala, em vez de pensar primeiro e falar depois. Na prática, chamadas de ferramenta podem ser disparadas antes que o agente termine sua primeira frase — algo fundamental para fluxos de voz sensíveis à latência.

• Muito menos tokens de raciocínio. A xAI relata que o uso mediano de tokens de raciocínio caiu para cerca de 0,4x o do predecessor (aproximadamente 60% a menos), o que é parte do motivo pelo qual afirma que o modelo é mais barato de servir, mesmo com o aumento do preço.

• Estilo de conversa aprendido por reforço. O RL transformou como ele fala: frases mais curtas, uma pergunta por vez, sem enrolação — um estilo de chamada mais conciso, mais "humano", adequado ao trabalho por telefone, onde divagar queima minutos (e, com tarifação por minuto, dinheiro).

Em velocidade mensurável, o tempo até o primeiro áudio caiu de 1,25s na versão 1.0 para 0,70s na 2.0. Em transcrição, a xAI relata uma melhoria de cerca de 1,4x em 24 idiomas (relatado pela fornecedora, abaixo).

Os benchmarks, benchmark por benchmark

O lançamento está ancorado na Artificial Analysis, uma casa de benchmarks independente de terceiros. Isso importa: ao contrário da maioria dos outros números do anúncio, estes são medidos por uma parte neutra, e são os que valem a pena comparar em igualdade de condições. O quadro geral é melhor do que um único número de destaque.

Índice de Qualidade Fala-para-Fala: 82,9% (segundo lugar). Esta é a pontuação composta geral de fala para fala, subindo de 75,7% no Think Fast 1.0. Supera o GPT-Realtime-2.1 (79,1%) e o Gemini 3.1 Flash (69,5%) — mas não é o primeiro. O Qwen Audio 3.0 Realtime Plus lidera com 84,1%. Portanto, "melhor modelo de voz geral" é um exagero que os dados não sustentam; "modelo de voz agêntico mais rápido no nível superior" é preciso.

Benchmark do agente τ-Voice: 56,5% (primeiro lugar). Esta é a métrica que mais importa para a xAI, e o ranking é real: 56,5% supera Think Fast 1.0 (52,1%), GPT-Realtime-2.1 (45,7%) e Gemini 3.1 Flash (37,7%). O τ-Voice mede o desempenho de voz agêntico — o quão bem um modelo conclui tarefas em um canal de voz, incluindo o uso de ferramentas no meio da conversa. No eixo restrito de "consegue fazer o trabalho", Grok lidera. Musk promoveu exatamente esse ranking.

Big Bench Audio: 97,2%. Um benchmark de raciocínio de fala; forte, embora a Qwen tenha registrado um recorde de 99,2%.

Full Duplex Bench: 95.1%. Dinâmica conversacional — tratamento de interrupções, tomada de turno, barge-in. É um grande salto em relação aos 77.8% da versão 1.0, mas a OpenAI ainda o supera com 95.7%, e a Qwen lidera com 98.4%.

Tempo até o primeiro áudio: 0.70s. O número mais importante para produtos de voz reais. Ele caiu de 1.25s e é o único valor abaixo de um segundo entre os cinco principais modelos do ranking; testes independentes corroboram amplamente uma resposta em menos de um segundo. A latência do primeiro token do TTS em streaming é de cerca de 285ms. Para uso telefônico e em tempo real, a latência é a métrica que os usuários sentem a cada turno, e é aqui que o 2.0 é decididamente o melhor.

Lendo ao longo das linhas, o perfil é específico: o mais rápido para falar, o melhor em concluir tarefas, o segundo melhor no geral, o terceiro em fineza de conversação. Esse é um excelente modelo de agente de voz e uma alegação medíocre de "melhor voz de chatbot". Escolha-o para os trabalhos que correspondem à linha superior.

Precisão de transcrição

Além da conversação, a xAI afirma ter transcrição materialmente melhor. Sua avaliação interna em 24 idiomas e milhares de frases supostamente mostra cerca de 1.4x a precisão do Think Fast 1.0, e 1.5–2x a precisão de modelos de transcrição dedicados como Deepgram Nova 3 e ElevenLabs Scribe v2. Em condições ruidosas do mundo real — ruído de fundo, compressão telefônica, chamadas de baixa largura de banda — a diferença de precisão relatada em relação aos modelos STT dedicados aumenta para cerca de 10x.

Estas são exatamente as alegações que devem ser tratadas com cuidado. Elas são relatadas pela xAI; o harness de avaliação, os conjuntos de frases e os perfis de ruído não são publicados. Um teste independente da transcrição de telefone ruidoso do 2.0 contra Deepgram ou ElevenLabs seria valioso e, até o momento em que escrevo, não foi publicado. Direcionalmente, modelos de ponta a ponta absorvendo mais telefonia no treinamento é uma melhoria real plausível — mas "10x" deve ser verificado, não repetido como fato.

Preços: US$ 0,08 por minuto e a questão dos 60%

É aqui que o lançamento se torna polêmico. O Think Fast 2.0 custa US$ 0,08 por minuto de áudio — cerca de US$ 4,80 por hora — mais US$ 0,004 por mensagem de texto de entrada. O Think Fast 1.0 custava US$ 0,05 por minuto (US$ 3,00/hora). Isso é um aumento de 60%, e ele chegou no mesmo mês em que a OpenAI reduziu os preços do GPT-5.6 Luna em 80% e do Terra em 20%, citando os mesmos custos de processamento em queda que a xAI alega para este modelo.

O medidor é a história toda. Modelos de texto cobram por token; portanto, quando um modelo fica mais eficiente, a conta do cliente encolhe automaticamente. Modelos de voz cobram por minuto de áudio em tempo real, e a duração de uma conversa é definida pela pessoa que fala, não pelo modelo. Ganhos de eficiência em um produto cobrado por minuto revertem para o fornecedor, não para o comprador. É por isso que um modelo que, segundo relatos, usa ~60% menos tokens de raciocínio — e que, portanto, é mais barato para a xAI servir — custa 60% mais para alugar.

Faça as contas em um fluxo de chamadas real. Uma chamada de 4 minutos a 1.0 custa $0,20; a mesma chamada na 2.0 custa $0,32. Dez mil dessas chamadas por mês são 40.000 minutos: $2.000/mês na 1.0 versus $3.200/mês na 2.0 — uma diferença de $1.200/mês, ou cerca de $14.400/ano, que vem apenas de uma mudança de roteamento, não do volume de chamadas. Mesmo um ganho generoso de velocidade mal altera isso: reduzir 10 segundos inteiros de cada chamada economiza cerca de $0,013, enquanto o aumento de preço acrescenta $0,12 — você recupera aproximadamente um nono do aumento. Qualquer análise de negócio que venda a 2.0 como o modelo mais barato confundiu "mais rápido" com "mais barato".

Para contexto, o 2.0 ainda é aproximadamente 2,2x mais barato que o GPT-Realtime-2.1 High, a cerca de US$ 10,75/hora. Portanto, não é caro em termos absolutos — é caro em relação ao próprio antecessor e à direção que todos os outros fornecedores de modelos estavam seguindo naquele mês.

A armadilha da migração de 5 de agosto

Há um prazo associado. Em 5 de agosto de 2026, o alias grok-voice-latest começará automaticamente a direcionar para o Think Fast 2.0. Se você estiver ativo no Think Fast 1.0 por meio desse alias, "não fazer nada" atualiza você — e sua fatura — para a nova versão nessa data. Para permanecer na 1.0, você deve fixar explicitamente o ID do modelo grok-voice-think-fast-1.0 antes de 5 de agosto.

As duas posições defensáveis exigem ação antes do prazo: ou fixar a 1.0 deliberadamente porque seus fluxos automatizados funcionaram bem a US$ 3,00/hora, ou migrar para a 2.0 deliberadamente e refazer a previsão a US$ 4,80/hora, justificada pela qualidade em vez da economia. O que é indefensável é descobrir a mudança em uma fatura de setembro. Uma boa regra: tratar qualquer alias que termine em "latest" como uma instrução permanente de aceitar o que o fornecedor enviar em seguida — incluindo o preço.

Como acessá-lo e usá-lo

Think Fast 2.0 está disponível por meio da API Speech-to-Speech da xAI sob o id de modelo grok-voice-think-fast-2.0, com grok-voice-latest como alias dinâmico. É um modelo em tempo real, full-duplex, sobre WebSocket: wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0, autenticado com um cabeçalho Authorization: Bearer no handshake. Para aplicativos de navegador, gere tokens efêmeros no lado do servidor por meio do endpoint de sessões de tempo real para que a chave da API principal nunca chegue ao cliente.

A API é compatível com OpenAI Realtime, portanto o código existente de voz em tempo real geralmente precisa apenas da troca da URL base e da chave. A configuração da sessão é feita por meio de um evento session.update: escolha uma voz predefinida (eve, ara, rex, sal, leo), defina o formato de áudio de entrada e saída (PCM16 a 24 kHz por padrão; μ-law para telefonia), ative a detecção de atividade de voz no servidor e registre ferramentas — incluindo uma ferramenta de busca web integrada — para que o agente possa agir no meio da conversa. O fluxo de eventos segue o padrão convencional: o cliente anexa frames do buffer de áudio, o servidor transmite deltas do áudio de resposta e eventos de argumentos de chamada de ferramenta são disparados quando o modelo decide agir, com os resultados enviados de volta como saídas de chamada de função. O modelo suporta mais de 25 idiomas e clonagem de voz personalizada a partir de aproximadamente um minuto de fala.

Note o que ele não é: trata-se de um modelo de agente fala-a-fala, não um serviço genérico de transcrição ou tradução. Se o trabalho central do seu produto é converter áudio em texto a baixo custo, um modelo STT dedicado é outra ferramenta — e, na métrica por minuto, você paga pela conversa inteira, então cargas de trabalho apenas de transcrição ficam caras rapidamente.

Como isso se encaixa na stack de um agente de voz

Think Fast 2.0 é um modelo de voz em tempo real especializado, acessado por meio da API dedicada da xAI, não um LLM de propósito geral que um roteador de modelos hospeda. O canal de voz roda diretamente no WebSocket da xAI — é lá que reside a latência de menos de um segundo, e ela não sobrevive a um salto intermediário.

Tudo o mais em torno de um produto de voz — a lógica de linguagem natural que não é crítica em termos de tempo, o raciocínio de fallback quando uma conversa sai do roteiro, a sumarização, as análises, o e-mail de acompanhamento que o agente dispara após uma chamada — é trabalho de texto e multimodal de uso geral. Para essa parte, um endpoint independente de fornecedor como o OrcaRouter oferece uma única API compatível com OpenAI para muitos LLMs, para que você não fique preso a um único fornecedor nas partes da stack que não precisam do canal de voz em tempo real. A divisão limpa: a API dedicada da xAI para a própria voz em streaming, e o OrcaRouter (ou similar) para o raciocínio de texto e multimodal em torno dela.

A competição: velocidade agêntica vs inteligência bruta

Think Fast 2.0 chega em meio ao mercado mais competitivo de IA no momento — agentes de voz em tempo real — e a tabela de benchmark torna os trade-offs excepcionalmente visíveis.

Qwen Audio 3.0 Realtime Plus é o líder em inteligência: 84.1% no índice de qualidade de fala para fala (primeiro), um recorde de 99.2% no Big Bench Audio e 98.4% em full duplex. Mas seu tempo médio até o primeiro áudio é de cerca de 4.02 segundos — aproximadamente 5.7x mais lento que os 0.70s do Grok. Para conversas no carro, em wearables e por telefone, essa diferença não é "rápido vs lento", é utilizável vs inutilizável. A Qwen também se divide em um nível Plus (qualidade) e um nível Flash (primeiro pacote em cerca de 300ms) para diferentes cenários, o que é uma resposta bem pensada para a mesma tensão.

GPT-Realtime-2.1 ocupa a posição intermediária na maioria das métricas (79,1% de qualidade, 45,7% agentic) e vence na dinâmica conversacional (95,7%). Seu nível High custa aproximadamente 2,2x o preço por hora do Grok. Para equipes já imersas no ecossistema OpenAI, continua sendo o padrão com menor atrito.

Gemini 3.1 Flash fica atrás nos compostos de qualidade e agênticos (69.5%, 37.7%), mas faz parte de um stack de voz Gemini mais amplo e do ecossistema Google que muitas equipes preferem por outros motivos.

A leitura prática: escolha pela carga de trabalho. Se o seu agente de voz precisa parecer instantâneo e concluir com confiabilidade tarefas apoiadas por ferramentas (suporte, qualificação, reserva), o Think Fast 2.0 é a opção mais forte segundo as medições atuais. Se a sua prioridade é o raciocínio mais profundo e você pode absorver latência de vários segundos, o Qwen Plus vence. Se o refinamento conversacional e a adequação ao ecossistema importam mais, o GPT-Realtime-2.1 continua sendo o incumbente a ser batido.

Três cenários onde ele se encaixa

1. Suporte por telefone e telefonia

A combinação que mais importa: primeiro áudio em menos de um segundo, transcrição robusta em telefone com ruído (relatada pelo fornecedor) e manipulação de interrupção full-duplex. Uma linha de suporte onde o agente começa a falar quase imediatamente e pode buscar informações da conta no meio da conversa é exatamente para o que o 2.0 foi ajustado. Seu estilo de fala RL mais curto, uma pergunta por vez, também combina bem com telefonia, onde minutos são a unidade cobrável — no medidor de qualquer um dos fornecedores.

2. Qualificação de leads e acompanhamento pós-chamada

A voz agêntica é onde a 2.0 é genuinamente pioneira, e a qualificação de leads é a tarefa canônica da voz agêntica: qualificar, direcionar e acionar o acompanhamento enquanto a intenção está fresca. Sua chamada de ferramentas pode ser acionada antes que a primeira frase termine, então um agente pode estar criando um registro no CRM enquanto ainda conversa com o prospect. Planeje a atribuição em nível de sessão e permissões estritas de ferramentas — um agente de voz pode errar em tempo real, e a limpeza é com você.

3. Produtos voice-agent em desenvolvimento ativo

Para desenvolvedores que criam seus próprios agentes de voz — as integrações Tradecraft e GrokTerm que a xAI cita têm exatamente esse formato — a velocidade do 2.0 e a API compatível com OpenAI tornam-no uma substituição de baixo atrito para código GPT-Realtime. Fixe a versão, execute um piloto restrito com uma condição de sucesso clara (por exemplo, "qualificar e encaminhar visitantes da página de preços") e meça o custo por resultado concluído, não o custo por minuto.

Limitações e ressalvas

Think Fast 2.0 tem cinco dias de existência no momento em que escrevo isto, e isso transparece nas ressalvas. Os resultados A/B da Starlink (maior conversão e contenção de suporte) são relatados pela xAI sem números publicados; os multiplicadores de transcrição e a afirmação de "quase 5x mais rápido" são igualmente alegações do fornecedor, não benchmarks independentes. O único artigo que você verá alegando "regressão de desempenho e relatórios de teste fabricados" refere-se a essa mesma impossibilidade de verificação — os números publicados pela xAI não foram reproduzidos de forma independente, e a comunidade de voz, sensível à confiabilidade, desconfia com razão de métricas não publicadas do fornecedor. Benchmarks também não conseguem medir sua pior chamada: uma resposta em 0,70s não vale nada se o agente encaminha confiantemente um lead para a equipe errada. A cobrança de voz é por minuto, com um aumento de preço já embutido, então a exposição de custo é real. E, como acontece com qualquer modelo em tempo real recém-lançado, espere instabilidade na API. Verifique as alegações de precisão com seu próprio áudio, fixe versões em produção e implemente escalonamento e gravação antes da primeira chamada ao vivo.

Perguntas Frequentes

O que é Grok Voice Think Fast 2.0?

O principal modelo de fala-para-fala da xAI para agentes de voz, lançado em 29 de julho de 2026: áudio-para-áudio nativo de ponta a ponta via WebSocket, com 0,70s de tempo até o primeiro áudio e primeiro lugar no benchmark agêntico τ-Voice.

Quanto custa o Grok Voice Think Fast 2.0?

US$ 0,08 por minuto de áudio (cerca de US$ 4,80/hora) mais US$ 0,004 por mensagem de texto de entrada — um aumento de 60% em relação aos US$ 0,05/minuto do Think Fast 1.0.

O Think Fast 2.0 é o melhor modelo de voz?

É o mais rápido e o melhor em tarefas agênticas (56,5% τ-Voice, primeiro lugar) e o segundo no geral no índice de qualidade fala-a-fala (82,9%), atrás do Qwen Audio 3.0 Realtime Plus (84,1%). "Melhor" depende da carga de trabalho.

O que mudou desde o Think Fast 1.0?

Raciocínio de fala paralelo (pensa enquanto fala), cerca de 60% menos tokens de raciocínio, estilo de conversa mais curto ajustado por RL, uma melhoria de 1,4x na transcrição (relatada pelo fornecedor) e tempo para o primeiro áudio reduzido de 1,25s para 0,70s.

O meu switch de tráfego Think Fast 1.0 alternará automaticamente?

Sim, em 5 de agosto de 2026, se você usar o alias grok-voice-latest. Fixe o grok-voice-think-fast-1.0 antes disso para permanecer na versão 1.0, ou adote a 2.0 deliberadamente e refaça a previsão do custo.

Isto é um teste de localização. A frase "How do I call Grok Voice Think Fast 2.0?" deve ser traduzida como: Como faço para chamar o Grok Voice Think Fast 2.0?

Por meio da API Speech-to-Speech da xAI — um WebSocket em tempo real (wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0) compatível com a API Realtime da OpenAI, com vozes predefinidas, VAD no servidor e chamada de ferramentas.

Com quais modelos de voz ele compete?

Qwen Audio 3.0 Realtime Plus (mais inteligente, muito mais lento com 4,02s para o primeiro áudio), GPT-Realtime-2.1 (melhor dinâmica conversacional, ~2,2x mais caro no nível High), e Gemini 3.1 Flash.

As alegações de benchmark são confiáveis?

As pontuações do Artificial Analysis são independentes e sólidas. Os resultados A/B do Starlink, os multiplicadores de transcrição e o enquadramento de velocidade são relatados pela xAI sem dados publicados — trate-os como indicativos e verifique no seu próprio áudio.

O Grok Voice é bom para transcrição?

Ele transcreve em uma conversa, e a xAI afirma grandes ganhos em relação a modelos STT dedicados em ambientes ruidosos — mas é cobrado por minuto de conversa, portanto cargas de trabalho de transcrição dedicadas são melhor atendidas por um modelo STT dedicado.

Conclusão

Grok Voice Think Fast 2.0 é o modelo de voz agêntico mais forte medido até agora, e o mais rápido no topo da lista por uma margem ampla — 0,70s para o primeiro áudio é uma vitória genuína, independente e voltada ao usuário, e o primeiro lugar no τ-Voice é uma classificação real. O resumo honesto é específico: é a melhor ferramenta em sua classe para agentes de voz em tempo real com suporte a ferramentas, não o melhor modelo de voz em todos os aspectos — a Qwen lidera em inteligência e a OpenAI em sofisticação conversacional. As controvérsias não são sobre a velocidade. São sobre a métrica: um aumento de preço de 60% em um modelo que a xAI diz ser mais barato de servir, uma migração automática de alias com prazo rígido e alegações de manchete que se apoiam em números de fornecedor não publicados. Use-o pela velocidade agêntica, fixe sua versão, rotule as alegações do fornecedor e verifique a precisão em suas próprias chamadas — e mantenha o texto de propósito geral e o raciocínio em torno do seu produto de voz em um endpoint neutro em relação ao fornecedor, como o OrcaRouter.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube