
Voxtral Mini 4B Realtime Arabic vs Grok Voice Transcribe 2.0: Um Líder do Ranking Encontra um Especialista em Dialetos
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
O ponto de partida honesto para esta comparação é que Voxtral Mini 4B Realtime Arabic e Grok Voice Transcribe 2.0 não concorrem pela mesma tarefa, e a forma mais rápida de perceber isso é olhar para o que cada fornecedor estava disposto a publicar. A Mistral AI colocou o Voxtral Mini 4B Realtime Arabic no Hugging Face em 8 de outubro de 2026 sem anúncio — pesos Apache 2.0, um cartão de modelo que nomeia dezesseis variedades de árabe e um único valor de precisão de 8,82% de Taxa Média de Erro de Caracteres em sete benchmarks de árabe com um atraso de 480 milissegundos. O Grok Voice Transcribe 2.0 da xAI foi lançado em 18 de setembro de 2026 com um post de lançamento, um preço e um resultado de ranking de terceiros: taxa de erro de palavras de 2,7% em transcrições finais, com o texto estabilizado 0,49 segundos depois que o falante para, em primeiro lugar no ranking de fala para texto em streaming da Artificial Analysis quando foi lançado. Um modelo diz exatamente quais dialetos ele atende e se recusa a adivinhar fora deles. O outro diz que cobre mais de 38 idiomas e não enumera um único.
Essa assimetria é a comparação inteira. Se você está comprando capacidade de transcrição em massa para áudio em vários idiomas, o modelo xAI é o produto mais completo, e com boa margem. Se o seu áudio é em árabe — e, especificamente, se for árabe dialetal, não árabe padrão moderno de transmissão — o checkpoint Mistral é voltado para um problema que o ranking que o modelo xAI lidera não mede, e seria um erro interpretar o fato de ele estar em segundo lugar nesse ranking, e não em primeiro, como um veredito.
A aritmética de preços, porque é excecionalmente limpa aqui.
A xAI publica uma tarifa. A Mistral publica um download. Essa diferença determina tudo o que vem depois, então comece pelo número que existe.
• Grok Voice Transcribe 2.0 — US$ 0,10 por hora de áudio via REST para arquivos gravados, US$ 0,20 por hora de áudio via WebSocket de streaming. Isso equivale a aproximadamente US$ 1,67 por mil minutos no modo em lote e US$ 3,33 por mil minutos no modo streaming, sem alteração em relação ao Grok Voice Transcribe 1.0, nos mesmos pontos de preço.
• Voxtral Mini 4B Realtime Arabic — nenhum preço publicado, porque não há um serviço publicado. Os pesos são Apache 2.0 e aproximadamente 4,4 bilhões de parâmetros em BF16, o que significa que o custo é a GPU que você anexa a ele e a utilização que você obtém dele. Em volume sustentado, isso é barato; em volume zero, é a opção mais cara neste artigo, porque você está pagando por hardware ocioso.
O ponto de equilíbrio não é sutil. Uma tarifa de streaming de US$ 0,20 por hora é cerca de um terço de centavo por minuto. Qualquer acelerador em que você rodasse um modelo de 4,4B custa mais do que isso por hora, a menos que você esteja submetendo-o a tráfego sustentado, o que significa que a rota de pesos abertos só vence em custo depois que você tiver volume de árabe suficiente para manter uma máquina ocupada — e perde em todos os outros eixos enquanto você chega lá, porque a API não tem capex, nem planejamento de capacidade, nem carga operacional.

O único ponto em que a aritmética se inverte cedo é a conformidade. O checkpoint Mistral processa áudio em hardware que você controla, então nada sai da sua rede, e o cartão acompanha um módulo de normalização para que o pipeline de pontuação em árabe seja seu para auditar. O Grok Voice Transcribe 2.0 é executado nas regiões da xAI e, conforme sua documentação, processa áudio em tempo real sem retê-lo ou usá-lo para treinamento, com respaldo de SOC 2 Type II e elegibilidade HIPAA. Ambas as histórias são defensáveis; apenas uma delas permite que um regulador inspecione o caminho do código.
O que US$ 0,20 por hora realmente compra, e o modelo Mistral não é lançado
A lacuna de funcionalidades aqui é maior que a lacuna de precisão e é discutida muito menos. O Grok Voice Transcribe 2.0 é um produto com uma interface; o Voxtral Mini 4B Realtime Arabic é um checkpoint que emite texto.
• Diarização de falantes — incluída no Grok Voice Transcribe 2.0, além de transcrição multicanal de até oito canais independentes. A ficha do Mistral não lista nenhuma capacidade de diarização; o modelo produz uma transcrição, não uma com atribuição.
• Timestamps em nível de palavra — o Grok os carrega com pontuações de confiança associadas, para que você possa aplicar um limiar a trechos de baixa confiança em vez de confiar igualmente em uma transcrição inteira. O card da Mistral não afirma timestamps para este checkpoint.
• Viés de termos-chave — até 100 termos de domínio por solicitação no endpoint Grok, que é como você faz um modelo acertar nomes de produtos, códigos de conta e nomes de lugares sem ajuste fino. A rota da Mistral para o mesmo resultado é o ajuste fino nos seus próprios dados, o que a Apache 2.0 permite e o endpoint hospedado não.
• Normalização inversa de texto — o Grok formata números, datas, moedas, números de telefone e endereços de e-mail em forma escrita em 25 idiomas. O card da Mistral inclui um script de normalização, mas seu propósito declarado é pontuar benchmarks em árabe, não formatar a saída para exibição.
• Superfície da interface — REST para arquivos de até 500 MB, streaming via WebSocket em wss://api.x.ai/v1/stt com resultados intermediários aproximadamente a cada 500 ms, um limite documentado de 10 requisições por segundo e 100 sessões de streaming simultâneas, e uma única região por enquanto. Do lado da Mistral, serviço vLLM com um WebSocket em /v1/realtime, ou Transformers nativos a partir da versão 5.2.0, sem limite de taxa além do seu hardware.
Se você precisar de diarização e marcas de tempo, a comparação já acabou antes mesmo de a precisão entrar na equação. Isso não é uma crítica ao modelo Mistral — um especialista em árabe de 4B treinado para produzir texto dialetal preciso é um alvo de engenharia diferente de um serviço de transcrição geral — mas significa que os dois só se tornam intercambiáveis se o seu pipeline tratar a transcrição como matéria-prima para o seu próprio pós-processamento.
O problema da lista de idiomas
Ambos os fornecedores descrevem o suporte a idiomas de uma forma que deixa a mesma pergunta sem resposta, a partir de direções opostas.
• Grok Voice Transcribe 2.0 — mais de 38 idiomas, detecção automática de idioma com troca de idioma no meio da gravação em uma única passagem, em 12 formatos de áudio, de 8 kHz a 48 kHz. A documentação fornece a contagem e não a lista. O árabe não é nomeado individualmente em nenhum lugar do material, o que significa que o suporte ao árabe é subentendido pela contagem e não confirmado pelo fornecedor.
• Voxtral Mini 4B Realtime Arabic — dezesseis variedades de árabe nomeadas explicitamente: árabe padrão moderno; marroquino, líbio, tunisino, argelino e hassaniya do Magrebe; árabe do Golfo, najdi, omani e sanaani do Golfo; egípcio e sudanês do Vale do Nilo; mesopotâmio e tanto o levantino meridional quanto o setentrional; e árabe chadiano. Tudo fora desse conjunto está fora do escopo, e a ficha diz para usar o modelo geral de tempo real em vez disso.
Então, a pergunta "qual destes lida melhor com o árabe" tem uma estrutura estranha. O modelo Mistral é um especialista documentado em árabe, com uma taxa de erro de árabe publicada e nenhuma verificação independente. O modelo xAI é um líder documentado de ranking cujo fornecedor não confirmou sequer que o árabe está no escopo. Uma contagem de 38 idiomas que inclui o árabe e uma lista de dezesseis dialetos que só inclui o árabe estão ambas respondendo à pergunta "ele lida com árabe" — mas só uma delas está respondendo "ele lida com darija".

A tabela de classificação não ajuda aqui. A avaliação de fala para texto da Artificial Analysis é uma mistura fixa ponderada para conversas de agentes em inglês, que é o design correto para classificar transcrição geral e o incorreto para destacar uma vitória do árabe dialetal. Um modelo poderia ser genuinamente melhor em árabe do Golfo e árabe marroquino e aparecer como apenas bom nessa tabela. Isto não é uma crítica à tabela; é uma razão para não usá-la como única entrada para uma implantação regional.
Precisão, em unidades que não se convertem
• Grok Voice Transcribe 2.0 — taxa de erro de palavras da transcrição final de 2,7%, com 0,49 segundos até o final, e 3,4% nas primeiras parciais, ambos medidos no índice AA-WER v2 da Artificial Analysis, que mistura um conjunto privado de conversas de agentes com VoxPopuli e Earnings22. O dado das primeiras parciais é o que chama atenção: caiu de 18,3% no Grok Voice Transcribe 1.0, o que é a diferença entre uma transcrição parcial que você pode usar para roteamento e uma que você só pode exibir.
• Voxtral Mini 4B Realtime Arabic — 8,82% de taxa média de erro de caractere em sete benchmarks de árabe, com 480 milissegundos de atraso, na avaliação do próprio fornecedor com um script de normalização fornecido junto com ela. A Mistral relata que isso fica a 0,91 pontos percentuais de Voxtral Transcribe Arabic, com 7,91% de CER, que é o modelo de árabe offline do mesmo laboratório — uma comparação que vale mais do que uma entre fornecedores diferentes, porque os benchmarks, a normalização e a medição são idênticos nos dois lados.
Colocar 2,7% ao lado de 8,82% não é uma comparação; é um erro de categoria. A taxa de erro de palavra conta palavras erradas em relação a uma referência, a taxa de erro de caractere conta caracteres errados, e a ortografia árabe — em que a mesma palavra tolera múltiplas grafias legítimas e os clíticos se anexam livremente — amplia a diferença entre as duas métricas muito além do que as línguas de escrita latina mostram. Os corpora são diferentes, a normalização é diferente, e apenas um número vem de terceiros. O que os dois números podem legitimamente dizer é que o modelo xAI é um transcritor geral medido e bem classificado e o modelo Mistral é um transcritor alegadamente específico para árabe. Eles não podem dizer qual transcreve melhor o seu áudio.
A comparação que realmente convence é a que está dentro do próprio cartão da Mistral: 8,82% em streaming contra 7,91% offline, os mesmos sete benchmarks, a mesma normalização, o mesmo laboratório. O streaming custa cerca de um ponto de precisão em árabe em relação a um modelo em lote. Se essa é uma boa troca, cabe a si decidir — e agora é uma decisão informada.
Onde o modelo pequeno vence, e não é no placar
Três coisas sobre o checkpoint Mistral valem mais do que os números sugerem, e nenhuma delas aparece em nenhum ranking.
O primeiro é a própria taxonomia de dialetos. Nomear dezesseis variedades como alvos de treinamento distintos, incluindo o Hassaniya e o árabe chadiano, é uma declaração sobre onde os erros do modelo foram medidos. Um modelo multilíngue geral que inclui o árabe como uma das 38 línguas apresenta melhorias primeiro no árabe padrão moderno, porque é aí que está a maior parte do sinal de treinamento e do peso do benchmark. Um modelo criado para a parceria com Marrocos, em conjunto com um ministério norte-africano, está otimizando para uma distribuição diferente, e foi co-desenvolvido com dois benchmarks — ISMA e Darija in the Wild — criados especificamente para medir isso.
O segundo é o atraso configurável. O número de 8,82% é citado a 480 milissegundos, e o atraso é ajustável em vez de fixo, o que transforma o índice de precisão em um ponto numa curva que o operador escolhe. Para um trabalho de legendagem ao vivo, você pode encurtá-lo e aceitar mais erros; para um pipeline de gravação de chamadas, você pode aumentá-lo e recuperar a precisão. O Grok Voice Transcribe 2.0 apresenta um ponto de operação fixo, e o próprio caminho de atualização do fornecedor mostra por que isso tem consequências — passar da versão 1.0 para a 2.0 custou cerca de um terço de segundo tanto na latência do primeiro parcial quanto na final, e a correção disponível para você é fixar o modelo antigo, não ajustar um botão.
A terceira é que a concessão da Apache 2.0 é incondicional para os pesos que você tem. Aconteça o que acontecer com o checkpoint upstream — seja ele anunciado, precificado, descontinuado ou nunca mais mencionado —, o artefato continua disponível para download, ajustável por fine-tuning e distribuível dentro do seu próprio produto. Tanto a tabela de tarifas de um endpoint hospedado quanto seu calendário de retirada do modelo podem ser alterados pelo fornecedor, e a xAI já sinalizou sua intenção de tornar o Grok Voice Transcribe 2.0 o padrão e descontinuar o 1.0, o que moverá de uma só vez para o novo perfil de latência todas as integrações que nunca passaram um parâmetro de modelo.
Na camada de encaminhamento acima da transcrição, uma nota prática: nenhum dos modelos é um sistema de fala para texto que nós alojamos, e este artigo não afirma o contrário. O que o OrcaRouter abrange é a camada de modelos de linguagem que consome o fluxo — o sumarizador, o classificador, o agente — por trás de uma única chave de API, em mais de 200 modelos ao preço de tabela do fornecedor, com 0% de acréscimo, pelo que uma alteração de preço de um fornecedor chega aqui no mesmo dia. Equipas que usam dois fornecedores de fala para cobertura de idiomas já carregam dois contratos e dois caminhos de autenticação; consolidar a metade a jusante numa única chave é o ganho fácil.
O que fazer com isto
Baseie-se no Grok Voice Transcribe 2.0 se o seu áudio for multilíngue, se precisar de diarização, carimbos de data/hora ou ponderação de termos-chave disponíveis de imediato, ou se quiser um serviço com tarifa publicada e um canal de suporte hoje mesmo. É o produto mais completo, é avaliado por terceiros, e a tarifa de streaming de $0,20 por hora de áudio é baixa o suficiente para que o argumento de custo dos pesos abertos não se torne relevante até você processar um volume significativo.
Baseie-se no Voxtral Mini 4B Realtime Arabic se o seu áudio for árabe e especificamente dialetal, se precisar do modelo dentro da sua própria rede por razões de conformidade, ou se pretender fazer fine-tuning — porque só um destes o permite. Aceite três coisas primeiro: sem diarização, sem marcas temporais e sem qualquer avaliação independente publicada por quem quer que seja. Dois dias depois de os pesos aparecerem, essa última não é um sinal de alerta; é simplesmente onde as evidências se encontram.
O que mudaria esta comparação mais rapidamente seria uma avaliação específica para o árabe em áudio dialetal real, realizada fora de ambos os fornecedores, com a mesma normalização aplicada aos dois sistemas. Até que isso exista, a decisão assenta na lista de dialetos de um fornecedor contra a lista não declarada de outro fornecedor, e o único teste fiável são as suas gravações.

Nenhum dos endpoints é um que atendemos — isto é uma comparação de dois sistemas fora do nosso catálogo — mas os modelos que consomem a transcrição são roteáveis: mais de 200 modelos com uma única chave de API ao preço de tabela do provedor com 0% de markup, portanto, uma mudança de tarifa no sumarizador ou no classificador entra em vigor no mesmo dia em que é anunciada.
O failover automático é o que impede que uma configuração de fala com dois fornecedores carregue dois pontos únicos de falha para a camada de idioma que se alimenta dela.
