Cartão de título hero gerado para uma comparação entre Voxtral Mini 4B Realtime Arabic e Grok Voice Transcribe 2.0, com o subtítulo 'um líder de ranking de rótulos encontra um especialista em árabe de 16 dialetos', com o selo 'repositório Mistral, 8 de outubro de 2026', com três chips de estatísticas exibindo 8,82% de taxa de erro de caracteres em árabe a 480 ms contra 2,7% de taxa de erro de palavras a 0,49 s, 16 dialetos nomeados contra 38+ idiomas não documentados, e pesos Apache 2.0 contra US$ 0,20 por hora de áudio, e o logotipo da OrcaRouter composto em uma faixa branca na parte inferior direita.
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs Grok Voice Transcribe 2.0: Um Líder do Ranking Encontra um Especialista em Dialetos

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O ponto de partida honesto para esta comparação é que Voxtral Mini 4B Realtime Arabic e Grok Voice Transcribe 2.0 não concorrem pela mesma tarefa, e a forma mais rápida de perceber isso é olhar para o que cada fornecedor estava disposto a publicar. A Mistral AI colocou o Voxtral Mini 4B Realtime Arabic no Hugging Face em 8 de outubro de 2026 sem anúncio — pesos Apache 2.0, um cartão de modelo que nomeia dezesseis variedades de árabe e um único valor de precisão de 8,82% de Taxa Média de Erro de Caracteres em sete benchmarks de árabe com um atraso de 480 milissegundos. O Grok Voice Transcribe 2.0 da xAI foi lançado em 18 de setembro de 2026 com um post de lançamento, um preço e um resultado de ranking de terceiros: taxa de erro de palavras de 2,7% em transcrições finais, com o texto estabilizado 0,49 segundos depois que o falante para, em primeiro lugar no ranking de fala para texto em streaming da Artificial Analysis quando foi lançado. Um modelo diz exatamente quais dialetos ele atende e se recusa a adivinhar fora deles. O outro diz que cobre mais de 38 idiomas e não enumera um único.

Essa assimetria é a comparação inteira. Se você está comprando capacidade de transcrição em massa para áudio em vários idiomas, o modelo xAI é o produto mais completo, e com boa margem. Se o seu áudio é em árabe — e, especificamente, se for árabe dialetal, não árabe padrão moderno de transmissão — o checkpoint Mistral é voltado para um problema que o ranking que o modelo xAI lidera não mede, e seria um erro interpretar o fato de ele estar em segundo lugar nesse ranking, e não em primeiro, como um veredito.

A aritmética de preços, porque é excecionalmente limpa aqui.

A xAI publica uma tarifa. A Mistral publica um download. Essa diferença determina tudo o que vem depois, então comece pelo número que existe.

• Grok Voice Transcribe 2.0 — US$ 0,10 por hora de áudio via REST para arquivos gravados, US$ 0,20 por hora de áudio via WebSocket de streaming. Isso equivale a aproximadamente US$ 1,67 por mil minutos no modo em lote e US$ 3,33 por mil minutos no modo streaming, sem alteração em relação ao Grok Voice Transcribe 1.0, nos mesmos pontos de preço.

• Voxtral Mini 4B Realtime Arabic — nenhum preço publicado, porque não há um serviço publicado. Os pesos são Apache 2.0 e aproximadamente 4,4 bilhões de parâmetros em BF16, o que significa que o custo é a GPU que você anexa a ele e a utilização que você obtém dele. Em volume sustentado, isso é barato; em volume zero, é a opção mais cara neste artigo, porque você está pagando por hardware ocioso.

O ponto de equilíbrio não é sutil. Uma tarifa de streaming de US$ 0,20 por hora é cerca de um terço de centavo por minuto. Qualquer acelerador em que você rodasse um modelo de 4,4B custa mais do que isso por hora, a menos que você esteja submetendo-o a tráfego sustentado, o que significa que a rota de pesos abertos só vence em custo depois que você tiver volume de árabe suficiente para manter uma máquina ocupada — e perde em todos os outros eixos enquanto você chega lá, porque a API não tem capex, nem planejamento de capacidade, nem carga operacional.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

O único ponto em que a aritmética se inverte cedo é a conformidade. O checkpoint Mistral processa áudio em hardware que você controla, então nada sai da sua rede, e o cartão acompanha um módulo de normalização para que o pipeline de pontuação em árabe seja seu para auditar. O Grok Voice Transcribe 2.0 é executado nas regiões da xAI e, conforme sua documentação, processa áudio em tempo real sem retê-lo ou usá-lo para treinamento, com respaldo de SOC 2 Type II e elegibilidade HIPAA. Ambas as histórias são defensáveis; apenas uma delas permite que um regulador inspecione o caminho do código.

O que US$ 0,20 por hora realmente compra, e o modelo Mistral não é lançado

A lacuna de funcionalidades aqui é maior que a lacuna de precisão e é discutida muito menos. O Grok Voice Transcribe 2.0 é um produto com uma interface; o Voxtral Mini 4B Realtime Arabic é um checkpoint que emite texto.

• Diarização de falantes — incluída no Grok Voice Transcribe 2.0, além de transcrição multicanal de até oito canais independentes. A ficha do Mistral não lista nenhuma capacidade de diarização; o modelo produz uma transcrição, não uma com atribuição.

• Timestamps em nível de palavra — o Grok os carrega com pontuações de confiança associadas, para que você possa aplicar um limiar a trechos de baixa confiança em vez de confiar igualmente em uma transcrição inteira. O card da Mistral não afirma timestamps para este checkpoint.

• Viés de termos-chave — até 100 termos de domínio por solicitação no endpoint Grok, que é como você faz um modelo acertar nomes de produtos, códigos de conta e nomes de lugares sem ajuste fino. A rota da Mistral para o mesmo resultado é o ajuste fino nos seus próprios dados, o que a Apache 2.0 permite e o endpoint hospedado não.

• Normalização inversa de texto — o Grok formata números, datas, moedas, números de telefone e endereços de e-mail em forma escrita em 25 idiomas. O card da Mistral inclui um script de normalização, mas seu propósito declarado é pontuar benchmarks em árabe, não formatar a saída para exibição.

• Superfície da interface — REST para arquivos de até 500 MB, streaming via WebSocket em wss://api.x.ai/v1/stt com resultados intermediários aproximadamente a cada 500 ms, um limite documentado de 10 requisições por segundo e 100 sessões de streaming simultâneas, e uma única região por enquanto. Do lado da Mistral, serviço vLLM com um WebSocket em /v1/realtime, ou Transformers nativos a partir da versão 5.2.0, sem limite de taxa além do seu hardware.

Se você precisar de diarização e marcas de tempo, a comparação já acabou antes mesmo de a precisão entrar na equação. Isso não é uma crítica ao modelo Mistral — um especialista em árabe de 4B treinado para produzir texto dialetal preciso é um alvo de engenharia diferente de um serviço de transcrição geral — mas significa que os dois só se tornam intercambiáveis se o seu pipeline tratar a transcrição como matéria-prima para o seu próprio pós-processamento.

O problema da lista de idiomas

Ambos os fornecedores descrevem o suporte a idiomas de uma forma que deixa a mesma pergunta sem resposta, a partir de direções opostas.

• Grok Voice Transcribe 2.0 — mais de 38 idiomas, detecção automática de idioma com troca de idioma no meio da gravação em uma única passagem, em 12 formatos de áudio, de 8 kHz a 48 kHz. A documentação fornece a contagem e não a lista. O árabe não é nomeado individualmente em nenhum lugar do material, o que significa que o suporte ao árabe é subentendido pela contagem e não confirmado pelo fornecedor.

• Voxtral Mini 4B Realtime Arabic — dezesseis variedades de árabe nomeadas explicitamente: árabe padrão moderno; marroquino, líbio, tunisino, argelino e hassaniya do Magrebe; árabe do Golfo, najdi, omani e sanaani do Golfo; egípcio e sudanês do Vale do Nilo; mesopotâmio e tanto o levantino meridional quanto o setentrional; e árabe chadiano. Tudo fora desse conjunto está fora do escopo, e a ficha diz para usar o modelo geral de tempo real em vez disso.

Então, a pergunta "qual destes lida melhor com o árabe" tem uma estrutura estranha. O modelo Mistral é um especialista documentado em árabe, com uma taxa de erro de árabe publicada e nenhuma verificação independente. O modelo xAI é um líder documentado de ranking cujo fornecedor não confirmou sequer que o árabe está no escopo. Uma contagem de 38 idiomas que inclui o árabe e uma lista de dezesseis dialetos que só inclui o árabe estão ambas respondendo à pergunta "ele lida com árabe" — mas só uma delas está respondendo "ele lida com darija".

Screenshot of the xAI documentation page for the grok-voice-transcribe-2.0 model, captured 10 October 2026, showing the Speech to Text entry in the Voice documentation navigation, the model page slug grok-voice-transcribe-2.0, its audio-to-text modality, and the us-east-1 region listing with rate-limit sections.

A tabela de classificação não ajuda aqui. A avaliação de fala para texto da Artificial Analysis é uma mistura fixa ponderada para conversas de agentes em inglês, que é o design correto para classificar transcrição geral e o incorreto para destacar uma vitória do árabe dialetal. Um modelo poderia ser genuinamente melhor em árabe do Golfo e árabe marroquino e aparecer como apenas bom nessa tabela. Isto não é uma crítica à tabela; é uma razão para não usá-la como única entrada para uma implantação regional.

Precisão, em unidades que não se convertem

• Grok Voice Transcribe 2.0 — taxa de erro de palavras da transcrição final de 2,7%, com 0,49 segundos até o final, e 3,4% nas primeiras parciais, ambos medidos no índice AA-WER v2 da Artificial Analysis, que mistura um conjunto privado de conversas de agentes com VoxPopuli e Earnings22. O dado das primeiras parciais é o que chama atenção: caiu de 18,3% no Grok Voice Transcribe 1.0, o que é a diferença entre uma transcrição parcial que você pode usar para roteamento e uma que você só pode exibir.

• Voxtral Mini 4B Realtime Arabic — 8,82% de taxa média de erro de caractere em sete benchmarks de árabe, com 480 milissegundos de atraso, na avaliação do próprio fornecedor com um script de normalização fornecido junto com ela. A Mistral relata que isso fica a 0,91 pontos percentuais de Voxtral Transcribe Arabic, com 7,91% de CER, que é o modelo de árabe offline do mesmo laboratório — uma comparação que vale mais do que uma entre fornecedores diferentes, porque os benchmarks, a normalização e a medição são idênticos nos dois lados.

Colocar 2,7% ao lado de 8,82% não é uma comparação; é um erro de categoria. A taxa de erro de palavra conta palavras erradas em relação a uma referência, a taxa de erro de caractere conta caracteres errados, e a ortografia árabe — em que a mesma palavra tolera múltiplas grafias legítimas e os clíticos se anexam livremente — amplia a diferença entre as duas métricas muito além do que as línguas de escrita latina mostram. Os corpora são diferentes, a normalização é diferente, e apenas um número vem de terceiros. O que os dois números podem legitimamente dizer é que o modelo xAI é um transcritor geral medido e bem classificado e o modelo Mistral é um transcritor alegadamente específico para árabe. Eles não podem dizer qual transcreve melhor o seu áudio.

A comparação que realmente convence é a que está dentro do próprio cartão da Mistral: 8,82% em streaming contra 7,91% offline, os mesmos sete benchmarks, a mesma normalização, o mesmo laboratório. O streaming custa cerca de um ponto de precisão em árabe em relação a um modelo em lote. Se essa é uma boa troca, cabe a si decidir — e agora é uma decisão informada.

Onde o modelo pequeno vence, e não é no placar

Três coisas sobre o checkpoint Mistral valem mais do que os números sugerem, e nenhuma delas aparece em nenhum ranking.

O primeiro é a própria taxonomia de dialetos. Nomear dezesseis variedades como alvos de treinamento distintos, incluindo o Hassaniya e o árabe chadiano, é uma declaração sobre onde os erros do modelo foram medidos. Um modelo multilíngue geral que inclui o árabe como uma das 38 línguas apresenta melhorias primeiro no árabe padrão moderno, porque é aí que está a maior parte do sinal de treinamento e do peso do benchmark. Um modelo criado para a parceria com Marrocos, em conjunto com um ministério norte-africano, está otimizando para uma distribuição diferente, e foi co-desenvolvido com dois benchmarks — ISMA e Darija in the Wild — criados especificamente para medir isso.

O segundo é o atraso configurável. O número de 8,82% é citado a 480 milissegundos, e o atraso é ajustável em vez de fixo, o que transforma o índice de precisão em um ponto numa curva que o operador escolhe. Para um trabalho de legendagem ao vivo, você pode encurtá-lo e aceitar mais erros; para um pipeline de gravação de chamadas, você pode aumentá-lo e recuperar a precisão. O Grok Voice Transcribe 2.0 apresenta um ponto de operação fixo, e o próprio caminho de atualização do fornecedor mostra por que isso tem consequências — passar da versão 1.0 para a 2.0 custou cerca de um terço de segundo tanto na latência do primeiro parcial quanto na final, e a correção disponível para você é fixar o modelo antigo, não ajustar um botão.

A terceira é que a concessão da Apache 2.0 é incondicional para os pesos que você tem. Aconteça o que acontecer com o checkpoint upstream — seja ele anunciado, precificado, descontinuado ou nunca mais mencionado —, o artefato continua disponível para download, ajustável por fine-tuning e distribuível dentro do seu próprio produto. Tanto a tabela de tarifas de um endpoint hospedado quanto seu calendário de retirada do modelo podem ser alterados pelo fornecedor, e a xAI já sinalizou sua intenção de tornar o Grok Voice Transcribe 2.0 o padrão e descontinuar o 1.0, o que moverá de uma só vez para o novo perfil de latência todas as integrações que nunca passaram um parâmetro de modelo.

Na camada de encaminhamento acima da transcrição, uma nota prática: nenhum dos modelos é um sistema de fala para texto que nós alojamos, e este artigo não afirma o contrário. O que o OrcaRouter abrange é a camada de modelos de linguagem que consome o fluxo — o sumarizador, o classificador, o agente — por trás de uma única chave de API, em mais de 200 modelos ao preço de tabela do fornecedor, com 0% de acréscimo, pelo que uma alteração de preço de um fornecedor chega aqui no mesmo dia. Equipas que usam dois fornecedores de fala para cobertura de idiomas já carregam dois contratos e dois caminhos de autenticação; consolidar a metade a jusante numa única chave é o ganho fácil.

O que fazer com isto

Baseie-se no Grok Voice Transcribe 2.0 se o seu áudio for multilíngue, se precisar de diarização, carimbos de data/hora ou ponderação de termos-chave disponíveis de imediato, ou se quiser um serviço com tarifa publicada e um canal de suporte hoje mesmo. É o produto mais completo, é avaliado por terceiros, e a tarifa de streaming de $0,20 por hora de áudio é baixa o suficiente para que o argumento de custo dos pesos abertos não se torne relevante até você processar um volume significativo.

Baseie-se no Voxtral Mini 4B Realtime Arabic se o seu áudio for árabe e especificamente dialetal, se precisar do modelo dentro da sua própria rede por razões de conformidade, ou se pretender fazer fine-tuning — porque só um destes o permite. Aceite três coisas primeiro: sem diarização, sem marcas temporais e sem qualquer avaliação independente publicada por quem quer que seja. Dois dias depois de os pesos aparecerem, essa última não é um sinal de alerta; é simplesmente onde as evidências se encontram.

O que mudaria esta comparação mais rapidamente seria uma avaliação específica para o árabe em áudio dialetal real, realizada fora de ambos os fornecedores, com a mesma normalização aplicada aos dois sistemas. Até que isso exista, a decisão assenta na lista de dialetos de um fornecedor contra a lista não declarada de outro fornecedor, e o único teste fiável são as suas gravações.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Grok Voice Transcribe 2.0 across six shared rows: price none published and self-host only against $0.10 per audio-hour over REST and $0.20 streaming; accuracy 8.82% Arabic character error rate vendor-reported against 2.7% final word error rate per Artificial Analysis; delay configurable with 480ms quoted against 0.49s to final and 0.49s to first partial; languages 16 named Arabic varieties against 38+ with none itemised by the vendor; diarization and timestamps not documented against included with confidence scores; and distribution Apache 2.0 weights on Hugging Face against API only. A footer reads that Mistral figures are vendor-reported and unverified while Grok figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

Nenhum dos endpoints é um que atendemos — isto é uma comparação de dois sistemas fora do nosso catálogo — mas os modelos que consomem a transcrição são roteáveis: mais de 200 modelos com uma única chave de API ao preço de tabela do provedor com 0% de markup, portanto, uma mudança de tarifa no sumarizador ou no classificador entra em vigor no mesmo dia em que é anunciada.

O failover automático é o que impede que uma configuração de fala com dois fornecedores carregue dois pontos únicos de falha para a camada de idioma que se alimenta dela.