Cartão de destaque do artigo com o texto 'Voxtral Mini 4B Realtime Arabic vs Gemini 3.5 Transcribe Live', com o subtítulo '15 dialetos árabes em pesos abertos contra 85+ localidades em uma API fechada', um selo que marca o modelo Mistral como um lançamento de repositório não anunciado, datado de 8 de outubro de 2026, e três chips de estatísticas: 16 variantes árabes contra 85+ localidades; taxa de erro de caracteres de 8,82% a 480 ms contra taxa de erro de palavras em streaming de 4,0% a 0,40 s; pesos abertos Apache 2.0 contra apenas API. O logotipo da OrcaRouter fica em uma faixa branca no canto inferior direito.
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs Gemini 3.5 Transcribe Live: Dialetos vs Abrangência

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois modelos de fala para texto em streaming, duas apostas completamente diferentes sobre qual é a parte difícil da transcrição. Voxtral Mini 4B Realtime Arabic é um ajuste fino de 4,4 bilhões de parâmetros que a Mistral AI publicou em um repositório público em 8 de outubro de 2026 sem post de lançamento, entrada em blog ou linha no índice de notícias da empresa, treinado especificamente em árabe padrão moderno e quinze dialetos nomeados, lançado sob Apache 2.0 com pesos BF16 disponíveis para download. Gem​ini 3.5 Transcribe Live é o endpoint de streaming do Gem​ini 3.5 Transcribe do G​ogle, anunciado em agosto de 2026 com todo o aparato de um lançamento de plataforma, cobrindo mais de 85 localidades, e fechado — uma API de pré-visualização sem pesos e com limite de sessão de dez minutos. Um modelo foi a fundo em uma única família linguística e disse isso em sua própria seção de limitações; o outro foi amplo e deixou as garantias no nível de sotaque não declaradas. Qual dos dois você quer depende de um eixo que o marketing de nenhum dos fornecedores coloca em primeiro lugar: como o seu áudio realmente soa.

Isto não é uma comparação simétrica, e vale a pena dizê-lo desde o início em vez de o esconder. O modelo da Mistral tem 48 horas no momento em que escrevo, não tem anúncio do fornecedor, nem avaliação independente, nem preço publicado. O modelo do Google está em pré-visualização pública desde o final de agosto e é medido num rastreador de terceiros. Trate o lado da Mistral como um conjunto de alegações de um cartão de modelo e o lado do Google como um conjunto de medições mais um conjunto de alegações, e a comparação mantém-se honesta.

O que cada modelo é, antes dos números

• Voxtral Mini 4B Realtime Arabic — um modelo ASR de streaming ajustado a partir do Voxtral-Mini-4B-Realtime-2602, com aproximadamente 4,4B parâmetros em BF16, recebendo áudio de 16 kHz através de um codificador de áudio causal e um decodificador de linguagem. Ele emite texto à medida que o áudio chega, com um atraso de transcrição configurável, e é Apache 2.0 com pesos no Hugging Face. A Mistral co-desenvolveu-o com o Ministère de la Transition Numérique et de la Réforme Administrative de Marrocos ao abrigo de uma parceria assinada em janeiro de 2026, e descreve o modelo como um ativo de IA soberano.

• Gemini 3.5 Transcribe Live — a metade em streaming de um lançamento de dois modelos. O endpoint da Live API transmite áudio contínuo do microfone por um WebSocket, retorna transcrições parciais enquanto o falante ainda está falando e define uma transcrição final pouco depois do fim de cada enunciado. O irmão em lote, gemini-3.5-transcribe, atende arquivos pré-gravados de até uma hora. Ambos estão em pré-visualização pública, ambos são somente via API e nenhum dos dois teve os pesos publicados.

A primeira diferença estrutural não é a precisão. É que um destes é um arquivo que você pode baixar hoje à noite e o outro é um serviço no qual você precisa ser aceito para poder usar.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Cobertura de idiomas: 16 contra mais de 85, e a disparidade não é o ponto.

Contar idiomas faz o modelo Mistral parecer limitado e o modelo Google parecer enorme. As contagens medem coisas diferentes, e lê-las lado a lado sem essa ressalva é o erro mais comum que esta comparação convida a cometer.

• Voxtral Mini 4B Realtime Arabic — 16 variedades de árabe, nomeadas individualmente na ficha do modelo por família dialetal: árabe padrão moderno, além de árabe marroquino, líbio, tunisino, argelino e hassaniya do Magrebe; árabe do Golfo, najdi, omani e sanaani do Golfo; egípcio e sudanês do Vale do Nilo; mesopotâmico e tanto o levantino meridional quanto o setentrional; e árabe chadiano. A própria ficha do modelo apresenta-o como vocacionado para a transcrição de árabe, e a alternância de código — falantes que alternam idiomas no meio da conversa — como a capacidade que foi construído para acertar, e não como um efeito secundário.

• Gemini 3.5 Transcribe Live — deteção automática de idioma em mais de 85 localidades, com alternância de código dentro da mesma frase e entre frases. A documentação do Google inclui o árabe nesse conjunto; a tabela de localidades nomeia árabe (Egito) como a entrada para árabe, e a cobertura mais ampla de localidades árabes não está detalhada na documentação do próprio modelo.

Leia isso com honestidade e a forma da troca aparece. O 85-plus do Google é uma alegação de amplitude: se o seu áudio estiver em um idioma que não seja árabe, o endpoint do Google cobre isso e o modelo da Mistral vai recusá-lo — o card diz explicitamente que, para outros idiomas, você deve usar o Voxtral Mini 4B Realtime original, e não este checkpoint. O 16 da Mistral é uma alegação de profundidade. Ele não está alegando transcrever árabe; está alegando transcrever darija marroquino, árabe do Golfo, árabe egípcio e árabe chadiano como alvos distintos, o que é um problema materialmente mais difícil do que transcrever árabe padrão moderno e torcer para que o dialeto surja daí. Um benchmark ponderado para o inglês e com prioridade em amplitude nunca mostrará essa diferença, porque os conjuntos de dialetos não estão nele.

Para um call center marroquino ou uma linha de suporte ao cliente do Golfo, um modelo que lida com 16 dialetos e nada mais pode superar um modelo que lida com 85 locales a uma precisão por dialeto não declarada. Para uma empresa europeia que transcreve reuniões em cinco idiomas, a equação se inverte instantaneamente. Nenhum fornecedor está errado; eles escolheram clientes diferentes.

Screenshot of Google's Gemini API model documentation for Gemini 3.5 Transcribe, captured 10 October 2026, showing the model code gemini-3.5-transcribe, audio input up to one hour per request dropping to 30 minutes when speaker diarization or word-level timestamps are enabled, and the supported capability list including speaker diarization, word-level timestamps, Smart transcription and custom vocabulary.

Os números que você pode comparar, e os que você não pode

É aqui que a assimetria cobra seu preço. Os dois modelos relatam unidades diferentes, sobre corpus diferentes, com evidências diferentes por trás deles, e nenhuma terceira parte os colocou frente a frente.

• Voxtral Mini 4B Realtime Arabic — 8,82% de taxa média de erro de caracteres em sete benchmarks de árabe, com um atraso de transcrição configurado de 480 milissegundos. Segundo o próprio card da Mistral, e não reproduzido de forma independente.

• O modelo que ele está perseguindo — Voxtral Transcribe Arabic com 7,91% de CER nos mesmos sete benchmarks, pela mesma medição, de modo que o modelo em tempo real fica 0,91 ponto percentual atrás de um modelo de árabe offline do mesmo fornecedor. Essa diferença é uma comparação da própria Mistral, o que a torna incomumente informativa: o fornecedor está lhe dizendo quanto o streaming custa em precisão nesta família de idiomas.

• Gemini 3.5 Transcribe Live — taxa de erro de palavras em streaming de 4,0%, medida pela Artificial Analysis e citada pelo Google, com uma transcrição final chegando 0,40 segundos após o fim da fala. Também medidos: 2,6% no painel não streaming do mesmo rastreador, e 5,50% em streaming no FLEURS segundo a própria divulgação do Google.

Não coloque 8,82% de CER ao lado de 4,0% de WER e tire qualquer conclusão. A taxa de erro de caractere e a taxa de erro de palavra têm denominadores diferentes — a ortografia do árabe faz a diferença entre elas ser maior do que é para línguas de escrita latina — e os corpora não são os mesmos, a normalização não é a mesma, e um dos números vem com um script reproduzível, enquanto o outro vem de uma mistura fixa de um tracker que tem peso maior para conversas de agentes em inglês.

A comparação mais útil é a que consta na própria ficha da Mistral: 8,82% em streaming contra 7,91% offline, em benchmarks idênticos com normalização idêntica. Essa é uma medição limpa do que a baixa latência traz e custa especificamente no árabe, e vale mais do que qualquer percentagem entre fornecedores. O que ninguém publicou é uma avaliação em árabe, em condições equivalentes, dos modelos Google e Mistral no mesmo áudio. Até que alguém o faça, "qual deles é mais preciso em árabe" é uma questão em aberto, e a única resposta defensável é: teste os dois nas suas gravações.

Um detalhe na ficha da Mistral merece menção porque vai contra o interesse da própria fornecedora. Ela observa que os filtros de segurança do Gemini bloqueiam a transcrição de algumas amostras de áudio do FLEURS. Essa é uma observação real e verificável sobre o pipeline de um concorrente, e também é exatamente o tipo de coisa que nunca aparece em um ranking — um modelo que se recusa a transcrever uma amostra é pontuado como falha ou como ausente, e nenhuma das duas leituras é justa. Se o seu áudio incluir material que um filtro de conteúdo possa capturar, esse é um risco de implantação que nenhum número de WER vai revelar.

Latência: um mostrador contra um número fixo

Modelos de streaming costumam ser comparados com base em um único valor de latência. Esses dois não têm um em comum.

• Voxtral Mini 4B Realtime Arabic — atraso de transcrição configurável. O valor de 8,82% de CER é indicado em 480 milissegundos, e o atraso é ajustável, o que significa que o número de precisão é um ponto em uma curva escolhida pelo operador, e não uma propriedade do modelo. Seu modelo base anuncia uma faixa de 240 milissegundos a 2,4 segundos.

• Gemini 3.5 Transcribe Live — 0,40 segundos do fim da fala até uma transcrição final, medidos pela Artificial Analysis, com resultados parciais chegando continuamente durante a fala. O Google afirma separadamente uma melhoria de 70% no tempo até a transcrição final em relação ao Chirp 3, o que é um dado do fornecedor e não foi replicado.

Ambos ficam na mesma faixa — aproximadamente meio segundo — mas o significado de engenharia difere. O modelo Mistral entrega a você o trade-off entre latência e precisão como um parâmetro, então você pode operar a 240 ms quando legendas em menos de um segundo importam mais do que os últimos pontos de precisão e aumentar o atraso quando não importam. O endpoint do Google apresenta um ponto de operação fixo com o próprio comportamento de filtro de conteúdo do Google anexado. Para um agente de voz, um ajuste vale mais do que um número fixo um pouco melhor, porque a configuração correta depende do seu áudio e dos seus usuários e nenhum fornecedor pode escolhê-la por você.

A verdadeira divisão: pesos abertos contra um endpoint de pré-visualização

A diferença de licença e distribuição é maior do que qualquer lacuna de benchmark nesta comparação, e decide a maioria das implantações reais antes mesmo de se discutir a precisão.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0, pesos BF16 no Hugging Face, podendo ser servido com vLLM por WebSocket em /v1/realtime, e com suporte nativo no Transformers a partir da versão 5.2.0. O card do modelo traz um exemplo em Python e um módulo de normalização para que você mesmo possa reproduzir o cálculo do CER em árabe. Nada no pipeline exige os servidores da Mistral, e o modelo é pequeno o bastante para que a questão operacional seja qual GPU usar, e não se você pode pagar por uma.

• Gemini 3.5 Transcribe Live — somente API, pré-visualização pública, sem compromisso de preço publicado além das tarifas de tabela, e um limite de sessão de dez minutos que significa que qualquer coisa mais longa precisa ser dividida em blocos, reconectada e remontada pelo seu próprio código. Três restrições relatadas junto com o lançamento são relevantes especificamente para implantações em árabe: o endpoint de streaming não retorna diarização de falantes nem marcações de tempo em nível de palavra, ambas presentes no endpoint em lote, mas não neste. Se sua transcrição em árabe precisa saber quem disse o quê, ou precisa estar alinhada temporalmente ao áudio, o endpoint Live não consegue produzi-lo, independentemente do idioma.

Essas duas restrições são o argumento mais forte a favor do pequeno modelo aberto numa implementação real em árabe, e não têm nada a ver com precisão. Um pipeline de centro de contacto quer atribuição de locutor, um pipeline de conformidade quer marcas temporais, e um modelo árabe offline com um script de normalização que controla dá-lhe as duas coisas sem ter de discutir com um contrato de endpoint. A ficha do modelo da Mistral também apresenta isso como uma limitação em vez de uma funcionalidade — destina-se à transcrição, é um ajuste fino de um modelo geral em tempo real, e é honesto ao reconhecer que existe um modelo mais abrangente a montante, caso precise de um.

Quanto custa cada um, e o que é desconhecido

• Gemini 3.5 Transcribe Live — aproximadamente US$ 0,009 por minuto de áudio em taxa combinada, derivada dos preços de tabela de US$ 3,50 por milhão de tokens de entrada e US$ 21 por milhão de tokens de saída, com o áudio avaliado em 25 tokens por segundo e a transcrição em cerca de 175 tokens por minuto. O endpoint em lote custa cerca de US$ 0,005 por minuto. Ambos os valores são estimativas baseadas na tokenização presumida do Google, portanto mudam se a contabilização mudar. Há um nível gratuito atualmente.

• Voxtral Mini 4B Realtime Arabic — sem preço publicado, porque não existe um serviço publicado. O custo é aquilo que o seu hardware custar. Um modelo BF16 de 4,4 mil milhões de parâmetros cabe num único acelerador moderno, pelo que o custo marginal por hora de áudio é a eletricidade e a utilização, e o custo fixo é a máquina. Isso é mais barato do que qualquer API por minuto em volume e mais caro do que qualquer API por minuto a volume zero, que é a forma habitual do trade-off dos pesos abertos.

A incógnita que mais importa do lado da Mistral não é o preço. É se este repositório é o início de uma linha de produtos ou uma entrega pontual no âmbito da parceria com Marrocos. Um modelo que é lançado discretamente, sem anúncio, sem preço e sem serviço é um modelo sem qualquer compromisso de suporte por trás. Apache 2.0 significa que a licença não pode ser retirada para os pesos que já tem, mas não diz nada sobre se o checkpoint continuará a ser mantido, e o próprio ponteiro para o modelo base no cartão sugere que o modelo geral em tempo real continua a ser a linha com suporte.

Para a camada acima da transcrição, uma camada de roteamento se paga de uma forma que não tem nada a ver com a transcrição. Nenhum desses modelos é um serviço de fala para texto que hospedamos — a OrcaRouter não roteia nenhum dos endpoints — mas o sumarizador, o classificador de intenção ou o agente que consome o fluxo é um modelo que você pode rotear: uma chave de API para mais de 200 modelos pelo preço de tabela do provedor com 0% de margem, então um corte de preço do fornecedor chega ao nosso lado no mesmo dia, além de failover automático se um provedor degradar. Se você já está costurando dois fornecedores de fala para cobrir dialetos, colocar os modelos de linguagem a jusante atrás de uma chave em vez de dois contratos é a metade barata da integração.

Em qual basear-se

Se o seu áudio for árabe — um dialeto, vários, ou com alternância de código entre árabe e outra língua — o modelo Mistral é o candidato mais sério, e a razão é estrutural, e não numérica. Ele nomeia os dialetos para os quais foi criado, é pequeno o suficiente para rodar no seu próprio hardware, retorna texto bruto que você pode pós-processar com sua própria normalização, e não fica atrás de um limite de sessão de dez minutos ou de um filtro de conteúdo que você não pode inspecionar. O custo é que ele atende a uma única família linguística e recusa o resto, e que ninguém publicou uma avaliação independente dele até agora.

Se o seu áudio abrange vários idiomas, ou se você precisa hoje de um serviço com um canal de suporte e uma tabela de preços publicada, o Gemini 3.5 Transcribe Live pode ser chamado agora, é medido em um rastreador de terceiros e cobre os idiomas que o checkpoint da Mistral vai rejeitar. Os custos são o limite de sessão, a ausência de diarização e de carimbos de data e hora no endpoint de streaming, e o fato de a precisão específica para árabe ser uma alegação que você terá de testar por conta própria — a lista de localidades nomeia o Egito, e o desempenho por dialeto não é detalhado.

O que importa observar não é um benchmark. É se a Mistral chega a anunciar este modelo e, em caso afirmativo, com que preço e que roteiro linguístico. Um repositório discreto com uma licença Apache 2.0 é um artefato útil e um compromisso fraco. Se se seguir um roteiro de dialetos árabes — levantino, do Golfo, egípcio como checkpoints separados —, a rota dos modelos pequenos torna-se uma resposta genuinamente completa para a região, e o argumento da amplitude torna-se muito mais difícil de sustentar.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Gemini 3.5 Transcribe Live across six shared rows: coverage 16 named Arabic varieties against 85+ locales that list Arabic as Egypt only; reported accuracy 8.82% Arabic character error rate at 480ms against 4.0% streaming word error rate at 0.40s; evidence vendor card unreproduced against Artificial Analysis cited by Google; delay configurable with 480ms quoted against 0.40s fixed to final transcript; weights Apache 2.0 and downloadable against API only in public preview; and diarization and timestamps not documented against absent on the Live endpoint. A footer reads that Mistral figures are vendor-reported while Gemini figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

Nenhum destes é um modelo de fala que hospedamos, mas a camada acima da transcrição é roteável - mais de 200 modelos por trás de uma única chave de API ao preço de tabela do provedor com 0% de acréscimo, então um corte de preço do fornecedor no modelo de raciocínio a jusante da sua transcrição entra em vigor no mesmo dia.

Failover automático significa que um pipeline de fala integrado tem um domínio de falha a menos, porque o sumarizador ou classificador de intenções que consome a transcrição pode ser redirecionado em vez de cair junto com um provedor.