Cartão de título principal gerado para uma comparação entre o Voxtral Mini 4B Realtime Arabic e o Voxtral 4B TTS, com o subtítulo «dois extremos do mesmo ciclo de voz árabe, duas licenças diferentes», com o selo «fala a entrar versus fala a sair», com três chips de estatísticas que indicam 8,82% de taxa de erro de caracteres em árabe a 480 ms contra 70 ms até ao primeiro áudio, 16 dialetos árabes contra 9 idiomas, incluindo o árabe, e pesos Apache 2.0 contra pesos CC BY-NC 4.0, e o logótipo OrcaRouter composto numa faixa branca no canto inferior direito.
Engineering & Research

Voxtral Mini 4B Realtime Arabic vs Voxtral 4B TTS: Duas pontas da mesma conversa

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Esses dois modelos compartilham um nome, uma contagem de parâmetros e um arquivo de licença que se comporta de modo diferente, e é aí que a semelhança termina. O Voxtral Mini 4B Realtime Arabic, publicado no Hugging Face em 8 de outubro de 2026 sem anúncio que o acompanhasse, recebe áudio e produz texto em árabe — um fine-tune de streaming do Voxtral-Mini-4B-Realtime-2602, criado para árabe padrão moderno e quinze dialetos nomeados, Apache 2.0, taxa média de erro de caractere de 8,82% com atraso de 480 milissegundos. O Voxtral 4B TTS, anunciado pela Mistral AI em março de 2026, faz o inverso: texto na entrada, fala na saída, vinte vozes predefinidas, além de adaptação a partir de um breve clipe de referência, nove idiomas, incluindo árabe, e uma licença — CC BY-NC 4.0 — que proíbe o uso comercial dos próprios pesos. Eles não são alternativas nem variantes. São as duas metades de um loop de voz, e a razão para olhá-los em conjunto é que as decisões que você toma sobre um deles restringem o outro mais do que a maioria das equipes espera.

A maioria das páginas de comparação dirá que esses modelos não têm relação porque um é ASR e o outro é TTS, e depois para por aí. Isso é verdade e não é útil. O que realmente vale a pena saber é onde eles se encontram: um agente de voz precisa dos dois, as duas licenças apontam em direções opostas, as duas pegadas de hardware são semelhantes, enquanto as características de throughput não são, e as alegações de cobertura do árabe têm formatos completamente diferentes. Tudo abaixo trata desses quatro pontos de encontro.

O que cada modelo é, nos termos que importam para um pipeline

• Voxtral Mini 4B Realtime Arabic — reconhecimento automático de fala em streaming. Áudio de 16 kHz na entrada, texto na saída, aproximadamente 4,4 bilhões de parâmetros em BF16, servido via vLLM com um WebSocket em /v1/realtime ou nativamente no Transformers a partir da versão 5.2.0. Um codificador de áudio causal e um decodificador de linguagem, um atraso de transcrição configurável citado em 480 milissegundos para o valor de precisão publicado, e um módulo de normalização fornecido em conjunto para que a taxa de erro de caracteres em árabe possa ser recalculada. Apache 2.0.

• Voxtral 4B TTS — síntese de fala em streaming e em lote. Texto de entrada, áudio de saída em 24 kHz em WAV, PCM, FLAC, MP3, AAC ou Opus, aproximadamente 4 bilhões de parâmetros, com um conjunto predefinido de 20 vozes e adaptação de voz a partir de um clipe de referência de apenas três segundos. O benchmark próprio da Mistral em um único H200 executando vLLM-Omni 0.18.0 com uma entrada de 500 caracteres e uma referência de dez segundos relata 70 milissegundos de latência e um fator de tempo real de 0,103 com concorrência 1, subindo para 331 milissegundos e 0,237 com concorrência 16, e 552 milissegundos com concorrência 32. Consultado como API a US$ 0,016 por mil caracteres.

A primeira observação desses dois parágrafos é que o par é pequeno. Ambos os modelos estão na faixa de 4 bilhões de parâmetros e ambos cabem em um único acelerador em BF16, o que significa que um agente de voz árabe construído inteiramente com pesos abertos é uma implantação de no máximo duas GPUs e, plausivelmente, uma implantação de uma única GPU com quantização dos dois lados. Essa é a razão prática para encará-los como um conjunto, e não como duas decisões de produto separadas.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

A assimetria da licença é o achado, não uma nota de rodapé

Eis o que surpreende quem assume que modelos do mesmo laboratório, com a mesma convenção de nomenclatura, têm os mesmos termos.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0. O uso comercial, a modificação, a redistribuição e o ajuste fino são todos permitidos, sujeitos à restrição padrão contra a violação de direitos de terceiros.

• Voxtral 4B TTS — CC BY-NC 4.0, herdada dos conjuntos de dados de vozes de referência por trás dele. Não comercial. O cartão da Mistral é explícito ao afirmar que o modelo herda a licença das suas referências de voz, provenientes de fontes que incluem EARS, CML-TTS, IndicVoices-R e um conjunto de áudio natural em árabe. Os pesos são descarregáveis e a licença não é comercial.

Esta é uma restrição rígida sobre a arquitetura exata que todos procuram primeiro. Se você construir um agente de voz em árabe cujo componente de reconhecimento de fala é o Voxtral Mini 4B Realtime Arabic e cujo componente de síntese de fala é o Voxtral 4B TTS, você tem um pipeline no qual metade dos componentes é livre para uso comercial e metade não é, e a metade restritiva governa o produto. O fato de o modelo ASR ser Apache 2.0 não resgata o componente de TTS. Executar o par localmente não altera a licença, e o mesmo vale para não enviar os pesos — a restrição está atrelada ao uso, não à distribuição.

Screenshot of the Hugging Face model card for mistralai/Voxtral-4B-TTS-2603, captured 10 October 2026, showing the model name, the mistralai organisation, the Text-to-Speech pipeline tag, 922 likes, a language badge, and the CC BY-NC 4.0 licence inherited from the reference-voice datasets.

A via comercial que a Mistral oferece para o lado da fala é a API hospedada a US$ 0,016 por mil caracteres, que é um contrato de serviço e não uma concessão de licença. Para uma equipe de produto, a consequência prática é que a metade livremente comercializável do ciclo é a metade que escuta, e a metade que fala é ou uma dependência de API ou uma conversa sobre licenciamento. Isso inverte o que a maioria das equipes assume quando começa a construir uma pilha de voz aberta, e vale a pena descobri-lo antes de ter escrito a integração, e não depois.

As alegações árabes não coincidem, e apenas uma delas é uma promessa de cobertura.

Ambos os modelos listam árabe. As listagens significam coisas diferentes.

• Voxtral Mini 4B Realtime Arabic — O árabe é todo o escopo. Dezesseis variedades enumeradas como alvos de treinamento: árabe padrão moderno, marroquino, líbio, tunisino, argelino e hassaniya, do Golfo, najdi, omani e sanaani, egípcio e sudanês, mesopotâmico e tanto o levantino meridional quanto o setentrional, e chadiano. Tudo o que estiver fora desse conjunto é documentado como fora do escopo. Um valor agregado de precisão, 8,82% CER, calculado pela média de sete benchmarks de árabe.

• Voxtral 4B TTS — O árabe é uma das nove línguas suportadas, a par do inglês, francês, espanhol, alemão, italiano, português, neerlandês e hindi. O cartão descreve "dialetos diversos" dentro desse suporte, sem os enumerar, e não há nenhuma métrica de qualidade por idioma publicada para o árabe nem para nenhuma das outras oito.

Lidos em conjunto, o par fornece uma declaração detalhada sobre quão bem seu sistema ouvirá árabe e quase nenhuma declaração sobre quão bem o falará. Essa assimetria tem uma consequência real para um agente de voz em Darija ou árabe do Golfo: o lado da entrada tem um benchmark publicado e uma lista de dialetos em relação à qual você pode avaliar, e o lado da saída tem um selo de idioma e uma lista de vozes. Ninguém publicou uma medição de inteligibilidade de árabe dialetal para o Voxtral 4B TTS, e o recurso de adaptação de voz não resolve isso — adaptar uma voz muda com quem a fala se parece, não qual dialeto ela produz.

Há um segundo ponto, mais sutil, sobre o próprio número de precisão do modelo ASR que também se aplica ao lado do TTS. A Mistral relata 8,82% de CER em streaming contra 7,91% para o Voxtral Transcribe Arabic offline nos mesmos sete benchmarks e com a mesma normalização, então o streaming custa cerca de um ponto percentual. O trade-off equivalente do lado do TTS — o que a inferência em streaming custa em qualidade de saída em comparação com o batch — não é quantificado de forma alguma no material. Os números de latência existem; o delta de qualidade, não.

Throughput: um modelo é feito para ser levado ao limite, o outro não.

A Mistral publicou dados de throughput para exatamente um destes modelos, e os números explicam por quê.

• Voxtral 4B TTS — medido em um H200 com vLLM-Omni, uma entrada de 500 caracteres e uma referência de áudio de dez segundos, a vazão vai de cerca de 119 caracteres por segundo de tempo de GPU na concorrência 1 para aproximadamente 879 na concorrência 16 e cerca de 1.431 na concorrência 32, com a latência subindo de 70 milissegundos para 331 e depois 552. Essa é uma curva de vazão com a qual você pode planejar capacidade, e é o formato que você esperaria de um modelo projetado como um serviço de voz de produção.

• Voxtral Mini 4B Realtime Arabic — o cartão não relata nenhum valor de throughput, nenhum comportamento de concorrência e nenhum benchmark de hardware. O que ele de fato afirma é a arquitetura: um codificador causal e um esquema de atenção de janela deslizante tanto no codificador quanto no decodificador, descrito no modelo base como suportando streaming efetivamente ilimitado. O ponto de precisão é citado em 480 milissegundos de atraso, o que implica que o modelo acompanha áudio em tempo real em hardware apropriado, e essa é a extensão do envelope de desempenho publicado.

A lacuna não é tanto uma crítica a nenhum dos dois modelos, mas antes uma afirmação sobre maturidade. O modelo TTS tem uma tabela de SLO publicada porque foi lançado como um produto, com um post de blog, uma demo, uma API e um preço. O modelo ASR árabe não tem um envelope de desempenho publicado porque chegou como um repositório com um cartão. Se hoje você está dimensionando uma frota de transcrição em árabe, o número de throughput de que você precisa ainda não existe, e a única forma de obtê-lo é executar o caminho de serving do vLLM no seu próprio hardware, com o seu próprio áudio.

É também aí que uma camada de roteamento muda o formato da implantação, e não apenas o faturamento. O OrcaRouter não roteia nenhum desses modelos — não hospedamos nenhum endpoint de fala da Mistral, e este artigo não está afirmando o contrário —, mas a camada de modelo de linguagem entre eles é exatamente a camada que se beneficia de ser roteada: uma única chave de API para mais de 200 modelos pelo preço de tabela do provedor com 0% de markup, de modo que uma mudança de preço de um fornecedor chega ao nosso lado no mesmo dia em que é anunciada, e failover automático, para que uma tarde ruim de um único provedor upstream seja um redirecionamento em vez de uma interrupção no seu loop de voz. Um agente de voz montado a partir de dois modelos Mistral auto-hospedados mais um modelo de raciocínio hospedado tem três domínios de falha; a camada de roteamento é o que torna o do meio entediante.

Custo, lado a lado, com a ressalva de que um dos lados não tem preço

• Voxtral 4B TTS — US$ 0,016 por mil caracteres por meio da API da Mistral, ou o custo da GPU caso você faça auto-hospedagem sob termos que permitam seu caso de uso. Para se ter uma noção aproximada da escala, mil caracteres equivalem a cerca de duzentas palavras, então um minuto de saída falada fica em frações baixas de centavo no preço de tabela, antes de qualquer vantagem de simultaneidade por executá-lo por conta própria.

• Voxtral Mini 4B Realtime Arabic — sem preço publicado, sem serviço hospedado, sem tabela de preços. O custo é hardware e utilização. Um modelo de 4,4B BF16 em um acelerador moderno é um custo mensal fixo que você amortiza pela quantidade de áudio que a máquina conseguir processar, o que é barato em volume sustentado e puro desperdício em volume ocasional.

A comparação que provavelmente importa mais é com as alternativas que você usaria em vez disso. Do lado da escuta, o checkpoint de árabe está competindo com APIs de streaming por hora, cujas tarifas são publicadas e baixas — MAI-Transcribe-2-Streaming da Microsoft a $0.54 por hora de áudio, em caráter introdutório, Grok Voice Transcribe 2.0 da xAI a $0.20 por hora de áudio em streaming — o que significa que um serviço de transcrição de árabe pode ser comprado por alguns décimos de centavo por minuto, e o argumento dos pesos abertos precisa ser feito com base na precisão de dialeto, residência de dados ou ajuste fino, em vez do custo unitário. Do lado da fala, um modelo TTS auto-hospedado com custo marginal zero é uma vantagem real sobre APIs por caractere em volume, e é por isso que a licença CC BY-NC é o fator limitante, e não o preço.

Uma observação estrutural para quem está orçando uma troca baseada em preço: um roteador que repassa o preço de tabela do provedor com 0% de margem é a superfície onde uma mudança de tarifa do fornecedor aparece no mesmo dia em que é anunciada, e não no próximo ciclo de reajuste. Isso importa mais no lado da escuta do que no lado da fala, porque a transcrição é cobrada por hora de áudio, e esse é um número que os fornecedores mudam.

Como pensar em escolher entre eles

Você não está escolhendo entre eles. A questão é qual metade do loop você consegue construir sobre pesos abertos, e a licença responde isso.

Se o seu requisito é um agente de voz árabe autocontido, no qual o áudio nunca sai da sua infraestrutura, a etapa de escuta está disponível para você incondicionalmente: Apache 2.0, baixável, ajustável, com uma lista de dialetos com a qual você pode testar e uma taxa de erro publicada para o árabe. A etapa de fala é onde a restrição se impõe, e você tem duas opções honestas — mover a síntese de fala para um serviço hospedado sob um acordo comercial, ou remover o Voxtral 4B TTS da arquitetura e encontrar um modelo de síntese com licença permissiva para o árabe.

Se a sua necessidade é um serviço de transcrição de produção e o idioma é o árabe, a decisão é entre um checkpoint baixável de 4,4B com uma taxonomia de dialetos publicada e uma única taxa de erro agregada, e uma API de streaming hospedada com um preço publicado, uma latência publicada e um leaderboard de terceiros. O modelo aberto ganha em controle, residência e ajuste fino; as opções hospedadas ganham em evidências, suporte e simplicidade operacional. Dois dias depois de os pesos aparecerem, ninguém fora da Mistral os mediu, e isso é um motivo para executar seu próprio benchmark em vez de um motivo para descartar o checkpoint.

O que mais mudaria este cenário é um lançamento de síntese em árabe sob termos que permitem uso comercial — o mesmo padrão que o lado da escuta já segue. Até que isso exista, o ciclo permanece meio aberto, e o trabalho prático é decidir qual metade você está disposto a alugar.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Voxtral 4B TTS across six shared rows: task speech to text against text to speech with 24 kHz audio output; Arabic claim 16 named dialects at 8.82% character error rate against 1 of 9 languages with no quality figure; licence Apache 2.0 permitting commercial use against CC BY-NC 4.0 non-commercial weights; service price none published against $0.016 per 1,000 characters; published throughput none against 119 to 1,431 characters per second per GPU; and hardware roughly 4.4B in BF16 on a single accelerator against roughly 4B in BF16 on a single accelerator. A footer reads that all figures are Mistral's own and unreproduced, and that the two models are complementary rather than competing. The OrcaRouter logo sits in a white strip at the bottom right.

Não hospedamos nenhum desses modelos de fala da Mistral e este artigo não afirma o contrário; o que o ciclo de voz precisa acima deles é a camada de linguagem, e essa é roteável - uma única chave de API para mais de 200 modelos ao preço de tabela do provedor, com 0% de margem, de modo que uma mudança de tarifa do fornecedor recai sobre nós no mesmo dia em que é anunciada.

Failover automático evita que o componente central de um agente de voz de três componentes — um modelo de raciocínio upstream entre dois modelos Mistral auto-hospedados — seja a parte que derruba o produto.